Egy osztályozási módszer (vagy osztályozó) egy szisztematikus megközelítés osztályozási modellek építésére egy bemeneti adatállományból. A példák között szerepelnek döntési fa osztályozók, szabály alapú osztályozók, neurális hálózatok, tartóvektor-gépek és naiv Bayes osztályozók. Minden módszer egy tanuló algoritmust (learning algorithm) alkalmaz annak a modellnek az azonosítására, amely a legjobban illeszkedik a bemenő adatok attribútumai és osztálycímkéje közötti kapcsolatra. A tanuló algoritmus által generált modellnek egyszerre kell jól illeszkednie a bemenő adatokra és helyesen megjósolnia korábban soha nem látott rekordok osztálycímkéit. Ezért a tanuló algoritmus fő célja jó általánosítási képességgel bíró modellek építése, azaz, hogy a modell pontosan jósolja meg korábban ismeretlen rekordok osztálycímkéit.
A 4.3. ábra osztályozási feladatok megoldásának egy általános megközelítését mutatja. Először meg kell adni egy tanulóhalmazt (training set), amely olyan rekordokból áll, amelyeknek ismert az osztálycímkéje. A tanulóhalmazt egy osztályozási modell kialakításához használjuk, amelyet ezt követően a teszthalmazra (test set) alkalmazunk, amely ismeretlen osztálycímkéjű rekordokból áll.
Egy osztályozási modell teljesítményének kiértékelése a modell
által helyesen és helytelenül előrejelzett tesztrekordok számán
alapszik. Ezeket a számokat egy táblázatba foglaljuk, amely az ún.
tévesztési mátrix (confusion matrix).
A 4.2. táblázat egy bináris osztályozási feladat tévesztési mátrixát
mutatja. Ennek a táblázatnak mindegyik
4.2. táblázat - Egy kétosztályos feladat tévesztési mátrixa
| Előrejelzett osztály | ||
|
|
| |
Tényleges |
|
|
|
osztály |
|
|
|
Bár a tévesztési mátrix biztosítja annak meghatározásához szükséges információkat, hogy milyen jól teljesít egy osztályozási modell, ezen információk egyetlen számmá való összegzése még kényelmesebbé tenné a különböző modellek teljesítményének az összehasonlítását. Ez olyan teljesítménymérték (performance metric) révén tehető meg, mint a pontosság (accuracy), amely a következőképpen van definiálva:
Ezzel egyenértékűen, egy modell teljesítményét kifejezhetjük a hibaarányával (error rate) megadva, amit a következő egyenlet ad meg:
A legtöbb osztályozási algoritmus olyan modelleket keres, amelyek a legnagyobb pontosságot, vagy azzal egyenértékűen, a legalacsonyabb hibaarányt érik el, amikor a teszthalmazon alkalmazzuk őket. A modell kiértékelés témájára 4.5. szakaszban térünk vissza.