Sok valós alkalmazásban elég gyakoriak a kiegyensúlyozatlan osztályeloszlású adatok. Például egy gyári szerelősorról lekerülő termékeket figyelő automatizált ellenőrzési rendszer megállapíthatja, hogy jelentősen kisebb a hibás termékek száma a hibátlan termékekénél. Hitelkártyacsalások felderítését tekintve hasonlóképpen vannak számbelileg kisebbségben a hamis tranzakciók a törvényes tranzakciókhoz képest. Mindkét példában aránytalan számú példány tartozik a különböző osztályokhoz. A kiegyensúlyozatlanság foka alkalmazásról alkalmazásra változik: egy a Six Sigma elvének megfelelően működő gyár lelhet négy hibát az ügyfeleinek szállított millió termékben, míg a hitelkártyacsalások mennyisége lehet egy a százhoz nagyságrendű. A ritka előfordulásuk ellenére ezekben az alkalmazásokban a rika osztály helyes osztályozásának gyakran nagyobb az értéke, mint a többségi osztály helyes osztályozásának. Azonban mivel az osztályeloszlás kiegyensúlyozatlan, ez a létező osztályozási algoritmusok számos problémáját veti fel.
Az osztályozók teljesítményének összehasonlításához széles körben használt pontosságmérték nem lehet megfelelően alkalmas kiegyensúlyozatlan adatokból származó modellek kiértékeléséhez. Ha például a hitelkártya tranzakciók 1%-a hamis, akkor 99% egy olyan modell pontossága, amely minden tranzakciót törvényesnek prediktál, bár nem érzékeli a hamis tevékenységek egyikét sem. Ezenkívül a tanuló algoritmus irányításához felhasznált mértékek (például döntési fa származtatáshoz az információmennyiség) módosítására lehet szükség a ritka osztályra való összpontosításhoz.
A ritka osztály példányainak felismerése hasonló egy tű kereséséhez a szénakazalban. Mivel a példányaik ritkán fordulnak elő, a ritka osztályt leíró modellek általában magas szinten specializáltak. Egy szabályalapú osztályozóban például a ritka osztályhoz kinyert szabályok rendszerint nagyszámú attribútumot tartalmaznak és nem lehet őket egykönnyen szélesebb lefedettségű általánosabb szabályokká egyszerűsíteni (eltérően a többségi osztály szabályaitól). Az ilyen modellek érzékenyebbek is zaj jelenlétére a tanulóadatokban. Következésképpen sok létező osztályozási algoritmus nem ismeri fel hatékonyan a ritka osztály példányait.
A szakasz néhány, az osztály-kiegyensúlyozatlanság problémájának kezeléséhez kifejlesztett módszert mutat be. Először a pontosságon túli alternatív metrikák kerülnek bevezetésre egy ROC elemzésnek nevezett grafikus módszerrel együtt. Ezután leírjuk, hogy hogyan lehet a költségérzékeny tanulást és mintavételezés-alapú módszereket felhasználni a ritka osztályok felismerésének javításához.
Mivel a pontosságmérték minden osztályt egyforma fontosságúként kezel, alkalmatlan lehet kiegyensúlyozatlan adatok elemzéséhez, ahol a ritka osztályt érdekesebbnek tekintjük, mint a többségi osztályt. Bináris osztályozásnál a ritka osztályt gyakran pozitív osztályként jelöljük, míg a többségi osztályt negatív osztályként. Egy osztályozási modell által helyesen vagy rosszul prediktált esetek számát összefoglaló tévesztési mátrix (confusion matrix) látható az 5.6. ábrán.
5.6. táblázat - Tévesztési mátrix egy olyan bináris osztályozási problémához, amelynél az osztályok nem egyformán fontosak
| Prediktált osztály | ||
|
|
| |
Aktuális |
|
|
|
osztály |
|
|
|
Gyakran használják a következő terminológiát a tévesztési mátrixban táblázatba foglalt számokra való hivatkozásnál:
Igaz pozitív (IP) vagy
Hamis negatív (HN) vagy
Hamis pozitív (HP) vagy
Igaz negatív (IN) vagy
A tévesztési mátrix számait ki lehet fejezni százalékosan is. Az igaz pozitív arány (IPA) (true positive rate) vagy érzékenység (sensitivity) a modell által helyesen prediktált pozitív esetek hányadaként definiált, azaz
Az igaz negatív arány (INA) (true negative rate) vagy specifikusság (specificity) hasonlóan, a modell által helyesen prediktált negatív esetek hányadaként definiált, azaz
Végül a hamis pozitív arány (HPA) (false positive rate) a pozitív osztályhoz tartozóként prediktált negatív esetek hányada, azaz
míg a hamis negatív arány (HNA) (false negative rate) a negatív osztályhoz tartozóként prediktált pozitív esetek hányada, azaz
A felidézés (recall) és precizitás[4] (precision) két széles körben használt metrika, amelyeket olyan alkalmazásokban alkalmaznak, ahol valamelyik osztály sikeres felismerését fontosabbnak tekintik, mint a többi osztály felismerését. Alább adjuk meg ezen metrikák formális definícióját:
A precizitás azon rekordok hányadát határozza meg, amelyek ténylegesen pozitívak az osztályozó által pozitív osztályúként deklarált csoportban. Minél magasabb a precizitás, annál alacsonyabb az osztályozó által elkövetett hamis pozitív hibák száma. A felidézés az osztályozó által helyesen prediktált pozitív esetek hányadát méri. Nagyon kevés pozitív esetet osztályoznak tévesen negatív osztályúként azok az osztályozók, amelyeknek nagy a felidézése. A felidézés értéke valójában ekvivalens az igaz pozitív aránnyal.
Gyakran lehetséges kiindulási modellek alkotása, amelyek az egyik metrikát maximalizálják, de a másikat nem. Tökéletes például egy olyan modell felidézése, amely minden rekordot pozitív osztályúként deklarál, azonban nagyon gyenge a precizitása. Ezzel szemben nagyon magas egy modell precizitása, ha a pozitív osztályt rendeli minden tesztrekordhoz, amely illeszkedik a tanulóhalmaz pozitív rekordjainak valamelyikére, de alacsony a felidézése. A precizitást és felidézést is maximalizáló modell építése az osztályozási algoritmusok legfőbb kihívása.
A precizitás és a felidézés összefoglalható egy másik
metrikában, amelyet
Elvben
Két szám,
Általánosságban az
A precizitás és a felidézés is
Egy általánosabb metrika a súlyozott
pontosságmérték (weighted accuracy
measure), amely magában foglalja
A súlyozott pontosság és a többi teljesítménymetrika közötti összefüggést a következő táblázat foglalja össze:
Mérték |
|
|
|
|
Felidézés | 1 | 1 | 0 | 0 |
Precizitás | 1 | 0 | 1 | 0 |
|
|
| 1 | 0 |
Pontosság | 1 | 1 | 1 | 1 |
A ``vevő működési karakterisztika'' (ROC -- Receiver Operating
Characteristic) görbe egy grafikus módszer egy osztályozó igaz pozitív
aránya és hamis negatív aránya közötti kompromisszum megjelenítésére.
A ROC-görbénél az igaz pozitív arányt (IPA) az
A ROC-görbe mentén van néhány kritikus pont, amelyeknek jól ismert értelmezése van:
•
•
•
Egy jó osztályozási modell a lehető legközelebb kell, hogy
elhelyezkedjen az ábra bal felső sarkához, míg egy véletlenszerűen
találgató modell az
A ROC-görbe hasznos különböző osztályozók relatív
teljesítményének ö`sszehasonlítására. Az 5.41. ábrán
A ROC-görbe alatti terület (AUC -- area under the ROC curve) egy
másik módszert biztosít annak kiértékeléséhez, hogy átlagosan melyik
modell a jobb. Ha a modell tökéletes, akkor a ROC-görbe alatti terület
1-gyel egyenlő. Ha a modell egyszerűen véletlen találgatást végez,
akkor a ROC-görbe alatti terület
ROC-görbe generálása
ROC-görbe rajzolásához az osztályozó képes kell, hogy legyen egy folytonos értékű kimenetet előállítani, amely felhasználható az előrejelzések rangsorolásához, a pozitív osztályúként osztályozandó legvalószínűbb rekordtól a legkevésbé valószínű rekordig. Ezek a kimenetek megfelelhetnek egy Bayes-osztályozó által generált a posteriori valószínűségeknek, vagy egy mesterséges neurális hálózat által előállított numerikus értékű kimeneteknek. Ezután a következő eljárás használható a ROC-görbe generálásához:
Azt feltételezve, hogy folytonos értékű kimenetek definiáltak a pozitív osztályhoz, rendezzük a tesztrekordokat a kimeneti értékeik szerint növekvő sorrendbe.
Válasszuk ki a rangsorban utolsó tesztrekordot (azaz a
legkisebb kimeneti értékű rekordot). A kiválasztott és a
rangsorban ezt megelőző rekordokat rendeljük hozzá a pozitív
osztályhoz. Ez a módszer ekvivalens az összes tesztrekord pozitív
osztályhoz tartozóként való osztályozásával. Mivel minden pozitív
eset helyesen osztályozott és a negatív esetek hibásan
osztályozottak,
Válasszuk ki a következő tesztrekordot a rendezett listából. Osztályozzuk a kiválasztott és a rangsorban ezt megelőző rekordot pozitívként, míg a rangsorban ezt követőket negatívként. Módosítsuk az IP és HP számokat megvizsgálva az előzőleg kiválasztott rekord aktuális osztálycímkéjét. Ha az előzőleg kiválasztott rekord pozitív osztályú, akkor az IP számot csökkentjük, a HP szám pedig változatlan marad. Ha az előzőleg kiválasztott rekord negatív osztályú, akkor a HP számot csökkentjük, az IP szám pedig változatlan marad.
Ismételjük meg a 3. lépést és módosítsuk megfelelően az IP és HP számokat, amíg nem a rangsorban első tesztrekord kerül kiválasztásra.
Ábrázoljuk az IPA-t a HPA függvényeként.
Az 5.42. ábrán egy példa látható a ROC-görbe kiszámításának
módjára. Öt pozitív és öt negatív eset van a teszthalmazban. A
táblázat első sorában láthatóak a tesztrekordok osztálycímkéi. A
második sor az egyes rekordok rendezett kimeneti értékeinek felel meg.
Ezek lehetnek például egy naiv Bayes-osztályozó által generált
Egy költségmátrix egy osztályból származó rekordok egy másik
osztályúként osztályozásának büntetését kódolja. Jelölje
A 0/1 költségmátrix mellett, azaz
ahol
5.9.Példa.
Tekintsük az 5.7. táblázatban látható költségmátrixot. Hamis negatív hiba elkövetésének költsége százszorosa a téves riasztás elkövetési költségének. Más szóval, bármely pozitív eset érzékelésének elmulasztása éppen olyan rossz, mint száz téves riasztás elkövetése. Az 5.8. táblázatban látható tévesztési mátrixokkal adott osztályozási modellek esetén a modellek összköltsége
5.7. táblázat - Költségmátrix az 5.9. példához
| Prediktált osztály | ||
| Osztály =
| Osztály =
| |
Aktuális | Osztály =
|
| 100 |
osztály | Osztály =
| 1 | 0 |
5.8. táblázat - Két osztályozási modell tévesztési mátrixa
| Prediktált oszt. | ||
| + oszt. | - oszt. | |
Aktuális | + oszt. | 150 | 40 |
oszt. | - oszt. | 60 | 250 |
5.8. táblázat - Két osztályozási modell tévesztési mátrixa
| Prediktált oszt. | ||
| + oszt. | - oszt. | |
Aktuális | + oszt. | 250 | 45 |
oszt. | - oszt. | 5 | 200 |
Vegyük észre, hogy az igaz pozitív és hamis pozitív számok
javulása ellenére az
Egy költségérzékeny osztályozási módszer a modellépítés során figyelembe veszi a költségmátrixot és egy minimális költségű modellt generál. Ha például a hamis negatív hibák a legköltségesebbek, akkor az algoritmus ezeket a hibákat próbálja meg csökkenteni a döntési határának a negatív osztály felé kiterjesztésével, amint az az 5.44. ábrán látható. Ilyen módon a generált modell több pozitív esetet tud lefedni, azonban további téves riasztások generálásának terhére.
5.44. ábra - Döntési határ módosítása (B1-ről B2-re) egy osztályozó hamis negatív hibáinak csökkentéséhez

Különböző módok vannak arra, hogy költséginformációt építsünk be
osztályozási algoritmusokba. Döntési fa származtatása esetén például a
költséginformáció felhasználható: (1) az adatok vágásához használt
legjobb attribútum kiválasztásához, (2) annak megállapításához, hogy
egy részfát le kell-e nyesni, (3) a tanulórekordok súlyainak olyan
módon való manipulálásához, hogy a tanuló algoritmus egy minimális
költségű döntési fához konvergáljon, (4) a döntési szabály
módosításához minden egyes levélcsúcsban. Az utolsó módszer
szemléltetéséhez jelölje
Az előbbi döntési szabály azt sugallja, hogy egy levélcsúcs osztálycímkéje az adott csúcsot elérő tanulórekordok többségi osztályától függ. Megjegyezzük, hogy ez a szabály azt feltétezi, hogy a hibás osztályozás költségei azonosak a pozitív és negatív esetekre. Ez a döntési szabály ekvivalens a (4.8) egyenletben a 170. oldalon szereplő kifejezéssel.
Többségi szavazás helyett egy költségérzékeny algoritmus az
Abban az esetben, ha
Ez a kifejezés azt sugallja, hogy a döntési szabály
küszöbértékét
A mintavételezés egy másik széles körben használt módszer az osztály-kiegyensúlyozatlansági probléma kezeléséhez. A mintavételezés ötlete a példányok eloszlásának olyan módon való módosítása, hogy a ritka osztály is jól reprezentált legyen a tanulóhalmazban. Néhány a mintavételezéshez rendelkezésre álló módszerek közül: alulmintavételezés (undersampling), túlmintavételezés (oversampling), a két módszer hibridje. Ezeknek a módszereknek a szemléltetéséhez tekintsünk egy 100 pozitív esetet és 1000 negatív esetet tartalmazó adathalmazt.
Az alulmintavételezés esetén egy 100 negatív esetből álló véletlenszerűen kiválasztott minta alkotja a tanulóhalmazt az összes pozitív esettel együtt. A módszer egy lehetséges problémája az, hogy a hasznos negatív esetek egy része nem kerül kiválasztásra a tanításhoz, amely az optimálistól elmaradó modellt eredményez. Ennek a problémának a leküzdésére egy lehetséges módszer az alulmintavételezés többszöri végrehajtása, és több osztályozó származtatása, hasonlóan az együttes tanulási módszerhez. Használni lehet fókuszált alulmintavételezési módszereket is, amelyeknél a mintavételezési eljárás egy megalapozott kiválasztást végez az eltávolítandó negatív esetek tekintetében (például elhagyhatók a döntési határtól távoli esetek).
A túlmintavételezés addig ismétli a pozitív eseteket, amíg a tanulóhalmaznak egyenlő számú pozitív és negatív esete nem lesz. Az 5.45. ábra szemlélteti a túlmintavételezés hatását a döntési határ egy osztályozó, például egy döntési fa, segítségével történő létrehozására. Túlmintavételezés nélkül csak az 5.45. (a) ábra bal alsó sarkában lévő pozitív esetek lesznek helyesen osztályozva. A pozitív eset az ábra közepén hibásan osztályozott, mert nincs elég eset a pozitív és negatív eseteket elválasztó új döntési határ létrehozásának megokolásához. A túlmintavételezés biztosítja azokat a további eseteket, amelyek szükségesek annak biztosításához, hogy a pozitív eseteket körülvevő döntési határ ne kerüljön lenyesésre, amint azt az 5.45. (b) ábra szemlélteti.
Zajos adatokra azonban a túlmintavételezés modell túlillesztést okozhat, mivel némelyik zajos eset többször ismétlődhet. Elvileg a túlmintavételezés nem ad hozzá új információt a tanulóhalmazhoz. A pozitív esetek ismétlése csak abban gátolja a tanuló algoritmust, hogy az lenyesse a modell nagyon kevés tanulóesetet tartalmazó területeket leíró részeit (azaz a kis diszjunktokat). A további pozitív esetek is növelik a modellépítés számítási idejét.
A hibrid módszer a többségi osztály alulmintavételezésének és a
ritka osztály túlmintavételezésének egy kombinációját használja
egyenletes osztályeloszlás eléréséhez. Az alulmintavételezés
elvégezhető véletlen vagy fókuszált részmintavételezés segítségével.
Ezzel szemben a túlmintavételezés elvégezhető a létező pozitív esetek
ismétlésével vagy a létező pozitív esetek környezetében új pozitív
esetek generálásával. Az utóbbi módszernél először meg kell határozni
minden egyes pozitív eset
[4] A fordító megjegyzése: Az accuracy és precision kifejezések szótári megfelelője egyaránt pontosság, ezért a félreérthetőség elkerülése miatt a továbbiakban utóbbi esetben magyar megfelelőként a precizitás kifejezést használjuk.