A statisztikai megközelítések modell-alapúak, azaz egy modellt alkotnak az adatokhoz, és az objektumokat aszerint értékelik, hogy mennyire jól illeszkednek a modellre. A kiugró értékek észlelésére szolgáló legtöbb statisztikai megközelítés valószínűségi eloszlással modellez, és azt vizsgálja, hogy mennyire valószínűek az objektumok ezen modell szerint. Ezt az elgondolást fejezi ki a 10.2. definíció.
10.2. Definíció
(A kiugró érték valószínűségi definíciója) Egy objektum kiugró érték, ha kicsi a valószínűsége az adatok valószínűségi eloszlás modellje szerint.
Az adatok valószínűségi eloszlás modellje egy felhasználó-specifikus eloszlás paramétereinek becsléséből adódik. Ha azt feltételezzük, hogy az adatok normális eloszlásból származnak, akkor a várható érték és a szórás becsülhető az adatokból az átlag és a tapasztalati szórás kiszámításával. Ezek után minden egyes objektum valószínűsége becsülhető ezen eloszlás alapján.
Statisztikai próbák széles választékát dolgozták ki a 10.2. definíció alapján a kiugró értékek, vagy ahogy a statisztikai szakirodalomban gyakran nevezik őket, disszonáns (discordant) megfigyelések, észlelésére. Ezen disszonancia próbák közül jónéhány igen specializált és a könyv keretein túlmutató statisztikai tudást igényel. Ezért az alapötleteket szemléltetjük néhány példával, és az olvasót az irodalmi megjegyzésekhez irányítjuk további útmutatásért.
Kérdések
Ezen kiugró érték észlelő megközelítés fontos kérdései közé tartoznak a következők.
Az adatok konkrét eloszlásának azonosítása
Bár sok adattípus leírására néhány közös eloszlás alkalmazható, úgymint a normális, a Poisson vagy a binomiális, viszonylag gyakoriak a nem standard eloszlású adatok. Természetesen, ha rossz modellt választunk, akkor tévesen azonosíthatunk objektumokat kiugró értékként. Az adatokat modellezhetjük például normális eloszlásból származónak, de lehet, hogy a valóságban olyan eloszlásúak, amely a normális eloszlásnál nagyobb valószínűséggel vesz fel az átlagtól távol eső értékeket. A gyakorlatban megszokottak az ilyen típusú statisztikai eloszlások és vastag farkú eloszlások (heavy tailed distributions) néven ismertek.
A használt attribútumok száma
A legtöbb statisztikai kiugró érték észlelő módszer egyetlen attribútumra vonatkozik, de van néhány többváltozós adatokra definiált módszer is.
Eloszlások keverékei
Az adatokat eloszlások keverékeiként is modellezhetjük, és kiugró érték észlelő sémákat ki lehet fejleszteni ilyen modellekre alapozva is. Bár ezek potenciálisan hatékonyabbak, egyúttal bonyolultabbak mind a megértésük, mind az alkalmazásuk tekintetében. Azonosítani kell például az eloszlásokat, mielőtt az objektumokat kiugró értékként osztályoznánk. Lásd a keverék modellek és az EM algoritmus tárgyalását a 9.2.2. szakaszban.
A normális (Gauss) eloszlás egyike a statisztikában
leggyakrabban használt eloszlásoknak, egy egyszerű statisztikai kiugró
érték észlelő megközelítés bemutatására fogjuk használni. Ennek az
eloszlásnak két paramétere van: a
Kicsi az esélye annak, hogy egy, az
10.1. táblázat -
c |
|
1,00 | 0,3173 |
1,50 | 0,1336 |
2,00 | 0,0455 |
2,50 | 0,0124 |
3,00 | 0,0027 |
3,50 | 0,0005 |
4,00 | 0,0001 |
Mivel egy érték az
10.3. Definíció
(Kiugró érték egyetlen,
ahol
Ennek a definíciónak az alkalmazásához meg kell adni
A többdimenziós Gauss-eloszlású megfigyelésekre hasonló megközelítést szeretnénk alkalmazni, mint amit az egydimenziós Gauss-eloszlásnál. Konkrétan, akkor szeretnénk pontokat kiugró értékként osztályozni, ha kis valószínűségűek az adatok becsült eloszlása szerint. Továbbá ezt egy egyszerű vizsgálattal szeretnénk eldönteni, például a pontnak az eloszlás középpontjától vett távolsága alapján.
A különböző változók (attribútumok) közötti korreláció miatt
azonban a többdimenziós normális eloszlás nem szimmetrikus a
középpontjára nézve. A 10.2 ábra mutatja a kétdimenziós,
kovarianciamátrixú Gauss-eloszlás valószínűség-sűrűségét.
Ha egyszerű küszöbértéket szeretnénk használni annak
eldöntésére, hogy egy objektum kiugró-e, akkor egy olyan
távolságmértékre van szükségünk, amely figyelembe veszi az adatok
eloszlásának alakját. A Mahalanobis távolság ilyen. (Lásd (2.14)
egyenlőséget a 83. oldalon.) Az
ahol
Könnyű megmutatni, hogy egy pont és az eloszlás várható értéke közötti Mahalanobis távolság közvetlenül kapcsolódik a pont valószínűségéhez. Konkrétan, a Mahalanobis távolság éppen a valószínűségi sűrűség logaritmusa plusz egy konstans. Lásd a 9. feladatot a 707. oldalon.
10.1. Példa.
(Kiugró érték többdimenziós normális eloszlásnál) A 10.3. ábra
egy kétdimenziós adathalmaz pontjainak (az eloszlás átlagától vett)
Mahalanobis távolságát mutatja. Az
Nagy Mahalanobis távolságú
Ez a szakasz egy olyan rendellenesség észlelő módszert ismertet, amely keverék modell megközelítést alkalmaz. A klaszterezésben (lásd 9.2.2. fejezetet) a keverék modell megközelítés azt feltételezi, hogy az adatok valószínűségi eloszlások keverékéből származnak, és hogy minden egyes klaszter megfeleltethető ezek közül egy eloszlásnak. A rendellenesség észlelésnél az adatokat hasonlóan két eloszlás keverékeként modellezzük: egy tartozik a normális adatokhoz, egy másik pedig a kiugró értékekhez.
A klaszterezésnél és a rendellenesség észlelésnél is az eloszlások paramétereinek becslése a cél, annak érdekében, hogy a likelihood (valószínűség) maximális legyen az adatokra. A klaszterezésnél az EM algoritmust használjuk az egyes valószínűségi eloszlások paramétereinek becslésére. Az itt bemutatásra kerülő rendellenesség észlelő módszer azonban egyszerűbb megközelítést alkalmaz. Kezdetben minden objektum a normális objektumok halmazába kerül, a rendellenes objektumok halmaza pedig üres. Ezután egy iteratív eljárás objektumokat helyez át az átlagos halmazból a rendellenes halmazba, mindaddig, míg az áthelyezés növeli az adatok teljes likelihoodját.
Tegyük fel, hogy a
alakban írható fel, ahol
ahol
Mivel a normális objektumok száma viszonylag nagy a
rendellenesekhez képest, a normális objektumok eloszlása nem változhat
sokat, amikor egy objektumot a rendellenességek közé helyezünk át.
Ebben az esetben viszonylag állandó marad minden egyes normális
objektum hozzájárulása a teljes likelihoodhoz. Továbbá, ha egyenletes
eloszlást tételezünk fel a rendellenességekről, akkor a
rendellenességek közé áthelyezett minden egyes objektum egy rögzített
értékkel járul hozzá a rendellenességek likelihoodjához. Ezért a
teljes likelihood összes változása egy objektum a rendellenességek
közé történő áthelyezésekor nagyjából egyenlő az objektum egyenletes
eloszlás melletti (
10.1 algoritmus. Likelihood-alapú kiugró érték észlelés |
1: Inicializálás: A
2: for minden
3: Helyezzük át
4: Számítsuk
ki
5: Számítsuk ki a
6: if
7: Az
8: end if 9: end for |
Az imént bemutatott helyzetben a 10.1. algoritmussal leírt
módszer nagyjából ekvivalens azzal, hogy azokat az objektumokat
osztályozzuk kiugró értékként, amelyek kis valószínűségűek a normális
objektumok eloszlása szerint. Ha például a 10.3. ábra pontjaira
alkalmaznánk, ez a módszer kiugró értékként osztályozná az
A kiugró érték észlelés statisztikai megközelítései megalapozottak és standard statisztikai módszerekre épülnek, mint például egy eloszlás paramétereinek becslése. Amikor elegendő ismeretünk van az adatokról és az alkalmazandó próbáról, ezek a próbák nagyon hatékonyak lehetnek. Egyetlen attribútumra vonatkozó statisztikai kiugró érték próbák széles választéka áll rendelkezésünkre. Kevesebb lehetőség van többdimenziós adatoknál, és ezek a próbák gyenge eredményt adhatnak sokdimenziós adatokra.