Az attribútumhalmaz és az osztályváltozó közötti kapcsolat sok alkalmazásban nemdeterminisztikus. Más szóval, egy tesztrekord osztálycímkéje nem jelezhető előre teljes bizonyossággal még akkor sem, ha az attribútumhalmaza azonos valamelyik tanulóesettel. Ez a helyzet a zajos adatok vagy bizonyos zavaró, az osztályozást befolyásoló, de az elemzésben nem szereplő hatások jelenléte miatt merülhet fel. Vegyük például annak előrejelzésének feladatát, hogy egy személy ki van-e téve a szívbaj kockázatának, a személy étrendje és edzéseinek gyakorisága alapján. Bár a legtöbb egészségesen táplálkozó és rendszeresen mozgó embernél kisebb eséllyel alakul ki szívbaj, még mindig kialakulhat más tényezők miatt, mint például az öröklődés, a mértéktelen dohányzás és túlzott alkoholfogyasztás. Annak eldöntése is értelmezés kérdése, hogy egy személy étrendje egészséges-e, vagy hogy megfelelő-e az edzéseinek gyakorisága, amely viszont bizonytalanságokat vihet be a tanulási feladatba.
Ez a szakasz egy megközelítést mutat be az attribútumhalmaz és az osztályváltozó közötti valószínűségi kapcsolatok modellezésére. A szakasz a Bayes-tételbe való bevezetéssel kezdődik, amely egy statisztikai elv az osztályokra vonatkozó a priori tudásnak az adatokból gyűjtött új tényekkel történő kombinálására. Kifejtésre kerül majd a Bayes-tétel felhasználása osztályozási problémák megoldására, amelyet a Bayes-féle osztályozók két implementációjának, a naiv Bayes-féle osztályozó és a Bayes-féle bizonyosságháló leírása követ.
Tekintsünk egy labdarúgó-mérkőzést két rivális csapat,
az
A kérdés a jól ismert Bayes-tétel segítségével válaszolható meg. A teljesség kedvéért néhány alapvető valószínűségszámítási definícióval kezdjük. A valószínűségszámítási fogalmakat nem ismerő olvasók 13. függelékhez fordulhatnak a téma egy tömör áttekintéséért.
Legyen
(5.9) egyenletben az utolsó két kifejezés átrendezése a következő képlethez vezet, amelyet Bayes-tételnek nevezünk:
A Bayes-tétel felhasználható a szakasz elején megfogalmazott
előrejelzési feladat megoldásához. Jelölési könnyítésként legyen
Annak valószínűsége, hogy az
Annak valószínűsége, hogy a
Annak valószínűsége, hogy a
Annak valószínűsége, hogy a
Célunk
ahol a teljes valószínűség tétele (lásd (13.5) egyenletet
app:total_prob. oldalon) került alkalmazásra a második sorban. Továbbá
Annak leírása előtt, hogy hogyan használható fel a Bayes-tétel
osztályozáshoz, formalizáljuk az osztályozási problémát statisztikai
nézőpontból. Jelölje
A tanítási fázis során a
Lakástulajdonos, Családi
állapot és Éves jövedelem. A fizetési késedelembe
esett hitelfelvevőket Igen-ként osztályozzuk, míg
Nem-ként azokat, akik visszafizették a kölcsönt.
Tételezzük fel, hogy adott egy tesztrekord a következő
attribútumhalmazzal:
Igen-ként
osztályozzuk, egyébként Nem-ként osztályozzuk.
Bonyolult probléma pontosan becsülni az a posteriori
valószínűségeket az osztálycímke és attribútumérték összes lehetséges
kombinációjára, mivel nagyon nagy tanulóhalmazt igényel, még csekély
számú attribútumra is. A Bayes-tétel azért hasznos, mert lehetővé
teszi számunkra az a posteriori valószínűség kifejezését a
Különböző
A naiv Bayes-féle osztályozó
(nave Bayes classifier) az
osztályra vonatkozó feltételes valószínűséget azt feltételezve becsüli
meg, hogy az attribútumok feltételesen függetlenek adott
ahol minden
Feltételes függetlenség
Mielőtt mélyre hatolnánk a naiv Bayes-féle osztályozó
működésének részleteibe, vizsgáljuk meg a feltételes függetlenség
fogalmát. Jelöljék
A feltételes függetlenség egy példája a karhossz és az olvasási készségek közötti kapcsolat. Úgy tapasztalhatnánk, hogy a hosszabb karú emberek többnyire magasabb szintű olvasási készségekkel rendelkeznek. Ez a kapcsolat egy zavaró tényező jelenlétével magyarázható, amely az életkor. Egy kisgyermeknek általában rövid karjai vannak és nem állnak rendelkezésére egy felnőtt olvasási készségei. Ha egy személy életkora rögzített, akkor eltűnik a karhossz és az olvasási készségek között megfigyelt kapcsolat. Megállapíthatjuk így, hogy a karhossz és az olvasási készségek feltételesen függetlenek, ha az életkor változó rögzített.
Az
ahol az (5.13) egyenletet használtuk fel ahhoz, hogy megkapjuk az (5.14) egyenlet utolsó sorát[2].
A naiv Bayes-osztályozó működése
A feltételes függetlenségi feltevéssel az osztályra vonatkozó
feltételes valószínűség
Egy tesztrekord osztályozásához a naiv Bayes-osztályozó minden
egyes
Mivel
Kategorikus attribútumok feltételes valószínűségeinek becslése
Egy
Folytonos attribútumok feltételes valószínűségeinek becslése
Két mód van folytonos attribútumok osztályra vonatkozó feltételes valószínűségeinek becslésére a naiv Bayes-féle osztályozókban:
Diszkretizálhatunk minden folytonos tulajdonságot, majd ezt
követően a megfelelő diszkrét intervallummal helyettesíthetjük a
folytonos attribútumértékeket. A módszer ordinális attribútumokká
alakítja a folytonos attribútumokat. A
A folytonos változóra feltételezhetünk egy bizonyos fajta
valószínűségi eloszlást, és a tanulóadatok segítségével
becsülhetjük meg az eloszlás paramétereit. A normális eloszlást
gyakran választják folytonos attribútumok osztályra vonatkozó
feltételes valószínűségének reprezentálásához. Az eloszlást két
paraméter jellemzi, a
A
Egy 120 000 dollár adóköteles jövedelmű tesztrekordra a következőképpen számíthatjuk ki az osztályra vonatkozó feltételes valószínűségét:
Megjegyezzük, hogy az osztályra vonatkozó feltételes
valószínűség előbbi értelmezése némileg félrevezető. Az (5.16)
egyenlet jobb oldala egy
Mivel
Példa a naiv Bayes-féle osztályozóra
Tekintsük az 5.10. (a) ábrán látható adatokat. Az előző alszakaszokban leírt módszertan segítségével minden egyes kategorikus attribútumra kiszámíthatjuk az osztályra vonatkozó feltételes valószínűséget a folytonos attribútum mintaátlagával és varianciájával együtt. Ezeket a valószínűségeket az 5.10. (b) ábra foglalja össze.
Az
Emlékezzünk arra a korábbi tárgyalásból, hogy ezekre az a
posteriori valószínűségekre becslés adható, ha kiszámoljuk a
Az egyes osztályok a priori valószínűsége megbecsülhető, ha
minden osztályra kiszámoljuk az odatartozó tanulórekordok arányát.
Mivel három Igen osztályba tartozó rekord és hét
Nem osztályba tartozó rekord van,
Ezeket kombinálva a Nem osztály a posteriori valószínűsége
Igen osztály a posteriori valószínűsége
nulla, mert az osztályra vonatkozó feltételes valószínűsége nulla.
Mivel
Nem -ként
osztályozzuk.
A feltételes valószínűség
Az előbbi példa az a posteriori valószínűségek tanulóadatokból való becslésének egy lehetséges problémáját szemlélteti. Ha valamelyik attribútum osztályra vonatkozó feltételes valószínűsége nulla, akkor ennek az osztálynak az a posteriori valószínűsége nullává válik. Az osztályra vonatkozó feltételes valószínűség egyszerű törtekkel történő becslésének ez a módszere törékenynek tűnhet, különösen akkor, ha kevés tanulóeset áll rendelkezésre és nagy az attribútumok száma.
Egy szélsőségesebb esetben, ha a tanulóesetek sok
attribútumértéket nem fednek le, lehet, hogy a tesztrekordok
némelyikét nem fogjuk tudni osztályozni. Például ha
A naiv Bayes-féle osztályozó nem lesz képes osztályozni a
rekordot. Ez a probléma kezelhető az osztályra vonatkozó feltételes
valószínűség becslésére szolgáló
ahol
Az előző szakaszban megadott példában a feltételes valószínűség
Ha
Igen osztály
minden attribútumára és
Nem osztály minden
attribútumára, akkor
A Nem osztály a posteriori valószínűsége
Igen osztály a posteriori
valószínűsége
A naiv Bayes-féle osztályozók jellemzői
A naiv Bayes-féle osztályozóknak általában a következő jellemzői vannak:
Robusztusak izolált zajos pontokra, mivel az ilyen pontok kiátlagolódnak a feltételes valószínűségek adatokból történő becslésénél. A naiv Bayes-féle osztályozók képesek hiányzó értékek kezelésére is, a modellépítés és osztályozás során figyelmen kívül hagyva az ilyeneket tartalmazó eseteket.
Robusztusak az irreleváns attribútumokra. Ha
Korrelált tulajdonságok leronthatják a naiv Bayes-féle osztályozó teljesítményét, mivel a feltételes függetlenségi feltevés már nem áll fenn az ilyen attribútumokra. Tekintsük például a következő valószínűségeket:
ahol
Ha
mivel
amely nagyobb, mint
Tegyük fel, hogy ismerjük azt a valóságnak megfelelő
valószínűségeloszlást, amely
5.3. Példa.
Vegyük azt a feladatot, amikor aligátorokat és krokodilokat kell
felismerni a hosszuk alapján. Egy felnőtt krokodil átlagos hossza
körülbelül 15 láb, míg egy felnőtt aligátor átlagos hossza
megközelítőleg 12 láb. Feltéve, hogy az
Az 5.11. ábra mutatja egy krokodil és egy aligátor osztályra
vonatkozó feltételes valószínűségének összehasonlítását. Feltéve, hogy
az a priori valószínűségeik megegyeznek, az ideális döntési határ
annál a bizonyos
Az (5.19) és (5.20) egyenletek felhasználásával azt kapjuk, hogy
amely megoldható,
Amikor az a priori valószínűségek különbözőek, a döntési határ a
kisebb a priori valószínűségű osztály felé tolódik el (lásd a 10.
feladatot a 327. oldalon). Kiszámítható továbbá az adott adatokon
bármely osztályozó által elérhető minimális hibaarány. Az ideális
döntési határ az előbbi példában aligátorként osztályoz minden olyan
élőlényt, amelyek hossza kisebb
A teljes hibaarány a Bayes-féle hibaarány (Bayes error rate).
A naiv Bayes-féle osztályozó által tett feltételes függetlenségi
feltevés túl szigorúnak tűnhet, különösen olyan osztályozási
problémáknál, amelyekben az attribútumok némileg korreláltak. A
szakasz egy rugalmasabb módszert mutat be a
Modell reprezentáció
Egy Bayes-féle bizonyosságháló (BBN -- Bayesian belief network) vagy egyszerűen Bayes-féle háló (Bayesian network) véletlen változók közötti valószínűségi kapcsolatok egy grafikus reprezentációját adja. Egy Bayes-féle hálónak két fő eleme van:
A változók közötti függőségi kapcsolatokat leíró irányított körmentes gráf (dag -- directed acyclic graph).
Egy valószínűségi tábla, amely minden egyes csúcsot a közvetlen szülőcsúcsaival kapcsol össze.
Vegyünk három véletlen változót,
1.Tulajdonság
(feltételes függetlenség) Egy csúcs egy Bayes-féle hálóban feltételesen független a nem leszármazottaitól, ha ismertek a szülői.
Az 5.12. (b) ábrán látható diagramban
A háló topológiája által meghatározott feltételes függetlenségi feltételek mellett minden egyes csúcshoz tartozik egy valószínűségi tábla is.
Ha egy X csúcsnak nincs szülője, akkor a tábla csak a P(X) a priori valószínűséget tartalmazza.
Ha egy X csúcsnak csak egy szülője van, Y, akkor a tábla a P(X|Y) feltételes valószínűséget tartalmazza.
Ha egy X csúcsnak több szülője van,
Az 5.13 ábra egy szívbaj vagy gyomorégés miatt szenvedő
betegeket modellező Bayes-féle hálóra mutat példát. A diagramban
minden egyes változó kétértékűnek feltételezett. A szívbaj (
A kockázati tényezőkhöz tartozó csúcsok csak az a priori
valószínűségeket tartalmazzák, míg a szívbaj, gyomorégés és ezek
megfelelő tüneteinek csúcsai a feltételes valószínűségeket.
Helytakarékossági okból néhány valószínűség el lett hagyva a
diagramról. Az elhagyott valószínűségeket pótolni lehet, ha figyelembe
vesszük, hogy
Modellépítés
A Bayes-féle hálókban a modellépítés két lépésből áll: (1) a hálózat szerkezetének létrehozása, és (2) a valószínűségi értékek becslése az egyes csúcsokhoz tartozó táblákban. A háló topológiáját megkaphatjuk a tárgyterület szakértőinek szubjektív tudását kódolva. Az 5.3. algoritmus egy szisztematikus eljárást mutat be a Bayes-háló topológiájának felépítéséhez.
5.3. algoritmus. Algoritmus Bayes-féle háló topológiájának létrehozásához |
1: Jelölje
2: for
3: Jelölje
4: Jelölje
5: Távolítsuk el
6: Hozzunk létre egy élt
7: end for |
5.4. Példa.
Tekintsük az 5.13. ábrán látható változókat. Az 1. lépés
végrehajtása után tegyük fel, hogy a változók a következő módon vannak
rendezve:
•
•
•
•
•
A fenti feltételes valószínűségek alapján éleket hozhatunk létre
a
Az 5.3. algoritmus egy olyan topológiát garantál, amely nem tartalmaz köröket. Ennek bizonyítása elég egyszerű. Ha létezik kör, akkor kell lennie legalább egy az alacsonyabb rendű csúcsokat a magasabb rendű csúcsokkal összekötő élnek, és legalább egy másik, a magasabb rendű csúcsokat az alacsonyabb rendű csúcsokkal összekötőnek. Mivel az 5.3. algoritmus megakadályozza, hogy az élek az alacsonyabb rendű csúcsokat kössék össze a magasabb rendű csúcsokkal, nem lehet kör a topológiában.
A hálózati topológia azonban megváltozhat, ha eltérő rendezési
sémát alkalmazunk a változókra. Néhány topológia gyenge minőségű
lehet, mert sok külöböző csúcspárt összekötő élt okoz. Elvileg lehet,
hogy meg kell vizsgálnunk az összes lehetséges
Ha megtaláltuk a helyes topológiát, minden egyes csúcshoz meghatározásra kerül a hozzá tartozó valószínűségi tábla. Az ilyen valószínűségek becslése meglehetősen egyszerű és hasonló a naiv Bayes-féle osztályozó által felhasznált módszerhez.
Bayes-féle háló segítségével történő következtetés példája
Tegyük fel, hogy az 5.13. ábrán látható Bayes-féle háló felhasználása érdekel minket annak megállapításához, hogy vajon egy személynek van-e szívbaja. A következő esetek azt szemléltetik, hogy hogyan állítható fel a diagnózis különböző forgatókönyvek mellett.
1. eset: nincs a priori információ
A priori információ nélkül meghatározhatjuk, hogy vajon a
személy vélhetőleg szívbajos-e, ha kiszámoljuk a
Mivel
2. eset: magas vérnyomás
Ha a személy magas vérnyomású, diagnózist állíthatunk fel a
szívbajról, ha a
ahol
Hasonlóan
3. eset: magas vérnyomás, egészséges táplálkozás és rendszeres testmozgás
Tételezzük fel, hogy arról értesülünk, hogy a személy rendszeresen mozog és egészségesen étkezik. Hogyan befolyásolja az új információ a diagnózisunkat? Az új információval annak az a posteriori valószínűsége, hogy a személy szívbajos
míg annak valószínűsége, hogy a személy nem szívbajos
A modell ezért arra enged következtetni, hogy az egészséges étkezés és a rendszeres testmozgás csökkentheti egy személy esetén a szívbaj kockázatát.
A Bayes-féle bizonyosságháló jellemzői
A Bayes-féle bizonyosságháló módszer néhány általános jellemzője az alábbi:
A Bayes-féle háló módszert biztosít egy adott terület a priori tudásának rögzítéséhez egy grafikus modell segítségével. A háló felhasználható változók közötti okozati kapcsolatok kódolásához is.
A háló létrehozása időigényes lehet és nagy erőfeszítést igényel. Ha azonban meghatározásra került a háló szerkezete, egy új változó hozzáadása elég egyszerű.
Bayes-féle hálók kiválóan alkalmasak hiányos adatok kezelésére. Úgy lehet kezelni azokat a példányokat, amelyeknek hiányoznak az attribútumai, hogy összeadjuk vagy intergráljuk a valószínűségeket az attribútum összes lehetséges értékére.
Mivel az adatok kombinálása valószínűségi alapon történik az a priori információkkal, a módszer elég robusztus a modell túlillesztésre.
[2] A fordító megjegyzése: A valószínűségszámítás absztrakt felépítésében valójában így definiáljuk a feltételes függetlenséget.