Az asszociációkat elemző algoritmusok potenciálisan nagyon nagy számú mintázatot állíthatnak elő. A 6.1. táblázatban látható adathalmaz például csupán hat elemet tartalmaz, mégis a megfelelő támogatottsági és megbízhatósági értékek mellett akár több száz asszociációs szabály t is ki lehet belőle nyerni. Mivel a valós kereskedelmi adatbázisok mérete és kiterjedése nagyon nagy lehet, könnyen több ezer vagy akár több millió mintázattal is szembetalálhatjuk magunkat, mely mintázatok közül sok valószínűleg nem is érdekes. A mintázatok közül a legérdekesebbek kiszűrése nem egy triviális feladat, hiszen ``ami valakinek szemét, az lehet hogy másnak kincs''. Emiatt fontos összeállítani egy széles körben elfogadott kritériumlistát, mely alapján értékelni lehet az asszociációs mintázatok minőségét.
A kritériumok első csoportját statisztikai érvek határozhatják meg. A kölcsönösen független elemcsoportokat tartalmazó, vagy a nagyon kevés tranzakció t lefedő mintázatokat érdektelennek tekintjük, mivel az adathalmazban valószínűleg félrevezető összefüggéseket jelölnek. Az ilyen mintázatok kizárhatók egy objektív érdekességi mérték használatával. Egy ilyen mérték az adatokból nyert statisztikák alapján dönti el, hogy egy mintázat érdekes-e vagy sem. Objektív érdekességi mértékekre példa a támogatottság, a megbízhatóság, illetve a korreláció.
A kritériumok második csoportját szubjektív argumentumok adhatják.
Egy mintázatot szubjektív szempontból érdektelennek tekintünk, ha nem
mutat rá valamilyen váratlan információra, vagy ha nem nyújt olyan
hasznos tudást, ami valamilyen jövedelmező tevékenységhez vezethet.
Például a
Nézzünk néhány módszert arra, hogy a mintázatok feltárását hogyan tudjuk segíteni a szubjektív tudással:
Vizualizáció
Ennél a megközelítésnél egy felhasználóbarát környezetre van szükség. Ez a környezet lehetővé teszi a szakértők és az adatbányász rendszer közti kölcsönhatást, melynek során a szakértők értelmezik és ellenőrzik a felfedezett mintázatokat.
Sablon-alapú megközelítés
Ez a módszer lehetővé teszi a felhasználóknak, hogy az adatbányászati algoritmus által kinyert mintázatokra korlátozásokat vezessenek be. Ekkor az összes kinyert szabály helyett csak a felhasználó által megadott sablonnak megfelelő szabályokat kapja meg a felhasználó.
Szubjektív érdekességi mérték
Egy szubjektív mértéket egy adott terület információi ( például fogalmi hierarchiák, lásd a 7.3. alfejezetet; vagy árucikkek profit fedezete) alapján lehet definiálni. A mértékkel ezután ki lehet szűrni a nyilvánvaló és érdektelen mintázatokat.
A szubjektív érdekességi mértékek iránt érdeklődő olvasók további információt találhatnak a fejezet végén lévő irodalomjegyzékben.
Egy objektív mérték egy adatvezérelt megközelítés az
asszociációs szabály ok minőségének értékelésére. Egy objektív mérték
független a területtől és a felhasználóktól, csak minimális bementet
igényel a kevésbé érdekes mintázatok kiszűréséhez szükséges hatérték
megadásán kívül. Egy objektív mértéket általában egy kontigenciatáblázatban szereplő gyakorisági
értékek alapján számítunk ki. A 6.7. táblázatban az
6.7. táblázat - Az
|
|
| |
|
|
|
|
|
|
|
|
|
|
|
|
A támogatottság-megbízhatóság korlátai
A hagyományos asszociációs szabály okat bányászó módszerek az érdektelen mintázatok kizárására a támogatottsági és megbízhatósági értékeket használják. A támogatottság hátrányáról a 6.8. szakaszban lesz szó, ahol látni fogjuk, hogy a támogatottsági küszöbérték számos olyan potenciálisan érdekes mintázatot is kizár, melyekben néhány alacsony támogatottságú elem is szerepel. A megbízhatóság hátrányát, amely jóval körmönfontabb, a következő példával tudjuk a legjobban szemléltetni.
6.3. Példa.
Tegyük fel, hogy a tea- és kávéfogyasztók közötti kapcsolatot szeretnénk elemezni. Egy csoport italfogyasztási szokásait összegyűjtve a válaszokat egy táblázatban foglalhatjuk össze (lásd a 6.8. táblázatot).
6.8. táblázat - Italfogyasztási szokások egy 1000 fős csoportban
|
|
| |
| 150 | 50 | 200 |
| 650 | 150 | 800 |
| 800 | 200 | 1000 |
A táblázatban megadott információk alapján értékelni tudjuk a
A megbízhatóság azért félrevezető, mert ez a mérték teljesen figyelmen kívül hagyja a szabály következményi oldalán szereplő elemhalmaz támogatottságát. Valóban, ha a kávét fogyasztók támogatottságát vesszük, akkor nem lepődünk meg azon, ha sok teát fogyasztó kávét is iszik egyben. Ennél meglepőbb viszont az, hogy azon teát fogyasztók aránya, akik kávét is isznak, valójában kisebb, mint a kávéfogyasztók összaránya. Ez egy fordított viszonyra enged következtetni a tea- és kávéfogyasztók között.
A támogatottság-megbízhatóság korlátai miatt számos objektív mértéket vezettek be az asszociációs mintázatok minőségének értékeléséhez. Az alábbiakban egy rövid áttekintést nyújtunk ezekről a mértékekről, és kitérünk az egyes mértékek előnyeire és korlátaira.
Érdekességi tényező
A tea-kávé példa rámutatott, hogy a magas megbízhatóságú szabály ok néha félrevezetők lehetnek, ugyanis a megbízhatósági mérték nem veszi figyelembe a szabály ok következményi oldalán szereplő elemhalmazok támogatottságát. Ezt a problémát például a lift nevű mértékkel lehet orvosolni:
Ez a mérték a szabály megbízhatósága és a szabály következményi oldalán szereplő elemhalmaz támogatottsága közti arányt számítja ki. Bináris változók esetén a lift ekvivalens az érdekességi tényező nevű objektív mértékkel, melyet a következőképpen definiálunk:
Az érdekességi tényező egy mintázat gyakoriságát hasonlítja össze a statisztikai függetlenség feltétele alatt kiszámított alapvonali gyakorisággal. Az alapvonali gyakoriság egy kölcsönösen független változópár esetén
Ez a képlet azt a bevett megközelítést követi, mely szerint
egyszerű törteket használunk a valószínűségek becslésére. Az
A 6.8. táblázatban szereplő tea-kávé példa esetén
Az érdekességi tényező korlátai
Az érdekességi tényező korlátait egy szövegbányászati példával szemléltetjük. Szövegek esetén joggal feltételezhetjük, hogy egy szópár tagjai közti asszociáció attól függ, hogy hány dokumentum tartalmazza mindkét szót. Például az erősebb asszociáció miatt azt várjuk, hogy az adat és bányászat szavak gyakrabban fordulnak elő számítástechnikai cikkekben mint a fordító és bányászat szavak.
A 6.9. táblázat két szópár (
6.9. táblázat - A {
|
|
|
|
|
|
|
|
|
| 880 | 50 | 930 |
|
| 20 | 50 | 70 |
| 50 | 20 | 70 |
|
| 50 | 880 | 930 |
| 930 | 70 | 1000 |
|
| 70 | 930 | 1000 |
Korrelációanalízis
A korrelációanalízis egy statisztikai alapú módszer változópárok
közti kapcsolatok elemzésére. Folytonos változók esetén a korrelációt
a Pearson korrelációs együttható felhasználásával definiáljuk (lásd a
(2.10) képletet a 79. oldalon). Bináris változók esetén a korrelációt
a
A korreláció értéke
A korrelációanalízis korlátai
A korreláció használatának hátrányát jól mutatja a szópárokat
tartalmazó példa a 6.9. táblázatban. Bár a
IS mérték
Az
Megjegyezzük, hogy az
Megmutatható, hogy az
Az
Mivel két tetszőleges szám mértani közepe mindig a kisebb
számhoz van közelebb, ezért egy
Az IS mérték korlátai
Az
Mivel ez az érték
6.10. táblázat - A
|
|
| |
| 800 | 100 | 900 |
| 100 | 0 | 100 |
| 900 | 100 | 1000 |
Alternatív objektív érdekességi mértékek
Az eddig bemutatott mértékek mellett egyéb mértékek is léteznek
bináris változópárok közti kapcsolatok elemzésére. Ezek a mértékek két
kategóriába sorolhatók, úgy mint szimmetrikus és aszimmetrikus mértékek. Egy
6.11. táblázat - Szimmetrikus objektív mértékek az
mérték (szimbólum) | definíció |
korreláció (
|
|
esélyhányados (
|
|
kappa (
|
|
érdekesség (
|
|
koszinusz (
|
|
Piatetsky-Shapiro (
|
|
együttes erő (
|
|
Jaccard (
|
|
teljes-bizonyosság (
|
|
6.12. táblázat - Aszimmetrikus objektív mértékek az
mérték (szimbólum) | definíció |
Goodman-Kruskal (
|
|
kölcsönös információ (
|
|
J-mérték (
|
|
Gini index (
|
|
| |
Laplace (
|
|
meggyőződés (
|
|
bizonyossági tényező (
|
|
hozzáadott érték (
|
|
Következetesség az objektív mértékek között
A mértékek széles skáláját látva joggal tehetjük fel a kérdést, hogy vajon hasonló eredményt adnak-e asszociációs mintázatok egy halmazán alkalmazva. Ha a mértékek következetesek (konzisztensek), akkor bármelyiket választhatjuk értékeléseinkhez. Ellenkező esetben viszont fontos megérteni a mértékek közti különbségeket ahhoz, hogy ki tudjuk választani a megfelelő mértéket a különböző típusú mintázatok elemzéséhez.
6.13. táblázat - Példa kontingenciatáblázatokra
példa |
|
|
|
|
| 8123 | 83 | 424 | 1370 |
| 8330 | 2 | 622 | 1046 |
| 3954 | 3080 | 5 | 2961 |
| 2886 | 1363 | 1320 | 4431 |
| 1500 | 2000 | 500 | 6000 |
| 4000 | 2000 | 1000 | 3000 |
| 9481 | 298 | 127 | 94 |
| 4000 | 2000 | 2000 | 2000 |
| 7450 | 2483 | 4 | 63 |
| 61 | 2483 | 4 | 7452 |
Vegyük a 6.13. táblázatban látható tíz kontingenciatáblázatot,
és alkalmazzuk rájuk a szimmetrikus és aszimmetrikus mértékeket.
Ezeket a kontingenciatáblázatokat úgy választottuk, hogy szemléltetni
tudjuk velük a mértékek közti különbségeket. A mértékek által
felállított sorrendet a 6.14. és 6.15. táblázatban foglaltuk össze
(ahol az 1 a legérdekesebb, a 10 pedig a legkevésbé érdekes
kontingenciatáblázatot jelöli). Bár néhány mérték egymással
konzisztensnek tűnik, bizonyos mértékek viszont alapvetően eltérő
sorrendet javasolnak. Például a
6.14. táblázat - A kontingenciatáblázat ok rangsorolása a 6.11. táblázatban megadott szimmetrikus mértékek alapján
|
|
|
|
|
|
|
|
|
|
| 1 | 3 | 1 | 6 | 2 | 2 | 1 | 2 | 2 |
| 2 | 1 | 2 | 7 | 3 | 5 | 2 | 3 | 3 |
| 3 | 2 | 4 | 4 | 5 | 1 | 3 | 6 | 8 |
| 4 | 8 | 3 | 3 | 7 | 3 | 4 | 7 | 5 |
| 5 | 7 | 6 | 2 | 9 | 6 | 6 | 9 | 9 |
| 6 | 9 | 5 | 5 | 6 | 4 | 5 | 5 | 7 |
| 7 | 6 | 7 | 9 | 1 | 8 | 7 | 1 | 1 |
| 8 | 10 | 8 | 8 | 8 | 7 | 8 | 8 | 7 |
| 9 | 4 | 9 | 10 | 4 | 9 | 9 | 4 | 4 |
| 10 | 5 | 10 | 1 | 10 | 10 | 10 | 10 | 10 |
6.15. táblázat - A kontingenciatáblázat ok rangsorolása a 6.12. táblázatban megadott aszimmetrikus mértékek alapján
|
|
|
|
|
|
|
|
|
| 1 | 1 | 1 | 1 | 4 | 2 | 2 | 5 |
| 2 | 2 | 2 | 3 | 5 | 1 | 1 | 6 |
| 5 | 3 | 5 | 2 | 2 | 6 | 6 | 4 |
| 4 | 6 | 3 | 4 | 9 | 3 | 3 | 1 |
| 9 | 7 | 4 | 6 | 8 | 5 | 5 | 2 |
| 3 | 8 | 6 | 5 | 7 | 4 | 4 | 3 |
| 7 | 5 | 9 | 8 | 3 | 7 | 7 | 9 |
| 8 | 9 | 7 | 7 | 10 | 8 | 8 | 7 |
| 6 | 4 | 10 | 9 | 1 | 9 | 9 | 10 |
| 10 | 10 | 8 | 10 | 6 | 10 | 10 | 8 |
Az objektív mértékek jellemzői
A 6.14. táblázat eredményei arra engednek következtetni, hogy a mértékek jelentős része egymásnak ellentmondó eredményt ad a mintázatok minőségét illetően. A különbségek megértése érdekében meg kell vizsgálni ezeknek a mértékeknek a jellemzőit.
Az inverzió tulajdonság
Tekintsük a 6.28. ábrán látható bitvektorokat. Az
oszlopvektorokban szereplő 0/1 bit azt jelöli, hogy egy tranzakció
(sor) tartalmaz-e egy adott elemet (oszlop). Például az
6.6. Definíció
(Inverzió tulajdonság) Egy
6.28. ábra - Az inverzió művelet hatása. A

A következő mértékek maradnak változatlanok erre a műveletre:
A null-bővítés tulajdonság
Tegyük fel hogy egy dokumentumhalmazban az adat és a bányászat szópár közti kapcsolatot szeretnénk elemezni. Ha ehhez az adathalmazhoz jéghalászattal kapcsolatos cikkeket adunk hozzá, akkor ez vajon befolyásolja az adat és a bányászat közti asszociációt? Ezt a műveletet, vagyis amikor egy adathalmazhoz idegen adatokat (ebben az esetben dokumentumokat) adunk hozzá, null-bővítés (null addition) műveletnek nevezzük.
6.7. Definíció
(Null-bővítés tulajdonság) Egy
Az olyan alkalmazások esetén, mint például a dokumentumelemzés
vagy a bevásárlókosarak analízise, azt várjuk el a mértéktől, hogy a
null-bővítés művelettel szemben változatlan maradjon. Máskülönben a
szavak közti kapcsolat megszűnhet, ha elegendő számú olyan
dokumentumot adunk hozzá, amelyek egyik szót sem tartalmazzák! Az
előző jellemzőnek a koszinusz (
A skálázás tulajdonság
A 6.16. táblázat kontingenciatáblázatai nemek és osztályzatok gyakoriságát mutatja. A felmérés egy egyetemi kurzuson történt 1993-ban és 2004-ben. A táblázatokból látható, hogy a férfi hallgatók száma a duplájára nőtt 1993 óta, míg a női hallgatók száma megháromszorozódott. A 2004-es férfi hallgatók azonban semmivel sem teljesítenek jobban, mint az 1993-asok, ugyanis a magas pontszámot és az alacsony pontszámot szerzők aránya továbbra is 3:4. Hasonlóképpen a 2004-es női hallgatók sem jobbak, mint az 1993-asok. Az osztályzatok és a nemek közti asszociációtól a mintaeloszlásban történt változások ellenére nem várunk változást.
6.16. táblázat - Osztályzatok és nemek közti összefüggések
| férfi | nő |
|
|
| férfi | nő |
|
magas | 30 | 20 | 50 |
| magas | 60 | 60 | 120 |
alacsony | 40 | 10 | 50 |
| alacsony | 80 | 30 | 110 |
| 70 | 30 | 100 |
|
| 140 | 90 | 230 |
| ||||||||
(a) Minta 1993-ból |
| (b) Minta 2004-ből |
6.8. Definíció
(Skálainvariancia tulajdonság) Egy
Vegyük észre, hogy a 6.17. táblázatban egyedül az esélyhányados
(
6.17. táblázat - A szimmetrikus mértékek jellemzői
Szimbólum | Mérték | Inverzió | Null-bővítés | Skálázás |
|
| igen | nem | nem |
| esélyhányados | igen | nem | igen |
| Cohen-féle | igen | nem | nem |
| érdekesség | nem | nem | nem |
| koszinusz | nem | igen | nem |
| Piatetsky-Shapiro | igen | nem | nem |
| együttes erő | igen | nem | nem |
| Jaccard | nem | igen | nem |
| teljes-bizonyosság | nem | nem | nem |
| támogatottság | nem | nem | nem |
A 6.11. és 6.12. táblázatban látható mértékek bináris
változópárokra ( például 2-elemhalmazokra vagy asszociációs szabály
okra) vannak definiálva. Több ezek közül azonban, mint például a
támogatottság vagy a teljes-bizonyosság, nagyobb méretű elemhalmazokra
is alkalmazható. Néhány mérték ( például érdekességi tényező,
6.18. táblázat - Példa háromdimenziós kontingenciatáblázatra
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Egy
Ezt a definíciót felhasználva ki tudjuk terjeszteni az objektív
mértékeket ( például az érdekességi tényezőt és a
Az objektív mértékek definiálásának egy másik módja az, hogy
vesszük egy mintázat elempárjai közti asszociációk maximumát,
minimumát, vagy átlagát. Például egy adott
A többdimenziós kontingenciatáblázatok elemzését megnehezíti az adatokban szereplő részleges kapcsolatok jelenléte. Némely társítások például megjelenhetnek vagy eltűnhetnek attól függően, hogy bizonyos változók milyen értékkel rendelkeznek. Ezt a problémát Simpson paradoxona néven is ismerjük, és a következő szakaszban mutatjuk be. Az ilyesfajta összefüggések elemzésére léteznek kifinomultabb statisztikai módszerek ( például loglineáris modellek), de ezen módszerek tárgyalása meghaladja e könyv kereteit.
A változók közötti asszociációk értelmezésekor óvatosan kell eljárni, ugyanis a megfigyelt összefüggéseket egyéb zavaró tényezők is befolyásolhatják ( például az elemzésben nem szereplő rejtett változók). Bizonyos esetekben a rejtett változók hatására a változópárok között megfigyelt összefüggés eltűnhet, vagy megváltozhat az iránya. Ezt a jelenséget Simpson paradoxona néven ismerjük. Ezen paradoxon természetét a következő példával szemléltetjük.
Tekintsük a nagyfelbontású televíziók (HDTV) és az edzőgépek
közötti kapcsolatot (lásd a 6.19. táblázatot). A
6.19. táblázat - Kétdimenziós kontingenciatáblázat nagyfelbontású televíziók és edzőgépek eladásáról
HDTV | edzőgép vétel |
| |
vétel | igen | nem |
|
igen | 99 | 81 | 180 |
nem | 54 | 66 | 120 |
| 153 | 147 | 300 |
6.20. táblázat - # Példa háromdimenziós kontingenciatáblázatra
vásárlói | HDTV | edzőgép vétel | összeg | |
csoport | vétel | igen | nem |
|
főiskolai diák | igen | 1 | 9 | 10 |
nem | 4 | 30 | 34 | |
dolgozó felnőtt | igen | 98 | 72 | 170 |
nem | 50 | 36 | 86 |
Azonban egy mélyebb elemzésből kiderül, hogy ezeknek a termékeknek az eladása attól függ, hogy a vevő főiskolai diák vagy dolgozó felnőtt. A 6.20. táblázat összefoglalja a HDTV-k és edzőgépek közötti kapcsolatot a főiskolai diákok és dolgozó felnőttek körében. Vegyük észre, hogy a táblázatban szereplő főiskolai diákok és dolgozó felnőttek vásárlással kapcsolatos adatainak összege tab4:simpson_table1. táblázatban látható gyakorisági értékeknek felel meg. Ráadásul több dolgozó felnőtt veszi meg ezeket a cikkeket, mint főiskolai diák. Főiskolai diákok esetén:
míg dolgozó felnőttek esetén:
Mindkét csoport esetén az látható, hogy a HDTV-t nem vásárló vevők inkább vesznek edzőgépet, ami ellentmond az előző eredménynek mikor a két vásárlói csoport adatait összevonva kezeltük. Még az alternatív mértékek ( például korreláció, esélyhányados, vagy érdekesség) alkalmazása esetén is azt tapasztaljuk, hogy a HDTV-k és edzőgépek eladása pozitívan korrelál az összevont adathalmazban, de negatívan korrelál a rétegzett adatok esetén (lásd a 20. gyakorlatot a 426. oldalon). A kapcsolatok irányának ilyesfajta megfordulását Simpson paradoxonának hívjuk.
A paradoxont a következőképpen lehet megmagyarázni. Vegyük észre, hogy a HDTV-t vásárlók többsége dolgozó felnőtt. Ugyancsak a dolgozó felnőttek veszik az edzőgépeket a legnagyobb számban. Mivel a vevők közel 85%-a dolgozó felnőtt, a HDTV-k és edzőgépek között megfigyelt kapcsolat az összevont adatok esetén erősebb lesz, mint ha az adatokat rétegeztük volna. Ezt matematikailag a következőképpen szemléltethetjük. Tegyük fel, hogy
ahol
ami hibás következtetéshez vezet a változók közti összefüggést illetően. Tanulság: az adatokat megfelelő módon kell rétegezni ahhoz, hogy elkerüljük a Simpson paradoxonára visszavezethető hamis mintázatokat. Egy szupermarkethálózat bevásárlókosár adatait például az üzletek elhelyezkedése alapján kell rétegezni; a betegek kórtörténeti adatait olyan zavaró tényezők alapján kell rétegezni, mint az életkor vagy a nem, stb.