Az előző szakaszban bemutatott internetes kérdőíves adatok tartalmazhatnak olyan folytonos attribútumokat is, mint amilyenek például a 7.3. táblázatban láthatóak. Az ilyen folytonos attribútumok bányászata olyan hasznos információkra deríthet fényt, mint például hogy ``a 120 000 dollár feletti éves keresettel rendelkező felhasználók a 45--60 év közötti korcsoportba tartoznak'', vagy hogy ``az olyan felhasználók, akik háromnál több e-mail címmel rendelkeznek és hetente 15-nél több órát töltenek online, gyakran aggódnak személyes adataik biztonságáért.'' A folytonos attribútumokat tartalmazó asszociációs szabályokat általában kvantitatív asszociációs szabályoknak nevezzük.
7.3. táblázat - Internetes kérdőíves adatok folytonos attribútumokkal
Nem |
| Kor | Éves | Hetente online | Email címek | Biztonsági |
|
| bevétel | töltött órák | száma | aggályok | |
nő |
| 26 | 90 000 | 20 | 4 | igen |
férfi |
| 51 | 135 000 | 10 | 2 | nem |
férfi |
| 29 | 80 000 | 10 | 3 | igen |
nő |
| 45 | 120 000 | 15 | 3 | igen |
nő |
| 31 | 95 000 | 20 | 5 | igen |
férfi |
| 25 | 55 000 | 25 | 5 | igen |
férfi |
| 37 | 100 000 | 10 | 1 | nem |
férfi |
| 41 | 65 000 | 8 | 2 | nem |
nő |
| 26 | 85 000 | 12 | 1 | nem |
|
|
|
|
|
|
|
Ebben a szakaszban a folytonos adatokon alkalmazható asszociációs elemzés különböző módszertanaival foglalkozunk. Konkrétan a következő három módszertípust tárgyaljuk: (1) diszkretizálás-alapú módszerek, (2) statisztikán alapuló módszerek, és (3) nem diszkretizálási módszerek. Az ezekkel a módszerekkel előállított kvantitatív asszociációs szabályok tulajdonságai nagy mértékben különböznek egymástól.
Folytonos attribútumok kezelésére a leggyakrabban alkalmazott megközelítés a diszkretizálás. Ez a megközelítés a folytonos attribútum egymáshoz közeli értékeit véges számú intervallumba csoportosítja. Például a Kor attribútumot feloszthatjuk a
intervallumokra, ahol
7.4. táblázat - Internetes kérdőíves adatok a kategorikus és folytonos attribútumok binarizálása után
Férfi | Nő |
| Kor | Kor | Kor |
| Biztonsági | Biztonsági |
|
|
|
|
|
| aggályok | aggályok | |
|
|
|
|
|
| = igen | = nem | |
0 | 1 |
| 0 | 0 | 1 |
| 1 | 0 |
1 | 0 |
| 0 | 0 | 0 |
| 0 | 1 |
1 | 0 |
| 0 | 0 | 1 |
| 1 | 0 |
0 | 1 |
| 0 | 0 | 0 |
| 1 | 0 |
0 | 1 |
| 0 | 0 | 0 |
| 1 | 0 |
1 | 0 |
| 0 | 0 | 1 |
| 1 | 0 |
1 | 0 |
| 0 | 0 | 0 |
| 0 | 1 |
1 | 0 |
| 0 | 0 | 0 |
| 0 | 1 |
0 | 1 |
| 0 | 0 | 1 |
| 0 | 1 |
|
|
|
|
|
|
|
|
|
Az attribútumok diszkretizálásának egyik legfontosabb paramétere az intervallumok száma, amelyekre az egyes attribútumokat felosztjuk. Ezt a paramétert általában a felhasználók adják meg, és általában az intervallumhosszal (az egyenlő intervallumhossz módszerénél), az egy intervallumra jutó átlagos tranzakciószámmal (az egyenlő gyakoriság módszerénél), vagy a klaszterek kívánt számával (a klaszterezés-alapú módszernél) fejezhető ki. A 7.5. táblázatban látható adatok a felmérésben résztvevő 250 felhasználó válaszait összesítik. Ezeken keresztül érzékeltethető a megfelelő intervallumszám meghatározásának nehézsége.
7.5. táblázat - Az online csevegésben résztvevő internet-felhasználók felosztása korcsoport szerint
Korcsoport | Online csevegés = igen | Online csevegés = nem |
| 12 | 13 |
| 11 | 2 |
| 11 | 3 |
| 12 | 13 |
| 14 | 12 |
| 15 | 12 |
| 16 | 14 |
| 16 | 14 |
| 4 | 10 |
| 5 | 11 |
| 5 | 10 |
| 4 | 11 |
Az adatokból két erős szabály nyerhető ki:
|
|
|
|
Ezek a szabályok arra engednek következtetni, hogy a 16--24 év
közötti korcsoportba tartozó felhasználók többsége gyakran vesz részt
online csevegésben, míg a 44--60 év közötti korcsoportba tartozók
kevésbé hajlamosak erre. Ebben a példában csak akkor tekintünk
érdekesnek egy szabályt, ha annak
1. Ha az intervallumok túl tágak, alacsony megbízhatóságuk miatt
elveszíthetünk néhány mintázatot. Például ha az intervallumhossz 24
év, az
|
|
|
|
Bár támogatottságuk magasabb, a tágabb intervallumok hatására mindkét szabály megbízhatósága az alsó megbízhatósági küszöbérték alá esett, melynek eredményeképpen mindkét mintázat elvész a diszkretizálás után.
2. Ha az intervallumok túl szűkek, alacsony támogatottságuk
miatt veszíthetünk el néhány mintázatot. Például ha az
intervallumhossz 4 év, akkor
|
|
|
|
Mivel a részszabályok támogatottsága nem éri el a támogatottsági
küszöbértéket,
3. Ha az intervallumhossz 8 év, akkor az
|
|
|
|
Mivel az
|
|
|
|
Az
Ezeket a problémákat kezelhetjük úgy, hogy megvizsgáljuk a
szomszédos intervallumok minden lehetséges csoportosítását.
Megállapíthatunk kezdetben például 4 éves intervallumhosszt, majd a
szomszédos intervallumok egyesítésével létrehozhatunk tágabb
intervallumokat:
A számítás rendkívül költségessé
válik. Ha kezdetben
Sok felesleges szabály kerül kinyerésre. Tekintsük például a következő szabálypárt:
|
|
|
|
Az
Kvantitatív asszociációs szabályok segítségével kikövetkeztethetjük egy populáció statisztikai tulajdonságait. Tegyük fel például, hogy ki szeretnénk deríteni internet-felhasználók bizonyos csoportjainak átlagéletkorát a 7.1. és 7.3. táblázatokban megadott adatok alapján. Az ebben a szakaszban leírt statisztikán alapuló módszerrel az alábbihoz hasonló kvantitatív asszociációs szabályokat nyerhetünk:
A szabály azt állapítja meg, hogy átlagosan 38 évesek az olyan internet-felhasználók, akik éves bevétele meghaladja a 100 ezer dollárt és rendszeresen vásárolnak online.
Szabálygenerálás
Statisztikán alapuló asszociációs szabályok generálásához meg
kell határoznunk azt a célattribútumot, amellyel leírjuk a populáció
érdekes szegmenseit. A célattribútumot kihagyva az adatállomány többi
kategorikus és folytonos attribútumát az előző szakaszban tárgyalt
módszerekkel binarizáljuk. Ezután olyan meglévő algoritmusokkal
nyerjük ki a gyakori elemhalmazokat a binarizált adatokból, mint
például az Apriori vagy az FP-bővítés. Minden gyakori elemcsoport a
populáció egy számunkra érdekes szegmensét azonosítja. A célattribútum
eloszlását minden szegmensben olyan leíró statisztikákkal
összegezhetjük, mint például az átlag, a medián, a szórásnégyzet és az
abszolút eltérés. Az előbbi szabályt úgy nyertük például, hogy
átlagoltuk azon internet-felhasználók életkorát, akik támogatják az
Ha ezt a módszert alkalmazzuk, a feltárt kvantitatív asszociációs szabályok száma egyenlő lesz a kinyert gyakori elemhalmazok számával. A kvantitatív asszociációs szabályokra definiálásuk módja miatt nem alkalmazható a megbízhatóság fogalma. Ezért a következőkben egy alternatív módszert mutatunk be kvantitatív asszociációs szabályok ellenőrzésére.
Szabályok ellenőrzése
Egy kvantitatív asszociációs szabály csak akkor érdekes
számunkra, ha az általa lefedett tranzakciókból származó statisztikák
eltérnek azoktól, amelyeket azokból a tranzakciókból számítunk,
amelyeket nem fed le. A szakasz elején megadott szabály például csak
akkor érdekes, ha 38 évnél szignifikánsan magasabb vagy alacsonyabb
azon internet-felhasználók átlagéletkora, akik nem támogatják az
Tekintsük az
Ebben az esetben azt feltételezzük, hogy
ahol
7.1. Példa.
Tekintsük a
kvantitatív asszociációs szabályt. Tegyük fel, hogy az előző
szabály előfeltételét 50 internet-felhasználó támogatja, akik
életkorának szórása 3,5. Másrészt viszont 30 az átlagéletkora annak a
200 felhasználónak, akik a szabály előfeltételét nem támogatják,
életkoruk szórása pedig 6,5. Tegyük fel, hogy egy kvantitatív
asszociációs szabály csak akkor érdekes számunkra, ha a
Ha egy egyoldali hipotézist vizsgálunk 95%-os
konfidenciaszinten, a kritikus érték a nullhipotézis elvetéséhez 1,64.
Mivel
Bizonyos alkalmazásoknál az elemzők sokkal inkább az iránt érdeklődnek, hogy a folytonos attribútumok között találjanak összefüggéseket, mint hogy a folytonos attribútumok diszkrét intervallumai között. Tekintsük például a szavak közti összefüggések feltárásának problémáját, mint ahogy az a 7.6. táblázatban is látható. A dokumentum-szó mátrix minden egyes eleme egy, az adott dokumentumban megjelenő szó normalizált gyakorisági száma. Az adatok normalizálását úgy végezzük el, hogy minden egyes szó gyakoriságát elosztjuk a szónak a teljes dokumentumhalmazon vett gyakoriságával. Ennek egyik oka az, hogy így biztosan 0 és 1 közé esik az eredményül kapott támogatottsági érték. Ennél azonban fontosabb azt biztosítani, hogy az adatok ugyanazon a skálán mozogjanak, így a hasonló eloszlású szavaknak hasonlóak lesznek a támogatottsági értékei.
7.6. táblázat - Normalizált dokumentum-szó mátrix
Dokumentum |
|
|
|
|
|
|
| 0.3 | 0.6 | 0 | 0 | 0 | 0.2 |
| 0.1 | 0.2 | 0 | 0 | 0 | 0.2 |
| 0.4 | 0.2 | 0.7 | 0 | 0 | 0.2 |
| 0.2 | 0 | 0.3 | 0 | 0 | 0.1 |
| 0 | 0 | 0 | 1.0 | 1.0 | 0.3 |
A szövegbányászatban az elemzőket sokkal jobban érdekli a szavak
közti összefüggések (például adat és bányászat) feltárása, mint a
szavak gyakoriságainak tartományai közöttieké (például
Ebben a szakaszban egy másik módszertant is bemutatunk a szavak
közötti összefüggések feltárására, a min-Apriori-t. A hagyományos
asszociációs elemzéshez hasonlóan elemhalmaznak szavak egy csoportját
tekintjük, melynek támogatottsága méri a szavak közötti összefüggés
mértékét. Egy elemhalmaz támogatottságát a beletartozó szavak
normalizált gyakorisága alapján számíthatjuk ki. Tekintsük például a
7.6. táblázatban látható
Ez az eredmény semmi esetre sem véletlen. Mivel minden szó gyakoriságát 1-re normalizáltuk, a normalizált gyakoriságok átlagolásával minden elemhalmaz támogatottsága 1 lesz. Így ezt a megközelítést használva minden elemhalmaz gyakori lesz, tehát alkalmatlan az érdekes mintázatok azonosítására.
A min-Apriori módszerben a szavak közötti asszociációt egy
dokumentumban úgy kapjuk meg, hogy a normalizált gyakoriságaik
minimumát vesszük, azaz
A min-Apriori-ban meghatározott támogatottsági mérték a következő elvárt tulajdonságokkal rendelkezik, melyek alkalmassá teszik arra, hogy segítségével szavak közötti kapcsolatokat tárjunk fel dokumentumokban:
A támogatottság monoton nő a szavak normalizált gyakoriságának növekedésével.
A támogatottság monoton nő az adott szót tartalmazó dokumentumok számának növekedésével.
A támogatottság rendelkezik egy anti-monoton tulajdonsággal.
Vegyük például az
A standard Apriori algoritmus módosítható úgy, hogy az új támogatottsági definíció szerint tárja fel a kapcsolatokat a szavak között.