Tartalom
Sok üzleti vállalkozás nagy mennyiségű adatot halmoz fel a
mindennapi működése során. Az élelmiszerboltok pénztárainál például minden
egyes nap óriási mennyiségű vásárlói adat gyűlik össze. A 6.1. táblázatban
lévő példa ilyen adatokat tartalmaz, ezeket általában vásárlói kosár tranzakcióknak nevezzük. A
táblázat minden egyes sora egy-egy tranzakció nak felel meg. Minden sorhoz
tartozik egy egyedi azonosító (
6.1. táblázat - Egy példa vásárlói kosár tranzakciókra
| Árucikkek |
1 |
|
2 |
|
3 |
|
4 |
|
5 |
|
Ez a fejezet az asszociációs elemzés nevű módszertant mutatja be, ame`llyel nagy adathalmazokban lévő rejtett összefüggéseket tudunk felfedezni. A feltárt kapcsolatokat asszociációs szabályokként vagy gyakori elemek halmazaiként tudjuk reprezentálni. A 6.1. táblázatban található adathalmazból például a következő szabályt tudjuk kinyerni:
Ez a szabály egy erős összefüggést sugall a pelenka- és a söreladás között, ugyanis számos vevő a pelenkával együtt sört is vesz. Az ilyen típusú szabály ok a kiskereskedők számára új lehetőségeket biztosíthatnak különböző cikkek árukapcsolására.
A bevásárlókosarak adatai mellett az asszociációs elemzés más területekre is alkalmazható, mint például bioinformatika, orvosi diagnosztizálás, web-bányászat, illetve tudományos adatok vizsgálata. A földtudományi adatok elemzése során például az asszociációs mintázatok érdekes összefüggéseket fedhetnek fel az óceáni, a szárazföldi és a légköri folyamatok között. Ezen információk segítségével a tudósok jobban megérthetik a Föld természeti erői közti kölcsönhatásokat. Bár az itt bemutatott módszerek általában többféle adathalmaz esetén is alkalmazhatók, a példa kedvéért mi főleg a bevásárlókosarak adataira fogunk koncentrálni.
A bevásárlókosarak adatain alkalmazott asszociációs elemzés esetén két kulcsfontosságú szempontot kell figyelembe venni. Először is egy nagyméretű tranzakció s adathalmazban a mintázatok megtalálása jelentős számítási költséggel járhat. Másodsorban a felfedezett mintázatok egy része potenciálisan félrevezető, ugyanis elképzelhető, hogy csak véletlenül fordulnak elő. A fejezet hátralévő része ezen két szempont köré épül fel. A fejezet első részét az asszociációs elemzés alapfogalmainak és néhány hatékony mintázatkereső algoritmus bemutatásának szenteljük. A fejezet második része a felfedezett mintázatok értékelésével foglalkozik, melynek célja a hibás eredmények előállításának a megelőzése.
Ebben a szakaszban az asszociációs elemzés ben használt alapvető terminológiát tekintjük át, illetve megadjuk a feladat formális leírását.
Bináris reprezentáció
A bevásárlókosár adatokat a 6.2. táblázatban látható bináris formátumban tudjuk reprezentálni, ahol egy sor egy tranzakció nak, egy oszlop pedig egy árucikknek felel meg. Egy árucikket bináris változónak lehet tekinteni, melynek értéke egy, ha az árucikk szerepel egy tranzakció ban, különben nulla. Mivel egy tranzakció ban egy cikk jelenléte gyakran fontosabb, mint a cikk hiánya, ezért a cikkek aszimmetrikus bináris változók. A valódi bevásárlókosár adatok esetén ez a reprezentáció talán túlságosan is leegyszerűsített nézetet ad, mivel néhány fontos szempontot -- mint például a vásárolt áruk mennyiségét vagy árát -- nem vesz figyelembe. Az ilyen jellegű nem-bináris adatok kezelésére szolgáló módszereket 7. fejezetben mutatjuk be.
6.2. táblázat - A bevásárlókosár adatok bináris (
TID | kenyér | tej | pelenka | sör | tojás | kóla |
1 | 1 | 1 | 0 | 0 | 0 | 0 |
2 | 1 | 0 | 1 | 1 | 1 | 0 |
3 | 0 | 1 | 1 | 1 | 0 | 1 |
4 | 1 | 1 | 1 | 1 | 0 | 0 |
5 | 1 | 1 | 1 | 0 | 0 | 1 |
Elemhalmaz és támogatottsági szint
Legyen
A tranzakció szélességét a tranzakció ban szereplő elemek száma
határozza meg. Azt mondjuk, hogy a
ahol
Asszociációs szabály
Egy asszociációs szabály egy
6.1. Példa.
Vegyük a
Mire jó a támogatottság és a megbízhatóság ?
A támogatottság egy fontos mérték, hiszen elképzelhető, hogy egy alacsony támogatottság ú szabály csupán véletlenül fordul elő. Egy alacsony támogatottság ú szabály nagy valószínűséggel nem is érdekes üzleti szempontból, mivel nem előnyös olyan árukat reklámozni, amelyeket a vásárlók csak ritkán vesznek meg együtt (kivéve azt az esetet, amelyet a 6.2.1. szakaszban mutatunk be). A támogatottság ot ezen okok miatt gyakran az érdektelen szabály ok kizárására használják. Amint azt a 6.2.1. szakaszban látni fogjuk, a támogatottság rendelkezik egy olyan előnyös jellemzővel is, amely felhasználható az asszociációs szabály ok hatékony felderítésére.
A megbízhatóság ezzel szemben a szabály által jelölt következtetés
hitelességét méri le. Egy adott
Az asszociációs elemzés eredményeit azonban óvatosan kell értelmezni. Egy asszociációs szabály által jelölt következtetés nem feltétlenül jelent okozati viszonyt. Inkább azt mondhatjuk, hogy a szabály feltételi és következményi oldalán szereplő elemek gyakran fordulnak elő együtt. Az okozati összefüggéshez viszont ismerni kell az adatokban lévő ok és okozati attribútum okat, és általában olyan kapcsolatokról van szó, melyek idővel változnak (például az ózoncsökkenés a globális felmelegedéshez vezet).
Az asszociációs szabály ok bányászatának problémája
Az asszociációs szabály ok bányászatának problémáját formálisan a következő képpen írhatjuk le:
6.1. Definíció
(Asszociációs szabály ok feltárása) Ha adott a tranzakció k egy
Ha az asszociációs szabály ok bányászatához a nyers erő módszerét
alkalmaznánk, akkor az összes lehetséges szabály támogatottság át,
illetve megbízhatóságát meg kellene állapítani. Ez a megközelítés
azonban megengedhetetlenül költséges, mivel egy adathalmazból
exponenciálisan sok szabályt lehet kinyerni. Egészen pontosan egy
darab szabályt lehet előállítani. Eme egyenlet bizonyítását
meghagyjuk az Olvasó számára (lásd 5. gyakorlatot 417. oldalon). Ezzel a
módszerrel még a 6.1. táblázatban látható kisméretű adathalmaz esetén is
Az asszociációs szabály okat bányászó algoritmusok
teljesítményének a növelése felé az első lépés a támogatottság i illetve
a megbízhatósági követelmények szétválasztása. A (6.2) egyenletből
látható, hogy egy
|
|
|
|
|
|
Ha az elemhalmaz nem gyakori, akkor mind a hat szabályjelöltet azonnal ki lehet zárni anélkül, hogy ki kellene számítani a megbízhatóságukat.
Így aztán számos asszociációs szabály t bányászó algoritmus azt a bevett stratégiát alkalmazza, hogy a problémát két nagyobb részfeladatra bontja:
Gyakori elemhalmazok
generálása, ahol a cél megtalálni az összes olyan
elemhalmazt amelyek megfelelnek a
Szabálygenerálás, melynek célja az összes magas megbízhatóságú szabály kinyerése az előző pontban megtalált gyakori elemhalmazokból.
A gyakori elemhalmazok kiszámítási költsége általában magasabb, mint a szabályok generálása esetén. A 6.2. szakaszban a gyakori elemhalmazok, míg a 6.3. szakaszban az asszociációs szabály ok előállítására mutatunk be néhány hatékony módszert.