A prototípus-alapú klaszterezésnél egy klaszter objektumok egy
olyan halmaza, amelyben minden objektum közelebb van a klasztert
definiáló prototípushoz, mint bármely más klaszter prototípusához. A
8.2. szakasz írta le a
Megengedett, hogy az objektumok egynél több klaszterhez tartozzanak. Konkrétabban, egy objektum minden klaszterhez valamilyen súllyal tartozik. Az ilyen megközelítés megválaszolja azt a problémát, hogy néhány objektum egyforma távol lehet több klaszter prototípustól is.
Egy klasztert egy statisztikai eloszlásként modellezünk, azaz az objektumokat néhány statisztikai paraméter -- mint például az átlag és a variancia -- által meghatározott statisztikai eloszlás generálja. Ez a nézőpont általánosítja a prototípus fogalmát és lehetővé teszi jól megalapozott statisztikai módszerek alkalmazását.
A klaszterekre rögzített kapcsolatokat feltételezünk. Legáltalánosabban ezek a kapcsolatok olyan megszorítások, amelyek a szomszédsági kapcsolatokat határozzák meg, azaz annak a fokát, hogy két klaszter mennyire szomszédja egymásnak. A klaszterek közötti kapcsolatokra vonatkozó megszorítások bevezetése egyszerűsítheti az adatok értelmezését és vizualizációját.
A prototípus-alapú klaszterezés ezen kiterjesztéseinek
szemléltetésére három speciális klaszterező algoritmust tekintünk. A
fuzzy
Ha az adatobjektumok jól szeparált csoportokba vannak elosztva,
akkor ideális megközelítésnek tűnik az objektumok diszjunkt
klaszterekbe történő éles osztályozása. A legtöbb esetben viszont az
adathalmaz objektumai nem oszthatóak jól szeparált klaszterekbe, és
lesz egy bizonyos önkényesség egy objektum egy konkrét klaszterhez
rendelésekor. Tekintsünk egy olyan objektumot, ami két klaszter
határának közelében fekszik, de kicsit közelebb van az egyikükhöz. Sok
ilyen esetben megfelelőbb lehet súlyt rendelni minden egyes
objektumhoz és minden egyes klaszterhez, ami azt jelzi, hogy az
objektum milyen mértékben tartozik a klaszterhez. Matematikailag,
legyen
Ahogy a következő részben megmutatjuk, valószínűségi
megközelítések is adhatnak ilyen súlyokat. Bár a valószínűségi
megközelítések sok helyzetben hasznosak, vannak olyan esetek, amikor
nehéz meghatározni a megfelelő statisztikai modellt. Ilyen esetekben
hasonló képességek biztosításához nem valószínűségi klaszterező
módszerekre van szükség. A fuzzy klaszterező módszerek a fuzzy
halmazelméleten alapulnak és természetes módszert adnak olyan
klaszterezés előállítására, ahol a tagság súlyainak (a
Fuzzy halmazok
Lotfi Zadeh 1965-ben vezette be a fuzzy halmazelméletet és a fuzzy logikát, mint a pontatlanság és bizonytalanság kezelésének eszközét. Röviden, a fuzzy halmazelmélet megengedi, hogy egy objektum 0 és 1 közötti szinten tartozzon egy halmazhoz, míg a fuzzy logika megengedi, hogy egy állítás 0 és 1 közötti bizonyossággal legyen igaz. A hagyományos halmazelmélet és logika speciális esetei a fuzzy megfelelőiknek, amelyek a halmazhoz tartozás vagy a bizonyosság szintjének csak a 0 vagy az 1 értéket engedik meg. A fuzzy fogalmakat sok területen alkalmazzák, beleértve a szabályozó rendszereket, mintázat felismerést és adatelemzést (osztályozást és klaszterezést).
Tekintsük a következő példát a fuzzy logikára. Annak az
állításnak az igazsága, hogy ``felhős az idő'', definiálható az égbolt
felhőborítottságának százalékos arányaként. Ha például az égbolt
50%-át borítják felhők, akkor a ``felhős az idő'' állításhoz a
Fuzzy klaszterek
Tegyük fel, hogy adott adatpontok egy
1. Adott
2. Minden
Fuzzy
Bár sok típusa van a fuzzy klaszterezésnek -- valójában sok
adatelemző algoritmus ``fuzzy-asítható'' -- mi csak a
9.1. algoritmus
Fuzzy
|
1: Válasszunk egy kiinduló fuzzy
pszeudo-partíciót, azaz rendeljünk értékeket minden
2: repeat 3: Számítsuk ki az egyes klaszterek középpontját a fuzzy pszeudo-partícióra 4: Számoljuk újra a fuzzy pszeudo-partíciót, azaz
a
5: a középpontok nem változnak (alternatív megállási feltételek
lehetnek a ``ha a hiba változása adott küszöbértéknél kisebb''
vagy ``ha
|
A kezdőértékadás után az FCM ismételten kiszámolja az egyes
klaszterek középpontjait és a fuzzy pszeudo-partíciót, amíg a partíció
már nem változik. Az FCM hasonló szerkezetű a
Az SSE kiszámítása
A négyzetes hibaösszeg (SSE) definíciója az alábbiak szerint módosul:
ahol
Kezdőértékadás
Gyakran használunk véletlen kezdőértékadást. Konkrétan, a
súlyokat választjuk véletlenszerűen úgy, hogy bármely objektumhoz
tartozó súlyok összege 1 legyen. Ahogy a
Középpontok kiszámítása
A (9.2) egyenlettel adott középpont-definíció megkapható úgy,
hogy megkeressük azt a középpontot, amely a (9.1) összefüggéssel
megadott fuzzy SSE értékét minimalizálja. (Lásd a 8.2.6. szakasz
megközelítését.) A
A fuzzy középpont definíciója hasonló a hagyományos
definícióhoz, kivéve azt, hogy minden pontot figyelembe veszünk
(bármely pont bármely klaszterhez tartozhat, legalábbis valamelyest)
és az egyes pontok hozzájárulása a középponthoz a tagságuk fokával van
súlyozva. A hagyományos, ``éles'' halmazokra, ahol minden
A
A fuzzy pszeudo-partíció frissítése
Mivel a fuzzy pszeudo-partíciót a súlyok definiálják, ez a lépés
magában foglalja az
Ez a képlet kicsit misztikusnak tűnhet. Meg kell jegyeznük
azonban, hogy a
Intuitív módon, a
Tekintsük most az
9.1. Példa.
(Fuzzy
Erősségek és korlátok
Az FCM pozitív tulajdonsága, hogy olyan klaszterezést állít elő,
ami azt is jelzi, hogy az egyes pontok milyen mértékben tartoznak az
egyes klaszterekhez. Egyébként leginkább ugyanazok az erősségei és
gyengeségei, mint a
Ez a szakasz a statisztikai modelleken alapuló klaszterezést tekinti át. Gyakran kényelmes és hatékony azt feltételezni, hogy az adatok generálása egy statisztikai folyamat eredményeként történt, az adatokat pedig a legjobban illeszkedő statisztikai modellel kívánjuk leírni, ahol a statisztikai modell egy eloszlással és a hozzá tartozó paraméterekkel van megadva. Magas szinten ez a folyamat magában foglalja a döntést az adatokra vonatkozó statisztikai modellről és a modell paramétereinek becslését az adatok alapján. Ez a szakasz egy konkrét statisztikai modell-típust ír le, a keverék modellt, ami több statisztikai eloszlással modellezi az adatokat. Minden eloszlás egy klaszternek felel meg, az egyes eloszlások paraméterei pedig megadják a hozzájuk tartozó klaszter leírását, tipikusan a középpontjának és szóródásának függvényében.
A szakasz tárgyalása a következőképpen folytatódik. A keverék modellek leírása után megvizsgáljuk, hogy a statisztikai adatmodellek paramétereit hogyan lehet becsülni. Először leírjuk, hogyan lehet a maximum likelihood becslés (MLE -- maximum likelihood estimation) nevű eljárást egyszerű statisztikai modellek paramétereinek becslésére használni, ezután pedig azt tárgyaljuk, hogy miképpen lehet ezt a megközelítést általánosítani keverék modellek paramétereinek becslésére. Nevezetesen a jól ismert EM (Expectation-Maximization) algoritmust írjuk le, ami először kiinduló becslést ad a paraméterekre, majd pedig iteratív módon javítja ezeket a becsléseket. Példákat adunk arra, hogyan használható az EM algoritmus az adatok klaszterezésére a keverék modell paramétereinek becslése révén, valamint megtárgyaljuk a módszer erősségeit és korlátait.
Ezen szakasz megértéséhez lényeges a statisztika és a valószínűség 13. függelékben leírt fogalmainak biztos ismerete. A kényelem kedvéért a következő tárgyalás során egyaránt a valószínűség szót használjuk, hogy a valószínűségre és a valószínűségi sűrűségre hivatkozzunk.
Keverék modellek
A keverék modellek úgy tekintenek az adatokra, mint különböző valószínűségeloszlások keverékéből származó megfigyeléshalmazra. A valószínűségeloszlások tetszőlegesek lehetnek, de gyakran többdimenziós Gauss (normális) eloszlásnak tekintjük őket, mivel ez az eloszlástípus jól ismert, matematikailag könnyű vele dolgozni, valamint kimutatták, hogy sok esetben jó eredményeket ad. Ezek az eloszlástípusok ellipszoid alakú klasztereket tudnak modellezni.
A keverék modellek fogalmilag a következő adatgeneráló
folyamatnak felelnek meg. Legyen adva több eloszlás, általában
ugyanabból a típusból, de különböző paraméterekkel, és válasszunk
véletlenszerűen ezekből az eloszlásokból egyet és generáljunk egy
objektumot belőle. Ismételjük meg a folyamatot
Formálisabban, tegyük fel, hogy
Ha az objektumokat egymástól függetlenül generáljuk, akkor a
teljes objektumhalmaz valószínűsége éppen az egyes
Keverék modelleknél minden egyes eloszlás egy különböző csoportot, azaz különböző klasztert ír le. Statisztikai módszerek alkalmazásával becsülhetjük ezeknek az eloszlásoknak a paramétereit az adatokból, és így leírhatjuk ezeket az eloszlásokat (klasztereket). Azonosítani tudjuk, hogy mely objektumok mely klaszterekhez tartoznak. Ugyanakkor a keverék-modellezés nem állítja elő az objektumok éles hozzárendelését a klaszterekhez, hanem inkább az objektumok egy bizonyos klaszterhez tartozásának a valószínűségét adja meg.
9.2. Példa.
(Egydimenziós Gauss keverék) A keverék modell egy konkrét
szemléltetését adjuk a Gauss eloszlások segítségével. Az egydimenziós
Gauss eloszlás valószínűségi sűrűségfüggvénye egy
A Gauss eloszlás paraméterei
A 9.2. (a) ábra a valószínűségi sűrűségfüggvény grafikonját mutatja erre a keverék modellre, míg a 9.2. (b) ábrán az ebből a keverék modellből generált 20 000 pont hisztogramja látható.
9.2. ábra - Keverék modell két normális eloszlásból, ahol a várható
értékek

A modell paramétereinek maximum likelihood becslése
Ha adott egy statisztikai modell az adatokra, meg kell becsülni a modell paramétereit. Erre a célra a standard megközelítés a maximum likelihood becslés, amit most magyarázunk el.
Először tekintsünk egy
Egy eljárást szeretnénk találni az ismeretlen
Az elvet maximum likelihood elvnek nevezzük, mert adott adatokra
az adatok a paraméterek függvényeként tekintett valószínűségét
likelihood függvénynek nevezzük.
Ennek szemléltetéséhez a (9.9) képletet a (9.11) alakba írjuk át, hogy
kihangsúlyozzuk azt, hogy a
9.3. Példa.
(Paraméterbecslés maximum likelihood módszerrel) Egy konkrét
példát adunk a MLE paraméterértékek megkeresésére történő
alkalmazására. Tegyük fel, hogy 200 pontunk van, amelyek hisztogramját
a 9.3. (a) ábra mutatja. A 9.3. (b) ábra mutatja a maximum
loglikelihood ábrát a vizsgált 200 pontra. A
Az adatok valószínűségét nem praktikus a paraméterek különböző
értékeire ábrázolni, legalábbis ha kettőnél több paraméter van. Ezért
egy statisztikai paraméter maximum likelihood becslésének
kiszámításához a standard statisztikai eljárás a loglikelihood
függvény deriváltját venni a paraméter szerint, az eredményt egyenlővé
tenni 0-val, és ezt megoldani. Konkrétan, a Gauss eloszlásra meg lehet
mutatni, hogy a mintaelemek átlaga és szórása az eloszlás
paramétereinek maximum likelihood becslése. (Lásd a 9. példát a 670.
oldalon.) Valóban pontosan a 200 pont átlaga és szórása -- azaz
9.3. ábra - Egy Gauss eloszlásból származó 200 pont és valószínűségük logaritmusa különböző paraméterértékekre

Keverék modell paramétereinek becslése maximum likelihood módszerrel: az EM algoritmus
A maximum likelihood megközelítést a keverék modell paramétereinek becslésére is használhatjuk. A legegyszerűbb esetben tudjuk, hogy melyik adatobjektum melyik eloszlásból származik, és a probléma visszavezetődik arra, amikor egy eloszlás paramétereit kell becsülnünk az ebből az eloszlásból származó adott adatok alapján. A legtöbb tipikus eloszlásra a paraméterek maximum likelihood becslését az adatokat használó egyszerű képletekből kaphatjuk meg.
Egy általánosabb (és realisztikusabb) helyzetben nem tudjuk, hogy melyik pontot melyik eloszlás generálta. Így nem tudjuk közvetlenül számolni az egyes adatpontok valószínűségét, ezért úgy tűnik, hogy a maximum likelihood elvet sem tudjuk használni a paraméterek becslésére. Erre a problémára az EM algoritmus a megoldás, amit a.9.2. algoritmus mutat be. Röviden, ha van egy becslésünk a paraméterértékekre, az EM algoritmus kiszámolja annak a valószínűségét, hogy a pontok az egyes eloszlásokhoz tartoznak, majd ezeket a valószínűségeket használja a paraméterek új becsléséhez. (Ezek a paraméterek maximalizálják a likelihoodot.) Ezt az iterációt addig folytatjuk, míg a paraméterbecslések vagy nem változnak, vagy csak nagyon kicsit. Tehát továbbra is a maximum likelihood becslést használjuk, de egy iteratív keresésen keresztül.
9.2. algoritmus. EM algoritmus |
1: Válasszunk kezdeti értékeket a modell paramétereire (ahogy a
2: repeat 3: E (expectation, várható érték) lépés
Minden objektumra számoljuk ki annak valószínűségét, hogy az
objektum az egyes eloszlásokhoz tartozik, azaz számoljuk ki a
4: M (maximalizáló) lépés Az E-lépésből adódó valószínűségekkel keressük meg az új paraméterbecsléseket, amelyek maximalizálják a várt likelihoodot 5: until a paraméterek nem változnak (vagy megállás akkor, ha a paraméterek változása egy adott küszöbértéknél kisebb) |
[1]
Az EM algoritmus hasonló a 8.2.1. szakaszban megadott
9.4. Példa.
(Egyszerű példa az EM algoritmusra) Ez a példa mutatja, hogyan
működik az EM algoritmus a 9.2. ábra adataira. Azért, hogy a példa a
lehető legegyszerűbb legyen, feltesszük, hogy tudjuk, hogy mindkét
eloszlás szórása
Az EM algoritmust a
ahol
Tegyük fel például, hogy az egyik pont a 0. (9.7) képlettel
megadott Gauss sűrűségfüggvény alapján ki tudjuk számolni, hogy
A klaszterhez tartozási valószínűséget mind a 20 000 pontra
kiszámolva új becsléseket számolunk
Addig ismételjük ezt a két lépést, amíg a
9.1. táblázat - Az EM algoritmus első néhány lépése az egyszerű példára
Iteráció |
|
|
0. |
| 3,00 |
1. |
| 4,10 |
2. |
| 4,07 |
3. |
| 4,04 |
4. |
| 4,03 |
5. |
| 4,03 |
9.5. Példa.
(Az EM algoritmus minta adathalmazokon) Három példát mutatunk
be, amelyek az EM algoritmus keverék modellek használatával történő
alkalmazását szemléltetik klaszterek megtalálására. Az első példa a
fuzzy
Második példánkban a keverék modell klaszterezést olyan adatokra
alkalmazzuk, amelyek különböző sűrűségű klasztereket tartalmaznak. Az
adatok két természetes klaszterből állnak, mindegyik nagyjából 500
pontot tartalmaz. Ezeket az adatokat két Gauss eloszlású adathalmaz
kombinálásával állítottuk elő, az egyik középpontja
Harmadik példánkban a keverék modell klaszterezést egy olyan
adathalmazra alkalmazzuk, amit a
Az EM algoritmust használó keverék modell klaszterezés előnyei és korlátai
Számos előnye és hátránya van annak a klaszterező megközelítésnek, amely az adatokat keverék modellekkel írja le, és ezen modellek paramétereit EM algoritmussal becsli. A negatív oldalon szerepel, hogy az EM algoritmus lassú lehet, nem praktikus nagy számú komponenst tartalmazó modellek esetén, és nem működik jól, amikor a klaszterek csak néhány adatpontot tartalmaznak, vagy amikor az adatpontok közel kollineárisak. A klaszterszám becslése, vagy általánosabban a használt modell pontos formájának meghatározása is problémát jelent. Ezt a problémát tipikusan a Bayes-féle megközelítés alkalmazásával oldják meg, ami lényegében egy modell esélyét adja meg egy másikhoz képest az adatokból kapott becslés alapján. A keverék modelleknek nehézséget okozhatnak a zaj és a kiugró értékek is, bár születtek eredmények ezen problémák megoldása irányában.
Előnyük, hogy a keverék modellek általánosabbak, mint a
A Kohonen-féle önszervező jellemzőháló (SOFM vagy SOM -- Self-Organizing Feature Map) egy neurális háló nézőpontú klaszterező és adatvizualizációs módszer. Neurális hálós eredete ellenére a SOM könnyebben ismertethető -- legalábbis ennek a szakasznak a szövegkörnyezetében -- a prototípus-alapú klaszterezés egy változataként. A középpont-alapú klaszterezés más típusaihoz hasonlóan a SOM célja a középpontok (a SOM terminológiában referencia vektorok) egy halmazának kijelölése és az adathalmaz minden egyes objektumának hozzárendelése ahhoz a középponthoz, amelyik az adott objektum legjobb approximációját adja. Neurális háló terminológiában fogalmazva minden egyes középponthoz egy neuron tartozik.
Az növekményes
A SOM algoritmus
A SOM ismertetőjele, hogy a középpontok (neuronok) topografikus
(térbeli) szerveződését írja elő. A 9.7. ábra egy kétdimenziós SOM-ra
mutat példát, ahol a középpontokat négyzetrács szerkezetbe rendezett
csomópontok reprezentálják. Minden középponthoz egy
Bár a SOM hasonló a
Magasabb szinten a SOM módszert használó klaszterezés 9.2. algoritmusban leírt lépésekből áll.
9.3. algoritmus. SOM alapalgoritmus |
1: Inicializáljuk a középpontokat 2: repeat 3: Válasszuk ki a következő objektumot 4: Határozzuk meg az objektumhoz legközelebbi középpontot 5: Frissítsük a középpontot és a hozzá közeli, azaz adott környezetbe eső középpontokat 6: until a középpontok nem változnak sokat vagy elérünk egy küszöbértéket 7: Minden objektumot rendeljünk hozzá a legközelebbi középponthoz és adjuk vissza a középpontokat és a klasztereket |
Kezdőértékadás
Ez a lépés (1. sor) többféleképpen hajtható végre. Az egyik
megközelítés az, hogy egy középpont minden egyes koordinátáját
véletlenszerűen választjuk az illető koordináta adatokban megfigyelt
értékeinek tartományából. Bár ez a megközelítés működik, nem
szükségszerűen a legjobb eljárás, különösen akkor nem, ha gyors
konvergenciát szeretnénk. Egy másik módszer a kezdeti középpontok
véletlenszerű választása a rendelkezésre álló adatpontok közül. Ez
nagyon hasonló a
Az objektum kiválasztása
A ciklus első lépése (3. sor) a következő objektum kiválasztása. Ez meglehetősen magától értetődő, de van néhány nehézség. Mivel a konvergenciához sok lépésre lehet szükség, minden adatobjektumot többször kellhet használni, különösen akkor, ha kicsi az objektumok száma. Ha viszont nagy az objektumok száma, akkor nem minden objektumot szükséges használni. Az objektumok bizonyos csoportjainak hatását is lehet növelni a tanulóhalmazbeli gyakoriságuk növelésével.
Besorolás
A legközelebbi középpont meghatározása (4. sor) szintén magától értetődő, bár szükség van hozzá egy távolság-metrika megadására. Gyakran használjuk az euklideszi távolság-metrikát, ahogy a skalárszorzat metrikát is. Amikor a skalárszorzat metrikát alkalmazzuk, az adatvektorokat előzőleg tipikusan normáljuk, a referenciavektorokat viszont minden egyes lépésben normáljuk. Ezekben az esetekben a skalárszorzat metrika alkalmazása ekvivalens a koszinusz mérték használatával.
Frissítés
A frissítési lépés (5. sor) a legbonyolultabb. Legyenek
Azaz a
Ezek a függvények bővebb magyarázatot igényelnek. Az
Ne felejtsük el, hogy a szomszédság frissítési módszer az, ami kikényszeríti a szomszédos neuronokhoz tartozó középpontok közötti kapcsolatot (rendezést).
Leállás
Egy fontos kérdés annak eldöntése, hogy mikor vagyunk elég közel
a középpontok egy stabil halmazához. Az iterációnak elméletileg addig
kellene folytatódnia, amíg be nem következik a konvergencia, azaz
addig, amikor a referencia vektorok már nem változnak, vagy csak
nagyon keveset. A konvergencia sebessége több tényezőtől is függ, így
például az adatoktól és az
9.6. Példa.
(Dokumentum-adatok) Két példát mutatunk be. Az elsőben a SOM
módszert egy
9.8. ábra - A Los Angeles Times cikkeiből álló adathalmaz SOM klaszterei közötti kapcsolatok megjelenítése

9.7. Példa
(Kétdimenziós pontok) A második esetben egy négyzetrács alapú
SOM-ot és egy kétdimenziós ponthalmazt használunk. A 9.9. (a) ábra
mutatja a pontokat és a SOM által előállított (x-ekkel ábrázolt) 36
referencia vektor elhelyezkedését. A pontok sakktábla-szerűen
helyezkednek el és öt csoportba soroljuk őket: körök, háromszögek,
négyzetek, rombuszok és hatszögek (csillagok). A középpontok egy
Alkalmazások
Ha már megtaláltuk a SOM vektorokat, a klaszterezésen kívül sok más célra is használhatjuk őket. Egy kétdimenziós SOM segítségével például különböző mennyiségeket lehet hozzárendelni az egyes középpontokhoz (klaszterekhez) tartozó rácspontokhoz, az eredményeket pedig különböző típusú ábrák segítségével lehet megjeleníteni. Az egyes klaszterekhez tartozó pontok számát kirajzolva például egy olyan ábrát kapunk, ami a pontok klaszterek közötti eloszlását fedi fel. A kétdimenziós SOM az eredeti valószínűségeloszlás-függvény egy két dimenzióra történő nemlineáris vetítése. Ez a projekció megkísérli a topológiai jellemzők megőrzését, így a SOM az adatok szerkezetének megőrzésére irányuló felhasználását egy virág lepréselésének folyamatához hasonlíthatjuk.
Erősségek és korlátok
A SOM olyan klaszterező módszer, amely szomszédsági kapcsolatokat kényszerít ki az eredményül kapott klaszterközéppontok között. Emiatt azok a klaszterek, amelyek szomszédok, szorosabb kapcsolatban állnak egymással, mint azok, amelyek nem. Az ilyen kapcsolatok megkönnyítik a klaszterezés eredményének értelmezését és megjelenítését. A SOM ezen aspektusát valóban sok területen aknázták ki, mint például webes dokumentum vagy génszekvencia adatok megjelenítése.
A SOM-nak számos korlátja is van, ezeket soroljuk fel az alábbiakban. A felsorolt korlátok némelyike csak akkor érvényes, ha a SOM-ot standard klaszterező módszernek tekintjük, amelynek az adatok valódi klasztereinek megtalálása a célja, nem pedig a klaszterezést az adatok szerkezetének feltárásához felhasználó módszernek. Ezen korlátok közül néhánnyal a SOM kiterjesztései vagy a SOM által inspirált klaszterező algoritmusok foglalkoznak. (Lásd az irodalmi megjegyzéseket.)
A felhasználónak kell megválasztania a paraméterbeállításokat, a szomszédsági függvényt, a rács típusát és a középpontok számát.
Egy SOM klaszter gyakran nem felel meg egy természetes klaszternek. Bizonyos esetekben egy SOM klaszter magában foglalhat több természetes klasztert, míg más esetekben egy természetes klaszter több SOM klaszterre bomlik fel. Ez a probléma részben annak tudható be, hogy középpontokból álló rácsot használunk, részben pedig annak a ténynek, hogy a SOM más prototípus-alapú klaszterező módszerekhez hasonlóan hajlamos szétvágni vagy egyesíteni a természetes klasztereket, ha azok különböző méretűek, alakúak vagy sűrűségűek.
A SOM-nál hiányzik a konkrét célfüggvény. A SOM középpontok egy olyan halmazát próbálja megkeresni, amely a legjobban közelíti az adatokat a középpontok közötti topográfiai feltételek figyelembe vétele mellett, de a SOM sikeressége ezen a téren nem fejezhető ki egy függvénnyel. Ez megnehezítheti különböző SOM klaszterezési eredmények összehasonlítását.
A SOM konvergenciája nem garantált, bár a gyakorlatban tipikusan konvergál a módszer.
[7] A fordító megjegyzése: A logaritmus alkalmazása a maximumhely analitikus megkereséséhez is hasznos, ezenkívül az elméleti tulajdonságai is kedvezőek például statisztikai próbák konstrukciójához.