A hasonlóság és különbözőség azért fontos, mert számos adatbányászati módszer, például a klaszterezés, a legközelebbi szomszéd osztályozás és a rendellenesség-észlelés, alkalmazza őket. Sok esetben az eredeti adatállományra már nincs is szükség, miután ezeket a hasonlóságokat vagy különbözőségeket kiszámítottuk. Az ilyen megközelítéseket tekinthetjük úgy, hogy az adatokat leképezzük egy hasonlósági (különbözőségi) térre, és ezután végezzük el az elemzést.
Először az alapokat tárgyaljuk: a hasonlóság és különbözőség általános definícióit és a közöttük lévő kapcsolatot. Az egyszerűség kedvéért a szomszédság kifejezést használjuk a hasonlóságra és a különbözőségre történő hivatkozásnál egyaránt. Mivel két objektum szomszédsága egy, a két objektum megfelelő attribútumainak szomszédságából előálló függvény, ezért először azt írjuk le, hogyan mérjük az egyetlen egyszerű attribútummal rendelkező objektumok szomszédságát, és ezután tekintjük a több attribútummal rendelkező objektumok szomszédsági mértékeit. Ide tartoznak olyan mértékek is, mint a korreláció vagy az euklideszi távolság, melyek hasznosak olyan sűrű adatoknál, mint az idősorok vagy a kétdimenziós pontok, csakúgy, mint a Jaccard és a koszinusz hasonlósági mértékek, amelyek ritka adatoknál, például dokumentumok esetén, használhatóak jól. Ezután számos fontos, a szomszédsági mértékekkel kapcsolatban felmerülő kérdést tárgyalunk. A szakasz végén röviden megvitatjuk, hogyan válasszuk ki a megfelelő szomszédsági mértéket.
Definíciók
Egyszerűen fogalmazva két objektum hasonlósága annak numerikus mértéke, hogy a két objektum mennyire hasonló. Ebből következik, hogy a hasonlóság nagyobb olyan objektumpárokra, amelyek jobban hasonlítanak egymáshoz. A hasonlóságok általában nemnegatívak és gyakran 0 (nincs hasonlóság) és 1 (teljes hasonlóság) közötti értékeket vesznek fel.
Két objektum különbözősége
annak numerikus mértéke, hogy a két objektum mennyire különböző. A
különbözőségek kisebbek az egymásra jobban
hasonlító objektumpárokra. Előfordul, hogy a távolság kifejezést a különbözőség
szinonimájaként alkalmazzák, bár, mint látni fogjuk, a távolságot
gyakran a különbözőségek egy speciális csoportjára értik. A
különbözőségek esetenként a
Transzformációk
Gyakran alkalmazunk transzformációkat, hogy hasonlóságot
különbözőséggé alakítsunk, illetve megfordítva, különbözőséget
hasonlósággá, vagy hogy úgy alakítsunk át egy szomszédsági mértéket,
hogy egy megadott intervallumba, például a
A szomszédsági mértékek, főleg a hasonlóságok, gyakran úgy
vannak definiálva vagy transzformálva, hogy az értékeik a
Azonban a szomszédsági mértékek
A hasonlóságok különbözőségekké alakítása és ennek megfordítása
is viszonylag egyszerű, bár itt is felmerül a jelentés megőrzésének és
a lineáris skálák nemlineárissá való átalakulásának kérdése. Ha a
hasonlóság (vagy különbözőség) a
A negáció transzformáció eredményeképpen előálló hasonlóságok
nincsenek a
Általánosságban, bármilyen monoton csökkenő függvény felhasználásával átalakíthatunk különbözőségeket hasonlóságokká, és fordítva. Természetesen más tényezőket is figyelembe kell venni mind a hasonlóságok különbözőségekké alakításakor, mind ennek fordítottja esetén, mind pedig egy szomszédsági mérték értékeinek más skálára való leképezésekor. Megemlíthetjük a jelentés megőrzésével, a skála torzulásával és az adatelemző eszközök követelményeivel kapcsolatos kérdéseket, de ez a lista nyilván nem teljes.
A több attribútummal rendelkező objektumok szomszédságát általában úgy határozzuk meg, hogy azok egyedi attribútumainak szomszédságait egyesítjük, ezért először az egyetlen attribútummal rendelkező objektumok szomszédságát tárgyaljuk. Tekintsük az egyetlen névleges attribútummal leírt objektumokat. Mit jelentene két ilyen objektum esetén, hogy hasonlóak? Mivel a névleges attribútumok csak az objektumok különbözőségéről hordoznak információkat, csak azt mondhatjuk, hogy két objektumnak ugyanaz-e az értéke vagy sem. Ezért ebben az esetben hagyományosan úgy definiáljuk a hasonlóságot, hogy értéke 1, ha az attribútumok megegyeznek és 0 egyébként. A különbözőséget ellentétes módon definiálhatjuk: 0, ha az attribútumok megegyeznek, és 1, ha nem.
Egyszerű sorrendi attribútummal rendelkező objektumok esetén a
helyzet bonyolultabb, mivel figyelembe kell vennünk a sorrendre
vonatkozó információkat. Tekintsünk egy olyan attribútumot, ami egy
termék, például egy csokiszelet minőségét méri a
A hasonlóság (különbözőség) sorrendi attribútumokra adott ezen definíciója valószínűleg kényelmetlen érzést kelt az Olvasóban, mivel egyenlő távolságokat tételez fel, pedig ez nincs így. Ellenkező esetben intervallum vagy hányados attribútumunk lenne. Vajon az elfogadható és a jó értékek között tényleg ugyanannyi a különbség, mint az átlagos és a finom értékek között? Valószínűleg nem, de a gyakorlatban korlátozottak a lehetőségeink, és további információk hiányában ez a sorrendi attribútumok közötti szomszédság definiálásának szabványos módja.
Intervallum vagy hányados attribútumokra a két objektum
különbözőségének magától értetődő mértéke az értékeik abszolút
különbsége. Összehasonlíthatjuk például a jelenlegi súlyunkat az egy
évvel korábbi súlyunkkal úgy, hogy ``10 kilóval nehezebb vagyok''. Az
ehhez hasonló esetekben a különbözőségek jellemzően inkább 0-tól
A 2.7. táblázat összegzi ezeket a részeket. Ebben a táblázatban

A következő két szakaszban összetettebb szomszédsági mértékekkel foglalkozunk, amelyek több attribútumot tartalmazó objektumokra vonatkoznak: (1) adatobjektumok különbözőségeivel és (2) adatobjektumok hasonlóságaival. Ez a felosztás teszi lehetővé számunkra, hogy még természetesebben mutassuk be az alkalmazott szomszédsági mértékek mögötti indokokat. Hangsúlyozzuk azonban, hogy a hasonlóságok különbözőségekkel, illetve fordítva, a különbözőségek hasonlóságokká alakíthatóak át a korábban leírt módokon.
Ebben a szakaszban különböző típusú különbözőségekkel foglalkozunk. A távolságok tárgyalásával kezdjük, amelyek meghatározott tulajdonságokkal rendelkező különbözőségek, és ezután adunk példákat általánosabb különbözőségekre.
Távolságok
Először néhány példát mutatunk, majd a távolság egy formálisabb
definícióját adjuk az összes távolságra érvényes közös tulajdonságok
alapján. Két pont,
ahol
(2.1) egyenlet által adott euklideszi távolsági mértéket (2.2) egyenletben leírt Minkowski távolság metrika általánosítja:
ahol
Ne tévesszük össze az
A 2.10., illetve 2.11. táblázatok a 2.8. táblázat adatainak
felhasználásával adják meg az
2.8. táblázat - A négy pont
pont | x koordináta | y koordináta |
p1 | 0 | 2 |
p2 | 2 | 0 |
p3 | 3 | 1 |
p4 | 5 | 1 |
2.9. táblázat - Euklideszi távolsági mátrix a 2.8. táblázathoz
| p1 | p2 | p3 | p4 |
p1 | 0,0 | 2,8 | 3,2 | 5,1 |
p2 | 2,8 | 0,0 | 1,4 | 3,2 |
p3 | 3,2 | 1,4 | 0,0 | 2,0 |
p4 | 5,1 | 3,2 | 2,0 | 0,0 |
2.10. táblázat - L1 távolsági mátrix a 2.8. táblázathoz
| p1 | p2 | p3 | p4 |
p1 | 0,0 | 4,0 | 4,0 | 6,0 |
p2 | 4,0 | 0,0 | 2,0 | 4,0 |
p3 | 4,0 | 2,0 | 0,0 | 2,0 |
p4 | 6,0 | 4,0 | 2,0 | 0,0 |
2.11. táblázat -
| p1 | p2 | p3 | p4 |
p1 | 0,0 | 2,0 | 3,0 | 5,0 |
p2 | 2,0 | 0,0 | 1,0 | 3,0 |
p3 | 3,0 | 1,0 | 0,0 | 2,0 |
p4 | 5,0 | 3,0 | 2,0 | 0,0 |
A távolságok, mint például az euklideszi távolság, néhány
közismert tulajdonsággal rendelkeznek. Ha az
1. Pozitivitás
2. Szimmetria
3. Háromszög egyenlőtlenség
Metrikáknak nevezzük az olyan mértékeket, amelyek mindhárom tulajdonsággal rendelkeznek. Egyesek a távolság kifejezést csak olyan különbözőségi mértékekre használják, amelyek ezekkel a tulajdonságokkal rendelkeznek, de ezt a gyakorlatot gyakran megszegik. Az itt leírt három tulajdonság egyaránt hasznos és matematikailag jól kezelhető. Továbbá, ha fennáll a háromszög egyenlőtlenség, akkor ezen tulajdonság felhasználásával növelhetjük az olyan módszerek hatékonyságát (ideértve például a klaszterezést), amelyek ezen tulajdonság meglététől függenek. (Lásd a 25. feladatot.) Mindazonáltal sok különbözőség nem elégít ki egyet vagy többet a metrikák tulajdonságai közül. Ilyen mértékekre adunk két példát.
2.14. Példa (Nem-metrikus különbözőségek: halmazkülönbségek)
Ez a példa két halmaz különbségének a halmazelméletben definiált
fogalmán alapul. Ha adott két halmaz,
2.15. Példa (Nem-metrikus különbözőségek: idő)
Ez a példa egy még mindennapibb példát ad olyan különbözőségi mértékre, ami nem metrikus, mégis hasznos. Definiáljuk a nap időpontjainak távolságát a következőképpen:
Szemléltetésképpen, d(1PM,2PM) = 1 óra, míg d(2PM,1PM) = 23 óra. Egy ilyen definíció értelmes lehet például, ha a következő kérdést akarjuk megválaszolni: ``Ha egy esemény minden nap délután 1-kor következik be, és most délután 2 van, meddig kell várnom, hogy az esemény ismét bekövetkezzen?''
A hasonlóságokra jellemzően nem áll fenn a háromszög
egyenlőtlenség (vagy egy azzal analóg tulajdonság), de a szimmetria és
a pozitivitás jellemzően igen. Konkrétan, ha
1.
2.
A hasonlósági mértékekre nincs általános megfelelője a háromszög egyenlőtlenségnek. Azonban esetenként lehetséges annak bizonyítása, hogy egy hasonlósági mérték könnyedén átalakítható egy metrikus távolsággá. A koszinusz és Jaccard hasonlósági mértékek, amelyeket rövidesen tárgyalunk, ennek két példája. Továbbá, meghatározott hasonlósági mértékekre a háromszög egyenlőtlenség szellemében lehetséges, hogy két hasonló objektum hasonlóságára matematikai korlátokat határozzunk meg.
2.16. Példa (Egy nem szimmetrikus hasonlósági mérték)
Tekintsünk egy kísérletet, melyben embereket kérünk meg, hogy
néhány karaktert osztályozzanak, ahogy azok felvillannak a képernyőn.
Az erre a kísérletre vonatkozó tévesztési
mátrix tartalmazza azt, hogy milyen gyakran osztályozzák az
egyes karaktereket saját magukként, és milyen gyakran osztályozzák egy
másikként. Tegyük fel például, hogy a ``0'' 200 alkalommal tűnt fel,
és ``0''-nak sorolták be 160 alkalommal, de 40 alkalommal ``o''-nak.
Hasonlóképpen feltételezzük, hogy az ``o'' 200 alkalommal jelent meg,
és ``o''-nak sorolták be 170 alkalommal, de ``0''-ként 30 alkalommal.
Ha ezeket a darabszámokat a két karakter közötti hasonlóság egy
mértékének tekintjük, akkor egy olyan hasonlósági mértéket kapunk,
amely nem szimmetrikus. Ilyen esetekben a hasonlósági mértéket gyakran
szimmetrikussá teszik az
Ebben a részben konkrét példákat mutatunk néhány hasonlósági és különbözőségi mértékre.
Hasonlósági mértékek bináris adatokra
Az olyan objektumok hasonlósági mértékeit, amelyek csak bináris attribútumokkal rendelkeznek, hasonlósági együtthatóknak nevezzük, és jellemzően 0 és 1 között veszik fel értékeiket. Az 1 érték azt jelzi, hogy a két objektum teljesen hasonló, míg a 0 érték azt jelzi, hogy az objektumok egyáltalán nem hasonlítanak. Számos okfejtés ismert arról, hogy bizonyos esetekben az egyik együttható miért jobb egy másiknál.
Legyen
Egyszerű egyezés együttható Az egyszerű egyezés együttható (SMC -- Simple Matching Coefficient) egy gyakran használt hasonlósági együttható, melyet a következőképpen definiálunk:
Ez a mérték egyformán számolja a jelenlévő és a hiányzó
értékeket. Ebből következik, hogy az
Jaccard együttható Tegyük
fel, hogy
2.17. Példa (Az SMC és a Jaccard hasonlósági együtthatók)
Hogy szemléltessük a két hasonlósági mérték közötti különbséget,
kiszámítjuk az
Koszinusz hasonlóság
A dokumentumokat gyakran vektorokként ábrázoljuk, ahol minden attribútum egy adott kifejezés (szó) előfordulási gyakoriságát fejezi ki a dokumentumban. Természetesen ez ennél bonyolultabb, mivel bizonyos gyakori szavakat figyelmen kívül hagyunk, és különböző előfeldolgozási módszerek felhasználásával kezeljük ugyanazon szó különböző formáit, a dokumentumok különböző hosszúságait és a szavak különböző gyakoriságait.
Bár a dokumentumoknak több ezer vagy több tízezer attribútuma
(kifejezése) van, minden dokumentum ritka, mivel viszonylag kevés
nem-nulla attribútuma van. (A dokumentumoknál használt normalizáló
módszerek nem hoznak létre nem-nulla bejegyzéseket nulla bejegyzések
helyén, azaz megőrzik a ritkaságot.) Így, csakúgy mint a tranzakciós
adatoknál, a hasonlóság nem függ a 0 értékek számától, mivel nem
valószínű, hogy két dokumentum ugyanazokat a szavakat ``nem
tartalmazza'', ezért ha megszámolnánk a 0-0 egyezéseket, a legtöbb
dokumentum nagy mértékben hasonlítana a többi dokumentumhoz. Ezért egy
dokumentumokra alkalmazott hasonlósági mértéknek figyelmen kívül kell
hagynia a 0-0 egyezéseket, csakúgy, mint a Jaccard mértéknek, de
emellett tudnia kell nem bináris vektorokat kezelni. A következőkben
definiált koszinusz hasonlóság a
dokumentumok hasonlóságának egyik legelterjedtebb mértéke. Ha
ahol
2.18. Példa (Két dokumentumvektor koszinusz hasonlósága)
Ebben a példában kiszámoljuk a koszinusz hasonlóságot a következő két adatobjektum között, amelyek dokumentumvektorokat is reprezentálhatnak:
Mint ahogy a 2.16. ábra mutatja, a koszinusz hasonlóság
valójában az
A (2.7) egyenlet felírható (2.8) egyenlet formájában.
ahol
Kiterjesztett Jaccard együttható (Tanimoto együttható)
A kiterjesztett Jaccard együttható használható
dokumentumadatokhoz, és bináris attribútumok esetén a Jaccard
együtthatóvá egyszerűsödik. A kiterjesztett Jaccard együttható
Tanimoto együtthatóként is ismert. (Azonban egy másik együttható is
ismert Tanimoto együttható néven.) Ezt az együtthatót, amit
Korreláció
Két bináris vagy folytonos változókkal rendelkező adatobjektum
közötti korreláció az objektumok attribútumai közötti lineáris
kapcsolat mértéke. (Az attribútumok közötti korreláció kiszámítását,
ami ismertebb, hasonlóképpen definiálhatjuk.) Konkrétabban, a két
adatobjektum,
ahol a következő szokásos statisztikai jelöléseket és definíciókat alkalmaztuk:
2.19. Példa (Tökéletes korreláció)
A korreláció mindig a
2.20. Példa (Nemlineáris kapcsolatok)
Ha a korreláció értéke 0, akkor a két adatobjektum attribútumai
között nincs lineáris kapcsolat. Nemlineáris kapcsolat azonban még
lehet. A következő példában
2.21. Példa (A korreláció szemléltetése)
Könnyű megítélni az
Ha úgy transzformáljuk
Bregman divergencia* Ebben a
szakaszban a Bregman divergenciát ismertetjük röviden, amely néhány
közös tulajdonsággal rendelkező szomszédsági függvény egy családja.
Eredményeképpen olyan általános adatbányászati algoritmusokat, például
klaszterező algoritmusokat alkothatunk, amelyek tetszőleges Bregman
divergenciával működnek. Erre konkrét példa a
A Bregman divergenciák veszteség- vagy torzításfüggvények. Hogy
megértsük a veszteségfüggvény fogalmát, tekintsük a következőket.
Legyen
Formálisabban a következő definíciót kapjuk.
2.6. Definíció (Bregman
divergencia) Ha adott egy
ahol
2.22. Példa. Egy konkrét
példát adunk négyzetes euklideszi távolságot használva, de csak egy
dimenzióra szorítkozunk, hogy a matematikai hátteret egyszerűsítsük.
Legyenek
A 2.18. ábra mutatja a példához tartozó grafikont
Ebben a szakaszban néhány fontos kérdést tárgyalunk a szomszédsági mértékekkel kapcsolatban: (1) hogyan kezeljük azokat az eseteket, amikor az attribútumok skálája eltérő és/vagy az attribútumok korreláltak, (2) hogyan számoljuk a szomszédságot különböző típusú, például kvantitatív és kvalitatív attribútumokból álló, objektumok között, és (3) hogyan kezeljük a szomszédság kiszámítását, amikor az egyes attribútumoknak különböző súlyaik vannak, azaz amikor nem minden attribútum járul hozzá egyenlően az objektumok szomszédságához.
Standardizálás és korreláció távolsági mértékeknél
A távolsági mértékek egy fontos kérdése, hogy hogyan kezeljük azt a helyzetet, amikor az egyes attribútumok értékeinek különböző a terjedelme. (Ezt a helyzetet gyakran úgy írják le, hogy ``a változók skálája különbözik''.) Korábban az euklideszi távolságot használtuk, hogy emberek közötti távolságot mérjünk két attribútumra, a korra és a jövedelemre alapozva. Ha ezeket az attribútumokat nem standardizáljuk, akkor a két ember közötti távolságban túlsúlyba kerül a jövedelem.
Ehhez kapcsolódó kérdés, hogy hogyan számoljuk a távolságot, ha
egyes attribútumok között korreláció figyelhető meg, esetleg az
értékek terjedelmeinek különbsége mellett. Az euklideszi távolság egy
általánosítása, a Mahalanobis
távolság, hasznos abban az esetben, ha az attribútumok
korreláltak, különböző az attribútumok értékeinek terjedelme
(különböző a szórásuk), és az adatok eloszlása közelítőleg Gauss
(normális). Speciálisan, az
ahol
2.23 Példa. A 2.19. ábrán
1000 pont látható, amelyek
2.19. ábra - Kétdimenziós pontok halmaza. A két, nagy pöttyökkel jelzett pont közötti Mahalanobis távolság 6, míg euklideszi távolságuk 14,7.

Heterogén attribútumok hasonlóságainak összekapcsolása
Az előző hasonlósági definíciók olyan megközelítéseken alapultak, amelyek feltételezték, hogy az összes attribútum egyforma típusú. Ha az attribútumok különböző típusúak, akkor egy általános megközelítésre van szükség. Egy egyszerű megközelítés, ha a 2.7. táblázat segítségével minden attribútumra külön-külön kiszámítjuk a hasonlóságot, majd ezeket összekapcsoljuk egy olyan módszerrel, amely egy 0 és 1 közötti hasonlóságot eredményez. A teljes hasonlóságot jellemzően az egyedi attribútumok hasonlóságainak átlagaként definiálják.
Sajnos ez a megközelítés nem működik jól, ha attribútumok közül néhány aszimmetrikus. Ha például minden attribútum aszimmetrikus bináris attribútum, akkor az előbb javasolt hasonlósági mérték az egyszerű egyezés együtthatóvá egyszerűsödik, egy olyan mértékké, amely nem megfelelő aszimmetrikus bináris attribútumok kezelésére. Ezt a problémát úgy orvosolhatjuk a legegyszerűbben, ha az aszimmetrikus attribútumokat kihagyjuk a hasonlóság kiszámításából, amennyiben az értékük 0 mindkét objektum esetén, amelyeknek a hasonlóságát számoljuk. Hasonló megközelítéssel a hiányzó értékek is jól kezelhetőek.
Összegezve, a 2.1. algoritmussal hatékonyan számítható ki az
2.1. algoritmus Heterogén objektumok hasonlóságai
1: A
2: Definiáljuk a
3: Számítsuk ki a teljes hasonlóságot a két objektum között a következő képlettel:
Súlyok használata
A korábbiakban többnyire az összes attribútumot egyenlőként kezeltük a szomszédság kiszámítása során. Ez nem előnyös, ha egyes attribútumok fontosabbak a szomszédság definíciójában, mint mások. Ezen helyzetek kezelésére módosíthatjuk a szomszédsági képleteket úgy, hogy minden attribútumot hozzájárulása szerint súlyozunk.
Ha a
A Minkowski távolság definíciója is módosítható a következőképpen:
A következőkben néhány olyan általános megfigyelést ismertetünk, amelyek segíthetnek. Először, a szomszédsági mérték típusának illeszkednie kell az adatok típusához. Sűrű, folytonos adatok számos típusánál gyakran használnak metrikus távolságmértéket, például euklideszi távolságot. A folytonos attribútumok szomszédságát leggyakrabban különbségek formájában fejezik ki, és a távolságmértékek jól definiált módot adnak ezen különbségek teljes szomszédsági mértékké való összekapcsolására. Bár az attribútumok skálája és fontossága különbözhet, ezeket a kérdéseket gyakran kezelni tudjuk a fentebb leírt módszerekkel.
Ritka adatokra, amelyek gyakran tartalmaznak aszimmetrikus attribútumokat, általában olyan hasonlósági mértékeket alkalmazunk, amelyek figyelmen kívül hagyják a 0-0 egyezéseket. Ez fogalmi szinten azt a tényt tükrözi, hogy két komplex objektum esetén a hasonlóság inkább a közös tulajdonságok számától függ, mint a mindkettőnél hiányzó tulajdonságok számától. Konkrétabban, ritka, aszimmetrikus adatoknál a legtöbb objektumnak csak néhány tulajdonságát írják le az attribútumok, és így ezek az objektumok nagyon hasonlóak azon tulajdonságok szempontjából, amelyekkel nem rendelkeznek. Az ilyen adatokhoz megfelelőek a koszinusz, Jaccard és kiterjesztett Jaccard mértékek.
Vannak olyan további jellemzői is az adatvektoroknak, melyeket figyelembe kell venni. Tegyük fel például, hogy idősorokat akarunk összehasonlítani. Ha az idősorok nagysága fontos (például minden idősor egy szervezet összes eladását mutatja a különböző évekre), akkor használhatjuk az euklideszi távolságot. Ha az idősorok különböző mennyiségeket (például vérnyomást és oxigénfogyasztást) ábrázolnak, akkor általában azt akarjuk meghatározni, hogy nagyságuk helyett az idősorok alakja egyforma-e. Ekkor megfelelőbb a korreláció, ami beépített normalizációt használ és kezeli a nagyság- és szintbeli különbségeket.
Egyes esetekben az adatok transzformálása vagy normalizálása azért fontos, hogy ezáltal egy megfelelő hasonlósági mértéket kapjunk, mivel az ilyen transzformációk nem mindig részei szomszédsági mértékeknek. Idősorokban például lehetnek olyan trendek vagy periodikus mintázatok, amelyek jelentős hatással vannak a hasonlóságra. Emellett a hasonlóság helyes kiszámításához szükséges lehet az időbeli eltérések figyelembevétele. Végül lehet, hogy két idősor csak meghatározott időintervallumokban hasonló. Erős kapcsolat figyelhető meg például a hőmérséklet és a földgázfelhasználás között, de csak a fűtési szezonban.
A gyakorlati megfontolások is fontosak lehetnek. Egyes esetekben egy adott területen már használatban van egy vagy több szomszédsági mérték, és így annak kérdését, hogy melyik szomszédsági mértéket használjuk, már korábban megválaszolták. Máskor előfordulhat, hogy a használt szoftvercsomag vagy klaszterező algoritmus drasztikusan lecsökkenti a lehetőségeinket. Ha a hatékonyság szempont, akkor olyan szomszédsági mértéket érdemes választanunk, aminek van olyan tulajdonsága, mint például a háromszög egyenlőtlenség, ami lecsökkenti a szomszédsági számítások számát. (Lásd 25. feladatot.)
Ha azonban a bevett gyakorlat vagy a gyakorlati szempontok nem írnak elő egy alternatívát, akkor a megfelelő szomszédsági mérték kiválasztása időigényes feladat lehet, amihez a szakterületi ismereteket és a mérték használatának céljait egyaránt alaposan át kell tekinteni. Szükséges lehet több különböző mérték kiértékelése, hogy lássuk, melyik adja azt az eredményt, aminek a legtöbb értelme van.