A 4.4.4. szakaszban számos módszert leírtunk egy modell általánosítási hibájának becslésére a tanítás során. A becsült hiba a modell kiválasztásban segíti a tanuló algoritmust, vagyis annak a megfelelő bonyolultságú modellnek a megtalálásában, amely nem fogékony a túlillesztésre. Miután felépült a modell, a teszthalmazon lehet alkalmazni korábban ismeretlen rekordok osztálycímkéinek az előrejelzésére.
Gyakran hasznos a modell teljesítményét a teszthalmazon mérni, mivel egy ilyen mérés a modell általánosítási hibájának egy torzítatlan becslését adja. A teszthalmazon számolt pontosságot vagy hibaarányt szintén használhatjuk különböző osztályozók ugyanazon a területen vett relatív teljesítményének az összehasonlítására. Ahhoz azonban, hogy ezt megtegyük, ismernünk kell a tesztrekordok osztálycímkéit. Ebben a pontban néhány, osztályozók teljesítményének a kiértékelésére általánosan használt módszert tekintünk át.
A visszatartó (holdout) módszerrel a címkézett esetekből álló eredeti adatokat két diszjunkt halmazra bontjuk, melyeket tanító- és teszthalmaznak nevezünk. Az osztályozási modellt ezután a tanulóhalmazon építjük fel, és teljesítményét a teszthalmazon értékeljük ki. A tanulásra és a tesztelésre fenntartott adatok arányát az elemzők általában saját belátásuk szerint állapítják meg (például fele-fele, vagy kétharmad a tanulásra és egyharmad a tesztelésre). Az osztályozó pontosságát a felépített modell teszthalmazon mért pontossága alapján lehet becsülni.
A visszatartó módszernek számos jól ismert korlátja van. Először is kevesebb címkézett eset áll rendelkezésére a tanuláshoz, mert néhány rekordot a teszteléshez tartunk vissza. Ennek eredményeképpen a felépített modell nem lehet olyan jó, mintha az összes címkézett esetet a tanulásra használnánk. Másodszor, a modell nagyban függhet a tanuló- és teszthalmazok összetételétől. Minél kisebb a tanulóhalmaz mérete, annál nagyobb a modell szórása. Másrészt, ha a tanulóhalmaz túl nagy, akkor a kisebb teszthalmazból számított becsült pontosság kevésbé megbízható. Egy ilyen becslésről azt mondhatjuk, hogy szélesebb konfidencia intervallummal rendelkezik. Végül, a tanuló- és teszthalmazok nem függetlenek egymástól. Mivel a tanuló- és teszthalmazok egyaránt az eredeti adatok részhalmazai, egy olyan osztály, amely felülreprezentált az egyik részhalmazban, alulreprezentált lesz a másikban, és fordítva.
A visszatartó módszert többször megismételhetjük azért, hogy egy
osztályozó teljesítményének a becslését javítsuk. Ez a megközelítés az
úgynevezett véletlen alulmintavételezés (random subsampling). Legyen
A véletlen alulmintavételezés egy alternatívája a
keresztellenőrzés (cross-validation). Ebben a megközelítésben minden
rekordot ugyanannyiszor használunk tanításra és pontosan egyszer
tesztelésre. A módszer szemléltetésére tegyük fel, hogy az adatokat
két egyenlő nagyságú részhalmazra osztjuk. Válasszuk először ki az
egyik részhalmazt tanításra, a másikat pedig tesztelésre. Ezután
cseréljük fel a részhalmazok szerepét, így a korábbi tanulóhalmaz lesz
a teszthalmaz, és fordítva. Ez a megközelítés az úgynevezett kettős
keresztellenőrzés. A teljes hibát úgy kapjuk, hogy mindkét futás
hibáját összegezzük. Ebben a példában minden egyes rekordot pontosan
egyszer használjuk tanításra és egyszer tesztelésre. A
A eddig bemutatott módszerek feltételezik, hogy a
tanulórekordokat visszatevés nélküli mintavételezéssel kapjuk. Ennek
eredményeként nincsenek ismétlődő rekordok a tanuló- és
teszthalmazokban. A bootstrap megközelítésben a tanulórekordokat
visszatevéses módon mintavételezzük, azaz egy, a tanulásra már
kiválasztott rekord visszakerül az eredeti rekordok közé, így azonos
eséllyel húzzuk ki újra. Ha az eredeti adatok
Számos változata van a bootstrap mintavételezési megközelítésnek
aszerint, hogy hogyan számítják az osztályozó teljes pontosságát. Az
egyik széles körben használt megközelítés a 0,632 bootstrap, amely mindegyik bootstrap
minta