Vissza a blogra

Hol érdemes tanítani a modellt?

Ugyanaz a döntési adapter két feladaton: az egyiken 13,7 ponttal több sort automatizál, a másikon rosszabb, mint a tanítás nélküli modell.

Október 5-én a döntési modellekről írt cikkünk végén megígértük, hogy kipróbáljuk a saját ötletünket: döntési adaptert a már betöltött modellünkhöz. Azt is megírtuk, hogy ha nem működik, arról is beszámolunk. Most mindkettő teljesült. Ugyanaz a kis adapter az egyik feladaton egyértelműen nyert, a másikon rosszabb lett, mint a tanítás nélküli modell.

A két eredményből derült ki az, ami szerintünk a legfontosabb: hol érdemes egyáltalán tanítani. Ez a rövid változat; a hosszú, módszertannal és korlátokkal, a Kutatás rovatban van.

Mit próbáltunk ki

A Sparkon, vLLM alatt naponta fut nálunk egy Qwen3.6-35B-A3B modell. Ehhez tanítottunk egy kis LoRA-adaptert, amely a chat helyett egyetlen döntést ad: a felkínált 2–10 lehetőség betűjelét, vagy azt, hogy egyik sem. A válasz mellé valószínűség is jár, erre lehet küszöböt tenni: ha a modell nem elég biztos, a döntés emberhez kerül.

A mérce mindkét feladaton ugyanaz volt: hány esetet visz automatikusan a rendszer, ha a besorolások 95 %-ának helyesnek kell lennie. Az összevetés alapja nem a nyers modell volt, hanem ugyanaz a modell tanítás nélkül, gondosan kalibrálva. Ilyenkor a lehetőségeket négyféle sorrendben kérdezzük meg, az eredményt átlagoljuk, és a valószínűségeket egy külön adathalmazon igazítjuk. Ez olcsó, és tanítás nélkül ennél jobbat nem tudunk kihozni a modellből.

A siker feltételeit mindkét körben a mérés előtt rögzítettük, és azt is, mi történik, ha az adapter elbukik.

Számlasor → cikk: nyert

Az első feladat a beszerzési számlák tételsorainak cikktörzshöz rendelése. A számlasorhoz a rendszer jelölt cikkeket ad, és a modellnek ki kell választania a jót, vagy azt kell mondania, hogy egyik sem az. A mérés szintetikus adaton futott, amelyet egy valós vállalkozás aggregált beszerzési profilja alapján generáltunk.

kalibrált alapmodelldöntési adapter
automatikusan besorolt sorok, 95 %-os célnál61,6 %75,2 %
ugyanez 16 új szállítónál56,8 %76,3 %
„egyik sem” esetek felismerése43 %96 %
hibaarány 70 %-os lefedettségnél4,8 %0,4–0,5 %

A nyereség +13,7 százalékpont, új szállítóknál +19,5 pont. Szinte teljes egészében abból jön, hogy az adapter felismeri, ha a jó cikk nincs a listán. A tanítás nélküli modell ezekben az esetekben választott valamit a felkínált cikkek közül. Az adapter és az adatkészlet publikus a Hugging Face-en.

Eszközválasztás: rosszabb lett

A második feladat: a kérés alapján melyik eszközt hívja az ügynök, vagy egyiket se. Ugyanaz a recept, publikus adaton (BFCL, When2Call, xLAM, a MASSIVE magyar része) és egy saját, 62 eszközös katalógus magyar kéréseivel. A teszt 10 013 elemből állt.

kalibrált alapmodelldöntési adapter
automatikusan besorolt kérések71,7 %76,7 %
ebből helyes (cél: 95 %)88,2 %84,0 %
hibaarány 50 %-os lefedettségnél4,9 %7,3–8,0 %
„nincs illő eszköz” felismerése76,2 %67,3 %

Az adapter több kérést sorolt be, de rosszabb pontossággal, és a „nincs illő eszköz” eseteket ritkábban ismerte fel. Azonos lefedettségnél a hibaaránya is magasabb volt. A sikerfeltétel a mérés előtt rögzített szabály szerint nem teljesült.

A táblázatban van egy második, kellemetlen sor is. A 95 %-os célt a tanítás nélküli modell sem tartotta: a küszöböt egy olyan adathalmazon választottuk, amelynek „nincs illő eszköz” esetei mások voltak, mint a teszté.

Egy ábrán a két feladat: minél lejjebb fut a görbe, annál kevesebb a hiba ugyanannyi automatikus besorolásnál.

Két grafikon egymás mellett: vízszintesen a gép által automatikusan besorolt tételek aránya, függőlegesen a hibaarány a besoroltak közt. A számlasor–cikk feladaton a döntési adapter görbéi végig a kalibrált alapmodellé alatt futnak: 70 százalékos lefedettségnél 0,4–0,5 százalék a hibaarány a 4,8 százalékkal szemben. Az eszközválasztásban az adapter görbéi végig fölötte vannak: 50 százalékos lefedettségnél 7,3–8,0 százalék a 4,9 százalékkal szemben. A validáción választott küszöb az első feladaton 5 százalék alatti hibaaránynál áll meg, a másodikon mindkét modellnél fölötte.

Miért fordult meg az eredmény?

Az első ok: az eszközválasztásban nem volt mit nyerni. Ha volt illő eszköz, a tanítás nélküli modell már 93–100 %-ban besorolta a kérést, 97–100 %-os pontossággal. Az alapmodellt nyilvánvalóan sokat tanították eszközhívásra, számlasorok cikkhez rendelésére viszont nem. Az első feladaton a tanítás nélküli modellnek volt hová fejlődnie, a másodikon már a plafon közelében járt.

A második ok: a tanítás rossz típusú „egyik sem” esetet mutatott. A tanító „nincs illő eszköz” esetek 80 %-a mesterséges volt: ugyanaz a kérés, csak a jó eszközt levettük a listáról. Ebből a modell azt tanulta meg, hogy ha van hasonló eszköz, hívja meg. A tesztben viszont valódi, irreleváns kérések jöttek, és mellettük közeli, de nem illő eszközök álltak. Az első feladaton a teszt „egyik sem” esetei pontosan ugyanolyanok voltak, mint a tanításéi, ezért ott ez nem okozott gondot.

Pontdiagram négy sorral: az „egyik sem” esetek hány százalékát ismeri fel a modell. Az első feladat mesterséges eseteinél (737 tétel) a kalibrált alapmodell 43 százalékot, a döntési adapter 94–97 százalékot. Az eszközválasztás valódi irrelevanciáján az adapter mindhárom forrásban rosszabb: BFCL irrelevancia 86 helyett 72–74 százalék, BFCL-live irrelevancia 66 helyett 50–56 százalék, When2Call nem megválaszolható kérések 77 helyett 69–73 százalék.

Egy harmadik jelenség is előjött: a magyar kéréseknél az adapter a forrásadatkészlet néhány hibás címkéjét is megtanulta. Ahol mi a címkét kijavítottuk, ott magabiztosan a régit adta.

A puha célokkal desztillált modell sem jobb

Kézenfekvő ellenvetés, hogy a hiba a tanítás módjában van: ha a modell egy tanármodell teljes valószínűség-eloszlását tanulja, talán megmarad a kalibrációja. Erre van egy publikus próba. A JEV-27B a zárt Jev modell nyílt, desztillált változata (az AutoTrust AI kiadása, nem a TypeSafe-é), és a készítői közzétették a válaszvalószínűségeit egy nagy benchmarkon. Ugyanazokon a When2Call-elemeken vetettük össze a modelleket.

szétválasztás (AUROC)hamis hívás 95 % helyes hívás mellett
kalibrált alapmodell0,96414,1 %
a mi döntési adapterünk0,945–0,95915,7–17,3 %
JEV-27B0,94937,3 %

A JEV-27B a mi adapterünk szintjén van, és mindkettő elmarad a tanítás nélküli, kalibrált modelltől. Ez nem a JEV hibája: a modellkártyája mást mér, a tanármodellhez való hűséget és a pontosságot rögzített opciókészleten. Azt viszont mutatja, hogy a „nincs illő eszköz” csapdát a puha célok önmagukban nem védik ki.

Mit döntöttünk

A számlasorok cikkhez rendelésénél a döntési adapter valódi nyereség, ott marad. Az eszközválasztó adaptert nem publikáljuk: a teszten a kalibrált alapmodell jobb, és aki letöltené, rosszabbul járna vele. A DocAI-ban az eszközválasztáshoz a kalibrált kiolvasás megy tovább, adapter nélkül. Ez egyébként a modell beépített eszközhívását is veri: azonos lefedettség mellett 5,7 ponttal pontosabb.

Egy jó hírt is hozott a mérés: ugyanazon a vLLM-példányon két adapter egyszerre betöltve, párhuzamos terhelés mellett is ugyanazt adja, mint külön. Feladatonként cserélhető adapterekkel tehát egyetlen modellpéldány is kiszolgálhat több döntést.

Összefoglalva

A finomhangolás nem eleve javítás. Ugyanaz a recept, ugyanazon a modellen, az egyik feladaton 13,7 pontot hozott, a másikon rontott. A különbség nem a receptben volt, hanem abban, hol volt gyenge a modell, és mit látott a tanítás.

  1. Előbb a tanítás nélküli, kalibrált modellt mérd meg. Ez a mérce, nem a nyers modell. Nálunk ez a lépés a modell beépített eszközhívását is verte.
  2. Ott taníts, ahol a modell gyenge. Ahol a tanítás nélküli modell már a plafon közelében jár, ott a tanítás inkább árt, mint használ.
  3. Az „egyik sem” esetek a tanításban olyanok legyenek, mint élesben. A mesterségesen előállított „nincs illő” eset mást tanít, mint a valódi.
  4. A küszöböt az éles forgalomhoz hasonló adaton válaszd. Más adaton választva a 95 %-os cél a tanítás nélküli modellnél is 88 %-ra esett.
  5. Rögzítsd előre, mi számít sikernek. A negatív eredményből tanultuk a legtöbbet, de csak azért, mert előre leírtuk, mit tekintünk bukásnak.

A mérés két előre regisztrált kör: a protokollokat 2026. október 3-án és 8-án, a teszt érintése előtt rögzítettük. Modell: Qwen3.6-35B-A3B-FP8, vLLM 0.30, NVIDIA GB10; adapterenként három tanítási ismétlés. A számlasoros kör szintetikus adaton futott (3534 + 2107 tesztelem), az eszközválasztásos publikus adaton és saját katalóguson (10 013 tesztelem). A JEV-27B számai a készítők közzétett, elemenkénti valószínűségeiből és a benchmark újraépített címkéiből származnak; a modellt nem futtattuk. A teljes módszertan, a konfidencia-intervallumok és a korlátok a kutatási jelentésben, a kód és az eredmények a docai-evals repóban vannak.