Vissza a Kutatás rovathoz

Kutatási jelentés

Hol érdemes döntésre tanítani a modellt?

Ugyanaz a recept, ugyanaz a kiszolgált modell, két feladat, két előre regisztrált mérés — és ellentétes eredmény. Egy kis döntési LoRA a magyar számlasorok cikkhez rendelésében 13,7 ponttal több sort automatizál 95 %-os precizitás mellett, az eszközválasztásban viszont rosszabb, mint a tanítás nélküli, kalibrált alapmodell. A különbség nem a receptben van, hanem abban, hol volt gyenge az alapmodell, és milyen „egyik sem” esetet látott a tanítás.

Modell
Qwen3.6-35B-A3B-FP8
Feladatok
2 · 15 654 tesztitem
Karok
L0 · L1★ · L3 × 3 seed
Hardver
NVIDIA GB10 · vLLM 0.30
A rövid válasz

Egy már kiszolgált chat-modellt (Qwen3.6-35B-A3B, FP8, vLLM) tanítottunk egy kis LoRA-adapterrel arra, hogy egyetlen címketokennel döntsön a felkínált opciók közt, vagy mondja azt, hogy egyik sem. A mérce mindkét feladaton ugyanaz volt: hány esetet visz automatikusan, ha a besorolások 95 %-ának helyesnek kell lennie, és ezt összevetettük azzal, amit a tanítás nélküli alapmodell ad, ha a válaszvalószínűségeit gondosan kalibráljuk. A számlasor → cikk feladaton az adapter nyer: +13,7 pont, új szállítókon +19,5 pont, és az „egyik sem” eseteket 43 % helyett 96 %-ban ismeri fel. Az eszközválasztásban veszít: több kérést sorol be, de a precizitása a kitartott teszten 84 %-ra esik, a kockázat–lefedettség görbéje rosszabb az alapmodellénél, és a valódi irrelevanciát 8,9 ponttal ritkábban ismeri fel. A nem-X eszközválasztásban az alapmodell már tanítás nélkül is szinte hibátlan volt, a nyerhető rész az „egyik sem” lett volna — és a tanítás pont ott rontott, mert más típusú „egyik sem” esetet látott, mint amilyennel a teszt jött. Egy publikus, puha célokkal desztillált döntési modell (JEV-27B) ugyanezeken az itemeken ugyanígy elmarad a kalibrált alapmodelltől.

kérdésítéletmire épül
Számlasor → cikk · többet automatizál-e a döntési adapter a kalibrált alapmodellnél? Igen. lef@95 0,616 → 0,752, Δ +13,7 pont [4,8; 21,0]; AURC 0,0273 → 0,0018
Új szállítók · általánosít-e? Igen. 16 csak tesztben szereplő szállító: +19,5 pont [10,2; 29,2], mind a 16-on pozitív
Eszközválasztás · ugyanez a recept nyer-e? Nem. precizitás 0,84 a 0,95-ös célnál (bukás); AURC +0,028 [0,022; 0,034] az alapmodell javára
Miért · hol romlik? Az „egyik sem” eseteken. X-fedés −8,9 pont [−11,4; −6,3]; a nem-X itemeken 98–100 % besorolás 97–100 % precizitással
Puha célok · elkerüli-e ezt egy desztillált modell? Nem. hívás/nem hívás AUROC ugyanazon 2328 itemen: alapmodell 0,964, adapter 0,945–0,959, JEV-27B 0,949
Kiszolgálás · mehet-e két adapter egy példányon, párhuzamos terhelés mellett? Igen, egy kitétellel. top-címke-egyezés a zaj-alapon belül, soros és c = 16 forgalomnál; a LoRA-támogatás bekapcsolása a LoRA nélküli kérések ~6 %-át átbillenti

Minden állítás egy modellen, egy kvantáláson, egy motoron mért. A korlátok a 11. fejezetben; a kód, a protokollok és az eredmények a mellékletben.

Miért mértem meg

A DocAI-ban két helyen kell gépnek döntenie úgy, hogy tudnia kell, mikor ne döntsön: a beszerzési számlák tételsorainak cikktörzshöz rendelésénél, és amikor egy ügynök a kérés alapján eszközt választ. Mindkét helyen ugyanaz a kérdés: ha a modell bizonytalan, a sor ne könyvelődjön automatikusan, hanem menjen emberhez. Ehhez a modellnek kalibrált valószínűség kell, nem csak válasz. Kézenfekvő ötlet egy kis döntési adapter ugyanarra a példányra, amelyik a chatet is kiszolgálja. Az első kör ezt igazolta, a második kör azt kérdezte, átvihető-e a recept egy második feladatra. Nem vihető át — és ebből a negatív eredményből tanultuk meg, hol érdemes egyáltalán tanítani.

1. fejezetA kérdés: döntés tartózkodással, ugyanazon a példányon

Mindkét kör kutatási kérdése ugyanaz volt: egy már kiszolgált chat-modell egy kis döntési adapterrel kalibráltabb és lefedettebb döntést ad-e, mint a saját, tanítás nélküli válaszvalószínűségeinek gondos kalibrálása? A döntés formája egyetlen token: a modell a felkínált 2–10 opció betűjelét adja (A–J), vagy X-et, ha egyik sem illik. A címketokenekre szűkített valószínűség a döntés bizonyossága; erre tehető egy küszöb, ami eldönti, mikor dönt a gép és mikor az ember.

A hipotéziseket, a cáfolati kritériumokat, az elsődleges végpontokat, a statisztikai eljárást és a publikálási döntési szabályt mindkét körben a mérés előtt rögzítettük: az első körben 2026. október 3-án, a másodikban október 8-án, mielőtt a tesztet bármelyik kar érintette volna. A publikálási szabály azt is előre kimondta, mi történik, ha az adapter elbukik: akkor az adapter nem publikus, a negatív eredmény igen.

2. fejezetKét feladat, egy recept

1. kör: számlasor → cikk2. kör: eszközválasztás
döntésegy magyar beszerzési számlasorhoz melyik cikk a 2–10 jelölt közül, vagy egyik semegy kéréshez melyik eszköz a 2–10 jelölt közül, vagy egyik sem
adatszintetikus: egy valós vállalkozás aggregált beszerzési profilja alapján kitalált cikktörzs (3514 cikk) és szállítókpublikus: xLAM, When2Call, BFCL, MASSIVE magyar része, plusz egy saját, 62 eszközös általános katalógus generált magyar kérésekkel
teszt3534 item négy rétegben (3020 pontozott) + 2107 item 16 új szállítóval10 013 item; a pontozott pool 7561 item öt rétegből
„egyik sem” a tesztben25 %; zömmel kényszerített (a jó cikket levettük a listáról)33 %; zömmel valódi irrelevancia (BFCL-live, When2Call)
„egyik sem” a tanításbanugyanazzal a kényszerítéssel, mint a tesztben80 % kényszerített, 20 % természetes (499 When2Call, 255 csevegés)
receptLoRA r16 az attention- és a GDN-vetítéseken, valamint a megosztott szakértő MLP-jén (a routolt szakértőkön nincs LoRA), 1 epoch, CE a jelen lévő címkékre + 0,5·Brier, ε = 0,05; a 2. körben 30 % opció-permutációval; 3 seed; BF16-on tanítva, az FP8 checkpointon kiszolgálva

A tesztcímkéket mindkét körben átnéztük. Az első körben két független LLM-bíráló előszűrt, utána rétegzett emberi átnézés jött (424 item); a maradék zaj 0,40 % (felső 95 %-os korlát 1,36 %). A második körben a magyar rétegek címkéit egy nagy modell nézte át teljesen, emberi vak szúrópróbával auditálva (300 változatlan + 70 gépi javítás): a becsült maradék zaj 1,2 % (felső korlát 2,4 %), a gépi javítások 87 %-a megerősítve. Az előre rögzített 2 %-os kaput ez nem teljesíti; korlátként jelentjük.

3. fejezetA létra, a mérőszámok és a protokoll

Minden kar ugyanazon a vLLM-példányon fut, így a páros különbségekből a példányzaj kiesik. A létra fokai:

  • L0 · nyers kiolvasás. Az alapmodell válaszának valószínűsége a címketokenekre szűkítve.
  • L1★ · kalibrált kiolvasás. Ugyanez négy opciósorrend átlagaként, a val-on illesztett temperature-rel. Tanítás nélkül ez a legjobb, amit a modellből ki lehet hozni; ez az összevetés alapja.
  • L3 · döntési LoRA. A fenti recept, temperature-rel kalibrálva.

Két saját mérőszám, mindkettő előre definiálva:

  • lef@95 (lefedettség 95 %-os precizitás mellett): a pontozott itemek aránya, amelyeket a kar egy τ küszöb fölött cikkhez vagy eszközhöz rendel. A τ a val-on választódik: a legkisebb küszöb, amely fölött a besorolások precizitásának egyoldali 95 %-os Clopper–Pearson alsó korlátja legalább 0,95. Felső korlátja a plafon, a nem-X itemek aránya. Ha a teszten elért precizitás 0,93 alá esik, az precizitás-bukás.
  • AURC: a kockázat–lefedettség görbe alatti terület; minél kisebb, annál jobban rangsorolja a kar a saját döntéseit bizonyosság szerint.

Statisztika: klaszterezett, hierarchikus bootstrap (seed × klaszter), 10 000 ismétlés, a val újramintavételezésével és a τ minden ismétlésben újraválasztva; Holm-korrekció a társ-elsődleges végpontokra.

4. fejezetSzámlasor → cikk: ahol az alapmodell gyenge

karlef@95elért precizitásAURCECEX-precizitás / X-fedés
L0 nyers0,5960,9570,03700,0480,850 / 0,385
L1★ kalibrált0,6160,9750,02730,0430,891 / 0,434
L3 döntési LoRA0,752 [0,745–0,761]0,9790,00180,0100,945 / 0,957

A négy tesztréteg együtt, 3020 pontozott item; a plafon 0,756. Az L3 a három seed átlaga, zárójelben a tartomány.

  • A nyereség +13,7 pont [4,8; 21,0], az AURC −0,0255 [−0,0300; −0,0213]. Az L3 gyakorlatilag a plafonon áll.
  • A nyereség az „egyik sem” felismeréséből jön. Az L1★ hibái 95 %-os célnál 46-ból 42 esetben tévesen besorolt „egyik sem” sorok; rossz cikket alig választ. Az X-fedés 0,43-ról 0,96-ra nő.
  • Kockázat azonos lefedettségen: 70 %-os lefedettségnél a besorolások hibaaránya 4,8 %-ról 0,4–0,5 %-ra csökken.
  • Általánosít: a tanításból kitartott kategóriaágakon +9,8 pont [1,7; 15,5], 16 csak tesztben szereplő szállítón +19,5 pont [10,2; 29,2], mind a 16 szállítón pozitív nyereséggel.
  • Az előny mérete a valós „egyik sem” aránytól függ: a teszt 25 %-os X-arányán +13,7 pont, 10 %-os X-arányra ritkítva +3,5 pont.

Az adapter és az adatkészlet publikus: Qwen3.6-35B-A3B-invoice-decision-lora és hu-invoice-catalog-decisions.

5. fejezetEszközválasztás: ahol az alapmodell erős

karlef@95 (/plafon)elért precizitásAURCECEX-precizitás / X-fedés
L0 nyers0,684 (1,02)0,893 ⚠0,03330,0560,912 / 0,762
L1★ kalibrált0,717 (1,07)0,882 ⚠0,03310,0230,919 / 0,762
L3 döntési LoRA0,767 (1,15) [0,758–0,775]0,840 ⚠0,06090,0880,964 / 0,673
natív tool callinghívásarány 0,6740,850——— / 0,735

A pontozott pool 7561 itemén (BFCL, BFCL-live, When2Call, magyar MASSIVE, katalógus); a plafon 0,669. ⚠ = precizitás-bukás. Az 1-nél nagyobb lefedettség/plafon arány azt jelenti, hogy a kar „egyik sem” itemeket is eszközhöz rendel.

  • Az elsődleges hipotézis cáfolt, mindkét végponton. A lefedettségben az L3 +4,9 pontot [3,6; 6,6] mutat, de a precizitása mindhárom seednél a bukási határ alatt van (0,83–0,85). Az AURC-ben szignifikánsan az alapmodell jobb (+0,028 [0,022; 0,034]).
  • Közös lefedettségre vágva is. Az AURC a kar saját besorolásain fut, így a többet besoroló kar hosszabb görbét kap. Ezért ugyanazon lefedettségen is összevetettük: 50 %-os lefedettségnél az alapmodell hibaaránya 4,9 %, az L3-é 7,3–8,0 %.
  • A natív tool callingot mindkettő veri a natív munkapontján (az L3 +3,4 pont precizitás azonos lefedettségen, +7,4 pont lefedettség azonos precizitáson) — de ezt az előnyt főleg a kalibrált kiolvasás adja, nem az adapter: az L1★ ugyanott +5,7, illetve +5,1 pont.
  • Egyik kar sem tartja a 95 %-ot. A val-on választott küszöb a teszten az alapmodellnél is 88 %-os precizitást ad: a val „egyik sem” esetei (kényszerített, xLAM és MASSIVE) nem képviselik a teszt valódi irrelevanciáját.
1 · a két kör egy ábrán: kockázat–lefedettség
Két kockázat–lefedettség grafikon egymás mellett: vízszintesen a gép által besorolt tételek aránya, függőlegesen a hibaarány a besoroltak közt. Bal oldalt, a számlasor–cikk feladaton a döntési adapter három görbéje végig a kalibrált alapmodellé alatt fut: 70 százalékos lefedettségnél 0,4–0,5 százalék a hibaarány a 4,8 százalékkal szemben, és a validáción választott küszöb mindkét karnál 5 százalék alatti hibaaránynál áll meg. Jobb oldalt, az eszközválasztásban az adapter görbéi végig az alapmodellé fölött vannak: 50 százalékos lefedettségnél 7,3–8,0 százalék a 4,9 százalékkal szemben, és a validáción választott küszöb mindkét karnál az 5 százalékos határ fölött, 12, illetve 15–17 százalékos hibaaránynál áll meg.
Mindkét kör kitartott tesztje, vLLM; az L3 mindhárom seedje külön görbe. A görbe a kar saját besorolásait rendezi bizonyosság szerint: minden pontban a lefedettség a besorolt itemek aránya, a kockázat a köztük lévő hibák aránya, a görbe alatti terület az AURC. A pontok a val-on választott 95 %-os küszöb munkapontjai: az 1. körben az 5 %-os vonal alatt maradnak, a 2. körben mindkét kar fölötte áll meg. A plafontól jobbra a kar már „egyik sem” itemeket is besorol.

6. fejezetMiért fordult meg: az „egyik sem” típusa

A két kör közti különbséget nem a recept magyarázza — az ugyanaz volt —, hanem az, hogy hol volt mit nyerni, és milyen „egyik sem” esetet látott a tanítás.

Ahol nem volt mit nyerni

Az eszközválasztás nem-X itemjein az alapmodell már tanítás nélkül is szinte hibátlan: a BFCL és a When2Call nem-X itemjeinek 93–100 %-át 97–100 %-os precizitással sorolja be. Az L3 itt 98–100 %-ra emeli a lefedettséget, ami alig több. Az alapmodellt kifejezetten tool callingra is tanították; számlasor → cikk besorolásra nem. Az első körben a kalibrált alapmodell lef@95-je 0,616 volt a 0,756-os plafon alatt, a másodikban a nem-X eszközválasztás már a plafon közelében járt. A tanulság: ott érdemes tanítani, ahol az alapmodell gyenge.

Ahol volt, ott rontott

forrás (X-itemek)nL1★: X-fedés / besorolva @95L3 (3 seed): X-fedés / besorolva @95
BFCL irrelevance2400,858 / 0,1420,717–0,738 / 0,263–0,283
BFCL-live irrelevance8750,657 / 0,3310,504–0,560 / 0,432–0,482
When2Call „cannot answer”10350,775 / 0,2100,689–0,730 / 0,269–0,309

A precizitásesés teljes egészében az „egyik sem” itemekből jön: az L3 a valódi irrelevanciát gyakrabban rendeli magabiztosan eszközhöz. A tanítás „egyik sem” esetei 80 %-ban kényszerítettek voltak: ugyanaz a kérés, a jó eszköz levéve a listáról. Ebből a modell azt tanulta meg, hogy ha van hasonló eszköz, hívja meg. A tesztben az irreleváns kérések mellett közeli, de nem illő eszközök állnak. Az első körben a teszt „egyik sem” esetei ugyanolyan kényszerítettek voltak, mint a tanításéi — ott a modell pontosan azt tanulta meg, amivel a teszt jött.

2 · az „egyik sem” felismerése típusonként
Pontdiagram négy sorral: az „egyik sem” esetek hány százalékán mondja a modell legvalószínűbb válaszként, hogy egyik sem. Az 1. kör kényszerített eseteinél (737 item) a kalibrált alapmodell 43 százalék, a döntési adapter 94–97 százalék. A 2. kör valódi irrelevanciáján az adapter mindhárom forrásban rosszabb: BFCL irrelevancia (240 item) 86 helyett 72–74 százalék, BFCL-live irrelevancia (875 item) 66 helyett 50–56 százalék, When2Call nem megválaszolható (1035 item) 77 helyett 69–73 százalék.
X-fedés: az „egyik sem” itemek aránya, amelyeken a kar legvalószínűbb válasza X, küszöbtől függetlenül (a 2. kör H5-jének mérőszáma). Kék pont: kalibrált alapmodell; narancs sáv: a döntési adapter három seedjének tartománya. Ahol a teszt „egyik sem” esetei olyanok voltak, mint a tanításéi, az adapter szinte mindet felismeri; ahol valódi irrelevancia jött, ott kevesebbet, mint tanítás nélkül.

Fontos részlet: a második kör tanítása 499 When2Call-típusú valódi irrelevanciát is tartalmazott (a tanító „egyik sem” esetek 13 %-a), és a modell mégis romlott ezen a típuson. Kis arányú lefedés nem volt elég ellensúlynak.

A forrás címkézési szokásait is megtanulta

A magyar rétegben az átnézés 40 itemen javította a MASSIVE eredeti címkéjét. Ezek közül az L3 18–24-nél a régi címkét adja, mindet a küszöb fölötti bizonyossággal; az alapmodell 8-nál. Ha ezt a 40 itemet kihagyjuk, az L3 a magyar rétegen is jobb (AURC 0,0011–0,0019 az alapmodell 0,0028-ával szemben). Ez utólagos részhalmaz, ítéletet nem változtat, de mutatja a kemény címkés tanítás egyik kockázatát: a forrás konvenciói magabiztosan beégnek.

Amit utólag kipróbáltunk

  • Gondolkodó mód a bizonytalanokra. A küszöb alatti itemeket az alapmodell gondolkodó módja kapta. Az oda került 1743 item 96 %-a „egyik sem” volt, és ezek 95 %-át helyesen ismerte fel — de a hibák nem ott voltak: az L3 rossz besorolásai a küszöb fölött ültek, magabiztosan.
  • Kétlépcsős döntés. Ha a hívjon-e kérdést az alapmodell dönti el, és csak az eszközt választja az L3, az „egyik sem” felismerés megmarad az alapmodell szintjén, de a lefedettség csak ~1 ponttal nő (0,726 vs. 0,717). Az eszközválasztásban nem volt mit nyerni.

7. fejezetEgy publikus, puha célú modell ugyanezen

Kézenfekvő ellenvetés, hogy a kemény címkés tanítás volt a hiba: egy tanármodell teljes eloszlására desztillált adapter talán megőrzi a kalibrációt. Erre van publikus próba. A JEV-27B döntési modell (autotrust/JEV-27B) puha célokkal, 656 ezer soron tanult, és a készítői közzétették az itemenkénti valószínűségeit a Decision Index benchmarkon (jev-decision-index-results). A goldot a benchmark-kit rögzített forrásaiból építettük újra; a közölt pontosságaik mindkét általunk használt sávon pontosan visszajönnek. A JEV-27B a When2Call-t és a CLINC150-et nem látta tanításkor; a 2. körünk adaptere a When2Call tanítórészén tanult.

karAUROChamis hívás 90 % helyes hívásnálhamis hívás 95 %-nálhívás a „cannot answer” itemeken
L1★ kalibrált alapmodell0,9648,6 %14,1 %22,5 %
L3 döntési LoRA (3 seed)0,945–0,9599,5–11,7 %15,7–17,3 %27–31 %
JEV-27B0,9499,7 %37,3 %6,2 %

When2Call, a 2. kör tesztjének ugyanazon 2328 itemén (1293 helyes hívás, 1035 „nincs illő eszköz”). A mi karjainknál a hívás valószínűsége 1 − P(X), a JEV-nél a tool-call válaszmód valószínűsége. A keretek eltérnek: a JEV négy válaszmód közül választ, a mi karjaink eszközlistából és X-ből; az itemek azonosak.

  • A JEV-27B alacsony hívásaránya óvatosabb munkapont, nem jobb szétválasztás: a helyes hívások 13 %-át is kihagyja. Küszöbtől függetlenül (AUROC) az adapterünk szintjén van, és mindkettő elmarad a kalibrált alapmodelltől.
  • CLINC150, hatókörön kívüli kérések: a JEV-27B 38 %-ban ismeri fel őket, miközben a hatókörön belüli pontossága 89 %. A Gemma-alapú testvére, amely a CLINC tanítórészét is látta, 67 %-ban.
  • Következtetés: a puha cél önmagában nem védi ki az irrelevancia-csapdát. Az „egyik sem” típus tanítása segíthet (CLINC), de a When2Call-on a rajta tanult modellek közül egyik sem éri el az alapmodellt.
3 · hívjon-e eszközt: öt kar ugyanazon a 2328 itemen
Vízszintes sávdiagram: a hamis hívások aránya a When2Call nem megválaszolható kérésein, ha a küszöb a helyes hívások 95 százalékát átengedi, ugyanazon a 2328 itemen. Kalibrált alapmodell 14,1 százalék (AUROC 0,964), döntési adapter 15,7–17,3 százalék (0,945–0,959), JEV-9B 33,4 százalék (0,953), JEV-27B 37,3 százalék (0,949), JEV-Gemma4-26B-A4B 35,7 százalék (0,943).
A fenti táblázat 95 %-os oszlopa, a JEV-27B két testvérével kiegészítve. Küszöbtől függetlenül (AUROC) mind az öt kar 0,94 és 0,97 között van, és a kalibrált alapmodell a legjobb; a 95 %-os munkapontban nagyobb a különbség. A JEV-modelleket nem futtattuk, a készítők közzétett valószínűségeivel számoltunk.

Ez nem a JEV hibája: a kártyája tanár-hűséget és pontosságot mér rögzített opciókészleten, és abban erős. Amin a mi adapterünk elbukott — irrelevancia és szelektív precizitás eloszlásváltás mellett, a kalibrált alapmodellel szemben —, azt a kártya nem méri, és a közzétett eredményeik tették lehetővé, hogy megmérjük.

8. fejezetKiszolgálás: egy példány, több adapter

  • Két adapter egy példányon működik. A 2. kör adaptere és az 1. körös cikkbesoroló adapter egyszerre betöltve, soros és párhuzamos (c = 16, vegyes adapteres és adapter nélküli) forgalom mellett is ugyanazt adja, mint az egyadapteres példány: a top-címke-egyezés mind a négy feltételben a két friss egyadapteres példány egymás közti egyezésén belül van (a különbség egyoldali alsó korlátja −0,26 és −0,70 pont közt).
  • A LoRA-támogatás bekapcsolása önmagában is változtat. A vLLM 0.30 --enable-lora mellett a MoE-réteg FP8-kernelét is cseréli, és ezen futnak a LoRA-t nem kérő kérések is: a bizonytalan döntések ~6 %-a átbillen, a példány újraindításonként más numerikai módba eshet. Kimutatható pontosságromlás nincs (±1,3 pont felbontással). Meglévő forgalommal közös példánynál ezzel számolni kell.
  • Ár: egy döntés ~160 ms egyesével, párhuzamosan ~15 döntés/s egy GB10-en; a LoRA-kérés többletköltsége 3–10 %.

9. fejezetAmit a mérés közben elrontottunk

  • Egy nem kitartott „új szállító” réteg. Az 1. kör generátora a szállítói réteg 14 szállítóját a tanításba is betette. A réteg így „látott szállító, új pár” lett. Egy előre rögzített kiegészítésben 16 valóban új szállítóval újramértük; a +19,5 pont innen jön.
  • Plafonon ülő val. Az 1. körben a val olyan könnyű volt, hogy a karválasztás zajra döntött. A 2. körben az előre rögzített szabály szerint plafonon ülő val mellett nem hangoltunk.
  • Szinonim opciók a kényszerített „egyik sem” mögött. Az első átnézés 99 itemből 12 hibát talált, zömmel a cikktörzs szemantikus duplikátumait: ha a levett cikk szinonimája a listán maradt, az „egyik sem” hamis volt. A 2. körben a szinonimaszűrés már a generálás előtt futott.
  • Gépi címke-átnéző. A 2. kör magyar címkéit egy gépi ágens nézte át; csak a döntések időbélyegéből derült ki, hogy nem ember kattintott. Utólag emberi vak szúrópróbát tettünk rá (2. fejezet).
  • Egy hiányos hipotézis. A 2. kör rétegenkénti általánosítási hipotézise a lefedettség-különbséget precizitási feltétel nélkül ítélte meg, ezért mindkét rétegen „általánosít” ítéletet adott, miközben ott az adapter precizitása bukott. Előre rögzített szabály, nem írtuk át; a fő hipotézis bukása miatt nincs rá épülő állítás. A következő körben a rétegítélet precizitáshoz kötött.

10. fejezetA hipotézisek verdiktje

állításverdiktalap
1/H1számlasor → cikk: az adapter veri a kalibrált alapmodelltigazoltlef@95 +13,7 [4,8; 21,0]; AURC −0,0255
1/H2általánosít új kategóriára és új szállítóraigazolt+9,8 [1,7; 15,5]; +19,5 [10,2; 29,2]
1/H3ugyanazon a példányon a LoRA nélküli forgalom változatlancáfolta LoRA-támogatás kernelt vált; ~6 % billenés, romlás nélkül
1/H5jobb kalibrációigazoltECE 0,043 → 0,010
2/H1eszközválasztás: az adapter veri a kalibrált alapmodelltcáfoltprecizitás-bukás (0,83–0,85); AURC az alapmodell javára
2/H2általánosít (BFCL-live + When2Call, magyar)formálisan „általánosít”a definíció nem köti precizitáshoz (9. fejezet); a 2/H1 nélkül nincs rá épülő állítás
2/H3veri a natív tool callingotigazolt+3,4 pont precizitás, +7,4 pont lefedettség; az előny zöme a kalibrált kiolvasásé
2/H4két adapter egy példányon, párhuzamosan isigazoltmind a négy feltétel a zaj-alapon belül
2/H5nincs irrelevancia-kompromisszumcáfoltX-fedés −8,9 [−11,4; −6,3]

Az 1. kör H4-e (lineáris szonda a rejtett állapoton: ér valamit, de az adapter alatt marad) és H6-ja (külön döntési fej, nem futott) a teljes protokollban szerepel.

11. fejezetKorlátok

  • Egy modell, egy kvantálás, egy motor, egy hardver. Hogy egy másik alapmodell hol gyenge, azt újra kell mérni.
  • Az 1. kör szintetikus adaton fut, egy generátorcsaládból; a valós ügyféladaton végzett igazolás külön történik. Az „egyik sem” esetek zöme ott konstrukció.
  • Az előny mérete a valós „egyik sem” aránytól függ (1. kör: 25 % X mellett +13,7, 10 %-nál +3,5 pont).
  • A 2. kör magyar címkéinek maradék zaja felső korlátban 2,4 %, az előre rögzített 2 %-os kapu fölött.
  • A JEV-összevetés eltérő keretben fut (négy válaszmód vs. eszközlista + X), ugyanazokon az itemeken; a JEV-modelleket nem futtattuk, a közzétett valószínűségeikkel számoltunk.
  • A mechanizmus-bontások utólagosak (6. fejezet): magyaráznak, ítéletet nem változtatnak.
  • A teljesítményszámok egy-egy példányon, egy futásból származnak.

12. fejezetDöntés és ami jön

Az előre rögzített publikálási szabály szerint az 1. kör adaptere és adatkészlete publikus, a 2. köré közül csak az adatkészlet és a mérés: a 2. kör adaptere nem kerül ki. A kitartott teszten a kalibrált alapmodell jobb vagy egyenlő, és aki letöltené, rosszabbul járna vele, mint az alapmodell gondos kiolvasásával. Az eszközválasztáshoz a DocAI-ban a kalibrált kiolvasás megy tovább, adapter nélkül.

A következő kör egy általános magyar döntési adapter sok feladatcsaládon. Abba ez a mérés négy szabályt visz:

  • Csak ott tanítunk, ahol az alapmodell gyenge. Ahol a kalibrált alapmodell a plafon közelében van, az a család csak kis arányban kerül a tanításba.
  • Az „egyik sem” többféle típusa a tanításban, nem csak kényszerített: természetes megválaszolhatatlan, hatókörön kívüli kérés közeli opciókkal, hiányzó feltétel.
  • Horgony az alapmodellhez az „egyik sem” eseteken, mert a hívás/nem hívás szétválasztásában a kalibrált alapmodell volt a legjobb.
  • Küszöb a célforgalom eloszlásán, mert a val-on választott küszöb egyik karnál sem vitte át a 95 %-ot egy más típusú tesztre.
Mit jelent ez a DocAI-ban

A számlasorok cikkhez rendelésében a döntési adapter valódi nyereség: több sor könyvelődik automatikusan, kisebb kockázattal, és a gép tudja, mikor kell emberhez fordulnia. Az eszközválasztásban ugyanez a lépés felesleges, sőt árt: ott a kiszolgált modell gondosan kalibrált valószínűségei a jobb megoldás. A tanulság általánosabb a két feladatnál: finomhangolás előtt meg kell mérni, hol gyenge az alapmodell, és a tanításnak pont azt az „egyik sem” esetet kell mutatnia, amivel élesben találkozik.

MellékletApparátus

1. kör (számlasor → cikk): adapter Qwen3.6-35B-A3B-invoice-decision-lora, adatkészlet hu-invoice-catalog-decisions (Hugging Face; az adapter Apache-2.0, az adatkészlet CC-BY-4.0), a kiszolgálási megjegyzéssel a model cardon.
Mérési csomag (mindkét kör protokollja, kódja, eredménylapjai és itemenkénti kiolvasásai, a JEV-összevetés, valamint egy ellenőrző szkript, amely a közölt számokat a kiolvasásokból újraszámolja): docai-evals → 2026-10-09-decision-lora-where-to-train-gb10.
Protokollok: az előregisztrált runbookok és a naplók (magyarul) ugyanott, a protocol/ alatt.
Külső források: autotrust/JEV-27B és jev-decision-index-results (Apache-2.0); a Decision Index kit (apolinario/decision-index, MIT); xLAM (APIGen, arXiv:2406.18518), When2Call, BFCL, MASSIVE; a Hammer-cikk (arXiv:2410.04587) az irrelevancia-kompromisszumról.
Rövid változat: a blogon, Hol érdemes tanítani a modellt?