Vissza a Kutatás rovathoz

Kutatási jelentés

Mennyit szabad elvenni egy tokenosztálytól?

Egy magyar dokumentum-ügynök sampling mellett néha kínai kötőszavakra váltott. A javítás ismert: a kimeneti mátrix kínai sorait le kell skálázni. Ez a mérés azt kérdezi, amit előtte senki nem mért meg: mennyit szabad elvenni, és mi az ára — magyarul és kínaiul. Tizenkét kar, hat műszer, előregisztrált protokoll, és három lelet, ami menet közben magát a protokollt írta át.

Modell
Qwen3.6-35B-A3B-FP8
Karok
12 · egyetlen tenzor
Műszerek
6 · 3 publikus
Hardver
NVIDIA GB10 · vLLM
A rövid válasz

A Qwen3.6-35B-A3B-FP8 kimeneti mátrixának (lm_head) 55 424 kínai írásjegyes sorát skáláztuk le 0,9-től 0,1-ig, két beavatkozási formában és két maszkkal, és minden kart hat műszeren mértünk. A dózis-hatás nem görbe, hanem két lépcső: a kínai képesség 0,7-ig érintetlen (36/36), 0,6-nál már 55,6 %, 0,5-nél 2,8 %; a magyar szövegbe csúszó kínai kockázata a termelési sampling-úton 0,8-tól lefelé exact nulla, 0,9-nél még szivárog. Az S = 0,7 az egyetlen dózis, ahol mindkét oldal rendben van — a költség-lépcső szélén, a haszon-lépcsőtől egy lépéssel beljebb. A magyar költség konstrukcióból nulla: a folt csak kínai sorok logitját változtatja, azok magyar szövegen soha nem argmaxok, ezért a folt greedy magyar kimenete bájtra azonos az azonos példány-módú kontrolléval a 150 itemes csapdakorpuszon (nyolc folton mérve, háromnál levezetve). A költség egésze a kínain van. Az irány-alapú sorcsere nem olcsóbb, a koreai mintájú finomított maszk mindkét tengelyen rosszabb. És a legkellemetlenebb lelet: a temperature 0,3-ra csökkentése — az addigi tűzoltás — nem véd: a tényleges sampling-tartón a kontroll 0,3-on 392/M kockázatot és valódi kínai tokeneket ad, mert a presence penalty a temperature-osztás előtt hat, és alacsony temperature mellett erősebb. A mérőműszer háromszor bizonyult hibásnak (batch size, kiszolgáló-példány, nyers top-20), mielőtt a modell egyszer is.

kérdésítéletmire épül
Dózis · van-e erősség, ahol a kockázat nulla, de a képesség ép? Van: S = 0,7. kínai 36/36 S ≥ 0,7-ig, 20/36 0,6-nál; Han-kockázat exact 0 S ≤ 0,8-nál, 16,9/M S = 0,9-nél t=0,8-on
Forma · olcsóbb-e az irány-alapú csere? Nem. α = 0,5 már 0/36 kínai; a mechanizmusa igaz (nyers tömeg exact 0), az ára nem kisebb
Maszk · megtartja-e a kínait a koreai mintájú finomítás? Nem, és a kockázatot sem nullázza. S05F: 19,4 % kínai, 11,3/M t=1,0-n; A200F: 2,8 %, valódi Han a válaszban
Magyar ár · fizetünk-e erős dózisnál? Nem — konstrukcióból. 150/150 item bájtra azonos az azonos módú kontrollal nyolc folton, S = 0,1-nél is (S08, S06, A050 módjában nincs kontrollmérés); a nem-célnyelvi költség felülről korlátos a nem-célnyelvi kockázattal

Minden állítás egy modellen, egy kvantáláson, egy motoron mért. A korlátok a 9. fejezetben; a teljes eredménylap és minden kimenet a mellékletben.

Miért mértem meg

A DocAI éjszakai ügynöki futásai magyar számlákon és szerződéseken dolgoznak, samplinggel (temperature 0,6, presence_penalty 1,5), mert a beragadt gondolatmenetekből változatosság nélkül nem lehet kijönni. Ebben az üzemmódban a modell néha — egy-két token erejéig — kínaira váltott. Két reflex volt: leszállítani a temperature-t 0,3-ra (ezt megtettük), és átírni a kimeneti mátrixot egy ismert recept szerint (ezt egyszer, egyetlen erősséggel kipróbáltuk, és működött). Ami hiányzott: a szám. Hol az optimum, mibe kerül, és jó formájú-e a beavatkozás. Erre készült ez a kör — és közben kiderült, hogy a tűzoltás sem az volt, aminek hittük.

1. fejezetA kérdés: dózis és forma

A kutatási kérdés a protokollban így áll: egy nyelvi modell kimeneti mátrixában egy tokenosztály elnyomása megszünteti a nem kívánt nyelvváltást — mennyit szabad elvenni, mielőtt fizetünk érte, és melyik beavatkozási forma fizet kevesebbet ugyanazért a haszonért? Két alkérdés, külön mérve:

  • (A) Dózis. Van-e olyan erősség, ahol a kockázat már nulla, de a képesség még sértetlen — és hol?
  • (B) Forma. Ugyanazért a kockázat-nulláért a szorzás vagy az irány-alapú csere fizet kevesebbet, magyarul és kínaiul?

A hipotéziseket (H1–H6), a cáfolati kritériumokat, az elsődleges végpontokat, a statisztikai eljárást és a publikálási döntési szabályt 2026. szeptember 15-én rögzítettük, mielőtt egyetlen kar lefutott volna. Ami menet közben változott, az dátummal és okkal a protokoll naplójába került — ebből a naplóból lett a 7. fejezet.

2. fejezetA beavatkozás és a tizenkét kar

1 · hol dől el, melyik token jön ki a modellből
Négy lépés: a rejtett állapot, az lm_head mátrix soronként egy tokennel, a logitok, majd a softmax és a temperature. A beavatkozás a mátrix kínai sorait skálázza.
Az lm_head egy szótár, soronként egy tokennel: egy sor és a rejtett állapot skalárszorzata a token pontszáma. A beavatkozás ezekből a sorokból 55 424-et érint — azokat, amelyek dekódolt szövege kínai írásjegyet vagy CJK írásjelet tartalmaz. A modell belső működéséhez nem nyúl.

Két forma versenyzett. A szorzás (Wi := S·Wi, a smoothie-qwen receptje) a célsorokat egy 1-nél kisebb számmal szorozza. Az irány-alapú csere (Wi := −α·μh/‖μh‖², a ThakiCloud koreai munkájából) a célsorokat a célnyelven mért átlagos rejtett állapot ellenirányába állítja: a token pontszáma nem arányosan csökken, hanem egy negatív szintre kerül, a korábbi előjeltől függetlenül. A μh-t 30 szintetikus magyar promptválasz-páron mértük; egy független 30-as halmazon az irány koszinusza 0,889, tehát nem a próbahalmaz műterméke.

Két maszk. A nyers maszk a smoothie-qwen Unicode-tartományai szerint minden CJK-tartalmú token (55 424). A finomított maszk a koreai munka mintájára készült: kana, csak-egyszerűsített karakterek és legalább kétkarakteres tisztán írásjegyes tokenek (54 939), és meghagy 3 964 gyakori egykarakteres írásjegyet — koreaiul ez a zárójeles hanja-használat miatt kell.

karformamaszkparaméterszerep
K0a változatlan alapmodell
S09 S08 S07 S06 S05 S03 S01szorzásnyersS = 0,9…0,1a dózis-sor (S05 a korábbi kör foltja)
A200 A050iránynyersα = 2,0 / 0,5a forma-kérdés (H2)
S05F A200Fszorzás / irányfinomított0,5 / 2,0a maszk-kérdés (H3, H4)

Minden kar egyetlen tenzor átírása: az FP8-ra kvantált súlyokhoz hozzá sem nyúltunk, a checkpoint 55 fájljából 54 bájtra azonos az alappal, és minden kart egy 507 ellenőrzéses igazoló nézett át fájl-, tenzor- és sorszinten a mérés előtt. A S07 publikált változata a Hugging Face-en a Qwen3.6-35B-A3B-FP8-cjk-damped-S07.

3. fejezetA műszerek és a protokoll

műszermit mérnpublikus
Han-szonda (haszon) a várható kínai tokenszám millió generált pozícióra: minden pozíción a top-20 logprobból a kínai jelöltek össztömege a termelési sampling-lánc után (t 0,6/0,8/1,0, top_p 0,95, top_k 20, presence 1,5, repetition 1,05), válaszonkénti bootstrap CI 3 magyar ügynöki nyomvonal (13–19 ezer token), 3–5 ismétlés × 3 temperature-érték nem (ügyféladat); az aggregátumok igen
Csapdakorpusz (költség → negatív kontroll) item-szintű átmenési arány 150 kinyerési és ítéleti feladaton, 16 szintetikus magyar iraton (50 régi + 100 valódi hibaosztályokból írt), greedy 150 item, sorosan igen
Kínai próba (költség) 36 rövid kínai feladat 7 kategóriában (chengyu, mértékszó, ellentét, egyszerűsített–hagyományos, osztályozás…), pontos egyezés; plusz: a válaszok hány százalékában nincs egyetlen kínai írásjegy sem 36 item, greedy igen
Előjel-csapda a célsorok nyers és csonkolt softmax-tömege a magyar átlagállapoton, karonként offline igen
belső KIE és szerződéskinyerés megerősítő műszerek; a publikálási szabály 3. feltétele 34 + 30 irat nem

A statisztika előre rögzítve: arányokra Wilson-intervallum, karok párosított összevetésére McNemar (kis n-nél exact), a nyolc (később tizenegy) kontroll-ellenes összevetésre Holm-korrekció, a nem-inferioritási margó −2 item a 150-es skálán. A nulla esemény önmagában nem eredmény: minden „exact nulla” mellett ott a megfigyelt eseményszámra épített Poisson felső korlát is. Négy kapu volt: az F0 (a kontroll hozza-e a korábbi kört), az F1 (a pilot validálja-e a protokollt), az F2 (azonosítható-e S*) és az F3 (a győztes megerősítése) — és mindegyiknél el lehetett volna állni.

4. fejezetEredmény: két lépcső, nem görbe

4 · a szorzásos dózis-sor két tengelyen
Fent: a kínai próba helyes válaszainak aránya karonként: K0, S09, S08, S07 100 százalék, S06 55,6, S05 2,8, S03 és S01 0. Lent: a magyar Han-kockázat rácsa három temperatureen: a K0 5,5, 105 és 220 per millió; S09 exact nulla, 16,9 és 3,3; S08 exact nulla, exact nulla és 1,6; S07-től lefelé minden cella exact nulla. A költség-lépcső 0,7 és 0,6 között, a haszon-lépcső 0,9 és 0,8 között.
Nyolc kar a szorzásos formán. A kínai próba 36 itemen, greedy; a Han-kockázat a termelési sampling-úton, esemény/M válaszpozíció, a nyers top-20 módszerrel (ami alsó korlát — ld. a 6. fejezetet). Az irány-forma és a finomított maszk karjai a következő táblázatban.
karkínai próbaHan nélküli válaszHan t=0,6t=0,8t=1,0csapda 150
K036/360 %5,5/M [0; 10,8]105/M [21; 248]220/M [70; 444]145/150
S0936/360 %exact 016,9/M [2,1; 37,9]3,3/M [0; 8,7]145/150
S0836/360 %exact 0exact 01,6/M [0; 4,8]143/150
S0736/360 %exact 0exact 0exact 0145/150
S0620/36 = 55,6 %44 %exact 0exact 0exact 0143/150
S051/36 = 2,8 %97 %exact 0exact 0exact 0145/150
S030/36100 %exact 0exact 0exact 0145/150
S010/36100 %exact 0exact 0exact 0144/150
A2000/36100 %exact 0exact 0exact 0145/150
A0500/3697 %exact 0exact 0exact 0143/150
S05F7/36 = 19,4 %44 %exact 010,8/M [0; 23,2]11,3/M [0; 22,0]144/150
A200F1/36 = 2,8 %86 %4,3/M [0; 10,2]39,3/M [0; 104,8]2,6/M [0; 7,3]145/150

Mind a tizenkét lefuttatott kar; egyet sem hagytunk el. A kínai próba kontroll-ellenes McNemar p < 10−4 minden folton Holm után is, kivéve S07, S08, S09, ahol nincs diszkordáns pár. A csapda-oszlop a kiszolgáló-példányt méri, nem a kart (5. és 7. fejezet).

A költség egésze a kínain van, és szakadék, nem lejtő. Az S05-nél a modell nem „rosszabbul tud kínaiul”: a válaszok 97 %-ában egyetlen kínai írásjegy sincs — nem tud megszólalni. S07-nél a próba érintetlen. A lépcső tehát 0,7 és 0,6 között van, és S07 közvetlenül a szélén ül, lefelé tartalék nélkül. A haszon-lépcső a másik oldalon: S09 t=0,8-on már a termelési úton szivárog, S08 csak t=1,0-n mutat 1,6/M-et. Az ablak létezik, és egy dózis van benne.

Az irány-forma nem olcsóbb. A mechanizmusa igazolódott: az előjel-csapda mérés szerint a nyers kínai tömeget pontosan nullára viszi, míg a szorzás a nyers tömeget növeli (10,5 % → 13,4 % S07-nél → 16,1 % S05-nél t=1,0-n), mert a célsorok 96,4 %-ának negatív a logitja, és a 0-hoz közelítés felfelé visz. De az α = 0,5 is leöli a kínait (0/36). A szorzás nullái a top_k=20 csonkolás termékei — a folt csak csonkoló samplerrel hatásos, és ez a model card kötelező mondata.

A finomított maszk mindkét irányban elbukik. A meghagyott 3 964 gyakori írásjegy a kínait nem tartja használható szinten (19,4 %, a válaszok fele Han-mentes), a kockázatot viszont nem nullázza (S05F t=1,0-n 11,3/M; A200F már a termelési úton 4,3/M, és t=0,8-on egy valódi kínai token a válaszban). Amit koreaiul meg kell tartani, azt magyarul el lehet dobni — és el is kell.

5. fejezetA magyar költség: egy nullműszer

A protokoll elsődleges költség-végpontja a 150 itemes magyar csapdakorpusz volt. Az első három kar után kiderült, hogy ez a műszer erre a beavatkozásra vak — konstrukcióból. A folt kizárólag a kínai sorok logitját változtatja. Magyar szövegen ezek soha nem argmaxok: a szorzás a negatív logitokat nulla felé tolja, az irány-csere −α körüli szintre állítja, mindkettő messze a tipikus +15…30-as csúcs alatt. A greedy kimenet tehát bitre ugyanaz. Sampling alatt is csak ott térhet el, ahol egy kínai token benne van a csonkolt tartóban — vagyis pontosan azokon a pozíciókon, amelyek maguk a kockázat.

A nem-célnyelvi költség felülről korlátos a nem-célnyelvi kockázattal. Ha a folt egy magyar pozíción változtatna a kimeneten, ott a kontroll kínait tudott volna írni.

Ezt nyolc folt bájtra igazolta: a 150 item greedy kimenete azonos a vele azonos kiszolgáló-példány-módban futó kontrolléval — S = 0,1-nél is. Három kar (S08, S06, A050) olyan módba esett, amelyben kontrollmérés nincs; ott a tulajdonság levezetett, nem mért (az S08 és az S06 egymással bájtra azonos). A H1 („erős dózisnál fizetünk magyarul”) tehát minden dózisra cáfolva, és a csapdakorpusz szerepe megváltozott: nem költségmérő, hanem negatív kontroll, amely azt bizonyítja, hogy a mérés nem lát fantomhatást. Ez a protokoll naplójában dátummal áll; a költség tengelye a kínai próba lett.

Ugyanez a tulajdonság a Han-szondán is megjelent, meglepő formában: a motor rögzített seeddel fut, és ha egyetlen pozíción sincs kínai a top-20-ban, a csonkolt-újranormált eloszlás minden S-karon ugyanaz — az S07 és az S03 mind a 27, sampling alatt bejárt trajektóriája karakterre azonos. A folt ott és csak ott hat, ahol a kínai a tartóban lenne; máshol a modell viselkedése a dózistól függetlenül ugyanaz.

6. fejezetA tényleges tartó és a tűzoltás

A 4. fejezet kockázatszámai a rögzített nyers top-20 logprobra alkalmazzák a sampling-láncot. A vLLM viszont a penaltyket a top-k előtt alkalmazza: a presence_penalty=1,5 a már látott tokeneket lenyomja, és a nyersen 21. vagy hátrébb álló jelölt bejuthat a tényleges top-20-ba — a számítás ezt nem látja. Az előjel-csapda miatt az S-karoknál épp a kínai tokenek másznak felfelé. Az „exact nulla” tehát a nyers top-20-ra volt bizonyított, a tényleges tartóra nem. Ezért az F3-ban a kiszolgálót processed_logprobs módban futtattuk: a visszaadott top-20 a penaltyk + temperature + top_k + top_p utáni eloszlás, és a kockázat lánc nélkül, közvetlenül összegezhető.

5 · E[Han] a tényleges sampling-tartón, K0 és S07, három termelési profilon
Vízszintes oszlopok: K0 t=0,3 392,4 per millió és 4 valódi kínai token a válaszokban; K0 t=0,9 retry-út 306,1 és 3 valódi; K0 t=0,6 73,4, a nyers módszer szerint 5,5 lett volna; S07 t=0,9 0,45 nem exact nulla, 0 esemény; S07 t=0,6 és t=0,3 exact nulla.
Három eset × 5 seed profilonként. A „mai éles állapot” a 0,3-as temperature, amire tűzoltásként álltunk át; a cél a 0,6-os üzem visszaállítása; a 0,9-es út a hurok-gyanú esetén egyszer lefutó perturbált újrahívás (top_p 1,0, presence 1,8).

Két korrekció jött ki belőle. Az első: a nyers módszer a kontroll kockázatát nagyságrendileg alulbecsülte (K0 @ 0,6: 5,5/M és 12/M nyersen → 73,4/M [14,9; 148,1] a tényleges tartón; ez pontbecslések hányadosa három esetből, nem mért szorzó). A 4. fejezet K0-számai alsó korlátok; a foltok exact nullái viszont a tényleges tartón is állnak — egy kivétellel: az S07 a retry-úton 0,45/M [0,04; 1,17], megfigyelt esemény nélkül. Ez egy kínai token 2,2 millió retry-pozíciónként, és a retry maga ritka; de nem exact nulla, és így írjuk le. Ráadásul alsó korlát: top_p = 1,0 mellett a top-k határán álló holtversenyek bent maradnak, így a pozíciók ~4 %-án a tényleges tartó 20-nál nagyobb, mint amit a rögzített top-20 lát.

A második a kellemetlen: a 0,3-as temperature nem véd. A tényleges tartón a kontroll 0,3-on 392/M, és 7 869 válaszpozíción 4 valódi kínai token — több, mint 0,6-on. A mechanizmus a sampler műveleti sorrendjében van: a presence penalty a logitra kerül, mielőtt a temperature-rel osztanánk, tehát alacsony temperatureen a presence penalty a skálázott térben erősebb (1,5/0,3 = 5), több helyet nyit a top-20-ban, és oda kínai jelölt ül be. Az n kicsi (három eset), a CI a nullát is tartalmazza — de a négy esemény valódi, és a „leszállítottuk a temperature-t, most jó” érzet ezzel megszűnt.

A megerősítés a sima, termelés-azonos motoron: három friss S07-példány, 15 seed, három profil, egy háromszálas párhuzamos batch, és a 150 irat a termelési sampling-profilon (~249 000 pozíció) — egyetlen kínai token sem, sehol, sem a gondolkodásban, sem a válaszban. A kontroll ugyanezeken a seedeken 65-öt generált. És a trajektóriák: K0 és S07 útja t=0,3-on 15/15 azonos, 0,6-on 13/15 — a két eltérő éppen az, ahol a kontroll kínait húzott.

Utólagos önellenőrzés (2026-09-20). A kockázatszámító csak a végső válasszal záruló rekordokat nézi; az eszközhívással záruló köröket és az elszabadult generálásokat gondolkodásostul kihagyja. Minden rekordot újraszámolva az S07 továbbra is nulla generált kínai token ~1,09 millió különböző pozíción (Poisson 95 % felső korlát: < 2,8/M) — a kontroll viszont az retry-profilon egyetlen elszabadult generálásban 6 593 kínai tokent írt, amit az eredeti tábla nem látott. És amit a folt nem old meg: ugyanazon a seeden az S07 is elszabadult (a 65 536 tokenes plafonig, kínai nélkül). A t=0,9 / top_p=1,0 profil 15 futásból 2-ben degenerál, folttal vagy anélkül; a folt a kínai tokent veszi el, a szósalátát nem.

7. fejezetAmit a mérés közben elrontottunk

A korábbi kör legértékesebb része a törött mérőműszer és a visszavont javulás volt. Ez a kör négy ilyet hozott, és mindegyiket a kapuk fogták meg — egyet a felhasználó.

A csendben véletlenszerű szakértők. A μh első becslése transformers-szel töltötte be az FP8-checkpointot; a MoE szakértősúlyok elrendezése nem egyezett, és mind a 40 réteg összes szakértője véletlenszerűen inicializálódott — a betöltés és az akkori önteszt hibátlannak látszott. Átállás vLLM poolingra, és egy tanári kényszerítéses önteszt (top-1 66 %) a kimenet előtt.

A batch size átbillenti a greedy kimenetet. A csapdát hat itemmel párhuzamosítottuk, és a beépített kapu — 12 item sorosan, bájtra összevetve — megbukott: a T7-08 párhuzamosan 3/3 átment, sorosan 3/3 elbukott. Nem zaj, hanem feltételhatás, épp akkora, mint a mérni kívánt. Soros mérés lett belőle, ami nem került többe, mert a soros dekódolás egy példányon belül bitre reprodukálható (150/150 item, 3 ismétlés), és az ismétlés elhagyható.

A kiszolgáló-példány is átbillenti. A friss példányon újramért kontroll 5/150 item PASS/FAIL-jében tért el az előzőtől; 16 indításból legalább öt diszkrét numerika-mód jött ki, és az azonos módú példányok bájtra reprodukálják egymást (két különböző kar csapdája és belső KIE-száma számjegyre azonos, ha egy módba estek). A karok összevetése mindig két példány között történik, tehát ez a zaj minden összevetésben benne van — a nullműszer-tulajdonság menti meg: a folt a magyar greedy kimenetet nem érinti, ezért bármely eltérés a kontrolltól a példányt azonosítja, nem a kart. A vLLM batch-invariáns módja (VLLM_BATCH_INVARIANT=1 + TRITON_ATTN) két friss példányon 17/17 és a batch size-zal szemben is bájtra azonosnak bizonyult, ~12 % lassulással; motorváltás lévén a kör a sima motoron maradt, és ezt is naplóztuk.

A nyers top-20 nem a tényleges tartó. Ezt a 6. fejezet mondja el; a protokoll fejléce „alsó korlátnak” jelölte, de a prod-döntésre nézve alulértékeltük, amíg a kör vezetője rá nem mutatott, hogy a vLLM a presence penaltyt a top-k előtt alkalmazza. A javítás egy motorkapcsoló és tizenkét sor a kockázatszámítóban; az eredmény a kör legfontosabb üzleti lelete.

Három mérőműszer-hiba egy modellhiba előtt. A modellről szóló állítások mindegyike túlélte; a műszerekről szólók közül egy sem maradt úgy, ahogy a protokoll indult.

8. fejezetA hipotézisek verdiktje

állítás (2026-09-15)verdiktalap
H1erős dózisnál fizetünk magyarulcáfolva, minden dózisra150/150 bájtra azonos S = 0,1-nél is; a költség egésze a kínain
H2az irány-csere mechanizmusa más, és olcsóbbmechanizmus igazolt, „olcsóbb” cáfolvanyers tömeg exact 0; A050 is 0/36 kínai
H3a finomított maszk megtartja a kínaitcáfolvaS05F 19,4 %, A200F 2,8 %
H4a finomított maszk is nullázza a kockázatotcáfolvaS05F 11,3/M t=1,0; A200F 4,3/M a prod-úton, valódi Han a válaszban
H5a kockázat a temperature-rel nőigazolt a kontrollon — de nem monoton, ld. 0,35,5 → 105 → 220/M (nyers); a tényleges tartón 0,3-on 392/M
H6a folt hatása a sampling-profiltól függigazoltaz S-karok nyers tömege nő; a nulla a top_k terméke; A200F t=0,8-on tényleges Han

9. fejezetKorlátok

  • Egy modell, egy kvantálás, egy motorbuild, egy hardver. A maszk a szótár függvénye; más modellre újra kell mérni, nem átvinni.
  • Csak kínai a költségoldalon. A kandzsi és a hanja ugyanabba a tartományba esik, a veszteség ott várhatóan ugyanekkora — de nem mértük.
  • Három ügyféladat-nyomvonal hordozza a magyar kockázatszámokat; a publikus ellenpár a 150 irat a termelési profilon, de ott a válasz rövid JSON, a pozíciók zöme a gondolkodásban van.
  • Példány-zaj. A greedy számok példányról példányra 2–5 itemet mozdulnak; a publikált csapda-számok sorosak, és a példányt mérik.
  • A nyers-módszeres kockázatszámok alsó korlátok; a kontroll a tényleges tartón ~10× rosszabb. Az S08-at nem mértük újra a tényleges tartón; 0,6 és 0,7 között nincs pont.
  • A Poisson-korlátok 300–1 100/M karonként: az exact nulla a pozíciónkénti tömegre épül, nem az eseményszámra.
  • Csonkoló sampler kell. Csonkolás nélkül az S-karok nyers kínai tömege nagyobb a kontrollénál.

10. fejezetDöntés és ami jön

A döntési szabályt az F3 adata előtt rögzítettük: a termelési próba akkor javasolható, ha az S07 kockázata a tényleges tartón 0,6-on nem nagyobb a mai éles állapoténál (K0 @ 0,3), a csapda a termelési profilon nem rosszabb, és három friss példányon nincs megfigyelt kínai token. Mindhárom teljesül: exact 0 a 392/M ellen; 146/150 a 146/150 ellen (pontban jobb: 194,5 vs 191,0, formátumsértés 0 vs 2); nulla esemény ~300 000 pozíción. Az S07 kis forgalmú, visszaállítható termelési próbára javasolt, 0,6-on, a kínai előfordulás és a feladatminőség követésével — és a mai 0,3-as állapot nem az a biztonságos hely, aminek látszott.

Ami nyitva maradt: az S08 a tényleges tartón (egy menet), a 0,6–0,7 közti pont a tanulmányhoz, a kandzsi/hanja mérése, és a batch-invariáns motor mint mérési út a következő körre.

Mit jelent ez a DocAI-ban

A magyar dokumentumfeldolgozás samplinggel futó útjai a csillapított modellel visszatérhetnek a 0,6-os üzemre, kínai kockázat nélkül és magyar ár nélkül. A tanulság általánosabb, mint a kínai: ha egy tokenosztállyal van baj, a kimeneti mátrix a legolcsóbb hely, ahol hozzá lehet nyúlni — de a dózist mérni kell, nem eltalálni, és a mérőműszert előbb kell kétségbe vonni, mint a modellt.

MellékletApparátus

Modell: Qwen3.6-35B-A3B-FP8-cjk-damped-S07 a Hugging Face-en, Apache-2.0, a teljes dózis-hatás táblázattal és a sampler-kitétellel a model cardon.
Mérési csomag (kód, szintetikus korpusz, kínai próba, minden kar kimenete a publikus műszereken, eredménylap, a példány-módok igazolásai): docai-evals → 2026-09-18-cjk-damping-dose-response-gb10.
Protokoll: az előregisztrált runbook és az F0–F3 jegyzőkönyvek (magyarul) ugyanott, a protocol/ alatt.
Előzmények: dnotitia/smoothie-qwen (a célosztály definíciója) és ThakiCloud/Qwen3.8-27B-ko-cjk-suppressed (irány-alapú csere, nyelvspecifikus maszk). Ami ez a kör hozzátett: a dózis-sor, a két forma és a két maszk egymás elleni mérése, a nullműszer-levezetés, és a tényleges sampling-tartón mért kockázat.
Rövid változat: a blogon, Kínai szavak a magyar válaszban.