Kutatás

Amit megmértünk, és amit nem hozott ki a mérés

Hosszabb, hivatkozható kutatási jelentések a DocAI mögül: rögzített korpusz, előre kimondott hipotézisek, konfidencia-intervallumok és korlát-fejezet. Ami a blogon 7 perc, az itt a teljes módszertan — a negatív eredményekkel együtt.

Kutatási jelentés · Kiss Dániel · · ~40 perc

Hol lakik a tudás?

Nyelvfüggetlen-e egy többnyelvű LLM tudása, vagy angolon keresztül fordít? 70 item három nyelven, logit lens, tuned lens és egy 64 ezer feature-ös sparse autoencoder a Qwen3.5-9B mind a 32 rétegén. Lexikális angol közvetítésre nincs pozitív evidencia, nyelvfüggetlen jelentés-közelségre van — a három nyelv viszont nem egyenrangú, és a csak a magyar Wikipédián dokumentált tények a base modellen, saját nyelven 7% (n = 15). Feltáró mérés, egy modellcsaládon.

Olvasás
Kutatási jelentés · Kiss Dániel · · ~23 perc

Mit ad hozzá egy LoRA a jó promptoláshoz?

Egy stílus-adapter valódi ellenfele nem a nyers modell, hanem ugyanaz a modell gondos prompttal és egy determinisztikus utószűrővel. Megmértük mindkettőt magyar kötött formájú versen, közkincs korpuszon. Formában a szűrő nyer, minden tengelyen, harmadannyi kitalált szóval — stílusban viszont nem mozdít (56,4% → 56,0%), azt kizárólag a tanítás hozza: 56% → 92%, memorizáció nélkül.

Olvasás