Prečo sa detektorom AI textu v češtine a slovenčine darí horšie než v angličtine
Detektory sa učia hlavne na angličtine, takže v češtine a slovenčine pracujú s menšou a menej zastúpenou vzorkou. Voľný slovosled a skloňovanie navyše rozmelňujú signály, na ktorých detekcia stojí. Výsledok v týchto jazykoch preto berte ako slabšiu nápovedu než ten istý výsledok v angličtine.
Menší korpus, menej istoty
Modely, na ktorých detektory stoja, videli rádovo viac anglického textu. Čeština a slovenčina sú pre ne menšinové jazyky a rozhodovacia hranica v nich sedí voľnejšie.
Prakticky to znamená širšiu sivú zónu — viac textov skončí niekde medzi jasne ľudským a jasne strojovým.
Voľný slovosled rozmelňuje signál
Detekcia veľa stavia na tom, aké predvídateľné je ďalšie slovo. Angličtina má pevný poriadok slov, takže predvídateľnosť je dobre merateľná. V češtine a slovenčine môžete rovnakú vetu poskladať piatimi spôsobmi bez toho, aby sa zmenil význam.
Model potom vidí menší rozdiel medzi písaním človeka a modelu, než aký v skutočnosti je.
Čo s tým robiť v praxi
Nepracujte s jedným číslom. Pozrite sa na označené vety a prečítajte si ich nahlas — kostrbatý rytmus a šablónovité obraty spoznáte sami.
Pri dlhších prácach kontrolujte po kapitolách. Priemer za sto strán zakryje presne to miesto, ktoré vás zaujíma.
Časté otázky
Je detekcia v češtine a slovenčine na niečo?
Áno, ako podklad pre rozhovor. Nie je to dôkaz a v týchto jazykoch to platí ešte viac než v angličtine.
Pomôže, keď text preložím do angličtiny?
Nepomôže. Prekladom sa zmení stavba viet a výsledok potom vypovedá o preklade, nie o pôvodnom texte.
Zohľadňuje DetekceGPT češtinu a slovenčinu?
Vlastná štýlová vrstva počíta aj s vecami typickými pre oba jazyky, napríklad s podielom diakritiky a početnosťou domácich funkčných slov. Ktorý z jazykov text je, si nástroj rozpozná sám.
Skúste to na vlastnom texte
Vložte text alebo nahrajte súbor a pozrite sa na skóre aj na konkrétne vety, ktoré vyšli podozrivo.
Spustiť detekciu