Ako to funguje

Prečo sa detektorom AI textu v češtine a slovenčine darí horšie než v angličtine

Detektory sa učia hlavne na angličtine, takže v češtine a slovenčine pracujú s menšou a menej zastúpenou vzorkou. Voľný slovosled a skloňovanie navyše rozmelňujú signály, na ktorých detekcia stojí. Výsledok v týchto jazykoch preto berte ako slabšiu nápovedu než ten istý výsledok v angličtine.

Menší korpus, menej istoty

Modely, na ktorých detektory stoja, videli rádovo viac anglického textu. Čeština a slovenčina sú pre ne menšinové jazyky a rozhodovacia hranica v nich sedí voľnejšie.

Prakticky to znamená širšiu sivú zónu — viac textov skončí niekde medzi jasne ľudským a jasne strojovým.

Voľný slovosled rozmelňuje signál

Detekcia veľa stavia na tom, aké predvídateľné je ďalšie slovo. Angličtina má pevný poriadok slov, takže predvídateľnosť je dobre merateľná. V češtine a slovenčine môžete rovnakú vetu poskladať piatimi spôsobmi bez toho, aby sa zmenil význam.

Model potom vidí menší rozdiel medzi písaním človeka a modelu, než aký v skutočnosti je.

Čo s tým robiť v praxi

Nepracujte s jedným číslom. Pozrite sa na označené vety a prečítajte si ich nahlas — kostrbatý rytmus a šablónovité obraty spoznáte sami.

Pri dlhších prácach kontrolujte po kapitolách. Priemer za sto strán zakryje presne to miesto, ktoré vás zaujíma.

Časté otázky

Je detekcia v češtine a slovenčine na niečo?

Áno, ako podklad pre rozhovor. Nie je to dôkaz a v týchto jazykoch to platí ešte viac než v angličtine.

Pomôže, keď text preložím do angličtiny?

Nepomôže. Prekladom sa zmení stavba viet a výsledok potom vypovedá o preklade, nie o pôvodnom texte.

Zohľadňuje DetekceGPT češtinu a slovenčinu?

Vlastná štýlová vrstva počíta aj s vecami typickými pre oba jazyky, napríklad s podielom diakritiky a početnosťou domácich funkčných slov. Ktorý z jazykov text je, si nástroj rozpozná sám.

Skúste to na vlastnom texte

Vložte text alebo nahrajte súbor a pozrite sa na skóre aj na konkrétne vety, ktoré vyšli podozrivo.

Spustiť detekciu

Ďalšie články