Proč se detektorům AI textu v češtině daří hůř než v angličtině
Detektory se učí hlavně na angličtině, takže v češtině pracují s menším a méně zastoupeným vzorkem. Volný slovosled a skloňování navíc rozmělňují signály, na kterých detekce stojí. Výsledek v češtině proto berte jako slabší nápovědu než ten samý výsledek v angličtině.
Menší korpus, méně jistoty
Modely, na kterých detektory stojí, viděly řádově víc anglického textu. Čeština je pro ně menšinový jazyk a rozhodovací hranice v ní sedí volněji.
Prakticky to znamená širší šedou zónu — víc textů skončí někde mezi jasně lidským a jasně strojovým.
Volný slovosled rozmělňuje signál
Detekce hodně staví na tom, jak předvídatelné je další slovo. Angličtina má pevný pořádek slov, takže předvídatelnost je dobře měřitelná. V češtině můžete stejnou větu poskládat pěti způsoby, aniž by se změnil význam.
Model pak vidí menší rozdíl mezi psaním člověka a modelu, než jaký ve skutečnosti je.
Co s tím dělat v praxi
Nepracujte s jedním číslem. Podívejte se na označené věty a přečtěte si je nahlas — kostrbatý rytmus a šablonovité obraty poznáte sami.
U delších prací kontrolujte po kapitolách. Průměr za sto stran zakryje přesně to místo, které vás zajímá.
Časté dotazy
Je detekce v češtině k něčemu?
Ano, jako podklad pro rozhovor. Není to důkaz a v češtině to platí ještě víc než v angličtině.
Pomůže, když text přeložím do angličtiny?
Nepomůže. Překladem se změní stavba vět a výsledek pak vypovídá o překladu, ne o původním textu.
Zohledňuje DetekceGPT češtinu?
Vlastní stylová vrstva počítá i s věcmi typickými pro češtinu, například s podílem diakritiky a četností českých funkčních slov.
Zkuste to na vlastním textu
Vložte text nebo nahrajte soubor a podívejte se na skóre i na konkrétní věty, které vyšly podezřele.
Spustit detekci