Jak to funguje

Proč se detektorům AI textu v češtině daří hůř než v angličtině

Detektory se učí hlavně na angličtině, takže v češtině pracují s menším a méně zastoupeným vzorkem. Volný slovosled a skloňování navíc rozmělňují signály, na kterých detekce stojí. Výsledek v češtině proto berte jako slabší nápovědu než ten samý výsledek v angličtině.

Menší korpus, méně jistoty

Modely, na kterých detektory stojí, viděly řádově víc anglického textu. Čeština je pro ně menšinový jazyk a rozhodovací hranice v ní sedí volněji.

Prakticky to znamená širší šedou zónu — víc textů skončí někde mezi jasně lidským a jasně strojovým.

Volný slovosled rozmělňuje signál

Detekce hodně staví na tom, jak předvídatelné je další slovo. Angličtina má pevný pořádek slov, takže předvídatelnost je dobře měřitelná. V češtině můžete stejnou větu poskládat pěti způsoby, aniž by se změnil význam.

Model pak vidí menší rozdíl mezi psaním člověka a modelu, než jaký ve skutečnosti je.

Co s tím dělat v praxi

Nepracujte s jedním číslem. Podívejte se na označené věty a přečtěte si je nahlas — kostrbatý rytmus a šablonovité obraty poznáte sami.

U delších prací kontrolujte po kapitolách. Průměr za sto stran zakryje přesně to místo, které vás zajímá.

Časté dotazy

Je detekce v češtině k něčemu?

Ano, jako podklad pro rozhovor. Není to důkaz a v češtině to platí ještě víc než v angličtině.

Pomůže, když text přeložím do angličtiny?

Nepomůže. Překladem se změní stavba vět a výsledek pak vypovídá o překladu, ne o původním textu.

Zohledňuje DetekceGPT češtinu?

Vlastní stylová vrstva počítá i s věcmi typickými pro češtinu, například s podílem diakritiky a četností českých funkčních slov.

Zkuste to na vlastním textu

Vložte text nebo nahrajte soubor a podívejte se na skóre i na konkrétní věty, které vyšly podezřele.

Spustit detekci

Další články