Niektoré štatistické charakteristiky slovenčiny
Na vzorke textu s 940 903 znakmi bez medzery, resp. s medzerou 1 109 841 znakmi (t.j. medzera mala 15% pravdepodobnosť výskytu), boli vykonané niektoré experimentálne merania frekvenčných charakteristík. Korpus (tj. súbor textov určených na štatistickú analýzu) mal simulovať modernizovanú náhodnú zmes, preto bol zložený z novinových článkov, informatických textov a klasickej slovenskej literatúry. Niektoré z nameraných štatistík užitočné pre lúštenie sú zhrnuté tu (Q, W, X sa vynechali, tieto sú v globále extrémne zriedkavé, aj keď v niektorých textoch sa správajú podobne ako F, G): TSA (Telegrafná slovenská abeceda) % 11 9 7 6 5 5 4 4 3 3 2 2 0 TSA: A O,E/I/N,S,T/ R L,D/V,K,U M,C/P,Z H/ Y,J,B/ F,G V rámci skupín znaky často menia poradie. % 12 9 8 7 ...