-
Data: 2012-06-13 09:46:39
Temat: Re: Jak efektywnie stwierdzić czy tekst jest w UTF8?
Od: "Borneq" <b...@a...hidden.pl> szukaj wiadomości tego autora
[ pokaż wszystkie nagłówki ]Użytkownik "Borneq" <b...@a...hidden.pl> napisał w wiadomości
news:jr8els$en3$1@inews.gazeta.pl...
> Trenuję najpierw na tekstach otrzymując tabelkę 256 częstotliwości
Metoda zliczań częstotliwości jest bezradna gdy mamy stwierdzić czy tekst
jest w Unicode czy też w Uniocode z odwróceniem bajtów. Wtedy potrzebne
byłyby dwie tabelki - dla parzystych i nieparzystych bajtów. Ale przyjmijmy
że nie rozpoznajemy Unicode 16-bitowego lecz UTF-8.
Wtedy zamiast częstotliwości 256 znaków będziemy mieli częstotliwość 7-mio
bitowych i 8-io bitowych. Oba dzielą się na wystąpienia po 7-mio lub 8-io
bitowym znaku.
Ośmiobitowe należałoby podzielić na:
10xxxxxx
110xxxxx
1110xxxx
11110xxx
111110xx
1111110x
razem z 0xxxxxxx i 1111111x będzie 8 klas.
Czyli 64 gdy mamy wystąpienie po jakimś znaku. Choć to nie całkiem bo po
1111110x powinno być aż 5 razy 10xxxxxx
Następne wpisy z tego wątku
- 13.06.12 13:19 Paweł Kierski
- 13.06.12 14:18 voy
- 13.06.12 14:44 Borneq
- 13.06.12 20:31 Jordan Szubert
- 13.06.12 23:59 Borneq
- 14.06.12 01:09 Jordan Szubert
- 14.06.12 11:05 Borneq
Najnowsze wątki z tej grupy
- Arch. Prog. Nieuprzywilejowanych w pełnej wer. na nowej s. WWW energokod.pl
- 7. Raport Totaliztyczny: Sprawa Qt Group wer. 424
- TCL - problem z escape ostatniego \ w nawiasach {}
- Nauka i Praca Programisty C++ w III Rzeczy (pospolitej)
- testy-wyd-sort - Podsumowanie
- Tworzenie Programów Nieuprzywilejowanych Opartych Na Wtyczkach
- Do czego nadaje się QDockWidget z bibl. Qt?
- Bibl. Qt jest sztucznie ograniczona - jest nieprzydatna do celów komercyjnych
- Co sciaga kretynow
- AEiC 2024 - Ada-Europe conference - Deadlines Approaching
- Jakie są dobre zasady programowania programów opartych na wtyczkach?
- sprawdzanie słów kluczowych dot. zła
- Re: W czym sie teraz pisze programy??
- Re: (PDF) Surgical Pathology of Non-neoplastic Gastrointestinal Diseases by Lizhi Zhang
- CfC 28th Ada-Europe Int. Conf. Reliable Software Technologies
Najnowsze wątki
- 2024-12-30 Moduł BT BLE 5.0
- 2024-12-30 Łódź => Application Security Engineer <=
- 2024-12-30 Lublin => Inżynier bezpieczeństwa aplikacji <=
- 2024-12-30 Nowy Outlander PHEV w PL
- 2024-12-30 Warszawa => Key Account Manager <=
- 2024-12-30 Katowice => Key Account Manager (ERP) <=
- 2024-12-28 Śmiechu KOOOOOOPA ;-)
- 2024-12-29 Pomiar amplitudy w zegarku mechanicznym
- 2024-12-28 Antyradar
- 2024-12-28 Deweloper przegral w sadzie musi zwrócic pieniądze Posypia sie kolejne pozwy?
- 2024-12-28 Warszawa => Full Stack .Net Engineer <=
- 2024-12-28 Warszawa => Sales Assistant <=
- 2024-12-28 Warszawa => Programista Full Stack .Net <=
- 2024-12-28 Warszawa => Full Stack web developer (obszar .Net Core, Angular6+) <=
- 2024-12-28 Katowice => Head of Virtualization Platform Management and Operating S