-
Path: news-archive.icm.edu.pl!news.gazeta.pl!not-for-mail
From: "Borneq" <b...@a...hidden.pl>
Newsgroups: pl.comp.programming
Subject: Re: Jak efektywnie stwierdzić czy tekst jest w UTF8?
Date: Wed, 13 Jun 2012 09:46:39 +0200
Organization: "Portal Gazeta.pl -> http://www.gazeta.pl"
Lines: 22
Message-ID: <jr9ggv$mak$1@inews.gazeta.pl>
References: <jr8els$en3$1@inews.gazeta.pl>
NNTP-Posting-Host: 194.117.241.226
Mime-Version: 1.0
Content-Type: text/plain; format=flowed; charset="iso-8859-2"; reply-type=response
Content-Transfer-Encoding: 8bit
X-Trace: inews.gazeta.pl 1339573599 22868 194.117.241.226 (13 Jun 2012 07:46:39 GMT)
X-Complaints-To: u...@a...pl
NNTP-Posting-Date: Wed, 13 Jun 2012 07:46:39 +0000 (UTC)
X-Antivirus-Status: Clean
X-MimeOLE: Produced By Microsoft MimeOLE V6.00.2900.6157
X-Priority: 3
X-Newsreader: Microsoft Outlook Express 6.00.2900.5931
X-User: bornega
X-Antivirus: avast! (VPS 120612-1, 2012-06-12), Outbound message
X-MSMail-Priority: Normal
Xref: news-archive.icm.edu.pl pl.comp.programming:197872
[ ukryj nagłówki ]Użytkownik "Borneq" <b...@a...hidden.pl> napisał w wiadomości
news:jr8els$en3$1@inews.gazeta.pl...
> Trenuję najpierw na tekstach otrzymując tabelkę 256 częstotliwości
Metoda zliczań częstotliwości jest bezradna gdy mamy stwierdzić czy tekst
jest w Unicode czy też w Uniocode z odwróceniem bajtów. Wtedy potrzebne
byłyby dwie tabelki - dla parzystych i nieparzystych bajtów. Ale przyjmijmy
że nie rozpoznajemy Unicode 16-bitowego lecz UTF-8.
Wtedy zamiast częstotliwości 256 znaków będziemy mieli częstotliwość 7-mio
bitowych i 8-io bitowych. Oba dzielą się na wystąpienia po 7-mio lub 8-io
bitowym znaku.
Ośmiobitowe należałoby podzielić na:
10xxxxxx
110xxxxx
1110xxxx
11110xxx
111110xx
1111110x
razem z 0xxxxxxx i 1111111x będzie 8 klas.
Czyli 64 gdy mamy wystąpienie po jakimś znaku. Choć to nie całkiem bo po
1111110x powinno być aż 5 razy 10xxxxxx
Następne wpisy z tego wątku
- 13.06.12 13:19 Paweł Kierski
- 13.06.12 14:18 voy
- 13.06.12 14:44 Borneq
- 13.06.12 20:31 Jordan Szubert
- 13.06.12 23:59 Borneq
- 14.06.12 01:09 Jordan Szubert
- 14.06.12 11:05 Borneq
Najnowsze wątki z tej grupy
- Arch. Prog. Nieuprzywilejowanych w pełnej wer. na nowej s. WWW energokod.pl
- 7. Raport Totaliztyczny: Sprawa Qt Group wer. 424
- TCL - problem z escape ostatniego \ w nawiasach {}
- Nauka i Praca Programisty C++ w III Rzeczy (pospolitej)
- testy-wyd-sort - Podsumowanie
- Tworzenie Programów Nieuprzywilejowanych Opartych Na Wtyczkach
- Do czego nadaje się QDockWidget z bibl. Qt?
- Bibl. Qt jest sztucznie ograniczona - jest nieprzydatna do celów komercyjnych
- Co sciaga kretynow
- AEiC 2024 - Ada-Europe conference - Deadlines Approaching
- Jakie są dobre zasady programowania programów opartych na wtyczkach?
- sprawdzanie słów kluczowych dot. zła
- Re: W czym sie teraz pisze programy??
- Re: (PDF) Surgical Pathology of Non-neoplastic Gastrointestinal Diseases by Lizhi Zhang
- CfC 28th Ada-Europe Int. Conf. Reliable Software Technologies
Najnowsze wątki
- 2024-12-30 Nowy Outlander PHEV w PL
- 2024-12-30 Warszawa => Key Account Manager <=
- 2024-12-30 Katowice => Key Account Manager (ERP) <=
- 2024-12-28 Śmiechu KOOOOOOPA ;-)
- 2024-12-29 Pomiar amplitudy w zegarku mechanicznym
- 2024-12-28 Antyradar
- 2024-12-28 Deweloper przegral w sadzie musi zwrócic pieniądze Posypia sie kolejne pozwy?
- 2024-12-28 Warszawa => Full Stack .Net Engineer <=
- 2024-12-28 Warszawa => Sales Assistant <=
- 2024-12-28 Warszawa => Programista Full Stack .Net <=
- 2024-12-28 Warszawa => Full Stack web developer (obszar .Net Core, Angular6+) <=
- 2024-12-28 Katowice => Head of Virtualization Platform Management and Operating S
- 2024-12-28 Błonie => Analityk Systemów Informatycznych (TMS SPEED) <=
- 2024-12-28 Warszawa => Senior Frontend Developer (React + React Native) <=
- 2024-12-28 Żerniki => Employer Branding Specialist <=