-
Data: 2009-10-17 21:09:53
Temat: Re: kompresja danych
Od: Mariusz Marszałkowski <m...@g...com> szukaj wiadomości tego autora
[ pokaż wszystkie nagłówki ]On 17 Paź, 20:34, Wojciech Muła
<w...@p...null.onet.pl.invalid> wrote:
> Mariusz Marszałkowski <m...@g...com> wrote:
> > Są jakieś specjalne algorytmy do kompresji tabel danych, w których
> > jest stała długość wiersza, a kolejność wierszy nie ma znaczenia?
>
> > Oznacza to, że kompresor może dowolnie zmieniać kolejność
> > wierszy i podczas dekompresji nie musi odtworzyć pierwotenj
> > kolejności.
>
> Nie słyszałem o niczym takim. A co masz w tych wierszach?
> Te wiersze się powtarzają?
Np. jest 30 kolumn i 20mln wierszy. Dane często wyglądają tak,
jakby sąsiadujące wiersze miały z dużym prawdopodobieństwem
te sam wartości w kolumnach. Np. w kolumnie 3-ciej od wiersza
100 do 200 są same jedynki, w kolumnie 2 od wiersza 50 do 150
są same zera. Wszystkie dane to mały podzbiór liczb całkowitych,
powiedzmy o mocy kilkuset elementów.
Uważam że można do tego podejść na dwa sposoby:
1) Skompresować każdą kolumnę osobno, podejrzewam że prosta
metoda długości serii skompresuje niektóre kolumny 100 krotnie.
2) Jakoś specjalnie posortować wiersze, aby dane powtarzające się
były blisko siebie
3) Można połączyć obie metody, najpierw jakoś posortować wiersze,
a później sortować każdą kolumnę niezależnie.
Kompresja może trwać dowolnie długo, nawet całą dobę, ale dekompresja
musi być bardzo szybka, gdyż skompresowane dane trafią do pamięci
RAM i będą dekompresowane w każdej iteracji algorytmu.
Pozdrawiam serdecznie
Następne wpisy z tego wątku
- 17.10.09 21:42 Wojciech Muła
- 17.10.09 22:05 Mariusz Marszałkowski
- 18.10.09 00:55 Wojciech Muła
- 18.10.09 07:37 Mariusz Marszałkowski
- 17.10.09 14:08 Wiktor S.
- 18.10.09 17:11 Mariusz Marszałkowski
- 19.10.09 13:36 Daniel Janus
Najnowsze wątki z tej grupy
- Popr. 14. Nauka i Praca Programisty C++ w III Rzeczy (pospolitej)
- Arch. Prog. Nieuprzywilejowanych w pełnej wer. na nowej s. WWW energokod.pl
- 7. Raport Totaliztyczny: Sprawa Qt Group wer. 424
- TCL - problem z escape ostatniego \ w nawiasach {}
- Nauka i Praca Programisty C++ w III Rzeczy (pospolitej)
- testy-wyd-sort - Podsumowanie
- Tworzenie Programów Nieuprzywilejowanych Opartych Na Wtyczkach
- Do czego nadaje się QDockWidget z bibl. Qt?
- Bibl. Qt jest sztucznie ograniczona - jest nieprzydatna do celów komercyjnych
- Co sciaga kretynow
- AEiC 2024 - Ada-Europe conference - Deadlines Approaching
- Jakie są dobre zasady programowania programów opartych na wtyczkach?
- sprawdzanie słów kluczowych dot. zła
- Re: W czym sie teraz pisze programy??
- Re: (PDF) Surgical Pathology of Non-neoplastic Gastrointestinal Diseases by Lizhi Zhang
Najnowsze wątki
- 2025-01-06 Popr. 14. Nauka i Praca Programisty C++ w III Rzeczy (pospolitej)
- 2025-01-06 Ostrów Wielkopolski => Area Sales Manager OZE <=
- 2025-01-06 Do IO i innych elektrooszolomow, tu macie prawdziwe smrody
- 2025-01-06 Białystok => Full Stack .Net Engineer <=
- 2025-01-06 Kraków => Business Development Manager - Network and Network Security
- 2025-01-06 Katowice => Regionalny Kierownik Sprzedaży (OZE) <=
- 2025-01-06 Warszawa => Spedytor Międzynarodowy <=
- 2025-01-06 Lublin => Programista Delphi <=
- 2025-01-06 Gdańsk => Specjalista ds. Sprzedaży <=
- 2025-01-06 śnieg
- 2025-01-05 Żarówka do lampy z czujnikiem ruchu
- 2025-01-05 Rozkręcają się
- 2025-01-04 pozew za naprawę sprzętu na youtube
- 2025-01-04 gasik
- 2025-01-04 13. Raport Totaliztyczny: Powszechna Deklaracja Praw Człowieka Nie Chroni Przed Wyzyskiem Ani Przed Eksploatacją