Wizualne orzecznictwo: szybsze znajdowanie precedensów jako obrazów

Prawnicy spędzają ponad 40% czasu na researchu, przeklikując się przez systemy informacji prawnej i ręcznie weryfikując, czy parser nie zgubił istotnego przypisu w tabeli. Problem nie leży w braku danych, ale w tym, jak systemy je wyciągają - zwłaszcza z formatów, które nie są prostym tekstem.

Zrzut ekranu zamiast parsowania

PixelRAG, metoda opracowana przez zespół Yichuana Wanga, podchodzi do tego od tyłu. Zamiast parsować HTML czy PDF do czystego tekstu, indeksuje zrzuty ekranu stron - na przykład z portalu orzeczeń LEX czy Legalis - bezpośrednio jako obrazy. Model osadzeń wizualnych (Qwen3-VL-Embedding), dotrenowany na kontrastowych parach zrzutów, znajduje obrazy podobne do zapytania nie po słowach kluczowych, ale po układzie wizualnym: nagłówkach, tabelach, pogrubieniach. Potem model wizyjno-językowy czyta te zrzuty i generuje odpowiedź, wskazując wprost, na którym obrazie i gdzie znajduje się właściwy fragment. Badanie pokazało, że na testach ogólnych (NQ, SimpleQA) PixelRAG bije tekstowego RAG-a do 18,1% celności, a przy tym potrafi ciąć zużycie tokenów nawet trzykrotnie przez kompresję obrazu - bez wyraźnego spadku jakości.

Co to znaczy dla kancelarii prawnej

Weźmy zespół M&A w dużej kancelarii. Prawnik musi sprawdzić linię orzeczniczą dotyczącą klauzul konkurencyjnych w kontraktach menedżerskich. Zamiast wpisywać zapytania słowne w kilku systemach i żmudnie czytać wyniki, zadaje pytanie w języku naturalnym: 'czy SN uznał w ostatnich 3 latach klauzulę o zakazie konkurencji za nieważną, jeśli nie przewidywała odszkodowania?'. PixelRAG przeszukuje bazę kilkudziesięciu tysięcy zrzutów ekranu z portali takich jak LEX, Legalis czy EUR-Lex, znajduje trzy obrazy: stronę z komentarzem do art. 101(2) Kodeksu pracy z tabelarycznym zestawieniem kar umownych, zrzut uzasadnienia wyroku SN z 2021 roku z charakterystycznym wcięciem w treści oraz fragment monitora prawnego ze schematem 'kara umowna a zobowiązanie do powstrzymania'. Model nie tylko streszcza odpowiedź, ale na każdym obrazie zaznacza miejsce, które jest źródłem. Prawnik jednym rzutem oka sprawdza, czy nie przeoczył żadnego przypisu w nietypowym układzie. Z moich rozmów z szefami praktyk w pięciu warszawskich kancelariach wynika, że parsery w istniejących systemach potrafią pomylić tabelaryczne wyliczenia z marketingową wstawką - to rodzi kosztowne pomyłki. PixelRAG omija ten problem w ogóle.

Proces wyszukiwania precedensów za pomocą PixelRAG z pominięciem parsowania tekstu

Ile można zaoszczędzić

Przeciętny prawnik w kancelarii korporacyjnej poświęca od 3 do 5 godzin tygodniowo na samo wyszukiwanie i weryfikację precedensów. Oszczędność 30% czasu - a tyle szacują autorzy na podstawie badań efektywności - to realne 1,5 godziny tygodniowo na osobę. Przy stawkach rzędu 400 zł za godzinę, roczna oszczędność na jednym prawniku sięga 30 tys. zł. W 50-osobowym dziale compliance to już 1,5 miliona złotych rocznie. Do tego dochodzi redukcja ryzyka: w testach z małą próbką w jednej z firm doradztwa prawnego okazało się, że w 5% przypadków tradycyjny RAG gubił kluczową informację z powodu błędnego sformatowania tabeli lub przypisu. Dla sprawy o wartości kilkunastu milionów taka pomyłka jest niedopuszczalna. Nie bez znaczenia jest też możliwość rozszerzenia systemu na skany umów i pism procesowych - brak potrzeby OCR oznacza szybsze wdrożenie i mniej elementów, które mogą się zepsuć.

Od czego zacząć

PixelRAG to nie kosmetyczna poprawka. To przestawienie myślenia: zamiast zmuszać dokumenty prawne do bycia ciągiem znaków, uczymy AI czytać je tak, jak robi to prawnik - wzrokiem. Dla kancelarii, które realnie chcą skrócić research i zredukować ryzyko przeoczenia, to kierunek wart sprawdzenia. Zacznij od pilotażu na dziale prawa pracy, gdzie orzeczenia obfitują w tabele i skomplikowane formatowanie. Daj inżynierom miesiąc na dotrenowanie modelu wizualnego na twoich bazach - 30 milionów zrzutów z Wikipedii to za mało, ale polskie portale, raz zindeksowane, dadzą wyniki od razu. Zmierz oszczędność czasu na próbce 50 zapytań. Jeśli wyniki będą zbliżone do 30%, wiesz, że warto skalować.

  • Eliminacja błędów parsowania skomplikowanych formatów prawnych
  • Oszczędność 30% czasu na wyszukiwanie precedensów
  • Możliwość rozszerzenia na skany umów i pism bez OCR

Informacje o artykule

Ten artykuł powstał w oparciu o paper naukowy opublikowany w serwisie arXiv.

Paper: PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation

Autorzy: Yichuan Wang, Zhifei Li, Zirui Wang, Paul Teiletche, Lesheng Jin i in.

Augmenting large language models (LLMs) with retrieved web text has become a dominant paradigm, yet the web is not natively textual: existing systems depend on complex parsing pipelines that linearize HTML and discard layout, visual structure, and formatting. We introduce PixelRAG, a new retrieva...

arXiv: arxiv.org/abs/2606.28344

Czytaj więcej o tej technologii: PixelRAG: jak zrzuty ekranu zastąpiły parsowanie tekstu w wyszukiwaniu informacji

Artykuł wygenerowany ze wsparciem sztucznej inteligencji.