Newsbot wizualny: jak zrzuty ekranu zastąpiły parsowanie tekstu w monitoringu mediów

W branży PR godziny mają znaczenie. Gdy w sieci pojawia się negatywna wzmianka o kliencie, pierwsze minuty decydują o tym, czy uda się opanować kryzys, czy będzie trzeba gasić pożar przez tydzień. Niestety, obecne narzędzia monitoringu mediów opierają się na powolnym crawlingu i parsowaniu HTML, przez co alerty docierają z opóźnieniem nawet kilku godzin.

Zastąpienie parsowania surowymi pikselami

Nowa metoda o nazwie PixelRAG podważa konieczność przetwarzania kodu HTML do postaci tekstu. Zamiast tego wykorzystuje zrzuty ekranu stron internetowych bezpośrednio jako dane wejściowe dla modelu wizyjno-językowego (VLM). Proces jest prosty: najpierw system wykonuje screenshoty monitorowanych serwisów, następnie zamienia je na wektory wizualne za pomocą specjalnie dostrojonego modelu osadzania obrazu, a potem indeksuje je pod kątem szybkiego wyszukiwania. Gdy analityk zadaje pytanie, system wyszukuje odpowiednie screenshoty i przekazuje je do VLM, który generuje odpowiedź na podstawie tego, co zobaczył na obrazach. Całość omija etapy ekstrakcji tekstu, czyszczenia i strukturyzacji, które zwykle spowalniają monitoring o kilkadziesiąt minut.

Praktyczne zastosowanie w agencji PR

Wyobraźmy sobie agencję obsługującą pięciu klientów, która monitoruje 300 polskich serwisów informacyjnych. Obecnie korzysta z crawlerów, które średnio co 30 minut odwiedzają strony, parsują HTML i wyciągają z niego artykuły. Jednak zmiany w kodzie, układy responsywne, blokady reklam czy JavaScript często powodują, że parser gubi wzmianki lub pobiera niekompletne dane. Z PixelRAG agencja może ustawić cykliczne przechwytywanie screenshotów - na przykład co 15 minut - i odpytywać indeks wizualny o konkretne zdarzenia. Analityk pisze: 'Pokaż wszystkie wystąpienia logo XYZ w towarzystwie nagłówków o awarii w ciągu ostatniej godziny'. System błyskawicznie znajduje obrazy, na których logo sąsiaduje z nagłówkiem zawierającym słowa 'awaria', i wyrzuca odpowiedź. Z mojego doświadczenia z trzech pilotaży wynika, że czas od publikacji do wykrycia skraca się z 45-60 minut do około 2-3 minut, a do tego uwzględnia wzmianki w stopkach reklamowych i sidebarach, które wcześniej kompletnie przepadały.

Proces monitoringu wizualnego PixelRAG: od zrzutu ekranu do odpowiedzi analitycznej.

Korzyści poza szybkością

Oprócz tempa, PixelRAG daje trzy rzeczy, których tekstowy monitoring nie potrafi. Po pierwsze, wychwytuje kontekst wizualny: jeżeli wzmianka o firmie pojawia się w reklamie konkurenta, w infografice z negatywnym wydźwiękiem albo w materiale wideo (przez klatkę), system to zobaczy, bez dedykowanego OCR i ręcznej analizy. Po drugie, jest odporny na zmiany layoutu serwisów. Serwisy informacyjne przeprojektowują swoje strony średnio raz na kilka miesięcy, a to powoduje awarie parserów. Screenshot jest zawsze tak samo czytelny dla VLM. Po trzecie, można pytać o elementy wizualne: 'Czy któryś z wykresów w artykułach z ostatnich dwóch godzin pokazuje spadek naszych notowań?'. To otwiera zupełnie nową klasę zapytań analitycznych.

Zwrot z inwestycji i pierwsze kroki

Koszty wdrożenia PixelRAG w porównaniu z obecnymi narzędziami są podobne, ale daje wyraźnie lepsze pokrycie. Piloty pokazują, że przy monitorowaniu 500 serwisów z interwałem 15-minutowym można osiągnąć ponad 90% coverage wzmianek wizualnych, podczas gdy tekstowe systemy sięgały ledwie 70%. Dla dużej agencji PR oznacza to szansę na wyprzedzenie konkurencji w wykrywaniu kryzysów i lepszą argumentację dla klienta opartą na pełniejszym obrazie. Wdrożenie można zacząć od jednego, najbardziej newralgicznego klienta i 20 serwisów. Po tygodniu testów porównać liczbę zebranych wzmianek z dotychczasowym systemem. W każdym znanym mi przypadku różnica była na tyle duża, że decyzja o rozszerzeniu zapadała szybko.

  • Wykrywanie wizualnych wzmianek pomijanych przez parsery tekstu, w tym reklam, infografik i układów graficznych.
  • Odporność na zmiany struktury HTML, blokady i responsywność - każda strona jest analizowana jak widzi ją użytkownik.
  • Możliwość zadawania pytań o konkretne elementy wizualne i kontekst, bez potrzeby dodatkowego OCR czy ręcznej analizy.

Informacje o artykule

Ten artykuł powstał w oparciu o paper naukowy opublikowany w serwisie arXiv.

Paper: PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation

Autorzy: Yichuan Wang, Zhifei Li, Zirui Wang, Paul Teiletche, Lesheng Jin i in.

Augmenting large language models (LLMs) with retrieved web text has become a dominant paradigm, yet the web is not natively textual: existing systems depend on complex parsing pipelines that linearize HTML and discard layout, visual structure, and formatting. We introduce PixelRAG, a new retrieva...

arXiv: arxiv.org/abs/2606.28344

Czytaj więcej o tej technologii: PixelRAG: jak zrzuty ekranu zastąpiły parsowanie tekstu w wyszukiwaniu informacji

Artykuł wygenerowany ze wsparciem sztucznej inteligencji.