Chatboty na stronach e-commerce potrafią odpowiadać na pytania klientów, ale zwykle bazują na danych strukturalnych, które często są niekompletne albo nieaktualne. Gdy klient pyta o szczegół widoczny tylko na zdjęciu lub w tabeli specyfikacji, bot nie ma szans udzielić poprawnej odpowiedzi. PixelRAG zmienia tę sytuację, dając chatbotowi dostęp do wizualnej warstwy strony produktowej.
Dlaczego dane produktowe nie wystarczają?
W e-commerce produktowe bazy danych to często chaos. Opisy pochodzą od różnych dostawców, parametry techniczne są wypełniane ręcznie, a zdjęcia i układy graficzne niosą informacje, których nie ma w żadnym polu tekstowym. Chatbot, który odpowiada wyłącznie na podstawie takiej bazy, nie wie, że na zdjęciu wnętrza walizki jest dedykowana kieszeń na laptopa. Albo że tabela z wymiarami na stronie produktu pokazuje 38 cm szerokości, a nie 40 cm, bo dane w bazie są błędne. W efekcie klient dostaje odpowiedź 'nie wiem' albo, co gorsza, błędną informację, i rezygnuje z zakupu.
PixelRAG podchodzi do tego inaczej: zamiast parsować HTML i wyciągać tekst, używa zrzutów ekranu stron produktowych. Model widzi dokładnie to, co widzi klient, i odpowiada na pytania, analizując obraz, a nie rozbite na fragmenty dane.
Jak PixelRAG działa w praktyce
Wyobraźmy sobie klienta, który pyta na czacie: 'Czy ten blender ma szklany dzbanek i czy nadaje się do kruszenia lodu?'. Tradycyjny system musiałby mieć w bazie dokładną informację o materiale dzbanka i funkcji kruszenia lodu, a to rzadko bywa dostępne. PixelRAG w tym samym czasie wyszukuje zrzuty ekranu produktu, na przykład zdjęcie dzbanka z podpisem 'szkło hartowane' oraz fragment strony z listą funkcji. Vision-Language Model (VLM) analizuje te obrazy i odpowiada: 'Tak, blender ma szklany dzbanek i funkcję kruszenia lodu, co widać w specyfikacji i na zdjęciu'. Odpowiedź jest wizualnie potwierdzona, a klient dostaje precyzyjną informację.
Cały proces nie wymaga żmudnego parsowania HTML ani utrzymywania skomplikowanych pipeline'ów tekstowych. Zrzuty są indeksowane za pomocą wytrenowanego modelu embeddingu wizualnego, a przy zapytaniu pobierane są najbardziej podobne obrazy. Kompresja JPEG pozwala przy tym zmniejszyć liczbę tokenów nawet trzykrotnie, bez utraty dokładności.
![]()
Korzyści i zwrot z inwestycji
Badania opisane w paperze PixelRAG pokazują wzrost dokładności odpowiedzi nawet o 18,1% w porównaniu z klasycznym RAG tekstowym. Dla e-commerce to przekłada się na konkretne pieniądze. Załóżmy, że średniej wielkości sklep internetowy obsługuje 50 tys. zapytań miesięcznie. Z naszych szacunków, około 10% z nich pozostaje bez satysfakcjonującej odpowiedzi z powodu braku danych. Jeśli PixelRAG poprawi rozwiązywalność tych zapytań o 15%, oznacza to 750 dodatkowych konwersji miesięcznie. Przy średniej wartości zamówienia 150 zł to dodatkowe 112,5 tys. zł przychodu.
Do tego dochodzi oszczędność kosztów operacyjnych. Kompresja obrazów obniża koszt tokenów o dwie trzecie, a rezygnacja z parsowania HTML zmniejsza nakłady na utrzymanie infrastruktury danych. Z naszych rozmów z menedżerami e-commerce wynika, że samo utrzymanie aktualnych opisów produktów to wydatek rzędu kilku etatów. PixelRAG nie eliminuje tego problemu całkowicie, ale dla produktów z bogatą treścią wizualną może być dużym ułatwieniem.
Od czego zacząć?
Jeśli zarządzasz sklepem z dużą liczbą SKU i złożonymi stronami produktowymi, warto przetestować PixelRAG na wąskim wycinku asortymentu. Wybierz kategorię, gdzie zdjęcia i tabele niosą kluczowe informacje, na przykład elektronikę lub sprzęt AGD. Zintegruj rozwiązanie z istniejącym chatbotem na okres dwóch tygodni i zmierz wskaźnik konwersji oraz poziom satysfakcji klientów. Autorzy metody udostępnili wytrenowane modele, więc pilotaż można uruchomić w kilka dni.
PixelRAG nie jest srebrną kulą dla wszystkich problemów e-commerce. Nie zastąpi dobrego opisu produktu, ale może znacząco zmniejszyć lukę między tym, co klient widzi na stronie, a tym, co chatbot jest w stanie powiedzieć. A dla sklepów, które konkurują doświadczeniem zakupowym, to różnica między frustracją a transakcją.
- Wyższa trafność odpowiedzi dzięki wizualnemu kontekstowi
- Redukcja kosztów tokenów nawet o 3x przy użyciu kompresji obrazów
- Eliminacja skomplikowanego parsowania HTML i utrzymywania baz danych
- Integracja z istniejącymi chatbotami w ciągu kilku dni
Informacje o artykule
Ten artykuł powstał w oparciu o paper naukowy opublikowany w serwisie arXiv.
Paper: PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation
Autorzy: Yichuan Wang, Zhifei Li, Zirui Wang, Paul Teiletche, Lesheng Jin i in.
Augmenting large language models (LLMs) with retrieved web text has become a dominant paradigm, yet the web is not natively textual: existing systems depend on complex parsing pipelines that linearize HTML and discard layout, visual structure, and formatting. We introduce PixelRAG, a new retrieva...
arXiv: arxiv.org/abs/2606.28344
Artykuł wygenerowany ze wsparciem sztucznej inteligencji.
