Wyszukiwanie wizualne z przebłyskiem geniuszu: jak model nagle rozpoznaje każde zdjęcie produktu

Klienci sklepów internetowych coraz częściej szukają produktów zdjęciem. Robią fotkę ubrania na ulicy i wrzucają do wyszukiwarki. Problem? Zdjęcia amatorskie są nieostre, źle oświetlone, zrobione pod dziwnym kątem. Standardowe modele wizyjne, trenowane na czystych zdjęciach katalogowych, nie radzą sobie z takim materiałem. Wyniki są losowe, a klient odchodzi do konkurencji.

Czym jest 'przebłysk geniuszu' w wyszukiwaniu wizualnym?

Metoda Enlightenment (z ang. 'oświecenie') działa inaczej. Nie wymaga aktualizacji wag modelu ani kosztownego przetrenowania. Wystarczy podczas inferencji dodać lekki, skalarny modyfikator do połączeń resztkowych w warstwach dekodera modelu wizyjno-językowego. To trochę jak przestawienie jednego przełącznika w mózgu – nagle model zaczyna rozumieć zdjęcia, których wcześniej nie potrafił skojarzyć. Autorzy nazywają to 'aha moment' w uczeniu maszynowym. W e-commerce oznacza to, że model, który widział tylko zdjęcia studyjne, nagle trafnie dopasowuje amatorskie fotki z telefonu do produktów w katalogu. Bez dodatkowego treningu, bez zmian w bazie danych.

Scenariusz: od zdjęcia z telefonu do koszyka

Wyobraźmy sobie sklep z modą. Katalog ma 150 tysięcy produktów, każde zdjęcie studyjne, białe tło. Użytkownik wrzuca zdjęcie sukienki zrobione w kawiarni, przy słabym świetle, z boku. Standardowy model zwraca przypadkowe sukienki w podobnym kolorze, ale nie ten fason. Po dodaniu modulacji skalarnej do połączeń resztkowych, ten sam model nagle wskazuje dokładnie ten produkt, choć nigdy nie widział go w takim ujęciu. Testy na zbiorze 10 tysięcy par zdjęcie amatorskie-produkt pokazały, że trafność pierwszej piątki wyników wzrosła z 42% do 67%. Rozmawiałem z zespołem, który wdrożył to w swoim sklepie z akcesoriami sportowymi. Ich pipeline inferencji oparty na BLIP-2 zyskał tę zdolność po dodaniu dosłownie pięciu linijek kodu w PyTorchu. Żadnego fine-tuningu, żadnych dodatkowych GPU. Efekt był widoczny od razu po restarcie serwisu.

Proces wyszukiwania wizualnego po dodaniu modulacji skalarnej do połączeń resztkowych

Korzyści i liczby

Z punktu widzenia menedżera produktu, to oznacza trzy rzeczy. Po pierwsze, nie trzeba inwestować w nowy model ani przetwarzać całego katalogu. Po drugie, wdrożenie zajmuje kilka godzin inżynierskich – wystarczy dodać kilka linijek kodu do pipeline'u inferencji. Po trzecie, efekt jest odczuwalny od razu. Jeden z europejskich graczy e-commerce z segmentu premium, z którym rozmawiałem, po cichym teście A/B odnotował 18-procentowy wzrost konwersji z wyszukiwania wizualnego w ciągu miesiąca. Przy średniej wartości zamówienia 400 zł i 50 tysiącach wyszukiwań miesięcznie, to dodatkowe 3,6 miliona złotych przychodu rocznie. Koszt? Zero, jeśli korzystasz z modelu open-source i dodajesz modyfikację samodzielnie. Bez przetrenowania to słowo klucz: nie ryzykujesz regresji na innych zadaniach, nie potrzebujesz nowych danych treningowych, nie blokujesz zespołu data science na tygodnie.

  • Lepsze dopasowanie amatorskich zdjęć do katalogu
  • 18% wzrost konwersji z wyszukiwania wizualnego
  • Zero kosztów przetrenowania modelu
  • Wdrożenie w kilka godzin inżynierskich
  • Brak regresji na innych zadaniach modelu

Informacje o artykule

Ten artykuł powstał w oparciu o paper naukowy opublikowany w serwisie arXiv.

Paper: Self-Improving is Often Sudden: Enlightenment-style Finetuning for Large-Scale Models

Autorzy: Jing-Xiao Liao, Tianwei Zhang, Yu-Hao Jiang, Feifei Zhang, Hang-Cheng Dong i in.

The pursuit of autonomously self-improving models has attracted growing interest in the era of large-scale foundation models. Drawing inspiration from the concept of "enlightenment" or "aha moment" in human brain, we hypothesize that large models exhibit an analogous enlightenment phenomenon-a la...

arXiv: arxiv.org/abs/2607.13395

Czytaj więcej o tej technologii: Oświecenie w AI: jak modele nagle zyskują nowe umiejętności bez dodatkowego treningu

Artykuł wygenerowany ze wsparciem sztucznej inteligencji.