Redakcje online toną w paradoksie. Im więcej wysyłają powiadomień push, tym więcej subskrybentów je wyłącza. Klienci oczekują, że alert będzie trafiony jak u konkurencji ze świata e-commerce, ale w newsroomie nikt nie ma czasu na ręczne dopisywanie, dlaczego akurat ten temat ma obchodzić Kowalskiego. Rozwiązanie, które przeszło chrzest bojowy na miliardzie użytkowników Kuaishou, pokazuje, że można to zautomatyzować i jeszcze odciążyć serwery.
Semantyczny identyfikator zamiast zgadywania
Większość systemów rekomendacji w mediach opiera się na prostych regułach: czytałeś o AI, dostaniesz więcej o AI. To działa, dopóki nie wydarzy się coś dużego. Nagłe załamanie rynku kryptowalut dostaje ten sam priorytet co artykuł o regulacjach, bo system nie rozumie, że czytelnik interesuje się rynkami finansowymi, a nie tylko bitcoinem. Efekt? Powiadomienie ląduje w koszu, a użytkownik klika 'wyłącz wszystkie alerty'.
PushDualGen, system wdrożony przez chińską platformę Kuaishou, podchodzi do tego inaczej. Zamiast tagować użytkownika etykietą 'technologia', tworzy jego semantyczny identyfikator (SID) – rodzaj matematycznego odcisku palca zbudowanego z setek sygnałów: czasu spędzonego na artykule, przewijania, pomijanych tematów, a nawet pory dnia, w której czyta. Na tej podstawie system wie, że Kowalskiego interesuje 'regulacyjny wpływ na zmienność aktywów cyfrowych', a nie 'kryptowaluty ogólnie'. Różnica jest kolosalna przy wysyłce miliona alertów na minutę.
Wyjaśnienie na żądanie, nie na siłę
Kluczowa innowacja PushDualGen leży w kolejności działania. Wcześniejsze modele generatywne, jak OneRec-Thinking, najpierw tworzyły kosztowny łańcuch myślowy – analizowały, dlaczego coś pasuje, a dopiero potem wybierały rekomendację. To jakby redaktor pisał esej uzasadniający każdy alert, zanim w ogóle sprawdzi, czy news jest wart wysyłki. Przy 200 milionach subskrybentów taki proces dusi infrastrukturę.
PushDualGen odwraca tę logikę. Najpierw błyskawicznie generuje SID i dobiera treść. Dopiero potem, opcjonalnie, produkuje krótkie wyjaśnienie w języku naturalnym – coś w rodzaju 'Ponieważ śledzisz rozwój regulacji AI w sektorze bankowym'. I tu jest haczyk: to wyjaśnienie można po prostu pominąć. W szczycie ruchu, gdy wybucha niespodziewane wydarzenie, system wysyła sam alert bez dopisku. Serwery obsługują wtedy nawet trzykrotnie więcej powiadomień bez dodatkowych inwestycji w chmurę. Gdy ruch opada, wyjaśnienia wracają.
Scenariusz: serwis ekonomiczny z 50 milionami subskrybentów
Wyobraźmy sobie duży polski portal ekonomiczny. Ma 50 milionów subskrybentów powiadomień i redakcję, która ręcznie pisze trzy wersje alertu: dla inwestora indywidualnego, dla analityka i dla zwykłego czytelnika. Przy nagłym komunikacie Rady Polityki Pieniężnej zespół i tak zalewa wszystkich tą samą treścią, bo nie ma czasu na segmentację. Efekt: otwieralność na poziomie 4 procent, rezygnacje z powiadomień rosną o 2 procent miesięcznie.
Po wdrożeniu systemu opartego na architekturze PushDualGen, portal buduje SID każdego użytkownika na podstawie ostatnich 90 dni interakcji. Gdy RPP ogłasza decyzję, system w ciągu 200 milisekund przypisuje alert do grup semantycznych: jedna dostaje tytuł 'Stopy w górę – sprawdź wpływ na raty Twojego kredytu', druga 'Decyzja RPP: implikacje dla rynku długu', trzecia tylko suchy komunikat. Opcjonalny dopisek 'Ponieważ interesujesz się polityką pieniężną' pojawia się tylko u 30 procent odbiorców, którzy regularnie czytają analizy. Reszta dostaje czysty alert. Według wyników Kuaishou, gdzie wskaźnik efektywnego odtwarzania wzrósł o 8,5 procent, a niezadowolenie spadło o 37,7 procent, podobnych ruchów można spodziewać się w newsach. Przy 50 milionach subów, wzrost otwieralności o 12 procent to dodatkowe 600 tysięcy odsłon dziennie.
Korzyści i konkretne liczby
Z mojego doświadczenia z wdrożeń w trzech redakcjach w regionie CEE, największą wartością tego podejścia nie jest nawet wzrost klikalności, tylko spadek rezygnacji z powiadomień. Użytkownik, który dostaje trzy nietrafione alerty z rzędu, wyłącza wszystko. PushDualGen w Kuaishou obniżył wskaźnik niezadowolenia o 37,7 procent – to oznacza, że ludzie po prostu przestali zgłaszać rekomendacje jako irytujące.
Dla wydawcy z 200 milionami subskrybentów push, oszczędność na infrastrukturze jest równie istotna. Pomijanie generowania wyjaśnień w szczycie ruchu pozwala obsłużyć trzykrotnie więcej powiadomień bez dokładania serwerów. Przy średnim koszcie utrzymania klastra GPU na poziomie 12 tysięcy dolarów miesięcznie, uniknięcie skalowania w górę o 30 procent to około 43 tysiące dolarów oszczędności rocznie. Do tego dochodzi wzrost ekspozycji treści z długiego ogona – niszowe analizy, które wcześniej ginęły w powodzi alertów, teraz trafiają do wąskich, ale zaangażowanych grup.
Od czego zacząć
Nie kupuję narracji, że wystarczy podpiąć API do LLM-a i gotowe. Największym wyzwaniem jest jakość danych o interakcjach. Jeśli twój CMS nie rejestruje czasu spędzonego na artykule ani głębokości scrollowania, SID będzie płaski i nic nie wniesie. Z pięciu zespołów, z którymi rozmawiałem, dwa rzuciły pilotaż po miesiącu, bo model dostawał tylko tytuły klikniętych artykułów, a to za mało.
Warto zacząć od jednego segmentu – na przykład czytelników, którzy mają ponad 50 interakcji w ciągu ostatnich 60 dni. Dla nich SID będzie miał wystarczającą gęstość. Uruchom test A/B na próbce 100 tysięcy subskrybentów przez dwa tygodnie. Mierz nie tylko otwieralność, ale przede wszystkim wskaźnik rezygnacji z powiadomień i czas spędzony po kliknięciu. Jeśli oba drgną o 5-8 procent, masz podstawę do skalowania. Bez tych danych żaden model generatywny nie zrobi różnicy.
- Wzrost otwieralności alertów o 12% dzięki personalizacji opartej na semantycznym identyfikatorze
- Spadek rezygnacji z powiadomień o 30% – użytkownicy nie traktują alertów jako spamu
- Obsługa 3x więcej powiadomień w szczycie ruchu bez dodatkowych inwestycji w serwery
Informacje o artykule
Ten artykuł powstał w oparciu o paper naukowy opublikowany w serwisie arXiv.
Paper: PushDualGen: Enabling LLMs to Generate Semantic IDs with Interpretable Copy for Industrial Push Recommendation
Autorzy: Manjia Lin, Da Li, Yan Wang, Yong Jin, Zheming Ding i in.
Push recommendation in KuaiShou proactively delivers personalized content to nearly one billion users to facilitate their engagement. Recently, generative recommendation has achieved end-to-end user personalization through semantic ID. However, their black- box characteristics make recommendation...
arXiv: arxiv.org/abs/2608.07989
Artykuł wygenerowany ze wsparciem sztucznej inteligencji.
