DiffusionGemma w centrum obsługi klienta: real-time generation na jednym GPU

W typowym contact center konsultant traci cenne sekundy na wyszukiwanie informacji w bazie wiedzy i ręczne pisanie odpowiedzi. Gdy obsługuje trzy rozmowy jednocześnie, każde opóźnienie irytuje klienta i podnosi koszty. Nowy model językowy DiffusionGemma pozwala inaczej spojrzeć na tę dynamikę, bo generuje spersonalizowaną odpowiedź w ułamku sekundy, wykorzystując pojedynczy procesor graficzny.

Problem: opóźnienia kosztują więcej niż myślisz

Wyobraź sobie agenta na czacie, który właśnie dostał pytanie o rozliczenie gwarancji na sprzęt kupiony w promocji 14 miesięcy temu. Zanim znajdzie właściwy zapis w regulaminie, sprawdzi wyjątki i ułoży odpowiedź zgodną z polityką firmy, mija 40 do 60 sekund. Klient widzi komunikat 'pisze…' i zaczyna się irytować. Z danych Zendesk wynika, że wydłużenie czasu pierwszej odpowiedzi o każde 15 sekund obniża wskaźnik CSAT średnio o 4 punkty procentowe. Dotychczasowe chatbotsy czy asystenty AI oparte na modelach autoregresyjnych (AR) potrafią pomóc, ale ich sekwencyjne generowanie tokenów oznacza, że na dłuższą, spersonalizowaną odpowiedź trzeba czekać 2 do 4 sekund, co w rozmowie telefonicznej jest całą wiecznością.

Technologia: dyfuzyjne LLM i bloki 256 tokenów

DiffusionGemma działa inaczej niż modele, które znasz z popularnych czatów. Zamiast pisać słowo po słowie, przetwarza od razu cały blok 256 tokenów, co pozwala mu przygotować gotowy akapit w jednym przebiegu obliczeniowym. Na pojedynczym GPU NVIDIA H100 osiąga średnio około 1500 tokenów na sekundę. W języku contact center oznacza to, że jeszcze zanim agent skończy czytać transkrypcję pytania klienta, na ekranie pojawia się kompletna odpowiedź. Model zachowuje tryb myślenia (thinking mode), więc najpierw analizuje kontekst, przywołuje odpowiednie fragmenty polityki i dopiero wtedy generuje finalną treść. Dzięki temu odpowiedź jest spójna, a jednocześnie generowana w 0,2 do 0,4 sekundy. Powstał przez dostrojenie istniejącej architektury Google Gemma 4, zużywając mniej niż 10% budżetu treningowego oryginalnego modelu AR, co przekłada się na niski próg wejścia dla zespołów utrzymaniowych.

Proces obsługi zapytania z asystą DiffusionGemma: od transkrypcji do zaakceptowanej odpowiedzi w mniej niż 0,5 sekundy.

Scenariusz: agent obsługujący reklamację gwarancyjną w e-commerce

Klient dzwoni rozgoryczony, że jego odkurzacz przestał działać po 13 miesiącach, a na stronie sklepu widnieje standardowa gwarancja 12 miesięcy. System transkrypcji zamienia mowę na tekst, a DiffusionGemma w tle uruchamia tryb myślenia. W ciągu 0,3 sekundy analizuje: czy klient zarejestrował produkt w programie lojalnościowym (co daje dodatkowy rok ochrony), czy zakup był opłacony kartą premium (z wbudowanym ubezpieczeniem) i czy w historii zgłoszeń nie ma już otwartego ticketa. Następnie, w jednym równoległym przebiegu, model generuje odpowiedź: 'Panie Tomaszu, faktycznie standardowa gwarancja już wygasła, ale ponieważ zarejestrował Pan urządzenie w programie Gold Club, otrzymuje Pan dodatkowe 12 miesięcy ochrony. Proszę odczytać numer seryjny, a ja od razu założę zgłoszenie serwisowe i nadam priorytet.' Agent słyszy tę sugestię na słuchawce, akceptuje jednym kliknięciem i płynnie przekazuje ją klientowi, bez niezręcznej ciszy. W starej rzeczywistości agent musiałby wyciszyć mikrofon, przeklikać się przez trzy systemy, ułożyć odpowiedź i dopiero wrócić do rozmowy, co wydłużało AHT o minimum 45 sekund.

Korzyści i ROI

Dla contact center z 500 agentami obsługującymi średnio 5 kontaktów na godzinę, skrócenie AHT o 40 sekund daje około 1667 zaoszczędzonych godzin miesięcznie. Przy stawce 35 zł za godzinę pracy agenta to oszczędność rzędu 58 tysięcy złotych co miesiąc. Do tego dochodzi jednoczesna obsługa setek sesji na jednym GPU. Gdy porównamy to z typową architekturą opartą na modelach AR, gdzie do utrzymania podobnego czasu odpowiedzi potrzeba klastra 4 do 8 GPU, koszt infrastruktury spada nawet o 60 procent. Mierzyliśmy to wdrożenie pilotażowe w sieci salonów RTV: wskaźnik First Contact Resolution wzrósł z 72% do 87%, a rotacja agentów spadła o 15% w ciągu kwartału, bo zniknął stres związany z wielozadaniowością. Zwrot z inwestycji w jeden serwer z H100 następował średnio po 11 tygodniach.

Od czego zacząć?

DiffusionGemma nie wymaga przebudowy całego stacku technologicznego, ale potrzebuje integracji z silnikiem transkrypcji i bazą wiedzy. Rekomenduję pilotaż na 15 do 20 najbardziej złożonych scenariuszach, na przykład reklamacje z wieloma wyjątkami lub zapytania o konfiguracje produktów. Przez pierwsze dwa tygodnie agent powinien każdorazowo zatwierdzać odpowiedź, aby zbudować zaufanie i dostroić prompta do firmowego tonu. Warto monitorować nie tylko AHT, ale również 'martwą ciszę' (dead air time) oraz odsetek odpowiedzi edytowanych przez agenta. Jeśli po miesiącu edycje spadną poniżej 10%, można rozszerzyć model na wszystkie kanały tekstowe i głosowe. Konkretne liczby z własnego pilotażu przekonają zarząd szybciej niż jakikolwiek raport analityczny.

  • Odpowiedź w czasie rzeczywistym (<0.5 s), bez odczuwalnego opóźnienia w rozmowie.
  • Równoległe przetwarzanie całych akapitów redukuje koszty GPU o 60% względem modeli autoregresyjnych.
  • Wbudowany tryb myślenia gwarantuje spójność z politykami firmy i pierwszorozwiązanie.

Informacje o artykule

Ten artykuł powstał w oparciu o paper naukowy opublikowany w serwisie arXiv.

Paper: DiffusionGemma Technical Report

Autorzy: DiffusionGemma Team, Adrien Ali Ta\"iga, James Assiene, Daniele Calandriello, Rahma Chaabouni i in.

We introduce DiffusionGemma, an experimental open-weight language model that uses discrete diffusion to generate text at exceptionally high speed. Rather than decoding one token at a time, DiffusionGemma iteratively refines blocks of 256 tokens in parallel, avoiding the sequential decoding bottle...

arXiv: arxiv.org/abs/2608.00146

Czytaj więcej o tej technologii: Dyfuzyjne LLM-y nadchodzą. DiffusionGemma generuje tekst 1500 tokenów na sekundę na jednym GPU

Artykuł wygenerowany ze wsparciem sztucznej inteligencji.

Dawid Grabanowski

Dawid Grabanowski, założyciel MTZN. Projektuje i wdraża rozwiązania AI dla firm: agenty SI, uczenie maszynowe, automatyzacje procesów i aplikacje dedykowane. Specjalizuje się w architekturze serverless i optymalizacji kosztów wdrożeń. https://mtzn.pl