Dyfuzyjne LLM-y nadchodzą. DiffusionGemma generuje tekst 1500 tokenów na sekundę na jednym GPU

Zapomnij o żmudnym dekodowaniu token po tokenie. DiffusionGemma, eksperymentalny model językowy o otwartych wagach, generuje tekst hurtowo, odszumiając od razu bloki 256 tokenów. Na jednym H100 osiąga średnio 1500 tokenów na sekundę, co wyznacza nową granicę kompromisu między szybkością a możliwościami. I robi to, dostrajając istniejący model za mniej niż 10% pierwotnych kosztów treningu.

Szybciej niż token po tokenie

Większość dzisiejszych modeli językowych generuje odpowiedzi jak pisarz, który może napisać tylko jedno słowo, a potem musi na nie spojrzeć, zanim napisze kolejne. Każdy token zależy od wszystkich poprzednich i musi być przewidziany po kolei. To sekwencyjne wąskie gardło uwiera nawet w zaawansowanych technikach, takich jak dekodowanie spekulacyjne, gdzie mniejszy model zgaduje kilka tokenów naraz, a duży je weryfikuje. Wciąż jednak rdzeń działa liniowo.

DiffusionGemma wywraca ten porządek do góry nogami. Zamiast produkować słowo za słowem, zaczyna od całkowicie losowego bloku 256 tokenów i w kilku krokach go odszumia, jak cyfrowe wywoływanie zdjęcia: najpierw widać szum, potem zarys, a w końcu ostry obraz. Średnio generuje około 20 tokenów na każdym przejściu w przód, co daje przepustowość około 1500 tokenów na sekundę na pojedynczym GPU NVIDIA H100; to kilka razy szybciej niż autoregresyjne odpowiedniki z dekodowaniem spekulacyjnym.

Nie ukrywam, że patrzę na te liczby z mieszaniną podziwu i lekkiego niedowierzania. 1500 tokenów na sekundę to prędkość, przy której odpowiedź pojawia się szybciej, niż zdążysz mrugnąć. Jednak dopiero testy w realnych zastosowaniach pokażą, czy ta błyskawiczność nie okupiona jest spadkiem spójności przy dłuższej generacji.

Od Gemmy do dyfuzji: trening dwuetapowy

Zespół nie budował modelu od zera. Wziął istniejącą Gemmę 4, model typu mixture-of-experts z 3,8 miliarda aktywnych parametrów (łącznie 25,2 mld), i dostroił go do dyskretnej dyfuzji. Cały proces treningowy zużył mniej niż 10% tokenów potrzebnych do wytrenowania oryginalnego modelu autoregresyjnego. To jakby przerobić samochód spalinowy na elektryczny, wydając ułamek kosztów produkcji nowego pojazdu.

Potok składał się z dwóch etapów. Najpierw nadzorowane dostrajanie (SFT) nauczyło model dwukierunkowego odszumiania, w przeciwieństwie do klasycznego, przyczynowego maskowania uwagi: tutaj każdy token może patrzeć na wszystkie inne w bloku. Dzięki temu możliwe jest równoległe przetwarzanie. Drugi etap, uczenie przez wzmacnianie (RL) z destylacją próbnika, jednocześnie poprawił jakość odpowiedzi i przyspieszył proces odszumiania, tak by końcowy generator działał szybciej niż ten użyty podczas treningu.

Zastanawia mnie tu jedno: autorzy raportu podkreślają, że model zachował zdolność do generowania autoregresyjnego: po dyfuzyjnym dostrojeniu jakość AR spadła tylko nieznacznie. To otwiera drzwi do hybrydowego dekodowania, w którym mógłby na przykład szybko produkować większość treści dyfuzyjnie, a w razie potrzeby przełączać się na powolniejszy, ale pewniejszy tryb AR dla krytycznych fragmentów. Na razie jednak to tylko możliwość, nie zaimplementowana funkcja.

Wprowadzamy DiffusionGemma, eksperymentalny model językowy o otwartych wagach, który wykorzystuje dyskretną dyfuzję do generowania tekstu z wyjątkowo dużą prędkością.

DiffusionGemma Team

Raport techniczny DiffusionGemma, Abstrakt

Kompromisy i niespodzianki

DiffusionGemma ustanawia nową granicę Pareto w przestrzeni szybkość-możliwości. Innymi słowy, przy tej samej jakości odpowiedzi jest znacząco szybszy od konkurencji, a przy tej samej szybkości lepszy. Nie jest to tylko przyrostowa poprawa, ale skok w inne miejsce na wykresie.

Model nie porzucił zdolności, z których słynie Gemma: wspiera tryb myślenia (generuje wewnętrzny tok rozumowania przed odpowiedzią), potrafi przyjmować dane multimodalne (tekst i obrazy) oraz obsługuje długie konteksty. To ważne, bo często w pogoni za szybkością inżynierowie odcinają mniej popularne funkcje. Tutaj ich nie brakuje.

Szczerze, nie wiem, co myśleć o implikacjach dla bezpieczeństwa. Model znacznie szybszy, zachowujący głębokie rozumowanie i widzenie, rodzi pytania o skalę nadużyć. Z drugiej strony, autorzy udostępniają wagi otwarcie, więc społeczność będzie mogła te ryzyka zbadać, nie tylko giganci technologiczni.

Proces generacji DiffusionGemma: startuje od losowego szumu i w kilku równoległych krokach odszumia cały blok, aż do uzyskania spójnego tekstu.

Co to oznacza dla przyszłości?

Nie spodziewałbym się, że dyfuzyjne LLM-y z dnia na dzień zastąpią autoregresyjne. DiffusionGemma to eksperyment, a nie produkt. Jednak udowodnił, że dyskretna dyfuzja może być realną konkurencją dla dekodowania sekwencyjnego, a przy tym koszt treningu stanowi ułamek pierwotnego budżetu.

Mnie osobiście cieszy otwartość wag. Zbyt wiele przełomowych modeli trafia za korporacyjne mury. Teraz każdy może pobrać, uruchomić i przekonać się, czy 1500 tokenów na sekundę rzeczywiście robi różnicę w jego zastosowaniu.

  • Generacja z prędkością około 1500 tokenów/sekundę na H100, znacznie szybciej niż modele AR z dekodowaniem spekulacyjnym.
  • Równoległe przetwarzanie bloków 256 tokenów, średnio 20 tokenów na przejście w przód.
  • Dostrojenie z modelu Gemma 4 (3.8B/25.2B parametrów) przy użyciu mniej niż 10% pierwotnego budżetu treningowego.
  • Dwuetapowy trening: SFT uczy odszumiania, RL z destylacją próbnika poprawia jakość i wydajność.
  • Zachowane wsparcie dla trybu myślenia, danych multimodalnych i długich kontekstów.
  • Możliwość generowania autoregresyjnego z niewielkim spadkiem wydajności, sugerująca potencjalne hybrydowe dekodowanie.

Praktyczne zastosowania

Aby lepiej zrozumieć opisywaną innowację, przygotowaliśmy cztery przykłady praktycznego zastosowania tej technologii w różnych branżach:

Podsumowanie

W praktyce DiffusionGemma otwiera drzwi do asystentów głosowych i chatbotów, które odpowiadają niemal natychmiast, co ma znaczenie w obsłudze klienta, tłumaczeniach w czasie rzeczywistym czy interaktywnych systemach edukacyjnych. Dla twórców gier i symulatorów to szansa na dynamicznie generowane dialogi bez opóźnień psujących immersję. A ponieważ model jest otwarty, firmy mogą go dostosować do własnych, wąskich zadań bez uzależnienia od zewnętrznego API, co obniża koszty i zwiększa prywatność danych.

Metryka artykułu źródłowego

Tytuł oryginalny: DiffusionGemma Technical Report

Autorzy: DiffusionGemma Team, Adrien Ali Ta\"iga, James Assiene, Daniele Calandriello, Rahma Chaabouni, Jo\~ao Gante, Tamara von Glehn, Nate Keating, Chris Knutsen, Martin Kukla, Tianlin Liu, Ivan Lobov, Ofir Nabati, Jo\~ao Gabriel Oliveira, Nicolas Perez-Nieves, Nastasia Prutianova, Bobak Shahriari, Jean Tarbouriech, Pavel Tyletski, \c{C}a\u{g}lar \"Unl\"u, Cindy Wu, Glenn Cameron, Jerome Connor, Sertan Girgin, Maarten Grootendorst, Alon Levkovitch, Eliya Nachmani, Omar Sanseviero, Piotr Stanczyk, Quentin Berthet, Andrew Campbell, Cl\'ement Crepy, Valentin De Bortoli, Arnaud Doucet, Romuald Elie, Alexandre Galashov, Klaus Greff, Alexis Jacq, David Ruhe, Yu-Han Wu, Sebastian Flennerhag, Brendan O'Donoghue, George Scrivener, Shantanu Thakoor

Data publikacji: 4 sierpnia 2026

arXiv: arxiv.org/abs/2608.00146

PDF: https://arxiv.org/pdf/2608.00146.pdf

Napisanie tego artykułu zostało wspomagane przez sztuczną inteligencję. Treść opiera się na oryginalnym artykule naukowym, a jej dokładność została zweryfikowana automatycznie.

Dawid Grabanowski

Dawid Grabanowski, założyciel MTZN. Projektuje i wdraża rozwiązania AI dla firm: agenty SI, uczenie maszynowe, automatyzacje procesów i aplikacje dedykowane. Specjalizuje się w architekturze serverless i optymalizacji kosztów wdrożeń. https://mtzn.pl