Dyfuzyjne LLM-y nadchodzą. DiffusionGemma generuje tekst 1500 tokenów na sekundę na jednym GPU
Zapomnij o żmudnym dekodowaniu token po tokenie. DiffusionGemma, eksperymentalny model językowy o otwartych wagach, generuje tekst hurtowo, odszumiając od razu bloki 256 tokenów. Na jednym H100 osiąga średnio 1500 tokenów na sekundę, co wyznacza nową…
