[DO PRZEGLĄDU] Indeks wektorowy zamiast gigantycznej macierzy. Jak przyspieszyć generowanie tekstu na procesorze
Każdy, kto próbował uruchomić duży model językowy na zwykłym laptopie, wie, że generowanie tekstu potrafi być boleśnie powolne. Problem nie zawsze tkwi w samej sieci neuronowej, ale w gigantycznej macierzy wyjściowej, która dla każdego tokena…
