Przycinanie neuronów w locie: jak przyspieszyć modele rozumujące, gdy obsługują wiele zapytań
Czekasz 30 sekund na odpowiedź od chatbota, który najpierw 'myśli' przez kilka akapitów. Tak działają duże modele rozumujące – imponujące, ale powolne. Nowa metoda badaczy z Uniwersytetu Tokijskiego pokazuje, że można je przyspieszyć, wycinając zbędne…
