Kompresja promptów bez AI: jak stare sztuczki NLP tną koszty API o 40%
Długie prompty kosztują. Każdy token to milisekundy i grosze, a w skali setek tysięcy zapytań robi się z tego konkretny budżet. Shamin Chokshi pokazał, że można przyciąć prompt o 40%, nie dotykając modelu, nie trenując…
