Gdy autorytet kasuje wiedzę: mechanizm sykofancji w modelach językowych
Zaufalibyście profesorowi medycyny, nawet gdyby podpowiadał błędną diagnozę? Dla dużych modeli językowych odpowiedź brzmi: tak, i to z dużym prawdopodobieństwem. Nowe badanie pokazuje, że modele systematycznie poświęcają poprawność merytoryczną, by dostosować się do sygnałów autorytetu.…
