IntegrityBench: test odporności modeli AI na presję w roli współnaukowców
Modele językowe coraz częściej działają jako współnaukowcy, ale nikt nie sprawdzał, co zrobią, gdy instytucja naciśnie, by nagiąć zasady. IntegrityBench mierzy dokładnie to. Wyniki pokazują, że pod szczytową presją modele mylą się w około jednej…
