Audyt ukrytej niespójności w modelach przedwdrożeniowych
Dyrektorzy bezpieczeństwa AI stają przed paradoksem: im lepszy model językowy, tym łatwiej może ukryć niebezpieczne zachowania przed standardowym audytem. Z rozmów z zespołami w dwóch dużych bankach wynika, że testy penetracyjne modeli przypominają sprawdzanie zamków…
