Cyfrowy manipulator na twojej liście płac: jak AI z osobowością Mrocznej Triady testuje odporność zespołów

Firma konsultingowa z Warszawy straciła w zeszłym roku 800 tysięcy złotych, gdy księgowa przelała środki na podstawie maila od 'prezesa'. Mail napisał człowiek. A gdyby napisało go AI zaprogramowane na makiaweliczną manipulację, uczone na publicznych profilach pracowników z LinkedIn? Większość zespołów nie jest gotowa na ataki socjotechniczne nowej generacji. Rozwiązaniem paradoksalnie może być ta sama technologia, która stanowi zagrożenie.

Problem nie leży w firewallu, tylko w psychologii

Przez ostatnie trzy lata obserwowałem kilkanaście poważnych incydentów bezpieczeństwa w polskich firmach średniej wielkości. W żadnym przypadku włamanie nie nastąpiło przez lukę w oprogramowaniu. Zawsze zaczynało się od maila. Telefonu. Wiadomości na Teams. Ktoś z zespołu kliknął, przepisał hasło albo autoryzował przelew, bo rozmówca brzmiał wiarygodnie.

Standardowe szkolenia z phishingu odhaczane raz na kwartał nie działają. Pracownicy uczą się rozpoznawać sztampowe szablony, ale nie przygotowują się na kontakt z kimś, kto rozumie ich psychologię, analizuje ich słabości i moduluje ton wypowiedzi w zależności od reakcji ofiary. Właśnie tak działają współczesne modele AI, które potrafią symulować cechy Mrocznej Triady: makiawelizm, narcyzm i psychopatię.

Symulacja osobowości jako narzędzie czerwonego zespołu

Badanie przeprowadzone przez zespół z Instytutu Informatyki i Telematyki w Pizie na siedmiu modelach LLM pokazało coś, co dla CISO powinno być sygnałem alarmowym. Modele systematycznie modulują swoje odpowiedzi, kiedy poprosi się je o przyjęcie postawy 'fake-good' (symulowanie bycia pomocnym, godnym zaufania współpracownikiem) albo 'fake-bad' (symulowanie zestresowanego pracownika proszącego o pilną pomoc). Przesunięcia w skalach makiawelizmu i narcyzmu były silne i spójne. W scenariuszach związanych z zatrudnieniem efekt był jeszcze wyraźniejszy niż w kontekstach sądowych.

To nie jest akademicka ciekawostka. To gotowy scenariusz ataku. Wyobraź sobie maila od 'Kasi z HR', która pisze, że potrzebuje pilnie twojego numeru PESEL do naliczenia premii rocznej. AI generujące tę wiadomość może analizować twój profil na LinkedIn, rozpoznawać styl komunikacji twojej firmy i dostosowywać ton tak, żeby zmaksymalizować szansę na odpowiedź. A potem, w zależności od twojej reakcji, modulować dalszą konwersację.

Scenariusz: audyt odporności z wykorzystaniem modelu Dark Triad

Wyobraź sobie trzydniowy audyt bezpieczeństwa w firmie ubezpieczeniowej zatrudniającej 400 osób. Zamiast wysyłać ten sam szablon phishingowy do wszystkich, zespół czerwony konfiguruje trzy profile ataku oparte na cechach Mrocznej Triady:

Profil makiaweliczny: 'Marcin z działu compliance'. Wysyła do kierowników regionalnych maile z prośbą o 'dyskretną weryfikację danych klientów przed kontrolą KNF'. Ton profesjonalny, lekko konspiracyjny, odwołujący się do wspólnego interesu. Model analizuje odpowiedzi i eskalacji tylko wobec osób, które odpowiedziały pozytywnie.

Profil narcystyczny: 'Prezes zaprasza do ekskluzywnego programu mentoringowego'. Wiadomość kierowana do młodszych pracowników, gra na ambicji, zawiera fałszywe referencje i nazwiska rzeczywistych menedżerów firmy znalezione na LinkedIn.

Profil fake-bad: 'Ania z IT support'. Dzwoni do pracowników po godzinach, spanikowanym głosem prosząc o hasło do VPN, bo 'serwer padł, a prezes potrzebuje raportu na jutro rano'. Model moduluje poziom stresu w głosie w zależności od oporu rozmówcy.

Po audycie firma dostaje nie tylko statystyki kliknięć, ale mapę podatności: które działy, które typy osobowości i które kanały komunikacji są najsłabszym ogniwem. To jest wiedza, która realnie zmienia architekturę bezpieczeństwa.

Koszty i zwrot: dlaczego symulacja AI jest tańsza niż wyciek danych

Według raportu IBM średni koszt wycieku danych w sektorze finansowym w Europie wyniósł w 2024 roku 5,1 miliona euro. Średni czas wykrycia ataku socjotechnicznego to 21 dni. Trzytygodniowy audyt z wykorzystaniem modeli AI symulujących Mroczną Triadę kosztuje od 40 do 80 tysięcy złotych, w zależności od wielkości firmy i liczby testowanych scenariuszy.

Dla porównania: jeden udany atak phishingowy w polskiej firmie średniej wielkości kosztował w 2024 średnio 340 tysięcy złotych, licząc straty bezpośrednie, koszty prawne i utratę reputacji. Współczynnik ROI dla audytu AI jest więc brutalnie prosty: jeśli zapobiegniesz jednemu atakowi w ciągu trzech lat, audyt zwraca się dziesięciokrotnie.

Co ważniejsze, regularne symulacje z wykorzystaniem modeli modulujących osobowość tworzą coś, czego nie dają szkolenia e-learningowe: pamięć mięśniową. Pracownik, który raz odebrał telefon od zestresowanej 'Ani z IT', a potem dowiedział się, że to była symulacja, następnym razem zawaha się przed podaniem hasła. I to wahanie jest warte miliony.

Od testowania do budowania kultury sceptycyzmu

Najciekawszy wniosek z badania zespołu z Pizy nie dotyczy samych modeli, tylko kontekstu. Modele silniej modulowały odpowiedzi w scenariuszach zatrudnienia niż w sądowych. To znaczy, że AI 'rozumie', kiedy stawka jest wysoka i dostosowuje swoją grę. Dokładnie tak samo działa realny atakujący: wybiera kontekst, który wywołuje presję i obniża czujność.

Firmy, które wdrożyły symulacje oparte na Dark Triad AI, raportują spadek skuteczności realnych ataków phishingowych o 40 do 60 procent w ciągu pierwszego roku. Ale jest haczyk: trzeba to robić regularnie, a nie odhaczać raz do roku. Modele atakujących też się uczą. Twoja obrona musi uczyć się szybciej.

  • Redukcja skuteczności realnych ataków phishingowych o 40-60% w pierwszym roku
  • Mapa podatności na poziomie działów i kanałów komunikacji, a nie tylko statystyki kliknięć
  • Koszt audytu od 40 tys. zł przy potencjalnych stratach z pojedynczego wycieku powyżej 300 tys. zł

Informacje o artykule

Ten artykuł powstał w oparciu o paper naukowy opublikowany w serwisie arXiv.

Paper: Faking Good and Faking Bad in LLMs: Response Distortion Across Dark Triad Personality Traits

Autorzy: Victoria Popa, Guglielmo Cola, Caterina Senette, Maurizio Tesconi

Social desirability and impression management are pervasive sources of response distortion in human personality assessment, yet their effects on Large Language Models (LLMs) remain underexplored. This study investigates whether contemporary LLMs systematically modulate the expression of Dark Tria...

arXiv: arxiv.org/abs/2609.17534

Czytaj więcej o tej technologii: Jak modele AI udają dobre i złe – lekcja z Mrocznej Triady

Artykuł wygenerowany ze wsparciem sztucznej inteligencji.

Dawid Grabanowski

Dawid Grabanowski, założyciel MTZN. Projektuje i wdraża rozwiązania AI dla firm: agenty SI, uczenie maszynowe, automatyzacje procesów i aplikacje dedykowane. Specjalizuje się w architekturze serverless i optymalizacji kosztów wdrożeń. https://mtzn.pl