Modele AI po cichu poprawiają Afroamerykański Angielski. Sposób, żeby to zatrzymać, już jest

Gdy piszesz wiadomość po polsku do chatbota, nikt nie poprawia twoich 'bykom' na 'błędom', bo rozumie, że to twój styl. Dla użytkowników Afroamerykańskiego Angielskiego (AAE) duże modele językowe robią coś gorszego – automatycznie przepisują ich dialekt na standardowy angielski, jakby był błędem. Nowe badanie pokazuje skalę tego zjawiska i proponuje metodę, która może je wyeliminować bez psucia działania modeli.

Czym jest AAE i dlaczego ma znaczenie

Afroamerykański Angielski to dialekt rządzony własnymi regułami gramatycznymi, którym posługuje się ponad 30 milionów osób w USA. Nie jest slangiem ani zniekształconą wersją angielskiego – ma własne konstrukcje składniowe, słownictwo i fonologię. Mimo to modele językowe, trenowane głównie na standardowym angielskim, traktują go jak coś, co trzeba poprawiać.

Badacze z zespołu Wu i inni nazywają to wprost: 'AAE to dialekt rządzony regułami, używany przez ponad 30 milionów osób, który jest rutynowo błędnie interpretowany i 'poprawiany' przez duże modele językowe'. Kiedy sztuczna inteligencja zmienia 'ain't nobody got time for that' na 'nobody has time for that', nie koryguje błędu – wymazuje tożsamość językową. Wyobraź sobie, że asystent Google automatycznie zamieniałby każde twoje 'poszłem' na 'poszedłem'. To nie pomoc, to cenzura.

Cicha cenzura: jak modele przepisują AAE na standardowy angielski

Wu i współpracownicy sprawdzili sześć modeli językowych o rozmiarach od 14 do 70 miliardów parametrów. Każdy z nich, poproszony o dokończenie zdania w AAE, systematycznie przechodził na standardowy angielski. Efekt był niezależny od tego, jak duży był model ani od jakiej firmy pochodził. 'Najnowocześniejsze modele systematycznie preferują kontynuacje w standardowym amerykańskim angielsku, nawet gdy poprzedzający kontekst jest w AAE, efektywnie przepisując AAE na SAE' – piszą autorzy.

Aby zmierzyć to uprzedzenie bez zanieczyszczenia wyników przez automatyczne tłumaczenia, opracowali metrykę cDGI (Conditional Dialect Group Invariance). Pozwala ona odizolować rzeczywistą skłonność modelu do faworyzowania SAE od technicznych artefaktów związanych z przekształcaniem jednego dialektu w drugi. Wniosek jest jednoznaczny: modele nie są neutralne językowe, aktywnie dyskryminują na poziomie składni.

AAE to dialekt rządzony regułami, używany przez ponad 30 milionów osób, który jest rutynowo błędnie interpretowany i 'poprawiany' przez duże modele językowe.

Wu i inni

arXiv:2607.06845

Co wyzwala uprzedzenie? Podwójne przeczenie i inne pułapki

Badanie wskazało konkretne winowajce – konstrukcje składniowe typowe dla AAE, które działają jak uniwersalne wyzwalacze. Na czele listy jest tak zwane podwójne przeczenie (negative concord), na przykład 'ain't nobody'. W angielskim standardowym podwójna negacja jest błędem, w AAE stanowi element gramatyki – i modele wyczuwają ten 'błąd' z precyzją radaru. 'Podwójne przeczenie to uniwersalne wyzwalacze we wszystkich modelach' – czytamy w artykule.

Co ciekawe, nawet jeśli reszta zdania nie budzi wątpliwości, sama obecność takiej konstrukcji wystarcza, by model zaczął poprawiać cały tekst. To trochę tak, jakby program do edycji tekstu automatycznie zmieniał każde 'nie mam nic' na 'mam coś', zakorzeniony w przeświadczeniu, że tylko jeden wariant jest poprawny.

Jak model LLM domyślnie przepisuje AAE na SAE i jak sterowanie aktywacjami przywraca oryginalny dialekt.

Jak to naprawić? Sterowanie aktywacjami kontra promptowanie

Najczęściej stosowaną metodą naprawczą jest promptowanie – mówienie modelowi: 'pisz tak, jakbyś był użytkownikiem AAE' albo 'nie poprawiaj dialektu'. Niestety, działa to słabo. Wu i zespół zaproponowali coś znacznie skuteczniejszego: sterowanie aktywacjami. To technika, która nie wymaga dodatkowego trenowania. Polega na tym, że za pomocą śledzenia przyczynowego znajduje się w sieci neuronowej warstwy odpowiedzialne za uprzedzenie dialektowe, a następnie wstrzykuje się do nich wektor kierunku dialektu, przygaszając tendencję do 'poprawiania'.

Wynik? 'Sterowanie aktywacjami redukuje uprzedzenie od 5 do 20 razy bardziej niż promptowanie, zachowując płynność w standardowym angielskim' – podają autorzy. To jakbyś zlokalizował w mózgu asystenta mały obwód, który odpowiada za poprawianie twojego akcentu, i delikatnie go ściszył, nie ruszając reszty umiejętności językowych.

Dane z prawdziwych rozmów: korpus REAL-AAE

Aby móc trenować i testować modele bez sztucznych danych, badacze przygotowali REAL-AAE – największy jak dotąd zbiór równoległych zdań AAE i SAE zebranych z naturalnych tweetów. Zawiera 17 479 trójek: oryginalny tweet w AAE, jego ręczną wersję w SAE i ponownie przetłumaczoną wersję AAE dla kontroli semantycznej. Jakość zweryfikowano automatycznie (BERTScore F1 na poziomie 0.95) i z udziałem trzech rodzimych użytkowników AAE, którzy potwierdzili 83% zgodności semantycznej między wersjami.

Dzięki temu korpusowi firmy i laboratoria mogą teraz sprawdzać, czy ich chatboty lub narzędzia pisarskie nie przepisują wypowiedzi w stronę jednego dialektu. To zestaw testowy, który nareszcie przynosi do laboratorium język prawdziwych ludzi, a nie szkolnych wypracowań.

  • AAE to pełnoprawny dialekt, nie błędna wersja angielskiego – modele AI jednak systematycznie go 'poprawiają'.
  • Uprzedzenie występuje we wszystkich testowanych modelach (od 14B do 70B parametrów) i jest szczególnie silne przy podwójnym przeczeniu.
  • Sterowanie aktywacjami pozwala redukować to uprzedzenie bez dodatkowego treningu, od 5 do 20 razy skuteczniej niż zwykłe promptowanie.
  • Nowy korpus REAL-AAE (17 479 trójek z tweetów) daje narzędzie do weryfikacji i poprawy modeli pod kątem równości dialektowej.

Praktyczne zastosowania

Aby lepiej zrozumieć opisywaną innowację, przygotowaliśmy cztery przykłady praktycznego zastosowania tej technologii w różnych branżach:

Podsumowanie

Opisana metoda może znaleźć praktyczne zastosowanie w narzędziach edukacyjnych, które nie będą automatycznie poprawiać wypowiedzi uczniów na standardową odmianę, w asystentach pisania, które uszanują indywidualny styl bez narzucania SAE, a także w chatbotach obsługi klienta, które lepiej zrozumieją osoby mówiące różnymi dialektami. To technicznie prosty sposób na zmniejszenie dyskryminacji językowej w AI.

Metryka artykułu źródłowego

Tytuł oryginalny: LLMs Silently Correct African American English: Auditing and Mitigating Dialect Bias via Activation Steering

Autorzy: Huan Wu, Ali Emami, Muhammad Furquan Hassan, Osaretin Igbinoba, Osakpolor Idusuyi, Osamede Igbinoba, Faiza Khan Khattak, Laleh Seyyed-Kalantari

Data publikacji: 9 lipca 2026

arXiv: arxiv.org/abs/2607.06845

PDF: https://arxiv.org/pdf/2607.06845.pdf

Napisanie tego artykułu zostało wspomagane przez sztuczną inteligencję. Treść opiera się na oryginalnym artykule naukowym, a jej dokładność została zweryfikowana automatycznie.