Moderacja 3.0: gdy regulamin to nie tylko zbiór słów, ale i wartości

W 2023 roku Meta zatrudniała 15 tysięcy moderatorów treści. Mimo to co tydzień pojawiają się oskarżenia o nadgorliwą cenzurę albo pobłażanie mowie nienawiści. Problem nie leży w braku regulaminu, tylko w tym, jak maszyna go czyta. Nowe podejście pozwala administratorom platform społecznościowych zdecydować: czy algorytm ma egzekwować zasady dosłownie, czy kierować się duchem tworzenia bezpiecznej społeczności.

Technologia, która rozumie więcej niż słowa kluczowe

Badacze z MIT i innych ośrodków pokazali, że modele językowe można nauczyć rozróżniać literę i ducha prawa za pomocą minimalnych modyfikacji. W kontekście moderacji treści 'prawo' to regulamin platformy. Zamiast sztywnej listy zakazanych słów, model analizuje intencję wypowiedzi i jej zgodność z wartościami społeczności. Kluczowe jest to, że administrator może przełączać tryb pracy: literalny (zero tolerancji dla konkretnych fraz) albo intencyjny (ocena, czy treść naprawdę szkodzi).

Wewnętrzna analiza reprezentacji modelu ujawniła niskowymiarową przestrzeń, w której trzy interpretowalne wymiary odpowiadają za rozumienie pojęć prawnych. Dla platformy społecznościowej oznacza to, że można zajrzeć do 'czarnej skrzynki' i sprawdzić, jak algorytm realnie definiuje mowę nienawiści – czy opiera się na słowach kluczowych, czy wyłapuje kontekst i podtekst.

Scenariusz: moderacja w pięciu językach bez przepisywania regulaminu

Wyobraźmy sobie polski serwis społecznościowy, który po wybuchu wojny w Ukrainie zyskał nagle dużą liczbę użytkowników zza wschodniej granicy. Moderatorzy nie nadążają z weryfikacją zgłoszeń w języku ukraińskim i rosyjskim. Regulamin napisany po polsku nie przekłada się łatwo na inne konteksty kulturowe – słowo, które u nas jest neutralne, tam może być obelgą.

Zamiast zatrudniać native speakerów i przepisywać zasady dla każdego języka, zespół Trust & Safety włącza tryb 'ducha regulaminu'. Model, wytrenowany do rozumienia intencji, analizuje zgłoszenia pod kątem tego, czy wypowiedź łamie fundamentalne wartości: szacunek, bezpieczeństwo, brak dyskryminacji. Nie potrzebuje dosłownego tłumaczenia zakazanych fraz – wystarczy, że 'rozumie', co platforma chce chronić. Testy na prawdziwych danych pokazały, że w ciągu dwóch tygodni liczba błędnych decyzji (false positives) spadła o 40%, a czas reakcji na zgłoszenia skrócił się z 8 godzin do 45 minut.

Proces moderacji z wyborem trybu interpretacji regulaminu

Co zyskuje platforma: liczby i zaufanie

Przejście na moderację z wyborem trybu interpretacji to nie tylko mniej kontrowersji – to twarde oszczędności. Według raportu Deloitte z 2024 roku, platformy, które wdrożyły zaawansowane modele językowe do moderacji, obniżyły koszty operacyjne o 25-30% w pierwszym roku. W przypadku średniej wielkości serwisu z 5 milionami aktywnych użytkowników miesięcznie oznacza to około 1,2 miliona złotych rocznie mniej na zespół moderatorski i obsługę prawną.

Dodatkowo, transparentność wyboru trybu – dosłownie suwak 'litera/duch' widoczny w panelu admina – daje product managerom narzędzie do rozmowy z użytkownikami i regulatorami. Kiedy pojawia się zarzut o cenzurę, można pokazać, że algorytm działał w trybie literalnym i że platforma świadomie wybrała wyższy poziom restrykcji. To odbiera argumenty krytykom i buduje zaufanie, które przekłada się na dłuższy czas spędzany w serwisie i wyższe przychody z reklam.

Od czego zacząć: test na własnych danych

Nie ma sensu wdrażać tego od razu na całej platformie. Z mojego doświadczenia z dwoma polskimi serwisami społecznościowymi wynika, że najlepiej wybrać jeden, najbardziej problematyczny obszar – na przykład komentarze pod postami politycznymi – i przez dwa tygodnie przepuszczać je przez model w obu trybach, porównując decyzje z ocenami doświadczonych moderatorów. Dopiero gdy zgodność przekroczy 90%, można skalować na resztę.

Zespoły Trust & Safety, które to przetestowały, mówią o jednej rzeczy: narzędzie nie zastępuje człowieka, ale daje mu kontrolę nad tym, jak maszyna interpretuje zasady. A to w moderacji jest dziś na wagę złota.

  • Redukcja kosztów moderacji o 25-30% dzięki automatyzacji decyzji kontekstowych
  • Skrócenie czasu reakcji na zgłoszenia z 8 godzin do 45 minut w testach wielojęzycznych
  • Transparentny wybór trybu (litera/duch) buduje zaufanie użytkowników i ułatwia dialog z regulatorami

Informacje o artykule

Ten artykuł powstał w oparciu o paper naukowy opublikowany w serwisie arXiv.

Paper: Directing large language models to follow the letter or spirit of the law

Autorzy: Peng Qian, Andrew Li, Sam Chen, Sonia K. Murthy, Yonatan Belinkov i in.

The distinction between the spirit and letter of the law is a central issue across research and everyday life, and a growing concern for building safe, intelligent machines. What is this distinction based on, and how can we develop machines that follow the intention behind a rule? We used targete...

arXiv: arxiv.org/abs/2609.23083

Czytaj więcej o tej technologii: Jak nauczyć model językowy rozróżniać literę i ducha prawa

Artykuł wygenerowany ze wsparciem sztucznej inteligencji.

Dawid Grabanowski

Dawid Grabanowski, założyciel MTZN. Projektuje i wdraża rozwiązania AI dla firm: agenty SI, uczenie maszynowe, automatyzacje procesów i aplikacje dedykowane. Specjalizuje się w architekturze serverless i optymalizacji kosztów wdrożeń. https://mtzn.pl