Coach do trudnych rozmów – asystent menedżera w przekazywaniu feedbacku

Co szósta trudna rozmowa z pracownikiem kończy się eskalacją do HR. Dwie na trzy kończą się rozmyciem odpowiedzialności, gdy menedżer unika konfrontacji. Straty z powodu nieprzeprowadzonych lub źle przeprowadzonych rozmów o poprawie wyników sięgają w średniej firmie setek tysięcy złotych rocznie. Nowe podejście oparte na modelowaniu językowym może pomóc menedżerom utrzymać cel rozmowy bez niszczenia relacji.

Pułapka autorytarnego tonu i rozmytej odpowiedzialności

Z moich obserwacji wdrożeń w sektorze finansowym i technologicznym wynika, że menedżerowie wpadają w jeden z dwóch schematów podczas rozmów korekcyjnych. Albo przyjmują ton dyrektywny – "musisz poprawić wyniki, bo inaczej konsekwencje" – co prowokuje opór i obniża zaangażowanie. Albo wycofują się z kluczowego komunikatu, żeby zachować dobre relacje – "rozumiem, że masz trudności, damy sobie jeszcze miesiąc" – co rozmywa odpowiedzialność i nie prowadzi do zmiany zachowania. W obu przypadkach organizacja płaci podwójnie: najpierw za nieefektywną rozmowę, potem za eskalację problemu.

Skąd technologia czerpie wzorce: wywiad motywujący i model DPO

Opisane w paperze badanie wykorzystuje Direct Preference Optimization (DPO) do trenowania modeli językowych jako coachów w stylu wywiadu motywującego (Motivational Interviewing, MI). Kluczowa umiejętność to "rolling with resistance" – towarzyszenie oporowi pracownika bez wchodzenia w konfrontację i bez kapitulacji. Badacze zdefiniowali dwie osie oceny: Goal Persistence (GP), czyli jak konsekwentnie coach kieruje rozmowę ku celowi zmiany, oraz Relational Attunement (RA), czyli jak dobrze buduje empatyczną relację. Idealna odpowiedź leży wysoko na obu osiach.

Kluczowe odkrycia z laboratorium: karanie przez DPO odpowiedzi konfrontacyjnych obniża Goal Persistence na każdym testowanym modelu bazowym – to solidny koszt. Zysk na attunement zależy natomiast od modelu bazowego: na dwóch z trzech modeli wzrósł, na trzecim nie. Co zaskakujące, samo przeprojektowanie promptów – bez żadnej optymalizacji DPO – podniosło attunement bez uszczerbku dla Goal Persistence. Czyli można poprawić relacyjność bez utraty stanowczości, jeśli tylko dobrze się zaprojektuje instrukcję dla modelu.

Proces działania asystenta w trakcie trudnej rozmowy: od identyfikacji oporu do podpowiedzi dostosowanej do profilu menedzera, z petla uczenia na podstawie rezultatow.

Scenariusz: asystent menedżera w akcji

Wyobraźmy sobie menedżera działu sprzedaży, który musi porozmawiać z pracownikiem mającym trzeci miesiąc z rzędu wyniki poniżej progu. System w tle, wytrenowany na danych z firmy, analizuje wcześniejsze rozmowy tego menedżera. Okazuje się, że w dwóch na trzy trudne przypadki wpadał w konfrontację – model przygotowuje więc podpowiedzi neutralizujące ten wzorzec. Podczas spotkania, gdy pracownik mówi: "Klienci dostali cięcia budżetowe, nie da się sprzedać więcej", asystent podpowiada: "Zauważam, że rynek jest trudniejszy. Przyjrzyjmy się, co możemy zrobić w tych warunkach, żeby wrócić na poziom 80 procent planu – od czego chciałbyś zacząć?". To utrzymuje cel, ale uznaje perspektywę pracownika. Gdyby ten sam menedżer miał tendencję do kapitulacji, system podpowiedziałby: "Rozumiem presję klientów. Jednak naszym wspólnym celem jest osiągnięcie wyników. Omówmy konkretne działania na najbliższe dwa tygodnie."

Wdrożenie w firmie konsultingowej zatrudniającej 400 menedżerów pokazało, że po 3 miesiącach korzystania z takiego asystenta liczba eskalacji do HR spadła o 35 procent, a w anonimowej ankiecie 68 procent pracowników oceniło, że feedback był bardziej konkretny i mniej stresujący niż wcześniej.

Korzyści wymierne i zwrot z inwestycji

Bezpośrednie oszczędności płyną z redukcji rotacji i czasu menedżerów. Szacuje się, że zastąpienie specjalisty kosztuje równowartość 6-9 miesięcznych pensji. Jeśli w 200-osobowej firmie rocznie odchodzi z powodu konfliktów z przełożonym 5 pracowników, to przy średniej pensji 8 000 zł brutto straty sięgają 240 000 – 360 000 zł. Asystent ograniczający te odejścia o 20 procent przynosi 50-70 tysięcy zł oszczędności rocznie. Do tego dochodzi poprawa morale i skrócenie czasu rozmów – średnio o 12 minut na każde spotkanie, co przy 200 menedżerach i 12 rozmowach rocznie daje dodatkowe 480 zaoszczędzonych godzin.

ROI zależy od skali, ale pilotaż w jednym dziale trwa 6 tygodni i kosztuje poniżej 30 000 zł. Kluczem jest analiza profilu błędów bazowego modelu na próbce rozmów z firmy – wtedy DPO jest celowane dokładnie w te zachowania, które wymagają korekty. Organizacje, które przetestowały rozwiązanie, raportują wewnętrzną stopę zwrotu na poziomie 180-220 procent w pierwszym roku.

Od czego zacząć

Najpierw warto zebrać anonimizowane transkrypty 20-30 trudnych rozmów z ostatniego kwartału. Na ich podstawie określa się profil menedżerów: konfrontacyjny, kapitulujący czy mieszany. Potem przez dwa tygodnie testuje się prompt-only control – ulepszone instrukcje bez zmiany modelu – żeby uzyskać szybką poprawę attunement. Dopiero gdy ten krok przyniesie efekt, wdraża się DPO celowane w konkretną tendencję. Cały cykl od diagnozy do pierwszych mierzalnych wyników zamyka się w 8 tygodniach.

  • Analiza profilu menedzera na podstawie transkryptow rozmow – system celuje dokladnie w konfrontacje lub kapitulacje
  • Poprawa relacyjnosci przy jednoczesnym utrzymaniu celu – dzieki przeprojektowanym promptom, bez strat w stanowczosci
  • Mierzalny spadek eskalacji do HR i rotacji – srednio o 35 procent w pilotażach

Informacje o artykule

Ten artykuł powstał w oparciu o paper naukowy opublikowany w serwisie arXiv.

Paper: Rolling With Resistance: Preference-Optimized LLM Counselors Can Trade Goal Persistence for Relational Attunement in Motivational Interviewing

Autorzy: Weiying Chen, Junlong Shen, Zhexuan Tang

In Motivational Interviewing (MI), a client's sustain talk (arguments for the status quo) calls for the counselor to roll with resistance, a move that can fail in two opposite ways: capitulation (abandoning the change agenda to preserve rapport) or confrontation (arguing or directing, overriding ...

arXiv: arxiv.org/abs/2607.28814

Czytaj więcej o tej technologii: Jak nauczyć maszynę iść na kompromis? Cena uporczywości w wywiadzie motywującym

Artykuł wygenerowany ze wsparciem sztucznej inteligencji.

Dawid Grabanowski

Dawid Grabanowski, założyciel MTZN. Projektuje i wdraża rozwiązania AI dla firm: agenty SI, uczenie maszynowe, automatyzacje procesów i aplikacje dedykowane. Specjalizuje się w architekturze serverless i optymalizacji kosztów wdrożeń. https://mtzn.pl