Błyskawiczne chatboty compliance na firmowych serwerach

Dyrektorzy IT w bankach od lat słyszą to samo: 'Nasze dane nie mogą wyjść poza serwerownię'. Tymczasem pracownicy męczą się z procedurami, których szukanie zajmuje im średnio 20 minut dziennie. Rozwiązanie, które działa na zwykłych procesorach i odpowiada w czasie poniżej sekundy, właśnie przestało być pobożnym życzeniem.

Problem nie do przeskoczenia: compliance, który spowalnia pracę

W dużym banku lub firmie ubezpieczeniowej dział compliance zarządza tysiącami stron dokumentów. Polityki AML, procedury KYC, wytyczne dotyczące ochrony danych osobowych, regulacje sektorowe KNF. Przeciętny pracownik pierwszej linii, który potrzebuje szybkiej odpowiedzi na pytanie 'czy mogę przyjąć ten dokument tożsamości od klienta z Ukrainy', ma trzy opcje: zadzwonić do compliance i czekać na oddzwonienie, przeszukać SharePointa ręcznie, albo zgadywać. Z moich rozmów z dwoma bankami wynika, że czas oczekiwania na odpowiedź z compliance rzadko schodzi poniżej czterech godzin. W tym czasie klient czeka, a pracownik traci rytm pracy.

Chatbot wewnętrzny oparty na Retrieval-Augmented Generation (RAG) rozwiązuje ten problem. Pod warunkiem, że działa szybko i nie wysyła dokumentów do zewnętrznego API. Tutaj właśnie wchodzi indeks wektorowy zamiast gigantycznej macierzy wyjściowej.

Skąd to opóźnienie i dlaczego GPU nie jest odpowiedzią

W standardowym modelu językowym, gdy generuje on kolejny token, musi pomnożyć swój stan ukryty przez macierz osadzeń wyjściowych. Dla modelu ze słownikiem 256 tysięcy tokenów i wymiarem ukrytym 2048 to około 524 miliony operacji zmiennoprzecinkowych na każdy wygenerowany token. Na procesorze to operacja mocno obciążająca przepustowość pamięci, nie samą jednostkę obliczeniową. Kupowanie GPU do wewnętrznego chatbota compliance, który obsługuje kilkadziesiąt zapytań na godzinę, jest jak kupowanie ciężarówki do przewożenia jednej paczki dziennie. Kosztuje fortunę, a przez 99% czasu stoi bezczynnie.

Zespół Martina Loretza i Seppa Hochreitera z Instytutu Machine Learning na JKU Linz pokazał w swoim paperze, że ten problem można obejść. Zamiast mnożyć przez całą macierz, traktują ten krok jako wyszukiwanie maksymalnego iloczynu skalarnego (MIPS) i używają do tego indeksu HNSW, czyli struktury grafowej dobrze znanej z wektorowych baz danych. Indeks zwraca tylko kilkadziesiąt najbardziej prawdopodobnych tokenów zamiast przeliczać wszystkie 256 tysięcy. Reszta dostaje zero. Wynik jest rzadkim tensorem, który zawiera tylko istotne logity.

Proces obsługi zapytania compliance z wykorzystaniem indeksu HNSW zamiast pełnej macierzy wyjściowej. Kluczowa różnica w kroku D-E: zamiast mnożyć przez całą macierz osadzeń (524M operacji), indeks zwraca tylko kilkadziesiąt kandydatów.

Konkretny scenariusz: bankowy chatbot procedur AML

Wyobraźmy sobie średniej wielkości bank komercyjny w Polsce, zatrudniający 3000 pracowników w centrali i oddziałach. Dział compliance utrzymuje około 800 dokumentów: polityki wewnętrzne, interpretacje KNF, wyroki TSUE dotyczące AML, instrukcje dla kasjerów. Wszystkie te dokumenty są indeksowane w wektorowej bazie danych (np. Qdrant lub Milvus) działającej na firmowym klastrze.

Pracownik oddziału ma przed sobą klienta z nietypową strukturą własnościową firmy. Wpisuje w wewnętrzny czat: 'Czy spółka zarejestrowana w Estonii, ale z faktycznym zarządem w Londynie, podlega uproszczonej procedurze CDD?' System RAG pobiera pięć najbardziej trafnych fragmentów z dokumentacji compliance, pakuje je do promptu i wysyła do modelu Gemma 3 270M działającego na firmowym serwerze z procesorem Intel Xeon.

Bez indeksu HNSW model generuje odpowiedź w 3,2 sekundy. Z indeksem ten sam model, na tym samym sprzęcie, odpowiada w 0,6 sekundy. Różnica 80% robi z chatbota narzędzie, którego ludzie faktycznie chcą używać, zamiast klikać w nie i iść po kawę.

Bezpieczeństwo danych bez kompromisów

Kluczowa przewaga tego podejścia dla sektora finansowego jest oczywista dla każdego, kto przeszedł audyt bezpieczeństwa w banku. Całość przetwarzania odbywa się lokalnie. Dokumenty compliance nie są wysyłane do OpenAI, Azure ani żadnego innego zewnętrznego dostawcy. Model językowy, baza wektorowa i indeks HNSW siedzą na serwerach banku, za firewallem, w tej samej sieci co reszta systemów wewnętrznych.

Co więcej, wdrożenie nie wymaga przebudowy całego pipeline'u RAG. Paper pokazuje, że wystarczy podmienić warstwę wyjściową modelu na indeks HNSW, a reszta architektury pozostaje bez zmian. To oznacza, że zespół IT nie musi wymieniać całego stosu technologicznego. Bierze istniejący pipeline RAG, podmienia jeden komponent i testuje. Z mojego doświadczenia z wdrożeń w sektorze regulowanym, każdy element, który można wymienić bez dotykania reszty systemu, skraca czas akceptacji przez architektów bezpieczeństwa o tygodnie.

Koszty i zwrot z inwestycji

Policzmy to dla banku z 3000 pracowników. Załóżmy, że każdy z nich traci średnio 15 minut dziennie na szukanie informacji w procedurach compliance. Przy stawce godzinowej 80 złotych to około 6 milionów złotych rocznie straconej produktywności. Nawet jeśli chatbot skróci ten czas o połowę, oszczędność wynosi 3 miliony złotych rocznie.

Koszt wdrożenia? Serwer z dwoma procesorami Intel Xeon 4. generacji, 128 GB RAM i dyskiem NVMe to wydatek rzędu 40-60 tysięcy złotych. Do tego dwa miesiące pracy jednego inżyniera ML i jednego devopsa, czyli około 120 tysięcy złotych. Łącznie mniej niż 200 tysięcy złotych za system, który zwraca się w pierwszym miesiącu po wdrożeniu. Bez kosztów GPU, bez opłat za API, bez ryzyka wycieku danych do chmury.

  • Przyspieszenie generowania odpowiedzi o 80% na zwykłych procesorach, bez inwestycji w GPU
  • Całość przetwarzania na serwerach firmy, dokumenty compliance nie opuszczają infrastruktury banku
  • Integracja przez podmianę jednej warstwy modelu, bez przebudowy całego pipeline'u RAG

Informacje o artykule

Ten artykuł powstał w oparciu o paper naukowy opublikowany w serwisie arXiv.

Paper: Accelerating LLM Inference via Vector Index Based Output Embeddings

Autorzy: Martin Loretz, Sepp Hochreiter

Large output embedding matrices create a significant memory bandwidth bottleneck during autoregressive decoding, especially for compact LLMs with large multilingual vocabularies. We reformulate the output projection followed by top-k token selection as a maximum inner product search over token em...

arXiv: arxiv.org/abs/2608.27460

Czytaj więcej o tej technologii: [DO PRZEGLĄDU] Indeks wektorowy zamiast gigantycznej macierzy. Jak przyspieszyć generowanie tekstu na procesorze

Artykuł wygenerowany ze wsparciem sztucznej inteligencji.

Dawid Grabanowski

Dawid Grabanowski, założyciel MTZN. Projektuje i wdraża rozwiązania AI dla firm: agenty SI, uczenie maszynowe, automatyzacje procesów i aplikacje dedykowane. Specjalizuje się w architekturze serverless i optymalizacji kosztów wdrożeń. https://mtzn.pl