Analityk funduszu private equity dostaje zadanie: porównaj wzrost przychodów i marżę EBITDA dwóch spółek z sektora SaaS za lata 2022-2024. Zaczyna od ściągnięcia czterech raportów 10-K, potem ręcznie wyciąga tabele z item 7, czyta sekcje MD&A, szuka przyczyn zmian. Zajmuje mu to minimum dwa dni, a i tak może przeoczyć rozbieżność między tabelą a komentarzem słownym. Taki problem rozwiązuje HC-RAG, system, który układa raporty finansowe w graf i odpowiada na pytania porównawcze w kilka minut.
Technologia, która rozumie pytanie analityka
HC-RAG to nie kolejny chatbot nad PDF-ami. Działa na raportach 10-K spółek publicznych, ale zasada przenosi się na każdy zestaw dokumentów finansowych. Zamiast dzielić dokumenty na przypadkowe fragmenty, buduje graf dowodów finansowych: oddzielne węzły dla sekcji, tabel, akapitów. Dzięki temu pytanie o 'wzrost przychodów' trafia do tabel z przychodami, a pytanie o 'przyczyny spadku' do sekcji MD&A. System klasyfikuje pytanie do jednej z czterech intencji: obliczenia, trend, fakt, porównanie. Dla pytania porównawczego łączy dowody z tabel i tekstu z dwóch raportów jednocześnie. To, co zwykle zajmuje analitykowi godziny przeskakiwania między dokumentami, system robi w sekundy.
Scenariusz: porównanie dwóch spółek w trzy minuty
Załóżmy, że fundusz VC rozważa inwestycję w dwie firmy e-commerce: A i B. Analityk wpisuje w interfejs: 'Porównaj wzrost przychodów i marżę EBITDA A i B w latach 2022-2024'. HC-RAG klasyfikuje intencję jako porównanie, przeszukuje graf dowodów obu raportów 10-K, wyciąga tabele z wynikami finansowymi za trzy lata oraz fragmenty MD&A, które opisują zmiany. Odpowiedź brzmi: 'Przychody A rosły średnio o 18 procent rocznie, B o 9 procent. Marża EBITDA A spadła z 22 do 17 procent, głównie z powodu wzrostu kosztów logistyki, co potwierdza cytat z MD&A A za 2024 rok'. System podaje źródło każdej liczby: sekcja, tabela, numer strony. Analityk weryfikuje w 15 minut zamiast dwóch dni. To nie jest skrót myślowy, tylko konkretne oszczędności.

Korzyści i liczby
W testach opublikowanych w artykule HC-RAG osiąga o 6,6 punktów F1 więcej niż system RAPTOR na benchmarku DocFinQA i o 10,9 punktów więcej niż GraphRAG na nowym benchmarku Multi-Doc-2025. W praktyce oznacza to mniej błędnych odpowiedzi przy pytaniach o konkretne wartości liczbowe. Dla funduszu analizującego 50 spółek rocznie oszczędność czasu sięga setek godzin. Szacunkowo: jeden analityk spędza średnio 12 godzin na pełne porównanie dwóch spółek. Przy 20 porównaniach rocznie to 240 godzin, czyli 1,5 miesiąca pracy. HC-RAG skraca to do około godziny na porównanie, wliczając weryfikację. To 220 zaoszczędzonych godzin rocznie na jednego analityka. W zespole pięciu osób daje to ponad 1000 godzin. Nawet jeśli założymy konserwatywnie, że połowa odpowiedzi wymaga dodatkowej weryfikacji, oszczędność pozostaje duża. Dochodzi do tego mniejsze ryzyko przeoczenia rozbieżności między tabelą a narracją, bo system z założenia łączy oba typy danych.
Od czego zacząć
Nie ma sensu wdrażać HC-RAG od razu na wszystkich raportach. Pilotaż powinien objąć jeden sektor i 20-30 raportów 10-K spółek, które analitycy znają najlepiej. Przygotuj pytania testowe: porównania marż, trendy zadłużenia, przyczyny spadku przepływów pieniężnych. Sprawdź, czy system podaje poprawne cytaty i czy intencja pytania jest dobrze klasyfikowana. Po dwóch tygodniach testów oceń, ile czasu realnie oszczędza zespół. Jeśli wyniki są dobre, rozszerz bazę dokumentów o raporty kolejnych firm. Największy błąd to rzucenie systemu na nieznane dokumenty bez walidacji. HC-RAG ma przewagę w lokalizacji sekcji i osadzaniu tabel, ale tylko wtedy, gdy graf dowodów jest poprawnie zbudowany. To wymaga inwestycji w parser raportów 10-K, który poprawnie rozpoznaje strukturę dokumentu.
- Skrócenie porównania dwóch spółek z 12 godzin do 1 godziny
- Redukcja błędów przy pytaniach o wartości liczbowe dzięki trasowaniu intencyjnemu
- Możliwość analizy 50+ raportów rocznych bez dodatkowych etatów
Informacje o artykule
Ten artykuł powstał w oparciu o paper naukowy opublikowany w serwisie arXiv.
Paper: HC-RAG: Evidence-Centric Retrieval-Augmented Generation over Heterogeneous Financial Filings
Autorzy: Siyuan Chen, Huaye Tan, You Li, Jiajun Liang
Financial question answering over annual reports requires more than retrieving semantically similar passages. It often involves identifying relevant companies and fiscal years, locating standardized filing sections, collecting textual and tabular evidence, and checking answers against the origina...
arXiv: arxiv.org/abs/2608.12335
Artykuł wygenerowany ze wsparciem sztucznej inteligencji.
