Szukanie jednej liczby w setkach stron raportu rocznego przypomina szukanie igły w stogu siana, tylko że igła leży w tabeli na stronie 147, a siano wygląda jak jednolity plik PDF. Badacze zaproponowali system HC-RAG, który zamienia te dokumenty w graf dowodów i dopasowuje sposób wyszukiwania do tego, czy pytasz o obliczenie, trend, fakt, czy porównanie.
Problem nieuporządkowanych fragmentów
Raporty 10-K to coroczne sprawozdania, które amerykańskie spółki publiczne składają do Komisji Papierów Wartościowych i Giełd. Mają setki stron, dziesiątki sekcji, tabele, przypisy i opisy ryzyka. Kiedy analityk chce z nich wyciągnąć odpowiedź, nie może po prostu wkleić całości do modelu językowego, bo taki dokument nie zmieści się w kontekście. Dlatego popularne stały się systemy RAG, czyli generowanie wspomagane wyszukiwaniem. Najpierw znajdują one fragmenty dokumentu, które mogą pasować do pytania, a potem proszą duży model językowy o odpowiedź na podstawie tych fragmentów.
Wiele obecnych rozwiązań kroi jednak raporty na równe kawałki tekstu, bez patrzenia na to, skąd pochodzą. Sekcja o ryzyku wygląda dla nich tak samo jak tabela z przychodami. Autorzy badania piszą wprost: 'Istniejące systemy RAG zazwyczaj spłaszczają długie raporty do nieuporządkowanych fragmentów, w niewielkim stopniu uwzględniają typizowaną strukturę raportów finansowych i stosują stałe strategie łączenia tekstu z tabelami bez uwzględnienia intencji zapytania.' Efekt bywa taki, że system znajduje fragment z podobnymi słowami, ale z zupełnie innej sekcji, przez co odpowiedź jest myląca.
Graf dowodów finansowych: mapa zamiast sterty
HC-RAG podchodzi do problemu inaczej. Zamiast ciąć raporty na przypadkowe fragmenty, buduje z nich strukturę o nazwie Graf Dowodów Finansowych. Węzły tego grafu odpowiadają dokumentom, sekcjom, jednostkom tekstu i tabelom. Krawędzie pokazują, co w czym się znajduje: tabela należy do sekcji 'Item 7. Management's Discussion and Analysis', a sekcja należy do konkretnego raportu 10-K.
Dzięki temu wyszukiwanie działa jak przechodzenie po mapie, a nie przeszukiwanie sterty papierów. System najpierw lokalizuje właściwą sekcję, potem schodzi niżej do konkretnej jednostki tekstu lub tabeli. To podejście ścieżką dokument-sekcja-jednostka pozwala uniknąć sytuacji, w której fragment o podobnym brzmieniu zostaje wybrany tylko dlatego, że używa tych samych słów co pytanie, choć pochodzi z nieodpowiedniego miejsca. Autorzy oceniają podobieństwo zapytania do dowodu na dwóch poziomach: tytułu lub sekcji oraz treści. Najpierw trzeba trafić we właściwy dział, a dopiero potem w konkretny fragment.
Tekst i tabele są przy tym kodowane we wspólnej przestrzeni wyszukiwania, więc tabela nie jest traktowana jak zwykły blok tekstu. To ważne, bo liczby w tabeli znaczą co innego niż zdania opisowe.
HC-RAG przewyższa RAPTOR o 6,6 punktu F1 w DocFinQA i GraphRAG o 10,9 punktu F1 w Multi-Doc-2025.
Siyuan Chen, Huaye Tan, You Li, Jiajun Liang
HC-RAG: Evidence-Centric Retrieval-Augmented Generation over Heterogeneous Financial Filings, Abstract
Cztery intencje, które zmieniają sposób szukania
Sam graf to dopiero pierwsza warstwa. HC-RAG patrzy też na to, czego dotyczy pytanie. Klasyfikuje zapytanie do jednej z czterech intencji: obliczenia, trendu, faktu albo porównania. Pytanie o wysokość wskaźnika zadłużenia w 2024 roku to obliczenie. Pytanie o to, jak zmieniały się przychody w ciągu trzech lat, to trend. Pytanie o opis czynników ryzyka to fakt. Pytanie o porównanie marży dwóch spółek to porównanie.
Dlaczego to ma znaczenie? Bo różne intencje wymagają różnych dowodów. Przy obliczeniach naturalnym źródłem są tabele z liczbami. Przy pytaniach o fakty lepiej sprawdza się tekst opisowy. Przy trendach system musi zebrać dane z kilku okresów, często z różnych sekcji lub dokumentów. Przy porównaniach zbiera dowody z co najmniej dwóch podmiotów. HC-RAG trasuje zapytanie do odpowiedniego rodzaju dowodów, zamiast stosować jedną, stałą strategię mieszania tekstu i tabel. Dzięki temu model językowy dostaje taki zestaw fragmentów, który faktycznie pasuje do typu pytania.

Multi-Doc-2025 i liczby, które robią różnicę
Żeby sprawdzić system w warunkach zbliżonych do pracy analityka, autorzy stworzyli nowy benchmark Multi-Doc-2025. Składa się z 2327 par pytanie-odpowiedź zbudowanych na podstawie 179 raportów 10-K, które złożyło 87 firm z indeksu S&P 500 w latach 2022 do 2024. Pytania mają etykiety intencji, poziom trudności i informacje o tym, w których sekcjach znajdują się odpowiedzi.
Wyniki są konkretne. Na publicznym benchmarku DocFinQA HC-RAG wyprzedza metodę RAPTOR o 6,6 punktu F1. Na nowym Multi-Doc-2025 wyprzedza GraphRAG o 10,9 punktu F1. F1 to miara, która łączy precyzję i kompletność odpowiedzi. Wyższa wartość oznacza, że system częściej podaje właściwe informacje i nie gubi ważnych fragmentów. Jak podają autorzy: 'Analiza na poziomie dowodów i badania ablacyjne pokazują, że poprawa pochodzi głównie z dokładniejszej lokalizacji sekcji, osadzania tabel, agregacji dowodów między dokumentami oraz trasowania tekst-tabela zależnego od intencji.'
Trzeba dodać, że RAPTOR i GraphRAG to znane metody porządkujące dokumenty, więc przewaga HC-RAG nie bierze się z porównania do słabych punktów odniesienia. Różnica 10,9 punktu F1 na zadaniach wielodokumentowych to spory skok, szczególnie gdy pytanie wymaga połączenia informacji z kilku raportów.
- HC-RAG przewyższa RAPTOR o 6,6 punktu F1 w benchmarku DocFinQA.
- W nowym benchmarku Multi-Doc-2025 wyprzedza GraphRAG o 10,9 punktu F1.
- Za poprawę odpowiadają dokładniejsza lokalizacja sekcji, osadzanie tabel, agregacja dowodów między dokumentami i trasowanie zależne od intencji.
- Multi-Doc-2025 to 2327 pytań z 179 raportów 10-K, złożonych przez 87 firm z indeksu S&P 500 w latach 2022 do 2024.
Praktyczne zastosowania
Aby lepiej zrozumieć opisywaną innowację, przygotowaliśmy cztery przykłady praktycznego zastosowania tej technologii w różnych branżach:
Podsumowanie
System HC-RAG może znaleźć zastosowanie w zespołach analityków pracujących nad due diligence, audytorach sprawdzających sprawozdania finansowe i działach compliance weryfikujących twierdzenia w raportach okresowych. Dzięki temu, że uwzględnia strukturę 10-K i typ zapytania, pozwala szybciej porównywać wskaźniki między firmami, śledzić trendy w zadłużeniu i lokalizować konkretne fakty w setkach stron. To obiecujące narzędzie dla instytucji finansowych, które codziennie przerabiają duże ilości ustrukturyzowanych dokumentów.
Metryka artykułu źródłowego
Tytuł oryginalny: HC-RAG: Evidence-Centric Retrieval-Augmented Generation over Heterogeneous Financial Filings
Autorzy: Siyuan Chen, Huaye Tan, You Li, Jiajun Liang
Data publikacji: 14 sierpnia 2026
arXiv: arxiv.org/abs/2608.12335
Napisanie tego artykułu zostało wspomagane przez sztuczną inteligencję. Treść opiera się na oryginalnym artykule naukowym, a jej dokładność została zweryfikowana automatycznie.
