Klienci skarbów w korporacjach i zarządzający funduszami obstawiają kierunek stóp procentowych na podstawie konsensusu rynkowego i przeczucia. Gdy jednak ton komunikatów zmienia się między posiedzeniami, spóźniona reakcja kosztuje. Test przeprowadzony na mundialu pokazuje, jak modele językowe z dostępem do sieci mogą skrócić ten czas do minut.
Od typowania meczów do prognozowania decyzji
W 2026 roku sześć modeli językowych przeszło prospektywny test podczas mistrzostw świata. Przed każdym meczem dostawały dossier z danymi o druzynach i miały wypełnić kartę predykcyjną, zanim znany był wynik. Trafność prognoz meczowych wyniosła 63,9 procent, czyli tyle, ile daje obstawianie faworyta u bukmachera. Modele trzymały się konserwatywnie ulubieńców, unikały remisów i pchały się w te same prototypowe wyniki.
Metoda ma znaczenie nie przez samą skutecznosc, ale przez konstrukcje: ewaluacje bez wycieku danych, bo odpowiedzi nie istnialy w momencie zapytania. Przed kazdym posiedzeniem Fed czy EBC stajemy przed podobna sytuacja. Kursy rynkowe sa jak kursy bukmachera, ale pojawiaja sie nowe wypowiedzi czlonkow zarzadu albo nieoczekiwane odczyty inflacji. Model z wlasnym rozumowaniem i przeszukiwaniem sieci moze to wchlonac szybciej niz analityk omawiajacy transkrypt przy porannej kawie.
Proces: dossier, lanuch rozumowania, karta prognostyczna
Przygotowanie dossier to pierwszy krok. Zawiera protokoly z poprzedniego posiedzenia, najnowsze odczyty CPI, zatrudnienia i indeksow koniunktury oraz transkrypty wystapien publicznych z ostatnich dwoch tygodni. Dla Fed dochodza minutes i wypowiedzi z Q&A po przemowieniach. Model z wlaczona funkcja rozumowania lancuchowego wazy sygnaly: jastrzebi ton regionalnego szefa moze oslabic efekt golebi golebi danych o inflacji.
Potem system wypelnia karte predykcyjna, analogiczna do mundialowej: prawdopodobienstwo podwyzki, obnizki, utrzymania stop, a takze mozliwa skala ruchu w punktach bazowych i uzasadnienie. Wszystko to, zanim decyzja zostanie ogloszona. Test mundialowy pokazal, ze modele nie sa lepsze od rynkowego konsensusu w meczach wyraznych, ale w tych wyrownanych, gdzie informacji jest najwiecej, roznica w szybkosci moze przesadzic. W finansach to wlasnie posiedzenia z niejednoznacznymi danymi generuja najwieksze wahania na rynku walutowym i dlugu.

Scenariusz: tydzien przed EBC
Wyobraz sobie tydzien przed posiedzeniem EBC. Konsensus terminowy wycenia 80 procent szans na utrzymanie stop. W srode rano pojawia sie wywiad z czlonkiem zarzadu, ktory wczesniej uchodzil za neutralnego, a teraz mowi o ryzyku dluzszego utrzymywania sie presji placowej. Analitycy potrzebuja godziny, zeby przeczytac i porownac z wczesniejszymi wypowiedziami. Model z dostepem do wyszukiwarki internetowej przetwarza ten wywiad w minute. Analizuje, czy slowa 'second-round effects' padaly wczesniej u tej osoby, czy to nowosc. Jesli tak, podnosi prawdopodobienstwo podwyzki z 15 na 35 procent, jednoczesnie generujac wyjasnienie, na ktorych fragmentach sie opiera. Diler walutowy, ktory dostaje takie ostrzezenie na kilka godzin przed publikacja wiekszego researchu, moze zamknac krotka pozycje w eurodolarze przed gwaltownym ruchem.
Korzysci i rachunek ekonomiczny
Dla funduszu z ekspozycja na stopy procentowe bledna decyzja o 25 punktow bazowych przy nominale 100 milionow euro to 250 tysiecy euro straty. Jesli AI pomoze uniknac jednej takiej wpadki rocznie, zwraca sie wielokrotnie. Dodatkowo, zespol analitykow zamiast recznie przekopywac transkrypty, dostaje juz przetrawione sygnaly i moze skupic sie na decyzjach taktycznych.
Ograniczenia sa realne. Mundialowy test pokazal, ze modele uciekaja w prototypowe wyniki i niechetnie przewiduja zdarzenia ogonowe. W praktyce finansowej moze to oznaczac zanizone prawdopodobienstwa interwencji nadzwyczajnych albo naglych zwrotow. Dlatego traktuje te prognozy jako dodatkowy input, a nie samodzielny sygnal. Warto rowniez porownac prognozy modelu z kursami kontraktow na stopy Fed Funds czy ESTR, zeby zobaczyc, gdzie jest rozbieznosc i czy ma ona fundament w nowych danych.
Od czego zaczac
Najlepiej przeprowadzic dwumiesieczny pilota z cieniem. Wybierz dwa banki centralne, dla ktorych masz dostep do archiwalnych transkryptow i danych rynkowych. Dla kazdego posiedzenia przygotuj dossier wedlug schematu, a model niech generuje karte predykcyjna 24 godziny przed decyzja. Porownaj z faktycznymi wynikami i z konsensusem rynkowym. Jesli w ktoryms przypadku model wychwycil zmiane tonu wczesniej niz rynek, masz sygnal, zeby go wdrozyc na zywo. Test mundialowy przypomina, ze sama diagnostyka procesu jest cenniejsza niz pojedyncze trafienie. System nie zastapi doswiadczonego dlugodystansowego zarzadzajacego, ale moze dokarmic jego decyzje informacja, ktorej konkurencja jeszcze nie zdazyla przetrawic.
- Przetwarzanie nowych wypowiedzi w mniej niz minute, zamiast godzin analizy manualnej
- Systematyczne porownanie tonu wypowiedzi z historycznymi wystapieniami danego czlonka zarzadu
- Wyjasnienie lancuchowe pokazuje, ktore fragmenty przesadzily o zmianie prawdopodobienstwa
Informacje o artykule
Ten artykuł powstał w oparciu o paper naukowy opublikowany w serwisie arXiv.
Paper: WorldCup Arena: Prospective, Leakage-Free Evaluation of Frontier LLMs on a Live Tournament
Autorzy: Zhenran Wang, Zhonghan Bian, Jinsong Li, Zhangyang Qi
Benchmarks that measure the forecasting ability of large language models are almost always retrospective: the event has happened, the answer is somewhere on the Web, and the evaluation must defend itself against memorisation. We report the opposite design. Over the 39 days of the 2026 FIFA World ...
arXiv: arxiv.org/abs/2608.04008
Artykuł wygenerowany ze wsparciem sztucznej inteligencji.
