Joey Xiao i Haonan Huang pokazali, że agent AI może dostać goły interfejs gry, pusty plik z polityką i w jednej sesji napisać sterownik, który potem ogrywa wbudowane AI w StarCraft II oraz wygrywa pełne partie w Freeciv - darmowym klonie Cywilizacji. Gotowy program działa bez dalszego udziału modelu językowego. To pierwsze takie osiągnięcie.
Jak to działa: od pustego pliku do zwycięzcy
Ramka Gauntlet, którą zaprojektowali badacze, działa w trzech fazach. Na wejściu agent kodujący dostaje tylko opis gry, surowe API (czyli bezpośredni dostęp do tego, co widzi gracz i jakie akcje może wykonać) oraz pusty plik z polityką. W fazie rozwoju agent eksperymentuje na żywo z grą, pisze kod, testuje go i poprawia. Po jednej długiej sesji powstaje samodzielny program sterujący, który jest zamrażany.
W fazie testów ten zamrożony kontroler gra na nowych mapach, których nigdy nie widział, bez ani jednego dodatkowego zapytania do modelu językowego. Nie ma żadnych zewnętrznych bibliotek taktyk, planerów czy wspomagaczy. To trochę tak, jakby dać zdolnemu programiście dokumentację nieznanej gry, zamknąć go na weekend i kazać napisać bota. Potem bot gra sam, bez dalszych poprawek.
Próg generacyjny i dominacja w StarCraft II
Pierwsze testy przeprowadzono na niespotykanej wcześniej, proceduralnej grze typu rogalik. Wyniki odsłoniły ostry próg: w zależności od generacji modelu, odsetek wygranych na nowych mapach skakał od zera do 86 procent. Co ciekawsze, każda pojedyncza sesja systemu najnowszej generacji dawała lepszy wynik niż najlepsza sesja jego poprzednika. Nie po prostu średnio lepiej - każda z osobna biła rekord poprzedniej epoki.
W StarCraft II skompilowany kontroler, korzystający z surowego API gry, pokonał wszystkich uczciwych przeciwników wbudowanych w grę oraz dwa warianty oszukujące. To duży przeskok. Wcześniej agenci oparte na dużych modelach językowych potrzebowali setek zapytań do modelu na minutę, ręcznie konstruowanych modułów percepcyjnych i taktycznych warstw. Tutaj wszystko zastępuje jeden program, który model napisał sam.
Agenci LLM wielokrotnie mieli problem z przełożeniem wiedzy o grze na faktyczne umiejętności, nawet gdy badacze opatulali model dodatkowymi systemami - dostarczali percepcję, pamięć, biblioteki taktyk, plannery czy gotowe rusztowania.
Joey Xiao, Haonan Huang
Abstract
Cywilizacja na haku: podbój bez pomocy
Freeciv to turowa gra strategiczna o wielkiej złożoności, gdzie trzeba zarządzać miastami, armią, technologią i dyplomacją przez setki tur. Agent w pojedynczej sesji stworzył program, który wygrał pełną grę przez całkowity podbój wszystkich przeciwników na nowych ziarnach map. Odsetek zwycięstw nie był wysoki - program mierzył się z AI na poziomie nowicjusza - ale liczy się samo ukończenie partii bez zewnętrznej pomocy.
Jest to pierwszy przypadek, kiedy agent językowy wygrał samodzielnie pełną grę tego gatunku, bez wołania modelu w każdej turze i bez ręcznie doklejonej warstwy taktycznej. Wcześniejsze próby albo nie kończyły się zwycięstwem, albo wymagały ciągłego podpierania się kosztownymi wywołaniami API.
Czym jest skompilowana sprawczość
Autorzy nazywają tę zdolność 'skompilowaną sprawczością' (compiled agency): doświadczenie zdobyte podczas fazy rozwoju zostaje utrwalone w stałym programie wykonywalnym, którego architekturę w całości buduje model. Program jest inspekcyjny - można go otworzyć w edytorze i zobaczyć, jaką strategię wymyślił, które warunki sprawdza, jakie priorytety ustawił. To uderzająca różnica wobec uczenia ze wzmocnieniem, gdzie polityka jest czarną skrzynką, albo wcześniejszych agentów LLM, gdzie logika była rozprowadzona po promptach i wywołaniach.
Dzięki zamrożeniu program działa szybko i tanio, bez ryzyka, że model w trakcie gry uroi coś niespodziewanego. W QA gier już testuje się podobne agenty do automatycznego wykrywania błędów.
Szerszy obrazek: nie tylko gry
Wyniki są nierówne. W Freeciv procent wygranych był skromny, a w proceduralnym rogaliku sukces przychodził dopiero z najnowszą generacją modeli. Metoda wymaga też, żeby środowisko udostępniało surowe API, co w grach komercyjnych rzadko jest dane od ręki. Mimo to fakt, że agent łapie długoterminową strategię, w Cywilizacji trzeba planować na dziesiątki tur naprzód, jest nowy.
Poza grami ten sam mechanizm może tworzyć kontrolery do robotów na podstawie obrazu z kamery, budować symulacje biznesowe, automatyzować testowanie reguł gry. Kilka firm z branży gier już eksperymentuje z podobnymi pomysłami w QA, sprawdzając, czy agent jest w stanie sam odkryć bugi, po prostu grając i pisząc skrypty.
- Agent AI konstruuje od zera program do gry, korzystając tylko z opisu i surowego API.
- Po zamrożeniu sterownik działa bez kosztownych wywołań modelu językowego.
- Najnowsze modele przebijają starsze o rząd wielkości w proceduralnym rogaliku.
- W StarCraft II kontroler pokonuje wszystkich wbudowanych przeciwników, także oszukujących.
- W Freeciv program wygrywa pełne partie przez podbój, co jest bezprecedensowe.
- 'Skompilowana sprawczość' oznacza, że kod jest trwale zapisany i można go analizować.
Praktyczne zastosowania
Aby lepiej zrozumieć opisywaną innowację, przygotowaliśmy cztery przykłady praktycznego zastosowania tej technologii w różnych branżach:
Podsumowanie
Technologia tworzenia autonomicznych sterowników z jednej sesji może wpłynąć na robotykę, gdzie agent na podstawie obrazu z kamery mógłby sam napisać program do nowego zadania. W testowaniu gier wideo już trwają próby wykorzystania podobnych agentów do automatycznego wykrywania błędów. W dłuższej perspektywie, jeśli modele poprawią się na tyle, by tworzyć niezawodne kontrolery dla bardziej złożonych środowisk, można sobie wyobrazić systemy, które adaptują się do zmiennych warunków w symulacjach przemysłowych czy logistycznych.
Metryka artykułu źródłowego
Tytuł oryginalny: Compiled Agency: Frontier General-Purpose Coding Agents Build Winning Game Players from Bare Interaction - from Flappy Bird to StarCraft II and Civilization
Autorzy: Joey Xiao, Haonan Huang
Data publikacji: 17 września 2026
arXiv: arxiv.org/abs/2609.18996
Napisanie tego artykułu zostało wspomagane przez sztuczną inteligencję. Treść opiera się na oryginalnym artykule naukowym, a jej dokładność została zweryfikowana automatycznie.
