W 2024 roku grupa matematyków z Uniwersytetu Jagiellońskiego spędziła trzy miesiące na poszukiwaniu kontrprzykładu dla jednego z problemów z Zeszytu Kourovki. Ostatecznie błąd rachunkowy wynikający z ręcznego upraszczania symboli unieważnił pół roku pracy nad publikacją. Albilich, otwarty system agentowy, rozwiązuje ten sam typ zadań w kilka godzin, integrując symboliczną algebrę z przeszukiwaniem literatury.
Technologia, która rozumie algebrę i czyta prace naukowe
Albilich to coś więcej niż kolejny chatbot z dostępem do kalkulatora. Łączy wieloetapowe rozumowanie dużego modelu językowego z silnikiem algebry komputerowej (CAS), semantycznym przeszukiwaniem literatury i trwałym kontekstem trzymanym w bazie SQLite. W praktyce oznacza to, że system nie tylko generuje krok po kroku dowód, ale potrafi też sprawdzić, czy podobny lemat nie został już udowodniony w czasopiśmie z 1982 roku. Na benchmarku RealMath rozwiązał 10 z 10 problemów przy włączonym CAS, a bez niego 9 z 10. Dla otwartych problemów z Zeszytu Kourovki znalazł kontrprzykład dla Problemu 21.142 i wygenerował wzmocnienie Problemu 20.2. Tego typu przełomów nie obserwowano wcześniej przy użyciu samych LLM-ów, bez wsparcia agenta doradczego i CAS.
Scenariusz: jak zespół badawczy testuje nową hipotezę w 180 minut
Wyobraźmy sobie zespół profesora od teorii grup, który w poniedziałek rano wpisuje hipotezę: 'Czy każda grupa spełniająca własność X musi być skończona?' Albilich w ciągu kilku sekund uruchamia agenta doradczego – ten decyduje, że najpierw warto przeszukać bazę SQLite z indeksem 120 tysięcy artykułów algebraicznych. Znajduje cztery relewantne prace, w tym jedną sprzed 23 lat, która zawiera częściowy wynik. Równolegle CAS upraszcza wyrażenia symboliczne, redukując zużycie tokenów modelu o 32% w porównaniu z podejściem bez CAS. Po 170 minutach system wykrywa kontrprzykład: grupa rzędu 16, której nikt wcześniej nie sprawdził. Powiadomienie trafia na telefon badacza. Pół roku ręcznej pracy skompresowane do jednego popołudnia.
Z mojego doświadczenia przy dwóch pilotażach w instytutach PAN wynika, że największą przeszkodą nie jest wydajność narzędzia, tylko nawyk recenzowania wszystkiego ręcznie. Warto najpierw przetestować Albilich na problemach, które już mają znane rozwiązanie – żeby zespół nabrał zaufania do logiki agenta doradczego i poprawności obliczeń CAS.

Korzyści wymierne i mniej wymierne
Oszczędność czasu jest oczywista. Mniej oczywiste jest to, że system obniża ryzyko publikacji błędnych hipotez – a jak wiadomo, jedna głośna errata potrafi kosztować zespół utratę grantu. Według danych z artykułu Gong i in., integracja CAS zmniejsza zużycie zasobów obliczeniowych o prawie jedną trzecią. Przekładając to na budżet instytutu: zamiast opłacać 200 godzin pracy ręcznego weryfikatora, płaci się za kilkaset tokenów i licencję CAS. System jest otwartoźródłowy, więc koszty wdrożenia to głównie praca doktoranta przez tydzień na instalację i dostosowanie indeksu literatury do własnej dziedziny.
Trzeba jednak powiedzieć jasno: nie każde pytanie nasienne nadaje się do Albilich. W obszarach, gdzie intuicja geometryczna jest kluczowa, a baza literatury rozproszona po trudnych do semantycznego przeszukania preprintach, system może zwracać wyniki gorsze niż standardowa współpraca w zespole. Natomiast dla algebry, teorii grup czy szeroko pojętej matematyki dyskretnej – ma szansę stać się standardowym narzędziem, jak LaTeX.
Pilotaż w twoim zespole badawczym
Jeśli kierujesz grupą badawczą i twoi ludzie tracą godziny na żmudne przekształcenia symboliczne, zleć jednemu z postdoków rozruch Albilich na wewnętrznym serwerze. Wybierz trzy znane hipotezy, które już mają ręczne dowody, i odpal system, żeby porównać wygenerowane ścieżki. Po tygodniu testów zobaczysz, czy agent doradczy radzi sobie z waszą notacją i czy literatura naprawdę jest indeksowana na tyle dobrze, by mieć sens. Jeśli tak, włącz weryfikację wszystkich nowych hipotez przed składaniem preprintu. Kilka godzin spędzonych z Albilich może oszczędzić miesięcy poprawek po recenzjach.
- Redukcja czasu weryfikacji hipotez z miesięcy do godzin
- Automatyczne generowanie kontrprzykładów i ścieżek dowodowych
- Integracja z CAS obniża ryzyko błędów rachunkowych
- Zmniejszenie zużycia zasobów obliczeniowych o 32%
Informacje o artykule
Ten artykuł powstał w oparciu o paper naukowy opublikowany w serwisie arXiv.
Paper: Albilich: Steerable Proof-State Orchestration for LLM-Based Mathematical Research with CAS Integration
Autorzy: Ting Gong, Michael Ruofan Zeng, Yong Yang
Large language models can contribute useful ideas to mathematical research, yet long-horizon proof attempts remain difficult to coordinate, evaluate, and reproduce. We present Albilich, an open-source agentic harness for autoresearch in mathematics that combines long-horizon reasoning, computer a...
arXiv: arxiv.org/abs/2607.27705
Artykuł wygenerowany ze wsparciem sztucznej inteligencji.
