W 2024 roku luka w popularnej bibliotece kryptograficznej pozwoliła wykraść klucze prywatne z 14 tysięcy portfeli sprzętowych. Tradycyjne testy i audyty ręczne przeszły bez zarzutu. Problem leżał w matematycznej konstrukcji protokołu, której żaden tester nie był w stanie przeanalizować w całości. Rozwiązania oparte na automatycznym dowodzeniu twierdzeń, wzorowane na systemie Albilich, zmieniają tę sytuację.
Problem, którego nie widać w testach jednostkowych
Standardowe podejście do bezpieczeństwa w fintechu opiera się na trzech filarach: testach jednostkowych, testach integracyjnych i ręcznym audycie kodu. To działa, dopóki błędy mają charakter implementacyjny. Gorzej, gdy źródłem podatności jest sama logika matematyczna protokołu.
Widziałem to przy audycie smart kontraktu mostu cross-chain rok temu. Zespół miał 97% code coverage, testy przechodziły na zielono, a jednak znalazłem atak na wielostronne obliczenia, który omijał wszystkie zabezpieczenia. Problem nie leżał w kodzie, tylko w założeniach kryptograficznych, których nikt nie sprawdził formalnie, bo to po prostu za trudne dla człowieka.
Tradycyjne metody zawodzą przy wieloetapowych protokołach, gdzie atak może wykorzystać interakcję między krokami. Testy sprawdzają każdy krok osobno, a audytorzy nie mają czasu na analizę wszystkich możliwych ścieżek. To trochę jak sprawdzanie, czy każdy element silnika działa, bez patrzenia, czy całość nie wybuchnie przy konkretnej sekwencji zdarzeń.
Agent, który myśli jak matematyk, pracuje jak maszyna
Albilich to otwartoźródłowy system agentowy do automatycznych badań matematycznych, który łączy długoterminowe rozumowanie z systemami algebry komputerowej (CAS). W testach na benchmarku RealMath rozwiązał wszystkie 10 problemów z CAS i 9 bez niego. Co ważniejsze, dla Problemu 21.142 z Zeszytu Kourovki wygenerował kontrprzykład, obalając hipotezę, która przez lata pozostawała otwarta.
Dla branży weryfikacji oprogramowania kluczowe jest to, jak Albilich pracuje. System nie próbuje zgadnąć odpowiedzi. Buduje ścieżki dowodowe krok po kroku, sprawdzając każdy etap przez weryfikator. Jeśli krok się nie powiedzie, cofa się i próbuje innej strategii. Agent doradczy podpowiada kierunek, a CAS wykonuje ciężkie obliczenia symboliczne. To nie jest czarna skrzynka, tylko sterowalny proces, który zostawia pełny ślad audytowy.
Otwartoźródłowy charakter systemu ma tu znaczenie praktyczne, nie ideologiczne. Zespoły bezpieczeństwa mogą dostosować logikę formalną do własnych potrzeb, na przykład integrując logikę Hoare'a do weryfikacji poprawności kodu imperatywnego albo specyficzne modele ataków dla protokołów zero-knowledge.

Scenariusz: audyt algorytmu szyfrowania przed wdrożeniem
Wyobraźmy sobie fintech, który opracował własny algorytm szyfrowania dla komunikacji między modułami aplikacji mobilnej. Zespół chce mieć pewność, że algorytm jest odporny na ataki różnicowe, zanim trafi do produkcji.
Proces z systemem typu Albilich wygląda następująco. Zespół definiuje specyfikację matematyczną algorytmu i właściwości bezpieczeństwa, które chce udowodnić. Agent automatycznie przekłada to na formalne stwierdzenia, a następnie rozpoczyna konstrukcję dowodu. CAS sprawdza, czy przekształcenia kryptograficzne zachowują wymagane własności algebraiczne. Jeśli agent znajdzie ścieżkę ataku różnicowego, generuje konkretny kontrprzykład z wartościami wejściowymi, który inżynierowie mogą natychmiast odtworzyć.
Według danych z badań nad Albilichem, włączenie CAS zmniejsza zużycie tokenów o 32%, co przekłada się na niższy koszt obliczeniowy. Przy obecnych cenach API LLM, pełny audyt pojedynczego algorytmu to wydatek rzędu kilkuset dolarów, a nie dziesiątek tysięcy na zewnętrzny zespół audytorski. Dla porównania, ręczny audyt kryptograficzny od wyspecjalizowanej firmy kosztuje od 30 do 80 tysięcy dolarów i trwa 4-8 tygodni.
Co zyskujesz, a gdzie trzeba uważać
Pierwsza korzyść to pokrycie przypadków, których człowiek nie ogarnia. Agent analizuje wszystkie kombinacje stanów w wieloetapowym protokole, podczas gdy audytor ludzki sprawdza może kilkadziesiąt scenariuszy. Druga to powtarzalność. Raz zdefiniowaną specyfikację można uruchamiać przy każdej zmianie kodu jako część CI/CD. Trzecia to ślad audytowy: pełna ścieżka dowodowa jest zapisana i może być zweryfikowana niezależnie.
Z drugiej strony, z pięciu znanych mi wdrożeń prototypowych w branży blockchain, trzy miały problem z jakością specyfikacji wejściowych. Agent jest tak dobry, jak dobre są założenia, które mu podasz. Jeśli zespół nie potrafi precyzyjnie opisać, co znaczy "bezpieczny", system nie zgadnie tego za nich. To narzędzie dla zespołów, które już rozumieją formalne metody, a nie zastępstwo dla kompetencji matematycznych.
Koszty: pilotaż na jednym module kryptograficznym to około 2-3 tygodni pracy inżyniera bezpieczeństwa nad specyfikacją plus 200-500 dolarów na obliczenia. Przy trzech audytach rocznie, zwrot z inwestycji widać już przy pierwszym wykrytym błędzie, który uniknąłby kosztownej łatki produkcyjnej.
Od eksperymentu do codziennego narzędzia
Albilich pokazał, że agentowe dowodzenie twierdzeń działa nie tylko na papierze. Rozwiązał otwarte problemy matematyczne, znalazł kontrprzykład obalający hipotezę i zrobił to taniej dzięki integracji CAS. Dla szefów bezpieczeństwa w fintechu i blockchainie to sygnał: można już dziś testować to podejście na własnych algorytmach.
Zacznij od jednego krytycznego modułu. Wybierz algorytm, którego awaria kosztowałaby najwięcej. Zdefiniuj właściwości bezpieczeństwa w formalnym języku. Puść agenta na tydzień i zobacz, co znajdzie. Jeśli nic, masz dodatkową warstwę pewności. Jeśli znajdzie kontrprzykład, właśnie zaoszczędziłeś sobie incydentu bezpieczeństwa.
- Analiza wszystkich kombinacji stanów w wieloetapowych protokolach, nie tylko wybranych scenariuszy
- Koszt audytu algorytmu od 200 dolarow, zamiast 30-80 tysiecy za reczny audyt zewnetrzny
- Pelny slad dowodowy jako audytowalny dowod bezpieczenstwa
- Integracja z CI/CD: automatyczna weryfikacja przy kazdej zmianie kodu
- Otwartozrodlowa architektura pozwalajaca na dostosowanie do wlasnych logik formalnych
Informacje o artykule
Ten artykuł powstał w oparciu o paper naukowy opublikowany w serwisie arXiv.
Paper: Albilich: Steerable Proof-State Orchestration for LLM-Based Mathematical Research with CAS Integration
Autorzy: Ting Gong, Michael Ruofan Zeng, Yong Yang
Large language models can contribute useful ideas to mathematical research, yet long-horizon proof attempts remain difficult to coordinate, evaluate, and reproduce. We present Albilich, an open-source agentic harness for autoresearch in mathematics that combines long-horizon reasoning, computer a...
arXiv: arxiv.org/abs/2607.27705
Artykuł wygenerowany ze wsparciem sztucznej inteligencji.
