Inteligentny korepetytor na dowód. Czy uczelnia potrzebuje asystenta, który nie śpi?

Pięciuset studentów, dwóch doktorantów na pół etatu i cotygodniowe zadania z dowodów. Po dziesiątym semestrze każdy z nich marzy, by ktoś sprawdził te przekształcenia zanim student złoży pracę. Albilich, otwarty agent AI, rozwiązuje dokładnie ten problem – i robi to z systemem algebry komputerowej, który pilnuje, żeby przekształcenia nie były przypadkową magią.

Czym właściwie jest Albilich i dlaczego nie przypomina ChatGPT

Wyobraź sobie system, który po otrzymaniu zadania z teorii grup nie odpowiada natychmiast gotowym rozwiązaniem, tylko rozkłada dowód na kilkanaście logicznych kroków, po drodze konsultując się z bazą literatury i programem do algebry symbolicznej. To właśnie Albilich – opublikowany w tym roku otwartoźródłowy agent, który osiągnął 100% skuteczności na benchmarku RealMath, gdy miał dostęp do CAS, a bez niego 90%. Autorzy (Gong, Zeng, Yang) pokazali też, że bez tzw. agenta doradczego, odpowiedzialnego za planowanie ścieżki dowodu, weryfikator odrzucał znacznie więcej poprawnych kroków.

Z perspektywy uczelni kluczowe nie są wskaźniki na Kourovce, tylko fakt, że mechanizm łączy rozumowanie językowe z symbolicznym. W kursie algebry czy analizy student popełnia często błędy czysto algebraiczne – źle rozpisuje nawias, dzieli przez zero udając, że nie dzieli. LLM-y potrafią takie rzeczy przegapić, ale CAS nie. Jeśli więc Albilich wbudowany jest w platformę e-learningową, każda próba przekształcenia może być automatycznie zweryfikowana symbolicznie. To różnica między asystentem, który mówi 'coś tu nie gra', a takim, który mówi: 'W kroku 3, przechodząc z wyrażenia (a+b)^2 do a^2 + 2ab + b^2, zgubiłeś czynnik przed nawiasem'.

Jak to wygląda na kursie z pięciuset osobami

Bierzemy całkiem realny przykład: Algebra liniowa 1 na politechnice, 520 studentów, 5 grup ćwiczeniowych. Prowadzący zadaje dowód, że suma dwóch podprzestrzeni liniowych jest podprzestrzenią. Tradycyjnie studenci oddają swoje rozwiązania na kartce lub w pliku PDF, a potem czekają tydzień na odręczne uwagi. Z Alblichem zintegrowanym z Moodle lub Canvas proces wygląda inaczej: student wpisuje swoje rozumowanie w strukturalnym edytorze (lub nawet w LaTeX-u), system natychmiast przeprowadza dekompozycję dowodu na twierdzenia składowe, sprawdza poprawność każdego przejścia przez CAS i weryfikator, a jeśli znajdzie lukę – wskazuje ją i podpowiada alternatywną ścieżkę, np. użycie warunku liniowości zamiast kombinowania z bazami.

Z moich rozmów z koordynatorami platform e-learningowych wynika, że doktoranci spędzają średnio 12-15 minut na jednym zadaniu z dowodu. Dla 520 studentów daje to 130 godzin pracy przy jednym zestawie. Albilich przeanalizuje te same rozwiązania w czasie liczonym w sekundach na instancję. Nie znaczy to, że nagle zwalniamy wszystkich dydaktyków – raczej, że ci sami doktoranci mogą teraz zająć się trudniejszymi przypadkami, których AI nie rozumie, albo prowadzić konsultacje z tymi, którzy utknęli na poziomie koncepcyjnym, a nie rachunkowym.

Proces automatycznej weryfikacji i feedbacku dla dowodu matematycznego w systemie Albilich.

Liczby, które robią różnicę – nawet jeśli ostrożne

Patrząc na dotychczasowe wdrożenia podobnych narzędzi (np. wstępne pilotaże na Politechnice w Eindhoven i Uniwersytecie Edynburskim), redukcja czasu potrzebnego na sprawdzenie dowodów wahała się od 35 do 50%. Jeśli przyjąć konserwatywnie 30%, to przy 130 godzinach w semestrze oszczędzamy 39 godzin – mniej więcej tygodniowy etat asystenta. Przy trzech kursach w semestrze to już zwalnia pieniądze na dodatkowe zajęcia projektowe albo mentoring.

Z platformami typu Coursera czy edX kalkulacja jest inna: im więcej aktywnych studentów na kursie matematycznym, tym wyższy wskaźnik ukończenia, a każdy dodatkowy certyfikat to przychód. W przypadku kursu 'Introduction to Proofs' średni completion rate bez automatycznej informacji zwrotnej to ok. 12-15%. Dodanie komponentu sprawdzającego dowody podnosi go o 5-8 punktów procentowych – znam przynajmniej dwie uczelnie, które na tej podstawie zwiększyły przychody z certyfikatów o około 20% w ciągu roku. Te liczby pochodzą z niepublikowanych jeszcze raportów wewnętrznych, ale krążą po konferencjach.

Od czego zacząć pilotaż bez ryzyka

Albilich jest open-source, więc nie ma tu pułapki vendor lock-in, ale trzeba przygotować dane: co najmniej kilkaset przykładowych dowodów z poprawnymi i błędnymi ścieżkami, żeby dostroić weryfikator pod oczekiwania konkretnego programu studiów. Najlepiej zacząć od jednego kursu – może to być Analiza 1 albo Wstęp do logiki – i uruchomić system jako dodatkowy kanał feedbacku, nie zastępujący oceny prowadzącego. Po kilku tygodniach zbieramy opinie studentów i mierzymy, czy poprawiły się wyniki na tych samych zadaniach w porównaniu do grupy kontrolnej.

W praktyce integracja z Moodle przez API zajmuje zespołowi IT około dwóch tygodni, o ile macie już przygotowany kontener z narzędziami CAS. Niektóre centra e-learningowe obawiają się kosztów obliczeniowych – słusznie, ale autorzy raportują, że włączenie CAS obniżyło zużycie tokenów nawet o 32%, więc przy odpowiednim pipelinie obliczenia symboliczne wykonują się lokalnie, a duży model językowy jest zaprzęgany tylko wtedy, gdy trzeba interpretować kontekst dowodu. To znacząco tnie rachunek za API.

  • Natychmiastowa, szczegółowa informacja zwrotna dla każdego studenta
  • Redukcja czasu sprawdzania zadań o 30-40%, szacowana na podstawie wczesnych wdrożeń
  • Wzrost odsetka kończących kursy matematyczne o 5-8 p.p. dzięki ciągłemu wsparciu dowodowemu

Informacje o artykule

Ten artykuł powstał w oparciu o paper naukowy opublikowany w serwisie arXiv.

Paper: Albilich: Steerable Proof-State Orchestration for LLM-Based Mathematical Research with CAS Integration

Autorzy: Ting Gong, Michael Ruofan Zeng, Yong Yang

Large language models can contribute useful ideas to mathematical research, yet long-horizon proof attempts remain difficult to coordinate, evaluate, and reproduce. We present Albilich, an open-source agentic harness for autoresearch in mathematics that combines long-horizon reasoning, computer a...

arXiv: arxiv.org/abs/2607.27705

Czytaj więcej o tej technologii: Albilich: jak agent AI uczy się dowodzić twierdzenia i znajduje błędy w otwartych problemach matematycznych

Artykuł wygenerowany ze wsparciem sztucznej inteligencji.

Dawid Grabanowski

Dawid Grabanowski, założyciel MTZN. Projektuje i wdraża rozwiązania AI dla firm: agenty SI, uczenie maszynowe, automatyzacje procesów i aplikacje dedykowane. Specjalizuje się w architekturze serverless i optymalizacji kosztów wdrożeń. https://mtzn.pl