8,3 miliarda cyfrowych testerów. MatrAIx chce zastąpić ludzi w testowaniu AI

Wyobraź sobie, że wypuszczasz nową aplikację i zamiast czekać tygodniami na opinie kilkuset beta-testerów, w ciągu jednej nocy przepytujesz osiem miliardów symulowanych użytkowników. Zespół Xiaomin Li właśnie opublikował infrastrukturę, która to umożliwia. MatrAIx to symulacja całej planety w pigułce, zaprojektowana po to, żeby testować systemy AI w skali, o jakiej działy QA mogą tylko pomarzyć.

Koniec z kosztownymi i powolnymi testami na ludziach

Testowanie produktów cyfrowych z udziałem prawdziwych użytkowników jest drogie, wolne i trudno je skalować. Zebranie reprezentatywnej grupy, która odda niuanse zachowań różnych kultur, grup wiekowych czy zawodów, graniczy z niemożliwością przy budżecie mniejszym niż ten na blockbuster. MatrAIx podchodzi do problemu od drugiej strony: zamiast szukać ludzi, tworzy ich cyfrowe odpowiedniki.

Infrastruktura opiera się na Persona 8B, zbiorze 8,3 miliarda rekordów opisujących fikcyjnych, ale statystycznie realistycznych użytkowników. Każda persona ma 1290 wymiarów kategorialnych. To nie jest lista 'wiek, płeć, zawód'. To gęsta siatka cech, od tolerancji na opóźnienia po reakcję na wzrost ceny, próbkowana z grafu zależności, który pilnuje, żeby 70-letni emeryt z Podlasia nie dostał przypadkiem profilu nastolatka z Doliny Krzemowej.

Persona 8B. Jak zbudować realistyczną symulację planety

Rdzeń zbioru, około miliona person, został udostępniony publicznie. 599 847 z nich to persony osadzone w rzeczywistości (human-grounded), stworzone na podstawie profili dostarczonych przez prawdziwych ludzi. Pozostałe 400 000 to rekordy syntetyczne, które wypełniają luki i zwiększają różnorodność. Reszta pełnego zbioru 8,3 miliarda pozostaje w infrastrukturze autorów, ale ten milionowy rdzeń daje już solidną próbkę.

Kluczowym pomysłem jest graf zależności między atrybutami. Jeśli persona ma cechę 'oszczędny', to przy wzroście ceny produktu powinna wykazać wahanie. Jeśli 'lojalny wobec marki', może kontynuować zakup mimo awarii asystenta AI. Graf pilnuje, żeby takie kombinacje były spójne, a nie losowe. W kontrolowanym badaniu 400 prób, zgodność zachowań agentów z deklarowanymi atrybutami wyniosła 91,5 procent. To nie jest doskonałe, ale wystarczająco dobre, żeby traktować wyniki poważnie.

Ewaluacja systemów AI i produktów cyfrowych z udziałem ludzi jest kosztowna, powolna i trudna do skalowania.

Xiaomin Li i zespół

Abstrakt, MatrAIx

Cztery place zabaw dla agentów

MatrAIx Playground to środowisko, w którym agenci-persony wchodzą w interakcje z testowanymi systemami. Autorzy przygotowali cztery typy interakcji: ankietę, chatbota AI, przeglądarkę webową i aplikację. Do tego dorzucili 1010 zadań aplikacyjnych w ponad 25 domenach, od handlu i finansów po opiekę zdrowotną i oprogramowanie.

W ramach walidacji przeprowadzili 18 189 prób na ośmiu reprezentatywnych zadaniach, zasilając agentów modelami Claude Opus 4.8, GPT 5.5 i Claude Haiku 4.5. Wyniki pokazały coś, czego nie da się wycisnąć z jednorodnej grupy beta-testerów: zróżnicowanie decyzji i preferencji w zależności od profilu persony. Jedni użytkownicy wahali się po podwyżce ceny, inni kontynuowali sesję mimo awarii asystenta, jeszcze inni wykazywali różną tolerancję na opóźnienia. Dokładnie tak, jak w prawdziwym świecie.

91,5 procent zgodności. Czy to wystarczy?

Liczba 91,5 procent zgodności zachowań z deklarowanymi atrybutami robi wrażenie, ale zostawia też miejsce na pytania. Osiem i pół procenta rozbieżności to nie jest margines, który można zignorować, szczególnie gdy testuje się systemy mające kontakt z prawdziwymi ludźmi. Autorzy nie ukrywają tego, podkreślając, że MatrAIx ma uzupełniać testy z udziałem ludzi, a nie zastępować je całkowicie.

Jakość ekstrakcji person osadzonych w rzeczywistości została pozytywnie oceniona zarówno przez sędziów ludzkich, jak i przez modele LLM. To ważne, bo jeśli persony są źle wyekstrahowane z prawdziwych profili, cała symulacja traci sens. Podwójna walidacja daje pewność, że proces działa.

Zastanawia mnie jedno: nawet przy 91,5 procent zgodności, co z tymi 8,5 procentami, które zachowują się nieprzewidywalnie? W prawdziwym świecie to właśnie te odstępstwa często prowadzą do najciekawszych odkryć o produkcie. Może to nie wada, tylko cecha.

Co to znaczy dla testowania AI

MatrAIx dostarcza kompletne narzędzie do end-to-end ewaluacji systemów AI z udziałem symulowanych, heterogenicznych użytkowników. Zamiast kosztownych i powolnych testów na ludziach, firmy mogą przepuścić swój produkt przez miliony interakcji w ciągu godzin. Nie dostaną przy tym opinii w stylu 'to jest super' albo 'nie podoba mi się kolor', tylko twarde dane behawioralne: gdzie użytkownik się zawahał, gdzie kliknął, gdzie porzucił koszyk.

Szczerze, nie wiem, jak się czuć z tą skalą. Osiem miliardów agentów testujących aplikację o trzeciej w nocy, kiedy nikt nie patrzy. Brzmi jak scena z filmu o osobliwości technologicznej. Ale też pamiętam, ile razy widziałem produkt wypuszczony po testach na dwustu osobach, który rozsypał się przy pierwszym kontakcie z prawdziwą różnorodnością użytkowników. Może lepiej, żeby rozsypał się przy agentach.

  • 8,3 miliarda agentów-person symuluje zróżnicowanych użytkowników do testowania systemów AI i produktów cyfrowych.
  • Każda persona ma 1290 wymiarów kategorialnych, próbkowanych z grafu zależności dla zachowania spójności.
  • W badaniu walidacyjnym 400 prób, zgodność zachowań agentów z atrybutami persony wyniosła 91,5%.
  • Udostępniono publiczny rdzeń ~1 mln person (599 847 human-grounded, 400 000 syntetycznych).
  • Infrastruktura obejmuje cztery środowiska interakcji: ankietę, chatbota AI, przeglądarkę webową i aplikację.

Praktyczne zastosowania

Aby lepiej zrozumieć opisywaną innowację, przygotowaliśmy cztery przykłady praktycznego zastosowania tej technologii w różnych branżach:

Podsumowanie

MatrAIx daje firmom możliwość testowania produktów cyfrowych na symulowanej populacji w skali, która przy prawdziwych użytkownikach wymagałaby budżetu rzędu milionów dolarów i miesięcy pracy. W e-commerce można sprawdzić, jak różne profile klientów reagują na dynamiczne ceny. W developmentie aplikacji mobilnych można przetestować odporność interfejsu na frustrację użytkowników o niskiej tolerancji na opóźnienia. W sektorze zdrowotnym można zweryfikować, czy chatbot medyczny nie gubi pacjentów o określonych profilach demograficznych. To nie zastąpi testów z ludźmi, ale pozwoli wyłapać większość problemów, zanim trafią one do prawdziwych użytkowników.

Metryka artykułu źródłowego

Tytuł oryginalny: MatrAIx: Simulating the World with 8.3 Billion Persona Agents

Autorzy: Xiaomin Li, Yuexing Hao, Jianheng Hou, Jintao Huang, Qianfeng Wen, Shirley Huang, Yifan Liu, Xiaoyi Liu, Yilan Fan, Yijun Wang, Koutian Wu, Ruoqi Gao, Muhammad Ahmed Mohsin, Jing Tang, Brihi Joshi, Heming Liu, Zheyuan Deng, Zonglin Di, Sankalp Jajee, Jiuyao Lu, Zhiwei Zhang, Saksham Kapoor, Ishan Gupta, Yunhan Zhao, Chanwoo Park, Yucheng Lu, Bing Hu, Weihang Xiao, Aravind Mohan, Hanwen Xing, Runyu Zhang, Mihir Kulshreshtha, Yuanda Xu, Qianyu Zhu, Dianzhuo Wang, Yuxin Xiao, Bowen Jiang, Yongye Su, Wenhao Chai, Zuxin Liu, Lawrence Yunliang Chen, Xuandong Zhao, Ethan Ye, Shivam Patel, Jason Xie, Alex Martin Richmond, Weixiang Ding, Emre Okcular, Diya Mathew, Ziheng Wang, Rana M. Shahroz Khan, Zhejian Peng, Fang Wu, Fan Nie, Xinyang Han, Yubin Kim, Jiawei Zhang, Zhenting Qi, Huangyuan Su, Xu Pan, Abinitha Gourabathina, Hyewon Jeong, Hemanth Neelgund Ramesh, Kumail Alhamoud, Kimia Hamidieh, Zidi Xiong, Samuel Schmidgall, Pengrui Han, Yepeng Huang, Yongheng Wang, Bowen Yang, Alex Gu, Yuchu Wang, Akshay Paruchuri, Brenna Li, Hejie Cui, Jiayuan Ding, Chaosheng Dong, Jiahao Wang, Yixuan He, Chi Wang, Pamela Bhattacharya, Tianyi Peng, Paul Pu Liang, Mitchell Gordon, Yilun Du, Marinka Zitnik, James Zou, Prasanna Tambe, Philip Torr, Emily Fox, Asu Ozdaglar, Dawn Song

Data publikacji: 6 sierpnia 2026

arXiv: arxiv.org/abs/2608.04205

PDF: https://arxiv.org/pdf/2608.04205.pdf

Napisanie tego artykułu zostało wspomagane przez sztuczną inteligencję. Treść opiera się na oryginalnym artykule naukowym, a jej dokładność została zweryfikowana automatycznie.

Dawid Grabanowski

Dawid Grabanowski, założyciel MTZN. Projektuje i wdraża rozwiązania AI dla firm: agenty SI, uczenie maszynowe, automatyzacje procesów i aplikacje dedykowane. Specjalizuje się w architekturze serverless i optymalizacji kosztów wdrożeń. https://mtzn.pl