🔥 Gemini Pro 18 miesięcy (voucher) 170 zł -43% do piątku Kup teraz →
Przejdź do treści
Newsy

MatrAIx: symulacja 8,3 miliarda wirtualnych użytkowników do testowania AI

Badacze stworzyli infrastrukturę, która pozwala testować systemy AI i produkty cyfrowe z udziałem miliardów syntetycznych person zamiast prawdziwych ludzi. Projekt udostępnia publicznie zestaw około miliona profili i zestaw ponad tysiąca zadań testowych.

3 min czytania
White sheet with several horizontal lines (four dark lines and one orange line) on a dark blue background.

👁 120 przeczytań

Testowanie produktów cyfrowych i systemów AI z udziałem prawdziwych ludzi jest drogie, powolne i trudne do skalowania. Automatyczne testy offline są szybsze, ale pomijają różnorodność ludzkich zachowań i preferencji. Autorzy artykułu MatrAIx - jest ich 93 - proponują wyjście z tego dylematu: infrastrukturę, która symuluje użytkowników na skalę całej ludzkości.

Trzy filary systemu

MatrAIx składa się z trzech elementów. Pierwszy to baza danych nazwana Persona 8B, zawierająca 8,3 miliarda rekordów person. Każda persona opisana jest przez 1290 wymiarów kategorycznych. Rekordy powstają na dwa sposoby: albo są próbkowane z grafu zależności, który zachowuje korelacje między atrybutami, albo wywodzone z profili napisanych przez ludzi. Publicznie udostępniony podzbiór liczy około miliona person: dokładnie 599 847 opartych na prawdziwych danych ludzkich i 400 000 syntetycznych.

Drugi element to MatrAIx Playground - cztery środowiska, w których wirtualni użytkownicy mogą oceniać i wchodzić w interakcje z produktami cyfrowymi. Są to: ankieta (Survey), czatbot AI (AI Chatbot), przeglądarka internetowa (Web) oraz aplikacja mobilna (App).

Trzeci element to zestaw 1010 zadań testowych obejmujących ponad 25 dziedzin, w tym handel, oprogramowanie, finanse i opiekę zdrowotną.

Jak przebiegały testy

Autorzy przeprowadzili 18 189 prób ewaluacyjnych na ośmiu reprezentatywnych zadaniach. Agentów zasilały trzy modele językowe: Claude Opus 4.8, GPT 5.5 i Claude Haiku 4.5. Zebrane wyniki pokazują, jak decyzje i preferencje zmieniają się w zależności od profilu osoby - autorzy wymieniają konkretne przykłady zachowań: wahanie po podwyżce ceny, gotowość do kontynuowania po awarii asystenta AI czy tolerancja na opóźnienia.

Walidacja - co i jak sprawdzono

Przeprowadzono dwa główne badania walidacyjne. Pierwsze to kontrolowane badanie na 400 próbach, które sprawdzało, czy persona zachowuje się zgodnie ze zadeklarowanymi atrybutami. Testowano dziesięć wymiarów behawioralnych we wszystkich czterech środowiskach. Zadeklarowane zachowanie zostało wyrażone lub poprawnie stłumione w 366 próbach, co daje wynik 91,5 procent. Drugie badanie polegało na tym, że sędziowie ludzcy i modele językowe oceniali jakość ekstrakcji person opartych na danych ludzkich - autorzy nie podają jednak w abstrakcie liczbowego wyniku tego drugiego badania.

Czego w dokumencie nie ma

Abstrakt nie zawiera szczegółowych wyników drugiego badania walidacyjnego, nie opisuje metodologii tworzenia grafu zależności ani nie wyjaśnia, w jaki sposób wybrano 25 dziedzin zadań testowych. Nie podano też kosztów ani czasu potrzebnego do przeprowadzenia pełnej ewaluacji w porównaniu z testami z udziałem prawdziwych użytkowników.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Co z tego wynika

Moim zdaniem MatrAIx to próba rozwiązania realnego problemu branży - ludzka ewaluacja AI jest wąskim gardłem każdego projektu. Wynik 91,5 procent zgodności person z deklarowanymi atrybutami brzmi obiecująco, ale nie wiem, jak ten wynik przekłada się na trafność wniosków, które ktoś wyciągnie z testów. Baza 8,3 miliarda profili robi wrażenie liczbowo, jednak udostępniony podzbiór to zaledwie milion rekordów - reszta pozostaje zamknięta. Nie wiadomo też, kto stoi za tym projektem instytucjonalnie ani czy narzędzie jest dostępne komercyjnie - artykuł wspomina o stronie projektu, ale nie rozstrzyga tych kwestii w abstrakcie.

Źródło: arXiv cs.AI: MatrAIx: Simulating the World with 8.3 Billion Persona Agents (dokument z 2026-08-06). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 600 zł/rok Cursor Pro 320 zł/rok Zobacz wszystko →
× powiększenie