🎬 Higgsfield Plus na rok 649 zł 1 990 zł -67% zostało 7 szt. albo Pro na rok 464 zł Kup teraz →
Przejdź do treści
Newsy

MirrorCode: AI odtworzył program w 14 godzin, jedno zadanie kosztowało 2600 dolarów

Nowy benchmark Epoch AI i METR sprawdza, czy modele AI potrafią odtworzyć całe programy od zera - a najtrudniejsze zadania wciąż pokonują wszystkie modele.

2 min czytania
Ostatnia aktualizacja:
MirrorCode: AI odtworzył program w 14 godzin, jedno zadanie kosztowało 2600 dolarów

👁 148 przeczytań

Epoch AI wspólnie z METR przedstawiło MirrorCode - benchmark, w którym modele AI mają odtworzyć kompletne programy od zera, bez dostępu do oryginalnego kodu źródłowego. Zestaw obejmuje 25 docelowych programów z obszarów takich jak narzędzia uniksowe, serializacja danych, bioinformatyka, interpretery, analiza statyczna, kryptografia i kompresja. Każde rozwiązanie wygenerowane przez AI musi dokładnie odtworzyć wynik oryginału, łącznie z ukrytymi testami end-to-end, których model nigdy nie widzi podczas pracy.

Tym, co odróżnia MirrorCode od innych testów, jest budżet na obliczenia. Jak piszą autorzy, dotychczasowe benchmarki inżynierii oprogramowania zwykle ograniczają koszt do 1-10 dolarów na zadanie, nawet gdy człowiek potrzebowałby na to tygodni. W MirrorCode jedno z największych zadań kosztowało 2600 dolarów za pojedynczy przebieg, a model pracował nieprzerwanie przez 19 dni bez żadnego udziału człowieka.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Claude Opus 4.7 na czele

Najbardziej spektakularny przykład dał Claude Opus 4.7, który odtworzył gotree - bioinformatyczny zestaw narzędzi liczący około 16 000 linii kodu w języku Go i ponad 40 poleceń. Według badaczy inżynier bez pomocy AI potrzebowałby na to od 2 do 17 tygodni. Opus 4.7 zrobił to w 14 godzin za 251 dolarów.

W ogólnym zestawieniu Claude Opus 4.7 osiągnął 56 procent rozwiązanych zadań, wyprzedzając GPT-5.5 (44 procent) i Gemini 3.1 Pro Preview (32 procent). Nawet gdy modele nie odtwarzają programu w całości, zwykle przechodzą 90 procent testów lub więcej. Z najmniejszymi programami radzą sobie wszystkie modele, ale największych zadań nie złamał żaden.

Epoch AI udostępniło na zasadach otwartego kodu rusztowanie i 22 z 25 programów, obejmujących 132 instancje zadań w sześciu językach programowania. Trzy programy pozostają zamknięte na potrzeby testów. Badacze zastrzegają jednak, że skoro celami są programy open source, modele mogły zetknąć się z oryginalnym kodem już podczas treningu.

To ważne zastrzeżenie - różnica między rzeczywistym programowaniem a wyrafinowanym przypominaniem sobie kodu decyduje bowiem o tym, jak czytać te 56 procent.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro+ 99 zł/mc Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie