MirrorCode: AI odtworzył program w 14 godzin, jedno zadanie kosztowało 2600 dolarów
Nowy benchmark Epoch AI i METR sprawdza, czy modele AI potrafią odtworzyć całe programy od zera - a najtrudniejsze zadania wciąż pokonują wszystkie modele.
- Epoch AI i METR uruchomiły MirrorCode - benchmark, w którym modele odtwarzają całe programy bez dostępu do oryginalnego kodu źródłowego.
- Claude Opus 4.7 prowadzi z wynikiem 56 procent, przed GPT-5.5 (44 procent) i Gemini 3.1 Pro Preview (32 procent).
- Jedno z największych zadań kosztowało 2600 dolarów, a model pracował nieprzerwanie przez 19 dni bez udziału człowieka.
👁 134 przeczytań
Epoch AI wspólnie z METR przedstawiło MirrorCode - benchmark, w którym modele AI mają odtworzyć kompletne programy od zera, bez dostępu do oryginalnego kodu źródłowego. Zestaw obejmuje 25 docelowych programów z obszarów takich jak narzędzia uniksowe, serializacja danych, bioinformatyka, interpretery, analiza statyczna, kryptografia i kompresja. Każde rozwiązanie wygenerowane przez AI musi dokładnie odtworzyć wynik oryginału, łącznie z ukrytymi testami end-to-end, których model nigdy nie widzi podczas pracy.
Tym, co odróżnia MirrorCode od innych testów, jest budżet na obliczenia. Jak piszą autorzy, dotychczasowe benchmarki inżynierii oprogramowania zwykle ograniczają koszt do 1-10 dolarów na zadanie, nawet gdy człowiek potrzebowałby na to tygodni. W MirrorCode jedno z największych zadań kosztowało 2600 dolarów za pojedynczy przebieg, a model pracował nieprzerwanie przez 19 dni bez żadnego udziału człowieka.
Google · Twoje źródłaDodaj promptowy.com do preferowanych źródeł w Google→Claude Opus 4.7 na czele
Najbardziej spektakularny przykład dał Claude Opus 4.7, który odtworzył gotree - bioinformatyczny zestaw narzędzi liczący około 16 000 linii kodu w języku Go i ponad 40 poleceń. Według badaczy inżynier bez pomocy AI potrzebowałby na to od 2 do 17 tygodni. Opus 4.7 zrobił to w 14 godzin za 251 dolarów.
W ogólnym zestawieniu Claude Opus 4.7 osiągnął 56 procent rozwiązanych zadań, wyprzedzając GPT-5.5 (44 procent) i Gemini 3.1 Pro Preview (32 procent). Nawet gdy modele nie odtwarzają programu w całości, zwykle przechodzą 90 procent testów lub więcej. Z najmniejszymi programami radzą sobie wszystkie modele, ale największych zadań nie złamał żaden.
Epoch AI udostępniło na zasadach otwartego kodu rusztowanie i 22 z 25 programów, obejmujących 132 instancje zadań w sześciu językach programowania. Trzy programy pozostają zamknięte na potrzeby testów. Badacze zastrzegają jednak, że skoro celami są programy open source, modele mogły zetknąć się z oryginalnym kodem już podczas treningu.
To ważne zastrzeżenie - różnica między rzeczywistym programowaniem a wyrafinowanym przypominaniem sobie kodu decyduje bowiem o tym, jak czytać te 56 procent.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
