Przejdź do treści
Newsy

MirrorCode: AI odtworzył program w 14 godzin, jedno zadanie kosztowało 2600 dolarów

Nowy benchmark Epoch AI i METR sprawdza, czy modele AI potrafią odtworzyć całe programy od zera - a najtrudniejsze zadania wciąż pokonują wszystkie modele.

2 min czytania
MirrorCode: AI odtworzył program w 14 godzin, jedno zadanie kosztowało 2600 dolarów
W skrócie
  • Epoch AI i METR uruchomiły MirrorCode - benchmark, w którym modele odtwarzają całe programy bez dostępu do oryginalnego kodu źródłowego.
  • Claude Opus 4.7 prowadzi z wynikiem 56 procent, przed GPT-5.5 (44 procent) i Gemini 3.1 Pro Preview (32 procent).
  • Jedno z największych zadań kosztowało 2600 dolarów, a model pracował nieprzerwanie przez 19 dni bez udziału człowieka.

👁 134 przeczytań

Epoch AI wspólnie z METR przedstawiło MirrorCode - benchmark, w którym modele AI mają odtworzyć kompletne programy od zera, bez dostępu do oryginalnego kodu źródłowego. Zestaw obejmuje 25 docelowych programów z obszarów takich jak narzędzia uniksowe, serializacja danych, bioinformatyka, interpretery, analiza statyczna, kryptografia i kompresja. Każde rozwiązanie wygenerowane przez AI musi dokładnie odtworzyć wynik oryginału, łącznie z ukrytymi testami end-to-end, których model nigdy nie widzi podczas pracy.

Tym, co odróżnia MirrorCode od innych testów, jest budżet na obliczenia. Jak piszą autorzy, dotychczasowe benchmarki inżynierii oprogramowania zwykle ograniczają koszt do 1-10 dolarów na zadanie, nawet gdy człowiek potrzebowałby na to tygodni. W MirrorCode jedno z największych zadań kosztowało 2600 dolarów za pojedynczy przebieg, a model pracował nieprzerwanie przez 19 dni bez żadnego udziału człowieka.

Google · Twoje źródłaDodaj promptowy.com do preferowanych źródeł w Google

Claude Opus 4.7 na czele

Najbardziej spektakularny przykład dał Claude Opus 4.7, który odtworzył gotree - bioinformatyczny zestaw narzędzi liczący około 16 000 linii kodu w języku Go i ponad 40 poleceń. Według badaczy inżynier bez pomocy AI potrzebowałby na to od 2 do 17 tygodni. Opus 4.7 zrobił to w 14 godzin za 251 dolarów.

W ogólnym zestawieniu Claude Opus 4.7 osiągnął 56 procent rozwiązanych zadań, wyprzedzając GPT-5.5 (44 procent) i Gemini 3.1 Pro Preview (32 procent). Nawet gdy modele nie odtwarzają programu w całości, zwykle przechodzą 90 procent testów lub więcej. Z najmniejszymi programami radzą sobie wszystkie modele, ale największych zadań nie złamał żaden.

Epoch AI udostępniło na zasadach otwartego kodu rusztowanie i 22 z 25 programów, obejmujących 132 instancje zadań w sześciu językach programowania. Trzy programy pozostają zamknięte na potrzeby testów. Badacze zastrzegają jednak, że skoro celami są programy open source, modele mogły zetknąć się z oryginalnym kodem już podczas treningu.

To ważne zastrzeżenie - różnica między rzeczywistym programowaniem a wyrafinowanym przypominaniem sobie kodu decyduje bowiem o tym, jak czytać te 56 procent.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Wypisujesz się jednym kliknięciem.
// Zapytaj AI o ten news
Co o tym sądzisz?
Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

$ sitemap --all Cała strona w jednym miejscu - żeby się nie pogubić.
🛒 Sklep Kinetyka X Premium+ & SuperGrok 699 zł/rok CapCut Pro 600 zł/rok LinkedIn Premium od 149 zł/rok Zobacz wszystko → 💙 wspieraj
Redaguje
× powiększenie