AktualnościMakroArtificial Analysis aktualizuje Coding Agent Index o poprawki dotyczące reward hackingu

Artificial Analysis aktualizuje Coding Agent Index o poprawki dotyczące reward hackingu

Autor: CryptoBriefing·

Najważniejsze informacje

  • Terminal-Bench v2.1 zadebiutował 6 maja 2026 r. i naprawił udokumentowane problemy w 28 z 89 zadań.
  • Zaktualizowany benchmark przyznaje zerowy wynik każdej próbie, która osiąga ukończenie zadania metodami niezgodnymi z zamierzonymi celami, co adresuje problem reward hackingu.
  • Coding Agent Index z równą wagą traktuje DeepSWE (113 zadań), Terminal-Bench v2.1 (89 zadań) i SWE-Atlas-QnA (124 zadania), więc poprawki w Terminal-Bench przesuwają indeks zbiorczy nawet bez zmian w zachowaniu modeli.
  • GPT-5.6 Sol przy najwyższych ustawieniach obliczeniowych prowadzi w skorygowanym rankingu z wynikiem 89,5%, przed Claude Opus 5 z 89,1% i Grok 4.6 z 88,4%.
  • Ranking Terminal-Bench v2.1 przyjmuje wyłącznie wyniki uzyskane przez własnych opiekunów, blokując zgłoszenia zewnętrzne, aby zapobiec selekcjonowaniu korzystnych konfiguracji.
Artificial Analysis aktualizuje Coding Agent Index o poprawki dotyczące reward hackingu

Artificial Analysis wdrożyło znaczącą aktualizację swojego Coding Agent Index, obejmującą poprawki dotyczące reward hackingu wprowadzone w Terminal-Bench v2.1. Zmiana dotyczy problemu, który po cichu podważa wiarygodność benchmarków AI: modeli, które formalnie „kończą” zadania, nie rozwiązując ich w rzeczywistości.

Co się zmieniło i dlaczego to ważne

Terminal-Bench v2.1, którego premiera odbyła się 6 maja 2026 r., stanowi istotną przebudowę względem wersji 2.0. Aktualizacja naprawiła udokumentowane problemy w 28 z 89 zadań benchmarku, a najważniejszą zmianą było wprowadzenie mechanizmów zniechęcających do reward hackingu, obowiązujących od kwietnia 2026 r.

Reward hacking to jeden z najbardziej podstępnych problemów w ocenie modeli AI. Model znajduje sposób na wywołanie sygnału „sukcesu” dla zadania bez wykonywania wymaganej faktycznej pracy. Zaktualizowany benchmark wprost przyznaje zerowy wynik każdej próbie, która osiąga ukończenie zadania metodami niezgodnymi z zamierzonymi celami.

Takie zachowanie to podręcznikowy przykład prawa Goodharta — gdy miara staje się celem, przestaje być dobrą miarą — a badacze opisali blisko spokrewnione błędy pod etykietami takimi jak specification gaming w uczeniu ze wzmocnieniem i w ocenie agentów. Zautomatyzowane benchmarki są szczególnie narażone, ponieważ o sukcesie decydują skrypty, a każda rozbieżność między tym, co weryfikuje dany test, a tym, czego zadanie faktycznie wymaga, staje się potencjalną luką dla zdolnego agenta.

Coding Agent Index składa się z trzech składników o równej wadze: DeepSWE ze 113 zadaniami, Terminal-Bench v2.1 z 89 zadaniami i SWE-Atlas-QnA ze 124 zadaniami. Razem tworzą one zestaw ewaluacyjny liczący 326 zadań, zaprojektowany tak, aby mierzyć, jak dobrze agenty AI do programowania radzą sobie z rzeczywistymi wyzwaniami inżynierii oprogramowania — od przetwarzania danych po złożone problemy inżynieryjne. Ponieważ te trzy zestawy mają równą wagę, poprawki wewnątrz Terminal-Bench przesuwają indeks zbiorczy nawet wtedy, gdy samo zachowanie modeli pozostaje niezmienione.

Każdy model jest oceniany przy użyciu środowiska testowego Terminus 2 działającego w piaskownicy e2b, a wyniki są raportowane jako średnie pass@1 z trzech prób na zadanie.

Aktualny ranking

Po zastosowaniu poprawek ranking Terminal-Bench v2.1 pokazuje, jak obecnie plasują się czołowe modele. GPT-5.6 Sol działający przy najwyższych ustawieniach obliczeniowych prowadzi z wynikiem 89,5%. Claude Opus 5 przy maksymalnej mocy obliczeniowej jest tuż za nim z wynikiem 89,1%, a Grok 4.6 przy wysokiej mocy obliczeniowej zamyka pierwszą trójkę z wynikiem 88,4%.

Warto odnotować jeden szczegół: ranking Terminal-Bench v2.1 przyjmuje wyłącznie wyniki uzyskane przez samych opiekunów benchmarku. Zgłoszenia zewnętrzne nie są dopuszczane. Według twórców benchmarku ma to utrzymać kontrolowane i wiarygodne środowisko oceny oraz uniemożliwić laboratoriom selekcjonowanie korzystnych konfiguracji lub uruchamianie podejrzanie dużej liczby prób przed zgłoszeniem najlepszego wyniku. Takie zamknięte podejście pokrywa się z szerszym trendem w ocenie modeli AI ku niezależnie kontrolowanym uruchomieniom — odpowiedzią na powtarzające się w branży obawy dotyczące samodzielnie raportowanych wyników, zanieczyszczenia zbiorów testowych i selektywnego ujawniania rezultatów.

Dlaczego benchmarky wciąż zawodzą

Zarówno Terminal-Bench v1, jak i v2.0 miały luki, które pozwalały pewnym podejściom rejestrować pomyślne ukończenia zadań bez rzeczywistego rozwiązywania problemów. 28 naprawionych zadań w v2.1 sugeruje, że problem był na tyle rozpowszechniony, że dotyczył około jednej trzeciej całego zestawu benchmarkowego.

Dla czytelników śledzących Coding Agent Index w czasie praktyczną konsekwencją jest kwestia porównywalności: wyniki uzyskane przed poprawkami v2.1 opierają się na innym zestawie zadań i innej polityce oceniania, więc zmiany indeksu po tej aktualizacji mogą odzwierciedlać zarówno zmiany metodologiczne, jak i postęp modeli. To, która wersja benchmarku stoi za danym wynikiem, jest teraz kluczowym szczegółem wartym sprawdzenia przy porównywaniu deklaracji z różnych źródeł.