AktualnościMakroFramework SIFT od MIT i Sakana AI obniża koszt oceny samoudoskonalających się agentów programistycznych

Framework SIFT od MIT i Sakana AI obniża koszt oceny samoudoskonalających się agentów programistycznych

Autor: CryptoBriefing·

Najważniejsze informacje

  • •SIFT osiągnął wynik 35,1% na benchmarku programistycznym Polyglot w zaledwie 30 krokach ekspansji, przewyższając Darwin Gödel Machine z wynikiem 30,7%, który wymagał przeszukiwania o 80 węzłach.
  • •Framework zastępuje pełne testowanie każdej proponowanej zmiany sędzią będącym dużym modelem językowym, którego parami wyrażone preferencje są przekształcane w rankingi za pomocą zregularyzowanego modelu Bradleya-Terry'ego.
  • •Konfiguracja oparta na modelu o otwartych wagach Qwen3-Coder-30B firmy Alibaba zakończyła całe przeszukiwanie w 224 godzinach CPU przy około 34 dolarach kosztów API — mniej więcej jednej dziesiątej zasobów zużytych przez DGM.
  • •SIFT poprawił również wyniki na TerminalBench 2.1 z 29,2% do 36,7% oraz na S-60 z 40,0% do 52,1%.
  • •Skuteczność metody zależy od trafności ocen modelu językowego pełniącego rolę sędziego, co badacze wskazują jako kluczowe otwarte pytanie w miarę skalowania przeszukiwań.
Framework SIFT od MIT i Sakana AI obniża koszt oceny samoudoskonalających się agentów programistycznych

Agenty programistyczne zdolne do przepisywania własnego kodu źródłowego niosą ukryty koszt, który ma niewiele wspólnego z samym generowaniem zmian: każda samomodyfikacja musi zostać zweryfikowana, zanim ktoś będzie mógł stwierdzić, czy faktycznie pomogła. Badacze z MIT i Sakana AI uważają, że znaleźli znacznie tańszy sposób na przeprowadzenie tej weryfikacji.

Ich framework, SIFT — skrót od Self-Improvement via Fast Tree-search — uzyskał wynik 35,1% na benchmarku programistycznym Polyglot po zaledwie 30 krokach ekspansji. Nazwa jest dosłowna: przeszukiwanie drzewiaste rozrasta rozgałęzioną strukturę kandydackich modyfikacji, przy czym każdy krok ekspansji dodaje węzeł do eksploracji. Istotny jest punkt odniesienia: wcześniejszy Darwin Gödel Machine (DGM) potrzebował 80 węzłów przeszukiwania, aby osiągnąć 30,7% na tym samym benchmarku.

Ocena kandydatów bez uruchamiania pełnego benchmarku

Rekurencyjne, samoudoskonalające się agenty programistyczne działają podobnie do pisarza redagującego własne szkice. Agent proponuje modyfikację własnego kodu, licząc, że nowa wersja będzie lepiej radzić sobie z rzeczywistymi zadaniami. Trudność polega na weryfikacji: testowanie każdego proponowanego patcha na pełnym benchmarku pochłania poważne zasoby obliczeniowe, a rachunek szybko rośnie, gdy agent generuje wielu kandydatów.

SIFT omija znaczną część tych kosztów, wprowadzając sędziego. Zamiast testować każdą zmianę benchmarku, framework prosi duży model językowy o porównanie dwóch kandydackich modyfikacji i określenie, która wygląda lepiej. Te bezpośrednie werdykty są następnie agregowane za pomocą zregularyzowanego modelu Bradleya-Terry'ego — metody statystycznej przekształcającej preferencje parami w ogólny ranking.

Framework przeprowadza również swoje oceny asynchronicznie, więc kandydaci nie muszą czekać w pojedynczej kolejce na swoją turę na stole testowym. Efektem jest hybrydowy potok: model językowy tanio filtruje grono kandydatów, a tylko wyselekcjonowane modyfikacje trafiają do kosztownej oceny końcowej.

Liczby stojące za deklaracją efektywności

Wynik przekrojowy uzyskał agent programistyczny o3-mini. Na Polyglot SIFT osiągnął wynik 35,1% w 30 krokach ekspansji, minimalnie przewyższając wynik DGM — 30,7%, uzyskany w znacznie dłuższym przeszukiwaniu obejmującym 80 węzłów.

Historia kosztów staje się jeszcze bardziej wyrazista w przypadku modeli o otwartych wagach. Konfiguracja oparta na Qwen3-Coder-30B, modelu o otwartych wagach z rodziny Qwen firmy Alibaba, zakończyła całe przeszukiwanie w 224 godzinach CPU przy około 34 dolarach kosztów API — około jednej dziesiątej zasobów zużytych przez DGM.

SIFT przyniósł również zyski na innych benchmarkach. Na TerminalBench 2.1 wydajność wzrosła z 29,2% do 36,7%, co stanowi poprawę o 7,5 punktu procentowego. Skok był większy na S-60, gdzie wyniki wzrosły z 40,0% do 52,1% — zysk 12,1 punktu procentowego względem wyjściowego poziomu bazowego.

Kto go stworzył i gdzie się mieści

Artykuł napisali Xinghong Fu z MIT, wraz z Aravinthem Kulanthaivelu i Yutaro Yamadą, przy czym Sakana AI było współpracującym laboratorium. Został opublikowany na arXiv — otwartej platformie preprintów, na której badania zazwyczaj pojawiają się przed formalną recenzją — około 18 września 2026 roku, a dyskusja o pracy zaczęła rozprzestrzeniać się na różnych platformach pod koniec września 2026 roku. Większość rozmów koncentrowała się na dwóch tematach: oszczędnościach kosztów oraz rosnącym znaczeniu tego, jak dobry jest faktycznie sędzia będący modelem językowym.

Podejście dobrze wpisuje się w szerszą filozofię Sakana AI. Tokijskie laboratorium, założone w 2023 roku przez byłych badaczy Google, w tym współautora pracy o Transformerze Lliona Jonesa, kładzie nacisk na ewolucyjne metody odkrywania ponad strategie siłowe w rozwoju AI, a SIFT jest w dużej mierze przykładem pracy sprytniejszej, a nie rzucania na problem większą ilością sprzętu. Opiera się też bezpośrednio na rodowodzie Darwin Gödel Machine: DGM wykazał, że agenty mogą doskonalić się poprzez iteracyjne przeszukiwanie, a SIFT celuje w wąskie gardło oceny, które czyniło to przeszukiwanie tak kosztownym.

Co to oznacza dla deweloperów iścigu samoudoskonalenia

Najbardziej bezpośrednią konsekwencją jest dostępność. Jeśli pełne przeszukiwanie samoudoskonalenia może zostać przeprowadzone za około 34 dolary kosztów API, ta dziedzina może już nie należeć wyłącznie do laboratoriów z budżetami obliczeniowymi.

Jedno zastrzeżenie zasługuje na uwagę. Cała przesłanka SIFT opiera się na tym, że sędzia będący modelem językowym podejmuje trafne decyzje — dlatego jakość sędziego stała się centralnym tematem dyskusji o artykule. Sędzia, który konsekwentnie preferuje zły patch, skierowałby przeszukiwanie w złą stronę — tylko taniej. Czy ta ocena pozostanie niezawodna w miarę skalowania przeszukiwań, to otwarte pytanie, na które warto zwracać uwagę w kolejnych pracach.

Źródło: CryptoBriefing