NoticiasMacroSIFT, de MIT y Sakana AI, reduce el costo de evaluar agentes de codificación que se auto-mejoran

SIFT, de MIT y Sakana AI, reduce el costo de evaluar agentes de codificación que se auto-mejoran

Autor: CryptoBriefing·

Puntos clave

  • •SIFT alcanzó 35.1% en el benchmark de codificación Polyglot en solo 30 pasos de expansión, superando el 30.7% de la Darwin Gödel Machine, que necesitó una búsqueda de 80 nodos.
  • •El marco reemplaza la evaluación completa de cada cambio propuesto por un juez de modelo de lenguaje cuyas preferencias por pares se convierten en clasificaciones mediante un modelo Bradley-Terry regularizado.
  • •Una configuración basada en Qwen3-Coder-30B, de pesos abiertos de Alibaba, completó toda su búsqueda en 224 horas de CPU con aproximadamente 34 dólares en costos de API, alrededor de una décima parte de los recursos que consumió DGM.
  • •SIFT también mejoró el rendimiento en TerminalBench 2.1 de 29.2% a 36.7% y en S- de 40.0% a 52.1%.
  • •La efectividad del método depende de la precisión del juez de modelo de lenguaje, que los investigadores destacan como la principal pregunta abierta a medida que crece la escala de la búsqueda.
SIFT, de MIT y Sakana AI, reduce el costo de evaluar agentes de codificación que se auto-mejoran

Los agentes de codificación capaces de reescribir su propio código fuente conllevan un gasto oculto que tiene poco que ver con generar los cambios en primer lugar: cada auto-modificación debe verificarse antes de que alguien pueda saber si realmente fue útil. Investigadores de MIT y Sakana AI creen haber encontrado una forma sustancialmente más económica de realizar esa verificación.

Su marco, SIFT—siglas de Self-Improvement via Fast Tree-search—obtuvo 35.1% en el benchmark de codificación Polyglot tras solo 30 pasos de expansión. El nombre es literal: la búsqueda en árbol genera una estructura ramificada de modificaciones candidatas, y cada paso de expansión añade un nodo por explorar. La línea base de comparación importa: la anterior Darwin Gödel Machine (DGM) necesitó 80 nodos de búsqueda para alcanzar 30.7% en el mismo benchmark.

Evaluar candidatos sin ejecutar el benchmark completo

Los agentes de codificación recursivos que se auto-mejoran operan de manera similar a un escritor que revisa sus propios borradores. El agente propone una modificación a su propio código, con la esperanza de que la nueva versión funcione mejor en tareas reales. La dificultad radica en la verificación: probar cada parche propuesto contra un benchmark completo consume una cantidad considerable de cómputo, y la factura se acumula rápidamente cuando un agente genera muchos candidatos.

SIFT evita gran parte de ese costo introduciendo un árbitro. En lugar de evaluar cada cambio, el marco pide a un modelo de lenguaje de gran escala que compare dos modificaciones candidatas y determine cuál luce mejor. Estos veredictos cara a cara se agregan luego mediante un modelo Bradley-Terry regularizado, un método estadístico para convertir preferencias por pares en una clasificación general.

El marco también ejecuta sus evaluaciones de forma asíncrona, por lo que los candidatos no tienen que esperar en una sola fila su turno en el banco de pruebas. El resultado es un pipeline híbrido: el modelo de lenguaje filtra el campo de manera económica, y solo las modificaciones preseleccionadas pasan a la costosa evaluación posterior.

Los números detrás de la afirmación de eficiencia

Un agente de codificación o3-mini produjo el resultado principal. En Polyglot, SIFT alcanzó su puntaje de 35.% en 30 pasos de expansión, superando el 30.7% de DGM, logrado en una búsqueda de 80 nodos considerablemente más larga.

La historia de costos se vuelve más contundente con los modelos de pesos abiertos. Una configuración basada en Qwen3-Coder-30B, un lanzamiento de pesos abiertos de la familia Qwen de Alibaba, completó toda su búsqueda en 224 horas de CPU con aproximadamente 34 dólares en costos de API, alrededor de una décima parte de los recursos que consumió DGM.

SIFT también mostró mejoras en otros benchmarks. En TerminalBench 2.1, el rendimiento subió de 29.2% a 36.7%, una mejora de 7.5 puntos porcentuales. El salto fue mayor en S-60, donde los puntajes pasaron de 40.0% a 52.1%, una ganancia de 12.1 puntos porcentuales sobre la línea base inicial.

Quiénes lo construyeron y dónde encaja

El artículo fue escrito por Xinghong Fu, de MIT, junto con Aravinth Kulanthaivelu y Yutaro Yamada, con Sakana AI como laboratorio colaborador. Fue publicado en arXiv, el servidor de preprints de acceso abierto donde las investigaciones suelen aparecer antes de la revisión por pares formal, alrededor del 18 de septiembre de 2026, y la discusión sobre el trabajo comenzó a difundirse por diversas plataformas a finales de septiembre de 2026. Gran parte de esa conversación se ha centrado en dos temas: el ahorro de costos y la creciente importancia de la calidad real del juez de modelo de lenguaje.

El enfoque encaja bien con la filosofía más amplia de Sakana AI. El laboratorio con sede en Tokio, fundado en 2023 por exinvestigadores de Google, incluido el coautor del artículo de Transformer, Llion Jones, ha enfatizado los métodos de descubrimiento evolutivo sobre las estrategias de fuerza bruta en el desarrollo de IA, y SIFT es un claro ejemplo de trabajar de manera más inteligente en lugar de lanzar más hardware al problema. También se construye directamente sobre el linaje de la Darwin Gödel Machine: DGM estableció que los agentes podían mejorarse a sí mismos mediante búsqueda iterativa, y SIFT ataca el cuello de botella de evaluación que hacía tan costosa esa búsqueda.

Qué significa esto para los desarrolladores y la carrera de la auto-mejora

La implicación más inmediata es la accesibilidad. Si una búsqueda completa de auto-mejora puede ejecutarse por alrededor de 34 dólares en costos de API, el campo quizás ya no pertenezca únicamente a los laboratorios con grandes presupuestos de cómputo.

Una advertencia merece atención. Toda la premisa de SIFT descansa en que el juez de modelo de lenguaje tome buenas decisiones, razón por la cual la calidad del juez se ha convertido en un punto central de la discusión del artículo. Un juez que prefiera consistentemente el parche equivocado dirigiría la búsqueda en la dirección incorrecta, solo que de manera más económica. Si ese juicio se mantiene confiable a medida que las búsquedas escalan es la pregunta abierta a seguir en trabajos futuros.

Fuente: CryptoBriefing