NoticiasMacroInvestigadores de Meta, Duke y UC Davis presentan ramas de auto-mejora para la optimización de harness de agentes

Investigadores de Meta, Duke y UC Davis presentan ramas de auto-mejora para la optimización de harness de agentes

Autor: CryptoBriefing·

Puntos clave

  • •El método logró una mejora relativa de 34.8% en razonamiento matemático de nivel Olimpiada con Gemini 3 Flash, elevando la precisión de 46.0% a 62.0% sin reentrenar el modelo subyacente.
  • •El enfoque divide la optimización de harness en múltiples ramas de auto-mejora, cada una con un subconjunto distinto de datos de desarrollo y su propia política para proponer cambios, con un router que selecciona la rama más fuerte para cada entrada en el despliegue.
  • •Las ganancias de rendimiento se extendieron más allá de las matemáticas a tareas agénticas, incluida una mejora de 11.6% en Terminal-Bench 2.0 y un incremento de 3.8% en SWE-bench Lite.
  • •El artículo, publicado como arXiv:2609.37834v1 el 29 de septiembre de 2026, se basa directamente en Meta-Harness, un sistema anterior lanzado el 30 de marzo de 2026 que ya superaba los métodos tradicionales de optimización.
  • •Según los autores, las ganancias se lograron utilizando únicamente datos del conjunto de desarrollo sin acceso al conjunto de prueba, pero el preprint aún no ha superado una revisión por pares formal.
Investigadores de Meta, Duke y UC Davis presentan ramas de auto-mejora para la optimización de harness de agentes

Investigadores de Meta, Duke University y la Universidad de California, Davis propusieron un nuevo enfoque para mejorar a los agentes de IA: dejar el modelo subyacente intacto y mejorar el andamiaje que lo rodea, utilizando varios equipos de auto-mejora en lugar de uno solo.

En un preprint titulado “Mixture of Self-Improving Branches for Agent Harness Optimization”, los investigadores reportan una mejora relativa de 34.8% en razonamiento matemático de nivel Olimpiada, elevando la precisión de 46.0% a 62.0% con el modelo Gemini 3 Flash, todo ello sin reentrenar el modelo.

Qué es un harness y por qué es importante

Más formalmente, un agent harness es el marco de código que envuelve a un modelo de lenguaje de gran escala. Rige los prompts que recibe el modelo, las herramientas que puede llamar, el contexto que puede ver y cómo se ejecutan sus acciones.

Como ese andamiaje es código y no pesos del modelo, puede modificarse sin una nueva ejecución de entrenamiento: esa es la palanca que esta línea de trabajo acciona. La optimización de harness es la práctica de buscar automáticamente una mejor versión de ese envoltorio. El nuevo artículo, publicado el 29 de septiembre de 2026 como arXiv:2609.37834v1, se basa directamente en un sistema anterior llamado Meta-Harness.

Cómo funciona el enfoque de ramificación

Meta-Harness, lanzado el 30 de marzo de 2026, ya había superado los métodos tradicionales en diversos benchmarks. El nuevo trabajo sostiene que una única ruta de búsqueda deja rendimiento sobre la mesa.

Por ello, los investigadores dividieron la búsqueda en múltiples ramas especializadas. Cada rama evoluciona por su cuenta, trabajando con un subconjunto distinto de datos de desarrollo y aplicando su propia política para proponer cambios.

Las ramas también aprenden de su historia. Cada una conserva los casos en los que supera a sus hermanas y refina su estrategia según el desempeño de intentos anteriores.

Esto plantea una pregunta obvia: ¿quién elige al especialista? La respuesta es un router. En el despliegue, el router selecciona la mejor cabecera de rama para cada entrada recibida.

Todo el proceso se ejecuta únicamente con datos del conjunto de desarrollo. Según los autores, los harness complementarios lograron sus ganancias sin ningún acceso al conjunto de prueba.

Las cifras de los benchmarks

El resultado principal llegó en razonamiento matemático de nivel Olimpiada. La precisión subió de 46.0% a 62.0% con Gemini 3 Flash, lo que los autores presentan como una mejora relativa de 34.8%.

Las ganancias se extendieron a tareas agénticas. En Terminal-Bench 2.0, que evalúa agentes que trabajan en un entorno de línea de comandos, el sistema registró una ganancia de 11.6%. SWE-bench Lite, un benchmark de ingeniería de software, mostró un incremento de 3.8.

En conjunto, las tres evaluaciones abarcan razonamiento matemático, trabajo de agentes en línea de comandos e ingeniería de software, por lo que las ganancias reportadas no se limitan a un solo tipo de tarea.

Quién está detrás del trabajo

La lista de autores incluye a Haoyu Dong, afiliado a Meta y Duke University, y a Zihao Lin, afiliado a Meta y UC Davis. Lizhu Zhang y Zhuokai Zhao figuran como coautores finales.

El artículo es un preprint publicado en arXiv, lo que significa que se ha compartido públicamente pero no necesariamente ha superado una revisión por pares formal.

Qué significa esto

Un salto de 46.0% a 62.0% en matemáticas difíciles, logrado sin tocar los pesos del modelo, sugiere que mejoras significativas pueden provenir de la ingeniería del entorno en el que opera un modelo. Para los equipos que construyen sobre modelos de lenguaje de gran escala, el trabajo plantea el propio harness como un artefacto optimizable: uno que puede avanzar al mismo ritmo que los lanzamientos de modelos, en lugar de esperarlos.

Hay preguntas abiertas que vale la pena seguir. Ejecutar y mantener múltiples ramas en evolución más un router probablemente añade complejidad, y los resultados del artículo provienen de benchmarks específicos y de un modelo concreto. Si el enfoque supera la revisión por pares, resiste pruebas independientes y se extiende más allá de Gemini 3 Flash son los puntos de control naturales a monitorear.

Meta-Harness llegó en marzo de 2026 y ya superaba los métodos tradicionales. Aproximadamente seis meses después, su sucesor afirma superar al propio Meta-Harness.