NoticiasMacroHarness-Zero: investigadores de Google demuestran cómo destilar un harness de agente de IA en los pesos del modelo

Harness-Zero: investigadores de Google demuestran cómo destilar un harness de agente de IA en los pesos del modelo

Autor: Metaverse Post·

Puntos clave

  • •Harness-Zero destila en los pesos del modelo los comportamientos inducidos por un harness de agente optimizado, de modo que las ganancias de rendimiento persisten cuando el harness especializado se sustituye por un harness fijo mínimo en el despliegue.
  • •En el enfoque agent-as-harness, un agente de harnessing separado, guiado por el harness optimizado, revisa y corrige cada respuesta del agente estudiante en el espacio de acciones nativo del harness objetivo, y las ejecuciones corregidas sirven como demostraciones de entrenamiento.
  • •En evaluaciones sin entrenamiento sobre modelos de frontera, el enfoque agent-as-harness superó al método convencional code-as-harness, con un promedio de 81,1% frente a 78,1% en los benchmarks y configuraciones de modelo probados.
  • •Tras la destilación, el éxito promedio macro de tareas de un modelo base de 9.000 millones de parámetros pasó del 23,3% al 44,3% con el harness especializado retirado, superando el 41,7% que el mismo modelo logró con el harness conectado, y el modelo destilado recuperó en promedio el 82,3% de los 28 patrones de comportamiento inducidos por el harness.
  • •Los autores señalan limitaciones: el agente de harnessing debe ser suficientemente capaz, ya que los modelos más débiles producen intervenciones netamente perjudiciales; el proceso de revisión eleva los costos de recolección de trayectorias; y el conocimiento profundo del dominio puede ser difícil de internalizar solo mediante ajuste fino.
Harness-Zero: investigadores de Google demuestran cómo destilar un harness de agente de IA en los pesos del modelo

Investigadores de la Universidad de Pekín, Google y la Universidad de Ciencia y Tecnología de Hong Kong han presentado Harness-Zero, un método que transfiere las ganancias de rendimiento de un harness especializado de agente de IA al propio modelo, de modo que esas ganancias ya no dependan del andamiaje externo. El trabajo aborda una tensión central de la ingeniería moderna de agentes: cuánta capacidad de un agente debe residir en los pesos del modelo y cuánta en el andamiaje que lo rodea.

Un harness de agente es el sistema externo que gobierna cómo un modelo de lenguaje interactúa con su entorno: orquesta el uso de herramientas, gestiona el contexto y el estado, y controla el bucle de interacción. La ingeniería de harnesses ha demostrado ser una palanca poderosa para mejorar el rendimiento de los agentes, pero las mejoras que aporta dependen de que ese harness específico esté presente en el despliegue. Dado que el harness óptimo varía según el dominio, las tareas individuales y los modelos base, un agente de propósito general enfrenta una disyuntiva difícil: adoptar un único harness compartido y renunciar a las ventajas especializadas, o mantener una colección creciente de harnesses especializados con los costos crecientes de enrutamiento, contexto y orquestación.

Harness-Zero propone un tercer camino: la destilación de harnesses. Un harness optimizado sirve solo como guía durante el entrenamiento, y los comportamientos que induce se transfieren a los pesos del modelo, de modo que las ganancias persistan incluso después de retirar el harness especializado y utilizar un harness fijo mínimo en el despliegue.

Agent-as-Harness: traducir la guía entre diferentes espacios de acciones

La dificultad central es que el harness optimizado y el harness objetivo difieren tanto en el espacio de acciones como en la información disponible, lo que significa que la guía del harness optimizado no puede aplicarse directamente como supervisión de entrenamiento. Harness-Zero lo resuelve con un enfoque de agent-as-harness: un agente de harnessing separado, guiado por el harness optimizado, revisa cada respuesta que propone el agente estudiante y, cuando es necesario, la corrige de manera que la corrección se exprese en el espacio de acciones nativo del harness objetivo antes de su ejecución.

Las ejecuciones corregidas sirven entonces como demostraciones de entrenamiento. El ajuste fino sobre las trayectorias resultantes internaliza en los pesos del modelo el comportamiento inducido por el harness, y en el despliegue se descartan tanto el harness especializado como el harness de referencia y el agente de harnessing.

Los investigadores evaluaron el método en tres dominios: trabajo del conocimiento basado en hojas de cálculo (SpreadsheetBench Verified), uso de herramientas multiaplicación (AppWorld) y razonamiento científico (USPTO Retrosynthesis). En evaluaciones sin entrenamiento sobre modelos de frontera —es decir, sin ajuste fino—, el enfoque agent-as-harness superó al método convencional code-as-harness, con un promedio de 81,1% frente a 78,1% en las configuraciones de benchmarks y modelos probadas.

En cuanto a la destilación, el éxito promedio macro de tareas de un modelo base de 9.000 millones deámetros, comparativamente compacto según los estándares actuales, pasó del 23,3% al 44,3% una vez retirado el harness especializado, superando el 41,7% que el mismo modelo base logró con el harness aún conectado. Un análisis conductual reveló además que el modelo destilado recuperó en promedio el 82,3% de los 28 patrones de comportamiento inducidos por el harness ausentes en el modelo base, lo que indica que el modelo destilado absorbió cómo funcionaba el harness, y no solo qué tan bien rendía.

Los autores señalan varias limitaciones. El enfoque requiere un modelo suficientemente capaz para actuar como agente de harnessing, ya que los modelos más débiles producen intervenciones netamente perjudiciales, y el proceso de revisión eleva el costo de recolección de trayectorias. El conocimiento profundo del dominio codificado en un harness también puede ser más difícil de internalizar solo mediante ajuste fino.

Aun así, los resultados sugieren que el desarrollo de harnesses podría convertirse en una fuente escalable de señal de entrenamiento: con mejores modelos construyendo mejores harnesses, y cada harness devolviendo sus ganancias al propio modelo en lugar de dejarlas atrapadas en el andamiaje que lo rodea. Cuánto puede estirarse ese ciclo, dadas las restricciones que los autores señalan, es la pregunta abierta que determinará si las ganancias de los harnesses siguen quedándose en el andamiaje —o empiezan a llegar a los propios pesos.