NoticiasAccionesEl documento de Microsoft revela una destilación de habilidades de bajo costo que permite a GPT-5.4-mini superar su propio modo de razonamiento

El documento de Microsoft revela una destilación de habilidades de bajo costo que permite a GPT-5.4-mini superar su propio modo de razonamiento

Autor: CryptoBriefing·

Puntos clave

  • El documento del 11 de agosto de Microsoft muestra un método de destilación de habilidades que permite a GPT-5.4-mini igualar o superar su modo de razonamiento más costoso por 1 a 3 dólares por dominio, sin reentrenamiento.
  • El enfoque genera documentos de habilidad en markdown de 40 a 130 líneas a partir de 35-50 trayectorias de tareas, que pueden inspeccionarse, editarse y controlarse por versiones como recursos de prompt ordinarios.
  • En el benchmark ALFWorld, el GPT-5.4-mini mejorado con habilidades obtuvo 0,787 frente a 0,713 del modo de razonamiento completo, mientras utilizaba entre 2,7 y 6 veces menos tokens de salida en los benchmarks.
  • El documento se basa en el framework SkillOpt de Microsoft lanzado en junio, que mostró una ganancia promedio de 23,5 puntos para GPT-5.5 en seis benchmarks.
  • Quedan preguntas abiertas sobre la durabilidad de las habilidades destiladas a medida que los modelos subyacentes se actualizan y si el método se generaliza más allá de los dominios agénticos probados.
El documento de Microsoft revela una destilación de habilidades de bajo costo que permite a GPT-5.4-mini superar su propio modo de razonamiento

Los investigadores de Microsoft han encontrado una forma de que un modelo de IA más económico supere su propio modo de razonamiento costoso, y el truco cuesta aproximadamente lo mismo que un café con leche.

Un documento publicado el 11 de agosto, titulado "Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills", presenta un método pasivo de destilación de habilidades que extrae conjuntos compactos de reglas a partir de un pequeño número de ejemplos de tareas. Esas reglas, escritas en markdown simple, se inyectan en el system prompt de un modelo y efectivamente le enseñan atajos que evitan la necesidad de un razonamiento costoso de cadena de pensamiento. El modelo objetivo en este caso es GPT-5.4-mini, lanzado en marzo.

El resultado importa más allá de una victoria en un benchmark. Los modos de razonamiento aumentan los costos de inferencia porque generan largas cadenas de tokens intermedios antes de responder, y la salida de tokens es uno de los principales factores de costo para los proveedores de IA a escala. Reducir los tokens de salida en múltiplos, manteniendo o mejorando la precisión, cambia directamente la economía de ejecutar cargas de trabajo agénticas en producción, donde la misma tarea puede ejecutarse miles o millones de veces.

Cómo funciona

El proceso es engañosamente simple. Un agente de programación revisa entre 35 y 50 trayectorias de tareas, esencialmente registros de cómo un modelo abordó, y a veces falló en, tareas específicas. De esas trayectorias, el agente destila un documento de "habilidad" en lenguaje natural de entre 40 y 130 líneas de markdown. No se trata de embeddings abstractos ni de ajustes de pesos mediante fine-tuning. Son reglas legibles y auditables derivadas de lo que salió mal y de lo que salió bien.

Esa legibilidad representa un cambio significativo respecto de las dos formas dominantes en que el conocimiento de dominio suele incorporarse a los modelos: el fine-tuning, que requiere ejecuciones de entrenamiento y hardware especializado, y los enfoques opacos basados en recuperación o embeddings. Dado que el conocimiento destilado reside en texto plano, los desarrolladores pueden inspeccionar, editar y controlar versiones de un documento de habilidad de la misma manera que lo harían con cualquier otro recurso de prompts, sin necesidad de un pipeline de MLOps.

Una vez que ese documento de habilidad se incorpora al system prompt de un modelo sin razonamiento, sucede algo interesante. El modelo recupera entre el 55 % y más del 100 % de la brecha de rendimiento que normalmente separa los modos de razonamiento y no razonamiento. En términos más simples: el modo económico empieza a funcionar como el modo costoso, y a veces incluso mejor.

El costo de cómputo para generar el documento de habilidad de cada dominio oscila entre 1 y 3 dólares, sin necesidad de reentrenar el modelo.

Resultados de los benchmarks

El equipo de investigación, liderado por Agamdeep Singh, Srishti Gautam, Priyanshu Gupta, Nikita Mehrotra, Tanmay Bakshi y Sumit Gulwani, evaluó el enfoque en cuatro benchmarks agénticos, incluidos ALFWorld y SpreadsheetBench-Verified.

En ALFWorld, el GPT-5.4-mini mejorado con habilidades logró una puntuación de 0,787, mientras que el modo de razonamiento completo obtuvo 0,713. La versión más económica y rápida no solo cerró la brecha: la superó.

En todos los benchmarks, el modelo aumentado con habilidades utilizó entre 2,7 y 6 veces menos tokens de salida que el modo de razonamiento. Menos tokens también significa respuestas más rápidas, una ventaja práctica para los agentes interactivos, donde la latencia influye en la experiencia del usuario.

Basado en SkillOpt

El documento se basa directamente en el framework SkillOpt de Microsoft, lanzado en junio, que replanteó las habilidades de los agentes como parámetros entrenables en lugar de pesos estáticos del modelo. SkillOpt demostró una ganancia promedio de 23,5 puntos para GPT-5.5 en seis benchmarks, estableciendo la base teórica de que las habilidades podían optimizarse de manera independiente del modelo subyacente.

El nuevo método de destilación toma ese concepto y lo hace radicalmente más accesible. Dado que los documentos de habilidad son simplemente archivos markdown inyectados mediante system prompts, funcionan con las estrategias de despliegue existentes: sin infraestructura de inferencia personalizada, sin hardware especializado y sin necesidad de reentrenamiento.

Para los profesionales, las preguntas abiertas son cuán duraderas permanecen las habilidades destiladas a medida que los modelos subyacentes se actualizan, y cómo se generaliza el enfoque más allá de los dominios agénticos probados, cuestiones que los resultados de los benchmarks por sí solos aún no responden.