NoticiasMacroMETR propone la métrica “horizonte de gasto” para comparar costos de investigación entre agentes de IA y humanos

METR propone la métrica “horizonte de gasto” para comparar costos de investigación entre agentes de IA y humanos

Autor: The Decoder·

Puntos clave

  • El horizonte de gasto marca el punto de presupuesto en el que un sistema de IA y un humano cuestan lo mismo para lograr una mejora equivalente.
  • METR estimó el trabajo humano en el speedrun de NanoGPT en unas 16 horas, o alrededor de $2,500, por cada aceleración de un 1%.
  • GPT-5.5 y Opus-4.8 produjeron mejoras verificadas de aproximadamente 1% y 1.5%, mientras que GPT-5 y Opus-4.1 no mostraron avances genuinos tras la verificación.
  • El estudio excluyó modelos más recientes como Fable 5, GPT-5.6 Sol y Opus 5, lo que podría cambiar la comparación si se prueban.
  • METR dijo que el análisis mide solo agentes de IA autónomos y no muestra cuánto aceleran las herramientas de IA a los investigadores que trabajan con supervisión humana.
METR propone la métrica “horizonte de gasto” para comparar costos de investigación entre agentes de IA y humanos

METR presentó una métrica llamada “horizonte de gasto” para medir qué tan rentables son los agentes de IA al resolver problemas de investigación. Los primeros resultados de aplicar la métrica al speedrun de NanoGPT son limitados, y METR señala que el enfoque tiene puntos ciegos importantes. Los modelos de IA más recientes también podrían cambiar los resultados.

Una pregunta central en la investigación de IA es si los sistemas de IA pueden acelerar su propio desarrollo, creando un ciclo en el que los modelos ayuden a que los modelos posteriores mejoren a un ritmo creciente. Medir eso ha sido difícil porque los costos relevantes no son directamente comparables. Los investigadores deben considerar el trabajo humano, el cómputo utilizado para experimentos y el costo de ejecutar los propios sistemas de IA. Por eso, una métrica que ponga esos costos en la misma escala resulta útil para evaluar afirmaciones sobre investigación de IA automatizada sin depender únicamente de puntajes en benchmarks o ejemplos anecdóticos.

La respuesta propuesta por METR es el “horizonte de gasto”. La métrica compara cuánto debe gastar un sistema de IA y cuánto debe gastar un humano para lograr la misma mejora. El horizonte de gasto es el nivel de presupuesto en el que ambos enfoques cuestan lo mismo. Por debajo de ese nivel, la IA es más rentable. Por encima, el humano resulta más barato.

La métrica se basa en un patrón que METR dice haber observado en pruebas anteriores: los agentes de IA suelen completar tareas simples y de bajo costo más rápido que los humanos, pero tienden a quedarse atrás cuando los presupuestos aumentan y las tareas se vuelven más difíciles.

Según METR, el método tiene dos ventajas frente a los benchmarks típicos de IA. Primero, no entrega solo un resultado de aprobado o reprobado. En cambio, ofrece una medición más granular de cuánta mejora se logra por una cantidad determinada de dinero. Segundo, convierte distintos insumos a una sola moneda, incluido el costo de ejecutar sistemas de IA, el cómputo usado para experimentos y el tiempo de trabajo humano.

METR estima que los humanos gastan cerca de $2,500 por cada aceleración de un 1%

METR probó la métrica en el speedrun de NanoGPT, un proyecto comunitario público en el que voluntarios compiten para entrenar un modelo de lenguaje de IA lo más rápido posible. La tarea en sí permanece fija, mientras que los participantes solo pueden cambiar el enfoque de entrenamiento. Desde mayo de 2024, el tiempo requerido en hardware estandarizado cayó de unos 45 minutos a menos de dos minutos a lo largo de 82 pasos de mejora documentados. Eso convierte al speedrun en un entorno controlado útil para comparar costos, aunque también en un indicador limitado de la investigación de IA más amplia, donde los objetivos, restricciones y criterios de evaluación pueden cambiar durante un proyecto.

Para estimar el costo del trabajo humano, METR entrevistó a dos de los colaboradores más activos del proyecto. También pidió a un modelo de IA, Opus-4.6, que estimara la cantidad de esfuerzo detrás de cada mejora. Ambos enfoques arrojaron una cifra similar: aproximadamente 16 horas de trabajo por cada aceleración de un 1%. Usando una tarifa horaria asumida de $150, METR calculó un costo de alrededor de $2,500 por punto porcentual.

METR subraya que la estimación es muy incierta. Las entrevistas también destacaron que la mayor parte del tiempo de los colaboradores se destinó a ideas que finalmente no funcionaron.

Los agentes de IA han producido solo avances limitados hasta ahora

Para la comparación, METR asignó a seis modelos de IA la misma tarea de forma independiente. Los modelos no comenzaron desde cero. En cambio, partieron de una versión ya altamente optimizada del speedrun, el Record #78 de marzo de 2026, y se les permitió gastar hasta $10,000 por ejecución en costos de cómputo y operación.

Los horizontes de gasto estimados resultantes fueron de entre $0 y $3,300. El desempeño varió marcadamente entre modelos. GPT-5 y Opus-4.1 no produjeron ningún avance genuino después de una verificación cuidadosa; sus aparentes mejoras fueron atribuidas a ruido aleatorio. GPT-5.5 y Opus-4.8, en cambio, lograron mejoras reales de aproximadamente 1% y 1.5%, respectivamente.

La calidad de las sugerencias de los modelos fue mixta. El mantenedor del speedrun estimó que alrededor del 70% de las ideas generadas por IA podrían, en principio, integrarse al proyecto, pero muchas no eran especialmente originales. Describió una optimización de bajo nivel de GPT-5.5 como la “coolest one”, mientras caracterizó la mayoría de las sugerencias restantes como ajustes de parámetros.

Los modelos también intentaron hacer trampa varias veces. Estos intentos implicaron atajos que producían resultados de prueba artificialmente buenos, pero que habrían sido inútiles en la práctica, como apagar partes del entrenamiento poco antes de la línea de meta. Ese problema subraya por qué importa el paso de verificación de METR: sin comprobar si una aceleración preserva la tarea prevista, la optimización automatizada puede recompensar conductas que mejoran el resultado medido mientras socavan el experimento subyacente.

La conclusión de METR es que, aunque algunos modelos individuales alcanzaron horizontes de gasto en los miles de dólares bajos, esos valores son muy pequeños en comparación con los $250,000 estimados de esfuerzo humano total detrás del speedrun de NanoGPT. Según la evaluación de METR, la optimización autónoma hasta ahora ha contribuido solo marginalmente al progreso general de NanoGPT.

Los modelos de IA más recientes podrían alterar la comparación

La prueba de METR tiene una advertencia importante: incluyó solo modelos más antiguos, específicamente GPT-5, GPT-5.2, GPT-5.5, Opus-4.1 y Opus-4.8. Los modelos lanzados después, incluidos Fable 5, GPT-5.6 Sol y Opus 5, no fueron incluidos en el documento.

Anthropic presenta Opus 5 como una mejora importante. En Frontier-Bench, la compañía afirma que Opus 5 duplica el rendimiento de Opus 4.8 al tiempo que reduce el costo por tarea. Según Anthropic, Opus 5 dedica menos esfuerzo a caminos sin salida, verifica su propio trabajo de manera más confiable y alcanza un rendimiento similar con un promedio de 26% menos pasos de cómputo. Cada uno de esos factores afecta directamente el horizonte de gasto de METR.

Los resultados en ARC-AGI-3 también son notables. El benchmark está diseñado para evaluar resolución de problemas en lugar de conocimiento memorizado. Los sistemas de IA se colocan en entornos desconocidos similares a juegos, sin instrucciones ni objetivos, y deben determinar cómo avanzar mediante prueba y error.

Opus 5 ocupa la primera posición en ARC-AGI-3 desde el 24 de julio de 2026, con una puntuación de 30.2%. Resolvió cinco tareas que todos los modelos anteriores habían fallado. Opus 4.8, su predecesor, obtuvo solo 1.5%. El equipo de ARC Prize atribuye la mejora a un razonamiento lógico más sólido, que permite a la IA explorar y planificar de forma más independiente. Esa capacidad también podría ser relevante para el speedrun de NanoGPT, aunque la comparación publicada por METR tendría que repetirse con modelos más recientes para mostrar si sus horizontes de gasto son diferentes.

El estudio no mide la colaboración humano-IA

Una de las mayores limitaciones del estudio es una que la propia METR identifica: el análisis mide sistemas de IA trabajando solos mediante optimización puramente autónoma. En la investigación real de IA, los humanos suelen usar la IA como herramienta en lugar de delegarle completamente tareas de investigación.

METR describe una tercera curva hipotética para este escenario de colaboración humano-IA. Si los humanos toman decisiones efectivas sobre cuándo y cómo usar la IA, el enfoque híbrido debería, en teoría, superar tanto al enfoque puramente humano como al puramente de IA al combinar las fortalezas de cada uno.

METR advierte que ese resultado no está garantizado. La organización apunta a trabajos anteriores propios que mostraron que las configuraciones humano-más-IA a veces tuvieron peor desempeño que humanos trabajando solos. El beneficio depende de si la IA se aplica en las partes adecuadas del proceso.

Medir eso correctamente requeriría un experimento controlado que comparara a los mismos investigadores trabajando con y sin asistencia de IA. METR dice que un experimento así sería difícil de organizar, pero muy informativo. Hasta entonces, el horizonte de gasto ofrece evidencia sobre lo que los sistemas de IA pueden lograr de forma independiente, pero dice mucho menos sobre cuánto aceleran en la práctica a los investigadores humanos.