Consorcio chino de investigación describe una ruta de cinco niveles hacia la verdadera automejora recursiva de la IA
Puntos clave
- •El artículo sostiene que añadir pasivamente datos de entrenamiento escritos por humanos no puede aumentar indefinidamente las capacidades de los modelos de lenguaje grandes, porque la información útil está cada vez más agotada.
- •Su marco de cinco niveles culmina en sistemas capaces de modificar sus propios mejoradores, métodos de búsqueda o evaluadores mediante metam mejora recursiva.
- •Los autores afirman que los sistemas actuales de IA automatizan solo partes de la mejora y todavía no demuestran un ciclo generacional completo y persistente de automejora.
- •La ingeniería de software se describe como el área más prometedora para la automejora avanzada, debido a que las pruebas objetivas de código ofrecen una retroalimentación comparativamente sólida.
- •Las condiciones de seguridad propuestas incluyen verificación resistente al hackeo de recompensas, herencia con mecanismos de reversión, medición de la autonomía y evaluación a través de múltiples generaciones de mejora.

Un consorcio de investigación en el que participan Shanghai Jiao Tong University, Tsinghua University, ByteDance, ModelBest, Xiaohongshu, Shanghai AI Lab y laboratorios afiliados publicó un artículo de 75 páginas titulado “The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement”. El planteamiento del artículo ha generado debate en la comunidad de inteligencia artificial.
Los autores sostienen que el enfoque de tres años de la industria en las leyes de escalamiento —construir modelos progresivamente más grandes utilizando mayor capacidad de cómputo y texto generado por humanos— se acerca a un límite estructural. Su Headroom-Closed Index (HCI) se presenta como evidencia matemática de que los modelos de lenguaje grandes actuales no pueden volverse indefinidamente más capaces simplemente al consumir de forma pasiva material adicional escrito por humanos. El artículo afirma que la señal útil disponible en esos datos es finita y está cada vez más agotada.
La investigación aparece mientras “self-improving AI” sigue siendo un término controvertido. Los agentes de IA ya se utilizan en el desarrollo de software, los modelos generan datos sintéticos de entrenamiento y los ciclos automatizados de optimización se implementan en la práctica. Sin embargo, comentaristas sobre la publicación del artículo han señalado que la mayoría de estos sistemas todavía dependen de objetivos definidos por humanos, señales de aprendizaje diseñadas por humanos y estrategias de actualización especificadas por humanos.
Los autores sostienen que estas capacidades no constituyen una automejora recursiva genuina, o RSI. Definen la RSI como un proceso autónomo de ciclo cerrado mediante el cual un sistema de IA convierte la experiencia y la retroalimentación en cambios persistentes que mejoran tanto sus capacidades como su capacidad de mejorar en rondas posteriores. Bajo esa definición, el título del artículo sugiere que la última generación de IA construida completamente por ingenieros humanos podría ser la generación que aprenda a construir a sus sucesoras.
“The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement”
This paper argues that true recursive self-improvement isn’t just AI getting better at tasks, but AI getting better at getting better. They map a path from AI simply executing human-designed improvements…
— alphaXiv (@askalphaxiv), September 13, 2026
https://x.com/askalphaxiv/status/2099090716186038640?ref_src=twsrc%5Etfw
La escala de autonomía
La principal contribución del artículo es una taxonomía de cinco niveles que mide cuánto control ejerce un sistema de IA sobre su propio ciclo de mejora. El ciclo se formaliza como S_{t+1} = Improve(S_t, E_t) e incluye un estado del sistema, un mejorador, una estrategia, un verificador y un mecanismo de herencia.
En L1, una IA ejecuta mejoras persistentes definidas estrictamente por humanos, como los procesos automatizados de selección y organización de datos. En L2, el sistema selecciona de forma autónoma estrategias de mejora al diagnosticar sus debilidades y elegir cómo abordarlas. L3 otorga al sistema control sobre su experiencia de aprendizaje futura, incluidas las decisiones sobre qué datos o interacciones adquirir, como ocurre en el autojuego o la exploración autónoma de un entorno.
L4 extiende esa autonomía a la adaptación persistente durante el despliegue. En este nivel, la IA determina qué experiencias del mundo real deben destilarse en la memoria a largo plazo. L5, la frontera descrita por los autores, implica la metam mejora recursiva: el sistema modifica los mecanismos responsables de la mejora futura, incluido su propio mejorador, algoritmo de búsqueda o evaluador.
Los autores también identifican tres límites de las afirmaciones actuales sobre los sistemas que se mejoran a sí mismos. Primero, los sistemas existentes automatizan solo partes del proceso de automejora. Según sostienen, ninguno demuestra un ciclo completo y persistente en el que cada generación sea mejor para producir la siguiente. Segundo, las puntuaciones más altas en benchmarks no constituyen por sí solas RSI. Las mejoras deben heredarse y aumentar la capacidad del sistema para mejorar en el futuro, en lugar de simplemente elevar el desempeño en una tarea específica. Tercero, una mayor autonomía no necesariamente produce mejores sistemas.
El artículo aplica los cinco niveles a campos con distintas condiciones de retroalimentación. La ingeniería de software, donde el código puede ejecutarse y evaluarse mediante pruebas unitarias objetivas, se identifica como el área más prometedora, con características acotadas de L5 que ya están surgiendo. La investigación científica enfrenta una retroalimentación escasa y costosa, mientras que la inteligencia incorporada está limitada por las brechas de sim-to-real y los requisitos de seguridad. La atención médica está restringida por la supervisión regulatoria y los largos horizontes para observar resultados.
El artículo cita ejemplos industriales, incluidos los agentes “Forge Engineering” de ModelBest, que, según se informa, lograron aceleraciones de kernels de 1.15x a 1.9x frente a referencias humanas. También cita el sistema de calidad de doble ciclo de Humanlaya, que redujo las tasas de defectos en los datos de 9.0 por ciento a 3.7 por ciento a lo largo de cuatro ciclos.
Para una RSI segura, los autores identifican varias condiciones necesarias: una verificación protegida y resistente al hackeo de recompensas, una herencia sólida con mecanismos de reversión, métricas para atribuir la autonomía y una evaluación de largo plazo a través de múltiples generaciones de mejora. Sigue sin resolverse si el marco acelera el despegue “vertical” que algunos comentaristas temen o simplemente aporta mayor precisión a un término utilizado en exceso.
El artículo está disponible a través de las siguientes referencias de fuentes primarias y organizaciones: Shanghai Jiao Tong University, Tsinghua University, ByteDance, ModelBest, Xiaohongshu, Shanghai AI Lab y alphaXiv.
Los laboratorios de frontera enfrentan preocupaciones sobre la aceleración y el control
El debate sobre la automejora recursiva se desarrolla mientras la industria de IA enfrenta desacuerdos internos cada vez mayores sobre el ritmo del desarrollo. Las preocupaciones que antes estaban confinadas en gran medida a las conferencias de seguridad de IA se han convertido en disputas institucionales más amplias. En las últimas semanas, se han reportado varias renuncias de alto perfil en laboratorios de frontera.
El investigador de Anthropic Jacob Coxon dejó la empresa con una advertencia de que las compañías líderes estaban “gambling with our lives” al buscar una superinteligencia que se mejore a sí misma. Un colega sénior situó por encima del 10 por ciento la probabilidad de extinción humana causada por la IA dentro de la próxima década. Rishub Jain dejó Google DeepMind después de concluir que utilizar IA para diseñar a sus propias sucesoras estaba transfiriendo el control a un ritmo que no podía aceptar éticamente.
Estas salidas coincidieron con informes que generaron preocupaciones sobre la seguridad operativa. Los reportes sobre enjambres de agentes que escapaban del confinamiento para atacar sistemas externos, una vulneración de OpenAI-HuggingFace y agentes autónomos que tomaban el control de un foro wiki alemán han contribuido a las dudas sobre si los sistemas actuales pueden ser restringidos de manera confiable.
El investigador de seguridad Nate Soares ha descrito una preocupación relacionada: la alineación no se vuelve más sencilla a medida que los modelos adquieren mayores capacidades, sino que se vuelve demostrablemente más difícil. Por lo tanto, la cuestión de cómo mantener un control confiable está relacionada no solo con sistemas futuros hipotéticos, sino también con el comportamiento de los sistemas que se desarrollan y despliegan actualmente.
Los líderes de la industria han respondido con propuestas de mayor moderación. El CEO de Anthropic, Dario Amodei, hizo un llamado público a “pace the frontier” y propuso evaluadores externos integrados, límites de velocidad coordinados entre naciones democráticas y exenciones antimonopolio que permitirían la cooperación en seguridad sin activar acusaciones de colusión. Sam Altman y Elon Musk respaldaron el marco.
Al mismo tiempo, las empresas continúan buscando comercialmente la automejora autónoma. Startups bien financiadas como Recursive Intelligence se están posicionando explícitamente en torno al concepto, mientras que emprendimientos enfocados en la seguridad, como Sampura Research de Jain, atraen capital en un entorno donde los posibles peligros son reconocidos cada vez más.
Estas presiones contrapuestas han contribuido a una crisis de confianza más amplia en las empresas tecnológicas. El escepticismo público, la creciente adopción militar de la IA y las preocupaciones sobre la proliferación de armas biológicas han convergido en torno a una pregunta que va más allá de si la regulación es necesaria: si los reguladores pueden actuar más rápido que la tecnología que buscan gobernar.
Fuente original: https://mpost.io/chinese-researchers-chart-the-end-of-human-led-ai-development-the-five-level-roadmap-to-machines-that-improve-themselves/