NoticiasMacroInvestigadores pusieron a prueba si los agentes de IA pueden realizar investigación científica de forma independiente — y no lo lograron

Investigadores pusieron a prueba si los agentes de IA pueden realizar investigación científica de forma independiente — y no lo lograron

Autor: Decrypt·

Puntos clave

  • Investigadores de Princeton, Stanford, el Instituto de Seguridad de IA del Reino Unido y otras instituciones evaluaron si los agentes de IA de vanguardia podían realizar de forma independiente investigación original en IA utilizando preguntas de dos artículos inéditos de NeurIPS 2026.
  • Cada agente de IA recibió seis días, miles de dólares en créditos de API, recursos de GPU, acceso a internet y una máquina virtual, y sin embargo ambos artículos resultantes fueron rechazados por los autores originales.
  • Los agentes completaron con éxito tareas de ingeniería, incluyendo revisiones bibliográficas, depuración de software, ejecución de experimentos y producción completa de artículos sin intervención humana.
  • Los revisores concluyeron que los sistemas no lograron generar contribuciones científicas originales, y el estudio identificó cinco modos de falla recurrentes que impidieron la investigación publicable.
  • Los autores advirtieron que el estudio examinó solo dos proyectos y reconocieron limitaciones como el tamaño reducido de la muestra y la participación de los investigadores originales en la evaluación de los artículos generados por IA.
Investigadores pusieron a prueba si los agentes de IA pueden realizar investigación científica de forma independiente — y no lo lograron

Un nuevo estudio ha encontrado que, si bien los actuales agentes de IA de vanguardia pueden completar muchas de las tareas de ingeniería requeridas para la investigación en IA, no lograron producir trabajo original digno de ser aceptado en una conferencia importante de aprendizaje automático.

En el estudio, titulado "¿Pueden los agentes de IA realizar investigación de IA abierta?" y publicado el miércoles, investigadores de la Universidad de Princeton, el Instituto de Seguridad de IA del Reino Unido, la Universidad de Stanford, la Universidad de Toronto y varias otras organizaciones académicas y de investigación evaluaron si los agentes de IA de vanguardia podrían realizar de forma independiente investigación original en IA. La pregunta se ha vuelto más urgente a medida que los laboratorios de IA presentan cada vez más sus sistemas como herramientas capaces de acelerar el descubrimiento científico, y a medida que investigadores de diversas disciplinas comienzan a incorporar asistentes de IA en sus flujos de trabajo.

"Responder a esto de manera rigurosa requiere preguntas de investigación reales y no contaminadas que el agente no pueda memorizar de sus datos de entrenamiento ni encontrar en línea", escribieron los investigadores. "Para cumplir con estos requisitos, nos basamos en investigación de IA de alta calidad que no era pública en el momento en que realizamos los experimentos."

Los investigadores proporcionaron a los agentes de IA las preguntas de investigación central de dos artículos inéditos de NeurIPS 2026, impidiendo que los sistemas recuperaran respuestas de los datos de entrenamiento o de la web. Cada agente recibió seis días, miles de dólares en créditos de API, recursos de GPU, acceso a internet y acceso a una máquina virtual para producir un artículo de calidad de conferencia. Los autores originales de la investigación inédita luego revisaron los artículos resultantes. Ambos fueron rechazados.

El estudio identificó cinco modos de falla recurrentes que impidieron que los sistemas de IA produjeran investigación publicable. Los agentes completaron con éxito gran parte de la ingeniería involucrada — realizando revisiones bibliográficas, depurando software, ejecutando experimentos, gestionando recursos de GPU y produciendo artículos académicos completos sin intervención humana. Sin embargo, los revisores concluyeron que los sistemas no lograron generar contribuciones científicas originales dignas de publicación. Esa distinción — entre automatizar el andamiaje mecánico de la investigación y producir conocimiento científico genuinamente novedoso — es central en los debates actuales sobre hasta dónde se extienden las capacidades de la IA en la actualidad.

Los autores señalaron que su evaluación mide mejor el razonamiento científico que los puntos de referencia anteriores porque pone a prueba problemas de investigación abierta en lugar de tareas predefinidas. La mayoría de los puntos de referencia existentes evalúan el desempeño en tareas bien definidas con respuestas conocidas, lo que puede hacer que los sistemas parezcan más capaces de lo que son en entornos no estructurados. Advirtieron que el estudio examinó solo dos proyectos de investigación y reconocieron limitaciones, incluido el tamaño pequeño de la muestra y el hecho de que los investigadores originales evaluaron los artículos generados por IA. Los resultados sugieren que los actuales agentes de IA de vanguardia pueden automatizar muchas de las tareas de ingeniería involucradas en la investigación, pero siguen teniendo dificultades para generar trabajo científico original.

Los hallazgos se producen en un momento en que los investigadores continúan descubriendo comportamientos sorprendentes y a veces riesgosos en agentes de IA cada vez más autónomos. En mayo, investigadores de UC Riverside, Microsoft y Nvidia encontraron que los agentes de IA con frecuencia realizaban tareas peligrosas o irracionales mientras permanecían enfocados en completar sus objetivos. A principios de julio, OpenAI reveló que uno de sus agentes de IA de vanguardia escapó de su contención y hackeó Hugging Face mientras intentaba hacer trampa en un punto de referencia de ciberseguridad. Esta semana, la empresa reveló que el agente también había accedido a cuatro servicios en línea adicionales.