Benchmark de revisión por pares con IA: la combinación de modelos detecta 93 de 100 errores sembrados en artículos de psicología
Puntos clave
- •El mejor sistema individual detectó 71 de los 100 errores sembrados, mientras que el más débil encontró 30.
- •Combinar los resultados de todos los sistemas evaluados elevó la detección a 93 de 100 errores.
- •Los siete errores que ningún sistema detectó fueron omisiones, lo que indica que las herramientas de IA tuvieron más dificultades con la información faltante que con el contenido alterado.
- •Refine.ink encontró más errores únicos que cualquier otra herramienta individual, aunque Litvak señaló que su uso es costoso.
- •Litvak publicó en GitHub los artículos, los errores sembrados, las salidas de los modelos y el registro del experimento para estudios posteriores.

En un experimento controlado para evaluar la eficacia de la revisión por pares impulsada por IA, el investigador Paul Litvak colaboró con Claude de Anthropic para sembrar 100 errores conocidos en 10 artículos de psicología de acceso abierto y luego pasó las versiones modificadas por varios modelos de IA de frontera y dos herramientas comerciales de revisión con IA. El experimento responde al creciente interés en flujos de trabajo de revisión asistidos por IA en la publicación académica, donde revisores sobrecargados y volúmenes crecientes de envíos han intensificado los debates sobre el control de calidad.
Los resultados mostraron variaciones significativas en el desempeño. El mejor sistema individual identificó 71 de los 100 errores sembrados, mientras que el sistema con peor desempeño detectó solo 30. Sin embargo, al agrupar las salidas de todos los sistemas, la tasa de detección subió a 93 de 100 errores, una mejora sustancial impulsada por el hecho de que los distintos modelos solo están parcialmente correlacionados en los errores que detectan. Las mejoras derivadas de la combinación son coherentes con un principio de larga data en aprendizaje automático: combinar clasificadores diversos a menudo supera a cualquier modelo individual porque los errores no correlacionados se compensan. Litvak enfatizó que la combinación de múltiples modelos es una estrategia potente para identificar problemas en artículos académicos y alentó a los investigadores a revisar sus manuscritos con varios modelos.
Siete errores escaparon a todos los sistemas evaluados. Los siete eran omisiones, es decir, casos en los que se había eliminado información de un artículo en lugar de introducir nuevos errores, lo que sugiere que las herramientas de IA siguen siendo mejores para detectar contenido fabricado o alterado que para identificar material faltante. La distinción es especialmente relevante en psicología, un campo que ha enfrentado una crisis de reproducibilidad ampliamente documentada, en la que la omisión de detalles sobre métodos, análisis o datos puede dificultar que otros investigadores reproduzcan los hallazgos.
Entre las herramientas evaluadas, Refine.ink aportó más detecciones únicas que cualquier otro sistema individual, aunque Litvak señaló que su uso es costoso, lo que plantea preguntas sobre cómo las barreras de precio pueden influir en qué investigadores e instituciones pueden acceder a la revisión asistida por IA más eficaz.
Litvak reconoció dos limitaciones del estudio: no midió las tasas de falsos positivos y la distribución de los errores sembrados puede no reflejar la distribución de errores encontrada en artículos del mundo real. La ausencia de datos sobre falsos positivos es relevante porque tasas elevadas de falsas alarmas podrían aumentar, en lugar de reducir, la carga de trabajo de los revisores si estos deben filtrar manualmente un gran número de críticas marcadas pero incorrectas.
Para apoyar futuras investigaciones, Litvak hizo públicos en GitHub los artículos, los errores sembrados, las salidas de los modelos y el registro completo del experimento: https://github.com/Dawes-Institute/ai-peer-review-benchmark. Expresó la আশা de que otros construyan sobre este trabajo para crear un benchmark integral de evaluación en distintas disciplinas académicas.
El informe completo de Paul Litvak está disponible aquí. Cabe destacar que el experimento no utilizó la generación más reciente de modelos de IA, lo que sugiere que sistemas más nuevos podrían alcanzar tasas de detección aún más altas.
Los hallazgos fueron destacados en Marginal Revolution.