Test de la révision par les pairs par IA : la combinaison de modèles détecte 93 des 100 erreurs insérées dans des articles de psychologie
Points clés
- •Le meilleur système individuel a détecté 71 des 100 erreurs insérées, tandis que le moins performant en a trouvé 30.
- •La combinaison des résultats de tous les systèmes testés a porté le taux de détection à 93 erreurs sur 100.
- •Les sept erreurs manquées par tous les systèmes étaient toutes des omissions, ce qui indique que les outils d'IA ont eu plus de difficultés avec les informations manquantes qu'avec le contenu modifié.
- •Refine.ink a trouvé plus d'erreurs uniques que n'importe quel autre outil individuel, mais Litvak a noté qu'il est coûteux à utiliser.
- •Litvak a rendu les articles, les erreurs insérées, les résultats des modèles et le journal d'expérience publiquement disponibles sur GitHub pour la recherche future.

Dans une expérience contrôlée testant l'efficacité de la révision par les pairs assistée par IA, le chercheur Paul Litvak a collaboré avec Claude d'Anthropic pour insérer 100 erreurs connues dans 10 articles de psychologie en accès ouvert, puis a soumis les articles modifiés à plusieurs modèles d'IA de pointe et à deux outils de révision par IA commerciaux. Cette expérience s'inscrit dans un intérêt croissant pour les flux de travail de révision assistée par IA dans l'édition académique, où les évaluateurs surchargés et l'augmentation du volume de soumissions ont intensifié les débats sur le contrôle qualité.
Les résultats ont révélé une variation significative des performances. Le meilleur système individuel a identifié 71 des 100 erreurs insérées, tandis que le système le moins performant n'en a détecté que 30. Cependant, la combinaison des résultats de tous les systèmes a porté le taux de détection à 93 erreurs sur 100 — une amélioration substantielle due au fait que les différents modèles ne sont que partiellement corrélés dans les erreurs qu'ils détectent. Ces gains liés à la combinaison sont conformes à un principe de longue date en apprentissage automatique : combiner des classificateurs diversifiés surpasse souvent n'importe quel modèle individuel car les erreurs non corrélées se compensent. Litvak a souligné que l'assemblage de plusieurs modèles est une stratégie puissante pour identifier les problèmes dans les articles académiques et a encouragé les chercheurs à vérifier leurs manuscrits auprès de plusieurs modèles.
Sept erreurs ont échappé à tous les systèmes testés. Les sept étaient des omissions — des cas où des informations avaient été supprimées d'un article plutôt que de nouvelles erreurs insérées — ce qui suggère que les outils d'IA restent plus performants pour détecter le contenu fabriqué ou modifié que pour repérer les éléments manquants. Cette distinction a une importance particulière pour la psychologie, un domaine qui a été confronté à une crise de reproductibilité largement documentée, où les détails omis concernant les méthodes, les analyses ou les données peuvent compromettre la capacité d'autres chercheurs à reproduire les résultats.
Parmi les outils évalués, Refine.ink a contribué à davantage de détections uniques que n'importe quel autre système individuel, bien que Litvak ait noté qu'il est coûteux à utiliser, ce qui soulève des questions sur la manière dont les barrières financières peuvent déterminer quels chercheurs et institutions peuvent accéder à la révision assistée par IA la plus efficace.
Litvak a reconnu deux limites à cette étude : il n'a pas mesuré les taux de faux positifs, et la distribution des erreurs insérées peut ne pas refléter la distribution des erreurs trouvées dans les articles réels. L'absence de données sur les faux positifs est notable, car des taux d'alarme élevés pourraient augmenter, plutôt qu'alléger, la charge de travail des évaluateurs si les chercheurs doivent trier manuellement un grand nombre de critiques signalées mais incorrectes.
Pour soutenir la recherche future, Litvak a rendu les articles, les erreurs insérées, les résultats des modèles et le journal complet de l'expérience publiquement disponibles sur GitHub : https://github.com/Dawes-Institute/ai-peer-review-benchmark. Il a exprimé l'espoir que d'autres s'appuieront sur ce travail pour créer un benchmark d'évaluation complet à travers les disciplines académiques.
Le compte rendu complet de Paul Litvak est disponible ici. Il est à noter que l'expérience n'a pas utilisé la génération la plus récente de modèles d'IA, ce qui suggère que les systèmes plus récents pourraient atteindre des taux de détection encore plus élevés.
Ces résultats ont été mis en avant sur Marginal Revolution.