S'abonner

L’Intelligence artificielle dans les revues systématiques et les méta-analyses : performance spécifique par tâche, quantification de l’erreur résiduelle et supervision humaine - 08/08/26

Artificial intelligence in systematic reviews and meta-analyses: Task-specific performance, residual error quantification, and human oversight

Doi : 10.1016/j.rcot.2026.07.013 
Jules Descamps 1, 2, Nicolas Bouguennec 3, Raphael Porcher 2, Matthieu Resche-Rigon 2, Pierre-Alban Bouché 1, 2,
1 Hôpital Lariboisière, service de chirurgie orthopédique, 2, rue Ambroise-Paré, 75010 Paris, France 
2 Faculté de médecine, université Paris Cité, Paris, France 
3 Sports Clinic of Bordeaux-Merignac, 4, rue Georges-Nègrevergne, 33700 Mérignac, France 

Pierre-Alban Bouché, Hôpital Lariboisière, service de chirurgie orthopédique, 2, rue Ambroise-Paré, 75010 Paris, France. Hôpital Lariboisière, service de chirurgie orthopédique 2, rue Ambroise-Paré Paris 75010 France
Sous presse. Épreuves corrigées par l'auteur. Disponible en ligne depuis le Saturday 08 August 2026

Résumé

Contexte

Le volume des publications scientifiques a augmenté rapidement, renforçant le besoin de synthèses probantes fiables et régulièrement mises à jour. Les revues systématiques (RS) et les méta-analyses (MA) demeurent le plus haut niveau de preuve, mais leur réalisation est longue et coûteuse en ressources, dépassant souvent un an. L’intelligence artificielle (IA) est de plus en plus utilisée pour automatiser les étapes de ce processus, mais la validation de ses performances et de sa rigueur méthodologique reste limitée. Cette revue narrative aborde trois questions : 1) à quelles étapes du processus RS/MA l’IA peut-elle être utilisée de manière fiable ; 2) comment évaluer la performance de l’IA pour chaque tâche ; et 3) comment quantifier l’erreur résiduelle après vérification humaine.

Méthodes

Nous décrivons les principes et les étapes clés d’une méta-analyse traditionnelle et examinons la contribution de l’IA à chaque étape. La littérature a été issue des principales bases de données biomédicales ; aucune recherche systématique n’a été réalisée. Les performances de l’IA sont résumées par tâche, l’évaluation comparative et la quantification de l’erreur résiduelle étant considérées séparément.

Résultats

Sur l’ensemble du processus, la maturité de l’IA est hétérogène. Dans une revue systématique de 2025 portant sur 19 études comparatives, l’IA générative a manqué 68,0 % à 96,0 % des études pertinentes lors de la recherche, et a produit des décisions d’inclusion incorrectes dans 0,0 % à 29,0 % des cas, des exclusions incorrectes dans 1,0 % à 83,0 %, des extractions incorrectes dans 4,0 % à 31,0 %, et des évaluations du risque de biais incorrectes dans 10,0 % à 56,0 %. Une revue de portée de 2025 a identifié 37 articles : 15/37 (41 %) concernant la recherche bibliographique, 14/37 (38 %) la sélection des études, 11/37 (30 %) l’extraction de données ; 33/37 (89 %) utilisaient des modèles GPT et 21/37 (57 %) étaient des études de validation ; 20/37 (54 %) ont conclu de manière prometteuse, aucune comme implémentation validée. Le cribéage titre/résumé était le plus mature (sensibilité 99,2 %, spécificité 83,6 %) par rapport au cribéage texte intégral (97,6 % et 47,4 %). Pour l’extraction structurée sur 30 articles, un outil a atteint 92,0 % de précision, rappel et F1, mais la sensibilité tombait à 77,0 %–80,0 % pour les variables spécifiques à la revue, avec des confabulations dans 4/90 (4 %) des points de données ; sur 107 essais, la précision d’extraction était de 96,2 % (97,9 % avec affinage) tandis que le temps moyen est passé de 86,9 à 14,7 min par essai. L’évaluation du risque de biais était la tâche la plus fragile (kappa 0,51, IC 95 % : 0,36–0,66). Pour l’erreur résiduelle, 0 erreur parmi 60 éléments vérifiés correspond à une borne supérieure unilatérale à 95 % de 4,9 %.

Discussion

L’IA transforme les RS/MA vers des flux de travail hybrides homme–machine plutôt qu’elle ne les remplace. Les performances sont spécifiques à la tâche, et les métriques seules sont insuffisantes : l’incertitude résiduelle doit être quantifiée. Les données actuelles soutiennent l’IA comme technologie d’assistance sous supervision humaine, et non une utilisation autonome.

Niveau de preuve

V ; revue narrative.

Le texte complet de cet article est disponible en PDF.

Summary

Background

The volume of published research has expanded rapidly, intensifying the need for reliable, regularly updated evidence syntheses. Systematic reviews (SRs) and meta-analyses (MAs) remain the highest level of evidence, but their completion is time-consuming and resource-intensive, often extending beyond one year. Artificial intelligence (AI) is increasingly applied to automate stages of this workflow, yet validation of performance and methodological rigor remains limited. This narrative review addresses three questions: 1) at which stages of the SR/MA workflow can AI be used reliably; 2) how should AI performance be benchmarked for each task; and 3) how can the residual error remaining after human checking be quantified.

Methods

We outline the principles and key steps of a traditional meta-analysis and examine the contribution of AI at each stage. Literature was drawn from major biomedical databases; no systematic search was performed. AI performance is summarized by task, with benchmarking and residual-error quantification considered separately.

Results

Across the workflow, AI maturity is heterogeneous. In a 2025 systematic review of 19 comparative studies, generative AI missed 68.0% to 96.0% of relevant studies in searching, made incorrect inclusion decisions in 0.0% to 29.0% and incorrect exclusions in 1.0% to 83.0%, incorrect data extractions in 4.0% to 31.0%, and incorrect risk-of-bias assessments in 10.0% to 56.0%. A 2025 scoping review identified 37 articles: 15/37 (41%) searching, 14/37 (38%) study selection, 11/37 (30%) extraction, 33/37 (89%) GPT-based, 21/37 (57%) validation studies; 20/37 (54%) drew a promising conclusion, none as a validated implementation. Title/abstract screening was most mature (sensitivity 99.2%, specificity 83.6%) versus full-text screening (97.6% and 47.4%). For structured extraction across 30 articles, one tool reached 92.0% precision, recall, and F1, but sensitivity fell to 77.0% to 80.0% for review-specific variables, with confabulations in 4/90 (4%) of data points; across 107 trials, extraction accuracy was 96.2% (97.9% with refinement) while mean time fell from 86.9 to 14.7 mins per trial. Risk-of-bias assessment was most fragile (kappa 0.51, 95% CI: 0.36–0.66). For residual error, 0 errors among 60 checked items corresponds to an upper one-sided 95% bound of 4.9%.

Discussion

AI is transforming SR/MA toward hybrid human–machine workflows rather than replacing them. Performance is task-specific, and metrics alone are insufficient: residual uncertainty should be quantified. Current evidence supports AI as an assistive technology under human oversight, not autonomous use.

Level of evidence

lV; narrative review.

Le texte complet de cet article est disponible en PDF.

Mots clés : Synthèse des preuves assistée par IA (revue systématique/méta-analyse/supervision humaine), Sélection des études (titre-résumé/texte intégral/rappel-spécificité/WSS@95 %), Extraction de données (variables structurées/précision au niveau du champ/confabulation), Évaluation du risque de biais (RoB 2/ROBINS-I/NOS/kappa), Quantification de l’erreur résiduelle (Clopper-Pearson/règle de trois/vérification manuelle)

Keywords : AI-assisted evidence synthesis (systematic review/meta-analysis/human oversight), Study screening (title-abstract/full-text/recall-specificity/WSS@95%), Data extraction (structured variables/field-level accuracy/confabulation), Risk-of-bias assessment (RoB 2/ROBINS-I/NOS/kappa), Residual error quantification (Clopper-Pearson/rule of three/manual checking)


Plan


  Ne pas utiliser, pour citation, la référence française de cet article, mais celle de l’article original paru dans Orthopaedics & Traumatology: Surgery & Research , en utilisant le DOI ci-dessus.


© 2026  The Author(s). Publié par Elsevier Masson SAS. Tous droits réservés.
Ajouter à ma bibliothèque Retirer de ma bibliothèque Imprimer
Export

    Export citations

  • Fichier

  • Contenu

Bienvenue sur EM-consulte, la référence des professionnels de santé.
L’accès au texte intégral de cet article nécessite un abonnement.

Déjà abonné à cette revue ?

Elsevier s'engage à rendre ses eBooks accessibles et à se conformer aux lois applicables. Compte tenu de notre vaste bibliothèque de titres, il existe des cas où rendre un livre électronique entièrement accessible présente des défis uniques et l'inclusion de fonctionnalités complètes pourrait transformer sa nature au point de ne plus servir son objectif principal ou d'entraîner un fardeau disproportionné pour l'éditeur. Par conséquent, l'accessibilité de cet eBook peut être limitée. Voir plus

Mon compte


Plateformes Elsevier Masson

Déclaration CNIL

EM-CONSULTE.COM est déclaré à la CNIL, déclaration n° 1286925.

En application de la loi nº78-17 du 6 janvier 1978 relative à l'informatique, aux fichiers et aux libertés, vous disposez des droits d'opposition (art.26 de la loi), d'accès (art.34 à 38 de la loi), et de rectification (art.36 de la loi) des données vous concernant. Ainsi, vous pouvez exiger que soient rectifiées, complétées, clarifiées, mises à jour ou effacées les informations vous concernant qui sont inexactes, incomplètes, équivoques, périmées ou dont la collecte ou l'utilisation ou la conservation est interdite.
Les informations personnelles concernant les visiteurs de notre site, y compris leur identité, sont confidentielles.
Le responsable du site s'engage sur l'honneur à respecter les conditions légales de confidentialité applicables en France et à ne pas divulguer ces informations à des tiers.


Tout le contenu de ce site: Copyright © 2026 Elsevier, ses concédants de licence et ses contributeurs. Tout les droits sont réservés, y compris ceux relatifs à l'exploration de textes et de données, a la formation en IA et aux technologies similaires. Pour tout contenu en libre accès, les conditions de licence Creative Commons s'appliquent.