S'abonner

Artificial intelligence in systematic reviews and meta-analyses: Task-specific performance, residual error quantification, and human oversight - 02/10/26

Doi : 10.1016/j.otsr.2026.104793 
Jules Descamps a, b, Nicolas Bouguennec c, Raphael Porcher b, Matthieu Resche-Rigon b, Pierre-Alban Bouché a, b, ⁎
a Division of Orthopaedic Surgery, Lariboisière hospital, 2 rue Ambroise Paré, 75010, Paris, France 
b Université Paris Cité, School of Medecine, Paris, France 
c Sports Clinic of Bordeaux-Merignac, 4 Rue Georges Nègrevergne, 33700 Mérignac, France 

⁎ Corresponding author.

Abstract

Background

The volume of published research has expanded rapidly, intensifying the need for reliable, regularly updated evidence syntheses. Systematic reviews (SRs) and meta-analyses (MAs) remain the highest level of evidence, but their completion is time-consuming and resource-intensive, often extending beyond one year. Artificial intelligence (AI) is increasingly applied to automate stages of this workflow, yet validation of performance and methodological rigor remains limited. This narrative review addresses three questions: 1) at which stages of the SR/MA workflow can AI be used reliably; 2) how should AI performance be benchmarked for each task; and 3) how can the residual error remaining after human checking be quantified.

Methods

We outline the principles and key steps of a traditional meta-analysis and examine the contribution of AI at each stage. Literature was drawn from major biomedical databases; no systematic search was performed. AI performance is summarized by task, with benchmarking and residual-error quantification considered separately.

Results

Across the workflow, AI maturity is heterogeneous. In a 2025 systematic review of 19 comparative studies, generative AI missed 68.0%–96.0% of relevant studies in searching, made incorrect inclusion decisions in 0.0%–29.0% and incorrect exclusions in 1.0%–83.0%, incorrect data extractions in 4.0%–31.0%, and incorrect risk-of-bias assessments in 10.0%–56.0%. A 2025 scoping review identified 37 articles: 15/37 (41%) searching, 14/37 (38%) study selection, 11/37 (30%) extraction, 33/37 (89%) GPT-based, 21/37 (57%) validation studies; 20/37 (54%) drew a promising conclusion, none as a validated implementation. Title/abstract screening was most mature (sensitivity 99.2%, specificity 83.6%) versus full-text screening (97.6% and 47.4%). For structured extraction across 30 articles, one tool reached 92.0% precision, recall, and F1, but sensitivity fell to 77.0%–80.0% for review-specific variables, with confabulations in 4/90 (4%) of data points; across 107 trials, extraction accuracy was 96.2% (97.9% with refinement) while mean time fell from 86.9 to 14.7 min per trial. Risk-of-bias assessment was most fragile (kappa 0.51, 95% CI: 0.36−0.66). For residual error, 0 errors among 60 checked items corresponds to an upper one-sided 95% bound of 4.9%.

Discussion

AI is transforming SR/MA toward hybrid human-machine workflows rather than replacing them. Performance is task-specific, and metrics alone are insufficient: residual uncertainty should be quantified. Current evidence supports AI as an assistive technology under human oversight, not autonomous use.

Level of evidence

lV; narrative review.

Le texte complet de cet article est disponible en PDF.

Keywords : AI-assisted evidence synthesis (systematic review/meta-analysis/human oversight), Study screening (title-abstract/full-text/recall-specificity/WSS@95%), Data extraction (structured variables/field-level accuracy/confabulation), Risk-of-bias assessment (RoB 2/ROBINS-I/NOS/kappa), Residual error quantification (Clopper-Pearson/rule of three/manual checking), Hybrid AI workflow (LLM benchmarking/prompt validation/inter-model entropy)


Plan


© 2026  The Authors. Publié par Elsevier Masson SAS. Tous droits réservés.
Ajouter à ma bibliothèque Retirer de ma bibliothèque Imprimer
Export

    Export citations

  • Fichier

  • Contenu

Vol 112 - N° 6

Article 104793- octobre 2026 Retour au numéro
Article précédent Article précédent
  • Can large language models provide high-quality desk review decisions in an orthopaedic surgery journal? A concordance study comparing three AI models to human editorial decisions
  • Elise Lupon, Quentin Bérard, Henri Migaud, Philippe Clavert, Grégoire Micicoi
| Article suivant Article suivant
  • What would be the ideal robotic companion in orthopaedic surgery in 10 years?
  • Alberto Fogacci, Pascal Kouyoumdjian, Tarik Ait Si Selmi, Sophie Putman, Christophe Jacquet, Sebastien Lustig

Bienvenue sur EM-consulte, la référence des professionnels de santé.
L’accès au texte intégral de cet article nécessite un abonnement.

Déjà abonné à cette revue ?

Elsevier s'engage à rendre ses eBooks accessibles et à se conformer aux lois applicables. Compte tenu de notre vaste bibliothèque de titres, il existe des cas où rendre un livre électronique entièrement accessible présente des défis uniques et l'inclusion de fonctionnalités complètes pourrait transformer sa nature au point de ne plus servir son objectif principal ou d'entraîner un fardeau disproportionné pour l'éditeur. Par conséquent, l'accessibilité de cet eBook peut être limitée. Voir plus

Mon compte


Plateformes Elsevier Masson

Déclaration CNIL

EM-CONSULTE.COM est déclaré à la CNIL, déclaration n° 1286925.

En application de la loi nº78-17 du 6 janvier 1978 relative à l'informatique, aux fichiers et aux libertés, vous disposez des droits d'opposition (art.26 de la loi), d'accès (art.34 à 38 de la loi), et de rectification (art.36 de la loi) des données vous concernant. Ainsi, vous pouvez exiger que soient rectifiées, complétées, clarifiées, mises à jour ou effacées les informations vous concernant qui sont inexactes, incomplètes, équivoques, périmées ou dont la collecte ou l'utilisation ou la conservation est interdite.
Les informations personnelles concernant les visiteurs de notre site, y compris leur identité, sont confidentielles.
Le responsable du site s'engage sur l'honneur à respecter les conditions légales de confidentialité applicables en France et à ne pas divulguer ces informations à des tiers.


Tout le contenu de ce site: Copyright © 2026 Elsevier, ses concédants de licence et ses contributeurs. Tout les droits sont réservés, y compris ceux relatifs à l'exploration de textes et de données, a la formation en IA et aux technologies similaires. Pour tout contenu en libre accès, les conditions de licence Creative Commons s'appliquent.