Suscribirse

Performance diagnostique des Large Language Models en rhumatologie : étude comparative de ChatGPT-4, Gemini, Copilot et Claude - 02/12/25

Doi : 10.1016/j.rhum.2025.10.333 
Y.L.T. Bayala , W.J.S. Zabsonré Tiendrebeogo, D.D. Ouedraogo, F. Kaboré, C. Sougué, A.R. Yameogo, M.W. Nacanabo, I. Ayouba Tinni, A. Ouedraogo, Y.E. Zongo
 Rhumatologie, centre hospitalier universitaire de Bogodogo, Ouagadougou, Burkina Faso 

Auteur correspondant.

Resumen

Introduction

Le diagnostic médical repose traditionnellement sur la clinique, l’imagerie et les examens biologiques, dont les limites en termes de précision ont favorisé le développement d’outils d’aide au diagnostic basés sur l’intelligence artificielle [1] . Les outils d’intelligence artificielle, en particulier les grands modèles de langage (LLMs), ont transformé la pratique médicale [2] . Toutefois, leurs performances diagnostiques demeurent encore peu explorées dans le contexte rhumatologique. L’objectif de cette étude était d’évaluer la précision diagnostique de ChatGPT-4, Gemini, Copilot et Claude en rhumatologie avec des données cliniques et paracliniques des patients réels.

Patients et méthodes

Il s’agit d’une étude analytique transversale avec collecte rétrospective, menée au sein du service de rhumatologie du Centre Hospitalier Universitaire de Bogodogo au Burkina Faso, du 1er janvier au 30 juin 2024. Les données cliniques et paracliniques standardisées des patients ont été soumises aux quatre modèles d’IA. Les diagnostics proposés par les IA ont été comparés aux diagnostics de référence établis par un panel de rhumatologues seniors. La qualité des diagnostics différentiels a été faite à l’aide du score ordinal de Bond et al. Les paramètres métriques ont été calculés pour chaque LLMs. Les analyses univariée et multivariée ont été menées. Le seuil de significativité statistique a été fixé à p < 0,05.

Résultats

Cent trois patients ont été inclus, les affections infectieuses représentaient 47,57 % des cas ( n = 49). L’exactitude diagnostique globale de la clinique combinée à la paraclinique était de 86,41 % pour ChatGPT 4 ( n = 89), 71,84 % pour Gemini ( n = 74). Copilot avait retrouvé exactement le diagnostic de 78 patients (75,73 %), et Claude pour 88 patients (85,44 %) ( Fig. 1 ). Le diagnostic du rhumatologue était inclus avec un score de 5 de Bound et al. dans les diagnostics différentiels de ChatGPT 4 dans 75,72 % des cas ( n = 78), Gemini dans 57,28 % ( n = 59), Copilot dans 55,33 % ( n = 57) et Claude AI dans 75,72 % des cas ( n = 78) ( Fig. 2 ). La concordance inter-LLMs selon le coefficient kappa de Cohen était compris entre 0,43 et 0,59. ChatGPT-4 et Claude ont montré une sensibilité élevée de plus de 90 % pour la majorité des affections, mais une performance plus faible pour les pathologies néoplasiques avec une sensibilité inférieur à 67 % et un AUC < 0,40. ( Fig. 3 ). L’analyse multivariée a montré que les pathologies tumorales étaient significativement associées à une réduction du taux de diagnostic correct par ChatGPT-4 (OR = 0,08 ; IC [0,01 ; 0,45] ; p = 0,004) et Copilot (OR = 0,09 ; IC [0,01 ; 0,54] ; p = 0,007). À l’inverse, les patients de moins de 50 ans avaient une probabilité significativement plus élevée d’obtenir un diagnostic correct avec Copilot (OR = 3,36 ; IC [1,16 ; 9,71] ; p = 0,025).

Conclusion

Les LLMs, en particulier ChatGPT-4 et Claude AI, présentent des performances diagnostiques élevées en rhumatologie. Les pathologies tumorales étaient moins bien identifiées par ChatGPT-4 et Copilot, réduisant leur performance dans ce domaine. En revanche, les patients de moins de 50 ans avaient une meilleure probabilité d’obtenir un diagnostic correct avec Copilot.

El texto completo de este artículo está disponible en PDF.

Esquema


© 2025  Publicado por Elsevier Masson SAS.
Añadir a mi biblioteca Eliminar de mi biblioteca Imprimir
Exportación

    Exportación citas

  • Fichero

  • Contenido

Vol 92 - N° S1

P. A25-A26 - décembre 2025 Regresar al número
Artículo precedente Artículo precedente
  • La sexualité féminine chez les rhumatismes inflammatoires chroniques : étude qualitative
  • A. Raja, S. Rachidi, H. Bighouab, M. Ouadaa, A.M. S, I. Ghozlani, M. Erraoui
| Artículo siguiente Artículo siguiente
  • Quel est l’impact environnemental de la recherche clinique en France ? Analyse du cycle de vie de l’essai clinique STAR
  • A. Ruyssen-Witrand, M. Masson, S. Galandrin, C. Daguzan, L. Caturla, D. Thuillez, Y. Degboe, A. Constantin

Bienvenido a EM-consulte, la referencia de los profesionales de la salud.
El acceso al texto completo de este artículo requiere una suscripción.

¿Ya suscrito a @@106933@@ revista ?

@@150455@@ Voir plus

Mi cuenta


Declaración CNIL

EM-CONSULTE.COM se declara a la CNIL, la declaración N º 1286925.

En virtud de la Ley N º 78-17 del 6 de enero de 1978, relativa a las computadoras, archivos y libertades, usted tiene el derecho de oposición (art.26 de la ley), el acceso (art.34 a 38 Ley), y correcta (artículo 36 de la ley) los datos que le conciernen. Por lo tanto, usted puede pedir que se corrija, complementado, clarificado, actualizado o suprimido información sobre usted que son inexactos, incompletos, engañosos, obsoletos o cuya recogida o de conservación o uso está prohibido.
La información personal sobre los visitantes de nuestro sitio, incluyendo su identidad, son confidenciales.
El jefe del sitio en el honor se compromete a respetar la confidencialidad de los requisitos legales aplicables en Francia y no de revelar dicha información a terceros.


Todo el contenido en este sitio: Copyright © 2026 Elsevier, sus licenciantes y colaboradores. Se reservan todos los derechos, incluidos los de minería de texto y datos, entrenamiento de IA y tecnologías similares. Para todo el contenido de acceso abierto, se aplican los términos de licencia de Creative Commons.