S'abonner

Guideline-based evaluation of five generative artificial intelligence chatbot platforms for clinician-oriented questions on open temporomandibular joint surgery - 11/09/26

Doi : 10.1016/j.jormas.2026.102972 
Selin Gaş a , Erdinç Sulukan b , Büşra Korkmaz a,
a Department of Oral and Maxillofacial Surgery, Faculty of Dentistry, Istanbul Gelisim University, Cihangir Mah., Şehit Jandarma Komando Er Hakan Öner Sok. No: 1, 34310 Avcılar, Istanbul, Turkey 
b Department of Oral and Maxillofacial Surgery, Faculty of Dentistry, Istanbul Beykent University, Ayazağa Mah., Hadım Koruyolu Cad. No: 19, 34398 Sarıyer, Istanbul, Turkey 

Corresponding author.

Abstract

Objective

To compare the quality and readability of responses from five generative artificial intelligence chatbot platforms to clinician-oriented questions on open temporomandibular joint (TMJ) surgery against guideline-based reference answers.

Material and methods

Forty questions across eight domains were submitted on 16 July 2026 to ChatGPT (GPT-5.5), Claude (Opus 4.8), Gemini (3.1 Pro), Grok (4) and Perplexity (Pro), each via its paid tier at default settings (200 responses). Two blinded oral and maxillofacial surgeons applied the Quality Analysis of Medical Artificial Intelligence (QAMAI) tool, the Global Quality Score (GQS) and a five-point overall quality rating using a priori key elements and written anchors. Readability was assessed with the Flesch-Kincaid Grade Level (FKGL) and Flesch Reading Ease Score (FRES); platforms were compared with the Friedman test and Bonferroni-corrected Wilcoxon post-hoc tests; inter-rater reliability used intraclass correlation coefficients (ICC).

Results

Inter-rater reliability was good to excellent (average-measure ICC 0.93–0.99). All outcomes except clarity differed among platforms ( P < .001). Perplexity achieved the highest QAMAI total (27.5 ± 1.4; Kendall’s W = 0.75), largely through retrieval-based source provision; excluding this domain, Claude, Perplexity and Gemini converged. Claude had the highest GQS (4.5 ± 0.6), Gemini the highest overall rating (4.3 ± 0.7); Grok scored lowest. Claude and Gemini were least readable (median FKGL 22.7 and 26.1; FRES −11.6 and −7.5). Length did not explain scores within platforms.

Conclusions

Performance varied substantially across platforms and dimensions; no platform optimized all outcomes. These findings describe informational quality, not clinical safety or decision-making, and support specialist verification before clinical use.

Le texte complet de cet article est disponible en PDF.

Keywords : Artificial intelligence, Generative artificial intelligence, Large language models, Temporomandibular joint, Arthroplasty, Clinical decision-making


Plan


© 2026  Elsevier Masson SAS. Tous droits réservés.
Ajouter à ma bibliothèque Retirer de ma bibliothèque Imprimer
Export

    Export citations

  • Fichier

  • Contenu

Vol 127 - N° 5

Article 102972- octobre 2026 Retour au numéro
Article précédent Article précédent
  • Dangerous trends on social media related to facial esthetics: Analysis of looksmaxxing and its softmaxxing and hardmaxxing practices
  • Ricardo Grillo, Laís Albuquerque Fernandes, Luiz Augusto Rodrigues dos Santos, Bernardo Correia Lima, Mariana Aparecida Brozoski, Guilherme Spagnol
| Article suivant Article suivant
  • First intraoral use of therapeutic oxygen carrier Hemarina-M101 for mandibular osteoradionecrosis: a case report
  • C. Duvaud, J.D. Kün-Darbois, H. Aïssani, A. Gueutier

Bienvenue sur EM-consulte, la référence des professionnels de santé.
L’accès au texte intégral de cet article nécessite un abonnement.

Déjà abonné à cette revue ?

Elsevier s'engage à rendre ses eBooks accessibles et à se conformer aux lois applicables. Compte tenu de notre vaste bibliothèque de titres, il existe des cas où rendre un livre électronique entièrement accessible présente des défis uniques et l'inclusion de fonctionnalités complètes pourrait transformer sa nature au point de ne plus servir son objectif principal ou d'entraîner un fardeau disproportionné pour l'éditeur. Par conséquent, l'accessibilité de cet eBook peut être limitée. Voir plus

Mon compte


Plateformes Elsevier Masson

Déclaration CNIL

EM-CONSULTE.COM est déclaré à la CNIL, déclaration n° 1286925.

En application de la loi nº78-17 du 6 janvier 1978 relative à l'informatique, aux fichiers et aux libertés, vous disposez des droits d'opposition (art.26 de la loi), d'accès (art.34 à 38 de la loi), et de rectification (art.36 de la loi) des données vous concernant. Ainsi, vous pouvez exiger que soient rectifiées, complétées, clarifiées, mises à jour ou effacées les informations vous concernant qui sont inexactes, incomplètes, équivoques, périmées ou dont la collecte ou l'utilisation ou la conservation est interdite.
Les informations personnelles concernant les visiteurs de notre site, y compris leur identité, sont confidentielles.
Le responsable du site s'engage sur l'honneur à respecter les conditions légales de confidentialité applicables en France et à ne pas divulguer ces informations à des tiers.


Tout le contenu de ce site: Copyright © 2026 Elsevier, ses concédants de licence et ses contributeurs. Tout les droits sont réservés, y compris ceux relatifs à l'exploration de textes et de données, a la formation en IA et aux technologies similaires. Pour tout contenu en libre accès, les conditions de licence Creative Commons s'appliquent.