Évaluation de la qualité des questions d’examens aux formats docimologiques variés générées par l’intelligence artificielle générative : une aide pour la créativité et un gain de temps pour les enseignants ? - 02/12/25
Résumé |
Introduction |
L’intelligence artificielle générative (IAG) est désormais couramment utilisée pour automatiser des tâches répétitives. Son utilisation en enseignement médical se développe également avec plusieurs publications montrant son intérêt dans l’écriture des questions d’examen, exercice chronophage pour les enseignants. Cependant, la majorité des études publiées portent sur la rédaction de questions simples de type question à réponses multiples (QRM). La réforme du second cycle (R2C) a imposé des formats docimologiques diversifiés tant dans la rédaction des briques élémentaires que dans l’agencement des questions. L’objectif de cette étude était d’évaluer la capacité de l’IAG d’écrire des questions types R2C et d’en évaluer la qualité.
Matériels et méthodes |
Chat GPT version 5 a été utilisée. L’écriture des prompts a été réalisée selon une méthode d’itération avec amélioration du prompt jusqu’à sa stabilisation lorsque le format de question satisfaisant était atteint. Des exemples de questions types ont été proposés à l’IA pour qu’elle en tire les règles de rédactions implicites. Dans un premier temps, l’écriture des prompts a, concerné le format des questions (QRM, QRP, QRPL, QRU best answer, QROC, ZAP) puis les différents types d’agencements en DP, KFP ou SQI. Enfin, les tableaux d’objectifs des connaissances en rhumatologie de la R2C précisant les rangs lui ont été fournis en précisant la nécessité d’un équilibre entre les rangs A et B. Aucune source de connaissance spécifique n’était donnée à l’IA. Un examen complet de 30 questions a été créé. La qualité des questions (énoncés et réponses proposées) a été analysée par 2 enseignants de manière indépendante avec discussion des jugements discordants pour aboutir à un consensus final.
Résultats |
Au total, 30 questions (150 propositions) ont été générées (10 QRM, 6 QRU, 5 QROC, 5 QRPL, 3 QRP, 1 ZAP) sous la forme de 3 DP, 1 KFP et 1 SQI. La proportion de rang A était de 50 %. Concernant la qualité des questions, le format docimologique était respecté dans 93 % des cas (28/30), les énoncés étaient pertinents et clairs dans 100 % des cas et le niveau des questions adapté au 2 e cycle dans 96 % des cas (29/30). Selon la classification de Bloom, 12 questions étaient de niveau « retient », 9 de niveau « applique » et 9 de niveau « analyse ». Des erreurs de réponses étaient présentes dans 12 propositions sur 150 (8 %) concernant au total 9 questions (30 %), le plus souvent dans les questions de type QRPL. 23 propositions sur 150 (15 %) ont dû subir des modifications mineures, 2 majeures (1 %) et 15 (10 %) ont été complètement réécrites. Concernant les modifications mineures, beaucoup concernaient des modifications de formulation des adverbes tels que « toujours » ou « jamais » qui rendaient la question trop facile.
Conclusion |
L’IAG est un outil utilisable pour la création de questions d’examen. L’écriture de prompts adaptés à permis de couvrir toute la docimologie demandée par la R2 C avec un très bon respect des formats. Les propositions étaient de niveau adapté et dans les objectifs de connaissance malgré l’absence d’utilisation du référentiel comme source de données. Le niveau des questions était le plus souvent de niveau « retient » selon la classification de Bloom. Quinze pourcents des questions nécessitaient des modifications mineures et 10 % devaient être entièrement réécrites. L’IAG peut donc aider l’enseignant à créer des questions d’examen mais avec nécessité d’une relecture attentive [1] .
Le texte complet de cet article est disponible en PDF.Plan
Vol 92 - N° S1
P. A110 - décembre 2025 Retour au numéroBienvenue sur EM-consulte, la référence des professionnels de santé.
L’accès au texte intégral de cet article nécessite un abonnement.
Déjà abonné à cette revue ?

