Fórum:AI/Porovnani MCQ
Porovnání testových úloh generovaných AI a lidmi
AI versus human-generated multiple-choice questions for medical education: a cohort study in a high-stakes examination je prospektivní kohortová studie publikovaná v únoru 2025 v odborném časopise BMC Medical Education. Výzkum se zaměřil na porovnání kvality testových otázek s výběrem odpovědí (MCQs) vytvořených modelem umělé inteligence ChatGPT-4o a zkušenými lékařskými pedagogy.
Metodika
Studie proběhla v srpnu 2024 v rámci přípravy na atestační zkoušku z urgentní medicíny v Hongkongu.
- Vzorek: 24 lékařů v předatestační přípravě.
- Nástroje: Porovnávaly se dvě sady po 100 otázkách (jedna generovaná AI, druhá lidmi).
- Kritéria hodnocení: Psychometrické vlastnosti, kognitivní úroveň dle Bloomovy taxonomie, faktická správnost a klinická relevance.
Klíčová zjištění
Kognitivní úroveň a obtížnost
Výsledky ukázaly signifikantní rozdíly v hloubce testování znalostí:
- Bloomova taxonomie: Otázky od AI se soustředily primárně na nižší kognitivní úrovně (znalosti a porozumění). Lidmi vytvořené otázky lépe cílily na vyšší úrovně (aplikace a analýza), které jsou pro klinickou praxi klíčové.
- Obtížnost: Testové položky generované AI byly vyhodnoceny jako statisticky významně snazší než položky vytvořené experty.
Kvalita a chybovost
Studie identifikovala vyšší míru nedostatků u AI:
- Faktická chybovost: 6 % u AI (oproti 4 % u lidí).
- Irelevance: 6 % otázek od AI bylo označeno za klinicky irelevantní (0 % u lidí).
- Nevhodná náročnost: 14 % AI otázek neodpovídalo úrovni atestační zkoušky (1 % u lidí).
Psychometrie
V oblasti diskriminační schopnosti (schopnost testu odlišit studenty s lepšími znalostmi od těch slabších) nebyly mezi AI a lidmi nalezeny žádné statisticky významné rozdíly. Obě sady otázek fungovaly v tomto ohledu srovnatelně.
Závěry
Autoři studie konstatují, že ačkoliv je ChatGPT-4o vysoce efektivním nástrojem pro rychlou tvorbu velkého množství otázek, v současné fázi vývoje nedosahuje kvality lidských expertů u vysoce náročných (high-stakes) lékařských zkoušek.
Hlavní doporučení pro pedagogickou praxi:
- Hybridní model: Využívat AI k tvorbě prvotních draftů otázek pro zvýšení efektivity.
- Lidský dohled: Nezbytnost přísné odborné revize (human-in-the-loop) k zajištění klinické hloubky a faktické přesnosti.
Reference
- Li, et al. (2025). AI versus human-generated multiple-choice questions for medical education: a cohort study in a high-stakes examination. BMC Medical Education. PMID: 39923067
