Fórum:AI/Porovnani MCQ

Porovnání testových úloh generovaných AI a lidmi

AI versus human-generated multiple-choice questions for medical education: a cohort study in a high-stakes examination je prospektivní kohortová studie publikovaná v únoru 2025 v odborném časopise BMC Medical Education. Výzkum se zaměřil na porovnání kvality testových otázek s výběrem odpovědí (MCQs) vytvořených modelem umělé inteligence ChatGPT-4o a zkušenými lékařskými pedagogy.

Metodika

Studie proběhla v srpnu 2024 v rámci přípravy na atestační zkoušku z urgentní medicíny v Hongkongu.

  • Vzorek: 24 lékařů v předatestační přípravě.
  • Nástroje: Porovnávaly se dvě sady po 100 otázkách (jedna generovaná AI, druhá lidmi).
  • Kritéria hodnocení: Psychometrické vlastnosti, kognitivní úroveň dle Bloomovy taxonomie, faktická správnost a klinická relevance.

Klíčová zjištění

Kognitivní úroveň a obtížnost

Výsledky ukázaly signifikantní rozdíly v hloubce testování znalostí:

  • Bloomova taxonomie: Otázky od AI se soustředily primárně na nižší kognitivní úrovně (znalosti a porozumění). Lidmi vytvořené otázky lépe cílily na vyšší úrovně (aplikace a analýza), které jsou pro klinickou praxi klíčové.
  • Obtížnost: Testové položky generované AI byly vyhodnoceny jako statisticky významně snazší než položky vytvořené experty.

Kvalita a chybovost

Studie identifikovala vyšší míru nedostatků u AI:

  • Faktická chybovost: 6 % u AI (oproti 4 % u lidí).
  • Irelevance: 6 % otázek od AI bylo označeno za klinicky irelevantní (0 % u lidí).
  • Nevhodná náročnost: 14 % AI otázek neodpovídalo úrovni atestační zkoušky (1 % u lidí).

Psychometrie

V oblasti diskriminační schopnosti (schopnost testu odlišit studenty s lepšími znalostmi od těch slabších) nebyly mezi AI a lidmi nalezeny žádné statisticky významné rozdíly. Obě sady otázek fungovaly v tomto ohledu srovnatelně.

Závěry

Autoři studie konstatují, že ačkoliv je ChatGPT-4o vysoce efektivním nástrojem pro rychlou tvorbu velkého množství otázek, v současné fázi vývoje nedosahuje kvality lidských expertů u vysoce náročných (high-stakes) lékařských zkoušek.

Hlavní doporučení pro pedagogickou praxi:

  1. Hybridní model: Využívat AI k tvorbě prvotních draftů otázek pro zvýšení efektivity.
  2. Lidský dohled: Nezbytnost přísné odborné revize (human-in-the-loop) k zajištění klinické hloubky a faktické přesnosti.


Reference

  • Li, et al. (2025). AI versus human-generated multiple-choice questions for medical education: a cohort study in a high-stakes examination. BMC Medical Education. PMID: 39923067