{"access":"open","annotations":"Correct answer per question; no oncology sub-labels, though many items are oncology cases.","article":null,"cancer_slugs":["pan-cancer"],"details":"","doi":null,"formats":["JSON"],"hf":null,"huggingface":null,"kind":"benchmark","license":"MIT","modalities":["clinical-text"],"models":[{"name":"MedGemma","note":"","role":"benchmark","slug":"medgemma"},{"name":"Med-PaLM 2","note":"","role":"benchmark","slug":"med-palm-2"}],"name":"MedQA (USMLE)","page":"/ai-oncology/datasets/medqa","provider":"Jin et al. (Columbia University)","size":{"items":12723,"notes_en":"multiple-choice medical licensing exam questions; also Mandarin and Traditional Chinese subsets","notes_pl":"pytania wielokrotnego wyboru z egzamin\u00f3w lekarskich; tak\u017ce podzbiory w mandary\u0144skim i tradycyjnym chi\u0144skim","unit":"questions (English)"},"slug":"medqa","sources":[{"label":"Jin D et al. What Disease Does This Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical Exams. 2021","url":"https://arxiv.org/abs/2009.13081"}],"summary":"The exam-style benchmark on which Med-PaLM 2, GPT-4 and MedGemma report headline accuracy; useful for comparing models, not for judging clinical safety.","tasks":["question-answering"],"url":"https://github.com/jind11/MedQA","verified_at":"2026-09-05T22:25:59.099060"}
