MedQA (USMLE)
Benchmark egzaminacyjny, na którym Med-PaLM 2, GPT-4 i MedGemma raportują nagłówkową dokładność; przydatny do porównań modeli, nie do oceny bezpieczeństwa klinicznego.
W skrócie
Etykiety i adnotacje
Poprawna odpowiedź per pytanie; brak podetykiet onkologicznych, choć wiele pozycji to przypadki onkologiczne.
Szczegóły
Ta karta jeszcze tego nie dokumentuje.
Modele trenowane lub oceniane na tym zbiorze
- benchmark MedGemma Google (Health AI Developer Foundations)
- benchmark Med-PaLM 2 Google Research
Źródła
Ta strona ma charakter edukacyjny — nie stanowi porady medycznej i nie zastępuje konsultacji z onkologiem. Decyzje diagnostyczne i terapeutyczne podejmuje wyłącznie lekarz specjalista.