BiomedBERT (PubMedBERT)
BERT pretrenowany od zera na abstraktach PubMed i pełnych tekstach PMC z biomedycznym słownikiem; podstawowy enkoder do rozpoznawania encji, ekstrakcji relacji i klasyfikacji tekstów onkologicznych i raportów.
🤗 220 044 pobrań / mies. ♥ 335 aktualizacja 2023-11-06W skrócie
Co robi
Ta karta jeszcze tego nie dokumentuje.
Zadania, typy danych i nowotwory
Architektura
Dane treningowe
Abstrakty PubMed (14 mln) plus pełne teksty PMC; dziedzinowy słownik WordPiece zbudowany z korpusu.
Powiązane zbiory danych
- pretrening PubMed / PMC Open Access Subset Otwarte pobieranie
Ewaluacja
| Benchmark / zbiór | Miara | Wartość | Walidacja zewnętrzna | Źródło |
|---|---|---|---|---|
| BLURB (biomedical NLP benchmark) | average score | state of the art at publication | tak | Źródło |
Jak uruchomić
# generic transformers loader — see the model card for the task-specific head and preprocessing
from transformers import AutoModel, AutoProcessor
model = AutoModel.from_pretrained('microsoft/BiomedNLP-BiomedBERT-base-uncased-abstract-fulltext')
processor = AutoProcessor.from_pretrained('microsoft/BiomedNLP-BiomedBERT-base-uncased-abstract-fulltext')
Status regulacyjny i przeznaczenie
Status regulacyjny cytujemy ze wskazanego źródła i może się zmienić. Modele „tylko do badań” nie służą do decyzji klinicznych.
Ograniczenia i błędy systematyczne
- Tylko literatura angielska; notatki kliniczne i teksty polskie wymagają dalszej adaptacji.
- Okno 512 tokenów.
Źródła
Ta strona ma charakter edukacyjny — nie stanowi porady medycznej i nie zastępuje konsultacji z onkologiem. Decyzje diagnostyczne i terapeutyczne podejmuje wyłącznie lekarz specjalista.