{"architecture":{"family":"BERT-base","input":"text \u2264 512 tokens","output":"token/sentence embeddings","params":"~110M","pretraining":"masked language modelling from scratch (domain vocabulary)"},"article":null,"cancer_slugs":["pan-cancer"],"category":"clinical-LLM","confidence":"high","datasets":[{"name":"PubMed / PMC Open Access Subset","note":"","role":"pretraining","slug":"pubmed-pmc-oa"}],"developer":"Microsoft Research","evaluation":[{"benchmark":"BLURB (biomedical NLP benchmark)","external":true,"metric":"average score","source":"https://dl.acm.org/doi/10.1145/3458754","value":"state of the art at publication"}],"hf":{"downloads":220044,"fetched_at":"2026-09-09T21:33:09Z","gated":false,"last_modified":"2023-11-06","library":"transformers","license":"mit","likes":335,"pipeline_tag":"fill-mask"},"kind":"foundation","license":"MIT","limitations":"- English literature only; clinical notes and Polish text need further adaptation.\n- 512-token window.","links":{"demo":null,"docs":null,"doi":"10.1145/3458754","github":null,"huggingface":"https://huggingface.co/microsoft/BiomedNLP-BiomedBERT-base-uncased-abstract-fulltext","paper":"https://dl.acm.org/doi/10.1145/3458754","pmid":null},"modalities":["literature","clinical-text"],"name":"BiomedBERT (PubMedBERT)","notable_uses":"","openness":"open-weights","regulatory":{"intended_use_en":"Research NLP encoder.","intended_use_pl":"Badawczy enkoder NLP.","source_url":"https://huggingface.co/microsoft/BiomedNLP-BiomedBERT-base-uncased-abstract-fulltext","status":"not-applicable"},"regulatory_status":"not-applicable","release_date":"2020-07-31","run_snippet":"# generic transformers loader \u2014 see the model card for the task-specific head and preprocessing\nfrom transformers import AutoModel, AutoProcessor\nmodel = AutoModel.from_pretrained('microsoft/BiomedNLP-BiomedBERT-base-uncased-abstract-fulltext')\nprocessor = AutoProcessor.from_pretrained('microsoft/BiomedNLP-BiomedBERT-base-uncased-abstract-fulltext')\n","settings":["basic-research","clinical-trials"],"slug":"biomedbert","sources":[{"label":"Gu Y et al. Domain-Specific Language Model Pretraining for Biomedical Natural Language Processing. ACM Trans Comput Healthc 2021","url":"https://dl.acm.org/doi/10.1145/3458754"},{"label":"Hugging Face \u2014 microsoft/BiomedNLP-BiomedBERT","url":"https://huggingface.co/microsoft/BiomedNLP-BiomedBERT-base-uncased-abstract-fulltext"}],"summary":"BERT pretrained from scratch on PubMed abstracts and PMC full text with a biomedical vocabulary; the workhorse encoder for named-entity recognition, relation extraction and classification over oncology literature and reports.","tasks":["information-extraction","classification","feature-extraction"],"training":{"summary_en":"PubMed abstracts (14M) plus PMC full-text articles; domain-specific WordPiece vocabulary built from the corpus.","summary_pl":"Abstrakty PubMed (14 mln) plus pe\u0142ne teksty PMC; dziedzinowy s\u0142ownik WordPiece zbudowany z korpusu."},"updated_at":"2026-09-09T21:33:09.703716","url":"/ai-oncology/models/biomedbert","usage":{"library":"transformers"},"verified_at":"2026-09-05T22:26:00.196585","verified_by":"editorial","version":null,"what_it_does":""}
