UNI UNI (v1)
Uniwersalny, samonadzorowany enkoder obrazów H&E, pretrenowany na ponad 100 milionach kafelków z ponad 100 000 preparatów; punkt odniesienia dla ekstrakcji cech w patomorfologii.
🤗 40 388 pobrań / mies. ♥ 372 aktualizacja 2025-03-06 po akceptacji licencjiW skrócie
Co robi
UNI zamienia kafelek obrazu histopatologicznego w wektor cech bez treningu pod konkretne zadanie. Dalej takie wektory agreguje się per preparat (np. lekkim modelem z uwagą), by klasyfikować podtyp, stopień złośliwości, wykrywać przerzuty lub przewidywać status molekularny.
Ważne zastosowania w onkologii
Zbenchmarkowany na 34 zadaniach klinicznych o różnym stopniu trudności w 20 głównych typach tkanek — podtypowanie, stopniowanie, wykrywanie przerzutów, przewidywanie biomarkerów; powszechnie używany jako enkoder kafelków w akademickich potokach patomorfologicznych.
Zadania, typy danych i nowotwory
Architektura
Ładowany przez timm jako hf-hub:MahmoodLab/UNI (ViT-L/16, patch 16, bez głowy klasyfikacyjnej). Przepis DINOv2 bez zmian; nowością jest skala i różnorodność własnych danych patomorfologicznych.
Dane treningowe
Mass-100K: ponad 100 milionów kafelków z ponad 100 000 diagnostycznych preparatów H&E z 20 głównych typów tkanek, zebranych w Massachusetts General Hospital i Brigham and Women's Hospital, uzupełnionych preparatami GTEx. Publiczne dane testowe nie weszły do pretreningu — dlatego publiczne benchmarki coś mówią.
Powiązane zbiory danych
- ewaluacja CAMELYON16 / CAMELYON17 Otwarte pobieranie — benchmark wykrywania przerzutów na poziomie preparatu
- ewaluacja PANDA — Prostate cANcer graDe Assessment Bezpłatna rejestracja — benchmark stopniowania Gleasona
- ewaluacja TCGA — The Cancer Genome Atlas (via NCI Genomic Data Commons) Bezpłatna rejestracja — zadania podtypowania i biomarkerów z kohort TCGA
Ewaluacja
| Benchmark / zbiór | Miara | Wartość | Walidacja zewnętrzna | Źródło |
|---|---|---|---|---|
| CAMELYON16 (breast lymph-node metastasis, slide-level) ↗ | AUROC | reported in paper (weakly supervised ABMIL) | tak | Źródło |
| PANDA (prostate Gleason grading) ↗ | quadratic-weighted κ / balanced accuracy | reported in paper | tak | Źródło |
| 34-task suite (subtyping, grading, biomarkers; 20 tissue types) | average performance vs. CTransPath / REMEDIS | best or tied-best on the majority of tasks | tak | Źródło |
Jak uruchomić
# generic timm loader — check the model card for the exact init args and image normalisation
import timm, torch
from huggingface_hub import login
login() # gated repos: accept the licence on huggingface.co first
model = timm.create_model('hf-hub:MahmoodLab/UNI', pretrained=True)
model.eval()
cfg = timm.data.resolve_data_config({}, model=model)
transform = timm.data.create_transform(**cfg)
# emb = model(transform(tile).unsqueeze(0)) # 1 x D tile embedding
Wagi są gated: poproś o dostęp na Hugging Face i zaakceptuj licencję CC-BY-NC-ND (tylko badania, bez rozpowszechniania pochodnych). Trzymaj się reżimu 224×224 / 20× z karty — kafelki spoza tego powiększenia psują cechy po cichu.
Status regulacyjny i przeznaczenie
Status regulacyjny cytujemy ze wskazanego źródła i może się zmienić. Modele „tylko do badań” nie służą do decyzji klinicznych.
Ograniczenia i błędy systematyczne
- Trenowany wyłącznie na H&E; immunohistochemia, skrawki mrożone i nietypowe barwienia leżą poza rozkładem danych.
- Różnice skanerów i laboratoriów nadal mają znaczenie; publikacja nie raportuje wyników per pochodzenie etniczne.
- Licencja niekomercyjna wyklucza użycie produktowe bez osobnej umowy.
- Zadania na poziomie preparatu wymagają drugiego, zadaniowego modelu agregującego, który trzeba samemu wytrenować i zwalidować.
Źródła
Ta strona ma charakter edukacyjny — nie stanowi porady medycznej i nie zastępuje konsultacji z onkologiem. Decyzje diagnostyczne i terapeutyczne podejmuje wyłącznie lekarz specjalista.