Cancer3.AIAI w onkologiiModele AI › ESM-2 / ESMFold
Model fundamentowy Otwarte wagi Nie dotyczy protein-structure

ESM-2 / ESMFold

Modele językowe białek od 8 mln do 15 mld parametrów trenowane na sekwencjach UniRef; wektory cech zasilają przewidywanie skutku wariantów i funkcji, a ESMFold przewiduje strukturę wprost z jednej sekwencji bez MSA.

1 303 383 pobrań / mies. ♥ 89 aktualizacja 2023-03-21

W skrócie

TwórcaMeta AI (FAIR)
Wydanie2022-11-01
LicencjaMIT
DostępnośćOtwarte wagi
RodzajModel fundamentowy
Status regulacyjnyNie dotyczy
Parametry650M (this checkpoint)

Co robi

Maskowane modelowanie językowe na aminokwasach; punkt kontrolny 650M to praktyczny domyślny wybór do wektorów cech, oceny wariantów zero-shot (ilorazy log-wiarygodności) i dostrajania do zadań białkowych w onkologii.

Zadania, typy danych i nowotwory

NowotwórWiele nowotworów
Wejścieamino-acid sequence (up to 1,024 tokens by default)
Wyjścieper-residue embeddings (1,280-dim for 650M), masked-token logits

Architektura

RodzinaTransformer encoder (BERT-style)
Szkieletesm2_t33_650M (33 layers) — checkpoints from 8M to 15B
Parametry650M (this checkpoint)
Pretreningmasked language modelling on UniRef50/UniRef90

Dane treningowe

Klastry UniRef50 (próbkowane z członków UniRef90), ok. 65 mln unikalnych sekwencji.

InstytucjeMeta AI; UniProt as data source

Ewaluacja

Benchmark / zbiórMiaraWartośćWalidacja zewnętrznaŹródło
CAMEO / CASP14 (ESMFold) TM-score close to AlphaFold 2 on high-perplexity-free targets, faster by orders of magnitude (paper) tak Źródło

Jak uruchomić

from transformers import AutoTokenizer, EsmModel
tok = AutoTokenizer.from_pretrained('facebook/esm2_t33_650M_UR50D')
model = EsmModel.from_pretrained('facebook/esm2_t33_650M_UR50D')
out = model(**tok('MKTAYIAKQRQISFVKSHFSRQ', return_tensors='pt'))
emb = out.last_hidden_state  # 1 x L x 1280
Bibliotekatransformers / esm package

Status regulacyjny i przeznaczenie

Status regulacyjnyNie dotyczy
PrzeznaczenieNarzędzie badawcze.

Źródło →

Status regulacyjny cytujemy ze wskazanego źródła i może się zmienić. Modele „tylko do badań” nie służą do decyzji klinicznych.

Ograniczenia i błędy systematyczne

  • Tylko sekwencja: bez ligandów i kompleksów.
  • Oceny wariantów zero-shot są mniej dokładne niż predyktory nadzorowane w klasyfikacji klinicznej.

Źródła

  1. Lin Z et al. Evolutionary-scale prediction of atomic-level protein structure with a language model. Science 2023
  2. Hugging Face — facebook/esm2_t33_650M_UR50D

Ta strona ma charakter edukacyjny — nie stanowi porady medycznej i nie zastępuje konsultacji z onkologiem. Decyzje diagnostyczne i terapeutyczne podejmuje wyłącznie lekarz specjalista.