ESM-2 / ESMFold
Modele językowe białek od 8 mln do 15 mld parametrów trenowane na sekwencjach UniRef; wektory cech zasilają przewidywanie skutku wariantów i funkcji, a ESMFold przewiduje strukturę wprost z jednej sekwencji bez MSA.
🤗 1 303 383 pobrań / mies. ♥ 89 aktualizacja 2023-03-21W skrócie
Co robi
Maskowane modelowanie językowe na aminokwasach; punkt kontrolny 650M to praktyczny domyślny wybór do wektorów cech, oceny wariantów zero-shot (ilorazy log-wiarygodności) i dostrajania do zadań białkowych w onkologii.
Zadania, typy danych i nowotwory
Architektura
Dane treningowe
Klastry UniRef50 (próbkowane z członków UniRef90), ok. 65 mln unikalnych sekwencji.
Ewaluacja
| Benchmark / zbiór | Miara | Wartość | Walidacja zewnętrzna | Źródło |
|---|---|---|---|---|
| CAMEO / CASP14 (ESMFold) | TM-score | close to AlphaFold 2 on high-perplexity-free targets, faster by orders of magnitude (paper) | tak | Źródło |
Jak uruchomić
from transformers import AutoTokenizer, EsmModel
tok = AutoTokenizer.from_pretrained('facebook/esm2_t33_650M_UR50D')
model = EsmModel.from_pretrained('facebook/esm2_t33_650M_UR50D')
out = model(**tok('MKTAYIAKQRQISFVKSHFSRQ', return_tensors='pt'))
emb = out.last_hidden_state # 1 x L x 1280
Status regulacyjny i przeznaczenie
Status regulacyjny cytujemy ze wskazanego źródła i może się zmienić. Modele „tylko do badań” nie służą do decyzji klinicznych.
Ograniczenia i błędy systematyczne
- Tylko sekwencja: bez ligandów i kompleksów.
- Oceny wariantów zero-shot są mniej dokładne niż predyktory nadzorowane w klasyfikacji klinicznej.
Źródła
Ta strona ma charakter edukacyjny — nie stanowi porady medycznej i nie zastępuje konsultacji z onkologiem. Decyzje diagnostyczne i terapeutyczne podejmuje wyłącznie lekarz specjalista.