Cancer3.AIAI w onkologiiModele AI › Geneformer
Model fundamentowy Otwarte wagi Nie dotyczy genomics

Geneformer

Transformer pretrenowany na rankingach ekspresji w pojedynczych komórkach, który uczy się kontekstu sieci genowych i pozwala przy niewielu danych przewidywać skutki dawki genu, stany komórek i kandydackie cele terapeutyczne. Wersja z 2023 r. była pretrenowana na Genecorpus-30M (ok. 30 mln ludzkich transkryptomów pojedynczych komórek); od grudnia 2024 r. autorzy udostępniają wersję V2 (warianty 104 mln i 316 mln parametrów) pretrenowaną na Genecorpus-104M oraz wariant douczany na ok. 14 mln transkryptomów nowotworowych.

1 698 pobrań / mies. ♥ 311 aktualizacja 2026-05-26

W skrócie

TwórcaTheodoris Lab (Gladstone Institutes / UCSF)
Wydanie2023-05-31
Licencjaapache-2.0
DostępnośćOtwarte wagi
RodzajModel fundamentowy
Status regulacyjnyNie dotyczy
ParametryV1 ~10M; V2 checkpoints of 104M and 316M parameters

Co robi

Każda komórka staje się sekwencją genów uporządkowanych po ekspresji; model dostraja się do klasyfikacji typów komórek, przewidywania stanu chorobowego i perturbacji in silico (który knock-out genu przesuwa stan złośliwy).

Zadania, typy danych i nowotwory

NowotwórWiele nowotworów
Wejścierank-encoded single-cell expression — 2,048 genes in V1, 4,096 genes in V2
Wyjściecell and gene embeddings

Architektura

RodzinaBERT-style transformer over rank-value gene encodings
ParametryV1 ~10M; V2 checkpoints of 104M and 316M parameters
Pretreningmasked gene prediction on Genecorpus-30M (V1) or Genecorpus-104M (V2); a separate V2 variant is continually trained on about 14 million cancer transcriptomes

Dane treningowe

V1 (korpus z czerwca 2021 r., publikacja 2023): Genecorpus-30M — ok. 29,9 mln ludzkich transkryptomów pojedynczych komórek z publicznych zbiorów, z wielu tkanek, bez ograniczenia do nowotworów. V2 (grudzień 2024): Genecorpus-104M — ok. 104 mln transkryptomów, warianty o 104 mln i 316 mln parametrów, okno wejściowe 4096 genów. Osobny wariant V2 (Geneformer-V2-104M_CLcancer) jest douczany na ok. 14 mln transkryptomów nowotworowych. Skład korpusu podajemy za kartą modelu autorów; same zbiory źródłowe nie są udostępnione jako jedna pobieralna kolekcja.

Rozmiar zbioru treningowego~30M cells (V1) / ~104M cells (V2) / ~14M cancer cells (continual-learning variant)

Powiązane zbiory danych

Ewaluacja

Benchmark / zbiórMiaraWartośćWalidacja zewnętrznaŹródło
Corpus scaling and model quantization (Nature Computational Science, 27.03.2026) — resource use during fine-tuning fine-tuning time and GPU memory relative to the full-precision model quantization preserved the contextual gene and cell embedding space while requiring 15% of the time and 34% of the memory of the full model; the pretraining corpus was expanded to more than 100 million human single-cell transcriptomes nie Źródło

Jak uruchomić

# generic transformers loader — see the model card for the task-specific head and preprocessing
from transformers import AutoModel, AutoProcessor
model = AutoModel.from_pretrained('ctheodoris/Geneformer')
processor = AutoProcessor.from_pretrained('ctheodoris/Geneformer')
Bibliotekatransformers + geneformer package

Install from the Hugging Face repo; tokenize with the provided gene-median dictionary. Fine-tuning on a few hundred labelled cells is the intended workflow.

Status regulacyjny i przeznaczenie

Status regulacyjnyNie dotyczy
PrzeznaczenieNarzędzie badawcze.

Źródło →

Status regulacyjny cytujemy ze wskazanego źródła i może się zmienić. Modele „tylko do badań” nie służą do decyzji klinicznych.

Ograniczenia i błędy systematyczne

  • Kodowanie rankingowe gubi ekspresję bezwzględną; efekty batchowe nadal przenikają.
  • Główny korpus pretreningowy nie jest nowotworowy. Od grudnia 2024 r. autorzy udostępniają wariant douczany na ok. 14 mln transkryptomów nowotworowych (Geneformer-V2-104M_CLcancer); wersje bazowe nadal wymagają dostrojenia do stanów mikrośrodowiska guza.
  • Opublikowane wyniki liczbowe pochodzą od zespołu tworzącego model; nie znamy niezależnego, zewnętrznego porównania dla zastosowań onkologicznych.

Źródła

  1. Theodoris CV et al. Transfer learning enables predictions in network biology. Nature 2023
  2. Chen H, Venkatesh MS et al. Scaling and quantization of large-scale foundation model enables resource-efficient predictions in network biology. Nature Computational Science, 27.03.2026 (PMID 41896605)
  3. Hugging Face — ctheodoris/Geneformer (karta modelu: warianty V1/V2, Genecorpus-104M, wariant nowotworowy CLcancer)

Ta strona ma charakter edukacyjny — nie stanowi porady medycznej i nie zastępuje konsultacji z onkologiem. Decyzje diagnostyczne i terapeutyczne podejmuje wyłącznie lekarz specjalista.