AI w onkologii · Modele AI
Katalog modeli AI, zbiorów danych i otwartych potrzeb danych w onkologii na poziomie badawczym — każda karta ustrukturyzowana, ze źródłami i datą.
Filtruj po zadaniu, typie danych, nowotworze, dostępności i statusie regulacyjnym. Każda karta trzyma jeden standard i prowadzi do Hugging Face, kodu, publikacji oraz zbiorów, na których model trenowano lub testowano. { } eksport JSON
AlphaFold 2 2
Przewiduje strukturę 3D białka z sekwencji aminokwasowej z dokładnością bliską eksperymentalnej; baza AlphaFold Protein Structure Database (z EMBL-EBI) udostępnia przewidywane struktury ponad 200 milionów białek, w tym celów istotnych w onkologii.
AlphaFold 3 3
Następca oparty na dyfuzji, przewidujący wspólne struktury białek z DNA, RNA, ligandami, jonami i zmodyfikowanymi resztami — typy oddziaływań kluczowe w projektowaniu leków i w rozumieniu kompleksów onkogennych.
BiomedBERT (PubMedBERT)
BERT pretrenowany od zera na abstraktach PubMed i pełnych tekstach PMC z biomedycznym słownikiem; podstawowy enkoder do rozpoznawania encji, ekstrakcji relacji i klasyfikacji tekstów onkologicznych i raportów.
BiomedCLIP
Model wizyjno-językowy w stylu CLIP pretrenowany na PMC-15M — 15 mln par rycina–opis z publikacji biomedycznych — z wieżą tekstową PubMedBERT i obrazową ViT-B; obsługuje klasyfikację zero-shot i wyszukiwanie w patomorfologii, radiologii i innych dziedzinach.
CHIEF
Model fundamentowy CHIEF: trenowany na 60 530 preparatach z 19 lokalizacji anatomicznych i walidowany na 19 491 preparatach z 24 szpitali — detekcja raka, przewidywanie pochodzenia guza, profil genomowy i przeżycie.
CONCH CONCH (v1)
Model wizyjno-językowy dla patomorfologii: enkoder obrazu i enkoder tekstu trenowane razem na 1,17 mln par obraz–opis, co daje klasyfikację zero-shot i wyszukiwanie obraz–tekst bez etykietowanych preparatów.
DeepVariant
Głęboki caller wariantów, który zamienia zrównane odczyty sekwencjonowania w obrazy pileup i klasyfikuje genotypy siecią konwolucyjną; szeroko używany w wywoływaniu wariantów germinalnych, a towarzyszący DeepSomatic rozszerza podejście na warianty somatyczne guz–norma.
ESM-2 / ESMFold
Modele językowe białek od 8 mln do 15 mld parametrów trenowane na sekwencjach UniRef; wektory cech zasilają przewidywanie skutku wariantów i funkcji, a ESMFold przewiduje strukturę wprost z jednej sekwencji bez MSA.
Geneformer
Transformer pretrenowany na rankingach ekspresji w pojedynczych komórkach, który uczy się kontekstu sieci genowych i pozwala przy niewielu danych przewidywać skutki dawki genu, stany komórek i kandydackie cele terapeutyczne. Wersja z 2023 r. była pretrenowana na Genecorpus-30M (ok. 30 mln ludzkich transkryptomów pojedynczych komórek); od grudnia 2024 r. autorzy udostępniają wersję V2 (warianty 104 mln i 316 mln parametrów) pretrenowaną na Genecorpus-104M oraz wariant douczany na ok. 14 mln transkryptomów nowotworowych.
H-optimus-0
Enkoder patomorfologiczny ViT-g/14 o 1,1 mld parametrów, trenowany na ponad 500 000 preparatów H&E (setki milionów kafelków), wydany na Apache-2.0 — jeden z nielicznych dużych modeli fundamentowych w patomorfologii z liberalną licencją.
HLAthena
Model prezentacji trenowany na peptydomie monoallelicznym 95 linii komórkowych — 186 464 peptydy dla 95 alleli HLA, z czego piętnaście nie miało wcześniej opisanego motywu — czyli na zbiorze, który zmienił tę dziedzinę bardziej niż jakikolwiek pomysł architektoniczny.
MedGemma 4B multimodal / 27B text
Modele wizyjno-językowe z otwartymi wagami na bazie Gemma 3: wariant 4B czyta RTG klatki piersiowej, obrazy dermatologiczne, okulistyczne i histopatologiczne razem z tekstem; wariant 27B celuje w rozumowanie na tekście medycznym. Punkt wyjścia do dostrajania przez deweloperów, nie gotowy produkt kliniczny.
MedSAM
Segment Anything dostosowany do obrazów medycznych: model segmentacji sterowany podpowiedziami, dostrojony na ponad 1,5 mln par obraz–maska z 10 modalności obrazowych i ponad 30 typów nowotworów.
MHCflurry 2.0 2.0
Otwartoźródłowy pan-alleliczny model prezentacji, którego wyróżnikiem jest osobny model przetwarzania antygenu: czyta peptyd razem z piętnastoma aminokwasami kontekstu po każdej stronie, bo cięcie proteasomem zależy od tego, co leży wokół miejsca cięcia.
MHCnuggets 2.x
Sieci LSTM osobne dla każdego allelu — 148 dla klasy I — czytające peptyd litera po literze, więc bez wyrównywania i dopełniania; trenowane przez uczenie transferowe od allelu najbogatszego w dane.
Mirai
Model oparty na mammografii, przewidujący pięcioletnie ryzyko raka piersi z czterech standardowych projekcji przesiewowych, zaprojektowany tak, by działać stabilnie między szpitalami, z czynnikami klinicznymi lub bez nich.
MixMHCpred 3.0 3.0
Model oparty na macierzach pozycyjnych, zbudowany na spostrzeżeniu, że ligandy klasy I niemal nie wykazują zależności między pozycjami; wersja 3.0 zatacza koło, bo macierz przewiduje sieć neuronowa z tych samych 34 aminokwasów rowka.
NetMHCIIpan-4.0 4.0
Odpowiednik NetMHCpan dla klasy II, wydany w tej samej publikacji: przewiduje prezentację przez HLA-DR, -DQ i -DP, których rowek jest otwarty z obu końców, więc peptydy są dłuższe, a rdzeń wiążący trzeba znaleźć wewnątrz dłuższej sekwencji.
NetMHCpan-4.1 4.1
Referencyjny pan-alleliczny model prezentacji antygenu przez MHC klasy I: jedna niewielka sieć obsługuje ponad 11 000 cząsteczek MHC, bo opis rowka jest częścią wejścia — 34-literowa pseudosekwencja obok peptydu.
nnU-Net v2
Samokonfigurujący się framework segmentacji: dla etykietowanego zbioru dobiera preprocessing, topologię sieci i harmonogram treningu automatycznie; pozostaje punktem odniesienia w większości konkursów segmentacji medycznej, także guzów.
Phikon-v2
Enkoder ViT-L trenowany metodą DINOv2 na PANCAN-XL — 456 mln kafelków z 58 359 preparatów łączących kohorty publiczne (TCGA, CPTAC, GTEx i inne) z danymi prywatnymi — nastawiony na przewidywanie biomarkerów.
Prov-GigaPath
Model fundamentowy dla całych preparatów, 1,3 mld parametrów, pretrenowany na 1,3 mld kafelków z 171 189 preparatów z rzeczywistej praktyki klinicznej; łączy enkoder kafelków DINOv2 z enkoderem preparatu LongNet, który analizuje cały preparat naraz.
scGPT
Generatywny pretrenowany transformer dla multi-omiki pojedynczych komórek, trenowany na ponad 33 mln komórek; obsługuje adnotację typów komórek, integrację batchy, przewidywanie odpowiedzi na perturbacje i wnioskowanie sieci genowych.
TotalSegmentator v2
Narzędzie wiersza poleceń, które segmentuje 117 struktur anatomicznych (v2) w dowolnym TK modelami nnU-Net trenowanymi na ponad 1200 klinicznych TK — standardowy sposób pozyskania masek narządów do radiomiki, planowania dawki i cech kontekstu guza.
TxGNN
Grafowa sieć neuronowa do repozycjonowania leków zero-shot, oceniająca wskazania i przeciwwskazania lek–choroba na grafie wiedzy medycznej obejmującym 17 080 chorób, w tym takie bez zatwierdzonego leczenia.
Virchow2
Następca Virchow: ViT-H/14 pretrenowany na 3,1 mln preparatów od około 225 000 pacjentów z 45 krajów, w mieszanych powiększeniach (5×–40×), z augmentacjami dobranymi pod patomorfologię.
UNI UNI (v1)
Uniwersalny, samonadzorowany enkoder obrazów H&E, pretrenowany na ponad 100 milionach kafelków z ponad 100 000 preparatów; punkt odniesienia dla ekstrakcji cech w patomorfologii.
Virchow Virchow (v1)
Transformer wizyjny o 632 mln parametrów, pretrenowany na 1,5 mln preparatów od około 100 000 pacjentów — największym zbiorze pretreningowym w patomorfologii w chwili publikacji — użyty do zbudowania pan-nowotworowego detektora obejmującego 17 typów raka, także rzadkich.
Paige Prostate Detect
Pierwsze oprogramowanie AI dla patomorfologii dopuszczone przez amerykańską FDA (De Novo, wrzesień 2021): oznacza preparaty z biopsji prostaty, które prawdopodobnie zawierają raka, tak by patomorfolog przejrzał podejrzany obszar.
Mia
Komercyjny czytnik AI dla mammografii przesiewowej, oceniany jako dodatkowy czytający w brytyjskim systemie podwójnego odczytu; prospektywne badanie GEMINI w Aberdeen wykazało dodatkowe raki wykryte, gdy Mia oznaczyła przypadki uznane przez czytających za prawidłowe.
Transpara
Komercyjne AI do mammografii z dopuszczeniem FDA i znakiem CE, używane jako czytający równoległy lub zastępczy w skriningu piersi; randomizowane badanie MASAI w Szwecji użyło go do triażu odczytów.
Sybil
Model głębokiego uczenia, który z jednego niskodawkowego TK klatki piersiowej przewiduje indywidualne ryzyko raka płuca w perspektywie od roku do sześciu lat, bez adnotacji radiologa i bez zmiennych klinicznych.
AlphaMissense
Klasyfikuje patogenność każdej możliwej pojedynczej substytucji aminokwasowej w ludzkim proteomie — 71 mln wariantów missense — dostrajając AlphaFold na częstościach wariantów w populacji; zasób do interpretacji wariantów o niepewnym znaczeniu.
TrialGPT
Trójetapowy framework LLM (wyszukiwanie, dopasowanie na poziomie kryteriów, ranking), który dopasowuje opis pacjenta do badań klinicznych z ClinicalTrials.gov; w publikacji skrócił czas przesiewu przez klinicystów o ponad 40% w pilotażowym badaniu z użytkownikami.
Med-PaLM 2
Medyczny duży model językowy Google, pierwszy z wynikiem na poziomie eksperta w pytaniach typu USMLE (86,5% na MedQA); dostępny wyłącznie przez Google Cloud dla wybranych partnerów, w dużej mierze zastąpiony modelami medycznymi opartymi na Gemini.
Karty trzymają standard cancer3.ai: AI_MODEL_CARD_STANDARD.md. Poprawki i nowe pozycje: kontakt z redakcją; każdy fakt wymaga publicznego źródła.
Ta strona ma charakter edukacyjny — nie stanowi porady medycznej i nie zastępuje konsultacji z onkologiem. Decyzje diagnostyczne i terapeutyczne podejmuje wyłącznie lekarz specjalista.