AI w onkologii · Modele AI
Katalog modeli AI, zbiorów danych i otwartych potrzeb danych w onkologii na poziomie badawczym — każda karta ustrukturyzowana, ze źródłami i datą.
Problemy onkologicznej AI, które blokuje brak danych. Każdy wpis mówi, dlaczego to ważne i co dokładnie zebrać — punkt wyjścia dla każdego, kto chce zbudować zbiór danych. { } eksport JSON
Polskojęzyczny korpus tekstów klinicznych z onkologii (zanonimizowane wyniki histopatologiczne i wypisy)
Dlaczego to ważne
Każdy model NLP kliniczny w tym katalogu trenowano na angielskim. Polskie wyniki histopatologiczne, notatki z konsyliów i wypisy mają własne słownictwo, fleksję i szablony; wyciąganie z nich stopnia zaawansowania, statusu receptorów czy linii leczenia wymaga dziś reguł pisanych ręcznie. Publiczny, zgodny z prawem korpus pozwoliłby każdemu zespołowi dostrajać enkodery klasy BiomedBERT lub oceniać ekstrakcję LLM po polsku.
Co zebrać
Co zebrać
- 5000–20 000 dokumentów: wyniki histopatologiczne (najpierw pierś, jelito grube, płuco, prostata), wypisy, decyzje konsyliów.
- Metadane: typ dokumentu, typ szpitala (akademicki / regionalny), rok; bez identyfikatorów w tekście.
Etykiety
- Encje na poziomie fragmentów: rozpoznanie (ICD-O-3), pTNM, stopień, receptory (ER/PR/HER2), biomarkery (KRAS, EGFR, PD-L1), linia leczenia, odpowiedź.
- Podwójna adnotacja na ≥10% z raportowaną zgodnością adnotatorów.
Format i udostępnienie
- JSONL z offsetami w stylu BRAT/CoNLL; wytyczne adnotacji publikowane razem z danymi.
- Anonimizacja zwalidowana na odłożonym audycie; udostępnienie na umowie o użyciu danych przez polską instytucję badawczą.
Etyka
- Zgoda komisji bioetycznej i podstawa z art. 89 RODO udokumentowane od początku; daty nie dokładniejsze niż miesiąc.
Wieloośrodkowe preparaty H&E z etykietami odpowiedzi na leczenie (neoadjuwantowe i immunoterapia)
Dlaczego to ważne
Modele fundamentowe patomorfologii benchmarkuje się na rozpoznaniu i stopniowaniu, bo tam są publiczne etykiety. Klinicznie cenne pytanie — czy ten pacjent odpowie na to leczenie — nie ma niemal żadnych publicznych preparatów z wynikami, więc każdy model odpowiedzi jest jednoośrodkowy i nieweryfikowalny.
Co zebrać
Co zebrać
- Diagnostyczne preparaty H&E sprzed leczenia (≥1000 pacjentów z ≥3 ośrodków i ≥2 skanerów) dla jednego wskazania naraz: np. chemioterapia neoadjuwantowa w potrójnie ujemnym raku piersi, anty-PD-1 w czerniaku lub NDRP.
Etykiety
- Patologiczna odpowiedź całkowita (klasa RCB) lub najlepsza odpowiedź RECIST i przeżycie wolne od progresji z obserwacją ≥24 mies.
- Schemat leczenia, stopień, status receptorów/biomarkerów jako zmienne.
Format
- Piramidalny TIFF/SVS w 20× lub 40× z zapisanym skanerem i partią barwienia; tabela kliniczna CSV ze słownikiem.
Udostępnienie
- Zanonimizowane preparaty na umowie DUA; jeden ośrodek testowy trzymany prywatnie pod ranking.
Europejska kohorta skriningu LDCT z obserwacją podłużną dla modeli ryzyka raka płuca
Dlaczego to ważne
Sybil i podobne modele ryzyka trenowano na NLST (USA, skanery z lat 2002–2009, intensywni palacze). Europa wdraża skrining LDCT z innymi populacjami, protokołami i włączaniem niepalących; bez udostępnialnej europejskiej kohorty z wynikami żadnego modelu nie da się zwalidować ani przekalibrować dla tych programów.
Co zebrać
Co zebrać
- ≥10 000 uczestników z wyjściowym i kontrolnym LDCT (DICOM, cienkie warstwy ≤1,5 mm), 3+ lata wyników powiązanych z rejestrem nowotworów.
- Parametry akwizycji per badanie; historia palenia, wiek, płeć.
Etykiety
- Rozpoznanie raka płuca (data, histologia, stopień) z krajowego rejestru; kategoria Lung-RADS guzka per badanie.
Udostępnienie
- Dostęp federacyjny lub repozytorium z dostępem kontrolowanym (zgodne z EHDS) na standardowej DUA; próbka syntetyczna do narzędzi.
Sparowane dane radiologiczne, patomorfologiczne i genomowe dla rzadkich nowotworów (mięsaki, neuroendokrynne, guzy OUN u dzieci)
Dlaczego to ważne
Modele fundamentowe tracą jakość na rzadkich jednostkach, bo publiczne kohorty mają po kilkadziesiąt przypadków. Rzadkie nowotwory to dokładnie miejsce, gdzie druga opinia modelu pomogłaby najbardziej — i gdzie sparowane modalności są potrzebne, by jakakolwiek predykcja była wiarygodna.
Co zebrać
Co zebrać
- Per pacjent: obrazowanie diagnostyczne (TK/MRI), preparat H&E, sekwencjonowanie celowane lub całoeksomowe oraz leczenie/wynik — dla ≥200 pacjentów na jednostkę, z ośrodków referencyjnych i sieci ERN.
Etykiety
- Podtyp histologiczny wg WHO 2020+ z oceną centralną; klasa molekularna; przeżycie.
Udostępnienie
- Dostęp kontrolowany ze wspólnym minimalnym modelem danych; uczenie federacyjne dopuszczalne tam, gdzie transfer jest niemożliwy.
Kohorta odpowiedzi na immunoterapię z sekwencjonowaniem guza, repertuarem TCR i wynikami
Dlaczego to ważne
Inhibitory punktów kontrolnych pomagają mniejszości pacjentów, a biomarkery (PD-L1, TMB) są słabe. Modele przewidujące odpowiedź z ładunku neoantygenów, typu HLA i repertuaru limfocytów T istnieją tylko na małych prywatnych zbiorach; publiczna kohorta ze standaryzowanymi wynikami uczyniłaby dziedzinę porównywalną.
Co zebrać
Co zebrać
- ≥500 pacjentów leczonych anty-PD-1/PD-L1 (czerniak, NDRP, rak nerki): WES/RNA-seq guza, typowanie HLA, TCR-seq z krwi na starcie, PD-L1 IHC.
Etykiety
- Odpowiedź RECIST, PFS/OS z obserwacją ≥24 mies., działania niepożądane immunologiczne.
Format
- Przetworzone macierze (warianty MAF, ekspresja TPM, klonotypy TCR) plus surowe odczyty na dostępie kontrolowanym.
Dermoskopia i zdjęcia kliniczne dla wszystkich fototypów skóry z rozpoznaniem potwierdzonym histologicznie
Dlaczego to ważne
Archiwum ISIC, podstawa niemal każdego klasyfikatora raka skóry, jest zdominowane przez jasną skórę. Czerniak w ciemniejszej skórze wygląda inaczej (akralny, podpaznokciowy) i jest rozpoznawany później; modele trenowane na ISIC nie mają dowodów działania u tych pacjentów.
Co zebrać
Co zebrać
- ≥5000 zmian z reprezentacją fototypów IV–VI ≥40%, pary dermoskopia + zdjęcie kliniczne, ustandaryzowana kalibracja kolorów.
Etykiety
- Rozpoznanie potwierdzone histopatologicznie dla każdej wyciętej zmiany; zapisany fototyp Fitzpatricka i skala Monka; lokalizacja anatomiczna.
Udostępnienie
- CC BY-NC z podziałem benchmarkowym stratyfikowanym po fototypie.
Peptydomy monoalleliczne dla „długiego ogona” alleli HLA (najpierw allele spoza populacji europejskich)
Dlaczego to ważne
Nazwanych alleli klasy I jest trzydzieści tysięcy; zmierzone ligandy ma około 135, a sam HLA-A*02:01 to ćwierć danych benchmarkowych. Modele pan-alleliczne obejmują resztę przez analogię, czyli przewidują, a nie wiedzą — i najgorzej obsługują dokładnie tych pacjentów, których alleli nikt nie mierzył.
Co zebrać
Co zebrać
- Peptydomy monoalleliczne (B721.221 lub równoważne) dla 50–100 alleli częstych w populacjach afrykańskich, południowo- i wschodnioazjatyckich, rdzennych amerykańskich i bliskowschodnich, nieobecnych w obecnych panelach; priorytet według częstości w populacji × wielkość luki danych.
Etykiety
- Sekwencje peptydów z wprowadzonym allelem jako etykietą, rozkład długości i wyprowadzony motyw; raportuj protokół elucji (kwas, stężenie rozpuszczalnika, FDR), bo same te parametry przesuwają pozorny repertuar.
Kontrole
- Dołącz kontrolę dla cysteiny (np. porównanie z przesiewem genetycznym), żeby znane 5–10-krotne niedowykrywanie peptydów cysteinowych dało się skorygować, a nie wyuczyć jako biologię.
Format i udostępnienie
- Tabele peptydów w CSV, surowe widma zdeponowane w PRIDE/MassIVE; licencja CC BY, żeby każdy model mógł na nich trenować.
Peptydy przetestowane doświadczalnie jako negatywne: prezentowane, ale nieimmunogenne
Dlaczego to ważne
Modele prezentacji odpowiadają na drugie z trzech pytań; na trzecie nikt nie odpowiada dobrze. Powód jest strukturalny: spektrometria nigdy nie zwraca prawdziwych negatywów, więc 94% typowego zbioru treningowego to negatywy przyjęte, a publicznych danych o peptydach prezentowanych, które mimo to nie wywołały odpowiedzi, prawie nie ma.
Co zebrać
Co zebrać
- Dla ≥2000 peptydów potwierdzonych na powierzchni komórki (zweryfikowanych spektrometrem) wynik testu limfocytów T u dawców o znanym typie HLA: odpowiadający / nieodpowiadający, z podanym testem i progiem.
- Dołącz repertuar TCR pacjenta, jeśli to możliwe, i odnotuj wcześniejsze leczenie.
Etykiety
- Binarna immunogenność plus surowy odczyt (liczba plamek, częstość tetramerowa), nigdy sama klasyfikacja.
Dlaczego taki kształt
- Negatywy muszą być peptydami, które naprawdę miały szansę okazać się pozytywne — losowe fragmenty proteomu nie uczą różnicy między „prezentowany” a „rozpoznany”.
Udostępnienie
- Tabele na CC BY plus zdeponowane dane surowe; odłożony podział trzymany prywatnie pod publiczny ranking.
Karty trzymają standard cancer3.ai: AI_MODEL_CARD_STANDARD.md. Poprawki i nowe pozycje: kontakt z redakcją; każdy fakt wymaga publicznego źródła.
Ta strona ma charakter edukacyjny — nie stanowi porady medycznej i nie zastępuje konsultacji z onkologiem. Decyzje diagnostyczne i terapeutyczne podejmuje wyłącznie lekarz specjalista.