Cancer3.AIAI w onkologiiModele AI › Potrzebne dane

AI w onkologii · Modele AI

Katalog modeli AI, zbiorów danych i otwartych potrzeb danych w onkologii na poziomie badawczym — każda karta ustrukturyzowana, ze źródłami i datą.

Problemy onkologicznej AI, które blokuje brak danych. Każdy wpis mówi, dlaczego to ważne i co dokładnie zebrać — punkt wyjścia dla każdego, kto chce zbudować zbiór danych. { } eksport JSON

Polskojęzyczny korpus tekstów klinicznych z onkologii (zanonimizowane wyniki histopatologiczne i wypisy)

Otwarte

Dlaczego to ważne

Każdy model NLP kliniczny w tym katalogu trenowano na angielskim. Polskie wyniki histopatologiczne, notatki z konsyliów i wypisy mają własne słownictwo, fleksję i szablony; wyciąganie z nich stopnia zaawansowania, statusu receptorów czy linii leczenia wymaga dziś reguł pisanych ręcznie. Publiczny, zgodny z prawem korpus pozwoliłby każdemu zespołowi dostrajać enkodery klasy BiomedBERT lub oceniać ekstrakcję LLM po polsku.

Co zebrać

Co zebrać

  • 5000–20 000 dokumentów: wyniki histopatologiczne (najpierw pierś, jelito grube, płuco, prostata), wypisy, decyzje konsyliów.
  • Metadane: typ dokumentu, typ szpitala (akademicki / regionalny), rok; bez identyfikatorów w tekście.

Etykiety

  • Encje na poziomie fragmentów: rozpoznanie (ICD-O-3), pTNM, stopień, receptory (ER/PR/HER2), biomarkery (KRAS, EGFR, PD-L1), linia leczenia, odpowiedź.
  • Podwójna adnotacja na ≥10% z raportowaną zgodnością adnotatorów.

Format i udostępnienie

  • JSONL z offsetami w stylu BRAT/CoNLL; wytyczne adnotacji publikowane razem z danymi.
  • Anonimizacja zwalidowana na odłożonym audycie; udostępnienie na umowie o użyciu danych przez polską instytucję badawczą.

Etyka

  • Zgoda komisji bioetycznej i podstawa z art. 89 RODO udokumentowane od początku; daty nie dokładniejsze niż miesiąc.
  1. BiomedBERT — English-only pretraining (this catalog)

Wieloośrodkowe preparaty H&E z etykietami odpowiedzi na leczenie (neoadjuwantowe i immunoterapia)

Otwarte

Dlaczego to ważne

Modele fundamentowe patomorfologii benchmarkuje się na rozpoznaniu i stopniowaniu, bo tam są publiczne etykiety. Klinicznie cenne pytanie — czy ten pacjent odpowie na to leczenie — nie ma niemal żadnych publicznych preparatów z wynikami, więc każdy model odpowiedzi jest jednoośrodkowy i nieweryfikowalny.

Co zebrać

Co zebrać

  • Diagnostyczne preparaty H&E sprzed leczenia (≥1000 pacjentów z ≥3 ośrodków i ≥2 skanerów) dla jednego wskazania naraz: np. chemioterapia neoadjuwantowa w potrójnie ujemnym raku piersi, anty-PD-1 w czerniaku lub NDRP.

Etykiety

  • Patologiczna odpowiedź całkowita (klasa RCB) lub najlepsza odpowiedź RECIST i przeżycie wolne od progresji z obserwacją ≥24 mies.
  • Schemat leczenia, stopień, status receptorów/biomarkerów jako zmienne.

Format

  • Piramidalny TIFF/SVS w 20× lub 40× z zapisanym skanerem i partią barwienia; tabela kliniczna CSV ze słownikiem.

Udostępnienie

  • Zanonimizowane preparaty na umowie DUA; jeden ośrodek testowy trzymany prywatnie pod ranking.
  1. CHIEF — survival prediction relies on retrospective cohorts (this catalog)

Europejska kohorta skriningu LDCT z obserwacją podłużną dla modeli ryzyka raka płuca

Otwarte

Dlaczego to ważne

Sybil i podobne modele ryzyka trenowano na NLST (USA, skanery z lat 2002–2009, intensywni palacze). Europa wdraża skrining LDCT z innymi populacjami, protokołami i włączaniem niepalących; bez udostępnialnej europejskiej kohorty z wynikami żadnego modelu nie da się zwalidować ani przekalibrować dla tych programów.

Co zebrać

Co zebrać

  • ≥10 000 uczestników z wyjściowym i kontrolnym LDCT (DICOM, cienkie warstwy ≤1,5 mm), 3+ lata wyników powiązanych z rejestrem nowotworów.
  • Parametry akwizycji per badanie; historia palenia, wiek, płeć.

Etykiety

  • Rozpoznanie raka płuca (data, histologia, stopień) z krajowego rejestru; kategoria Lung-RADS guzka per badanie.

Udostępnienie

  • Dostęp federacyjny lub repozytorium z dostępem kontrolowanym (zgodne z EHDS) na standardowej DUA; próbka syntetyczna do narzędzi.
  1. Sybil — trained on NLST (this catalog)
  2. NLST data card

Sparowane dane radiologiczne, patomorfologiczne i genomowe dla rzadkich nowotworów (mięsaki, neuroendokrynne, guzy OUN u dzieci)

Otwarte

Dlaczego to ważne

Modele fundamentowe tracą jakość na rzadkich jednostkach, bo publiczne kohorty mają po kilkadziesiąt przypadków. Rzadkie nowotwory to dokładnie miejsce, gdzie druga opinia modelu pomogłaby najbardziej — i gdzie sparowane modalności są potrzebne, by jakakolwiek predykcja była wiarygodna.

Co zebrać

Co zebrać

  • Per pacjent: obrazowanie diagnostyczne (TK/MRI), preparat H&E, sekwencjonowanie celowane lub całoeksomowe oraz leczenie/wynik — dla ≥200 pacjentów na jednostkę, z ośrodków referencyjnych i sieci ERN.

Etykiety

  • Podtyp histologiczny wg WHO 2020+ z oceną centralną; klasa molekularna; przeżycie.

Udostępnienie

  • Dostęp kontrolowany ze wspólnym minimalnym modelem danych; uczenie federacyjne dopuszczalne tam, gdzie transfer jest niemożliwy.
  1. Virchow — rare-cancer detection motivation (this catalog)

Kohorta odpowiedzi na immunoterapię z sekwencjonowaniem guza, repertuarem TCR i wynikami

Otwarte

Dlaczego to ważne

Inhibitory punktów kontrolnych pomagają mniejszości pacjentów, a biomarkery (PD-L1, TMB) są słabe. Modele przewidujące odpowiedź z ładunku neoantygenów, typu HLA i repertuaru limfocytów T istnieją tylko na małych prywatnych zbiorach; publiczna kohorta ze standaryzowanymi wynikami uczyniłaby dziedzinę porównywalną.

Co zebrać

Co zebrać

  • ≥500 pacjentów leczonych anty-PD-1/PD-L1 (czerniak, NDRP, rak nerki): WES/RNA-seq guza, typowanie HLA, TCR-seq z krwi na starcie, PD-L1 IHC.

Etykiety

  • Odpowiedź RECIST, PFS/OS z obserwacją ≥24 mies., działania niepożądane immunologiczne.

Format

  • Przetworzone macierze (warianty MAF, ekspresja TPM, klonotypy TCR) plus surowe odczyty na dostępie kontrolowanym.
Genomika (DNA)Transkryptomika (RNA)Proteomika Czerniak złośliwy (melanoma)Płuca i oskrzelaNerka
  1. AACR GENIE — real-world sequencing without immunotherapy outcomes at scale (this catalog)

Dermoskopia i zdjęcia kliniczne dla wszystkich fototypów skóry z rozpoznaniem potwierdzonym histologicznie

Otwarte

Dlaczego to ważne

Archiwum ISIC, podstawa niemal każdego klasyfikatora raka skóry, jest zdominowane przez jasną skórę. Czerniak w ciemniejszej skórze wygląda inaczej (akralny, podpaznokciowy) i jest rozpoznawany później; modele trenowane na ISIC nie mają dowodów działania u tych pacjentów.

Co zebrać

Co zebrać

  • ≥5000 zmian z reprezentacją fototypów IV–VI ≥40%, pary dermoskopia + zdjęcie kliniczne, ustandaryzowana kalibracja kolorów.

Etykiety

  • Rozpoznanie potwierdzone histopatologicznie dla każdej wyciętej zmiany; zapisany fototyp Fitzpatricka i skala Monka; lokalizacja anatomiczna.

Udostępnienie

  • CC BY-NC z podziałem benchmarkowym stratyfikowanym po fototypie.
  1. ISIC Archive data card (this catalog)

Peptydomy monoalleliczne dla „długiego ogona” alleli HLA (najpierw allele spoza populacji europejskich)

Otwarte

Dlaczego to ważne

Nazwanych alleli klasy I jest trzydzieści tysięcy; zmierzone ligandy ma około 135, a sam HLA-A*02:01 to ćwierć danych benchmarkowych. Modele pan-alleliczne obejmują resztę przez analogię, czyli przewidują, a nie wiedzą — i najgorzej obsługują dokładnie tych pacjentów, których alleli nikt nie mierzył.

Co zebrać

Co zebrać

  • Peptydomy monoalleliczne (B721.221 lub równoważne) dla 50–100 alleli częstych w populacjach afrykańskich, południowo- i wschodnioazjatyckich, rdzennych amerykańskich i bliskowschodnich, nieobecnych w obecnych panelach; priorytet według częstości w populacji × wielkość luki danych.

Etykiety

  • Sekwencje peptydów z wprowadzonym allelem jako etykietą, rozkład długości i wyprowadzony motyw; raportuj protokół elucji (kwas, stężenie rozpuszczalnika, FDR), bo same te parametry przesuwają pozorny repertuar.

Kontrole

  • Dołącz kontrolę dla cysteiny (np. porównanie z przesiewem genetycznym), żeby znane 5–10-krotne niedowykrywanie peptydów cysteinowych dało się skorygować, a nie wyuczyć jako biologię.

Format i udostępnienie

  • Tabele peptydów w CSV, surowe widma zdeponowane w PRIDE/MassIVE; licencja CC BY, żeby każdy model mógł na nich trenować.
Immunopeptydomika (peptydy ze spektrometru) Wiele nowotworów
  1. cancer3.ai — Trzydzieści cztery litery zamka
  2. Trevizani R et al. IEDB benchmark analysis. Brief Bioinform 2022

Peptydy przetestowane doświadczalnie jako negatywne: prezentowane, ale nieimmunogenne

Otwarte

Dlaczego to ważne

Modele prezentacji odpowiadają na drugie z trzech pytań; na trzecie nikt nie odpowiada dobrze. Powód jest strukturalny: spektrometria nigdy nie zwraca prawdziwych negatywów, więc 94% typowego zbioru treningowego to negatywy przyjęte, a publicznych danych o peptydach prezentowanych, które mimo to nie wywołały odpowiedzi, prawie nie ma.

Co zebrać

Co zebrać

  • Dla ≥2000 peptydów potwierdzonych na powierzchni komórki (zweryfikowanych spektrometrem) wynik testu limfocytów T u dawców o znanym typie HLA: odpowiadający / nieodpowiadający, z podanym testem i progiem.
  • Dołącz repertuar TCR pacjenta, jeśli to możliwe, i odnotuj wcześniejsze leczenie.

Etykiety

  • Binarna immunogenność plus surowy odczyt (liczba plamek, częstość tetramerowa), nigdy sama klasyfikacja.

Dlaczego taki kształt

  • Negatywy muszą być peptydami, które naprawdę miały szansę okazać się pozytywne — losowe fragmenty proteomu nie uczą różnicy między „prezentowany” a „rozpoznany”.

Udostępnienie

  • Tabele na CC BY plus zdeponowane dane surowe; odłożony podział trzymany prywatnie pod publiczny ranking.
Immunopeptydomika (peptydy ze spektrometru)Sekwencja białka Wiele nowotworów
  1. cancer3.ai — Trzydzieści cztery litery zamka
  2. Paul S et al. Benchmarking predictions of MHC class I restricted T cell epitopes. PLoS Comput Biol 2020

Karty trzymają standard cancer3.ai: AI_MODEL_CARD_STANDARD.md. Poprawki i nowe pozycje: kontakt z redakcją; każdy fakt wymaga publicznego źródła.

Ta strona ma charakter edukacyjny — nie stanowi porady medycznej i nie zastępuje konsultacji z onkologiem. Decyzje diagnostyczne i terapeutyczne podejmuje wyłącznie lekarz specjalista.