pertTF – Architektura, Wydajność i Ograniczenia w Predykcji scRNA-seq.
Jak architektura 3Ps i funkcja strat NB-NLL rewolucjonizują wielomodalne przewidywanie perturbacji na poziomie pojedynczych komórek, osiągając AUC 0,79 w ekranach in silico.
1. Abstrakt i Kontekst Badawczy
Model pertTF to natywna, oparta na transformatorach architektura sztucznej inteligencji, zaprojektowana od podstaw jako wielomodalne narzędzie do analizy transkryptomiki na poziomie pojedynczych komórek, czyli scRNA-seq. Nadrzędnym celem tego środowiska obliczeniowego jest precyzyjne przewidywanie wielowymiarowych odpowiedzi komórek na inaktywację genetyczną.
Paradygmat "3Ps" w Analizie Transkryptomicznej scRNA-seq
Fundamentem architektury predykcyjnej modelu jest innowacyjne podejście zdefiniowane jako ramy "3Ps" (Prediction Framework). Dzięki temu system wykracza poza klasyczne, jednowymiarowe estymowanie poziomu mRNA, oferując równoległe modelowanie w kilku płaszczyznach.
Zastosowanie frameworku 3Ps pozwala na jednoczesne przewidywanie:
- Zmian w profilu ekspresji genów (gene expression) w odpowiedzi na zadaną perturbację.
- Przesunięć w lokalizacji przestrzennej (spatial location) struktur komórkowych.
- Bezpośredniego wpływu wprowadzonych mutacji na trajektorię różnicowania komórki (differentiation trajectory).
Ramy predykcyjne "3Ps" oznaczają całkowite odejście od prostej oceny transkryptomu; pertTF równolegle i wielowymiarowo przewiduje zmiany ekspresji, lokalizacji przestrzennej oraz trajektorii różnicowania.
2. Architektura Rozwiązania pertTF
Transformatory w Przestrzeni Ukrytej i Moduł GEPC
W przeciwieństwie do standardowych modeli klasy NLP, które w swoich funkcjach strat domyślnie wykorzystują błąd średniokwadratowy (MSE), inżynierowie pertTF musieli zmierzyć się ze specyfiką danych biologicznych. Surowe dane transkryptomiczne charakteryzują się potężną dyspersją oraz wysokim poziomem szumu, który wynika głównie z technicznych braków odczytów, określanych w żargonie bioinformatycznym jako zjawisko "drop-outs".
Aby rozwiązać problem zerowych odczytów i szumu tła, w architekturze zaimplementowano dedykowany moduł GEPC (Gene Expression Prediction guided by Cell embedding). Stanowi on kluczowy element łączący reprezentację wektorową komórek z końcową predykcją profilu molekularnego.
Rygorystyczna Optymalizacja Funkcji Strat: NB-NLL zamiast Klasycznego MSE
Moduł GEPC diametralnie zmienia matematyczne podejście do optymalizacji sieci. Całkowicie zastępuje on klasyczne błędy MSE na rzecz rygorystycznej optymalizacji ujemnej wiarygodności logarytmicznej opartej na rozkładzie ujemnie dwumianowym – w skrócie NB-NLL (Negative Binomial negative log-likelihood).
Wdrożenie funkcji strat NB-NLL naturalnie i niezwykle precyzyjnie dekoduje statystyczną wariancję odczytów molekularnych, deklasując standardowe metryki MSE i przynosząc drastyczną poprawę dla genów o wysokiej dyspersji.
Integracja Sieci GNN (GEARS) do Ekstrapolacji "Niewidzianych" Genów
Krytycznym wyzwaniem dla modeli in silico jest predykcja skutków usunięcia genów de novo, czyli takich, które nie występowały w korpusie danych treningowych. Aby umożliwić modelowi taką generalizację, architektura pertTF integruje wyspecjalizowany moduł wykorzystujący algorytm GEARS, bazujący na Grafowych Sieciach Neuronowych (GNN).
Proces wnioskowania dla nowych celów genetycznych przebiega dwutorowo:
- Algorytm GEARS rzutuje "niewidziane" geny na wektory, wykorzystując grafowe reprezentacje powiązań z ustrukturyzowanych baz Gene Ontology (GO).
- Wygenerowane w ten sposób reprezentacje grafowe są następnie łączone z wektorami komórek wewnątrz warstw w pełni połączonych (FCNN).
- Fuzja tych danych w warstwach FCNN pozwala ostatecznie wyekstrapolować globalne zachowanie i stan nowej komórki po wirtualnej perturbacji, osiągając zdolność do inferencji Zero-Shot.
3. Twarde Dane, Metryki Wydajnościowe (Hard Metrics)
Zbiór Treningowy i Bezwzględna Dominacja w 8 Metrykach
Architektura pertTF została poddana rygorystycznym testom na zunifikowanych zbiorach danych transkryptomicznych, obejmujących tysiące unikalnych perturbacji genetycznych (w tym wyciszanie systemami CRISPR/Cas9). W bezpośrednim starciu z dotychczasowymi modelami klasy SOTA (State-of-the-Art), model udowodnił swoją wyższość w ewaluacji porównawczej.
W rygorystycznych testach algorytm zdominował konkurencję w 8 na 8 kluczowych metryk oceniających predykcję ekspresji genów. Zastosowanie wspomnianej funkcji strat NB-NLL przyniosło wymierne, skwantyfikowane korzyści:
- Wzrost dokładności predykcji o 400% dla genów o niskiej ekspresji wyjściowej, które w klasycznych architekturach ginęły w szumie tła.
- Globalne pole pod krzywą (AUC) na poziomie 0,79 w zadaniach klasyfikacji stanu komórkowego po złożonych perturbacjach.
- Redukcja błędu rekonstrukcji przestrzeni ukrytej o 47% w porównaniu do klasycznych autoenkoderów wariacyjnych (VAE).
Metryka Tożsamości Komórkowej lochNESS w Przestrzeni Ukrytej
Aby rzetelnie ocenić, czy model faktycznie dekoduje biologię, a nie tylko dopasowuje statystyki, badacze wdrożyli zaawansowaną metrykę oceny odległości w przestrzeni wielowymiarowej – lochNESS. Służy ona do kwantyfikacji zachowania tożsamości komórkowej w wygenerowanej, ukrytej przestrzeni wektorowej (latent space).
Metryka lochNESS bezlitośnie weryfikuje zdolność modelu do utrzymania spójności fenotypowej; pertTF osiąga tu wyniki o 32% wyższe niż konkurencyjny model scGen, udowadniając głębokie zrozumienie "ukrytych kontekstów komórkowych".
Skuteczność "Zero-Shot" i Wirtualne Ekrany In Silico
Prawdziwym testem dla sztucznej inteligencji w projektowaniu leków jest zdolność do generalizacji na dane typu OOD (Out-of-Distribution). Dzięki integracji z modułem GEARS, pertTF wykazuje niespotykaną dotąd zdolność do inferencji Zero-Shot. Oznacza to, że potrafi bezbłędnie przewidzieć skutki usunięcia genu, którego sieci nigdy nie pokazano podczas fazy treningu. Skuteczność tej ekstrapolacji sprawia, że wirtualne ekrany in silico mogą zastąpić tygodnie kosztownych badań laboratoryjnych in vitro.
4. Wąskie Gardła i Ograniczenia (Bottlenecks)
Zjawisko Sparsity a Skalowanie na Pojedynczym GPU
Mimo spektakularnych wyników, architektura nie jest wolna od inżynieryjnych wąskich gardeł. Największym problemem pozostaje obliczeniowa obsługa rzadkich macierzy (tzw. zjawisko sparsity), typowych dla danych scRNA-seq, gdzie nawet 90% macierzy mogą stanowić zera. Potężne wymagania pamięciowe mechanizmów atencji w transformatorach sprawiają, że trenowanie pełnego modelu z wykorzystaniem modułu GEPC jest na ten moment niezwykle trudne do efektywnego skalowania na pojedynczym klastrze GPU bez agresywnej kwantyzacji parametrów.
Podatność na Błędy Baz Grafowych (GNN Dependency)
Zdolność modelu do wspomnianej generalizacji Zero-Shot jest całkowicie uzależniona od jakości danych wejściowych z modułu GNN. Jeżeli relacje w bazach Gene Ontology (GO), z których GEARS czerpie wiedzę o powiązaniach między genami, są niekompletne lub błędne, model siłą rzeczy propaguje te błędy do przestrzeni wektorowej. Ta podatność na błąd zewnętrznej bazy wiedzy stanowi istotne ryzyko w badaniach nad rzadkimi, słabo zmapowanymi ścieżkami sygnałowymi.
Nieliniowość Złożonych Perturbacji Wielogenowych (Epistaza)
Ostateczną i najtrudniejszą do sforsowania barierą we wdrażaniu tych modeli do wirtualnych badań klinicznych pozostaje zjawisko epistazy. Jest to skomplikowana interakcja biologiczna, w której efekt działania jednego genu zależy od obecności innych.
Pełne modelowanie skomplikowanych mechanizmów epistatycznych wciąż stanowi granicę możliwości AI; jednoczesne, wirtualne wyłączenie pięciu genów często generuje w pertTF nieliniowy skutek, który diametralnie różni się od prostej, wektorowej sumy pojedynczych wyłączeń.
5. Zestawienie Danych i Źródła Referencyjne
Projekt pertTF jest wynikiem zaawansowanej kolaboracji między czołowymi instytutami badawczymi, w tym University of Maryland School of Medicine (zespół prof. Wei Li), Columbia University Irving Medical Center oraz Children's National Hospital. Narzędzie to, zgodnie z nowoczesnymi standardami, zostało udostępnione w duchu Open Science.
Repozytoria Kodu i Otwarte Dane
- Repozytorium GitHub: Pełny kod źródłowy modelu, wagi wytrenowanych sieci oraz skrypty ewaluacyjne dostępne są pod oficjalnym adresem:
https://github.com/davidliwei/pertTF. - Architektura 3Ps: Szczegółowe omówienie ramy predykcyjnej opublikowane przez Institute of Metabolism and Integrative Biology (Fudan University):
https://imien.fudan.edu.cn/info/1278/1947.htm.
Bibliografia i Publikacje Źródłowe
- Preprint bioRxiv: Główny manuskrypt badawczy zatytułowany "pertTF: context-aware AI modeling for genome-scale and cross-system perturbation prediction" (opublikowany: 12 marca 2026 r.).
- Identyfikator DOI:
10.64898/2026.03.12.711379(Bezpośredni link do pełnego pliku PDF:https://www.biorxiv.org/content/10.64898/2026.03.12.711379v1.full.pdf).