撰文丨王聰
編輯丨王多魚
排版丨水成文
系統性地模擬和預測在異質性細胞環境中多種干預措施的表型效應(例如,敲除一個基因,或添加一種藥物,細胞會產生什么變化),是實現人工智能虛擬細胞(Artificial Intelligence Virtual Cell,AIVC)愿景的核心。
然而,一直以來,研究遺傳(基因)和化學(藥物)的實驗室往往是兩條平行線。遺傳篩選通量高,但難以直接成藥,化學篩選針對治療卻因化學空間浩瀚無比而效率低下。如果能用一個統一的 AI 模型橋接這兩大領域,打破遺傳與化學擾動之間的壁壘,不僅能揭示更深層的生物學機制,還能極大加速藥物研發。
2026 年 7 月 24 日,騰訊生命科學實驗室(AI for Life Sciences Lab)姚建華研究員、楊帆研究員及中南大學計算機學院李敏教授作為共同通訊作者(李一鳴為論文第一作者),在國際頂尖學術期刊Cell上發表了題為:UniPert-G2CP bridges genetic and chemical screens from molecular representation to phenotype modeling 的研究論文。
該研究構建了一個名為UniPert-G2CP的全新 AI 框架,通過整合多模態分子擾動因子(原因)表征,并實現從遺傳到化學擾動表型(結果)的遷移學習,從而連接遺傳篩選與化學篩選,從而更準確地預測擾動、發現作用機制,并實現高效的計算機輔助藥物篩選。UniPert-G2CP推動了通用生物學因果建模的發展,加速了人工智能虛擬細胞(AIVC)的實現,并拓展了 AI 驅動的精準醫學的應用潛力。
![]()
![]()
痛點:基因與藥物的“雞同鴨講”
模擬細胞狀態并預測來自多種干預措施(包括遺傳和化學擾動因子)的表型效應,已成為人工智能虛擬細胞(Artificial Intelligence Virtual Cell,AIVC)發展中的核心目標。這一進展得益于諸如 Connectivity Map、Cancer Dependency Map 及 Cell Painting Gallery 等項目所提供的具有上下文特異性的、高通量、多領域的擾動后表型特征數據。通過對這些擾動因子所引起的細胞響應與行為進行聯合建模與分析,可系統性地探索生物學機制和治療干預手段,同時有助于識別潛在的治療靶點,并發現針對特定疾病的新型藥物候選物,從而推動高效的數據驅動型個體化醫療。然而,這一前景廣闊的范式在細胞擾動建模方面仍面臨若干關鍵瓶頸——
1、模態差異大: 基因是由 A、G、C、T 組成的長鏈序列,而藥物通常是原子構成的小分子化合物,傳統的 AI 模型很難將兩者映射到同一個語義空間中。
2、數據規模不對等: 基因庫相對有限(人類只有大約 2 萬個基因),可以通過 CRISPR 技術進行大規模并行篩選;而化學藥物的空間近乎無限(估計有超過 10?3 種化合物),實驗篩選成本高昂,覆蓋率極低。
3、細胞異質性: 同樣的藥,對不同來源的細胞(例如不同患者的癌細胞)效果可能截然不同,模型需要具備跨環境的泛化能力。
破局:UniPert-G2CP 是如何工作的?
為了攻克上述難題,研究團隊設計了一個兩階段深度學習框架,以克服跨擾動域、分子模態和文庫規模的表型篩選中的建模瓶頸。在第一階段,研究團隊開發了UniPert(Unified Multimodal Perturbagen Representation Learning),這是一個基于對比學習的多模態分子表征學習模型,能夠將大分子和小分子編碼到共享的語義嵌入空間中,從而橋接遺傳擾動與化學擾動。在第二階段,研究團隊將 UniPert 集成到一個擾動效應預測模型中,開發出了G2CP(Genetic-to-Chemical Perturbation Transfer Learning),這是一種遺傳到化學擾動的遷移學習方法,利用系統性的基于 CRISPR 的遺傳篩選來提升計算藥物篩選的效率。
![]()
UniPert-G2CP 概述
第一階段:UniPert——打造通用的分子“語言”
UniPert的核心任務是將基因(編碼的蛋白質)和小分子藥物轉化為同一種“AI 語言”(向量嵌入)。
對于藥物(小分子): 它使用了經典的 ECFP 指紋作為輸入,這相當于提取了藥物的結構骨架特征。
對于基因(編碼的蛋白質): 這是創新的關鍵,它不僅僅依賴最新的蛋白質語言模型(例如 ESM)來獲取全局特征,還結合了多序列比對(MSA)和圖神經網絡(GNN)。這就像一個既懂宏觀語法又精通局部方言的專家,能更好地捕捉蛋白質的保守功能區域。
對齊訓練: 利用已知的化合物-靶點相互作用(CPI)數據,通過對比學習,強制讓相互作用的藥物和蛋白在向量空間中“貼在一起”。
結果顯示,UniPert 不僅學會了區分不同作用機制的藥物,甚至能識別出結合在同一蛋白不同位點的結構不相似的藥物(例如作用于 GABAA 受體的不同變構調節劑)。對于蛋白來說,它能準確地將功能相似的蛋白家族聚集在一起,甚至能推斷出未被充分研究的蛋白所屬家族或相互作用關系。
第二階段:G2CP——“以基因為師,導藥入海”
有了UniPert這個強大的“翻譯器”,G2CP框架就能大顯身手了,它的策略是“遺傳預訓練 + 化學微調”。
預訓練(學基因): 首先,利用大量、系統性的 CRISPR 基因篩選數據來訓練模型。這讓模型深刻理解了“敲除某個基因會導致細胞發生什么變化”這一底層邏輯,給模型打下了堅實的生物學基礎。
微調(學藥物): 由于化學藥物數據少,直接用少量藥物數據訓練效果差。G2CP 的做法是將 UniPert 編碼的藥物信息輸入模型,利用從基因中學到的知識,去預測未見過的藥物會引起的細胞反應。
這就像先在題庫(基因庫)里做了海量練習,掌握了解題規律,然后再參加考試,遇到新題型(藥物),也能舉一反三,準確作答。
成績:效果顯著,洞察深刻
論文中的實驗結果令人印象深刻——
1、預測更準確: 在多個數據集(例如 LINCS、sciPlex3)上,G2CP 預測藥物誘導的基因表達變化(轉錄組)和形態學變化的準確度遠超現有方法。特別是在數據稀缺的情況下,性能提升尤為明顯(高達 375%)。
2、搞定“難搞”的藥物: 對于組蛋白去乙酰化酶(HDAC)抑制劑這類結構相似但藥效有細微差別的藥物,UniPert-G2CP 也能精準區分它們的分子特征和預期效果。
3、揭示耐藥機制: 作為一個案例研究,研究團隊聚焦于乳腺癌中的雌激素受體(ER),成功復現了 ER 突變(例如 Y537S、D538G)如何導致對現有藥物(例如氟維司群)產生耐藥性,并指出了潛在的耐藥相關基因通路(例如 MYC、DNA 修復通路)。這為克服內分泌治療耐藥提供了新的計算視角。
意義與展望:邁向虛擬細胞時代
UniPert-G2CP的核心是一個通用計算框架,通過統一因果和效應兩個視角下的擾動表征,結合多模態分子表征學習和跨域擾動表型遷移學習,顯著提升了生物學因果模型在不同數據模態、實驗尺度和生物學背景下的泛化能力。該研究的意義不止于開發了一個新算法,更為整個領域帶來了新范式——
加速藥物發現: 通過“遺傳指導化學”,可以用計算機模擬海量化合物的效果,優先篩選出最有潛力的候選藥物,大幅降低濕實驗的成本和時間。
賦能精準醫療: 模型能考慮到不同細胞系(患者來源)的異質性,未來有望根據患者的基因背景,預測其個性化用藥反應,實現真正的“對癥下藥”。
奠定 AIVC 基礎: UniPert-G2CP 提供了一種統一建模“原因”(擾動因子)和“結果”(細胞表型)的通用框架,是推動構建全功能人工智能虛擬細胞(AIVC)的重要一步。
總的來說,UniPert-G2CP的出現,標志著我們在利用 AI 解析復雜生命系統、連接基因型與表型方面邁出了堅實一步。它不僅是一個強大的預測工具,更是一個生成假設的平臺,有望在未來幫助我們更快地發現新藥、破解疾病機制,最終造福人類健康。
論文鏈接:
https://www.cell.com/cell/fulltext/S0092-8674(26)00654-9
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.