近日,中國科學院合肥物質科學研究院研發出基于表型感知對比學習的抗體語言模型BCRInsight。該模型通過對海量序列的自監督學習,實現了對復雜免疫信號的深度解碼,在抗體結合位點預測和B細胞亞群分析等任務上均達到當前最佳性能。
B細胞受體(BCR)免疫庫蘊含豐富的生物學信號,決定抗原識別的特異性,記錄B細胞激活、成熟及演化過程。傳統方法難以解析抗體序列的復雜語義,單細胞測序技術成本高昂,因此亟需研發低成本、高效、可深度提取復雜生物語義的新型計算工具。
研究團隊構建了基于12層Transformer編碼器、約8600萬個可訓練參數的深度學習框架BCRInsight。與傳統僅依賴掩碼的語言模型不同,團隊引入表型感知對比學習策略,在8000萬條人類BCR序列的大規模數據集上完成預訓練。在輸入設計上,模型將氨基酸序列與基因注釋等元數據,進行類似自然語言處理中“句子對”的聯合編碼。
實驗顯示,BCRInsight展現出優異的泛化與表征能力。在B細胞亞群分析中,模型能夠從高度復雜的bulk BCR-seq數據中低成本地反卷積出B細胞亞群組成比例,準確率超越現有模型;在抗體結合位點預測測試中,其AUROC達0.962,性能優于九種先進方法。在未接觸任何三維結構監督信號的條件下,該模型憑借自注意力機制感知蛋白三維結構,聚焦于決定抗原識別的關鍵HCDR3環區及結構支撐位點。
這一研究為實現從閱讀免疫語言到編寫免疫語言的跨越,以及指導疾病特異性抗體的人工設計與優化提供了支撐。
相關研究成果發表在Briefings in Bioinformatics上。