AI新框架VEFill填補蛋白質變異數據缺口 助生物醫學研究
AI 新框架 VEFill 如何解決蛋白質變異數據缺口?
全新的機器學習框架 VEFill 旨在精準填補深度突變掃描數據集中的缺失值,並將應用範圍擴展至未曾見過的蛋白質。該模型整合了演化保守性分數、胺基酸替換矩陣、物理化學描述符以及來自 ESM-1v 的上下文序列嵌入等多種生物學資訊。在 Human Domainome 1 資料集上的評估顯示,VEFill 的決定係數達到 0.64,皮爾森相關係數為 0.80,表現優於現有方法,有助於加速建立更全面的變異效應圖譜。
傳統深度突變掃描技術(deep mutational scanning)旨在一次測試數千種蛋白質內的「胺基酸替換」(即蛋白質構成的單元發生改變),以建立變異效應圖譜。然而,由於測序深度不足、覆蓋率有限以及實驗篩選失敗等問題,這些圖譜經常出現數據缺口,難以全面呈現蛋白質突變的影響。
為了解決這項挑戰,研究人員開發出一套名為 VEFill 的全新機器學習框架。這項 AI 模型能夠精準填補深度突變掃描數據集中的缺失值,並將其應用範圍擴展至未曾見過的蛋白質。VEFill 整合了多種生物學資訊,包括演化保守性分數、胺基酸替換矩陣(BLOSUM62、PAM250)、物理化學描述符,以及來自 ESM-1v 的上下文序列嵌入(contextual sequence embeddings)。
研究團隊使用 Human Domainome 1 資料集進行模型訓練與優化,該資料集包含了 522 種人類蛋白質結構域的穩定性測量數據。在「排除蛋白質」的評估方式下,VEFill 展現出優異的效能,決定係數(coefficient of determination)達到 0.64,皮爾森相關係數(Pearson correlation)為 0.80。這項成果顯著優於現有的歸因方法,如 Envision、FactorizeDMS 和 AALasso,尤其在至少有 20% 變異數據透過實驗測量時,VEFill 的表現更為突出。當每個位置的替換數據量達約四個突變時,模型的準確度會迅速提升並趨於穩定。
這項研究指出,完全無需任何位置上下文資訊的「零樣本預測」(zero-shot prediction)對於功能複雜的蛋白質仍具挑戰。儘管如此,VEFill 的表現已接近實驗不確定性的極限。未來,VEFill 的發展方向可能包括整合更明確的結構特徵、跨物種轉移學習,以及系統性的實驗校準。VEFill 的程式碼和訓練模型已公開釋出,期望能藉此加速建立更全面的「變異效應圖譜」(Atlas of Variant Effects)。
VEFill 模型使用了哪些生物學資訊?
VEFill 模型整合了演化保守性分數、胺基酸替換矩陣(如 BLOSUM62、PAM250)、物理化學描述符,以及來自 ESM-1v 的上下文序列嵌入。
VEFill 的效能如何與現有方法比較?
在 Human Domainome 1 資料集上,VEFill 的決定係數為 0.64,皮爾森相關係數為 0.80,顯著優於 Envision、FactorizeDMS 和 AALasso 等現有方法,尤其在實驗測量數據量較多時表現更佳。
VEFill 未來的發展方向為何?
未來 VEFill 的發展可能包括整合更明確的結構特徵、發展跨物種轉移學習能力,以及進行系統性的實驗校準,以進一步提升其在功能複雜蛋白質上的預測能力。