商傳媒|葉安庭/綜合外電報導

加州大學柏克萊分校研究團隊開發出一款名為 GPN-Star 的新型人工智慧模型,能有效解碼基因組(genome,生物體內一套完整的基因訊息)的「語法」,並精準識別影響人類健康的基因變異(genetic variants,指基因序列的差異),為遺傳疾病的預測與診斷帶來突破性進展。

根據《自然》期刊於 9 月 9 日發表的這項研究,GPN-Star 的一大優勢在於其出色的運算效率。相較於現有模型如 Evo 2,Evo 2 需要動用數千顆 NVIDIA 處理器並耗時數月才能完成訓練,GPN-Star 僅需數個處理器,數天甚至數小時內即可完成訓練,大幅降低了研究成本與時間。

研究共同作者、柏克萊大學電腦科學與統計學教授 Yun S. Song 博士指出,他們的模型在預測基因變異的致病性(pathogenicity,引起疾病的能力)以及區分基因組中功能性與非功能性元素方面表現出色。Yun S. Song 博士表示:「我們希望這項工作能推動生物學的發現。目前已有許多工具能評估基因變異的影響,但無法對基因組中的每個變異都進行實驗測試。我們相信 GPN-Star 的預測結果將有助於優先篩選出對人類健康影響最大的實驗。」

傳統的基因組語言模型通常以大量獨立的未比對基因序列進行訓練,導致運算負擔龐大。GPN-Star 的創新之處在於它採用「全基因組比對」(whole-genome alignments, WGAs)的數據進行訓練。WGAs 透過演算法將數百種不同物種的基因組與單一物種進行關聯比對,從中突顯相似處與差異性,這使得 GPN-Star 能在訓練時直接聚焦於預先識別出的保守區域,大幅提升效率。

研究人員也發現,針對不同演化時間尺度進行訓練的模型,在解釋不同類型的基因變異時各有優勢。例如,針對較長演化時間尺度訓練的模型,更擅長預測蛋白質中罕見基因變異的影響;而針對較短演化時間尺度訓練的模型,則在預測精神分裂症風險等複雜特徵的基因變異方面表現更佳。加州大學柏克萊分校統計學博士生 Chengzhong Ye 解釋:「這在演化生物學上是合理的,因為有些基因組元素演化速度比其他元素快得多。」此外,針對靈長類基因組訓練的模型,也提升了與近期人類演化相關複雜特徵的預測準確度。

GPN-Star 的研究團隊已將其模型產生的大量基因組預測結果公開,這些預測點出了哪些基因變異最可能影響遺傳特徵。生物學家可利用這些註釋進一步辨識相關基因與調控元素,進行深入研究。研究共同第一作者 Gonzalo Benegas 期望,GPN-Star 對訓練資源的低需求,能讓更多團隊修改及採用此模型,加速基因研究的整體進程。