中文自然語言處理新突破:ALTAI 模型精準識別文本實體
ALTAI 模型如何提升中文命名實體識別的精準度?
ALTAI 模型透過兩項創新組件,大幅提升中文命名實體識別(NER)的精準度。首先,「Cross Transformer」模組能明確建模字元、詞彙及語義表徵之間的互動,讓字元能參考其所屬詞彙並由語義層調整解釋。其次,「Cross-Granularity Contrastive Learning」訓練策略則在 Embedding space 中拉近相關表徵、推遠不相關表徵,藉此強化實體的區辨能力。這項技術突破的關鍵在於其明確的跨粒度互動原則,已在四個中文命名實體識別基準數據集上持續優於現有模型。
華南師範大學與廣州航海學院的研究人員共同開發了一款名為 ALTAI(A noveL cross-granulariTy contrAstive learnIng network)的新型人工智慧模型,大幅提升中文命名實體識別(Named Entity Recognition, NER)的精準度。命名實體識別是一項基礎的自然語言處理任務,旨在自動找出並分類中文文本中的人名、組織、地點等關鍵詞。
中文文本處理面臨特有挑戰。與英文不同,中文詞彙之間沒有空格分隔,這使得機器難以判斷詞彙界線,必須從上下文推斷實體意義。傳統模型若僅依賴字元層級資訊,容易忽略詞彙知識;若僅依賴詞彙層級,則可能失去細緻的組合結構。儘管現有的詞字格框架(word-character lattice framework),如 Flat-Lattice Transformer,已廣泛應用並帶來顯著進展,但這些方法在整合詞彙資訊時,通常透過隱式方式進行,忽略了字元與詞彙表徵之間複雜的跨粒度互動。
ALTAI 模型透過兩項緊密結合的創新組件來解決此問題。首先是「Cross Transformer」,一個模組,明確地建模字元表徵、詞彙層級的詞彙表徵與語義表徵之間的互動。這讓每個字元能直接參考其所屬詞彙,並由語義層調整字元與詞彙的解釋。其次是「Cross-Granularity Contrastive Learning」,這是一種訓練策略,讓模型在 Embedding space(模型用來表示語義關係的向量空間)中,將相關的表徵拉近,不相關的則推遠,藉此強化實體的區辨能力。
根據《Bioengineer.org》報導,ALTAI 在四個中文命名實體識別基準數據集上的表現,均持續優於既有的強勢基準模型。研究人員指出,這項技術突破的關鍵在於其明確的跨粒度互動原則,該原則具有普適性,未來有望推廣至其他語言與任務。命名實體識別作為資訊擷取、問答系統、知識圖譜建構、搜尋與推薦系統等下游應用的基石,ALTAI 的發展無疑為這些領域帶來新的進展。這項研究也反映了機器學習領域中,對比學習(contrastive learning)從電腦視覺應用轉向結構化語言任務的廣泛趨勢。此研究獲得中國國家自然科學基金委員會與廣東省多項研究計畫支持。
ALTAI 模型解決了中文文本處理的哪些挑戰?
中文文本因詞彙間無空格,機器判斷詞彙界線較英文困難。傳統模型若僅依賴字元層級易忽略詞彙知識,若僅依賴詞彙層級則可能失去細緻的組合結構。ALTAI 模型透過明確的跨粒度互動,有效整合了字元與詞彙的表徵。
ALTAI 模型的研究獲得哪些支持?
此項研究獲得中國國家自然科學基金委員會與廣東省多項研究計畫的支持。研究人員指出,ALTAI 的跨粒度互動原則具有普適性,未來有望推廣至其他語言與任務。