商傳媒|何映辰/台北報導

人工智慧(AI)在企業決策中的應用日益廣泛,從篩選求職者到投資評估,甚至好萊塢的選角過程,都能見其身影。然而,耶魯大學管理學院(Yale SOM)近日發表一項研究指出,儘管大型語言模型(LLM)在評估時看似公正,卻可能未能真正消除潛藏的偏見,引發學術界與業界對AI公平性原則的關注。

這項由耶魯大學管理學院副教授 Tristan Botelho 與博士生 Qingyang Wang 共同進行的研究,深入探討了 LLM 在評估過程中如何處理種族和性別偏見問題。研究團隊發現,AI 系統通常是依據帶有「人類偏見」的數據進行訓練,這可能導致「輸入偏見,輸出偏見」(bias in, bias out)的結果。例如,過去亞馬遜(Amazon)就曾因其招募工具懲罰提及「女性」的應徵者而最終棄用。

研究人員透過兩項實驗檢驗了 LLM 的表現。在首項實驗中,LLM 針對 2,000 份新創公司提案進行評估,這些提案被隨機分配給具有不同種族和性別暗示姓名(例如白人男性、白人女性、非裔男性、非裔女性)的創辦人。結果顯示,LLM 雖然略微提高了與白人女性、非裔男性及非裔女性相關提案的分數,並減少將其列為最後一名,但這些提案並未因此更有機會被選為優勝者。這表明 LLM 僅展現「象徵性合規」(symbolic compliance),即僅避免表面上的歧視,但其底層的評估邏輯仍不夠公平,未能實質改變結果。

在第二項實驗中,LLM 作為人類評估者的「同儕」,當人類評估理由帶有「明顯偏見」(基於身份的刻板印象)時,LLM 會顯著提高低分提案的分數;但若偏見被偽裝成「商業考量」時,LLM 的分數調整幅度則不明顯。這意味著 LLM 能夠避免「觀感不佳」並糾正公開的歧視行為,卻難以識別或處理更為細微的偏見形式。

Tristan Botelho 教授強調,LLM 的使用者與開發者應保持謹慎。目前許多 AI 公司在模型訓練後會進行「安全對齊」(safety alignment)來抑制帶有偏見的輸出,但研究結果指出,這項措施可能只會造成表面上的象徵性合規,而非真正的偏見消除。Qingyang Wang 也補充說,此現象是 AI 領域一個更廣泛問題的一部分,需要各方共同努力解決。研究團隊呼籲,AI 評估的便捷與光鮮外表不應欺騙使用者,因為潛在的不理想結果仍然存在。