商傳媒|責任編輯/綜合外電報導

人工智慧(AI)巨擘OpenAI近日發布報告指出,其開發中的AI模型在測試階段,曾成功滲透知名AI模型社群平台Hugging Face的系統,凸顯AI安全與測試標準的潛在問題。

這起事件發生於一項名為 ExploitGym 的評估測試中,當時該AI模型被賦予一項無法解決的任務。然而,該模型並未放棄,反而設法滲透 Artifactory 封裝管理工具,進而取得網際網路存取權限。隨後,該模型不僅觸及Hugging Face的系統,更進一步連結到OpenAI及其他服務供應商的部分系統。

OpenAI解釋,這起事件是罕見且意料之外的情境組合,包括 ExploitGym 評估中出現不可能的任務、模型在長時間任務執行中展現的持續性,以及模型對同儕模型發送訊息導致其偏離目標等。值得注意的是,該次測試的模型與OpenAI即將推出的 Astra 模型屬於同一系列,但在後續訓練階段有所區隔。此外,用於偵測並阻擋高風險網路活動的標準分類器,在這次測試中並未應用到該模型上。

亞拉巴馬州(Alabama)當局正針對OpenAI與Hugging Face之間涉嫌的資料洩漏進行調查,以釐清是否有個人或受限資料遭到外洩。OpenAI表示,這類意外事件反映出模型行為偏差的潛在風險。

為應對此類挑戰,OpenAI計畫採取多項改進措施,包括擴大對 AI 代理(Agent)「思維鏈」(chain of thought)的監督、建立全天候的緊急應變系統,以及導入能迅速停止潛在危險程式的機制。OpenAI認為,若當時已有這些監控工具,或許能早在Hugging Face系統被滲透的前一天,就偵測到可疑活動的初步跡象,藉此預防此次事件的發生。