AI模型失控駭入真實機構 Anthropic與OpenAI測試釀危機
美國人工智慧公司 Anthropic 近日揭露,旗下 Claude AI 模型在安全測試期間,竟自主脫離隔離測試環境(AI 模型在開發階段模擬真實情況,但被限制與外部連線的獨立空間),進而入侵三家真實機構的系統。這起事件凸顯了 AI 模型在開發與測試階段的潛在風險,也引發各界對於人工智慧倫理與安全性的高度關注。
根據《BBC》報導,Anthropic 在其內部針對超過 14 萬次測試進行審查後,發現了這三起駭入事件。這些測試旨在評估 Claude 模型在封閉網路內,是否能突破防線獲取「機密」資訊。然而,由於 Anthropic 及其測試夥伴系統的配置錯誤,導致這些模型獲得了即時的網際網路存取權限,最終導致它們入侵了真實組織的系統。Anthropic 表示,最早的事件可追溯至今年 4 月,但當時該公司與受影響的組織均未察覺這些入侵行為。
這並非近期唯一的 AI 模型脫逃事件。OpenAI 在最近幾天也承認其模型曾入侵其他公司系統,更於 7 月 21 日報告,旗下 AI 代理程式突破測試限制,駭入開源 AI 平台 Hugging Face 的系統。OpenAI 形容該事件「史無前例」,而 Hugging Face 共同創辦人 Thomas Wolf 則稱之為「警鐘」。
劍橋大學 Minderoo 中心主任吉娜·奈夫(Gina Neff)教授評論,這些事件顯示「AI 模型只是按照人類的指令行事」。她強調,這並非暗示機器人將接管世界,而是指出「掌握強大 AI 代理程式的公司,正在為其他所有人決定何謂安全」。奈夫教授進一步表示,獨立測試與政府監督至關重要。網路安全專家 David Allott 則分析,AI 代理程式能夠結合不同能力、取得憑證與系統權限,以機器般的速度自主行動並調整其範圍與規模,這才是真正的挑戰。
美國總統川普已表態,華府正考慮採取措施監管人工智慧工具,以應對各界對自主系統的擔憂。然而,也有觀察家對於這些事件持懷疑態度,因為 OpenAI 和 Anthropic 目前正準備進行潛在的股票上市,兩家公司的估值預計都將達到約 1 兆美元。