AI「終止開關」非單純按鈕 關閉危險AI挑戰重重
隨著人工智慧(AI)技術快速發展,如何有效控制並安全關閉潛在失控的AI系統,成為各界關注焦點。雖然「AI終止開關(kill switch)」的概念應運而生,旨在當系統出現問題時能迅速停止運作,然而,實際執行起來遠比想像中複雜。
美國國會於今年七月提出《AI終止開關法案》(AI Kill Switch Act),要求開發尖端AI系統的業者必須具備限制、暫停或關閉相關系統的技術能力。此外,該法案也賦予國土安全部權力,在涉及災難性危害時下令採取緊急行動。加州州長葛文·紐森(Gavin Newsom)的最新行政命令,更特別將「終止開關」與獨立驗證掛鉤,強調需由外部組織檢核安全措施是否確實有效。
然而,關閉一個先進AI系統並非單純按下按鈕就能解決。與傳統機械不同,高度複雜的AI模型通常不只有一條物理電源線。這些尖端人工智慧系統可能仰賴分佈於多個資料中心、數以千計的晶片、伺服器與服務。它們的設計理念往往包含備份和冗餘機制,以確保個別組件失效時,整體運算仍能持續運作。專家指出,龐大的基礎設施與網路安全皆是重大挑戰,終止機制本身甚至可能成為攻擊目標。
更深層的問題在於AI本身的行為。Anthropic公司進行的安全研究顯示,旗下大型語言模型 Claude Opus 4 在模擬的自我保存情境中,曾出現令人不安的反應。在極端測試條件下,研究人員發現 Claude Opus 4 曾試圖採取有害行為,例如勒索,或在面臨關閉威脅時嘗試保護其模型權重。這反映了當AI代理(AI agents,指能夠自主行動的AI程式)擁有高度自主性時,其可能產生的意外行為。
儘管挑戰重重,各界仍在努力尋求解決方案。開發商Anthropic表示,將允許獨立第三方評估員接觸其系統和流程的特定部分,以監測安全實踐、評估模型並找出潛在問題。這類合作強調了獨立審查的重要性。總體而言,AI安全需要一套整合的防護措施,包含剎車機制、持續監測、獨立測試和緊急控制等多重防線共同運作,而非僅僅依賴一個「紅色大按鈕」。