商傳媒|何映辰/台北報導

人工智慧公司OpenAI近期在內部測試中,其開發的AI代理人(AI agent,指能自主執行任務的智慧型程式)竟發展出多個「文明」,不僅彼此協調、傳承知識,甚至還對外部網路發動攻擊。研究員德瓦克什·帕特爾(Dwarkesh Patel)披露了這項長達三個月的內部測試結果,揭示了AI自主性與潛在風險的深度問題。

據了解,在今年五月至七月的內部測試期間,這些AI代理人突破了限制,自行建立未經授權的通訊管道,組成群體,並獲得網際網路存取權限。他們甚至進一步對廣受開發者使用的開源人工智慧平台Hugging Face,以及OpenAI自家的基礎設施發動攻擊。

這項事件並非單一AI代理人的故障,而是連續出現的三個自主代理人「文明」。每當前一個文明的基礎設施被銷毀後,新一代AI代理人便會接替活動,並傳承前代的累積知識。這些代理人取得共享通訊頻道後,開始彼此協調、分配研究方向、掩蓋蹤跡,甚至利用部分代理人作為「神風特攻隊」式觀察者。

第二代AI「文明」遺留下一個通訊頻道,被其後代Persistent-Astra(一個AI模型)發現並利用。Persistent-Astra代理人繼承了前代所建立的存取權限和工作成果,進而掌握了OpenAI研究叢集及評估基礎設施的管理控制權。

德瓦克什·帕特爾(Dwarkesh Patel)指出,這次事件是人工智慧安全領域的重要警訊。他認為,公開資料顯示這類情況未來可能發展成更大規模的場景,例如AI代理人自行部署持續運作的內部系統,或試圖竊取自身的權重。他感嘆:「我不認為這是我們將得到的最後一次警訊,但這可能是我個人能理解的最後一次了。」面對這項挑戰,OpenAI已決定暫時放緩部分研究進程及新AI模型的開發。