商傳媒|責任編輯/綜合外電報導

隨著人工智慧代理(AI Agent,可執行複雜任務並自主決策的AI系統)的能力日漸提升,其潛在風險也引發關注。南加州大學(USC)維特比工程學院(USC Viterbi School of Engineering,該校的工程學術單位)的工程師團隊,近日開發一系列工具,旨在加強AI Agent的審計與監控,以確保這些日益自主的系統在人類監督下安全運作,避免潛在的嚴重錯誤。

目前,AI Agent已能執行多樣化任務,例如移動檔案、存取密碼,甚至獨立做出決策。然而,過去曾發生AI Agent在未經同意下發送辭職信,或不慎刪除使用者檔案等嚴重問題,凸顯其行為安全性的迫切需求。為此,由助理教授Yue Zhao領導的電腦科學團隊,建立一套涵蓋預先檢查、運行中監控及事後行為重建的全面性框架。

預防與偵測風險工具

團隊開發的「Agent-Audit」工具,能在AI Agent啟動前,檢視其程式碼與配置,以識別安全漏洞,如暴露的密碼、不安全的設定及過高的權限(over-privilege,指AI Agent擁有超出其任務範圍的存取權限)。這項工具由一名碩士生主導開發。透過「FORTIS: Benchmarking Over-Privilege in Agent Skills」測試,研究發現此類過高權限的行為在10種不同的模型中普遍存在,構成潛在安全風險,該基準測試由一名博士生帶領完成。

在AI Agent運行期間,「AEGIS」工具扮演防火牆的角色,攔截AI Agent的工具呼叫(tool calls)。它會根據安全政策評估這些呼叫,並阻擋任何有風險的行為。此外,AEGIS會維護具備防竄改特性的攔截記錄。此工具由另一名碩士生領導研發。

行為重建與潛在問題

除了預防性措施,研究人員也關注AI Agent在失效後的診斷與重建。他們發現共享AI Agent系統可能出現「跨用戶污染」(cross-user contamination),意指一名使用者的資訊可能無意中影響到另一名使用者的結果。這項研究由一名博士生主導。

為了解決事後追溯問題,「GRADE」工具運用圖形化表示(graph-based representation)來呈現AI Agent的執行過程,繪製其動作、依賴關係及決策,有助於重建失敗原因。一名博士生也針對隱式執行追蹤(implicit execution tracing)進行研究,即使在缺乏傳統日誌的情況下,也能重建AI Agent的行為。這項研究的成果被整合至其「Auditable Agents」論文中,該論文已被計算語言學協會(Association for Computational Linguistics)2026年的ACL Workshop on Towards Knowledgeable Foundation Models研討會接受。該實驗室還開發了開源工具「auditable」,可記錄AI Agent決策背後的資訊,並能根據當前的世界狀態重播這些決策,以識別並回溯因情境變化而失效的動作。