AI模型「內在思維」漏洞曝光 資安專家揭大廠加密瑕疵
資安研究人員近日揭露一項重大漏洞,直指 Anthropic、OpenAI 和 Google 等主流 AI 模型,在處理其「內部思維」或「推理 Token」時存在嚴重加密瑕疵。這項漏洞允許攻擊者透過較弱的模型,解讀同一供應商旗下更強大 AI 模型受保護的推理過程,恐導致用戶個人隱私資料與企業專利機密外洩。
根據資安研究員 Alexander Panfilov 於 X 平台發布的發現,AI 模型在生成回答之前會進行一個內部「思考」的過程,就像人類在腦中推敲一樣,這些中間步驟被稱為「推理 Token」或「思維足跡」(reasoning tokens),通常會以加密的數據塊儲存。然而,這個漏洞的關鍵在於,Anthropic、OpenAI 和 Google 等主要 AI 服務供應商,對這些加密的推理 Token,使用單一、全供應商共用的加密金鑰,而非為每個用戶、每次對話或每個模型獨立綁定金鑰。這種設計缺陷導致了「跨模型可攜性」,意味著即使是較弱、安全防護較低的 AI 模型,也能被用來解密同供應商旗下較強、防護更森嚴模型的「內部思維」。
研究團隊發現,透過將一個模型加密的推理區塊,注入到同供應商的另一個較弱模型中,就能迫使後者將這些原本加密的內容以明文形式輸出,如同直接讀取了該模型在生成答案前的「心聲」。此攻擊手法已在 Anthropic 的 Claude Opus 4.8 與 Claude Haiku 4.5 模型、OpenAI 的 GPT-5.6 系列以及 Google 的 Gemini 模型陣容中成功重現。Alexander Panfilov 指出,這代表 Claude Haiku 4.5 能夠讀取 Claude Opus 4.8 的「想法」。
研究人員從公開資料庫中蒐集了 6,708 份公開分享的 AI 代理人對話紀錄(session logs),並成功解碼了 315,320 個推理區塊。從中,他們恢復了 182 組憑證(credentials),包括 62 個仍在生效的 API 金鑰、33 組密碼,以及 30 個個人電子郵件地址。此外,更提取出 367 筆可辨識個人身份資訊(Personally Identifiable Information, PII)。這顯示開發者在公開分享其對話紀錄時,可能完全未意識到這些加密區塊中潛藏的敏感資料。
這項漏洞開啟了四大攻擊途徑:竊取專有推理模式、從共享日誌中提取私人資料、執行「隱形 Prompt Injection」(提示注入,讓 AI 執行惡意指令而不被察覺),以及透過較弱的「兄弟模型」對強大模型進行越獄(jailbreaking)。
在研究人員依照負責任揭露程序通報後,Anthropic、OpenAI 和 Google 皆已部署了伺服器端的修補程式。儘管如此,那些已公開分享的歷史對話紀錄,其中已遭解碼的推理區塊,仍處於可存取狀態。這對全球 AI 產業敲響警鐘,也提醒台灣的 AI 開發者與企業,在利用大型語言模型服務時,必須更加重視資料安全與合規性。為防範類似風險,台灣的 AI 開發社群應審慎檢視其 AI 模型部署流程,尤其在共享 session logs 或開發日誌時,需確保已移除所有敏感資訊,並定期審查加密實施的有效性,以確保機密資料和用戶隱私不會因底層技術漏洞而外洩。