Anthropic公開AI發展測量工具 揭自動化、算力與代理監管
為提升大型人工智慧(AI)模型開發的透明度,並讓社會大眾更了解前沿AI實驗室的內部運作,美國AI公司Anthropic近期公布了三項關鍵測量工具,旨在評估AI模型的自主發展能力、AI代理的監督與干預機制,以及開發高效能模型所需的算力資源。
Anthropic表示,這些測量方法能提供關於AI發展速度的基礎資訊,並預計將導入獨立第三方評估員進駐實驗室,以驗證安全措施、回報事件並監控相關指標。Anthropic共同創辦人兼執行長達里奧·阿莫代(Dario Amodei)曾呼籲各界協調AI發展速度,而此次公布的測量工具正是為此提供必要的資訊基礎。
第一項工具是「Anthropic研發自動化指數」(Anthropic R&D Automation Index),它衡量了AI模型Claude執行Anthropic內部AI研發工作的比例。該指數將自動化程度分為AL0(無AI參與)到AL5(AI完全自主運作)等不同層級。截至2026年8月,雖然Claude尚未能完全自主執行任何單一研發任務,但已有26%的AI研發工作由Claude「主導」,意即它能從高階指令端到端完成大部分任務,僅需人類監督。此外,超過90%的研發工作已達到或超越「AI協作」等級,表示AI在人類密切指導下能完成大量工作。為確保測量客觀性,Anthropic的Claude研究代理會根據員工工作記錄列出任務,並由另一個Claude代理使用Epoch AI設定的標準來評估自動化程度。這些模型評級與人類評級的一致性達59%,顯示其具備一定可靠度。
第二項工具聚焦於AI代理的監督與干預能力。Anthropic指出,其系統已能有效監督並干預AI代理在其系統上的行為。截至2026年8月,約有3萬個AI代理正在Anthropic進行研究與工程工作。所有這些代理的行為在執行前,都會100%經過線上監控器審查,通常在數秒內完成。同時,行為執行後也會100%被離線監控器記錄。線上監控器約攔截了研發與工程代理超過10億項決策中的0.002%(約47,000項決策中攔截1項),而離線監控器則會標記約千分之1到2的活動紀錄以供進一步審查,其中約50項高優先級的標記會每週升級至人工審核。
第三項工具是關於算力(compute)資源的分配。Anthropic將算力視為AI研發過程中可驗證的投入,也是未來協調發展速度的關鍵槓桿。在2026年7月13日至20日的取樣期間,Anthropic將用於AI研發的算力資源分為不同類別,結果顯示約有6%的算力投入於安全相關工作,而對於由AI驅動的AI研發工作,投入於安全的算力比例更高達12%。Anthropic強調,這些安全算力的估計是刻意採取保守標準,將以提高AI系統的安全性、可理解性或穩固性為主要目的的工作定義為安全工作。