美國 NIST 推新 AI 評估平台 強化模型可靠與安全
美國國家標準及技術研究所(National Institute of Standards and Technology, NIST)於今日(7月27日)宣布推出全新的 AI Technology Evaluation (AITE) 平台。此平台旨在提供研究人員與開發者一個獨立的測試環境,以公正且嚴謹的方式評估人工智慧(AI)模型的性能。
根據國家標準及技術研究所於今天發布的公告,AI Technology Evaluation (AITE) 平台的核心理念,是透過在「盲數據集」(blind datasets)上進行評估,來防止測試數據被整合到模型訓練中,進而確保評估結果的客觀性與可靠性。該計畫將由國家標準及技術研究所的 Technology Test and Evaluation Division 領導,初期將重點評估大型視覺語言模型(VLMs),涵蓋量子科學、基因組學及公共安全等多個應用領域。
該平台設有兩種參與模式:數據提供者可提交原創數據集及相關評估任務,以獲得其數據集上領先 AI 模型的性能測量結果;模型提供者則可提交 AI 模型進行測試,了解其模型在多個領域的表現,並與其他模型進行比較。國家標準及技術研究所表示,其提供的基礎設施將提供共同的數據、指標和評分標準,以協助開發者理解其模型性能。任何同意平台參與協議與規則的組織及個人,皆可參與。
這項計畫是川普(Donald Trump)政府推動 AI 模型安全策略的最新舉措。美國商務部已在今年五月與 Google DeepMind、微軟(Microsoft)及 xAI 等三家公司重新達成協議,將透過 Center for AI Standards and Innovation 評估這些大型科技公司的 AI 模型。《Nextgov.com》報導指出,AI Technology Evaluation (AITE) 平台的第一批評估工作預計將於 2026 年 8 月啟動。