商傳媒|葉安庭/綜合外電報導

人工智慧(AI)領域的競爭態勢持續升溫。儘管數週前Anthropic與OpenAI的領導者才呼籲放緩模型發展,兩大AI巨頭仍於週二(23日)幾乎同步推出新一代大型語言模型。Anthropic發表了Claude Opus 5.5,而OpenAI則推出了GPT-6 Sol及GPT-6 Luna。這場競賽的焦點已從單純追求模型規模,轉向效率、成本與實際應用效能。

Anthropic的Claude Opus 5.5(一種大型語言模型)在效能上媲美Fable 5.1,並且相較於前一代Opus 5,總營運成本降低約四成,回應速度更提升超過三成。其應用程式介面(API)定價已大幅調降至每百萬輸入Token(AI處理的最小資訊單位,如單字或字元)4美元,每百萬輸出Token 20美元,同時快取讀取成本也減少六成。Anthropic特別著重改善Claude的溝通風格,使其表達更直接、清晰,以回應此前對其「Claudish」寫作風格的批評。

OpenAI方面,其主要工作模型GPT-6 Sol據稱能將事實錯誤率減半。GPT-6系列模型的API定價也較先前發布時調降約五成。另一款模型GPT-6 Luna則以更低的成本提供與過去頂級模型相當的效能,並提升了穩定性與對安全指令的遵循度。

獨立基準測試顯示,Opus 5.5以58分的成績位居業界領先地位,在十項主要測試中有六項表現最佳。在針對通用智力測試的「人類最終考試」(Humanity's Last Exam)中,Opus 5.5在搭配工具使用時的準確率達到67.7%,超越了OpenAI的GPT-6 Astra的57.2%。在程式開發與自主代理(Agent,能自主執行任務的AI系統)操作的Terminal-Bench 4.0測試中,Opus 5.5獲得66.4%的分數,也領先GPT-6 Astra的57.9%。

然而,OpenAI的GPT-6 Astra在複雜商業流程自動化平台AutomationBench上表現更優,以41.4%勝過Opus 5.5的40.0%。在自主科學研究的Terminal-Bench-Science測試中,也以64.6%領先Opus 5.5的58.7%。這顯示Anthropic在開發與技術能力上有所領先,而OpenAI則在商業應用與科學研究領域較具優勢。

這波全球市場的價格競爭,主要來自歐洲、美國與中國企業加速開發更高效、更經濟的AI模型。特別是中國模型以其具競爭力的效能與低成本,對美國公司構成壓力,促使其需展現AI的經濟效益。歐盟的《人工智慧法案》(EU AI Act)等國際法規,也要求開發商納入標示機制、零資料保留政策,以及加強防範「蒸餾攻擊」(distillation attacks,一種透過精煉方式竊取模型知識的行為)等保護措施。

當前競爭的核心已轉向運算效率、企業應用中的實用準確性,以及降低資料中心營運成本。API成本降低和更高效的Token使用,是應對電力供應、散熱和加速器(例如GPU)可用性等基礎設施限制的策略。導入Prompt-caching(提示詞快取)技術,更能有效降低伺服器耗電量,並支援營運擴張。這顯示AI公司已體認到,單純的效能已不足以取勝,效率對於AI的持續進步與普及應用同樣關鍵。對於台灣的AI開發者與生物科技從業人員而言,全球AI模型的成本效益與專業領域表現的提升,將提供更易於部署、更精確的工具,有助於加速研究與應用創新。