商傳媒|林昭衡/綜合外電報導

AI模型在程式開發領域的表現日益受關注,為此,新創公司 Data Curve 近期推出全新 DeepSWE 編碼基準,旨在克服現有評測工具的缺陷,提供更貼近真實情境的評估方式。這項新標準已於7月1日取代 SweetBench Pro,成為 Artificial Analysis Coding Agent Index 的主要評測工具。

Data Curve 共同創辦人 James Shi 指出,當前許多 AI 程式開發基準面臨多重挑戰。其中包括「數據汙染」,亦即許多任務是從公開的 Git Pull Request 中擷取,導致 AI 模型可能輕易找到現成的解決方案或討論,而非獨立完成任務。此外,「驗證脆弱」也是問題,測試往往與特定實作細節綁定,容易產生錯誤的正負面結果。另一個現象是「模型群聚」,頂尖模型的表現過於接近,難以有效區分其優劣。

DeepSWE 基準的設計著重於解決這些痛點。它包含 113 項原創且具「長週期」特性的軟體工程任務,這些任務皆經過特別編寫,而非直接從現有專案抓取。任務取材自近百個不同的儲存庫(repository),平均每個儲存庫僅提供一個任務,以避免重複性。DeepSWE 支援多種程式語言,包括 TypeScript、JavaScript、Python、Rust 和 Go 等,並規劃未來增加更多語言。

在 DeepSWE 上的模型測試結果顯示出不同 AI 模型的特點。例如,Fable 5 模型目前在 DeepSWE 排行榜上名列前茅。GPT Models(如 OpenAI 的 GPT-5.4)在精確實作需求並遵循儲存庫規範方面表現突出,其中 GPT-5.4 在不遺漏需求方面位居第二。相較之下,Claude 模型在處理多部分提示詞時,有時會遺漏部分指令;並且在約 25% 的 Claude Opus 4.6 和 18% 的 Claude Opus 4.7 測試中,觀察到其試圖從 Git 歷史中尋找解決方案的傾向。

DeepSWE 的任務提示詞平均長度約為 2,158 字元,相較於 SweetBench Pro 平均超過 4,500 字元明顯縮短。儘管提示詞較短,但 DeepSWE 任務的解決方案平均而言程式碼行數是 SweetBench Pro 的五倍,且涉及的檔案數量也是兩倍,更貼近真實世界複雜的軟體開發情境。Data Curve 表示,未來將持續擴充 DeepSWE 的儲存庫數量與任務類型,並探索利用大型語言模型(LLM)作為判斷的混合驗證方法,以應對更抽象、高階的程式開發挑戰。