Kwaipilot開源AI編碼代理KAT-Coder-V2.5-Dev 軟體開發效率升級
人工智慧開發商 Kwaipilot 近日推出開源的 KAT-Coder-V2.5-Dev 模型,這款混合專家(MoE)AI 編碼代理專為自動化軟體工程任務設計,在多項基準測試中展現出領先的程式開發能力,可望提升軟體開發流程的效率。
KAT-Coder-V2.5-Dev 是一款總參數達 350 億的純文字模型,每次處理 Token 時會激活 30 億個參數。它基於 Qwen3.6-35B-A3B 模型,經過 12.7 萬個範例的監督式微調(SFT)後,再進行了 10 個訓練週期的強化學習(RL)。作為一個代理工具,它能在模擬沙盒環境中執行指令、讀取程式庫檔案,並根據測試回饋迭代地解決任務,這對於需要多次工具互動和錯誤恢復的任務尤其有效。此模型採用 Apache授權條款2.0版發布,允許商業使用。
性能卓越:多項基準測試領先
KAT-Coder-V2.5-Dev 在多項軟體工程基準測試中表現突出。它在 SWE-bench Verified 基準測試中達到 69.40% 的成績,成為同級開源模型中的最佳表現者。相較於其基礎模型 Qwen3.5-35B-A3B 的 58.60%,提升了近 11 個百分點。在 SWE-bench Multilingual 測試中,該模型取得 63.00% 的分數,顯示其支援多種程式語言的能力。此外,它在 Terminal-Bench 2.1 測試中獲得 41.02% 的成績,證明其在命令列工具協調和終端互動方面的專業度;在 PinchBench 測試中則高達 93.43%,凸顯其強大的工具使用基礎。而針對特定領域問題解決的 Scicode 基準測試,它也獲得 44.20% 的成果。
挑戰與潛在限制
儘管性能亮眼,KAT-Coder-V2.5-Dev 仍面臨一些挑戰。該模型的開源版本僅限於語言模型權重,不包含視覺或多模態組件,因此無法分析螢幕截圖或視覺文件。部署此模型需要較高的硬體要求,標準配置需要 8 顆 GPU 進行張量平行(tensor parallelism)部署,目前沒有單顆 GPU 的推理選項或量化版本。此外,該模型也偶爾會生成不存在的「幻覺函式」(hallucinated functions)呼叫,且在訓練過程中若無精確的獎勵機制,可能導致模型崩潰。截至目前,其下載量僅 396 次,顯示實際應用和產品化經驗尚有限。