商傳媒|責任編輯/綜合外電報導

對於有意在個人電腦上運行本地 AI 模型(local AI model)的使用者與開發者而言,選擇合適的模型規格至關重要。資深作者諾倫·瓊格爾(Nolen Jonker)指出,判斷本地 AI 模型效能的關鍵指標,除了常見的「每秒處理 Token 數量」(tokens per second)外,至少還有四項更值得關注的數字,且每秒處理 Token 數量的重要性甚至排在這些指標之後。

諾倫·瓊格爾強調,許多使用者可能過度關注每秒處理 Token 數量,這項指標衡量的是 AI 模型每秒能生成或處理多少個「Token」(AI 模型處理資訊的最小單位,可以是一個字、詞或字元的一部分)。然而,實際的執行體驗深受其他因素影響,若選擇不當,可能導致效能不如預期。

首先是「KV Cache」的記憶體成本。KV Cache(Key-Value Cache,鍵值快取)是 AI 模型處理對話時所使用的暫存記憶體,其大小與上下文長度成正比。當 KV Cache 超過可用的顯示記憶體(VRAM)時,就會發生 VRAM 溢出(VRAM spillover),導致模型生成速度顯著下降。例如,作者自身使用的 GeForce RTX 4070 Ti Super 顯示卡擁有 16GB VRAM,若要有效利用,就需仔細管理 KV Cache。透過「量化」(Quantization)技術(將模型權重從高精度壓縮到低精度以減少檔案大小及運算需求),例如從 Q4 降至 Q8,可使 KV Cache 的成本大致減半。

其次是模型的「量化等級」與「有效參數」。量化等級如 Q4_K_M、Q4_0 和 IQ4_XS 雖然都屬於 4 位元量化,但在每個權重的位元數、困惑度損失(perplexity loss)以及檔案大小上有所差異。從 Q4 提升到 Q8 量化,會使相同權重的 VRAM 消耗加倍。此外,模型名稱中的「E」代表「有效參數」(effective parameters),而非實際參數總數。例如,Gemma 4 E4B 約有 45 億個有效參數,但其包含每層嵌入(per-layer embeddings)後總參數約達 80 億。而專家混合模型(Mixture-of-Experts, MoE),這是一種由多個小型「專家」子模型組成的 AI 模型架構,處理輸入時只會啟動部分專家模型,這讓其在總體權重較大的情況下,仍能實現更快的生成速度。一個 Q4 量化的 30B 級 MoE 模型,在不計入 KV Cache 前,可能就需要 16 到 18 GB 的 VRAM。MoE 模型通常也比傳統的密集模型更能承受 CPU 卸載(CPU offloading)。

最後一項重要指標是模型的「上下文長度」(Context Length)。即便模型文件宣稱支援某個較長的上下文長度(例如 128K),這不代表它在預訓練時就有效利用了這麼長的上下文。模型可能只是透過後續調整(如擴展旋轉位置嵌入或使用 YaRN 等方法)來達到標示的長度。當模型被推向其原生訓練範圍以外的上下文長度時,效能可能會悄無聲息地下降,且難以被使用者察覺錯誤。因此,如果模型在較短的上下文長度下表現不穩定,那麼追求較大的 KV Cache 也沒有意義。諾倫·瓊格爾認為,新使用者花五分鐘檢查這些數值,將有助於避免資源浪費。