商傳媒|葉安庭/綜合外電報導

人工智慧(AI)技術的快速發展,正為企業網路架構帶來前所未有的挑戰。為滿足大型AI模型訓練與推論的需求,企業IT部門必須重新評估現有網路設計,以應對高頻寬、低延遲與複雜流量模式的嚴苛要求。

《Search IT Operations》指出,傳統企業網路主要處理使用者、應用程式與資料庫間的流量,然而AI工作負載徹底改變了網路與運算之間的關係。特別是訓練大型AI模型,需要數百甚至數千個GPU(圖形處理器)協同運作,期間不斷交換梯度、模型參數與中介資料,使得網路效能成為AI運算效率的關鍵。這些AI工作負載並非單一類型,例如模型推論(inference,指模型接收輸入並產生預測或生成內容的過程) 對網路頻寬、延遲與壅塞的敏感度各不相同。

AI工作負載的流量模式主要分為兩類:南北向流量與東西向流量(east-west traffic,指資料在資料中心內部各伺服器、GPU、儲存設備間流動) 。隨著大型AI模型分散式部署,推論也逐漸轉向更頻繁的東西向流量。這種轉變對傳統的三層式階層網路構成壓力,可能在AI同步流量下產生過度訂閱問題,導致效能瓶頸。

為因應此挑戰,AI叢集普遍採用更扁平的葉脊式網路架構(leaf-spine network,透過葉層交換器與脊層交換器組成兩層結構,提供多重路徑與高頻寬) 。這種設計能降低網路層級並提供多重路徑,以減少網路過度訂閱問題並處理同步流量。Google的Virgo網路架構便是扁平雙層、無阻塞拓撲的範例,透過高基數交換器為加速器提供橫向擴展頻寬。

在分散式AI叢集中,網路壅塞導致的封包遺失(packet drops,指資料在傳輸過程中因壅塞等原因未能抵達目的地) 會因需要重傳而造成嚴重延遲,因此「無損網路」(lossless networking)對於緊密連結的AI工作負載至關重要。無損網路的目標並非消除壅塞,而是透過管理緩衝區、壅塞控制與流量控制來防止封包遺失。要有效運作無損網路,企業需要全面監控佇列行為、封包遺失與流量控制事件等指標。

為規劃「AI就緒」的企業網路,IT團隊應從AI工作負載的具體需求著手,確認其通訊要求、資料與模型儲存位置以及擴展需求。容量規劃應考量伺服器連接、流量注入率、儲存傳輸量與上行頻寬,並根據工作負載對網路爭用的容忍度,調整網路過度訂閱(oversubscription)水準以應對突發流量。將網路投資與其支援的運算價值保持一致,確保足夠頻寬、一致的低延遲和高彈性,避免效能下降。