芯片與算力 : Arista的AI Ethernet故事 InfiniBand之外的第二路線

分享

Arista的AI Ethernet故事:InfiniBand之外的第二路線

 

人工智能競賽最受注目的通常是GPU,但當數千甚至數十萬枚加速器連接成一個運算集群,網絡便不再只是傳送數據的配角,而是決定整個系統效率的關鍵。若網絡出現堵塞、延遲或丟包,昂貴的GPU只能等待數據,投資數十億美元建立的算力中心亦難以充分發揮效能。這正是Arista Networks試圖抓住的機會:以高速Ethernet建立AI後端網絡,為Nvidia主導的InfiniBand提供第二條路線。

 

InfiniBand長期是高性能運算及大型AI訓練集群的首選。它具備低延遲、無損傳輸、適應性路由及網絡內運算能力,配合Nvidia的GPU、ConnectX網卡和Quantum交換器,可以形成高度整合的端到端系統。Nvidia最新Quantum-X800平台提供每端口800 Gbps連接,並以SHARP技術在網絡內處理部分集合通訊,優勢不只是速度,更在於硬件、軟件與運算工作負載可共同設計。

 

然而,這種一體化模式也意味企業更依賴單一供應商。大型雲端服務商本來已使用Ethernet管理前端、儲存及數據中心網絡,若AI集群另建InfiniBand架構,便需要兩套設備、技術團隊和管理工具。隨着集群規模擴大,供應鏈選擇、設備成本及營運一致性的重要性逐漸上升,Ethernet遂由「性能較低但便宜」的方案,轉變為大型客戶主動推動的開放標準。

 

Ethernet能否把開放優勢變成可預測性能

 

Arista的核心賣點並非重新發明Ethernet,而是把其改造成適合AI工作負載的網絡。傳統數據中心流量較分散,AI訓練卻會在短時間內出現少量但極龐大的同步數據流,容易產生流量碰撞、尾部延遲及局部堵塞。Arista透過Etherlink平台、EOS網絡操作系統、RDMA負載平衡、ECN與PFC擁塞管理,以及CloudVision監察工具,希望讓網絡能夠按AI任務觀察流量、辨識瓶頸及調整路徑。

 

其Cluster Load Balancing技術會根據RDMA佇列配置數據流,平衡葉節點與骨幹交換器之間的使用率;AI Analyzer則以高頻率監察封包丟失、緩衝區、網卡錯誤及任務完成時間。Etherlink現時涵蓋400G及800G平台,可支援由小型集群至十萬枚以上加速器的部署。公司亦已公布1.6T平台,把Ethernet由跨機架的「scale-out」網絡,進一步推向機架內的「scale-up」連接。

 

Ethernet路線的另一推動力來自Ultra Ethernet Consortium。該聯盟的1.0規格涵蓋網卡、交換器、光學元件、線纜及傳輸協議,目標是在保留Ethernet互通性的同時,改善RDMA、頻寬、延遲、擁塞控制及大規模部署能力。若標準成熟,客戶便可混合使用不同供應商產品,避免被單一系統鎖定,亦有利Broadcom、Arista、AMD及其他網絡設備商形成更完整的生態。

 

不過,開放並不等於簡單。InfiniBand的優勢在於整套系統已有成熟的調校方式,Ethernet則需要交換器、網卡、光模組、佈線及擁塞控制精密配合。配置稍有偏差,便可能出現尾部延遲上升,拖慢整個訓練任務。大型雲端企業具備足夠工程人才,可自行優化網絡並透過規模降低成本;一般企業若只希望快速部署Nvidia GPU集群,採用預先整合的InfiniBand方案可能仍較穩妥。因此,Ethernet的總成本優勢必須把工程、測試及故障排查成本一併計算,不能只比較交換器價格。

 

Arista的業績已反映市場對高速網絡的強勁需求。公司2025年收入達90億美元,2026年首季再按年增長35.1%至27.09億美元。不過,這並不代表Ethernet已全面擊敗InfiniBand,因為Arista收入仍包括傳統雲端、數據中心、園區及路由業務,而AI訂單亦高度依賴少數超大型客戶的資本開支周期。

 

更值得注意的是,Nvidia自己也在發展Spectrum-X Ethernet。這反映真正的競爭未必是InfiniBand與Ethernet二選一,而是誰能控制AI網絡的軟硬件價值。未來最前沿、要求極致性能的訓練集群仍可能偏向InfiniBand;追求多供應商、營運統一及成本彈性的雲端平台,則會加快採用Ethernet。Arista的機會不是消滅InfiniBand,而是證明開放網絡也能提供接近專用架構的可預測性能。一旦做到這點,AI基礎設施便不再只有Nvidia一條道路。

 

義合控股投資者關係部  

(芯片與算力系列之83)

分享