AI晶片的「去Nvidia化」:夢想、現實與成本曲線
生成式人工智能熱潮把Nvidia推上算力王座,也令全球科技企業產生同一焦慮:當最重要的生產工具由單一供應商掌握,晶片價格、交付周期和議價權便難以控制。因此,Google擴大TPU部署,亞馬遜推進Trainium,微軟、Meta等亦投資自研晶片;AMD則以Instinct系列正面挑戰。市場遂出現「去Nvidia化」想像,彷彿只要推出另一款加速器,便能打破其壟斷。
現實卻複雜得多。Nvidia的護城河從來不只是一塊GPU,而是由CUDA軟件、開發工具、模型函式庫、高速互連、伺服器架構及工程人才組成的完整系統。企業購買的不是晶片規格,而是把模型快速訓練、部署及持續升級的能力。若轉用其他平台,即使晶片單價較低,也可能要重寫程式、重新測試模型、培訓團隊,甚至調整數據中心網絡。算力便宜了,上市時間卻延後半年,對AI競賽中的企業而言,代價可能更高。
真正競爭不在晶片價格,而在每個Token成本
替代者並非沒有機會。AMD的MI300X配備192 GB HBM3記憶體,較適合大型模型推理及記憶體密集型工作;Google第六代TPU Trillium的單晶片峰值運算能力較TPU v5e提高4.7倍,能源效率提升超過67%;AWS亦以Trainium2配合Neuron軟件,支援PyTorch、vLLM及大型開源模型,盡量降低遷移門檻。
但晶片比較不能只看峰值算力。真正決定成本的是每個Token的綜合成本,包括晶片購入或租用價格、記憶體容量、互連效率、電力、散熱、集群利用率,以及軟件工程投入。某款晶片理論性能再高,若模型只能發揮六成效能,或者調試時間較長,其實際成本未必較低。這亦解釋了為何雲端巨頭有能力自研ASIC,中小型企業卻多數繼續使用Nvidia:前者每天處理數以萬億計Token,可用龐大固定工作量攤薄設計和軟件成本;後者工作量不足,採用成熟平台反而更划算。
「去Nvidia化」首先會在推理市場發生,而不是最前沿模型訓練。訓練工作負載變化快,需要高度靈活的通用運算能力,Nvidia在軟硬件協同、集群規模及故障管理方面仍佔優勢。推理則相對標準化,模型一旦定型,企業可以透過量化、剪枝及專用晶片降低成本。因此,搜尋、推薦、廣告及固定模型服務,最適合轉移至TPU、Trainium或自研ASIC;探索性研發及大型模型訓練,則仍可能留在Nvidia平台。
中國市場的「去Nvidia化」還多了一層供應鏈安全考慮。國產AI晶片不僅要追趕運算性能,更要建立編譯器、算子庫、互連、伺服器和開發者社群。政策和出口管制可以創造替代需求,卻不能自動消除軟件差距。若企業為滿足自主可控而同時維護兩套甚至三套技術棧,短期成本反而可能上升。國產替代的成功標準,不應只是晶片能否點亮,而是能否長期穩定運行主流模型,並把遷移及維護成本降至可接受水平。
因此,未來並非「Nvidia被取代」,而是AI算力市場逐漸分層:最前沿訓練由Nvidia繼續主導,大型雲端平台以自研晶片承接固定工作負載,AMD爭取需要通用GPU但希望降低供應商依賴的客戶,國產晶片則在特定市場及政策環境中擴張。Nvidia的市場份額或會下降,但AI算力總需求仍在增長,其收入未必因此收縮。
所謂「去Nvidia化」,更準確的說法應是「降低Nvidia的邊際依賴」。夢想是擺脫單一供應商,現實是軟件生態難以繞過,而最終勝負則取決於成本曲線。當替代平台能在不犧牲模型性能和開發速度的前提下,持續降低每個Token的成本,去Nvidia化才會從企業口號變成真正的產業趨勢。
義合控股投資者關係部
(芯片與算力系列之82)











