Hyperscaler自研晶片降低Nvidia依賴?

分享

Hyperscaler自研晶片降低Nvidia依賴?

 

生成式人工智能的競賽,表面上是模型之爭,背後其實也是算力成本與供應鏈控制權之爭。當Nvidia憑藉GPU、CUDA軟件生態及高速互連技術,掌握AI基建的重要話語權,Amazon、Google、Microsoft及Meta等Hyperscaler紛紛加快自研晶片步伐。市場自然追問:雲端巨頭是否正在削弱Nvidia的護城河,還是為自己的數據中心增加另一層昂貴而複雜的系統?

 

Google是最早投入專用AI加速器的雲端企業之一,其TPU已發展至第七代Ironwood。Google表示,Ironwood既可支援大型模型訓練及強化學習,也針對高流量推理而設,單顆晶片的訓練及推理效能較上一代Trillium提升逾四倍,並可把9,216顆晶片組成Superpod。更重要的是,TPU不只服務Gemini,也獲Anthropic等外部客戶採用,反映自研晶片正由內部成本工具轉向雲端商業產品。

 

Amazon的方向同樣清晰。Trainium系列與AWS雲端、網絡及機器學習服務深度整合,第三代Trainium3採用3納米製程,每套UltraServer最多配置144顆晶片。AWS宣稱,其運算效能及能源效率較Trainium2顯著提高,部分客戶使用Trainium可把訓練或推理成本降低最多約五成;然而,AWS仍同步提供Nvidia Blackwell系統,顯示自研晶片並非全面取代GPU,而是建立第二個算力來源。

 

真正競爭的是整套系統,而非單一晶片

 

Hyperscaler自研晶片首先解決的是經濟問題。雲端企業每年投入數以百億美元計的資本開支,若能把推薦、廣告排序、內容審核及大模型推理等高頻而相對固定的工作,轉移至成本較低、能耗較佳的專用晶片,即使每個運算單位只節省一小部分開支,放大至全球數據中心後也足以產生龐大效益。自研能力亦增加採購議價權,避免算力供應完全受制於單一廠商的產能、定價與產品周期。

 

Microsoft於2026年推出專門處理推理的Maia 200,採用3納米製程,配備216GB HBM3e,並以標準以太網絡建立大規模互連。公司稱其每美元效能較現有硬件提高約三成,計劃用於Microsoft 365 Copilot、Azure AI服務及OpenAI模型。這說明自研晶片的首要目標並非贏取跑分,而是降低每個生成token的成本;當AI應用由訓練走向每天數十億次推理,單位成本比峰值性能更直接影響毛利率。

 

但晶片多元化也會帶來新的代價。不同加速器擁有不同編譯器、運算核心、記憶體架構及網絡拓撲,同一模型要在GPU、TPU、Trainium或Maia之間遷移,往往需要重寫核心程式、重新調校精度及驗證模型輸出。硬件型號愈多,工作負載調度、備件管理、散熱設計與工程人才培訓便愈複雜,甚至可能出現某類晶片供不應求,另一類晶片卻因軟件未成熟而閒置的情況。Meta也公開承認,每年管理五至六種硬件規格會增加調度難度,並可能造成設備使用率不足。

 

因此,Nvidia真正的護城河不只是晶片性能,而是CUDA、開發工具、互連網絡和大量工程人才共同形成的完整生態。GPU具備較強通用性,特別適合架構仍在快速變化的前沿模型訓練;自研ASIC則更適合規模龐大、重複度高及需求可以預測的工作。若模型演進方向突然改變,過度專用的晶片可能在折舊期尚未結束前便失去效率優勢。

 

從投資角度看,Hyperscaler自研晶片不宜被理解為「Nvidia終結者」,而應視為算力市場由單一GPU主導,轉向異質運算的開始。未來較可能出現的格局,是Nvidia繼續掌握高端訓練及通用運算,自研晶片承接內部推理、推薦和特定模型,AMD及其他供應商則補充第二來源。雲端巨頭確實能降低對Nvidia的邊際依賴,但同時必須承擔更高的研發、軟件適配和數據中心管理成本。最後勝出的未必是擁有最快晶片的企業,而是能夠把晶片、模型、網絡、能源與軟件調度整合得最有效率的平台。

 

義合控股投資者關係部  

(芯片與算力系列之95)

 

分享