DeepSeek改寫AI硬體需求推估邏輯:Token暴增不再等於HBM、SSD等比例成長
優分析 Uanalyze

2026年09月16日(優分析/產業數據中心報導)⸺ AI算力需求由訓練逐步轉向推理,已成市場共識。隨著Agent應用擴大,模型呼叫頻率提高、Token消耗量增加,市場過去普遍據此推估GPU、HBM及Enterprise SSD需求將同步受惠。然而,DeepSeek最新模型揭露的硬體效率變化,正讓這套推估邏輯出現新的變數。
DeepSeek於9月10日發布DeepSeek V4.1 Flash,新模型大幅縮減KV Cache容量,與上一代相比,HBM需求降至1/4,SSD需求更降至1/8。
市場評估AI硬體需求時,未來可能不能只看Token成長速度,還必須同步考量「單位推理所需硬體資源」的下降幅度。
換句話說,Token持續暴增的方向並沒有改變,但Token如何轉化為HBM與SSD需求,可能正在改變。
推理需求成長已是共識 市場焦點轉向單位資源消耗
以DeepSeek所處的中國市場為例,中國電信研究院資料預估,2026年中國Token年消耗量將達10億億,到2030年將超過3500億億;未來2至3年中國算力需求平均每年可能成長近10倍,預估2029年推理算力市場占比將達80%。
過去市場對硬體需求的推估方法很直接。Agent應用增加,代表模型呼叫次數會上升,進一步帶動Token與推理工作量的成長,以相同比例去換算,最終會反映至GPU、HBM、SSD及資料中心需求量。
DeepSeek V4.1 Flash卻展示了,模型架構本身也在快速提高硬體使用效率。
KV Cache(快取)是大型語言模型推理過程中保存既有運算結果的重要機制。當上下文愈長、互動輪數增加,尤其Agent需要持續執行多步驟任務時,KV Cache占用的記憶體資源及相關成本也會增加。
在Agent應用中,模型會反覆處理大量上下文,因此KV Cache的儲存與使用會成為整體推理成本的重要部分;如果能把KV Cache壓縮,就能減少記憶體與儲存資源占用,進而降低Agent運行成本。DeepSeek本次將HBM需求降至上一代1/4、SSD降至1/8,顯示模型業者除了提高模型能力,也有辦法從架構端降低推理所需硬體資源,增加同一個硬體的產出效率。
Token需求成長與模型效率提升形成兩股反向力量
這使AI硬體需求開始受到兩股方向不同的力量影響。
一方面,Agent滲透率提高與應用場景增加,將推升Token消耗及推理工作量;另一方面,KV Cache壓縮及模型架構最佳化,則持續降低單位工作量所需要的HBM與SSD資源。
因此,未來HBM與SSD需求增幅,關鍵將不只是Token增加多少,而是Token成長速度能否高於單位硬體需求下降速度。
過去市場比較聚焦於前者,DeepSeek本次揭露的數據,則讓後者的重要性開始浮現。
SSD需求降至1/8 儲存供應鏈值得進一步觀察
其中,DeepSeek對SSD需求的改善幅度尤其值得留意。
特別是Enterprise SSD。市場原先關注長上下文、Agent及大規模推理對儲存容量與資料存取需求的拉動效果,但DeepSeek這次SSD需求降至1/8,顯示軟體及模型架構的改善,可能大幅改變單位推理所需的儲存資源。
後續觀察重點,將是這種效率改善的路徑究竟屬於DeepSeek的特定架構,還是逐漸成為其他大型模型共同採用的技術方向。
※ 本文經「優分析」授權轉載,原文出處:原文連結
※ 免責聲明:文中所提的個股、基金、期貨商品內容僅供參考,並非投資建議,投資人應獨立判斷,審慎評估風險。
- 美股科技產業將迎來黃金十年成長前景?
- 掌握全球財經資訊點我下載APP
延伸閱讀
- OpenAI攜手Anthropic、Google DeepMindAI巨頭罕見合作強化安全機制
- Anthropic首度開放外部人員監督AI訓練!模型開發恐拉長一至兩年,晶片升級需求會受影響嗎?
- AI競賽突然喊停?OpenAI延後上市,三大巨頭同日支持模型減速
- ChatGPT每週活躍用戶突破10億人,Ads上線不到200天年化營收達10億美元
- 講座
- 公告
上一篇
下一篇