• 【超完整懶人包】認識比特幣!原理與應用全面解析|動區新手村
  • BlockTempo Beginner – 動區新手村
  • 不只加密貨幣,談談那些你不知道的區塊鏈應用|動區新手村
  • 動區動趨 BlockTempo – 最有影響力的區塊鏈新聞媒體 (比特幣, 加密貨幣)
  • 所有文章
  • 最完整的「區塊鏈入門懶人包」|動區新手村
  • 服務條款 (Terms of Use)
  • 關於 BlockTempo
  • 隱私政策政策頁面 / Privacy Policy
動區動趨-最具影響力的區塊鏈新聞媒體
  • 所有文章
  • 搶先看
  • 🔥動區專題
  • 🔥Tempo 30 Award
  • 加密貨幣市場
    • 市場分析
    • 交易所
    • 投資分析
    • 創投
    • RootData
    • 比特幣 BTC 即時價格
    • 以太幣 ETH 即時價格
    • Solana SOL 即時價格
    • 瑞波幣 XRP 即時價格
    • Pi Network PI 即時價格
  • 區塊鏈商業應用
    • 金融市場
    • 銀行
    • 錢包
    • 支付
    • defi
    • 區塊鏈平台
    • 挖礦
    • 供應鏈
    • 遊戲
    • dApps
  • 技術
    • 比特幣
    • 以太坊
    • 分散式帳本技術
    • 其他幣別
    • 數據報告
      • 私人機構報告
      • 評級報告
  • 法規
    • 央行
    • 管制
    • 犯罪
    • 稅務
  • 區塊鏈新手教學
  • 人物專訪
    • 獨立觀點
  • 懶人包
    • 比特幣概念入門
    • 從零開始認識區塊鏈
    • 區塊鏈應用
No Result
View All Result
  • 所有文章
  • 搶先看
  • 🔥動區專題
  • 🔥Tempo 30 Award
  • 加密貨幣市場
    • 市場分析
    • 交易所
    • 投資分析
    • 創投
    • RootData
    • 比特幣 BTC 即時價格
    • 以太幣 ETH 即時價格
    • Solana SOL 即時價格
    • 瑞波幣 XRP 即時價格
    • Pi Network PI 即時價格
  • 區塊鏈商業應用
    • 金融市場
    • 銀行
    • 錢包
    • 支付
    • defi
    • 區塊鏈平台
    • 挖礦
    • 供應鏈
    • 遊戲
    • dApps
  • 技術
    • 比特幣
    • 以太坊
    • 分散式帳本技術
    • 其他幣別
    • 數據報告
      • 私人機構報告
      • 評級報告
  • 法規
    • 央行
    • 管制
    • 犯罪
    • 稅務
  • 區塊鏈新手教學
  • 人物專訪
    • 獨立觀點
  • 懶人包
    • 比特幣概念入門
    • 從零開始認識區塊鏈
    • 區塊鏈應用
No Result
View All Result
動區動趨-最具影響力的區塊鏈新聞媒體
No Result
View All Result
Home 區塊鏈商業應用 AI

AI 記憶體荒為何反讓輝達減配?大摩:瓶頸將把資料掃向 NAND 與互連晶片

Block Beats by Block Beats
2026-10-08 15:56
in AI
A A
36
SHARES
分享至Facebook分享至Twitter

摩根士丹利最新研報指出,AI 記憶體短缺恐貫穿整個週期,但輝達不會坐等擴產——傳將為 Rubin 平台推出降規版,HBM4 從 288GB 砍到 192GB、LPDDR5 從 54TB 砍到 28TB。需求並未消失,而是向 NAND、DRAM 與高速互連轉移,CXL 市場 2030 年上看 60 億美元。
(前情提要:高盛喊價鎧俠!目標價拉到 11.6 萬日圓、買進評級:AI 造成 NAND 缺貨到 2028 年)
(背景補充:長江儲存擴產近 25% 喊話 2027 稱霸 NAND,傳 Q4 掛牌 IPO 籌彈藥)

本文目錄

Toggle
  • 輝達 Rubin 竟然「減配」:HBM4 砍至 192GB
  • 需求沒消失:資料被掃向 NAND 與互連晶片
  • Prefill 與 Decode 拆開:推理架構大重組
  • CXL 十年後 60 億美元新戰場
  • 大摩按讚美光、閃迪:真正的風險在資料中心

 

當所有人都在追 GPU 數量時,摩根士丹利半導體分析師 Joseph Moore 在最新報告中丟擲一個反直覺警告:AI 競賽真正的瓶頸已轉向記憶體,而輝達的解法竟是「減配」。報告揭露,Rubin 平台的 HBM4 配置可能從 288GB 下修至 192GB、機架級 LPDDR5 從 54TB 砍半至 28TB——這不是需求見頂的訊號,而是供應緊張迫使整個 AI 產業重新設計系統架構的開端。

TL;DR:

AI 記憶體短缺可能貫穿整個週期。摩根士丹利認為,模型規模、上下文長度和推理併發量持續增長,將不斷吸收新增儲存供應。

輝達開始為 Rubin 提供「減配」方案。部分 HBM 和 LPDDR5 容量可能下調,但需求並未消失,而是向 NAND、DRAM 和高速互連轉移。

AI 推理架構正在重構。Prefill 與 Decode 分離,有望提高硬體利用率,為 Cerebras、輝達 Groq 等技術方案創造機會。

CXL 有望成為新的增長點。摩根士丹利預計,2030 年相關半導體市場規模約達 60 億美元,Astera Labs 和 Marvell 是潛在受益者。

儲存股的關鍵是週期持續時間,而非短期漲價幅度。摩根士丹利維持增持美光和閃迪,主要風險在於 AI 投資及資料中心建設放緩。

以下為原文編譯:

AI 基礎建設正面臨一個愈來愈棘手的問題:算力能靠加購 GPU 快速擴充,記憶體供應卻無法同步跟上。

摩根士丹利認為,未來一段時間內,AI 需求仍將持續吸納大量新增的記憶體供給。即使不同時期的緊缺程度有所波動,DRAM 產能擴張仍難以迅速消除供需缺口。

摩根士丹利與多家運算業者訪談後發現,如何繞過記憶體瓶頸已成為越來越重要的話題。輝達 CEO 黃仁勳也談到了透過計算、網路和儲存系統的協同設計緩解供應限制的必要性。

分析師認為,這不是對儲存需求轉弱的預警,而是整個 AI 產業不得不面對的現實:當記憶體無法按原計劃供應時,企業必須找到新的系統架構,讓現有硬體繼續支援 AI 增長。

最直覺的應變,就是下修單一伺服器或單顆 GPU 內建記憶體規格。

輝達 Rubin 竟然「減配」:HBM4 砍至 192GB

摩根士丹利指出,DRAM 和 NAND 供應緊張及價格上漲,正在迫使 AI 產業鏈重新考慮產品配置。對於晶片廠商而言,與其堅持原有規格、導致系統無法按計劃交付,不如提供不同記憶體容量的版本,讓客戶根據實際需求選擇。

研報預計,輝達可能為 Rubin 平台提供多種較低記憶體配置。

在機架級記憶體方面,Rubin 原先規劃的 LPDDR5 容量約為 54TB,而部分新配置可能降至 28TB,對應 SOCAMM2 記憶體模組容量從 192GB 降至 96GB。

在 HBM 方面,Rubin 單 GPU 原先預計配備 288GB HBM4,採用 8 組 12 層堆疊設計;摩根士丹利預計,輝達可能增加配備 192GB HBM4 的產品版本,將堆疊層數降至 8 層。

對於 Rubin Ultra,研報認為,在調整為雙計算芯粒方案後,512GB 是更合適的比較基準,未來可能出現約 192GB 至 384GB 的不同容量選擇。

這些均屬於摩根士丹利截至研報發布日對產品配置的判斷,並非所有規格都已得到輝達正式確認。

若從成本面檢視,這套策略相當合理。降低 HBM 堆疊層數可以減少容量,而在介面數量和引腳速率等條件不變時,理論頻寬不一定同步下降。

但容量和頻寬解決的是兩個不同問題。對於模型較小、上下文較短的應用,降低容量可能影響有限;但當模型越來越大、推理任務越來越複雜時,記憶體容量不足仍可能導致更多資料需要在不同儲存層級之間轉移,增加延遲或 GPU 使用量。

更重要的是,減少 HBM 並不會讓 AI 原本需要處理的資料消失,只會讓這些資料尋找新的存放位置。

例如,當 GPU 的 HBM 容量不足時,部分資料可能需要儲存在主記憶體中;當機架級 LPDDR5 容量降低時,部分 KV Cache(鍵值快取)需求又可能轉向 NAND 快閃記憶體。

KV Cache 是大模型推理過程中用於儲存歷史計算資訊的快取。隨著上下文變長、同時執行的請求增加,其容量需求也隨之上升。

記憶體需求並未消失,只是轉往其他層級。

摩根士丹利指出,輝達降低部分 LPDDR5 配置的同時,產業鏈已經觀察到來自 NAND 的新增需求。HBM 容量減少還可能增加 GPU 間的資料傳輸,使高速互連網路承擔更大壓力。

需求沒消失:資料被掃向 NAND 與互連晶片

這意味著,輝達的減配策略可能暫時緩解 DRAM 供應約束,卻同時增加對 NAND、互連晶片以及更大規模 GPU 叢集的需求。

這股壓力轉移背後有長遠結構因素。

根據研報引用的 Epoch AI 歷史資料,大語言模型時代的前沿模型引數規模曾呈現約每六個月翻倍的增長趨勢。上下文視窗也經歷了快速擴張。同時,更多 AI 應用從簡單問答轉向程式設計、複雜推理和長時間執行的 Agent 任務,進一步推高記憶體使用量。

摩根士丹利認為,模型規模、上下文長度和推理併發量將繼續推動儲存需求增長。因此,降低部分產品配置更可能是供應緊張時期的過渡方案,而不是 AI 記憶體需求長期下降的訊號。

如果說減少記憶體配置是短期應對措施,那麼改變 AI 推理的計算方式,則可能帶來更深層次的產業變化。

摩根士丹利關注的第二條路徑是 Disaggregated Inference(解耦式推理),即將原本集中在同一套計算系統中的不同推理任務拆開,分別交給更適合的硬體執行。

傳統大模型推理主要包含兩個階段。

第一個階段是 Prefill(預填充),即處理使用者輸入的提示詞、檔案或歷史上下文,並進行大量平行計算。這一階段通常更依賴計算效能。

第二個階段是 Decode(解碼),即模型逐個生成輸出 Token。這個過程需要反覆訪問模型權重和 KV Cache,因此更加依賴記憶體頻寬、容量及資料訪問延遲。

過去,同一套 GPU 往往同時承擔這兩類任務。但隨著推理需求擴大,這種配置未必總是最有效率的選擇。

摩根士丹利認為,更合理的方向可能是讓計算密集型硬體負責 Prefill,再由針對低延遲和高頻寬最佳化的架構承擔 Decode。

這種方式不僅能夠提高硬體利用率,還可以讓資料中心分別擴張兩種計算資源,而不必為所有任務配置完全相同的 GPU 和 HBM。

Prefill 與 Decode 的技術區別

Prefill 與 Decode 拆開:推理架構大重組

其中最直接的潛在受益者之一是 Cerebras。

Cerebras 採用晶圓級處理器架構,將大量計算單元和 SRAM 整合在同一塊晶片上。SRAM(靜態隨機存取儲存器)容量密度通常低於 DRAM,但具備低延遲、高頻寬的特點,適合某些需要頻繁讀取資料的推理任務。

透過讓計算單元更靠近資料,Cerebras 能夠減少外部記憶體訪問需求,提高特定推理環節的處理速度。

摩根士丹利指出,Cerebras 已與 AMD、AWS 展開合作,探索將不同處理器組合成統一的推理系統。

在 AMD 與 Cerebras 的聯合方案中,AMD Helios 負責更偏計算密集型的 Prefill 和大上下文處理,Cerebras 晶圓級引擎則負責 Decode。研報預計,該方案將在 2026 年第四季度進入生產階段。

AWS 採用類似思路,透過 Trainium 處理 Prefill,再由 Cerebras 處理 Decode,相關組合方案預計於 2027 年第一季度進入 Amazon Bedrock。

根據 Cerebras 和 AMD 披露的特定方案效能資料,兩者結合有望在維持 Cerebras 推理速度的同時,實現最高約五倍的吞吐量提升。這並不意味著所有推理任務都能獲得同等提升,但說明針對不同任務配置硬體,可能顯著改善系統經濟性。

對 Cerebras 而言,這種變化不僅意味著更多晶片銷售機會。由於公司還經營自己的推理雲服務,如果相同硬體能夠生成更多 Token,單位 Token 成本就可能下降,從而改善毛利率,或為降低客戶價格提供空間。

輝達也在探索類似方向。

透過整合 Groq 相關技術,輝達正在將基於 HBM 的 GPU 與採用高速 SRAM 的 LPU 架構相結合。研報描述的方案中,Rubin GPU 負責 Prefill 及部分需要大容量快取的解碼計算,而 Groq 架構承擔更適合其低延遲特性的運算,由 NVIDIA Dynamo 軟體協調不同處理器之間的任務。

值得區分的是,輝達與 Groq 在 2025 年達成的是技術授權及人才引進安排,並非對 Groq 公司的完整收購。

摩根士丹利認為,隨著推理開支增長速度超過訓練,針對不同推理環節最佳化的異構計算架構可能獲得更大市場空間。按照研報的基礎設施支出預測,到 2030 年,推理預計佔 AI 基礎設施支出的約 56%,訓練佔比約為 44%。

這也為 AI 晶片產業帶來新的競爭邏輯:未來衡量一套 AI 系統競爭力的指標,可能不僅是峰值算力,還包括每秒生成多少 Token,以及生成每個 Token 需要多少成本。

CXL 十年後 60 億美元新戰場

除了改變推理任務的分配方式,摩根士丹利還重點關注如何提高現有記憶體資源的使用效率。這正是 CXL 技術的機會所在。

CXL(Compute Express Link,計算快速互連)是一種高速互連協議,能夠讓處理器更靈活地訪問外部記憶體,而不必始終依賴直接連線在本地的 DRAM。

傳統伺服器中,記憶體資源往往與特定 CPU 繫結。即使一臺伺服器有大量閒置記憶體,也很難直接供另一臺伺服器使用。CXL 則透過記憶體擴充套件、共享和池化,提高資料中心對 DRAM 的整體利用率。其中,記憶體擴充套件可以為單個處理器提供額外容量;記憶體共享允許多個處理器訪問相同的記憶體資源;記憶體池化則將分散的記憶體組織成統一資源池,根據工作負載動態分配。

這種技術過去更多應用於傳統 CPU 計算環境,因為 CPU 工作負載相對更容易接受外部記憶體帶來的額外訪問延遲。相比之下,AI GPU 長期依賴 HBM 提供極高的資料頻寬,CXL 連線的外部 DRAM 難以直接替代 HBM。

但隨著 AI 推理需求變化,這種架構的價值正在上升。

例如,長上下文推理需要儲存大量 KV Cache,但並不是所有快取資料都必須始終留在最快的 HBM 中。系統可以將效能敏感的資料保留在 HBM,把部分訪問頻率較低、對延遲要求相對寬鬆的資料轉移到外部 DRAM。

這樣既可以緩解昂貴 HBM 的容量壓力,也可以提高已有 DRAM 的利用效率。

摩根士丹利認為,AI 正在推動 CXL 從傳統伺服器記憶體擴充套件走向更廣泛的加速器記憶體連線與共享市場。

過去,Astera Labs 曾將 CXL 記憶體控制器的潛在市場規模估計在 40 億美元以上。摩根士丹利目前預計,隨著 AI 推理、KV Cache 解除安裝和機架級記憶體池化需求增長,到 2030 年,CXL 及相關記憶體連線半導體的潛在市場規模有望達到約 60 億美元。

需要強調的是,這一數字屬於分析師對潛在市場空間的預測,並非已經實現的市場收入。

在具體公司方面,研報重點關注 Astera Labs(ALAB)和 Marvell(MRVL)。

Astera Labs 的機會主要來自 Leo 記憶體控制器產品。摩根士丹利指出,公司預計標準化和定製化 Leo 產品將在 2027 年於兩家美國大型雲服務商客戶中開始規模放量,其中包括面向 AI 推理的 KV Cache 解除安裝設計。

Marvell 則透過 Structera X 和 Structera S,分別布局記憶體擴充套件與機架級記憶體池化。公司此前預計,CXL 業務有望在 2028 年左右貢獻超過 10 億美元的收入。

大摩按讚美光、閃迪:真正的風險在資料中心

對於這兩家公司而言,AI 儲存短缺可能使原本推廣較慢的 CXL 技術獲得新的商業需求。

不過,摩根士丹利也承認,CXL 市場的實際規模仍難以精確預測。不同雲廠商可能選擇非 CXL 互連技術、更大容量 HBM,或者基於快閃記憶體的快取方案,最終市場採用速度可能與當前預期存在明顯差異。

因此,CXL 的投資邏輯能否兌現,仍需要觀察雲廠商實際部署進度、產品出貨量及相關業務收入。

對於儲存產業鏈而言,輝達降低部分記憶體配置似乎並不是好訊息。如果單個 GPU 的 HBM 容量下降,單機架 LPDDR5 用量減少,儲存廠商能夠出售的記憶體數量就可能低於原先規劃。

摩根士丹利承認,從短期利潤最大化的角度看,這確實可能削弱儲存廠商原本能夠獲得的部分需求和定價機會。但分析師認為,這不應簡單理解為儲存週期即將結束。關鍵在於,當前的減配主要是受供應約束推動,而不是因為客戶不再需要那麼多記憶體。

當 AI 廠商希望採購更多 DRAM,卻無法獲得足夠供應時,降低配置可以幫助其維持系統交付。未來供應增加之後,廠商仍有動力重新提高配置水平。這意味著,當前未被滿足的需求可能形成一定的後續採購空間。

基於這一判斷,大摩真正在意的,是這波記憶體景氣能持續多久,而非短期報價能衝多高。如果 AI 模型持續擴大,Agent 應用不斷增加,推理併發量繼續增長,那麼即使 DRAM 廠商提高產能,新增供應也可能被快速吸收。

因此,摩根士丹利維持對美光(MU)和閃迪(SNDK)的 Overweight(增持)評級,認為儲存供應緊張不會迅速結束。

但這並不意味著儲存產業可以完全擺脫週期風險。研報認為,最核心的風險仍然來自 AI 需求本身。一旦模型開發、推論應用或算力投資增速明顯放緩,計算與儲存產業鏈都可能受到衝擊。

此外,還有一種更復雜的情況:AI 需求仍然旺盛,但資料中心建設因為土地、電力或基礎設施限制而延遲。在這種情景下,儲存產品可能已經完成生產,卻因為伺服器部署延後而無法按預期被消化,進而造成階段性的供需失衡。

摩根士丹利認為,這類建設瓶頸可能對儲存廠商形成額外擾動,甚至使其短期表現與部分計算晶片企業出現分化。因此,未來判斷儲存週期是否能夠延續,不能只觀察 DRAM 價格和 HBM 訂單,還需要追蹤 AI 基礎設施的實際部署進度。

AI 儲存短缺的最終影響,可能並不是讓產業減少使用記憶體,而是迫使產業重新決定:哪些資料必須留在 HBM,哪些可以轉移至 DRAM 或 NAND,以及哪些計算任務應該交給不同型別的晶片。

對於投資者而言,接下來需要關注的核心變數也逐漸清晰:Rubin 實際出貨配置是否降低、解耦式推理能否實現商業化規模部署、CXL 產品能否在 2027 年按計劃放量,以及 AI 資料中心建設是否繼續消化新增儲存供應。

如果這些技術調整能夠維持 AI 系統部署,同時長期儲存需求繼續增長,那麼儲存與互連產業鏈可能共同受益;但如果 AI 投資放緩,或者電力與土地限制持續阻礙資料中心落實,當前的供需緊張也可能面臨重新定價。

這就是大摩對本輪 AI 記憶體週期最核心的結論:產業真正需要解決的不是如何等待更多記憶體,而是如何在記憶體始終稀缺的情況下,繼續擴大 AI 的計算能力。

加入動區 Telegram 頻道

📍相關報導📍

海力士Q2財報炸裂,華爾街急凍:預期差才是核心

三星強漲記憶體 20%!瑞銀上修報價:DRAM Q3 季增 32%、NAND 漲 30%!

別只看海力士,全球記憶體概念股一次看:韓國定價、臺灣吃供應鏈、日本隱形冠軍

Tags: HBMNvidiaRubin摩根士丹利記憶體


關於我們

動區動趨

為您帶來最即時最全面
區塊鏈世界脈動剖析
之動感新聞站

訂閱我們的最新消息

動區精選-為您整理一週間的國際動態

戰略夥伴

Foresight Ventures Foresight News MEXC

主題分類

  • 關於 BlockTempo

動區動趨 BlockTempo © All Rights Reserved.

No Result
View All Result
  • 所有文章
  • 搶先看
  • 市場脈動
  • 商業應用
  • 區塊鏈新手教學
  • 區塊鏈技術
  • 數據洞察
  • 政府法規
  • RootData

動區動趨 BlockTempo © All Rights Reserved.