閱讀約 6 分鐘investing

高頻寬閃存 HBF 要來了:容量翻十六倍,代價是什麼

半導體測試實驗室裡,一顆堆疊記憶體模組被探針架壓住,燈光從上方斜落,走道往深處延伸出一排相同的測試站

Asianometry 2026-09-24 那集〈High Bandwidth Flash Is Coming〉的聽後心得:HBF 把一疊記憶體的容量從 36GB 拉到 512GB,卻慢上兩個數量級、只能寫幾千次。整理它的機會、代價,以及 Optane 留下的教訓。教育性內容,非投資建議,不含個股推薦與目標價。

  • 記憶體
  • HBM
  • HBF
  • 半導體
  • AI推論
目錄
  1. 這集在講什麼
  2. 摘要重點
  3. 延伸想法
  4. 「新規格的新聞出來了,我要不要現在就動」
  5. 「大廠都說好,我怎麼知道能不能信」
  6. 「這種技術題我看不懂,它跟我有什麼關係」
  7. 可以參考的資料
  8. 帶得走的一件事

半導體測試實驗室裡,一顆堆疊記憶體模組被探針架壓住,燈光從上方斜落,走道往深處延伸出一排相同的測試站

大方無隅,大器晚成,大音希聲,大象無形。

—— 《老子・第四十一章》(春秋)

2026 年 9 月 24 日 Asianometry 這集〈High Bandwidth Flash Is Coming〉,講的是 Sandisk 與 SK hynix 在推的新記憶體 HBF(高頻寬閃存)。它把單一疊的容量從 HBM4 的 36GB 左右拉到 512GB,帳面頻寬上限 3 TB/s,可是讀寫速度比 DRAM 慢兩個數量級,寫入壽命只有幾千次。主講人引用 Sandisk 在 SEMICON Taiwan 給出的時程:工程樣品要等到 2027 年底,量產排在 2029 年。他的判斷是這東西成不成,取決於軟體能不能挑對「哪些資料該放進去」,而不取決於容量數字好不好看。

這集在講什麼

主講人開場先承認自己上個月去 Hot Chips 之前,沒聽過 prefill、decode、KV Cache 這三個詞,回來以後到處都看到。這三個詞是整集的入口。

跑一次大型語言模型的推論,可以拆成兩段。前半段叫 prefill:模型要把你丟進去的東西全部讀一遍——提示詞、系統提示、之前的對話、圖片、語音、工具呼叫,還有它自己的思考鏈。這一段可以平行處理,所以吃的是算力。讀完之後它會留下一份 KV Cache,主講人形容那是「模型替這場對話寫的工作筆記」。後半段叫 decode:模型一個字一個字往外吐,每吐一個就回頭查那份筆記,再把新字寫進去。這一段沒辦法平行,所以吃的是記憶體——邏輯電路在那邊乾等資料從記憶體搬過來。

左右兩塊對照,左邊是六條等長橫條同時排開代表可平行的 prefill,右邊是一串一個接一個的小方塊,下方筆記本厚度逐格增高,代表 decode 一次吐一個字並不斷回寫筆記

理解了這一層,後面的問題就清楚了:筆記本會愈來愈厚,而搬紙的速度沒跟上。HBF 就是為了「讓筆記本放得下」提出來的答案。

摘要重點

兩條同時往上長的曲線。 一條是模型權重:主講人舉最新的 Kimi K3,總參數 2.8 兆,用 8 位元精度存大約 2.8TB;往前看 K2.7 是 1TB,DeepSeek V3 是 671GB。另一條是 KV Cache,被那些跑好幾個小時的長任務代理人撐大——上下文視窗現在大約一百萬個 token,聽起來很多,換成文字是一千五到三千頁,可是換成語音只有十一二個小時,換成高畫質影片只剩一小時。

上方一個虛線框標著文字的頁數,下方兩條長度懸殊的橫條落在同一條小時刻度上,語音那條橫跨十二小時,影片那條只剩最左邊一小截

HBM 被當場質疑的那一刀。 Hot Chips 2026 的記憶體場次,SK hynix 講完之後,一位 SemiAnalysis 的分析師舉手問:單顆晶片在儲存單元層級的內部頻寬大約每平方公分 20TB,你們講 HBM4 要疊到 20 層,一疊算下來每平方公分只剩 4TB,等於每一層分到單顆的百分之二十,吞吐被稀釋掉了,為什麼往高疊而不是往快跑?痛點在中央那塊區域能放的矽穿孔數量有限,容量要加就得犧牲每 GB 的頻寬。疊到夠高的時候,會出現一個荒謬的畫面:每一顆核心晶片跑得比普通商用記憶體還慢。

左邊一顆單晶片配一根高柱,右邊一疊二十層配一根只剩五分之一高度的矮柱,兩根柱站在同一條基線上

大人物也開始挑。 前 Intel 執行長 Pat Gelsinger 夏天在一位 SK hynix 副總面前說 HBM 是「爛記憶體」。那位副總 Kim Ho-sik 回得挺誠實:他部分同意,HBM 不是記憶體牆問題的最終答案,可是這是目前市場上最好的東西,SK hynix 也在做別的解法。

HBF 到底是什麼。 它用 HBM 堆疊 DRAM 晶片的同一套封裝手法去堆閃存晶片,跟 3D NAND 那種在單一晶片裡往上長記憶單元層是兩回事。好處是單疊容量一口氣加八到十六倍(512GB 對上 HBM4 一疊 36GB 左右),同時保住高頻寬——因為打開了更多 NAND 單元給 GPU 讀,理論上頻寬還能再往上。主講人自己補了一句要記住:換算成每 GB 的頻寬,HBF 的數字小得多。

三個躲不掉的代價。 第一是速度,NAND 的讀取與寫入比 DRAM 慢兩個數量級,寫又比讀更慢,延遲是結構性的,Sandisk 可以調晶片去換低延遲,代價是資料保存年限或每位元成本。第二是壽命,NAND 單元寫幾千次就開始耗損,DRAM 沒有這個上限。第三是功耗與發熱,這麼大一塊立方體要更多電,熱起來系統就降頻,降頻又反過來惡化壽命。

一條水平基線上,最左邊一根柱往上長很高,右邊三根柱往下長,方向相反

容量變便宜,token 不會自動變便宜。 Hot Chips 2026 有一場由 A. Agrawal 與 R. Giduthuri 講整合難點,核心那句話我記到現在:系統被評價的標準是它每秒能服務多少 token,資料如果沒能及時從 HBF 搬出來,加速器就在那邊等,token 產出照樣掉。北京大學五位研究者加一位復旦的(主講人開玩笑說那位大概走錯路了)寫了篇標題叫〈HBF Sucks?〉的論文,講的是同一件事:HBF 不是換上去就能用的 SSD 替代品,軟體得仔細決定哪些資料進去,例如很多人共用的那段提示詞。模型架構也有差別,混合專家模型只啟動其中幾位專家,需要容量把全部專家放著、每次只讀幾位,這種形狀對每 GB 頻寬較低的 HBF 比較友善。

Optane 那面鏡子。 2015 年 Intel 和 Micron 合推 3D XPoint,非揮發、速度接近 DRAM、價格卡在中間,賣的概念叫「溫資料」——想要 DRAM 的延遲但大到放不進 DRAM 的那些資料庫。結果 3D NAND 的每位元成本一路往下掉,把 Optane 的經濟理由整個抽空,Micron 退出,剩 Intel 一家做,沒人願意讓同一家公司同時當 CPU 和記憶體的單一來源,就結束了。主講人挖出一個讓人坐直的細節:現在 Sandisk 主推 HBF 的高層 Alper Ilkbahar,在 Intel 待過五年,職位是 Optane 事業群的副總裁兼總經理。他還補了一段反面證詞:有人說 HBF 的優勢是從閃存出發、大家熟悉,所以市場接受度會比較好;可是 Optane 的相變單元本身做得漂亮,倒的是控制器和進入市場的策略。

兩條線隨年份走,上面一條幾乎水平代表價格不動,下面一條持續下滑,兩線之間的灰色間隙愈拉愈寬,右端以叉號收尾

延伸想法

「新規格的新聞出來了,我要不要現在就動」

這是我聽完第一個冒出來的念頭,也是我過去幾次吃虧的地方。這集給了我一把尺:先去找時程,再去找出貨。Sandisk 自己在 SEMICON Taiwan 放的排程是 2027 年底給潛在客戶工程樣品,2029 年高量產。從現在算過去,中間還隔著兩次以上的年度資本支出週期、兩次以上的產品世代。規格文件公開(Open Compute Project 2026 年 8 月放出 0.7.0 版)代表大家願意坐下來談介面,不代表有人下單。

一條時間線上三個點,現在在最左邊,工程樣品在中間,量產在最右端,下方一個大括號標出中間隔著的週期

我後來判讀這類消息會看三件事:有沒有可信的第二供應來源(Sandisk 和 SK hynix 在 2025 年 8 月簽備忘錄要把規格標準化,這一步就是替客戶消掉單一來源的恐懼,也正是 Optane 最後倒在那裡)、有沒有客戶名字浮出來(Google 和 Tenstorrent 加入聯盟算訊號,但加入聯盟不是採購合約)、還有軟體生態有沒有人在動。三件缺兩件,我就當它是待觀察的題目。

「大廠都說好,我怎麼知道能不能信」

我自己最受用的是那位分析師問的問題長什麼樣。他沒有問「HBM 好不好」,他問的是「你為什麼選擇往高疊,而放棄往快跑」——把對方的路線攤成一個取捨,然後要對方解釋捨掉的那一半。這種問法沒辦法被公關稿吸收掉。

所以我現在看任何技術路線的宣傳,會刻意去找「代價在哪一格」的聲音,而不是找誰唱反調。唱反調很便宜,指出取捨很貴。Kim Ho-sik 那句「HBM 不是最終答案,可是它是現在市場上最好的東西」,其實已經把整個產業的處境講完了:大家一邊賺著 HBM 的錢,一邊知道這個架構撐不到底。這兩件事同時成立的時候,最危險的是把「現在最好」讀成「以後也會最好」。

「這種技術題我看不懂,它跟我有什麼關係」

我聽到 Agrawal 那段的時候想了很久。整個 HBF 的敘事都在講容量,可是系統被評價的標準是每秒服務幾個 token;容量便宜十倍,而資料搬不出來,最後的數字不會變好看。這個形狀在我自己生活裡到處都是:買了大冰箱,晚餐還是不知道吃什麼,因為卡住的從來是決定要吃什麼那一步;擴充了硬碟,檔案還是找不到。

我現在會把「不夠」這個抱怨先拆成三種:總量不夠、取用速度不夠、等別人回覆的時間太長。

三個並排的方框,各自畫著不同位置的堵點,一個是裝滿的容器,一個是中間縮細的管子,一個是被切斷、中間擺著時鐘的管子

拆完再問要加的資源落在哪一格。這集裡混合專家模型那個例子是同一件事的正面版——它之所以配得上 HBF,是因為它的需求形狀剛好是「要放很多、每次只讀一點」。形狀對上了,慢一點也沒關係。

可以參考的資料

  • Asianometry 頻道,〈High Bandwidth Flash Is Coming〉,2026-09-24(本文的來源)
  • Open Compute Project 的 HBF 規格 0.7.0 版,2026 年 8 月公開
  • Koji Sakui 與 Takayuki Ohba,IEEE 2019 International 3D Systems Integrated Conference 的「High Bandwidth NAND」論文與演講
  • 北京大學與復旦大學研究者的論文〈HBF Sucks?〉,談 HBF 與 SSD 的差異與軟體選料
  • Sandisk 2025 年 2 月 Future FWD 投資人日的 HBF 發表資料
  • 想補 Optane 的背景,Asianometry 頻道自己有一集舊的 Optane 影片

帶得走的一件事

加容量不等於加速度,瓶頸只認最慢的那一段。 這集所有的數字最後都收在這一句上:單疊容量從 36GB 跳到 512GB 是十四倍,可是延遲慢兩個數量級、每 GB 頻寬掉下來,系統能不能多服務 token 由最慢的那一段決定,不由最亮的那個數字決定。

三根高低不同的柱子,一條虛線貼著最矮那根的高度橫貫整張圖,把前兩根高出來的部分切在線外

我試過的一個做法,分享給你:找一件你最近抱怨過「不夠」的事——時間不夠、家裡收納不夠、人手不夠都行——拿紙寫三行,把它拆成總量不夠、取用速度不夠、等別人回覆太久。然後把你原本打算加的那個東西(買收納箱、請人、多排一小時)對上去,看它落在哪一行。我上次做這個練習,發現我抱怨時間不夠而想早起,可是真正卡住我的是每天早上花二十分鐘決定先做哪件事——那是第二行的問題,早起是往第一行加東西,加了也不會通。

本文為投資方法論的教育性分享,不構成任何個股買賣建議、不提供目標價、不針對當期標的。投資有風險,任何決策請自行判斷或諮詢合格的專業人士。