investing

AI 的上中下游:當「省記憶體」變成一則要拆開來讀的消息

聽財報狗第 540 集的心得。一個中國開源模型宣稱省下七成五的鍵值快取,一場大會端出千卡超節點,幾家美國公司的財報同時上修——把這三件事擺在一起,看到的不是「不用買記憶體了」,而是瓶頸層正在往下游移動。

  • AI 算力
  • 記憶體
  • 開源模型
  • 資本支出
  • 半導體供應鏈
  • podcast 心得

資料中心冷通道的深長走廊,前排機櫃指示燈明亮、遠端逐漸沒入昏暗,一名工程師蹲在近景地板上牽引一束光纖

三十輻,共一轂,當其無,有車之用。埏埴以為器,當其無,有器之用。鑿戶牖以為室,當其無,有室之用。故有之以為利,無之以為用。

——《道德經》第十一章

老子講的是一件很反直覺的事:輪子能轉,靠的不是那三十根輻條,是中間空著的那個孔;房子能住人,靠的不是牆,是牆圍出來的那塊空。有形的東西提供便利,真正被使用的卻是那個「沒有東西」的部分。

這段話拿來看今天的算力產業,剛好對得上。大家講 AI,講的都是「算」——幾顆晶片、多少浮點運算、模型多大。但這集節目從頭到尾在講的其實是另一件事:那些「空」的部分——記憶體、頻寬、互連、把資料放在哪一層——才是決定這台車能不能轉起來的東西。而這一集最值得記下來的,是有人試圖把那個「空」變小的時候,事情並沒有照直覺發展。

這集在講什麼

節目把上週三件表面上各自獨立的事擺在一起講。

第一件是中國團隊月之暗面(Moonshot)推出的新一代開源模型 Kimi K3,主打大幅壓低鍵值快取(key-value cache,模型推論時暫存的中間結果)的佔用,加上一套新的注意力算法。第二件是同一週的世界人工智慧大會,中國廠商端出千卡等級的超節點、以及宣稱達到先進封裝等級的自研晶片。第三件是美國這邊的財報季:伺服器組裝廠的毛利率大幅上修、Google 的資本支出再往上調並首次對外認列自研晶片收入、德州儀器(TI)談 800 伏特供電的設計進度。

主持人沒有把這三件事講成三則新聞。他們的問題只有一個:在這條從模型、到晶片、到記憶體、到電源的鏈條上,現在最緊的是哪一段?錢又是往哪一段流的?

順帶一提,節目開頭有個小插曲挺可愛:主持人研究了半天「Kimi」和「月之暗面」的關係,最後結論是「這英文跟中文根本沒有關係」——公司是中國公司,先有中文名,英文名是另外取的。

摘要重點

一、便宜模型的總帳,要把三個數字一起乘完才算數。

節目提到有人拿同一個任務去比對這個開源模型和頂級旗艦模型的成本。結論是:單價大約只有三分之一,但因為它的智能沒到旗艦水準,處理中型任務時會「繞路」——第一次嘗試失敗,再試第二次——所以總共燒掉的 token 大約是兩倍;再加上中國模型逐字產出的速度本來就比較慢,時間也拉長。三個數字乘完,總帳仍然便宜。

重點不在「便宜」這個結論,在於這三個數字決定了它的用途邊界。即時對話不行,因為人等不了;但只要是背景執行、不需要立刻回覆的活——每天定時整理報告、跑排程、代理人型的重複任務——十秒鐘完成和半小時完成沒有差別,那就是它的主場。這也是為什麼幾家美國公司早就把中國模型當成預設選項之一:不是覺得它比較強,是他們算得出來哪些工作不需要付旗艦價。

二、「省七成五」省的是哪一塊,界線要畫清楚。

宣稱減少七成五的是鍵值快取,不是整體記憶體。這個算法叫 Kimi Delta Attention,主持人吐槽說名字很帥,因為有個 Delta——而它真的就是數學上「差」的意思:不重複存整份狀態,只存變化量,再用變化量去推估。它跟傳統的完整注意力層以三比一的比例混用,七成五這個數字就是這樣來的,計算很直觀。

但推論過程本身也要記憶體,而且那部分和快取是分開的。剛才第一點才說過,這個模型完成同等任務要多花兩倍 token——那兩倍的推論過程,記憶體照吃不誤。所以「省了快取所以不用買記憶體」是把一塊的節省,錯當成整體的節省。節目裡提到有人真的以為可以拿消費級顯示卡跑,主持人的回應很直白:那大概只能在零上下文的狀態下勉強動一動。官方自己建議的配置是六十四張加速卡。

還有一個容易被略過但資訊量很高的點:這個模型的訓練用的是開放格式的低精度規格,不是某家晶片廠的專屬規格。這意味著別人要拿它去微調或做下一代,不一定得綁在特定晶片上。這是選擇權,不是效能——短期看不出差別,長期會影響議價結構。

三、開源不等於你家跑得動。

六十四張加速卡是什麼概念?換算成整櫃系統大概是八台連起來,主持人邊查邊修正價格,最後落在一櫃大約兩三百萬美元,而且提醒那可能還是不含其他配套的出廠價,實際落地更高。他的結論是:這東西還是給有錢的企業用,離「地端自建」還有距離,只是把門檻往下拉了一點。

更麻煩的是,這類混合專家架構非常吃互連速度。每個 token 都要在多顆加速卡之間全域交換,你如果為了省錢把八台分開放、中間用比較慢的線,成本不會消失,只會從晶片挪到網路上。「開源」解決的是授權,不是物理。

四、規格名詞誰都能取,要看的是實物。

節目講到中國廠商發表宣稱是先進封裝等級的晶片、還有玻璃基板,主持人的反應很有意思:名字隨便你取,你說是什麼都可以,我要看的是現況線和規格帶。同一段裡他們也拆了超節點的難點——把機櫃接起來不難,難在讓一千零二十四張卡互連之後速度不掉。交換機、拓樸結構、網卡與交換晶片的切分,這些才是真正的門檻;某家公司能把規模拉到四千多顆而速度不衰減,厲害的是這件事,不是數字本身。

還有一個關於中國路線的觀察:他們的製程受限,於是走「速度慢沒關係,我腳位多一點、輸出入通道多一倍」的補償路線。有人拆解晶片說是靠多次曝光硬做出來的,良率很低但確實能用。用錢換良率、用面積換速度——這是一個明確的取捨,不是黑科技。

五、以存代算:記憶體不再是一塊,是一疊。

這是這集技術含量最高、也最值得記住的一段。既然快取這麼吃記憶體,就有人把它往下卸載:第一層一定是高頻寬記憶體,第二層是板上的低功耗記憶體,第三層是本地或遠端的一般記憶體,再往下就是固態硬碟。原則一句話——越不常用的,放越遠

中國特別愛講這套「以存代算」,原因很現實:他們的高頻寬記憶體還在追,供給不夠,只能往下找替代。但這件事在美國那邊也在推進,而且動機不同:高頻寬記憶體和一般動態記憶體吃的是同一條製程資源,快閃記憶體是另外一條。多用後者,等於繞開最擠的那條路。

這裡有個很有人味的橋段:節目提到有日本記者堵到一家記憶體大廠的總裁,問他跟晶片龍頭執行長聊了什麼、有沒有談到記憶體。對方笑。再問卸載方案的進度呢?對方笑得更大聲,說「這我不能講」。底下的留言結論是:看起來進度一定不差。

量的部分,節目引用的說法是快閃記憶體需求今年約三千五百萬 TB,明年會超過一億 TB,增加的量級大概等於整個智慧型手機市場再加一份。

六、組裝廠的毛利率跳一倍,以及 Google 的三個數字。

伺服器組裝廠原本的毛利率指引是百分之八點二到八點四,實際上修到百分之十五到十七。一家做組裝的公司毛利率跳成兩倍,節目給了三個可能解釋:新世代設計的單機價值量提高、規格複雜讓收頂變困難因而議價能力上升、以及良率的學習曲線上來了。同業股價跟著漲,代表市場把它讀成整個環節的現象,不是單一公司的事。

Google 那邊有三個數字:應用程式介面的 token 處理量從每分鐘一百六十億跳到兩百二十一億,一季成長約三成七;雲端的積壓訂單在高基期上還在增加;資本支出再度上修到約兩千零五十億美元。同時,自由現金流這一季轉為淨流出。另外,自研晶片首次對外認列收入,只認了一小部分。

主持人對最後這件事的解讀很直觀:租雲服務是收租,做好晶片、做好伺服器,再一年一年收回來;直接賣晶片是賣房子,一次把錢拿回來。同樣的投入,現金回收速度不一樣,能撐的循環長度也不一樣。

延伸想法

一、判斷雜音還是結構,問「變的是總量還是配比」

「模型省了七成五記憶體」這種標題,第一時間會讓人想到一個很大的結論:那是不是不用買那麼多記憶體了?

拆開來看就知道不是。省的是特定一塊;繞路多花的 token 又把另一塊吃回去;而分層卸載的做法,是把需求從最貴的那層挪到便宜的那層,不是讓需求消失。這三件事加起來,改變的是配比和位置,不是總量。

這給了一個可以重複使用的判準:遇到一則「某某技術讓某某東西不再必要」的消息,先問它改變的是總量還是配比。改變總量的,才是結構性的;只改配比的,是雜音——但那個雜音對「配比裡誰的份額變大、誰變小」的人來說,是真的。同一則消息對不同層的意義相反,這很正常。會出錯的是把它讀成單一方向。

反過來說,這個判準也有它會失效的地方:配比的改變如果持續夠久、規模夠大,它自己就會變成總量問題。從最貴那層挪到便宜那層,短期是替代,長期會改變兩層各自的產能投資決策,再回頭改變總量。所以這個判準是拿來擋掉第一時間的過度反應的,不是拿來永久分類的。

二、瓶頸層會移動,而且移動的方向是可以被推理的

這集其實是一份「瓶頸層在哪」的實地觀察報告:算力吃緊,於是轉向互連;互連成本上升,於是有人靠多腳位補;記憶體吃緊,於是往下分層卸載;電源密度吃緊,於是有人推 800 伏特的供電架構。

值得注意的是,每一次緩解都不是消滅瓶頸,是把它推到下一站。訓練格式脫離專屬規格,是把議價權從晶片推向格式;快取卸載到固態硬碟,是把壓力從最擠的製程推向另一條製程;超節點把規模拉大,代價是交換與拓樸的難度上升。你順著這條鏈往下看,可以大致推出「下一個緊的地方」會在哪。

這也給了一個失效條件,值得寫下來:如果某一層的替代路徑真的成立,那一層的定價權會被稀釋。 這句話是可以驗證的——不是靠感覺,是靠看替代路徑的實際採用進度:是只有規格書和發表會,還是已經有規模化部署。節目裡對這點很誠實,說這些做法「是現在進行式,但真的大規模落地,可能還要再觀察」。這種誠實比結論本身有價值:它把「已經發生」和「正在被討論」分開了。

三、領先指標與落後指標,以及只調一邊的分母

節目後半段花了不少篇幅講一個爭論:資本支出什麼時候見頂。主流說法是明年下半年到後年上半年,理由是從自由現金流推——你已經投到現金流轉負了,再往上加的空間有限。

主持人的回應很關鍵:自由現金流是落後指標。 你現在算出來的東西,是大家都看得到的東西。真正的領先指標得往別處找——token 使用量、應用的實際採用度、以及信用市場。

信用市場那段是這集最值得記下來的方法論。他們提到六月以來,這幾家大型雲端公司的債券利差開始擴大。利差擴大意味著舉債成本上升,而舉債成本是折現率的組成之一——分母變大,理論上估值就該往下。二○○八年的教訓是信用違約交換先被買爆,股市後知後覺;債券市場參與者結構不同、資訊來源不同,反應通常比較早。除了資訊優勢,還有一個更機械的理由:債券跌得多,配置型的資金為了再平衡就得賣股票。這種賣壓和基本面無關,但它是真的。

把這一節收在一個投資紀律上:折現率的分母和分子會同時動,只調一邊就一定會得到自己想要的答案。 這一集同時給了兩邊的訊號——分子端是 token 量成長三成七、積壓訂單續增、組裝毛利率上修;分母端是利差擴大、現金流轉負。只看分子的人會覺得還早,只看分母的人會覺得已經到了。誠實的做法是兩邊都調,然後接受結論可能是「不知道」。

而最後判斷遊戲什麼時候慢下來,節目給的標準其實很樸素:當使用量的成長 cover 不了支出的成長,量價算不過來的時候,它自己就會慢下來。這句話的好處是它是可以持續追蹤的,不是一個要押注的日期。與其每季看到一個數字就翻案一次,不如把「用量成長 vs 支出成長」這組比較固定下來,長期對答案。

可以參考的資料

  • 財報狗 podcast 第 540 集〈【財經時事放大鏡】AI 上中下游:Kimi k3 x Google x TI〉(2026-07-23)
  • Moonshot 官方部落格關於 Kimi K3 的技術說明與建議部署配置
  • Google 母公司最新一季財報與法說會逐字紀錄(資本支出、雲端積壓訂單、自研晶片認列口徑)
  • 德州儀器最新一季法說會中關於 800 伏特供電架構的說明
  • 2026 世界人工智慧大會公開發表資料
  • 記憶體分層與快取卸載的公開技術文件,以及各記憶體大廠的產業需求展望

本文所引用的數字均為節目中口述、憑印象轉述或現場查詢,主持人自己也在節目中修正過其中幾個。任何要用來做判斷的數字,請以官方財報、法說會紀錄與原廠技術文件為準。

免責聲明

本文是一篇 podcast 的聽後心得與延伸思考,屬於個人觀點的整理與教育性內容,不構成任何投資建議、要約或招攬。文中提及的公司、產品與技術僅為說明產業結構之用,不代表推薦買進或賣出任何證券,也不提供目標價或進出場時點。

文中的數字來自節目中的口述轉引,可能存在誤差或已經過時。投資有風險,任何投資決策應基於您自身的財務狀況、風險承受度與獨立研究,必要時請諮詢具備資格的專業人士。作者不對因使用本文內容所導致的任何損失負責。

本文為投資方法論的教育性分享,不構成任何個股買賣建議、不提供目標價、不針對當期標的。投資有風險,任何決策請自行判斷或諮詢合格的專業人士。