investing

科技浪 EP148 聽後心得:排名是真的,便宜是假的

聽科技浪 EP148 的個人心得:一個開源模型衝上全球第三,社群同時傳著兩個相反的謠言——一邊說它成本不到十分之一,一邊說它只是抄來的。兩個都不對。真正有意思的是中間那段:它的單價確實便宜一半,卻要花兩倍的 token 才做完同一件事;而它之所以強,理由跟大家在吵的完全不是同一件事。教育性心得,非投資建議,文末附免責。

  • techwave
  • podcast-notes
  • ai
  • semiconductor
  • valuation
  • education

寫實油畫封面:深夜的資料中心長廊,從一條走道的最近端望進去,前景兩三排機櫃被冷白的維護燈照亮、看得清每一道理線與接頭,一名工程師的身影小小地站在中景、手裡的平板透出微光;走道往深處一路收束,機櫃的輪廓逐漸被薄薄的塵霧吞掉,只剩無數細小的狀態指示燈在黑暗裡延伸,看不到盡頭

吾生也有涯,而知也無涯。
以有涯隨無涯,殆已;
已而為知者,殆而已矣。
—— 《莊子·養生主》

這是我聽科技浪 EP148(2026-07-20 上架)的個人心得,不是逐字稿、也不是官方內容。想聽完整內容請直接支持原節目。以下把節目給我的啟發,加上我自己的整理寫成一篇。

這集在講什麼

一句話:一個開源模型真的擠進了全球前三,而社群同時在傳兩個方向相反、但都不成立的說法。

一邊說它跟最強的模型同級、成本卻不到十分之一;另一邊說它不過是把別人的模型蒸餾一遍,沒什麼了不起。主持人的處理方式很乾脆——兩邊都駁,然後把節目拆成三個問題:它真的這麼強嗎、它為什麼這麼強、它會造成什麼影響。

他開場的自嘲蠻好笑的:過去五十週裡他大概有四十五週都在說「上禮拜有重大科技新聞」,但這次是真的。他也順帶酸了一下這波討論的品質——他的社群平台整整幾天滑不到別的東西,而華語圈裡最積極發言的那批人,「完全跳過所有的邏輯跟事實,直接看他們想支持誰,就可以把事實講成那樣子」。所以這集他要做的事,就是把邏輯跟事實補回去。

還有一句話很有他的風格:如果你講話比較賤一點,像我一樣,你在那個工具裡大概也只能用到 Opus 4.8,因為最強的那個模型不會理你。這種東西是摘要留不下來的,但它其實透露了一個真訊息——「用得到什麼」和「排行榜上有什麼」,本來就不是同一件事。

摘要重點

一、第三名站得住,但「成本只有十分之一」站不住。 在那個綜合了很多測驗的智能指數上,它拿 57 分,落在 GPT 5.6 的 59 分與 Fable 5 的 60 分之後,但高過 Opus 4.8 與 GPT 5.5;主持人自己的實測體感、加上網路上大量的實測回報,都落在同一個位置,所以他認為第三名已經是共識。真正被誤傳的是另一半:它的單價大約是 GPT 5.6 的一半,但完成同一件工作平均要多花一倍的 token,兩個一乘,每件事的總成本其實是打平的。他的結論因此很不留情:同樣的錢,換一個比較笨又比較慢的,你為什麼要換。

二、「慢」有很具體的樣子,不是印象。 他把同一個遊戲開發任務丟給兩邊:對照組十六分鐘做完,這一邊跑了一小時二十分鐘還沒做完,順便把他五小時的額度整個燒光(他老實承認,開六個代理同時跑是他自己的問題)。但更值得看的是慢在哪一段——它花了四十分鐘在「確認自己對遊戲規則的理解對不對」,而它在動手查證之前寫下的那份理解,其實幾乎全對;過程中它還跑去翻很久以前的改版紀錄。對照組做同一件事只花三分鐘。它不是算得慢,是繞路繞得久,而這兩件事在成本上的意義完全不同。

三、現在要拿超大型專案才分得出模型的高下。 網路上瘋傳一個用它做出來的網頁版 macOS 模擬,主持人自己也轉了:所有應用程式都能打開、音樂播放器真的會放音樂、你真的可以到商店裡下載一個西洋棋來玩;假的聯絡人會回你訊息、還會按你的訊息讚;你打電話按數字鍵,每個數字還真的發出它自己正確的那個音。他順手回顧了一下標準的膨脹速度:兩年前大家在比誰寫的貪吃蛇好,去年在比誰的球滾得比較像物理,現在這些全部分不出差別,連他自己愛用的那個遊戲測驗也在上一集之後宣告飽和了。

四、蒸餾不是主因,而他給的三個反駁都站得住。 第一,它在前端程式的對戰排行上分數高過 Fable,而單靠模仿老師不可能超過老師。第二,時間對不上:要逼近那兩個最強的模型就得蒸餾那兩個,可它們兩週前才開放。第三也最結構性:現在的模型在做的事情是花半天做出一個 macOS 模擬,這種工作有無限多條路徑,你中途遇到的狀況跟老師當時遇到的不會一樣,根本沒有可以照抄的對象。蒸餾真正解決的是強化學習的冷啟動——它讓你學得快、省算力,但不保證你學得好。主持人那句原話很值得記:只靠蒸餾做出來的東西,只有你家的蒸餾水。

五、真正的原因有三個:夠大、架構、強化學習。 它是 2.8 兆參數、史上最大的開源模型,比上一代大一倍,內含 896 個專家、每次只啟用其中 16 個——去年吵得很兇的「擴展定律是不是死了」,看起來活得好好的。架構上有兩項創新:一項是把「隨著上下文一路長大的鍵值快取」換成一個固定大小的狀態,新資訊持續壓縮進去,論文說在一百萬字的上下文下最多能省掉約七成五;另一項是讓深層網路在往上疊的時候會挑重要的層加權,同一個目標只要八成算力就能達標。第三項則是強化學習,他推測是走精心設計訓練資料的路線,但也直說外界一無所知。

六、他解釋那個省記憶體的技術時,舉了一個很好懂的例子。 假設第一句是「阿根廷進入決賽,對手尚未確定」,第二句是「阿根廷進決賽,對上西班牙」。傳統做法會把兩句話每個字都算一遍、一視同仁地存起來;新做法則只維護一份固定大小的筆記——第二句前半段帶來的資訊筆記裡已經有了,幾乎不用改,只有「對上西班牙」需要動筆。所以就算你把同一句話跳針講一百遍,它佔的記憶體也不會變大,而重要的資訊一樣都在。 順帶一提,實務上不會整個模型都這樣做,因為壓縮就一定會掉東西,得跟完整版混用。

七、公開排名之外,還有兩件看不見的事。 一是算力天花板:官方建議至少要 64 張緊密相連的 GPU 才跑得好,而中國買不到整櫃高速互連的機種,能買到的最強晶片一次只綁得起八張,八組之間得走比較慢的網路。主持人由此懷疑走私量不小(他明說自己沒有證據),同時也注意到他們在為國產晶片做底層優化。二是發表節奏:中國的實驗室訓完很快就上架,美國的訓完會先壓著——某個模型一月就存在、六七月才推出——所以「只落後一兩個月」是拿上架日期在比,實質差距他估半年上下,比從前的八個月以上有縮短,但不是大家想的那麼近。另外,他也提到一條剛冒頭的線:一個早期版本的模型參與了最終版模型的底層程式優化,而那些程式現在真的用在它的推論上——AI 開始在加速 AI 自己的開發了。

延伸想法

一、單價不是成本,完成一件事的花費才是

這集最實用的一課,是它示範了一個很常見的錯誤怎麼發生:把「每百萬 token 多少錢」當成成本。正確的算法主持人已經寫在那裡了——單價乘上完成一件事所需的用量,才是成本,而這一邊是零點五乘以二,等於一。

推論很直接:任何「便宜多少」的宣稱,都要先問分母是什麼。報價表比的是單價,你的帳單來自任務。這一步之所以容易漏,是因為單價是公開的、寫在官網上的,而每件事花多少 token 得自己跑過才知道——公開的數字總是先被拿來比較,不是因為它比較對,是因為它比較容易拿到。

但這個結論有明確的失效條件,得誠實掛上去:token 用量是可以靠後訓練改善的,部署也還有優化空間,主持人自己就說了,未來成本再往下掉完全有可能。所以「打平」是一個帶時效的判斷,不是這個模型的本質。要對答案的話,該對的是「同一個任務、同一套工具鏈,兩邊各花多少」,而不是回頭重看報價表——重看報價表只會讓你再得到同一個錯誤的答案。

那能不能用另一種解釋來救「它就是比較便宜」?最常見的說法是「開源可以自己架,所以還是便宜」。這個說法漏掉的東西,剛好也在這集裡:把它跑好要 64 張緊密互連的 GPU,那筆錢從來不會出現在每百萬 token 的報價裡。開源省下來的是授權費與被綁定的風險,不是算力本身。

二、一條說服力很強的推論,時間軸卻掛在一個沒人估得出的參數上

主持人設了一個假想情境:如果真的出現一個「有最強模型九成到九成五的智能、卻只要一成成本」的開源模型,格局會怎麼變。他先聲明現在還不符合這個假設,然後推了一條相當漂亮的鏈子:混合使用會變成常態(重要的步驟交給最貴的、簡單的交給便宜的、最簡單的直接跑在你的筆電上)→ 閉源公司的定價權與毛利被削弱 → 但總用量不一定下降,因為便宜會解鎖一堆原本不會想交給 AI 的事 → 而且他們還能靠產品與黏性把利潤守回來一些。

這條鏈子裡最值得留下來的,是他順手講的那句結構性的話:開源不太可能真的超越閉源,因為一旦哪一家真的超越了前沿,他們就不會開源了。 這不是預測,是誘因結構——也就是說,「開源終將吃掉閉源」這個故事,內建了自己的天花板。

但這條鏈子有一個很弱的環,而且弱在最前面:混合使用要成立,前提是大家已經知道哪個步驟該配哪個模型。現在沒有人知道,所以所有人都直接開最強的下去跑——不是因為懶,是因為在實驗期,你要先摸到能力的上限在哪裡,才知道哪些步驟可以降級。主持人自己問得很好:你要幫公司做一套工具,你會坐下來把它拆成幾個難度不同的步驟、再一一配模型嗎?不會,你就直接開最強的叫它做了。

所以整條推論的時間軸,完全掛在「實驗期還有多久」這個沒有人估得出來的參數上。這一段給我的提醒是:推論鏈的每一環都成立,不代表你可以拿它去安排時間。 判準也就跟著出來了——要看這一段有沒有開始發生,該盯的不是誰又發表了什麼模型,而是市面上的工具有沒有開始內建「自動把任務分派給不同模型」這件事;那才是實驗期結束的訊號。

三、效率改善是一次性的台階,需求成長才是複利——但這是判斷,不是結論

省掉七成五的記憶體用量是真的,所以有人立刻推到「那記憶體的需求怎麼辦」。主持人的回應是往需求那一邊看:去問你身邊任何一個白領——做行銷的、做財務的、做分析的——現在有幾成工作是全部交給 AI 處理的?他保證你問不到一個超過五成的人;而未來這個數字會到七八成,這還沒算機器人那一整塊。所以他的說法是,我們還太早。

把這兩邊擺在一起,判準其實是清楚的:效率改善能不能吃掉需求成長,取決於效率是一次性的還是持續的、需求是線性的還是複利的。 省七成五是一個台階,省完就省完了,下一版要再省得再發明一次;而滲透率從五成走到八成是持續的。

但這裡必須誠實標記:兩邊都沒有可以直接查的數字,所以這是一個判斷,不是一個結論。它可以被驗,只是驗的方式不是看下週的報價,而是一年一年去看部署量與滲透率有沒有照著走。

而這剛好接上這集最後那段最有人味的抱怨。主持人說他的粉專上有一大堆人,聽到他長期看好就去買,下禮拜跌了就回來罵他。他的辯解其實是一句方法論:短期漲跌沒有人預測得到,長期趨勢的信心反而高很多。我會再往下推一句——這個差別不在難度,在能不能對答案。 短期的影響因素多到無法列舉,所以你事後永遠不知道自己是對是錯,只知道結果;長期則有滲透率、部署量、開源與閉源的差距會不會收斂這些看得見的東西,可以一年年拿出來比對。沒有判準的預測,就算猜中了也學不到東西,因為你不知道自己憑什麼猜中。

回到莊子那句「以有涯隨無涯,殆已」。它在這集裡出現了兩次形狀:一次是那個模型,用有限的算力去追一條無限長的查證路徑,四十分鐘還在翻很久以前的改版紀錄;一次是我們自己,用有限的注意力去追每天無限多的漲跌訊息。兩次的解法是同一個——不是追得更用力,是先決定哪些東西值得追。

可以參考的資料

  • 科技浪 EP148(2026-07-20 上架)——本文的靈感來源,完整內容請直接收聽原節目,支持創作者
  • 科技浪 EP146、EP121——主持人自己在這集裡指路的兩集,分別詳細講了鍵值快取的儲存量,以及深層網路裡那條「捷徑」機制;想把本文第五、六點看懂,那兩集是背景
  • 《莊子·養生主》——「吾生也有涯,而知也無涯」的出處,可對照那四十分鐘的繞路
  • 《論語·子路》——「無欲速,無見小利;欲速則不達,見小利則大事不成」,可對照「單價便宜一半、總成本卻打平」那一段

免責聲明:本文為個人聽後心得與學習筆記,屬教育性內容,不構成任何投資建議、要約或招攬。文中不推薦任何特定標的,也不提供目標價,對節目中提及的個別公司、產業、模型或商品皆不做評價或背書;提及公司與產品名稱僅因其為新聞事件本身的當事人,相關敘述僅用於說明思路。節目中的觀察、數字、部位與經歷均為主講者自述,本文引用是為了說明推論方式,未經查證亦無從查證;其中關於供應鏈的部分,主講者本人已明確表示屬個人臆測且無證據,讀者請勿當作事實。投資有風險,過去績效不代表未來表現,請依自身財務狀況與風險承受度獨立判斷,必要時諮詢合格專業人士。作者可能持有文中提及類型的資產部位。

本文為投資方法論的教育性分享,不構成任何個股買賣建議、不提供目標價、不針對當期標的。投資有風險,任何決策請自行判斷或諮詢合格的專業人士。