科技浪 EP147 聽後心得:當聰明程度分不出來,那把尺就換人了
聽科技浪 EP147 的個人心得:兩週之內冒出四個最新模型,但前兩名的差距只有一分,要用幾十次任務才看得出來。當智能差距收斂,決勝的就換成了「完成一次工作要花多少錢」;而主持人更大膽的一句是——能力可能已經到了,真正卡住的是算力、速度與工具。教育性心得,非投資建議,文末附免責。

積土成山,風雨興焉;
積水成淵,蛟龍生焉。
騏驥一躍,不能十步;
駑馬十駕,功在不舍。
—— 《荀子·勸學》
這是我聽科技浪 EP147(2026-07-13 上架)的個人心得,不是逐字稿、也不是官方內容。想聽完整內容請直接支持原節目。以下把節目給我的啟發,加上我自己的整理寫成一篇。
這集在講什麼
一句話:這集表面在排模型的名次,真正的重點是——當名次已經分不出來,決勝的那把尺就換人了。
七月八號到九號兩天之內,三間公司同時發表新模型:OpenAI 的 GPT-5.6、SpaceXAI 的 Grok-4.5、Meta 的 Muse Spark 1.1;再加上前一週回歸的 Fable 5,兩週內多了四個最新模型可以用。主持人說這是他印象中第一次密集到這種程度——以前大家半年才發一次,後來變成兩間公司搶在同一週,現在是一週三個。
節目前半段逐個聊這三個模型的亮點,後半段給出一張三層排名,然後把整集導向他認為現在最關鍵的問題:距離 Digital AGI 還有多遠。他的答案相當大膽——他認為模型的能力其實已經到了,真正卡住的是算力、速度與工具。
荀子那四句放在這裡剛好。「騏驥一躍,不能十步;駑馬十駕,功在不舍」講的正是這集後半的整個論證:決定跑多遠的,往往不是那匹馬有多快,而是你讓牠跑幾天。
順帶一提,主持人自己正在趕一個一個月後要上線的線上學習平台。他說農曆年後到現在幾乎天天工作,真正休息的日子不到三天——而且他定義的「休息」是工作時間少於三小時。結果最該把自己鎖起來的最後一個月,世足賽跟英雄聯盟的季中邀請賽全撞在一起,每天一堆比賽可以看。一個講模型戰爭的節目,開場先抱怨自己被比賽誘惑到不行,這種東西是摘要留不下來的。
摘要重點
一、前兩名的差距只有一分,而且要用幾十次任務才看得出來。 他參考的第三方綜合評測把 Fable 5 排第一(六十分)、GPT-5.6 最大尺寸排第二(五十九分),第三名 Opus 4.8 就掉到五十六。他知道單一 benchmark 又片面又常有污染,但他的解釋是:九個各有偏差的測驗綜合起來,誤差反而互相抵消,過去一年這張榜跟他自己的體感一直吻合。至於舊的那種競技場式投票為什麼失效,他講得很直接——現在的模型是在做多步驟的工作,不是回一句話看誰寫得漂亮,看一眼分不出高下。
二、他形容那一分的差距叫「大模型的味道」。 一兩次測試感覺不出來,用到四五次之後才會從很細微的地方看出差別:Fable 5 有時候會出現「神來一筆」,講出一句你覺得其他模型沒有能力講出來的話;或者在工作過程中額外做了一項你沒要求、但確實該做的檢查。這個描述本身就很有訊息量——當領先要靠這種程度的細節才辨認得出來,代表智能已經不是使用者選擇時的主要變數了。
三、成本那把尺量的是「一次工作」,不是「每百萬 token 的標價」。 同一份評測會統計每題平均燒掉多少 token(模型處理文字的最小單位,含思考過程):Fable 5 平均三萬三千、GPT-5.6 一萬五千、Opus 4.8 四萬一千。於是出現一個反直覺的結果——GPT-5.6 的標價比 Opus 4.8 貴,但完成同一題的總成本更低,而且更聰明。 標價只是單價,token 效率才決定你真正付出去的錢;只看單價會把排序看反。
四、產出品質變好,他自己估七成不是模型變聰明。 OpenAI 這次同時推出了一個專做知識工作的工具層(節目裡稱 harness,指模型外面那一圈工具與流程)。他實測把一份四十幾項的行事曆搬到另一個行事曆上,每項的時間、標籤、備註全對,連已經重複存在的項目它都自己判斷不要再加一次——換上一代模型通常會錯個一兩項。做簡報時的排版問題也大幅減少,而他發現原因很大一部分是它產出後會逐頁自己檢查。他的結論是七成功勞在工具層、三成在模型,並說「進步來自哪裡其實不重要,重要的是結果」。對使用者來說確實不重要;但要判斷誰領先的話就很重要——工具層的改良,比底層模型的改良好抄得多。
五、他有一道自己出的私房考題:叫模型做一個《皇室戰爭》。 這題難在模型得先自己上網查清楚遊戲機制(他的指令裡不會給),八種兵種各有不同的攻擊距離、血量、移動速度,還有聖水與塔的規則,最後還要寫一個真的會玩的電腦對手。這次 GPT-5.6 花十六分鐘做出一個機制幾乎全對、而且他自己認真玩會輸的版本——他放哥布林群,對面用箭雨清掉;他放巨人,對面派小型高攻單位去砍。對照組是十五個月前的 Gemini 2.5 Pro,那是史上第一個做出「勉強能玩」的模型,在那之前只能看到幾個點在畫面上移動。而這題的價值在於它沒有被公開過,所以測到的是真本事,不是背過的答案。
六、Grok-4.5 的意義不是名次,是它是一塊新地基的第一版。 上一代是五千億參數,這一代是一點五兆——版號只跳了 0.2,模型卻整個換掉,是團隊大改組後第一次完整交作業。能力大約是 Opus 4.7 的等級,成本只有三分之一,所以它落在「效能與成本的最佳取捨邊界」上(Pareto Frontier,主持人給的白話翻譯是:你找不到跟它一樣聰明又更便宜的,也找不到跟它一樣便宜又更聰明的)。而他們內部還在訓練六兆與十兆參數的模型。所以這裡要讀的是斜率,不是位置——第一版就到這裡,而地基還沒用完。
七、Meta 賭的不是模型,是資料的形狀。 他們在數萬名員工的電腦裝追蹤軟體記錄工作過程,又把三千名資深工程師轉成專門生產訓練資料與環境的團隊,內部士氣因此很差;主持人不諱言這件事在員工權益上有爭議,但他從模型迭代的角度給了一個很銳利的區分:OpenAI 與 Anthropic 收到的,是「他們的工具已經做得好的那些工作」的資料;Meta 收到的,是所有真實工作的資料,不管 AI 現在做不做得到——起點、終點、中間走過的每一條路徑都有,而且同一件事還有跨部門、跨國家的多種做法。再加上他查到 Meta 今年預計上線的算力遠高於同業。三塊拼圖裡資料與算力都到位了,缺的是研究文化——他用傭兵與傳教士的對比來講:錢請得到人,請不到默契。
八、整集最大膽的一句:能力已經到了,卡住的是算力與工具——而且他給了一個可以驗的測法。 他引用一位專門研究「思考時間」的研究員的說法:現在所有評測都只給模型十幾二十分鐘,換成兩小時分數會往上跑,而且到目前為止沒看到明顯的遞減點。他自己的例子是一份簡報裡的截圖被切掉了;他的判斷方式是——把同一張圖單獨截下來再問模型一次,它看得出來有問題。既然單獨問看得出來,那剛才沒修就不是智能不足,是預算不足。 順著這條線,他認為要優化的其實是兩個數字:每秒產出多少 token(現在還是聊天速度,人讀夠用,但拿去跑一百個步驟的任務就無望),以及每 token 的成本(一份簡報不可能讓人花好幾萬)。若成本下降的趨勢只要維持、不必加速,他估一年半到兩年會到。
九、但他把界線畫得很清楚:完成 60% 到 80% 的工作量,不等於取代 60% 到 80% 的人。 剩下那兩成通常是最有價值的部分——定義目標,以及檢查產出符不符合目標。低層次的目標(例如通過測試)模型自己驗得了;但如果目標是「讓這個介面更人性一點」,他認為給再多算力也做不到,因為那是對人的理解不足,不是想得不夠久。這個界線很關鍵:它把「多給算力就會更好」限縮在「驗得出對錯」的工作上。
延伸想法
一、差距看得見時看能力,差距看不見時看單位成本
這集提供的最實用的一組數字,是那三個 token 用量。前兩名的智能差一分,token 用量卻差一倍以上;而排第三的模型不但比較笨,每題還燒掉最多 token。當一個市場的產品差異已經要用幾十次任務才辨認得出來,選擇標準就會自動從「哪個最好」滑向「哪個單位成本最低」——這不是誰的偏好,是差異消失後的必然。
這件事跟看公司其實是同一個結構。標價從來不是成本,每完成一單位你真正要的東西,花掉多少錢,才是成本。一個看起來比較貴的東西,如果它把同一件事做完只需要一半的資源,它就是便宜的那個;反過來,帳面便宜但每次要重跑三遍,帳是算在你頭上。這也是為什麼只比較每百萬 token 的報價會把排序看反——那個數字量的不是你要的東西。
失效條件也要一起寫下來,不然這就變成「永遠買便宜的」這種懶人規則:這套推論只在能力差距看不見的時候成立。 主持人自己就留了那個縫——他說在某些工作流上,Fable 5 仍然能提供 GPT-5.6 提供不了的價值,所以他寧可為了它多留一份訂閱。也就是說,只要出現一次「一試就看得出來」的差距,尺就要換回能力那一把。所以真正該定期回頭確認的不是排名,而是自己現在到底處在哪一種狀態。
為什麼不能用另一種解釋,說「決定勝負的是習慣與轉換成本」?因為這集本身就是反例:主持人講得很白,他這一代已經整個換過去了,而換過去的代價只是一份訂閱。護城河在轉換成本很低的地方會很薄——這句話在很多產業都成立,不只是這一個。
二、瓶頸不一定在你正在看的那一層
如果主持人的判斷是對的,那現在真正的限制條件不在「誰的模型最聰明」,而在每秒能吐多少 token、每 token 多少錢,以及工具做得夠不夠好。他舉的工具例子小得很好笑:他串的行事曆工具可以新增行程,卻不能新增待辦事項——你看到 AI 沒幫你把待辦加進去,那跟模型聰不聰明一點關係都沒有。
這是一個很典型的瓶頸層問題:需求翻倍的時候,最先斷掉的是哪一層。 而值得抄下來的不是他的結論,是他的測法——把出錯的那一小塊單獨拿出來問一次,如果模型單獨問答得出來,那剛才的失敗就是預算問題不是能力問題。這個測法之所以站得住,是因為它真的能區分兩種解釋;沒有這個區分,「都是算力不夠啦」就只是一句護航。
也因為有了測法,界線才跟著長出來:它只適用在驗得出對錯的工作上。 「讓介面更人性一點」沒有自我檢查的方法,所以多給算力也不會變好——這正是主持人自己畫的那條線。所以「瓶頸在算力」這個判斷是有範圍的,不是萬用解釋。
落到自己的紀錄上,我覺得該調整的是驗證點的位置,而不是結論。如果一段持有理由寫的是「AI 能力會持續變強」,那它其實沒有寫下任何可以對答案的東西;如果限制條件真的已經移到推論成本與速度那一層,那該追蹤的就是每 token 成本的下降斜率、推論速度、以及工具層的成熟度,而不是又一張刷新的評測排行榜。看錯層,就會在一個跟自己的理由無關的指標上反覆宣告自己對或錯。
三、有到期日的預測,才有資格拿來對答案
這集有一個很少見的橋段:主持人回頭對了自己兩個月前的答案。他在 EP138 講過一種「可以邊聽邊講、隨時被打斷」的語音模型,當時他的判斷是——這個做法在任何情況下都優於舊版,而且技術門檻沒有很高,任何一間公司想訓練都不難,所以主流遲早全部會換過去。兩個月後,這件事真的發生了。
值得注意的不是他猜中了,而是那個預測的形狀本身就是可以計分的:它有機制(為什麼一定會換)、有範圍(主流語音)、也有隱含的失敗條件(如果門檻其實很高,就不會這麼快出現第二家)。同樣的形狀也出現在他這集的大膽主張上——他給了定義(完成六到八成的數位工作量)、給了時間(一年半到兩年)、也給了前提(成本下降的趨勢只要維持,不必加速)。這種講法可以被打臉,所以才有價值。
而真正有用的做法是預先想好「錯了要怎麼讀」:如果兩年後沒到,該問的是哪一節斷掉——是成本沒有照趨勢降,是工具層沒跟上,還是能力本來就沒到?三個答案通往完全不同的後續判斷,混在一起就只剩下「他猜錯了」這種毫無資訊量的結論。
至於他那句「能力已經到了」,我自己傾向當成一個待驗證的假設而不是既成事實——畢竟它建立在「無限算力下模型會表現得更好」這個外推上,而那個外推目前是由沒看到遞減點來支撐的,沒看到不等於不存在。荀子那句「駑馬十駕,功在不舍」講的是同一件事的一體兩面:多跑幾天確實能補上速度的差距,但前提是路真的通到那裡。
可以參考的資料
- 科技浪 EP147(2026-07-13 上架)——本文的靈感來源,完整內容請直接收聽原節目,支持創作者
- 科技浪 EP138——本集回頭對答案的那個預測出處,講「可以邊聽邊講」的語音模型典範
- 《荀子·勸學》——「積土成山」「騏驥一躍,不能十步;駑馬十駕,功在不舍」的出處,可對照本集關於思考時間與成本累積的整段論證
- 第三方 AI 模型綜合評測(節目中作為排名依據,同時公布每題平均 token 用量與成本)——想自己看數字的人可以從這裡開始,重點是把成本欄一起看
免責聲明:本文為個人聽後心得與學習筆記,屬教育性內容,不構成任何投資建議、要約或招攬。文中不推薦任何特定標的,也不提供目標價,對節目中提及的個別公司、產業或商品皆不做評價或背書;提及公司名稱僅因其為新聞事件本身的當事人,相關敘述僅用於說明思路。節目中的觀察、數字、體感與經歷均為主講者自述,本文引用是為了說明推論方式,未經查證亦無從查證。投資有風險,過去績效不代表未來表現,請依自身財務狀況與風險承受度獨立判斷,必要時諮詢合格專業人士。作者可能持有文中提及類型的資產部位。
本文為投資方法論的教育性分享,不構成任何個股買賣建議、不提供目標價、不針對當期標的。投資有風險,任何決策請自行判斷或諮詢合格的專業人士。