同一個模型,一個榜給 62.7 分,另一個榜給 99.9 分,你該信哪個
Caleb Writes Code 拆開 GPT-6 Astra 的發布:十四個跑分裡只有一個跟主流綜合榜重疊,同一個模型在同一個測驗上,換一套執行框架分數從 62.7 變成 99.9。他提出一個新尺:省 token 不等於省錢。我拿自家一週的帳來對,發現輸出 token 只佔帳單 8%,跑分在量的那一小塊,剛好是我最不痛的那一塊。教育性整理與延伸,不是購買建議。

始吾於人也,聽其言而信其行;今吾於人也,聽其言而觀其行。
—— 《論語・公冶長》(春秋)
這集在講什麼
Caleb Writes Code(YouTube 頻道,2026-09-04 上架,11 分 08 秒)這集在拆 GPT-6 Astra 的發布。他的切入點不是這個模型強不強,是「強」這個字是怎麼被量出來的。發布文列了十四個跑分,其中只有一個跟外界最常引用的一份綜合智能榜重疊,而那份榜把 Astra 排在第五名,還落在另一家的模型後面。
他用一個工程師都懂的比喻:跑分本身是子程式,綜合榜是包在外面的包裝函式。包裝函式有寫得好的也有寫得糟的,一份綜合榜可以幫你聚焦在對的訊號上,也可以被底下的雜訊帶著走。他認為那份綜合榜是糟的包裝,但同時補一句:發布文自己挑的十四個跑分,也未必就是好的包裝。要看懂這個模型,得把包裝拆開,一個一個看底下的測驗。
摘要重點
第一個測驗是 ARC-AGI-3,Astra 拿 99.9 分,等於把這個測驗打滿。但他馬上追問:不久前 Nvidia 不是也宣布拿了 100 分,那這有什麼了不起。拆開來看是三件不同的事。那個測驗的題目是抽象小遊戲,模型拿到的不是畫面,是一格一格的文字網格,靠送出動作指令去試出規則。資料集分公開、半私有、全私有三份。Nvidia 的 100 分是在公開集上,靠的是一層包在 Opus 5 外面的代理人框架,給它記憶、上下文管理和執行環境。Astra 的 99.9 分是在半私有集上。而他找到的關鍵數字是:同一個 Astra 模型,如果不用 OpenAI 自己的框架,只透過 API 接進主辦方的框架去跑,分數是 62.7。同一個模型,換一套上下文管理,62.7 變 99.9。
第二個是數學測驗 FrontierMath 第四級,由七十多位數學家出題,資料全私有,主辦方跟 OpenAI 沒有關係。Astra 拿 97.6,他拿 Anthropic 幾天前剛發布的 Fable 5.1 對照,是 87.8。
第三個是他自己最看重的 DeepSuite,因為它比較像真實工作。這個榜沒有飽和,但前段模型全擠在七十分上下,將近五個月前的 5.5 只落後現在的最高分七、八分,Astra 是 74。他在這份榜上看到的不是分數,是旁邊那一欄:輸出 token 數。Astra 完成同樣的題目,輸出 token 只有前一代 5.6 Sol 的一半。
然後他做了一個區分,這集最值錢的地方在這裡。Astra 的價格是每百萬輸入 10 美元、輸出 50 美元,5.6 Sol 是 4 美元和 20 美元。token 少一半、單價貴一倍多,畫出來的成本曲線跟前代重疊。所以 Astra 是一個省 token 的模型,不是一個省錢的模型,這兩件事不一樣。
他順著往下推:如果模型越來越省 token,每個 token 能交付的價值就在上升,對靠賣 token 賺錢的實驗室來說,同樣的需求需要的算力變少了。這個省下來的差額可以還給用戶,也可以留在自己口袋。從 Astra 的定價看,目前是後者。他也點名,在同一份榜上分數接近的 Gemini 3.8 Flash 和 Opus 5,每 token 的效率比 Astra 差四到五倍。
結尾他講了兩句心裡話。發布會上用語音操作電腦的示範很酷,但他自己用代理人操作電腦的經驗一直不太行,這是他很想相信卻還沒到的東西。還有,Fable 5.1 在某些量法上比 GPT-6 更好,所以「好模型」的定義正在改:從聰明的模型,變成有用的模型,省 token、省錢、快、在真實任務上的表現,這幾樣說的話比綜合榜多。
延伸想法
看完這集我想對的是一件事:他說的「省 token 不等於省錢」,套到我自己的帳上會長什麼樣。
我平常在用的代理人工具會記錄每一次請求讀了多少、寫了多少。我把 2026 年 8 月 30 日到 9 月 5 日這七天的紀錄,照公開牌價換算成按量付費的金額(牌價 as-of 2026-06,快取讀取用折扣價,屬估算),然後拆成三塊:
- 模型輸出的 token:約 269 美元,佔 8%
- 模型重讀上下文(快取讀取):約 2,314 美元,佔 65%
- 新輸入和建立快取:約 996 美元,佔 28%
七天 7,754 個請求,平均每個請求輸出 805 個 token。如果有一個模型像 Astra 那樣把輸出砍一半,我一週省 82 美元,佔帳單 4%。也就是說,跑分榜上那條「輸出 token 效率」,量的是我帳單裡最小的那一塊。
決定我帳單的是另一條線:每一次請求,模型要重讀多少東西。這一條在任何榜上都沒有,因為它不是模型的屬性,是我怎麼用它的屬性。
重讀那一塊有多大,給一個具體的數。9 月 4 日那天我 2,325 個請求,模型讀進去的上下文合計約 10.5 億個 token,平均每個請求 45 萬。我沒有叫它讀這麼多,是它接進工具的那一刻,把整個工作區當成了上下文。同一天換一種做法,把讀大檔的活派給便宜的引擎、換題目就開新對話,平均值會往下掉一個量級。模型沒換,帳單換了。
這跟他找到的 62.7 對 99.9 是同一件事的兩面。同一個模型,換一套框架,分數差 37 分;同一個模型,換一種用法,帳單差十倍。跑分量的是模型,帳單量的是框架和用法,這兩個數字不會自己對上。
那我到底該看哪個榜
你心裡的問題是這個。我的做法是先問榜上哪一題最像我每天做的事。他看重 DeepSuite,因為那份題目像他的工作;ARC-AGI-3 對做科學的人有意義,對每天在改程式的人沒有。同一份榜對不同的人是不同的東西,不是榜錯了,是它回答的問題跟你的問題不一樣。
「跑分高就是好模型」這個信念從哪來?它來自機器學習研究的傳統。十幾年前模型之間的差距大到一個榜就能分出高下,那時候看榜是對的,因為榜上的一分對應得到你手上能不能做到。今天前段模型在他最看重的那份榜上全擠在七十分上下,一分的差距換不到任何實際的不同,榜還是那個榜,只是它能告訴你的事情變少了。
第二個問題比第一個更值得做:先量自己的兩個數字,每個請求讀多少、寫多少。這兩個數字一出來,你就知道模型的 token 效率對你重不重要。輸出佔你帳單的大頭,那 Astra 那種省 token 的模型對你是實打實的省;輸出只佔 8%,那你該省的地方在讀取那一邊,換模型不會有感覺,換用法才會。
再說一句我的體會。他影片裡最扎實的一個數字不是 99.9,是 62.7,因為它證明了框架不是配角。我這一年做的大部分事情都在框架這一層:什麼時候清空上下文、把讀大檔的活派給便宜的引擎、只讓貴的模型看結論。這些事不會出現在任何一份榜上,但它們決定了我付多少錢。
可以參考的資料
- 原片:Caleb Writes Code〈GPT-6 Astra.. full analysis..〉(2026-09-04 上架,11 分 08 秒;標題照錄原片)
- 我自己的用量數字:代理人工具 2026-08-30 至 09-05 的用量記錄(請求數、輸出 token、快取讀取 token、快取建立 token)
- 換算用的牌價:各家公開 API 定價(as-of 2026-06),快取讀取以折扣價、輸出以全價計,屬估算;文中 Astra 與 5.6 Sol 的單價為原片轉述
- 我今天另外兩篇談帳單的:〈一個請求十美元〉與〈訂閱比按量划算得多,那他為什麼還是不敢一次丟六個任務〉(皆 2026-09-06)
帶得走的一件事
我看完這集留在腦子裡的是一句話:跑分量的是模型,帳單量的是你的用法,兩個數字不會自己對上。我自己是因為拆出那個 8%,才不再追著榜跑。
我試過一個做法,你要的話可以試試:下次看到一則模型跑分的新聞,先拿一張紙,寫下那份榜裡哪一題最像你每天做的事。寫得出來,就只看那一題的分數;寫不出來,把那則新聞關掉。一週後回頭數,紙上有幾行,你就知道這一週有幾則新聞值得你花時間。