tech

一個請求十美元:掄錘者被 GPT6 Astra 燒掉餘額那天,我回頭看了自己的帳

掄錘者實測 GPT6 Astra:網頁聊天三題花一美元,接進 Codex 一個小任務就把七美元餘額燒成負的。他的結論是模型不貴,是我們窮。我拿自己一天的 AI 用量對了一遍,發現帳單算的不是它答了多少,是它讀了多少。教育性整理與延伸,不是購買建議。

  • 掄錘者
  • AI 工具
  • token
  • 訂閱
  • 本地部署
  • education

文藝復興風格油畫封面:一位穿粗布衣的抄寫員坐在昏暗書房,桌上一枚金幣正在燭火中融化,他手裡的鵝毛筆只寫了一行字,身後整面牆的書架卻全被燭光照亮

一粥一飯,當思來處不易;半絲半縷,恆念物力維艱。
—— 朱柏廬《朱子家訓》(明末清初)

這集在講什麼

掄錘者(YouTube 頻道「抡锤者」)這集(2026-09-05 上架,12 分 43 秒)是一支被觀眾逼出來的實測。GPT6 Astra 剛發布,跑分號稱超過 Claude 的頂級模型,留言區一直有人要他測。他平常不碰 OpenAI 和 Anthropic 的模型,理由很直接:他每次只儲十美元,這種等級的模型一接進代理人工具,錢就沒了。

這集他還是測了。然後錢就沒了。

摘要重點

他先在網頁聊天介面跑三個小題:做一個講八卦文化的網頁、畫一張圖靈機運作原理的向量圖、再畫一張薛丁格的貓的向量圖。三題各花 0.28、0.27、0.27 美元,合計約一美元。品質他給 95、90、80 分,跟他平常用的便宜模型差不多,沒有明顯領先。

接著他把模型接進 Codex,改自己 App 裡一個很小的地方:回覆時的引用要限制長度、格式排好看一點、游標停到最後一行下方。他估這種任務用平常的模型一到兩分鐘搞定,花不到人民幣兩毛。結果 Codex 回他一個錯誤:餘額不足,請付款。他帳上原本有七美元,一個請求過去,變成負 2.5 美元。查用量紀錄,那一個請求九美元出頭,加上網頁聊天的一美元,這天總共十美元。

他拿自己最重的一天對比:那天同時在開發一個 AI 影片剪輯器和一個論壇程式,用便宜模型瘋狂跑了一整天,人民幣 40 元。現在一句話就花掉 60 元。他也講了訂閱方案的經驗:他有訂 ChatGPT 的 Plus,主要拿來做頻道封面,順手試了一個簡單的接入任務,跑了四分零五秒,吃掉五小時額度的 6%。之前訂過 Grok 每月 30 美元的方案,額度看起來很多,做起事來很快就沒了。

他的結論分兩層。第一層是自嘲:模型不貴,是我們窮。第二層是給觀眾的:他頻道九成的人用不起這種東西,那就把便宜的雲端模型和本地部署的模型用好。他自己在本機跑一套開源模型,平常開發用 DeepSeek 系列,最重的月份人民幣一千出頭,正常五百就夠。

影片結尾他說還是會再儲 15 美元,因為那個平台上有很多國產模型長期免費,薅羊毛很划算。他唯一虧的地方,就是被頂級模型吃掉的那幾次。

延伸想法

你看完這集心裡會有一個問題:那個請求到底做了什麼,可以花掉九美元。他自己也不知道,影片裡只說「它才理解了一下,還沒開始做」。這句話就是答案,我拿自己的帳來對。

我平常也在用 Claude 的代理人工具寫程式、整理資料。它會記錄每一次請求讀了多少、寫了多少。我抓 2026 年 9 月 4 日一整天的紀錄(as-of 2026-09-04,來源是工具自己的用量記錄):

  • 請求數:2,325 個
  • 模型輸出:約 178 萬個 token,平均每個請求不到 800 個
  • 模型讀進去的上下文:約 10.5 億個 token,平均每個請求約 45 萬個

也就是說,每一次我丟一句話進去,它平均要先把 45 萬個 token 的東西重讀一遍,然後回我 800 個 token。讀和寫的比例接近六百比一。這 45 萬個 token 是什麼?是我的專案檔案、之前的對話、它自己讀過的工具輸出。我沒有叫它讀,是接進工具那一刻它就把整個工作區當成上下文。

掄錘者那個九美元的請求,就是這件事的縮小版。他把模型接進 Codex,指到自己開發中的 App。「理解了一下」的意思,是模型把那個 App 的程式碼讀了一遍。他改的地方很小,但模型讀的東西很大。帳單算的不是他要它答什麼,是它為了答而讀了什麼。

左邊一張紙只寫了一行字,右邊一整座書架;兩邊各掛一張帳單,右邊那張跟書架一樣高,跟左邊那行字無關

我把自己那天的用量照公開牌價換算了一次:如果不是訂閱制,而是按量付費,那一天大約六百美元(估算,牌價 as-of 2026-06,讀取快取有折扣、輸出全價)。我沒有付這筆錢,因為訂閱制把它攤平了。但攤平不代表不存在,它會變成另一種形式回來:額度。我這週的三家額度(as-of 2026-09-06 上午):Claude 每週額度還剩 91%,Codex 每週額度只剩 29%,Grok 每月額度剩 45%。Codex 那條最先被吃掉,因為我把最重的讀取類工作都推給它。

所以掄錘者說的「用不起」,我會改寫成另一句:頂級模型的錢不是花在它有多聰明,是花在它讀了多少。而讀多少,很大一部分是使用者可以控制的。

那個請求教我的三件事

你可能會問:那我是不是該像他一樣,退回去用便宜模型和本地模型。我自己不是這樣做的,我是把工作分開。

第一,讀大東西的工作不要放在最貴的模型上。我把逐字稿、長報告、批次檔案這類讀取工作派給便宜的引擎去讀,讀完只把結論交回來。主對話的模型只看結論,不看原料。我那天 45 萬個 token 的平均值,就是這條沒守好的證據。

第二,換題目就清空上下文。掄錘者影片裡那個 App 的整份程式碼,對他改游標位置那個任務來說,九成是不需要的。工具不知道哪些不需要,人知道。我現在的習慣是換一件事就開新的對話,讓它從空的開始讀。

第三,先用最小的一題量價格。這是掄錘者自己做對的事,他先在網頁上跑三個小題,看到一美元,才決定要不要接進 Codex。他說「怕它一下把額度乾光」,這個怕是對的,只是他量的地方不對:網頁聊天量到的是模型本身的價格,接進工具之後多出來的是讀取的價格。這兩個要分開量。

三格漫畫:第一格一個人在雜貨店付一枚硬幣買一顆糖;第二格同一個人把整間雜貨店搬上卡車,收銀員遞出一張長長的帳單;第三格他站在卡車前,手裡還是只拿著那顆糖

那對正在挑工具的人是什麼意思

掄錘者這集在打一個信念:更強的模型等於更高的生產力。這個信念不是憑空來的。2023 年前後,模型之間的差距很大,換一個更強的模型,同一件事從做不到變成做得到,那時候「用最強的」是對的,因為瓶頸在能力。但今天他跑的三個小題,頂級模型和便宜模型的分數差不到五分。瓶頸從能力移到了帳單,而帳單跟著讀取走,不跟著聰明走。

如果你正在決定要不要訂一個頂級方案,我會建議先看自己的工作長什麼樣。你的任務是不是大多小而多,像改一個游標位置那種?那便宜模型加上本地模型,像掄錘者那樣,很可能就夠了。你的任務裡有沒有非頂級推理不可的那一成?那把那一成留給貴的,其餘九成分出去,訂閱的額度會撐得比較久。兩種做法都對,錯的是把所有東西都丟給同一個模型,然後看著餘額變負的。

寫到這裡我想講一句自己的體會。最新的模型不等於最好用的模型。好不好用,要看你怎麼用它、你自己想拿它做什麼。跑分再高的模型,如果沒有落到你每天的工作和生活裡,替你省下一段時間、做成一件事,那個分數跟你沒有關係。掄錘者用便宜模型一天做出兩個程式,他手上那個就是最好用的模型。

可以參考的資料

  • 原片:掄錘者〈GPT6 Astra编程实测,一个请求消耗10美金吓傻穷博主,泪流满面!轻度任务没有明显优势,重度任务用不起!〉(2026-09-05 上架,12 分 43 秒;標題照錄原片,原片為簡體字)
  • 我自己的用量數字:Claude 代理人工具 2026-09-04 一整天的用量記錄(請求數、輸出 token、快取讀取 token);三家額度為 2026-09-06 上午的快照
  • 換算用的牌價:Anthropic 公開 API 定價(as-of 2026-06),快取讀取以折扣價、輸出以全價計,屬估算
  • 我上一篇聽他談模型與代理人的心得:〈便宜的夠用,貴的用不完〉(2026-09-01)
  • 我之前寫過訂閱與按量計費是兩道門:〈訂閱不等於省錢〉(2026-07-09)

帶得走的一件事

我看完這集,留在腦子裡的不是「別用貴的」,是另一件事:AI 的帳單算的是它讀了多少,不是它答了多少。我自己是因為對了那個六百比一的數字,才開始把讀和答分開派。

我試過一個很小的做法,你要的話可以試試:下次 AI 工具回完你一題之後,打開它的用量頁面,找到那一次讀進去的 token 數和寫出來的 token 數,把前者除以後者,記下那個倍數。我算出來是六百。我自己的線畫在一百:超過一百,那個對話的下一題就換新的開;沒超過,接著聊。算一次只要兩分鐘,算完你就知道自己的錢有幾成是在付它讀書。