便宜的夠用,貴的用不完:聽掄錘者講怎麼選模型和 agent
掄錘者用十八分鐘把他這幾個月測過的模型和 agent 排了一次隊:本地只認 Qwen3.8 27B,線上首推 DeepSeek V4 Flash,日常助手用 Hermes、寫程式用 Codex,Gemini 和 Grok 直接勸退。他的排隊方法比排隊結果更值得學:先問你一個月用多少、任務要跑幾步,再決定付誰的錢。我拿自己這一個月的實測數字對了一遍,有兩處跟他一致,一處相反。

彼節者有間,而刀刃者無厚;
以無厚入有間,恢恢乎其於遊刃必有餘地矣。
—— 《莊子・養生主》(戰國,約西元前 4 世紀)
這集在講什麼
掄錘者(YouTube 頻道「抡锤者」)這集(2026-08-31 上架,18 分 33 秒)他自己說是「水一下」——早上要送小孩上學,沒時間做實測,就把這幾個月測過的模型、agent、硬體做一次總整理。我反而覺得這種集數最好用,因為他把散在十幾支影片裡的判斷一次排成了隊。
他的排法很簡單:先問你一個月用多少,再問你的任務要跑幾步。這兩個問題答完,該付誰的錢、該不該買顯卡,答案就出來了。
摘要重點
本地模型只有一個答案。他說 Qwen3.8 27B 是當下最好的本地模型,「沒有質疑」。Google 的 Gemma 系列、Meta 的模型都來挑戰過,「輸得都不是一星半點」。有人問為什麼不選參數更大的 Qwen 35B-A3B,他的回答是這集最有價值的一段:35B 那個是混合專家模型,每次推理只喚醒 30 億參數,27B 是稠密模型,270 億參數全部上工。寫個小腳本、推理七八步,兩者看不出差別;但接上 agent 去做要跑一兩百步的開發任務,每一步的小誤差會一路累積,跑到十輪八輪之後就「並掉了」。同樣的事,稠密模型能做完,混合專家模型做不完。
用量決定買不買顯卡。他把自己歸在「輕度到中度」:寫點程式、維護論壇腳本,用 DeepSeek V4 Flash 一個月大約三百多塊人民幣,加上偶爾用本地模型,五百塊可能擋不住(他的估算,2026-08-31 影片)。他的分界線是這樣畫的:如果你是專業工程師,或每天有大量文件要處理,線上最便宜的方案一個月也要一千塊起跳,一年下來好幾萬,這筆錢拿去買一張 48G 的顯卡,九成五的工作可以在本地做完。如果你要生圖生影片,那更不用算,線上 API 的消耗比寫程式高好幾個數量級,「有多少錢都擋不住」,一張 32G 以上的卡半年回本。
但除了隱私、抗審查、大量日常消耗這三種情況,其他時候他都建議用線上 API。理由不是能力,是體驗:線上是集群服務、全天候在線、幾乎不掉線,而且你不用忍受渦輪卡的噪音。
線上模型他首推 DeepSeek V4 Flash:最便宜、最全能,能做完絕大多數人九成九的工作,工程師也有九成五。小米 MiMo、智譜 GLM 5.3 Flash、騰訊混元、MiniMax、Qwen 各有特點,他對混元 4 印象不好。真的要上國外模型,他推 OpenAI 的二十美元方案,理由是額度給得足:網頁聊天不計額度,Codex 的額度五小時和七天各重置一次,小任務用不完。他覺得 GPT-5.6 Luna 拿來跑長程開發「比較蠢」,但搜尋、翻譯、日常對話很夠,生封面圖一到三次就能出想要的。
勸退兩家。Gemini 的二十美元方案他曾長期當主力,「從兩個月前開始變得非常蠢」,比前一代還差,生圖的優勢也沒了,唯一好用的分析 YouTube 影片功能不訂閱也能用。Grok 他沒訂閱,X 會員送的額度「基本上沒用過」;他的講法是除非你要做 GPT 和 Gemini 會罷工的政治敏感題材,否則「馬斯克的 AI 已經死了」。
agent 分兩種用法。日常助手選 Hermes:最穩、流量最高,能寫程式但效率不如專門的編程 agent。寫程式選 Codex:安裝最簡單,接 DeepSeek V4 Flash 或本地 Qwen 27B 體驗都好,但它是命令列工具不是常駐服務,沒有跨對話記憶,不適合當二十四小時的個人助手。OpenCode 也很好,就是介面太醜。他最看好的是 DSH,影片標題寫 DSH、他口中叫 DeepSeek Hermes——發布不到二十天,GitHub 星數已經追平 Hermes 和 OpenCode,程式碼品質「是正規軍」,外掛系統連主迴圈都能換掉;但還在候選版,有 bug,他建議等正式版再當主力。
順帶提一句他早前的預測:OpenClaw 曾是星數最多、「全民養龍蝦」的那個 agent,他當時說框架寫得爛、遲早被取代,被笑不懂;現在他認為已經被 Hermes 取代了。
延伸想法
你可能跟我一樣,訂了不只一家的方案,每個月帳單來的時候都在想:這幾家到底哪個是我真的在用的?他這集給了一個排隊的方法,我拿自己過去一個月的紀錄對了一遍。
先講對得上的。Gemini 變差這件事,我在 2026 年 8 月中也把它從實作型任務的名單裡拿掉了,理由一樣:不太可靠。這不是兩個人的錯覺,是同一個時間窗兩邊各自量到的。
再講對不上的。他說 Grok 已經死了,我 8 月 24 日做過一次同題對照:一支跑得動、不報錯、但答案錯的 Python,交給三家分別找缺陷。Grok 4.6 找到兩個真缺陷、最多,還順手量化了誤差;另外兩家各找到一個。代價是慢,四百九十五秒,比最快的那家慢八倍。所以我的版本是:Grok 不是死了,是慢,而慢在很多場景等於死。這個結論只有一次實驗,我不敢說更多。
然後是他這集最重要的邏輯,用我的數字驗一次。他說短任務看不出差別、長任務誤差會累積。我同一天先做了一題機械活:兩百列的表格算三個統計數,答案事先算好。三家全對,耗時分別是十八秒、二十二到二十五秒、四十八秒(2026-08-24 實測)。答案一樣的時候,差別只剩速度和價錢,那就該付最便宜那家。這跟他「短任務何必用大模型」的結論完全一致。
還有一個他沒講、但我覺得比選哪家更要緊的事:你付了錢的額度,到底用掉多少?我在 8 月中查過自己的 Codex 週額度,用掉百分之一。他說 OpenAI 的額度「小任務用不完」,我的數字更極端——不是用不完,是幾乎沒動。原因不是模型不好,是我沒把工作派出去。
這件事翻轉了我對「該訂哪家」的想法。掄錘者把問題框成「花多少錢買到夠用的腦袋」,這在他的用量下是對的。但如果你跟我一樣,額度大半沒用,那瓶頸根本不在腦袋,在派工:有沒有把任務拆成可以丟出去的形狀。拆不出來,訂最強的模型也是閒著。
最後回到他的核心分界,稠密還是混合專家。我沒有本地卡可以驗這一段,但有一個旁證。8 月初我對比過同一家的兩個模型跑三類機械活,品質三比三打平,價錢差二十二倍(2026-08-02 實測,六題全部滿分,所以只能證明「這個難度以下打平」)。後來我把便宜那個設成預設,貴的只在便宜那個答錯時才升級。這跟他「35B 混合專家在短任務上也能用」是同一件事的另一面:在誤差還來不及累積的地方,貴的買不到準確度。
可以參考的資料
- 原片:掄錘者〈AI 大模型/Agent入门推荐,Qwen3.8 27B/DeepSeek V4 Flash/国产替代模型/GPT,Hermes/Codex/DSH/OpenCode体验对比!〉(2026-08-31 上架,18 分 33 秒;標題照錄原片,原片為簡體字)
- 我上一篇聽他談硬體的心得:〈本地模型 Qwen3.8 27B 適合你嗎?〉(2026-08-21),這集可以當那篇的模型與軟體篇
- 文中的秒數與缺陷數:我自己 2026-08-24 的同題對照,各家只跑一次,是旁證不是定論
- 額度用掉百分之一:2026-08-14 查詢當時的數字,之後有變動
- 開頭那段出自《莊子・養生主》庖丁解牛,是我聽這集想到的註腳,不是節目內容
帶得走的一件事
我聽完這集最有感的一句是:一步答完的事付最便宜的,要跑一百步才值得付貴的。我自己就是因為這句,才放棄了「先訂最強的再說」這個習慣。
如果你也訂了不只一家,我試過一個很小的做法,你可以試試:下次打開付費工具之前,先看一眼這個月額度用了幾成,把那個百分比寫在便利貼貼在螢幕邊。就這樣,寫完就好,不用再做別的。
我的數字是百分之一,看到的時候有點不好意思。如果你的也差不多,別急著換家——找一件你每週都要重複做的事,整件丟給它跑一次看看。下個月同一天再瞄一眼便利貼,數字動了,就代表你找對了可以丟出去的工作;沒動也沒關係,那只是說瓶頸還不在工具,在我們還沒把工作拆成能丟出去的形狀。