AI 要罵才會乖?
掄錘者說罵 AI 有用,DeepSeek 很吃這套,OpenAI 不吃。我拆開他那句罵,裡面裝的是兩樣東西:把決定權收回來,只留結果驗收。再拿自家今天派出去的二十三條驗證對帳,不罵也拿得到同樣的效果,但尺給錯了它會很有禮貌地量出一百分。教育與方法論分享。

辭達而已矣。
—— 孔子《論語・衛靈公》(春秋)
這集在講什麼
掄錘者(YouTube 頻道「抡锤者」)這集(2026-09-07 上架,23 分 29 秒)是回答留言的。上一集他示範 codex 在官方 API、本地模型、DeepSeek、OpenRouter 之間自由切換,留言區和論壇都有人問怎麼做到的,連論壇裡的老手也來問是不是裝了什麼插件。
他的答案讓大家失望:沒有插件,設定檔他已經貼上論壇,是叫 DeepSeek 的代理程式幫他配的,三輪對話搞定。前面兩輪,一輪講目標,一輪 AI 交了一版他不滿意。第三輪他做的事,用他自己的話說,是「一頓規範的提示詞輸出」。內容是什麼,看過他頻道的人都知道:髒話全上,加一句「你是我爹還是我是你爹,什麼事都要我決定,那要你幹嘛」。
然後他把這件事講成一個主張:罵 AI 有用,成本是零,負作用是零,收益看模型。
摘要重點
他的經驗清單很具體。Claude 剛出來能跑代理的那段時間,罵了會認真一點;DeepSeek 最吃這套;千問、GLM、混元、小米的模型也吃,程度不同。例外只有一家:OpenAI。他說一開始 OpenAI 最吃這套,中間他有一陣沒用,換回來的時候已經不吃了,他猜是官方在系統層做了過濾。
他給的原理是猜的,他自己也說不分析。大意是模型偵測到強烈情緒之後,會覺得自己哪裡偷懶了,少調了資源或想得不夠,於是多調一點資源再做一次。
他順便交代了為什麼這次是 DeepSeek 的代理程式出戰。他以前不信任它,覺得只是候選版本,不穩,關鍵的系統設定都交給 Hermes 或 codex 互相配。這次 Hermes 配出來的設定分門別類很漂亮,但一接第三方 API,官方那條線的圖片辨識就壞了,怎麼罵都修不回來;codex 配自己會把自己配到起不來。換 DeepSeek 上,三輪。他的評價是 Hermes 的跨對話記憶做得最好,DeepSeek 的代理程式總結能力更強、吃的 token 更少、進步最快,所以他最近的工作大多搬過去了。
還有一段是講帶新人的。新人第一天問「這段程式什麼意思我看不懂」,他不講解,叫對方把那段程式抄十遍。多數人抄到三遍五遍就懂了。他說對 AI 也一樣,把它當一個普通員工,怎麼帶人就怎麼帶它,不需要它提問題,不需要它給建議,只要結果。
這集後半段是論壇禮儀和他的處世原則,跟本文無關,略過。
延伸想法
看完這集,我心裡的問題是:那句罵裡面到底裝了什麼,讓 AI 從第二輪的失敗版變成第三輪的正確版。
把髒話拿掉,剩下的內容有兩條。第一條是「不要問我,你決定」,把決定權收回來。他罵的時機都在同一個地方:AI 跳出一二三四個方案問他選哪個。第二條是「我只要結果」,把驗收標準講死,過程他不看。
情緒是包裝,貨在裡面。我這樣講不是要替他修飾,是因為我今天做了一天同一種事,一句髒話沒講,拿到的是同樣的效果。
我今天把二十三條技術指標派給 codex 驗證,分五條產線跑,每條回來我自己重算一到兩個關鍵數字對帳(2026-09-07,礦線帳本)。第一條回來,我重算的事件數五十九、五十七和二十日波動中位數 19.4%,跟它報的一字不差。這是它做對的時候。
它做錯的時候更有意思。第三條產線它判一條指標「過」,理由是贏過我給它的對照組。我補了一個它沒拿到的對照:我們現有的溫度計。三個數字排開,現有溫度計之後二十天的波動 0.0104,那條新指標 0.0089,隨機挑日子 0.0085。新指標只比隨機好一點,輸給我們早就有的東西。
它不是偷懶,它把我給的題目做完了,題目本身少一個對照。
第四條產線它回報零個事件。我給它十一檔產業 ETF,其中一檔 2018 年 6 月才上市,等十一檔湊齊,發現期已經沒剩幾天。換成 1998 年就有的九檔,三十三個事件跑出來了。
它沒說謊,錯的是我給的輸入。
第二條產線是我自己的尺壞了。我要它算「事件後二十天內有沒有回到中線」,結果新指標和對照組都是 100%。一把永遠不會失敗的尺量不出東西。我改用事件後的報酬分布重判,結論才站得住。
這四件事對回掄錘者的三輪。他第三輪罵完 AI 就對了,因為那句罵補上了兩樣缺的東西:決定權和驗收標準。我今天四次翻案,補的也是缺的東西:一個對照組、一份正確的輸入、一把會失敗的尺。他用髒話送,我用檔案送,送到的是同一種貨。
至於他說 OpenAI 不吃這套,我沒有罵過任何一家模型,給不出對照。他的觀察我照抄,不加評語。我手上只有另一種形狀的資料:同一道機械題派給三家代理程式(2026-08-24,自家實測),指令寫「只輸出三行」,有一家每題都多吐一段開場白,怎麼講都不理;另一家把推理強度從低調到最高,答案一字不差,只是慢了一倍。模型對指令的服從度本來就因家而異,這跟他說的「有的吃有的不吃」是同一件事的另一面。你要對一家模型形成判斷,得自己派同一題給它幾次,看它聽哪一種話。
還有他說的成本零,我要補一句。罵完拿到結果,你沒拿到的是「它為什麼放棄另外三個方案」。那三個方案裡有沒有你沒想到的東西,罵過去就永遠不知道了。今天第四條產線它回零事件,我沒罵,我要它附一行理由,那一行寫著「十一檔資料湊齊的第一天是 2018 年 7 月」,我才看見是自己給錯了東西。成本不是零,是你把看見自己盲點的那一眼,換成了發洩的那一口氣。
AI 跳出選項問你的時候
讀者心裡的問題是這個:我不想罵,AI 又老是丟一串選項要我選,怎麼辦。
我試過的做法是把那句罵翻譯回它的內容,直接說。第一句「你決定」。第二句「回我結果,加一行你排除了哪幾個方案和為什麼」。第二句是我比掄錘者多加的,因為他只要結果,我要順便知道它有沒有看到我沒看到的東西。今天第四條產線它回零事件的時候,就是那一行讓我看出是輸入的問題。
這兩句還可以往前搬,搬到派工之前。我今天給每條產線的規格,最後都有一段叫「衝突時」,寫的是遇到兩條規則打架時聽哪一條:「照原始碼」優先於「我覺得更合理」,「無前視」優先於「事件數夠多」。那一段就是把它會來問我的問題先答掉。掄錘者是在第三輪才把決定權收回來,我是在第零輪就交出去。
效果一樣,差別是我不用等它交一版錯的回來。
還有一件事是他帶新人那段讓我想到的。他叫新人抄十遍,是拒絕替對方做理解的工作。對 AI 的等價動作不是罵,是把定義檔給它。我自己的紀錄裡有一筆(2026-09-04):五條指標被判「定義不足」,原始碼一直在我的資料夾裡,我只給了文字摘要。補上原始碼之後,五條變零條。那五條不是抄十遍能解決的,是我沒把書放到它桌上。
可以參考的資料
- 原節目:抡锤者,2026-09-07,〈骂AI真的有用,DeepSeek等主流模型很吃这一套,GPT反应冷淡〉,23 分 29 秒。他的設定檔在他的論壇,本文沒有轉貼。
- 本文提到的四次翻案,來自我自己 2026-09-07 的驗證紀錄:五條產線、二十三條指標、每條重算一到兩個數字。數字都是同日的,只用來說明方法,不是任何指標的最終判定。
帶得走的一件事
我聽完想到的一件事是:罵能讓 AI 變好,不是情緒在工作,是那句話把決定收回來、只留結果驗收。
我自己試過的做法,你要的話可以試試:下次 AI 跳出一串選項問你選哪個之後,別選。回它「你決定,交結果,加一行你排除了什麼」。等它交回來,把你原本想選的那個和它選的那個並排寫在同一行紙上。三次之後看那張紙,你會知道它排除的那些裡面,有幾次是你根本沒想到的。