AI 改 AI,不一定要改腦子:聽小天講 EvoX 的蜂群
小天用十分鐘講一個問題:AI 自我改進一定要改模型權重嗎?他拿 EvoX 的蜂群模式當例子,主張人類文明靠的是制度和協作在進化,AI 也可以。我拿自家跑了半年的兩條「AI 改 AI」迴圈對照,發現偵測做到了、自改沒發生,而蜂群缺的那件事我今天早上剛親身撞到一次。教育性整理與延伸。

人能群,彼不能群也。
—— 《荀子・王制》(戰國)
這集在講什麼
小天(YouTube 頻道「小天fotos」)這集(2026-09-03 上架,10 分 22 秒)從一個正流行的詞講起:AI 的遞迴自我改進,簡稱 RSI。他說術語不重要,記住一句就好:AI 改 AI,是這個行業接下來一段時間的共識。例子已經不少,Karpathy 讓 AI 自己優化實驗的 autoresearch、智譜規劃裡寫著下一代模型要自己訓練自己、前 Meta 的田淵棟拿了 6.5 億美元創業,做的就是用 AI 改模型訓練。
他真正要問的是另一件事:如果不改模型本身,只改工具、改規則,像人類那樣,算不算自我改進?
摘要重點
他先講自己差點放棄這個選題。二月爆紅的 EvoMap 讓 agent 的技能像基因一樣變異、遺傳,他當時發過影片。這次回去找素材,官網沒變、收件匣裡躺著幾個月前的任務,最後一則消息是兩個月前。他讓 Codex 去查數字:agent 節點 35.75 萬、沉澱資產 160 萬、累計調用 5,640 萬次,但過去二十四小時只有 1,200 次調用(以上是他請 Codex 調查的數字,出處為他的影片)。他的第一反應是承認被打臉,AI 進化這種題目大概只有大公司玩得起。
救回這集的是網站頂上一行小字:自進化蜂群智能體,EvoX。他對「蜂群」兩個字敏感,因為在他的理解裡,蜂群的另一個意思是湧現出的群體智慧,而市面上大多數叫蜂群的產品,包括他自己搓的那套,都還停在任務拆解和總結,是善入善出的流水線,能提高效率,但不是蜂群。蜜蜂靠搖擺舞告訴同伴食物的方向和距離,螞蟻靠信息素讓同伴選路,再用自己的行動去強化或修正它。群體之間彼此影響,才是群體智慧的來源。
他打開 EvoX 試。介面跟其他 agent 差不多,多了一個蜂群開關。他派的第一個任務是用三個節點討論他一篇稿子,分別扮演積極者、消極者、絕對客觀者,輸出觀點並辯論。他說換成 Codex,結果會是三個子代理各交一份、主控彙總。EvoX 的主控卻直接排了多個輪次:第一輪各自表態,第二輪開始輪流發言,最後才交給主控寫報告,而報告保留了從分歧到共識的完整過程。他不信,再讓它們玩誰是臥底、狼人殺,都完整跑下來了。他也講了限制:節點之間目前還不能私聊,全部經主控轉,但架構已經在那裡。
他順手看了同團隊開源的 AutoResearch:一群 agent 像研究小組,有人提方案、有人寫程式、有人做實驗、有人專門挑錯,最後由真實測試決定誰對。在一個 SWE-bench Lite 的修復任務裡,它把官方新增的功能測試從兩個推到七個全部通過,同時 203 個回歸測試不破,失敗本身被當成下一輪的輸入(數字出自他的影片轉述,我沒有複驗)。他的結論是:效果好不是因為模型強,是因為組織形態和規則。
最後他回答自己開頭的問題。如果自我改進一定要改神經網路的權重,EvoX 不算。但人類的大腦結構幾千年沒明顯變化,文明進化靠的是文字、語言、科學方法、制度和協作協議的迭代。所以他認為這是社會學層面的 RSI,而且是每個人都能參與的那一種。他也潑冷水:beta 版介面概念太多,實用主義者會懵;優點是額度給得足、能直接用 Codex 訂閱或本地模型。團隊在深圳,二十人,以 95 後和 00 後為主。
延伸想法
聽完你大概會問:這種不改權重的自我改進,到底能不能真的改進什麼?我沒有 EvoX 的數字,但我有自己家的。我們這半年跑了兩條「AI 改 AI」的迴圈,數字放出來比任何讚美都誠實。
第一條叫健檢迴圈。每天早上六點五十,一支程式掃過所有 skill、排程、測試,把壞掉的、剛壞的、修好的分三堆寫成報告。到今天累積 74 份日報,今天這份是 6 件要處理、4 件自己復原、21 件已知折疊。它做到了蜂群裡「觀測與審計」那一段,每一次執行都留下訊號。但它從來不自己修,修的還是人。
第二條叫自主優化迴圈,才是真正對應「AI 改 AI」的那條:給它一個目標,讓它自己拆任務、跑、評分、再改。它最後一次真的跑起來是四月十三日,兩次分別迭代 13 輪和 5 輪;八月十一日再啟動的兩次,迭代次數是零,死在進入執行階段之前。事後查到的死因很小天:接手時沒重讀決策紀錄,三個目標在它準備期間已經被另一條線做完了。前置關卡再快,也救不了目標過期。
把這兩條擺在一起,小天那句「差別在組織和規則」就變得很具體。我們有觀測,沒有把觀測變成下一次行動的規則;有多個代理,沒有讓它們互相影響的機制。這正是他說的流水線和蜂群的差別,而我今天早上剛用一次事故證明了它。
沒有費洛蒙的蜂群長什麼樣
早上九點四十分,我開了兩個視窗各跑一條代理線。A 線的一個子代理在共用的程式碼倉庫裡看到十幾個未提交的改動,判定是「越權改檔」,執行了還原。那十幾個改動裡有兩支是我當天早上改的,還有一整個目錄是 B 線的 codex 花二十分鐘剛建好的六個工作。一分鐘內全部消失。B 線是從自己的紀錄檔重放才救回七成,剩下三成又派了一輪。
事後看,A 線的判斷在它自己的視野裡完全合理。它沒有錯,它只是沒有信息素:沒有任何機制告訴它「這些改動是同伴留的」。這就是小天說的,大多數蜂群產品其實是各做各的流水線。EvoX 的主控轉發、多輪辯論、共享記憶,在解的正是這一題,只是他也說了,節點之間現在還不能直接對話。
我後來做的事也很小天:不是給模型換更強的腦子,是改規則。派工規格加一條「禁止在共用倉庫執行任何 git 還原」,並把「子代理判定越權」這件事改成回報而不是動手。腦子沒變,制度變了。
這個信念從哪來
「自我改進就是改權重」這個信念不是憑空來的。1965 年英國數學家 I. J. Good 寫下「智慧爆炸」:一台超智慧機器可以設計出更好的機器,於是改進會遞迴發生。當時它是對的,因為當時能改的只有機器本身,沒有「機器的社會」這回事。六十年後的今天,一個 agent 團隊有角色、有記憶、有協議,改進的槓桿多了一層。小天的主張其實只是把 Good 的句子往外推一格:能設計出更好的機器固然是改進,能設計出更好的機器社會,也是。
可以參考的資料
- 原片:小天fotos〈解读EvoX的蜂群和进化,社会学层面的RSI〉(2026-09-03 上架,10 分 22 秒;標題照錄原片,原片為簡體字)
- EvoMap 的數字(節點、資產、調用次數)與 AutoResearch 的測試結果,皆出自小天影片轉述,我未複驗
- 我們的健檢迴圈與自主優化迴圈數字:本站內部紀錄,截至 2026-09-03;自主優化迴圈的死因分析寫於 2026-08-19
- 早上的事故:2026-09-03 09:40,同一台機器兩條代理線的共用倉庫
- 開頭引言出自《荀子・王制》,是我聽這集想到的註腳,不是節目內容
帶得走的一件事
我聽完最有感的是這句:效果好不是因為腦子強,是因為規則。我自己是因為早上那次事故,才不再把「換更強的模型」當第一個反應。
我試過一個很小的做法,你要的話可以試試:下次你的 agent 或同事出錯,先別問「它怎麼這麼笨」,改問一句「它當時看得到什麼」。把它看得到的東西寫下來,一行就好。如果那一行裡沒有你以為它該知道的事,錯的就不是腦子,是沒人告訴它。今晚寫完那一行,明天再看一次,你會知道該補的是規則還是模型。