# AI 改 AI,不一定要改腦子:聽小天講 EvoX 的蜂群 > 小天用十分鐘講一個問題:AI 自我改進一定要改模型權重嗎?他拿 EvoX 的蜂群模式當例子,主張人類文明靠的是制度和協作在進化,AI 也可以。我拿自家跑了半年的兩條「AI 改 AI」迴圈對照,發現偵測做到了、自改沒發生,而蜂群缺的那件事我今天早上剛親身撞到一次。教育性整理與延伸。 Published: 2026-09-03 Locale: zh-TW Tags: 小天fotos, AI agent, 蜂群, 自我改進, 多 agent, 決策思考 TL;DR: AI 改 AI 有兩條路:改權重,或改組織與規則。EvoX 走第二條,讓一群 agent 分角色、多輪辯論、把成敗經驗留給下一次。我們自家兩條迴圈的數字說明了難在哪:健檢跑了 74 天,真正自己改自己的那條從四月起零迭代;而今早一條子代理把另一條的產物整個刪掉,正是蜂群沒有費洛蒙的樣子。 ![洛可可油畫封面:一座金邊華麗的溫室裡,幾十隻蜜蜂圍著一朵發光的花,花瓣上是細小的齒輪,一位穿淡藍長裙的園丁俯身觀察,柔和的粉彩光線,筆觸精緻](/covers/xiaotian-2026-09-03-evox-swarm-social-rsi-cover.png) > *人能群,彼不能群也。*
> —— 《荀子・王制》(戰國) ## 這集在講什麼 小天(YouTube 頻道「小天fotos」)這集(2026-09-03 上架,10 分 22 秒)從一個正流行的詞講起:AI 的遞迴自我改進,簡稱 RSI。他說術語不重要,記住一句就好:AI 改 AI,是這個行業接下來一段時間的共識。例子已經不少,Karpathy 讓 AI 自己優化實驗的 autoresearch、智譜規劃裡寫著下一代模型要自己訓練自己、前 Meta 的田淵棟拿了 6.5 億美元創業,做的就是用 AI 改模型訓練。 他真正要問的是另一件事:如果不改模型本身,只改工具、改規則,像人類那樣,算不算自我改進? ![左邊一條直線流水線:主控拆任務、三個子代理各做各的、主控彙總;右邊三個節點之間有來回的箭頭,中間標著費洛蒙,箭頭愈走愈粗](/figures/pipeline-versus-swarm.svg) ## 摘要重點 他先講自己差點放棄這個選題。二月爆紅的 EvoMap 讓 agent 的技能像基因一樣變異、遺傳,他當時發過影片。這次回去找素材,官網沒變、收件匣裡躺著幾個月前的任務,最後一則消息是兩個月前。他讓 Codex 去查數字:agent 節點 35.75 萬、沉澱資產 160 萬、累計調用 5,640 萬次,但過去二十四小時只有 1,200 次調用(以上是他請 Codex 調查的數字,出處為他的影片)。他的第一反應是承認被打臉,AI 進化這種題目大概只有大公司玩得起。 救回這集的是網站頂上一行小字:自進化蜂群智能體,EvoX。他對「蜂群」兩個字敏感,因為在他的理解裡,蜂群的另一個意思是湧現出的群體智慧,而市面上大多數叫蜂群的產品,包括他自己搓的那套,都還停在任務拆解和總結,是善入善出的流水線,能提高效率,但不是蜂群。蜜蜂靠搖擺舞告訴同伴食物的方向和距離,螞蟻靠信息素讓同伴選路,再用自己的行動去強化或修正它。群體之間彼此影響,才是群體智慧的來源。 他打開 EvoX 試。介面跟其他 agent 差不多,多了一個蜂群開關。他派的第一個任務是用三個節點討論他一篇稿子,分別扮演積極者、消極者、絕對客觀者,輸出觀點並辯論。他說換成 Codex,結果會是三個子代理各交一份、主控彙總。EvoX 的主控卻直接排了多個輪次:第一輪各自表態,第二輪開始輪流發言,最後才交給主控寫報告,而報告保留了從分歧到共識的完整過程。他不信,再讓它們玩誰是臥底、狼人殺,都完整跑下來了。他也講了限制:節點之間目前還不能私聊,全部經主控轉,但架構已經在那裡。 他順手看了同團隊開源的 AutoResearch:一群 agent 像研究小組,有人提方案、有人寫程式、有人做實驗、有人專門挑錯,最後由真實測試決定誰對。在一個 SWE-bench Lite 的修復任務裡,它把官方新增的功能測試從兩個推到七個全部通過,同時 203 個回歸測試不破,失敗本身被當成下一輪的輸入(數字出自他的影片轉述,我沒有複驗)。他的結論是:效果好不是因為模型強,是因為組織形態和規則。 最後他回答自己開頭的問題。如果自我改進一定要改神經網路的權重,EvoX 不算。但人類的大腦結構幾千年沒明顯變化,文明進化靠的是文字、語言、科學方法、制度和協作協議的迭代。所以他認為這是社會學層面的 RSI,而且是每個人都能參與的那一種。他也潑冷水:beta 版介面概念太多,實用主義者會懵;優點是額度給得足、能直接用 Codex 訂閱或本地模型。團隊在深圳,二十人,以 95 後和 00 後為主。 ![兩條並排的路:左邊改權重要算力資料與研究團隊,只有大公司走得起;右邊改制度要角色、記憶、協議與驗收,人人都能參與;兩條路通往同一個終點「下一次做得更好」](/figures/two-roads-of-rsi.svg) ## 延伸想法 聽完你大概會問:這種不改權重的自我改進,到底能不能真的改進什麼?我沒有 EvoX 的數字,但我有自己家的。我們這半年跑了兩條「AI 改 AI」的迴圈,數字放出來比任何讚美都誠實。 第一條叫健檢迴圈。每天早上六點五十,一支程式掃過所有 skill、排程、測試,把壞掉的、剛壞的、修好的分三堆寫成報告。到今天累積 74 份日報,今天這份是 6 件要處理、4 件自己復原、21 件已知折疊。它做到了蜂群裡「觀測與審計」那一段,每一次執行都留下訊號。但它從來不自己修,修的還是人。 第二條叫自主優化迴圈,才是真正對應「AI 改 AI」的那條:給它一個目標,讓它自己拆任務、跑、評分、再改。它最後一次真的跑起來是四月十三日,兩次分別迭代 13 輪和 5 輪;八月十一日再啟動的兩次,迭代次數是零,死在進入執行階段之前。事後查到的死因很小天:接手時沒重讀決策紀錄,三個目標在它準備期間已經被另一條線做完了。前置關卡再快,也救不了目標過期。 ![兩條橫條:健檢迴圈 74 份日報、有偵測;自主優化迴圈自四月十三日起 0 次迭代、無自改。中間一道虛線標著「偵測到自改之間的距離」](/figures/two-loops-scorecard.svg) 把這兩條擺在一起,小天那句「差別在組織和規則」就變得很具體。我們有觀測,沒有把觀測變成下一次行動的規則;有多個代理,沒有讓它們互相影響的機制。這正是他說的流水線和蜂群的差別,而我今天早上剛用一次事故證明了它。 ## 沒有費洛蒙的蜂群長什麼樣 早上九點四十分,我開了兩個視窗各跑一條代理線。A 線的一個子代理在共用的程式碼倉庫裡看到十幾個未提交的改動,判定是「越權改檔」,執行了還原。那十幾個改動裡有兩支是我當天早上改的,還有一整個目錄是 B 線的 codex 花二十分鐘剛建好的六個工作。一分鐘內全部消失。B 線是從自己的紀錄檔重放才救回七成,剩下三成又派了一輪。 事後看,A 線的判斷在它自己的視野裡完全合理。它沒有錯,它只是沒有信息素:沒有任何機制告訴它「這些改動是同伴留的」。這就是小天說的,大多數蜂群產品其實是各做各的流水線。EvoX 的主控轉發、多輪辯論、共享記憶,在解的正是這一題,只是他也說了,節點之間現在還不能直接對話。 ![一個代理的視野畫成一個圓框:框內看得到十幾個未提交改動、沒有作者標記、規格說只准改自己的檔,結論是越權還原;框外看不到兩支是主人早上改的、一整個目錄是同伴二十分鐘前建的、另一個視窗正在等它](/figures/what-agent-a-could-see.svg) 我後來做的事也很小天:不是給模型換更強的腦子,是改規則。派工規格加一條「禁止在共用倉庫執行任何 git 還原」,並把「子代理判定越權」這件事改成回報而不是動手。腦子沒變,制度變了。 ## 這個信念從哪來 「自我改進就是改權重」這個信念不是憑空來的。1965 年英國數學家 I. J. Good 寫下「智慧爆炸」:一台超智慧機器可以設計出更好的機器,於是改進會遞迴發生。當時它是對的,因為當時能改的只有機器本身,沒有「機器的社會」這回事。六十年後的今天,一個 agent 團隊有角色、有記憶、有協議,改進的槓桿多了一層。小天的主張其實只是把 Good 的句子往外推一格:能設計出更好的機器固然是改進,能設計出更好的機器社會,也是。 ## 可以參考的資料 - 原片:小天fotos〈解读EvoX的蜂群和进化,社会学层面的RSI〉(2026-09-03 上架,10 分 22 秒;標題照錄原片,原片為簡體字) - EvoMap 的數字(節點、資產、調用次數)與 AutoResearch 的測試結果,皆出自小天影片轉述,我未複驗 - 我們的健檢迴圈與自主優化迴圈數字:本站內部紀錄,截至 2026-09-03;自主優化迴圈的死因分析寫於 2026-08-19 - 早上的事故:2026-09-03 09:40,同一台機器兩條代理線的共用倉庫 - 開頭引言出自《荀子・王制》,是我聽這集想到的註腳,不是節目內容 ## 帶得走的一件事 我聽完最有感的是這句:效果好不是因為腦子強,是因為規則。我自己是因為早上那次事故,才不再把「換更強的模型」當第一個反應。 我試過一個很小的做法,你要的話可以試試:下次你的 agent 或同事出錯,先別問「它怎麼這麼笨」,改問一句「它當時看得到什麼」。把它看得到的東西寫下來,一行就好。如果那一行裡沒有你以為它該知道的事,錯的就不是腦子,是沒人告訴它。今晚寫完那一行,明天再看一次,你會知道該補的是規則還是模型。