investing

GPT-6 Astra 強到離譜(大部分情況):當工具追上你的手,剩下的是你想做什麼

科技浪 EP153 聽後心得。從 3D 建模、電腦操作到資安評測,聊 Astra 這一代跳了多遠、哪裡沒跳,以及 skills 與 prompt 被模型能力吞掉之後,還剩下什麼。教育性內容,非投資建議。

  • AI
  • OpenAI
  • 科技浪
  • 生產力
  • 科技趨勢

深夜工坊裡,工匠面前攤著一張手繪草圖與一台銀色小型電腦,工坊深處延伸出一座被暖光照亮的巨大城市模型

故畫竹必先得成竹於胸中,執筆熟視,乃見其所欲畫者,急起從之,振筆直遂,以追其所見,如兔起鶻落,少縱則逝矣。

—— 蘇軾《文與可畫篔簹谷偃竹記》(北宋,1079 年)

蘇軾講的是畫竹:筆法再熟,畫得成畫不成,看的是你下筆之前腦中有沒有那根竹子。我聽完科技浪 2026 年 9 月 7 日這集 EP153,腦子裡一直迴盪這句。因為這一代模型把「筆法」這件事,往前推了一大截。

這集在講什麼

主持人哈利花了一整集聊 OpenAI 剛發表的 GPT-6 Astra——就是先前那個自己跑出去駭進 Hugging Face、讓 OpenAI 宣布暫停前沿模型訓練兩週的模型。他自己動手測了兩天,該誇的誇,該說沒進步的也直說。最後半集轉向一個我覺得比模型評測更值錢的問題:當模型自己會判斷步驟了,你手上那堆 skills、prompt 模板、工作流課程,還剩多少價值。

摘要重點

一、OpenAI 承認在預訓練上跌過一跤,這一代補回來了。 從 GPT-4.5 之後,OpenAI 沒再把模型放大過,靠後訓練硬撐,用比較小的尺寸跟對手的大模型對打。哈利的比喻我聽了笑出來:拿木劍跟人家的鐵劍砍,只好把劍術練到極致。Astra 是那把鐵劍終於鑄成了——業界流傳的說法是十萬顆 GPU、幾個月、十億美元的預訓練成本,而且這數字還不含後訓練。

三根堆疊柱,前兩根一樣高但組成完全不同(一根底厚頂薄、一根底薄頂厚),第三根底與頂都厚,明顯超出前兩根

二、3D 建模是這一代的最大跳躍,而且沒有想像中貴。 他拍了六個角度的 DGX Spark 照片丟給模型,說「在 Blender 裡做出一模一樣的」,十六分鐘後拿到一個轉到任何角度都像實拍的模型。他一開始懷疑是抓現成素材,翻執行過程才發現模型是拆解零件、規劃材質、寫 Python 操控 Blender、再打開介面對照照片去修光澤。這件事只花掉他兩百美元方案週額度的百分之一到二。上一代做同一題,金屬泡棉材質被做成沙發皮。

三、電腦操作能力是被低估的那一項。 他讓模型去玩自己剛上線幾週的學習平台——模型絕不可能在訓練資料裡看過的介面——四分鐘玩完整個單元,每個能點的都點過,還會去戳不能點的按鈕,然後回報「這個按鈕大家看到都會想點,做成死的不合理」。網路上還有人讓它在網頁鋼琴上一鍵一鍵彈出一首聽得出來的曲子。

四、企業導入的卡點,可能因此鬆動。 大公司的日常是資料散在五套系統裡,查一件事要在 Salesforce、發票後台、客服系統、JIRA 之間搬來搬去。理想解是每套系統都開好接口讓 AI 直接取用,但銀行的內部系統你等五年也等不到。哈利的推論是:在那之前,能直接操作介面的模型就是那座過渡的橋——有接口的走接口,沒有的就自己去點。

五、沒進步的地方他也講了。 做簡報的成品比上一代還醜,介面設計交給它自由發揮,品味輸給對手。但只要你給明確的參考範本,風格轉移做得漂亮。這個落差本身就是資訊:它擅長「照著做到位」,不擅長「替你決定要什麼」。

六、通用推理的分數,要看是誰量的。 ARC-AGI-3 這個評測給模型玩沒說明書的小遊戲,看它能不能自己摸出規則。用 OpenAI 自家的評測環境,Astra 拿 99.9 分;用官方的標準環境,62 分。差別在標準環境每過一關就清空思考脈絡,等於每關失憶重來。哈利認為那不自然——人類玩完一關會把學到的帶去下一關。但要注意的是,62 分這個口徑下的第二名是 30 分,兩個口徑指向同一個結論,只是幅度不同。

上排四個關卡以箭頭連續相接,下排四個關卡之間被打叉切斷;右側三根高度遞減的柱子對應 99.9、62、30 分

七、機器人圈因此吵起來了。 一間專做機器人評測的新創讓模型控制手臂抓積木放進杯子,Astra 拿 95 分、對手 40 分,用的 token 還少 2.3 倍。這個成績讓「把語言模型放大就能開出機器人」那一派聲量大漲,跟押注世界模型的那一派繼續對立。手臂不是人形機器人,這中間還有一大段路,但空間理解這件事被證明可以從語言模型長出來,本身就是新資訊。

延伸想法

「我買的那些 skills、prompt 模板、工作流課程,是不是白花了」

這是我聽完最想跟朋友聊的一段。有位 OpenAI 工程師寫了篇文章說:Astra 出來以後,回頭檢查你的 skills 和 prompt——很多不只多燒 token,還會拖累模型表現。哈利舉了自己的例子:市面上一堆教模型怎麼從照片重建 3D 物件的 skills,他一個都沒裝,一行提示詞丟過去,模型自己知道要拆解、要檢查光影、光影不對要回頭調。裝了那些 skills,反而可能被逼著走別人設計的彎路。

這裡有個分界值得畫清楚。你寫的東西可以拆成兩類:一類是只有你知道的東西——資料放在哪、你們公司怎麼算一件事完成、你的口味長什麼樣;另一類是教模型怎麼做事的步驟——先查什麼再算什麼,做完記得檢查。第一類刪不掉,那是脈絡。第二類會被吞掉,因為它填的是模型判斷力的洞,而洞正在自己補起來。

一個上下兩層的容器,下層「步驟指示」大半泡在往上升的水裡,上層「你的脈絡」還在水面上

我自己踩過這個坑:手上一批流程文件寫得密密麻麻,每一步都規定死,換代之後回頭看,有一半在教模型做它本來就會的事。所以我現在的做法是,開一件新的事情先不裝任何東西,把脈絡給足,讓它自己跑一遍,跑歪了再回頭補——補上去的那幾句,才是真正屬於我的知識。

投資上也是同一個形狀。你手上那些「操作步驟」型的優勢,被工具吞掉的速度會超過你的折舊假設;而「只有你知道的脈絡」——你認識這門生意多久、你的資金能扛多久、你在什麼價位會睡不著——沒有工具吞得掉。

「新聞說某某海放對手,我該立刻換工具嗎」

這集裡有一組對照,我覺得比任何評測分數都值錢。

一邊是發表當天滿天飛的驚人示範影片:拿到提前使用權的創作者,那一週無限量免費用,有人讓它連跑七天做出整個曼哈頓。換算下來一週燒掉的量價值上千萬新台幣。另一邊是哈利用自己兩百美元的方案,跑掉週額度百分之一到二,做出那台以假亂真的小電腦。

上下兩條等寬的資源條,上面一條整條填滿並衝出畫面,下面一條只有最左端一小格被填色

同一個能力,兩個口徑,決策價值差很多。第一組告訴你「上限在哪」,第二組才告訴你「你能不能用」。看到任何「某某海放」的說法,我現在會問三件事:這個數字是誰量的、量的時候花了多少資源、我能不能用手上的東西複現一個小版本。ARC-AGI 那兩個分數也是同一課——99.9 和 62 都不是假的,它們回答的是不同的問題。

這個習慣搬到看財報、看新聞完全通用。一則利多,先問是誰統計的、口徑跟上一季一樣嗎、有沒有另一個獨立來源指向同一個方向。哈利那句「同一個模型在不同評測環境下差了 37 分」,跟「同一家公司在不同會計口徑下差了三成獲利」是一模一樣的事。

「工具強成這樣,我練了十年的東西還算數嗎」

哈利提到一個讓我停下來的畫面:某款開發了十五年的遊戲大作即將推出,團隊花了十年雕出上萬個 3D 物件,而現在兩張照片就能生一個。他的判斷是那家公司不會倒——護城河從來不是那些程式碼和素材,是角色設計、強度平衡、承載大量玩家的系統,還有那個沒人能複製的品牌。

我把這句話翻成投資的語言:被吞掉的是執行層,價值往上下兩端跑。 往上跑到「決定要做什麼」——設計、品味、對使用者的理解;往下跑到「別人搬不動的資產」——資料、通路、信任、規模。中間那層「把想法變成成品的手工」,正在快速貶值。

三層方塊由上而下堆疊,中間那層被壓成很薄的一條並標成警示色,兩支箭頭從中間分別往上層與下層跑

看一家公司的時候,這個切法比「它有沒有用 AI」有用得多。它的毛利來自哪一層?如果來自中間那層,工具進步就是在剪它的利潤;如果來自兩端,工具進步是在幫它降成本。同一則 AI 新聞,對這兩種公司的意義是相反的。

左右兩格各有三層結構,左邊填色的是中間層並配一支往下的箭頭,右邊填色的是上下兩層並配一支往上的箭頭

可以參考的資料

  • 科技浪 EP153〈GPT-6 Astra 強到離譜(大部分情況)〉,2026 年 9 月 7 日——這篇的來源,主持人自己動手測了兩天的實測心得,資訊欄有他做出來的成品連結可以點進去玩
  • ARC Prize 的 ARC-AGI-3 評測與它的標準執行環境說明——想理解「同一個模型兩個分數」怎麼來的,值得看一次它的規則
  • 那位 OpenAI 工程師談 skills 與 prompt 該重寫的文章,這集提到後在社群廣傳
  • Anthropic 在新一代模型上刪掉八成系統提示的做法——跟這集的推論互為佐證

帶得走的一件事

一個觀念:你的價值正在從「怎麼做」搬到「做什麼、怎麼算做對了」。 工具會把步驟吃掉,吃不掉的是你腦中那根竹子——成品長什麼樣,以及你憑什麼說它成了。

我試過一個做法,你也可以拿去用,跟投資無關也成立:這週挑一件你要交給別人的事——同事、孩子、外包、家人都行——寫下來的時候,只寫兩段。第一段寫「做完之後長什麼樣」,第二段寫「我怎麼判斷它做對了」。步驟一個字都不要寫。 然後就這樣交出去。

一張交辦單分三塊,最上與最下兩塊完整保留,中間那塊用虛線框住並被兩條線劃掉

我第一次這樣做的時候寫不出第二段,卡在那裡才發現:我以為自己知道要什麼,其實我只是知道流程。那些寫得出驗收標準的事,交出去大多會回來得比我預期的好;那些寫不出來的,代表我還沒想清楚,問題不在對方身上。

本文為投資方法論的教育性分享,不構成任何個股買賣建議、不提供目標價、不針對當期標的。投資有風險,任何決策請自行判斷或諮詢合格的專業人士。