investing

OpenAI 的辣椒晶片:當複雜度可以外包給 AI,晶片設計的規矩就變了

科技浪 EP152 聽後心得。從 Jalapeño 在公開推論測試上贏過 Blackwell 這件事,聊三層:這些數字的口徑到底能推論到哪、一張晶片自己切換工作模式的設計為什麼省電、以及最關鍵的——當寫程式的複雜度可以交給 AI 承擔,晶片設計裡那些「太麻煩所以沒人做」的取捨就重新被打開了。教育性內容,非投資建議,不含個股推薦與目標價。

  • 半導體
  • AI晶片
  • OpenAI
  • 產業趨勢
  • 科技浪

資料中心深處一條長走道,兩側機櫃指示燈延伸到遠方消失點,最前方一雙戴手套的手把一片晶片舉在檢測燈下,晶片邊緣泛出微紅的光

世之奇偉、瑰怪、非常之觀,常在於險遠,而人之所罕至焉,故非有志者不能至也。

—— 王安石《遊褒禪山記》(北宋,1054 年)

險遠之地沒人去,不是因為那裡不好,是因為路難走。而一旦有人把路修平,原本因為難走而空著的地方,就會突然變得很擁擠。這集講的,本質上是這件事發生在晶片設計上。

這集在講什麼

《科技浪》2026 年 8 月 31 日這集(EP152),主持人哈利聊了 OpenAI 自研推論晶片 Jalapeño 剛公布的實測成績。這張晶片的名字就是墨西哥辣椒,主持人還特地說他每次吃 Subway 都要加雙份 Jalapeño——一個技術節目用這種方式開場,其實很好地說明了這集的氣氛:一件大家等了一年多、終於等到數字的事。

重點不只是「贏了」這個結果,而是三層東西:這些數字的口徑撐得起多大的結論、這張晶片在硬體上做了哪些以前不會做的設計、以及為什麼現在做得成。

摘要重點

一、爭論了一年的問題,第一次有了公開數字。 過去一年很多人猜測,專為 AI 設計的專用晶片在能源效率上會不會贏過輝達的通用繪圖處理器。但真正搬得上檯面的兩家(Google 的 TPU、亞馬遜的 Trainium)都沒有交出公開測試成績。黃仁勳過去一年最愛打的就是這一點:測驗擺在那裡給你跑,我們全跑完了成績都掛在網路上,你們為什麼不敢跑?沒有人回答。所以業界的共識大致是「他們大概是跑了發現不好看」。Jalapeño 是第一個真的把成績交出來的。

二、成績本身很兇。 使用的是 SemiAnalysis 的 InferenceX,目前公信力最高的推論測試。相同耗電下的吞吐量領先 1.5 到 1.9 倍;使用者從送出請求到拿到完整回答的端到端時間,快了 1.7 到 3.6 倍;如果不計成本、單純把延遲壓到極限,上限可以快 2.1 到 4.1 倍。而且不是只跑自家模型——跑了小、中、大三種尺寸、三種架構的模型,這在自家晶片的自家測試裡算是相當自律的做法。

三條由左向右延伸的橫條,起點都在代表上一代 Blackwell 的基準虛線右側,越往右代表領先越多;第三條「延遲極限」延伸得最遠。

三、但主持人自己列了四個保留,這比數字更值得記。 能耗是用晶片標稱的功耗上限去算,不是實際量測拔牆插座的耗電;測試範圍是單一機櫃內,不是整座 AI 工廠的規模,而輝達真正的強項恰恰在整廠層級的協同設計;測試的工作型態是固定的「長輸入、短輸出」,而現在最主流的其實是代理程式那種反覆來回的用法;比較對象是上一代的 Blackwell,但論製程與記憶體世代,Jalapeño 該對上的是 Rubin。主持人的判斷是:這四點會讓差距縮小,但不至於推翻結論。

四、最漂亮的硬體設計,是「一張晶片自己換模式」。 AI 推論其實分好幾個階段,需要的硬體完全不同:處理你整段提問的階段吃的是算力,一次要算完所有詞之間的關聯;逐字吐出答案的階段吃的是頻寬,每吐一個字就要把模型權重搬一次。傳統做法是不同階段交給不同晶片——這就必然要在晶片之間搬運中間結果,而且兩個階段的比例會隨著使用者的問題長短一直變,分配跟不上就會有一堆晶片閒著。Jalapeño 讓同一張晶片在不同模式間切換:中間結果不用搬了,用不到的運算單元直接關掉不吃電。省下來的是搬運成本加上閒置成本。

左右兩格對比,左格是上下兩個方塊之間有一條「搬中間結果」的箭頭並旁掛一塊閒置區;右格只有一個方塊,內部上下兩區以雙向箭頭切換,底下一排小格中有幾格是灰的表示關電。

五、真正的分水嶺在「空間架構」。 一般繪圖處理器上,工作分配是硬體自己做的——晶片內建的排程器看誰空著就把活丟給誰。好處是軟體好寫、換張卡也能跑、利用率有保底。壞處是排程器只看眼前,不會規劃。舉個主持人的例子:如果第一號核心算完的結果等一下要跟第三號核心的結果合併,排程器不知道,它會讓兩邊都把結果寫回記憶體,再另外派一個核心去把它們撈出來合併——繞了一大圈。空間架構讓軟體直接指定每一筆資料放在哪、由哪個核心算、算完直接傳給誰。上限高很多,因為每條路徑都能走最短的。

上下兩條資料路徑對比,上排的資料先繞進中間的記憶體再被撈出來合併,路徑折了三段;下排兩個核心之間直接一條短箭頭傳到結果。

代價是軟體複雜度暴增,而且寫壞了會比原本慢很多——某個核心被派了一件耗時的活,剛好大家都在等它的產出,整批就一起卡住。

六、以前沒人這樣設計,是因為沒人寫得動。 接觸過這張晶片的外部單位形容,OpenAI 寫的底層程式碼像在寫組合語言,一個核心程式可以到三千多行。三千行寫一個功能單元,你去哪裡找工程師寫?找不到,所以傳統上大家不會為了多榨一點效能,把整個開發過程搞成這樣。OpenAI 敢做,是因為那些複雜度現在是 AI 在扛——人類只要把功能寫對,資料流動怎麼排、捷徑怎麼走,交給編譯器與最佳化工具去磨。佐證是他們為三個架構不同的模型客製底層程式的過程非常短。

七、整條線最反直覺的一句話。 過去要榨效能,通常得走向極端專用化:把晶片死死綁在某一種模型架構上。Jalapeño 沒有這樣做——它跑得動別家的模型,甚至還被拿去跑《毀滅戰士》證明架構沒寫死。它同時拿到了「相對通用」跟「資料流動最佳化」,因為以前這兩者之間那個叫做「程式太難寫」的取捨,被 AI 吃掉了。附帶一提,從架構定案到設計交付台積電製造,只花了九個月,而這是他們的第一代晶片。

延伸想法

「新聞說某公司晶片打敗輝達了,我手上的部位要不要動?」

這是看到這種新聞時第一個冒出來的念頭,而它幾乎總是太快。因為「贏」這個字在晶片比較裡是個極度壓縮的說法,展開之後至少有三層口徑要問。

第一問:贏在哪個維度。 這次贏的是每瓦吞吐量與端到端延遲,不是絕對算力,也不是訓練能力——Jalapeño 根本不能拿來訓練模型。這句話很重要:它參加的是一場輝達也在跑、但只佔輝達業務一部分的比賽。一個只能做推論的選手在推論項目上贏了,跟「取代」是兩件事。

第二問:比較對象是不是同代。 對上的是 Blackwell,但同製程同記憶體世代的對手是 Rubin。這種「拿新的比舊的」在產業新聞裡極其普遍,而且往往不是刻意作弊——就是新一代還沒有公開數據可比。你要做的不是指控,是自己在心裡把折扣打回去。

第三問:測試邊界在哪。 單機櫃不是整廠、標稱功耗不是實測功耗、固定的長輸入短輸出不是現在最常見的代理程式用法。而這幾個邊界剛好都偏向對輝達不利——因為輝達最強的整廠協同設計,在單機櫃測試裡根本用不上。

四條由長到短、左端對齊的橫條,最上面是標題宣稱的範圍,每問一次就短一截,最底下那條最短,是實際能推論到的範圍。

三問問完,結論不會是「這消息是假的」,而是「這消息真實,但它能推到的範圍比標題小」。這就是判讀的價值:不是拒絕好消息,是知道好消息的邊界在哪裡。而真正該引起注意的,其實不是那幾個倍數,是「第一代」跟「九個月」這兩個詞。

「那護城河到底還在不在?大家一下說有一下說沒有。」

這是聽這種內容最常見的混亂——同一集節目裡,護城河好像既被拆了又還在。原因是「護城河」被當成一個整體在講,但它其實是好幾層不同材質疊起來的,被拆的跟還在的不是同一層。

拆一下就清楚了。軟體難度型的護城河:一套東西之所以難取代,是因為要重寫的程式碼太多、生態太厚、工程師學習成本太高。這一層現在正在被侵蝕,理由就是這集講的——當寫程式的複雜度可以交給 AI 承擔,「難寫」就不再是一道牆。主持人甚至直接推到底:接下來任何原本因為開發難度而有價值的東西,都會慢慢失去那份價值。

物理與互聯型的護城河:晶片與晶片之間的高速連線、機櫃之間的互聯、冷卻,這些是實體工程與多年迭代堆出來的,不是寫個軟體就能追平。主持人明確把這一層點名為輝達真正的護城河。

資本與裝機量型的護城河:已經部署出去的規模本身會產生慣性,工具鏈、運維經驗、生態夥伴都黏在上面。這一層變化最慢。

三層由上而下堆疊的地層,最上層的上緣被啃成鋸齒狀且最薄,中層較厚,最下層最厚;右側一條由上往下的箭頭標示侵蝕速度由快變慢。

有了這個分層,同一則新聞就不再自相矛盾了:Jalapeño 打的是第一層,第二、三層它幾乎沒碰到。而它在單機櫃裡贏得漂亮、在整廠規模下可能不會贏這麼多,正好就是第二層還在的證據。

這個分層方法不只用在晶片。任何你在評估的競爭優勢,都值得問一句:這條護城河的材質是什麼?是「別人做起來很麻煩」,還是「別人在物理上做不到」? 前者的保存期限,取決於那個麻煩有多快被工具吃掉。

「主持人自己都說要重估時間表了,那我的判斷要不要跟著改?」

節目最後有一段很誠實的自述。主持人說他原本的看法是輝達三年內沒問題——靠著互聯技術、整廠協同設計、資本與裝機量撐著——三年後才進入不確定。而看完這次的成績,他說他可能得重新審視這個時間表。

值得注意的是他改的是什麼。他沒有說「我錯了,輝達要完了」,也沒有說「這不影響我的判斷」。他改的是時間軸。原本判斷的結構(護城河分三層、軟體那層最脆弱)沒有變,變的是「那層被侵蝕得比我以為的快」。

一條由今天延伸到三年後的時間軸,原本標在最右端的檢查點以灰色虛圈呈現,一條弧線把它拉回到靠前的位置,下方掛著四個要盯的觀察項。

這個區分在自己做判斷時很有用,因為新資訊進來時只有三種可能的處置:改結論、改時間表、改失效條件。大部分人只會第一種和最後一種——要嘛推翻整個看法,要嘛當作沒看見。但實務上最常發生的其實是中間那種:你原本的框架是對的,只是速度算錯了。

而速度算錯,該調整的通常不是持有或不持有,是你設定的觀察點與失效條件。原本你可能想「等三年後再說」,現在你該把檢查點往前搬,並且寫下具體要盯什麼:第二代的成績、下一次比較是不是換成同代對手、單機櫃以外的規模測試有沒有出現、其他家會不會跟著交成績。這些是可以觀察、可以對答案的東西,而不是一個模糊的「感覺變了」。

順帶一提,其他兩家專用晶片這次依然沒交成績。如果 Jalapeño 開了頭之後他們還是不交,那本身就是資訊——不是關於 Jalapeño 的,是關於他們的。

可以參考的資料

  • 《科技浪》EP152(2026 年 8 月 31 日):本文的來源,主持人哈利對 Jalapeño 的完整解讀
  • OpenAI 官方部落格:Jalapeño 的完整測試數據,主持人說詳細數字非常多且複雜,想看細節的可以直接去看原始資料
  • Hot Chips 研討會:晶片與硬體領域的年度研討會,OpenAI 在這裡補充了較多技術細節
  • SemiAnalysis 的 InferenceX 與 AgentX:目前推論測試裡公信力較高的一套;後者針對代理程式工作型態,這次沒跑

帶得走的一件事

當一件事的難度被外包出去,靠難度撐起來的價值就會跟著消失。

這集最大的訊息不是誰的晶片比較快,是一個以前沒人願意付的代價——三千行的底層程式、要人類手動安排每一筆資料的流向——現在有人替你付了。代價一被吃掉,那些「因為太麻煩所以沒人做」的選項,就一次全部重新回到桌上。

左邊一道高牆,牆頂站著一個人,牆後空地只有一個人影;右邊同一道牆被削矮,原本的高度以虛線留著,牆後的地面上擠著一排人。

同時,所有原本靠「這件事很難所以別人追不上我」建立起來的優勢,開始從腳下鬆動。

這個道理不只在晶片上成立。它成立在任何「我的價值來自這件事很麻煩」的地方——會用某套複雜工具、記得住某套繁瑣流程、有耐心做完別人不想做的整理。

今天可以做的一件事: 拿一張紙,寫下你目前手上一件「因為很麻煩,所以沒什麼人跟你搶」的事。可能是工作上的一項技能,可能是家裡只有你會處理的某件事,可能是你在某個群體裡的固定角色。寫完之後問自己一個問題——

如果明天有個工具讓這件事變得不麻煩了,我還剩下什麼?

答得出來的,那才是你真正的東西:判斷、關係、品味、對別人處境的理解。答不出來的,就是你該開始加東西的地方。不用急著改變什麼,先知道自己站在哪一邊,就已經比大部分人早了。

後半篇在方格子

這篇的完整內容放在方格子,點過去就能接著讀完,不用付費。 訂閱沙龍也是免費的,之後有新文章會直接通知你。

本文為投資方法論的教育性分享,不構成任何個股買賣建議、不提供目標價、不針對當期標的。投資有風險,任何決策請自行判斷或諮詢合格的專業人士。