# 只會做選擇題的 Jev 為什麼紅?聽科技浪 EP155 想到的三道判讀題 來源:Realpha 讀市場(blog.getrealpha.com) 原文與圖表:https://blog.getrealpha.com/blog/techwave-2026-09-21-ep155-ai-jev-ai-agent/ > 科技浪 EP155(2026-09-21)聽後心得:Jev 是一個只輸出選項機率的分類模型。它快兩百倍、便宜四百倍,拿什麼換來?它對 AI 助理和模型路由有什麼影響?教育性分享,非投資建議,不構成任何買賣推薦。 Published: 2026-09-22 Locale: zh-TW Tags: 科技浪, 人工智慧, Jev, 模型路由, AI 助理 ![深夜的郵件分揀中心,長長的輸送帶往遠處延伸,一名穿工作服的分揀員站在前景,把包裹推進一排排亮著小燈的分類槽,遠端一扇高窗透進一道冷白的光](/covers/techwave-2026-09-21-ep155-ai-jev-ai-agent-cover.png) > 方以類聚,物以群分,吉凶生矣。 > > —— 《周易・繫辭上》(先秦) ## 這集在講什麼 過去一週,AI 圈被一個名字洗版:Jev。科技浪 EP155(2026-09-21)這一集,主持人哈利就在拆它。推出 Jev 的 TypeSafe AI 是 2024 年成立的公司,前兩年一個產品都沒發表過,一出手宣傳文就寫了三件事:零幻覺、速度快兩百倍、成本便宜四百倍。 執行長 Diogo Almeida 來頭不小,當年把只會接龍的模型訓練成會對話的 ChatGPT,那篇論文他是主要作者之一。他出席活動愛穿一件亮粉紅羽絨大衣,哈利說看起來像《航海王》的多佛朗明哥。不過哈利一開場就先把話說在前頭:天下沒有白吃的午餐,要做到那三件事,模型得放棄一些東西。整集就在找它放棄了什麼、又換到了什麼。 ## 摘要重點 ### 一、Jev 只做一件事:在你給的選項之間分配機率 Jev 底層也是大型語言模型,可是它不寫文字、不畫圖、也不寫程式。你給它一段情況、一道題和幾個選項,它只回你每個選項各有幾成機率。哈利舉了一個客服的例子:客人傳來「我想知道包裹目前的進度」,選項是帳務、技術、物流,Jev 回物流 92%。 ![左邊是一則客服訊息和三個選項,中間經過 Jev,右邊三條長短差很多的橫條,物流那條幾乎拉滿到 92%,帳務和技術只剩一小截。](/figures/jev-options-to-probability.svg) TypeSafe 叫它 System 1 模型,這個名字來自《快思慢想》裡的直覺腦,看到題目不多想,直接反應。 哈利覺得更準的叫法是「以大型語言模型為底的通用分類模型」,而我覺得「通用」這兩個字最有份量。以前銀行想判斷客戶會不會違約,得拿自家歷史資料另外訓練一個模型,那個模型也就只會做這件事;Jev 換一道題,不必重新訓練。可是它的邊界也在這裡:違約這種題目,要看過銀行內部的資料才養得出直覺,這是 Jev 從網路上學不到的。 ### 二、快兩百倍,是因為它只算一次 一般模型寫一段 2,000 字的回答,是一個字一個字吐出來的,每吐一個字就要把整個模型算一遍,總共算 2,000 遍。Jev 答一道題,只算一遍,運算量差不多就是一般模型吐出第一個字的量。 ![左邊是一整塊由 2,000 個小點排成的方陣,代表一般模型寫 2,000 字要算 2,000 遍;右邊只有一個被圈起來的小點,代表 Jev 答一題只算一遍,和左邊方陣左上角第一個點一樣大。](/figures/jev-one-pass-vs-two-thousand.svg) 執行長在技術論壇 Hacker News 上講過核心做法:模型原本就會算「下一個字是哪個字」的機率,Jev 只是把它改成算「這題該選哪個選項」。 哈利還從 API 的限制倒推回去。每題選項最多 255 個,剛好是 2 的 8 次方減 1;情況加上一道題不能超過 32K token(模型計算文字長度的單位),他猜這就是模型一次讀得下的長度。官方又說多道題會拆開同時算,所以題目加多了,也不用等比較久。 ### 三、任何語言模型都能改造成 Jev,護城河在訓練配方 這是整集我覺得最反直覺的地方。社群沒幾天就用 Qwen3.5-4B 做出開源版,那是一個筆電就跑得動的小模型。做法很簡單:在提示詞裡把選項標成 A、B,等模型要吐第一個字時,只看 A 和 B 這兩個字各拿幾分,再用 softmax(一個把分數換成機率的公式)換算成加起來 100% 的機率。 ![左邊是一排高低不一的灰色長條,代表模型對詞表裡每個字的分數,其中 A、B 兩條被標成藍色;箭頭指向右邊,只剩 A、B 兩段拼成一條加總 100% 的橫條,A 約七成、B 約三成。](/figures/softmax-read-only-a-b.svg) 這樣做不用額外訓練,結果在簡單題和中等題上跟 Jev 差不多,速度和成本也不輸。它輸的是難題,還有給出來的機率準不準。 這段差距,來自 TypeSafe 自己發明的後訓練方法 RLCD,中文叫「校準決策」,意思是模型要選對,給的機率也要貼近現實。哈利舉的例子很好懂:Google 評論寫「這間餐廳很扯」,多數人是在罵,但也有少數人是在誇,「很扯,竟然做出這麼好吃的漢堡」。所以理想的答案是八成負面、兩成正面。 ![左邊十個圓圈代表寫這句話的十個人,八個在罵、兩個在誇;右邊兩條橫條,只挑一個的模型整條都是負面,校準過的模型是八成負面加兩成正面,和左邊人群的比例一樣。](/figures/calibrated-decision-restaurant.svg) Jev 的架構是有一些小改動,但執行長自己也說那不是重點。真正值錢的配方和訓練資料都沒公開,外人只能透過它的 API 來用。 ### 四、「零幻覺」只保證一種錯不會發生 Jev 只在你給的選項之間分配機率,給它五個選項,它不會自己冒出第六個,也不會把選項的字寫錯。這類錯誤叫型別錯誤(type error),哈利猜 TypeSafe 這個公司名就是從這裡來的。可是它照樣會很有信心地選錯,如果把答錯也算成幻覺,那 Jev 一樣會幻覺。 ![兩個面板。左邊五個選項被一圈虛線圍住,圈外冒出的第六個選項和寫錯字的選項都被打叉,代表這種錯不會發生;右邊同樣五個選項的機率長條,最長的一條落在錯的 A,正解 C 只有一小截,代表自信地選錯照樣會發生。](/figures/zero-hallucination-one-kind-only.svg) 說穿了,宣傳詞是把一個很窄的定義,講成了一個很寬的承諾。 ### 五、操作電腦:成本低一百多倍,速度只快三倍 網路上有人用 Jev 組了一套會自己操作電腦的系統,拿去跟 Claude Opus 比。兩邊都把任務做完了,Jev 的成本低了一百多倍,速度卻只快三倍左右。 ![兩條時間長條。上面是 Claude Opus 的一整條;下面 Jev 系統的長條只有約三分之一長,而且大部分被讀網頁結構和文字辨識佔掉,真正屬於 Jev 判斷的只有末端一小截。](/figures/computer-use-time-bottleneck.svg) 為什麼只快三倍?因為 Jev 看不到畫面,只能去讀網頁的原始結構、讀給視障者用的無障礙標籤,再另外接一個文字辨識模型,時間大多花在這些地方。碰到標籤沒做好的網站(哈利點名 Notion),就只能靠文字辨識;按鈕如果只是個圖示,它點不到,拖滑桿這種細的動作也做不了。 就算下一代 Jev 加上視覺,這件事也解決不了。一般模型可以直接說出要點畫面上哪個座標,幾百萬個像素都點得到;Jev 每題最多只有 255 個選項,網頁得先被整理成一份選項清單才行。 ![兩個畫面並排。左邊畫面佈滿細點,準星可以落在任何一點,連滑桿也能拖;右邊畫面被整理成一欄選項清單,最多 255 項,清單外的圖示按鈕和滑桿被打叉,點不到。](/figures/pixels-vs-option-list.svg) 哈利拿自己的經驗來對照。他叫 GPT-6 Astra 幫忙訂餐廳,網站的驗證碼是三個卡通角色一直跳,要選跳最高的那個。Astra 第一次只截一張圖,選錯了;它想了一下,改成連續截好幾張,就過關了。這種題目,Jev 連碰都碰不到。 ### 六、哈利的實測:一封過期一天的繳費信 哈利也拿自己信箱裡的工作信給 Jev 分類,多數都答對了。他印象最深的是一封活動繳費提醒,期限已經過了一天。有人會覺得反正錯過了,不急;哈利卻覺得要排最急,因為才過期不到 24 小時,主辦單位說不定還肯通融。結果 GPT-6 回「無法判斷」,Jev 選了最急的那一級,機率 47%。 ![左邊 GPT-6 的框裡是空的,只寫著無法判斷;右邊 Jev 的四根長條由低到最急逐漸變高,最急那根到 47%,上方用虛線框出 100% 的高度,看得出它沒有裝滿。](/figures/urgency-forty-seven-percent.svg) 哈利很欣賞這個 47%。這題本來就見仁見智,模型也沒有裝出一副很有把握的樣子。 ### 七、Jev 讓模型路由這條舊路走得更快 哈利最後的結論是,Jev 讓一個早就在發生的趨勢跑得更快,這個趨勢叫模型路由:一套系統裡放幾個強弱不同的模型,看任務難易來分派工作。這條路一直走得很慢,因為工作流程變得太快,年初定好的流程,年中模型一升級就換掉了,分派規則根本定不下來。OpenAI 也試過讓系統自動幫使用者挑模型,結果挨了一堆罵,後來撤掉。哈利覺得大家罵的是那個路由器太爛,只要路由器夠好,沒有人會想自己選。 Jev 把這件事的門檻降低了。它可以直接拿來當路由器,也可以直接接手簡單的判斷,比如先從五千份履歷裡挑出兩百份,再交給大模型仔細讀。 ![一個由寬變窄的漏斗。最上層最寬,是五千份履歷,由 Jev 快速便宜地粗篩;收窄到兩百份後交給大模型慢而貴地細讀;最底下只剩一小格進面試。](/figures/resume-funnel-jev-then-big-model.svg) 所以一般人不會直接看到 Jev,只會覺得手上的 AI 助理變快、變便宜了。 ## 延伸想法 ### 看到「快兩百倍、便宜四百倍」,我怎麼判斷能信幾成 新產品發表、新公司上線,數字一個比一個大,讀起來每個都像革命。我常常不知道該信幾成。聽完這集,我整理出三個問題。 第一個問題:它放棄了什麼?Jev 的兩百倍有物理上的來由,因為它只算一次;代價也講得出來,它只能做選擇題。講不出代價的大數字,我會先打折。 第二個問題:數字放進整條系統之後剩多少?操作電腦只快三倍,時間花在讀網頁結構和文字辨識上。整條線的速度由最慢的那一段決定。這和投資裡看瓶頸層是同一道題:某一段零件快了一百倍,成品能快多少,要看下一個最慢的環節是誰。 第三個問題:別人用免費工具能做到幾成?Qwen 4B 在簡單題上就接近 Jev,所以兩百倍的速度本身擋不住對手,擋得住的是難題和機率準度上那段差距。我讀公司的時候也會問:它最亮眼的那個數字,對手要花多少力氣複製?複製得了的部分,市場給的溢價撐不久。我以前看到「十倍」就先興奮,後來才習慣把這三題寫在旁邊。 ### 每週都有東西被說成改變世界,我怎麼分辨它是新路,還是舊路變快 怕錯過,又怕追錯。哈利的做法是把 Jev 放回一條已經在走的線上。這樣做有個好處:影響有現成的卡點可以對照。模型路由普及得慢,是因為工作流不穩定,Jev 沒有解決這件事,它降低的是做路由器的門檻。 照這個推下去,最早受惠的會是工作流已經固定、重複量又大的人,例如篩履歷、分客服單。哈利自己用來分類信件,每次只省幾秒,他說對他影響不大。社群洗版三天是雜音,簡單判斷的成本往下掉是結構。 我聽到新東西時會問三件事:它加速了哪條原本就在走的線?那條線卡在哪裡?卡點有沒有被移開?失效條件也要先寫好。哈利猜下一步是大模型在工作途中自己呼叫 Jev;真走到那一步,路由就從工程師手動設定,變成模型自己決定,這已經算換一條路了,我的判讀也得跟著改。 ## 可以參考的資料 - 科技浪 EP155(2026-09-21)〈席捲 AI 圈的 Jev,到底在紅什麼?AI Agent 真的要大改了嗎?〉 - 康納曼《快思慢想》:System 1/System 2 的出處 - TypeSafe AI 官方對 Jev 的說明與 API 文件 - Hacker News 上 TypeSafe 執行長回覆的討論串 ## 帶得走的一件事 一個判斷要附上把握程度,事後才對得了答案。Jev 那個 47% 讓我想到,我平常下判斷,只說「會」或「不會」,事後回頭看,根本分不出自己是猜中還是看準。 我試過的一個做法:每天挑三件很快就會揭曉的小事,各寫一個百分比。像是「這場會議準時結束,60%」「晚上會下雨,30%」「那封信對方今天會回,80%」。隔天對答案。做滿兩週,把寫 80% 的那幾筆挑出來數,看十次裡是不是有八次成真。我第一次數,寫 80% 的只中了一半,之後每次要寫數字,手都會停一下。 ![兩排各十個圓點。上排是寫 80% 時應該成真的次數,八個實心兩個空心;下排是實際成真的次數,只有五個實心,比上排少了三個。](/figures/eighty-percent-calibration-check.svg)