# Mac 裡那顆沒人在看的晶片,讓 AI 推理快了 1.8 倍:小天的實測,和我在 Windows 上算的一次 > 小天用一台入門款 Mac mini 做了一週實驗,把影片入向量庫的時間從 127 秒壓到 70 秒,靠的是蘋果晶片裡一塊多數人沒注意的神經網路引擎。我把他的數字跟自家在 Windows 上跑的同一種工作放在一起比,想回答一個更實際的問題:電腦跑 AI 慢,該換機還是換模型。教育性整理與延伸,非採購建議。 Published: 2026-09-08 Locale: zh-TW Tags: 小天fotos, Mac, ANE, NPU, 本地 AI, 硬體, 決策思考 TL;DR: 同一台入門款 Mac mini、同一個模型,把一部分計算交給蘋果神經網路引擎,四分鐘影片入庫從 127 秒變 70 秒。它的價值不只是快,是 GPU 忙的時候它不受影響。我拿自家在 Windows 純 CPU 上跑的同類工作對照,發現差距主要來自模型大小,所以換機之前先量模型。 ![古典主義油畫封面:一間莊嚴的石造工坊,中央是一具由許多齒輪組成的大機器,工匠們圍著最顯眼的大輪子忙碌,角落一枚小小的青銅齒輪安靜轉動,一道晨光斜斜落在它身上,構圖對稱工整,色調沉穩](/covers/xiaotian-2026-09-07-mac-ane-inference-1-8x-cover.png) > *隨風潛入夜,潤物細無聲。*
> —— 杜甫《春夜喜雨》(唐,761 年) 杜甫寫的是春雨,夜裡悄悄下,把土地都澆透了,沒人聽見。看小天 9 月 7 日的[影片](https://youtu.be/VKEXWXMlVS0)時,我想到的就是這兩句。他講的是蘋果晶片裡一塊多數人買電腦時不會看的東西,它在背景做事,不吵,做完了你只覺得電腦變快了。 ## 他碰到的問題,我也碰過 小天有個習慣跟我一樣:看過的教學影片想記住,下次要找的時候一搜就出來。他做了一個叫 Indexed 的瀏覽器插件,看影片時點一下,影片就切段進向量庫,之後用一句話就能搜到那一段。 問題出在速度。他用的是入門款 Mac mini M4,記憶體 16 GB,跑一個 20 億參數的多模態嵌入模型,把一支四分鐘的影片切段入庫要 127 秒。四分鐘的片要等兩分鐘,這種工具用兩次就不會再想開了。 他花了一週折騰,同一台機器、同一個模型,時間壓到 70 秒,差 1.8 倍。硬體沒換,換的是把一部分計算交給了那塊晶片。 ## 那塊晶片是什麼 它叫 ANE,蘋果神經網路引擎。你的 iPhone、iPad、Mac 裡都有,只是過去多半是蘋果自己的功能在用,一般軟體很少碰得到。講白一點,它就是蘋果版的 NPU,專門算神經網路的處理器。Intel 和 AMD 的新處理器也都放了一塊 NPU 進去,不過軟體跟不上,大多數時候閒著。 小天給了一個比喻,我覺得比規格表好懂: | 零件 | 像什麼 | 擅長什麼 | |---|---|---| | CPU | 總管 | 什麼雜事都能處理,會臨場判斷、會調度 | | GPU | 一大群工人 | 換一種活重新分工照樣能做,代價是耗電、發熱 | | ANE | 一條自動化流水線 | 只做特定工序,但把流水線排順了,比一群工人更快也更省 | 所以替 ANE 寫程式,大半的工作是把模型裡的計算重新排成流水線最順手的工序。 ![三欄並列:左邊是一個中心方塊向外連出四條線,中間是一大群整齊排列的同樣小方塊,右邊是一條軌道上依序串起的少數幾格,形狀分別像一個人、一群人、一條線](/figures/three-parts-three-shapes.svg) 小天沒有自己排,他用 GPT6 Astra 幫他排,這是他影片說明欄寫的。 ## 甜蜜點,和一個更重要的發現 他做了四組測試,從 A 到 D,交給 ANE 的工作越來越多(數字取自影片畫面上的測試結果,2026-09-07): | 設定 | 誰在算 | 耗時 | |---|---|---| | A | 全部 GPU | 130 秒 | | B | 視覺部分交給 ANE | 120 秒 | | C | 視覺加一部分語言計算交給 ANE | 70 秒 | | D | 再多丟一些給 ANE | 比 C 慢 | 不是丟越多越快,中間有個甜蜜點。 ![四根柱子由左到右代表交給 ANE 的工作越來越多,高度先小幅下降再驟降到最低,第四根又回升,谷底那根被標為甜蜜點](/figures/ane-sweet-spot-four-runs.svg) 這件事本身不意外。意外的是他第二輪示範時,D 反而跑贏了。原因是那一輪 GPU 正在忙別的事,靠 GPU 的設定被拖慢,靠 ANE 的設定不受影響。 ![兩條線從左往右,靠 GPU 的那條在 GPU 變忙時明顯往上翹(變慢),靠 ANE 的那條幾乎水平,兩條線在中間交叉](/figures/gpu-busy-two-paths-cross.svg) 這才是我覺得最值得記的一段。ANE 的價值不只是快,是穩。電腦的 GPU 負載本來就忽高忽低,一個要在背景常駐的 AI 工作,如果跟 GPU 搶,別的程式一忙它就卡;放到 ANE 上,它有自己的路。小天那台機器常常 CPU 滿載燙到不行,把模型搬去 ANE 之後,CPU 跟 GPU 就空出來做別的事。 ## 為什麼是現在 今年六月蘋果開發者大會推出了讓開發者更容易用到 ANE 的新工具。小天去數了 GitHub 上跟 ANE 相關的修改請求:三月 134 條,八月 421 條,半年翻了三倍。 社群裡已經有人在各種工作上試了,他影片裡點名幾個(皆為他轉述的第三方測試,2026-09-07): - Qwen 3.8 27B 在 M3 Ultra 上用 MLX 跑,讓 ANE 分擔之後,提示詞處理速度快了兩成多。 - 一個影片生成模型在 24 GB 的 M4 mini 上,單步從 32 秒降到 26 秒,少了 18%。 - 有人繞過蘋果的原生介面,自己給 ANE 排工序,做了一個純 ANE 跑的圖像辨識:從 2.03 毫秒降到 0.33 毫秒,耗能降到約十六分之一。 長期看,所有能在背景做的活都適合:語音辨識、即時字幕、分辨說話人、幫圖片自動下標、文字轉語音。這些活的共同點是不需要最快,需要的是不打擾你正在做的事。 ## 我拿自家的數字比了一次 看完影片我第一個念頭是:我沒有 Mac,這件事跟我有關嗎。 剛好有東西可以比。八月底我替小天這個 Indexed 插件寫過一個全本地的後端,原因是官方版本當時接的是雲端向量服務,我想要資料不出門。那個後端跑在我的 Windows 電腦上,沒有獨立顯卡,嵌入模型用的是 Google 的 SigLIP 2 base。實測數字(2026-08-28,我自己的機器): | 工作 | 耗時 | |---|---| | 一段文字轉向量 | 0.06 秒 | | 一張圖轉向量 | 0.3 秒 | 影片每十秒抽一張中間幀當一段,四分鐘影片 24 段,全部算完不到十秒。純 CPU,沒有任何加速器。 同樣是「影片入向量庫」,小天要 127 秒,我要不到 10 秒,差在哪?不是他的機器比我差,是模型差了一個量級。他用的是 20 億參數的多模態模型,我用的是 base 級的小模型,參數量不到他的五分之一。他的模型看得懂更細的東西,搜尋結果會更準;我的模型夠用,但細節少。 ![上下兩行對照,上行是一個大圓配一條很長的耗時條,下行是一個小很多的圓配一條極短的條,長度落差比圓的落差更大](/figures/model-size-decides-the-wait.svg) 這讓我把問題換了一個問法。原本想的是「要不要為了 ANE 買 Mac」,比完之後變成「我這個工作需要多大的模型」。小模型在 CPU 上就飛,ANE 對我是錦上添花;一旦要換成大模型追準度,CPU 就撐不住,那時 ANE 就從加分變成門票。 ![橫軸是模型越來越大,兩條曲線:CPU 那條起初較低但很快陡升,ANE 那條一路平緩,兩線交叉處畫一條虛線標為門檻](/figures/when-accelerator-becomes-a-ticket.svg) ## 那要不要買 小天的判斷很直接:M6 Mac mini 有兩顆 ANE,可以同時做兩件事;M5 Ultra 的 ANE 從 16 核升到 32 核。他猜等某個靠 ANE 的現象級軟體出現,M6 Mac mini 會突然買不到。他自己補了一句,這些都是猜的,未必準。 我不下這個判斷,我沒有那台機器。我想分享的是我自己怎麼決定要不要跟: 1. 先量:把最常跑的 AI 工作跑一次,記下秒數,和它用的模型有幾 B(十億)參數。 2. 再問:慢,是模型太大,還是機器沒有能接這種活的零件?前者換小模型就好,後者才輪到換機。 3. 最後看軟體:NPU 有沒有價值是軟體決定的。Windows 上的 NPU 多數時間閒著,就是因為沒軟體接;蘋果這邊修改請求半年翻三倍,代表有人在接。買硬體是買它接下來一年會被用到的那部分,不是買規格表。 小天在影片最後講了一個我同意的底層道理:以前軟體追不上硬體,硬體性能發揮不出來;現在換成 AI 在補軟體,補得比硬體出得還快,同一個 27B 模型剛出來時一秒 23 個 token,幾個月後同一台機器能跑到 100 多。硬體裡那些沒被用到的角落,會一個一個被點亮。ANE 是其中一個。 ## 帶得走的一件事 電腦跑 AI 慢,先量是哪一段慢,再決定換不換機。 我自己試過的做法:今晚把你最常跑的那個 AI 工作跑一次,把秒數和模型參數量寫在一張便利貼上,貼在螢幕邊。下次想按下購物車之前,先看那張紙,寫下你猜換機後會變幾秒。買了再量一次,兩個數字對一下,就知道那筆錢買到的是什麼。