本地跑 AI 的顯卡怎麼選:該買的新卡,和該避開的舊卡

掄錘者連兩天講顯卡:一支排出他推薦的四張卡,一支勸退 48GB 的老卡。我家那台 Windows 桌機裝的正好是 AMD 上一代的舊卡,這個月實測生圖、生影片、跑語言模型,哪些能跑、哪些要繞路都記了下來。用白話講清楚看顯卡的兩格:顯示記憶體和 BF16。個人心得與實測紀錄,非購買建議。

不慕古,不留今,與時變,與俗化。
—— 《管子・正世》(春秋戰國)
不羨慕舊的,也不死守現在手上的,跟著時勢變。這句話我讀了好幾遍,因為我手上那張顯卡,剛好是舊的那一邊。
掄錘者在 9 月 13 日和 9 月 14 日連發兩支影片:第一支把他這幾個月一路推薦的四張卡排了一次,第二支勸退一批 48GB 的老卡。該不該買卡、租卡划不划算,我之前在〈本地模型 Qwen3.8 27B 適合你嗎?〉和〈本地大模型要買卡還是租卡?〉算過了。這篇往下走一步:假設你已經決定要買,該挑哪一張。
我家那台裝了 AMD 顯卡的 Windows 桌機,裝的是一張 8GB 的 RX 6600 XT,AMD 上一代的卡。這個月我在上面試了生圖、生影片、跑語言模型,每個卡住的地方都有紀錄。對照著他的兩支影片看,很多事情一下子接起來了。
看顯卡,我現在只先看兩格
規格表上的數字很多,想在家跑 AI,我會先看兩格。
第一格是顯示記憶體,也就是卡上自己的記憶體。我把它想成工作桌的桌面:模型要整個攤在桌上才算得快,攤不下的部分只能放到身後的書架(電腦的一般記憶體),每算一步就回頭拿一次,速度掉得很兇。
我 2026-09-12 在自己那張 8GB 卡上量過。一個 27B 的稠密模型,擠一擠跑得動,每秒只吐 1.8 個 token(模型吐字的單位,一個詞的一小段)。換成 35B-A3B,參數總共三百五十億個,每吐一個字只動其中三十億個,大部分可以留在書架上,每秒反而有 23 個 token,我出的六題有標準答案的小考全對。還有一件事是量了才知道的:8GB 的卡用不滿 8GB,桌面畫面、生圖軟體、瀏覽器加起來先吃掉約 2.5GB。而且一張卡同時只能做一件大事,生影片的時候,語言模型就得先讓位。
他在影片裡推薦的卡,顯示記憶體都在 24GB 到 32GB 之間,理由就在這裡。
第二格是 BF16,這是一種數字的存法。電腦算 AI 時,每個數字要塞進固定的格子裡,16 個格子有兩種分法:FP16 刻度細,但尺很短,數字一大就超出去;BF16 刻度粗一點,尺卻跟 32 格的大尺一樣長。現在的模型多半用 BF16 存,生圖用的 ComfyUI、跑語言模型的 SGLang 這些工具,也都繞著 BF16 做優化。
卡如果不支援 BF16,工具只能退回 FP16 算,或是用軟體硬模擬。前者可能超出尺的長度,後者慢。
他推的四張卡,和那句改變我想法的話
第一支影片的四張卡,我整理成一張表:
| 卡 | 顯示記憶體 | 新或舊 | 他給的位置 |
|---|---|---|---|
| AMD 7900 XTX | 24GB | 新卡 | 單卡首選 |
| NVIDIA 3090 | 24GB | 多半是二手或重新焊的渦輪卡 | 雙卡首選,因為有 NVLink |
| AMD AI Pro R9700 | 32GB | 新卡 | 32GB 這一級的首選 |
| 4080S 32G | 32GB | 改裝卡 | 他不再推薦 |
他回顧了自己的轉變。頻道剛開的時候,AMD 在 Windows 上很難用,他那時的建議是:想買回來插上就能做事,買 3090;有技術能力、願意改用 Linux,才買 7900 XTX。這幾個月情況變了,他說 Windows 上現在有整合好的套件,驅動、環境都幫你裝好,還附了能跑的工作流程;跑語言模型的幾套常用軟體也都能用。
3090 在他口中的問題出在硬體本身:市面上的渦輪卡多半是舊礦卡的核心拆下來重新焊的,製程舊、熱、吵。價格他照當時的行情講:3090 漲價前約人民幣 6,000 元,現在破萬;7900 XTX 從人民幣 5,000 出頭漲到 8,000 左右,二手的人民幣 5,000 上下還買得到。有人會說 3090 生圖比 7900 XTX 快,他覺得這點差距沒有意義:24GB 的卡生圖一次只能跑一個工作,快一點省不了多少事。他自己用 7900 XTX 配 llama.cpp,開 128K 的長上下文(模型一次讀得進去的內容長度)寫程式,說體驗很好。
那為什麼雙卡又選 3090?因為兩張 3090 可以用 NVLink 這條專用線接在一起,傳資料的頻寬比主機板上的插槽高出一大截。他說兩張 3090 一起跑語言模型,比一張 48GB 的 4090 還能打;但如果主要是生圖,兩張卡還比不上一張記憶體大的單卡。AMD 兩張 7900 XTX 也能一起跑,論壇上已經有人跑起來,只是配套還不如 3090 成熟。
這一段他順便更正了自己兩次。一次是他以前說 NVLink 挑主機板,後來發現大家出問題,是橋接器和卡的厚度不合,或橋接器本身壞了。另一次是他說過雙 7900 XTX 用 X99 那種老主機板就行,那時成功的案例用的是 llama.cpp,換成 SGLang 就挑主機板。他在片尾也講,這些卡他沒有每張都買過,很多判斷來自論壇上大家貼的實測,錯了歡迎來指正。我喜歡這種講法,他把「我哪裡講錯過」直接擺在推薦旁邊。
32GB 那一級,他選 R9700,放棄 4080S 32G。他承認 R9700 慢一些,但他說在 Windows 和 Linux 上都已經成熟,是一線品牌出的新卡;4080S 32G 是改裝卡,他請觀眾去論壇看那些改裝卡出問題之後的經過。買兩張 R9700 的話,生圖可以兩張各跑一個工作,跑語言模型時湊成 64GB 一起用。
真正改變我想法的,是他講這件事的理由。以前窮的人只能二選一:要嘛折騰硬體(買二手、跟賣家周旋),要嘛折騰軟體(買 AMD、自己調環境)。現在軟體出問題,丟給 AI 代理去查就好。他舉論壇一位版主的例子,對方買了幾萬塊的卡,卻懶得自己調設定,他把自己的參數傳過去,讓對方丟給 AI 代理,很快就好了,一共花了人民幣一塊錢。硬體出問題,你要找的是二手平台上的賣家,輕一點商品連結不見,重一點電話都打不通。
我那台桌機這個月踩到的軟體坑,大部分也是 AI 陪我一個開關一個開關試出來的。這兩種麻煩的成本,已經不在同一個量級了。
舊卡缺的那一格
第二支影片講的就是這些 48GB、64GB 看起來很划算的老卡。
RTX 8000,他形容就是一張 48GB 的 2080,稍微強一點,他講的行情是人民幣 11,000 元;兩張 32GB 的 V100 配一台舊伺服器,二手平台上賣人民幣 15,000 元。記憶體大,他說 48GB 也只能跑千問 27B 這種語言模型,生圖、生影片慢到不值得。
他翻出顯卡的世代表來講原因。V100 那一代、RTX 8000 和 2080 Ti 那一代,都不支援 BF16;到 3090 那一代(Ampere 架構)才開始支援。後面 4090 加上 FP8,5090 再加上更省的 4 位元格式,他說這些都有用,但加起來都比不上 BF16 那一步重要,因為現在的工具最低就是以 3090 那一代為目標在優化。他把 3090 和 7900 XTX 當成這個世代的入場門檻。
他還幫忙拆了一個常讓人買錯的地方:專業卡的名字。RTX A6000 跟 3090 同一代,48GB、有 NVLink、有 BF16,但沒有 FP8;RTX 6000(Ada 那一張)跟 4090 同一代,他說可以把它看成 48GB 版的 4090;RTX Pro 6000 則跟 5090 同一代,一張人民幣十幾萬。名字只差一兩個字,世代差了一整代,買二手專業卡之前,我會先把這一格對清楚。
已經買了的人,他倒沒有叫人丟掉:跑語言模型退回 FP16 算,27B 量化過還能玩,撐個一兩年沒問題。只是花了大錢,買到一半的功能。
我那張卡,就是 AMD 這一邊的舊卡
我那張 RX 6600 XT 屬於 AMD 的 RDNA 2 世代,沒有原生的 BF16,照他的分法,落在門的外面。
先講他說對的部分。我 2026-09-12 在 Windows 上裝的是 AMD 官方給 Windows 的 PyTorch,不用任何轉譯工具,ComfyUI 抓得到卡,生影片的 MiniMax H3 也跑通了。他說 AMD 補強了,在我這台上對得起來。只是速度要有心理準備:一段 1.6 秒、608×352 的小影片,連同載入模型大約要 11 分鐘。
然後是繞路的部分,我照實測列出來:
| 想做的事 | 照預設跑會怎樣 | 我怎麼繞 |
|---|---|---|
| 生圖(1024×1024、8 步) | 用 BF16 模擬,每步 43 秒,一張 6 分 10 秒 | 強制改 FP16,每步 14 秒,一張 2 分 15 秒,畫面正常 |
| 生影片 | 同一招改 FP16,每步從 58 秒變 33 秒,存出來的檔只有 7.5KB,是壞的 | 影片不改 FP16,生圖和生影片分成兩個啟動捷徑 |
| 用更省記憶體的 int8 版模型 | 5 秒就掛,這一代卡沒有 int8 的矩陣運算 | 一律改用 GGUF 版,4 位元的 nvfp4 版也不能用 |
| 用 Ollama 跑語言模型 | 官方支援清單不收這張卡,退回處理器跑 | 改用 llama.cpp 的 Vulkan 版 |
| 文字轉語音 | 其中兩種常見運算一跑就當 | 那兩段丟給處理器 |
影片存壞那一格,我猜是 FP16 的尺太短,數字超出去變成無效值,但沒有驗證過。另外還有兩個記憶體相關的開關,一個不加就報系統資源不足,另一個加了整個伺服器當掉,這些都是一次一次試出來的。
這張表讓我讀懂他那句「硬性殘疾」。卡沒有壞,每個工具最後大多有一條路走得通,可是每裝一個新東西,我都要先查它會不會踩到缺的那一格,而且事前看不出來,只能跑了才知道。生圖那格繞了變快,生影片那格照同一招繞,換來一個壞檔。
記憶體那一格也一樣。有一個讓影片裡的臉變清楚的工作,一次要 7.17GB,卡上總共 7.98GB,還是爆掉。AI 幫我把工作切成小塊塞進去,跑是跑得動了,畫面卻多了一格一格的方塊,又調了一輪才消掉。
如果我今天重買
要不要換卡,我還沒決定,這是要花錢的事,我想再看自己的用量。但如果要挑,我的順序會變成這樣:先看它有沒有 BF16,照他的說法,NVIDIA 從 3090 那一代、AMD 從 7900 XTX 那一代開始算;再看顯示記憶體,我想跑的 27B 稠密模型,我查到的資料是要 24GB 才順;最後才比新卡和二手的價差,把「硬體出問題時我找得到誰」算進去。
帶得走的一件事
我聽完想到的是:舊東西便宜的那一截,常常就是它缺的那一項功能。
我打算下次這樣做,你要的話也可以試試:下次在二手平台看到一個比新品便宜一大截的東西,手機、相機、家電都算,按下購買之前,先查它「比新版少了哪一項」,寫在一張便利貼上,旁邊寫「這一年我會用到」或「用不到」。寫下少了哪一項就算完成。