# 本地跑 AI 的顯卡怎麼選:該買的新卡,和該避開的舊卡 > 掄錘者連兩天講顯卡:一支排出他推薦的四張卡,一支勸退 48GB 的老卡。我家那台 Windows 桌機裝的正好是 AMD 上一代的舊卡,這個月實測生圖、生影片、跑語言模型,哪些能跑、哪些要繞路都記了下來。用白話講清楚看顯卡的兩格:顯示記憶體和 BF16。個人心得與實測紀錄,非購買建議。 Published: 2026-09-15 Locale: zh-TW Tags: 本地 AI, 顯示卡, AMD, BF16, ComfyUI, 決策思考 TL;DR: 看顯卡先看兩格:顯示記憶體決定塞得下多大的模型,BF16 決定新工具跑不跑得順。沒有 BF16 的舊卡不會壞,只是每用一個新工具都要先查它踩不踩到缺的那一格;我那張 AMD 舊卡生圖從每步 43 秒繞到 14 秒,生影片照同一招繞,存出來的檔卻是壞的。軟體的坑現在可以請 AI 陪你繞,卡上缺的東西繞不出來。 ![一座高窗大廳,左邊一排大理石台座上擺著閃亮的黃銅新機器,右邊是更大更沉的深色舊機器,一個人提著小燈籠走在中間的走道上,還在想要往哪一邊走](/covers/lunchuizhe-2026-09-14-local-ai-gpu-new-vs-old.png) > *不慕古,不留今,與時變,與俗化。*
> —— 《管子・正世》(春秋戰國) 不羨慕舊的,也不死守現在手上的,跟著時勢變。這句話我讀了好幾遍,因為我手上那張顯卡,剛好是舊的那一邊。 掄錘者在 [9 月 13 日](https://youtu.be/EbbybCpCG3s)和 [9 月 14 日](https://youtu.be/vLoU8LVLAVM)連發兩支影片:第一支把他這幾個月一路推薦的四張卡排了一次,第二支勸退一批 48GB 的老卡。該不該買卡、租卡划不划算,我之前在〈[本地模型 Qwen3.8 27B 適合你嗎?](/blog/local-ai-hardware-worth-it/)〉和〈[本地大模型要買卡還是租卡?](/blog/runpod-vs-local-gpu-2026-09/)〉算過了。這篇往下走一步:假設你已經決定要買,該挑哪一張。 我家那台裝了 AMD 顯卡的 Windows 桌機,裝的是一張 8GB 的 RX 6600 XT,AMD 上一代的卡。這個月我在上面試了生圖、生影片、跑語言模型,每個卡住的地方都有紀錄。對照著他的兩支影片看,很多事情一下子接起來了。 ## 看顯卡,我現在只先看兩格 規格表上的數字很多,想在家跑 AI,我會先看兩格。 第一格是顯示記憶體,也就是卡上自己的記憶體。我把它想成工作桌的桌面:模型要整個攤在桌上才算得快,攤不下的部分只能放到身後的書架(電腦的一般記憶體),每算一步就回頭拿一次,速度掉得很兇。 我 2026-09-12 在自己那張 8GB 卡上量過。一個 27B 的稠密模型,擠一擠跑得動,每秒只吐 1.8 個 token(模型吐字的單位,一個詞的一小段)。換成 35B-A3B,參數總共三百五十億個,每吐一個字只動其中三十億個,大部分可以留在書架上,每秒反而有 23 個 token,我出的六題有標準答案的小考全對。還有一件事是量了才知道的:8GB 的卡用不滿 8GB,桌面畫面、生圖軟體、瀏覽器加起來先吃掉約 2.5GB。而且一張卡同時只能做一件大事,生影片的時候,語言模型就得先讓位。 ![兩條橫條對比:27B 稠密模型整條都是每字要動的參數,每秒只吐 1.8 個 token;35B-A3B 總長更長,但每字只動最前面一小截,每秒吐 23 個 token。](/figures/dense-vs-moe-active-params.svg) 他在影片裡推薦的卡,顯示記憶體都在 24GB 到 32GB 之間,理由就在這裡。 ![三條同比例的橫條:我的 8GB 卡最短,其中約 2.5GB 先被桌面與軟體占掉;24GB 的卡是它的三倍長,32GB 的卡是四倍長。](/figures/vram-desk-size-8-vs-24-vs-32.svg) 第二格是 BF16,這是一種數字的存法。電腦算 AI 時,每個數字要塞進固定的格子裡,16 個格子有兩種分法:FP16 刻度細,但尺很短,數字一大就超出去;BF16 刻度粗一點,尺卻跟 32 格的大尺一樣長。現在的模型多半用 BF16 存,生圖用的 ComfyUI、跑語言模型的 SGLang 這些工具,也都繞著 BF16 做優化。 卡如果不支援 BF16,工具只能退回 FP16 算,或是用軟體硬模擬。前者可能超出尺的長度,後者慢。 ![兩把尺上下對照:FP16 刻度細但很短,模型裡的大數字落在它的盡頭外面;BF16 刻度粗,長度和 32 格的尺一樣,同一個大數字落在尺上量得到。](/figures/fp16-vs-bf16-two-rulers.svg) ## 他推的四張卡,和那句改變我想法的話 第一支影片的四張卡,我整理成一張表: | 卡 | 顯示記憶體 | 新或舊 | 他給的位置 | |---|---|---|---| | AMD 7900 XTX | 24GB | 新卡 | 單卡首選 | | NVIDIA 3090 | 24GB | 多半是二手或重新焊的渦輪卡 | 雙卡首選,因為有 NVLink | | AMD AI Pro R9700 | 32GB | 新卡 | 32GB 這一級的首選 | | 4080S 32G | 32GB | 改裝卡 | 他不再推薦 | 他回顧了自己的轉變。頻道剛開的時候,AMD 在 Windows 上很難用,他那時的建議是:想買回來插上就能做事,買 3090;有技術能力、願意改用 Linux,才買 7900 XTX。這幾個月情況變了,他說 Windows 上現在有整合好的套件,驅動、環境都幫你裝好,還附了能跑的工作流程;跑語言模型的幾套常用軟體也都能用。 3090 在他口中的問題出在硬體本身:市面上的渦輪卡多半是舊礦卡的核心拆下來重新焊的,製程舊、熱、吵。價格他照當時的行情講:3090 漲價前約人民幣 6,000 元,現在破萬;7900 XTX 從人民幣 5,000 出頭漲到 8,000 左右,二手的人民幣 5,000 上下還買得到。有人會說 3090 生圖比 7900 XTX 快,他覺得這點差距沒有意義:24GB 的卡生圖一次只能跑一個工作,快一點省不了多少事。他自己用 7900 XTX 配 llama.cpp,開 128K 的長上下文(模型一次讀得進去的內容長度)寫程式,說體驗很好。 ![漲價前與現在兩欄的斜線圖:3090 從約 6,000 人民幣陡升到破萬,7900 XTX 從 5,000 出頭升到約 8,000,二手 7900 XTX 現在約 5,000 落在最低處。](/figures/rtx3090-vs-7900xtx-price-slope.svg) 那為什麼雙卡又選 3090?因為兩張 3090 可以用 NVLink 這條專用線接在一起,傳資料的頻寬比主機板上的插槽高出一大截。他說兩張 3090 一起跑語言模型,比一張 48GB 的 4090 還能打;但如果主要是生圖,兩張卡還比不上一張記憶體大的單卡。AMD 兩張 7900 XTX 也能一起跑,論壇上已經有人跑起來,只是配套還不如 3090 成熟。 這一段他順便更正了自己兩次。一次是他以前說 NVLink 挑主機板,後來發現大家出問題,是橋接器和卡的厚度不合,或橋接器本身壞了。另一次是他說過雙 7900 XTX 用 X99 那種老主機板就行,那時成功的案例用的是 llama.cpp,換成 SGLang 就挑主機板。他在片尾也講,這些卡他沒有每張都買過,很多判斷來自論壇上大家貼的實測,錯了歡迎來指正。我喜歡這種講法,他把「我哪裡講錯過」直接擺在推薦旁邊。 32GB 那一級,他選 R9700,放棄 4080S 32G。他承認 R9700 慢一些,但他說在 Windows 和 Linux 上都已經成熟,是一線品牌出的新卡;4080S 32G 是改裝卡,他請觀眾去論壇看那些改裝卡出問題之後的經過。買兩張 R9700 的話,生圖可以兩張各跑一個工作,跑語言模型時湊成 64GB 一起用。 真正改變我想法的,是他講這件事的理由。以前窮的人只能二選一:要嘛折騰硬體(買二手、跟賣家周旋),要嘛折騰軟體(買 AMD、自己調環境)。現在軟體出問題,丟給 AI 代理去查就好。他舉論壇一位版主的例子,對方買了幾萬塊的卡,卻懶得自己調設定,他把自己的參數傳過去,讓對方丟給 AI 代理,很快就好了,一共花了人民幣一塊錢。硬體出問題,你要找的是二手平台上的賣家,輕一點商品連結不見,重一點電話都打不通。 我那台桌機這個月踩到的軟體坑,大部分也是 AI 陪我一個開關一個開關試出來的。這兩種麻煩的成本,已經不在同一個量級了。 ![左右兩條往上的路:左邊從「軟體出問題」一路走到頂端的 AI 代理,旁邊標人民幣 1 元;右邊從「硬體出問題」出發,走到半路路面斷開,頂端的二手賣家只剩虛線。](/figures/software-vs-hardware-trouble-two-roads.svg) ## 舊卡缺的那一格 第二支影片講的就是這些 48GB、64GB 看起來很划算的老卡。 RTX 8000,他形容就是一張 48GB 的 2080,稍微強一點,他講的行情是人民幣 11,000 元;兩張 32GB 的 V100 配一台舊伺服器,二手平台上賣人民幣 15,000 元。記憶體大,他說 48GB 也只能跑千問 27B 這種語言模型,生圖、生影片慢到不值得。 他翻出顯卡的世代表來講原因。V100 那一代、RTX 8000 和 2080 Ti 那一代,都不支援 BF16;到 3090 那一代(Ampere 架構)才開始支援。後面 4090 加上 FP8,5090 再加上更省的 4 位元格式,他說這些都有用,但加起來都比不上 BF16 那一步重要,因為現在的工具最低就是以 3090 那一代為目標在優化。他把 3090 和 7900 XTX 當成這個世代的入場門檻。 ![顯卡世代的階梯圖:V100 與 2080 Ti/RTX 8000 在低處、沒有 BF16;到 3090 階梯一口氣跳高,標為入場門檻與 BF16;之後 4090 加 FP8、5090 加 4 位元格式,都只再往上一小階。](/figures/gpu-generations-bf16-threshold-staircase.svg) 他還幫忙拆了一個常讓人買錯的地方:專業卡的名字。RTX A6000 跟 3090 同一代,48GB、有 NVLink、有 BF16,但沒有 FP8;RTX 6000(Ada 那一張)跟 4090 同一代,他說可以把它看成 48GB 版的 4090;RTX Pro 6000 則跟 5090 同一代,一張人民幣十幾萬。名字只差一兩個字,世代差了一整代,買二手專業卡之前,我會先把這一格對清楚。 ![三欄分別是 3090、4090、5090 世代,每欄底下掛一張名字都帶「6000」的專業卡:RTX A6000、RTX 6000(Ada)、RTX Pro 6000,名字幾乎一樣卻分散在三個不同世代。](/figures/pro-card-names-across-generations.svg) 已經買了的人,他倒沒有叫人丟掉:跑語言模型退回 FP16 算,27B 量化過還能玩,撐個一兩年沒問題。只是花了大錢,買到一半的功能。 ## 我那張卡,就是 AMD 這一邊的舊卡 我那張 RX 6600 XT 屬於 AMD 的 RDNA 2 世代,沒有原生的 BF16,照他的分法,落在門的外面。 先講他說對的部分。我 2026-09-12 在 Windows 上裝的是 AMD 官方給 Windows 的 PyTorch,不用任何轉譯工具,ComfyUI 抓得到卡,生影片的 MiniMax H3 也跑通了。他說 AMD 補強了,在我這台上對得起來。只是速度要有心理準備:一段 1.6 秒、608×352 的小影片,連同載入模型大約要 11 分鐘。 然後是繞路的部分,我照實測列出來: | 想做的事 | 照預設跑會怎樣 | 我怎麼繞 | |---|---|---| | 生圖(1024×1024、8 步) | 用 BF16 模擬,每步 43 秒,一張 6 分 10 秒 | 強制改 FP16,每步 14 秒,一張 2 分 15 秒,畫面正常 | | 生影片 | 同一招改 FP16,每步從 58 秒變 33 秒,存出來的檔只有 7.5KB,是壞的 | 影片不改 FP16,生圖和生影片分成兩個啟動捷徑 | | 用更省記憶體的 int8 版模型 | 5 秒就掛,這一代卡沒有 int8 的矩陣運算 | 一律改用 GGUF 版,4 位元的 nvfp4 版也不能用 | | 用 Ollama 跑語言模型 | 官方支援清單不收這張卡,退回處理器跑 | 改用 llama.cpp 的 Vulkan 版 | | 文字轉語音 | 其中兩種常見運算一跑就當 | 那兩段丟給處理器 | 影片存壞那一格,我猜是 FP16 的尺太短,數字超出去變成無效值,但沒有驗證過。另外還有兩個記憶體相關的開關,一個不加就報系統資源不足,另一個加了整個伺服器當掉,這些都是一次一次試出來的。 這張表讓我讀懂他那句「硬性殘疾」。卡沒有壞,每個工具最後大多有一條路走得通,可是每裝一個新東西,我都要先查它會不會踩到缺的那一格,而且事前看不出來,只能跑了才知道。生圖那格繞了變快,生影片那格照同一招繞,換來一個壞檔。 ![兩組橫條:生圖從每步 43 秒縮到 14 秒,標「畫面正常」;生影片從每步 58 秒縮到 33 秒,但標「壞檔 7.5KB」。同一招都變快,只有一邊結果是對的。](/figures/fp16-workaround-image-ok-video-broken.svg) 記憶體那一格也一樣。有一個讓影片裡的臉變清楚的工作,一次要 7.17GB,卡上總共 7.98GB,還是爆掉。AI 幫我把工作切成小塊塞進去,跑是跑得動了,畫面卻多了一格一格的方塊,又調了一輪才消掉。 ## 如果我今天重買 要不要換卡,我還沒決定,這是要花錢的事,我想再看自己的用量。但如果要挑,我的順序會變成這樣:先看它有沒有 BF16,照他的說法,NVIDIA 從 3090 那一代、AMD 從 7900 XTX 那一代開始算;再看顯示記憶體,我想跑的 27B 稠密模型,我查到的資料是要 24GB 才順;最後才比新卡和二手的價差,把「硬體出問題時我找得到誰」算進去。 ## 帶得走的一件事 我聽完想到的是:舊東西便宜的那一截,常常就是它缺的那一項功能。 ![兩根柱子:新品 $10 較高,二手 $6 較矮;二手柱頂上方到新品高度之間畫成虛線框,標「少的那一項」,表示便宜的那一截就是缺的功能。](/figures/cheap-gap-is-missing-feature.svg) 我打算下次這樣做,你要的話也可以試試:下次在二手平台看到一個比新品便宜一大截的東西,手機、相機、家電都算,按下購買之前,先查它「比新版少了哪一項」,寫在一張便利貼上,旁邊寫「這一年我會用到」或「用不到」。寫下少了哪一項就算完成。