快訊
2026-07-23
AI 硬體

本地 LLM 顯卡軟體生態:NVIDIA CUDA vs AMD ROCm vs Vulkan 怎麼選

約 12 分鐘閱讀

⚡ 站長快讀:核心重點

  • 文章屬性:選購比較(軟體堆疊選型)
  • 核心結論:本地 LLM 顯卡軟體生態的決策點不在顯卡型號,而在「作業系統 × 後端」的交叉——同一張卡在 Linux 與 Windows 底下,官方支援程度可以差一整個世代。
  • 適用對象:手上已經有卡(或正要買卡)、想在自己機器上跑 GGUF 模型,卻搞不懂 CUDA、ROCm、Vulkan 差在哪的人。
  • 本文比較範圍:llama.cpp / Ollama / LM Studio 這條 GGUF 推論路線上,2026 年 7 月當下三大 GPU 後端的官方支援現況;不含雲端與資料中心卡。

📌 快速答案

一句話答案:本地 LLM 顯卡軟體生態由 CUDA、ROCm、Vulkan 三條堆疊撐起——NVIDIA 用 CUDA 最省事,AMD 在 Linux 才有完整 ROCm,其餘情況一律用 Vulkan 保底。

廣告

🔍 為什麼這個選擇很重要?

多數人挑本地 LLM 的機器,眼睛只盯著 VRAM 幾 GB、頻寬多少 GB/s。硬體規格當然重要——這部分站長之前在〈2026 本地端 AI(Local LLM)硬體指南:NPU 是智商稅嗎?〉已經拆過一輪。但很多人是買完卡、插上去、灌好軟體,才發現一個更基本的問題:它根本沒吃到 GPU

原因就在軟體堆疊。GPU 不會自己聽懂「請幫我算矩陣乘法」,中間要有一層運算 API 把工作翻譯下去。llama.cpp 官方列出的後端表裡,對應到桌機顯卡的主要就三條:CUDA(NVIDIA)、HIP(AMD,也就是 ROCm 那套)、Vulkan(跨廠通用),另外 Intel GPU 走 SYCL、Apple Silicon 走 Metal。

本文和一般「AMD 能不能跑 LLM」的文章有三個不一樣的切入點,先講在前面:

  1. 決定能不能跑的是「OS × 後端」交叉,不是卡的型號。 下面會用 AMD 官方與 Ollama 官方兩份支援表交叉出來的破口說明——同一張 RX 7900 XTX,Linux 和 Windows 的待遇不同;而 RDNA4 的 RX 9070 在 AMD 官方 ROCm 表裡是支援的,在 Ollama 的 Windows ROCm 清單裡卻找不到。
  2. Vulkan 不是「次等替代品」,是保底方案,但它有明確的代價。 本文查到的官方文件把代價明確指向排程資訊這一面(精度面官方未著墨,本文不臆測),下面拆。
  3. 官方支援清單 ≠ 實際跑不跑得動。 兩邊都有官方載明的逃生門(gfx target 覆寫、社群 nightly 建置),但那是「自己承擔」的路。

📊 關鍵規格快速比較

後端主要對應硬體Windows 現況最大罩門站長推薦度
CUDANVIDIA GPU原生支援,驅動裝好即可完全綁定 NVIDIA;老卡有運算能力門檻⭐⭐⭐⭐⭐
ROCm / HIPAMD Radeon、Ryzen APU框架支援窄,官方僅列 PyTorchOS 發行版與型號清單都限縮得很緊⭐⭐⭐
Vulkan幾乎所有現代 GPU多數廠商驅動已內建,免額外設定VRAM 回報需權限,排程退為近似值⭐⭐⭐⭐

⚠️ 上表為 2026-07-22 查證之官方支援聲明現況,不是效能排名;三者的實際速度差異依卡別、模型與量化格式而異,本文不提供未經第一手實測的效能數字。

CUDA、ROCm 與 Vulkan 三大後端官方支援現況比較表

📋 重點摘要(行動版精簡版)

  • 最推薦:CUDA——不是因為它最快,而是因為它的「能不能跑」問號最少。
  • 次選:Vulkan——跨廠、驅動內建、Windows 幾乎免設定,拿來保底最實在。
  • 條件推:ROCm——只有在你願意照官方指定的 Linux 發行版走的時候,它才是完整的那個 ROCm。

🔎 逐項深入解析

CUDA:選它是為了「不用查支援表」

直接結論:CUDA 的價值不在效能領先,而在它把「相容性」這個變數幾乎消掉了。

llama.cpp 官方後端表把 CUDA 直接標為 NVIDIA GPU 的對應後端;README 也寫明專案的自訂 kernel 是以 CUDA 撰寫,AMD 是透過 HIP 沿用同一套、Moore Threads 則透過 MUSA——換句話說,CUDA 是那條被別人拿來對接的基準路徑。實務上你會遇到的門檻多半只有一個:卡夠不夠新。以 Ollama 官方硬體支援頁為例,它要求 NVIDIA GPU 的運算能力(compute capability)5.0 以上、驅動版本 550 以上;運算能力落在 5.0 到 6.2 之間的舊卡(Maxwell、Pascal 世代),還要再往上要求驅動 570 以上

廣告

換句話說,GTX 750 Ti 這種等級的老卡在名單上,但要吃到更新的驅動;RTX 20/30/40/50 系列則完全落在舒適區。這也是為什麼「二手 3090」長年是本地 LLM 社群的口袋名單——它的軟體面幾乎零風險,剩下的只是 VRAM 夠不夠的問題,而那部分可以靠量化調節,細節見〈本地 LLM 模型怎麼選?7B/70B、Q4/Q8 量化與 VRAM 一次搞懂〉。

ROCm:完整版只在 Linux,而且挑發行版

直接結論:ROCm 這幾年進步很大,但「支援」兩個字在 AMD 官方文件裡被切得很細——切到你必須逐項對照才知道自己算不算。

先講好消息。AMD 官方的《Use ROCm on Radeon and Ryzen》文件寫明,ROCm 7.2.1 已經支援 Radeon 9000 系列(RDNA 4)與部分 7000 系列(RDNA 3),並且首次把 Ryzen APU(AI Max 300 系列、部分 AI 400 與部分 AI 300 系列) 納入。同一頁的平台支援表也直接列出 Radeon GPU 在 Linux 上支援 PyTorch、TensorFlow、JAX、ONNX,而 Windows 上官方列出的框架只有 PyTorch;llama.cpp 則被列在「Radeon on Linux」的既有支援功能裡。

再看硬體清單。AMD ROCm 的 Linux 系統需求頁(頁面標示 2026-04-17 更新,對應生產版本 ROCm 7.2.4;另有 7.13.0 技術預覽)列出的消費級 Radeon 只有這些:

  • RDNA 4:RX 9070 XT、9070 GRE、9070、9060 XT、9060 XT LP、9060
  • RDNA 3:RX 7900 XTX、7900 XT、7900 GRE、7800 XT、7700 XT、7700

RX 6000 系列的消費卡整組不在這張表上(RDNA 2 只留下 Radeon PRO W6800 與 V620)。而且同一頁的註腳寫得更嚴:這些 Radeon 與 Radeon PRO 卡只支援 Ubuntu 24.04.4、Ubuntu 22.04.5、RHEL 10.1、RHEL 9.7 這四個發行版——不是「Linux 都行」,是這四個。注意 AMD 自己有兩張表:安裝文件註腳是上述四個,但 Radeon/Ryzen 專屬的 Linux 相容性矩陣只列 Ubuntu 24.04.4、22.04.5 與 RHEL 10.1(沒有 RHEL 9.7)——兩表不一致時請以較嚴格的三個為準。另外 ROCm 要求 CPU 支援 PCIe atomics,官方說明 AMD 第一代 Zen 與 Intel Haswell 之後的現代 CPU 都有。

最後是 WSL 這條路。AMD 在同一份文件裡說明,ROCm 7.2.1 搭配 Adrenalin 26.2.2 起,才首次為 Strix 與 Strix Halo SKU 提供開源 ROCDXG 的 WSL 生產支援——這對想在 Windows 筆電上用 Ryzen AI APU 跑東西的人是關鍵資訊。Strix Halo 這顆晶片本身的取捨,站長在〈AMD Strix Halo 值不值得買?128GB 統一記憶體跑本地 LLM 的真相〉裡拆過。

廣告

Vulkan:跨廠的保底方案,代價是「排程看不清楚」

直接結論:Vulkan 讓幾乎任何一張現代 GPU 都有機會參與運算,但它取得的硬體資訊比原生後端少,而這會直接影響排程決策。

llama.cpp 的後端表把 Vulkan 的對應裝置直接寫成「GPU」——不指定廠商,這就是它的定位。Ollama 官方硬體頁進一步說明:Vulkan 在 Windows 與 Linux 上提供額外的 GPU 支援,後端安裝後預設啟用;Windows 上多數 GPU 廠商的驅動已經內建 Vulkan,不需要額外設定步驟,Linux 則多半要另外安裝元件(Mesa 或廠商專屬套件擇一)。

代價在這裡:Ollama 的排程器要靠 GPU 函式庫回報的可用 VRAM 數據來決定怎麼分配,而Vulkan 需要額外的 capability 或以 root 執行,才能把這份可用 VRAM 資料吐出來。兩者都沒有的話,Ollama 只能拿模型的近似大小去做盡力而為的排程。官方給的解法是在 Linux 上授予對應能力:

sudo setcap cap_perfmon+ep /usr/local/bin/ollama

實務上還有兩個環境變數值得先記起來:

GGML_VK_VISIBLE_DEVICES=1

用來指定要用哪一顆 Vulkan 裝置(官方特別提到 iGPU 與獨顯混插、iGPU 那顆不穩時,就把索引指到獨顯)。要整組關掉 Vulkan 則是:

OLLAMA_VULKAN=0

⚠️ 反向淘汰指標 / 極端缺點揭露

三條路都有真實的硬傷,而且都寫在官方文件裡。買卡前看這段比看跑分有用。

各方案的「不該選」情境

CUDA — 這些情況請別預設它

廣告
  • 致命缺點:完全綁定 NVIDIA。手上是 AMD 或 Intel 卡,這條路直接不存在,沒有中間地帶。
  • 使用場景排除:主力機是 Maxwell 之前的骨董卡(運算能力低於 5.0),依 Ollama 官方支援表就已經出局。

ROCm — 這些情況請別碰

  • 致命缺點:支援清單同時被三個維度切——卡別、作業系統發行版、框架。三個維度任一沒對上,就不算官方支援。最容易踩的是第二個:裝的是 Fedora、Arch、Debian 桌面或 Ubuntu 25.x,而官方對 Radeon 卡只列 Ubuntu 24.04.4 / 22.04.5 與 RHEL 10.1 / 9.7。
  • 使用場景排除:純 Windows 環境又想要 PyTorch 以外的框架。AMD 官方 Windows 那一列只寫 PyTorch,其餘框架的官方支援是掛在 Linux 那一列的。

Vulkan — 這些情況請別當主力

  • 致命缺點:VRAM 回報要靠額外權限,拿不到就退化成官方所稱的「近似大小、盡力而為」排程。在「模型剛好塞得下又剛好塞不下」的臨界點上,這種近似估算最容易翻車。
  • 使用場景排除:你要做的是訓練或微調、要用 PyTorch 生態。那條路走的是 CUDA 或 ROCm,Vulkan 在這裡幫不上忙。

站長故意不推的選項

為了跑本地 LLM,特地去買二手 RDNA 2 的 A 卡(RX 6800 / 6900 XT 這類)。

這個組合在社群裡常被推,理由是 16GB VRAM 便宜。但把兩份官方文件疊在一起看就知道風險在哪:AMD 自家的 ROCm 系統需求表裡,RX 6000 系列消費卡整組不在支援清單上(RDNA 2 只剩 PRO W6800 與 V620);Ollama 官方的 Linux ROCm 清單倒是把 6950 XT、6900 XT、6800 XT、6800 列進去了,但 Ollama 的 Windows ROCm 清單就到 RX 7000 系列為止,RX 6000 系列一張都沒有

這代表什麼?你買的是一張「在 Linux 上有工具鏈願意支援、在 Windows 上沒有、在晶片商自己的支援表上也不在」的卡。能不能跑?很可能可以——但你是在靠下游工具的善意,不是靠官方承諾。願意承擔就上,不知情就買最傷。

順帶一提,這種「官方清單沒有但實際上跑得動」的灰色地帶,官方自己也留了門:Ollama 文件載明可以用 HSA_OVERRIDE_GFX_VERSION 把裝置偽裝成相近的 LLVM target(它舉的例子是 RX 5400 屬 gfx1034、ROCm 未支援,可覆寫為 10.3.0 借用 gfx1030);AMD ROCm 文件也提到未列名的 GPU 可能透過 TheRock nightly 建置取得社群支援。兩條都是「自負盈虧」的路,不是保證。


🏆 站長推薦:不同需求怎麼選

  • 只想趕快跑起來、不想研究:NVIDIA + CUDA。付出的是硬體溢價,換掉的是整段相容性排查時間。
  • 手上是 AMD 官方 ROCm 表上的卡(RX 9000 全系,或 RX 7900 XTX / 7900 XT / 7900 GRE / 7800 XT / 7700 XT / 7700),而且願意用 Linux:走 ROCm,但先照官方發行版清單選 OS(保守起見取 Ubuntu 24.04.4 / 22.04.5 或 RHEL 10.1),不要先裝好系統再回頭遷就。注意 RX 7600 與 7600 XT 不在 AMD 這張表上。
  • Windows 使用者,卡是 AMD、Intel 或不在任何清單上:Vulkan。Windows 驅動多半已經內建,是這三條路裡設定成本最低的。
  • Ryzen AI 筆電(AI Max 300 系列,以及部分 AI 400 / AI 300 系列):Windows 上走官方 PyTorch 支援或 WSL 的 ROCDXG(需 Adrenalin 26.2.2 + ROCm 7.2.1),要跑 GGUF 推論則 Vulkan 通常最快上手。
  • Intel Arc:llama.cpp 官方對應的是 SYCL 後端;想省事一樣可以先用 Vulkan 保底。

💡 總結:選型眉角

站長我在整理這三條堆疊的官方文件時,最深的一個感想是:「支援」這兩個字在 GPU 運算生態裡,從來不是一個布林值。

它至少是四個維度的交集——晶片架構、作業系統、發行版本、上層框架。AMD 的文件把這四個維度分在三份不同的頁面上寫,你要自己交叉;NVIDIA 的門檻少一些,但也有運算能力與驅動版本的暗門;Vulkan 看起來最寬鬆,卻在排程資訊上留了一個要靠權限才能補的洞。

所以真正實用的選型順序是反過來的:先確定你要用的作業系統與框架,再回頭決定買哪張卡——而不是先買卡,再祈禱軟體那邊有人接。

本文所有支援現況均引自 AMD、Ollama、llama.cpp 與 LM Studio 官方文件,屬公開文件交叉查證(E3),無第一手實測;三者的實際效能差距請以你自己機器上的 llama-bench 結果為準。

順帶補一個常被忽略的前置條件:LM Studio 官方系統需求載明,Windows x64 版要求 CPU 支援 AVX2 指令集,並建議至少 16GB RAM 與 4GB 以上專用 VRAM;macOS 版只支援 Apple Silicon(M1/M2/M3/M4)且需 macOS 14.0 以上;Linux 版以 AppImage 發布、需 Ubuntu 20.04 以上。有些人卡在啟動就失敗,問題根本不在顯卡。


❓ 常見問題

Q:所以 AMD 顯卡到底能不能跑本地 LLM?

可以,但要先問三個子問題:卡在不在清單上、你用哪個作業系統、要用哪個框架。AMD 官方 ROCm 支援的消費級 Radeon 是 RX 9000 全系與 RX 7900/7800/7700 這幾張,且 Radeon 卡的 Linux 只認 Ubuntu 24.04.4 / 22.04.5 與 RHEL 10.1(安裝文件註腳另列 RHEL 9.7,兩表不一致時取較嚴格者)。不符合就走 Vulkan,一樣跑得動,只是排程精度要打折。

Q:我用 Windows,ROCm 跟 Vulkan 該選哪個?

以官方文件的支援廣度看,Windows 上 Vulkan 的門檻明顯低——多數 GPU 廠商驅動已內建、不需要額外設定。ROCm 在 Windows 的官方框架支援目前只列 PyTorch,想跑 GGUF 推論的人不一定用得到那條。

Q:Intel 的顯卡呢?

llama.cpp 官方後端表裡,Intel GPU 對應的是 SYCL 後端;另外 OpenVINO 後端在表上標記為進行中(In Progress)。想省事的話,Vulkan 同樣涵蓋 Intel 的現代 GPU。

Q:我的卡不在任何官方清單上,是不是就沒救了?

不一定。Vulkan 是第一條退路。AMD 這邊,官方文件也提到未列名 GPU 可能經由 TheRock nightly 建置取得社群支援,Ollama 則提供 HSA_OVERRIDE_GFX_VERSION 讓你借用相近的 LLVM target。但這兩條都不是官方保證,出事沒人接——不要拿它當買卡的理由


🔗 延伸閱讀


📎 參考資料來源

📖 第一級|官方文件:

📅 本文查證戳記:2026-07-22 撰寫。GPU 後端支援清單隨版本更新變動頻繁,實際部署前請再次確認官方最新支援矩陣。


廣告