快訊
2026-07-11
AI 硬體

AMD Strix Halo 值不值得買?128GB 統一記憶體跑本地 LLM 的真相

約 10 分鐘閱讀 · 34 次瀏覽

⚡ 站長快讀:核心重點

  • 文章屬性:規格解析 / 選購決策
  • 核心結論:Strix Halo(Ryzen AI Max+ 395)最大的價值是 128GB 統一記憶體最高可切 96GB 當 VRAM,讓消費級機器第一次「裝得下」70B 甚至 120B 模型;但 256 GB/s 頻寬決定了大模型「跑得慢」,買它前要先想清楚你要的是「跑得動」還是「跑得快」。
  • 適用對象:想在本地跑大模型、糾結該買迷你 AI PC 還是堆獨立顯示卡的人

📌 快速答案

一句話答案:Strix Halo(AMD Ryzen AI Max+ 395)靠 128GB 統一記憶體、最高 96GB 轉 VRAM,能在一台迷你 PC 裡跑下 70B 大模型;但 256 GB/s 頻寬讓大模型速度落在個位數 token/s,適合「要裝得下」而非「要最快」的人。

廣告

🔍 為什麼這台「小盒子」突然被拿來跟顯示卡比?

過去想在家跑大型語言模型,答案很簡單粗暴:買顯示卡、堆 VRAM。問題是消費級顯示卡的 VRAM 很小氣——RTX 4090、5090 頂天也才 24GB、32GB,想跑一個 70B 的模型根本裝不下,只能忍痛降級或砸錢上二手伺服器卡。

AMD 的 Strix Halo(正式名稱 Ryzen AI Max+ 395)從另一個方向打這個痛點:它是一顆 APU(把 CPU、GPU、NPU 全塞在一顆晶片裡),但配了最高 128GB 的統一記憶體,而且其中最多 96GB 可以透過「可變顯示記憶體」(Variable Graphics Memory,VGM)轉給 GPU 當 VRAM 用。換句話說,一台 4.5 公升的迷你 PC,忽然有了比任何消費級顯示卡都大的「顯示記憶體」。這就是它被拿來跟顯示卡放在同一張比較表上的原因。

但「裝得下」跟「跑得快」是兩回事——這篇就從規格拆解到實際該不該買,幫你把這件事講清楚。這也是站長認為多數行銷素材刻意迴避的重點:統一記憶體解決的是容量,不是速度


🧩 Strix Halo 到底是什麼?先把規格攤開

先講清楚這顆晶片的身分:Strix Halo 是 AMD 在 2025 年初 CES 發表的旗艦 APU,產品線叫「Ryzen AI Max 300 系列」,最高階型號就是 Ryzen AI Max+ 395。它的定位很特別——不是筆電低功耗晶片,也不是桌機獨立平台,而是一顆「把工作站等級的運算塞進薄型裝置」的整合方案。

以下是 AMD 官方規格頁(2026-07-06 查證)列出的核心數字:

項目Ryzen AI Max+ 395 規格
CPU16 核 32 執行緒 Zen 5,最高 5.1 GHz
iGPURadeon 8060S,40 組 RDNA 3.5 CU
NPUXDNA 2,最高 50 TOPS
整體算力最高 126 TOPS(CPU+GPU+NPU 合計)
記憶體256-bit LPDDR5X-8000,最高 128GB
記憶體頻寬256 GB/s(256-bit × 8000 MT/s)
VRAM 分配最高 96GB 可轉為顯示記憶體(VGM)
製程 / 功耗台積電 4nm;預設 TDP 55W,可設定 45–120W

這張表的重點摘要:

廣告
  • CPU 端是完整的 16 核 Zen 5,桌機級效能,不是筆電閹割版。
  • GPU 端的 Radeon 8060S 有 40 組運算單元,是目前 x86 平台裡數一數二強的內顯。
  • 真正的賣點是記憶體:256-bit 匯流排 + LPDDR5X-8000,配到 128GB,而且能撥 96GB 給 GPU。
  • 50 TOPS 的 NPU 是行銷主角,但跑本地 LLM 時它其實不是重點——這點下一段細講。

💡 補充:NPU 的 TOPS 數字在跑大型語言模型時參考價值有限。真正扛 LLM 推論的是 GPU + 記憶體頻寬,NPU 主要服務的是背景 AI 功能與小模型。想搞懂 NPU 到底有沒有用,可以看站長這篇 2026 本地端 AI 硬體指南:NPU 是智商稅嗎?


🧪 統一記憶體的真相:能「裝下」不等於能「跑快」

這是全篇最重要的一段,先給結論:Strix Halo 的 128GB 統一記憶體解決的是「模型裝不裝得下」,但它的 256 GB/s 頻寬決定了「大模型跑多快」——這兩件事千萬不要混為一談。

容量這關,它確實贏了

本地跑 LLM 的第一道門檻是「模型放不放得進 VRAM」。一個 70B 參數的模型,用業界常見的 Q4 量化大約要 40GB 上下的記憶體;120B 的 MoE 模型(像近期的開源大模型)更大。消費級獨立顯示卡最大 32GB,直接出局。

Strix Halo 撥 96GB 給 GPU,這些模型「塞得進去」了。AMD 官方部落格與 Framework 官網都明講:這台可以在桌上直接跑 Llama 70B 這種等級的模型。這在一台不到 5 公升、不用外接顯示卡的機器上,兩年前是不可想像的。想搞懂參數量、量化位元跟 VRAM 需求怎麼換算,可以參考站長的 本地 LLM 模型量化與 VRAM 需求對照

但速度這關,頻寬是硬天花板

問題來了:模型「跑多快」(每秒吐幾個字,token/s)在解碼階段幾乎完全被記憶體頻寬綁死,而不是算力。原理是每生成一個 token,GPU 都得把整個模型的權重從記憶體讀一遍;所以理論上限大約是「頻寬 ÷ 模型大小」。

Strix Halo 的頻寬是 256 GB/s。拿它跑一個 40GB 的 70B Q4 模型,理論上限大約是 256 ÷ 40 ≈ 每秒 6 個 token(實際會更低)。這是什麼概念?比人閱讀速度快一點點,可以用,但談不上流暢。相比之下,一張 RTX 4090 的頻寬約 1008 GB/s、5090 約 1792 GB/s——單看每個 token 的吐字速度,獨立顯示卡是碾壓級的快,只是它們裝不下大模型而已。

⚠️ 這就是統一記憶體平台共同的宿命:大容量 + 相對低頻寬。想深入理解「為什麼本地 LLM 的真瓶頸是記憶體頻寬、不是顯卡算力」,站長有一篇專文把數字算得更細:真瓶頸是記憶體頻寬,不是顯卡算力

AMD 自己的效能數據怎麼看

AMD 官方測試(2025 年 3 月,用 ASUS ROG Flow Z13 64GB、LM Studio、llama.cpp)主打的是「贏 Intel 內顯」:在 token 吞吐上最高達 Intel Arc 140V 的 2.2 倍,首字延遲在 14B 模型上最高快 12.2 倍。這些數字是真的,但要看清楚兩個前提:一是對手是筆電內顯、不是獨立顯示卡;二是測試模型偏中小型(≤14B)。到了 70B 這種真正吃記憶體的場景,比較對象和數字都會變——這也是為什麼站長強調要用「頻寬 ÷ 模型大小」這把尺自己心裡有數,別被行銷 benchmark 帶著走。

廣告

📊 值不值?先跟三個對手放在一起看

Strix Halo 不是活在真空裡。想在本地跑大模型,你的錢還可以往別的方向花。以下用「跑本地 LLM」這個單一情境做對照(規格為 2026-07-06 官方查證):

方案記憶體 / VRAM頻寬大模型能力參考價位
Strix Halo 迷你 PC最高 128GB,96GB 可當 VRAM256 GB/s裝得下 70B/120B,速度個位數 token/s官方 MSRP 約 US$1,599–1,999
Apple Silicon Mac統一記憶體,最高數百 GBM4 Max 約 546 GB/s(更高階更快)裝得下且頻寬更高,但貴高階機種明顯更貴
獨立顯示卡(RTX 4090/5090)24–32GB1008–1792 GB/s小模型飛快,大模型裝不下單卡即數萬元起
NVIDIA DGX Spark128GB約 256–273 GB/s 級定位開發原型機官方約 US$3,999 起

📋 重點摘要(行動版精簡版):

  • 要「裝得下」最省錢 → Strix Halo:一台迷你 PC 就有 96GB 可用 VRAM,單位容量成本無敵。
  • 要「跑得快」 → 獨立顯示卡:每 token 速度電爆,但被 VRAM 容量卡死,跑不了超大模型。
  • 要頻寬也要容量、且預算充足 → 高階 Apple Silicon:頻寬比 Strix Halo 高,但整機價格也高一截。
  • DGX Spark 帳面容量相同,但頻寬同樣落在統一記憶體的區間,且價格與定位偏開發者原型機,不是家用首選。

看懂這張表,你會發現 Strix Halo 的位置很清楚:它不是最快的,也不是最便宜的顯示卡替代品,而是「用最低成本把超大模型裝進一台安靜小機器」的那個選項。


🏆 三種人,三種答案

✅ 適合買 Strix Halo 的人

  • 你要跑的是 30B–70B 這種「獨立顯示卡裝不下、但你能接受個位數到低雙位數 token/s」的模型。
  • 你在意機器體積、噪音、耗電,想要一台放桌上安靜的小盒子,而不是一台轟隆作響的顯示卡工作站。
  • 你會玩 MoE 架構模型(例如活躍參數較小的大模型),這類模型能吃到大容量、又相對不那麼吃頻寬,是 Strix Halo 的甜蜜點。

❌ 這些情況請別買

  • 你只跑 7B–14B 小模型:一張中階獨立顯示卡又快又便宜,買 Strix Halo 是浪費它的大記憶體。
  • 你要的是即時、流暢、高吞吐的體驗:256 GB/s 頻寬在大模型上就是慢,期待值放太高會失望。
  • 你要拿它做模型訓練 / 微調:這顆的定位是推論與原型開發,訓練請看資料中心級硬體。

⚠️ 買之前一定要知道的三個現實

先給結論:Strix Halo 是好東西,但它的價值高度綁定「你跑什麼模型」,買錯情境會後悔。

廣告

第一,軟體生態還在成熟中。在 Windows 上,AMD 官方推薦的路徑是更新到最新 Adrenalin 驅動、把 VGM 設成 High、用 LM Studio 並把 GPU Offload 開到 MAX。這條路對一般使用者算友善(圖形化操作,不用打指令),但要跑得順,韌體與驅動版本要跟上;Linux 端則有多家評測(如 Phoronix)回報相容性良好。整體而言,它不像 NVIDIA CUDA 生態那樣「插上就好」,是要花點時間調的。

第二,頻寬天花板改不了。前面算過的 256 GB/s 是硬體規格,不會因為換驅動就變快。想清楚你最常跑的模型大小,用「頻寬 ÷ 模型大小」估一下能接受的速度,再決定要不要買。

第三,它是「單位容量便宜」,不是「絕對便宜」。官方 MSRP 從 64GB 版約 US$1,599 到 128GB 版約 US$1,999(以 Framework Desktop 為例),不是隨手可買的入門價;要對比的是「同樣容量,用獨立顯示卡要花多少、佔多大、多吵」,這樣它才划算。


💡 總結:站長怎麼看這台

站長我把 Strix Halo 定位成「本地 AI 的容量普及者」,而不是「速度怪獸」。它真正的歷史意義,是把「在家跑 70B 級模型」這件事,從「要嘛砸錢上多卡工作站、要嘛買頂規 Mac」的死局,拉到「一台一兩千美金的迷你 PC 就能做」的高度——這是實打實的門檻下降。

但站長也要老實講:它不會讓你的大模型變快,只會讓你的大模型「能跑」。 這顆晶片最尷尬的買家,是那種看了「跑得動 70B!」的標題就衝動下單、結果每秒吐幾個字覺得被騙的人。頻寬決定速度、容量決定能不能跑,這兩把尺請一定要分開量。

如果你是開發者、想在本地驗證大模型的原型、或是重視隱私不想把資料丟雲端,而且能接受「大模型慢慢跑」的節奏,那 Strix Halo 是 2026 年這個價位帶最有想像力的選擇。如果你追求的是流暢即時的推論體驗,老實說,先把模型縮小、或把錢投在頻寬更高的方案上,會比較不會後悔。

⚠️ 價格與庫存為撰文日(2026-07-06)查證之官方 MSRP,台灣通路實際售價與供貨依通路即時資訊為準,購買前請再次確認。


❓ 常見問題

Q:Strix Halo 真的能跑 Llama 70B 嗎?

能「跑」,但要放對期待。它靠 96GB 可用 VRAM 把 70B(Q4 約 40GB)裝進去,這點 AMD 與 Framework 官方都確認;但受限於 256 GB/s 頻寬,實際吐字速度大約在個位數 token/s(理論推估,實測依模型與設定而異),適合能接受「慢慢跑」的使用者。

Q:它跟頂規顯示卡比,到底差在哪?

差在「容量 vs 速度」的取捨。獨立顯示卡(如 RTX 5090)頻寬高達 1792 GB/s,每個 token 快得多,但 VRAM 只有 32GB,大模型根本裝不下;Strix Halo 反過來,容量海放、速度受限。沒有誰全贏,看你跑多大的模型。

Q:一定要買 128GB 版嗎?64GB 夠不夠?

看模型大小。若你主要跑 30B 以內、或 MoE 中型模型,64GB 版(約可撥 32–48GB 當 VRAM)通常夠且便宜約 US$400;想跑 70B 以上、或同時開多個模型 / 長上下文,才需要上 128GB。

Q:Windows 跟 Linux 哪個比較適合拿它跑 LLM?

兩者都可行。Windows 上用 LM Studio + VGM High 對新手最友善(圖形化、免打指令);Linux 端相容性也獲得多家評測正面評價,適合想用 llama.cpp、進階調校的玩家。


🔗 延伸閱讀

📎 參考資料來源

📖 第一級|廠商官方:

📖 第二級|權威技術媒體:

⚠️ 本文核心事實(規格、記憶體、VGM、價位)以第一級 AMD / Framework 官方為準;效能數字凡屬 AMD 官方測試皆已標註,70B 速度為依頻寬推估之理論上限,非站長實機實測,實際依機型與設定而異。

📅 本文查證戳記:2026-07-06 依 AMD 官方規格與部落格、Framework 官方頁撰寫。硬體規格與價格隨版本、通路變動,購買前請再次確認。

廣告