⚡ 站長快讀:核心重點
- 文章屬性:規格解析 / 選購決策
- 核心結論:Strix Halo(Ryzen AI Max+ 395)最大的價值是 128GB 統一記憶體最高可切 96GB 當 VRAM,讓消費級機器第一次「裝得下」70B 甚至 120B 模型;但 256 GB/s 頻寬決定了大模型「跑得慢」,買它前要先想清楚你要的是「跑得動」還是「跑得快」。
- 適用對象:想在本地跑大模型、糾結該買迷你 AI PC 還是堆獨立顯示卡的人
📌 快速答案
一句話答案:Strix Halo(AMD Ryzen AI Max+ 395)靠 128GB 統一記憶體、最高 96GB 轉 VRAM,能在一台迷你 PC 裡跑下 70B 大模型;但 256 GB/s 頻寬讓大模型速度落在個位數 token/s,適合「要裝得下」而非「要最快」的人。
🔍 為什麼這台「小盒子」突然被拿來跟顯示卡比?
過去想在家跑大型語言模型,答案很簡單粗暴:買顯示卡、堆 VRAM。問題是消費級顯示卡的 VRAM 很小氣——RTX 4090、5090 頂天也才 24GB、32GB,想跑一個 70B 的模型根本裝不下,只能忍痛降級或砸錢上二手伺服器卡。
AMD 的 Strix Halo(正式名稱 Ryzen AI Max+ 395)從另一個方向打這個痛點:它是一顆 APU(把 CPU、GPU、NPU 全塞在一顆晶片裡),但配了最高 128GB 的統一記憶體,而且其中最多 96GB 可以透過「可變顯示記憶體」(Variable Graphics Memory,VGM)轉給 GPU 當 VRAM 用。換句話說,一台 4.5 公升的迷你 PC,忽然有了比任何消費級顯示卡都大的「顯示記憶體」。這就是它被拿來跟顯示卡放在同一張比較表上的原因。
但「裝得下」跟「跑得快」是兩回事——這篇就從規格拆解到實際該不該買,幫你把這件事講清楚。這也是站長認為多數行銷素材刻意迴避的重點:統一記憶體解決的是容量,不是速度。
🧩 Strix Halo 到底是什麼?先把規格攤開
先講清楚這顆晶片的身分:Strix Halo 是 AMD 在 2025 年初 CES 發表的旗艦 APU,產品線叫「Ryzen AI Max 300 系列」,最高階型號就是 Ryzen AI Max+ 395。它的定位很特別——不是筆電低功耗晶片,也不是桌機獨立平台,而是一顆「把工作站等級的運算塞進薄型裝置」的整合方案。
以下是 AMD 官方規格頁(2026-07-06 查證)列出的核心數字:
| 項目 | Ryzen AI Max+ 395 規格 |
|---|---|
| CPU | 16 核 32 執行緒 Zen 5,最高 5.1 GHz |
| iGPU | Radeon 8060S,40 組 RDNA 3.5 CU |
| NPU | XDNA 2,最高 50 TOPS |
| 整體算力 | 最高 126 TOPS(CPU+GPU+NPU 合計) |
| 記憶體 | 256-bit LPDDR5X-8000,最高 128GB |
| 記憶體頻寬 | 256 GB/s(256-bit × 8000 MT/s) |
| VRAM 分配 | 最高 96GB 可轉為顯示記憶體(VGM) |
| 製程 / 功耗 | 台積電 4nm;預設 TDP 55W,可設定 45–120W |
這張表的重點摘要:
- CPU 端是完整的 16 核 Zen 5,桌機級效能,不是筆電閹割版。
- GPU 端的 Radeon 8060S 有 40 組運算單元,是目前 x86 平台裡數一數二強的內顯。
- 真正的賣點是記憶體:256-bit 匯流排 + LPDDR5X-8000,配到 128GB,而且能撥 96GB 給 GPU。
- 50 TOPS 的 NPU 是行銷主角,但跑本地 LLM 時它其實不是重點——這點下一段細講。
💡 補充:NPU 的 TOPS 數字在跑大型語言模型時參考價值有限。真正扛 LLM 推論的是 GPU + 記憶體頻寬,NPU 主要服務的是背景 AI 功能與小模型。想搞懂 NPU 到底有沒有用,可以看站長這篇 2026 本地端 AI 硬體指南:NPU 是智商稅嗎?。
🧪 統一記憶體的真相:能「裝下」不等於能「跑快」
這是全篇最重要的一段,先給結論:Strix Halo 的 128GB 統一記憶體解決的是「模型裝不裝得下」,但它的 256 GB/s 頻寬決定了「大模型跑多快」——這兩件事千萬不要混為一談。
容量這關,它確實贏了
本地跑 LLM 的第一道門檻是「模型放不放得進 VRAM」。一個 70B 參數的模型,用業界常見的 Q4 量化大約要 40GB 上下的記憶體;120B 的 MoE 模型(像近期的開源大模型)更大。消費級獨立顯示卡最大 32GB,直接出局。
Strix Halo 撥 96GB 給 GPU,這些模型「塞得進去」了。AMD 官方部落格與 Framework 官網都明講:這台可以在桌上直接跑 Llama 70B 這種等級的模型。這在一台不到 5 公升、不用外接顯示卡的機器上,兩年前是不可想像的。想搞懂參數量、量化位元跟 VRAM 需求怎麼換算,可以參考站長的 本地 LLM 模型量化與 VRAM 需求對照。
但速度這關,頻寬是硬天花板
問題來了:模型「跑多快」(每秒吐幾個字,token/s)在解碼階段幾乎完全被記憶體頻寬綁死,而不是算力。原理是每生成一個 token,GPU 都得把整個模型的權重從記憶體讀一遍;所以理論上限大約是「頻寬 ÷ 模型大小」。
Strix Halo 的頻寬是 256 GB/s。拿它跑一個 40GB 的 70B Q4 模型,理論上限大約是 256 ÷ 40 ≈ 每秒 6 個 token(實際會更低)。這是什麼概念?比人閱讀速度快一點點,可以用,但談不上流暢。相比之下,一張 RTX 4090 的頻寬約 1008 GB/s、5090 約 1792 GB/s——單看每個 token 的吐字速度,獨立顯示卡是碾壓級的快,只是它們裝不下大模型而已。
⚠️ 這就是統一記憶體平台共同的宿命:大容量 + 相對低頻寬。想深入理解「為什麼本地 LLM 的真瓶頸是記憶體頻寬、不是顯卡算力」,站長有一篇專文把數字算得更細:真瓶頸是記憶體頻寬,不是顯卡算力。
AMD 自己的效能數據怎麼看
AMD 官方測試(2025 年 3 月,用 ASUS ROG Flow Z13 64GB、LM Studio、llama.cpp)主打的是「贏 Intel 內顯」:在 token 吞吐上最高達 Intel Arc 140V 的 2.2 倍,首字延遲在 14B 模型上最高快 12.2 倍。這些數字是真的,但要看清楚兩個前提:一是對手是筆電內顯、不是獨立顯示卡;二是測試模型偏中小型(≤14B)。到了 70B 這種真正吃記憶體的場景,比較對象和數字都會變——這也是為什麼站長強調要用「頻寬 ÷ 模型大小」這把尺自己心裡有數,別被行銷 benchmark 帶著走。
📊 值不值?先跟三個對手放在一起看
Strix Halo 不是活在真空裡。想在本地跑大模型,你的錢還可以往別的方向花。以下用「跑本地 LLM」這個單一情境做對照(規格為 2026-07-06 官方查證):
| 方案 | 記憶體 / VRAM | 頻寬 | 大模型能力 | 參考價位 |
|---|---|---|---|---|
| Strix Halo 迷你 PC | 最高 128GB,96GB 可當 VRAM | 256 GB/s | 裝得下 70B/120B,速度個位數 token/s | 官方 MSRP 約 US$1,599–1,999 |
| Apple Silicon Mac | 統一記憶體,最高數百 GB | M4 Max 約 546 GB/s(更高階更快) | 裝得下且頻寬更高,但貴 | 高階機種明顯更貴 |
| 獨立顯示卡(RTX 4090/5090) | 24–32GB | 1008–1792 GB/s | 小模型飛快,大模型裝不下 | 單卡即數萬元起 |
| NVIDIA DGX Spark | 128GB | 約 256–273 GB/s 級 | 定位開發原型機 | 官方約 US$3,999 起 |
📋 重點摘要(行動版精簡版):
- 要「裝得下」最省錢 → Strix Halo:一台迷你 PC 就有 96GB 可用 VRAM,單位容量成本無敵。
- 要「跑得快」 → 獨立顯示卡:每 token 速度電爆,但被 VRAM 容量卡死,跑不了超大模型。
- 要頻寬也要容量、且預算充足 → 高階 Apple Silicon:頻寬比 Strix Halo 高,但整機價格也高一截。
- DGX Spark 帳面容量相同,但頻寬同樣落在統一記憶體的區間,且價格與定位偏開發者原型機,不是家用首選。
看懂這張表,你會發現 Strix Halo 的位置很清楚:它不是最快的,也不是最便宜的顯示卡替代品,而是「用最低成本把超大模型裝進一台安靜小機器」的那個選項。
🏆 三種人,三種答案
✅ 適合買 Strix Halo 的人
- 你要跑的是 30B–70B 這種「獨立顯示卡裝不下、但你能接受個位數到低雙位數 token/s」的模型。
- 你在意機器體積、噪音、耗電,想要一台放桌上安靜的小盒子,而不是一台轟隆作響的顯示卡工作站。
- 你會玩 MoE 架構模型(例如活躍參數較小的大模型),這類模型能吃到大容量、又相對不那麼吃頻寬,是 Strix Halo 的甜蜜點。
❌ 這些情況請別買
- 你只跑 7B–14B 小模型:一張中階獨立顯示卡又快又便宜,買 Strix Halo 是浪費它的大記憶體。
- 你要的是即時、流暢、高吞吐的體驗:256 GB/s 頻寬在大模型上就是慢,期待值放太高會失望。
- 你要拿它做模型訓練 / 微調:這顆的定位是推論與原型開發,訓練請看資料中心級硬體。
⚠️ 買之前一定要知道的三個現實
先給結論:Strix Halo 是好東西,但它的價值高度綁定「你跑什麼模型」,買錯情境會後悔。
第一,軟體生態還在成熟中。在 Windows 上,AMD 官方推薦的路徑是更新到最新 Adrenalin 驅動、把 VGM 設成 High、用 LM Studio 並把 GPU Offload 開到 MAX。這條路對一般使用者算友善(圖形化操作,不用打指令),但要跑得順,韌體與驅動版本要跟上;Linux 端則有多家評測(如 Phoronix)回報相容性良好。整體而言,它不像 NVIDIA CUDA 生態那樣「插上就好」,是要花點時間調的。
第二,頻寬天花板改不了。前面算過的 256 GB/s 是硬體規格,不會因為換驅動就變快。想清楚你最常跑的模型大小,用「頻寬 ÷ 模型大小」估一下能接受的速度,再決定要不要買。
第三,它是「單位容量便宜」,不是「絕對便宜」。官方 MSRP 從 64GB 版約 US$1,599 到 128GB 版約 US$1,999(以 Framework Desktop 為例),不是隨手可買的入門價;要對比的是「同樣容量,用獨立顯示卡要花多少、佔多大、多吵」,這樣它才划算。
💡 總結:站長怎麼看這台
站長我把 Strix Halo 定位成「本地 AI 的容量普及者」,而不是「速度怪獸」。它真正的歷史意義,是把「在家跑 70B 級模型」這件事,從「要嘛砸錢上多卡工作站、要嘛買頂規 Mac」的死局,拉到「一台一兩千美金的迷你 PC 就能做」的高度——這是實打實的門檻下降。
但站長也要老實講:它不會讓你的大模型變快,只會讓你的大模型「能跑」。 這顆晶片最尷尬的買家,是那種看了「跑得動 70B!」的標題就衝動下單、結果每秒吐幾個字覺得被騙的人。頻寬決定速度、容量決定能不能跑,這兩把尺請一定要分開量。
如果你是開發者、想在本地驗證大模型的原型、或是重視隱私不想把資料丟雲端,而且能接受「大模型慢慢跑」的節奏,那 Strix Halo 是 2026 年這個價位帶最有想像力的選擇。如果你追求的是流暢即時的推論體驗,老實說,先把模型縮小、或把錢投在頻寬更高的方案上,會比較不會後悔。
⚠️ 價格與庫存為撰文日(2026-07-06)查證之官方 MSRP,台灣通路實際售價與供貨依通路即時資訊為準,購買前請再次確認。
❓ 常見問題
Q:Strix Halo 真的能跑 Llama 70B 嗎?
能「跑」,但要放對期待。它靠 96GB 可用 VRAM 把 70B(Q4 約 40GB)裝進去,這點 AMD 與 Framework 官方都確認;但受限於 256 GB/s 頻寬,實際吐字速度大約在個位數 token/s(理論推估,實測依模型與設定而異),適合能接受「慢慢跑」的使用者。
Q:它跟頂規顯示卡比,到底差在哪?
差在「容量 vs 速度」的取捨。獨立顯示卡(如 RTX 5090)頻寬高達 1792 GB/s,每個 token 快得多,但 VRAM 只有 32GB,大模型根本裝不下;Strix Halo 反過來,容量海放、速度受限。沒有誰全贏,看你跑多大的模型。
Q:一定要買 128GB 版嗎?64GB 夠不夠?
看模型大小。若你主要跑 30B 以內、或 MoE 中型模型,64GB 版(約可撥 32–48GB 當 VRAM)通常夠且便宜約 US$400;想跑 70B 以上、或同時開多個模型 / 長上下文,才需要上 128GB。
Q:Windows 跟 Linux 哪個比較適合拿它跑 LLM?
兩者都可行。Windows 上用 LM Studio + VGM High 對新手最友善(圖形化、免打指令);Linux 端相容性也獲得多家評測正面評價,適合想用 llama.cpp、進階調校的玩家。
🔗 延伸閱讀
- LM Studio 完整教學:不打指令,在 Windows 本地跑 LLM
- 你的 “AI PC” 只是行銷騙局?2026 本地端大模型 (LLM) 實戰與 NPU 真實算力揭密
- Whisper 語音轉文字教學:錄音、影片一鍵轉逐字稿,本地離線免上傳
- Windows 11 25H2 實戰:解放你的 NPU!本地端 AI 算力啟用與 Ollama 最佳化指南 (2026版)
- 提示詞怎麼寫?10 個技巧讓 AI 聽懂你要什麼(新手入門)
📎 參考資料來源
📖 第一級|廠商官方:
- AMD Ryzen™ AI Max+ 395 產品規格頁 — 2026-07-06 查證
- AMD 官方部落格:Ryzen AI MAX+ 395 Breakthrough AI Performance — 2026-07-06 查證
- Framework Desktop 官方產品頁 — 2026-07-06 查證
📖 第二級|權威技術媒體:
- ServeTheHome:Framework Desktop AMD Strix Halo 評測 — 2026-07-06 查證
- Phoronix:Framework Desktop AMD Ryzen AI Max Linux 效能評測 — 2026-07-06 查證
⚠️ 本文核心事實(規格、記憶體、VGM、價位)以第一級 AMD / Framework 官方為準;效能數字凡屬 AMD 官方測試皆已標註,70B 速度為依頻寬推估之理論上限,非站長實機實測,實際依機型與設定而異。
📅 本文查證戳記:2026-07-06 依 AMD 官方規格與部落格、Framework 官方頁撰寫。硬體規格與價格隨版本、通路變動,購買前請再次確認。