快訊
2026-08-17

MoE 混合專家是什麼?為何 235B 模型只算 22B、卻還是很吃 VRAM

MoE 混合專家架構解析:啟用參數與總參數對 VRAM 與速度影響示意圖

2026 年開源大模型名字愈來愈怪,動不動就是 Qwen3-235B-A22B、DeepSeek-V3 671B/37B,為何要標兩個參數量?答案是 MoE(混合專家)。本文白話拆解最容易搞混的錯配:總參數決定要多少 VRAM 才裝得下,啟用參數才決定跑多快,並附 Mixtral、Qwen3、DeepSeek、gpt-oss 規格對照與 VRAM 估算,讓你選本地 LLM 硬體不再被名字騙。

為什麼本地 LLM 跑不快?真瓶頸是記憶體頻寬,不是顯卡算力

記憶體頻寬與本地 LLM token 速度關係示意封面,含晶片與頻寬階梯圖示

在本地端跑 LLM,決定生成速度的常常不是顯示卡算力,而是記憶體頻寬。本文從自迴歸解碼機制講起,說明 token 速度為何約等於「頻寬 ÷ 模型大小」,並用 RTX 5090、Apple M5、Strix Halo 等官方頻寬數據對照,拆解模型溢出系統 RAM 的「頻寬懸崖」與統一記憶體「塞得下不等於跑得快」的取捨。