為什麼本地 LLM 跑不快?真瓶頸是記憶體頻寬,不是顯卡算力
在本地端跑 LLM,決定生成速度的常常不是顯示卡算力,而是記憶體頻寬。本文從自迴歸解碼機制講起,說明 token 速度為何約等於「頻寬 ÷ 模型大小」,並用 RTX 5090、Apple M5、Strix Halo 等官方頻寬數據對照,拆解模型溢出系統 RAM 的「頻寬懸崖」與統一記憶體「塞得下不等於跑得快」的取捨。
在本地端跑 LLM,決定生成速度的常常不是顯示卡算力,而是記憶體頻寬。本文從自迴歸解碼機制講起,說明 token 速度為何約等於「頻寬 ÷ 模型大小」,並用 RTX 5090、Apple M5、Strix Halo 等官方頻寬數據對照,拆解模型溢出系統 RAM 的「頻寬懸崖」與統一記憶體「塞得下不等於跑得快」的取捨。
玩遊戲、跑繪圖跳 VIDEO_TDR_FAILURE(0x116)藍屏,或可靠性紀錄冒出 LiveKernelEvent 141「硬體錯誤」,先別急著買新顯卡。這是 Windows 偵測到顯示卡逾時、想重置卻失敗的訊號,八成出在驅動、散熱或供電。本文依微軟官方文件拆解 TDR 機制與四個藍屏參數,帶你從乾淨重裝驅動排到用 WinDbg 揪出兇手驅動。
當我們在選購新電腦、筆電,或是升級現有電腦的硬體時,除了影響運算速度的 CPU (中央處理器) 之外,另一個決