快訊
2026-09-04

Speculative Decoding 是什麼?用小模型幫大模型「猜下一個字」為什麼會更快

Speculative Decoding 推測解碼草稿模型與目標模型驗證流程示意

在自己電腦上跑本地 LLM,字總是一個一個慢慢冒出來?Speculative Decoding 的解法很反直覺:讓小模型先猜下一批字,再由大模型一次驗證。本文拆解草稿與驗證兩階段、為何加速卻不掉品質,並用 NVIDIA 與 LM Studio 官方實測說明草稿模型不是越大越好、主模型不夠大時幾乎沒賺頭,以及 llama.cpp 的實際參數怎麼設。

Flash Attention 是什麼?為什麼能讓大模型跑得更快、更省 VRAM

Flash Attention 是什麼 注意力分塊計算與 VRAM 節省原理示意圖

本地跑 LLM 時看到 Flash Attention 這個開關,到底該不該打開?站長把論文與各家原始碼翻過一輪,把中文圈最常弄反的三件事講清楚:它是演算法不是那個 pip 套件、它省的不是模型權重也不是 KV cache、它是 exact 不是近似所以不會讓模型變笨。內含 llama.cpp 與 Ollama 的實際參數、四代版本差異對照,以及消費級顯卡到底吃不吃得到的完整說明。

Intel Arc B580 本地 AI 划算嗎?12GB VRAM 台灣 NT$8,990,但軟體要付代價

Intel Arc B580 本地 AI 跑本地 LLM 顯卡選購比較示意圖

Intel Arc B580 用 NT$8,990 給你 12GB VRAM,而只有 8GB 的 NVIDIA 卡在同通路反而貴六到八成——但這篇不只算硬體帳。站長把 2026 年 8 月的軟體實況攤開:Intel 自家的 ipex-llm 已封存唯讀,接棒的 llm-scaler 對消費級單卡支援掛在 GitHub 沒人回。內含同通路同日四張卡價格對照、12GB 能跑多大模型,以及 PCIe 4.0 x8 陷阱。

雙顯卡跑大模型值不值?PCIe 頻寬、模型切分與實務取捨

雙顯卡跑大模型 PCIe 頻寬與模型切分示意封面

加第二張顯卡就能讓本地大模型跑更快?這個直覺只對一半。本文依 llama.cpp 與 vLLM 官方文件,拆解 pipeline 與 tensor 兩種切分模式的真正差別——關鍵不是 PCIe 一秒搬幾 GB,而是每產生一個 token 要跨卡同步幾次。文中整理三條配置路線的適用情境與淘汰條件,並說明為何沒有 NVLink 的消費級雙卡該選 pipeline。

本地 LLM 顯卡軟體生態:NVIDIA CUDA vs AMD ROCm vs Vulkan 怎麼選

本地 LLM 顯卡軟體生態 CUDA ROCm Vulkan 後端比較示意封面

買了顯卡卻發現本地 LLM 根本沒吃到 GPU?問題通常不在卡,而在軟體堆疊。本文交叉 AMD、Ollama、llama.cpp 三份官方文件,拆解 CUDA、ROCm、Vulkan 三條後端的真實支援邊界——包含 AMD 官方 ROCm 只認四個 Linux 發行版、RX 6000 消費卡整組不在支援表,以及同一張卡在 Windows 與 Linux 待遇不同的破口。看完你會知道該先選作業系統,還是先選卡。