快訊
2026-08-17

Flash Attention 是什麼?為什麼能讓大模型跑得更快、更省 VRAM

Flash Attention 是什麼 注意力分塊計算與 VRAM 節省原理示意圖

本地跑 LLM 時看到 Flash Attention 這個開關,到底該不該打開?站長把論文與各家原始碼翻過一輪,把中文圈最常弄反的三件事講清楚:它是演算法不是那個 pip 套件、它省的不是模型權重也不是 KV cache、它是 exact 不是近似所以不會讓模型變笨。內含 llama.cpp 與 Ollama 的實際參數、四代版本差異對照,以及消費級顯卡到底吃不吃得到的完整說明。

本地 LLM 模型怎麼選?7B/70B、Q4/Q8 量化與 VRAM 一次搞懂

本地 LLM 量化與 VRAM 需求對照 Q4 Q8 參數量示意圖

想在自己電腦跑 AI,卻被模型頁一堆 Q4、Q8、7B、70B 代號搞得霧煞煞?這篇從模型端把本地 LLM 的參數量與量化講清楚:Q4_K_M 的 K 和 M 是什麼、每 1B 參數大概吃多少 VRAM,教你一條估算記憶體的公式,並附 llama.cpp 官方檔案大小對照表與「幾 GB 顯示卡配什麼模型」決策表,不再點錯爆記憶體。