快訊
2026-08-18

雙顯卡跑大模型值不值?PCIe 頻寬、模型切分與實務取捨

雙顯卡跑大模型 PCIe 頻寬與模型切分示意封面

加第二張顯卡就能讓本地大模型跑更快?這個直覺只對一半。本文依 llama.cpp 與 vLLM 官方文件,拆解 pipeline 與 tensor 兩種切分模式的真正差別——關鍵不是 PCIe 一秒搬幾 GB,而是每產生一個 token 要跨卡同步幾次。文中整理三條配置路線的適用情境與淘汰條件,並說明為何沒有 NVLink 的消費級雙卡該選 pipeline。