快訊
2026-08-17

AI 的 Temperature 是什麼?調成 0 就真的不會亂回答嗎

AI Temperature 取樣參數與 top-p 機率分布解析

AI 的 temperature 滑桿到底在調什麼?這篇用官方文件講清楚:它縮放的是挑下一個字的機率分布,跟答案正不正確無關。也拆解為什麼 Anthropic 明寫「temperature 0.0 仍不完全確定」、批次不變性如何讓同一個提示詞跑出 80 種結果,以及 top-p 為何官方要你二擇一調、推理模型為何乾脆不給你這個參數。

模型蒸餾 Distillation 是什麼?小模型怎麼跟大模型「偷學功夫」

模型蒸餾教師學生模型與軟標籤機率分布原理示意

看到 DistilBERT、DeepSeek-R1-Distill 就以為是「原模型的縮小版」?其實蒸餾是一種訓練方法,學的是老師對每個選項的信心比例,不是正確答案本身。本文從軟標籤、溫度 T 講到大語言模型時代的序列蒸餾與 GKD,並用官方模型卡拆穿一個常見誤會:R1-Distill 的骨架其實是 Qwen 和 Llama。順帶釐清蒸餾、量化、剪枝的差別,以及 2026 年的蒸餾合規爭議。

LoRA 微調是什麼?QLoRA 不用重新訓練整個模型也能改造 AI 的原理

LoRA 微調低秩分解與 QLoRA 4-bit 量化基座原理示意

看到 LoRA、QLoRA、adapter 就頭大?本文把低秩微調的原理一次講清楚:為什麼兩個小矩陣就能代表整個權重變化、為什麼 B 矩陣要初始化為零、lora_alpha 跟 r 為什麼必須一起調。QLoRA 的 NF4、雙重量化與分頁最佳化器分別省在哪一段也逐項拆解,並整理官方公布的 VRAM 門檻數字,以及自行換算與官方實測之間該留多少餘裕。

Speculative Decoding 是什麼?用小模型幫大模型「猜下一個字」為什麼會更快

Speculative Decoding 推測解碼草稿模型與目標模型驗證流程示意

在自己電腦上跑本地 LLM,字總是一個一個慢慢冒出來?Speculative Decoding 的解法很反直覺:讓小模型先猜下一批字,再由大模型一次驗證。本文拆解草稿與驗證兩階段、為何加速卻不掉品質,並用 NVIDIA 與 LM Studio 官方實測說明草稿模型不是越大越好、主模型不夠大時幾乎沒賺頭,以及 llama.cpp 的實際參數怎麼設。

雙顯卡跑大模型值不值?PCIe 頻寬、模型切分與實務取捨

雙顯卡跑大模型 PCIe 頻寬與模型切分示意封面

加第二張顯卡就能讓本地大模型跑更快?這個直覺只對一半。本文依 llama.cpp 與 vLLM 官方文件,拆解 pipeline 與 tensor 兩種切分模式的真正差別——關鍵不是 PCIe 一秒搬幾 GB,而是每產生一個 token 要跨卡同步幾次。文中整理三條配置路線的適用情境與淘汰條件,並說明為何沒有 NVLink 的消費級雙卡該選 pipeline。

MCP 是什麼?Model Context Protocol 讓 AI 接上你的工具與資料

Model Context Protocol(MCP)封面圖:AI 工具連接協定主題插圖

Model Context Protocol(MCP)是 Anthropic 在 2024 年開源、如今由 Linux Foundation 治理的開放標準,官方比喻為「AI 應用的 USB-C 埠」。本文說明 MCP 的主機/用戶端/伺服器架構、Tools 與 Resources 等核心原語、與 Function Calling 和 Agent Skills 的層次差異,並整理 2026-07-28 無狀態新版規格重點與官方明列的資安風險。

Claude Skills 是什麼?Agent Skills 讓 AI 學會新技能的開放標準

Claude Skills Agent Skills 資料夾結構示意圖

Claude 最近能自動生成 PowerPoint、Excel 這些文件,背後靠的就是 Agent Skills 這套機制。這篇文章拆解 SKILL.md 資料夾格式怎麼運作、漸進式揭露三層架構省下多少 token,也整理 Claude Skills 從 Anthropic 自家功能開放成跨平台標準的過程,並釐清它跟提示詞、MCP 到底差在哪裡。

Prompt Caching 是什麼:AI API 費用怎麼一口氣省一半以上

Prompt Caching 提示詞快取概念示意圖

AI API 帳單常常因為同一份系統提示、同一份長文件重複運算而爆量?Prompt Caching(提示詞快取)就是解方:把不變的內容存起來重複讀取,不必每次重算。這篇把 Anthropic、OpenAI、Google、AWS 四家的快取機制攤開來比,含觸發門檻、省多少錢的實際數字,還有最常被忽略的設計地雷。

開源模型怎麼選?一次搞懂 Llama、Qwen、DeepSeek 授權與量化規格

開源模型怎麼選?一次搞懂 Llama、Qwen、DeepSeek 授權與量化規格 2

開源模型琳瑯滿目,但「開源」兩個字不能當商用保證——Llama、Qwen、DeepSeek、Gemma 授權條款差很大,GGUF、GPTQ、AWQ 量化格式也各有適用場景。這篇一次講清楚模型家族定位、授權能不能商用、量化格式該選哪個,還附簡化版 VRAM 估算公式,少踩一次授權或硬體規劃的雷。