AI 的 Temperature 是什麼?調成 0 就真的不會亂回答嗎
AI 的 temperature 滑桿到底在調什麼?這篇用官方文件講清楚:它縮放的是挑下一個字的機率分布,跟答案正不正確無關。也拆解為什麼 Anthropic 明寫「temperature 0.0 仍不完全確定」、批次不變性如何讓同一個提示詞跑出 80 種結果,以及 top-p 為何官方要你二擇一調、推理模型為何乾脆不給你這個參數。
AI 的 temperature 滑桿到底在調什麼?這篇用官方文件講清楚:它縮放的是挑下一個字的機率分布,跟答案正不正確無關。也拆解為什麼 Anthropic 明寫「temperature 0.0 仍不完全確定」、批次不變性如何讓同一個提示詞跑出 80 種結果,以及 top-p 為何官方要你二擇一調、推理模型為何乾脆不給你這個參數。
看到 DistilBERT、DeepSeek-R1-Distill 就以為是「原模型的縮小版」?其實蒸餾是一種訓練方法,學的是老師對每個選項的信心比例,不是正確答案本身。本文從軟標籤、溫度 T 講到大語言模型時代的序列蒸餾與 GKD,並用官方模型卡拆穿一個常見誤會:R1-Distill 的骨架其實是 Qwen 和 Llama。順帶釐清蒸餾、量化、剪枝的差別,以及 2026 年的蒸餾合規爭議。
看到 LoRA、QLoRA、adapter 就頭大?本文把低秩微調的原理一次講清楚:為什麼兩個小矩陣就能代表整個權重變化、為什麼 B 矩陣要初始化為零、lora_alpha 跟 r 為什麼必須一起調。QLoRA 的 NF4、雙重量化與分頁最佳化器分別省在哪一段也逐項拆解,並整理官方公布的 VRAM 門檻數字,以及自行換算與官方實測之間該留多少餘裕。
在自己電腦上跑本地 LLM,字總是一個一個慢慢冒出來?Speculative Decoding 的解法很反直覺:讓小模型先猜下一批字,再由大模型一次驗證。本文拆解草稿與驗證兩階段、為何加速卻不掉品質,並用 NVIDIA 與 LM Studio 官方實測說明草稿模型不是越大越好、主模型不夠大時幾乎沒賺頭,以及 llama.cpp 的實際參數怎麼設。
加第二張顯卡就能讓本地大模型跑更快?這個直覺只對一半。本文依 llama.cpp 與 vLLM 官方文件,拆解 pipeline 與 tensor 兩種切分模式的真正差別——關鍵不是 PCIe 一秒搬幾 GB,而是每產生一個 token 要跨卡同步幾次。文中整理三條配置路線的適用情境與淘汰條件,並說明為何沒有 NVLink 的消費級雙卡該選 pipeline。
Model Context Protocol(MCP)是 Anthropic 在 2024 年開源、如今由 Linux Foundation 治理的開放標準,官方比喻為「AI 應用的 USB-C 埠」。本文說明 MCP 的主機/用戶端/伺服器架構、Tools 與 Resources 等核心原語、與 Function Calling 和 Agent Skills 的層次差異,並整理 2026-07-28 無狀態新版規格重點與官方明列的資安風險。
Claude 最近能自動生成 PowerPoint、Excel 這些文件,背後靠的就是 Agent Skills 這套機制。這篇文章拆解 SKILL.md 資料夾格式怎麼運作、漸進式揭露三層架構省下多少 token,也整理 Claude Skills 從 Anthropic 自家功能開放成跨平台標準的過程,並釐清它跟提示詞、MCP 到底差在哪裡。
AI 助理要怎麼查資料庫、訂機票、控制系統,而不是只會嘴巴回答?這篇拆解 Function Calling(工具呼叫)的完整運作機制與五步驟流程,比較 OpenAI、Anthropic、Google Gemini 三家實際做法差異,並釐清它跟 Structured Outputs、MCP 到底差在哪裡。
AI API 帳單常常因為同一份系統提示、同一份長文件重複運算而爆量?Prompt Caching(提示詞快取)就是解方:把不變的內容存起來重複讀取,不必每次重算。這篇把 Anthropic、OpenAI、Google、AWS 四家的快取機制攤開來比,含觸發門檻、省多少錢的實際數字,還有最常被忽略的設計地雷。
開源模型琳瑯滿目,但「開源」兩個字不能當商用保證——Llama、Qwen、DeepSeek、Gemma 授權條款差很大,GGUF、GPTQ、AWQ 量化格式也各有適用場景。這篇一次講清楚模型家族定位、授權能不能商用、量化格式該選哪個,還附簡化版 VRAM 估算公式,少踩一次授權或硬體規劃的雷。