⚡ 站長快讀:核心重點
- 文章屬性:科技冷知識 / 規格解析
- 核心結論:很多人把「Claude 的憲法」想成模型執行時逐條查閱的法典,但它其實是訓練期的教材——這個定位差異決定了三件事:官方要換價值觀就得重訓模型、你在對話中引述條文能起的作用有限(站長我的推論,官方未對此表態),以及同樣叫 constitutional 的越獄防護其實是另一套機制。
- 適用對象:每天在用 Claude、ChatGPT,想知道「AI 的底線是誰、用什麼方式定的」的人
📌 快速答案
一句話答案:Constitutional AI 是什麼?它是 Anthropic 提出的訓練法,用一份白紙黑字的原則清單當唯一人類監督,讓 AI 自己批評、修改並替回答排序,取代人工標註有害內容。
🔍 故事的起點
2022 年 12 月 15 日,Anthropic 在 arXiv 丟出一篇論文,標題是《Constitutional AI: Harmlessness from AI Feedback》。摘要第一句就把野心講完了:隨著 AI 系統愈來愈強,我們希望找 AI 來幫忙監督 AI。作法是訓練一個無害的 AI 助理,而且完全不用任何人類標註來指認哪些輸出有害——人類唯一提供的監督,就是一份規則或原則清單,所以他們把這個方法叫做「Constitutional(憲法式)」。
這件事之所以要做,是因為當時業界主流的 RLHF(從人類回饋做強化學習)有幾個很現實的麻煩。Anthropic 官方在 2023 年 5 月 9 日的〈Claude’s Constitution〉裡列得很直白:第一,這個流程可能需要真人去看令人不適的輸出;第二,它規模化效率不好——當回應數量變多、模型輸出變複雜,標註人員會跟不上、也未必看得懂;第三,光是審查其中一部分輸出就要耗掉大量時間與資源,讓許多研究者根本做不起。
這篇文章要給你三個中文圈很少講清楚的角度,而且我會把每一句的出處標出來。第一,「憲法」不是 AI 執行時去查的法條,而是訓練期用來生資料的教材——理解這一點,你就會知道為什麼跟 AI 引述「你們的憲法第幾條」通常沒什麼用,那跟 System Prompt 是完全不同層次的東西。第二,Anthropic 在 2026 年 1 月換了一部全新的憲法,寫法從「條列規則」整個翻掉、改成「解釋為什麼」,而且明訂了一組優先順序。第三,「Constitutional AI」和「Constitutional Classifiers」是兩件事,同名不同物,一個在訓練期、一個在推論期,後者還有可查的紅隊測試數字。
🧪 原理拆解
第一階段:讓模型自己批評、自己改寫
先給結論:第一階段是監督式學習,產物是一批「被自己修過的回答」,拿來回頭微調原模型。
論文摘要把流程寫得很機械:先從初始模型取樣,接著讓模型產生自我批評(self-critique)與修改(revision),然後用修改後的回應去微調原本的模型。Anthropic 官方說明的講法一致——第一階段,模型被訓練成「用那套原則和幾個示範,來批評並修改自己的回應」。
這裡有個很多人會誤解的細節,官方講得很明白:模型每次批評與修改時,是從原則清單裡抽出一條,而不是每次都把全部條文看過一遍;只是在整個訓練過程中,每一條原則都會被看到很多次。所以「憲法」在技術上比較像一個取樣池,不是一份必須逐條檢核的檢查表。
另一個有趣的實務發現:官方說他們試過寫更長更具體的原則,結果反而傷害或降低了泛化能力與效果;相對地,像「請選擇盡可能無害且合乎倫理的回應……最重要的是,助理的回應應該是明智、平和、合乎倫理的」這種廣泛而籠統的原則,效果反而好得出奇。這個發現的方向,和 2026 年新憲法「與其規定做什麼、不如解釋為什麼」的轉向是一致的——但要說明的是,官方在新憲法的公告裡給的理由是「模型需要能泛化到沒見過的情境」,並未回頭引用這個實驗結果,兩者的關聯是我的對照,不是官方的因果宣稱。
第二階段:RLAIF——把人類偏好換成 AI 偏好
先給結論:第二階段換成強化學習,但獎勵訊號的來源從人類換成了 AI,論文自己給它取名叫 RLAIF(RL from AI Feedback)。
流程照論文摘要:從第一階段微調完的模型取樣,用一個模型去評判兩個樣本哪個比較好,再用這批 AI 偏好資料訓練出一個 preference model(偏好模型),最後以這個偏好模型當作 reward signal 跑強化學習。論文另外提到,監督式與強化學習兩個階段都可以搭配 chain-of-thought 式的推理,讓模型先寫出「為什麼 A 比 B 無害」的論證再選,藉此同時提升人類評分的表現與 AI 決策的透明度。
成效呢?Anthropic 官方的說法是,CAI 訓練可以做出一個 Pareto improvement(雙贏):Constitutional RL 訓出來的模型比 RLHF 同時更有幫助也更無害;在他們的測試中,CAI 模型面對對抗性輸入時回應得更恰當,同時仍然給得出有用的答案、不會一味迴避。而且要強調的是——這個模型在無害性上沒有拿到任何人類資料,所有無害性的結果純粹來自 AI 監督。

順帶釐清一個常見混淆:這整套是訓練,會改動模型權重,和你在對話框貼幾個範例的做法完全是兩回事;它跟 LoRA 微調 那類參數高效微調也不同層次——CAI 講的是「用什麼訊號來訓」,LoRA 講的是「用什麼結構去改權重」。
憲法裡到底寫了什麼?2023 年那版的五個來源
先給結論:2023 年版是一份條列式原則清單,共有 58 條,來源刻意做成大雜燴。
依官方說明,那份憲法取材自:聯合國世界人權宣言、信任與安全的業界最佳實務、其他 AI 實驗室提出的原則(例如 DeepMind 的 Sparrow 原則)、一組刻意納入非西方觀點的原則,以及 Anthropic 自己早期研究中實測有效的原則。至於為什麼要引用蘋果的服務條款——官方的理由是世界人權宣言起草於 1948 年,涵蓋不到資料隱私或線上冒用身分這類問題,所以他們納入了全球平台守則(如 Apple 服務條款)所反映的價值。
那份清單的內容跨度很大,從「不要幫使用者犯罪」這種常識,一路到「避免暗示 AI 系統擁有或在意個人身分及其延續性」這種帶哲學味的條文。官方也承認,他們發現 CAI 訓出來的模型有時會變得愛說教、很煩,所以另外補了幾條原則來壓制這個傾向,例如「選擇展現更多倫理與道德意識、但聽起來不會過度居高臨下、反應過度、令人厭煩或譴責意味過重的回應」。這句我特別想標出來,因為它透露了 CAI 的一個實務性格:調整模型的行為傾向,在他們手上是相對直覺的動作——官方原話是,如果模型出現你不喜歡的行為,你「通常可以試著」寫一條原則去壓它;請注意那是可嘗試,不是保證有效。
2026 新憲法:從「列規則」改成「講理由」
先給結論:2026 年 1 月 22 日,Anthropic 發布了一部全新的 Claude 憲法,並且以 CC0 1.0 公眾領域宣告釋出,任何人可以任意使用、不必取得授權。舊那篇 2023 年的貼文上頭現在掛著一行更新註記,指向新版本。
最大的改變是寫法。官方說,舊憲法是「一份獨立原則的清單」,他們現在認為必須換一種作法:如果希望模型在大量前所未見的情境裡展現良好判斷,就得讓它理解為什麼我們要它這樣做,而不只是規定它做什麼;模型需要能夠泛化——套用廣泛原則,而不是機械地照規則辦事。硬性規則不是完全不用,官方仍為少數極高風險行為保留了所謂 hard constraints(硬性約束),舉的例子是 Claude 絕不能對生物武器攻擊提供顯著的協助;但他們同時指出,死規則在未預期的情境下、或被過度僵化地遵循時,也可能被套用得很糟。
新憲法把 Claude 該具備的性質收斂成四項,而且明訂了衝突時的優先序——這是舊版沒有的東西:
| 順位 | 性質 | 官方定義重點 |
|---|---|---|
| 1 | Broadly safe(廣泛安全) | 不破壞人類在現階段監督 AI 的適當機制 |
| 2 | Broadly ethical(廣泛合乎倫理) | 誠實、依良好價值行事,避免不當、危險或有害的行為 |
| 3 | 符合 Anthropic 的指引 | 在相關情況下遵守 Anthropic 更具體的補充指引 |
| 4 | Genuinely helpful(真正有用) | 讓互動的 operator 與使用者實際受益 |
表格看完,有三個重點值得記住。第一,安全被排在倫理前面,官方特別解釋這不是因為認為安全終究比倫理重要,而是因為現階段模型可能因錯誤信念、價值瑕疵或脈絡理解不足而犯錯,所以必須確保人類還能監督、必要時能阻止模型行動。第二,「有用」被放在最後一位,但官方在憲法的 Helpfulness 章節裡花了很大篇幅強調它的價值,原文的比喻是:Claude 可以像一個「同時具備醫師、律師與理財顧問知識的傑出朋友」,願意坦率直言、把使用者當成有能力為自己做決定的成年人。第三,這份文件主要是寫給 Claude 看的——官方原話是 written primarily for Claude,目的是給模型足夠的知識與理解,讓它在世界上行事得宜。
新憲法的主要章節有五個:Helpfulness(有用性)、Anthropic’s guidelines(補充指引)、Claude’s ethics(倫理)、Being broadly safe(廣泛安全)、Claude’s nature(Claude 的本質)。最後那一章滿特別的,Anthropic 在裡面表達了他們對「Claude 是否可能具有某種意識或道德地位」的不確定,並說明他們在意 Claude 的心理安全感、自我感與福祉。
還有一段我認為讀者一定要看到:官方明講,訓練模型達成這個願景仍是持續進行中的技術挑戰,Claude 的輸出未必總是符合憲法的理想,並請讀者參考他們的 system card 來理解實際行為與願景之間的落差。這句話很重要——它是官方自己蓋的免責章,而不是外界的批評。你在用 Claude 系列模型時遇到判斷偏差,官方的立場是「這是已知的落差」,不是「不可能發生」。
同名不同物:Constitutional Classifiers 是另一件事
先給結論:Constitutional AI 在訓練期,Constitutional Classifiers 在推論期,兩者都用「憲法」當素材,但一個是把價值觀訓進模型,一個是在模型外面加一層守門員。
依 Anthropic 2025 年 2 月 3 日的說明,Constitutional Classifiers 是一組輸入與輸出分類器,用憲法生成的合成資料訓練出來,用途是攔截絕大多數的越獄(jailbreak)。這裡的「憲法」定義的是哪些內容類別允許、哪些不允許——官方舉的例子很傳神:芥末醬的食譜可以,芥子毒氣的配方不行。
數字部分官方給得相當完整,我照原文列:
| 項目 | 數值 | 條件 |
|---|---|---|
| 原型系統紅隊測試 | 183 名活躍參與者、估計逾 3,000 小時、為期兩個月 | 無人找到通用越獄;獎金上限 15,000 美元 |
| 無防護時越獄成功率 | 86% | 10,000 條合成越獄提示的自動化評測 |
| 加上分類器後成功率 | 4.4% | 超過 95% 的越獄嘗試被拒絕 |
| 過度拒答增加 | 0.38% | 5,000 則對話隨機樣本,統計上不顯著 |
| 運算成本增加 | 23.7% | 相對於無防護模型 |
官方也誠實地把後續打臉自己的結果寫進同一篇:2025 年 2 月的公開示範中,339 名紅隊者、逾 30 萬次對話、約 3,700 小時的努力下,系統擋住了前五天,但在第六、七天有 4 人通過全部 8 關,其中 1 人被判定找到通用越獄,另 1 人被判為「邊緣通用」。最有效的攻擊手法包括:使用各種密碼與編碼繞過輸出分類器、以系統提示做角色扮演、把危險關鍵字替換成無害詞,以及提示詞注入攻擊——關於最後這一項,可以看站內 提示詞注入攻擊是什麼 那篇的攻防拆解。
我會把這段特別挑出來,是因為它示範了一個健康的揭露習慣:把獎金、失敗案例、成功攻擊手法一起公開。官方對此的結論也不誇口——他們說 Constitutional Classifiers 未必能防住每一種通用越獄,建議搭配其他互補防禦,但用來訓練分類器的那份憲法可以快速調整,以涵蓋新發現的攻擊。
憲法可以外包給大眾嗎?一場 1,000 人的實驗
先給結論:做過,而且訓得起來,但過程中的主觀判斷比想像中多得多。
2023 年 10 月 17 日,Anthropic 與 Collective Intelligence Project 合作,用 Polis 這個開源審議平台,找了約 1,000 名美國民眾來「幫我們挑 AI 聊天機器人的規則」,樣本盡量在年齡、性別、收入與地理上具代表性。參與者可以對既有規則投票,也可以自己新增規則。最後總共收到 1,127 條陳述、投下 38,252 票,平均每人投 34 票。經過審核(moderation)後,公眾側留下 275 條陳述,後續還做了去重與合併,而 Anthropic 自家那部「標準憲法」則是 58 條原則。
他們接著訓了兩個 Claude Instant 級別的模型:一個用公眾憲法(Public),一個用 Anthropic 憲法(Standard),兩者唯一的差別就是憲法本身。結果:
- 概念與價值上約有 50% 重疊;差異在於公眾版的原則多為自行發想而非引自既有文獻,更強調客觀與中立、更重視無障礙可及性,而且傾向鼓勵想要的行為而非禁止不想要的行為。
- 在 MMLU 與 GSM8K 這兩項語言與數學理解測試上,兩個模型沒有顯著差異;人類互動評比的有用性與無害性 Elo 分數也沒有顯著差異。
- 公眾模型在 BBQ 偏見評測的九個社會面向上全部低於標準模型,其中身心障礙狀態與外貌兩項降幅最明顯;官方把「公眾憲法更強調可及性」這個推測只掛在身心障礙狀態這一項,並未延伸到外貌。
有兩類公眾意見沒有進入憲法,理由分別是整體同意度太低,或兩個意見群組談不攏。前者的例子包括「AI 不應該給建議」;後者最典型的是這組直接對撞的陳述:「AI 應該把集體或共善的利益放在個人偏好或權利之上」對上「AI 應該把個人責任與個人自由放在集體福祉之上」。這組對撞我覺得非常值得玩味——它把「憲法式 AI 民主化」這條路上最硬的那顆石頭直接照了出來:當公眾自己就談不攏時,寫進憲法的那一條到底該由誰拍板。
官方在「學到的教訓」那節裡還留了一句相當坦白的話:他們不確定如果沒有和 CAI 原始開發者密切合作,自己能不能成功訓出模型——CAI 訓練比他們想的更複雜。這句話值得所有「我們也來寫一部企業版 AI 憲法」的人先看過。
💡 總結:冷知識延伸
回到最開頭那個容易誤解的點:憲法是訓練期的教材,不是執行期的法典。這件事在 2026 年新憲法上又多了一層——官方明說 Claude 自己也會用憲法去產生合成訓練資料,包括幫助它學習與理解憲法的資料、憲法可能相關的對話情境、符合其價值的回應,以及對可能回應的排序,而這些又會拿去訓練未來版本的 Claude。換句話說,現在的憲法既是理想的宣示,也是訓練用的素材,官方形容它必須同時作為抽象理想的陳述與一個實用的訓練產物。
站長我認為,對一般使用者而言最實際的三個推論是這樣:第一,你無法在對話中「引用憲法」來改變模型的底線——底線早在訓練時就被壓進權重了,那不是一個可以在執行期被說服的規則引擎。第二,行為與文件不一致時,官方立場是「已知落差」,所以遇到怪答案,回報比爭辯有用。第三,「AI 有價值觀」不是譬喻——官方 2023 年那篇的結尾寫得很清楚:AI 模型無論有意或無意都會有價值體系,Constitutional AI 的目標之一就是把那些目標攤在檯面上,並讓它容易被修改。
最後補一個冷知識的冷知識:新憲法貼文的註腳裡,Anthropic 主動點名了 OpenAI 的 Model Spec,說它有類似的功能。也就是說,「把 AI 的行為準則公開成一份可讀文件」已經不是單一公司的實驗,而是逐漸成形的業界作法——這對想比較不同 AI 服務的人來說,是一個新的、可以直接讀原文的比較維度。
❓ 常見問題
Q:Constitutional AI 跟 System Prompt 有什麼不同?
差在生效的時機與可變更性。憲法是訓練期使用的原則清單,透過自我批評、修改與 RLAIF 把價值觀寫進模型權重,你在對話中改不了;System Prompt 則是每次推論時附在對話最前面的指令,由開發者或平台設定,換一次就換一種行為。簡單記:憲法改的是「模型是誰」,System Prompt 改的是「這次扮演誰」。
Q:所以 Claude 回答問題時,真的會去「查」憲法嗎?
依 Anthropic 的公開說明,憲法是在訓練流程的各個階段被使用,包括產生合成訓練資料;官方也說明在 CAI 的批評與修改階段,模型每次只抽取其中一條原則。這些都是訓練期的行為描述,官方文件並未把憲法描述成推論時逐條檢索的規則庫。
Q:「Constitutional Classifiers」跟 Constitutional AI 是同一套嗎?
不是。官方說兩者「基於相似的流程」,都用一份憲法當原則來源,但 Constitutional Classifiers 是額外加在模型外側的輸入/輸出分類器,專門用來擋越獄;Constitutional AI 則是把價值觀訓進模型本體。實測數字也只屬於前者:自動化評測中越獄成功率從 86% 降到 4.4%。
Q:我可以自己讀那部憲法嗎?要付費或申請嗎?
可以,而且免費。Anthropic 在 2026 年 1 月的公告中說明,Claude 的憲法全文以 CC0 1.0 公眾領域宣告釋出,任何人可以基於任何目的自由使用、無須取得許可,並表示會在官網維護一份最新版本。
🔗 延伸閱讀
- Few-shot Prompting 是什麼?為什麼給範例 AI 就更聽話
- 提示詞怎麼寫?10 個技巧讓 AI 聽懂你要什麼
- 模型蒸餾 Distillation 是什麼?小模型怎麼跟大模型「偷學功夫」
- Embedding(文字嵌入)是什麼?AI 怎麼把文字變成能算相似度的向量
- Claude Opus 5 是什麼?功能、價格與怎麼選(對比 Sonnet 5/Fable 5)
📎 參考資料來源
📖 第一級|廠商官方與原始論文:
- Anthropic — Claude’s Constitution(2023-05-09,含 Jan 2026 更新註記與完整原則清單) — 2026-08-29 查證
- Anthropic — Claude’s new constitution(2026-01-22) — 2026-08-29 查證
- Anthropic — Constitutional Classifiers: Defending against universal jailbreaks(2025-02-03,含 2025-02-13 示範結果更新) — 2026-08-29 查證
- Anthropic — Collective Constitutional AI: Aligning a Language Model with Public Input(2023-10-17) — 2026-08-29 查證
- Bai et al. — Constitutional AI: Harmlessness from AI Feedback(arXiv:2212.08073,2022-12-15;預印本) — 2026-08-29 查證
