🌏 Read this article in English
架構會議上,PM 轉發了客戶的信:「這個場景的回答,需要高度準確,不能偏離指令。」
工程師看著螢幕,心裡清楚這句話的代價。 要讓模型高度收斂在預期內,意味著要降低不符合偏好的輸出機率——這能減少幻覺,但也可能同時限縮了模型在其他任務上的發散能力。
OpenAI 的 InstructGPT 實驗揭示了一個反直覺的事實:在 OpenAI API prompt 分布的人類偏好評測中,1.3B 的 InstructGPT 勝過了 175B 的 GPT-3。
當我們強行讓模型「聽話」時,部分公開 NLP 任務可能出現回退,且需用下游評測確認。這就是「對齊稅」(Alignment Tax)。
175B 輸給了 1.3B。
這不是參數的勝利。是「聽話」的勝利。
但聽話的代價,是你在部分任務分布上會付出能力取捨。
核心取捨
GPT-3 是一個強大的「續寫機器」。你給它一個開頭,它會根據概率接下去,而不是回答你的問題。
這導致兩個痛點:
- 可控性不足:在指令遵循場景中,模型傾向於續寫而非回答,需額外的 prompt 設計來引導。
- 應用門檻:在實際應用中,用戶需要的是「回答問題」,而不是「續寫故事」。
InstructGPT 的工程價值在於把人類偏好納入訓練流程。但他們也觀察到了一個取捨:對齊是有成本的。
核心機制:輸出策略的偏好優化
RLHF 分為三個階段:SFT、RM、PPO。讓我們用「系統架構」的視角來解釋。
1. SFT(監督式微調):重繪決策邊界
SFT 不是在教知識,而是在重繪決策邊界。我們給模型成千上萬個「問題-答案」對,讓它模仿。
介入位置:這不是下 prompt。這是修改模型的權重(weights),讓它在看到指令時,激活的機率分佈偏向「回答」而非「續寫」。
2. RM(獎勵模型):偏好評分
我們訓練一個獨立的獎勵模型,讓它給模型的輸出打分。這個模型是基於人類偏好訓練的:如果人類認為答案 A 比 B 好,RM 就會給 A 更高的分數。
類比:RM 不是老師,是評分函數。它不直接改模型,而是告訴模型:「這樣做加分,那樣做扣分。」
3. PPO(近端策略優化):在狹窄的走廊裡奔跑
看起來很簡單。但——
PPO 是讓模型根據 RM 的回饋來調整自己的策略。關鍵在於 KL 懲罰(KL Penalty):它限制模型不能偏離原始分佈太遠。
KL 約束是散度懲罰(Divergence Penalty)。它確保模型在更新策略以討好人類偏好時,輸出的機率分佈不會過度偏離原始的預訓練基座模型。
RLHF 優化的是偏好模型下的輸出策略。這可能改善可控性,但不等於提升事實性。這就像在狹窄的走廊裡奔跑,牆壁越貼越近。KL 約束限制偏離基座模型,能力變化需由下游評測觀察,而非直接由權重空間推出。
可控性與部分任務表現之間可能存在取捨。你提升了特定指令的可控性,但可能在部分通用數據集上付出代價。這是獲得收斂必須支付的成本。
真正重要的結果
Key Insight: InstructGPT 證明了透過 RLHF,1.3B 規模的模型在指令遵循能力上能超越 175B 的 GPT-3。
- 參數規模不是指令遵循偏好的唯一決定因素:人類標註者更喜歡 1.3B 的 InstructGPT,而非 175B 的 GPT-3。這意味著「對齊」帶來的增益,在該 API prompt 偏好評測中超過了規模差異。
- 對齊稅:依 InstructGPT 論文表格/結果,InstructGPT 在客戶任務上表現更好,但在 SQuAD、DROP、HellaSwag 等公開數據集上表現較差。這表示模型變得更「專精」,但也變得更「偏科」。這僅是部分公開資料集回退,非全面下降。
- 混合數據的解法:在 RL 微調期間,混合一小部分原始預訓練數據,可以減輕對齊稅。這就像讓小孩在學禮儀的同時,不要忘記基礎知識。
你的判斷
適用邊界
- 適合:需要較高指令遵循與一致回覆的場景(如客服、資訊查詢)。需注意,仍需安全評測。
- 需要額外評估:複雜推理、開放式研究、創意生成等任務,需看對齊後評測是否保留能力。
取捨
- 對齊 vs. 能力:對齊強度、資料混合與 KL 約束會共同影響通用任務表現。對齊強度提高時,部分通用任務可能需要重新評估是否回退。你用部分邊界任務的表現,換取了核心場景的可控性。這不是壞事,這是定價。
- 數據品質 vs. 數量:SFT 的數據品質比數量更重要。SFT 資料品質會影響泛化,但需以驗證集與偏好評測確認。
實務意圖
- 值得先確認目標是可用性、可控性,還是純能力,再決定規模投資。
- 監控對齊稅:定期評估模型在通用任務上的表現,避免過度優化特定任務。
限制
InstructGPT 仍可能產生有害內容,且在面對未見過的指令時表現不穩定。對齊稅仍是可優化的地方。這不是終點,而是當下工程上的妥協。在投入資源前,先搞清楚你的場景能不能承受這個代價。
來源
- Training language models to follow instructions with human feedback — InstructGPT 原論文
- InstructGPT: Training Language Models to Follow Instructions with Human Feedback — OpenAI 官方說明頁
這不是單一答案,而是任務邊界與成本結構的選擇。
你的模型任務,值得為哪一種可控性付出學費?