Chinchilla Scaling Laws: 算力預算下的模型與資料比例優化

🌏 Read this article in English


算力預算的零和遊戲

打開訓練日誌。Loss 曲線在 Epoch 50 變成一條死線。

GPU 帳單每小時燒掉 $200。你面臨的選擇只有一個:加參數,還是加資料?

過去十年,業界的直覺是前者。我們認為模型越大,智慧越高。直到 DeepMind 發表 Chinchilla 論文,數據顯示這種直覺在數學上是次優的。

結論很平靜:在固定算力下,模型太大、資料太少,是效率最低的投資。

核心情境:模型與資料如何分配?

在 LLM 時代,訓練一個模型就像在賭桌上下注。算力是籌碼,模型參數是你手中的牌面大小,訓練資料是你看到的對手底牌。

DeepMind 定義了一個關鍵概念:Compute-Optimal(計算最優)。 這指的是在給定的算力預算(C)下,透過調整模型參數規模(N)與訓練資料量(D),使模型達到最低 Loss 的配置狀態。

必須釐清的是,公式 C ≈ 6ND 只是計算訓練 FLOPs 的硬體成本近似值,隱藏了特定架構與訓練設定的假設。最優比例並非由這個公式直接推導,而是 DeepMind 透過大量實驗擬合 Loss 函數得出的經驗結果。

當 C 固定時,N 與 D 是殘酷的取捨關係。Chinchilla 的貢獻在於估計出讓 Loss 最低的 N/D 配置。

過去的業界慣例傾向於優先增加參數(牌面)。這在探索模型能力上限時非常有效,但在預算受限時,若未能相應增加資料(底牌資訊),就會面臨風險。

結果是,模型雖然具備龐大的記憶容量,但因為見識的資料太少,未能充分發揮其「理解」世界規律的潛力。

Chinchilla 論文指出,在固定算力下,這種配置的邊際效益會逐漸遞減。

核心機制:為什麼「小模型 + 多資料」更聰明?

要理解為什麼 Chinchilla 勝出,我們換個視角:因為模型不是靠「記住」資料來變聰明,而是靠「從資料中學習規律」來變聰明。

當算力固定時,增加模型大小會提高「記憶容量」,但減少「學習規律的機會」。 增加資料量會提高「學習規律的密度」,但需要足夠的模型大小來吸收這些規律。

Chinchilla 的發現是:當算力預算(C)增加時,模型大小與資料量應該等比例增長。但在固定算力下,如果把籌碼全押在模型大小而不增加資料,參數偏大會讓每個參數看到的 token 不足,形成 under-trained 模型,就像你只記住了一副牌的每一張順序,卻不會玩下一手。

看起來很簡單。但——許多團隊付出的學費,不在數學,而在高估資料處理能力。

真正重要的結果:70B vs 280B 的實測數據

DeepMind 在 2022 年發表了兩組對比實驗,兩者都是 DeepMind 的模型:

  1. Gopher:280B 參數,訓練資料約 300B tokens。
  2. Chinchilla:70B 參數,訓練資料約 1.4T tokens。

算力預算相同。

  • Chinchilla 的模型大小只有 Gopher 的 1/4。
  • Chinchilla 的訓練資料是 Gopher 的 4 倍。
  • 在相同的算力成本下,Chinchilla 在多數下游任務與平均表現上優於 Gopher。

更具體地說,Chinchilla 在數學推理、語言理解等任務上,表現甚至超過了比它大 4 倍的 Gopher。

這意味著兩件事:第一,同樣的算力籌碼,你換到了更聰明的模型。第二,因為模型變小了,未來的每一次推理,都在幫你省下維運成本。

在該論文的模型族、資料與訓練設定下,估計的 compute-optimal 比例約為每參數 20 tokens。

你的判斷:適用邊界與取捨

擴展參數規模(大模型路線)在追求極致容量與湧現能力的情境下依然是主流,但在固定預算下,我們多了一個調整資料比例的槓桿。

誰在獲利?

  • 資源有限的團隊:如果你只有有限的 GPU 集群,或者預算固定,Chinchilla 的法則告訴你:「縮小模型,擴大資料」。
  • 追求性價比的企業:模型參數量降低,推理成本隨之下降。這對長期維運至關重要。

不適合哪種情境?

  • 極端長尾知識需求:如果你的應用需要記住極其細微的專業知識,需同時評估參數容量、資料覆蓋率與檢索架構。單純依賴模型大小未必能覆蓋這類需求。
  • 算力無限的實驗室:若預算充足,同步擴大模型與資料仍是常見提升路徑之一。

對實務的意涵

  1. 訓練成本結構改變:你可以用更少的錢訓練出更好的模型。
  2. 資料量是關鍵變數:在 compute-optimal 配置下,資料量是關鍵變數;實務上還需用品質控制維持有效 token。
  3. 模型選型決策:不要一上來就追求「最大模型」。先問自己:「我的算力預算下,多少參數是計算最優的?」

Sources

作者標註的限制(Caveats)

  1. 算力環境變化:1:20 的比例是基於該論文的模型族、資料集、訓練設定與當時實驗範圍。隨著訓練技術(如混合精度、優化器)的進步,最佳比例可能會移動。
  2. 資料管道的維運面:Chinchilla 的代價是:你需要處理 1.4T tokens 的資料。這意味著資料清洗、預處理的工程成本大幅上升。若資料管道成熟度不足,導入前需先評估清洗與預處理成本。
  3. 推理成本的轉移:訓練成本降低,但推理時的延遲取決於模型大小與服務策略,而非訓練資料處理階段。需評估整體 TCO(總擁有成本)。

市場訊號尚未明朗:隨著 MoE(混合專家)模型的興起,「稀疏大模型」可能正在重塑這個比例。但 Chinchilla 的核心洞察——「資料是燃料,模型是引擎」——依然成立。

下一步:你今天的十分鐘

1:20 不是真理,是 2022 年的地圖。你的地形變了嗎?

如果你正在規劃下一個模型訓練專案:

  1. 檢查你的比例:計算你目前的 參數數量訓練 Token 數量 的比例。如果遠低於 1:20,考慮縮小模型。
  2. 審視資料管道:將一部分時間投入資料清洗。讓資料品質變好一點就好,不用一開始就追求完美的 1T tokens。乾淨的 100B 勝過雜亂的 1T。
  3. 重新評估預算:問自己:「如果我把模型縮小 4 倍,省下的算力可用於擴大有效 token、資料清洗、消融實驗或更多訓練 run。」

如果還沒有答案,先算一下你目前的『參數/Token』比例。數據說了什麼,你自己判斷。

你的算力預算,是在買模型,還是在買數據?這不是對錯的問題,是選擇的問題。