Kaplan 2020 論文:Scaling Laws 的演進與情境邊界

🌏 Read this article in English


Loss 曲線在 Epoch 50 後開始平坦化。

你盯著 GPU 利用率,心裡盤算的是:下一張卡買大一點,還是去撈更多資料?

這一刻的停頓,源於一個核心取捨:在算力受限的情況下,我們該如何配置資源,才能讓效能發揮到極限?

2020 年 OpenAI 發表了一篇被業界廣泛引用的論文,提供了可預測的 Loss Scaling 框架。但兩年後,這份建議在實務應用中被證明需要更精確的情境邊界。

理解這段歷史,不是為了學術考據,而是為了避免你在未來的資源分配中,沿用舊的假設。

核心觀點:從模型規模到資料規模的範式轉移

Kaplan 2020 給出了一張地圖,但那是基於當時算力與資料成本的權衡。

當時的假設是:資料蒐集成本極高、可得性低。在這種限制下,Kaplan 團隊觀察到,在他們實驗的參數範圍內,增加模型大小(N)比增加資料量(D)更能有效降低 Loss。

這份研究成為後來幾年業界訓練模型的參考。但這份研究,在關鍵的推論上,留下了一個後來需要補上的適用邊界。

直到 2022 年,Chinchilla 論文基於新的實驗設定,提出了 compute-optimal(算力最佳化)配置,重新估計了模型大小、資料量與算力的平衡點。

早期決策為何偏向模型規模?

在 LLM 剛興起時,工程師面對一個巨大的不確定性:當我們增加訓練算力時,模型的表現會如何變化?

直覺告訴我們,只要算力夠大,模型就會變強。但「變強」的邊際效益是多少?是線性的?指數的?還是很快就會碰到天花板?

在市場訊號與實測數據尚未明朗前,我們很難回答以下實務取捨:

  1. 資源分配:該花錢買更多 GPU,還是花錢蒐集更多資料?
  2. 模型選型:該訓練一個 175B 參數的巨獸,還是 7B 參數的精實模型?
  3. 成本預估:要訓練到什麼程度,才能達到可用的效果?

Kaplan 試圖用數據給出答案。但這份答案,建立在當時「資料極度昂貴」的假設之上。

核心機制:為什麼「大模型、少資料」會成為主流?

Kaplan 2020 的核心發現是:模型損失(Loss)與模型大小(N)、資料量(D)、算力(C)之間,存在著穩定的冪次律(Power-law)關係。

白話來說:在未飽和的區間內,算力、資料量與參數規模的同步擴張,能帶來可預期的 Loss 下降。

關鍵推論:樣本效率(Sample Efficiency)

Kaplan 團隊在分析中發現了一個現象:當模型變大時,它對每個資料點的學習效率會提高。

這意味著,大模型能從同樣的資料中榨出更多資訊。直覺上,這似乎暗示「大即是美」。

因此,Kaplan 給出的建議是:在固定算力下,優先增加模型大小(N),因為大模型更 sample-efficient(樣本效率高)。

這個推論在他們的實驗設定下完全成立。但當我們把視角切換到 compute-optimal(算力最佳化)時,過度偏重參數而忽略資料量,反而會讓訓練效率打折。

當資料重複、品質與覆蓋率不足時,增加參數可能無法改善泛化。這就像在沒有新情報的情況下增加分析師人數。人越多,只是把舊情報過度解讀(Overfit),不會產生新洞見。

真正重要的結果:Chinchilla 的修正

Kaplan 沒算錯。他們只是在當時高昂的資料成本與特定實驗設計下,推導出偏向較大模型的配置。

2022 年,DeepMind 發表了 Chinchilla 論文。他們以新訓練實驗與 scaling analysis 重新估計 compute-optimal 配置,並修正了 Kaplan 的結論。

他們發現:Kaplan 的數據點,其實落在一個「次優」的區域。

當他們將資料量(D)大幅增加,並相應減少模型大小(N)時,他們發現:

  1. Chinchilla(70B 參數,約 1.4T tokens) 在多個基準測試中,表現優於 GPT-3(175B 參數,300B 資料)
  2. 關鍵比例:Chinchilla 發現,模型大小與資料量應該保持約 1:20 的比例(約 20 tokens/parameter),這是 Chinchilla 實驗設定下的經驗性 compute-optimal 參考值。

這裡需要區分兩個概念:「模型與資料隨算力等比例縮放」與「約 20 tokens/parameter 的絕對比例」。前者是動態平衡,後者是具體的黃金標準。

換句話說,Kaplan 建議的「大模型、少資料」,其實是因為當時的資料可得性與估算方法,導致業界無法蒐集足夠的資料,從而誤以為「大模型」是解方。

具體數據對比

模型參數大小 (N)訓練 tokens (D)N:D 比例備註
GPT-3 (Kaplan-style allocation)175B300B~1:1.7被視為當時的巔峰
Chinchilla (DeepMind)70B1.4T~1:20在同等算力下,表現超越 GPT-3
Optimal (Chinchilla 推論)N20N~1:20理論上的最佳化比例

Chinchilla 的發現是:資料量的重要性被低估;模型大小與資料量需要共同平衡。 增加模型大小而不增加資料,可能讓配置偏離 compute-optimal,導致資料效率與泛化收益低於同算力下更平衡的配置。

你的判斷:適用邊界與取捨

理解這段歷史,對你現在的決策有什麼意義?

1. 先檢查資料是否成為瓶頸

如果你正在規劃一個新的訓練專案,優先確保資料的品質與數量,而不是單純擴張參數規模。

  • 適合情境:你有足夠的算力,但資料來源有限。
  • 取捨:在資料品質、架構、訓練 recipe 相近時,訓練一個中等大小(如 7B-13B)但經過充分訓練的模型,通常比訓練一個巨大但資料不足的模型,在實務上更有效率。

2. 算力分配的邊界

Kaplan 的 Power-law 依然成立,但它的應用場景變了。

  • 當資料充足時:增加模型大小確實能帶來效能提升,但 loss 會依冪次律下降,呈現邊際效益遞減。
  • 當資料不足時:單純撐大模型會讓配置偏離 compute-optimal。泛化能力的提升,將無法與你投入的算力成本成正比。

3. 對實務的意涵

  • 模型選型:更值得比較的是參數規模、訓練 tokens 與資料處理策略的組合。一個 7B 模型如果經過 100B+ 資料訓練,可能比一個 13B 模型只經過 10B 資料訓練更強大。
  • 成本結構:資料處理在總成本中的占比更值得被單獨估算。

來源與限制

Kaplan 的推論在當時有其合理性,因為資料蒐集成本極高;而 Chinchilla 的修正也並非完美無瑕,它假設資料可以無限擴展,但實務上,高品質資料的邊際成本是遞增的。

在超高資料量的區間,市場訊號尚未明朗。未來的最佳配置,仍取決於資料去重技術、多樣性,以及具體的評測任務。

你的下一步:盤點你的資源

  1. 估算你的訓練資料量:如果你正在訓練模型,計算 N:D 比例。若 tokens/parameter 明顯低於 compute-optimal 參考值,優先檢查資料缺口。
  2. 把訓練資料量納入模型比較:在比較不同模型時,不僅看參數規模,更要查詢其訓練資料量與去重策略。

Kaplan 給了你一張地圖,但地形已經改變。現在,你手邊有多少資料?

這不是對錯的問題,是你的算力預算,要投在參數還是資料的問題。你自己判斷。

Sources