漸進式非平穩環境中,穩定性何時勝於可塑性?

🌏 Read this article in English

強化學習代理在面對環境變化時,必須在「快速適應新狀況」與「保留舊知識」之間取得平衡。研究《Balancing Plasticity and Stability with Fast and Slow Successor Features》透過系統性比較提出了一個反直覺的結論:在受測的持續非平穩設定中,效能衰退的主因並非代理缺乏學習能力(可塑性不足),而是因為過度適應短期波動導致了策略不穩定。

這項研究指出,當代理對每一個微小的環境波動都進行大幅度的參數更新時,策略容易受到短期干擾的影響而失去長期一致性。透過將神經啟發的突觸鞏固(Synaptic Consolidation, SC)應用於多時間尺度的後繼特徵(Successor Features, SFs),代理能夠在吸收新資訊的同時,保護長期結構知識不被覆蓋。這種方法在環境擾動幅度較大時表現尤為顯著,但也帶來了計算延遲與 SGD 優化器依賴的工程挑戰。

背景與核心張力:為什麼「適應力」有時是瓶頸?

在強化學習的實驗設定中,研究者通常使用不同的非平穩模式來測試模型。例如,讓機器人從平地突然走到冰面,或遊戲規則瞬間改變(abrupt non-stationarity)。這種設定下,代理必須具備高度的可塑性,也就是快速忘記舊策略、學習新策略的能力。因此,過去的解決方案多集中在如何加速更新、重置參數或引入更大的探索率。

然而,當環境以漸進且持續的方式演化時(gradual non-stationarity),過度追求「快速適應」反而會成為劣勢。如果代理對每一個微小的環境波動都進行大幅度的參數更新,它實際上是在追逐短期的隨機性,導致策略在短期內劇烈震盪,無法形成穩定的長期規劃。這就是所謂的「穩定性-可塑性窘境」(stability-plasticity dilemma):系統需要足夠的穩定性來保留有用的長期知識,同時又需要足夠的可塑性來吸收新的環境資訊。

論文中的觀察進一步突顯了這個張力:即使是具備穩定性機制的 PPO 演算法,在面對環境動態的漸進變化時,仍難以維持強健的表現。這暗示了單靠基於信任區域的優化(trust-region-based optimization)可能不足以應對持續的非平穩性。數據顯示,效能衰退的主要驅動力是過度適應導致的不穩定性,而非學習速率不足。因此,抑制參數震盪比單純加速更新更為關鍵。

核心機制:快慢時間尺度的雙軌制

為了解決這項穩定性與可塑性的取捨,論文提出了一套結合「後繼特徵(SFs)」與「多時間尺度突觸鞏固」的機制。這裡的關鍵在於理解 SFs 的本質以及它如何被分割成不同時間尺度的變數。

後繼特徵(Successor Features, SFs)是一種預測表示法,它不直接預測即時的獎勵,而是預測在未來一段時間內將獲得的特徵總和。這使得代理能夠進行更長遠的規劃。論文將這些 SFs 進一步細分為多個時間尺度(timescales),從快速變化的短期預測到慢速變化的長期趨勢。

這個機制的運作邏輯可以類比為「記憶的鞏固過程」。初期對細節敏感(快速時間尺度),讓代理能夠迅速應對當下的變化;隨著時間推移,將這些經驗提煉成更穩定、更底層的模式(慢速時間尺度),以防止被後續的微小干擾所破壞。

在技術實現上,論文採用了神經啟發的「突觸鞏固」(Synaptic Consolidation, SC)。與傳統的權重更新不同,SC 通過分析式、序列化的方式計算鞏固變數(例如 SFu2, SFu3 等)。這些變數並不在反向傳播的計算圖中。更重要的是,這種整合是針對 SFs 進行的,而非直接針對 Q-values。兩者的表示差異構成了這項設計的因果鏈:Q-value 將狀態與動作的預期回報壓縮為標量,短期獎勵波動因此可能直接改變其估值;SFs 則保留未來特徵總和的預測表示,讓不同時間尺度分別整合近期變化與較慢的特徵結構。當慢速 SF 變數受到鞏固時,較快變數仍可吸收新資訊,而較慢變數則降低短期回報波動覆蓋未來特徵結構的風險。這提供了 SF 鞏固在較大結構擾動下可能較有利的機制解釋,但不是無條件優勢:在轉移動態接近平穩的輕微變異下,鞏固 Q-value 反而最有效;在 Quadruped 與 Humanoid 等高維任務中,鞏固 SFs 也未必優於鞏固 Q-value。

為了讓不同時間尺度的 SFs 能夠協同工作,論文引入了一個跨注意力機制(cross-attention)。為了讓這個機制可微,研究者應用了重參數化技巧(reparameterization trick),將跨注意力機制的輸出加到最具可塑性的短期 SF(如 SFu1)上。這使得注意力機制的權重(Query, Keys, Values)可以透過 Q-SF-TD 損失函數來學習,同時允許代理在更新最易變的特徵時,參考來自較慢時間尺度的穩定資訊。在本文測試的配置中,六個以上時間尺度變數表現較好,但尚不能外推為通用超參數建議。

真正重要的結果:穩定性勝於可塑性

實驗數據顯示以下機制差異:

  1. 穩定性方法優於可塑性方法:在論文測試的連續非平穩設定中,AUC 與回報比較提供支持,採用突觸鞏固(SC)和 EWC(彈性權重鞏固)等穩定性保留方法的表現較好於那些專注於可塑性的方法(如參數重置 CBP 或最後一層更新 P-last)。這為「在受測的連續非平穩環境下,效能衰退的主要驅動力是不穩定,而非缺乏適應力」提供了系統性的實驗證據。
  2. SF + SC 的優勢:雖然將 SC 應用於 Q-value(TD3+SC)也能提升表現,但將 SC 應用於 SFs(SF+SC)在大多數情況下表現更佳。在輕微變異(轉移狀態接近平穩)時,將 SC 應用於 Q-value 最有效;但隨著擾動幅度增加,將 SC 應用於 SFs 的優勢變得越來越明顯。在 3D Four Rooms 環境中,這種結合在所有擾動區間都展現了更穩健的學習表現。這表明 SFs 作為預測表示,能更好地與多時間尺度整合機制配合。
  3. 多時間尺度的協同效益:使用六個或更多時間尺度變數的模型學習效果更好。跨注意力機制的機率分佈揭示了有趣的動態:在某些情況下,快慢時間尺度變數獲得相近的關注,暗示它們的貢獻幾乎相等;而在其他情況下,較快的時間尺度變數(如 SFu2SFu3)獲得了較強的注意力權重,負責驅動主要的學習過程,慢速變數則提供補充性的穩定性。這些注意力動態與「預測表示和多時間尺度整合共同帶來效能增益」的解釋一致,但本身不足以排除模型規模效應;若要作出因果排除,仍需以相同參數量等控制比較加以驗證。
  4. 環境複雜度的影響:在較為簡單的環境(如 Half-Cheetah 和 Walker)中,SF+SC 表現優異,能從跨注意力機制的記憶喚回中獲益;但在更複雜的環境(如 Quadruped and Humanoid)中,SF+SC 的表現有時不如直接對 Q-value 進行整合。這可能是因為高維狀態和動作空間降低了跨注意力機制的學習效率,需要更多的訓練步驟才能收斂。

在設計持續學習算法時,優化過程(如選擇 SGD 而非 Adam)對特徵表示的影響與網絡架構同樣至關重要。研究指出,使用 SGD 來學習 SFs 是保留時間尺度資訊的關鍵;若混用基於適應性的優化器(如 Adam),可能會導致不穩定。

適用情境與工程取捨

這項研究為持續學習提供了一個重要的新視角,但也帶來了新的工程挑戰。在決定是否採用這種方法時,需要考慮以下取捨:

適用情境:

  • 漸進式環境變化:如果你的應用場景涉及連續、小幅度的環境漂移(如推薦系統中的用戶興趣演化、機器人操作中的摩擦係數緩慢變化),SF+SC 是一個值得考慮的方向。但需注意,這些推論主要來自模擬控制任務,轉移至真實世界前需比對漂移速度、可觀測性、狀態維度與吞吐量條件。
  • 長期規劃需求:當代理需要進行多步預測和長遠規劃時,SFs 的結構化表示能提供更穩定的基礎。

不適合情境:

  • 劇烈斷層式變化:如果環境會發生瞬間、巨大的改變(如遊戲規則完全重寫),傳統的高可塑性方法可能更合適,因為 SF+SC 的穩定性機制可能會阻礙快速適應。此結論為選型假設,本論文證據不足以判定 abrupt change 下哪類方法較佳。
  • 極高複雜度的連續控制:在 Quadruped 或 Humanoid 等高維度任務中,SF+SC 的學習效率較低,可能需要更多的訓練資源和時間才能達到與其他方法相當的性能。

代價與限制:

  • 計算延遲與吞吐量下降:在 Slippery Four Rooms 與 MuJoCo Humanoid 等實驗中,SF+SC 模型的吞吐量最低。這個效能下降源自於鞏固動態:它需要在鞏固變數之間進行分析式的序列更新。因為這些更新不在反向傳播的處理範圍內,且無法被平行化,它們引入了常數倍數的計算開銷(constant-factor computational overhead)。在需要高吞吐量或實時響應的場景中,這是一個必須承擔的工程代價。
  • 優化器依賴:研究發現,使用 SGD 而非 Adam 來學習 SFs 是保留時間尺度資訊的關鍵。這意味著現有框架可能需要支援分離的優化器與分析式鞏固更新,不能直接套用現成的基於 Adam 的 RL 框架。

邊界與未來方向

這項研究雖然提供了有力的證據,但也存在明確的邊界。首先,實驗主要集中在模擬環境中,真實世界的噪聲和不可觀測變數可能帶來不同的挑戰。其次,跨注意力機制在複雜任務中的效率限制尚未完全解決,這限制了其在高維連續控制任務中的直接應用。

此外,研究指出 SC 優於 EWC,但兩者都屬於穩定性方法。未來的工作可以探索如何動態調整穩定性與可塑性的比例,以適應不同強度的環境變化。例如,在環境變化平緩時保持高穩定性,而在檢測到重大結構變化時暫時提高可塑性。

最後,關於優化器的選擇,研究強調了 SGD 對保留時間尺度資訊的重要性。這顯示在設計持續學習算法時,不僅要關注損失函數和網絡架構,還要仔細考慮優化過程本身對特徵表示的影響。這是一個容易被忽視但至關重要的細節。

總體而言,這項研究提供了在漸進式非平穩環境下,透過穩定多時間尺度預測表示來構建魯棒系統的證據。在需要長期穩定性的場景中,分析式序列更新造成固定倍數開銷是本文實作的工程取捨;是否可接受取決於吞吐量需求。若需極致響應速度,則需重新評估架構。

Sources