Adaptive Multi-Horizon RL:狀態依賴閘道與固定 γ 的工程取捨

🌏 Read this article in English

論文報告的結果與復現所需條件

在強化學習(Reinforcement Learning, RL)的持續學習(Continual Learning)場景中,智能體面臨一個核心取捨:折現因子(discount factor, γ)決定了未來獎勵在當前決策中的權重。單一固定的 γ 在時間結構穩定的環境中表現良好,但在任務頻繁切換、因果鏈長度劇烈變化的情境下,往往導致效能衰退。

本文基於研究團隊發表的論文《Adaptive Multi-Horizon Reinforcement Learning》,說明如何透過「狀態依賴閘道網路」(state-dependent gating network)讓智能體動態權重多個不同 γ 值的 critic 網絡。

可觀察的結果:在 MiniGrid 環境的多任務切換實驗中,該架構使智能體在第一個 4k 集數(episodes)自動傾向採集任務的短視角,隨後隨任務切換調整權重。最終每集回報(episode return)穩定維持在 36 到 40 之間,未出現明顯的效能衰退。

復現所需條件

  • 環境具備可觀測的狀態特徵,能區分不同時間結構的需求。
  • 計算資源足以支撐多個 critic 網絡的並行運算與閘道權重更新。
  • 目標是降低超參數調整負擔,而非追求單一任務的極致效能。

步驟:實作狀態依賴的多視角混合器

要復現此機制,需建立一個包含多個不同 γ 值的 critic 網絡,並引入閘道網路進行動態權重。以下是核心步驟與執行約束:

步驟 1:初始化多時間尺度 Critic 網絡

維護一組具有不同折現因子 γi 的 critic 網絡 Qγi(s,a)。這些網絡分別學習不同時間範圍下的價值估計。

  • 前提:確定 γ 的採樣範圍(例如從短視角的 0.5 到長視角的 0.99)。
  • 檢查:確認每個 critic 能獨立收斂於其對應的 γ 值,避免初始權重衝突。
  • 停止條件:持續觀察各 critic 的 loss 與 Q-value 分佈;當 loss 不再呈現持續上升或擴大的震盪,且各自的 Q-value 分佈不再明顯漂移時,才視為初始化完成。
  • 恢復路徑:若某個 critic 無法收斂(loss 持續上升或震盪),可嘗試降低該 critic 的學習率,或檢查 γi 是否過於極端導致梯度消失。

初始化的驗證紀錄需保留每個 critic 的獨立 loss 與 Q-value 分佈,而不是只看聚合結果。這個邊界很重要:整體曲線看似平穩,仍可能掩蓋其中一個時間視角持續漂移。若任一 critic 尚未穩定,先沿用其最近一次未惡化的模型狀態,完成輸入、更新規則與折現因子設定的核對,再重新納入混合器。

步驟 2:建立狀態依賴閘道網路(Gating Network)

設計一個小型神經網絡作為閘道器,輸入當前狀態 s,輸出各 critic 的權重分佈 wi(s)。最終混合價值函數為:

Qmix(s,a) = ∑iwi(s)Qγi(s,a)

  • 前提:狀態特徵需具備足夠的資訊密度,以區分當前任務的時間結構需求。
  • 檢查:驗證閘道輸出為合法機率分佈(和為 1)。
  • 停止條件:當相同或等價的狀態輸入持續產生可重複的權重分配趨勢,且權重不再無規則地擴大震盪或長期集中於單一 critic 時,才視為權重分配已穩定。
  • 恢復路徑:若權重收斂於單一 critic(不分化),需檢查狀態特徵是否足夠,或調整閘道網路的學習率。

步驟 3:執行 Undiscounted Expected SARSA 更新

為了優化閘道網路與混合價值,系統採用無折現(γ = 1)的 Expected SARSA 更新規則。目標函數使用平方 TD error loss:

$$ L = \frac{1}{2} \delta^2 $$

其中 TD error (δ) 為:

δ = rt + 1 + ∑aπ(a′|st + 1)Qmix(st + 1,a′) − Qmix(st,at)

  • 前提:策略 π(s) 由混合價值決定:π(s) = arg maxaG(s,a),其中 G(s,a) 為權重後的價值。
  • 檢查:觀察 TD error 是否由持續增大或劇烈震盪轉為穩定,並同步確認閘道權重不再無規則地大幅變動。
  • 停止條件:當 TD error 不再持續增大、其波動不再擴張,且閘道權重對相同狀態呈現可重複的分配趨勢時,停止本輪更新並進入任務切換驗證。
  • 恢復路徑:若 TD error 持續增大或震盪加劇,先停止閘道網路的更新並回復到最近一次 TD error 未惡化的模型狀態;再逐項核對 TD target、策略輸出與 Qmix 是否依照同一更新式計算,待誤差不再擴大後才恢復聯合更新。

這一步的停止條件不能只依賴 loss 下降。混合器的目標是讓狀態對應到不同時間視角,因此還需確認相同狀態輸入能產生可重複的權重趨勢。若 TD error 變得平穩,但權重仍無規則跳動,更新尚未完成;若權重平穩但 TD error 持續惡化,也不能將固定輸出誤認為收斂。

失效案例與觀察:不同折現率會改變行為

在實作過程中,必須區分「機制有效」與「參數敏感」。論文指出,當 γ < 0.5 時,智能體傾向選擇「左側分支」;當 γ > 0.5 時,則切換至「右側分支」。這證明了策略對折現率高度敏感,但並不直接證明閘道網路的適應性優於固定 γ

失效訊號

  • 權重不分化:閘道網路始終將權重集中在單一 γ 值,導致系統退化為固定折現率模型。這通常發生在狀態特徵無法區分任務差異時。
  • 回報波動劇烈:在任務切換初期,若閘道權重調整過慢或過快,可能導致短期回報大幅下降。此時需檢查 TD error 的更新穩定性。

失效定位可分成兩層。第一層先確認各固定 γ critic 是否呈現論文描述的行為差異;若沒有,問題位於基礎價值估計,而不是閘道。第二層才檢查任務切換時的權重是否移動,以及這項移動是否與回報表現同時出現。這個順序能縮小除錯的 blast radius,避免在 critic 尚未建立可區分視角時反覆調整閘道。

驗證方法:對照 Figures 6–9 的權重與回報

要確認系統是否成功捕捉「時間視角」,可透過以下指標進行驗證:

  1. 監控閘道權重分布:記錄不同任務階段(如從 Foraging 切換到 Goal Reaching)時,閘道網路對各個 γ 值的權重變化。根據 Figures 6–8,Foraging 任務的最佳有效視界為 16–32 步,Goal Reaching 為 32–512 步,Four Rooms 為 128 步。若權重能隨任務切換而轉移,表示機制運作正常。
  2. 回報穩定性:如 Figure 9a 所示,成功的實作應使每集回報維持在 36–40 之間,且在持續學習中無明顯衰退。
  3. 行為一致性:觀察智能體在不同 γ 設定下的行為分支(左/右),確認其與預期時間視角一致。

驗證時可採用由局部到整體的 checklist:先檢查固定 γ 是否造成可觀察的行為差異,再核對各任務的有效視界,接著觀察閘道權重是否在任務切換後轉移,最後才比較每集回報。四項訊號的角色不同,不能互相替代。行為分支一致只驗證折現率敏感性;權重轉移才驗證閘道確實利用狀態調整混合結果;回報落在論文報告區間,則是整體復現的結果檢查。

若固定 critic 能重現行為差異,但閘道權重沒有隨任務轉移,應把問題定位在狀態表示或閘道更新。若權重已轉移,但回報仍明顯波動,則回到 TD error 與混合價值的更新路徑檢查。這套判準不把單一漂亮曲線當成完成證據,而是要求機制訊號與結果訊號彼此對得上。

適用邊界與工程取捨

此方法並非萬靈丹,其效益取決於具體情境。以下是基於論文結果的工程取捨分析:

適用情境

  • 持續學習環境:任務頻繁切換,且不同任務具有截然不同的時間結構(如上述 Foraging 與 Goal Reaching 的差異)。
  • 參數效率敏感:希望減少超參數調整負擔,讓系統自動適應環境變化的應用。

取捨分析

  • 計算成本增加:維護多個 critic 網絡並實時計算閘道權重,會增加訓練與推論的計算開銷。這是一種以額外計算成本換取超參數穩定性的策略,其邊際效益取決於任務切換頻率與調參的人力成本。
  • 狀態特徵依賴:閘道網路的效能高度依賴狀態特徵的品質。若狀態表示無法有效區分不同時間視角的需求,系統可能無法正確權重。

決策規則

在評估是否採用此方法時,可以參考以下判準:

  1. 任務切換頻率:若任務切換頻繁且時間結構差異大,此法的候選優先度提高;反之,固定 γ baseline 較適合先行驗證。
  2. 計算資源:確保有足夠的運力支援多個 critic 網絡的並行計算。
  3. 狀態可觀測性:確認狀態特徵能夠反映當前任務的時間需求。若資訊密度不足,建議先改進狀態表示而非引入複雜閘道。

限制與下一步驗證

實驗範圍與轉移邊界

目前的實證結果主要來自 MiniGrid 等離散動作空間的環境。其在連續動作空間或更複雜視覺輸入下的表現仍需進一步驗證。此外,閘道網路的有效性建立在狀態能正確識別時間視角需求的前提下;若環境動態過於複雜,可能面臨收斂困難。

下一步驗證

對於正在處理動態任務切換問題的實務團隊,可以嘗試從以下維度觀察系統是否成功捕捉了「時間視角」:

  • 監控閘道權重分布:記錄不同任務階段(如從 Foraging 切換到 Goal Reaching)時,閘道網路對各個 γ 值的權重變化趨勢。這將是確認系統是否真正學會根據情境調整規劃深度的重要指標。
  • 驗證權重響應速度:在切換任務時,記錄閘道權重的變化斜率。若斜率過緩導致效能下降,則需檢查狀態特徵的區分度(discriminative power)是否足以支撐多時間尺度的決策分離。

論文報告的驗證結果是:在 MiniGrid 的任務切換實驗中,每集回報維持在 36–40,且混合器在第一個 4k episodes 的 Foraging 階段主要配置權重給對應短有效視界的折現因子。下一個安全且有邊界的驗證,是先在相同任務切換範圍內重現這兩項可觀察結果:確認權重會由 Foraging 的 16–32 步有效視界轉向後續任務所需視界,並同步核對回報是否維持於論文報告區間。完成這項對照後,再由你自己判斷是否值得把驗證範圍延伸至連續動作或更複雜的視覺輸入。

Sources