🌏 Read this article in English
在視覺表示中,相機位移與物體運動的耦合是長期存在的混淆來源。當鏡頭平移時,背景與前景同時位移;當物體自轉時,相機也可能在跟隨。這種視覺訊號的交織,讓大多數視覺模型難以分辨哪些是場景中物體的實際運動,哪些只是觀察角度的改變。
SDM(Structured Dynamics Model)提出了一種結構化方法來處理這種耦合。它不直接預測下一幀畫面,而是透過自監督學習,將複雜的動態拆解為「主要 token」(primary token)與「殘差 token」(residual token)。研究團隊在 ProbeMotion 的五項任務取得較佳結果,其中包括 Kubric 合成資料與 SSv2-110k 行動預測任務。
SDM 的價值在於提供了一種可檢驗的動態解構機制,而非僅僅是數值上的提升。主要 token 捕捉主導運動,其實證角色會隨相機是否移動而改變:在動態相機影片中主要對應相機運動,在近靜態相機影片中則主要對應物體運動;殘差 token 捕捉主要成分之外的物體動態。這不僅是學術上的挑戰,也帶來了實際的工程考量:在動作識別或物理推理等下游任務中,如何處理視角變化與物體行為的交織,仍需依任務驗證。
挑戰與現狀:動態訊號的耦合現象
在理解 SDM 之前,需要先釐清傳統視覺模型面臨的根本限制。訓練模型理解影片時,輸入的每一幀都包含了兩種截然不同的資訊來源:一是相機本身的運動(如平移、旋轉),二是場景中物體的相對運動。這兩者在畫素層級上往往是高度交織的。
舉例來說,當相機向右移動時,畫面中的所有物體都會向左移動。如果模型只學習像素的變化模式,它很難區分這種移動是來自於「相機在動」還是「所有物體同時向左跑」。這種混淆形成了兩項限制:首先,模型難以學到對相機運動不變的物體特徵;其次,在需要物理推理的任務中,模型容易將視角變化誤認為是物體的實際位移。
過去的研究傾向於使用全局池化(global pooling)或 CLS token 來壓縮整個畫面的資訊。這種方法在低成本摘要場景中非常有效,但也丟失了空間結構上的細節。更嚴重的挑戰是,當相機與物體同時運動時,單一的全局表示會將這兩種動態混合在一起,導致動態信號混雜在單一向量中,難以進行因果歸因或物理推理。
SDM 的出發點很直接:如果我們能將主導動態與其餘動態分開,是否就能獲得更魯棒的視覺表示?研究團隊假設,視頻中的時間變化可以分解為一個主導成分和一個殘差成分。主導成分的角色取決於場景條件:相機移動時通常是相機運動,相機近乎靜止時則可能是物體運動;殘差成分捕捉其餘的物體動態。透過這種結構化的拆解,模型可以依場景配置組織不同的運動訊號。
核心機制:主要與殘差的雙軌解構
SDM 的核心機制在於它如何從凍結的特徵中提取運動資訊,並將其組織為兩個獨立的 token。這個過程並非透過複雜的端到端訓練實現,而是建立在一個相對簡潔但有效的架構之上。
首先,模型使用凍結的 DINOv2-B/14 作為特徵提取器(Encoder)。DINOv2 是一個廣泛使用的預訓練視覺 Transformer,它已經在大量無標籤圖像上學到了豐富的語義與結構資訊。研究團隊從 DINOv2 的所有 12 個區塊中提取 patch features,並利用其內建的 registers 來增強空間位置感。
SDM 在不重新訓練底層模型的情況下,將動態組織為主要與殘差 token,其關鍵在於預測未來特徵並拆解其中的主導與剩餘成分。
接下來是 SDM 最核心的設計:將時間變化分解為「主要 token」(primary token)與「殘差 token」(residual token)。這個過程透過未來特徵預測(future-feature prediction)來實現。模型被要求預測下一幀的特徵,但預測的目標不是整個畫面,而是兩個獨立的動態成分。
具體來說,主要 token 負責捕捉場景中最大的時間變化來源。在動態相機的影片中,這通常對應於相機運動;在靜態相機的影片中,則對應於物體運動。殘差 token 則捕捉剩餘的、與物體相關的動態細節。這種設計允許模型根據場景配置靈活調整:當相機移動時,主要 token 會專注於視角變化;當相機固定時,它會轉向關注物體的行為。
為了讓這個機制生效,研究團隊使用了三種場景配置進行訓練:靜態場景搭配移動相機、動態場景搭配靜態相機,以及兩者同時移動。這種訓練配置的設計目的,是讓模型在不同情境下學習主要與殘差的責任分配;目前觀察到的效果限於已評估的資料與 ProbeMotion 任務。例如,在 Kubric 合成資料中,物體只有平移而沒有旋轉,這使得模型可以專注於學習 3D 平移向量 [vx, vy, vz];而在 DL3DV 真實資料中,則需要預測包含偏航、俯仰和滾轉的 6D 相機運動向量。
這種雙軌解構的優勢在於它引入了明確的結構化歸納偏置。傳統模型往往將所有畫素變化視為同等重要,而 SDM 透過區分主導動態與殘差動態,迫使模型學習到更具結構性的表示。這就像是在處理一張複雜的樂譜時,先分離出主旋律(主要 token)與伴奏(殘差 token),從而更清晰地理解每種樂器的角色。
證據與評估:在 ProbeMotion 上的表現
為了驗證 SDM 的有效性,研究團隊提出了 ProbeMotion 評估套件,這是一個涵蓋合成與真實影片的綜合測試平台。ProbeMotion 包含多個子任務,旨在評估模型在不同動態情境下的分離能力。
SDM 在七項 ProbeMotion 任務中贏得了五項。與基底模型 DeltaTok 相比,SDM 在 Kubric 物體運動任務上取得了最大的增益(MSE 降低 0.16)。這項結果顯示,在 ProbeMotion 與 Kubric 的比較設定下,SDM 的機制能更有效地捕捉物體動態;這屬於該特定基準下的觀察,而非對模型內部能力的確證。在消融實驗中,相較於使用 L1 訓練目標,SDM 採用的 MSE 目標將 Kubric 物體運動的誤差從 0.30 降至 0.19,相機運動預測誤差從 0.18 降至 0.16。這些運動迴歸指標的改善,顯示模型能更精確地分離並預測不同動態。
在 SSv2-110k 行動預測任務上,SDM 的表現同樣出色。相較於使用全局 CLS token 或平均池化特徵的基底模型(DeltaTok),SDM 提升了 9.6 個百分點的準確率。這表明,分離出的主要 token 不僅能捕捉相機運動,還能有效編碼與動作相關的物體動態,即使這些動態可能不是場景中最大的視覺變化來源。
值得注意的是,SDM 的訓練成本相對較低。主實驗使用了三個隨機種子,總計約 132 GPU 小時(每個 seed 約 11 小時乘 4 GPU);而 9 個消融實驗則需要約 396 GPU 小時。相對於許多需要大規模重新訓練視覺模型的方案,這個訓練規模在工程實踐上是可以核對的。
在數據處理方面,研究團隊採取了嚴格的篩選策略。他們保留了運動幅度在前 75 個百分位數以上的樣本,並對其餘較低運動的樣本進行隨機下採樣,以確保數據平衡。此外,對於 DL3DV 數據集,他們採用了影片級別的劃分(70% 訓練,30% 測試),以避免資料洩漏。這些細節是結果可信度的重要基礎。
取捨與邊界:什麼情況下 SDM 最有效?
任何技術方案都有其適用邊界,SDM 也不例外。理解它的取捨,有助於判斷它是否適合特定的應用場景。
首先,SDM 的優勢在於其對結構化動態的分離能力,但這也意味著它在處理高度非結構化或隨機噪聲時可能不如預期。由於模型依賴於預測未來特徵並將其分解為主要與殘差成分,如果場景中的變化缺乏明確的物理規律(例如大量雜亂的背景干擾),模型的表現可能會受到影響。約有 90% 的 Kubric 動態物體樣本通過有效性檢查;這個數字只描述該批樣本的篩選結果,不能據此推論資料品質對模型表現的影響。
其次,SDM 的訓練依賴於合成數據(Kubric)與真實數據(SSv2, DL3DV)的混合。這種混合策略涵蓋合成與真實影片,但領域差距是仍需評估的轉移邊界。合成數據提供了精確的運動標籤,但可能無法完全覆蓋真實世界的複雜性;真實數據則缺乏精確的監督訊號。研究團隊透過保留高運動幅度樣本並平衡低運動樣本來緩解這個問題,但這仍然是一個需要持續關注的挑戰。
另一個重要的取捨是計算效率與表示能力的權衡。SDM 使用凍結的 DINOv2 特徵,這避免了重新訓練大型視覺模型的開銷。然而,它仍然需要額外的計算資源來處理主要與殘差 token 的預測與分離。相較於簡單的全局池化方法,SDM 的推理成本略高,但這換來了更豐富的結構化資訊。對於對延遲敏感的應用,這種權衡需要仔細評估。
最後,SDM 目前仍處於研究階段,其適用範圍主要限於影片動態分析與物理推理任務。它並不是一個通用的視覺模型替代品,而是一個專門用於增強現有模型的模組化組件。這意味著它需要與下游任務(如動作識別、場景理解)緊密整合,才能發揮最大價值。
結論:結構化表示的邊界與價值
SDM 展示了在凍結特徵上進行結構化分解的可行性。對於需要物理推理的場景,這種分離提供了比全局池化更清晰的訊號;但在高噪聲或非結構化環境中,其增益仍需進一步驗證。這項研究提供了一個值得參考的設計模式:透過結構化拆解將複雜動態轉化為可管理的組件,而非依賴單一黑箱模型。
這種結構化思維的價值不僅在於提升準確率,更在於它提供了可檢驗的動態表示。在 ProbeMotion 與凍結編碼器設定下,主要 token 在動態相機影片中主要捕捉相機運動,在近靜態相機影片中則主要捕捉物體運動;當主要成分解釋相機引起的變化時,殘差 token 捕捉其餘的物體動態。這種分工是否能提升特定下游任務的可解釋性,以及其工程成本是否合適,仍需依資料、延遲與任務需求分別驗證。這種將複雜訊號解耦的思路,或許也能應用於其他類似的時序數據場景中。
Sources
- Self-Supervised Learning of Structured Dynamics from Videos — SDM 方法與 ProbeMotion 實驗
- Decoupling Motion: The Structured Dynamics Model for Video Representation — 第三方研究摘要與技術背景