🌏 Read this article in English
為什麼你的影片模型看不懂物理?
打開你的 Prompt 測試介面。 拖曳一張手繪草圖:一個球、一個斜坡、幾條線代表障礙物。 你以為這只是個簡單的物理模擬測試。 等待三秒。模型輸出了答案,但球穿過了牆壁。
直到那一幕,你才意識到——表示差距(Representation Gap)是影響因素之一。 關鍵不在於模型完全沒有能力,而在於抽象輸入增加了理解門檻。
DeepMind 在論文《Visual prompt engineering for video models》中指出一個反直覺的事實:影片模型在處理視覺推理任務時,對寫實場景的偏好遠高於抽象草圖。(註:該論文為 2026 年 7 月提交的 arXiv 預印本,尚未完成同儕審查。)
透過自動將輸入圖像轉為寫實風格(VIPE),在 VPCT 基準測試中,Veo 3.1 的準確率從 41.3% 躍升至 59.3%,Omni Flash 從 56.3% 提升至 67.5%。在該測試條件下,這比單純增加文字提示或測試時間擴展展現出更好的成本效益。
關鍵差異:抽象草圖增加表示門檻
我們習慣認為,LLM 需要好的文字提示才能產生更準確的回答。 對於影片模型(Video Models),我們同樣依賴「視覺提示」(Visual Prompt)。 但傳統做法是直接丟一張原始圖像給模型——無論這張圖是照片還是簡筆畫。
論文觀察到一個常被忽略的變數:當輸入是抽象草圖時,場景一致性會大幅下降。 在抽象設定中,物體會隨機出現、消失或變形;而在寫實場景中,物理規律更容易被模型捕捉。這意味著,許多基準測試(如 VPCT)可能同時測量了抽象圖理解與物理推理能力。當基準使用簡筆畫風格時,它不僅是在測物理,也是在測「翻譯」能力。
這指向一個未確認的假設:輸入分佈的錯位。模型被預期要理解物理世界,但輸入的卻是一張抽象示意圖。至於這究竟是因為模型缺乏抽象理解力,還是單純的訓練數據分佈差異?論文也指出,具體的底層機制仍需進一步的消融實驗(Ablation)來釐清。
核心機制:VIPE 如何運作?
VIPE 是一個任務導向的視覺輸入編輯框架。它不修改模型權重,也不動文字提示,而是在推理前自動優化任務圖像。
具體流程為: 拿到草圖 → 丟給圖像編輯器轉成寫實照片 → 把照片餵給影片模型。
VIPE 包含多種編輯策略(如自由風格轉換或原子概念編輯 ACE),其中寫實化是最常見的一類,但並非唯一。它會生成多個候選編輯(例如套用不同的編輯強度或隨機種子),再透過任務導向的取用步驟形成實際採用的視覺輸入,最後送入影片模型。本文引用的現有證據並未確立候選如何評分、選擇或整合,因此不能把這一步解讀為已公開的固定排序機制。
介入位置:不是下 Prompt,是改 Input
這裡必須釐清一個關鍵點: VIPE 不是在文字層面告訴模型「請想像這是真實世界」。 它是直接在視覺輸入層面,將抽象的像素結構替換為寫實的像素結構。這是一種「模型外部的輸入前處理」。
看起來只是多加了一道濾鏡。但真正的關鍵在於——它改變了模型看到的數據分佈,而不是指令。
Key Insight: VIPE 的測試結果提供了一個觀察——與其費盡心力用文字向模型解釋『這是真實世界』,不如直接把圖換成真實世界的樣子。
回到賭桌:VIPE 的成本效益
讓我們看幾個具體數字。這些數據來自 DeepMind 在 VPCT(Visual Physics Comprehension Test)上的實測。VPCT 主要評估模型對物體運動、碰撞與重力的物理直覺。
1. 準確率的幅度明顯提升
| 模型 | 基線準確率 (Baseline) | VIPE 後準確率 | 提升幅度 |
|---|---|---|---|
| Veo 3.1 | 41.3% | 59.3% | +18.0 個百分點(相對提升約 43.6%) |
| Omni Flash | 56.3% | 67.5% | +11.2 個百分點(相對提升約 19.9%) |
兩者皆顯示出,即使是表現較好的模型,在面對抽象輸入時仍有巨大的潛力未被釋放。
註:數據來自論文表 1,基於 VPCT 基準測試的平均正確率。
2. 成本效益:圖像編輯 vs. 影片生成
VIPE 在該測試中展現為一種具成本效益的測試時間擴展策略。
- 基線影片生成成本:Veo 3.1 每秒約 0.40 美元,8 秒影片約 3.20 美元。(定價依據:Gemini API pricing,截至論文發表時)
- VIPE 前處理成本:包含五次圖像編輯,總成本約 0.40 美元。
- 完整 VIPE 推理成本:在包含五次前處理與單次 8 秒影片生成的特定測試條件下,總計約 3.60 美元。
這意味著:在該測試條件下,先優化視覺輸入可能比增加影片採樣更具成本效益。增加採樣與優化輸入是兩種可接力的策略,選擇哪一種取決於你的延遲預算與算力限制。
3. 對文字提示的優勢
論文比較了 VIPE 與傳統的文字提示工程(Text Prompt Engineering)。結果顯示,在視覺推理任務上,VIPE 的效果通常優於僅優化文字提示。這驗證了一個假設:對於該測試的模型與任務而言,視覺輸入的質量比文字指令的細微調整更重要。
你的判斷:適用邊界與取捨
VIPE 透過外部前處理繞過了表示差距,而不是直接突破了模型原生的物理推理天花板。它有明確的適用邊界和代價。
適合誰?
- 需要處理抽象或簡筆畫場景的應用:例如教育軟體、物理教學工具、遊戲開發中的原型測試。(這是一個值得測試的方向,但前提是你要先測過語意保真度與延遲代價。)
- 追求高推理準確率且預算有限的團隊:VIPE 提供了低成本的性能提升路徑。
- 依賴現有影片模型的開發者:無需重新訓練模型,只需在推理前加入圖像編輯步驟。
不適合哪種情境?
- 原生影像生成模型(Native Image Generation Models):論文指出 VIPE 並未系統性地改善原生影像生成模型的推理表現。目前受測影像模型未呈現一致增益;模型類別差異仍需更廣泛實驗確認。
- 需要極高實時性的場景:雖然圖像編輯成本低,但仍需額外的計算步驟。如果延遲是首要考量,需評估整體 Pipeline 的瓶頸。
取捨:代價是什麼?
- 依賴圖像編輯模型的質量:VIPE 的效果取決於底層圖像編輯模型能否準確生成寫實場景。
- 潛在的偏差引入:寫實場景可能引入原始草圖中沒有的細節(如光影、紋理)。這些細節是否會導致模型產生新的誤判?目前研究顯示整體有益,但需持續監控。
Key Insight: VIPE 的實測結果揭示了一個可驗證的新優化介面:視覺提示不再只是固定輸入,而是可優化的空間。 這與文字提示工程在 LLM 中的演進軌跡相似——從「手寫提示」走向「自動化優化」。
結論:在證據邊界內的決策
若你的工作流高度依賴草圖或抽象輸入,VIPE 提供了一個在不重新訓練模型的前提下,透過前處理提升物理推理準確率的方向。
但這個方向有其證據邊界。目前的實測數據主要集中在 VPCT 基準與特定的影片生成模型(如 Veo 3.1 與 Omni Flash)。在將其投入生產環境前,仍需針對具體的語意保真度、額外的延遲代價,以及不同模型架構的適配性進行局部驗證。增加採樣與優化輸入是兩種可接力的策略,具體比重取決於系統的延遲預算與算力限制。
Sources
- Visual prompt engineering for video models — 定義 VIPE 機制與 VPCT 基準測試結果
- Gemini API Pricing — Veo 3.1 官方單價 USD 0.40/s
- VPCT dataset — VPCT 欄位與規模