視覺提示工程:VIPE 如何改善抽象圖上的物理推理

🌏 Read this article in English


為什麼你的影片模型看不懂物理?

打開你的 Prompt 測試介面。 拖曳一張手繪草圖:一個球、一個斜坡、幾條線代表障礙物。 你以為這只是個簡單的物理模擬測試。 等待三秒。模型輸出了答案,但球穿過了牆壁。

直到那一幕,你才意識到——表示差距(Representation Gap)是影響因素之一。 關鍵不在於模型完全沒有能力,而在於抽象輸入增加了理解門檻。

DeepMind 在論文《Visual prompt engineering for video models》中指出一個反直覺的事實:影片模型在處理視覺推理任務時,對寫實場景的偏好遠高於抽象草圖。(註:該論文為 2026 年 7 月提交的 arXiv 預印本,尚未完成同儕審查。)

透過自動將輸入圖像轉為寫實風格(VIPE),在 VPCT 基準測試中,Veo 3.1 的準確率從 41.3% 躍升至 59.3%,Omni Flash 從 56.3% 提升至 67.5%。在該測試條件下,這比單純增加文字提示或測試時間擴展展現出更好的成本效益。

關鍵差異:抽象草圖增加表示門檻

我們習慣認為,LLM 需要好的文字提示才能產生更準確的回答。 對於影片模型(Video Models),我們同樣依賴「視覺提示」(Visual Prompt)。 但傳統做法是直接丟一張原始圖像給模型——無論這張圖是照片還是簡筆畫。

論文觀察到一個常被忽略的變數:當輸入是抽象草圖時,場景一致性會大幅下降。 在抽象設定中,物體會隨機出現、消失或變形;而在寫實場景中,物理規律更容易被模型捕捉。這意味著,許多基準測試(如 VPCT)可能同時測量了抽象圖理解與物理推理能力。當基準使用簡筆畫風格時,它不僅是在測物理,也是在測「翻譯」能力。

這指向一個未確認的假設:輸入分佈的錯位。模型被預期要理解物理世界,但輸入的卻是一張抽象示意圖。至於這究竟是因為模型缺乏抽象理解力,還是單純的訓練數據分佈差異?論文也指出,具體的底層機制仍需進一步的消融實驗(Ablation)來釐清。

核心機制:VIPE 如何運作?

VIPE 是一個任務導向的視覺輸入編輯框架。它不修改模型權重,也不動文字提示,而是在推理前自動優化任務圖像。

具體流程為: 拿到草圖 丟給圖像編輯器轉成寫實照片 把照片餵給影片模型。

VIPE 包含多種編輯策略(如自由風格轉換或原子概念編輯 ACE),其中寫實化是最常見的一類,但並非唯一。它會生成多個候選編輯(例如套用不同的編輯強度或隨機種子),再透過任務導向的取用步驟形成實際採用的視覺輸入,最後送入影片模型。本文引用的現有證據並未確立候選如何評分、選擇或整合,因此不能把這一步解讀為已公開的固定排序機制。

介入位置:不是下 Prompt,是改 Input

這裡必須釐清一個關鍵點: VIPE 不是在文字層面告訴模型「請想像這是真實世界」。 它是直接在視覺輸入層面,將抽象的像素結構替換為寫實的像素結構。這是一種「模型外部的輸入前處理」。

看起來只是多加了一道濾鏡。但真正的關鍵在於——它改變了模型看到的數據分佈,而不是指令。

Key Insight: VIPE 的測試結果提供了一個觀察——與其費盡心力用文字向模型解釋『這是真實世界』,不如直接把圖換成真實世界的樣子。

回到賭桌:VIPE 的成本效益

讓我們看幾個具體數字。這些數據來自 DeepMind 在 VPCT(Visual Physics Comprehension Test)上的實測。VPCT 主要評估模型對物體運動、碰撞與重力的物理直覺。

1. 準確率的幅度明顯提升

模型基線準確率 (Baseline)VIPE 後準確率提升幅度
Veo 3.141.3%59.3%+18.0 個百分點(相對提升約 43.6%)
Omni Flash56.3%67.5%+11.2 個百分點(相對提升約 19.9%)

兩者皆顯示出,即使是表現較好的模型,在面對抽象輸入時仍有巨大的潛力未被釋放。

註:數據來自論文表 1,基於 VPCT 基準測試的平均正確率。

2. 成本效益:圖像編輯 vs. 影片生成

VIPE 在該測試中展現為一種具成本效益的測試時間擴展策略。

  • 基線影片生成成本:Veo 3.1 每秒約 0.40 美元,8 秒影片約 3.20 美元。(定價依據:Gemini API pricing,截至論文發表時)
  • VIPE 前處理成本:包含五次圖像編輯,總成本約 0.40 美元。
  • 完整 VIPE 推理成本:在包含五次前處理與單次 8 秒影片生成的特定測試條件下,總計約 3.60 美元。

這意味著:在該測試條件下,先優化視覺輸入可能比增加影片採樣更具成本效益。增加採樣與優化輸入是兩種可接力的策略,選擇哪一種取決於你的延遲預算與算力限制。

3. 對文字提示的優勢

論文比較了 VIPE 與傳統的文字提示工程(Text Prompt Engineering)。結果顯示,在視覺推理任務上,VIPE 的效果通常優於僅優化文字提示。這驗證了一個假設:對於該測試的模型與任務而言,視覺輸入的質量比文字指令的細微調整更重要。

你的判斷:適用邊界與取捨

VIPE 透過外部前處理繞過了表示差距,而不是直接突破了模型原生的物理推理天花板。它有明確的適用邊界和代價。

適合誰?

  • 需要處理抽象或簡筆畫場景的應用:例如教育軟體、物理教學工具、遊戲開發中的原型測試。(這是一個值得測試的方向,但前提是你要先測過語意保真度與延遲代價。)
  • 追求高推理準確率且預算有限的團隊:VIPE 提供了低成本的性能提升路徑。
  • 依賴現有影片模型的開發者:無需重新訓練模型,只需在推理前加入圖像編輯步驟。

不適合哪種情境?

  • 原生影像生成模型(Native Image Generation Models):論文指出 VIPE 並未系統性地改善原生影像生成模型的推理表現。目前受測影像模型未呈現一致增益;模型類別差異仍需更廣泛實驗確認。
  • 需要極高實時性的場景:雖然圖像編輯成本低,但仍需額外的計算步驟。如果延遲是首要考量,需評估整體 Pipeline 的瓶頸。

取捨:代價是什麼?

  1. 依賴圖像編輯模型的質量:VIPE 的效果取決於底層圖像編輯模型能否準確生成寫實場景。
  2. 潛在的偏差引入:寫實場景可能引入原始草圖中沒有的細節(如光影、紋理)。這些細節是否會導致模型產生新的誤判?目前研究顯示整體有益,但需持續監控。

Key Insight: VIPE 的實測結果揭示了一個可驗證的新優化介面:視覺提示不再只是固定輸入,而是可優化的空間。 這與文字提示工程在 LLM 中的演進軌跡相似——從「手寫提示」走向「自動化優化」。

結論:在證據邊界內的決策

若你的工作流高度依賴草圖或抽象輸入,VIPE 提供了一個在不重新訓練模型的前提下,透過前處理提升物理推理準確率的方向。

但這個方向有其證據邊界。目前的實測數據主要集中在 VPCT 基準與特定的影片生成模型(如 Veo 3.1 與 Omni Flash)。在將其投入生產環境前,仍需針對具體的語意保真度、額外的延遲代價,以及不同模型架構的適配性進行局部驗證。增加採樣與優化輸入是兩種可接力的策略,具體比重取決於系統的延遲預算與算力限制。

Sources