Slot Machines:LLM 如何追蹤多個實體

🌏 Read this article in English

Anthropic 最新研究《Slot Machines》揭示了 LLM 內部表示的一個核心矛盾:受測模型內部存儲了豐富的資訊,但並非所有資訊都能被調用進行推理。在處理包含多個角色的複雜敘述時,受測的 LLM 並未將資訊混雜在同一個向量中,而是透過一種「多槽位」(multi-slot)機制來維持秩序——分別記錄當前實體與緊鄰的前一實體。

研究發現,受測模型會在單一 token 位置內,利用正交的 current-entity(當前實體)與 prior-entity(先前實體)槽位,分別承擔事實檢索與關係推論的任務。這種分工不僅解釋了模型為何在特定句法下會失效,也暴露了資訊「可用」與「被使用」之間的巨大落差。

研究問題:單一 Token 的資訊承載與綁定約束

語言模型必須將實體(如人名)與屬性(如動作、特徵)準確連結,並在上下文維持多組這樣的連結。在雙主體互動的任務中(例如:「Alice 準備食物,Bob 吃掉它。」),模型需要在處理到最後一個詞彙時,同時記住 Alice 和 Bob 分別做了什麼。

若資訊混雜在一起,模型很容易發生綁定錯誤(binding error)。研究透過對比實驗觀察到,當句法結構強制單一 token 承載兩個主謂賓關係時(例如:”Alice prepares and Bob consumes food.”),部分受測模型的準確率會顯著下降,整體準確率僅約 50.3%;而當這些關係被拆分為獨立句子時(”Alice prepares food. Bob consumes food.”),多數受測模型的表現則近乎完美。這顯示了模型在 binding 機制上的特定約束,而非單純的記憶容量限制。

核心機制:正交槽位與複製轉換

要理解這個機制,我們可以把受測 LLM 的內部運算想像成一個「多軌道磁帶錄音室」。研究發現,模型實際上會將上一個時間點的實體資訊「複製」並轉移到新的軌道上,形成一種疊加狀態。

具體來說,當模型讀到一個新實體時,它會在殘差流中建立一個 current-entity 槽位來處理當前資訊。同時,它會將前一個實體的資訊經過某種轉換(copying transformation),存入另一個正交的 prior-entity 槽位。這兩個槽位在向量空間中的權重幾乎不相關(相關係數 r = 0.11),這表示它們讀取的是不同的特徵方向;且二階相關性也僅為 r = 0.34,顯示它們編碼的關聯結構亦不相同。

研究團隊使用了一種稱為「多槽探針」(multi-slot probing)的方法,透過混合專家架構(mixture-of-experts, MoE)來解構此機制。在這種架構中,數個分類器被訓練以學習同一特徵的不同表徵模式,並由一個路由層(routing layer)決定每個實體應使用的槽位。實驗證實,引入第二個槽位能大幅提升區分當前實體與先前實體表示的準確率。

另一個有趣的發現是,使用者(user)描述的實體,其資訊在後續 token 中的留存強度,略高於 AI 助手(assistant)描述的實體。這項證據反駁了「模型對自我指涉(self-referential)資訊有特殊處理機制」的假設,至少在受測的模型範圍內,資訊的留存更多取決於槽位機制的自然運作,而非角色標籤的特權。

真正重要的結果:功能分工與資訊斷層

研究透過一系列嚴謹的介入實驗(patching 與 steering),揭示了這兩個槽位的功能差異,並產生了幾個可證偽的具體發現。

功能分工明確與整合路徑

prior-entity 槽位主要用於關係推論,例如「誰跟在 Alice 後面?」或檢測相鄰實體間的衝突。當研究團隊對 prior-entity 表示進行因果干預(patching)時,模型的序列推論能力顯著下降。然而,對於明確的事實檢索問題(如「故事中誰很高?」),模型完全依賴 current-entity 槽位。

這背後存在一個關鍵的洞察:資訊可用性不等於被使用。研究發現,即使透過探針可以從 prior-entity 槽位中解碼出 Alice 的特徵,當直接修改 Bob 的 token 表示時,模型對 Alice 特徵的回答幾乎沒有變化。這表明模型內部存在一個「資訊可用性」與「實際使用」之間的斷層。

這種斷層的機制根源在於 MLP 層的整合方式。Steering 實驗顯示,MLP 層負責將 prior-entity 的方向與當前實體的資訊進行整合,以推導出兩者間的關係(例如衝突檢測)。值得注意的是,當對 key/value 向量進行 steering 時並未產生相同效果,這進一步支持了 MLP 在此路徑中的關鍵角色。然而,當模型被要求回答明確的事實問題時,它並未調用這個整合路徑,而是直接從 current-entity 槽位中提取資訊。這意味著,雖然 prior-entity 槽位中確實存儲了相關資訊,但模型的推理架構並未將其納入事實檢索的決策範圍內。

受測模型的能力邊界

在處理強制單一 token 綁定兩個主謂賓關係的複雜句法時,受測的現有 open-weight 模型表現不佳。其中,論文中規模最小的 Qwen3-32B 模型,其準確率僅略高於隨機猜測(near chance level)。Qwen3-32B 作為一款具備優秀多語言與邏輯能力的模型,在多數基準測試中展現了穩定的工程價值;然而,在此次針對特定句法綁定的實驗條件下,它未能正確處理單一位置的多工綁定。

相比之下,當這些關係被拆分為獨立句子時,模型表現近乎完美。這顯示目前的受測模型在此提示格式與任務上未能正確處理單一位置的多工綁定(multiplex multiple bindings),而非它們缺乏表示分離的基礎機制。有趣的是,部分最新的前沿模型(frontier models)能夠正確解析此類複雜句法,暗示它們可能發展出了更複雜的綁定策略,或者具備在單一 token 位置處理多重綁定的能力。

機制邊界與工程取捨

這項研究揭示了 LLM 內部表示的細微結構,但也帶來了重要的工程啟示與取捨。

適用邊界:目前的「多槽位」機制在處理論文的 separated condition(分句條件)時非常有效。然而,當面對需要同時追蹤多個獨立實體綁定的複雜句法時,許多現有受測模型會遭遇瓶頸。研究定位了特定提示格式下的綁定限制,但尚未區分這是句法解析、訓練資料覆蓋率或架構因素所致。

取捨分析 (Trade-offs)

  1. 結構重構 vs. 模型依賴:若任務含複合綁定,開發者面臨兩條路徑:一是透過拆句重構提示(prompt engineering),降低單一位置需承載的綁定數量;二是採用在該綁定測試中表現較佳的模型。這兩種方案的取捨,應依據系統的準確率需求、API 呼叫成本及延遲容忍度來決定。漸進改善的做法通常是先從提示結構著手,確保資訊在時間軸上的分布足夠清晰。

對實務的意涵:理解這些機制邊界,可作為風險控制判準之一。在設計系統時,單一 token 位置處理多重複雜綁定的能力限制,是評估模型適用性時的一項邊界條件。主動將複雜句法拆解為獨立的邏輯斷言,能降低單一位置需要承載的綁定數量,進而減少因綁定錯誤導致的不可預測行為。這是一個值得考慮的方向。

可查證來源與限制

這項研究為理解 LLM 內部機制提供了寶貴的透視,但也存在若干限制。研究主要基於特定的探針架構和介入實驗。探針方法提供了可解碼的相關證據,而 patching 與 steering 則提供了因果介入的證據;然而,這些結果仍受限於受測模型、特定任務及介入設計的外推範圍。

此外,對於為何部分前沿模型能克服單一位置多工綁定的瓶頸,目前仍僅是推測,需要更多研究來驗證其具體機制是否源於規模擴展或架構微調。作者也指出,這種多槽位結構可能是產生某些複雜行為(如阿諛奉承或欺騙)的自然基底,因為它允許模型同時持有兩個視角。這為未來的安全研究開啟了新的方向,但也增加了理解和控制模型行為的難度。

面對複雜綁定任務,選擇在該綁定測試中通過驗證的模型,或優化數據結構以適應現有模型的邊界,取決於你的風險容忍度與成本考量。理解這些機制邊界,或許能讓我們在設計複雜任務時,更精準地評估 Prompt 結構與模型能力的匹配度。

Sources