AGI 的維度:如何透過能力與自主度評估 AI 風險

🌏 Read this article in English


PM 轉發了一篇標題為「AGI 時代來臨」的文章。附言:「我們是不是該全自動化?」

你盯著 CI/CD 流水線,心裡想的不是自動化,而是:「如果它把資料庫刪了,誰來負責復原?」

答案通常是:你明天早上會多流兩滴汗。

把 AI 專案視為單一的黑盒,是工程評估中最常見的盲點。你以為你在評估一個完整的物種,其實你只是在評估某個維度的極限。

Google DeepMind 在《The Levels of AGI Framework》中提出了一套分類標準。除了評估 Performance Levels(能力等級)與 Generality(廣度),論文更明確提出了一個關鍵維度:Autonomy Levels(自主度等級)。它衡量的是:AI 在執行任務時,需要多少人類監督?

混淆這些維度,通常會導致兩種常見的決策偏差:

  1. 部署保守:認為它已經具備自主意識,所以不敢部署任何自動化流程。
  2. 授權過快:認為它能力強,所以允許它在關鍵決策中獨立執行。

我們需要一個矩陣,而不是標籤。

能力等級:從「Emerging」到「Superhuman」

論文的核心貢獻之一,是將 AGI 拆解為 Performance Levels(能力等級)。這不是關於「它是不是人」,而是「它在認知任務上表現得比誰好」。

請記住這六個等級,它們是漸進的,不是跳躍的:

等級名稱定義實務對應
L0No AI無 AI 介入傳統規則引擎
L1Emerging AGI在少數任務上表現 competent,多數任務 emergent部分公開模型在該論文語境下可視為 L1 例子
L2Competent AGI在大多數認知任務上,表現達人類 50th percentile能獨立處理標準客服、基礎程式碼審查
L3Expert AGI在特定領域,表現達人類 Top 10%醫療影像診斷、複雜法律文書審閱
L4Exceptional AGI表現達人類 Top 0.1%(引用 arXiv v5 術語)尚不存在,僅限理論推演
L5Superhuman AGI在相關任務上超越人類最佳表現理論上的終極目標

依該論文框架與目前公開能力觀察(截至 2026-07),現行 SOTA 模型普遍被歸類為 L1 (Emerging AGI)

因為它們在編寫程式、翻譯、摘要上表現優異(Competence),但在邏輯推理、長程規劃、複雜數學證明上,表現仍不穩定(Emergent)。

「Emergent」這個詞很危險。它暗示著「突現」,讓人以為只要規模夠大,就會自動變成 Competent。事實並非如此。L1 到 L2 的跨越,可能需要模型架構、工具使用、評測與互動設計的共同改進,而不僅僅是數據量的堆疊。

自主度等級:從「工具」到「代理人」

為了評估部署風險,我們必須看論文提出的另一個核心維度:Autonomy Levels(自主度等級)。它衡量的是:AI 在執行任務時,需要多少人類監督?

『Agent』在不同產品語境中的定義不一致,工程上需回到這套權限邊界來檢視。

等級名稱定義
L0Tool完全手動,AI 僅作為查詢工具
L1Consultant提供建議,人類執行
L2Collaborator輔助人類決策,共同執行
L3Expert執行特定子任務,人類監督
L4Agent自主執行完整流程,人類可撤銷

注意 L4 的定義:「Autonomous execution… but knows when to consult humans」。這不是「沒有監督」,而是「動態監督」。

目前的 API 呼叫、Chatbot 回覆,大多落在 L0 到 L2。你下指令,它給結果。你決定下一步。

風險在於,許多團隊試圖將 L1 的能力,直接部署到 L4 的場景中。這就像給 L1 的腳本配上 root 權限——它跑得動,但一旦出錯,整個系統都會崩潰。

正交性:為什麼這兩個維度必須分開看?

這是整篇論文最關鍵的洞見:Performance 和 Autonomy 是正交的(Orthogonal)。

這意味著,你可以有「高能力、低自主」的系統,也可以有「低能力、高自主」的系統。大多數風險評估偏差,源於混淆了這兩者。

把能力想像成引擎馬力,自主度是方向盤

給賽車引擎配玩具方向盤——它只會直線衝撞。給玩具引擎配賽車方向盤——它會在轉彎時翻車。兩者必須匹配。這不是對錯的問題,是選擇的問題。

案例一:低到中能力、低自主(L1 Performance, L1 Autonomy)

場景:客服機器人。 能力:L1。它能理解 90% 的常見問題,並給出準確答案。 自主:L1。它提供建議,但回覆需經人類確認後才發送。

風險:低。即使它給出錯誤答案,人類客服會攔截。錯誤的邊際效應被限制在「資訊層面」。

案例二:低能力、高自主(L1 Performance, L4 Autonomy)

承接:自動程式碼部署腳本。 能力:L1。它生成的程式碼可能有邏輯錯誤,或忽略邊緣情況。 自主:L4。它自動執行部署,人類僅在失敗時介入。

風險:極高。能力不足導致錯誤,高自主度導致錯誤被快速放大。這就是所謂的「自動化災難」——錯誤被加速放大,而你連擋都擋不住。

案例三:高能力、高自主(L3 Performance, L4 Autonomy)

場景:醫療診斷輔助系統。 能力:L3。在特定影像診斷上,表現達專家級。 自主:L4。它能自主調用檢查設備、提出後續檢查建議並建立待醫師確認的工作單,僅在疑難雜症時諮詢醫生。

風險:高。雖能力足夠支撐自主決策,但高監管情境下的風險包含誤診、流程執行、責任歸屬與合規審計。醫療場景需額外考量法規合規、人工覆核與審計紀錄。

關鍵在於:你不需要 L5 的能力,就可以部署 L4 的自主度。你只需要足夠的能力來支撐該自主度下的風險邊界

如果一個任務的錯誤成本極低(例如:重新輸入表格),那麼 L1 能力 + L3 自主度屬於中風險,在可逆前提下是可以接受的。但如果錯誤成本是「資金流失」,那麼 L1 能力 + L4 自主度就是高風險,屬於不可接受的風險敞口。

風險矩陣:如何決定你的部署策略?

把這兩個維度疊起來,你的風險地圖就出來了。請把你目前的 AI 專案放進去:

能力 \ 自主度L0-L2 (輔助/資訊)L3 (專家/監督)L4 (高自主/可撤銷)
L1 (Emerging)低風險
推薦:客服、摘要、翻譯
中風險
僅限低可逆成本任務
高風險
未經驗證的自主決策
L2 (Competent)低風險
推薦:程式碼輔助、數據分析
中風險
建議:逐步放權,監控邊界
高風險
需極長期的安全驗證
L3+ (Expert+)低風險
推薦:任何輔助場景
中低風險
建議:動態監督
中風險
需法律與責任框架

實務建議

  1. 先評估能力等級:不要問「這模型強不強?」。問「在 100 次任務中,它有幾次會犯下不可逆的錯誤?」
  2. 再決定自主度:不要問「我們能不能自動化?」。問「如果它錯了,誰來承擔成本?這個成本我們付得起嗎?」
  3. 匹配原則:依錯誤成本、可逆性、監控能力決定,不把 L3 當硬性門檻。如果能力是 L1,請將自主度限制在 L2。如果需要 L4 自主度,請確保能力至少達到 L3,並建立強大的回滾機制。

市場訊號與未來展望

目前的 SOTA 模型,仍處於 L1 Performance 的階段。在這篇論文的分類下,現有模型更接近 Emerging AGI,而非 Competent AGI。若依本文採用的能力與自主度定義,AGI 已達成的說法仍需更多共同基準。

隨著模型能力的提升,我們預期會看到:

  • L2 Performance 的普及:模型將能穩定處理大多數認知任務。
  • Expert-level performance 的垂直試點:在金融、醫療等領域,出現「專家級」的自主輔助系統。
  • L3-L4 Autonomy 的流程試點:在特定工作流中,出現「專家級」的自主輔助系統。
  • L4 Autonomy 的爭議:關於「AI 代理人」的法律責任與倫理框架,將成為主要討論焦點。

L3 到 L4 的跨越,目前仍缺乏足夠的歷史數據。等 N 年回頭看,我們可能會發現現在的框架過於樂觀。

選擇在正確的格子裡部署 AI,而不是在模糊的標題下冒險。

你明天的決策檢查點

在按下部署鍵之前,不妨把這三個問題攤在桌上:

  1. 錯誤成本是多少? 是重新輸入表格,還是資金流失?
  2. 誰負責復原與成本承擔? 如果它錯了,是你來修,還是系統自動修復?
  3. 依賴什麼? 我們是依賴它的「能力」,還是依賴我們的「監控」?

答案不同,你的策略就不同。

市場訊號尚未明朗,但風險邊界可以現在就畫好。你明天的十分鐘,打算花在『畫邊界』,還是『處理例外成本』?

Sources