🌏 Read this article in English
PM 轉發了一篇標題為「AGI 時代來臨」的文章。附言:「我們是不是該全自動化?」
你盯著 CI/CD 流水線,心裡想的不是自動化,而是:「如果它把資料庫刪了,誰來負責復原?」
答案通常是:你明天早上會多流兩滴汗。
把 AI 專案視為單一的黑盒,是工程評估中最常見的盲點。你以為你在評估一個完整的物種,其實你只是在評估某個維度的極限。
Google DeepMind 在《The Levels of AGI Framework》中提出了一套分類標準。除了評估 Performance Levels(能力等級)與 Generality(廣度),論文更明確提出了一個關鍵維度:Autonomy Levels(自主度等級)。它衡量的是:AI 在執行任務時,需要多少人類監督?
混淆這些維度,通常會導致兩種常見的決策偏差:
- 部署保守:認為它已經具備自主意識,所以不敢部署任何自動化流程。
- 授權過快:認為它能力強,所以允許它在關鍵決策中獨立執行。
我們需要一個矩陣,而不是標籤。
能力等級:從「Emerging」到「Superhuman」
論文的核心貢獻之一,是將 AGI 拆解為 Performance Levels(能力等級)。這不是關於「它是不是人」,而是「它在認知任務上表現得比誰好」。
請記住這六個等級,它們是漸進的,不是跳躍的:
| 等級 | 名稱 | 定義 | 實務對應 |
|---|---|---|---|
| L0 | No AI | 無 AI 介入 | 傳統規則引擎 |
| L1 | Emerging AGI | 在少數任務上表現 competent,多數任務 emergent | 部分公開模型在該論文語境下可視為 L1 例子 |
| L2 | Competent AGI | 在大多數認知任務上,表現達人類 50th percentile | 能獨立處理標準客服、基礎程式碼審查 |
| L3 | Expert AGI | 在特定領域,表現達人類 Top 10% | 醫療影像診斷、複雜法律文書審閱 |
| L4 | Exceptional AGI | 表現達人類 Top 0.1%(引用 arXiv v5 術語) | 尚不存在,僅限理論推演 |
| L5 | Superhuman AGI | 在相關任務上超越人類最佳表現 | 理論上的終極目標 |
依該論文框架與目前公開能力觀察(截至 2026-07),現行 SOTA 模型普遍被歸類為 L1 (Emerging AGI)。
因為它們在編寫程式、翻譯、摘要上表現優異(Competence),但在邏輯推理、長程規劃、複雜數學證明上,表現仍不穩定(Emergent)。
「Emergent」這個詞很危險。它暗示著「突現」,讓人以為只要規模夠大,就會自動變成 Competent。事實並非如此。L1 到 L2 的跨越,可能需要模型架構、工具使用、評測與互動設計的共同改進,而不僅僅是數據量的堆疊。
自主度等級:從「工具」到「代理人」
為了評估部署風險,我們必須看論文提出的另一個核心維度:Autonomy Levels(自主度等級)。它衡量的是:AI 在執行任務時,需要多少人類監督?
『Agent』在不同產品語境中的定義不一致,工程上需回到這套權限邊界來檢視。
| 等級 | 名稱 | 定義 |
|---|---|---|
| L0 | Tool | 完全手動,AI 僅作為查詢工具 |
| L1 | Consultant | 提供建議,人類執行 |
| L2 | Collaborator | 輔助人類決策,共同執行 |
| L3 | Expert | 執行特定子任務,人類監督 |
| L4 | Agent | 自主執行完整流程,人類可撤銷 |
注意 L4 的定義:「Autonomous execution… but knows when to consult humans」。這不是「沒有監督」,而是「動態監督」。
目前的 API 呼叫、Chatbot 回覆,大多落在 L0 到 L2。你下指令,它給結果。你決定下一步。
風險在於,許多團隊試圖將 L1 的能力,直接部署到 L4 的場景中。這就像給 L1 的腳本配上 root 權限——它跑得動,但一旦出錯,整個系統都會崩潰。
正交性:為什麼這兩個維度必須分開看?
這是整篇論文最關鍵的洞見:Performance 和 Autonomy 是正交的(Orthogonal)。
這意味著,你可以有「高能力、低自主」的系統,也可以有「低能力、高自主」的系統。大多數風險評估偏差,源於混淆了這兩者。
把能力想像成引擎馬力,自主度是方向盤。
給賽車引擎配玩具方向盤——它只會直線衝撞。給玩具引擎配賽車方向盤——它會在轉彎時翻車。兩者必須匹配。這不是對錯的問題,是選擇的問題。
案例一:低到中能力、低自主(L1 Performance, L1 Autonomy)
場景:客服機器人。 能力:L1。它能理解 90% 的常見問題,並給出準確答案。 自主:L1。它提供建議,但回覆需經人類確認後才發送。
風險:低。即使它給出錯誤答案,人類客服會攔截。錯誤的邊際效應被限制在「資訊層面」。
案例二:低能力、高自主(L1 Performance, L4 Autonomy)
承接:自動程式碼部署腳本。 能力:L1。它生成的程式碼可能有邏輯錯誤,或忽略邊緣情況。 自主:L4。它自動執行部署,人類僅在失敗時介入。
風險:極高。能力不足導致錯誤,高自主度導致錯誤被快速放大。這就是所謂的「自動化災難」——錯誤被加速放大,而你連擋都擋不住。
案例三:高能力、高自主(L3 Performance, L4 Autonomy)
場景:醫療診斷輔助系統。 能力:L3。在特定影像診斷上,表現達專家級。 自主:L4。它能自主調用檢查設備、提出後續檢查建議並建立待醫師確認的工作單,僅在疑難雜症時諮詢醫生。
風險:高。雖能力足夠支撐自主決策,但高監管情境下的風險包含誤診、流程執行、責任歸屬與合規審計。醫療場景需額外考量法規合規、人工覆核與審計紀錄。
關鍵在於:你不需要 L5 的能力,就可以部署 L4 的自主度。你只需要足夠的能力來支撐該自主度下的風險邊界。
如果一個任務的錯誤成本極低(例如:重新輸入表格),那麼 L1 能力 + L3 自主度屬於中風險,在可逆前提下是可以接受的。但如果錯誤成本是「資金流失」,那麼 L1 能力 + L4 自主度就是高風險,屬於不可接受的風險敞口。
風險矩陣:如何決定你的部署策略?
把這兩個維度疊起來,你的風險地圖就出來了。請把你目前的 AI 專案放進去:
| 能力 \ 自主度 | L0-L2 (輔助/資訊) | L3 (專家/監督) | L4 (高自主/可撤銷) |
|---|---|---|---|
| L1 (Emerging) | 低風險 推薦:客服、摘要、翻譯 | 中風險 僅限低可逆成本任務 | 高風險 未經驗證的自主決策 |
| L2 (Competent) | 低風險 推薦:程式碼輔助、數據分析 | 中風險 建議:逐步放權,監控邊界 | 高風險 需極長期的安全驗證 |
| L3+ (Expert+) | 低風險 推薦:任何輔助場景 | 中低風險 建議:動態監督 | 中風險 需法律與責任框架 |
實務建議
- 先評估能力等級:不要問「這模型強不強?」。問「在 100 次任務中,它有幾次會犯下不可逆的錯誤?」
- 再決定自主度:不要問「我們能不能自動化?」。問「如果它錯了,誰來承擔成本?這個成本我們付得起嗎?」
- 匹配原則:依錯誤成本、可逆性、監控能力決定,不把 L3 當硬性門檻。如果能力是 L1,請將自主度限制在 L2。如果需要 L4 自主度,請確保能力至少達到 L3,並建立強大的回滾機制。
市場訊號與未來展望
目前的 SOTA 模型,仍處於 L1 Performance 的階段。在這篇論文的分類下,現有模型更接近 Emerging AGI,而非 Competent AGI。若依本文採用的能力與自主度定義,AGI 已達成的說法仍需更多共同基準。
隨著模型能力的提升,我們預期會看到:
- L2 Performance 的普及:模型將能穩定處理大多數認知任務。
- Expert-level performance 的垂直試點:在金融、醫療等領域,出現「專家級」的自主輔助系統。
- L3-L4 Autonomy 的流程試點:在特定工作流中,出現「專家級」的自主輔助系統。
- L4 Autonomy 的爭議:關於「AI 代理人」的法律責任與倫理框架,將成為主要討論焦點。
L3 到 L4 的跨越,目前仍缺乏足夠的歷史數據。等 N 年回頭看,我們可能會發現現在的框架過於樂觀。
選擇在正確的格子裡部署 AI,而不是在模糊的標題下冒險。
你明天的決策檢查點
在按下部署鍵之前,不妨把這三個問題攤在桌上:
- 錯誤成本是多少? 是重新輸入表格,還是資金流失?
- 誰負責復原與成本承擔? 如果它錯了,是你來修,還是系統自動修復?
- 依賴什麼? 我們是依賴它的「能力」,還是依賴我們的「監控」?
答案不同,你的策略就不同。
市場訊號尚未明朗,但風險邊界可以現在就畫好。你明天的十分鐘,打算花在『畫邊界』,還是『處理例外成本』?
Sources
- The Levels of AGI Framework — 定義 AGI 能力、廣度與部署自主性討論的原始論文