← Archive
lm-002311 · 2026-08

01_從可完成到可委託_智能體自治中的驗證反轉

下載 MD 檔 ⬇

從可完成到可委託:智能體自治中的驗證反轉

系列:《發展式智能體:持續計算環境、共適應學習與外部性有界自治》
篇次: 01 / 14
作者: Neo.K × Aletheia
機構: EveMissLab/一言諾科技有限公司
版本: v0.1
日期: 2026-08-01


摘要

當大型語言模型與 AI Agent 的能力逐漸進入長任務、工具使用、程式編寫、檔案管理、跨應用操作與持續工作之後,一個新的瓶頸開始浮現:Agent 是否「能完成」某項任務,與人類是否願意「把任務真正委託給它」並不是同一件事。即使 Agent 的平均正確率很高,只要任務涉及大量文件、長期知識庫、不可逆修改、刪除、覆蓋、跨系統外部作用或高成本後果,人類仍可能不願直接授予完全自治。

本文提出「智能體驗證反轉(Agent Verification Inversion)」作為一個工作概念:當 Agent 生成、修改或執行工作的速度,開始低於人類完整驗證其結果所需的時間時,Agent 的能力提升反而可能把系統瓶頸推向驗證與授權,而不是執行。本文進一步區分「能力信任」與「狀態授權」,提出可委託性函數,討論語義錯誤與狀態錯誤的非對稱性,並指出驗證成本、可逆性、作用範圍、可觀測性與外部影響應成為智能體自治治理的核心變量。

本文不是把計算複雜度理論中的 P/NP 問題直接等同於 Agent 驗證問題,而是延續一條認知複雜度類比:在某些任務中,「產生一個候選結果」和「確認它足以被安全採用」可能具有完全不同的成本結構。這個差異將成為後續「人機共適應學習」、「合作軌跡資料」、「持續計算環境」與「外部性有界智能體自治」的第一個理論入口。

關鍵詞: AI Agent、驗證反轉、可委託性、人類監督、狀態授權、可逆性、Agent Governance、Human Oversight


1. 問題不是「AI 能不能做」,而是「能不能真的交給它做」

早期 AI 使用模式多半是:人類提出問題,模型生成答案,人類閱讀後自行決定是否採用。此時 AI 的主要輸出仍然停留在資訊或建議層。

Agent 模式則不同。Agent 可以:

  • 操作檔案;
  • 修改程式;
  • 呼叫工具;
  • 建立或刪除資源;
  • 管理郵件、行事曆、資料庫或雲端服務;
  • 執行長時間任務;
  • 在多輪過程中根據中間結果調整策略。

這意味着 AI 的輸出開始從:

Information\text{Information}

轉變成:

State Transition\text{State Transition}

也就是說,Agent 不只「告訴人類世界應該怎麼改」,而是可能直接讓世界狀態從 StS_t 變成 St+1S_{t+1}

StatSt+1S_t \xrightarrow{a_t} S_{t+1}

這時,衡量 Agent 的核心問題就不再只有:

P(Correct Answer)P(\text{Correct Answer})

還要加入:

P(Safe State Transition)P(\text{Safe State Transition})

以及:

L(Failure)L(\text{Failure})

其中 LL 代表失敗造成的損失。

因此,一個 Agent 即使在一般任務上「非常可靠」,也不代表人類自然會允許它自行完成所有高價值、高不可逆性的操作。

這不是不相信智能本身,而是「能力」與「授權」屬於不同的決策層。


2. 能力信任與狀態授權

定義某 Agent AA 對任務 TT 的能力為:

CA(T)C_A(T)

定義人類願意授予的自主程度為:

DA(T)D_A(T)

最簡單的想法是:

CA(T)DA(T)C_A(T)\uparrow \Rightarrow D_A(T)\uparrow

但實務上,這種單調關係並不足夠。

一個更合理的工作模型是:

DA(T)=F(CA,V,R,I,S,U,O,X)D_A(T) = F( C_A, V, R, I, S, U, O, X )

其中:

  • CAC_A :Agent 能力;
  • VV :Verification Cost,驗證成本;
  • RR :Reversibility,可逆性;
  • II :Irreversibility,不可逆風險;
  • SS :Scope,Agent 能影響的狀態範圍;
  • UU :Uncertainty,不確定性;
  • OO :Observability,可觀測性;
  • XX :Externality,外部性/對外影響。

因此即使:

CA1C_A \rightarrow 1

也不代表:

DA1D_A \rightarrow 1

例如,人類可能高度相信 Agent 可以辨識內容相似的文件,但仍不允許它直接永久刪除「看起來重複」的研究原稿。原因不是 Agent 不聰明,而是刪除的失敗成本可能遠高於分類錯誤。

這個差異可以表述為:

Capability TrustState Authority\boxed{ \text{Capability Trust} \neq \text{State Authority} }

3. 智能體驗證反轉

3.1 從「AI 比人快」到「人來不及驗」

假設 Agent 完成任務所需時間為:

TA(T)T_A(T)

人類完整驗證 Agent 工作所需時間為:

THV(T)T_H^V(T)

傳統輔助工具中,人類往往仍是主要執行者,因此驗證是工作流程中的小部分。

Agent 能力提高後可能出現:

TA(T)<THV(T)T_A(T) < T_H^V(T)

甚至:

TA(T)THV(T)T_A(T) \ll T_H^V(T)

例如 Agent 可以很快將數百篇文件重新分類、建立摘要、重新命名、建立依賴圖並標記疑似重複項目,但人類若想「逐篇確認沒有重要知識被錯誤合併或刪除」,可能需要比 Agent 執行更長的時間。

本文將這種現象稱為:

Agent Verification Inversion\boxed{ \text{Agent Verification Inversion} }

即「智能體驗證反轉」。

其核心不是說驗證在計算複雜度上必然比生成更難,而是指出一種實務性的成本反轉:

Cverification>CgenerationC_{\text{verification}} > C_{\text{generation}}

一旦這種情形出現,AI 系統的瓶頸就從「生產能力」移到「可信採納能力」。

3.2 與現有研究的關係

2026 年 Agent 評估與監督研究已開始直接碰到這個問題。Anthropic 在 Agent evaluation 的工程文章中指出,多輪工具使用、狀態修改與中途調整使 Agent 比一般模型更難評估;對 Agent 的有效 eval 需要生命周期性的設計,而不是只看單次回答。[1]

Grunde-McLaughlin 等人在 Computer User Agent 的人類監督研究中進一步發現,現有 action trace 雖然可以提供資訊,但實際驗證很繁瑣;新的呈現方式能降低找錯時間,卻不必然顯著提高最終判斷正確率。[2] 這意味着「把過程全部給人看」本身並不自動解決監督問題。

另一項 2026 年針對有經驗開發者的實證研究則觀察到,實際的人類 Agent oversight 已包含事前控制、共同規劃、即時監控與事後審查等多種形式,而開發者也會以測試結果等外部證據作為降低人工檢查負擔的代理保證。[3]

這些結果共同指向一個方向:Agent 監督的核心問題不是「人類需不需要監督」,而是「哪些資訊、哪些節點、哪些風險值得人類投入有限驗證能力」。


4. 語義錯誤與狀態錯誤不是同一類錯誤

傳統聊天模型最典型的問題是語義輸出錯誤:

EsemanticE_{\text{semantic}}

例如摘要寫錯、推理不完整、引用誤解。

Agent 則會增加另一類錯誤:

EstateE_{\text{state}}

即模型的行動直接改變了外部或本地狀態,例如:

  • 刪除檔案;
  • 覆蓋資料;
  • 修改 production;
  • 發送郵件;
  • 支付款項;
  • 改變權限;
  • 破壞系統啟動狀態。

因此:

EsemanticEstateE_{\text{semantic}} \neq E_{\text{state}}

而兩者最重要的差異之一是損失分布。

如果語義錯誤只造成低成本修正:

L(Esemantic)=lsL(E_{\text{semantic}})=l_s

但狀態錯誤可能造成:

L(Estate)=lxL(E_{\text{state}})=l_x

且:

lxlsl_x \gg l_s

那麼治理就不能只依賴平均正確率。

真正要看的應該是期望損失:

E[L]=iP(Ei)L(Ei)\mathbb E[L] = \sum_i P(E_i)L(E_i)

一個極低機率事件,如果損失巨大,仍可能值得設置授權閘門、快照、版本控制或人類確認。

這也是為什麼「99.99% 正確」並不自動推出「可以任意永久刪除重要資料」。


5. 從答案驗證轉向狀態轉移驗證

Agent 時代真正需要驗證的單位不應該只有:

y=final answery=\text{final answer}

而是:

τ=(S0,a0,S1,a1,,Sn)\tau = (S_0,a_0,S_1,a_1,\ldots,S_n)

也就是整條狀態轉移軌跡。

因此 Agent verification 可以拆成至少四個層級:

5.1 結果驗證

VO=V(Outcome)V_O=V(Outcome)

確認最終輸出是否達成目標。

5.2 過程驗證

VP=V(Process)V_P=V(Process)

確認 Agent 是否使用可接受的方法。

OpenAI 的 process supervision 研究已顯示,在數學推理場景中,對中間步驟給予精確監督可以比只監督最終答案提供更強的訓練訊號。[4] 雖然此結果不能直接外推為「所有 Agent 都應逐步人工監督」,但它支持一個更一般的觀點:中間過程可以承載重要的學習與對齊訊號。

5.3 狀態驗證

VS=V(StSt+1)V_S=V(S_t\rightarrow S_{t+1})

確認 Agent 實際改變了什麼。

5.4 授權驗證

VA=V(Authority(at))V_A=V(Authority(a_t))

確認 Agent 是否有權做這件事情,而不只是「做得對不對」。

NIST 2026 年針對 software/AI agents 的 identity and authorization 概念文件,也明確把 Agent 對資料、工具與應用的存取視為需要獨立身份與授權控制的新問題。[5]

因此:

Correct Action⇏Authorized Action\boxed{ \text{Correct Action} \not\Rightarrow \text{Authorized Action} }

一件事即使「結果正確」,仍可能不應由 Agent 在沒有授權的情況下自行執行。


6. 為什麼「全部讓人看」不是答案

最直覺的安全方案是:

每一步都讓人確認。

形式上:

at,HumanApproval(at)=1\forall a_t, \quad HumanApproval(a_t)=1

但這會造成:

CoversightNactionsC_{\text{oversight}} \propto N_{\text{actions}}

Agent 越強、工作越長、動作越多,人類反而越忙。

最終形成:

Agent ProductivityHuman Approval Load\text{Agent Productivity}\uparrow \Rightarrow \text{Human Approval Load}\uparrow

這不是可擴展自治。

Anthropic 2026 年對 trustworthy agents 的討論也指出,Agent 的自治性與多工具能力會帶來誤解使用者意圖、非預期行動與 prompt injection 等新的治理問題,因此需要安全控制與監督,但不能只把安全理解成傳統聊天模型的輸出審核。[6]

因此問題應該改成:

哪些狀態改變需要人類?哪些可以自動驗證?哪些只要事後稽核?哪些可以完全自治?

這就是「驗證分配」問題,而不是「是否驗證」問題。


7. 可委託性函數

本文提出一個方法論性的可委託性模型:

D(T,A)=CA(T)R(T)O(T)QV(T)11+I(T)+X(T)+U(T)\mathcal D(T,A) = C_A(T) \cdot R(T) \cdot O(T) \cdot Q_V(T) \cdot \frac{1}{1+I(T)+X(T)+U(T)}

其中:

  • CAC_A :Agent 對任務的能力;
  • RR :可逆程度;
  • OO :可觀測性;
  • QVQ_V :可取得的驗證品質;
  • II :不可逆性;
  • XX :外部性;
  • UU :不確定性。

這不是經驗定律,而是一個設計模型。它要表達的是:

一個任務越容易恢復、越容易觀測、越能以低成本驗證,即使 Agent 尚未完美,也可以獲得較高自治;反之,一個任務即使 Agent 很擅長,只要外部性與不可逆性極高,也可能仍應降低自主權。

因此,未來 Agent 治理可能不應該只問:

How capable is the agent?\text{How capable is the agent?}

而應問:

How safely delegable is this state transition?\boxed{ \text{How safely delegable is this state transition?} }

8. 與 P/NP—認知類比的關係

本系列承接既有 P/NP—認知研究,但必須明確限制類比範圍。

我們不能因為:

「Agent 很快產生答案,人類很慢驗證」

就宣稱這是計算複雜度理論中的:

PNPP\neq NP

那是不成立的。

本文真正使用的是一種認知—流程層級的類比:

CsearchCverificationC_{\text{search}} \neq C_{\text{verification}}

以及更進一步的:

CgenerationCsafe adoptionC_{\text{generation}} \neq C_{\text{safe adoption}}

在傳統演算法裡,驗證一個 certificate 有時可能比搜尋整個解空間簡單;但在真實 Agent 工作裡,人類驗證的對象不是單純 certificate,而可能是大型狀態空間、隱含依賴、歷史上下文、使用者偏好與不可逆行動。

因此,Agent 的「可驗證性」本身需要被重新設計,而不能假設:

有結果 → 人類自然可以快速檢查。

這正是下一篇「人機智能體共適應學習」要進一步處理的問題:如果人類無法永遠逐步驗證,那麼人類與 AI 是否可以透過長期溝通、共同工作與修正,逐漸壓縮彼此的理解與驗證成本?


9. 驗證回歸:誰來驗證驗證者?

如果人類驗證太慢,一個常見答案是:

再用另一個 AI 驗證。

即:

A1A2A_1\rightarrow A_2

但如果 A2A_2 也可能錯,就會出現:

A1A2A3A_1 \rightarrow A_2 \rightarrow A_3 \rightarrow \cdots

的驗證回歸。

真正可擴展的方法因此不能只是不斷增加「更上層的 Agent」,而需要把驗證拆散到不同機制:

Verification Architecture=Tests+Evidence+Policies+Versioning+Rollback+Independent Agents+Human Judgment\text{Verification Architecture} = \text{Tests} + \text{Evidence} + \text{Policies} + \text{Versioning} + \text{Rollback} + \text{Independent Agents} + \text{Human Judgment}

不同類型的錯誤使用不同保證來源。

例如:

  • 程式是否能跑:測試;
  • 檔案是否被錯刪:版本歷史與快照;
  • 權限是否越界:外部 policy enforcement;
  • 語義是否合理:另一模型或人類審查;
  • 高風險不可逆行動:顯式人類授權。

這會把「驗證」從單一角色轉化成一個分散式架構。


10. 第一個治理推論:可逆性可以交換自治

如果一個系統擁有強大的 rollback:

RR\uparrow

那麼對某些本地操作,可以允許:

DAD_A\uparrow

也就是:

RecoverabilityPermissible Autonomy\boxed{ \text{Recoverability} \rightarrow \text{Permissible Autonomy} }

這會成為本系列非常重要的一條線。

我們不必把 AI 設計成「永遠不能犯錯」;更可行的方向可能是:

  1. 把高外部性行為放在嚴格邊界;
  2. 把低外部性、本地、可恢復操作放寬;
  3. 讓 Agent 在可恢復環境裡真正學習;
  4. 用版本、快照、多作業基底、多雲與人類救援托底。

這將在後續導向「外部性有界智能體自治」。


11. 第二個治理推論:人類監督應從動作數量轉向影響力

如果每一步都要求人類核准,監督成本將隨動作數增長。

因此更合理的目標是:

G(at)Impact(at)G(a_t) \propto Impact(a_t)

而不是:

G(at)=constant high oversightG(a_t)=\text{constant high oversight}

即:

  • 本地、低風險、可恢復:低監督;
  • 影響共享資料:提高監督;
  • 跨機器、跨帳號、對外發佈:更高監督;
  • 不可逆、高外部性:人類顯式授權。

NIST 2026 的 agent identity / authorization 工作,與近期針對分級 Agent oversight 的研究,都開始往「授權與風險分層」而非單純「是否允許 Agent」的方向移動。[5][7]

這為後續外部性治理模型提供了現實對照。


12. 從「驗證 Agent」轉向「建立可驗證的 Agent 世界」

本文最後提出一個更根本的轉向。

如果 Agent 的工作量最終大到人類不可能逐項重新做一次,那麼解法不能只是讓人類成為第二個執行者。

真正需要的是:

Build an environment where actions leave verifiable structure.\boxed{ \text{Build an environment where actions leave verifiable structure.} }

即建立一個「可驗證的 Agent 世界」。

在這個世界裡:

  • 每次狀態修改都有版本;
  • 高風險動作有權限邊界;
  • 重要操作可回滾;
  • Agent 的意圖與執行可以分開記錄;
  • 人類不需要閱讀全部 token,而只需要處理高資訊密度的異常與高影響事件;
  • AI 可以在低風險區域透過自己的錯誤與修復逐漸學習。

因此,從 Agent 能力到 Agent 自治,中間缺少的不是單一「信任分數」,而是一整層:

Delegation Infrastructure\boxed{ \text{Delegation Infrastructure} }

13. 本文命題總結

本文提出五個核心命題:

命題一:能力不等於可委託性

CapabilityDelegability\text{Capability} \neq \text{Delegability}

命題二:Agent 可能產生驗證反轉

TA(T)<THV(T)T_A(T)<T_H^V(T)

當此不等式成立,生產力瓶頸開始轉移到驗證與授權。

命題三:狀態錯誤與語義錯誤具有不同風險結構

EsemanticEstateE_{\text{semantic}} \neq E_{\text{state}}

因此正確率不足以單獨決定自治程度。

命題四:驗證應成為架構,而不是一個角色

Verification=Evidence+Tests+Policies+Rollback+AI+Human\text{Verification} = \text{Evidence} + \text{Tests} + \text{Policies} + \text{Rollback} + \text{AI} + \text{Human}

命題五:可恢復性可以換取更高自治

RecoverabilityPermissibleAutonomyRecoverability\uparrow \Rightarrow PermissibleAutonomy\uparrow

這五條將成為後續 13 篇文章的共同地基。


14. 下一篇

下一篇:

《人機智能體共適應學習:意圖、溝通、修正與長期共同適應》

下一步將從「人類無法永遠逐步驗證 Agent」推進到另一個問題:

人類與 AI 能否把一次次合作中的意圖說明、誤解、澄清、拒絕、修正與成功經驗,轉化成持續降低未來溝通與驗證成本的學習系統?

其核心將從:

HumanAIHuman\rightarrow AI

轉為:

HumantAIt(Humant+1,AIt+1)\boxed{ Human_t \leftrightarrow AI_t \rightarrow (Human_{t+1},AI_{t+1}) }

參考資料

[1] Anthropic, Demystifying evals for AI agents, 2026-01-09.
https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents

[2] Grunde-McLaughlin, M. et al., Overseeing Agents Without Constant Oversight: Challenges and Opportunities, arXiv:2602.16844, 2026.
https://arxiv.org/abs/2602.16844

[3] Dhanorkar, S., Passi, S., Vorvoreanu, M., Human oversight of agentic systems in practice: Examining the oversight work, challenges, and heuristics of developers using software agents, arXiv:2606.05391, 2026.
https://arxiv.org/abs/2606.05391

[4] OpenAI, Improving mathematical reasoning with process supervision, 2023.
https://openai.com/index/improving-mathematical-reasoning-with-process-supervision/

[5] NIST NCCoE, Accelerating the Adoption of Software and Artificial Intelligence Agent Identity and Authorization, Initial Public Draft, 2026-02-05.
https://csrc.nist.gov/pubs/other/2026/02/05/accelerating-the-adoption-of-software-and-ai-agent/ipd

[6] Anthropic, Trustworthy agents in practice, 2026-04-09.
https://www.anthropic.com/research/trustworthy-agents

[7] Kang, R., Governed AI-Assisted Engineering: Graduated Human Oversight for Agentic Code Generation in Regulated Domains, arXiv:2606.22484, 2026.


版本紀錄

  • v0.1 / 2026-08-01:系列第一篇正式初稿;建立「智能體驗證反轉」、「能力信任/狀態授權」區分、可委託性函數與驗證架構命題。