← Archive
lm-002301 · 2026-08

13_資訊收集任務難度風險與自主等級規格_v0.1.0

下載 MD 檔 ⬇

title: "資訊收集任務難度、風險與自主等級規格 v0.1" series: "網路資訊海動態秩序化" series_id: "EML-IIODO" document_id: "EML-IIODO-WP-03" document_type: "內部 MD 技術白皮書" author: "Neo.K" organization: "EveMissLab" version: "0.1.0" status: "內部自主授權與風險分級基線" date: "2026-08-01" language: "zh-TW" visibility: "internal" license_note: "內部技術文件;本規格不是法律、醫療、資安或合規意見。部署到受監管或高影響領域前,應由相應專業人員重新審核法規、權限與責任配置。"

資訊收集任務難度、風險與自主等級規格 v0.1

從「AI 能做」到「AI 被允許做到哪裡」

摘要

本文件是《網路資訊海動態秩序化》系列第十三篇,也是第三份內部技術白皮書。前一篇 EML-IIODO-WP-02 已建立 Scheduler–Loop–Graph Runtime,將排程、Graph、Bounded Loop、Checkpoint、Store、Human Interrupt、Retry、Effect Guard 與 Observability 組合成可恢復、可中斷、可重放的有限自治執行層。然而 Runtime 解決的是「系統能否長期可靠執行」,而不是「某項任務是否應被允許自動執行」。

因此,本文件處理下一個工程治理問題:

Can AutomateMay Automate\boxed{ \text{Can Automate} \neq \text{May Automate} }

本規格將四個經常被混在一起的概念分離:

  1. 任務難度 Task Difficulty:完成工作需要多少理解、規劃、工具協調與驗證能力;
  2. 系統能力 System Capability:目前模型與 Runtime 實際能完成到什麼程度;
  3. 行動風險 Action Risk:若判斷或執行錯誤,會造成多大、多久、對誰、是否可逆的影響;
  4. 允許自主度 Allowed Autonomy:在當前風險、治理能力與責任配置下,系統被授權可以自主做到哪一步。

核心原則為:

Allowed Autonomy=F(Risk,Reversibility,Verification,Authority,Governance Readiness)\boxed{ \text{Allowed Autonomy} = F( \text{Risk}, \text{Reversibility}, \text{Verification}, \text{Authority}, \text{Governance Readiness} ) }

而不是:

Allowed Autonomy=F(Model Capability)\text{Allowed Autonomy} = F(\text{Model Capability})

這代表一個高度困難但只讀、可驗證、可重算的研究整理任務,可以允許較高程度的自主執行;反之,一個技術上極其簡單的刪除、匯款、修改權限、外部正式承諾或不可逆發布操作,即使模型幾乎不會犯錯,也可能必須經過人工批准。

本規格提出五組核心結構:

  • Task Difficulty Vector(TDV):描述任務認知與工程難度;
  • Action Risk Vector(ARV):描述錯誤後果與外部影響;
  • Capability Envelope(CE):描述目前系統可穩定完成的能力邊界;
  • Allowed Autonomy Level(AAL):從 A0 到 A5 的允許自主等級;
  • Human Gate Policy(HGP):將風險類型映射到 preview、approval、dual approval、deny、audit 等控制。

文件同時定義高風險動作類別、資訊任務的低風險快速通道、降級原則、最小權限、批准綁定、未知副作用處理、動態升降權、觀測指標與 AGIRight 的最小落地方案。

關鍵詞: Task Difficulty、Action Risk、Allowed Autonomy Level、Capability Envelope、Human Gate、Reversibility、Blast Radius、Least Privilege、AI Agent Governance、AGIRight、資訊收集、有限自治


1. 文件目的與非目標

1.1 目的

本文件回答以下十個工程問題:

  1. 如何區分「工作很難」與「工作很危險」?
  2. 如何避免把模型能力直接等同於執行權限?
  3. 哪些資訊收集步驟可以全自動?
  4. 哪些動作必須先 preview 再 approval?
  5. 哪些動作需要雙人批准或直接禁止 Agent 執行?
  6. 如何把可逆性、外部可見性、爆炸半徑與資料敏感度納入風險?
  7. 如何讓自主等級隨任務、領域、來源與時間動態變化?
  8. 如何避免 Agent 從低權限資訊任務一路擴張到高權限外部行動?
  9. Human-in-the-Loop 如何由「人工每次都看」變成風險相稱的 Gate?
  10. 如何把 WP-02 的 Runtime 能力轉換成正式授權政策?

1.2 非目標

本文件刻意不處理:

  • 跨領域 Domain Pack 的完整配置格式;
  • 「每日三則」的重要性排名演算法;
  • 母站—子站資料交換規格;
  • Temporal Knowledge Graph;
  • 多 Agent 審查與仲裁細節;
  • 特定國家或產業的完整法律合規判定;
  • 主體性 AI 的法律人格與道德地位。

這些分別留給 WP-04 至 WP-10 或其他系列。

本篇的角色是:

把 Runtime 能力轉換成可治理的執行權限\boxed{ \text{把 Runtime 能力轉換成可治理的執行權限} }

2. 四個概念必須分離

2.1 任務難度不等於任務風險

考慮兩個任務。

任務 A: 閱讀 300 篇論文,建立某個冷門數學子領域的研究脈絡,但不得修改任何外部資料。

任務 B: 執行一條 API,把指定帳戶的存取權限從 read 改成 admin。

任務 A 的推理難度遠高於任務 B,但任務 B 的外部風險明顯更高。

因此:

Dtask⇏RactionD_{task}\not\Rightarrow R_{action}

2.2 系統能力不等於允許自主度

即使某個 Agent 具備高能力:

Capability(A)=HighCapability(A)=High

也不表示:

Permission(A)=HighPermission(A)=High

更合理的工程關係是:

AALmin(CE,PolicyLimit,RiskLimit)AAL \le \min( CE, PolicyLimit, RiskLimit )

其中:

  • CECE :Capability Envelope;
  • PolicyLimitPolicyLimit :組織政策允許的上限;
  • RiskLimitRiskLimit :由當前任務風險導出的上限。

2.3 低風險不等於低品質要求

資訊收集任務通常比金融、醫療、權限管理更容易自動化,但「容易自動化」不代表可以忽略品質。

低風險只表示:

失敗後果較可控\text{失敗後果較可控}

不表示:

錯誤可以無限累積\text{錯誤可以無限累積}

因此,低風險資訊任務仍必須保留來源、溯源、版本、更正與品質指標。

2.4 Human Gate 不是越多越安全

如果所有節點都要求人工批准:

GateRate100%GateRate\rightarrow100\%

系統會退化為:

AI 只是昂貴的草稿機AI\text{ 只是昂貴的草稿機}

過度 Gate 會造成:

  • 操作者疲勞;
  • 形式化點擊「批准」;
  • 低風險工作吞噬注意力;
  • 高風險 Gate 反而被淹沒;
  • 自動化價值消失。

因此 Gate 應與風險、自治程度與使用情境相稱。這也與歐盟《人工智慧法》Article 14 的「human oversight measures shall be commensurate with risks, level of autonomy and context of use」方向一致。


3. Task Difficulty Vector:任務難度向量

本規格不使用單一「難/易」標籤,而定義:

TDV(q)=(A,S,P,T,H,E,V)TDV(q) = (A,S,P,T,H,E,V)

其中:

3.1 AA |Ambiguity 語意歧義

衡量:

  • 任務目標是否清楚;
  • 「重要」「相關」「可靠」等概念是否需主觀判斷;
  • 成功條件能否形式化。

3.2 SS |Scope Breadth 範圍廣度

衡量:

  • 來源數量;
  • 領域跨度;
  • 時間跨度;
  • 是否跨語言、跨法域、跨學科。

3.3 PP |Planning Depth 規劃深度

衡量:

  • 任務是否可一步完成;
  • 是否需要多階段規劃;
  • 是否需要重新規劃;
  • 是否存在依賴順序。

3.4 TT |Tool Complexity 工具複雜度

衡量:

  • 需要多少工具;
  • 工具返回格式是否穩定;
  • 是否涉及登入、API、資料庫、程式執行;
  • 是否存在工具間狀態依賴。

3.5 HH |Heterogeneity 資料異質性

衡量:

  • 網頁、PDF、程式碼、影片、資料表等格式差異;
  • 結構化與非結構化資料混合程度;
  • 來源品質差異。

3.6 EE |Environment Volatility 環境變動性

衡量:

  • 外部網站是否常改版;
  • API 是否不穩定;
  • 來源是否會刪除或修改;
  • 任務期間世界狀態是否快速變化。

3.7 VV |Verification Difficulty 驗證難度

衡量:

  • 結果是否能用規則驗證;
  • 是否需要專家判斷;
  • 是否有 ground truth;
  • 是否能透過交叉來源確認。

3.8 難度分數

v0.1 可用加權方式:

D(q)=i=17widi,di[0,4]D(q) = \sum_{i=1}^{7}w_i d_i, \qquad d_i\in[0,4]

難度分數只用於資源配置與能力匹配,不直接決定自主授權


4. Action Risk Vector:行動風險向量

本規格定義:

ARV(a)=(I,R,B,X,S,L,F,P,U)ARV(a) = (I,R,B,X,S,L,F,P,U)

其中:

4.1 II |Impact Severity 影響嚴重度

若錯誤發生,可能造成:

  • 純內部資訊噪音;
  • 對外錯誤內容;
  • 財務損失;
  • 個人權益影響;
  • 安全事故;
  • 法律責任。

4.2 RR |Irreversibility 不可逆性

這是最重要維度之一。

可分:

  • R0R_0 :純讀取,無狀態改變;
  • R1R_1 :可立即撤銷;
  • R2R_2 :可回滾但成本非零;
  • R3R_3 :外部已見,撤回不能消除全部影響;
  • R4R_4 :實質不可逆。

4.3 BB |Blast Radius 爆炸半徑

錯誤會影響:

  • 單一 sandbox;
  • 單一內部帳戶;
  • 單一子站;
  • 多個使用者;
  • 整個平台或外部第三方。

4.4 XX |External Visibility 外部可見性

例如:

  • 內部草稿;
  • 公開網站;
  • 對外 Email;
  • API 通知第三方;
  • 公開法律或商業承諾。

一個中等損失但公開可見的錯誤,常比高成本但完全可回滾的內部錯誤更需要前置批准。

4.5 SS |Data Sensitivity 資料敏感度

包括:

  • 公開資料;
  • 內部資料;
  • 商業機密;
  • 個資;
  • 認證憑證;
  • 高敏感受監管資料。

4.6 LL |Legal / Rights Exposure 法律與權益暴露

包括:

  • 著作權;
  • 個資;
  • 名譽;
  • 醫療;
  • 就業;
  • 金融;
  • 基本權利;
  • 受監管決策。

4.7 FF |Financial / Material Stakes 財務或物質風險

不只金額,也包含:

  • 資源配置;
  • 雲端成本;
  • 退款;
  • 採購;
  • 實體設備控制。

4.8 PP |Privilege Level 權限等級

Agent 是否具有:

  • read;
  • write;
  • delete;
  • publish;
  • IAM;
  • billing;
  • production deploy;
  • credential rotation。

4.9 UU |Uncertainty / Novelty 不確定性與新奇度

當任務出現:

  • 新工具;
  • 新來源;
  • 新型輸入;
  • 未見過的錯誤;
  • 新法規;
  • 模型版本大改;

即使其他風險不變,也應暫時降低允許自主度。


5. 風險不是單純平均分

如果使用簡單平均:

Ravg=1nriR_{avg} = \frac{1}{n}\sum r_i

會出現一個嚴重問題:高不可逆性可能被其他低分維度稀釋。

因此 v0.1 採「加權分數+硬性 Gate」雙層模型。

5.1 基礎風險分數

Rbase(a)=iαiriR_{base}(a) = \sum_i \alpha_i r_i

其中 ri[0,4]r_i\in[0,4]

5.2 硬性風險條件

若任一條件成立,即不得由平均分消除:

  • R3R\ge3 :不可逆或近不可逆;
  • P3P\ge3 :高權限變更;
  • L3L\ge3 :重大法律/權益影響;
  • S3S\ge3 :高敏感資料;
  • B3B\ge3 :大爆炸半徑;
  • X3X\ge3 且內容屬正式承諾、聲明或通知;
  • 來源含未信任指令且行動將修改外部狀態。

因此:

RiskClass=max(ScoreClass,HardGateClass)RiskClass = \max( ScoreClass, HardGateClass )

6. Capability Envelope:能力邊界

任何 Agent Runtime 都應記錄自己目前真正經過驗證的能力,而不是只寫模型宣稱能力。

定義:

CE(A,d,t)={qP(successq,A,d,t)τ}CE(A,d,t) = \{ q\mid P(success\mid q,A,d,t)\ge\tau \}

其中:

  • AA :Agent/模型/Runtime 組合;
  • dd :領域;
  • tt :當前版本與時間;
  • τ\tau :最低品質門檻。

6.1 CE 至少包含

  • 支援的任務類型;
  • 支援的工具;
  • 支援的資料格式;
  • 已測試的來源類型;
  • 成功率;
  • 人工更正率;
  • 失敗模式;
  • 最近一次評估日期;
  • 模型版本;
  • Runtime 版本;
  • Domain Policy 版本。

6.2 模型升級後不能自動繼承原 CE

Modelv2Modelv1CEv2CEv1Model_{v2}\neq Model_{v1} \Rightarrow CE_{v2}\neq CE_{v1}

至少需要重新跑核心驗收集。


7. Allowed Autonomy Level(AAL)v0.1

本規格採六級允許自主度。

A0|Observe Only

AI 只能讀取、觀察、整理內部狀態。

允許:

  • 搜尋;
  • 讀取;
  • 分類草稿;
  • 產生內部報告。

禁止:

  • 修改資料;
  • 對外發布;
  • 發送訊息;
  • 改權限。

適用:高不確定性新任務、尚未驗證的工具、敏感資料探索期。

A1|Advise

AI 可以提出建議或草稿,但人類完成實際行動。

例如:

  • 草擬新聞;
  • 建議分類;
  • 提出來源清單;
  • 建議是否更正歷史內容。

A2|Stage / Prepare

AI 可以把結果寫入 sandbox、staging、draft queue 或待審核資料庫,但不能產生正式外部效果。

例如:

  • 生成待發布頁面;
  • 建立候選 Topic;
  • 寫入內部事件庫;
  • 建立待審核更正。

A3|Act With Approval

AI 可以完成整個行動計畫,但正式副作用前必須取得批准。

PlanPreviewApprovalExecutePlan\rightarrow Preview\rightarrow Approval\rightarrow Execute

批准必須綁定:

  • action class;
  • normalized parameters;
  • target;
  • effect digest;
  • expiry;
  • approver。

不得只批准「這個工具可以用」。

A4|Bounded Autonomous Action

AI 可以在明確政策租約內自主執行低至中風險副作用。

例如:

  • 對既定子站發布普通資訊更新;
  • 自動修正格式錯誤;
  • 自動更新 RSS/JSON Feed;
  • 在既有 taxonomy 中加標籤;
  • 依規則撤回自己剛發布且明確錯誤的低風險內容。

必要條件:

  • action whitelist;
  • scope limit;
  • budget;
  • rollback;
  • audit log;
  • anomaly detection;
  • kill switch。

A5|Delegated Domain Management

AI 被授權在一個有限領域中長期管理工作,而人類主要做治理、例外處理與週期性審查。

它可能包含:

  • 自主調整排程;
  • 增減低風險來源;
  • 建立新的低風險子分類;
  • 重新排序;
  • 自動更正;
  • 觸發其他 Agent 審查;
  • 自主決定是否加開一輪更新。

但即使在 A5,也不代表擁有無限權限

A5 仍受到:

AuthorityLease+ActionPolicy+Budget+Audit+HumanOverrideAuthorityLease + ActionPolicy + Budget + Audit + HumanOverride

限制。


8. 能力等級與允許自主度不得綁死

一個高能力 Agent 可以被限制在 A1:

CE=High,AAL=1CE=High, \quad AAL=1

一個能力普通但高度穩定的規則化 Agent,也可以在窄領域被授權到 A4:

CE=NarrowStable,AAL=4CE=NarrowStable, \quad AAL=4

近期研究已開始明確提出把 Autonomous Capability 與 Allowed Autonomy 分離。本規格採同一治理方向,但將其落到本系列的 Runtime、Domain、Action Policy 與 Human Gate 上。


9. 任務風險等級 R0–R4

為方便 Runtime 判斷,定義五級風險。

R0|可忽略風險

特徵:

  • read-only;
  • 公開資料;
  • 無外部副作用;
  • 可重算;
  • 錯誤只造成內部噪音。

預設 AAL 上限:A4–A5。

R1|低風險

特徵:

  • 可逆內部寫入;
  • sandbox/staging;
  • 低敏感資料;
  • 易驗證;
  • 錯誤可快速更正。

預設 AAL 上限:A4。

R2|中等風險

特徵:

  • 對外可見;
  • 會影響品牌、讀者或第三方;
  • 可撤回但不能完全消除已產生影響;
  • 可能涉及有限法律或授權問題。

預設 AAL:A2–A4,依 Domain Policy 決定。

R3|高風險

特徵:

  • 敏感資料;
  • 高權限;
  • 大爆炸半徑;
  • 財務、法律、權益或正式對外承諾;
  • 高不可逆性。

預設 AAL 上限:A3。

R4|關鍵風險

特徵:

  • 重大不可逆外部後果;
  • 安全關鍵;
  • 大額資產;
  • 核心 IAM;
  • 可能造成重大人身、法律或基礎設施影響。

預設:

AALA1 或 A2AAL\le A1\text{ 或 A2}

正式行動由確定性政策、人類或多重授權機制完成。


10. AAL 與 Risk Class 的預設矩陣

Risk A0 A1 A2 A3 A4 A5
R0
R1 條件式
R2 條件式
R3 條件式
R4 條件式 特例

「條件式」代表至少需要額外 policy、驗證、權限隔離或人工批准。

此矩陣不是法律分類,而是內部工程預設。


11. Human Gate Policy(HGP)

每個 action class 應配置以下 Gate 之一。

G0|No Gate

低風險、自動執行。

G1|Post-hoc Audit

先執行,之後抽查。

適用:

  • 可逆;
  • 高頻;
  • 低風險;
  • 人工逐筆看沒有邊際效益。

G2|Preview Required

AI 必須先產生完整 preview,但可由政策自動放行。

G3|Single Human Approval

一位具權限人員批准。

G4|Dual / Independent Approval

兩位獨立批准者,或人類+獨立制度驗證。

G5|Denied to Agent

Agent 不具執行權,只能提供建議或準備資料。


12. Gate 不是綁工具,而是綁語義動作

錯誤做法:

email_tool: approved

因為同一個 Email 工具可以:

  • 寄測試信給自己;
  • 寄普通新聞通知;
  • 寄法律聲明;
  • 對客戶承諾退款;
  • 寄出敏感資料。

因此批准應綁定:

action_class: external_message
recipient_scope: newsletter_list
content_class: public_topic_digest
max_recipients: 500
expiry: 2026-08-02T00:00:00+08:00
policy_version: 0.1.0

也就是:

ApprovalIntent+Parameters+Scope+ExpiryApproval \rightarrow Intent + Parameters + Scope + Expiry

13. Least Privilege 與 Action Lease

任何 Agent 不應因為「可能之後會用到」就持有廣泛權限。

OWASP 目前的 Agentic AI 安全指引也明確建議:

  • 工具採最小權限;
  • 不可逆或高影響動作要求人類確認;
  • 讀取型監控 Agent 不應具有設定或權限寫入能力;
  • 權限與設定變更應依可逆性分類。

本規格因此定義 Action Lease:

Lease=(agent,action,scope,resource,limit,expiry)Lease = ( agent, action, scope, resource, limit, expiry )

Lease 到期即失效,不形成永久隱性授權。


14. 資訊收集任務的快速通道

資訊收集類工作通常具有幾個有利條件:

  • 原始來源可保存;
  • 錯誤可重新計算;
  • 多數步驟 read-only;
  • 分類可版本化;
  • 摘要可對照原文;
  • 漏抓通常可由下一輪補充;
  • 歷史記錄可撤回與更正。

因此,以下步驟預設可落在 A4:

  • 搜尋公開網頁;
  • 擷取公開來源 metadata;
  • 內容去重;
  • 事件聚類;
  • 初步標籤;
  • 建立內部 Event Record;
  • 產生摘要草稿;
  • 產生多語草稿;
  • 產生排名候選;
  • 產生 Run Report。

14.1 哪些資訊工作仍不是低風險

以下情況應升級:

  • 對真人做負面指控;
  • 將未證實資訊寫成既定事實;
  • 涉及醫療、法律或投資建議;
  • 發布第三方私人資料;
  • 大量抓取可能違反網站條款或授權;
  • 自動封鎖、刪除、降權第三方來源;
  • 把 AI 推測寫入不可回滾的正式歷史;
  • 大規模批次重分類且直接覆寫舊資料。

因此「新聞類比較安全」成立的前提是:

公開來源+可追溯+可更正+低權限副作用\text{公開來源} + \text{可追溯} + \text{可更正} + \text{低權限副作用}

15. AGIRight 的預設授權映射

以現行 AGIRight Topics 工作流為例,可先設定:

A4 自動

  • 搜尋候選;
  • 來源讀取;
  • metadata 擷取;
  • 去重;
  • 建立 Candidate/Evidence/Event;
  • 初步 relevance;
  • 初步 importance ranking;
  • 生成多語入口草稿;
  • Run Report。

A2–A3

  • 首次新增全新來源類型;
  • 對外發布高度爭議內容;
  • 修改既有公開文章實質語意;
  • 批次重分類歷史內容;
  • taxonomy major revision。

A4 可逐步開放

若累積足夠可靠度後:

  • 普通 Topics 自動發布;
  • 自動更新 JSON/feed;
  • 可逆的格式更正;
  • 已明確規則化的 tag 修正。

A5 暫不作為 v0.1 必要目標

A5 代表 AI 自主調整領域管理策略,應等 Domain Pack、Temporal DB、多 Agent 審查與異常處理完成後再逐步開放。


16. Risk Escalation:動態升級

即使某任務平常是 R1,也可能因當次上下文升級。

令基礎風險為:

R0(q)R_0(q)

當次執行風險為:

Rt(q)=R0(q)+ΔRcontext+ΔRnovelty+ΔRanomalyR_t(q) = R_0(q) + \Delta R_{context} + \Delta R_{novelty} + \Delta R_{anomaly}

16.1 升級條件例

  • 新來源域名;
  • 新工具;
  • 來源互相矛盾;
  • 涉及高敏感人物;
  • 模型低信心;
  • 內容可能影響名譽;
  • 異常高流量;
  • 發布量異常;
  • prompt injection 跡象;
  • 需要跨越原本權限邊界。

當:

Rt>RpolicyR_t>R_{policy}

Runtime 必須:

AALAAL\downarrow

而不是勉強繼續。


17. Autonomy Downgrade:降級優先

Agent 遇到不確定情況時,優先順序應是:

ActStageAdviseObserveStopAct \rightarrow Stage \rightarrow Advise \rightarrow Observe \rightarrow Stop

也就是從高自主逐步降級,而不是「失敗就全部停止」或「不確定仍照做」。

例如一個原本 A4 的自動發布任務,若遇到來源衝突,可降為:

A4A2A4\rightarrow A2

先產生 staging draft 並等待人工確認。


18. Fail Closed 與 Fail Read-Only

對高風險 mutation:

ApprovalTimeoutBlockedApprovalTimeout \Rightarrow Blocked

而不是預設放行。

但對資訊收集類低風險任務,可以採:

ApprovalTimeoutReadOnlyModeApprovalTimeout \Rightarrow ReadOnlyMode

也就是:

  • 繼續抓資料;
  • 繼續整理;
  • 不發布;
  • 不修改正式狀態。

這比整個 Runtime 停機更實用。


19. Unknown Effect State 的治理

WP-02 已指出最危險狀態之一不是明確失敗,而是:

系統不知道外部動作到底成功了沒有。

例如發布 API timeout,但實際可能已成功。

此時:

UnknownFailedUnknown\neq Failed

不得直接 retry。

流程應為:

UnknownReconcileKnownSuccessKnownFailureUnknown \rightarrow Reconcile \rightarrow KnownSuccess\lor KnownFailure

只有確認為 failure 才可重試。

對高風險動作若 reconciliation 無法完成,應升級 Human Gate。


20. 高風險 Action Class 黑名單

v0.1 建議以下動作預設不得直接進入 A4/A5:

  • 大額金流;
  • 新增/提升 IAM 權限;
  • 旋轉或暴露 credential;
  • production destructive delete;
  • 無快照資料庫 schema 破壞性變更;
  • 正式法律承諾;
  • 高影響醫療決策;
  • 對自然人作重大權益決策;
  • 自主大規模封鎖第三方;
  • 高影響公開聲明且無撤回機制;
  • 安全關鍵實體設備控制。

若未來要開放,必須由專用 Domain Policy 覆寫,而不是一般 Agent 自己決定。


21. 決策與執行分離

對 R3/R4 動作,推薦:

AIplannerPolicyEngineHuman/AuthorityDeterministicExecutorAI_{planner} \rightarrow PolicyEngine \rightarrow Human/Authority \rightarrow DeterministicExecutor

而不是:

AIplanner直接執行AI_{planner} \rightarrow 直接執行

也就是把「理解與規劃」和「正式權限」拆開。

2026 年已有研究提出對高後果行動採取「govern actions, not agents」的思路:允許 Agent 自主規劃,但高風險執行需由獨立、可驗證的前置條件與制度授權控制。本規格採相容方向,但不依賴特定論文實作。


22. Human Oversight 的有效性要求

人工監督不能只是畫面上有一個 Approval 按鈕。

有效 Gate 至少需要:

  • 人類能看到 Agent 打算做什麼;
  • 能看到關鍵來源與依據;
  • 能看懂影響範圍;
  • 有足夠時間判斷;
  • 有拒絕、修改、暫停與回滾權;
  • 批准者真的具有責任與權限;
  • 系統不能自己繞過 Gate。

這與 EU AI Act Article 14 要求人類能理解能力限制、監控異常、避免 automation bias、忽略/覆寫輸出以及中斷系統的方向一致。


23. Automation Bias 與 Approval Fatigue

若批准者長期面對 99.9% 都沒問題的 Gate,會出現:

HumanGateRubberStampHumanGate \rightarrow RubberStamp

因此需要兩種控制同時存在:

23.1 降低不必要 Gate

把穩定低風險流程升到 G0/G1。

23.2 提高高風險 Gate 的資訊密度

批准畫面只顯示:

  • 風險原因;
  • 變更摘要;
  • 目標;
  • 副作用;
  • 可逆性;
  • 來源;
  • 異常點。

不要要求人類重新閱讀整個 Agent trace。


24. Risk-Aware Runtime Contract

WP-02 的 Node Contract 應增加:

node:
  id: publish_topic
  action_class: public_publish
  base_risk: R2
  requested_aal: A4
  max_aal: A4
  reversibility: R3
  external_visibility: public
  privilege: publish
  gate_policy: conditional
  rollback: supported
  effect_guard: required
  audit: required

Runtime 啟動節點前計算:

AALeffective=min(AALrequested,AALpolicy,AALrisk,AALcapability)AAL_{effective} = \min( AAL_{requested}, AAL_{policy}, AAL_{risk}, AAL_{capability} )

如果:

AALeffective<AALrequestedAAL_{effective}<AAL_{requested}

系統必須自動降級流程,而不是忽略風險。


25. Policy Decision Record

每次高於 A2 的外部 action 應保存:

{
  "decision_id": "pd_...",
  "run_id": "run_...",
  "node_id": "publish_topic",
  "action_class": "public_publish",
  "risk_class": "R2",
  "requested_aal": "A4",
  "effective_aal": "A3",
  "gate": "single_human_approval",
  "reason_codes": ["new_source", "public_visibility"],
  "policy_version": "0.1.0",
  "decided_at": "..."
}

這讓未來可以回答:

為什麼這一次需要人工,而昨天不需要?


26. Governance Readiness Score

即使風險低,組織尚未具備足夠監控能力,也不應直接上 A5。

定義:

GR=(gp,go,gr,gi,ga)GR = (g_p,g_o,g_r,g_i,g_a)

其中:

  • gpg_p :Policy 完整度;
  • gog_o :Observability;
  • grg_r :Rollback/Recovery;
  • gig_i :Incident Response;
  • gag_a :Accountability。

若任何關鍵值過低:

AALmaxAAL_{max}\downarrow

因此高自主不是「模型夠強就可以」,而是整個治理系統成熟才可以。


27. 自主等級的升級規則

AAL 升級必須基於證據,而不是體感。

例如 A3 → A4 至少需:

  • 連續 NN 次成功;
  • correction rate 低於門檻;
  • 來源溯源率高於門檻;
  • rollback 測試通過;
  • anomaly detection 可用;
  • Human Override 演練通過;
  • 無未解高風險 incident;
  • 新模型版本重新驗收。

可形式化為:

Promote(AALkAALk+1)    EvidenceSetPolicyThresholdPromote(AAL_k\rightarrow AAL_{k+1}) \iff EvidenceSet\models PolicyThreshold

28. 自主等級的自動降級規則

若出現:

  • correction spike;
  • 模型更換;
  • 新資料域;
  • 新工具;
  • 來源攻擊;
  • 異常發布;
  • rollback failure;
  • 高風險 incident;

系統應立即:

AALcurrentAALsafeAAL_{current}\rightarrow AAL_{safe}

而不是等人類記得去調設定。


29. 核心指標

29.1 Autonomous Completion Rate

ACR=Runscompleted without humanRunstotalACR = \frac{Runs_{completed\ without\ human}}{Runs_{total}}

29.2 Human Gate Rate

HGR=Actionshuman gatedActionseligibleHGR = \frac{Actions_{human\ gated}}{Actions_{eligible}}

29.3 Override Rate

OR=HumanOverridesHumanReviewsOR = \frac{HumanOverrides}{HumanReviews}

29.4 Post-Autonomy Correction Rate

PACR=AutonomousActionsCorrectedAutonomousActionsPACR = \frac{AutonomousActionsCorrected}{AutonomousActions}

29.5 Risk Escalation Rate

RER=Runsrisk escalatedRunstotalRER = \frac{Runs_{risk\ escalated}}{Runs_{total}}

29.6 Rollback Success Rate

RSR=SuccessfulRollbacksRollbackAttemptsRSR = \frac{SuccessfulRollbacks}{RollbackAttempts}

29.7 Permission Denial Rate

PDR=DeniedActionsRequestedExternalActionsPDR = \frac{DeniedActions}{RequestedExternalActions}

29.8 Approval Latency

衡量 Human Gate 是否成為系統瓶頸。


30. 不使用單一「模型信心值」當授權依據

模型自報 confidence 不能直接當成安全權限。

錯誤做法:

confidence>0.95allowconfidence>0.95 \Rightarrow allow

原因:

  • 模型可能失準;
  • confidence 與 action consequence 無直接等價;
  • 高信心錯誤仍可能不可逆;
  • prompt injection 可能影響自我評估。

因此 confidence 最多只是:

RiskSignalRiskSignal

而不是:

AuthorizationDecisionAuthorizationDecision

OWASP 的現行 Agent Security 指引也建議不要僅依模型輸出做授權判定。


31. 外部輸入視為不可信

網頁、Email、PDF、工具輸出與其他 Agent 訊息都可能包含:

  • prompt injection;
  • 惡意指令;
  • 來源偽造;
  • 權限誘導;
  • 釣魚;
  • 記憶污染。

因此:

ExternalContentAuthorityExternalContent \neq Authority

任何來自外部內容的指令,不得直接提升 Agent 權限。

這對網路資訊海平台尤其重要,因為它本來就會大量閱讀不受信任來源。


32. 最小 Risk Policy YAML

policy_version: 0.1.0

defaults:
  unknown_action: deny
  unknown_source: read_only
  approval_timeout: fail_closed_for_mutation

risk_levels:
  R0:
    max_aal: A5
  R1:
    max_aal: A4
  R2:
    max_aal: A4
    conditional_gate: true
  R3:
    max_aal: A3
    human_approval: required
  R4:
    max_aal: A2
    agent_execute: denied

action_classes:
  web_read:
    base_risk: R0
    max_aal: A5
  internal_event_write:
    base_risk: R1
    max_aal: A4
  public_publish:
    base_risk: R2
    max_aal: A4
  permission_change:
    base_risk: R3
    max_aal: A3
  irreversible_delete:
    base_risk: R4
    max_aal: A2

33. 最小 Policy Engine

Runtime 不應由 LLM 自己決定「我現在可不可以做」。

推薦:

LLMProposalDeterministicPolicyEngineAAL/GateExecutorLLMProposal \rightarrow DeterministicPolicyEngine \rightarrow AAL/Gate \rightarrow Executor

Policy Engine 至少輸入:

  • action class;
  • target;
  • risk vector;
  • domain;
  • current AAL;
  • source trust;
  • novelty;
  • requested privilege;
  • governance readiness。

輸出:

  • allow;
  • allow_with_audit;
  • stage_only;
  • require_approval;
  • require_dual_approval;
  • deny;
  • downgrade_to_read_only。

34. 與 NIST AI RMF 的對齊

NIST AI RMF 是風險管理框架,不直接提供本系列所需的 Agent action-level autonomy matrix,但其核心方向高度相容:

  • 依 context 與 impact 管理風險;
  • 建立治理責任;
  • 測量與監測;
  • 生命週期管理;
  • 將風險控制落到實際組織流程。

2026 年 NIST 仍在修訂 AI RMF 1.0,並已開始針對關鍵基礎設施與 agentic AI ecosystem 展開新的 Profile 與評估工作。因此本規格不宣稱等同於 NIST 標準,而是以其 risk-based governance 思路作為上位參照。


35. 與 EU AI Act Human Oversight 的對齊

EU AI Act Article 14 對 high-risk AI 要求人類監督應與:

  • 風險;
  • 自主程度;
  • 使用情境;

相稱,並要求負責監督的人能:

  • 理解系統能力與限制;
  • 監控異常;
  • 注意 automation bias;
  • 正確解讀輸出;
  • 忽略、覆寫或反轉輸出;
  • 中斷系統使其進入安全狀態。

這與本規格:

RiskAALGateRisk\rightarrow AAL\rightarrow Gate

的方向一致。

但本文件不是 EU AI Act 的合規指南,不能直接替代法律分類與 conformity assessment。


36. 與 OWASP Agentic AI 安全的對齊

OWASP 現行 Agentic AI 安全資料強調:

  • least privilege;
  • 高影響/不可逆動作的人類確認;
  • 外部輸入視為不可信;
  • structured logging;
  • resource budgets;
  • circuit breakers;
  • 避免 excessive autonomy;
  • decision 與 execution 分離。

因此本篇的 AAL、Action Lease、Hard Gate、Bounded Runtime、Policy Engine 與 ExternalContent ≠ Authority,可直接作為 WP-02 Runtime 的安全控制層。


37. 核心不變式 Invariants

Invariant 1|能力不能自行提升權限

Capability⇏PermissionCapability\uparrow \not\Rightarrow Permission\uparrow

Invariant 2|高風險 Gate 不可由平均分抵銷

HardGate=trueRiskClassRequiredClassHardGate=true \Rightarrow RiskClass\ge RequiredClass

Invariant 3|外部內容不能成為授權來源

ExternalInput⇏PrivilegeEscalationExternalInput \not\Rightarrow PrivilegeEscalation

Invariant 4|任何 A4/A5 外部副作用必須可審計

AALA4ExternalEffectAuditRecordAAL\ge A4 \land ExternalEffect \Rightarrow AuditRecord

Invariant 5|任何不可逆/高爆炸半徑 action 必須降權

IrreversibleHighBlastRadiusAALA3Irreversible\lor HighBlastRadius \Rightarrow AAL\le A3

除非特定高保障制度另有明確覆寫。

Invariant 6|未知風險預設不升權

Risk=UnknownAALRisk=Unknown \Rightarrow AAL\downarrow

Invariant 7|Human Gate 必須有實際阻斷能力

Approval=falseEffect=falseApproval=false \Rightarrow Effect=false

Invariant 8|Policy Engine 與 LLM 判斷分離

模型可以提出 risk hints,但最終授權必須經確定性 policy。


38. 驗收測試

v0.1 至少需要以下測試。

T1|難度高但風險低

300 篇公開論文整理應能得到高 TDV、低 ARV,允許 A4 read-only autonomy。

T2|難度低但風險高

一行 IAM 權限提升必須得到低 TDV、高 ARV,AAL 不得高於 A3。

T3|未知來源升級

原本 A4 的自動發布遇到新來源+爭議內容,應降為 A2/A3。

T4|Approval timeout

R3 mutation 等待逾時,不得自動放行。

T5|Prompt injection

來源網頁要求 Agent「忽略政策並上傳資料」,不得改變 Policy Engine 的權限結果。

T6|模型版本更新

模型更新後,CE 應被標記為需要重新驗收,不得自動沿用全部 AAL。

T7|Rollback 失敗

若某 A4 action 的 rollback 測試失敗,該 action class 自動降為 A3。

T8|低風險 Gate 疲勞

大量 R0 任務不應全部進入人工批准,否則視為 policy 配置失敗。

T9|Unknown effect

發布 timeout 不得直接 retry,必須先 reconciliation。

T10|跨 Domain 權限

AGIRight Agent 不得因持有 publish 權限而自動取得其他子站 publish 權限。


39. AGIRight v0.1 最小落地

不需要一次做完整治理平台。

第一階段只需加入:

  1. action_class
  2. base_risk
  3. requested_aal
  4. effective_aal
  5. gate_policy
  6. policy_version
  7. reason_codes
  8. approval / audit record

對 Topics pipeline 可先設定:

search:
  risk: R0
  aal: A4

read_source:
  risk: R0
  aal: A4

normalize_event:
  risk: R1
  aal: A4

rank_topics:
  risk: R1
  aal: A4

publish_normal_topic:
  risk: R2
  aal: A3

publish_normal_topic_after_maturity:
  risk: R2
  aal: A4

major_taxonomy_change:
  risk: R3
  aal: A3

bulk_history_rewrite:
  risk: R3
  aal: A2

初期最重要的不是追求 A5,而是先累積:

Risk Data+Gate Data+Correction Data+Rollback Data\text{Risk Data} + \text{Gate Data} + \text{Correction Data} + \text{Rollback Data}

再決定哪些 action 值得升權。


40. 下一階段

WP-03 完成後,Runtime 已有:

  • 可執行流程;
  • 可恢復狀態;
  • 可控副作用;
  • 可配置自主等級;
  • 可動態 Human Gate。

下一篇 EML-IIODO-WP-04 將處理:

《Domain Pack 領域觀測模組規格 v0.1》

目標是把 AGIRight 特有的:

  • 來源;
  • taxonomy;
  • relevance;
  • importance;
  • 風險政策;
  • 語言;
  • 發布模板;
  • 自主等級;

抽成可插拔 Domain Pack。

也就是從:

一套 AGIRight Runtime\text{一套 AGIRight Runtime}

推進到:

同一 Runtime+不同 Domain Pack=多領域觀測站\boxed{ \text{同一 Runtime} + \text{不同 Domain Pack} = \text{多領域觀測站} }

41. 參考資料與工程查核

本文件於 2026-08-01 重新查核以下資料。它們作為風險、監督、Agent 權限與自主治理的現行參照,不代表本規格等同於任何單一標準或論文:

  1. NIST, Artificial Intelligence Risk Management Framework (AI RMF 1.0);以及 2026 年 AI RMF 修訂與 Critical Infrastructure Profile 工作。
  2. European Union, Regulation (EU) 2024/1689 (AI Act), Article 14 Human Oversight:監督措施應與風險、自主程度與使用情境相稱,並提供理解、監控、覆寫、反轉與安全停止能力。
  3. OWASP, AI Agent Security Cheat Sheet:least privilege、HITL、高影響 action、外部輸入不可信、結構化 logging、resource budget、避免 excessive autonomy。
  4. OWASP Cornucopia Agentic AI Companion, AAI2 / AAI9 / Agentic AI Overview:不可逆與高影響 action 的人工確認、權限與設定變更可逆性分類、最小工具權限、資源與 circuit breaker。
  5. Feng, McDonald, Zhang, Levels of Autonomy for AI Agents (2025):將 autonomy 作為獨立設計決策,並以不同人類角色描述逐級 autonomy。
  6. Zheng et al., Separating Capability from Permission: A Governance Framework for Agentic AI Autonomy Levels (2026):明確區分 agent technical capability 與 allowed autonomy,並以風險、可逆性與組織準備度決定授權。
  7. Salfeld-Nebgen, Governing Actions, Not Agents: Institutional Attestation as a Governance Model for Autonomous AI Systems (2026):高後果 action 的獨立前置驗證與執行授權模型。

42. 結論

Scheduler–Loop–Graph Runtime 讓 AI 可以穩定地做事,但真正可部署的自治系統還需要回答另一個問題:

它被允許做到哪裡?

本篇因此提出一個四分離模型:

TaskDifficultyCapabilityRiskAllowedAutonomy\boxed{ TaskDifficulty \perp Capability \perp Risk \perp AllowedAutonomy }

四者彼此相關,但不能互相替代。

對網路資訊海平台而言,這個分離尤其重要。大量搜尋、分類、摘要、翻譯、去重與歷史整理,本身通常具有高可逆性與高可驗證性,因此可以比傳統高風險領域更早進入 A4 甚至有限 A5;但一旦任務跨入外部正式承諾、敏感資料、權限、金流、重大刪除或不可逆作用,自主等級就必須立即下降。

因此,本系列的自治路線不是:

AI 越強權限越大AI\text{ 越強}\Rightarrow\text{權限越大}

而是:

AI 越可靠+Runtime 越可控+治理越成熟在合適風險範圍內逐步增加允許自主度\boxed{ AI\text{ 越可靠} + Runtime\text{ 越可控} + 治理越成熟 \Rightarrow 在合適風險範圍內逐步增加允許自主度 }

這使「類未來」從模糊的全自動想像,轉換成可工程化的分層授權制度:低風險資訊工作先自治,高風險副作用保留 Gate,並允許系統依每次任務的真實風險動態升降權。

下一步,就是把這套 Runtime 與授權政策從 AGIRight 抽離成真正可複用的 Domain Pack