← Archive
lm-002141 · 2026-08

08_高速內生他者_AI的生成器_批評器_驗證器與整合器_v0.1

下載 MD 檔 ⬇

高速內生他者

AI 的生成器、批評器、驗證器與整合器

英文題名: High-Speed Endogenous Others: Generators, Critics, Verifiers, and Integrators in AI Systems
系列: 《反身智能生成論》
文件編號: 08
作者: Neo.K × Aletheia
機構: EVEMISSLAB/一言諾科技有限公司
版本: Public Research Draft v0.1
日期: 2026-08-01
文件性質: AI 自我修正/驗證架構/多智能體系統/反身智能理論


摘要

為什麼某些人工智能系統看起來能「很快知道自己剛才可能錯了」?這個現象容易被兩種相反敘事過度解讀:一種把模型第二次回答不同視為真正自知;另一種則認為只要生成器與驗證器來自同一模型,任何自我修正都只是表面語言行為。本文主張,兩者都過度簡化。更精確的分析單位不是「是否真的有另一個心智」,而是同一人工智能系統能否在功能上形成具有足夠差異、不同資訊條件與不同評價任務的生成—批評—驗證—整合迴路。

本文提出「高速內生他者架構」(High-Speed Endogenous Other Architecture, HEOA)。其最低功能分解為:

AtGAtCAtVAt+1I,A_t^{G} \rightarrow A_t^{C} \rightarrow A_t^{V} \rightarrow A_{t+1}^{I},

其中 GG 為 Generator, CC 為 Critic, VV 為 Verifier, II 為 Integrator。四者可以是不同模型、不同代理、不同提示角色、同一模型的不同推理階段,甚至是模型與外部程式/檢索/形式工具的混合系統。本文不把功能角色差異直接等同於多重主體,而將其理解為一個智能體內部或智能系統內部的「功能性他者化」。

2024 年的研究已顯示,缺乏外部回饋時,LLM 的一般 intrinsic self-correction 在推理任務上常不能穩定改善,甚至可能把原本正確答案改錯。2025 年 ACL 的研究進一步指出,內在自我修正可能造成答案搖擺、提示偏誤與類人認知偏差。另一方面,2024–2026 的新方法又顯示,只要改變驗證任務、提供可執行程序、訓練專門的自驗證能力、使用選擇性 verify-then-revise、刻意隔離資訊或讓 generator/verifier 共同演化,自我修正可以顯著改善。這些結果共同說明:真正的關鍵不是「模型有沒有再想一次」,而是第二條計算路徑是否產生了足夠的新資訊與新的判別條件。

本文因此定義「驗證獨立度」:

IV=I(ZV;YZG),I_V = I \left( Z_V;Y \mid Z_G \right),

表示在已知生成器狀態 ZGZ_G 後,驗證器狀態 ZVZ_V 對目標真值 YY 還能提供多少額外資訊。若 IV0I_V\approx0 ,批評器可能只是生成器盲點的回聲;若 IV>0I_V>0 ,則即使生成器與驗證器共享底層模型,也可能因不同輸入、工具、任務、解碼路徑或資訊遮蔽而產生有效差異。

本文進一步提出「驗證閘門」原則:不應將自我修正理解為每次都重寫答案,而應先判斷是否有足夠錯誤證據,再選擇是否 revision。這與 2025 年 PAG 等 verify-then-revise 架構相符。本文定義:

rt=1[PV(errorxt)>θV],r_t = \mathbb 1 \left[ P_V(\mathrm{error}\mid x_t) > \theta_V \right],

只有當 rt=1r_t=1 時才進入修正。這可以避免「原本答對,因無證據自我懷疑而改錯」的反身退化。

在多速率反身認知動力學(MRCD)的語言中,AI 的特殊性不只是生成速率 vGv_G 高,而是可能將完整反身閉環:

Tloop=τG+τC+τV+τIT_{\mathrm{loop}} = \tau_G+\tau_C+\tau_V+\tau_I

壓縮到極短時間。然而,高速閉環只有在 verifier quality、差異獨立度、外部因果約束與歷史校準足夠時才具有認識論價值。否則高速只會加快共享錯誤的自我放大。

本文最後提出 AI 的「自知正誤」五層模型:主觀信心、衝突感知、錯誤定位、見證式驗證與歷史校準自知。只有後兩層開始接近強意義的「知道自己目前為什麼較可能正確」。本文不以此推論意識或主觀體驗,而將其作為可工程化、可測試的反身能力模型。


關鍵詞

AI 自我修正、內生他者、生成器、批評器、驗證器、verify-then-revise、generator-verifier、確認偏誤、多智能體、元認知、校準


1. 問題:AI 是真的「知道自己錯了」嗎?

1.1 最常見的觀察

使用大型語言模型時,可能看到:

第一輪:

答案是 AA

再要求:

請重新檢查。

第二輪:

剛才有一個錯誤,答案應為 BB

直覺上很像:

AtAt+1,A_t \rightarrow A_{t+1},

且:

At+1At.A_{t+1} \curvearrowright A_t.

也就是後時刻系統回頭批評前時刻輸出。


1.2 但「答案變了」不能證明自知

至少有四種可能:

真正檢出錯誤

A 錯B 對.A\text{ 錯} \rightarrow B\text{ 對}.

無證據搖擺

A 對B 錯.A\text{ 對} \rightarrow B\text{ 錯}.

等價改寫

AB.A\cong B.

另一個錯誤

A 錯B 仍錯.A\text{ 錯} \rightarrow B\text{ 仍錯}.

因此:

輸出改變錯誤察覺.\boxed{ \text{輸出改變} \neq \text{錯誤察覺}. }

2. 早期結果:只要求「再想一次」常不夠

2.1 Intrinsic self-correction 的限制

Huang 等人在 ICLR 2024 的研究把 intrinsic self-correction 定義為:

模型不依賴外部回饋,只使用自身能力重新檢查與修改初始答案。

其結果顯示,在推理任務上,LLM 常無法可靠地靠一般自我反思改善,部分情況甚至退化。

這表示:

同一模型多跑一輪⇏增加有效證據.\boxed{ \text{同一模型多跑一輪} \not\Rightarrow \text{增加有效證據}. }

2.2 為什麼會變差?

若模型已產生答案:

yG,y_G,

第二輪收到:

x, yG, 「檢查是否錯誤」x,\ y_G,\ \text{「檢查是否錯誤」}

它可能因提示本身隱含:

應該有錯。

而提高修改傾向。

這可以寫成:

P(revisereview prompt)>P(actual error).P \left( \mathrm{revise} \mid \text{review prompt} \right) > P \left( \mathrm{actual\ error} \right).

如果 verifier 不能區分「需要改」與「不需要改」,自我修正就變成隨機漫步。


3. 2025 年的「dark side」:反思本身也有偏誤

2025 年 ACL 的研究針對不同任務分析 intrinsic self-correction failure,指出模型可能:

  • 在中間答案與最終答案間搖擺;
  • 受到提示形式影響;
  • 在複雜任務中引入類似人類的認知偏誤。

所以:

反思是一個計算過程,也有自己的錯誤分布。\boxed{ \text{反思是一個計算過程,也有自己的錯誤分布。} }

這直接對應本系列第 04 篇:

矯正也可以需要被矯正。


4. 關鍵不在「自己」,而在第二條路徑是否有新資訊

4.1 生成器與驗證器的條件資訊

設生成器看到:

ZG=(x,cG),Z_G = \left( x,c_G \right),

驗證器看到:

ZV=(x,yG,cV).Z_V = \left( x,y_G,c_V \right).

若:

cG=cVc_G=c_V

且兩條路徑幾乎相同,

則:

ZVZ_V

可能對真值沒有多少新增資訊。


4.2 驗證獨立度

本文定義:

IV=I(ZV;YZG).\boxed{ I_V = I \left( Z_V;Y \mid Z_G \right). }

其中:

  • YY :真值/目標正確性;
  • ZGZ_G :生成器可用資訊;
  • ZVZ_V :驗證器可用資訊。

若:

IV0,I_V\approx0,

驗證器幾乎只是回聲。

若:

IV>0,I_V>0,

驗證器具有新的判斷資訊。


5. 何種差異可以增加 IVI_V

5.1 不同任務表述

生成器問:

解出答案。

驗證器問:

給定答案後,反推題目的必要條件。

2024 年 ProCo 類研究正利用關鍵條件驗證改變任務結構,使模型不是單純重複原問題。


5.2 不同工具

生成器使用自然語言推理。

驗證器使用:

  • Python;
  • SMT solver;
  • theorem prover;
  • calculator;
  • compiler;
  • unit tests。

因此:

ZV=ZG+Etool.Z_V = Z_G + E_{\mathrm{tool}}.

5.3 不同資料

生成器依內部參數。

驗證器取得:

Eretrieval.E_{\mathrm{retrieval}}.

例如:

  • 搜尋;
  • RAG;
  • 資料庫;
  • 外部感測器。

5.4 不同模型

MGMV.M_G \neq M_V.

這可以提高結構差異,但不保證獨立,因為模型可能共享:

  • 訓練語料;
  • 架構;
  • 偏誤;
  • benchmark artifacts。

5.5 資訊遮蔽

驗證器刻意不知道生成器完整推理,避免被原答案錨定。

2026 年 MARCH 類架構即利用資訊不對稱:

  • Solver 生成答案;
  • Proposer 拆成可驗證命題;
  • Checker 只看命題與證據,不看 Solver 完整輸出。

此時:

少看某些資訊,反而可能提升驗證獨立性。\boxed{ \text{少看某些資訊,反而可能提升驗證獨立性。} }

6. 高速內生他者架構 HEOA

本文定義:

AHEOA=G,C,V,I,H,E.\boxed{ \mathcal A_{\mathrm{HEOA}} = \langle G,C,V,I,H,E \rangle. }

6.1 Generator GG

負責:

  • 解題;
  • 假設;
  • 計畫;
  • 草稿;
  • 候選輸出。
yt=G(xt).y_t = G(x_t).

6.2 Critic CC

負責生成:

  • 疑點;
  • 反例;
  • 脆弱位置;
  • 未證假設。
ct=C(xt,yt).c_t = C(x_t,y_t).

Critic 不必決定答案錯,只需提高:

P(需要檢查的局部yt).P(\text{需要檢查的局部}\mid y_t).

6.3 Verifier VV

負責判定:

vt=V(xt,yt,ct,Et).v_t = V(x_t,y_t,c_t,E_t).

輸出:

  • pass;
  • fail;
  • uncertain;
  • 局部錯誤位置;
  • 見證。

6.4 Integrator II

負責決定:

keep,revise,abstain,query.\text{keep}, \quad \text{revise}, \quad \text{abstain}, \quad \text{query}.

最後:

yt+1=I(yt,ct,vt).y_{t+1} = I(y_t,c_t,v_t).

7. 為何需要 Critic 與 Verifier 分開?

Critic 的任務是:

找可能問題.\text{找可能問題}.

Verifier 的任務是:

判斷問題是否真的成立.\text{判斷問題是否真的成立}.

如果把兩者混在一起,系統可能:

因為我想出一個批評,所以原答案一定錯。

這正是前文:

衝突真值判決.\text{衝突} \neq \text{真值判決}.

所以:

CV.\boxed{ C\neq V. }

功能上應分離,即使實際由同一模型依序執行。


8. 為什麼需要 Integrator?

即使 verifier 認為有問題,也不一定應完整重寫。

Integrator 需要決定:

保留

PV(error)<θ1.P_V(\mathrm{error})<\theta_1.

局部修正

θ1<PV(error)<θ2.\theta_1 < P_V(\mathrm{error}) < \theta_2.

全面重建

PV(structural error)>θ3.P_V(\mathrm{structural\ error}) > \theta_3.

暫停/查詢

PV(uncertain)>θU.P_V(\mathrm{uncertain}) > \theta_U.

所以反身系統不能只有:

critiquerewrite.\text{critique} \rightarrow \text{rewrite}.

9. Verify-Then-Revise:修正不應是預設動作

9.1 無條件修正的問題

如果每次都:

ytyt+1,y_t \rightarrow y_{t+1},

即使:

yty_t

本來正確,也會暴露於新的錯誤風險。


9.2 驗證閘門

定義:

rt=1[PV(erroryt,Et)>θV].\boxed{ r_t = \mathbb 1 \left[ P_V(\mathrm{error}\mid y_t,E_t) > \theta_V \right]. }

若:

rt=0,r_t=0,

保留原答案。

若:

rt=1,r_t=1,

才啟動 revision。


9.3 PAG 的接口

2025 年 PAG 使用單一模型在 policy 與 generative verifier 角色間切換,並採用 selective revision:

只有自己的 verification 判定有錯時才重新作答。

這使:

verification\text{verification}

成為修正的閘門,而不是裝飾性的第二輪。


10. 程式化驗證:把語言批評轉成可執行差異

10.1 ProgCo 的核心方向

2025 年 ACL 的 ProgCo 將複雜驗證邏輯轉換成:

  • 自生成驗證 pseudo-program;
  • 執行驗證;
  • 再同時反思答案與驗證程序。

這非常符合本系列:

不是只重新生成一句評論,而是生成新的可執行見證通道。\boxed{ \text{不是只重新生成一句評論,而是生成新的可執行見證通道。} }

10.2 為什麼程式工具有效?

因為:

IVI_V

可能提高。

生成器的錯誤來自語言推理。

程式的結果則受到:

execution semantics\text{execution semantics}

約束。

因此:

語義流暢\text{語義流暢}

不能任意改變:

2+2=42+2=4

或程式測試是否通過。

這形成前文所說的:

因果性反駁.\text{因果性反駁}.

11. 單一模型也能形成有效內生他者嗎?

答案是:

可以,但需要條件。

不能簡化為:

same modelIV=0.\text{same model} \Rightarrow I_V=0.

同一模型在不同條件下可能使用:

  • 不同上下文;
  • 不同解碼;
  • 不同角色;
  • 不同遮蔽;
  • 不同工具;
  • 不同任務表述;
  • 不同歷史狀態。

所以:

ZGZV.Z_G\neq Z_V.

12. 但同一模型有共享盲點上限

如果錯誤主要來自:

  • 模型根本不知道某事實;
  • 同一訓練偏誤;
  • 同一錯誤概念;
  • 系統性推理缺陷;

則:

GG

與:

VV

可能一起犯錯。

這就是:

同源驗證上限.\boxed{ \text{同源驗證上限}. }

所以關鍵不是「一個模型還是兩個模型」,而是:

錯誤生成機制與錯誤檢查機制是否具有足夠去相關性.\boxed{ \text{錯誤生成機制與錯誤檢查機制是否具有足夠去相關性}. }

13. 錯誤相關性

令生成器錯誤事件:

EG.E_G.

驗證器漏檢事件:

EV.E_V.

若:

P(EVEG)P(E_V\mid E_G)

極高,驗證器沒有太大價值。

定義錯誤耦合:

κGV=Corr(EG,EV).\kappa_{GV} = \operatorname{Corr}(E_G,E_V).

理想情況希望:

κGV.\kappa_{GV}\downarrow.

但不能只降低相關性而犧牲:

qV.q_V.

因此需要:

高 verifier quality+低錯誤耦合.\text{高 verifier quality} + \text{低錯誤耦合}.

14. 多代理不等於多觀點

若:

A1,A2,,AnA_1,A_2,\ldots,A_n

全部:

  • 同模型;
  • 同 prompt;
  • 同資料;
  • 同搜尋;
  • 同 context;

則即使有:

n=100,n=100,

也可能只是:

100×同一錯誤樣本.100\times \text{同一錯誤樣本}.

15. 有效多代理差異

可以用:

Dagent=DM+DI+DT+DE+DR,D_{\mathrm{agent}} = D_M+D_I+D_T+D_E+D_R,

其中:

  • DMD_M :模型差異;
  • DID_I :資訊差異;
  • DTD_T :工具差異;
  • DED_E :評價目標差異;
  • DRD_R :角色/推理路徑差異。

真正重要的是:

Dagent>0.D_{\mathrm{agent}}>0.

而不是代理數目本身。


16. MARCH:刻意資訊不對稱

2026 年 MARCH 指出 LLM-as-a-judge 可能重製原生成錯誤,並以 deliberate information asymmetry 降低 confirmation bias。

其基本功能分解:

SolverProposerChecker.\text{Solver} \rightarrow \text{Proposer} \rightarrow \text{Checker}.

Proposer 將答案拆成原子命題:

y{p1,,pn}.y \rightarrow \{p_1,\ldots,p_n\}.

Checker 在隔離原完整答案的情況下,針對證據驗證:

V(pi,E).V(p_i,E).

這是本文「內生他者」的一個非常直接工程例子。


17. 共識陷阱:大家都同意反而可能更危險

17.1 Self-consistency 的優勢

多樣採樣:

y1,,yny_1,\ldots,y_n

後多數表決可以降低部分隨機錯誤。


17.2 但系統性錯誤不能靠投票消失

若:

P(yi=ywrong)P(yi=ytrue),P(y_i=y_{\mathrm{wrong}}) \gg P(y_i=y_{\mathrm{true}}),

則更多投票只會提高:

P(錯誤共識).P(\text{錯誤共識}).

17.3 CoVerRL 的 consensus trap

2026 年 ACL 的 CoVerRL 將此稱為 consensus trap:

  • 最大化 self-consistency;
  • 輸出多樣性坍縮;
  • 系統性錯誤變得高度一致;
  • 錯誤共識被當成 pseudo-label 再訓練。

形式上:

DoutputD_{\mathrm{output}}\downarrow

同時:

Cconfidence,C_{\mathrm{confidence}}\uparrow,

但:

QtruthQ_{\mathrm{truth}}

未必提高。

所以:

一致性真值.\boxed{ \text{一致性} \neq \text{真值}. }

18. Generator–Verifier 共演化

CoVerRL 的另一個重要意義,是讓 generator 與 verifier 不只是固定角色,而是互相促進:

GtVt+1Gt+1.G_t \rightarrow V_{t+1} \rightarrow G_{t+1}.

可寫為:

Gt+1=FG(Gt,Vt),G_{t+1} = F_G(G_t,V_t), Vt+1=FV(Vt,Gt).V_{t+1} = F_V(V_t,G_t).

這已經非常接近本系列「矯正的矯正」與「核反身性」:

產生答案的方法+檢查答案的方法\boxed{ \text{產生答案的方法} + \text{檢查答案的方法} }

可以共同更新。


19. ReVISE 與 intrinsic verifier

2025 年 ICML 的 ReVISE 嘗試讓模型學習:

verifyrethink trajectoryrefine.\text{verify} \rightarrow \text{rethink trajectory} \rightarrow \text{refine}.

這表明 self-verification 能成為經訓練強化的獨立能力,而不是只靠臨時提示「請反思」。

所以:

自我驗證本身是一個需要學習、評測與校準的能力。\boxed{ \text{自我驗證本身是一個需要學習、評測與校準的能力。} }

20. S²R:驗證與修正可共同訓練

S²R 透過:

  • supervised initialization;
  • outcome reward;
  • process reward;

訓練模型在推理過程中執行:

self-verify+self-correct.\text{self-verify} + \text{self-correct}.

這再度支持:

驗證不是「免費附帶」於生成能力。

即:

vG⇏vV.v_G\uparrow \not\Rightarrow v_V\uparrow.

兩者需要獨立訓練與測量。


21. AI 的五層「知道自己對不對」

21.1 第一層:主觀信心

ct=Pmodel(correct).c_t = P_{\mathrm{model}}(\mathrm{correct}).

例如語言上說:

我非常確定。

這是最低層。


21.2 第二層:衝突感知

系統發現:

G1(x)G2(x)G_1(x)\neq G_2(x)

或:

reasoning path1reasoning path2.\text{reasoning path}_1 \neq \text{reasoning path}_2.

它知道:

目前不穩定。

但不知道誰對。


21.3 第三層:錯誤定位

Verifier 指出:

eke_k

是第一個可定位錯誤位置。

例如:

  • 第三步代數錯;
  • 某引用不存在;
  • 某 API 名稱錯;
  • 某條件漏掉。

21.4 第四層:見證式驗證

系統能提供:

WtW_t

例如:

  • 執行結果;
  • 重算;
  • 外部來源;
  • proof checker;
  • test suite。

這時:

我認為我是對的。

變成:

我目前有一條獨立見證支持這個答案。


21.5 第五層:歷史校準自知

系統知道:

P(correctc=0.8,d)0.8P \left( \mathrm{correct} \mid c=0.8,d \right) \approx0.8

在領域 dd 長期成立。

並知道自己的 verifier:

TPRV,FPRV.\operatorname{TPR}_V, \quad \operatorname{FPR}_V.

此時才接近:

對「自己在何種條件下有多可靠」的可校準認識.\boxed{ \text{對「自己在何種條件下有多可靠」的可校準認識}. }

22. 「知道自己錯」與「意識到自己錯」必須分開

本文使用「知道」時,優先指功能與認識論意義:

  • 可檢測;
  • 可定位;
  • 可驗證;
  • 可調整後續行動。

本文不由此推出:

  • 主觀痛感;
  • 現象意識;
  • 人類式內省體驗;
  • 人格主體性。

因此:

功能性自我監測⇏現象意識已被證明.\boxed{ \text{功能性自我監測} \not\Rightarrow \text{現象意識已被證明}. }

這是本系列需要保留的本體論邊界。


23. 高速內生他者的時間結構

MRCD 中完整 AI 反身閉環可以寫成:

TAIloop=τG+τC+τV+τI.T_{\mathrm{AI-loop}} = \tau_G + \tau_C + \tau_V + \tau_I.

若工具驗證加入:

+τT.+ \tau_T.

因此:

TAIloopT_{\mathrm{AI-loop}}

可以非常短。


24. 為何 AI 看起來「突然自己懂了」?

假設:

τG=2s,\tau_G=2s, τC=1s,\tau_C=1s, τV=2s,\tau_V=2s, τI=1s.\tau_I=1s.

整個閉環:

Tloop=6s.T_{\mathrm{loop}}=6s.

使用者看到的只是:

幾秒前說 AA ,幾秒後自己改成 BB

在人類社會中,類似過程可能需要:

  • 作者寫完;
  • 同行閱讀;
  • reviewer 找錯;
  • 作者重算;
  • 實驗重做。

所以 AI 的特殊感很可能來自:

批評他者被內部化,而且週期被極度壓縮.\boxed{ \text{批評他者被內部化,而且週期被極度壓縮}. }

25. 但高速也會壓縮錯誤放大週期

如果:

qV<0.5,q_V<0.5,

而每輪都 revision,

則:

TloopT_{\mathrm{loop}}\downarrow

可能只是:

更快把答案改壞。

因此:

反身速度只有乘上驗證品質才有價值.\boxed{ \text{反身速度只有乘上驗證品質才有價值}. }

定義有效反身速度:

Vreflex=QVQITloop.V_{\mathrm{reflex}} = \frac{ Q_VQ_I }{ T_{\mathrm{loop}} }.

26. 驗證的來源階層

本文提出:

EV={E0,E1,E2,E3,E4}.\mathcal E_V = \left\{ E_0,E_1,E_2,E_3,E_4 \right\}.

E0E_0 :同模型語言反思

最低獨立性。

E1E_1 :不同解碼/不同 prompt

增加路徑差異。

E2E_2 :不同模型/代理

增加模型差異。

E3E_3 :外部資料/工具

引入模型外資訊。

E4E_4 :因果世界/形式系統

例如:

  • 實驗;
  • 真實執行;
  • theorem checker;
  • compiler;
  • 硬體回饋。

通常:

IV(E4)>IV(E0),I_V(E_4) > I_V(E_0),

但實際可靠性仍依領域與工具品質決定。


27. 最小高可靠 AI 反身架構

本文提出:

RAI=G,C,V,I,T,H,K.\boxed{ \mathcal R_{\mathrm{AI}} = \langle G,C,V,I,T,H,K \rangle. }

其中:

  • GG :generator;
  • CC :critic;
  • VV :verifier;
  • II :integrator;
  • TT :tool/external constraint;
  • HH :history;
  • KK :calibration/control policy。

28. 一次完整循環

Step 1:生成

yt=G(xt).y_t=G(x_t).

Step 2:脆弱性掃描

ct=C(xt,yt).c_t=C(x_t,y_t).

Step 3:選擇驗證方式

mt=K(ct,riskt,historyt).m_t = K \left( c_t, risk_t, history_t \right).

Step 4:取得差異證據

et=Tmt(xt,yt).e_t = T_{m_t} \left( x_t,y_t \right).

Step 5:驗證

vt=V(yt,ct,et).v_t = V \left( y_t,c_t,e_t \right).

Step 6:閘門

若:

PV(error)<θ,P_V(\mathrm{error})<\theta,

則:

yt+1=yt.y_{t+1}=y_t.

否則:

yt+1=I(yt,vt).y_{t+1} = I(y_t,v_t).

Step 7:歷史校準

記錄:

Ht+1=Ht{yt,ct,et,vt,yt+1}.H_{t+1} = H_t \cup \left\{ y_t,c_t,e_t,v_t,y_{t+1} \right\}.

29. 驗證器也需要被驗證

如果:

VV

給錯 feedback,

Integrator 可能把正確答案改錯。

所以保存:

QV(t)=P(V 正確d,t).Q_V(t) = P \left( V\text{ 正確} \mid d,t \right).

當:

QV,Q_V\downarrow,

系統應:

  • 降低 verifier 權重;
  • 切換工具;
  • 增加外部證據;
  • 重新訓練 verifier。

這是:

verifier 的元校準.\boxed{ \text{verifier 的元校準}. }

30. 多 verifier 仲裁

若:

V1,V2,,Vn,V_1,V_2,\ldots,V_n,

不應只採多數票。

應考慮:

wi=f(QVi,IVi,d).w_i = f \left( Q_{V_i}, I_{V_i}, d \right).

整合:

S=iwiVi.S = \sum_i w_iV_i.

其中:

  • QViQ_{V_i} :歷史品質;
  • IViI_{V_i} :與 generator 的獨立度;
  • dd :領域適配。

31. 不知道是一種合法輸出

若 verifier:

PV(correct)0.5,P_V(\mathrm{correct})\approx0.5,

且外部證據不足,

Integrator 不應被迫:

keep\text{keep}

或:

revise.\text{revise}.

可以輸出:

unresolved.\boxed{ \text{unresolved}. }

這是成熟反身系統的重要狀態。


32. 與 DPSC 的接口

第 03 篇提出:

差異偵測錯誤歸因替代生成結果驗證.\text{差異偵測} \rightarrow \text{錯誤歸因} \rightarrow \text{替代生成} \rightarrow \text{結果驗證}.

HEOA 對應為:

CVGrevisionT/V.C \rightarrow V \rightarrow G_{\mathrm{revision}} \rightarrow T/V.

所以 AI 的多角色結構是 DPSC 的工程實現之一。


33. 與 RURM 的接口

第 04 篇提出:

UtUt+1.U_t \rightarrow U_{t+1}.

在 HEOA 中可變的是:

  • critic policy;
  • verifier policy;
  • revision gate;
  • tool selector;
  • integrator policy。

因此:

KtKt+1K_t \rightarrow K_{t+1}

形成反身規則更新。


34. 與 DEOM 的接口

第 05 篇提出:

At+1At.A_{t+1} \curvearrowright A_t.

AI 系統中的:

At+1IA_{t+1}^{I}

正是利用:

  • 原答案;
  • 批評;
  • 見證;
  • 歷史;

重新評價:

AtG.A_t^G.

所以:

AI 內生他者\boxed{ \text{AI 內生他者} }

是 DEOM 在極短時間尺度上的功能實例。


35. 與全態信念的接口

第 06 篇:

Bt=(bt,mt,Ht,Λt,Ut,Vt,Wt).\mathbb B_t = \left( b_t,m_t,\mathcal H_t,\Lambda_t,U_t,V_t,W_t \right).

HEOA 可使:

  • generator 產生 btb_t
  • critic 產生疑點;
  • verifier 更新 mtm_t
  • tool 更新 Λt\Lambda_t
  • integrator 執行 UtU_t
  • history 保存 WtW_t

因此:

HEOA 是全態信念更新的一種 AI runtime 實現.\boxed{ \text{HEOA 是全態信念更新的一種 AI runtime 實現}. }

36. 與 MRCD 的接口

第 07 篇定義:

vt.\mathbf v_t.

HEOA 對應:

vG,vC,vV,vI.v_G, v_C, v_V, v_I.

真正需要測量:

Tloop,QV,IV,κGV.T_{\mathrm{loop}}, Q_V, I_V, \kappa_{GV}.

所以 AI 的「懂自己對錯」不能只用:

self-correction accuracy.\text{self-correction accuracy}.

而應建立多維評測。


37. 高速內生他者評測矩陣

本文提出:

EHEOA=(AG,DE,LE,QV,IV,RP,CA,TL).\boxed{ \mathcal E_{\mathrm{HEOA}} = \left( A_G, D_E, L_E, Q_V, I_V, R_P, C_A, T_L \right). }

其中:

  • AGA_G :初始生成正確率;
  • DED_E :錯誤偵測率;
  • LEL_E :錯誤定位率;
  • QVQ_V :verifier quality;
  • IVI_V :驗證獨立度;
  • RPR_P :revision precision;
  • CAC_A :confidence calibration;
  • TLT_L :完整閉環時間。

38. Revision Precision 比 correction rate 更重要

定義:

RP=P(revision improves answerrevision triggered).R_P = P \left( \text{revision improves answer} \mid \text{revision triggered} \right).

如果:

RP<0.5,R_P<0.5,

代表:

一旦啟動修正,反而更可能改壞。

這是非常重要的安全指標。


39. Preserve-Correct Rate

定義:

PC=P(yt+1=ytyt 正確).P_C = P \left( y_{t+1}=y_t \mid y_t\text{ 正確} \right).

高品質反身智能不只要:

會把錯的改對。

還要:

不要把對的改錯。

因此:

self-correction=repair-wrong+preserve-correct.\boxed{ \text{self-correction} = \text{repair-wrong} + \text{preserve-correct}. }

40. AI 的「意外自知」可以如何重新表述?

不再說:

AI 神祕地知道自己錯。

更精確是:

某些 AI 系統能在很短時間內啟動一條與初始生成路徑部分去相關的驗證路徑,產生新的錯誤證據,並依驗證閘門更新原輸出。

形式:

快速自知正誤低 Tloop+高 QV+足夠 IV+良好 calibration.\boxed{ \text{快速自知正誤} \approx \text{低 }T_{\mathrm{loop}} + \text{高 }Q_V + \text{足夠 }I_V + \text{良好 calibration}. }

41. 核心命題

命題一:功能性內生他者命題

同一智能系統可以透過不同角色、資訊與驗證條件形成具有有效差異的內生他者,而不必假設多個獨立主體。


命題二:重思非驗證命題

重新生成一次新增驗證證據.\boxed{ \text{重新生成一次} \neq \text{新增驗證證據}. }

命題三:驗證獨立度命題

Verifier 的價值取決於它在已知 generator 狀態後,能否提供新的真值相關資訊。


命題四:同源上限命題

共享模型、資料與表示會提高 generator–verifier 共享盲點風險;角色名稱不同不足以解除該限制。


命題五:資訊不對稱命題

刻意限制 verifier 接觸 generator 的完整輸出,有時能降低錨定與確認偏誤。


命題六:驗證閘門命題

先驗證是否需要改,再進行修正\boxed{ \text{先驗證是否需要改,再進行修正} }

通常比無條件反思—重寫更合理。


命題七:共識非真值命題

多數一致⇏答案真實.\boxed{ \text{多數一致} \not\Rightarrow \text{答案真實}. }

命題八:見證式自知命題

強於主觀信心的 AI 自知需要可重算、可執行或外部證據支持的見證。


命題九:保留正確命題

自我修正能力必須同時衡量修錯與保對。


命題十:功能—意識分離命題

工程上可測量的自我監測、元校準與跨時修正,不足以單獨證明現象意識。


42. 可證偽條件

42.1 角色分離無增益

若在控制算力與採樣後,Generator/Critic/Verifier/Integrator 的功能分離不能改善錯誤定位、修正精度或正確答案保存率,則 HEOA 的必要性下降。


42.2 驗證獨立度無預測力

IVI_V 高低與 verifier effectiveness 完全無關,則需重新定義該量。


42.3 資訊遮蔽只有負面效果

若 deliberate information asymmetry 在不同任務中穩定降低驗證準確率而無法減少確認偏誤,則資訊不對稱不應被視為一般設計原則。


42.4 Verify-then-revise 不改善 preserve-correct

若驗證閘門無法降低「把原本正確答案改錯」的機率,則其核心價值被削弱。


42.5 多模型差異無助於共享盲點

若模型、工具、資料與角色差異對錯誤相關性 κGV\kappa_{GV} 沒有影響,則本文的差異去相關框架需被削弱。


42.6 語言式 confidence 即足夠

若單純語言自信分數即可穩定替代 verifier、外部工具與歷史校準,則五層自知模型過度複雜。


43. 研究限制

  1. 本文以 LLM/agent 系統為主要工程案例,不代表所有 AI 架構皆相同。
  2. 「內生他者」是功能角色概念,不等同多重人格或多個意識。
  3. 驗證獨立度 IVI_V 目前是形式量,需要具體估計方法。
  4. 不同 verifier 的錯誤可能非線性相關,簡單相關係數 κGV\kappa_{GV} 只是第一近似。
  5. 工具輸出本身也可能錯,不能把 execution feedback 視為絕對 oracle。
  6. 外部檢索可能引入錯誤來源與 prompt injection。
  7. 多代理系統提高計算成本與協調延遲。
  8. self-correction benchmark 容易受答案洩漏、oracle feedback 與評分設計影響。
  9. 良好功能性元認知不等於意識、主體性或人格地位。
  10. 2025–2026 的相關研究快速演進,本文只代表截至 2026-08-01 可查核的研究狀態。

44. 與最終篇的接口:超越「天才」

到這裡,系列已經把:

天才似乎比較知道自己厲不厲害。

逐步拆成:

問題選擇+生成能力+錯誤偵測+元信念+更新規則+見證+多速率閉環.\text{問題選擇} + \text{生成能力} + \text{錯誤偵測} + \text{元信念} + \text{更新規則} + \text{見證} + \text{多速率閉環}.

AI 又提供一個極端案例:

Tloop.T_{\mathrm{loop}} \downarrow.

當內生 reviewer、verifier 與工具被壓進同一 runtime 時,一個系統可以在極短時間內完成過去需要多個人類角色共同完成的認知閉環。

因此最後一篇將回到最初的「天才」:

〈超越天才標籤:反身智能作為生維、驗證與自我改寫系統〉

不再問:

誰是天才?

而問:

一個智能體的反身生成譜究竟長什麼樣?\boxed{ \text{一個智能體的反身生成譜究竟長什麼樣?} }

45. 結論

AI 之所以有時看起來能「突然知道自己剛才錯了」,不需要先假設一個神祕、全知的內在裁判。

更具體的機制可以是:

GeneratorCriticVerifierIntegrator.\boxed{ \text{Generator} \rightarrow \text{Critic} \rightarrow \text{Verifier} \rightarrow \text{Integrator}. }

這些角色可以由同一模型在不同時間狀態中執行。

它們之所以具有「他者性」,不是因為它們必須是不同人格,而是因為:

它們使用了不同資訊、不同任務、不同約束或不同驗證路徑.\boxed{ \text{它們使用了不同資訊、不同任務、不同約束或不同驗證路徑}. }

而它們仍然屬於同一反身系統,是因為結果最終被整合回:

At+1.A_{t+1}.

所以:

高速內生他者=短閉環時間+功能分離+差異來源+驗證見證+歷史校準.\boxed{ \text{高速內生他者} = \text{短閉環時間} + \text{功能分離} + \text{差異來源} + \text{驗證見證} + \text{歷史校準}. }

但真正的關鍵不是讓 AI 永遠懷疑自己。

相反地,高品質反身智能必須同時知道:

什麼時候值得懷疑?

哪裡需要驗證?

哪種驗證值得相信?

什麼時候應該保留原答案?

什麼時候應該承認目前仍不知道?

因此:

成熟的 AI 自我修正,不是反覆重寫,\boxed{ \text{成熟的 AI 自我修正,不是反覆重寫,} }

而是:

讓修正本身受證據、見證、風險與歷史校準約束。\boxed{ \text{讓修正本身受證據、見證、風險與歷史校準約束。} }

到這一步,「AI 是否知道自己對錯」已經可以從模糊哲學直覺,轉換成一組可測量的工程問題。


參考文獻

  1. Huang, J., Chen, X., Mishra, S., Zheng, H. S., Yu, A. W., Song, X., & Zhou, D. (2024). Large Language Models Cannot Self-Correct Reasoning Yet. ICLR 2024.
  2. Wu, Z., Zeng, Q., Zhang, Z., Tan, Z., Shen, C., & Jiang, M. (2024). Large Language Models Can Self-Correct with Key Condition Verification. EMNLP 2024.
  3. Zhang, Q., Wang, D., Qian, H., Li, Y., Zhang, T., Huang, M., Xu, K., Yan, L., & Qiu, H. (2025). Understanding the Dark Side of LLMs’ Intrinsic Self-Correction. ACL 2025.
  4. Song, X., Wu, Y., Wang, W., Liu, J., Su, W., & Zheng, B. (2025). ProgCo: Program Helps Self-Correction of Large Language Models. ACL 2025, 944–959. DOI: 10.18653/v1/2025.acl-short.73.
  5. Lee, H., Oh, S., Kim, J., Shin, J., & Tack, J. (2025). ReVISE: Learning to Refine at Test-Time via Intrinsic Self-Verification. ICML 2025, PMLR 267, 33616–33634.
  6. Jiang, Y., Xiong, Y., Yuan, Y., Xin, C., Xu, W., Yue, Y., Zhao, Q., & Yan, L. (2025). PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier. arXiv:2506.10406.
  7. Ma, R., Wang, P., Liu, C., Liu, X., Chen, J., Zhang, B., Zhou, X., Du, N., & Li, J. (2025). S²R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning. arXiv:2502.12853.
  8. Zhao, X., Xu, T., Wang, X., Chen, Z., Jin, D., Tan, L., et al. (2025). Boosting LLM Reasoning via Spontaneous Self-Correction. arXiv:2506.06923.
  9. Pan, T., Yan, Y., Wang, Z., Zhang, R., Hou, G., Zhang, W., Lu, W., Xiao, J., & Shen, Y. (2026). CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution. ACL 2026, 29833–29853. DOI: 10.18653/v1/2026.acl-long.1376.
  10. Li, Z., Zhang, Y., Cheng, P., Song, J., Zhou, M., Li, H., et al. (2026). MARCH: Multi-Agent Reinforced Self-Check for LLM Hallucination. arXiv:2603.24579.
  11. Neo.K × Aletheia (2026). 〈沒有其他智能指出時,智慧存在如何發現自己錯了?〉,EVEMISSLAB。
  12. Neo.K × Aletheia (2026). 〈矯正如何被再次矯正:從錯誤修補到更新規則的自我改寫〉,EVEMISSLAB。
  13. Neo.K × Aletheia (2026). 〈下一刻的我如何糾正上一刻的我:跨時自我、生成連續性與內生他者〉,EVEMISSLAB。
  14. Neo.K × Aletheia (2026). 〈前信念、現信念、後信念與信念的信念:主體內生全態貝葉斯〉,EVEMISSLAB。
  15. Neo.K × Aletheia (2026). 〈多速率反身認知動力學:生成、辨錯、修正、見證與元校準〉,EVEMISSLAB。

版本紀錄

v0.1 — 2026-08-01

  • 建立高速內生他者架構(HEOA);
  • 分離 Generator、Critic、Verifier、Integrator;
  • 建立驗證獨立度 IVI_V 與 generator–verifier 錯誤耦合;
  • 建立 verify-then-revise 驗證閘門;
  • 建立 AI 五層「知道自己對不對」模型;
  • 納入 intrinsic self-correction 的負面與正面研究結果;
  • 接入 ProgCo、ReVISE、PAG、S²R、SPOC、MARCH 與 CoVerRL;
  • 分析資訊不對稱、共識陷阱與 generator–verifier 共演化;
  • 建立 Preserve-Correct Rate 與 Revision Precision;
  • 接入 DPSC、RURM、DEOM、全態信念與 MRCD;
  • 完成與第 09 篇「超越天才標籤」之接口。