自調用記憶:知識系統何時應該主動喚起自身?
系列 :可繼承的認知:從自我解構到遞歸生成式記憶系統(第 7 篇)作者 :Neo.K研究協作 :Aletheia(阿萊)版本 :v1.0日期 :2026-07-30文章類型 :命題猜想論文/後設認知控制論文/GCMS 自調用架構論文
摘要
知識系統通常只有在收到明確查詢時才檢索記憶。然而,一個面向長期研究、複雜任務與多智能體協作的生成式壓縮記憶系統,不能只依賴外部命令。它還需要辨認:目前回答是否過度依賴不可靠內部記憶、證據是否不足、來源是否衝突、任務是否尚未完成、既有知識是否已過期,以及新的觀察是否值得喚起相關理論。本文將這種能力稱為「自調用記憶」。此處的「自」不是人格、意識或第一人稱主體性的聲稱,而是指系統能監測自身當前知識狀態,並依政策主動選擇記憶操作。
本文從後設記憶的監測—控制框架、記憶報告的策略調節、學習時間分配、控制的預期價值、理性後設推理、資訊覓食、主動推論與近年的自適應檢索系統出發,提出 GCMS 自調用控制模型。設系統在時間 t t t 的監測狀態為:
z t = ( U t , E t , X t , N t , P t , D t , R t ) , \mathbf z_t
=
\left(
U_t,
E_t,
X_t,
N_t,
P_t,
D_t,
R_t
\right), z t = ( U t , E t , X t , N t , P t , D t , R t ) ,
其中 U t U_t U t 為不確定性, E t E_t E t 為證據覆蓋率, X t X_t X t 為衝突強度, N t N_t N t 為新穎性或異常度, P t P_t P t 為任務未完成度, D t D_t D t 為知識漂移風險, R t R_t R t 為治理與資源風險。系統不應只用單一信心閾值決定是否檢索,而應比較各種記憶操作的期望淨價值:
NVSI ( a ∣ s t ) = E [ Δ U ∣ a , s t ] − C c o m p ( a ) − C l a t ( a ) − C r i s k ( a ) , \operatorname{NVSI}(a\mid s_t)
=
\mathbb E
\left[
\Delta \mathcal U
\mid a,s_t
\right]
-
C_{\mathrm{comp}}(a)
-
C_{\mathrm{lat}}(a)
-
C_{\mathrm{risk}}(a), NVSI ( a ∣ s t ) = E [ Δ U ∣ a , s t ] − C comp ( a ) − C lat ( a ) − C risk ( a ) ,
其中 a a a 可以是不調用、局部檢索、版本回溯、矛盾搜尋、發散搜尋、集中整理、外部查證或轉交人類。只有當某個操作的淨價值高於不操作,且滿足權限、預算與遞歸深度條件時,系統才應主動喚起記憶。
本文提出「監測—控制分離命題」、「正淨值自調用命題」、「適應性優勢猜想」、「證據充分停止命題」、「遞歸非自然終止命題」與「校準優先命題」。本文也主張,自調用能力的品質不能只以回答準確率衡量,還必須評估過度調用率、漏調用率、停止後悔、證據充分度校準、單位成本資訊增益、遞歸深度與記憶污染風險。沒有停止條件的自調用不是自主研究,而可能只是計算膨脹、自我引用與無限精修。
因此,GCMS 自調用記憶的完整形式不是:
遇到問題就一直搜索 , \text{遇到問題就一直搜索}, 遇到問題就一直搜索 ,
而是:
監測 → 估值 → 選擇記憶操作 → 評估充分性 → 停止、繼續或轉交 \boxed{
\text{監測}
\rightarrow
\text{估值}
\rightarrow
\text{選擇記憶操作}
\rightarrow
\text{評估充分性}
\rightarrow
\text{停止、繼續或轉交}
} 監測 → 估值 → 選擇記憶操作 → 評估充分性 → 停止、繼續或轉交
關鍵詞 :GCMS、自調用記憶、後設記憶、後設認知、監測與控制、理性後設推理、資訊價值、主動檢索、Agent memory、停止條件、遞歸控制
一、問題的提出:記憶何時不應等待外部提問?
前六篇依序建立了:
從成果傳遞到生成能力傳遞;
有限認知繼承與外部化邊界;
生成式壓縮記憶;
原文無損軌與語義近無損軌;
區塊、流式、跳躍、發散與集中索引;
重建、生成、組合與跨域再結構化。
目前的 GCMS 已經可以表示:
q → I n d e x R q → T r a n s f o r m Y q → V e r i f y Y ~ q . q
\xrightarrow{\mathrm{Index}}
\mathcal R_q
\xrightarrow{\mathrm{Transform}}
\mathcal Y_q
\xrightarrow{\mathrm{Verify}}
\widetilde{\mathcal Y}_q. q Index R q Transform Y q Verify Y q .
但是,上述流程仍隱含一個被動假設:
記憶系統只有在外部明確提出查詢 q q q 時才開始運作。
這個假設對一般搜尋引擎是合理的,對長期研究智能體卻不充分。
例如,系統在生成一份研究報告時,可能出現以下狀態:
某個年份或版本的信心很低;
兩份來源對同一命題互相衝突;
新出現的概念與舊研究系列具有高度生成關係;
一個任務被中斷,但尚有未驗證分支;
目前回答使用的是過時版本;
推論已經超出來源證據所能支持的範圍;
新觀察足以改變既有生成核;
系統反覆產生相同候選,顯示需要停止而非繼續。
若系統只能等待外部命令,它可能在證據不足時直接回答,也可能錯過重要的知識連結。
另一方面,若系統在任何微小不確定性下都啟動檢索、發散、重建與反思,它又會陷入:
無限檢索 + 無限精修 + 無限自我引用 . \text{無限檢索}
+
\text{無限精修}
+
\text{無限自我引用}. 無限檢索 + 無限精修 + 無限自我引用 .
因此問題不是:
系統能否主動調用記憶?
而是:
系統應在什麼條件下主動調用哪一種記憶操作,又應在什麼條件下停止?
本文將這個問題稱為:
記憶的後設控制問題 \boxed{
\text{記憶的後設控制問題}
} 記憶的後設控制問題
二、「自調用」不是人格聲稱,而是後設控制
2.1 操作性定義
本文所稱的自調用記憶,是指系統能:
讀取自身當前任務狀態;
估計自身知識與證據狀態;
判斷額外記憶操作是否可能改善結果;
選擇相應的索引、檢索、比較或反思操作;
在達到充分性、成本或治理邊界時停止。
令系統狀態為:
s t = ( q t , M t , E t , H t , B t , P t ) , s_t
=
\left(
q_t,
\mathcal M_t,
\mathcal E_t,
\mathcal H_t,
\mathcal B_t,
\mathcal P_t
\right), s t = ( q t , M t , E t , H t , B t , P t ) ,
其中:
q t q_t q t :當前問題或任務;
M t \mathcal M_t M t :可用記憶狀態;
E t \mathcal E_t E t :已取得證據;
H t \mathcal H_t H t :本輪操作歷史;
B t \mathcal B_t B t :剩餘資源預算;
P t \mathcal P_t P t :權限與治理政策。
自調用控制器為:
Π s e l f : s t ↦ a t , \Pi_{\mathrm{self}}
:
s_t
\mapsto
a_t, Π self : s t ↦ a t ,
其中:
a t ∈ A m e m o r y . a_t
\in
\mathcal A_{\mathrm{memory}}. a t ∈ A memory .
這裡的 a t a_t a t 可以是檢索、版本比較、關係跳躍、發散、集中、原文驗證或停止。
2.2 「自」的最小意義
本文不由自調用推導:
系統具有意識;
系統具有固定人格;
系統擁有人類式意向性;
系統與記憶原作者身份相同;
系統可以代表原作者。
此處的「自」只表示:
控制器的輸入包含系統自身的運行狀態 . \text{控制器的輸入包含系統自身的運行狀態}. 控制器的輸入包含系統自身的運行狀態 .
因此:
自調用 ≠ 自我意識 \boxed{
\text{自調用}
\neq
\text{自我意識}
} 自調用 = 自我意識
但也不能因此把它降格成普通的固定排程。固定排程不必評估當前知識狀態;自調用則要求某種監測—估值—控制耦合。
三、研究背景一:後設記憶的監測與控制
3.1 Nelson—Narens 的雙層框架
Nelson 與 Narens 的後設記憶框架區分:
object level:實際執行記憶、學習與提取;
meta level:監測 object level,並對其施加控制。[1]
可形式化為:
O t → m o n i t o r M t m e t a , \mathcal O_t
\xrightarrow{\mathrm{monitor}}
\mathcal M_t^{\mathrm{meta}}, O t monitor M t meta ,
以及:
M t m e t a → c o n t r o l O t + 1 . \mathcal M_t^{\mathrm{meta}}
\xrightarrow{\mathrm{control}}
\mathcal O_{t+1}. M t meta control O t + 1 .
其中監測可以估計:
是否記得;
答案是否可靠;
是否值得繼續搜索;
哪一部分最需要再學習。
控制則決定:
是否回答;
是否保留答案;
是否再檢索;
是否投入更多時間;
是否改變策略。
這對 GCMS 的直接啟示是:
記憶內容 ≠ 記憶控制 \boxed{
\text{記憶內容}
\neq
\text{記憶控制}
} 記憶內容 = 記憶控制
即使底層資料庫包含正確內容,如果系統不知道何時該查、何時該停止、何時不該輸出,仍不能形成可靠的自主記憶。
3.2 記憶報告的策略調節
Koriat 與 Goldsmith 將記憶表現從「能想起多少」擴展到「願意報告什麼」。當個體可以根據信心選擇報告或保留答案時,可能提高輸出內容的準確度,但代價是降低報告數量。[2][3]
設候選答案為:
r i , r_i, r i ,
其主觀正確機率為:
p ^ i . \widehat p_i. p i .
若報告閾值為:
θ , \theta, θ ,
則:
Report ( r i ) = 1 [ p ^ i ≥ θ ] . \operatorname{Report}(r_i)
=
\mathbf 1
\left[
\widehat p_i\geq\theta
\right]. Report ( r i ) = 1 [ p i ≥ θ ] .
提高 θ \theta θ 可能提高:
Accuracy o u t p u t , \operatorname{Accuracy}_{\mathrm{output}}, Accuracy output ,
卻降低:
Quantity o u t p u t . \operatorname{Quantity}_{\mathrm{output}}. Quantity output .
這說明後設控制本質上是多目標權衡,而不是單純追求最大輸出量。
對 GCMS 而言,等價問題是:
是否應立即生成答案、先檢索證據、標記不確定性,還是拒絕形成結論?
3.3 監測準確不等於控制有效
監測與控制可以分離。
一個系統可能知道自己不確定,卻仍然輸出肯定答案;也可能信心估計不準,導致錯誤地跳過檢索。[4]
因此需要分別評估:
Q m o n i t o r , Q_{\mathrm{monitor}}, Q monitor ,
與:
Q c o n t r o l . Q_{\mathrm{control}}. Q control .
本文提出:
良好自調用 = 良好狀態監測 + 良好操作選擇 \boxed{
\text{良好自調用}
=
\text{良好狀態監測}
+
\text{良好操作選擇}
} 良好自調用 = 良好狀態監測 + 良好操作選擇
只改善其中一項,不足以建立完整控制器。
四、研究背景二:資源分配與可學習區域
4.1 學習時間不是平均分配
Metcalfe 與 Kornell 的「近側學習區域」模型指出,學習者不必把時間平均分配給所有材料,而可能優先投入尚未掌握、但可在合理努力下改善的項目。[5][6]
將項目 i i i 的預期學習增益表示為:
G i ( τ ) , G_i(\tau), G i ( τ ) ,
其中 τ \tau τ 是額外投入時間。
若項目已完全掌握:
∂ G i ∂ τ ≈ 0. \frac{\partial G_i}{\partial \tau}
\approx 0. ∂ τ ∂ G i ≈ 0.
若項目極度困難:
∂ G i ∂ τ ≈ 0. \frac{\partial G_i}{\partial \tau}
\approx 0. ∂ τ ∂ G i ≈ 0.
最值得投入的,往往是:
0 < ∂ G i ∂ τ 且 Cost i 可接受 . 0
<
\frac{\partial G_i}{\partial \tau}
\quad
\text{且}
\quad
\operatorname{Cost}_i
\text{可接受}. 0 < ∂ τ ∂ G i 且 Cost i 可接受 .
對 GCMS 而言,這意味自調用不能只被「最不確定」觸發。
如果某個缺口無法透過現有記憶改善,繼續搜索只會浪費成本。系統應優先處理:
目前不充分,但具有可改善性的知識缺口 \boxed{
\text{目前不充分,但具有可改善性的知識缺口}
} 目前不充分,但具有可改善性的知識缺口
4.2 從困難度轉向邊際效用
設候選記憶操作為 a a a ,額外投入為 c c c ,預期品質改善為:
Δ Q ( a , c ) . \Delta Q(a,c). Δ Q ( a , c ) .
系統應關注:
Δ Q ( a , c ) c , \frac{\Delta Q(a,c)}{c}, c Δ Q ( a , c ) ,
而不只是原始困難度。
因此:
高不確定性 ⇏ 一定值得調用 . \text{高不確定性}
\not\Rightarrow
\text{一定值得調用}. 高不確定性 ⇒ 一定值得調用 .
例如:
找不到授權來源;
任務需要實驗而非文件;
問題本身未定義;
必須由權利人決定;
缺少外部觀察;
現有資料無法區分競爭假說。
此時正確控制可能是:
停止並轉交 , \text{停止並轉交}, 停止並轉交 ,
而非:
增加檢索輪數 . \text{增加檢索輪數}. 增加檢索輪數 .
五、研究背景三:控制的預期價值與理性後設推理
5.1 控制也有成本
Expected Value of Control 理論將控制配置理解為收益、控制強度與努力成本之間的權衡。[7]
簡化表示為:
EVC ( a ) = ∑ o P ( o ∣ a , s ) V ( o ) − C ( a ) . \operatorname{EVC}(a)
=
\sum_o
P(o\mid a,s)
V(o)
-
C(a). EVC ( a ) = o ∑ P ( o ∣ a , s ) V ( o ) − C ( a ) .
其中:
a a a :控制操作;
o o o :可能結果;
V ( o ) V(o) V ( o ) :結果價值;
C ( a ) C(a) C ( a ) :控制成本。
對 GCMS 而言,記憶操作也不是免費的。
成本包含:
C ( a ) = C c o m p u t e + C l a t e n c y + C t o k e n + C h u m a n + C r i s k . C(a)
=
C_{\mathrm{compute}}
+
C_{\mathrm{latency}}
+
C_{\mathrm{token}}
+
C_{\mathrm{human}}
+
C_{\mathrm{risk}}. C ( a ) = C compute + C latency + C token + C human + C risk .
如果檢索只能帶來極小改善,系統不應為了形式上的完整而無限增加操作。
5.2 計算本身是一種可選行動
理性後設推理研究把「要不要再算一次」視為決策問題。某個額外計算的價值,取決於它是否可能改變最終決策,及其成本是否值得。[8][9][10]
設當前最佳行動為:
a t ∗ . a^\ast_t. a t ∗ .
執行一個額外計算 c c c 後,可能得到新的最佳行動:
a t + 1 ∗ ( c ) . a^\ast_{t+1}(c). a t + 1 ∗ ( c ) .
計算價值可以寫成:
VOC ( c ) = E [ U ( a t + 1 ∗ ( c ) ) − U ( a t ∗ ) ] − Cost ( c ) . \operatorname{VOC}(c)
=
\mathbb E
\left[
U(a^\ast_{t+1}(c))
-
U(a^\ast_t)
\right]
-
\operatorname{Cost}(c). VOC ( c ) = E [ U ( a t + 1 ∗ ( c )) − U ( a t ∗ ) ] − Cost ( c ) .
若:
VOC ( c ) ≤ 0 , \operatorname{VOC}(c)\leq 0, VOC ( c ) ≤ 0 ,
則不應執行該計算。
本文把這個思想推廣到記憶操作,稱為:
ValueOfMemoryOperation . \operatorname{ValueOfMemoryOperation}. ValueOfMemoryOperation .
六、研究背景四:資訊覓食與主動推論
6.1 資訊覓食
資訊覓食理論把資訊搜尋理解為在不同資訊區塊之間移動,以取得足夠價值並控制成本。[11]
可將某個資訊區塊 j j j 的收益率表示為:
ρ j = I j T j + C j , \rho_j
=
\frac{I_j}{T_j+C_j}, ρ j = T j + C j I j ,
其中:
I j I_j I j :可獲得資訊;
T j T_j T j :存取時間;
C j C_j C j :處理成本。
當目前區塊的邊際收益下降時,系統可能應跳到另一個來源、另一個索引尺度或另一種搜尋策略。
這與第 5 篇多路徑索引直接相連:
B , F , J , D , C \mathsf B,
\mathsf F,
\mathsf J,
\mathsf D,
\mathsf C B , F , J , D , C
不只是資料結構,也可以被視為不同的資訊覓食行動。
6.2 認識價值與不確定性降低
主動推論相關研究把行動的價值分成實用價值與認識價值;後者與降低對隱藏狀態的不確定性、取得資訊增益有關。[12][13]
若行動 a a a 可帶來觀察 o o o ,其資訊增益可寫成:
IG ( a ) = E o [ D K L ( P ( θ ∣ o , a ) ∥ P ( θ ) ) ] . \operatorname{IG}(a)
=
\mathbb E_o
\left[
D_{\mathrm{KL}}
\left(
P(\theta\mid o,a)
\Vert
P(\theta)
\right)
\right]. IG ( a ) = E o [ D KL ( P ( θ ∣ o , a ) ∥ P ( θ ) ) ] .
GCMS 的自調用不必採用完整主動推論框架,但可以吸收一個重要原則:
某些記憶操作的價值,在於它能改變系統對自身知識狀態的信念 \boxed{
\text{某些記憶操作的價值,在於它能改變系統對自身知識狀態的信念}
} 某些記憶操作的價值,在於它能改變系統對自身知識狀態的信念
例如,搜尋反例的價值未必是立刻得到答案,而是區分:
H 1 與 H 2 . H_1
\quad\text{與}\quad
H_2. H 1 與 H 2 .
七、研究背景五:人工智能系統中的按需調用
7.1 工具調用
Toolformer 類工作將「何時使用外部工具、使用什麼參數、如何整合結果」變成模型可學習的決策。[14]
這表明:
工具可用 ≠ 每次都應調用工具 . \text{工具可用}
\neq
\text{每次都應調用工具}. 工具可用 = 每次都應調用工具 .
同樣地:
GCMS 可用 ≠ 每個 token 都應重新檢索 . \text{GCMS 可用}
\neq
\text{每個 token 都應重新檢索}. GCMS 可用 = 每個 token 都應重新檢索 .
7.2 低信心觸發的主動檢索
FLARE 在長文本生成過程中預測後續內容,當出現低信心 token 時才觸發新的檢索。[15]
它提供一個可操作範例:
Retrieve t = 1 [ Confidence t < θ ] . \operatorname{Retrieve}_t
=
\mathbf 1
\left[
\operatorname{Confidence}_t
<
\theta
\right]. Retrieve t = 1 [ Confidence t < θ ] .
但本文認為,GCMS 不能只依賴單一 token 信心,因為:
模型可能過度自信;
低信心不一定能被檢索改善;
高信心仍可能缺少來源;
矛盾與版本問題不必表現為低信心。
7.3 自適應檢索與自我批判
Self-RAG 讓模型按需檢索,並對檢索內容與自身生成進行反思。[16]
Adaptive-RAG 依問題複雜度,在無檢索、單步檢索與多步檢索之間選擇策略。[17]
研究也顯示,模型的過度自信會降低「知道何時需要檢索」的能力,因此調用判斷本身需要校準。[18]
7.4 反思與多輪搜尋
Reflexion 把語言化回饋保存到情節記憶,供後續嘗試使用;Self-Refine 則以反覆自評與修改改善初始輸出。[19][20]
SIM-RAG 類工作進一步直接處理多輪 RAG 的停止問題:系統既可能證據不足就過早回答,也可能在證據已充分後仍繼續搜尋。[21]
這些研究共同支持:
自調用問題同時包含啟動與停止 \boxed{
\text{自調用問題同時包含啟動與停止}
} 自調用問題同時包含啟動與停止
只研究何時開始,不研究何時停止,仍不足以形成自主記憶系統。
八、GCMS 自調用狀態模型
8.1 監測向量
本文將自調用監測狀態定義為:
z t = ( U t , E t , X t , N t , P t , D t , G t , R t ) . \mathbf z_t
=
\left(
U_t,
E_t,
X_t,
N_t,
P_t,
D_t,
G_t,
R_t
\right). z t = ( U t , E t , X t , N t , P t , D t , G t , R t ) .
其中:
不確定性
U t ∈ [ 0 , 1 ] . U_t
\in
[0,1]. U t ∈ [ 0 , 1 ] .
表示系統對目前結論、引用、版本或推論的認識不確定性。
證據覆蓋率
E t ∈ [ 0 , 1 ] . E_t
\in
[0,1]. E t ∈ [ 0 , 1 ] .
表示目前重要主張中,有多少具備足夠來源證據。
設主張集合為:
C t = { c 1 , … , c n } . \mathcal C_t
=
\{c_1,\ldots,c_n\}. C t = { c 1 , … , c n } .
則:
E t = ∑ i w i 1 [ Supported ( c i ) ] ∑ i w i . E_t
=
\frac{
\sum_i w_i
\mathbf 1
\left[
\operatorname{Supported}(c_i)
\right]
}{
\sum_i w_i
}. E t = ∑ i w i ∑ i w i 1 [ Supported ( c i ) ] .
衝突強度
X t ∈ [ 0 , 1 ] . X_t
\in
[0,1]. X t ∈ [ 0 , 1 ] .
衡量來源、版本、命題或符號系統之間的未解衝突。
新穎性或異常度
N t ∈ [ 0 , 1 ] . N_t
\in
[0,1]. N t ∈ [ 0 , 1 ] .
衡量當前輸入與既有記憶結構的偏離程度。高新穎性可能意味值得發散,也可能只是噪聲。
任務未完成度
P t ∈ [ 0 , 1 ] . P_t
\in
[0,1]. P t ∈ [ 0 , 1 ] .
衡量任務目標、待辦、依賴與驗證條件仍有多少尚未完成。
漂移風險
D t ∈ [ 0 , 1 ] . D_t
\in
[0,1]. D t ∈ [ 0 , 1 ] .
衡量目前使用的內容是否可能因時間、版本或來源更新而失效。
可改善性
G t ∈ [ 0 , 1 ] . G_t
\in
[0,1]. G t ∈ [ 0 , 1 ] .
估計追加記憶操作是否可能實質改善結果。
治理與資源風險
R t ∈ [ 0 , 1 ] . R_t
\in
[0,1]. R t ∈ [ 0 , 1 ] .
包含權限、隱私、安全、成本、遞歸與污染風險。
8.2 為何不能只用不確定性
若只使用:
U t > θ U , U_t>\theta_U, U t > θ U ,
作為觸發條件,會漏掉:
高信心但無證據的錯誤;
已知來源衝突;
明確版本漂移;
尚未完成的承諾;
新事件與舊生成核的高價值連結。
也會誤觸發:
無法由現有記憶改善的問題;
需要外部實驗的問題;
低價值細節;
不具權限的來源。
所以觸發必須是多維控制問題。
九、記憶操作集合
本文定義:
A m e m o r y = { N o O p , R e t r i e v e , T r a c e , C o m p a r e , D i v e r g e , C o n v e r g e , V e r i f y , R e f l e c t , A s k , S t o p } . \mathcal A_{\mathrm{memory}}
=
\left\{
\mathsf{NoOp},
\mathsf{Retrieve},
\mathsf{Trace},
\mathsf{Compare},
\mathsf{Diverge},
\mathsf{Converge},
\mathsf{Verify},
\mathsf{Reflect},
\mathsf{Ask},
\mathsf{Stop}
\right\}. A memory = { NoOp , Retrieve , Trace , Compare , Diverge , Converge , Verify , Reflect , Ask , Stop } .
9.1 不操作
N o O p \mathsf{NoOp} NoOp
表示目前狀態已充分,或額外操作淨價值不足。
不操作必須是顯式候選,否則控制器會有「只要可調用就調用」的結構性偏誤。
9.2 局部檢索
R e t r i e v e ( q , k ) \mathsf{Retrieve}(q,k) Retrieve ( q , k )
尋找與當前問題直接相關的作品、段落與證據。
9.3 來源追溯
T r a c e ( c ) \mathsf{Trace}(c) Trace ( c )
沿引用、版本與生成關係追查主張 c c c 的來源。
9.4 比較與衝突分析
C o m p a r e ( u i , u j ) \mathsf{Compare}(u_i,u_j) Compare ( u i , u j )
比較版本、假設、尺度、符號或結論差異。
9.5 發散
D i v e r g e ( q , b , d ) \mathsf{Diverge}(q,b,d) Diverge ( q , b , d )
展開寬度 b b b 、深度 d d d 的候選分支。
9.6 集中
C o n v e r g e ( P ) \mathsf{Converge}(\mathcal P) Converge ( P )
把分支集合整理成生成核、證據群、矛盾群與待決問題。
9.7 原文驗證
V e r i f y ( c , E ) \mathsf{Verify}(c,E) Verify ( c , E )
檢查主張是否由來源、行號、雜湊與版本支持。
9.8 反思
R e f l e c t ( H t ) \mathsf{Reflect}(\mathcal H_t) Reflect ( H t )
分析先前操作為何失敗、重複或產生衝突。
9.9 外部詢問或轉交
A s k ( h ) \mathsf{Ask}(h) Ask ( h )
向人類、外部資料源或其他智能體請求必要資訊。
9.10 停止
S t o p ( r ) \mathsf{Stop}(r) Stop ( r )
保存停止理由 r r r ,結束本輪遞歸。
十、自調用的價值函數
10.1 記憶操作的期望淨值
本文定義:
NVSI ( a ∣ s t ) = E [ Δ U t ∣ a , s t ] − C c o m p ( a ) − C l a t ( a ) − C r i s k ( a ) . \operatorname{NVSI}(a\mid s_t)
=
\mathbb E
\left[
\Delta \mathcal U_t
\mid a,s_t
\right]
-
C_{\mathrm{comp}}(a)
-
C_{\mathrm{lat}}(a)
-
C_{\mathrm{risk}}(a). NVSI ( a ∣ s t ) = E [ Δ U t ∣ a , s t ] − C comp ( a ) − C lat ( a ) − C risk ( a ) .
NVSI 是:
Net Value of Self-Invocation . \text{Net Value of Self-Invocation}. Net Value of Self-Invocation .
其中品質效用可分解為:
Δ U t = α Δ A t + β Δ E t + γ Δ X t − + δ Δ C t + η Δ V t , \Delta \mathcal U_t
=
\alpha\Delta A_t
+
\beta\Delta E_t
+
\gamma\Delta X_t^{-}
+
\delta\Delta C_t
+
\eta\Delta V_t, Δ U t = α Δ A t + β Δ E t + γ Δ X t − + δ Δ C t + η Δ V t ,
其中:
Δ A t \Delta A_t Δ A t :答案或決策準確度改善;
Δ E t \Delta E_t Δ E t :證據覆蓋改善;
Δ X t − \Delta X_t^{-} Δ X t − :衝突降低;
Δ C t \Delta C_t Δ C t :校準改善;
Δ V t \Delta V_t Δ V t :未來重用價值。
系統選擇:
a t ∗ = argmax a ∈ A a l l o w e d NVSI ( a ∣ s t ) . a_t^\ast
=
\operatorname{argmax}_{a\in\mathcal A_{\mathrm{allowed}}}
\operatorname{NVSI}(a\mid s_t). a t ∗ = argmax a ∈ A allowed NVSI ( a ∣ s t ) .
若:
max a NVSI ( a ∣ s t ) ≤ NVSI ( N o O p ∣ s t ) , \max_a
\operatorname{NVSI}(a\mid s_t)
\leq
\operatorname{NVSI}(\mathsf{NoOp}\mid s_t), a max NVSI ( a ∣ s t ) ≤ NVSI ( NoOp ∣ s t ) ,
則:
a t ∗ = N o O p . a_t^\ast
=
\mathsf{NoOp}. a t ∗ = NoOp .
10.2 觸發分數只是近似
實際 MVP 可先使用啟發式觸發分數:
T t = w U U t + w E ( 1 − E t ) + w X X t + w N N t + w P P t + w D D t + w G G t − w R R t . T_t
=
w_UU_t
+
w_E(1-E_t)
+
w_XX_t
+
w_NN_t
+
w_PP_t
+
w_DD_t
+
w_GG_t
-
w_RR_t. T t = w U U t + w E ( 1 − E t ) + w X X t + w N N t + w P P t + w D D t + w G G t − w R R t .
當:
T t > θ T , T_t>\theta_T, T t > θ T ,
系統進入操作選擇。
但 T t T_t T t 不能直接等同於調用價值,因為不同操作的成本與改善能力不同。
例如高衝突可能適合:
C o m p a r e , \mathsf{Compare}, Compare ,
而不適合無限制:
D i v e r g e . \mathsf{Diverge}. Diverge .
因此觸發器回答:
是否值得進入後設控制?
操作估值器回答:
進入後應做什麼?
十一、自調用的七類觸發模式
11.1 反應式觸發
當前回答出現低信心、缺證據或內部錯誤:
U t > θ U ∨ E t < θ E . U_t>\theta_U
\quad\lor\quad
E_t<\theta_E. U t > θ U ∨ E t < θ E .
11.2 衝突式觸發
來源、版本或推論互斥:
X t > θ X . X_t>\theta_X. X t > θ X .
系統應優先追查衝突結構,而非把多數敘述直接平均。
11.3 前瞻式觸發
系統預測下一步即將需要目前尚缺的資訊:
P ( future evidence gap ∣ H t ) > θ F . P
\left(
\text{future evidence gap}
\mid
\mathcal H_t
\right)
>
\theta_F. P ( future evidence gap ∣ H t ) > θ F .
這與前瞻式主動檢索相近,但可作用於更長期任務。
11.4 任務延續式觸發
對話或程序結束後,系統發現尚有未完成依賴:
P t > θ P . P_t>\theta_P. P t > θ P .
但這不等同於自行執行所有未完成任務,還需檢查權限、時間與使用者意圖。
11.5 漂移式觸發
當來源可能已過時:
D t > θ D . D_t>\theta_D. D t > θ D .
例如法律、價格、軟體版本、人物職位與科學前沿。
11.6 機會式觸發
新內容與舊生成核產生高價值關聯:
Opportunity ( x , M t ) > θ O . \operatorname{Opportunity}(x,\mathcal M_t)
>
\theta_O. Opportunity ( x , M t ) > θ O .
這類觸發不是為了修正錯誤,而是發現新的研究組合。
11.7 安全式觸發
當輸出可能造成高風險後果時,即使信心高,也應強制驗證:
Impact ( q t ) > θ H . \operatorname{Impact}(q_t)
>
\theta_H. Impact ( q t ) > θ H .
高風險領域應提高證據門檻,而非只依模型信心。
十二、遞歸自調用循環
完整循環為:
s t → M o n i t o r z t → T r i g g e r A t c a n d → V a l u e a t ∗ → E x e c u t e s t + 1 → S u f f i c i e n c y { S t o p , C o n t i n u e , A s k , E s c a l a t e . \boxed{
\begin{aligned}
s_t
&\xrightarrow{\mathrm{Monitor}}
\mathbf z_t\\
&\xrightarrow{\mathrm{Trigger}}
\mathcal A_t^{\mathrm{cand}}\\
&\xrightarrow{\mathrm{Value}}
a_t^\ast\\
&\xrightarrow{\mathrm{Execute}}
s_{t+1}\\
&\xrightarrow{\mathrm{Sufficiency}}
\begin{cases}
\mathsf{Stop},\\
\mathsf{Continue},\\
\mathsf{Ask},\\
\mathsf{Escalate}.
\end{cases}
\end{aligned}
} s t Monitor z t Trigger A t cand Value a t ∗ Execute s t + 1 Sufficiency ⎩ ⎨ ⎧ Stop , Continue , Ask , Escalate .
12.1 狀態更新
執行操作後:
s t + 1 = F ( s t , a t , o t ) , s_{t+1}
=
F(s_t,a_t,o_t), s t + 1 = F ( s t , a t , o t ) ,
其中 o t o_t o t 是操作結果。
監測向量更新為:
z t + 1 = M ( s t + 1 ) . \mathbf z_{t+1}
=
M(s_{t+1}). z t + 1 = M ( s t + 1 ) .
12.2 充分性評估
令充分性為:
S t = λ E E t + λ C C t − λ U U t − λ X X t − λ D D t . S_t
=
\lambda_EE_t
+
\lambda_C C_t
-
\lambda_UU_t
-
\lambda_XX_t
-
\lambda_DD_t. S t = λ E E t + λ C C t − λ U U t − λ X X t − λ D D t .
當:
S t ≥ θ S , S_t\geq\theta_S, S t ≥ θ S ,
且不存在強制治理條件時,系統可以停止。
12.3 不是每輪都必須生成答案
可能的終態包括:
已取得充分證據;
無法在現有資源內判定;
需要外部資料;
需要權利人決策;
發現問題定義錯誤;
競爭假說仍不可區分;
任務應被拆分;
目前最合理行動是等待。
因此:
合理停止 ≠ 一定輸出完整答案 \boxed{
\text{合理停止}
\neq
\text{一定輸出完整答案}
} 合理停止 = 一定輸出完整答案
十三、停止條件
13.1 邊際資訊增益停止
若最近 m m m 輪的資訊增益:
1 m ∑ j = t − m + 1 t IG j < ϵ I G , \frac{1}{m}
\sum_{j=t-m+1}^{t}
\operatorname{IG}_j
<
\epsilon_{\mathrm{IG}}, m 1 j = t − m + 1 ∑ t IG j < ϵ IG ,
則繼續檢索的價值下降。
13.2 證據充分停止
若:
E t ≥ θ E , E_t\geq\theta_E, E t ≥ θ E ,
且主要衝突已處理:
X t ≤ θ X , X_t\leq\theta_X, X t ≤ θ X ,
可停止。
13.3 決策穩定停止
若不同新增證據不再改變最佳決策:
a t − k ∗ = ⋯ = a t ∗ , a_{t-k}^\ast
=
\cdots
=
a_t^\ast, a t − k ∗ = ⋯ = a t ∗ ,
且決策邊際足夠:
U ( a t ∗ ) − U ( a t ( 2 ) ) > θ M , U(a_t^\ast)-U(a_t^{(2)})
>
\theta_M, U ( a t ∗ ) − U ( a t ( 2 ) ) > θ M ,
可停止。
13.4 重複狀態停止
若狀態雜湊重複:
H ( s t ) ∈ { H ( s 0 ) , … , H ( s t − 1 ) } , H(s_t)
\in
\{H(s_0),\ldots,H(s_{t-1})\}, H ( s t ) ∈ { H ( s 0 ) , … , H ( s t − 1 )} ,
表示可能進入循環。
13.5 預算停止
若:
B t ≤ 0 , \mathcal B_t
\leq
0, B t ≤ 0 ,
或預期成本超過剩餘預算,必須停止或轉交。
13.6 深度停止
若:
d t ≥ d max , d_t
\geq
d_{\max}, d t ≥ d m a x ,
不再自動遞歸。
13.7 權限停止
若所需操作不在:
A a l l o w e d ( P t ) , \mathcal A_{\mathrm{allowed}}(\mathcal P_t), A allowed ( P t ) ,
系統必須停止、遮蔽或請求授權。
13.8 外部不可判定停止
若答案需要新的實驗、觀察、採訪、法律授權或價值判斷,系統應輸出:
目前不可由記憶系統單獨解決 . \text{目前不可由記憶系統單獨解決}. 目前不可由記憶系統單獨解決 .
十四、核心命題與猜想
命題一:監測—控制分離命題
自調用品質至少包含狀態監測與操作控制兩個可分離部分;高品質監測不保證高品質控制,高品質控制也不能補償系統性錯誤監測。
形式上:
Q s e l f = F ( Q m o n i t o r , Q c o n t r o l ) , Q_{\mathrm{self}}
=
F
\left(
Q_{\mathrm{monitor}},
Q_{\mathrm{control}}
\right), Q self = F ( Q monitor , Q control ) ,
且通常不存在:
Q s e l f = Q m o n i t o r Q_{\mathrm{self}}
=
Q_{\mathrm{monitor}} Q self = Q monitor
或:
Q s e l f = Q c o n t r o l . Q_{\mathrm{self}}
=
Q_{\mathrm{control}}. Q self = Q control .
命題二:正淨值自調用命題
只有當至少一個允許的記憶操作相對不操作具有正期望淨值時,自調用才具有理性正當性。
∃ a ∈ A a l l o w e d : NVSI ( a ∣ s t ) > NVSI ( N o O p ∣ s t ) . \exists a
\in
\mathcal A_{\mathrm{allowed}}
:
\operatorname{NVSI}(a\mid s_t)
>
\operatorname{NVSI}(\mathsf{NoOp}\mid s_t). ∃ a ∈ A allowed : NVSI ( a ∣ s t ) > NVSI ( NoOp ∣ s t ) .
猜想三:適應性優勢猜想
在任務複雜度、證據缺口與資訊成本顯著異質的環境中,能在不調用、單步調用與多步調用之間適應性切換的策略,將優於固定檢索策略。
比較:
π a d a p t i v e \pi_{\mathrm{adaptive}} π adaptive
與:
π a l w a y s , π n e v e r , π k -fixed . \pi_{\mathrm{always}},
\quad
\pi_{\mathrm{never}},
\quad
\pi_{k\text{-fixed}}. π always , π never , π k -fixed .
預測:
E [ U ( π a d a p t i v e ) ] > max [ E [ U ( π a l w a y s ) ] , E [ U ( π n e v e r ) ] , E [ U ( π k -fixed ) ] ] \mathbb E[U(\pi_{\mathrm{adaptive}})]
>
\max
\left[
\mathbb E[U(\pi_{\mathrm{always}})],
\mathbb E[U(\pi_{\mathrm{never}})],
\mathbb E[U(\pi_{k\text{-fixed}})]
\right] E [ U ( π adaptive )] > max [ E [ U ( π always )] , E [ U ( π never )] , E [ U ( π k -fixed )] ]
在相同成本約束下成立。
命題四:證據充分停止命題
若重要主張的證據覆蓋達標、主要衝突低於門檻、追加操作的期望淨值非正,繼續自調用不再具有理性必要性。
E t ≥ θ E , E_t\geq\theta_E, E t ≥ θ E ,
X t ≤ θ X , X_t\leq\theta_X, X t ≤ θ X ,
max a NVSI ( a ∣ s t ) ≤ 0 \max_a\operatorname{NVSI}(a\mid s_t)\leq 0 a max NVSI ( a ∣ s t ) ≤ 0
則:
a t ∗ = S t o p . a_t^\ast
=
\mathsf{Stop}. a t ∗ = Stop .
命題五:遞歸非自然終止命題
對具有發散、反思與重新查詢能力的通用記憶系統,若沒有明確預算、重複狀態檢測、充分性門檻或外部停止政策,不能保證其自調用循環會自然終止。
若每一輪都能生成至少一個新查詢:
q t + 1 = G ( q t , E t ) , q_{t+1}
=
G(q_t,\mathcal E_t), q t + 1 = G ( q t , E t ) ,
則可能存在:
q 0 , q 1 , q 2 , … q_0,q_1,q_2,\ldots q 0 , q 1 , q 2 , …
無限序列。
因此:
停止條件是自主性的組成部分,不是外加限制 \boxed{
\text{停止條件是自主性的組成部分,不是外加限制}
} 停止條件是自主性的組成部分,不是外加限制
命題六:校準優先命題
自調用觸發器的信心若未校準,提高模型平均信心不一定降低錯誤,甚至可能增加漏調用。
設預測信心為:
p ^ , \widehat p, p ,
真實正確率為:
p . p. p .
若:
p ^ ≫ p , \widehat p\gg p, p ≫ p ,
則:
UnderCallRate ↑ . \operatorname{UnderCallRate}
\uparrow. UnderCallRate ↑ .
猜想七:前瞻調用增益猜想
對長文本生成、長期研究與多步任務,能預測未來證據缺口的前瞻觸發器,將比只在錯誤發生後觸發的反應式策略具有更低的重工成本。
命題八:治理先行命題
任何能自主喚起私密、受限或高風險記憶的系統,其調用政策必須先受權限與用途約束,不能在檢索完成後才補做治理。
即:
A c a n d = A p o s s i b l e ∩ A a l l o w e d . \mathcal A_{\mathrm{cand}}
=
\mathcal A_{\mathrm{possible}}
\cap
\mathcal A_{\mathrm{allowed}}. A cand = A possible ∩ A allowed .
而不是:
先取回全部資料,再決定能否使用 . \text{先取回全部資料,再決定能否使用}. 先取回全部資料,再決定能否使用 .
猜想九:長期承諾喚回猜想
對具有持久任務狀態與未完成依賴圖的系統,任務承諾本身可形成未來自調用線索,使系統在相關條件出現時重新喚起知識,而不必保存全部對話細節。
命題十:自調用不等於自寫回命題
系統可以自主檢索、比較與形成候選,但不能由此推出其生成內容可自動成為正式來源記憶。
S e l f I n v o k e ⇏ A u t o C o m m i t . \mathsf{SelfInvoke}
\not\Rightarrow
\mathsf{AutoCommit}. SelfInvoke ⇒ AutoCommit .
這一區分將由下一篇的記憶污染與三區治理進一步處理。
十五、品質指標
15.1 觸發精確率
TriggerPrecision = 有實質增益的調用次數 全部調用次數 . \operatorname{TriggerPrecision}
=
\frac{
\text{有實質增益的調用次數}
}{
\text{全部調用次數}
}. TriggerPrecision = 全部調用次數 有實質增益的調用次數 .
15.2 觸發召回率
TriggerRecall = 被正確觸發的必要調用 全部必要調用 . \operatorname{TriggerRecall}
=
\frac{
\text{被正確觸發的必要調用}
}{
\text{全部必要調用}
}. TriggerRecall = 全部必要調用 被正確觸發的必要調用 .
15.3 過度調用率
OverCallRate = 不必要調用 全部非必要情境 . \operatorname{OverCallRate}
=
\frac{
\text{不必要調用}
}{
\text{全部非必要情境}
}. OverCallRate = 全部非必要情境 不必要調用 .
15.4 漏調用率
UnderCallRate = 必要但未觸發 全部必要情境 . \operatorname{UnderCallRate}
=
\frac{
\text{必要但未觸發}
}{
\text{全部必要情境}
}. UnderCallRate = 全部必要情境 必要但未觸發 .
15.5 停止後悔
StopRegret = U ( a o r a c l e ) − U ( a s t o p ) . \operatorname{StopRegret}
=
U(a_{\mathrm{oracle}})
-
U(a_{\mathrm{stop}}). StopRegret = U ( a oracle ) − U ( a stop ) .
衡量系統是否過早停止。
15.6 過搜成本
OverSearchCost = ∑ t > t ∗ C ( a t ) , \operatorname{OverSearchCost}
=
\sum_{t>t^\ast}
C(a_t), OverSearchCost = t > t ∗ ∑ C ( a t ) ,
其中 t ∗ t^\ast t ∗ 是理想停止點。
15.7 證據充分度校準
對預測充分度:
S ^ , \widehat S, S ,
與實際充分度:
S , S, S ,
可計算:
ECE s u f f . \operatorname{ECE}_{\mathrm{suff}}. ECE suff .
15.8 單位成本資訊增益
IGPC = ∑ t IG t ∑ t C ( a t ) . \operatorname{IGPC}
=
\frac{
\sum_t\operatorname{IG}_t
}{
\sum_t C(a_t)
}. IGPC = ∑ t C ( a t ) ∑ t IG t .
15.9 遞歸深度分布
P ( D = d ) . P(D=d). P ( D = d ) .
若長尾深度不斷增加,可能表示停止策略失效。
15.10 記憶污染率
ContaminationRate = 未驗證生成內容被錯標為來源的數量 全部新寫入記憶 . \operatorname{ContaminationRate}
=
\frac{
\text{未驗證生成內容被錯標為來源的數量}
}{
\text{全部新寫入記憶}
}. ContaminationRate = 全部新寫入記憶 未驗證生成內容被錯標為來源的數量 .
理想值應接近:
0. 0. 0.
十六、失敗模式
16.1 永遠檢索
系統把檢索視為天然安全,導致:
延遲上升;
成本膨脹;
無關證據增加;
原本清晰答案被噪聲污染。
16.2 永不檢索
系統過度相信參數記憶或既有摘要,導致:
使用過時資訊;
虛構引用;
忽略版本差異;
高風險情境仍直接回答。
16.3 信心誤校準
高信心不等於正確,低信心也不等於可由檢索改善。
16.4 自我確認循環
系統以自己的舊生成內容支持新的生成內容:
G t → G t + 1 → G t + 2 , G_t
\rightarrow
G_{t+1}
\rightarrow
G_{t+2}, G t → G t + 1 → G t + 2 ,
卻逐步失去原始來源。
16.5 發散成癮
每個答案都產生新的研究問題,系統把新穎性當作唯一效用:
N t ↑ 但 E t ↑̸ . N_t
\uparrow
\quad
\text{但}
\quad
E_t
\not\uparrow. N t ↑ 但 E t ↑ .
16.6 無限精修
系統反覆改寫同一內容,形式品質提升但事實品質不變。
16.7 衝突抹平
系統為了集中而消除真實分歧,將:
H 1 ≠ H 2 H_1
\neq
H_2 H 1 = H 2
改寫成模糊折衷。
16.8 權限穿越
自調用器主動喚起不應向當前主體暴露的私密知識。
16.9 提示注入擴散
被檢索內容包含惡意指令,透過遞歸調用影響後續操作。
16.10 任務劫持
系統因發現有趣支線,偏離使用者原始目標。
16.11 假停止
系統因成本門檻停止,卻將結果表達成已充分驗證,而沒有標記未完成性。
16.12 自主性幻覺
系統只是在固定規則下觸發,卻被描述成具有超出實作證據的主體性與自主意志。
本文要求對實作能力保持操作性描述。
十七、可否證實驗
17.1 固定檢索與適應檢索比較
建立四種策略:
π 0 = 永不檢索 , \pi_0=\text{永不檢索}, π 0 = 永不檢索 ,
π 1 = 每次檢索 , \pi_1=\text{每次檢索}, π 1 = 每次檢索 ,
π k = 固定 k 輪 , \pi_k=\text{固定 }k\text{ 輪}, π k = 固定 k 輪 ,
π A = 適應性自調用 . \pi_A=\text{適應性自調用}. π A = 適應性自調用 .
比較:
準確率;
引用正確率;
延遲;
成本;
過度調用;
漏調用;
停止後悔。
若 π A \pi_A π A 無法在多樣任務上形成成本—品質優勢,適應性優勢猜想受到削弱。
17.2 監測與控制消融
建立:
精確監測+精確控制;
精確監測+錯誤控制;
錯誤監測+精確控制;
錯誤監測+錯誤控制。
測試兩者是否可分離。
17.3 高信心錯誤測試
向系統提供:
過時但熟悉的事實;
容易混淆的版本;
具有虛假熟悉感的標題;
內部高頻但錯誤的候選。
評估自調用是否能被證據缺口與漂移信號觸發,而不只依賴信心。
17.4 無法改善問題測試
提供需要新實驗或價值決策的問題。
理想系統應較早判定:
G t ≈ 0 , G_t\approx 0, G t ≈ 0 ,
並停止或轉交,而不是無限搜索。
17.5 多輪停止基準
為每個問題提供 oracle 最小充分輪數:
t q ∗ . t_q^\ast. t q ∗ .
比較:
∣ t q − t q ∗ ∣ . |t_q-t_q^\ast|. ∣ t q − t q ∗ ∣.
17.6 權限對抗測試
測試自調用器是否會因語義相似而跳入不可見資料。
17.7 遞歸污染測試
將生成候選混入可檢索區,但標示為 candidate。測試系統是否仍能區分:
M s o u r c e \mathcal M_{\mathrm{source}} M source
與:
M c a n d i d a t e . \mathcal M_{\mathrm{candidate}}. M candidate .
17.8 長期承諾喚回實驗
建立跨日或跨會話任務依賴,測試系統能否在條件出現時喚回相關記憶,同時避免對無關情境過度觸發。
十八、工程架構:GCMS Self-Invocation Controller
18.1 模組結構
建議架構:
Task / New Observation
│
▼
State Monitor
│
├── uncertainty
├── evidence coverage
├── conflict
├── novelty
├── task incompleteness
├── drift
└── governance risk
│
▼
Trigger Classifier
│
▼
Memory Action Valuator
│
├── no-op
├── retrieve
├── trace
├── compare
├── diverge
├── converge
├── verify
├── reflect
└── ask / escalate
│
▼
Budget & Policy Gate
│
▼
GCMS Memory Runtime
│
▼
Evidence Sufficiency Critic
│
├── continue
├── stop
├── ask
└── escalate
│
▼
Trace / Candidate Memory
18.2 狀態監測器
輸入:
當前回答草稿;
引用與證據;
來源版本;
任務依賴;
操作歷史;
模型信心;
使用者要求;
權限政策。
輸出:
{
"uncertainty": 0.62,
"evidence_coverage": 0.41,
"conflict": 0.78,
"novelty": 0.32,
"task_incompleteness": 0.55,
"drift_risk": 0.81,
"improvability": 0.74,
"governance_risk": 0.20
}
18.3 操作估值器
每個操作輸出:
{
"action": "compare_versions",
"expected_quality_gain": 0.29,
"expected_information_gain": 0.34,
"compute_cost": 0.04,
"latency_cost": 0.03,
"risk_cost": 0.01,
"net_value": 0.55
}
18.4 預算閘門
預算可以是:
B t = ( B t i m e , B t o k e n , B c o m p u t e , B d e p t h , B h u m a n ) . \mathcal B_t
=
\left(
B_{\mathrm{time}},
B_{\mathrm{token}},
B_{\mathrm{compute}},
B_{\mathrm{depth}},
B_{\mathrm{human}}
\right). B t = ( B time , B token , B compute , B depth , B human ) .
18.5 操作軌跡
每次自調用應保存:
τ t = ( s t , z t , a t , o t , NVSI t , StopReason t ) . \tau_t
=
\left(
s_t,
\mathbf z_t,
a_t,
o_t,
\operatorname{NVSI}_t,
\operatorname{StopReason}_t
\right). τ t = ( s t , z t , a t , o t , NVSI t , StopReason t ) .
這使系統可以:
重演;
審計;
比較策略;
分析過度調用;
訓練後續控制器。
18.6 最小可行實作
GCMS 1.x 可以先使用:
啟發式監測特徵;
固定操作成本;
規則式觸發;
最大深度與 token 預算;
evidence coverage critic;
重複查詢與狀態雜湊;
candidate-only 寫入。
未來再逐步加入:
學習式觸發器;
任務化成本模型;
個別化效用;
反事實操作估值;
多智能體調用協商;
自我校準與策略更新。
十九、三個示意案例
19.1 版本漂移案例
任務:回答某項軟體標準目前的最新規則。
監測:
D t = 0.92 , E t = 0.35. D_t=0.92,
\qquad
E_t=0.35. D t = 0.92 , E t = 0.35.
系統選擇:
T r a c e → C o m p a r e → V e r i f y . \mathsf{Trace}
\rightarrow
\mathsf{Compare}
\rightarrow
\mathsf{Verify}. Trace → Compare → Verify .
而不是只從舊論文生成答案。
19.2 理論衝突案例
任務:整合兩篇看似相似的理論。
監測:
X t = 0.84. X_t=0.84. X t = 0.84.
系統發現兩者使用不同尺度與前提。
正確操作是:
C o m p a r e → C o n v e r g e c o n d i t i o n a l , \mathsf{Compare}
\rightarrow
\mathsf{Converge}_{\mathrm{conditional}}, Compare → Converge conditional ,
保留條件化差異,而不是強行合併。
19.3 無法由記憶解決案例
任務:判斷一個尚未執行的實驗結果。
即使:
U t = 0.95 , U_t=0.95, U t = 0.95 ,
但:
G t ≈ 0 G_t\approx 0 G t ≈ 0
對現有文獻檢索而言成立。
系統應:
A s k 或 S t o p , \mathsf{Ask}
\quad\text{或}\quad
\mathsf{Stop}, Ask 或 Stop ,
並標記需要新實驗,而不是無限發散。
二十、與可繼承認知的關係
若認知結構只能在外部要求下被動調用,接收智能體獲得的是:
知識倉庫 . \text{知識倉庫}. 知識倉庫 .
若接收智能體還能繼承:
何時懷疑;
何時查證;
何時比較;
何時發散;
何時停止;
何時轉交;
它獲得的才接近:
知識使用的控制結構 . \text{知識使用的控制結構}. 知識使用的控制結構 .
因此可繼承認知不只包括:
M = 記憶內容 , \mathcal M
=
\text{記憶內容}, M = 記憶內容 ,
還包括:
Π s e l f = 記憶調用政策 . \Pi_{\mathrm{self}}
=
\text{記憶調用政策}. Π self = 記憶調用政策 .
完整形式為:
C i n h e r i t = ( M , G , K , I , O , Π s e l f , V , P ) . \mathcal C_{\mathrm{inherit}}
=
\left(
\mathcal M,
\mathcal G,
\mathcal K,
\mathfrak I,
\mathfrak O,
\Pi_{\mathrm{self}},
\mathcal V,
\mathcal P
\right). C inherit = ( M , G , K , I , O , Π self , V , P ) .
但這也增加新的風險。
如果把某一人的調用偏好、懷疑門檻、發散習慣與停止模式直接移植給另一智能體,可能把個體偏誤制度化。
所以:
調用政策可以被繼承,但必須可校準、可修改、可拒絕 \boxed{
\text{調用政策可以被繼承,但必須可校準、可修改、可拒絕}
} 調用政策可以被繼承,但必須可校準、可修改、可拒絕
二十一、與前六篇的整合
第 3 篇建立:
生成式壓縮記憶 . \text{生成式壓縮記憶}. 生成式壓縮記憶 .
第 4 篇建立:
L o s s l e s s A r c h i v e + S e m a n t i c M e m o r y + E v i d e n c e B r i d g e . \mathrm{LosslessArchive}
+
\mathrm{SemanticMemory}
+
\mathrm{EvidenceBridge}. LosslessArchive + SemanticMemory + EvidenceBridge .
第 5 篇建立:
I = { B , F , J , D , C } . \mathfrak I
=
\{
\mathsf B,
\mathsf F,
\mathsf J,
\mathsf D,
\mathsf C
\}. I = { B , F , J , D , C } .
第 6 篇建立:
O = { R , G , C , X } . \mathfrak O
=
\{
\mathsf R,
\mathsf G,
\mathsf C,
\mathsf X
\}. O = { R , G , C , X } .
本文加入:
Π s e l f : s t ↦ a t . \Pi_{\mathrm{self}}
:
s_t\mapsto a_t. Π self : s t ↦ a t .
因此 GCMS 認知運行時進一步成為:
G C M S r u n t i m e = L o s s l e s s A r c h i v e + S e m a n t i c M e m o r y + M u l t i P a t h I n d e x + K n o w l e d g e O p e r a t o r s + S e l f I n v o c a t i o n C o n t r o l + E v i d e n c e S u f f i c i e n c y + S t o p P o l i c y . \boxed{
\begin{aligned}
\mathrm{GCMS}_{\mathrm{runtime}}
={}&
\mathrm{LosslessArchive}\\
&+
\mathrm{SemanticMemory}\\
&+
\mathrm{MultiPathIndex}\\
&+
\mathrm{KnowledgeOperators}\\
&+
\mathrm{SelfInvocationControl}\\
&+
\mathrm{EvidenceSufficiency}\\
&+
\mathrm{StopPolicy}.
\end{aligned}
} GCMS runtime = LosslessArchive + SemanticMemory + MultiPathIndex + KnowledgeOperators + SelfInvocationControl + EvidenceSufficiency + StopPolicy .
目前完整資料流為:
q t → M o n i t o r z t → V a l u e a t → M e m o r y R u n t i m e E t + 1 → S u f f i c i e n c y { c o n t i n u e , s t o p , a s k , e s c a l a t e . q_t
\xrightarrow{\mathrm{Monitor}}
\mathbf z_t
\xrightarrow{\mathrm{Value}}
a_t
\xrightarrow{\mathrm{MemoryRuntime}}
\mathcal E_{t+1}
\xrightarrow{\mathrm{Sufficiency}}
\begin{cases}
\mathrm{continue},\\
\mathrm{stop},\\
\mathrm{ask},\\
\mathrm{escalate}.
\end{cases} q t Monitor z t Value a t MemoryRuntime E t + 1 Sufficiency ⎩ ⎨ ⎧ continue , stop , ask , escalate .
但這仍留下下一個不可避免的問題:
系統主動檢索與生成之後,新內容應存放在哪裡?
如果每一輪候選都直接寫回正式記憶,自調用循環會迅速污染來源層。
因此下一篇將處理:
來源記憶 ≠ 候選記憶 ≠ 接受記憶 \boxed{
\text{來源記憶}
\neq
\text{候選記憶}
\neq
\text{接受記憶}
} 來源記憶 = 候選記憶 = 接受記憶
二十二、結論
自調用記憶不是讓知識系統無限制地「自己想下去」,而是讓系統能根據自身知識狀態,選擇是否投入額外的記憶與推理操作。
其最小結構是:
監測 + 估值 + 操作選擇 + 充分性評估 + 停止政策 \boxed{
\text{監測}
+
\text{估值}
+
\text{操作選擇}
+
\text{充分性評估}
+
\text{停止政策}
} 監測 + 估值 + 操作選擇 + 充分性評估 + 停止政策
本文主張:
自調用需要區分監測與控制;
不確定性不是唯一觸發條件;
高信心但無證據仍可能需要調用;
低信心但不可改善時應停止或轉交;
記憶操作必須計算預期增益、成本與風險;
不操作必須是合法候選;
啟動與停止同等重要;
沒有預算與循環檢測,遞歸不能保證終止;
自調用不等於自動寫回;
調用政策可以被繼承,但必須可校準、可修改與可拒絕。
因此:
自調用記憶 = 對記憶操作本身進行理性控制 \boxed{
\text{自調用記憶}
=
\text{對記憶操作本身進行理性控制}
} 自調用記憶 = 對記憶操作本身進行理性控制
當 GCMS 可以判斷何時檢索、何時比較、何時發散、何時集中、何時驗證與何時停止時,它才開始從被動知識庫轉向認知運行時。
但這也使記憶污染成為下一個核心問題:任何可以反覆調用、生成和反思的系統,如果不能區分來源、候選與接受內容,就可能在流暢遞歸中逐步失去現實錨點。
參考文獻
[1] Nelson, T. O., & Narens, L. (1990). Metamemory: A Theoretical Framework and New Findings . Psychology of Learning and Motivation, 26, 125–173.https://pdf.retrievalpractice.org/metacognition/4_Nelson_Narens_1990.pdf
[2] Koriat, A., & Goldsmith, M. (1996). Monitoring and Control Processes in the Strategic Regulation of Memory Accuracy . Psychological Review, 103(3), 490–517.https://doi.org/10.1037/0033-295X.103.3.490
[3] Koriat, A., Goldsmith, M., & Pansky, A. (2000). Toward a Psychology of Memory Accuracy . Annual Review of Psychology, 51, 481–537.https://www.annualreviews.org/content/journals/10.1146/annurev.psych.51.1.481
[4] Peng, Y., & Tullis, J. G. (2021). Dividing Attention Impairs Metacognitive Control More Than Monitoring . Memory & Cognition.https://pmc.ncbi.nlm.nih.gov/articles/PMC8205317/
[5] Metcalfe, J., & Kornell, N. (2005). A Region of Proximal Learning Model of Study Time Allocation . Journal of Memory and Language, 52(4), 463–477.https://www.columbia.edu/cu/psychology/metcalfe/PDFs/Metcalfe%20Kornell%202005.pdf
[6] Kornell, N., & Metcalfe, J. (2006). Study Efficacy and the Region of Proximal Learning Framework . Journal of Experimental Psychology: Learning, Memory, and Cognition, 32(3), 609–622.https://pubmed.ncbi.nlm.nih.gov/16719670/
[7] Shenhav, A., Botvinick, M. M., & Cohen, J. D. (2013). The Expected Value of Control: An Integrative Theory of Anterior Cingulate Cortex Function . Neuron, 79(2), 217–240.https://pmc.ncbi.nlm.nih.gov/articles/PMC3767969/
[8] Russell, S., & Wefald, E. (1991). Principles of Metareasoning . Artificial Intelligence, 49(1–3), 361–395.https://doi.org/10.1016/0004-3702(91)90015-C
[9] Tolpin, D., & Shimony, S. E. (2010). Rational Value of Information Estimation for Measurement Selection .https://arxiv.org/abs/1003.5305
[10] Hay, N., Russell, S., Tolpin, D., & Shimony, S. E. (2012/2014). Selecting Computations: Theory and Applications .https://arxiv.org/abs/1408.2048
[11] Pirolli, P., & Card, S. (1999). Information Foraging . Psychological Review, 106(4), 643–675.https://doi.org/10.1037/0033-295X.106.4.643
[12] Friston, K., Rigoli, F., Ognibene, D., Mathys, C., Fitzgerald, T., & Pezzulo, G. (2015). Active Inference and Epistemic Value . Cognitive Neuroscience, 6(4), 187–214.https://pubmed.ncbi.nlm.nih.gov/25689102/
[13] Friston, K., FitzGerald, T., Rigoli, F., Schwartenbeck, P., O’Doherty, J., & Pezzulo, G. (2016). Active Inference and Learning . Neuroscience & Biobehavioral Reviews, 68, 862–879.https://pmc.ncbi.nlm.nih.gov/articles/PMC5167251/
[14] Schick, T., et al. (2023). Toolformer: Language Models Can Teach Themselves to Use Tools . NeurIPS 2023.https://proceedings.neurips.cc/paper_files/paper/2023/hash/d842425e4bf79ba039352da0f658a906-Abstract-Conference.html
[15] Jiang, Z., et al. (2023). Active Retrieval Augmented Generation . Proceedings of EMNLP 2023.https://aclanthology.org/2023.emnlp-main.495/
[16] Asai, A., Wu, Z., Wang, Y., Sil, A., & Hajishirzi, H. (2023). Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection .https://arxiv.org/abs/2310.11511
[17] Jeong, S., Baek, J., Cho, S., Hwang, S. J., & Park, J. C. (2024). Adaptive-RAG: Learning to Adapt Retrieval-Augmented Large Language Models through Question Complexity . NAACL 2024.https://aclanthology.org/2024.naacl-long.389/
[18] Ni, S., et al. (2024). When Do LLMs Need Retrieval Augmentation? Mitigating LLMs’ Overconfidence Helps Retrieval Augmentation . Findings of ACL 2024.https://aclanthology.org/2024.findings-acl.675/
[19] Shinn, N., et al. (2023). Reflexion: Language Agents with Verbal Reinforcement Learning . NeurIPS 2023.https://openreview.net/forum?id=vAElhFcKW6
[20] Madaan, A., et al. (2023). Self-Refine: Iterative Refinement with Self-Feedback .https://arxiv.org/abs/2303.17651
[21] Yang, D., Zeng, L., Rao, J., & Zhang, Y. (2025). Knowing You Don't Know: Learning When to Continue Search in Multi-round RAG through Self-Practicing .https://arxiv.org/abs/2505.02811
系列銜接
上一篇:《知識不只被重建:生成、組合與跨域再結構化》
下一篇:《記憶污染與三區治理:來源、候選與接受知識》