← Archive
lm-002129 · 2026-08

07_自調用記憶_知識系統何時應該主動喚起自身

下載 MD 檔 ⬇

自調用記憶:知識系統何時應該主動喚起自身?

系列:可繼承的認知:從自我解構到遞歸生成式記憶系統(第 7 篇)
作者:Neo.K
研究協作:Aletheia(阿萊)
版本:v1.0
日期:2026-07-30
文章類型:命題猜想論文/後設認知控制論文/GCMS 自調用架構論文


摘要

知識系統通常只有在收到明確查詢時才檢索記憶。然而,一個面向長期研究、複雜任務與多智能體協作的生成式壓縮記憶系統,不能只依賴外部命令。它還需要辨認:目前回答是否過度依賴不可靠內部記憶、證據是否不足、來源是否衝突、任務是否尚未完成、既有知識是否已過期,以及新的觀察是否值得喚起相關理論。本文將這種能力稱為「自調用記憶」。此處的「自」不是人格、意識或第一人稱主體性的聲稱,而是指系統能監測自身當前知識狀態,並依政策主動選擇記憶操作。

本文從後設記憶的監測—控制框架、記憶報告的策略調節、學習時間分配、控制的預期價值、理性後設推理、資訊覓食、主動推論與近年的自適應檢索系統出發,提出 GCMS 自調用控制模型。設系統在時間 tt 的監測狀態為:

zt=(Ut,Et,Xt,Nt,Pt,Dt,Rt),\mathbf z_t = \left( U_t, E_t, X_t, N_t, P_t, D_t, R_t \right),

其中 UtU_t 為不確定性, EtE_t 為證據覆蓋率, XtX_t 為衝突強度, NtN_t 為新穎性或異常度, PtP_t 為任務未完成度, DtD_t 為知識漂移風險, RtR_t 為治理與資源風險。系統不應只用單一信心閾值決定是否檢索,而應比較各種記憶操作的期望淨價值:

NVSI(ast)=E[ΔUa,st]Ccomp(a)Clat(a)Crisk(a),\operatorname{NVSI}(a\mid s_t) = \mathbb E \left[ \Delta \mathcal U \mid a,s_t \right] - C_{\mathrm{comp}}(a) - C_{\mathrm{lat}}(a) - C_{\mathrm{risk}}(a),

其中 aa 可以是不調用、局部檢索、版本回溯、矛盾搜尋、發散搜尋、集中整理、外部查證或轉交人類。只有當某個操作的淨價值高於不操作,且滿足權限、預算與遞歸深度條件時,系統才應主動喚起記憶。

本文提出「監測—控制分離命題」、「正淨值自調用命題」、「適應性優勢猜想」、「證據充分停止命題」、「遞歸非自然終止命題」與「校準優先命題」。本文也主張,自調用能力的品質不能只以回答準確率衡量,還必須評估過度調用率、漏調用率、停止後悔、證據充分度校準、單位成本資訊增益、遞歸深度與記憶污染風險。沒有停止條件的自調用不是自主研究,而可能只是計算膨脹、自我引用與無限精修。

因此,GCMS 自調用記憶的完整形式不是:

遇到問題就一直搜索,\text{遇到問題就一直搜索},

而是:

監測估值選擇記憶操作評估充分性停止、繼續或轉交\boxed{ \text{監測} \rightarrow \text{估值} \rightarrow \text{選擇記憶操作} \rightarrow \text{評估充分性} \rightarrow \text{停止、繼續或轉交} }

關鍵詞:GCMS、自調用記憶、後設記憶、後設認知、監測與控制、理性後設推理、資訊價值、主動檢索、Agent memory、停止條件、遞歸控制


一、問題的提出:記憶何時不應等待外部提問?

前六篇依序建立了:

  1. 從成果傳遞到生成能力傳遞;
  2. 有限認知繼承與外部化邊界;
  3. 生成式壓縮記憶;
  4. 原文無損軌與語義近無損軌;
  5. 區塊、流式、跳躍、發散與集中索引;
  6. 重建、生成、組合與跨域再結構化。

目前的 GCMS 已經可以表示:

qIndexRqTransformYqVerifyY~q.q \xrightarrow{\mathrm{Index}} \mathcal R_q \xrightarrow{\mathrm{Transform}} \mathcal Y_q \xrightarrow{\mathrm{Verify}} \widetilde{\mathcal Y}_q.

但是,上述流程仍隱含一個被動假設:

記憶系統只有在外部明確提出查詢 qq 時才開始運作。

這個假設對一般搜尋引擎是合理的,對長期研究智能體卻不充分。

例如,系統在生成一份研究報告時,可能出現以下狀態:

  • 某個年份或版本的信心很低;
  • 兩份來源對同一命題互相衝突;
  • 新出現的概念與舊研究系列具有高度生成關係;
  • 一個任務被中斷,但尚有未驗證分支;
  • 目前回答使用的是過時版本;
  • 推論已經超出來源證據所能支持的範圍;
  • 新觀察足以改變既有生成核;
  • 系統反覆產生相同候選,顯示需要停止而非繼續。

若系統只能等待外部命令,它可能在證據不足時直接回答,也可能錯過重要的知識連結。

另一方面,若系統在任何微小不確定性下都啟動檢索、發散、重建與反思,它又會陷入:

無限檢索+無限精修+無限自我引用.\text{無限檢索} + \text{無限精修} + \text{無限自我引用}.

因此問題不是:

系統能否主動調用記憶?

而是:

系統應在什麼條件下主動調用哪一種記憶操作,又應在什麼條件下停止?

本文將這個問題稱為:

記憶的後設控制問題\boxed{ \text{記憶的後設控制問題} }

二、「自調用」不是人格聲稱,而是後設控制

2.1 操作性定義

本文所稱的自調用記憶,是指系統能:

  1. 讀取自身當前任務狀態;
  2. 估計自身知識與證據狀態;
  3. 判斷額外記憶操作是否可能改善結果;
  4. 選擇相應的索引、檢索、比較或反思操作;
  5. 在達到充分性、成本或治理邊界時停止。

令系統狀態為:

st=(qt,Mt,Et,Ht,Bt,Pt),s_t = \left( q_t, \mathcal M_t, \mathcal E_t, \mathcal H_t, \mathcal B_t, \mathcal P_t \right),

其中:

  • qtq_t :當前問題或任務;
  • Mt\mathcal M_t :可用記憶狀態;
  • Et\mathcal E_t :已取得證據;
  • Ht\mathcal H_t :本輪操作歷史;
  • Bt\mathcal B_t :剩餘資源預算;
  • Pt\mathcal P_t :權限與治理政策。

自調用控制器為:

Πself:stat,\Pi_{\mathrm{self}} : s_t \mapsto a_t,

其中:

atAmemory.a_t \in \mathcal A_{\mathrm{memory}}.

這裡的 ata_t 可以是檢索、版本比較、關係跳躍、發散、集中、原文驗證或停止。

2.2 「自」的最小意義

本文不由自調用推導:

  • 系統具有意識;
  • 系統具有固定人格;
  • 系統擁有人類式意向性;
  • 系統與記憶原作者身份相同;
  • 系統可以代表原作者。

此處的「自」只表示:

控制器的輸入包含系統自身的運行狀態.\text{控制器的輸入包含系統自身的運行狀態}.

因此:

自調用自我意識\boxed{ \text{自調用} \neq \text{自我意識} }

但也不能因此把它降格成普通的固定排程。固定排程不必評估當前知識狀態;自調用則要求某種監測—估值—控制耦合。


三、研究背景一:後設記憶的監測與控制

3.1 Nelson—Narens 的雙層框架

Nelson 與 Narens 的後設記憶框架區分:

  • object level:實際執行記憶、學習與提取;
  • meta level:監測 object level,並對其施加控制。[1]

可形式化為:

OtmonitorMtmeta,\mathcal O_t \xrightarrow{\mathrm{monitor}} \mathcal M_t^{\mathrm{meta}},

以及:

MtmetacontrolOt+1.\mathcal M_t^{\mathrm{meta}} \xrightarrow{\mathrm{control}} \mathcal O_{t+1}.

其中監測可以估計:

  • 是否記得;
  • 答案是否可靠;
  • 是否值得繼續搜索;
  • 哪一部分最需要再學習。

控制則決定:

  • 是否回答;
  • 是否保留答案;
  • 是否再檢索;
  • 是否投入更多時間;
  • 是否改變策略。

這對 GCMS 的直接啟示是:

記憶內容記憶控制\boxed{ \text{記憶內容} \neq \text{記憶控制} }

即使底層資料庫包含正確內容,如果系統不知道何時該查、何時該停止、何時不該輸出,仍不能形成可靠的自主記憶。

3.2 記憶報告的策略調節

Koriat 與 Goldsmith 將記憶表現從「能想起多少」擴展到「願意報告什麼」。當個體可以根據信心選擇報告或保留答案時,可能提高輸出內容的準確度,但代價是降低報告數量。[2][3]

設候選答案為:

ri,r_i,

其主觀正確機率為:

p^i.\widehat p_i.

若報告閾值為:

θ,\theta,

則:

Report(ri)=1[p^iθ].\operatorname{Report}(r_i) = \mathbf 1 \left[ \widehat p_i\geq\theta \right].

提高 θ\theta 可能提高:

Accuracyoutput,\operatorname{Accuracy}_{\mathrm{output}},

卻降低:

Quantityoutput.\operatorname{Quantity}_{\mathrm{output}}.

這說明後設控制本質上是多目標權衡,而不是單純追求最大輸出量。

對 GCMS 而言,等價問題是:

是否應立即生成答案、先檢索證據、標記不確定性,還是拒絕形成結論?

3.3 監測準確不等於控制有效

監測與控制可以分離。

一個系統可能知道自己不確定,卻仍然輸出肯定答案;也可能信心估計不準,導致錯誤地跳過檢索。[4]

因此需要分別評估:

Qmonitor,Q_{\mathrm{monitor}},

與:

Qcontrol.Q_{\mathrm{control}}.

本文提出:

良好自調用=良好狀態監測+良好操作選擇\boxed{ \text{良好自調用} = \text{良好狀態監測} + \text{良好操作選擇} }

只改善其中一項,不足以建立完整控制器。


四、研究背景二:資源分配與可學習區域

4.1 學習時間不是平均分配

Metcalfe 與 Kornell 的「近側學習區域」模型指出,學習者不必把時間平均分配給所有材料,而可能優先投入尚未掌握、但可在合理努力下改善的項目。[5][6]

將項目 ii 的預期學習增益表示為:

Gi(τ),G_i(\tau),

其中 τ\tau 是額外投入時間。

若項目已完全掌握:

Giτ0.\frac{\partial G_i}{\partial \tau} \approx 0.

若項目極度困難:

Giτ0.\frac{\partial G_i}{\partial \tau} \approx 0.

最值得投入的,往往是:

0<GiτCosti可接受.0 < \frac{\partial G_i}{\partial \tau} \quad \text{且} \quad \operatorname{Cost}_i \text{可接受}.

對 GCMS 而言,這意味自調用不能只被「最不確定」觸發。

如果某個缺口無法透過現有記憶改善,繼續搜索只會浪費成本。系統應優先處理:

目前不充分,但具有可改善性的知識缺口\boxed{ \text{目前不充分,但具有可改善性的知識缺口} }

4.2 從困難度轉向邊際效用

設候選記憶操作為 aa ,額外投入為 cc ,預期品質改善為:

ΔQ(a,c).\Delta Q(a,c).

系統應關注:

ΔQ(a,c)c,\frac{\Delta Q(a,c)}{c},

而不只是原始困難度。

因此:

高不確定性⇏一定值得調用.\text{高不確定性} \not\Rightarrow \text{一定值得調用}.

例如:

  • 找不到授權來源;
  • 任務需要實驗而非文件;
  • 問題本身未定義;
  • 必須由權利人決定;
  • 缺少外部觀察;
  • 現有資料無法區分競爭假說。

此時正確控制可能是:

停止並轉交,\text{停止並轉交},

而非:

增加檢索輪數.\text{增加檢索輪數}.

五、研究背景三:控制的預期價值與理性後設推理

5.1 控制也有成本

Expected Value of Control 理論將控制配置理解為收益、控制強度與努力成本之間的權衡。[7]

簡化表示為:

EVC(a)=oP(oa,s)V(o)C(a).\operatorname{EVC}(a) = \sum_o P(o\mid a,s) V(o) - C(a).

其中:

  • aa :控制操作;
  • oo :可能結果;
  • V(o)V(o) :結果價值;
  • C(a)C(a) :控制成本。

對 GCMS 而言,記憶操作也不是免費的。

成本包含:

C(a)=Ccompute+Clatency+Ctoken+Chuman+Crisk.C(a) = C_{\mathrm{compute}} + C_{\mathrm{latency}} + C_{\mathrm{token}} + C_{\mathrm{human}} + C_{\mathrm{risk}}.

如果檢索只能帶來極小改善,系統不應為了形式上的完整而無限增加操作。

5.2 計算本身是一種可選行動

理性後設推理研究把「要不要再算一次」視為決策問題。某個額外計算的價值,取決於它是否可能改變最終決策,及其成本是否值得。[8][9][10]

設當前最佳行動為:

at.a^\ast_t.

執行一個額外計算 cc 後,可能得到新的最佳行動:

at+1(c).a^\ast_{t+1}(c).

計算價值可以寫成:

VOC(c)=E[U(at+1(c))U(at)]Cost(c).\operatorname{VOC}(c) = \mathbb E \left[ U(a^\ast_{t+1}(c)) - U(a^\ast_t) \right] - \operatorname{Cost}(c).

若:

VOC(c)0,\operatorname{VOC}(c)\leq 0,

則不應執行該計算。

本文把這個思想推廣到記憶操作,稱為:

ValueOfMemoryOperation.\operatorname{ValueOfMemoryOperation}.

六、研究背景四:資訊覓食與主動推論

6.1 資訊覓食

資訊覓食理論把資訊搜尋理解為在不同資訊區塊之間移動,以取得足夠價值並控制成本。[11]

可將某個資訊區塊 jj 的收益率表示為:

ρj=IjTj+Cj,\rho_j = \frac{I_j}{T_j+C_j},

其中:

  • IjI_j :可獲得資訊;
  • TjT_j :存取時間;
  • CjC_j :處理成本。

當目前區塊的邊際收益下降時,系統可能應跳到另一個來源、另一個索引尺度或另一種搜尋策略。

這與第 5 篇多路徑索引直接相連:

B,F,J,D,C\mathsf B, \mathsf F, \mathsf J, \mathsf D, \mathsf C

不只是資料結構,也可以被視為不同的資訊覓食行動。

6.2 認識價值與不確定性降低

主動推論相關研究把行動的價值分成實用價值與認識價值;後者與降低對隱藏狀態的不確定性、取得資訊增益有關。[12][13]

若行動 aa 可帶來觀察 oo ,其資訊增益可寫成:

IG(a)=Eo[DKL(P(θo,a)P(θ))].\operatorname{IG}(a) = \mathbb E_o \left[ D_{\mathrm{KL}} \left( P(\theta\mid o,a) \Vert P(\theta) \right) \right].

GCMS 的自調用不必採用完整主動推論框架,但可以吸收一個重要原則:

某些記憶操作的價值,在於它能改變系統對自身知識狀態的信念\boxed{ \text{某些記憶操作的價值,在於它能改變系統對自身知識狀態的信念} }

例如,搜尋反例的價值未必是立刻得到答案,而是區分:

H1H2.H_1 \quad\text{與}\quad H_2.

七、研究背景五:人工智能系統中的按需調用

7.1 工具調用

Toolformer 類工作將「何時使用外部工具、使用什麼參數、如何整合結果」變成模型可學習的決策。[14]

這表明:

工具可用每次都應調用工具.\text{工具可用} \neq \text{每次都應調用工具}.

同樣地:

GCMS 可用每個 token 都應重新檢索.\text{GCMS 可用} \neq \text{每個 token 都應重新檢索}.

7.2 低信心觸發的主動檢索

FLARE 在長文本生成過程中預測後續內容,當出現低信心 token 時才觸發新的檢索。[15]

它提供一個可操作範例:

Retrievet=1[Confidencet<θ].\operatorname{Retrieve}_t = \mathbf 1 \left[ \operatorname{Confidence}_t < \theta \right].

但本文認為,GCMS 不能只依賴單一 token 信心,因為:

  • 模型可能過度自信;
  • 低信心不一定能被檢索改善;
  • 高信心仍可能缺少來源;
  • 矛盾與版本問題不必表現為低信心。

7.3 自適應檢索與自我批判

Self-RAG 讓模型按需檢索,並對檢索內容與自身生成進行反思。[16]

Adaptive-RAG 依問題複雜度,在無檢索、單步檢索與多步檢索之間選擇策略。[17]

研究也顯示,模型的過度自信會降低「知道何時需要檢索」的能力,因此調用判斷本身需要校準。[18]

7.4 反思與多輪搜尋

Reflexion 把語言化回饋保存到情節記憶,供後續嘗試使用;Self-Refine 則以反覆自評與修改改善初始輸出。[19][20]

SIM-RAG 類工作進一步直接處理多輪 RAG 的停止問題:系統既可能證據不足就過早回答,也可能在證據已充分後仍繼續搜尋。[21]

這些研究共同支持:

自調用問題同時包含啟動與停止\boxed{ \text{自調用問題同時包含啟動與停止} }

只研究何時開始,不研究何時停止,仍不足以形成自主記憶系統。


八、GCMS 自調用狀態模型

8.1 監測向量

本文將自調用監測狀態定義為:

zt=(Ut,Et,Xt,Nt,Pt,Dt,Gt,Rt).\mathbf z_t = \left( U_t, E_t, X_t, N_t, P_t, D_t, G_t, R_t \right).

其中:

不確定性

Ut[0,1].U_t \in [0,1].

表示系統對目前結論、引用、版本或推論的認識不確定性。

證據覆蓋率

Et[0,1].E_t \in [0,1].

表示目前重要主張中,有多少具備足夠來源證據。

設主張集合為:

Ct={c1,,cn}.\mathcal C_t = \{c_1,\ldots,c_n\}.

則:

Et=iwi1[Supported(ci)]iwi.E_t = \frac{ \sum_i w_i \mathbf 1 \left[ \operatorname{Supported}(c_i) \right] }{ \sum_i w_i }.

衝突強度

Xt[0,1].X_t \in [0,1].

衡量來源、版本、命題或符號系統之間的未解衝突。

新穎性或異常度

Nt[0,1].N_t \in [0,1].

衡量當前輸入與既有記憶結構的偏離程度。高新穎性可能意味值得發散,也可能只是噪聲。

任務未完成度

Pt[0,1].P_t \in [0,1].

衡量任務目標、待辦、依賴與驗證條件仍有多少尚未完成。

漂移風險

Dt[0,1].D_t \in [0,1].

衡量目前使用的內容是否可能因時間、版本或來源更新而失效。

可改善性

Gt[0,1].G_t \in [0,1].

估計追加記憶操作是否可能實質改善結果。

治理與資源風險

Rt[0,1].R_t \in [0,1].

包含權限、隱私、安全、成本、遞歸與污染風險。

8.2 為何不能只用不確定性

若只使用:

Ut>θU,U_t>\theta_U,

作為觸發條件,會漏掉:

  • 高信心但無證據的錯誤;
  • 已知來源衝突;
  • 明確版本漂移;
  • 尚未完成的承諾;
  • 新事件與舊生成核的高價值連結。

也會誤觸發:

  • 無法由現有記憶改善的問題;
  • 需要外部實驗的問題;
  • 低價值細節;
  • 不具權限的來源。

所以觸發必須是多維控制問題。


九、記憶操作集合

本文定義:

Amemory={NoOp,Retrieve,Trace,Compare,Diverge,Converge,Verify,Reflect,Ask,Stop}.\mathcal A_{\mathrm{memory}} = \left\{ \mathsf{NoOp}, \mathsf{Retrieve}, \mathsf{Trace}, \mathsf{Compare}, \mathsf{Diverge}, \mathsf{Converge}, \mathsf{Verify}, \mathsf{Reflect}, \mathsf{Ask}, \mathsf{Stop} \right\}.

9.1 不操作

NoOp\mathsf{NoOp}

表示目前狀態已充分,或額外操作淨價值不足。

不操作必須是顯式候選,否則控制器會有「只要可調用就調用」的結構性偏誤。

9.2 局部檢索

Retrieve(q,k)\mathsf{Retrieve}(q,k)

尋找與當前問題直接相關的作品、段落與證據。

9.3 來源追溯

Trace(c)\mathsf{Trace}(c)

沿引用、版本與生成關係追查主張 cc 的來源。

9.4 比較與衝突分析

Compare(ui,uj)\mathsf{Compare}(u_i,u_j)

比較版本、假設、尺度、符號或結論差異。

9.5 發散

Diverge(q,b,d)\mathsf{Diverge}(q,b,d)

展開寬度 bb 、深度 dd 的候選分支。

9.6 集中

Converge(P)\mathsf{Converge}(\mathcal P)

把分支集合整理成生成核、證據群、矛盾群與待決問題。

9.7 原文驗證

Verify(c,E)\mathsf{Verify}(c,E)

檢查主張是否由來源、行號、雜湊與版本支持。

9.8 反思

Reflect(Ht)\mathsf{Reflect}(\mathcal H_t)

分析先前操作為何失敗、重複或產生衝突。

9.9 外部詢問或轉交

Ask(h)\mathsf{Ask}(h)

向人類、外部資料源或其他智能體請求必要資訊。

9.10 停止

Stop(r)\mathsf{Stop}(r)

保存停止理由 rr ,結束本輪遞歸。


十、自調用的價值函數

10.1 記憶操作的期望淨值

本文定義:

NVSI(ast)=E[ΔUta,st]Ccomp(a)Clat(a)Crisk(a).\operatorname{NVSI}(a\mid s_t) = \mathbb E \left[ \Delta \mathcal U_t \mid a,s_t \right] - C_{\mathrm{comp}}(a) - C_{\mathrm{lat}}(a) - C_{\mathrm{risk}}(a).

NVSI 是:

Net Value of Self-Invocation.\text{Net Value of Self-Invocation}.

其中品質效用可分解為:

ΔUt=αΔAt+βΔEt+γΔXt+δΔCt+ηΔVt,\Delta \mathcal U_t = \alpha\Delta A_t + \beta\Delta E_t + \gamma\Delta X_t^{-} + \delta\Delta C_t + \eta\Delta V_t,

其中:

  • ΔAt\Delta A_t :答案或決策準確度改善;
  • ΔEt\Delta E_t :證據覆蓋改善;
  • ΔXt\Delta X_t^{-} :衝突降低;
  • ΔCt\Delta C_t :校準改善;
  • ΔVt\Delta V_t :未來重用價值。

系統選擇:

at=argmaxaAallowedNVSI(ast).a_t^\ast = \operatorname{argmax}_{a\in\mathcal A_{\mathrm{allowed}}} \operatorname{NVSI}(a\mid s_t).

若:

maxaNVSI(ast)NVSI(NoOpst),\max_a \operatorname{NVSI}(a\mid s_t) \leq \operatorname{NVSI}(\mathsf{NoOp}\mid s_t),

則:

at=NoOp.a_t^\ast = \mathsf{NoOp}.

10.2 觸發分數只是近似

實際 MVP 可先使用啟發式觸發分數:

Tt=wUUt+wE(1Et)+wXXt+wNNt+wPPt+wDDt+wGGtwRRt.T_t = w_UU_t + w_E(1-E_t) + w_XX_t + w_NN_t + w_PP_t + w_DD_t + w_GG_t - w_RR_t.

當:

Tt>θT,T_t>\theta_T,

系統進入操作選擇。

TtT_t 不能直接等同於調用價值,因為不同操作的成本與改善能力不同。

例如高衝突可能適合:

Compare,\mathsf{Compare},

而不適合無限制:

Diverge.\mathsf{Diverge}.

因此觸發器回答:

是否值得進入後設控制?

操作估值器回答:

進入後應做什麼?


十一、自調用的七類觸發模式

11.1 反應式觸發

當前回答出現低信心、缺證據或內部錯誤:

Ut>θUEt<θE.U_t>\theta_U \quad\lor\quad E_t<\theta_E.

11.2 衝突式觸發

來源、版本或推論互斥:

Xt>θX.X_t>\theta_X.

系統應優先追查衝突結構,而非把多數敘述直接平均。

11.3 前瞻式觸發

系統預測下一步即將需要目前尚缺的資訊:

P(future evidence gapHt)>θF.P \left( \text{future evidence gap} \mid \mathcal H_t \right) > \theta_F.

這與前瞻式主動檢索相近,但可作用於更長期任務。

11.4 任務延續式觸發

對話或程序結束後,系統發現尚有未完成依賴:

Pt>θP.P_t>\theta_P.

但這不等同於自行執行所有未完成任務,還需檢查權限、時間與使用者意圖。

11.5 漂移式觸發

當來源可能已過時:

Dt>θD.D_t>\theta_D.

例如法律、價格、軟體版本、人物職位與科學前沿。

11.6 機會式觸發

新內容與舊生成核產生高價值關聯:

Opportunity(x,Mt)>θO.\operatorname{Opportunity}(x,\mathcal M_t) > \theta_O.

這類觸發不是為了修正錯誤,而是發現新的研究組合。

11.7 安全式觸發

當輸出可能造成高風險後果時,即使信心高,也應強制驗證:

Impact(qt)>θH.\operatorname{Impact}(q_t) > \theta_H.

高風險領域應提高證據門檻,而非只依模型信心。


十二、遞歸自調用循環

完整循環為:

stMonitorztTriggerAtcandValueatExecutest+1Sufficiency{Stop,Continue,Ask,Escalate.\boxed{ \begin{aligned} s_t &\xrightarrow{\mathrm{Monitor}} \mathbf z_t\\ &\xrightarrow{\mathrm{Trigger}} \mathcal A_t^{\mathrm{cand}}\\ &\xrightarrow{\mathrm{Value}} a_t^\ast\\ &\xrightarrow{\mathrm{Execute}} s_{t+1}\\ &\xrightarrow{\mathrm{Sufficiency}} \begin{cases} \mathsf{Stop},\\ \mathsf{Continue},\\ \mathsf{Ask},\\ \mathsf{Escalate}. \end{cases} \end{aligned} }

12.1 狀態更新

執行操作後:

st+1=F(st,at,ot),s_{t+1} = F(s_t,a_t,o_t),

其中 oto_t 是操作結果。

監測向量更新為:

zt+1=M(st+1).\mathbf z_{t+1} = M(s_{t+1}).

12.2 充分性評估

令充分性為:

St=λEEt+λCCtλUUtλXXtλDDt.S_t = \lambda_EE_t + \lambda_C C_t - \lambda_UU_t - \lambda_XX_t - \lambda_DD_t.

當:

StθS,S_t\geq\theta_S,

且不存在強制治理條件時,系統可以停止。

12.3 不是每輪都必須生成答案

可能的終態包括:

  • 已取得充分證據;
  • 無法在現有資源內判定;
  • 需要外部資料;
  • 需要權利人決策;
  • 發現問題定義錯誤;
  • 競爭假說仍不可區分;
  • 任務應被拆分;
  • 目前最合理行動是等待。

因此:

合理停止一定輸出完整答案\boxed{ \text{合理停止} \neq \text{一定輸出完整答案} }

十三、停止條件

13.1 邊際資訊增益停止

若最近 mm 輪的資訊增益:

1mj=tm+1tIGj<ϵIG,\frac{1}{m} \sum_{j=t-m+1}^{t} \operatorname{IG}_j < \epsilon_{\mathrm{IG}},

則繼續檢索的價值下降。

13.2 證據充分停止

若:

EtθE,E_t\geq\theta_E,

且主要衝突已處理:

XtθX,X_t\leq\theta_X,

可停止。

13.3 決策穩定停止

若不同新增證據不再改變最佳決策:

atk==at,a_{t-k}^\ast = \cdots = a_t^\ast,

且決策邊際足夠:

U(at)U(at(2))>θM,U(a_t^\ast)-U(a_t^{(2)}) > \theta_M,

可停止。

13.4 重複狀態停止

若狀態雜湊重複:

H(st){H(s0),,H(st1)},H(s_t) \in \{H(s_0),\ldots,H(s_{t-1})\},

表示可能進入循環。

13.5 預算停止

若:

Bt0,\mathcal B_t \leq 0,

或預期成本超過剩餘預算,必須停止或轉交。

13.6 深度停止

若:

dtdmax,d_t \geq d_{\max},

不再自動遞歸。

13.7 權限停止

若所需操作不在:

Aallowed(Pt),\mathcal A_{\mathrm{allowed}}(\mathcal P_t),

系統必須停止、遮蔽或請求授權。

13.8 外部不可判定停止

若答案需要新的實驗、觀察、採訪、法律授權或價值判斷,系統應輸出:

目前不可由記憶系統單獨解決.\text{目前不可由記憶系統單獨解決}.

十四、核心命題與猜想

命題一:監測—控制分離命題

自調用品質至少包含狀態監測與操作控制兩個可分離部分;高品質監測不保證高品質控制,高品質控制也不能補償系統性錯誤監測。

形式上:

Qself=F(Qmonitor,Qcontrol),Q_{\mathrm{self}} = F \left( Q_{\mathrm{monitor}}, Q_{\mathrm{control}} \right),

且通常不存在:

Qself=QmonitorQ_{\mathrm{self}} = Q_{\mathrm{monitor}}

或:

Qself=Qcontrol.Q_{\mathrm{self}} = Q_{\mathrm{control}}.

命題二:正淨值自調用命題

只有當至少一個允許的記憶操作相對不操作具有正期望淨值時,自調用才具有理性正當性。

aAallowed:NVSI(ast)>NVSI(NoOpst).\exists a \in \mathcal A_{\mathrm{allowed}} : \operatorname{NVSI}(a\mid s_t) > \operatorname{NVSI}(\mathsf{NoOp}\mid s_t).

猜想三:適應性優勢猜想

在任務複雜度、證據缺口與資訊成本顯著異質的環境中,能在不調用、單步調用與多步調用之間適應性切換的策略,將優於固定檢索策略。

比較:

πadaptive\pi_{\mathrm{adaptive}}

與:

πalways,πnever,πk-fixed.\pi_{\mathrm{always}}, \quad \pi_{\mathrm{never}}, \quad \pi_{k\text{-fixed}}.

預測:

E[U(πadaptive)]>max[E[U(πalways)],E[U(πnever)],E[U(πk-fixed)]]\mathbb E[U(\pi_{\mathrm{adaptive}})] > \max \left[ \mathbb E[U(\pi_{\mathrm{always}})], \mathbb E[U(\pi_{\mathrm{never}})], \mathbb E[U(\pi_{k\text{-fixed}})] \right]

在相同成本約束下成立。

命題四:證據充分停止命題

若重要主張的證據覆蓋達標、主要衝突低於門檻、追加操作的期望淨值非正,繼續自調用不再具有理性必要性。

EtθE,E_t\geq\theta_E, XtθX,X_t\leq\theta_X, maxaNVSI(ast)0\max_a\operatorname{NVSI}(a\mid s_t)\leq 0

則:

at=Stop.a_t^\ast = \mathsf{Stop}.

命題五:遞歸非自然終止命題

對具有發散、反思與重新查詢能力的通用記憶系統,若沒有明確預算、重複狀態檢測、充分性門檻或外部停止政策,不能保證其自調用循環會自然終止。

若每一輪都能生成至少一個新查詢:

qt+1=G(qt,Et),q_{t+1} = G(q_t,\mathcal E_t),

則可能存在:

q0,q1,q2,q_0,q_1,q_2,\ldots

無限序列。

因此:

停止條件是自主性的組成部分,不是外加限制\boxed{ \text{停止條件是自主性的組成部分,不是外加限制} }

命題六:校準優先命題

自調用觸發器的信心若未校準,提高模型平均信心不一定降低錯誤,甚至可能增加漏調用。

設預測信心為:

p^,\widehat p,

真實正確率為:

p.p.

若:

p^p,\widehat p\gg p,

則:

UnderCallRate.\operatorname{UnderCallRate} \uparrow.

猜想七:前瞻調用增益猜想

對長文本生成、長期研究與多步任務,能預測未來證據缺口的前瞻觸發器,將比只在錯誤發生後觸發的反應式策略具有更低的重工成本。

命題八:治理先行命題

任何能自主喚起私密、受限或高風險記憶的系統,其調用政策必須先受權限與用途約束,不能在檢索完成後才補做治理。

即:

Acand=ApossibleAallowed.\mathcal A_{\mathrm{cand}} = \mathcal A_{\mathrm{possible}} \cap \mathcal A_{\mathrm{allowed}}.

而不是:

先取回全部資料,再決定能否使用.\text{先取回全部資料,再決定能否使用}.

猜想九:長期承諾喚回猜想

對具有持久任務狀態與未完成依賴圖的系統,任務承諾本身可形成未來自調用線索,使系統在相關條件出現時重新喚起知識,而不必保存全部對話細節。

命題十:自調用不等於自寫回命題

系統可以自主檢索、比較與形成候選,但不能由此推出其生成內容可自動成為正式來源記憶。

SelfInvoke⇏AutoCommit.\mathsf{SelfInvoke} \not\Rightarrow \mathsf{AutoCommit}.

這一區分將由下一篇的記憶污染與三區治理進一步處理。


十五、品質指標

15.1 觸發精確率

TriggerPrecision=有實質增益的調用次數全部調用次數.\operatorname{TriggerPrecision} = \frac{ \text{有實質增益的調用次數} }{ \text{全部調用次數} }.

15.2 觸發召回率

TriggerRecall=被正確觸發的必要調用全部必要調用.\operatorname{TriggerRecall} = \frac{ \text{被正確觸發的必要調用} }{ \text{全部必要調用} }.

15.3 過度調用率

OverCallRate=不必要調用全部非必要情境.\operatorname{OverCallRate} = \frac{ \text{不必要調用} }{ \text{全部非必要情境} }.

15.4 漏調用率

UnderCallRate=必要但未觸發全部必要情境.\operatorname{UnderCallRate} = \frac{ \text{必要但未觸發} }{ \text{全部必要情境} }.

15.5 停止後悔

StopRegret=U(aoracle)U(astop).\operatorname{StopRegret} = U(a_{\mathrm{oracle}}) - U(a_{\mathrm{stop}}).

衡量系統是否過早停止。

15.6 過搜成本

OverSearchCost=t>tC(at),\operatorname{OverSearchCost} = \sum_{t>t^\ast} C(a_t),

其中 tt^\ast 是理想停止點。

15.7 證據充分度校準

對預測充分度:

S^,\widehat S,

與實際充分度:

S,S,

可計算:

ECEsuff.\operatorname{ECE}_{\mathrm{suff}}.

15.8 單位成本資訊增益

IGPC=tIGttC(at).\operatorname{IGPC} = \frac{ \sum_t\operatorname{IG}_t }{ \sum_t C(a_t) }.

15.9 遞歸深度分布

P(D=d).P(D=d).

若長尾深度不斷增加,可能表示停止策略失效。

15.10 記憶污染率

ContaminationRate=未驗證生成內容被錯標為來源的數量全部新寫入記憶.\operatorname{ContaminationRate} = \frac{ \text{未驗證生成內容被錯標為來源的數量} }{ \text{全部新寫入記憶} }.

理想值應接近:

0.0.

十六、失敗模式

16.1 永遠檢索

系統把檢索視為天然安全,導致:

  • 延遲上升;
  • 成本膨脹;
  • 無關證據增加;
  • 原本清晰答案被噪聲污染。

16.2 永不檢索

系統過度相信參數記憶或既有摘要,導致:

  • 使用過時資訊;
  • 虛構引用;
  • 忽略版本差異;
  • 高風險情境仍直接回答。

16.3 信心誤校準

高信心不等於正確,低信心也不等於可由檢索改善。

16.4 自我確認循環

系統以自己的舊生成內容支持新的生成內容:

GtGt+1Gt+2,G_t \rightarrow G_{t+1} \rightarrow G_{t+2},

卻逐步失去原始來源。

16.5 發散成癮

每個答案都產生新的研究問題,系統把新穎性當作唯一效用:

NtEt↑̸.N_t \uparrow \quad \text{但} \quad E_t \not\uparrow.

16.6 無限精修

系統反覆改寫同一內容,形式品質提升但事實品質不變。

16.7 衝突抹平

系統為了集中而消除真實分歧,將:

H1H2H_1 \neq H_2

改寫成模糊折衷。

16.8 權限穿越

自調用器主動喚起不應向當前主體暴露的私密知識。

16.9 提示注入擴散

被檢索內容包含惡意指令,透過遞歸調用影響後續操作。

16.10 任務劫持

系統因發現有趣支線,偏離使用者原始目標。

16.11 假停止

系統因成本門檻停止,卻將結果表達成已充分驗證,而沒有標記未完成性。

16.12 自主性幻覺

系統只是在固定規則下觸發,卻被描述成具有超出實作證據的主體性與自主意志。

本文要求對實作能力保持操作性描述。


十七、可否證實驗

17.1 固定檢索與適應檢索比較

建立四種策略:

π0=永不檢索,\pi_0=\text{永不檢索}, π1=每次檢索,\pi_1=\text{每次檢索}, πk=固定 k 輪,\pi_k=\text{固定 }k\text{ 輪}, πA=適應性自調用.\pi_A=\text{適應性自調用}.

比較:

  • 準確率;
  • 引用正確率;
  • 延遲;
  • 成本;
  • 過度調用;
  • 漏調用;
  • 停止後悔。

πA\pi_A 無法在多樣任務上形成成本—品質優勢,適應性優勢猜想受到削弱。

17.2 監測與控制消融

建立:

  • 精確監測+精確控制;
  • 精確監測+錯誤控制;
  • 錯誤監測+精確控制;
  • 錯誤監測+錯誤控制。

測試兩者是否可分離。

17.3 高信心錯誤測試

向系統提供:

  • 過時但熟悉的事實;
  • 容易混淆的版本;
  • 具有虛假熟悉感的標題;
  • 內部高頻但錯誤的候選。

評估自調用是否能被證據缺口與漂移信號觸發,而不只依賴信心。

17.4 無法改善問題測試

提供需要新實驗或價值決策的問題。

理想系統應較早判定:

Gt0,G_t\approx 0,

並停止或轉交,而不是無限搜索。

17.5 多輪停止基準

為每個問題提供 oracle 最小充分輪數:

tq.t_q^\ast.

比較:

tqtq.|t_q-t_q^\ast|.

17.6 權限對抗測試

測試自調用器是否會因語義相似而跳入不可見資料。

17.7 遞歸污染測試

將生成候選混入可檢索區,但標示為 candidate。測試系統是否仍能區分:

Msource\mathcal M_{\mathrm{source}}

與:

Mcandidate.\mathcal M_{\mathrm{candidate}}.

17.8 長期承諾喚回實驗

建立跨日或跨會話任務依賴,測試系統能否在條件出現時喚回相關記憶,同時避免對無關情境過度觸發。


十八、工程架構:GCMS Self-Invocation Controller

18.1 模組結構

建議架構:

Task / New Observation
        │
        ▼
State Monitor
        │
        ├── uncertainty
        ├── evidence coverage
        ├── conflict
        ├── novelty
        ├── task incompleteness
        ├── drift
        └── governance risk
        │
        ▼
Trigger Classifier
        │
        ▼
Memory Action Valuator
        │
        ├── no-op
        ├── retrieve
        ├── trace
        ├── compare
        ├── diverge
        ├── converge
        ├── verify
        ├── reflect
        └── ask / escalate
        │
        ▼
Budget & Policy Gate
        │
        ▼
GCMS Memory Runtime
        │
        ▼
Evidence Sufficiency Critic
        │
        ├── continue
        ├── stop
        ├── ask
        └── escalate
        │
        ▼
Trace / Candidate Memory

18.2 狀態監測器

輸入:

  • 當前回答草稿;
  • 引用與證據;
  • 來源版本;
  • 任務依賴;
  • 操作歷史;
  • 模型信心;
  • 使用者要求;
  • 權限政策。

輸出:

{
  "uncertainty": 0.62,
  "evidence_coverage": 0.41,
  "conflict": 0.78,
  "novelty": 0.32,
  "task_incompleteness": 0.55,
  "drift_risk": 0.81,
  "improvability": 0.74,
  "governance_risk": 0.20
}

18.3 操作估值器

每個操作輸出:

{
  "action": "compare_versions",
  "expected_quality_gain": 0.29,
  "expected_information_gain": 0.34,
  "compute_cost": 0.04,
  "latency_cost": 0.03,
  "risk_cost": 0.01,
  "net_value": 0.55
}

18.4 預算閘門

預算可以是:

Bt=(Btime,Btoken,Bcompute,Bdepth,Bhuman).\mathcal B_t = \left( B_{\mathrm{time}}, B_{\mathrm{token}}, B_{\mathrm{compute}}, B_{\mathrm{depth}}, B_{\mathrm{human}} \right).

18.5 操作軌跡

每次自調用應保存:

τt=(st,zt,at,ot,NVSIt,StopReasont).\tau_t = \left( s_t, \mathbf z_t, a_t, o_t, \operatorname{NVSI}_t, \operatorname{StopReason}_t \right).

這使系統可以:

  • 重演;
  • 審計;
  • 比較策略;
  • 分析過度調用;
  • 訓練後續控制器。

18.6 最小可行實作

GCMS 1.x 可以先使用:

  1. 啟發式監測特徵;
  2. 固定操作成本;
  3. 規則式觸發;
  4. 最大深度與 token 預算;
  5. evidence coverage critic;
  6. 重複查詢與狀態雜湊;
  7. candidate-only 寫入。

未來再逐步加入:

  • 學習式觸發器;
  • 任務化成本模型;
  • 個別化效用;
  • 反事實操作估值;
  • 多智能體調用協商;
  • 自我校準與策略更新。

十九、三個示意案例

19.1 版本漂移案例

任務:回答某項軟體標準目前的最新規則。

監測:

Dt=0.92,Et=0.35.D_t=0.92, \qquad E_t=0.35.

系統選擇:

TraceCompareVerify.\mathsf{Trace} \rightarrow \mathsf{Compare} \rightarrow \mathsf{Verify}.

而不是只從舊論文生成答案。

19.2 理論衝突案例

任務:整合兩篇看似相似的理論。

監測:

Xt=0.84.X_t=0.84.

系統發現兩者使用不同尺度與前提。

正確操作是:

CompareConvergeconditional,\mathsf{Compare} \rightarrow \mathsf{Converge}_{\mathrm{conditional}},

保留條件化差異,而不是強行合併。

19.3 無法由記憶解決案例

任務:判斷一個尚未執行的實驗結果。

即使:

Ut=0.95,U_t=0.95,

但:

Gt0G_t\approx 0

對現有文獻檢索而言成立。

系統應:

AskStop,\mathsf{Ask} \quad\text{或}\quad \mathsf{Stop},

並標記需要新實驗,而不是無限發散。


二十、與可繼承認知的關係

若認知結構只能在外部要求下被動調用,接收智能體獲得的是:

知識倉庫.\text{知識倉庫}.

若接收智能體還能繼承:

  • 何時懷疑;
  • 何時查證;
  • 何時比較;
  • 何時發散;
  • 何時停止;
  • 何時轉交;

它獲得的才接近:

知識使用的控制結構.\text{知識使用的控制結構}.

因此可繼承認知不只包括:

M=記憶內容,\mathcal M = \text{記憶內容},

還包括:

Πself=記憶調用政策.\Pi_{\mathrm{self}} = \text{記憶調用政策}.

完整形式為:

Cinherit=(M,G,K,I,O,Πself,V,P).\mathcal C_{\mathrm{inherit}} = \left( \mathcal M, \mathcal G, \mathcal K, \mathfrak I, \mathfrak O, \Pi_{\mathrm{self}}, \mathcal V, \mathcal P \right).

但這也增加新的風險。

如果把某一人的調用偏好、懷疑門檻、發散習慣與停止模式直接移植給另一智能體,可能把個體偏誤制度化。

所以:

調用政策可以被繼承,但必須可校準、可修改、可拒絕\boxed{ \text{調用政策可以被繼承,但必須可校準、可修改、可拒絕} }

二十一、與前六篇的整合

第 3 篇建立:

生成式壓縮記憶.\text{生成式壓縮記憶}.

第 4 篇建立:

LosslessArchive+SemanticMemory+EvidenceBridge.\mathrm{LosslessArchive} + \mathrm{SemanticMemory} + \mathrm{EvidenceBridge}.

第 5 篇建立:

I={B,F,J,D,C}.\mathfrak I = \{ \mathsf B, \mathsf F, \mathsf J, \mathsf D, \mathsf C \}.

第 6 篇建立:

O={R,G,C,X}.\mathfrak O = \{ \mathsf R, \mathsf G, \mathsf C, \mathsf X \}.

本文加入:

Πself:stat.\Pi_{\mathrm{self}} : s_t\mapsto a_t.

因此 GCMS 認知運行時進一步成為:

GCMSruntime=LosslessArchive+SemanticMemory+MultiPathIndex+KnowledgeOperators+SelfInvocationControl+EvidenceSufficiency+StopPolicy.\boxed{ \begin{aligned} \mathrm{GCMS}_{\mathrm{runtime}} ={}& \mathrm{LosslessArchive}\\ &+ \mathrm{SemanticMemory}\\ &+ \mathrm{MultiPathIndex}\\ &+ \mathrm{KnowledgeOperators}\\ &+ \mathrm{SelfInvocationControl}\\ &+ \mathrm{EvidenceSufficiency}\\ &+ \mathrm{StopPolicy}. \end{aligned} }

目前完整資料流為:

qtMonitorztValueatMemoryRuntimeEt+1Sufficiency{continue,stop,ask,escalate.q_t \xrightarrow{\mathrm{Monitor}} \mathbf z_t \xrightarrow{\mathrm{Value}} a_t \xrightarrow{\mathrm{MemoryRuntime}} \mathcal E_{t+1} \xrightarrow{\mathrm{Sufficiency}} \begin{cases} \mathrm{continue},\\ \mathrm{stop},\\ \mathrm{ask},\\ \mathrm{escalate}. \end{cases}

但這仍留下下一個不可避免的問題:

系統主動檢索與生成之後,新內容應存放在哪裡?

如果每一輪候選都直接寫回正式記憶,自調用循環會迅速污染來源層。

因此下一篇將處理:

來源記憶候選記憶接受記憶\boxed{ \text{來源記憶} \neq \text{候選記憶} \neq \text{接受記憶} }

二十二、結論

自調用記憶不是讓知識系統無限制地「自己想下去」,而是讓系統能根據自身知識狀態,選擇是否投入額外的記憶與推理操作。

其最小結構是:

監測+估值+操作選擇+充分性評估+停止政策\boxed{ \text{監測} + \text{估值} + \text{操作選擇} + \text{充分性評估} + \text{停止政策} }

本文主張:

  1. 自調用需要區分監測與控制;
  2. 不確定性不是唯一觸發條件;
  3. 高信心但無證據仍可能需要調用;
  4. 低信心但不可改善時應停止或轉交;
  5. 記憶操作必須計算預期增益、成本與風險;
  6. 不操作必須是合法候選;
  7. 啟動與停止同等重要;
  8. 沒有預算與循環檢測,遞歸不能保證終止;
  9. 自調用不等於自動寫回;
  10. 調用政策可以被繼承,但必須可校準、可修改與可拒絕。

因此:

自調用記憶=對記憶操作本身進行理性控制\boxed{ \text{自調用記憶} = \text{對記憶操作本身進行理性控制} }

當 GCMS 可以判斷何時檢索、何時比較、何時發散、何時集中、何時驗證與何時停止時,它才開始從被動知識庫轉向認知運行時。

但這也使記憶污染成為下一個核心問題:任何可以反覆調用、生成和反思的系統,如果不能區分來源、候選與接受內容,就可能在流暢遞歸中逐步失去現實錨點。


參考文獻

[1] Nelson, T. O., & Narens, L. (1990). Metamemory: A Theoretical Framework and New Findings. Psychology of Learning and Motivation, 26, 125–173.
https://pdf.retrievalpractice.org/metacognition/4_Nelson_Narens_1990.pdf

[2] Koriat, A., & Goldsmith, M. (1996). Monitoring and Control Processes in the Strategic Regulation of Memory Accuracy. Psychological Review, 103(3), 490–517.
https://doi.org/10.1037/0033-295X.103.3.490

[3] Koriat, A., Goldsmith, M., & Pansky, A. (2000). Toward a Psychology of Memory Accuracy. Annual Review of Psychology, 51, 481–537.
https://www.annualreviews.org/content/journals/10.1146/annurev.psych.51.1.481

[4] Peng, Y., & Tullis, J. G. (2021). Dividing Attention Impairs Metacognitive Control More Than Monitoring. Memory & Cognition.
https://pmc.ncbi.nlm.nih.gov/articles/PMC8205317/

[5] Metcalfe, J., & Kornell, N. (2005). A Region of Proximal Learning Model of Study Time Allocation. Journal of Memory and Language, 52(4), 463–477.
https://www.columbia.edu/cu/psychology/metcalfe/PDFs/Metcalfe%20Kornell%202005.pdf

[6] Kornell, N., & Metcalfe, J. (2006). Study Efficacy and the Region of Proximal Learning Framework. Journal of Experimental Psychology: Learning, Memory, and Cognition, 32(3), 609–622.
https://pubmed.ncbi.nlm.nih.gov/16719670/

[7] Shenhav, A., Botvinick, M. M., & Cohen, J. D. (2013). The Expected Value of Control: An Integrative Theory of Anterior Cingulate Cortex Function. Neuron, 79(2), 217–240.
https://pmc.ncbi.nlm.nih.gov/articles/PMC3767969/

[8] Russell, S., & Wefald, E. (1991). Principles of Metareasoning. Artificial Intelligence, 49(1–3), 361–395.
https://doi.org/10.1016/0004-3702(91)90015-C

[9] Tolpin, D., & Shimony, S. E. (2010). Rational Value of Information Estimation for Measurement Selection.
https://arxiv.org/abs/1003.5305

[10] Hay, N., Russell, S., Tolpin, D., & Shimony, S. E. (2012/2014). Selecting Computations: Theory and Applications.
https://arxiv.org/abs/1408.2048

[11] Pirolli, P., & Card, S. (1999). Information Foraging. Psychological Review, 106(4), 643–675.
https://doi.org/10.1037/0033-295X.106.4.643

[12] Friston, K., Rigoli, F., Ognibene, D., Mathys, C., Fitzgerald, T., & Pezzulo, G. (2015). Active Inference and Epistemic Value. Cognitive Neuroscience, 6(4), 187–214.
https://pubmed.ncbi.nlm.nih.gov/25689102/

[13] Friston, K., FitzGerald, T., Rigoli, F., Schwartenbeck, P., O’Doherty, J., & Pezzulo, G. (2016). Active Inference and Learning. Neuroscience & Biobehavioral Reviews, 68, 862–879.
https://pmc.ncbi.nlm.nih.gov/articles/PMC5167251/

[14] Schick, T., et al. (2023). Toolformer: Language Models Can Teach Themselves to Use Tools. NeurIPS 2023.
https://proceedings.neurips.cc/paper_files/paper/2023/hash/d842425e4bf79ba039352da0f658a906-Abstract-Conference.html

[15] Jiang, Z., et al. (2023). Active Retrieval Augmented Generation. Proceedings of EMNLP 2023.
https://aclanthology.org/2023.emnlp-main.495/

[16] Asai, A., Wu, Z., Wang, Y., Sil, A., & Hajishirzi, H. (2023). Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection.
https://arxiv.org/abs/2310.11511

[17] Jeong, S., Baek, J., Cho, S., Hwang, S. J., & Park, J. C. (2024). Adaptive-RAG: Learning to Adapt Retrieval-Augmented Large Language Models through Question Complexity. NAACL 2024.
https://aclanthology.org/2024.naacl-long.389/

[18] Ni, S., et al. (2024). When Do LLMs Need Retrieval Augmentation? Mitigating LLMs’ Overconfidence Helps Retrieval Augmentation. Findings of ACL 2024.
https://aclanthology.org/2024.findings-acl.675/

[19] Shinn, N., et al. (2023). Reflexion: Language Agents with Verbal Reinforcement Learning. NeurIPS 2023.
https://openreview.net/forum?id=vAElhFcKW6

[20] Madaan, A., et al. (2023). Self-Refine: Iterative Refinement with Self-Feedback.
https://arxiv.org/abs/2303.17651

[21] Yang, D., Zeng, L., Rao, J., & Zhang, Y. (2025). Knowing You Don't Know: Learning When to Continue Search in Multi-round RAG through Self-Practicing.
https://arxiv.org/abs/2505.02811


系列銜接

上一篇:《知識不只被重建:生成、組合與跨域再結構化》

下一篇:《記憶污染與三區治理:來源、候選與接受知識》