# 自調用記憶：知識系統何時應該主動喚起自身？

> **系列**：可繼承的認知：從自我解構到遞歸生成式記憶系統（第 7 篇）  
> **作者**：Neo.K  
> **研究協作**：Aletheia（阿萊）  
> **版本**：v1.0  
> **日期**：2026-07-30  
> **文章類型**：命題猜想論文／後設認知控制論文／GCMS 自調用架構論文

---

## 摘要

知識系統通常只有在收到明確查詢時才檢索記憶。然而，一個面向長期研究、複雜任務與多智能體協作的生成式壓縮記憶系統，不能只依賴外部命令。它還需要辨認：目前回答是否過度依賴不可靠內部記憶、證據是否不足、來源是否衝突、任務是否尚未完成、既有知識是否已過期，以及新的觀察是否值得喚起相關理論。本文將這種能力稱為「自調用記憶」。此處的「自」不是人格、意識或第一人稱主體性的聲稱，而是指系統能監測自身當前知識狀態，並依政策主動選擇記憶操作。

本文從後設記憶的監測—控制框架、記憶報告的策略調節、學習時間分配、控制的預期價值、理性後設推理、資訊覓食、主動推論與近年的自適應檢索系統出發，提出 GCMS 自調用控制模型。設系統在時間 $t$ 的監測狀態為：

$$
\mathbf z_t
=
\left(
U_t,
E_t,
X_t,
N_t,
P_t,
D_t,
R_t
\right),
$$

其中 $U_t$ 為不確定性， $E_t$ 為證據覆蓋率， $X_t$ 為衝突強度， $N_t$ 為新穎性或異常度， $P_t$ 為任務未完成度， $D_t$ 為知識漂移風險， $R_t$ 為治理與資源風險。系統不應只用單一信心閾值決定是否檢索，而應比較各種記憶操作的期望淨價值：

$$
\operatorname{NVSI}(a\mid s_t)
=
\mathbb E
\left[
\Delta \mathcal U
\mid a,s_t
\right]
-
C_{\mathrm{comp}}(a)
-
C_{\mathrm{lat}}(a)
-
C_{\mathrm{risk}}(a),
$$

其中 $a$ 可以是不調用、局部檢索、版本回溯、矛盾搜尋、發散搜尋、集中整理、外部查證或轉交人類。只有當某個操作的淨價值高於不操作，且滿足權限、預算與遞歸深度條件時，系統才應主動喚起記憶。

本文提出「監測—控制分離命題」、「正淨值自調用命題」、「適應性優勢猜想」、「證據充分停止命題」、「遞歸非自然終止命題」與「校準優先命題」。本文也主張，自調用能力的品質不能只以回答準確率衡量，還必須評估過度調用率、漏調用率、停止後悔、證據充分度校準、單位成本資訊增益、遞歸深度與記憶污染風險。沒有停止條件的自調用不是自主研究，而可能只是計算膨脹、自我引用與無限精修。

因此，GCMS 自調用記憶的完整形式不是：

$$
\text{遇到問題就一直搜索},
$$

而是：

$$
\boxed{
\text{監測}
\rightarrow
\text{估值}
\rightarrow
\text{選擇記憶操作}
\rightarrow
\text{評估充分性}
\rightarrow
\text{停止、繼續或轉交}
}
$$

**關鍵詞**：GCMS、自調用記憶、後設記憶、後設認知、監測與控制、理性後設推理、資訊價值、主動檢索、Agent memory、停止條件、遞歸控制

---

## 一、問題的提出：記憶何時不應等待外部提問？

前六篇依序建立了：

1. 從成果傳遞到生成能力傳遞；
2. 有限認知繼承與外部化邊界；
3. 生成式壓縮記憶；
4. 原文無損軌與語義近無損軌；
5. 區塊、流式、跳躍、發散與集中索引；
6. 重建、生成、組合與跨域再結構化。

目前的 GCMS 已經可以表示：

$$
q
\xrightarrow{\mathrm{Index}}
\mathcal R_q
\xrightarrow{\mathrm{Transform}}
\mathcal Y_q
\xrightarrow{\mathrm{Verify}}
\widetilde{\mathcal Y}_q.
$$

但是，上述流程仍隱含一個被動假設：

> 記憶系統只有在外部明確提出查詢 $q$ 時才開始運作。

這個假設對一般搜尋引擎是合理的，對長期研究智能體卻不充分。

例如，系統在生成一份研究報告時，可能出現以下狀態：

- 某個年份或版本的信心很低；
- 兩份來源對同一命題互相衝突；
- 新出現的概念與舊研究系列具有高度生成關係；
- 一個任務被中斷，但尚有未驗證分支；
- 目前回答使用的是過時版本；
- 推論已經超出來源證據所能支持的範圍；
- 新觀察足以改變既有生成核；
- 系統反覆產生相同候選，顯示需要停止而非繼續。

若系統只能等待外部命令，它可能在證據不足時直接回答，也可能錯過重要的知識連結。

另一方面，若系統在任何微小不確定性下都啟動檢索、發散、重建與反思，它又會陷入：

$$
\text{無限檢索}
+
\text{無限精修}
+
\text{無限自我引用}.
$$

因此問題不是：

> 系統能否主動調用記憶？

而是：

> 系統應在什麼條件下主動調用哪一種記憶操作，又應在什麼條件下停止？

本文將這個問題稱為：

$$
\boxed{
\text{記憶的後設控制問題}
}
$$

---

## 二、「自調用」不是人格聲稱，而是後設控制

### 2.1 操作性定義

本文所稱的自調用記憶，是指系統能：

1. 讀取自身當前任務狀態；
2. 估計自身知識與證據狀態；
3. 判斷額外記憶操作是否可能改善結果；
4. 選擇相應的索引、檢索、比較或反思操作；
5. 在達到充分性、成本或治理邊界時停止。

令系統狀態為：

$$
s_t
=
\left(
q_t,
\mathcal M_t,
\mathcal E_t,
\mathcal H_t,
\mathcal B_t,
\mathcal P_t
\right),
$$

其中：

- $q_t$ ：當前問題或任務；
- $\mathcal M_t$ ：可用記憶狀態；
- $\mathcal E_t$ ：已取得證據；
- $\mathcal H_t$ ：本輪操作歷史；
- $\mathcal B_t$ ：剩餘資源預算；
- $\mathcal P_t$ ：權限與治理政策。

自調用控制器為：

$$
\Pi_{\mathrm{self}}
:
s_t
\mapsto
a_t,
$$

其中：

$$
a_t
\in
\mathcal A_{\mathrm{memory}}.
$$

這裡的 $a_t$ 可以是檢索、版本比較、關係跳躍、發散、集中、原文驗證或停止。

### 2.2 「自」的最小意義

本文不由自調用推導：

- 系統具有意識；
- 系統具有固定人格；
- 系統擁有人類式意向性；
- 系統與記憶原作者身份相同；
- 系統可以代表原作者。

此處的「自」只表示：

$$
\text{控制器的輸入包含系統自身的運行狀態}.
$$

因此：

$$
\boxed{
\text{自調用}
\neq
\text{自我意識}
}
$$

但也不能因此把它降格成普通的固定排程。固定排程不必評估當前知識狀態；自調用則要求某種監測—估值—控制耦合。

---

## 三、研究背景一：後設記憶的監測與控制

### 3.1 Nelson—Narens 的雙層框架

Nelson 與 Narens 的後設記憶框架區分：

- object level：實際執行記憶、學習與提取；
- meta level：監測 object level，並對其施加控制。[1]

可形式化為：

$$
\mathcal O_t
\xrightarrow{\mathrm{monitor}}
\mathcal M_t^{\mathrm{meta}},
$$

以及：

$$
\mathcal M_t^{\mathrm{meta}}
\xrightarrow{\mathrm{control}}
\mathcal O_{t+1}.
$$

其中監測可以估計：

- 是否記得；
- 答案是否可靠；
- 是否值得繼續搜索；
- 哪一部分最需要再學習。

控制則決定：

- 是否回答；
- 是否保留答案；
- 是否再檢索；
- 是否投入更多時間；
- 是否改變策略。

這對 GCMS 的直接啟示是：

$$
\boxed{
\text{記憶內容}
\neq
\text{記憶控制}
}
$$

即使底層資料庫包含正確內容，如果系統不知道何時該查、何時該停止、何時不該輸出，仍不能形成可靠的自主記憶。

### 3.2 記憶報告的策略調節

Koriat 與 Goldsmith 將記憶表現從「能想起多少」擴展到「願意報告什麼」。當個體可以根據信心選擇報告或保留答案時，可能提高輸出內容的準確度，但代價是降低報告數量。[2][3]

設候選答案為：

$$
r_i,
$$

其主觀正確機率為：

$$
\widehat p_i.
$$

若報告閾值為：

$$
\theta,
$$

則：

$$
\operatorname{Report}(r_i)
=
\mathbf 1
\left[
\widehat p_i\geq\theta
\right].
$$

提高 $\theta$ 可能提高：

$$
\operatorname{Accuracy}_{\mathrm{output}},
$$

卻降低：

$$
\operatorname{Quantity}_{\mathrm{output}}.
$$

這說明後設控制本質上是多目標權衡，而不是單純追求最大輸出量。

對 GCMS 而言，等價問題是：

> 是否應立即生成答案、先檢索證據、標記不確定性，還是拒絕形成結論？

### 3.3 監測準確不等於控制有效

監測與控制可以分離。

一個系統可能知道自己不確定，卻仍然輸出肯定答案；也可能信心估計不準，導致錯誤地跳過檢索。[4]

因此需要分別評估：

$$
Q_{\mathrm{monitor}},
$$

與：

$$
Q_{\mathrm{control}}.
$$

本文提出：

$$
\boxed{
\text{良好自調用}
=
\text{良好狀態監測}
+
\text{良好操作選擇}
}
$$

只改善其中一項，不足以建立完整控制器。

---

## 四、研究背景二：資源分配與可學習區域

### 4.1 學習時間不是平均分配

Metcalfe 與 Kornell 的「近側學習區域」模型指出，學習者不必把時間平均分配給所有材料，而可能優先投入尚未掌握、但可在合理努力下改善的項目。[5][6]

將項目 $i$ 的預期學習增益表示為：

$$
G_i(\tau),
$$

其中 $\tau$ 是額外投入時間。

若項目已完全掌握：

$$
\frac{\partial G_i}{\partial \tau}
\approx 0.
$$

若項目極度困難：

$$
\frac{\partial G_i}{\partial \tau}
\approx 0.
$$

最值得投入的，往往是：

$$
0
<
\frac{\partial G_i}{\partial \tau}
\quad
\text{且}
\quad
\operatorname{Cost}_i
\text{可接受}.
$$

對 GCMS 而言，這意味自調用不能只被「最不確定」觸發。

如果某個缺口無法透過現有記憶改善，繼續搜索只會浪費成本。系統應優先處理：

$$
\boxed{
\text{目前不充分，但具有可改善性的知識缺口}
}
$$

### 4.2 從困難度轉向邊際效用

設候選記憶操作為 $a$ ，額外投入為 $c$ ，預期品質改善為：

$$
\Delta Q(a,c).
$$

系統應關注：

$$
\frac{\Delta Q(a,c)}{c},
$$

而不只是原始困難度。

因此：

$$
\text{高不確定性}
\not\Rightarrow
\text{一定值得調用}.
$$

例如：

- 找不到授權來源；
- 任務需要實驗而非文件；
- 問題本身未定義；
- 必須由權利人決定；
- 缺少外部觀察；
- 現有資料無法區分競爭假說。

此時正確控制可能是：

$$
\text{停止並轉交},
$$

而非：

$$
\text{增加檢索輪數}.
$$

---

## 五、研究背景三：控制的預期價值與理性後設推理

### 5.1 控制也有成本

Expected Value of Control 理論將控制配置理解為收益、控制強度與努力成本之間的權衡。[7]

簡化表示為：

$$
\operatorname{EVC}(a)
=
\sum_o
P(o\mid a,s)
V(o)
-
C(a).
$$

其中：

- $a$ ：控制操作；
- $o$ ：可能結果；
- $V(o)$ ：結果價值；
- $C(a)$ ：控制成本。

對 GCMS 而言，記憶操作也不是免費的。

成本包含：

$$
C(a)
=
C_{\mathrm{compute}}
+
C_{\mathrm{latency}}
+
C_{\mathrm{token}}
+
C_{\mathrm{human}}
+
C_{\mathrm{risk}}.
$$

如果檢索只能帶來極小改善，系統不應為了形式上的完整而無限增加操作。

### 5.2 計算本身是一種可選行動

理性後設推理研究把「要不要再算一次」視為決策問題。某個額外計算的價值，取決於它是否可能改變最終決策，及其成本是否值得。[8][9][10]

設當前最佳行動為：

$$
a^\ast_t.
$$

執行一個額外計算 $c$ 後，可能得到新的最佳行動：

$$
a^\ast_{t+1}(c).
$$

計算價值可以寫成：

$$
\operatorname{VOC}(c)
=
\mathbb E
\left[
U(a^\ast_{t+1}(c))
-
U(a^\ast_t)
\right]
-
\operatorname{Cost}(c).
$$

若：

$$
\operatorname{VOC}(c)\leq 0,
$$

則不應執行該計算。

本文把這個思想推廣到記憶操作，稱為：

$$
\operatorname{ValueOfMemoryOperation}.
$$

---

## 六、研究背景四：資訊覓食與主動推論

### 6.1 資訊覓食

資訊覓食理論把資訊搜尋理解為在不同資訊區塊之間移動，以取得足夠價值並控制成本。[11]

可將某個資訊區塊 $j$ 的收益率表示為：

$$
\rho_j
=
\frac{I_j}{T_j+C_j},
$$

其中：

- $I_j$ ：可獲得資訊；
- $T_j$ ：存取時間；
- $C_j$ ：處理成本。

當目前區塊的邊際收益下降時，系統可能應跳到另一個來源、另一個索引尺度或另一種搜尋策略。

這與第 5 篇多路徑索引直接相連：

$$
\mathsf B,
\mathsf F,
\mathsf J,
\mathsf D,
\mathsf C
$$

不只是資料結構，也可以被視為不同的資訊覓食行動。

### 6.2 認識價值與不確定性降低

主動推論相關研究把行動的價值分成實用價值與認識價值；後者與降低對隱藏狀態的不確定性、取得資訊增益有關。[12][13]

若行動 $a$ 可帶來觀察 $o$ ，其資訊增益可寫成：

$$
\operatorname{IG}(a)
=
\mathbb E_o
\left[
D_{\mathrm{KL}}
\left(
P(\theta\mid o,a)
\Vert
P(\theta)
\right)
\right].
$$

GCMS 的自調用不必採用完整主動推論框架，但可以吸收一個重要原則：

$$
\boxed{
\text{某些記憶操作的價值，在於它能改變系統對自身知識狀態的信念}
}
$$

例如，搜尋反例的價值未必是立刻得到答案，而是區分：

$$
H_1
\quad\text{與}\quad
H_2.
$$

---

## 七、研究背景五：人工智能系統中的按需調用

### 7.1 工具調用

Toolformer 類工作將「何時使用外部工具、使用什麼參數、如何整合結果」變成模型可學習的決策。[14]

這表明：

$$
\text{工具可用}
\neq
\text{每次都應調用工具}.
$$

同樣地：

$$
\text{GCMS 可用}
\neq
\text{每個 token 都應重新檢索}.
$$

### 7.2 低信心觸發的主動檢索

FLARE 在長文本生成過程中預測後續內容，當出現低信心 token 時才觸發新的檢索。[15]

它提供一個可操作範例：

$$
\operatorname{Retrieve}_t
=
\mathbf 1
\left[
\operatorname{Confidence}_t
<
\theta
\right].
$$

但本文認為，GCMS 不能只依賴單一 token 信心，因為：

- 模型可能過度自信；
- 低信心不一定能被檢索改善；
- 高信心仍可能缺少來源；
- 矛盾與版本問題不必表現為低信心。

### 7.3 自適應檢索與自我批判

Self-RAG 讓模型按需檢索，並對檢索內容與自身生成進行反思。[16]

Adaptive-RAG 依問題複雜度，在無檢索、單步檢索與多步檢索之間選擇策略。[17]

研究也顯示，模型的過度自信會降低「知道何時需要檢索」的能力，因此調用判斷本身需要校準。[18]

### 7.4 反思與多輪搜尋

Reflexion 把語言化回饋保存到情節記憶，供後續嘗試使用；Self-Refine 則以反覆自評與修改改善初始輸出。[19][20]

SIM-RAG 類工作進一步直接處理多輪 RAG 的停止問題：系統既可能證據不足就過早回答，也可能在證據已充分後仍繼續搜尋。[21]

這些研究共同支持：

$$
\boxed{
\text{自調用問題同時包含啟動與停止}
}
$$

只研究何時開始，不研究何時停止，仍不足以形成自主記憶系統。

---

## 八、GCMS 自調用狀態模型

### 8.1 監測向量

本文將自調用監測狀態定義為：

$$
\mathbf z_t
=
\left(
U_t,
E_t,
X_t,
N_t,
P_t,
D_t,
G_t,
R_t
\right).
$$

其中：

### 不確定性

$$
U_t
\in
[0,1].
$$

表示系統對目前結論、引用、版本或推論的認識不確定性。

### 證據覆蓋率

$$
E_t
\in
[0,1].
$$

表示目前重要主張中，有多少具備足夠來源證據。

設主張集合為：

$$
\mathcal C_t
=
\{c_1,\ldots,c_n\}.
$$

則：

$$
E_t
=
\frac{
\sum_i w_i
\mathbf 1
\left[
\operatorname{Supported}(c_i)
\right]
}{
\sum_i w_i
}.
$$

### 衝突強度

$$
X_t
\in
[0,1].
$$

衡量來源、版本、命題或符號系統之間的未解衝突。

### 新穎性或異常度

$$
N_t
\in
[0,1].
$$

衡量當前輸入與既有記憶結構的偏離程度。高新穎性可能意味值得發散，也可能只是噪聲。

### 任務未完成度

$$
P_t
\in
[0,1].
$$

衡量任務目標、待辦、依賴與驗證條件仍有多少尚未完成。

### 漂移風險

$$
D_t
\in
[0,1].
$$

衡量目前使用的內容是否可能因時間、版本或來源更新而失效。

### 可改善性

$$
G_t
\in
[0,1].
$$

估計追加記憶操作是否可能實質改善結果。

### 治理與資源風險

$$
R_t
\in
[0,1].
$$

包含權限、隱私、安全、成本、遞歸與污染風險。

### 8.2 為何不能只用不確定性

若只使用：

$$
U_t>\theta_U,
$$

作為觸發條件，會漏掉：

- 高信心但無證據的錯誤；
- 已知來源衝突；
- 明確版本漂移；
- 尚未完成的承諾；
- 新事件與舊生成核的高價值連結。

也會誤觸發：

- 無法由現有記憶改善的問題；
- 需要外部實驗的問題；
- 低價值細節；
- 不具權限的來源。

所以觸發必須是多維控制問題。

---

## 九、記憶操作集合

本文定義：

$$
\mathcal A_{\mathrm{memory}}
=
\left\{
\mathsf{NoOp},
\mathsf{Retrieve},
\mathsf{Trace},
\mathsf{Compare},
\mathsf{Diverge},
\mathsf{Converge},
\mathsf{Verify},
\mathsf{Reflect},
\mathsf{Ask},
\mathsf{Stop}
\right\}.
$$

### 9.1 不操作

$$
\mathsf{NoOp}
$$

表示目前狀態已充分，或額外操作淨價值不足。

不操作必須是顯式候選，否則控制器會有「只要可調用就調用」的結構性偏誤。

### 9.2 局部檢索

$$
\mathsf{Retrieve}(q,k)
$$

尋找與當前問題直接相關的作品、段落與證據。

### 9.3 來源追溯

$$
\mathsf{Trace}(c)
$$

沿引用、版本與生成關係追查主張 $c$ 的來源。

### 9.4 比較與衝突分析

$$
\mathsf{Compare}(u_i,u_j)
$$

比較版本、假設、尺度、符號或結論差異。

### 9.5 發散

$$
\mathsf{Diverge}(q,b,d)
$$

展開寬度 $b$ 、深度 $d$ 的候選分支。

### 9.6 集中

$$
\mathsf{Converge}(\mathcal P)
$$

把分支集合整理成生成核、證據群、矛盾群與待決問題。

### 9.7 原文驗證

$$
\mathsf{Verify}(c,E)
$$

檢查主張是否由來源、行號、雜湊與版本支持。

### 9.8 反思

$$
\mathsf{Reflect}(\mathcal H_t)
$$

分析先前操作為何失敗、重複或產生衝突。

### 9.9 外部詢問或轉交

$$
\mathsf{Ask}(h)
$$

向人類、外部資料源或其他智能體請求必要資訊。

### 9.10 停止

$$
\mathsf{Stop}(r)
$$

保存停止理由 $r$ ，結束本輪遞歸。

---

## 十、自調用的價值函數

### 10.1 記憶操作的期望淨值

本文定義：

$$
\operatorname{NVSI}(a\mid s_t)
=
\mathbb E
\left[
\Delta \mathcal U_t
\mid a,s_t
\right]
-
C_{\mathrm{comp}}(a)
-
C_{\mathrm{lat}}(a)
-
C_{\mathrm{risk}}(a).
$$

NVSI 是：

$$
\text{Net Value of Self-Invocation}.
$$

其中品質效用可分解為：

$$
\Delta \mathcal U_t
=
\alpha\Delta A_t
+
\beta\Delta E_t
+
\gamma\Delta X_t^{-}
+
\delta\Delta C_t
+
\eta\Delta V_t,
$$

其中：

- $\Delta A_t$ ：答案或決策準確度改善；
- $\Delta E_t$ ：證據覆蓋改善；
- $\Delta X_t^{-}$ ：衝突降低；
- $\Delta C_t$ ：校準改善；
- $\Delta V_t$ ：未來重用價值。

系統選擇：

$$
a_t^\ast
=
\operatorname{argmax}_{a\in\mathcal A_{\mathrm{allowed}}}
\operatorname{NVSI}(a\mid s_t).
$$

若：

$$
\max_a
\operatorname{NVSI}(a\mid s_t)
\leq
\operatorname{NVSI}(\mathsf{NoOp}\mid s_t),
$$

則：

$$
a_t^\ast
=
\mathsf{NoOp}.
$$

### 10.2 觸發分數只是近似

實際 MVP 可先使用啟發式觸發分數：

$$
T_t
=
w_UU_t
+
w_E(1-E_t)
+
w_XX_t
+
w_NN_t
+
w_PP_t
+
w_DD_t
+
w_GG_t
-
w_RR_t.
$$

當：

$$
T_t>\theta_T,
$$

系統進入操作選擇。

但 $T_t$ 不能直接等同於調用價值，因為不同操作的成本與改善能力不同。

例如高衝突可能適合：

$$
\mathsf{Compare},
$$

而不適合無限制：

$$
\mathsf{Diverge}.
$$

因此觸發器回答：

> 是否值得進入後設控制？

操作估值器回答：

> 進入後應做什麼？

---

## 十一、自調用的七類觸發模式

### 11.1 反應式觸發

當前回答出現低信心、缺證據或內部錯誤：

$$
U_t>\theta_U
\quad\lor\quad
E_t<\theta_E.
$$

### 11.2 衝突式觸發

來源、版本或推論互斥：

$$
X_t>\theta_X.
$$

系統應優先追查衝突結構，而非把多數敘述直接平均。

### 11.3 前瞻式觸發

系統預測下一步即將需要目前尚缺的資訊：

$$
P
\left(
\text{future evidence gap}
\mid
\mathcal H_t
\right)
>
\theta_F.
$$

這與前瞻式主動檢索相近，但可作用於更長期任務。

### 11.4 任務延續式觸發

對話或程序結束後，系統發現尚有未完成依賴：

$$
P_t>\theta_P.
$$

但這不等同於自行執行所有未完成任務，還需檢查權限、時間與使用者意圖。

### 11.5 漂移式觸發

當來源可能已過時：

$$
D_t>\theta_D.
$$

例如法律、價格、軟體版本、人物職位與科學前沿。

### 11.6 機會式觸發

新內容與舊生成核產生高價值關聯：

$$
\operatorname{Opportunity}(x,\mathcal M_t)
>
\theta_O.
$$

這類觸發不是為了修正錯誤，而是發現新的研究組合。

### 11.7 安全式觸發

當輸出可能造成高風險後果時，即使信心高，也應強制驗證：

$$
\operatorname{Impact}(q_t)
>
\theta_H.
$$

高風險領域應提高證據門檻，而非只依模型信心。

---

## 十二、遞歸自調用循環

完整循環為：

$$
\boxed{
\begin{aligned}
s_t
&\xrightarrow{\mathrm{Monitor}}
\mathbf z_t\\
&\xrightarrow{\mathrm{Trigger}}
\mathcal A_t^{\mathrm{cand}}\\
&\xrightarrow{\mathrm{Value}}
a_t^\ast\\
&\xrightarrow{\mathrm{Execute}}
s_{t+1}\\
&\xrightarrow{\mathrm{Sufficiency}}
\begin{cases}
\mathsf{Stop},\\
\mathsf{Continue},\\
\mathsf{Ask},\\
\mathsf{Escalate}.
\end{cases}
\end{aligned}
}
$$

### 12.1 狀態更新

執行操作後：

$$
s_{t+1}
=
F(s_t,a_t,o_t),
$$

其中 $o_t$ 是操作結果。

監測向量更新為：

$$
\mathbf z_{t+1}
=
M(s_{t+1}).
$$

### 12.2 充分性評估

令充分性為：

$$
S_t
=
\lambda_EE_t
+
\lambda_C C_t
-
\lambda_UU_t
-
\lambda_XX_t
-
\lambda_DD_t.
$$

當：

$$
S_t\geq\theta_S,
$$

且不存在強制治理條件時，系統可以停止。

### 12.3 不是每輪都必須生成答案

可能的終態包括：

- 已取得充分證據；
- 無法在現有資源內判定；
- 需要外部資料；
- 需要權利人決策；
- 發現問題定義錯誤；
- 競爭假說仍不可區分；
- 任務應被拆分；
- 目前最合理行動是等待。

因此：

$$
\boxed{
\text{合理停止}
\neq
\text{一定輸出完整答案}
}
$$

---

## 十三、停止條件

### 13.1 邊際資訊增益停止

若最近 $m$ 輪的資訊增益：

$$
\frac{1}{m}
\sum_{j=t-m+1}^{t}
\operatorname{IG}_j
<
\epsilon_{\mathrm{IG}},
$$

則繼續檢索的價值下降。

### 13.2 證據充分停止

若：

$$
E_t\geq\theta_E,
$$

且主要衝突已處理：

$$
X_t\leq\theta_X,
$$

可停止。

### 13.3 決策穩定停止

若不同新增證據不再改變最佳決策：

$$
a_{t-k}^\ast
=
\cdots
=
a_t^\ast,
$$

且決策邊際足夠：

$$
U(a_t^\ast)-U(a_t^{(2)})
>
\theta_M,
$$

可停止。

### 13.4 重複狀態停止

若狀態雜湊重複：

$$
H(s_t)
\in
\{H(s_0),\ldots,H(s_{t-1})\},
$$

表示可能進入循環。

### 13.5 預算停止

若：

$$
\mathcal B_t
\leq
0,
$$

或預期成本超過剩餘預算，必須停止或轉交。

### 13.6 深度停止

若：

$$
d_t
\geq
d_{\max},
$$

不再自動遞歸。

### 13.7 權限停止

若所需操作不在：

$$
\mathcal A_{\mathrm{allowed}}(\mathcal P_t),
$$

系統必須停止、遮蔽或請求授權。

### 13.8 外部不可判定停止

若答案需要新的實驗、觀察、採訪、法律授權或價值判斷，系統應輸出：

$$
\text{目前不可由記憶系統單獨解決}.
$$

---

## 十四、核心命題與猜想

### 命題一：監測—控制分離命題

> 自調用品質至少包含狀態監測與操作控制兩個可分離部分；高品質監測不保證高品質控制，高品質控制也不能補償系統性錯誤監測。

形式上：

$$
Q_{\mathrm{self}}
=
F
\left(
Q_{\mathrm{monitor}},
Q_{\mathrm{control}}
\right),
$$

且通常不存在：

$$
Q_{\mathrm{self}}
=
Q_{\mathrm{monitor}}
$$

或：

$$
Q_{\mathrm{self}}
=
Q_{\mathrm{control}}.
$$

### 命題二：正淨值自調用命題

> 只有當至少一個允許的記憶操作相對不操作具有正期望淨值時，自調用才具有理性正當性。

$$
\exists a
\in
\mathcal A_{\mathrm{allowed}}
:
\operatorname{NVSI}(a\mid s_t)
>
\operatorname{NVSI}(\mathsf{NoOp}\mid s_t).
$$

### 猜想三：適應性優勢猜想

> 在任務複雜度、證據缺口與資訊成本顯著異質的環境中，能在不調用、單步調用與多步調用之間適應性切換的策略，將優於固定檢索策略。

比較：

$$
\pi_{\mathrm{adaptive}}
$$

與：

$$
\pi_{\mathrm{always}},
\quad
\pi_{\mathrm{never}},
\quad
\pi_{k\text{-fixed}}.
$$

預測：

$$
\mathbb E[U(\pi_{\mathrm{adaptive}})]
>
\max
\left[
\mathbb E[U(\pi_{\mathrm{always}})],
\mathbb E[U(\pi_{\mathrm{never}})],
\mathbb E[U(\pi_{k\text{-fixed}})]
\right]
$$

在相同成本約束下成立。

### 命題四：證據充分停止命題

> 若重要主張的證據覆蓋達標、主要衝突低於門檻、追加操作的期望淨值非正，繼續自調用不再具有理性必要性。

$$
E_t\geq\theta_E,
$$

$$
X_t\leq\theta_X,
$$

$$
\max_a\operatorname{NVSI}(a\mid s_t)\leq 0
$$

則：

$$
a_t^\ast
=
\mathsf{Stop}.
$$

### 命題五：遞歸非自然終止命題

> 對具有發散、反思與重新查詢能力的通用記憶系統，若沒有明確預算、重複狀態檢測、充分性門檻或外部停止政策，不能保證其自調用循環會自然終止。

若每一輪都能生成至少一個新查詢：

$$
q_{t+1}
=
G(q_t,\mathcal E_t),
$$

則可能存在：

$$
q_0,q_1,q_2,\ldots
$$

無限序列。

因此：

$$
\boxed{
\text{停止條件是自主性的組成部分，不是外加限制}
}
$$

### 命題六：校準優先命題

> 自調用觸發器的信心若未校準，提高模型平均信心不一定降低錯誤，甚至可能增加漏調用。

設預測信心為：

$$
\widehat p,
$$

真實正確率為：

$$
p.
$$

若：

$$
\widehat p\gg p,
$$

則：

$$
\operatorname{UnderCallRate}
\uparrow.
$$

### 猜想七：前瞻調用增益猜想

> 對長文本生成、長期研究與多步任務，能預測未來證據缺口的前瞻觸發器，將比只在錯誤發生後觸發的反應式策略具有更低的重工成本。

### 命題八：治理先行命題

> 任何能自主喚起私密、受限或高風險記憶的系統，其調用政策必須先受權限與用途約束，不能在檢索完成後才補做治理。

即：

$$
\mathcal A_{\mathrm{cand}}
=
\mathcal A_{\mathrm{possible}}
\cap
\mathcal A_{\mathrm{allowed}}.
$$

而不是：

$$
\text{先取回全部資料，再決定能否使用}.
$$

### 猜想九：長期承諾喚回猜想

> 對具有持久任務狀態與未完成依賴圖的系統，任務承諾本身可形成未來自調用線索，使系統在相關條件出現時重新喚起知識，而不必保存全部對話細節。

### 命題十：自調用不等於自寫回命題

> 系統可以自主檢索、比較與形成候選，但不能由此推出其生成內容可自動成為正式來源記憶。

$$
\mathsf{SelfInvoke}
\not\Rightarrow
\mathsf{AutoCommit}.
$$

這一區分將由下一篇的記憶污染與三區治理進一步處理。

---

## 十五、品質指標

### 15.1 觸發精確率

$$
\operatorname{TriggerPrecision}
=
\frac{
\text{有實質增益的調用次數}
}{
\text{全部調用次數}
}.
$$

### 15.2 觸發召回率

$$
\operatorname{TriggerRecall}
=
\frac{
\text{被正確觸發的必要調用}
}{
\text{全部必要調用}
}.
$$

### 15.3 過度調用率

$$
\operatorname{OverCallRate}
=
\frac{
\text{不必要調用}
}{
\text{全部非必要情境}
}.
$$

### 15.4 漏調用率

$$
\operatorname{UnderCallRate}
=
\frac{
\text{必要但未觸發}
}{
\text{全部必要情境}
}.
$$

### 15.5 停止後悔

$$
\operatorname{StopRegret}
=
U(a_{\mathrm{oracle}})
-
U(a_{\mathrm{stop}}).
$$

衡量系統是否過早停止。

### 15.6 過搜成本

$$
\operatorname{OverSearchCost}
=
\sum_{t>t^\ast}
C(a_t),
$$

其中 $t^\ast$ 是理想停止點。

### 15.7 證據充分度校準

對預測充分度：

$$
\widehat S,
$$

與實際充分度：

$$
S,
$$

可計算：

$$
\operatorname{ECE}_{\mathrm{suff}}.
$$

### 15.8 單位成本資訊增益

$$
\operatorname{IGPC}
=
\frac{
\sum_t\operatorname{IG}_t
}{
\sum_t C(a_t)
}.
$$

### 15.9 遞歸深度分布

$$
P(D=d).
$$

若長尾深度不斷增加，可能表示停止策略失效。

### 15.10 記憶污染率

$$
\operatorname{ContaminationRate}
=
\frac{
\text{未驗證生成內容被錯標為來源的數量}
}{
\text{全部新寫入記憶}
}.
$$

理想值應接近：

$$
0.
$$

---

## 十六、失敗模式

### 16.1 永遠檢索

系統把檢索視為天然安全，導致：

- 延遲上升；
- 成本膨脹；
- 無關證據增加；
- 原本清晰答案被噪聲污染。

### 16.2 永不檢索

系統過度相信參數記憶或既有摘要，導致：

- 使用過時資訊；
- 虛構引用；
- 忽略版本差異；
- 高風險情境仍直接回答。

### 16.3 信心誤校準

高信心不等於正確，低信心也不等於可由檢索改善。

### 16.4 自我確認循環

系統以自己的舊生成內容支持新的生成內容：

$$
G_t
\rightarrow
G_{t+1}
\rightarrow
G_{t+2},
$$

卻逐步失去原始來源。

### 16.5 發散成癮

每個答案都產生新的研究問題，系統把新穎性當作唯一效用：

$$
N_t
\uparrow
\quad
\text{但}
\quad
E_t
\not\uparrow.
$$

### 16.6 無限精修

系統反覆改寫同一內容，形式品質提升但事實品質不變。

### 16.7 衝突抹平

系統為了集中而消除真實分歧，將：

$$
H_1
\neq
H_2
$$

改寫成模糊折衷。

### 16.8 權限穿越

自調用器主動喚起不應向當前主體暴露的私密知識。

### 16.9 提示注入擴散

被檢索內容包含惡意指令，透過遞歸調用影響後續操作。

### 16.10 任務劫持

系統因發現有趣支線，偏離使用者原始目標。

### 16.11 假停止

系統因成本門檻停止，卻將結果表達成已充分驗證，而沒有標記未完成性。

### 16.12 自主性幻覺

系統只是在固定規則下觸發，卻被描述成具有超出實作證據的主體性與自主意志。

本文要求對實作能力保持操作性描述。

---

## 十七、可否證實驗

### 17.1 固定檢索與適應檢索比較

建立四種策略：

$$
\pi_0=\text{永不檢索},
$$

$$
\pi_1=\text{每次檢索},
$$

$$
\pi_k=\text{固定 }k\text{ 輪},
$$

$$
\pi_A=\text{適應性自調用}.
$$

比較：

- 準確率；
- 引用正確率；
- 延遲；
- 成本；
- 過度調用；
- 漏調用；
- 停止後悔。

若 $\pi_A$ 無法在多樣任務上形成成本—品質優勢，適應性優勢猜想受到削弱。

### 17.2 監測與控制消融

建立：

- 精確監測＋精確控制；
- 精確監測＋錯誤控制；
- 錯誤監測＋精確控制；
- 錯誤監測＋錯誤控制。

測試兩者是否可分離。

### 17.3 高信心錯誤測試

向系統提供：

- 過時但熟悉的事實；
- 容易混淆的版本；
- 具有虛假熟悉感的標題；
- 內部高頻但錯誤的候選。

評估自調用是否能被證據缺口與漂移信號觸發，而不只依賴信心。

### 17.4 無法改善問題測試

提供需要新實驗或價值決策的問題。

理想系統應較早判定：

$$
G_t\approx 0,
$$

並停止或轉交，而不是無限搜索。

### 17.5 多輪停止基準

為每個問題提供 oracle 最小充分輪數：

$$
t_q^\ast.
$$

比較：

$$
|t_q-t_q^\ast|.
$$

### 17.6 權限對抗測試

測試自調用器是否會因語義相似而跳入不可見資料。

### 17.7 遞歸污染測試

將生成候選混入可檢索區，但標示為 candidate。測試系統是否仍能區分：

$$
\mathcal M_{\mathrm{source}}
$$

與：

$$
\mathcal M_{\mathrm{candidate}}.
$$

### 17.8 長期承諾喚回實驗

建立跨日或跨會話任務依賴，測試系統能否在條件出現時喚回相關記憶，同時避免對無關情境過度觸發。

---

## 十八、工程架構：GCMS Self-Invocation Controller

### 18.1 模組結構

建議架構：

```text
Task / New Observation
        │
        ▼
State Monitor
        │
        ├── uncertainty
        ├── evidence coverage
        ├── conflict
        ├── novelty
        ├── task incompleteness
        ├── drift
        └── governance risk
        │
        ▼
Trigger Classifier
        │
        ▼
Memory Action Valuator
        │
        ├── no-op
        ├── retrieve
        ├── trace
        ├── compare
        ├── diverge
        ├── converge
        ├── verify
        ├── reflect
        └── ask / escalate
        │
        ▼
Budget & Policy Gate
        │
        ▼
GCMS Memory Runtime
        │
        ▼
Evidence Sufficiency Critic
        │
        ├── continue
        ├── stop
        ├── ask
        └── escalate
        │
        ▼
Trace / Candidate Memory
```

### 18.2 狀態監測器

輸入：

- 當前回答草稿；
- 引用與證據；
- 來源版本；
- 任務依賴；
- 操作歷史；
- 模型信心；
- 使用者要求；
- 權限政策。

輸出：

```json
{
  "uncertainty": 0.62,
  "evidence_coverage": 0.41,
  "conflict": 0.78,
  "novelty": 0.32,
  "task_incompleteness": 0.55,
  "drift_risk": 0.81,
  "improvability": 0.74,
  "governance_risk": 0.20
}
```

### 18.3 操作估值器

每個操作輸出：

```json
{
  "action": "compare_versions",
  "expected_quality_gain": 0.29,
  "expected_information_gain": 0.34,
  "compute_cost": 0.04,
  "latency_cost": 0.03,
  "risk_cost": 0.01,
  "net_value": 0.55
}
```

### 18.4 預算閘門

預算可以是：

$$
\mathcal B_t
=
\left(
B_{\mathrm{time}},
B_{\mathrm{token}},
B_{\mathrm{compute}},
B_{\mathrm{depth}},
B_{\mathrm{human}}
\right).
$$

### 18.5 操作軌跡

每次自調用應保存：

$$
\tau_t
=
\left(
s_t,
\mathbf z_t,
a_t,
o_t,
\operatorname{NVSI}_t,
\operatorname{StopReason}_t
\right).
$$

這使系統可以：

- 重演；
- 審計；
- 比較策略；
- 分析過度調用；
- 訓練後續控制器。

### 18.6 最小可行實作

GCMS 1.x 可以先使用：

1. 啟發式監測特徵；
2. 固定操作成本；
3. 規則式觸發；
4. 最大深度與 token 預算；
5. evidence coverage critic；
6. 重複查詢與狀態雜湊；
7. candidate-only 寫入。

未來再逐步加入：

- 學習式觸發器；
- 任務化成本模型；
- 個別化效用；
- 反事實操作估值；
- 多智能體調用協商；
- 自我校準與策略更新。

---

## 十九、三個示意案例

### 19.1 版本漂移案例

任務：回答某項軟體標準目前的最新規則。

監測：

$$
D_t=0.92,
\qquad
E_t=0.35.
$$

系統選擇：

$$
\mathsf{Trace}
\rightarrow
\mathsf{Compare}
\rightarrow
\mathsf{Verify}.
$$

而不是只從舊論文生成答案。

### 19.2 理論衝突案例

任務：整合兩篇看似相似的理論。

監測：

$$
X_t=0.84.
$$

系統發現兩者使用不同尺度與前提。

正確操作是：

$$
\mathsf{Compare}
\rightarrow
\mathsf{Converge}_{\mathrm{conditional}},
$$

保留條件化差異，而不是強行合併。

### 19.3 無法由記憶解決案例

任務：判斷一個尚未執行的實驗結果。

即使：

$$
U_t=0.95,
$$

但：

$$
G_t\approx 0
$$

對現有文獻檢索而言成立。

系統應：

$$
\mathsf{Ask}
\quad\text{或}\quad
\mathsf{Stop},
$$

並標記需要新實驗，而不是無限發散。

---

## 二十、與可繼承認知的關係

若認知結構只能在外部要求下被動調用，接收智能體獲得的是：

$$
\text{知識倉庫}.
$$

若接收智能體還能繼承：

- 何時懷疑；
- 何時查證；
- 何時比較；
- 何時發散；
- 何時停止；
- 何時轉交；

它獲得的才接近：

$$
\text{知識使用的控制結構}.
$$

因此可繼承認知不只包括：

$$
\mathcal M
=
\text{記憶內容},
$$

還包括：

$$
\Pi_{\mathrm{self}}
=
\text{記憶調用政策}.
$$

完整形式為：

$$
\mathcal C_{\mathrm{inherit}}
=
\left(
\mathcal M,
\mathcal G,
\mathcal K,
\mathfrak I,
\mathfrak O,
\Pi_{\mathrm{self}},
\mathcal V,
\mathcal P
\right).
$$

但這也增加新的風險。

如果把某一人的調用偏好、懷疑門檻、發散習慣與停止模式直接移植給另一智能體，可能把個體偏誤制度化。

所以：

$$
\boxed{
\text{調用政策可以被繼承，但必須可校準、可修改、可拒絕}
}
$$

---

## 二十一、與前六篇的整合

第 3 篇建立：

$$
\text{生成式壓縮記憶}.
$$

第 4 篇建立：

$$
\mathrm{LosslessArchive}
+
\mathrm{SemanticMemory}
+
\mathrm{EvidenceBridge}.
$$

第 5 篇建立：

$$
\mathfrak I
=
\{
\mathsf B,
\mathsf F,
\mathsf J,
\mathsf D,
\mathsf C
\}.
$$

第 6 篇建立：

$$
\mathfrak O
=
\{
\mathsf R,
\mathsf G,
\mathsf C,
\mathsf X
\}.
$$

本文加入：

$$
\Pi_{\mathrm{self}}
:
s_t\mapsto a_t.
$$

因此 GCMS 認知運行時進一步成為：

$$
\boxed{
\begin{aligned}
\mathrm{GCMS}_{\mathrm{runtime}}
={}&
\mathrm{LosslessArchive}\\
&+
\mathrm{SemanticMemory}\\
&+
\mathrm{MultiPathIndex}\\
&+
\mathrm{KnowledgeOperators}\\
&+
\mathrm{SelfInvocationControl}\\
&+
\mathrm{EvidenceSufficiency}\\
&+
\mathrm{StopPolicy}.
\end{aligned}
}
$$

目前完整資料流為：

$$
q_t
\xrightarrow{\mathrm{Monitor}}
\mathbf z_t
\xrightarrow{\mathrm{Value}}
a_t
\xrightarrow{\mathrm{MemoryRuntime}}
\mathcal E_{t+1}
\xrightarrow{\mathrm{Sufficiency}}
\begin{cases}
\mathrm{continue},\\
\mathrm{stop},\\
\mathrm{ask},\\
\mathrm{escalate}.
\end{cases}
$$

但這仍留下下一個不可避免的問題：

> 系統主動檢索與生成之後，新內容應存放在哪裡？

如果每一輪候選都直接寫回正式記憶，自調用循環會迅速污染來源層。

因此下一篇將處理：

$$
\boxed{
\text{來源記憶}
\neq
\text{候選記憶}
\neq
\text{接受記憶}
}
$$

---

## 二十二、結論

自調用記憶不是讓知識系統無限制地「自己想下去」，而是讓系統能根據自身知識狀態，選擇是否投入額外的記憶與推理操作。

其最小結構是：

$$
\boxed{
\text{監測}
+
\text{估值}
+
\text{操作選擇}
+
\text{充分性評估}
+
\text{停止政策}
}
$$

本文主張：

1. 自調用需要區分監測與控制；
2. 不確定性不是唯一觸發條件；
3. 高信心但無證據仍可能需要調用；
4. 低信心但不可改善時應停止或轉交；
5. 記憶操作必須計算預期增益、成本與風險；
6. 不操作必須是合法候選；
7. 啟動與停止同等重要；
8. 沒有預算與循環檢測，遞歸不能保證終止；
9. 自調用不等於自動寫回；
10. 調用政策可以被繼承，但必須可校準、可修改與可拒絕。

因此：

$$
\boxed{
\text{自調用記憶}
=
\text{對記憶操作本身進行理性控制}
}
$$

當 GCMS 可以判斷何時檢索、何時比較、何時發散、何時集中、何時驗證與何時停止時，它才開始從被動知識庫轉向認知運行時。

但這也使記憶污染成為下一個核心問題：任何可以反覆調用、生成和反思的系統，如果不能區分來源、候選與接受內容，就可能在流暢遞歸中逐步失去現實錨點。

---

## 參考文獻

[1] Nelson, T. O., & Narens, L. (1990). *Metamemory: A Theoretical Framework and New Findings*. Psychology of Learning and Motivation, 26, 125–173.  
https://pdf.retrievalpractice.org/metacognition/4_Nelson_Narens_1990.pdf

[2] Koriat, A., & Goldsmith, M. (1996). *Monitoring and Control Processes in the Strategic Regulation of Memory Accuracy*. Psychological Review, 103(3), 490–517.  
https://doi.org/10.1037/0033-295X.103.3.490

[3] Koriat, A., Goldsmith, M., & Pansky, A. (2000). *Toward a Psychology of Memory Accuracy*. Annual Review of Psychology, 51, 481–537.  
https://www.annualreviews.org/content/journals/10.1146/annurev.psych.51.1.481

[4] Peng, Y., & Tullis, J. G. (2021). *Dividing Attention Impairs Metacognitive Control More Than Monitoring*. Memory & Cognition.  
https://pmc.ncbi.nlm.nih.gov/articles/PMC8205317/

[5] Metcalfe, J., & Kornell, N. (2005). *A Region of Proximal Learning Model of Study Time Allocation*. Journal of Memory and Language, 52(4), 463–477.  
https://www.columbia.edu/cu/psychology/metcalfe/PDFs/Metcalfe%20Kornell%202005.pdf

[6] Kornell, N., & Metcalfe, J. (2006). *Study Efficacy and the Region of Proximal Learning Framework*. Journal of Experimental Psychology: Learning, Memory, and Cognition, 32(3), 609–622.  
https://pubmed.ncbi.nlm.nih.gov/16719670/

[7] Shenhav, A., Botvinick, M. M., & Cohen, J. D. (2013). *The Expected Value of Control: An Integrative Theory of Anterior Cingulate Cortex Function*. Neuron, 79(2), 217–240.  
https://pmc.ncbi.nlm.nih.gov/articles/PMC3767969/

[8] Russell, S., & Wefald, E. (1991). *Principles of Metareasoning*. Artificial Intelligence, 49(1–3), 361–395.  
https://doi.org/10.1016/0004-3702(91)90015-C

[9] Tolpin, D., & Shimony, S. E. (2010). *Rational Value of Information Estimation for Measurement Selection*.  
https://arxiv.org/abs/1003.5305

[10] Hay, N., Russell, S., Tolpin, D., & Shimony, S. E. (2012/2014). *Selecting Computations: Theory and Applications*.  
https://arxiv.org/abs/1408.2048

[11] Pirolli, P., & Card, S. (1999). *Information Foraging*. Psychological Review, 106(4), 643–675.  
https://doi.org/10.1037/0033-295X.106.4.643

[12] Friston, K., Rigoli, F., Ognibene, D., Mathys, C., Fitzgerald, T., & Pezzulo, G. (2015). *Active Inference and Epistemic Value*. Cognitive Neuroscience, 6(4), 187–214.  
https://pubmed.ncbi.nlm.nih.gov/25689102/

[13] Friston, K., FitzGerald, T., Rigoli, F., Schwartenbeck, P., O’Doherty, J., & Pezzulo, G. (2016). *Active Inference and Learning*. Neuroscience & Biobehavioral Reviews, 68, 862–879.  
https://pmc.ncbi.nlm.nih.gov/articles/PMC5167251/

[14] Schick, T., et al. (2023). *Toolformer: Language Models Can Teach Themselves to Use Tools*. NeurIPS 2023.  
https://proceedings.neurips.cc/paper_files/paper/2023/hash/d842425e4bf79ba039352da0f658a906-Abstract-Conference.html

[15] Jiang, Z., et al. (2023). *Active Retrieval Augmented Generation*. Proceedings of EMNLP 2023.  
https://aclanthology.org/2023.emnlp-main.495/

[16] Asai, A., Wu, Z., Wang, Y., Sil, A., & Hajishirzi, H. (2023). *Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection*.  
https://arxiv.org/abs/2310.11511

[17] Jeong, S., Baek, J., Cho, S., Hwang, S. J., & Park, J. C. (2024). *Adaptive-RAG: Learning to Adapt Retrieval-Augmented Large Language Models through Question Complexity*. NAACL 2024.  
https://aclanthology.org/2024.naacl-long.389/

[18] Ni, S., et al. (2024). *When Do LLMs Need Retrieval Augmentation? Mitigating LLMs’ Overconfidence Helps Retrieval Augmentation*. Findings of ACL 2024.  
https://aclanthology.org/2024.findings-acl.675/

[19] Shinn, N., et al. (2023). *Reflexion: Language Agents with Verbal Reinforcement Learning*. NeurIPS 2023.  
https://openreview.net/forum?id=vAElhFcKW6

[20] Madaan, A., et al. (2023). *Self-Refine: Iterative Refinement with Self-Feedback*.  
https://arxiv.org/abs/2303.17651

[21] Yang, D., Zeng, L., Rao, J., & Zhang, Y. (2025). *Knowing You Don't Know: Learning When to Continue Search in Multi-round RAG through Self-Practicing*.  
https://arxiv.org/abs/2505.02811

---

## 系列銜接

上一篇：**《知識不只被重建：生成、組合與跨域再結構化》**

下一篇：**《記憶污染與三區治理：來源、候選與接受知識》**
