# 多路徑知識索引：區塊、流式、跳躍、發散與集中

> **系列**：可繼承的認知：從自我解構到遞歸生成式記憶系統（第 5 篇）  
> **作者**：Neo.K  
> **研究協作**：Aletheia（阿萊）  
> **版本**：v1.0  
> **日期**：2026-07-30  
> **文章類型**：命題猜想論文／知識索引理論論文／GCMS 架構論文

---

## 摘要

大型知識系統經常把「索引」理解成一個單一問題：輸入查詢，返回若干最相似文件。然而，知識的可提取性並不只依賴相似度。當任務要求定位局部定義、重建理論演化、跨越遠距概念、展開多條候選路徑或將分散材料收斂成較少的生成核時，單一向量近鄰、全文檢索或靜態知識圖都可能出現系統性失敗。本文提出 GCMS 的多路徑知識索引理論，將索引形式化為作用於同一知識底圖之上的五類基本算子：區塊索引、流式索引、跳躍索引、發散索引與集中索引。

區塊索引將作品分割成具有局部語義、上下文與邊界條件的可操作單元；流式索引保存知識形成、修改與推導的時間方向；跳躍索引允許系統利用符號、生成核、關係邊與多尺度近鄰跨越線性鄰接；發散索引將一個問題展開為多個觀點、子問題、假說與檢索路徑；集中索引則對多路結果進行聚類、去重、衝突保存、證據排序與生成核抽取。五種模式不是彼此替代，而是構成一組可組合算子族。

本文提出「索引任務非同質命題」：不存在一個固定索引策略，能在所有知識任務上同時最佳化局部精確度、時間連續性、遠距橋接、候選多樣性、全局壓縮、證據保真與成本。本文進一步提出多路徑支配猜想、發散—集中對偶命題、跳躍增益命題、邊界—連續性張力命題與矛盾保存命題，並建立區塊完整率、流路連貫度、跳躍增益、分支覆蓋率、集中保真度、矛盾保存率及索引成本等評估指標。

本文主張，GCMS 未來的索引器不應只是資料結構集合，而應是一個具任務辨識能力的索引控制系統。給定查詢、當前證據、不確定性、資源預算與治理限制，後設控制器應動態生成索引程式，例如「先以生成核跳躍，再沿版本流回溯，接著發散檢索，最後集中但保留衝突」。這使索引從靜態尋址轉化為可驗證的知識運算路徑，並為後續的生成、組合、自調用與遞歸自主循環建立基礎。

**關鍵詞**：GCMS、多路徑索引、區塊索引、流式索引、跳躍索引、發散檢索、集中檢索、知識圖、GraphRAG、事件分段、認知分塊、證據鏈

---

## 一、問題的提出：為什麼「相似文件搜尋」不等於知識索引

設知識庫為：

$$
\mathcal K=\{d_1,d_2,\ldots,d_n\},
$$

查詢為：

$$
q\in\mathcal Q.
$$

典型檢索系統以一個分數函數排序文件：

$$
S(d_i\mid q),
$$

並返回：

$$
\operatorname{TopK}(q)
=
\underset{d_i\in\mathcal K}{\operatorname{arg\,top\,k}}
S(d_i\mid q).
$$

這種模型適合回答「哪一些文件和查詢最相似」，卻不必然適合回答以下問題：

1. 某一概念第一次在哪個版本出現？
2. 一個理論從母問題經過哪些中間命題才形成目前版本？
3. 哪兩篇表面用詞不同的作品其實共享同一生成核？
4. 哪些遠距系列可以藉由一個符號、反例或方法形成橋接？
5. 一個新問題可能沿哪些互不相同的方向展開？
6. 大量相近作品如何收斂為較少核心結構，而不抹去真正矛盾？
7. 目前證據不足時，系統應擴大搜尋、向前追蹤、向後回溯，還是停止？

這些任務的差異不是查詢措辭差異，而是**尋址幾何不同**。

局部定義查詢偏好細粒度單元；理論演化查詢需要時間順序；跨領域橋接需要遠距跳躍；開放研究需要多分支探索；整體理解需要全局聚合。若全部被壓縮成單一相似度排序，系統通常會得到一組「看起來都相關」但無法重建路徑、來源與結構的結果。

因此本文將知識索引重新定義為：

> 在證據、結構、時間與成本約束下，生成一條或多條可重演的知識尋址路徑，使系統能定位、連接、展開、聚合並驗證與任務相關的知識單元。

形式上，索引不再只是：

$$
q\mapsto\{d_1,\ldots,d_k\},
$$

而是：

$$
(q,\mathcal K,\Theta)
\mapsto
\left(
\pi,
\mathcal E,
\mathcal C,
\mathcal T
\right),
$$

其中：

- $\pi$ ：索引操作序列；
- $\mathcal E$ ：取得的證據集合；
- $\mathcal C$ ：證據之間的關係與上下文；
- $\mathcal T$ ：可重演的檢索軌跡；
- $\Theta$ ：權限、成本、版本與停止條件。

---

## 二、研究背景：知識尋址本來就不是單一路徑

### 2.1 認知分塊：局部結構能降低工作記憶負擔

分塊研究顯示，人類會利用既有知識與規律，把多個元素重新編碼為較少、較具意義的單元。Chekaf 等人的實驗指出，參與者會在立即記憶任務中主動形成 chunks，而 chunking 可藉由知識降低需維持的單元數量。[1] Chen 與 Cowan 的研究則顯示，當排除語音複誦等因素後，工作記憶容量更接近以 chunks 而非原始項目計算。[2]

這類結果不能直接推出數位知識庫應如何切分，但提供一項重要啟示：

$$
\text{可操作單位}
\neq
\text{原始最小單位}.
$$

若系統以整篇論文為唯一索引單位，局部定義與證據會被大文件稀釋；若每一句都獨立索引，生成路徑與上下文又會碎裂。因此區塊不是任意字數窗口，而應是一個帶有內部凝聚力與外部邊界的知識單元。

### 2.2 事件分段與時間情境：連續知識會被組織成可回溯事件

人類經驗在物理時間上連續，記憶卻常以事件為單位。事件邊界會影響哪些資訊被整合、哪些資訊被分離，以及跨邊界的時間關係是否容易被保持。海馬迴與前額葉相關研究顯示，穩定情境有利於事件內部的時間綁定，而情境轉換會形成新的事件模型。[3][4][5]

這支持一種不同於靜態文件索引的視角：

$$
\text{知識狀態}
=
\text{內容}
+
\text{形成順序}
+
\text{邊界轉換}.
$$

一篇論文的最終版本無法完整替代它的推導流；同一概念在不同時期的意義，也不能只靠最新摘要理解。流式索引因此必須保存狀態轉換、版本、前置依賴、否定路徑與中止分支。

### 2.3 小世界與多尺度圖：遠距節點可以藉由少量長連結快速抵達

HNSW 將多尺度鄰近圖構造成分層的小世界索引，上層長距離連結用於快速導航，下層局部連結則用於精細搜尋。其效果說明：在高維相似空間中，只依賴線性掃描或單尺度鄰近通常效率不足；多尺度、跨距離的連結可以顯著改變尋址成本。[6]

對 GCMS 而言，「跳躍」不限於向量近鄰。跳躍邊可以來自：

- 相同符號；
- 相同生成核；
- 相同母問題；
- 反例關係；
- 方法借用；
- 版本派生；
- 產品—理論投影；
- 人工指定的橋接。

GraphRAG 與其他圖檢索研究也顯示，將實體、文本與關係組成圖結構，能支援跨文件、多跳與全局性問題，而不只是返回獨立段落。[7][8][9][10]

### 2.4 發散檢索：單一查詢通常只覆蓋問題的一個投影

對開放問題，查詢 $q$ 本身往往是不完整的。單次表述可能只激活某一術語、某一學科或某一解法。多查詢、查詢分解與鏈式檢索研究的共同方向，是把單一查詢展開為多個子查詢或觀點，再合併取得的證據。[11][12]

可寫成：

$$
q
\xrightarrow{\mathrm{expand}}
\{q_1,q_2,\ldots,q_m\}.
$$

發散的目標不是產生越多查詢越好，而是提升對潛在相關區域的覆蓋：

$$
\operatorname{Coverage}
\left(
\bigcup_{j=1}^{m}R(q_j)
\right)
>
\operatorname{Coverage}(R(q)).
$$

心理學中的發散與集中思考研究也長期區分「生成多種可能」與「選擇或形成較少答案」兩種處理模式；實驗研究顯示兩者在任務表現與神經活動上並非完全相同。[13][14]

本文不把創造力任務直接等同於檢索演算法，但借用其操作性區分：發散負責擴大候選空間，集中負責評估與重構候選空間。

### 2.5 全局聚合與社群摘要：集中不只是把前幾名文件再摘要一次

GraphRAG 的 global search 將文本轉成實體圖、建立社群階層並生成社群摘要，用以處理「整個資料集主要主題為何」這類不適合局部近鄰檢索的問題。[9] 其他多粒度圖索引研究也指出，局部 chunks、實體關係、文件層與社群層具有不同成本與用途。[10][15]

集中因此至少包含：

1. 去除重複表述；
2. 聚合同源分支；
3. 找出共同生成核；
4. 對證據品質排序；
5. 保存少數但關鍵的反例；
6. 標示不能合併的矛盾；
7. 將局部結果映射回全局結構。

若集中只追求短摘要，就可能把「多個可相容觀點」與「真正互相矛盾的命題」一起抹平。

---

## 三、統一知識底圖

### 3.1 知識單元

設 GCMS 的基本知識單元集合為：

$$
\mathcal U
=
\{u_1,u_2,\ldots,u_N\}.
$$

每個單元定義為：

$$
u_i
=
\left(
 c_i,
 h_i,
 b_i,
 \tau_i,
 s_i,
 v_i,
 a_i
\right),
$$

其中：

- $c_i$ ：內容；
- $h_i$ ：來源與內容雜湊；
- $b_i$ ：區塊邊界與上下文；
- $\tau_i$ ：時間、版本或形成序位；
- $s_i$ ：語義指紋；
- $v_i$ ：可見性與治理狀態；
- $a_i$ ：作品、章節、公式、實驗或生成核等類型。

### 3.2 多關係邊

知識底圖不是單一邊類型的圖，而是：

$$
\mathcal G
=
\left(
\mathcal U,
\mathcal E
\right),
$$

其中：

$$
\mathcal E
=
\mathcal E_{\mathrm{sem}}
\cup
\mathcal E_{\mathrm{temp}}
\cup
\mathcal E_{\mathrm{gen}}
\cup
\mathcal E_{\mathrm{evid}}
\cup
\mathcal E_{\mathrm{contra}}
\cup
\mathcal E_{\mathrm{manual}}.
$$

各類邊分別表示：

- $\mathcal E_{\mathrm{sem}}$ ：語義相似或主題相關；
- $\mathcal E_{\mathrm{temp}}$ ：時間、版本與狀態轉換；
- $\mathcal E_{\mathrm{gen}}$ ：生成、推導與依賴；
- $\mathcal E_{\mathrm{evid}}$ ：主張與原始證據；
- $\mathcal E_{\mathrm{contra}}$ ：矛盾、反例或不相容；
- $\mathcal E_{\mathrm{manual}}$ ：人工指定橋接與策展關係。

同一對節點可以具有多個關係：

$$
(u_i,u_j)
\in
\mathcal E_{\mathrm{sem}}
\cap
\mathcal E_{\mathrm{temp}}.
$$

### 3.3 索引不是另一份知識，而是對底圖施加的運算

本文定義索引算子族：

$$
\mathfrak I
=
\{
\mathsf B,
\mathsf F,
\mathsf J,
\mathsf D,
\mathsf C
\},
$$

分別對應：

- $\mathsf B$ ：Block，區塊；
- $\mathsf F$ ：Flow，流式；
- $\mathsf J$ ：Jump，跳躍；
- $\mathsf D$ ：Divergence，發散；
- $\mathsf C$ ：Convergence，集中。

這些算子使用同一批來源、版本與證據，但產生不同尋址路徑。

---

## 四、區塊索引：將內容切成可操作、可重組但不失去邊界的單元

### 4.1 區塊不是固定字數窗口

對作品 $d$ ，區塊算子為：

$$
\mathsf B(d;\theta_B)
=
\{b_1,b_2,\ldots,b_m\},
$$

並要求：

$$
\bigcup_{i=1}^{m}\operatorname{Span}(b_i)
=
\operatorname{Span}(d).
$$

但相鄰區塊可重疊，以保存跨邊界上下文：

$$
\operatorname{Span}(b_i)
\cap
\operatorname{Span}(b_{i+1})
\neq
\varnothing.
$$

固定 token 數量只是一種低成本方法。更完整的區塊邊界應綜合：

$$
\operatorname{BoundaryScore}(t)
=
\alpha S_{\mathrm{topic}}
+
\beta S_{\mathrm{syntax}}
+
\gamma S_{\mathrm{event}}
+
\delta S_{\mathrm{symbol}}
+
\eta S_{\mathrm{author}}.
$$

其中可考慮：

- 標題與章節；
- 語義主題轉移；
- 定義、定理、證明、實驗等結構；
- 公式與符號作用域；
- 作者明確標示的邊界；
- 事件或版本轉換。

### 4.2 區塊的最小充分上下文

區塊 $b_i$ 不只保存文字，還應保存：

$$
b_i
=
\left(
 x_i,
 c_i^{-},
 c_i^{+},
 \operatorname{scope}_i,
 \operatorname{deps}_i
\right),
$$

其中：

- $x_i$ ：核心內容；
- $c_i^{-}$ ：前置上下文；
- $c_i^{+}$ ：後續上下文；
- $\operatorname{scope}_i$ ：符號、版本與章節作用域；
- $\operatorname{deps}_i$ ：依賴的定義、證據與前置命題。

這可降低「檢索到一句正確文字，卻失去它成立的假設」的風險。

### 4.3 區塊完整率

定義任務 $q$ 所需的最小證據集合為 $E_q^\ast$ ，實際取回區塊證據為 $E_q$ ，則：

$$
\operatorname{BCR}(q)
=
\frac{|E_q\cap E_q^\ast|}{|E_q^\ast|}.
$$

但還需懲罰失去上下文的孤立命中：

$$
\operatorname{BCR}^{+}(q)
=
\operatorname{BCR}(q)
\cdot
\operatorname{ContextAdequacy}(E_q).
$$

### 4.4 區塊索引的失敗模式

1. **過度分塊**：命題、證明與條件被分散；
2. **分塊不足**：局部訊號被大篇幅背景稀釋；
3. **邊界僵化**：同一作品只能有一套切分；
4. **符號失域**：公式被取回，但定義不在同一區塊；
5. **版本混塊**：不同版本內容被視為同一語義單元。

因此本文主張 GCMS 應允許：

$$
\mathsf B_1(d),
\mathsf B_2(d),
\ldots,
\mathsf B_r(d),
$$

也就是同一作品具有多粒度、多目的區塊視圖，而不是只有一套永久切分。

---

## 五、流式索引：保存知識如何形成，而不只保存最後狀態

### 5.1 流是有方向的狀態序列

對一個理論或作品系列，定義狀態流：

$$
\mathcal F
=
\left(
 z_0
\xrightarrow{e_1}
 z_1
\xrightarrow{e_2}
 \cdots
\xrightarrow{e_T}
 z_T
\right),
$$

其中：

- $z_t$ ：時間 $t$ 的知識狀態；
- $e_t$ ：修改、反例、實驗、合併、分支或重命名事件。

流式索引算子為：

$$
\mathsf F(q,z_t;w,d)
\rightarrow
\left(
 z_{t-w},\ldots,z_t,\ldots,z_{t+d}
\right),
$$

其中 $w$ 是回溯窗口， $d$ 是前向追蹤窗口。

### 5.2 流式索引的五種方向

1. **回溯**：目前結論從何而來；
2. **前向追蹤**：一個母命題後來形成哪些分支；
3. **版本差分**：兩版之間改變什麼；
4. **中止路徑**：哪些方向曾被提出但被放棄；
5. **週期與復現**：某一問題是否在不同時期重複出現。

### 5.3 流路連貫度

令檢索到的有序節點為：

$$
P=(u_{i_1},u_{i_2},\ldots,u_{i_k}),
$$

定義流路連貫度：

$$
\operatorname{FC}(P)
=
\frac{1}{k-1}
\sum_{j=1}^{k-1}
\mathbf 1
\left[
(u_{i_j},u_{i_{j+1}})
\in
\mathcal E_{\mathrm{temp}}
\cup
\mathcal E_{\mathrm{gen}}
\right].
$$

可再加入方向一致性：

$$
\operatorname{FDC}(P)
=
\operatorname{FC}(P)
\cdot
\left(
1-\frac{N_{\mathrm{reverse}}}{k-1}
\right).
$$

### 5.4 流式索引與最新版本偏誤

流式系統若只按時間衰減加權：

$$
w_t=e^{-\lambda\Delta t},
$$

會自然偏向最新內容。但舊版本可能包含：

- 已被刪除的假設；
- 失敗但重要的實驗；
- 被後來版本掩蓋的概念來源；
- 重命名前的同義術語。

因此流式索引不能把「最近」等同「最重要」，而應分離：

$$
S_{\mathrm{flow}}
=
\alpha S_{\mathrm{temporal}}
+
\beta S_{\mathrm{causal}}
+
\gamma S_{\mathrm{version}}
+
\delta S_{\mathrm{evidence}}.
$$

---

## 六、跳躍索引：跨越表面相似度與線性鄰接

### 6.1 跳躍的定義

設目前節點為 $u_i$ ，一般局部檢索只查看鄰域：

$$
\mathcal N_r(u_i)
=
\{u_j\mid \operatorname{dist}(u_i,u_j)\leq r\}.
$$

跳躍索引允許選擇：

$$
u_j\notin\mathcal N_r(u_i),
$$

但滿足某個高辨識度關係：

$$
\operatorname{Anchor}(u_i,u_j\mid q)\geq\theta_J.
$$

因此：

$$
\mathsf J(u_i,q)
=
\operatorname{TopK}_{u_j}
S_J(u_j\mid u_i,q).
$$

### 6.2 跳躍分數

可定義：

$$
\begin{aligned}
S_J(u_j\mid u_i,q)
={}&
\alpha S_{\mathrm{semantic}}
+
\beta S_{\mathrm{symbol}}
+
\gamma S_{\mathrm{kernel}}\\
&+
\delta S_{\mathrm{relation}}
+
\eta S_{\mathrm{contrast}}
+
\zeta S_{\mathrm{manual}}.
\end{aligned}
$$

其中 $S_{\mathrm{contrast}}$ 允許跳到反例與矛盾，而不是只跳到相似內容。

### 6.3 多尺度跳躍

借鑑多層小世界索引，可將知識圖分成不同尺度：

$$
\mathcal G^{(0)},
\mathcal G^{(1)},
\ldots,
\mathcal G^{(L)}.
$$

其中：

- 低層保存段落、定義與局部證據；
- 中層保存作品、系列與生成核；
- 高層保存跨域方法、母問題與抽象關係。

跳躍路徑可以先在高層快速定位，再下降到原文證據：

$$
\mathcal G^{(L)}
\rightarrow
\mathcal G^{(L-1)}
\rightarrow
\cdots
\rightarrow
\mathcal G^{(0)}.
$$

### 6.4 跳躍增益

設不允許跳躍的基線檢索效用為 $U_0(q)$ ，允許跳躍後為 $U_J(q)$ ：

$$
\operatorname{JG}(q)
=
U_J(q)-U_0(q).
$$

但也需計算跳躍漂移：

$$
\operatorname{JD}(q)
=
1-
\frac{|E_J\cap E_q^\ast|}{|E_J|}.
$$

真正有效的跳躍需同時滿足：

$$
\operatorname{JG}(q)>0,
$$

且：

$$
\operatorname{JD}(q)<\theta_{\mathrm{drift}}.
$$

### 6.5 語義瞬移風險

跳躍索引最危險的錯誤不是找不到，而是找到一個「高階概念很像，底層假設完全不同」的遠端節點。

例如兩篇作品都使用「固定點」，但其數學空間、算子條件與證明目的不同。若只靠詞彙或向量相似度跳躍，系統可能把比喻關係誤當可運算同一性。

因此每次跳躍都應附帶：

$$
J_{ij}
=
\left(
\text{理由},
\text{邊類型},
\text{尺度},
\text{證據},
\text{不相容條件}
\right).
$$

---

## 七、發散索引：將單一查詢展開成受控候選空間

### 7.1 發散不是隨機聯想

發散索引算子：

$$
\mathsf D(q;\theta_D)
=
\{q_1,q_2,\ldots,q_m\}.
$$

子查詢可來自不同變換：

$$
q_j
=
T_j(q),
$$

例如：

- 同義與術語變換；
- 抽象化或具體化；
- 因果前件與後件；
- 方法、反例、限制與應用；
- 不同學科投影；
- 不同時間與版本；
- 支持與反對立場；
- 部分問題分解。

### 7.2 發散樹

發散過程形成樹：

$$
\mathcal T_D
=
(V_D,E_D),
$$

根節點為原始問題 $q_0$ ，每個節點可再展開：

$$
q_{t+1}^{(j)}
=
T_j(q_t).
$$

若不限制深度與寬度，候選數可能指數增長：

$$
|V_D|
\approx
\sum_{t=0}^{L}b^t.
$$

因此發散必須受預算控制：

$$
|V_D|\leq B_D,
$$

$$
L\leq L_{\max}.
$$

### 7.3 分支覆蓋與分支新穎度

若真實相關面向集合為 $A_q^\ast$ ，已覆蓋面向為 $A_D$ ：

$$
\operatorname{BCov}(q)
=
\frac{|A_D\cap A_q^\ast|}{|A_q^\ast|}.
$$

分支間的平均差異可定義為：

$$
\operatorname{BDiv}(q)
=
\frac{2}{m(m-1)}
\sum_{i<j}
\left(
1-\operatorname{sim}(q_i,q_j)
\right).
$$

好的發散需避免兩種極端：

$$
\operatorname{BDiv}\approx0,
$$

代表只是同義改寫；

$$
\operatorname{BDiv}\approx1,
$$

則可能表示分支已脫離原問題。

### 7.4 證據驅動發散

GCMS 不應只在查詢開始時發散。當檢索後發現證據缺口，也可生成新分支：

$$
q_{t+1}
=
\operatorname{GapToQuery}
\left(
q_t,E_t,\mathcal U_t
\right),
$$

其中 $\mathcal U_t$ 是未解決的不確定性。

觸發條件可為：

$$
\operatorname{Coverage}(E_t)<\theta_C,
$$

或：

$$
\operatorname{Conflict}(E_t)>\theta_X.
$$

### 7.5 發散爆炸與新穎性幻覺

發散容易產生：

- 大量同義問題；
- 與來源無關的創意分支；
- 被模型語言風格誤判為新概念的重複內容；
- 只支持原假設、不搜尋反例的確認偏誤；
- 無限研究循環。

因此每個分支應保存：

$$
D_j
=
\left(
q_j,
\operatorname{parent}(q_j),
\operatorname{transform}_j,
\operatorname{expectedGain}_j,
\operatorname{cost}_j,
\operatorname{status}_j
\right).
$$

---

## 八、集中索引：從多路候選恢復結構，而不是只做摘要

### 8.1 集中算子

給定發散或多路檢索結果：

$$
\mathcal R
=
\{r_1,r_2,\ldots,r_n\},
$$

集中算子為：

$$
\mathsf C(\mathcal R;q,\theta_C)
=
\left(
\mathcal K_R,
\mathcal X_R,
\mathcal S_R,
\mathcal E_R
\right),
$$

其中：

- $\mathcal K_R$ ：抽取的生成核或主題核心；
- $\mathcal X_R$ ：不可合併的矛盾與反例；
- $\mathcal S_R$ ：代表性證據集合；
- $\mathcal E_R$ ：來源與關係映射。

### 8.2 集中的五個階段

#### 第一階段：正規化

對名稱、符號、版本與引用進行對齊：

$$
\widetilde r_i
=
\operatorname{Normalize}(r_i).
$$

#### 第二階段：聚類與去重

$$
\mathcal R
\rightarrow
\{C_1,C_2,\ldots,C_k\},
$$

其中每個 $C_j$ 是語義或生成關係較密集的群集。

#### 第三階段：證據排序

$$
S_E(r_i)
=
\alpha S_{\mathrm{source}}
+
\beta S_{\mathrm{direct}}
+
\gamma S_{\mathrm{version}}
+
\delta S_{\mathrm{independent}}.
$$

#### 第四階段：核心抽取

$$
K_j
=
\operatorname{Invariant}(C_j),
$$

但抽取的核心必須附帶其支撐與不適用邊界。

#### 第五階段：矛盾保存

若兩命題：

$$
p_i\land p_j\models\bot,
$$

則不得只因一方較常見就自動刪除另一方，而應保存：

$$
X_{ij}
=
\left(
 p_i,p_j,
 \text{各自證據},
 \text{適用條件},
 \text{未決狀態}
\right).
$$

### 8.3 集中保真度

令集中前的關鍵不變量集合為 $\mathcal I(\mathcal R)$ ，集中結果為 $Y$ ：

$$
\operatorname{CFid}
=
\frac{
|\mathcal I(Y)\cap\mathcal I(\mathcal R)|
}{
|\mathcal I(\mathcal R)|
}.
$$

定義矛盾保存率：

$$
\operatorname{CPR}
=
\frac{|\mathcal X_Y\cap\mathcal X_R|}{|\mathcal X_R|}.
$$

若一個摘要非常流暢但：

$$
\operatorname{CPR}\approx0,
$$

則它可能只是把爭議抹平，而不是完成可靠集中。

### 8.4 集中與壓縮的差異

一般壓縮關心：

$$
\frac{|Y|}{|\mathcal R|}.
$$

可靠集中還關心：

$$
\operatorname{Traceability}(Y),
$$

$$
\operatorname{BoundaryPreservation}(Y),
$$

以及：

$$
\operatorname{MinorityEvidenceRetention}(Y).
$$

因此：

$$
\boxed{
\text{集中}
\neq
\text{刪到只剩最常見敘述}
}
$$

---

## 九、發散—集中對偶

### 9.1 不是互相抵銷，而是兩個不同階段

發散擴大候選空間：

$$
\mathsf D:
\mathcal Q
\rightarrow
\mathcal P(\mathcal Q),
$$

集中把候選空間轉換為結構化結果：

$$
\mathsf C:
\mathcal P(\mathcal R)
\rightarrow
\mathcal Y.
$$

兩者組合：

$$
q
\xrightarrow{\mathsf D}
\{q_1,\ldots,q_m\}
\xrightarrow{\mathrm{Retrieve}}
\mathcal R
\xrightarrow{\mathsf C}
Y.
$$

### 9.2 集中不是發散的逆函數

一般而言：

$$
\mathsf C(\mathsf D(q))
\neq q.
$$

因為發散可能發現原問題未包含的新證據、衝突與結構。集中後的結果 $Y$ 應該是受證據修正的新狀態，而不是回到起點。

### 9.3 對偶效用

設發散後的覆蓋增益為：

$$
G_D
=
\operatorname{Coverage}(\mathcal R_D)
-
\operatorname{Coverage}(\mathcal R_0),
$$

集中後的認知負擔降低為：

$$
G_C
=
\operatorname{Load}(\mathcal R_D)
-
\operatorname{Load}(Y).
$$

可靠流程需同時保持：

$$
G_D>0,
$$

$$
G_C>0,
$$

以及：

$$
\operatorname{CFid}\geq\theta_F.
$$

---

## 十、後設索引控制器：何時使用哪一條路徑

### 10.1 索引程式

GCMS 的索引控制器不是固定選擇一種模式，而是生成算子序列：

$$
\pi_q
=
(o_1,o_2,\ldots,o_T),
$$

其中：

$$
o_t\in\mathfrak I.
$$

例如：

$$
\pi_1
=(\mathsf B,\mathsf J,\mathsf C),
$$

表示先做局部區塊定位，再跨系列跳躍，最後聚合。

又如：

$$
\pi_2
=(\mathsf J,\mathsf F^{-},\mathsf D,\mathsf C),
$$

表示先以生成核跳到遠端作品，再沿時間流回溯來源，之後發散搜尋相關分支，最後集中。

### 10.2 控制器狀態

控制器輸入：

$$
\Sigma_t
=
\left(
q,
E_t,
U_t,
X_t,
B_t,
R_t,
P_t
\right),
$$

其中：

- $E_t$ ：目前證據；
- $U_t$ ：不確定性；
- $X_t$ ：衝突程度；
- $B_t$ ：資源預算；
- $R_t$ ：剩餘遞歸深度；
- $P_t$ ：權限與治理政策。

動作選擇：

$$
o_{t+1}
=
\Pi(\Sigma_t).
$$

### 10.3 效用函數

可定義：

$$
\begin{aligned}
U(\pi_q)
={}&
\alpha R_{\mathrm{relevance}}
+
\beta R_{\mathrm{coverage}}
+
\gamma R_{\mathrm{faithfulness}}\\
&+
\delta R_{\mathrm{diversity}}
+
\eta R_{\mathrm{traceability}}
-
\lambda C_{\mathrm{cost}}
-
\mu C_{\mathrm{risk}}.
\end{aligned}
$$

控制器目標：

$$
\pi_q^\ast
=
\underset{\pi}{\operatorname{argmax}}
U(\pi).
$$

### 10.4 停止條件

索引不能永遠展開。停止條件可為：

$$
\Delta U_t<\varepsilon,
$$

或：

$$
\operatorname{Coverage}(E_t)\geq\theta_C,
$$

或：

$$
B_t\leq0,
$$

或：

$$
\operatorname{StateRepeat}(\Sigma_t)=1,
$$

或需要外部權限與人工判斷。

---

## 十一、核心命題與猜想

### 命題一：索引任務非同質命題

不存在一個固定索引策略 $I^\ast$ ，能對所有任務分布 $\mathcal Q$ 同時最大化：

$$
\{
\text{局部精確度},
\text{時間連續性},
\text{遠距橋接},
\text{候選多樣性},
\text{全局壓縮},
\text{證據保真},
\text{低成本}
\}.
$$

只要存在兩類任務 $q_a,q_b$ ，其最優尋址幾何不同，即有：

$$
\operatorname{argmax}_{I}U(I\mid q_a)
\neq
\operatorname{argmax}_{I}U(I\mid q_b).
$$

### 命題二：多路徑支配猜想

對具有局部、時間、跨文件與全局任務混合的查詢分布，若後設控制器能正確選擇算子序列，則：

$$
\mathbb E_{q\sim\mathcal Q}
[U(\pi_q^\ast)]
>
\max_{I\in\mathfrak I}
\mathbb E_{q\sim\mathcal Q}
[U(I(q))].
$$

此命題不是宣稱多路徑對每一查詢都優於最佳單一路徑，而是宣稱在異質任務分布上，動態選路的平均效用可能更高。

### 命題三：邊界—連續性張力命題

更細的區塊通常提高局部可定位性，卻可能降低跨區塊連續性：

$$
\frac{\partial R_{\mathrm{local}}}{\partial g}>0,
$$

$$
\frac{\partial R_{\mathrm{flow}}}{\partial g}<0,
$$

其中 $g$ 表示分塊細粒度。

因此最佳粒度依任務而變：

$$
g^\ast=g(q).
$$

### 命題四：跳躍增益命題

當答案證據分散於語義距離遠但關係上可橋接的節點時，加入有證據的跳躍邊可提升召回或降低尋址成本：

$$
\operatorname{JG}(q)>0.
$$

但若跳躍邊缺少作用域與不相容條件，漂移風險上升。

### 命題五：發散—集中對偶命題

只發散會提高覆蓋但增加成本與噪音；只集中會降低負擔但可能遺失新穎性與少數證據。對開放問題，存在一組非零發散與非零集中強度：

$$
(d^\ast,c^\ast),
\qquad
 d^\ast>0,
\quad
 c^\ast>0,
$$

使總效用高於任一極端。

### 命題六：矛盾保存命題

若集中算子只以頻率、相似度或摘要流暢度作為目標，則隨壓縮率提高，矛盾保存率可能下降：

$$
\frac{\partial\operatorname{CPR}}{\partial\operatorname{Compression}}<0.
$$

加入顯式矛盾邊與少數證據保留政策，應能改善此問題。

### 命題七：可重演索引命題

若索引結果保存：

$$
\left(
\pi,
\theta,
\text{版本},
\text{證據},
\text{隨機種子}
\right),
$$

則在底層知識狀態不變時，索引路徑應可被近似重演。若系統只保存最終回答，而不保存路徑，則無法區分來源變動、模型漂移與索引策略改變。

---

## 十二、評估框架

### 12.1 任務類型

建立五類基準：

1. **局部定位任務**：找定義、公式、段落與直接證據；
2. **演化重建任務**：找版本、前置命題與形成順序；
3. **橋接任務**：找跨系列、跨術語與跨學科關係；
4. **發現任務**：對開放問題生成多種有證據的研究方向；
5. **全局集中任務**：抽取核心、聚合系列並保存矛盾。

### 12.2 比較系統

至少比較：

- BM25 或全文檢索；
- 單一向量近鄰；
- 單一知識圖檢索；
- 固定 chunk RAG；
- 多路徑但無控制器；
- 完整多路徑控制器。

### 12.3 主要指標

局部檢索：

$$
\mathrm{Recall@k},
\quad
\mathrm{MRR},
\quad
\mathrm{nDCG@k}.
$$

流式重建：

$$
\operatorname{FC},
\quad
\operatorname{FDC},
\quad
\operatorname{VersionAccuracy}.
$$

跳躍：

$$
\operatorname{JG},
\quad
\operatorname{JD},
\quad
\operatorname{HopCount}.
$$

發散：

$$
\operatorname{BCov},
\quad
\operatorname{BDiv},
\quad
\operatorname{NovelEvidenceRate}.
$$

集中：

$$
\operatorname{CFid},
\quad
\operatorname{CPR},
\quad
\operatorname{Traceability}.
$$

成本：

$$
C
=
\alpha T_{\mathrm{latency}}
+
\beta N_{\mathrm{retrieval}}
+
\gamma N_{\mathrm{tokens}}
+
\delta N_{\mathrm{graph\,ops}}.
$$

### 12.4 消融實驗

依序移除：

- 流式邊；
- 生成核跳躍；
- 反例邊；
- 發散分支；
- 集中矛盾保存；
- 後設控制器。

若移除某一算子只影響對應任務，而不顯著影響其他任務，支持五種索引具有功能分化。若單一向量檢索在所有任務與成本下都不劣於多路徑系統，則本文核心猜想受到否證。

---

## 十三、工程架構

### 13.1 七層架構

GCMS 多路徑索引可分為：

$$
\begin{aligned}
L_0&=\text{無損來源與版本層},\\
L_1&=\text{多粒度區塊層},\\
L_2&=\text{時間與生成流層},\\
L_3&=\text{多關係圖與跳躍層},\\
L_4&=\text{發散／集中算子層},\\
L_5&=\text{後設控制與停止層},\\
L_6&=\text{證據、審計與治理層}.
\end{aligned}
$$

### 13.2 索引紀錄

每次索引執行保存：

```json
{
  "trace_id": "TRACE-...",
  "query": "...",
  "operators": ["block", "jump", "flow-backward", "diverge", "converge"],
  "parameters": {},
  "retrieved_units": [],
  "evidence_citations": [],
  "conflicts": [],
  "stop_reason": "coverage_satisfied",
  "cost": {},
  "knowledge_snapshot": "sha256:..."
}
```

### 13.3 候選路徑與正式知識分離

索引路徑可能產生新的橋接與群集，但這些結果不應直接改寫正式知識圖。

應分成：

$$
\mathcal E
=
\mathcal E_{\mathrm{accepted}}
\cup
\mathcal E_{\mathrm{candidate}}.
$$

候選跳躍邊、生成核或群集需經：

$$
\operatorname{Propose}
\rightarrow
\operatorname{Verify}
\rightarrow
\operatorname{Accept/Reject}.
$$

---

## 十四、失敗模式與治理邊界

### 14.1 過度分塊

系統返回大量局部正確但無法組合的片段。

治理：保留父區塊、章節作用域與跨區塊依賴。

### 14.2 邊界鎖死

早期錯誤切分被永久制度化。

治理：允許多粒度視圖與版本化重新分塊。

### 14.3 流式近期偏誤

新內容自動覆蓋舊內容的重要性。

治理：分離時間新近性、因果重要性與證據品質。

### 14.4 語義瞬移

高階詞彙相似造成跨域錯誤映射。

治理：每次跳躍保存理由、作用域與不相容條件。

### 14.5 發散爆炸

分支數量增長，但資訊增益下降。

治理：分支預算、重複檢測、邊際增益停止與人工閘門。

### 14.6 集中抹平

少數證據、反例與真正矛盾被「主題摘要」消失。

治理：顯式矛盾邊、矛盾保存率與少數證據配額。

### 14.7 自我強化索引漂移

系統依自己生成的群集建立新跳躍，再用新跳躍證明原群集合理。

治理：來源邊、候選邊與接受邊分區；禁止候選關係自我驗證。

### 14.8 權限穿越

高層社群摘要或圖統計洩漏不可見作品的存在與主題。

治理：所有聚合與跳躍必須在查詢主體可見子圖上執行：

$$
\mathcal G_p
=
\mathcal G[\mathcal U_p].
$$

---

## 十五、與 GCMS 既有雙軌記憶架構的關係

上一篇建立：

$$
\mathrm{GCMS}
=
\mathrm{LosslessArchive}
+
\mathrm{SemanticMemory}
+
\mathrm{EvidenceBridge}.
$$

本文進一步說明，語義記憶本身不能只是一個向量表，而應是：

$$
\mathrm{SemanticMemory}
=
\left(
\mathcal G,
\mathfrak I,
\Pi,
\mathcal T
\right),
$$

其中：

- $\mathcal G$ ：統一知識底圖；
- $\mathfrak I$ ：五類索引算子；
- $\Pi$ ：後設控制器；
- $\mathcal T$ ：可重演軌跡。

雙軌架構保證原文可以被驗證；多路徑索引則決定在何時、以何種幾何找到原文與語義結構。

完整形式為：

$$
\boxed{
\begin{aligned}
\mathrm{GCMS}_{\mathrm{index}}
={}&
\mathrm{LosslessSource}\\
&+
\mathrm{MultiGranularBlocks}\\
&+
\mathrm{TemporalFlows}\\
&+
\mathrm{GraphJumps}\\
&+
\mathrm{DivergentSearch}\\
&+
\mathrm{ConvergentIntegration}\\
&+
\mathrm{MetaControl}\\
&+
\mathrm{EvidenceTrace}.
\end{aligned}
}
$$

---

## 十六、結論

知識索引不是一個可以被單一相似度函數完全取代的問題。

不同任務要求不同尋址幾何：

- 區塊索引處理局部可操作性；
- 流式索引保存形成方向與狀態轉換；
- 跳躍索引跨越線性鄰接與表面術語；
- 發散索引擴大問題與證據空間；
- 集中索引恢復核心、證據與矛盾結構。

因此：

$$
\boxed{
\text{多路徑知識索引}
\neq
\text{多個搜尋框並列}
}
$$

它是一套可組合的知識運算子，以及一個根據任務、不確定性、成本與治理限制選擇運算路徑的後設控制系統。

若這套理論成立，GCMS 未來不會只回答「最相關的文章是哪一篇」，而能回答：

- 該從哪一個局部證據開始；
- 該沿哪條時間與生成路徑回溯；
- 該跳到哪個遠距系列；
- 該展開哪些相互獨立的研究分支；
- 最後哪些內容可以合併，哪些矛盾必須保留。

這使索引從資料庫查詢提升為：

$$
\boxed{
\text{可驗證的知識路徑生成}
}
$$

而下一篇將在此基礎上處理更進一步的問題：當系統找到多個知識單元後，它如何不只重建既有作品，而是進行生成、組合與跨域再結構化。

---

## 參考文獻

[1] Chekaf, M., Cowan, N., & Mathy, F. (2016). *Chunk Formation in Immediate Memory and How It Relates to Data Compression*. Cognition, 155, 96–107.  
https://pmc.ncbi.nlm.nih.gov/articles/PMC4983232/

[2] Chen, Z., & Cowan, N. (2009). *Core Verbal Working-Memory Capacity: The Limit in Words Retained Without Covert Articulation*. Quarterly Journal of Experimental Psychology, 62(7), 1420–1429.  
https://pmc.ncbi.nlm.nih.gov/articles/PMC2693080/

[3] Bladon, J. H., et al. (2019). *In a Temporally Segmented Experience Hippocampal Neurons Represent Temporally Drifting Context But Not Discrete Segments*. Journal of Neuroscience.  
https://pubmed.ncbi.nlm.nih.gov/31253754/

[4] DuBrow, S., & Davachi, L. (2016). *Temporal Binding Within and Across Events*. Neurobiology of Learning and Memory, 134, 107–114.  
https://pubmed.ncbi.nlm.nih.gov/27422018/

[5] Lohnas, L. J., et al. (2023). *Neural Temporal Context Reinstatement of Event Structure During Memory Recall*. Communications Biology.  
https://pmc.ncbi.nlm.nih.gov/articles/PMC10293072/

[6] Malkov, Y. A., & Yashunin, D. A. (2020). *Efficient and Robust Approximate Nearest Neighbor Search Using Hierarchical Navigable Small World Graphs*. IEEE Transactions on Pattern Analysis and Machine Intelligence, 42(4), 824–836.  
https://arxiv.org/abs/1603.09320

[7] Hu, Y., et al. (2024). *GRAG: Graph Retrieval-Augmented Generation*.  
https://arxiv.org/abs/2405.16506

[8] Chen, W., et al. (2024). *KG-Retriever: Efficient Knowledge Indexing for Retrieval-Augmented Large Language Models*.  
https://arxiv.org/abs/2412.05547

[9] Edge, D., et al. (2024). *From Local to Global: A Graph RAG Approach to Query-Focused Summarization*.  
https://arxiv.org/abs/2404.16130

[10] Huang, Y., Zhang, S., & Xiao, X. (2025). *KET-RAG: A Cost-Efficient Multi-Granular Indexing Framework for Graph-RAG*.  
https://arxiv.org/abs/2502.09304

[11] Fang, Z., et al. (2021). *A Query-Driven Topic Model*. Findings of ACL-IJCNLP 2021.  
https://aclanthology.org/2021.findings-acl.154.pdf

[12] Liu, J., et al. (2026). *Scaling Retrieval-Augmented Reasoning with Parallel Search and Explicit Merging*.  
https://arxiv.org/html/2605.13534v1

[13] Jauk, E., Benedek, M., & Neubauer, A. C. (2012). *Tackling Creativity at Its Roots: Evidence for Different Patterns of EEG Alpha Activity Related to Convergent and Divergent Modes of Task Processing*. International Journal of Psychophysiology, 84(2), 219–225.  
https://pmc.ncbi.nlm.nih.gov/articles/PMC3343259/

[14] Liu, C., Lin, Y., Ye, C., Yang, J., & He, W. (2023). *Alpha ERS-ERD Pattern During Divergent and Convergent Thinking Depends on Individual Differences on Metacontrol*. Journal of Intelligence, 11(4), 74.  
https://pmc.ncbi.nlm.nih.gov/articles/PMC10144848/

[15] Zhao, Y., et al. (2025). *E²GraphRAG: Streamlining Graph-Based RAG for High Efficiency and Effectiveness*.  
https://arxiv.org/abs/2505.24226

---

## 系列銜接

上一篇：**《無損保存與近無損語義重建：GCMS 的雙軌記憶架構》**

下一篇：**《知識不只被重建：生成、組合與跨域再結構化》**
