← Archive
lm-002098 · 2026-08

05_多路徑知識索引_區塊流式跳躍發散與集中

下載 MD 檔 ⬇

多路徑知識索引:區塊、流式、跳躍、發散與集中

系列:可繼承的認知:從自我解構到遞歸生成式記憶系統(第 5 篇)
作者:Neo.K
研究協作:Aletheia(阿萊)
版本:v1.0
日期:2026-07-30
文章類型:命題猜想論文/知識索引理論論文/GCMS 架構論文


摘要

大型知識系統經常把「索引」理解成一個單一問題:輸入查詢,返回若干最相似文件。然而,知識的可提取性並不只依賴相似度。當任務要求定位局部定義、重建理論演化、跨越遠距概念、展開多條候選路徑或將分散材料收斂成較少的生成核時,單一向量近鄰、全文檢索或靜態知識圖都可能出現系統性失敗。本文提出 GCMS 的多路徑知識索引理論,將索引形式化為作用於同一知識底圖之上的五類基本算子:區塊索引、流式索引、跳躍索引、發散索引與集中索引。

區塊索引將作品分割成具有局部語義、上下文與邊界條件的可操作單元;流式索引保存知識形成、修改與推導的時間方向;跳躍索引允許系統利用符號、生成核、關係邊與多尺度近鄰跨越線性鄰接;發散索引將一個問題展開為多個觀點、子問題、假說與檢索路徑;集中索引則對多路結果進行聚類、去重、衝突保存、證據排序與生成核抽取。五種模式不是彼此替代,而是構成一組可組合算子族。

本文提出「索引任務非同質命題」:不存在一個固定索引策略,能在所有知識任務上同時最佳化局部精確度、時間連續性、遠距橋接、候選多樣性、全局壓縮、證據保真與成本。本文進一步提出多路徑支配猜想、發散—集中對偶命題、跳躍增益命題、邊界—連續性張力命題與矛盾保存命題,並建立區塊完整率、流路連貫度、跳躍增益、分支覆蓋率、集中保真度、矛盾保存率及索引成本等評估指標。

本文主張,GCMS 未來的索引器不應只是資料結構集合,而應是一個具任務辨識能力的索引控制系統。給定查詢、當前證據、不確定性、資源預算與治理限制,後設控制器應動態生成索引程式,例如「先以生成核跳躍,再沿版本流回溯,接著發散檢索,最後集中但保留衝突」。這使索引從靜態尋址轉化為可驗證的知識運算路徑,並為後續的生成、組合、自調用與遞歸自主循環建立基礎。

關鍵詞:GCMS、多路徑索引、區塊索引、流式索引、跳躍索引、發散檢索、集中檢索、知識圖、GraphRAG、事件分段、認知分塊、證據鏈


一、問題的提出:為什麼「相似文件搜尋」不等於知識索引

設知識庫為:

K={d1,d2,,dn},\mathcal K=\{d_1,d_2,\ldots,d_n\},

查詢為:

qQ.q\in\mathcal Q.

典型檢索系統以一個分數函數排序文件:

S(diq),S(d_i\mid q),

並返回:

TopK(q)=arg top kdiKS(diq).\operatorname{TopK}(q) = \underset{d_i\in\mathcal K}{\operatorname{arg\,top\,k}} S(d_i\mid q).

這種模型適合回答「哪一些文件和查詢最相似」,卻不必然適合回答以下問題:

  1. 某一概念第一次在哪個版本出現?
  2. 一個理論從母問題經過哪些中間命題才形成目前版本?
  3. 哪兩篇表面用詞不同的作品其實共享同一生成核?
  4. 哪些遠距系列可以藉由一個符號、反例或方法形成橋接?
  5. 一個新問題可能沿哪些互不相同的方向展開?
  6. 大量相近作品如何收斂為較少核心結構,而不抹去真正矛盾?
  7. 目前證據不足時,系統應擴大搜尋、向前追蹤、向後回溯,還是停止?

這些任務的差異不是查詢措辭差異,而是尋址幾何不同

局部定義查詢偏好細粒度單元;理論演化查詢需要時間順序;跨領域橋接需要遠距跳躍;開放研究需要多分支探索;整體理解需要全局聚合。若全部被壓縮成單一相似度排序,系統通常會得到一組「看起來都相關」但無法重建路徑、來源與結構的結果。

因此本文將知識索引重新定義為:

在證據、結構、時間與成本約束下,生成一條或多條可重演的知識尋址路徑,使系統能定位、連接、展開、聚合並驗證與任務相關的知識單元。

形式上,索引不再只是:

q{d1,,dk},q\mapsto\{d_1,\ldots,d_k\},

而是:

(q,K,Θ)(π,E,C,T),(q,\mathcal K,\Theta) \mapsto \left( \pi, \mathcal E, \mathcal C, \mathcal T \right),

其中:

  • π\pi :索引操作序列;
  • E\mathcal E :取得的證據集合;
  • C\mathcal C :證據之間的關係與上下文;
  • T\mathcal T :可重演的檢索軌跡;
  • Θ\Theta :權限、成本、版本與停止條件。

二、研究背景:知識尋址本來就不是單一路徑

2.1 認知分塊:局部結構能降低工作記憶負擔

分塊研究顯示,人類會利用既有知識與規律,把多個元素重新編碼為較少、較具意義的單元。Chekaf 等人的實驗指出,參與者會在立即記憶任務中主動形成 chunks,而 chunking 可藉由知識降低需維持的單元數量。[1] Chen 與 Cowan 的研究則顯示,當排除語音複誦等因素後,工作記憶容量更接近以 chunks 而非原始項目計算。[2]

這類結果不能直接推出數位知識庫應如何切分,但提供一項重要啟示:

可操作單位原始最小單位.\text{可操作單位} \neq \text{原始最小單位}.

若系統以整篇論文為唯一索引單位,局部定義與證據會被大文件稀釋;若每一句都獨立索引,生成路徑與上下文又會碎裂。因此區塊不是任意字數窗口,而應是一個帶有內部凝聚力與外部邊界的知識單元。

2.2 事件分段與時間情境:連續知識會被組織成可回溯事件

人類經驗在物理時間上連續,記憶卻常以事件為單位。事件邊界會影響哪些資訊被整合、哪些資訊被分離,以及跨邊界的時間關係是否容易被保持。海馬迴與前額葉相關研究顯示,穩定情境有利於事件內部的時間綁定,而情境轉換會形成新的事件模型。[3][4][5]

這支持一種不同於靜態文件索引的視角:

知識狀態=內容+形成順序+邊界轉換.\text{知識狀態} = \text{內容} + \text{形成順序} + \text{邊界轉換}.

一篇論文的最終版本無法完整替代它的推導流;同一概念在不同時期的意義,也不能只靠最新摘要理解。流式索引因此必須保存狀態轉換、版本、前置依賴、否定路徑與中止分支。

2.3 小世界與多尺度圖:遠距節點可以藉由少量長連結快速抵達

HNSW 將多尺度鄰近圖構造成分層的小世界索引,上層長距離連結用於快速導航,下層局部連結則用於精細搜尋。其效果說明:在高維相似空間中,只依賴線性掃描或單尺度鄰近通常效率不足;多尺度、跨距離的連結可以顯著改變尋址成本。[6]

對 GCMS 而言,「跳躍」不限於向量近鄰。跳躍邊可以來自:

  • 相同符號;
  • 相同生成核;
  • 相同母問題;
  • 反例關係;
  • 方法借用;
  • 版本派生;
  • 產品—理論投影;
  • 人工指定的橋接。

GraphRAG 與其他圖檢索研究也顯示,將實體、文本與關係組成圖結構,能支援跨文件、多跳與全局性問題,而不只是返回獨立段落。[7][8][9][10]

2.4 發散檢索:單一查詢通常只覆蓋問題的一個投影

對開放問題,查詢 qq 本身往往是不完整的。單次表述可能只激活某一術語、某一學科或某一解法。多查詢、查詢分解與鏈式檢索研究的共同方向,是把單一查詢展開為多個子查詢或觀點,再合併取得的證據。[11][12]

可寫成:

qexpand{q1,q2,,qm}.q \xrightarrow{\mathrm{expand}} \{q_1,q_2,\ldots,q_m\}.

發散的目標不是產生越多查詢越好,而是提升對潛在相關區域的覆蓋:

Coverage(j=1mR(qj))>Coverage(R(q)).\operatorname{Coverage} \left( \bigcup_{j=1}^{m}R(q_j) \right) > \operatorname{Coverage}(R(q)).

心理學中的發散與集中思考研究也長期區分「生成多種可能」與「選擇或形成較少答案」兩種處理模式;實驗研究顯示兩者在任務表現與神經活動上並非完全相同。[13][14]

本文不把創造力任務直接等同於檢索演算法,但借用其操作性區分:發散負責擴大候選空間,集中負責評估與重構候選空間。

2.5 全局聚合與社群摘要:集中不只是把前幾名文件再摘要一次

GraphRAG 的 global search 將文本轉成實體圖、建立社群階層並生成社群摘要,用以處理「整個資料集主要主題為何」這類不適合局部近鄰檢索的問題。[9] 其他多粒度圖索引研究也指出,局部 chunks、實體關係、文件層與社群層具有不同成本與用途。[10][15]

集中因此至少包含:

  1. 去除重複表述;
  2. 聚合同源分支;
  3. 找出共同生成核;
  4. 對證據品質排序;
  5. 保存少數但關鍵的反例;
  6. 標示不能合併的矛盾;
  7. 將局部結果映射回全局結構。

若集中只追求短摘要,就可能把「多個可相容觀點」與「真正互相矛盾的命題」一起抹平。


三、統一知識底圖

3.1 知識單元

設 GCMS 的基本知識單元集合為:

U={u1,u2,,uN}.\mathcal U = \{u_1,u_2,\ldots,u_N\}.

每個單元定義為:

ui=(ci,hi,bi,τi,si,vi,ai),u_i = \left( c_i, h_i, b_i, \tau_i, s_i, v_i, a_i \right),

其中:

  • cic_i :內容;
  • hih_i :來源與內容雜湊;
  • bib_i :區塊邊界與上下文;
  • τi\tau_i :時間、版本或形成序位;
  • sis_i :語義指紋;
  • viv_i :可見性與治理狀態;
  • aia_i :作品、章節、公式、實驗或生成核等類型。

3.2 多關係邊

知識底圖不是單一邊類型的圖,而是:

G=(U,E),\mathcal G = \left( \mathcal U, \mathcal E \right),

其中:

E=EsemEtempEgenEevidEcontraEmanual.\mathcal E = \mathcal E_{\mathrm{sem}} \cup \mathcal E_{\mathrm{temp}} \cup \mathcal E_{\mathrm{gen}} \cup \mathcal E_{\mathrm{evid}} \cup \mathcal E_{\mathrm{contra}} \cup \mathcal E_{\mathrm{manual}}.

各類邊分別表示:

  • Esem\mathcal E_{\mathrm{sem}} :語義相似或主題相關;
  • Etemp\mathcal E_{\mathrm{temp}} :時間、版本與狀態轉換;
  • Egen\mathcal E_{\mathrm{gen}} :生成、推導與依賴;
  • Eevid\mathcal E_{\mathrm{evid}} :主張與原始證據;
  • Econtra\mathcal E_{\mathrm{contra}} :矛盾、反例或不相容;
  • Emanual\mathcal E_{\mathrm{manual}} :人工指定橋接與策展關係。

同一對節點可以具有多個關係:

(ui,uj)EsemEtemp.(u_i,u_j) \in \mathcal E_{\mathrm{sem}} \cap \mathcal E_{\mathrm{temp}}.

3.3 索引不是另一份知識,而是對底圖施加的運算

本文定義索引算子族:

I={B,F,J,D,C},\mathfrak I = \{ \mathsf B, \mathsf F, \mathsf J, \mathsf D, \mathsf C \},

分別對應:

  • B\mathsf B :Block,區塊;
  • F\mathsf F :Flow,流式;
  • J\mathsf J :Jump,跳躍;
  • D\mathsf D :Divergence,發散;
  • C\mathsf C :Convergence,集中。

這些算子使用同一批來源、版本與證據,但產生不同尋址路徑。


四、區塊索引:將內容切成可操作、可重組但不失去邊界的單元

4.1 區塊不是固定字數窗口

對作品 dd ,區塊算子為:

B(d;θB)={b1,b2,,bm},\mathsf B(d;\theta_B) = \{b_1,b_2,\ldots,b_m\},

並要求:

i=1mSpan(bi)=Span(d).\bigcup_{i=1}^{m}\operatorname{Span}(b_i) = \operatorname{Span}(d).

但相鄰區塊可重疊,以保存跨邊界上下文:

Span(bi)Span(bi+1).\operatorname{Span}(b_i) \cap \operatorname{Span}(b_{i+1}) \neq \varnothing.

固定 token 數量只是一種低成本方法。更完整的區塊邊界應綜合:

BoundaryScore(t)=αStopic+βSsyntax+γSevent+δSsymbol+ηSauthor.\operatorname{BoundaryScore}(t) = \alpha S_{\mathrm{topic}} + \beta S_{\mathrm{syntax}} + \gamma S_{\mathrm{event}} + \delta S_{\mathrm{symbol}} + \eta S_{\mathrm{author}}.

其中可考慮:

  • 標題與章節;
  • 語義主題轉移;
  • 定義、定理、證明、實驗等結構;
  • 公式與符號作用域;
  • 作者明確標示的邊界;
  • 事件或版本轉換。

4.2 區塊的最小充分上下文

區塊 bib_i 不只保存文字,還應保存:

bi=(xi,ci,ci+,scopei,depsi),b_i = \left( x_i, c_i^{-}, c_i^{+}, \operatorname{scope}_i, \operatorname{deps}_i \right),

其中:

  • xix_i :核心內容;
  • cic_i^{-} :前置上下文;
  • ci+c_i^{+} :後續上下文;
  • scopei\operatorname{scope}_i :符號、版本與章節作用域;
  • depsi\operatorname{deps}_i :依賴的定義、證據與前置命題。

這可降低「檢索到一句正確文字,卻失去它成立的假設」的風險。

4.3 區塊完整率

定義任務 qq 所需的最小證據集合為 EqE_q^\ast ,實際取回區塊證據為 EqE_q ,則:

BCR(q)=EqEqEq.\operatorname{BCR}(q) = \frac{|E_q\cap E_q^\ast|}{|E_q^\ast|}.

但還需懲罰失去上下文的孤立命中:

BCR+(q)=BCR(q)ContextAdequacy(Eq).\operatorname{BCR}^{+}(q) = \operatorname{BCR}(q) \cdot \operatorname{ContextAdequacy}(E_q).

4.4 區塊索引的失敗模式

  1. 過度分塊:命題、證明與條件被分散;
  2. 分塊不足:局部訊號被大篇幅背景稀釋;
  3. 邊界僵化:同一作品只能有一套切分;
  4. 符號失域:公式被取回,但定義不在同一區塊;
  5. 版本混塊:不同版本內容被視為同一語義單元。

因此本文主張 GCMS 應允許:

B1(d),B2(d),,Br(d),\mathsf B_1(d), \mathsf B_2(d), \ldots, \mathsf B_r(d),

也就是同一作品具有多粒度、多目的區塊視圖,而不是只有一套永久切分。


五、流式索引:保存知識如何形成,而不只保存最後狀態

5.1 流是有方向的狀態序列

對一個理論或作品系列,定義狀態流:

F=(z0e1z1e2eTzT),\mathcal F = \left( z_0 \xrightarrow{e_1} z_1 \xrightarrow{e_2} \cdots \xrightarrow{e_T} z_T \right),

其中:

  • ztz_t :時間 tt 的知識狀態;
  • ete_t :修改、反例、實驗、合併、分支或重命名事件。

流式索引算子為:

F(q,zt;w,d)(ztw,,zt,,zt+d),\mathsf F(q,z_t;w,d) \rightarrow \left( z_{t-w},\ldots,z_t,\ldots,z_{t+d} \right),

其中 ww 是回溯窗口, dd 是前向追蹤窗口。

5.2 流式索引的五種方向

  1. 回溯:目前結論從何而來;
  2. 前向追蹤:一個母命題後來形成哪些分支;
  3. 版本差分:兩版之間改變什麼;
  4. 中止路徑:哪些方向曾被提出但被放棄;
  5. 週期與復現:某一問題是否在不同時期重複出現。

5.3 流路連貫度

令檢索到的有序節點為:

P=(ui1,ui2,,uik),P=(u_{i_1},u_{i_2},\ldots,u_{i_k}),

定義流路連貫度:

FC(P)=1k1j=1k11[(uij,uij+1)EtempEgen].\operatorname{FC}(P) = \frac{1}{k-1} \sum_{j=1}^{k-1} \mathbf 1 \left[ (u_{i_j},u_{i_{j+1}}) \in \mathcal E_{\mathrm{temp}} \cup \mathcal E_{\mathrm{gen}} \right].

可再加入方向一致性:

FDC(P)=FC(P)(1Nreversek1).\operatorname{FDC}(P) = \operatorname{FC}(P) \cdot \left( 1-\frac{N_{\mathrm{reverse}}}{k-1} \right).

5.4 流式索引與最新版本偏誤

流式系統若只按時間衰減加權:

wt=eλΔt,w_t=e^{-\lambda\Delta t},

會自然偏向最新內容。但舊版本可能包含:

  • 已被刪除的假設;
  • 失敗但重要的實驗;
  • 被後來版本掩蓋的概念來源;
  • 重命名前的同義術語。

因此流式索引不能把「最近」等同「最重要」,而應分離:

Sflow=αStemporal+βScausal+γSversion+δSevidence.S_{\mathrm{flow}} = \alpha S_{\mathrm{temporal}} + \beta S_{\mathrm{causal}} + \gamma S_{\mathrm{version}} + \delta S_{\mathrm{evidence}}.

六、跳躍索引:跨越表面相似度與線性鄰接

6.1 跳躍的定義

設目前節點為 uiu_i ,一般局部檢索只查看鄰域:

Nr(ui)={ujdist(ui,uj)r}.\mathcal N_r(u_i) = \{u_j\mid \operatorname{dist}(u_i,u_j)\leq r\}.

跳躍索引允許選擇:

ujNr(ui),u_j\notin\mathcal N_r(u_i),

但滿足某個高辨識度關係:

Anchor(ui,ujq)θJ.\operatorname{Anchor}(u_i,u_j\mid q)\geq\theta_J.

因此:

J(ui,q)=TopKujSJ(ujui,q).\mathsf J(u_i,q) = \operatorname{TopK}_{u_j} S_J(u_j\mid u_i,q).

6.2 跳躍分數

可定義:

SJ(ujui,q)=αSsemantic+βSsymbol+γSkernel+δSrelation+ηScontrast+ζSmanual.\begin{aligned} S_J(u_j\mid u_i,q) ={}& \alpha S_{\mathrm{semantic}} + \beta S_{\mathrm{symbol}} + \gamma S_{\mathrm{kernel}}\\ &+ \delta S_{\mathrm{relation}} + \eta S_{\mathrm{contrast}} + \zeta S_{\mathrm{manual}}. \end{aligned}

其中 ScontrastS_{\mathrm{contrast}} 允許跳到反例與矛盾,而不是只跳到相似內容。

6.3 多尺度跳躍

借鑑多層小世界索引,可將知識圖分成不同尺度:

G(0),G(1),,G(L).\mathcal G^{(0)}, \mathcal G^{(1)}, \ldots, \mathcal G^{(L)}.

其中:

  • 低層保存段落、定義與局部證據;
  • 中層保存作品、系列與生成核;
  • 高層保存跨域方法、母問題與抽象關係。

跳躍路徑可以先在高層快速定位,再下降到原文證據:

G(L)G(L1)G(0).\mathcal G^{(L)} \rightarrow \mathcal G^{(L-1)} \rightarrow \cdots \rightarrow \mathcal G^{(0)}.

6.4 跳躍增益

設不允許跳躍的基線檢索效用為 U0(q)U_0(q) ,允許跳躍後為 UJ(q)U_J(q)

JG(q)=UJ(q)U0(q).\operatorname{JG}(q) = U_J(q)-U_0(q).

但也需計算跳躍漂移:

JD(q)=1EJEqEJ.\operatorname{JD}(q) = 1- \frac{|E_J\cap E_q^\ast|}{|E_J|}.

真正有效的跳躍需同時滿足:

JG(q)>0,\operatorname{JG}(q)>0,

且:

JD(q)<θdrift.\operatorname{JD}(q)<\theta_{\mathrm{drift}}.

6.5 語義瞬移風險

跳躍索引最危險的錯誤不是找不到,而是找到一個「高階概念很像,底層假設完全不同」的遠端節點。

例如兩篇作品都使用「固定點」,但其數學空間、算子條件與證明目的不同。若只靠詞彙或向量相似度跳躍,系統可能把比喻關係誤當可運算同一性。

因此每次跳躍都應附帶:

Jij=(理由,邊類型,尺度,證據,不相容條件).J_{ij} = \left( \text{理由}, \text{邊類型}, \text{尺度}, \text{證據}, \text{不相容條件} \right).

七、發散索引:將單一查詢展開成受控候選空間

7.1 發散不是隨機聯想

發散索引算子:

D(q;θD)={q1,q2,,qm}.\mathsf D(q;\theta_D) = \{q_1,q_2,\ldots,q_m\}.

子查詢可來自不同變換:

qj=Tj(q),q_j = T_j(q),

例如:

  • 同義與術語變換;
  • 抽象化或具體化;
  • 因果前件與後件;
  • 方法、反例、限制與應用;
  • 不同學科投影;
  • 不同時間與版本;
  • 支持與反對立場;
  • 部分問題分解。

7.2 發散樹

發散過程形成樹:

TD=(VD,ED),\mathcal T_D = (V_D,E_D),

根節點為原始問題 q0q_0 ,每個節點可再展開:

qt+1(j)=Tj(qt).q_{t+1}^{(j)} = T_j(q_t).

若不限制深度與寬度,候選數可能指數增長:

VDt=0Lbt.|V_D| \approx \sum_{t=0}^{L}b^t.

因此發散必須受預算控制:

VDBD,|V_D|\leq B_D, LLmax.L\leq L_{\max}.

7.3 分支覆蓋與分支新穎度

若真實相關面向集合為 AqA_q^\ast ,已覆蓋面向為 ADA_D

BCov(q)=ADAqAq.\operatorname{BCov}(q) = \frac{|A_D\cap A_q^\ast|}{|A_q^\ast|}.

分支間的平均差異可定義為:

BDiv(q)=2m(m1)i<j(1sim(qi,qj)).\operatorname{BDiv}(q) = \frac{2}{m(m-1)} \sum_{i<j} \left( 1-\operatorname{sim}(q_i,q_j) \right).

好的發散需避免兩種極端:

BDiv0,\operatorname{BDiv}\approx0,

代表只是同義改寫;

BDiv1,\operatorname{BDiv}\approx1,

則可能表示分支已脫離原問題。

7.4 證據驅動發散

GCMS 不應只在查詢開始時發散。當檢索後發現證據缺口,也可生成新分支:

qt+1=GapToQuery(qt,Et,Ut),q_{t+1} = \operatorname{GapToQuery} \left( q_t,E_t,\mathcal U_t \right),

其中 Ut\mathcal U_t 是未解決的不確定性。

觸發條件可為:

Coverage(Et)<θC,\operatorname{Coverage}(E_t)<\theta_C,

或:

Conflict(Et)>θX.\operatorname{Conflict}(E_t)>\theta_X.

7.5 發散爆炸與新穎性幻覺

發散容易產生:

  • 大量同義問題;
  • 與來源無關的創意分支;
  • 被模型語言風格誤判為新概念的重複內容;
  • 只支持原假設、不搜尋反例的確認偏誤;
  • 無限研究循環。

因此每個分支應保存:

Dj=(qj,parent(qj),transformj,expectedGainj,costj,statusj).D_j = \left( q_j, \operatorname{parent}(q_j), \operatorname{transform}_j, \operatorname{expectedGain}_j, \operatorname{cost}_j, \operatorname{status}_j \right).

八、集中索引:從多路候選恢復結構,而不是只做摘要

8.1 集中算子

給定發散或多路檢索結果:

R={r1,r2,,rn},\mathcal R = \{r_1,r_2,\ldots,r_n\},

集中算子為:

C(R;q,θC)=(KR,XR,SR,ER),\mathsf C(\mathcal R;q,\theta_C) = \left( \mathcal K_R, \mathcal X_R, \mathcal S_R, \mathcal E_R \right),

其中:

  • KR\mathcal K_R :抽取的生成核或主題核心;
  • XR\mathcal X_R :不可合併的矛盾與反例;
  • SR\mathcal S_R :代表性證據集合;
  • ER\mathcal E_R :來源與關係映射。

8.2 集中的五個階段

第一階段:正規化

對名稱、符號、版本與引用進行對齊:

r~i=Normalize(ri).\widetilde r_i = \operatorname{Normalize}(r_i).

第二階段:聚類與去重

R{C1,C2,,Ck},\mathcal R \rightarrow \{C_1,C_2,\ldots,C_k\},

其中每個 CjC_j 是語義或生成關係較密集的群集。

第三階段:證據排序

SE(ri)=αSsource+βSdirect+γSversion+δSindependent.S_E(r_i) = \alpha S_{\mathrm{source}} + \beta S_{\mathrm{direct}} + \gamma S_{\mathrm{version}} + \delta S_{\mathrm{independent}}.

第四階段:核心抽取

Kj=Invariant(Cj),K_j = \operatorname{Invariant}(C_j),

但抽取的核心必須附帶其支撐與不適用邊界。

第五階段:矛盾保存

若兩命題:

pipj,p_i\land p_j\models\bot,

則不得只因一方較常見就自動刪除另一方,而應保存:

Xij=(pi,pj,各自證據,適用條件,未決狀態).X_{ij} = \left( p_i,p_j, \text{各自證據}, \text{適用條件}, \text{未決狀態} \right).

8.3 集中保真度

令集中前的關鍵不變量集合為 I(R)\mathcal I(\mathcal R) ,集中結果為 YY

CFid=I(Y)I(R)I(R).\operatorname{CFid} = \frac{ |\mathcal I(Y)\cap\mathcal I(\mathcal R)| }{ |\mathcal I(\mathcal R)| }.

定義矛盾保存率:

CPR=XYXRXR.\operatorname{CPR} = \frac{|\mathcal X_Y\cap\mathcal X_R|}{|\mathcal X_R|}.

若一個摘要非常流暢但:

CPR0,\operatorname{CPR}\approx0,

則它可能只是把爭議抹平,而不是完成可靠集中。

8.4 集中與壓縮的差異

一般壓縮關心:

YR.\frac{|Y|}{|\mathcal R|}.

可靠集中還關心:

Traceability(Y),\operatorname{Traceability}(Y), BoundaryPreservation(Y),\operatorname{BoundaryPreservation}(Y),

以及:

MinorityEvidenceRetention(Y).\operatorname{MinorityEvidenceRetention}(Y).

因此:

集中刪到只剩最常見敘述\boxed{ \text{集中} \neq \text{刪到只剩最常見敘述} }

九、發散—集中對偶

9.1 不是互相抵銷,而是兩個不同階段

發散擴大候選空間:

D:QP(Q),\mathsf D: \mathcal Q \rightarrow \mathcal P(\mathcal Q),

集中把候選空間轉換為結構化結果:

C:P(R)Y.\mathsf C: \mathcal P(\mathcal R) \rightarrow \mathcal Y.

兩者組合:

qD{q1,,qm}RetrieveRCY.q \xrightarrow{\mathsf D} \{q_1,\ldots,q_m\} \xrightarrow{\mathrm{Retrieve}} \mathcal R \xrightarrow{\mathsf C} Y.

9.2 集中不是發散的逆函數

一般而言:

C(D(q))q.\mathsf C(\mathsf D(q)) \neq q.

因為發散可能發現原問題未包含的新證據、衝突與結構。集中後的結果 YY 應該是受證據修正的新狀態,而不是回到起點。

9.3 對偶效用

設發散後的覆蓋增益為:

GD=Coverage(RD)Coverage(R0),G_D = \operatorname{Coverage}(\mathcal R_D) - \operatorname{Coverage}(\mathcal R_0),

集中後的認知負擔降低為:

GC=Load(RD)Load(Y).G_C = \operatorname{Load}(\mathcal R_D) - \operatorname{Load}(Y).

可靠流程需同時保持:

GD>0,G_D>0, GC>0,G_C>0,

以及:

CFidθF.\operatorname{CFid}\geq\theta_F.

十、後設索引控制器:何時使用哪一條路徑

10.1 索引程式

GCMS 的索引控制器不是固定選擇一種模式,而是生成算子序列:

πq=(o1,o2,,oT),\pi_q = (o_1,o_2,\ldots,o_T),

其中:

otI.o_t\in\mathfrak I.

例如:

π1=(B,J,C),\pi_1 =(\mathsf B,\mathsf J,\mathsf C),

表示先做局部區塊定位,再跨系列跳躍,最後聚合。

又如:

π2=(J,F,D,C),\pi_2 =(\mathsf J,\mathsf F^{-},\mathsf D,\mathsf C),

表示先以生成核跳到遠端作品,再沿時間流回溯來源,之後發散搜尋相關分支,最後集中。

10.2 控制器狀態

控制器輸入:

Σt=(q,Et,Ut,Xt,Bt,Rt,Pt),\Sigma_t = \left( q, E_t, U_t, X_t, B_t, R_t, P_t \right),

其中:

  • EtE_t :目前證據;
  • UtU_t :不確定性;
  • XtX_t :衝突程度;
  • BtB_t :資源預算;
  • RtR_t :剩餘遞歸深度;
  • PtP_t :權限與治理政策。

動作選擇:

ot+1=Π(Σt).o_{t+1} = \Pi(\Sigma_t).

10.3 效用函數

可定義:

U(πq)=αRrelevance+βRcoverage+γRfaithfulness+δRdiversity+ηRtraceabilityλCcostμCrisk.\begin{aligned} U(\pi_q) ={}& \alpha R_{\mathrm{relevance}} + \beta R_{\mathrm{coverage}} + \gamma R_{\mathrm{faithfulness}}\\ &+ \delta R_{\mathrm{diversity}} + \eta R_{\mathrm{traceability}} - \lambda C_{\mathrm{cost}} - \mu C_{\mathrm{risk}}. \end{aligned}

控制器目標:

πq=argmaxπU(π).\pi_q^\ast = \underset{\pi}{\operatorname{argmax}} U(\pi).

10.4 停止條件

索引不能永遠展開。停止條件可為:

ΔUt<ε,\Delta U_t<\varepsilon,

或:

Coverage(Et)θC,\operatorname{Coverage}(E_t)\geq\theta_C,

或:

Bt0,B_t\leq0,

或:

StateRepeat(Σt)=1,\operatorname{StateRepeat}(\Sigma_t)=1,

或需要外部權限與人工判斷。


十一、核心命題與猜想

命題一:索引任務非同質命題

不存在一個固定索引策略 II^\ast ,能對所有任務分布 Q\mathcal Q 同時最大化:

{局部精確度,時間連續性,遠距橋接,候選多樣性,全局壓縮,證據保真,低成本}.\{ \text{局部精確度}, \text{時間連續性}, \text{遠距橋接}, \text{候選多樣性}, \text{全局壓縮}, \text{證據保真}, \text{低成本} \}.

只要存在兩類任務 qa,qbq_a,q_b ,其最優尋址幾何不同,即有:

argmaxIU(Iqa)argmaxIU(Iqb).\operatorname{argmax}_{I}U(I\mid q_a) \neq \operatorname{argmax}_{I}U(I\mid q_b).

命題二:多路徑支配猜想

對具有局部、時間、跨文件與全局任務混合的查詢分布,若後設控制器能正確選擇算子序列,則:

EqQ[U(πq)]>maxIIEqQ[U(I(q))].\mathbb E_{q\sim\mathcal Q} [U(\pi_q^\ast)] > \max_{I\in\mathfrak I} \mathbb E_{q\sim\mathcal Q} [U(I(q))].

此命題不是宣稱多路徑對每一查詢都優於最佳單一路徑,而是宣稱在異質任務分布上,動態選路的平均效用可能更高。

命題三:邊界—連續性張力命題

更細的區塊通常提高局部可定位性,卻可能降低跨區塊連續性:

Rlocalg>0,\frac{\partial R_{\mathrm{local}}}{\partial g}>0, Rflowg<0,\frac{\partial R_{\mathrm{flow}}}{\partial g}<0,

其中 gg 表示分塊細粒度。

因此最佳粒度依任務而變:

g=g(q).g^\ast=g(q).

命題四:跳躍增益命題

當答案證據分散於語義距離遠但關係上可橋接的節點時,加入有證據的跳躍邊可提升召回或降低尋址成本:

JG(q)>0.\operatorname{JG}(q)>0.

但若跳躍邊缺少作用域與不相容條件,漂移風險上升。

命題五:發散—集中對偶命題

只發散會提高覆蓋但增加成本與噪音;只集中會降低負擔但可能遺失新穎性與少數證據。對開放問題,存在一組非零發散與非零集中強度:

(d,c),d>0,c>0,(d^\ast,c^\ast), \qquad d^\ast>0, \quad c^\ast>0,

使總效用高於任一極端。

命題六:矛盾保存命題

若集中算子只以頻率、相似度或摘要流暢度作為目標,則隨壓縮率提高,矛盾保存率可能下降:

CPRCompression<0.\frac{\partial\operatorname{CPR}}{\partial\operatorname{Compression}}<0.

加入顯式矛盾邊與少數證據保留政策,應能改善此問題。

命題七:可重演索引命題

若索引結果保存:

(π,θ,版本,證據,隨機種子),\left( \pi, \theta, \text{版本}, \text{證據}, \text{隨機種子} \right),

則在底層知識狀態不變時,索引路徑應可被近似重演。若系統只保存最終回答,而不保存路徑,則無法區分來源變動、模型漂移與索引策略改變。


十二、評估框架

12.1 任務類型

建立五類基準:

  1. 局部定位任務:找定義、公式、段落與直接證據;
  2. 演化重建任務:找版本、前置命題與形成順序;
  3. 橋接任務:找跨系列、跨術語與跨學科關係;
  4. 發現任務:對開放問題生成多種有證據的研究方向;
  5. 全局集中任務:抽取核心、聚合系列並保存矛盾。

12.2 比較系統

至少比較:

  • BM25 或全文檢索;
  • 單一向量近鄰;
  • 單一知識圖檢索;
  • 固定 chunk RAG;
  • 多路徑但無控制器;
  • 完整多路徑控制器。

12.3 主要指標

局部檢索:

Recall@k,MRR,nDCG@k.\mathrm{Recall@k}, \quad \mathrm{MRR}, \quad \mathrm{nDCG@k}.

流式重建:

FC,FDC,VersionAccuracy.\operatorname{FC}, \quad \operatorname{FDC}, \quad \operatorname{VersionAccuracy}.

跳躍:

JG,JD,HopCount.\operatorname{JG}, \quad \operatorname{JD}, \quad \operatorname{HopCount}.

發散:

BCov,BDiv,NovelEvidenceRate.\operatorname{BCov}, \quad \operatorname{BDiv}, \quad \operatorname{NovelEvidenceRate}.

集中:

CFid,CPR,Traceability.\operatorname{CFid}, \quad \operatorname{CPR}, \quad \operatorname{Traceability}.

成本:

C=αTlatency+βNretrieval+γNtokens+δNgraphops.C = \alpha T_{\mathrm{latency}} + \beta N_{\mathrm{retrieval}} + \gamma N_{\mathrm{tokens}} + \delta N_{\mathrm{graph\,ops}}.

12.4 消融實驗

依序移除:

  • 流式邊;
  • 生成核跳躍;
  • 反例邊;
  • 發散分支;
  • 集中矛盾保存;
  • 後設控制器。

若移除某一算子只影響對應任務,而不顯著影響其他任務,支持五種索引具有功能分化。若單一向量檢索在所有任務與成本下都不劣於多路徑系統,則本文核心猜想受到否證。


十三、工程架構

13.1 七層架構

GCMS 多路徑索引可分為:

L0=無損來源與版本層,L1=多粒度區塊層,L2=時間與生成流層,L3=多關係圖與跳躍層,L4=發散/集中算子層,L5=後設控制與停止層,L6=證據、審計與治理層.\begin{aligned} L_0&=\text{無損來源與版本層},\\ L_1&=\text{多粒度區塊層},\\ L_2&=\text{時間與生成流層},\\ L_3&=\text{多關係圖與跳躍層},\\ L_4&=\text{發散/集中算子層},\\ L_5&=\text{後設控制與停止層},\\ L_6&=\text{證據、審計與治理層}. \end{aligned}

13.2 索引紀錄

每次索引執行保存:

{
  "trace_id": "TRACE-...",
  "query": "...",
  "operators": ["block", "jump", "flow-backward", "diverge", "converge"],
  "parameters": {},
  "retrieved_units": [],
  "evidence_citations": [],
  "conflicts": [],
  "stop_reason": "coverage_satisfied",
  "cost": {},
  "knowledge_snapshot": "sha256:..."
}

13.3 候選路徑與正式知識分離

索引路徑可能產生新的橋接與群集,但這些結果不應直接改寫正式知識圖。

應分成:

E=EacceptedEcandidate.\mathcal E = \mathcal E_{\mathrm{accepted}} \cup \mathcal E_{\mathrm{candidate}}.

候選跳躍邊、生成核或群集需經:

ProposeVerifyAccept/Reject.\operatorname{Propose} \rightarrow \operatorname{Verify} \rightarrow \operatorname{Accept/Reject}.

十四、失敗模式與治理邊界

14.1 過度分塊

系統返回大量局部正確但無法組合的片段。

治理:保留父區塊、章節作用域與跨區塊依賴。

14.2 邊界鎖死

早期錯誤切分被永久制度化。

治理:允許多粒度視圖與版本化重新分塊。

14.3 流式近期偏誤

新內容自動覆蓋舊內容的重要性。

治理:分離時間新近性、因果重要性與證據品質。

14.4 語義瞬移

高階詞彙相似造成跨域錯誤映射。

治理:每次跳躍保存理由、作用域與不相容條件。

14.5 發散爆炸

分支數量增長,但資訊增益下降。

治理:分支預算、重複檢測、邊際增益停止與人工閘門。

14.6 集中抹平

少數證據、反例與真正矛盾被「主題摘要」消失。

治理:顯式矛盾邊、矛盾保存率與少數證據配額。

14.7 自我強化索引漂移

系統依自己生成的群集建立新跳躍,再用新跳躍證明原群集合理。

治理:來源邊、候選邊與接受邊分區;禁止候選關係自我驗證。

14.8 權限穿越

高層社群摘要或圖統計洩漏不可見作品的存在與主題。

治理:所有聚合與跳躍必須在查詢主體可見子圖上執行:

Gp=G[Up].\mathcal G_p = \mathcal G[\mathcal U_p].

十五、與 GCMS 既有雙軌記憶架構的關係

上一篇建立:

GCMS=LosslessArchive+SemanticMemory+EvidenceBridge.\mathrm{GCMS} = \mathrm{LosslessArchive} + \mathrm{SemanticMemory} + \mathrm{EvidenceBridge}.

本文進一步說明,語義記憶本身不能只是一個向量表,而應是:

SemanticMemory=(G,I,Π,T),\mathrm{SemanticMemory} = \left( \mathcal G, \mathfrak I, \Pi, \mathcal T \right),

其中:

  • G\mathcal G :統一知識底圖;
  • I\mathfrak I :五類索引算子;
  • Π\Pi :後設控制器;
  • T\mathcal T :可重演軌跡。

雙軌架構保證原文可以被驗證;多路徑索引則決定在何時、以何種幾何找到原文與語義結構。

完整形式為:

GCMSindex=LosslessSource+MultiGranularBlocks+TemporalFlows+GraphJumps+DivergentSearch+ConvergentIntegration+MetaControl+EvidenceTrace.\boxed{ \begin{aligned} \mathrm{GCMS}_{\mathrm{index}} ={}& \mathrm{LosslessSource}\\ &+ \mathrm{MultiGranularBlocks}\\ &+ \mathrm{TemporalFlows}\\ &+ \mathrm{GraphJumps}\\ &+ \mathrm{DivergentSearch}\\ &+ \mathrm{ConvergentIntegration}\\ &+ \mathrm{MetaControl}\\ &+ \mathrm{EvidenceTrace}. \end{aligned} }

十六、結論

知識索引不是一個可以被單一相似度函數完全取代的問題。

不同任務要求不同尋址幾何:

  • 區塊索引處理局部可操作性;
  • 流式索引保存形成方向與狀態轉換;
  • 跳躍索引跨越線性鄰接與表面術語;
  • 發散索引擴大問題與證據空間;
  • 集中索引恢復核心、證據與矛盾結構。

因此:

多路徑知識索引多個搜尋框並列\boxed{ \text{多路徑知識索引} \neq \text{多個搜尋框並列} }

它是一套可組合的知識運算子,以及一個根據任務、不確定性、成本與治理限制選擇運算路徑的後設控制系統。

若這套理論成立,GCMS 未來不會只回答「最相關的文章是哪一篇」,而能回答:

  • 該從哪一個局部證據開始;
  • 該沿哪條時間與生成路徑回溯;
  • 該跳到哪個遠距系列;
  • 該展開哪些相互獨立的研究分支;
  • 最後哪些內容可以合併,哪些矛盾必須保留。

這使索引從資料庫查詢提升為:

可驗證的知識路徑生成\boxed{ \text{可驗證的知識路徑生成} }

而下一篇將在此基礎上處理更進一步的問題:當系統找到多個知識單元後,它如何不只重建既有作品,而是進行生成、組合與跨域再結構化。


參考文獻

[1] Chekaf, M., Cowan, N., & Mathy, F. (2016). Chunk Formation in Immediate Memory and How It Relates to Data Compression. Cognition, 155, 96–107.
https://pmc.ncbi.nlm.nih.gov/articles/PMC4983232/

[2] Chen, Z., & Cowan, N. (2009). Core Verbal Working-Memory Capacity: The Limit in Words Retained Without Covert Articulation. Quarterly Journal of Experimental Psychology, 62(7), 1420–1429.
https://pmc.ncbi.nlm.nih.gov/articles/PMC2693080/

[3] Bladon, J. H., et al. (2019). In a Temporally Segmented Experience Hippocampal Neurons Represent Temporally Drifting Context But Not Discrete Segments. Journal of Neuroscience.
https://pubmed.ncbi.nlm.nih.gov/31253754/

[4] DuBrow, S., & Davachi, L. (2016). Temporal Binding Within and Across Events. Neurobiology of Learning and Memory, 134, 107–114.
https://pubmed.ncbi.nlm.nih.gov/27422018/

[5] Lohnas, L. J., et al. (2023). Neural Temporal Context Reinstatement of Event Structure During Memory Recall. Communications Biology.
https://pmc.ncbi.nlm.nih.gov/articles/PMC10293072/

[6] Malkov, Y. A., & Yashunin, D. A. (2020). Efficient and Robust Approximate Nearest Neighbor Search Using Hierarchical Navigable Small World Graphs. IEEE Transactions on Pattern Analysis and Machine Intelligence, 42(4), 824–836.
https://arxiv.org/abs/1603.09320

[7] Hu, Y., et al. (2024). GRAG: Graph Retrieval-Augmented Generation.
https://arxiv.org/abs/2405.16506

[8] Chen, W., et al. (2024). KG-Retriever: Efficient Knowledge Indexing for Retrieval-Augmented Large Language Models.
https://arxiv.org/abs/2412.05547

[9] Edge, D., et al. (2024). From Local to Global: A Graph RAG Approach to Query-Focused Summarization.
https://arxiv.org/abs/2404.16130

[10] Huang, Y., Zhang, S., & Xiao, X. (2025). KET-RAG: A Cost-Efficient Multi-Granular Indexing Framework for Graph-RAG.
https://arxiv.org/abs/2502.09304

[11] Fang, Z., et al. (2021). A Query-Driven Topic Model. Findings of ACL-IJCNLP 2021.
https://aclanthology.org/2021.findings-acl.154.pdf

[12] Liu, J., et al. (2026). Scaling Retrieval-Augmented Reasoning with Parallel Search and Explicit Merging.
https://arxiv.org/html/2605.13534v1

[13] Jauk, E., Benedek, M., & Neubauer, A. C. (2012). Tackling Creativity at Its Roots: Evidence for Different Patterns of EEG Alpha Activity Related to Convergent and Divergent Modes of Task Processing. International Journal of Psychophysiology, 84(2), 219–225.
https://pmc.ncbi.nlm.nih.gov/articles/PMC3343259/

[14] Liu, C., Lin, Y., Ye, C., Yang, J., & He, W. (2023). Alpha ERS-ERD Pattern During Divergent and Convergent Thinking Depends on Individual Differences on Metacontrol. Journal of Intelligence, 11(4), 74.
https://pmc.ncbi.nlm.nih.gov/articles/PMC10144848/

[15] Zhao, Y., et al. (2025). E²GraphRAG: Streamlining Graph-Based RAG for High Efficiency and Effectiveness.
https://arxiv.org/abs/2505.24226


系列銜接

上一篇:《無損保存與近無損語義重建:GCMS 的雙軌記憶架構》

下一篇:《知識不只被重建:生成、組合與跨域再結構化》