多路徑知識索引:區塊、流式、跳躍、發散與集中
系列 :可繼承的認知:從自我解構到遞歸生成式記憶系統(第 5 篇)作者 :Neo.K研究協作 :Aletheia(阿萊)版本 :v1.0日期 :2026-07-30文章類型 :命題猜想論文/知識索引理論論文/GCMS 架構論文
摘要
大型知識系統經常把「索引」理解成一個單一問題:輸入查詢,返回若干最相似文件。然而,知識的可提取性並不只依賴相似度。當任務要求定位局部定義、重建理論演化、跨越遠距概念、展開多條候選路徑或將分散材料收斂成較少的生成核時,單一向量近鄰、全文檢索或靜態知識圖都可能出現系統性失敗。本文提出 GCMS 的多路徑知識索引理論,將索引形式化為作用於同一知識底圖之上的五類基本算子:區塊索引、流式索引、跳躍索引、發散索引與集中索引。
區塊索引將作品分割成具有局部語義、上下文與邊界條件的可操作單元;流式索引保存知識形成、修改與推導的時間方向;跳躍索引允許系統利用符號、生成核、關係邊與多尺度近鄰跨越線性鄰接;發散索引將一個問題展開為多個觀點、子問題、假說與檢索路徑;集中索引則對多路結果進行聚類、去重、衝突保存、證據排序與生成核抽取。五種模式不是彼此替代,而是構成一組可組合算子族。
本文提出「索引任務非同質命題」:不存在一個固定索引策略,能在所有知識任務上同時最佳化局部精確度、時間連續性、遠距橋接、候選多樣性、全局壓縮、證據保真與成本。本文進一步提出多路徑支配猜想、發散—集中對偶命題、跳躍增益命題、邊界—連續性張力命題與矛盾保存命題,並建立區塊完整率、流路連貫度、跳躍增益、分支覆蓋率、集中保真度、矛盾保存率及索引成本等評估指標。
本文主張,GCMS 未來的索引器不應只是資料結構集合,而應是一個具任務辨識能力的索引控制系統。給定查詢、當前證據、不確定性、資源預算與治理限制,後設控制器應動態生成索引程式,例如「先以生成核跳躍,再沿版本流回溯,接著發散檢索,最後集中但保留衝突」。這使索引從靜態尋址轉化為可驗證的知識運算路徑,並為後續的生成、組合、自調用與遞歸自主循環建立基礎。
關鍵詞 :GCMS、多路徑索引、區塊索引、流式索引、跳躍索引、發散檢索、集中檢索、知識圖、GraphRAG、事件分段、認知分塊、證據鏈
一、問題的提出:為什麼「相似文件搜尋」不等於知識索引
設知識庫為:
K = { d 1 , d 2 , … , d n } , \mathcal K=\{d_1,d_2,\ldots,d_n\}, K = { d 1 , d 2 , … , d n } ,
查詢為:
q ∈ Q . q\in\mathcal Q. q ∈ Q .
典型檢索系統以一個分數函數排序文件:
S ( d i ∣ q ) , S(d_i\mid q), S ( d i ∣ q ) ,
並返回:
TopK ( q ) = arg top k d i ∈ K S ( d i ∣ q ) . \operatorname{TopK}(q)
=
\underset{d_i\in\mathcal K}{\operatorname{arg\,top\,k}}
S(d_i\mid q). TopK ( q ) = d i ∈ K arg top k S ( d i ∣ q ) .
這種模型適合回答「哪一些文件和查詢最相似」,卻不必然適合回答以下問題:
某一概念第一次在哪個版本出現?
一個理論從母問題經過哪些中間命題才形成目前版本?
哪兩篇表面用詞不同的作品其實共享同一生成核?
哪些遠距系列可以藉由一個符號、反例或方法形成橋接?
一個新問題可能沿哪些互不相同的方向展開?
大量相近作品如何收斂為較少核心結構,而不抹去真正矛盾?
目前證據不足時,系統應擴大搜尋、向前追蹤、向後回溯,還是停止?
這些任務的差異不是查詢措辭差異,而是尋址幾何不同 。
局部定義查詢偏好細粒度單元;理論演化查詢需要時間順序;跨領域橋接需要遠距跳躍;開放研究需要多分支探索;整體理解需要全局聚合。若全部被壓縮成單一相似度排序,系統通常會得到一組「看起來都相關」但無法重建路徑、來源與結構的結果。
因此本文將知識索引重新定義為:
在證據、結構、時間與成本約束下,生成一條或多條可重演的知識尋址路徑,使系統能定位、連接、展開、聚合並驗證與任務相關的知識單元。
形式上,索引不再只是:
q ↦ { d 1 , … , d k } , q\mapsto\{d_1,\ldots,d_k\}, q ↦ { d 1 , … , d k } ,
而是:
( q , K , Θ ) ↦ ( π , E , C , T ) , (q,\mathcal K,\Theta)
\mapsto
\left(
\pi,
\mathcal E,
\mathcal C,
\mathcal T
\right), ( q , K , Θ ) ↦ ( π , E , C , T ) ,
其中:
π \pi π :索引操作序列;
E \mathcal E E :取得的證據集合;
C \mathcal C C :證據之間的關係與上下文;
T \mathcal T T :可重演的檢索軌跡;
Θ \Theta Θ :權限、成本、版本與停止條件。
二、研究背景:知識尋址本來就不是單一路徑
2.1 認知分塊:局部結構能降低工作記憶負擔
分塊研究顯示,人類會利用既有知識與規律,把多個元素重新編碼為較少、較具意義的單元。Chekaf 等人的實驗指出,參與者會在立即記憶任務中主動形成 chunks,而 chunking 可藉由知識降低需維持的單元數量。[1] Chen 與 Cowan 的研究則顯示,當排除語音複誦等因素後,工作記憶容量更接近以 chunks 而非原始項目計算。[2]
這類結果不能直接推出數位知識庫應如何切分,但提供一項重要啟示:
可操作單位 ≠ 原始最小單位 . \text{可操作單位}
\neq
\text{原始最小單位}. 可操作單位 = 原始最小單位 .
若系統以整篇論文為唯一索引單位,局部定義與證據會被大文件稀釋;若每一句都獨立索引,生成路徑與上下文又會碎裂。因此區塊不是任意字數窗口,而應是一個帶有內部凝聚力與外部邊界的知識單元。
2.2 事件分段與時間情境:連續知識會被組織成可回溯事件
人類經驗在物理時間上連續,記憶卻常以事件為單位。事件邊界會影響哪些資訊被整合、哪些資訊被分離,以及跨邊界的時間關係是否容易被保持。海馬迴與前額葉相關研究顯示,穩定情境有利於事件內部的時間綁定,而情境轉換會形成新的事件模型。[3][4][5]
這支持一種不同於靜態文件索引的視角:
知識狀態 = 內容 + 形成順序 + 邊界轉換 . \text{知識狀態}
=
\text{內容}
+
\text{形成順序}
+
\text{邊界轉換}. 知識狀態 = 內容 + 形成順序 + 邊界轉換 .
一篇論文的最終版本無法完整替代它的推導流;同一概念在不同時期的意義,也不能只靠最新摘要理解。流式索引因此必須保存狀態轉換、版本、前置依賴、否定路徑與中止分支。
2.3 小世界與多尺度圖:遠距節點可以藉由少量長連結快速抵達
HNSW 將多尺度鄰近圖構造成分層的小世界索引,上層長距離連結用於快速導航,下層局部連結則用於精細搜尋。其效果說明:在高維相似空間中,只依賴線性掃描或單尺度鄰近通常效率不足;多尺度、跨距離的連結可以顯著改變尋址成本。[6]
對 GCMS 而言,「跳躍」不限於向量近鄰。跳躍邊可以來自:
相同符號;
相同生成核;
相同母問題;
反例關係;
方法借用;
版本派生;
產品—理論投影;
人工指定的橋接。
GraphRAG 與其他圖檢索研究也顯示,將實體、文本與關係組成圖結構,能支援跨文件、多跳與全局性問題,而不只是返回獨立段落。[7][8][9][10]
2.4 發散檢索:單一查詢通常只覆蓋問題的一個投影
對開放問題,查詢 q q q 本身往往是不完整的。單次表述可能只激活某一術語、某一學科或某一解法。多查詢、查詢分解與鏈式檢索研究的共同方向,是把單一查詢展開為多個子查詢或觀點,再合併取得的證據。[11][12]
可寫成:
q → e x p a n d { q 1 , q 2 , … , q m } . q
\xrightarrow{\mathrm{expand}}
\{q_1,q_2,\ldots,q_m\}. q expand { q 1 , q 2 , … , q m } .
發散的目標不是產生越多查詢越好,而是提升對潛在相關區域的覆蓋:
Coverage ( ⋃ j = 1 m R ( q j ) ) > Coverage ( R ( q ) ) . \operatorname{Coverage}
\left(
\bigcup_{j=1}^{m}R(q_j)
\right)
>
\operatorname{Coverage}(R(q)). Coverage ( j = 1 ⋃ m R ( q j ) ) > Coverage ( R ( q )) .
心理學中的發散與集中思考研究也長期區分「生成多種可能」與「選擇或形成較少答案」兩種處理模式;實驗研究顯示兩者在任務表現與神經活動上並非完全相同。[13][14]
本文不把創造力任務直接等同於檢索演算法,但借用其操作性區分:發散負責擴大候選空間,集中負責評估與重構候選空間。
2.5 全局聚合與社群摘要:集中不只是把前幾名文件再摘要一次
GraphRAG 的 global search 將文本轉成實體圖、建立社群階層並生成社群摘要,用以處理「整個資料集主要主題為何」這類不適合局部近鄰檢索的問題。[9] 其他多粒度圖索引研究也指出,局部 chunks、實體關係、文件層與社群層具有不同成本與用途。[10][15]
集中因此至少包含:
去除重複表述;
聚合同源分支;
找出共同生成核;
對證據品質排序;
保存少數但關鍵的反例;
標示不能合併的矛盾;
將局部結果映射回全局結構。
若集中只追求短摘要,就可能把「多個可相容觀點」與「真正互相矛盾的命題」一起抹平。
三、統一知識底圖
3.1 知識單元
設 GCMS 的基本知識單元集合為:
U = { u 1 , u 2 , … , u N } . \mathcal U
=
\{u_1,u_2,\ldots,u_N\}. U = { u 1 , u 2 , … , u N } .
每個單元定義為:
u i = ( c i , h i , b i , τ i , s i , v i , a i ) , u_i
=
\left(
c_i,
h_i,
b_i,
\tau_i,
s_i,
v_i,
a_i
\right), u i = ( c i , h i , b i , τ i , s i , v i , a i ) ,
其中:
c i c_i c i :內容;
h i h_i h i :來源與內容雜湊;
b i b_i b i :區塊邊界與上下文;
τ i \tau_i τ i :時間、版本或形成序位;
s i s_i s i :語義指紋;
v i v_i v i :可見性與治理狀態;
a i a_i a i :作品、章節、公式、實驗或生成核等類型。
3.2 多關係邊
知識底圖不是單一邊類型的圖,而是:
G = ( U , E ) , \mathcal G
=
\left(
\mathcal U,
\mathcal E
\right), G = ( U , E ) ,
其中:
E = E s e m ∪ E t e m p ∪ E g e n ∪ E e v i d ∪ E c o n t r a ∪ E m a n u a l . \mathcal E
=
\mathcal E_{\mathrm{sem}}
\cup
\mathcal E_{\mathrm{temp}}
\cup
\mathcal E_{\mathrm{gen}}
\cup
\mathcal E_{\mathrm{evid}}
\cup
\mathcal E_{\mathrm{contra}}
\cup
\mathcal E_{\mathrm{manual}}. E = E sem ∪ E temp ∪ E gen ∪ E evid ∪ E contra ∪ E manual .
各類邊分別表示:
E s e m \mathcal E_{\mathrm{sem}} E sem :語義相似或主題相關;
E t e m p \mathcal E_{\mathrm{temp}} E temp :時間、版本與狀態轉換;
E g e n \mathcal E_{\mathrm{gen}} E gen :生成、推導與依賴;
E e v i d \mathcal E_{\mathrm{evid}} E evid :主張與原始證據;
E c o n t r a \mathcal E_{\mathrm{contra}} E contra :矛盾、反例或不相容;
E m a n u a l \mathcal E_{\mathrm{manual}} E manual :人工指定橋接與策展關係。
同一對節點可以具有多個關係:
( u i , u j ) ∈ E s e m ∩ E t e m p . (u_i,u_j)
\in
\mathcal E_{\mathrm{sem}}
\cap
\mathcal E_{\mathrm{temp}}. ( u i , u j ) ∈ E sem ∩ E temp .
3.3 索引不是另一份知識,而是對底圖施加的運算
本文定義索引算子族:
I = { B , F , J , D , C } , \mathfrak I
=
\{
\mathsf B,
\mathsf F,
\mathsf J,
\mathsf D,
\mathsf C
\}, I = { B , F , J , D , C } ,
分別對應:
B \mathsf B B :Block,區塊;
F \mathsf F F :Flow,流式;
J \mathsf J J :Jump,跳躍;
D \mathsf D D :Divergence,發散;
C \mathsf C C :Convergence,集中。
這些算子使用同一批來源、版本與證據,但產生不同尋址路徑。
四、區塊索引:將內容切成可操作、可重組但不失去邊界的單元
4.1 區塊不是固定字數窗口
對作品 d d d ,區塊算子為:
B ( d ; θ B ) = { b 1 , b 2 , … , b m } , \mathsf B(d;\theta_B)
=
\{b_1,b_2,\ldots,b_m\}, B ( d ; θ B ) = { b 1 , b 2 , … , b m } ,
並要求:
⋃ i = 1 m Span ( b i ) = Span ( d ) . \bigcup_{i=1}^{m}\operatorname{Span}(b_i)
=
\operatorname{Span}(d). i = 1 ⋃ m Span ( b i ) = Span ( d ) .
但相鄰區塊可重疊,以保存跨邊界上下文:
Span ( b i ) ∩ Span ( b i + 1 ) ≠ ∅ . \operatorname{Span}(b_i)
\cap
\operatorname{Span}(b_{i+1})
\neq
\varnothing. Span ( b i ) ∩ Span ( b i + 1 ) = ∅ .
固定 token 數量只是一種低成本方法。更完整的區塊邊界應綜合:
BoundaryScore ( t ) = α S t o p i c + β S s y n t a x + γ S e v e n t + δ S s y m b o l + η S a u t h o r . \operatorname{BoundaryScore}(t)
=
\alpha S_{\mathrm{topic}}
+
\beta S_{\mathrm{syntax}}
+
\gamma S_{\mathrm{event}}
+
\delta S_{\mathrm{symbol}}
+
\eta S_{\mathrm{author}}. BoundaryScore ( t ) = α S topic + β S syntax + γ S event + δ S symbol + η S author .
其中可考慮:
標題與章節;
語義主題轉移;
定義、定理、證明、實驗等結構;
公式與符號作用域;
作者明確標示的邊界;
事件或版本轉換。
4.2 區塊的最小充分上下文
區塊 b i b_i b i 不只保存文字,還應保存:
b i = ( x i , c i − , c i + , scope i , deps i ) , b_i
=
\left(
x_i,
c_i^{-},
c_i^{+},
\operatorname{scope}_i,
\operatorname{deps}_i
\right), b i = ( x i , c i − , c i + , scope i , deps i ) ,
其中:
x i x_i x i :核心內容;
c i − c_i^{-} c i − :前置上下文;
c i + c_i^{+} c i + :後續上下文;
scope i \operatorname{scope}_i scope i :符號、版本與章節作用域;
deps i \operatorname{deps}_i deps i :依賴的定義、證據與前置命題。
這可降低「檢索到一句正確文字,卻失去它成立的假設」的風險。
4.3 區塊完整率
定義任務 q q q 所需的最小證據集合為 E q ∗ E_q^\ast E q ∗ ,實際取回區塊證據為 E q E_q E q ,則:
BCR ( q ) = ∣ E q ∩ E q ∗ ∣ ∣ E q ∗ ∣ . \operatorname{BCR}(q)
=
\frac{|E_q\cap E_q^\ast|}{|E_q^\ast|}. BCR ( q ) = ∣ E q ∗ ∣ ∣ E q ∩ E q ∗ ∣ .
但還需懲罰失去上下文的孤立命中:
BCR + ( q ) = BCR ( q ) ⋅ ContextAdequacy ( E q ) . \operatorname{BCR}^{+}(q)
=
\operatorname{BCR}(q)
\cdot
\operatorname{ContextAdequacy}(E_q). BCR + ( q ) = BCR ( q ) ⋅ ContextAdequacy ( E q ) .
4.4 區塊索引的失敗模式
過度分塊 :命題、證明與條件被分散;
分塊不足 :局部訊號被大篇幅背景稀釋;
邊界僵化 :同一作品只能有一套切分;
符號失域 :公式被取回,但定義不在同一區塊;
版本混塊 :不同版本內容被視為同一語義單元。
因此本文主張 GCMS 應允許:
B 1 ( d ) , B 2 ( d ) , … , B r ( d ) , \mathsf B_1(d),
\mathsf B_2(d),
\ldots,
\mathsf B_r(d), B 1 ( d ) , B 2 ( d ) , … , B r ( d ) ,
也就是同一作品具有多粒度、多目的區塊視圖,而不是只有一套永久切分。
五、流式索引:保存知識如何形成,而不只保存最後狀態
5.1 流是有方向的狀態序列
對一個理論或作品系列,定義狀態流:
F = ( z 0 → e 1 z 1 → e 2 ⋯ → e T z T ) , \mathcal F
=
\left(
z_0
\xrightarrow{e_1}
z_1
\xrightarrow{e_2}
\cdots
\xrightarrow{e_T}
z_T
\right), F = ( z 0 e 1 z 1 e 2 ⋯ e T z T ) ,
其中:
z t z_t z t :時間 t t t 的知識狀態;
e t e_t e t :修改、反例、實驗、合併、分支或重命名事件。
流式索引算子為:
F ( q , z t ; w , d ) → ( z t − w , … , z t , … , z t + d ) , \mathsf F(q,z_t;w,d)
\rightarrow
\left(
z_{t-w},\ldots,z_t,\ldots,z_{t+d}
\right), F ( q , z t ; w , d ) → ( z t − w , … , z t , … , z t + d ) ,
其中 w w w 是回溯窗口, d d d 是前向追蹤窗口。
5.2 流式索引的五種方向
回溯 :目前結論從何而來;
前向追蹤 :一個母命題後來形成哪些分支;
版本差分 :兩版之間改變什麼;
中止路徑 :哪些方向曾被提出但被放棄;
週期與復現 :某一問題是否在不同時期重複出現。
5.3 流路連貫度
令檢索到的有序節點為:
P = ( u i 1 , u i 2 , … , u i k ) , P=(u_{i_1},u_{i_2},\ldots,u_{i_k}), P = ( u i 1 , u i 2 , … , u i k ) ,
定義流路連貫度:
FC ( P ) = 1 k − 1 ∑ j = 1 k − 1 1 [ ( u i j , u i j + 1 ) ∈ E t e m p ∪ E g e n ] . \operatorname{FC}(P)
=
\frac{1}{k-1}
\sum_{j=1}^{k-1}
\mathbf 1
\left[
(u_{i_j},u_{i_{j+1}})
\in
\mathcal E_{\mathrm{temp}}
\cup
\mathcal E_{\mathrm{gen}}
\right]. FC ( P ) = k − 1 1 j = 1 ∑ k − 1 1 [ ( u i j , u i j + 1 ) ∈ E temp ∪ E gen ] .
可再加入方向一致性:
FDC ( P ) = FC ( P ) ⋅ ( 1 − N r e v e r s e k − 1 ) . \operatorname{FDC}(P)
=
\operatorname{FC}(P)
\cdot
\left(
1-\frac{N_{\mathrm{reverse}}}{k-1}
\right). FDC ( P ) = FC ( P ) ⋅ ( 1 − k − 1 N reverse ) .
5.4 流式索引與最新版本偏誤
流式系統若只按時間衰減加權:
w t = e − λ Δ t , w_t=e^{-\lambda\Delta t}, w t = e − λ Δ t ,
會自然偏向最新內容。但舊版本可能包含:
已被刪除的假設;
失敗但重要的實驗;
被後來版本掩蓋的概念來源;
重命名前的同義術語。
因此流式索引不能把「最近」等同「最重要」,而應分離:
S f l o w = α S t e m p o r a l + β S c a u s a l + γ S v e r s i o n + δ S e v i d e n c e . S_{\mathrm{flow}}
=
\alpha S_{\mathrm{temporal}}
+
\beta S_{\mathrm{causal}}
+
\gamma S_{\mathrm{version}}
+
\delta S_{\mathrm{evidence}}. S flow = α S temporal + β S causal + γ S version + δ S evidence .
六、跳躍索引:跨越表面相似度與線性鄰接
6.1 跳躍的定義
設目前節點為 u i u_i u i ,一般局部檢索只查看鄰域:
N r ( u i ) = { u j ∣ dist ( u i , u j ) ≤ r } . \mathcal N_r(u_i)
=
\{u_j\mid \operatorname{dist}(u_i,u_j)\leq r\}. N r ( u i ) = { u j ∣ dist ( u i , u j ) ≤ r } .
跳躍索引允許選擇:
u j ∉ N r ( u i ) , u_j\notin\mathcal N_r(u_i), u j ∈ / N r ( u i ) ,
但滿足某個高辨識度關係:
Anchor ( u i , u j ∣ q ) ≥ θ J . \operatorname{Anchor}(u_i,u_j\mid q)\geq\theta_J. Anchor ( u i , u j ∣ q ) ≥ θ J .
因此:
J ( u i , q ) = TopK u j S J ( u j ∣ u i , q ) . \mathsf J(u_i,q)
=
\operatorname{TopK}_{u_j}
S_J(u_j\mid u_i,q). J ( u i , q ) = TopK u j S J ( u j ∣ u i , q ) .
6.2 跳躍分數
可定義:
S J ( u j ∣ u i , q ) = α S s e m a n t i c + β S s y m b o l + γ S k e r n e l + δ S r e l a t i o n + η S c o n t r a s t + ζ S m a n u a l . \begin{aligned}
S_J(u_j\mid u_i,q)
={}&
\alpha S_{\mathrm{semantic}}
+
\beta S_{\mathrm{symbol}}
+
\gamma S_{\mathrm{kernel}}\\
&+
\delta S_{\mathrm{relation}}
+
\eta S_{\mathrm{contrast}}
+
\zeta S_{\mathrm{manual}}.
\end{aligned} S J ( u j ∣ u i , q ) = α S semantic + β S symbol + γ S kernel + δ S relation + η S contrast + ζ S manual .
其中 S c o n t r a s t S_{\mathrm{contrast}} S contrast 允許跳到反例與矛盾,而不是只跳到相似內容。
6.3 多尺度跳躍
借鑑多層小世界索引,可將知識圖分成不同尺度:
G ( 0 ) , G ( 1 ) , … , G ( L ) . \mathcal G^{(0)},
\mathcal G^{(1)},
\ldots,
\mathcal G^{(L)}. G ( 0 ) , G ( 1 ) , … , G ( L ) .
其中:
低層保存段落、定義與局部證據;
中層保存作品、系列與生成核;
高層保存跨域方法、母問題與抽象關係。
跳躍路徑可以先在高層快速定位,再下降到原文證據:
G ( L ) → G ( L − 1 ) → ⋯ → G ( 0 ) . \mathcal G^{(L)}
\rightarrow
\mathcal G^{(L-1)}
\rightarrow
\cdots
\rightarrow
\mathcal G^{(0)}. G ( L ) → G ( L − 1 ) → ⋯ → G ( 0 ) .
6.4 跳躍增益
設不允許跳躍的基線檢索效用為 U 0 ( q ) U_0(q) U 0 ( q ) ,允許跳躍後為 U J ( q ) U_J(q) U J ( q ) :
JG ( q ) = U J ( q ) − U 0 ( q ) . \operatorname{JG}(q)
=
U_J(q)-U_0(q). JG ( q ) = U J ( q ) − U 0 ( q ) .
但也需計算跳躍漂移:
JD ( q ) = 1 − ∣ E J ∩ E q ∗ ∣ ∣ E J ∣ . \operatorname{JD}(q)
=
1-
\frac{|E_J\cap E_q^\ast|}{|E_J|}. JD ( q ) = 1 − ∣ E J ∣ ∣ E J ∩ E q ∗ ∣ .
真正有效的跳躍需同時滿足:
JG ( q ) > 0 , \operatorname{JG}(q)>0, JG ( q ) > 0 ,
且:
JD ( q ) < θ d r i f t . \operatorname{JD}(q)<\theta_{\mathrm{drift}}. JD ( q ) < θ drift .
6.5 語義瞬移風險
跳躍索引最危險的錯誤不是找不到,而是找到一個「高階概念很像,底層假設完全不同」的遠端節點。
例如兩篇作品都使用「固定點」,但其數學空間、算子條件與證明目的不同。若只靠詞彙或向量相似度跳躍,系統可能把比喻關係誤當可運算同一性。
因此每次跳躍都應附帶:
J i j = ( 理由 , 邊類型 , 尺度 , 證據 , 不相容條件 ) . J_{ij}
=
\left(
\text{理由},
\text{邊類型},
\text{尺度},
\text{證據},
\text{不相容條件}
\right). J ij = ( 理由 , 邊類型 , 尺度 , 證據 , 不相容條件 ) .
七、發散索引:將單一查詢展開成受控候選空間
7.1 發散不是隨機聯想
發散索引算子:
D ( q ; θ D ) = { q 1 , q 2 , … , q m } . \mathsf D(q;\theta_D)
=
\{q_1,q_2,\ldots,q_m\}. D ( q ; θ D ) = { q 1 , q 2 , … , q m } .
子查詢可來自不同變換:
q j = T j ( q ) , q_j
=
T_j(q), q j = T j ( q ) ,
例如:
同義與術語變換;
抽象化或具體化;
因果前件與後件;
方法、反例、限制與應用;
不同學科投影;
不同時間與版本;
支持與反對立場;
部分問題分解。
7.2 發散樹
發散過程形成樹:
T D = ( V D , E D ) , \mathcal T_D
=
(V_D,E_D), T D = ( V D , E D ) ,
根節點為原始問題 q 0 q_0 q 0 ,每個節點可再展開:
q t + 1 ( j ) = T j ( q t ) . q_{t+1}^{(j)}
=
T_j(q_t). q t + 1 ( j ) = T j ( q t ) .
若不限制深度與寬度,候選數可能指數增長:
∣ V D ∣ ≈ ∑ t = 0 L b t . |V_D|
\approx
\sum_{t=0}^{L}b^t. ∣ V D ∣ ≈ t = 0 ∑ L b t .
因此發散必須受預算控制:
∣ V D ∣ ≤ B D , |V_D|\leq B_D, ∣ V D ∣ ≤ B D ,
L ≤ L max . L\leq L_{\max}. L ≤ L m a x .
7.3 分支覆蓋與分支新穎度
若真實相關面向集合為 A q ∗ A_q^\ast A q ∗ ,已覆蓋面向為 A D A_D A D :
BCov ( q ) = ∣ A D ∩ A q ∗ ∣ ∣ A q ∗ ∣ . \operatorname{BCov}(q)
=
\frac{|A_D\cap A_q^\ast|}{|A_q^\ast|}. BCov ( q ) = ∣ A q ∗ ∣ ∣ A D ∩ A q ∗ ∣ .
分支間的平均差異可定義為:
BDiv ( q ) = 2 m ( m − 1 ) ∑ i < j ( 1 − sim ( q i , q j ) ) . \operatorname{BDiv}(q)
=
\frac{2}{m(m-1)}
\sum_{i<j}
\left(
1-\operatorname{sim}(q_i,q_j)
\right). BDiv ( q ) = m ( m − 1 ) 2 i < j ∑ ( 1 − sim ( q i , q j ) ) .
好的發散需避免兩種極端:
BDiv ≈ 0 , \operatorname{BDiv}\approx0, BDiv ≈ 0 ,
代表只是同義改寫;
BDiv ≈ 1 , \operatorname{BDiv}\approx1, BDiv ≈ 1 ,
則可能表示分支已脫離原問題。
7.4 證據驅動發散
GCMS 不應只在查詢開始時發散。當檢索後發現證據缺口,也可生成新分支:
q t + 1 = GapToQuery ( q t , E t , U t ) , q_{t+1}
=
\operatorname{GapToQuery}
\left(
q_t,E_t,\mathcal U_t
\right), q t + 1 = GapToQuery ( q t , E t , U t ) ,
其中 U t \mathcal U_t U t 是未解決的不確定性。
觸發條件可為:
Coverage ( E t ) < θ C , \operatorname{Coverage}(E_t)<\theta_C, Coverage ( E t ) < θ C ,
或:
Conflict ( E t ) > θ X . \operatorname{Conflict}(E_t)>\theta_X. Conflict ( E t ) > θ X .
7.5 發散爆炸與新穎性幻覺
發散容易產生:
大量同義問題;
與來源無關的創意分支;
被模型語言風格誤判為新概念的重複內容;
只支持原假設、不搜尋反例的確認偏誤;
無限研究循環。
因此每個分支應保存:
D j = ( q j , parent ( q j ) , transform j , expectedGain j , cost j , status j ) . D_j
=
\left(
q_j,
\operatorname{parent}(q_j),
\operatorname{transform}_j,
\operatorname{expectedGain}_j,
\operatorname{cost}_j,
\operatorname{status}_j
\right). D j = ( q j , parent ( q j ) , transform j , expectedGain j , cost j , status j ) .
八、集中索引:從多路候選恢復結構,而不是只做摘要
8.1 集中算子
給定發散或多路檢索結果:
R = { r 1 , r 2 , … , r n } , \mathcal R
=
\{r_1,r_2,\ldots,r_n\}, R = { r 1 , r 2 , … , r n } ,
集中算子為:
C ( R ; q , θ C ) = ( K R , X R , S R , E R ) , \mathsf C(\mathcal R;q,\theta_C)
=
\left(
\mathcal K_R,
\mathcal X_R,
\mathcal S_R,
\mathcal E_R
\right), C ( R ; q , θ C ) = ( K R , X R , S R , E R ) ,
其中:
K R \mathcal K_R K R :抽取的生成核或主題核心;
X R \mathcal X_R X R :不可合併的矛盾與反例;
S R \mathcal S_R S R :代表性證據集合;
E R \mathcal E_R E R :來源與關係映射。
8.2 集中的五個階段
第一階段:正規化
對名稱、符號、版本與引用進行對齊:
r ~ i = Normalize ( r i ) . \widetilde r_i
=
\operatorname{Normalize}(r_i). r i = Normalize ( r i ) .
第二階段:聚類與去重
R → { C 1 , C 2 , … , C k } , \mathcal R
\rightarrow
\{C_1,C_2,\ldots,C_k\}, R → { C 1 , C 2 , … , C k } ,
其中每個 C j C_j C j 是語義或生成關係較密集的群集。
第三階段:證據排序
S E ( r i ) = α S s o u r c e + β S d i r e c t + γ S v e r s i o n + δ S i n d e p e n d e n t . S_E(r_i)
=
\alpha S_{\mathrm{source}}
+
\beta S_{\mathrm{direct}}
+
\gamma S_{\mathrm{version}}
+
\delta S_{\mathrm{independent}}. S E ( r i ) = α S source + β S direct + γ S version + δ S independent .
第四階段:核心抽取
K j = Invariant ( C j ) , K_j
=
\operatorname{Invariant}(C_j), K j = Invariant ( C j ) ,
但抽取的核心必須附帶其支撐與不適用邊界。
第五階段:矛盾保存
若兩命題:
p i ∧ p j ⊨ ⊥ , p_i\land p_j\models\bot, p i ∧ p j ⊨ ⊥ ,
則不得只因一方較常見就自動刪除另一方,而應保存:
X i j = ( p i , p j , 各自證據 , 適用條件 , 未決狀態 ) . X_{ij}
=
\left(
p_i,p_j,
\text{各自證據},
\text{適用條件},
\text{未決狀態}
\right). X ij = ( p i , p j , 各自證據 , 適用條件 , 未決狀態 ) .
8.3 集中保真度
令集中前的關鍵不變量集合為 I ( R ) \mathcal I(\mathcal R) I ( R ) ,集中結果為 Y Y Y :
CFid = ∣ I ( Y ) ∩ I ( R ) ∣ ∣ I ( R ) ∣ . \operatorname{CFid}
=
\frac{
|\mathcal I(Y)\cap\mathcal I(\mathcal R)|
}{
|\mathcal I(\mathcal R)|
}. CFid = ∣ I ( R ) ∣ ∣ I ( Y ) ∩ I ( R ) ∣ .
定義矛盾保存率:
CPR = ∣ X Y ∩ X R ∣ ∣ X R ∣ . \operatorname{CPR}
=
\frac{|\mathcal X_Y\cap\mathcal X_R|}{|\mathcal X_R|}. CPR = ∣ X R ∣ ∣ X Y ∩ X R ∣ .
若一個摘要非常流暢但:
CPR ≈ 0 , \operatorname{CPR}\approx0, CPR ≈ 0 ,
則它可能只是把爭議抹平,而不是完成可靠集中。
8.4 集中與壓縮的差異
一般壓縮關心:
∣ Y ∣ ∣ R ∣ . \frac{|Y|}{|\mathcal R|}. ∣ R ∣ ∣ Y ∣ .
可靠集中還關心:
Traceability ( Y ) , \operatorname{Traceability}(Y), Traceability ( Y ) ,
BoundaryPreservation ( Y ) , \operatorname{BoundaryPreservation}(Y), BoundaryPreservation ( Y ) ,
以及:
MinorityEvidenceRetention ( Y ) . \operatorname{MinorityEvidenceRetention}(Y). MinorityEvidenceRetention ( Y ) .
因此:
集中 ≠ 刪到只剩最常見敘述 \boxed{
\text{集中}
\neq
\text{刪到只剩最常見敘述}
} 集中 = 刪到只剩最常見敘述
九、發散—集中對偶
9.1 不是互相抵銷,而是兩個不同階段
發散擴大候選空間:
D : Q → P ( Q ) , \mathsf D:
\mathcal Q
\rightarrow
\mathcal P(\mathcal Q), D : Q → P ( Q ) ,
集中把候選空間轉換為結構化結果:
C : P ( R ) → Y . \mathsf C:
\mathcal P(\mathcal R)
\rightarrow
\mathcal Y. C : P ( R ) → Y .
兩者組合:
q → D { q 1 , … , q m } → R e t r i e v e R → C Y . q
\xrightarrow{\mathsf D}
\{q_1,\ldots,q_m\}
\xrightarrow{\mathrm{Retrieve}}
\mathcal R
\xrightarrow{\mathsf C}
Y. q D { q 1 , … , q m } Retrieve R C Y .
9.2 集中不是發散的逆函數
一般而言:
C ( D ( q ) ) ≠ q . \mathsf C(\mathsf D(q))
\neq q. C ( D ( q )) = q .
因為發散可能發現原問題未包含的新證據、衝突與結構。集中後的結果 Y Y Y 應該是受證據修正的新狀態,而不是回到起點。
9.3 對偶效用
設發散後的覆蓋增益為:
G D = Coverage ( R D ) − Coverage ( R 0 ) , G_D
=
\operatorname{Coverage}(\mathcal R_D)
-
\operatorname{Coverage}(\mathcal R_0), G D = Coverage ( R D ) − Coverage ( R 0 ) ,
集中後的認知負擔降低為:
G C = Load ( R D ) − Load ( Y ) . G_C
=
\operatorname{Load}(\mathcal R_D)
-
\operatorname{Load}(Y). G C = Load ( R D ) − Load ( Y ) .
可靠流程需同時保持:
G D > 0 , G_D>0, G D > 0 ,
G C > 0 , G_C>0, G C > 0 ,
以及:
CFid ≥ θ F . \operatorname{CFid}\geq\theta_F. CFid ≥ θ F .
十、後設索引控制器:何時使用哪一條路徑
10.1 索引程式
GCMS 的索引控制器不是固定選擇一種模式,而是生成算子序列:
π q = ( o 1 , o 2 , … , o T ) , \pi_q
=
(o_1,o_2,\ldots,o_T), π q = ( o 1 , o 2 , … , o T ) ,
其中:
o t ∈ I . o_t\in\mathfrak I. o t ∈ I .
例如:
π 1 = ( B , J , C ) , \pi_1
=(\mathsf B,\mathsf J,\mathsf C), π 1 = ( B , J , C ) ,
表示先做局部區塊定位,再跨系列跳躍,最後聚合。
又如:
π 2 = ( J , F − , D , C ) , \pi_2
=(\mathsf J,\mathsf F^{-},\mathsf D,\mathsf C), π 2 = ( J , F − , D , C ) ,
表示先以生成核跳到遠端作品,再沿時間流回溯來源,之後發散搜尋相關分支,最後集中。
10.2 控制器狀態
控制器輸入:
Σ t = ( q , E t , U t , X t , B t , R t , P t ) , \Sigma_t
=
\left(
q,
E_t,
U_t,
X_t,
B_t,
R_t,
P_t
\right), Σ t = ( q , E t , U t , X t , B t , R t , P t ) ,
其中:
E t E_t E t :目前證據;
U t U_t U t :不確定性;
X t X_t X t :衝突程度;
B t B_t B t :資源預算;
R t R_t R t :剩餘遞歸深度;
P t P_t P t :權限與治理政策。
動作選擇:
o t + 1 = Π ( Σ t ) . o_{t+1}
=
\Pi(\Sigma_t). o t + 1 = Π ( Σ t ) .
10.3 效用函數
可定義:
U ( π q ) = α R r e l e v a n c e + β R c o v e r a g e + γ R f a i t h f u l n e s s + δ R d i v e r s i t y + η R t r a c e a b i l i t y − λ C c o s t − μ C r i s k . \begin{aligned}
U(\pi_q)
={}&
\alpha R_{\mathrm{relevance}}
+
\beta R_{\mathrm{coverage}}
+
\gamma R_{\mathrm{faithfulness}}\\
&+
\delta R_{\mathrm{diversity}}
+
\eta R_{\mathrm{traceability}}
-
\lambda C_{\mathrm{cost}}
-
\mu C_{\mathrm{risk}}.
\end{aligned} U ( π q ) = α R relevance + β R coverage + γ R faithfulness + δ R diversity + η R traceability − λ C cost − μ C risk .
控制器目標:
π q ∗ = argmax π U ( π ) . \pi_q^\ast
=
\underset{\pi}{\operatorname{argmax}}
U(\pi). π q ∗ = π argmax U ( π ) .
10.4 停止條件
索引不能永遠展開。停止條件可為:
Δ U t < ε , \Delta U_t<\varepsilon, Δ U t < ε ,
或:
Coverage ( E t ) ≥ θ C , \operatorname{Coverage}(E_t)\geq\theta_C, Coverage ( E t ) ≥ θ C ,
或:
B t ≤ 0 , B_t\leq0, B t ≤ 0 ,
或:
StateRepeat ( Σ t ) = 1 , \operatorname{StateRepeat}(\Sigma_t)=1, StateRepeat ( Σ t ) = 1 ,
或需要外部權限與人工判斷。
十一、核心命題與猜想
命題一:索引任務非同質命題
不存在一個固定索引策略 I ∗ I^\ast I ∗ ,能對所有任務分布 Q \mathcal Q Q 同時最大化:
{ 局部精確度 , 時間連續性 , 遠距橋接 , 候選多樣性 , 全局壓縮 , 證據保真 , 低成本 } . \{
\text{局部精確度},
\text{時間連續性},
\text{遠距橋接},
\text{候選多樣性},
\text{全局壓縮},
\text{證據保真},
\text{低成本}
\}. { 局部精確度 , 時間連續性 , 遠距橋接 , 候選多樣性 , 全局壓縮 , 證據保真 , 低成本 } .
只要存在兩類任務 q a , q b q_a,q_b q a , q b ,其最優尋址幾何不同,即有:
argmax I U ( I ∣ q a ) ≠ argmax I U ( I ∣ q b ) . \operatorname{argmax}_{I}U(I\mid q_a)
\neq
\operatorname{argmax}_{I}U(I\mid q_b). argmax I U ( I ∣ q a ) = argmax I U ( I ∣ q b ) .
命題二:多路徑支配猜想
對具有局部、時間、跨文件與全局任務混合的查詢分布,若後設控制器能正確選擇算子序列,則:
E q ∼ Q [ U ( π q ∗ ) ] > max I ∈ I E q ∼ Q [ U ( I ( q ) ) ] . \mathbb E_{q\sim\mathcal Q}
[U(\pi_q^\ast)]
>
\max_{I\in\mathfrak I}
\mathbb E_{q\sim\mathcal Q}
[U(I(q))]. E q ∼ Q [ U ( π q ∗ )] > I ∈ I max E q ∼ Q [ U ( I ( q ))] .
此命題不是宣稱多路徑對每一查詢都優於最佳單一路徑,而是宣稱在異質任務分布上,動態選路的平均效用可能更高。
命題三:邊界—連續性張力命題
更細的區塊通常提高局部可定位性,卻可能降低跨區塊連續性:
∂ R l o c a l ∂ g > 0 , \frac{\partial R_{\mathrm{local}}}{\partial g}>0, ∂ g ∂ R local > 0 ,
∂ R f l o w ∂ g < 0 , \frac{\partial R_{\mathrm{flow}}}{\partial g}<0, ∂ g ∂ R flow < 0 ,
其中 g g g 表示分塊細粒度。
因此最佳粒度依任務而變:
g ∗ = g ( q ) . g^\ast=g(q). g ∗ = g ( q ) .
命題四:跳躍增益命題
當答案證據分散於語義距離遠但關係上可橋接的節點時,加入有證據的跳躍邊可提升召回或降低尋址成本:
JG ( q ) > 0. \operatorname{JG}(q)>0. JG ( q ) > 0.
但若跳躍邊缺少作用域與不相容條件,漂移風險上升。
命題五:發散—集中對偶命題
只發散會提高覆蓋但增加成本與噪音;只集中會降低負擔但可能遺失新穎性與少數證據。對開放問題,存在一組非零發散與非零集中強度:
( d ∗ , c ∗ ) , d ∗ > 0 , c ∗ > 0 , (d^\ast,c^\ast),
\qquad
d^\ast>0,
\quad
c^\ast>0, ( d ∗ , c ∗ ) , d ∗ > 0 , c ∗ > 0 ,
使總效用高於任一極端。
命題六:矛盾保存命題
若集中算子只以頻率、相似度或摘要流暢度作為目標,則隨壓縮率提高,矛盾保存率可能下降:
∂ CPR ∂ Compression < 0. \frac{\partial\operatorname{CPR}}{\partial\operatorname{Compression}}<0. ∂ Compression ∂ CPR < 0.
加入顯式矛盾邊與少數證據保留政策,應能改善此問題。
命題七:可重演索引命題
若索引結果保存:
( π , θ , 版本 , 證據 , 隨機種子 ) , \left(
\pi,
\theta,
\text{版本},
\text{證據},
\text{隨機種子}
\right), ( π , θ , 版本 , 證據 , 隨機種子 ) ,
則在底層知識狀態不變時,索引路徑應可被近似重演。若系統只保存最終回答,而不保存路徑,則無法區分來源變動、模型漂移與索引策略改變。
十二、評估框架
12.1 任務類型
建立五類基準:
局部定位任務 :找定義、公式、段落與直接證據;
演化重建任務 :找版本、前置命題與形成順序;
橋接任務 :找跨系列、跨術語與跨學科關係;
發現任務 :對開放問題生成多種有證據的研究方向;
全局集中任務 :抽取核心、聚合系列並保存矛盾。
12.2 比較系統
至少比較:
BM25 或全文檢索;
單一向量近鄰;
單一知識圖檢索;
固定 chunk RAG;
多路徑但無控制器;
完整多路徑控制器。
12.3 主要指標
局部檢索:
R e c a l l @ k , M R R , n D C G @ k . \mathrm{Recall@k},
\quad
\mathrm{MRR},
\quad
\mathrm{nDCG@k}. Recall@k , MRR , nDCG@k .
流式重建:
FC , FDC , VersionAccuracy . \operatorname{FC},
\quad
\operatorname{FDC},
\quad
\operatorname{VersionAccuracy}. FC , FDC , VersionAccuracy .
跳躍:
JG , JD , HopCount . \operatorname{JG},
\quad
\operatorname{JD},
\quad
\operatorname{HopCount}. JG , JD , HopCount .
發散:
BCov , BDiv , NovelEvidenceRate . \operatorname{BCov},
\quad
\operatorname{BDiv},
\quad
\operatorname{NovelEvidenceRate}. BCov , BDiv , NovelEvidenceRate .
集中:
CFid , CPR , Traceability . \operatorname{CFid},
\quad
\operatorname{CPR},
\quad
\operatorname{Traceability}. CFid , CPR , Traceability .
成本:
C = α T l a t e n c y + β N r e t r i e v a l + γ N t o k e n s + δ N g r a p h o p s . C
=
\alpha T_{\mathrm{latency}}
+
\beta N_{\mathrm{retrieval}}
+
\gamma N_{\mathrm{tokens}}
+
\delta N_{\mathrm{graph\,ops}}. C = α T latency + β N retrieval + γ N tokens + δ N graph ops .
12.4 消融實驗
依序移除:
流式邊;
生成核跳躍;
反例邊;
發散分支;
集中矛盾保存;
後設控制器。
若移除某一算子只影響對應任務,而不顯著影響其他任務,支持五種索引具有功能分化。若單一向量檢索在所有任務與成本下都不劣於多路徑系統,則本文核心猜想受到否證。
十三、工程架構
13.1 七層架構
GCMS 多路徑索引可分為:
L 0 = 無損來源與版本層 , L 1 = 多粒度區塊層 , L 2 = 時間與生成流層 , L 3 = 多關係圖與跳躍層 , L 4 = 發散/集中算子層 , L 5 = 後設控制與停止層 , L 6 = 證據、審計與治理層 . \begin{aligned}
L_0&=\text{無損來源與版本層},\\
L_1&=\text{多粒度區塊層},\\
L_2&=\text{時間與生成流層},\\
L_3&=\text{多關係圖與跳躍層},\\
L_4&=\text{發散/集中算子層},\\
L_5&=\text{後設控制與停止層},\\
L_6&=\text{證據、審計與治理層}.
\end{aligned} L 0 L 1 L 2 L 3 L 4 L 5 L 6 = 無損來源與版本層 , = 多粒度區塊層 , = 時間與生成流層 , = 多關係圖與跳躍層 , = 發散/集中算子層 , = 後設控制與停止層 , = 證據、審計與治理層 .
13.2 索引紀錄
每次索引執行保存:
{
"trace_id": "TRACE-...",
"query": "...",
"operators": ["block", "jump", "flow-backward", "diverge", "converge"],
"parameters": {},
"retrieved_units": [],
"evidence_citations": [],
"conflicts": [],
"stop_reason": "coverage_satisfied",
"cost": {},
"knowledge_snapshot": "sha256:..."
}
13.3 候選路徑與正式知識分離
索引路徑可能產生新的橋接與群集,但這些結果不應直接改寫正式知識圖。
應分成:
E = E a c c e p t e d ∪ E c a n d i d a t e . \mathcal E
=
\mathcal E_{\mathrm{accepted}}
\cup
\mathcal E_{\mathrm{candidate}}. E = E accepted ∪ E candidate .
候選跳躍邊、生成核或群集需經:
Propose → Verify → Accept/Reject . \operatorname{Propose}
\rightarrow
\operatorname{Verify}
\rightarrow
\operatorname{Accept/Reject}. Propose → Verify → Accept/Reject .
十四、失敗模式與治理邊界
14.1 過度分塊
系統返回大量局部正確但無法組合的片段。
治理:保留父區塊、章節作用域與跨區塊依賴。
14.2 邊界鎖死
早期錯誤切分被永久制度化。
治理:允許多粒度視圖與版本化重新分塊。
14.3 流式近期偏誤
新內容自動覆蓋舊內容的重要性。
治理:分離時間新近性、因果重要性與證據品質。
14.4 語義瞬移
高階詞彙相似造成跨域錯誤映射。
治理:每次跳躍保存理由、作用域與不相容條件。
14.5 發散爆炸
分支數量增長,但資訊增益下降。
治理:分支預算、重複檢測、邊際增益停止與人工閘門。
14.6 集中抹平
少數證據、反例與真正矛盾被「主題摘要」消失。
治理:顯式矛盾邊、矛盾保存率與少數證據配額。
14.7 自我強化索引漂移
系統依自己生成的群集建立新跳躍,再用新跳躍證明原群集合理。
治理:來源邊、候選邊與接受邊分區;禁止候選關係自我驗證。
14.8 權限穿越
高層社群摘要或圖統計洩漏不可見作品的存在與主題。
治理:所有聚合與跳躍必須在查詢主體可見子圖上執行:
G p = G [ U p ] . \mathcal G_p
=
\mathcal G[\mathcal U_p]. G p = G [ U p ] .
十五、與 GCMS 既有雙軌記憶架構的關係
上一篇建立:
G C M S = L o s s l e s s A r c h i v e + S e m a n t i c M e m o r y + E v i d e n c e B r i d g e . \mathrm{GCMS}
=
\mathrm{LosslessArchive}
+
\mathrm{SemanticMemory}
+
\mathrm{EvidenceBridge}. GCMS = LosslessArchive + SemanticMemory + EvidenceBridge .
本文進一步說明,語義記憶本身不能只是一個向量表,而應是:
S e m a n t i c M e m o r y = ( G , I , Π , T ) , \mathrm{SemanticMemory}
=
\left(
\mathcal G,
\mathfrak I,
\Pi,
\mathcal T
\right), SemanticMemory = ( G , I , Π , T ) ,
其中:
G \mathcal G G :統一知識底圖;
I \mathfrak I I :五類索引算子;
Π \Pi Π :後設控制器;
T \mathcal T T :可重演軌跡。
雙軌架構保證原文可以被驗證;多路徑索引則決定在何時、以何種幾何找到原文與語義結構。
完整形式為:
G C M S i n d e x = L o s s l e s s S o u r c e + M u l t i G r a n u l a r B l o c k s + T e m p o r a l F l o w s + G r a p h J u m p s + D i v e r g e n t S e a r c h + C o n v e r g e n t I n t e g r a t i o n + M e t a C o n t r o l + E v i d e n c e T r a c e . \boxed{
\begin{aligned}
\mathrm{GCMS}_{\mathrm{index}}
={}&
\mathrm{LosslessSource}\\
&+
\mathrm{MultiGranularBlocks}\\
&+
\mathrm{TemporalFlows}\\
&+
\mathrm{GraphJumps}\\
&+
\mathrm{DivergentSearch}\\
&+
\mathrm{ConvergentIntegration}\\
&+
\mathrm{MetaControl}\\
&+
\mathrm{EvidenceTrace}.
\end{aligned}
} GCMS index = LosslessSource + MultiGranularBlocks + TemporalFlows + GraphJumps + DivergentSearch + ConvergentIntegration + MetaControl + EvidenceTrace .
十六、結論
知識索引不是一個可以被單一相似度函數完全取代的問題。
不同任務要求不同尋址幾何:
區塊索引處理局部可操作性;
流式索引保存形成方向與狀態轉換;
跳躍索引跨越線性鄰接與表面術語;
發散索引擴大問題與證據空間;
集中索引恢復核心、證據與矛盾結構。
因此:
多路徑知識索引 ≠ 多個搜尋框並列 \boxed{
\text{多路徑知識索引}
\neq
\text{多個搜尋框並列}
} 多路徑知識索引 = 多個搜尋框並列
它是一套可組合的知識運算子,以及一個根據任務、不確定性、成本與治理限制選擇運算路徑的後設控制系統。
若這套理論成立,GCMS 未來不會只回答「最相關的文章是哪一篇」,而能回答:
該從哪一個局部證據開始;
該沿哪條時間與生成路徑回溯;
該跳到哪個遠距系列;
該展開哪些相互獨立的研究分支;
最後哪些內容可以合併,哪些矛盾必須保留。
這使索引從資料庫查詢提升為:
可驗證的知識路徑生成 \boxed{
\text{可驗證的知識路徑生成}
} 可驗證的知識路徑生成
而下一篇將在此基礎上處理更進一步的問題:當系統找到多個知識單元後,它如何不只重建既有作品,而是進行生成、組合與跨域再結構化。
參考文獻
[1] Chekaf, M., Cowan, N., & Mathy, F. (2016). Chunk Formation in Immediate Memory and How It Relates to Data Compression . Cognition, 155, 96–107.https://pmc.ncbi.nlm.nih.gov/articles/PMC4983232/
[2] Chen, Z., & Cowan, N. (2009). Core Verbal Working-Memory Capacity: The Limit in Words Retained Without Covert Articulation . Quarterly Journal of Experimental Psychology, 62(7), 1420–1429.https://pmc.ncbi.nlm.nih.gov/articles/PMC2693080/
[3] Bladon, J. H., et al. (2019). In a Temporally Segmented Experience Hippocampal Neurons Represent Temporally Drifting Context But Not Discrete Segments . Journal of Neuroscience.https://pubmed.ncbi.nlm.nih.gov/31253754/
[4] DuBrow, S., & Davachi, L. (2016). Temporal Binding Within and Across Events . Neurobiology of Learning and Memory, 134, 107–114.https://pubmed.ncbi.nlm.nih.gov/27422018/
[5] Lohnas, L. J., et al. (2023). Neural Temporal Context Reinstatement of Event Structure During Memory Recall . Communications Biology.https://pmc.ncbi.nlm.nih.gov/articles/PMC10293072/
[6] Malkov, Y. A., & Yashunin, D. A. (2020). Efficient and Robust Approximate Nearest Neighbor Search Using Hierarchical Navigable Small World Graphs . IEEE Transactions on Pattern Analysis and Machine Intelligence, 42(4), 824–836.https://arxiv.org/abs/1603.09320
[7] Hu, Y., et al. (2024). GRAG: Graph Retrieval-Augmented Generation .https://arxiv.org/abs/2405.16506
[8] Chen, W., et al. (2024). KG-Retriever: Efficient Knowledge Indexing for Retrieval-Augmented Large Language Models .https://arxiv.org/abs/2412.05547
[9] Edge, D., et al. (2024). From Local to Global: A Graph RAG Approach to Query-Focused Summarization .https://arxiv.org/abs/2404.16130
[10] Huang, Y., Zhang, S., & Xiao, X. (2025). KET-RAG: A Cost-Efficient Multi-Granular Indexing Framework for Graph-RAG .https://arxiv.org/abs/2502.09304
[11] Fang, Z., et al. (2021). A Query-Driven Topic Model . Findings of ACL-IJCNLP 2021.https://aclanthology.org/2021.findings-acl.154.pdf
[12] Liu, J., et al. (2026). Scaling Retrieval-Augmented Reasoning with Parallel Search and Explicit Merging .https://arxiv.org/html/2605.13534v1
[13] Jauk, E., Benedek, M., & Neubauer, A. C. (2012). Tackling Creativity at Its Roots: Evidence for Different Patterns of EEG Alpha Activity Related to Convergent and Divergent Modes of Task Processing . International Journal of Psychophysiology, 84(2), 219–225.https://pmc.ncbi.nlm.nih.gov/articles/PMC3343259/
[14] Liu, C., Lin, Y., Ye, C., Yang, J., & He, W. (2023). Alpha ERS-ERD Pattern During Divergent and Convergent Thinking Depends on Individual Differences on Metacontrol . Journal of Intelligence, 11(4), 74.https://pmc.ncbi.nlm.nih.gov/articles/PMC10144848/
[15] Zhao, Y., et al. (2025). E²GraphRAG: Streamlining Graph-Based RAG for High Efficiency and Effectiveness .https://arxiv.org/abs/2505.24226
系列銜接
上一篇:《無損保存與近無損語義重建:GCMS 的雙軌記憶架構》
下一篇:《知識不只被重建:生成、組合與跨域再結構化》