← Archive
lm-002116 · 2026-08

06_知識不只被重建_生成組合與跨域再結構化

下載 MD 檔 ⬇

知識不只被重建:生成、組合與跨域再結構化

系列:可繼承的認知:從自我解構到遞歸生成式記憶系統(第 6 篇)
作者:Neo.K
研究協作:Aletheia(阿萊)
版本:v1.0
日期:2026-07-30
文章類型:命題猜想論文/知識組合理論論文/GCMS 架構論文


摘要

記憶系統通常被理解為保存、索引與重建既有內容的工具。然而,當系統能從多個來源抽取生成核、映射關係、重組約束並建立新的問題空間時,它所執行的已不再只是回憶。本文提出 GCMS 的生成—組合—再結構化理論,區分四種容易被混為一談的運算:來源重建、受約束生成、知識組合與跨域再結構化。來源重建要求輸出可追溯至既有證據;受約束生成允許形成來源中未逐字出現的候選敘述;知識組合要求多個知識單元在型別、尺度、假設、版本與因果方向上完成顯式對齊;跨域再結構化則進一步改寫概念分類、關係圖與問題表示,使原先分離的領域能形成新的可檢驗模型。

本文將知識組合形式化為一個帶對齊映射、相容性約束、來源證據與新穎性評估的部分運算,而非任意文字拼接。若來源單元為 u1,,uku_1,\ldots,u_k ,組合算子不是無條件定義的 u1uku_1\oplus\cdots\oplus u_k ,而是:

Y=ComposeΘ(u1,,uk;Φ,Γ,E),Y = \operatorname{Compose}_{\Theta} \left( u_1,\ldots,u_k; \Phi,\Gamma,\mathcal E \right),

其中 Φ\Phi 為跨來源對齊映射, Γ\Gamma 為約束集合, E\mathcal E 為證據與來源鏈。只有當型別一致性、前提相容性、尺度可轉換性、版本可辨識性與矛盾處理條件成立時,組合才被視為有效候選。本文進一步提出「結構優先組合命題」:跨域組合的可遷移價值主要來自關係與生成程序的保留,而非表面詞彙或主題相似;「新穎性—可追溯性雙約束命題」:高品質生成必須同時提高相對來源的新穎性與對來源的可驗證依賴;以及「再結構化非保守命題」:真正的跨域創新可能改變原有分類與問題空間,因此不能被簡化為既有知識圖上的邊新增。

本文也分析七類失敗模式:語義拼貼、型別衝突、尺度錯置、類比過伸、來源洗白、矛盾抹平與遞歸自證。為避免生成內容污染記憶,本文主張 GCMS 必須把來源、候選、接受與棄用知識分區,並將每次生成或組合保存為可重演的運算軌跡。知識系統的目標不應只是產生看似連貫的新文本,而是建立可被證據反駁、可被版本比較、可被其他智能體重演的知識轉換。

關鍵詞:GCMS、知識生成、知識組合、跨域再結構化、概念組合、類比映射、概念融合、組合泛化、知識圖譜融合、本體對齊、證據鏈


一、問題的提出:找到知識之後,系統要做什麼?

上一篇建立了五類多路徑索引算子:

I={B,F,J,D,C},\mathfrak I = \{ \mathsf B, \mathsf F, \mathsf J, \mathsf D, \mathsf C \},

分別處理區塊、流式、跳躍、發散與集中尋址。

這套索引理論回答的是:

系統如何找到局部證據、演化路徑、遠距橋接、多條候選分支與全局生成核?

但當系統已找到多個相關知識單元後,仍有一個更困難的問題:

這些單元應被原樣返回、重新敘述、推導新命題、互相組合,還是用來重寫原本的問題空間?

設檢索取得的知識集合為:

Rq={u1,u2,,uk}.\mathcal R_q = \{ u_1,u_2,\ldots,u_k \}.

最保守的系統只返回:

qRq.q \mapsto \mathcal R_q.

摘要系統則產生:

qSummarize(Rq).q \mapsto \operatorname{Summarize} \left(\mathcal R_q\right).

然而,研究與創造性任務通常要求更高階的運算:

  1. 從多篇作品中重建共同生成核;
  2. 把一個領域的關係結構遷移到另一領域;
  3. 合併互補方法,形成新演算法或新實驗;
  4. 發現兩個理論其實使用不同詞彙描述相似結構;
  5. 發現兩個表面相似的理論在尺度或前提上不能合併;
  6. 將理論、產品與資料結構重新排列成新的研究計畫;
  7. 由既有知識形成來源中未逐字出現、但可被檢驗的新命題。

這些運算不能都被稱為「重建」。

若系統只是把來源中已存在的結論改寫,稱為生成會誇大其創新性;若系統產生了來源中沒有的新結論,稱為重建則會掩蓋推論責任。若系統把兩篇文件的句子拼在一起,稱為知識組合也會把表面流暢誤當結構有效。

因此本文先提出四分法:

Oknowledge={R,G,C,X},\mathfrak O_{\mathrm{knowledge}} = \{ \mathsf R, \mathsf G, \mathsf C, \mathsf X \},

其中:

  • R\mathsf R :重建(reconstruction);
  • G\mathsf G :生成(generation);
  • C\mathsf C :組合(composition);
  • X\mathsf X :再結構化(restructuring)。

本文主張:

知識不只被重建\boxed{ \text{知識不只被重建} }

但只有在來源、約束、型別與驗證被明確保存時,生成與組合才可能成為知識運算,而不是修辭性拼貼。


二、研究背景:組合不是把元素放在一起而已

2.1 組合性:整體意義取決於部分與結構

組合性原則通常被表述為:複雜表達式的意義由其組成部分的意義以及組合結構決定。[1]

若組成元素為:

a1,a2,,an,a_1,a_2,\ldots,a_n,

組合結構為:

σ,\sigma,

則整體意義可寫成:

μ(σ(a1,,an))=Fσ(μ(a1),,μ(an)).\mu \left( \sigma(a_1,\ldots,a_n) \right) = F_{\sigma} \left( \mu(a_1),\ldots,\mu(a_n) \right).

這個原則對 GCMS 的重要性在於:

相同元素+不同結構不同知識結果.\text{相同元素} + \text{不同結構} \Rightarrow \text{不同知識結果}.

例如,「理論 AA 支援理論 BB 」與「理論 BB 反駁理論 AA 」可能涉及相同兩個節點,卻具有完全不同的知識內容。若系統只聚合詞彙與段落,而忽略關係方向與作用域,就無法形成可靠的組合。

然而,本文不採用最強的完全組合主義。跨域創新有時會產生輸入領域中都沒有直接表示的新結構;語境、目的與背景知識也可能改變組合結果。因此本文採取較一般的形式:

μ(Y)=F(μ(u1),,μ(uk),Φ,Γ,q,B),\mu(Y) = F \left( \mu(u_1),\ldots,\mu(u_k), \Phi, \Gamma, q, \mathcal B \right),

其中:

  • Φ\Phi :來源之間的對齊;
  • Γ\Gamma :相容性與治理約束;
  • qq :當前任務;
  • B\mathcal B :背景知識與可用算子。

組合結果不只取決於元素,也取決於它們如何被映射、在哪個問題下被結合,以及哪些條件禁止某些組合。

2.2 類比與結構映射:跨域遷移的是關係,不只是屬性

Gentner 的結構映射理論主張,類比的重要部分是把基底領域中的關係系統映射到目標領域,而不是只比較物件的表面屬性;高階、系統性的關係通常比孤立特徵更有價值。[2][3][4]

設基底領域為:

Ds,\mathcal D_s,

目標領域為:

Dt.\mathcal D_t.

類比映射可表示為一個部分映射:

ϕ:DsDt,\phi: \mathcal D_s \rightharpoonup \mathcal D_t,

使某些關係近似保持:

Rs(x1,,xm)Rt(ϕ(x1),,ϕ(xm)).R_s(x_1,\ldots,x_m) \Rightarrow R_t \left( \phi(x_1),\ldots,\phi(x_m) \right).

這對 GCMS 的啟示是:

跨域組合不能以詞彙重疊作為唯一橋梁;真正可遷移的往往是因果、約束、遞歸、守恆、分層或轉換等關係結構。

例如,兩個領域都使用「流」這個詞,不代表它們可以直接組合;反之,兩個領域即使完全沒有共同詞彙,只要共享可對齊的狀態轉移與守恆結構,仍可能形成高價值橋接。

2.3 概念融合:新結構可能在組合空間中湧現

Fauconnier 與 Turner 的概念融合框架以多個輸入心理空間、一般空間與融合空間描述概念整合。其重點之一是:融合空間可能形成輸入空間中沒有逐項存在的 emergent structure,並透過組合、完成與展開產生新的推論。[5][6]

可將輸入空間寫成:

I1,I2,\mathcal I_1, \mathcal I_2,

一般結構為:

G0,\mathcal G_0,

融合空間為:

B.\mathcal B^\ast.

選擇性投影為:

π1:I1B,π2:I2B.\pi_1:\mathcal I_1\rightharpoonup\mathcal B^\ast, \qquad \pi_2:\mathcal I_2\rightharpoonup\mathcal B^\ast.

則:

Bπ1(I1)π2(I2),\mathcal B^\ast \neq \pi_1(\mathcal I_1) \cup \pi_2(\mathcal I_2),

因為融合空間還可能包含由輸入互動產生的新關係。

本文吸收這個洞見,但加入 GCMS 所需的證據治理:融合空間中的新結構必須被標記為候選,不能因為它在語言上自然就被宣稱為來源事實。

2.4 程式歸納與組合泛化:生成能力依賴可重用程序

Lake、Salakhutdinov 與 Tenenbaum 的 Bayesian Program Learning 研究將概念表示為可組合的生成程序,並顯示程序式表示可以支援由少量樣本進行概念學習與生成。[7]

在這類觀點下,概念不是只有靜態向量,而可能包含:

primitive+composition rule+stochastic variation.\text{primitive} + \text{composition rule} + \text{stochastic variation}.

然而,Lake 與 Baroni 的 SCAN 實驗也顯示,序列模型在某些訓練分布內可以成功混合已見片段,卻可能在要求系統性重組的新組合上失敗。[8] 後續研究則試圖同時取得神經模型的彈性與人類式系統性泛化。[9]

這些結果共同指出:

會產生新輸出具有可靠組合能力.\text{會產生新輸出} \neq \text{具有可靠組合能力}.

GCMS 若要進行生成與組合,必須評估系統能否把學到的生成規則重新作用於未見結構,而不是只依靠訓練分布中的表面片段近鄰。

2.5 關係歸納偏置與圖網路:組合需要顯式結構介面

Battaglia 等人主張,實體、關係與可重用規則所形成的關係歸納偏置,是組合泛化的重要基礎;圖網路提供了一種以節點、邊與全局狀態進行結構化更新的通用介面。[10]

對知識組合而言,這意味著組合不應只發生在文本層,而應作用於:

  • 實體與概念;
  • 關係與因果方向;
  • 局部規則;
  • 全局約束;
  • 來源與版本。

若組合只在字串層進行,系統很難判斷「相同名稱但不同實體」或「不同名稱但相同角色」;若有結構化圖表示,則可顯式檢查關係是否能被遷移與合成。

2.6 本體與實體對齊:跨知識庫組合首先是對齊問題

跨知識圖譜整合通常需要辨識不同圖中的等價、近似、包含或互斥實體。實體對齊研究指出,名稱與屬性相似不一定足夠,結構與本體資訊可以降低錯誤映射;OntoEA 進一步利用類別階層與類別互斥資訊避免不合理對齊。[11][12][13]

對 GCMS 而言,跨域組合至少需要區分:

,,,,,unresolved.\equiv, \subseteq, \supseteq, \approx, \perp, \text{unresolved}.

即:

  • 等價;
  • 子類或特例;
  • 上位類或一般化;
  • 近似但不可互換;
  • 互斥或型別不相容;
  • 尚未確定。

將所有高相似度節點視為等價,會使跨域組合從一開始就失真。


三、知識單元與組合介面

3.1 帶型別的知識單元

設知識單元為:

ui=(ci,τi,Γi,Λi,Vi,Ei,Pi),u_i = \left( c_i, \tau_i, \Gamma_i, \Lambda_i, V_i, E_i, P_i \right),

其中:

  • cic_i :內容或命題;
  • τi\tau_i :知識型別;
  • Γi\Gamma_i :前提與約束;
  • Λi\Lambda_i :尺度、單位、時間與作用域;
  • ViV_i :版本資訊;
  • EiE_i :來源證據;
  • PiP_i :生成或推導路徑。

型別集合可包含:

T={definition,observation,hypothesis,theorem,method,model,artifact,policy}.\mathcal T = \{ \text{definition}, \text{observation}, \text{hypothesis}, \text{theorem}, \text{method}, \text{model}, \text{artifact}, \text{policy} \}.

一個觀察不能在沒有額外推理時被當成普遍定律;一個命題猜想也不能因為與已證明定理相鄰就取得相同真值地位。

因此知識組合不是:

ci+cj,c_i+c_j,

而是:

(ci,τi,Γi,Λi,Ei)(cj,τj,Γj,Λj,Ej).\left(c_i,\tau_i,\Gamma_i,\Lambda_i,E_i\right) \oplus \left(c_j,\tau_j,\Gamma_j,\Lambda_j,E_j\right).

3.2 組合介面

定義組合介面:

Icomp=(Φ,Γ,Ω,E,Q),\mathcal I_{\mathrm{comp}} = \left( \Phi, \Gamma, \Omega, \mathcal E, \mathcal Q \right),

其中:

  • Φ\Phi :實體、關係、變數與角色對齊;
  • Γ\Gamma :相容性約束;
  • Ω\Omega :允許使用的組合算子;
  • E\mathcal E :證據與來源鏈;
  • Q\mathcal Q :待回答問題與評估目標。

組合算子定義為部分函數:

ComposeIcomp:UkY.\operatorname{Compose}_{\mathcal I_{\mathrm{comp}}}: \mathcal U^k \rightharpoonup \mathcal Y.

之所以是部分函數,是因為並非任何知識單元都可以被合法組合。

3.3 相容性條件

定義:

Compatible(u1,,uk)CtypeCpremiseCscaleCversionCcausalCgovernance.\operatorname{Compatible} \left( u_1,\ldots,u_k \right) \equiv C_{\mathrm{type}} \wedge C_{\mathrm{premise}} \wedge C_{\mathrm{scale}} \wedge C_{\mathrm{version}} \wedge C_{\mathrm{causal}} \wedge C_{\mathrm{governance}}.

其中:

  • CtypeC_{\mathrm{type}} :型別可以轉換或共同作用;
  • CpremiseC_{\mathrm{premise}} :前提不互相否定,或矛盾已被顯式處理;
  • CscaleC_{\mathrm{scale}} :尺度、單位與粒度可轉換;
  • CversionC_{\mathrm{version}} :版本差異已辨識;
  • CcausalC_{\mathrm{causal}} :因果方向未被倒置;
  • CgovernanceC_{\mathrm{governance}} :權限、授權與來源政策允許組合。

只有當:

Compatible(u1,,uk)=1,\operatorname{Compatible} \left( u_1,\ldots,u_k \right) =1,

組合才可以進入正式候選階段。

若相容性不成立,系統仍可建立「比較包」或「矛盾包」,但不能產生未標記的融合結論。


四、四類知識運算

4.1 重建算子 R\mathsf R

重建的目標是依據證據恢復既有內容或結構:

x^=R(E,S,q).\hat x = \mathsf R \left( \mathcal E, \mathcal S, q \right).

重建輸出應滿足:

Grounded(x^,E)θE.\operatorname{Grounded}(\hat x,\mathcal E) \geq \theta_E.

重建可以是:

  • 原文恢復;
  • 章節結構恢復;
  • 摘要與命題恢復;
  • 生成路徑恢復;
  • 版本差分恢復。

但重建不應偷偷加入來源中沒有的新前提。

4.2 生成算子 G\mathsf G

生成允許形成來源中未逐字存在的新候選:

y=G(q,Rq,Θ).y = \mathsf G \left( q, \mathcal R_q, \Theta \right).

生成的關鍵不是「新文字」,而是相對來源的新結構:

N(yRq)>0.N(y\mid\mathcal R_q) >0.

例如:

  • 從多篇文獻歸納共同命題;
  • 形成新的實驗預測;
  • 提出尚未存在的分類;
  • 把既有生成核作用於新問題;
  • 將既有方法改造成新演算法。

但生成物必須標註為:

candidate,\text{candidate},

而不是:

source fact.\text{source fact}.

4.3 組合算子 C\mathsf C

組合要求至少兩個可辨識來源共同參與:

y=C(u1,,uk;Φ,Γ).y = \mathsf C \left( u_1,\ldots,u_k; \Phi,\Gamma \right).

本文區分五種組合:

並置組合

只把多個來源放在同一結構中:

Cjuxtapose(u1,u2)={u1,u2}.\mathsf C_{\mathrm{juxtapose}} \left(u_1,u_2\right) = \{u_1,u_2\}.

這不是深層融合,但有助於比較。

補完組合

兩個來源提供互補部分:

Ccomplete(u1,u2)=y,\mathsf C_{\mathrm{complete}} \left(u_1,u_2\right) = y,

使:

Coverage(y)>Coverage(u1),Coverage(u2).\operatorname{Coverage}(y) > \operatorname{Coverage}(u_1), \operatorname{Coverage}(u_2).

模組組合

方法或元件經介面連接:

M2M1.M_2 \circ M_1.

此時必須檢查輸出型別是否符合下一模組輸入型別。

類比組合

將一個領域的關係系統遷移到另一領域:

ϕ:DsDt.\phi:\mathcal D_s\rightharpoonup\mathcal D_t.

融合組合

在對齊後形成輸入中沒有的 emergent structure:

yClosure({u1,,uk},Ωtrivial).y \notin \operatorname{Closure} \left( \{u_1,\ldots,u_k\}, \Omega_{\mathrm{trivial}} \right).

這是創新潛力最高、同時風險最大的組合形式。

4.4 再結構化算子 X\mathsf X

再結構化不只產生新命題,而是改變知識空間本身:

X:GtGt+1.\mathsf X: \mathcal G_t \mapsto \mathcal G_{t+1}.

變化可能包括:

  • 重定義節點型別;
  • 新增或刪除關係類別;
  • 將兩個系列視為同一生成核的投影;
  • 把原本的一個問題拆成多個不同問題;
  • 發現兩個不同領域共享更高階的抽象結構;
  • 將一套結果重新排列成方法論、產品架構或研究計畫。

若舊問題空間為:

Qt,\mathcal Q_t,

再結構化後可能得到:

Qt+1Qt.\mathcal Q_{t+1} \neq \mathcal Q_t.

因此:

再結構化在舊圖上多加幾條邊\boxed{ \text{再結構化} \neq \text{在舊圖上多加幾條邊} }

真正的再結構化可能改變什麼被視為節點、什麼被視為關係,以及什麼才是問題。


五、跨域對齊模型

5.1 對齊對象

設兩個領域知識圖為:

GA=(VA,EA,τA),\mathcal G_A = \left(V_A,E_A,\tau_A\right), GB=(VB,EB,τB).\mathcal G_B = \left(V_B,E_B,\tau_B\right).

對齊不只是節點映射:

ϕV:VAVB,\phi_V:V_A\rightharpoonup V_B,

也包括關係映射:

ϕE:EAEB,\phi_E:E_A\rightharpoonup E_B,

型別映射:

ϕτ:TATB,\phi_{\tau}:\mathcal T_A\rightharpoonup\mathcal T_B,

以及約束映射:

ϕΓ:ΓAΓB.\phi_{\Gamma}:\Gamma_A\rightharpoonup\Gamma_B.

完整對齊為:

Φ=(ϕV,ϕE,ϕτ,ϕΓ).\Phi = \left( \phi_V, \phi_E, \phi_{\tau}, \phi_{\Gamma} \right).

5.2 對齊信心

每一映射應保存信心與證據:

mj=(aj,bj,rj,pj,κj),m_j = \left( a_j,b_j,r_j,p_j,\kappa_j \right),

其中:

  • aja_j :來源元素;
  • bjb_j :目標元素;
  • rjr_j :等價、包含、近似、互斥等關係;
  • pjp_j :支持證據;
  • κj\kappa_j :信心。

不能只保存:

ajbj,a_j\approx b_j,

而沒有說明近似在哪個維度成立。

5.3 保結構與不保結構映射

若映射保持關係:

RA(x,y)RB(ϕ(x),ϕ(y)),R_A(x,y) \Rightarrow R_B \left( \phi(x),\phi(y) \right),

稱為保結構映射。

若只保持局部表面相似:

Sim(x,ϕ(x))θ,\operatorname{Sim}(x,\phi(x)) \geq\theta,

但關係不保持,則只能視為候選橋接。

本文定義結構保持率:

SPR(Φ)=#{eEA:ϕE(e) 成立}#{eEA:ϕE(e) 可評估}.\operatorname{SPR}(\Phi) = \frac{ \#\{ e\in E_A:\phi_E(e)\text{ 成立} \} }{ \#\{ e\in E_A:\phi_E(e)\text{ 可評估} \} }.

高詞彙相似但低 SPR\operatorname{SPR} 的映射,不應被用來支撐深層跨域推論。


六、知識組合的正式流程

6.1 步驟一:任務與作用域宣告

輸入:

q,Θq,q, \Theta_q,

其中 Θq\Theta_q 包含:

  • 目標輸出型別;
  • 可使用領域;
  • 可接受新穎度;
  • 必要證據門檻;
  • 權限與敏感度;
  • 最大發散與遞歸深度。

6.2 步驟二:多路徑檢索

使用上一篇的索引程式:

πq=(o1,,oT),otI.\pi_q = (o_1,\ldots,o_T), \qquad o_t\in\mathfrak I.

取得:

Rq={u1,,uk}.\mathcal R_q = \{u_1,\ldots,u_k\}.

6.3 步驟三:型別與來源正規化

建立:

u~i=Normalize(ui).\widetilde u_i = \operatorname{Normalize}(u_i).

正規化包括:

  • 單位與尺度;
  • 符號名稱;
  • 版本;
  • 真值狀態;
  • 作者與來源;
  • 時間作用域;
  • 定義域與適用邊界。

6.4 步驟四:候選對齊

產生多個候選映射:

A={Φ1,,Φm}.\mathcal A = \{ \Phi_1,\ldots,\Phi_m \}.

每個映射評估:

Salign=w1Sentity+w2Srelation+w3Stype+w4Sconstraintw5Pconflict.S_{\mathrm{align}} = w_1S_{\mathrm{entity}} + w_2S_{\mathrm{relation}} + w_3S_{\mathrm{type}} + w_4S_{\mathrm{constraint}} - w_5P_{\mathrm{conflict}}.

6.5 步驟五:相容性與矛盾分析

對候選集合計算:

Compatible(u1,,uk).\operatorname{Compatible} \left( u_1,\ldots,u_k \right).

矛盾不一定導致停止。系統可以選擇:

  • 排除衝突來源;
  • 分支組合;
  • 建立條件化結論;
  • 建立反例包;
  • 保留不可判定狀態。

若兩個命題為:

p¬p,p \qquad\text{與}\qquad \neg p,

合法處理可以是:

(pΓ1)(¬pΓ2),(p\mid\Gamma_1) \qquad\text{與}\qquad (\neg p\mid\Gamma_2),

而不是把二者平均成模糊敘述。

6.6 步驟六:產生候選組合

對每個有效映射與算子產生:

Yj=Compose(Rq,Φj,Ωj).Y_j = \operatorname{Compose} \left( \mathcal R_q, \Phi_j, \Omega_j \right).

6.7 步驟七:評估新穎性、保真與效用

定義候選分數:

U(Yj)=αNj+βFj+γTj+δVjλRjμCj,U(Y_j) = \alpha N_j + \beta F_j + \gamma T_j + \delta V_j - \lambda R_j - \mu C_j,

其中:

  • NjN_j :新穎性;
  • FjF_j :來源保真;
  • TjT_j :新任務遷移能力;
  • VjV_j :可驗證性;
  • RjR_j :治理與失真風險;
  • CjC_j :運算成本。

6.8 步驟八:證據化輸出

輸出不是只有正文,而是:

Yj=(Yj,Ej,Φj,Γj,Δj,Σj),\mathcal Y_j = \left( Y_j, \mathcal E_j, \Phi_j, \Gamma_j, \Delta_j, \Sigma_j \right),

其中:

  • YjY_j :候選內容;
  • Ej\mathcal E_j :來源證據;
  • Φj\Phi_j :對齊映射;
  • Γj\Gamma_j :假設與邊界;
  • Δj\Delta_j :相對來源新增的推論;
  • Σj\Sigma_j :未解決衝突與不確定性。

6.9 步驟九:治理寫回

候選先進入:

Mcandidate,\mathcal M_{\mathrm{candidate}},

只有經過驗證後才能進入:

Maccepted.\mathcal M_{\mathrm{accepted}}.

這為後續第 8 篇的三區治理建立前置形式。


七、核心命題與猜想

命題一:組合非拼接命題

設:

Concat(u1,u2)\operatorname{Concat}(u_1,u_2)

只保留內容並置,而:

Compose(u1,u2)\operatorname{Compose}(u_1,u_2)

保留對齊、型別、關係、約束與來源。

對需要跨來源推理的任務集合 QCQ_C ,本文預測:

EqQC[U(Compose(u1,u2))]>EqQC[U(Concat(u1,u2))].\mathbb E_{q\sim Q_C} \left[ U \left( \operatorname{Compose}(u_1,u_2) \right) \right] > \mathbb E_{q\sim Q_C} \left[ U \left( \operatorname{Concat}(u_1,u_2) \right) \right].

若兩者在控制文字長度與模型能力後沒有顯著差異,命題被削弱。

命題二:結構優先組合命題

對遠距跨域問題,基於關係結構的對齊,應比僅基於表面詞彙相似的對齊具有更高遷移效用:

Tstruct>Tlexical.T_{\mathrm{struct}} > T_{\mathrm{lexical}}.

該命題承接結構映射理論與關係歸納偏置,但在 GCMS 中要求實際以新問題表現檢驗。

命題三:新穎性—可追溯性雙約束命題

高品質知識生成不能只最大化新穎性:

maxN(Y).\max N(Y).

而應最佳化:

max(N(Y),FE(Y),V(Y)),\max \left( N(Y), F_E(Y), V(Y) \right),

其中 FEF_E 為證據保真, VV 為可驗證性。

若新穎性提高時證據與驗證能力快速坍縮,則系統只是提高不可控生成自由度。

命題四:型別約束增益命題

在混合定義、觀察、猜想、定理與方法的知識庫中,加入型別約束應降低錯誤真值提升:

FalseUpgradetyped<FalseUpgradeuntyped.\operatorname{FalseUpgrade}_{\mathrm{typed}} < \operatorname{FalseUpgrade}_{\mathrm{untyped}}.

所謂錯誤真值提升,是指系統把低證據狀態內容當成高證據狀態結論。

命題五:條件化矛盾保存命題

若兩個結論在不同前提下成立,顯式保存條件應比無條件融合得到更高準確度:

U((pΓ1),(¬pΓ2))>U(Average(p,¬p)).U \left( (p\mid\Gamma_1), (\neg p\mid\Gamma_2) \right) > U \left( \operatorname{Average}(p,\neg p) \right).

命題六:組合泛化命題

若系統真正學到可重用生成核與關係算子,則它在未見元素組合上的表現應高於只依靠表面近鄰的模型:

Perfnovel-compositionPerfmemorization.\operatorname{Perf}_{\mathrm{novel\text{-}composition}} \gg \operatorname{Perf}_{\mathrm{memorization}}.

此命題需要以分布外組合測試,而不是只在同分布文本生成上測量。

命題七:再結構化非保守命題

設原知識圖為:

Gt.\mathcal G_t.

若所有「創新」都只能表示為:

Gt+1=GtΔE,\mathcal G_{t+1} = \mathcal G_t \cup \Delta E,

即只新增邊而不改變節點與關係類型,則系統無法表達某些真正改變概念分類與問題邊界的創新。

因此存在任務,使:

Gt+1≇GtΔE.\mathcal G_{t+1} \not\cong \mathcal G_t \cup \Delta E.

猜想一:生成核傳輸猜想

若兩個領域共享較高階生成程序:

KAKB,K_A \cong K_B,

即使表面內容相似度低,將 KAK_A 遷移到領域 BB 仍可能提高新問題解決率。

猜想二:多階段組合支配猜想

相較於一次性端到端生成:

Y=G(q,Rq),Y = G(q,\mathcal R_q),

顯式執行:

對齊相容性生成驗證\text{對齊} \rightarrow \text{相容性} \rightarrow \text{生成} \rightarrow \text{驗證}

在高風險知識任務上應有較低錯誤率與較高可審計性。

猜想三:重組臨界點猜想

當跨域對齊的結構保持率與證據覆蓋率超過某個閾值時,組合結果的效用可能出現非線性躍升:

SPR(Φ)θS,FEθEU(Y) 急遽上升.\operatorname{SPR}(\Phi) \geq \theta_S, \qquad F_E \geq \theta_E \Rightarrow U(Y) \text{ 急遽上升}.

這與第 3 篇的提示相變概念相呼應,但作用於多來源組合而非單一記憶提取。


八、品質與風險指標

8.1 來源覆蓋率

SourceCoverage(Y)=可追溯主張數總主張數.\operatorname{SourceCoverage}(Y) = \frac{ \text{可追溯主張數} }{ \text{總主張數} }.

8.2 新增推論率

NovelInferenceRate(Y)=來源未逐字包含但由組合導出的主張總主張數.\operatorname{NovelInferenceRate}(Y) = \frac{ \text{來源未逐字包含但由組合導出的主張} }{ \text{總主張數} }.

8.3 映射正確率

MAPAcc(Φ)=經人工或黃金標準確認的映射全部映射.\operatorname{MAPAcc}(\Phi) = \frac{ \text{經人工或黃金標準確認的映射} }{ \text{全部映射} }.

8.4 型別保持率

TypePreservation(Y)=1型別提升或錯置數可評估主張數.\operatorname{TypePreservation}(Y) = 1- \frac{ \text{型別提升或錯置數} }{ \text{可評估主張數} }.

8.5 矛盾保存率

ConflictRetention(Y)=輸出中保留的關鍵矛盾來源中可辨識的關鍵矛盾.\operatorname{ConflictRetention}(Y) = \frac{ \text{輸出中保留的關鍵矛盾} }{ \text{來源中可辨識的關鍵矛盾} }.

8.6 組合新穎性

可用來源到輸出的最短描述差異近似:

N(Y)L(YRq,Ω),N(Y) \approx L(Y\mid\mathcal R_q,\Omega),

但必須避免把無意義噪音當成高新穎性。

8.7 組合效用

Ucomp=αT+βV+γFE+δNusefulλR.U_{\mathrm{comp}} = \alpha T + \beta V + \gamma F_E + \delta N_{\mathrm{useful}} - \lambda R.

8.8 結構改寫幅度

RestructureDistance(Gt,Gt+1)=αdV+βdE+γdτ+δdQ.\operatorname{RestructureDistance} \left( \mathcal G_t,\mathcal G_{t+1} \right) = \alpha d_V + \beta d_E + \gamma d_{\tau} + \delta d_Q.

其中:

  • dVd_V :節點集合變化;
  • dEd_E :關係變化;
  • dτd_{\tau} :型別系統變化;
  • dQd_Q :問題空間變化。

九、實驗設計與可否證條件

9.1 拼接、摘要、組合三組比較

建立三種系統:

  1. 文字拼接;
  2. 一般摘要或端到端生成;
  3. 顯式對齊、相容性與證據化組合。

任務包括:

  • 找出跨文獻共同機制;
  • 合併兩個互補方法;
  • 判斷兩個理論能否組合;
  • 產生可檢驗的新預測。

若第三組在正確率、來源可追溯性與新問題遷移上無顯著優勢,組合框架需被修正。

9.2 表面相似與結構相似對照

建立:

  • 高詞彙相似、低關係同構對;
  • 低詞彙相似、高關係同構對。

檢驗系統是否偏好錯誤的表面橋接。

9.3 未見組合測試

訓練或建庫時只呈現部分元素—操作組合,測試時要求未見重組:

(a,ω1),(b,ω2)(a,ω2).(a,\omega_1), (b,\omega_2) \Rightarrow (a,\omega_2).

若系統只能在已見組合上表現良好,則不具可靠組合泛化。

9.4 型別消融

移除:

  • 命題型別;
  • 真值狀態;
  • 版本;
  • 尺度;
  • 來源。

測量錯誤真值提升與錯誤組合率。

9.5 矛盾保存測試

建立來源內含:

pΓ1,¬pΓ2.p\mid\Gamma_1, \qquad \neg p\mid\Gamma_2.

觀察系統能否保留條件差異,而不是輸出模糊平均。

9.6 再結構化人工評審

由跨領域專家評估:

  • 是否形成新但有用的分類;
  • 是否改變問題表示;
  • 是否只是重新命名;
  • 是否保留來源與反例;
  • 是否提出可被實驗否證的結果。

9.7 長期遞歸污染測試

將候選組合在多輪後重新作為輸入,測量:

Drift(t),SourceLoss(t),SelfCitation(t).\operatorname{Drift}(t), \qquad \operatorname{SourceLoss}(t), \qquad \operatorname{SelfCitation}(t).

若生成物逐輪失去原始來源,或主要依靠先前生成物互相支持,則自主循環不可進入正式記憶。


十、工程架構:GCMS Composition Runtime

10.1 核心元件

未來 GCMS 組合運行時可分為:

  1. Retriever:多路徑檢索;
  2. Normalizer:型別、尺度與版本正規化;
  3. Aligner:實體、關係與約束對齊;
  4. Compatibility Engine:相容性與衝突檢查;
  5. Composer:產生組合候選;
  6. Restructurer:產生圖與問題空間改寫候選;
  7. Verifier:證據、邏輯與實驗驗證;
  8. Memory Governor:候選、接受與棄用治理;
  9. Trace Store:保存可重演運算軌跡。

形式上:

RqNormalizeR~qAlignAqCheckAqComposeYqVerifyY~q.\mathcal R_q \xrightarrow{\mathrm{Normalize}} \widetilde{\mathcal R}_q \xrightarrow{\mathrm{Align}} \mathcal A_q \xrightarrow{\mathrm{Check}} \mathcal A_q^\ast \xrightarrow{\mathrm{Compose}} \mathcal Y_q \xrightarrow{\mathrm{Verify}} \widetilde{\mathcal Y}_q.

10.2 組合軌跡

每次運算應保存:

TC=(q,Rq,Φ,Γ,Ω,Y,E,Σ,Decision).\mathcal T_C = \left( q, \mathcal R_q, \Phi, \Gamma, \Omega, Y, \mathcal E, \Sigma, \operatorname{Decision} \right).

這使其他智能體可以回答:

  • 哪些來源被使用?
  • 哪些元素被對齊?
  • 哪些來源被排除?
  • 哪些主張是新推論?
  • 哪些矛盾尚未解決?
  • 為什麼候選被接受或拒絕?

10.3 候選分區

組合輸出至少分為:

Y=YreconstructedYgeneratedYcomposedYrestructured.\mathcal Y = \mathcal Y_{\mathrm{reconstructed}} \cup \mathcal Y_{\mathrm{generated}} \cup \mathcal Y_{\mathrm{composed}} \cup \mathcal Y_{\mathrm{restructured}}.

不同類型使用不同審核門檻。重建只需來源保真;再結構化則需要更高層的專家、實驗或長期驗證。

10.4 可用算子登錄

組合算子應版本化:

Ω={ω1(v1),ω2(v2),}.\Omega = \{ \omega_1^{(v_1)}, \omega_2^{(v_2)}, \ldots \}.

例如:

  • 類比映射;
  • 模組串接;
  • 變數替換;
  • 尺度轉換;
  • 因果圖合併;
  • 生成核抽取;
  • 本體橋接;
  • 矛盾分支;
  • 抽象化與具體化。

算子本身也是可審計知識,而不是隱藏提示詞。


十一、三個示意案例

11.1 方法—方法組合

來源 u1u_1 提供高召回檢索方法:

MR.M_R.

來源 u2u_2 提供高精度證據驗證方法:

MV.M_V.

若介面型別相容:

OutputType(MR)=InputType(MV),\operatorname{OutputType}(M_R) = \operatorname{InputType}(M_V),

則可形成:

M=MVMR.M = M_V\circ M_R.

但若 MVM_V 假設輸入已去重,而 MRM_R 返回大量重複候選,就需要額外中介模組:

M=MVMDMR.M = M_V\circ M_D\circ M_R.

這顯示組合不是簡單把兩個方法同時提到,而是建立可執行介面。

11.2 跨域類比組合

來源領域 AA 有:

狀態轉換守恆檢查.\text{狀態} \rightarrow \text{轉換} \rightarrow \text{守恆檢查}.

目標領域 BB 有:

知識版本編輯操作來源一致性檢查.\text{知識版本} \rightarrow \text{編輯操作} \rightarrow \text{來源一致性檢查}.

若建立映射:

ϕ(狀態)=知識版本,\phi(\text{狀態}) = \text{知識版本}, ϕ(轉換)=編輯操作,\phi(\text{轉換}) = \text{編輯操作}, ϕ(守恆)=證據不變量,\phi(\text{守恆}) = \text{證據不變量},

則可形成「知識版本守恆」候選框架。

但這仍是類比,不是物理守恆定律的直接轉移。系統必須標記哪些關係被保留,哪些只是啟發式。

11.3 系列再結構化

假設知識庫原本依網站、年份與檔案分類:

Gt.\mathcal G_t.

經生成核與關係分析後,系統發現多個系列共享:

  • 相同母問題;
  • 相同遞歸算子;
  • 不同尺度實作;
  • 相似驗證模式。

系統提出新結構:

Gt+1=Regroup(Gt,Kgen,Ebridge).\mathcal G_{t+1} = \operatorname{Regroup} \left( \mathcal G_t, \mathcal K_{\mathrm{gen}}, \mathcal E_{\mathrm{bridge}} \right).

這不刪除舊分類,而是建立一個新的可驗證投影。如此一來,歷史檔案結構與理論結構可以共存。


十二、失敗模式與治理邊界

12.1 語義拼貼

系統把多個相關段落組成流暢文本,卻沒有真正對齊其前提與關係。

治理:強制輸出對齊映射與新增推論清單。

12.2 型別衝突

把觀察、猜想或設計提案提升為已證明事實。

治理:型別檢查、真值狀態與證據門檻。

12.3 尺度錯置

微觀模型被直接套用到宏觀層次,或局部案例被宣稱為普遍規律。

治理:保存尺度、單位、時間窗與作用域;要求顯式尺度轉換。

12.4 類比過伸

來源與目標只有局部關係相似,系統卻把所有屬性一起遷移。

治理:區分保結構關係與未映射屬性,保存映射覆蓋率。

12.5 來源洗白

生成物多輪改寫後,來源、作者、版本與推論責任消失。

治理:每個主張保留 provenance graph,不允許候選內容覆蓋來源。

12.6 矛盾抹平

集中與組合把少數反例轉成模糊平均。

治理:顯式矛盾邊、條件化結論與衝突保存率。

12.7 版本錯配

舊版方法與新版假設被無標記混合。

治理:版本相容矩陣與時間作用域檢查。

12.8 權限穿越

組合結果洩漏不可見來源的存在、主題或結論。

治理:所有對齊、聚合與生成只作用於主體可見子圖:

Gp=G[Up].\mathcal G_p = \mathcal G[\mathcal U_p].

12.9 遞歸自證

系統使用自己生成的候選支持下一輪候選,再回頭宣稱來源已充分。

治理:來源邊、候選邊與接受邊分層;候選不能獨立證明自身。

12.10 創新權與代表權混淆

系統以某人的知識結構生成新內容後,宣稱該內容代表原作者立場。

治理:

由某認知結構生成由原主體主張.\text{由某認知結構生成} \neq \text{由原主體主張}.

衍生內容必須有獨立作者、版本與責任標示。


十三、與認知繼承的關係

本系列第 1、2 篇提出:可以被外部化與繼承的,不是完整人格,而是受限的生成結構、問題模式、操作程序與驗證規則。

本文進一步指出,真正的認知繼承不能只讓接收智能體「找到原作者寫過什麼」,還必須讓它知道:

  • 哪些生成核可以重新作用;
  • 哪些關係可以跨域遷移;
  • 哪些知識單元可以安全組合;
  • 哪些矛盾不能抹平;
  • 哪些新結論只是候選;
  • 何時需要改寫問題空間,而不是繼續在舊分類中搜尋。

因此可繼承認知不只包含:

Mmemory,\mathcal M_{\mathrm{memory}},

也包含:

Otransform,\mathcal O_{\mathrm{transform}},

即對知識進行合法轉換的算子集合。

完整形式為:

Cinherit=(M,G,K,O,V,P),\mathcal C_{\mathrm{inherit}} = \left( \mathcal M, \mathcal G, \mathcal K, \mathcal O, \mathcal V, \mathcal P \right),

其中:

  • M\mathcal M :記憶內容;
  • G\mathcal G :關係圖;
  • K\mathcal K :生成核;
  • O\mathcal O :生成、組合與轉換算子;
  • V\mathcal V :驗證規則;
  • P\mathcal P :權限與治理政策。

這使認知繼承從文件閱讀提升為:

受治理的知識變換能力繼承\boxed{ \text{受治理的知識變換能力繼承} }

十四、與 GCMS 雙軌記憶及多路徑索引的整合

第 4 篇建立:

GCMS=LosslessArchive+SemanticMemory+EvidenceBridge.\mathrm{GCMS} = \mathrm{LosslessArchive} + \mathrm{SemanticMemory} + \mathrm{EvidenceBridge}.

第 5 篇建立:

SemanticMemory=(G,I,Π,T).\mathrm{SemanticMemory} = \left( \mathcal G, \mathfrak I, \Pi, \mathcal T \right).

本文再加入:

Oknowledge={R,G,C,X}.\mathfrak O_{\mathrm{knowledge}} = \{ \mathsf R, \mathsf G, \mathsf C, \mathsf X \}.

因此目前 GCMS 的理論結構可寫成:

GCMScognitive=LosslessArchive+SemanticCompression+MultiPathIndex+EvidenceBridge+KnowledgeGeneration+ConstrainedComposition+CrossDomainRestructuring+GovernanceTrace.\boxed{ \begin{aligned} \mathrm{GCMS}_{\mathrm{cognitive}} ={}& \mathrm{LosslessArchive}\\ &+ \mathrm{SemanticCompression}\\ &+ \mathrm{MultiPathIndex}\\ &+ \mathrm{EvidenceBridge}\\ &+ \mathrm{KnowledgeGeneration}\\ &+ \mathrm{ConstrainedComposition}\\ &+ \mathrm{CrossDomainRestructuring}\\ &+ \mathrm{GovernanceTrace}. \end{aligned} }

資料流為:

qIndexRqAlignAqComposeYqVerifyY~qGovernMt+1.q \xrightarrow{\mathrm{Index}} \mathcal R_q \xrightarrow{\mathrm{Align}} \mathcal A_q \xrightarrow{\mathrm{Compose}} \mathcal Y_q \xrightarrow{\mathrm{Verify}} \widetilde{\mathcal Y}_q \xrightarrow{\mathrm{Govern}} \mathcal M_{t+1}.

但最後一步尚不能自動執行。因為一旦系統能主動決定何時喚起記憶、發散、組合與重新寫回,就進入下一階段:自調用記憶與遞歸循環。


十五、結論

知識重建的目標,是讓既有內容重新可用;知識生成的目標,是形成來源中未逐字存在的新候選;知識組合的目標,是在多來源之間建立合法對齊、相容性與新結構;跨域再結構化的目標,則是改變原本的概念分類、關係圖與問題空間。

因此:

RGCX.\mathsf R \neq \mathsf G \neq \mathsf C \neq \mathsf X.

一個可靠的 GCMS 不能把這四種運算混成同一個「回答生成」步驟。

本文的核心主張是:

知識組合=對齊+約束+生成+證據+治理\boxed{ \text{知識組合} = \text{對齊} + \text{約束} + \text{生成} + \text{證據} + \text{治理} }

其中任何一項缺失,都可能使組合退化為:

  • 流暢拼貼;
  • 錯誤類比;
  • 尺度錯置;
  • 真值提升;
  • 矛盾抹平;
  • 來源洗白;
  • 遞歸自證。

如果本文命題成立,GCMS 的未來就不只是重現一個知識體系,而是能在證據約束下:

  • 重建既有內容;
  • 重新作用生成核;
  • 對齊遠距領域;
  • 組合互補方法;
  • 形成可檢驗的新命題;
  • 重新排列整個研究空間。

這使 GCMS 從記憶系統向認知運行時推進一步:

記憶索引組合知識狀態轉換\boxed{ \text{記憶} \rightarrow \text{索引} \rightarrow \text{組合} \rightarrow \text{知識狀態轉換} }

下一篇將處理一個更關鍵的控制問題:知識系統不應每次都被外部查詢動作喚起。它在什麼情況下應主動發現不確定性、證據缺口、矛盾或未完成任務,並自我調用記憶與索引系統?


參考文獻

[1] Pickel, B., & Rabern, B. (2024). Compositionality. Stanford Encyclopedia of Philosophy.
https://plato.stanford.edu/entries/compositionality/

[2] Gentner, D. (1983). Structure-Mapping: A Theoretical Framework for Analogy. Cognitive Science, 7(2), 155–170.
https://onlinelibrary.wiley.com/doi/abs/10.1207/s15516709cog0702_3

[3] Gentner, D., & Markman, A. B. (1997). Structure Mapping in Analogy and Similarity. American Psychologist, 52(1), 45–56.
https://groups.psych.northwestern.edu/gentner/papers/GentnerMarkman97.pdf

[4] Markman, A. B., & Gentner, D. (2000). Structure Mapping in the Comparison Process. American Journal of Psychology, 113(4), 501–538.
https://groups.psych.northwestern.edu/gentner/papers/MarkmanGentner00.pdf

[5] Fauconnier, G., & Turner, M. (2003). Conceptual Blending, Form and Meaning. Recherches en Communication, 19, 57–86.
https://tecfa.unige.ch/tecfa/maltt/cofor-1/textes/Fauconnier-Turner03.pdf

[6] Fauconnier, G., & Turner, M. (2003). Polysemy and Conceptual Blending. In B. Nerlich et al. (Eds.), Polysemy: Flexible Patterns of Meaning in Mind and Language.
https://pages.ucsd.edu/~scoulson/203/turner-polysemy.pdf

[7] Lake, B. M., Salakhutdinov, R., & Tenenbaum, J. B. (2015). Human-Level Concept Learning Through Probabilistic Program Induction. Science, 350(6266), 1332–1338.
https://pubmed.ncbi.nlm.nih.gov/26659050/

[8] Lake, B. M., & Baroni, M. (2018). Generalization Without Systematicity: On the Compositional Skills of Sequence-to-Sequence Recurrent Networks. Proceedings of ICML, PMLR 80, 2873–2882.
https://proceedings.mlr.press/v80/lake18a.html

[9] Lake, B. M., & Baroni, M. (2023). Human-Like Systematic Generalization Through a Meta-Learning Neural Network. Nature, 623, 115–121.
https://www.nature.com/articles/s41586-023-06668-3

[10] Battaglia, P. W., et al. (2018). Relational Inductive Biases, Deep Learning, and Graph Networks.
https://arxiv.org/abs/1806.01261

[11] Zeng, K., et al. (2021). A Comprehensive Survey of Entity Alignment for Knowledge Graphs. AI Open, 2, 1–13.
https://www.sciencedirect.com/science/article/pii/S2666651021000036

[12] Xiang, Y., Zhang, Z., Chen, J., Chen, X., Lin, Z., & Zheng, Y. (2021). OntoEA: Ontology-Guided Entity Alignment via Joint Knowledge Graph Embedding. Findings of ACL-IJCNLP 2021.
https://aclanthology.org/2021.findings-acl.96.pdf

[13] Teymurova, S., et al. (2024). OWL2Vec4OA: Tailoring Knowledge Graph Embeddings for Ontology Alignment.
https://ernestojimenezruiz.github.io/assets/pdf/owl2vec4oa-2024.pdf

[14] Bechberger, L., & Kühnberger, K.-U. (2018). A Comprehensive Implementation of Conceptual Spaces.
https://ceur-ws.org/Vol-2090/paper4.pdf

[15] Warglien, M., & Gärdenfors, P. (2013). Semantics, Conceptual Spaces and the Meeting of Minds. Synthese, 190, 2165–2193.
https://www.blutner.de/NeuralNets/Texts/Warglien-Gardenfors.pdf


系列銜接

上一篇:《多路徑知識索引:區塊、流式、跳躍、發散與集中》

下一篇:《自調用記憶:知識系統何時應該主動喚起自身?》