← Archive
lm-003353 · 2026-09

自然語言精細化的矩陣表示

下載 MD 檔 ⬇

自然語言精細化的矩陣表示

從條件投影、判準映射到低秩收斂

系列: 自然語言無界精細化與收斂系列
Paper: 07 / 08
作者: Neo.K
AI 協作整理: GPT-5.6 Sol
機構: EveMissLab/一言諾科技有限公司
版本: v0.1
日期: 2026-08-20
類型: 形式語義/矩陣模型/語義動力學/表示壓縮


摘要

本文將前六篇的自然語言精細化模型轉換為一套可計算矩陣接口。目的不是宣稱「語義本體就是矩陣」,而是讓狀態、條件、判準、比較、作用、反饋、情境、遞迴與收斂具有明確維度。

令:

XtRn×p\mathbf X_t\in\mathbb R^{n\times p}

為案例狀態矩陣,

CtRp×p\mathbf C_t\in\mathbb R^{p\times p}

為條件投影,

Jt:Rn×pRn×r\mathcal J_t: \mathbb R^{n\times p} \rightarrow \mathbb R^{n\times r}

為判準映射,

Lt{1,0,1}m×n\mathbf L_t\in\{-1,0,1\}^{m\times n}

為有向比較矩陣,

AtRr×q\mathbf A_t\in\mathbb R^{r\times q}

為作用矩陣。

定義:

Qt=Jt(XtCt),\mathbf Q_t = \mathcal J_t( \mathbf X_t\mathbf C_t ), Kt=LtQt,\mathbf K_t = \mathbf L_t\mathbf Q_t, Et=KtAt.\mathbf E_t = \mathbf K_t\mathbf A_t.

再以:

ρ:Rm×qR0m\rho: \mathbb R^{m\times q} \rightarrow \mathbb R_{\ge0}^{m}

得到:

bt=ρ(Et).\boxed{ \mathbf b_t = \rho(\mathbf E_t). }

其中 bt\mathbf b_t 表示在目前條件、判準與作用通道下的有效差異強度,而不是先驗二值分類。

本文進一步加入維度一致的動態回寫:

Xt+1=Xt+ηLtEtWt,\boxed{ \mathbf X_{t+1} = \mathbf X_t + \eta \mathbf L_t^\top \mathbf E_t \mathbf W_t, }

其中:

WtRq×p.\mathbf W_t\in\mathbb R^{q\times p}.

跨輪語義歷史則由:

StRN×dt\mathbf S_t\in\mathbb R^{N\times d_t}

表示。新增語義欄、effective rank、低秩 rebase、task-preserving reconstruction 與判別損失共同構成本系列的矩陣化收斂條件。


1. 矩陣化的目標

前六篇已得到:

Δ,C,J,A,\Delta, \quad C, \quad J, \quad A,

以及:

Expand,Compress,Recursion.\mathrm{Expand}, \quad \mathrm{Compress}, \quad \mathrm{Recursion}.

矩陣化的目的不是增加裝飾性公式,而是解決三個問題:

  1. 變數維度必須明確;
  2. 「新增語義」與「重新表示舊語義」必須可以比較;
  3. 收斂後是否仍保留歷史判別能力,必須可以回測。

因此:

Matrix formalization=a computational interface,\boxed{ \text{Matrix formalization} = \text{a computational interface}, }

而不是:

semantic ontology.\boxed{ \text{semantic ontology}. }

2. 與既有向量語義的邊界

向量空間與矩陣方法長期存在於 distributional semantics。Compositional distributional semantics 也已研究如何將詞向量與語法結構組合成句子意義。

因此本文不提出「語言可以用線性代數表示」為新發現。本文的新位置是:把本系列的精細化歷史、判別增益、反饋與收斂統一進同一矩陣更新框架。

3. 狀態與條件投影

令:

Xt=[x1xn]Rn×p.\mathbf X_t = \begin{bmatrix} \mathbf x_1\\ \vdots\\ \mathbf x_n \end{bmatrix} \in \mathbb R^{n\times p}.

每列是一個案例,每欄是一個工作特徵。

條件投影:

X~t=XtCt.\boxed{ \widetilde{\mathbf X}_t = \mathbf X_t\mathbf C_t. }

最簡單的 Ct\mathbf C_t 可以是對角權重矩陣;更一般時可重新混合特徵。

這是 Parametric Expansion 的主要矩陣接口。

4. 判準映射

條件投影後,仍未產生判斷。

定義:

Qt=Jt(X~t)Rn×r.\boxed{ \mathbf Q_t = \mathcal J_t( \widetilde{\mathbf X}_t ) \in \mathbb R^{n\times r}. }

Jt\mathcal J_t 可以是線性、閾值、非線性分類器、規則系統或邏輯映射。本文不要求其線性。

5. 比較矩陣

定義:

Lt{1,0,1}m×n.\boxed{ \mathbf L_t \in \{-1,0,1\}^{m\times n}. }

每列表示一組有向案例比較。

因此:

Kt=LtQtRm×r.\boxed{ \mathbf K_t = \mathbf L_t\mathbf Q_t \in \mathbb R^{m\times r}. }

這使「差異」明確依附於案例對與判準維度。

6. 作用矩陣與有效差異

令:

AtRr×q.\boxed{ \mathbf A_t \in \mathbb R^{r\times q}. }

則:

Et=KtAtRm×q.\boxed{ \mathbf E_t = \mathbf K_t\mathbf A_t \in \mathbb R^{m\times q}. }

即使:

Kt0,\mathbf K_t\neq0,

仍可能:

Et=0.\mathbf E_t=0.

所以:

判準差異存在⇏當前任務上的有效作用差異存在.\boxed{ \text{判準差異存在} \not\Rightarrow \text{當前任務上的有效作用差異存在}. }

7. 有效強度與二值化

定義:

bt,i=Et,i:2.\boxed{ b_{t,i} = \left\| \mathbf E_{t,i:} \right\|_2. }

整體:

bt=ρ(Et).\boxed{ \mathbf b_t = \rho( \mathbf E_t ). }

若任務需要二值結果,再定義:

b^t,i=I[bt,i>τ].\widehat b_{t,i} = \mathbb I[ b_{t,i}>\tau ].

因此二值分類只是後續投影。

8. 方向不對稱

因為 Lt\mathbf L_t 可保存方向,

bijb_{i\rightarrow j}

不必等於:

bji.b_{j\rightarrow i}.

因此可以有:

BB.\boxed{ \mathbf B \neq \mathbf B^\top. }

可用於單向門、權限流、非對稱可達與有向因果。

9. 動態回寫

若要讓判準結果反過來改變狀態,必須加入:

WtRq×p.\boxed{ \mathbf W_t \in \mathbb R^{q\times p}. }

定義:

Xt+1=Xt+ηLtEtWt.\boxed{ \mathbf X_{t+1} = \mathbf X_t + \eta \mathbf L_t^\top \mathbf E_t \mathbf W_t. }

維度為:

(n×m)(m×q)(q×p)=n×p.(n\times m) (m\times q) (q\times p) = n\times p.

這正式化:

ΔtBtΔt+1.\boxed{ \Delta_t \rightarrow B_t \rightarrow \Delta_{t+1}. }

10. 正負反饋

令:

Dt=LtXtCt.\mathbf D_t = \mathbf L_t \mathbf X_t \mathbf C_t.

若:

Dt+1F>DtF,\| \mathbf D_{t+1} \|_F > \| \mathbf D_t \|_F,

則差異被放大。

若:

Dt+1F<DtF,\| \mathbf D_{t+1} \|_F < \| \mathbf D_t \|_F,

則差異被削弱。

線性近似下還可以研究轉移矩陣的 spectral radius。

11. 情境索引

對情境 ω\omega 定義:

Xt(ω),Ct(ω),Jt(ω).\mathbf X_t^{(\omega)}, \quad \mathbf C_t^{(\omega)}, \quad \mathcal J_t^{(\omega)}.

得到:

bt(ω)=ρ(LtJt(ω)(Xt(ω)Ct(ω))At(ω)).\boxed{ \mathbf b_t^{(\omega)} = \rho \left( \mathbf L_t \mathcal J_t^{(\omega)} ( \mathbf X_t^{(\omega)} \mathbf C_t^{(\omega)} ) \mathbf A_t^{(\omega)} \right). }

因此「當前弱邊界」與「另一可能狀態下的強邊界」可以分離。

12. 遞迴 Lift

上一層輸出可以成為下一層輸入。

定義:

Φk:Rmk×qkRnk+1×pk+1.\boxed{ \Phi_k: \mathbb R^{m_k\times q_k} \rightarrow \mathbb R^{n_{k+1}\times p_{k+1}}. }

以及:

X(k+1)=Φk(E(k)).\boxed{ \mathbf X^{(k+1)} = \Phi_k( \mathbf E^{(k)} ). }

因此:

X(0)E(0)X(1)E(1).\mathbf X^{(0)} \rightarrow \mathbf E^{(0)} \rightarrow \mathbf X^{(1)} \rightarrow \mathbf E^{(1)} \rightarrow \cdots.

不要求每層維度相同。

13. 遞迴不自動等於增益

若新增一層只是在可逆地重命名前一層,則:

Gaink=0.\mathrm{Gain}_k=0.

只有當新 lift 真正改善歷史案例判別時,才算 Structural Expansion。

所以:

formal depthsemantic gain.\boxed{ \text{formal depth} \neq \text{semantic gain}. }

14. 跨輪語義矩陣

對整個 refinement history,定義:

StRN×dt.\boxed{ \mathbf S_t \in \mathbb R^{N\times d_t}. }

每列是一個保留案例,每欄是一個目前有效語義座標。

dtd_t 可以隨輪次改變。

15. 新語義欄與 Rank

候選新語義:

zRN.\mathbf z \in \mathbb R^N.

加入:

St=[Stz].\boxed{ \mathbf S_t' = \begin{bmatrix} \mathbf S_t&\mathbf z \end{bmatrix}. }

若:

rank(St)>rank(St),\operatorname{rank}( \mathbf S_t' ) > \operatorname{rank}( \mathbf S_t ),

則新欄至少在線性模型中增加新的獨立方向。

但 rank 只是一個診斷量,不是完整語義新穎性定理。

16. Rank 不變仍可能有價值

若:

zspan(St),\mathbf z \in \operatorname{span}( \mathbf S_t ),

則:

Δrank=0.\Delta \mathrm{rank}=0.

但如果新表示降低重複表達成本,仍可有:

VC>0.V_C>0.

所以:

V(z)=VD(z)+VC(z).\boxed{ V(\mathbf z) = V_D(\mathbf z) + V_C(\mathbf z). }

17. 歷史判別損失

定義歷史比較矩陣:

RH{1,0,1}M×N.\boxed{ \mathbf R_H \in \{-1,0,1\}^{M\times N}. }

TH\mathbf T_H 為目標判別結構, Ψ\Psi 為任務 decoder。

定義:

LD(S)=1MΨ(RHS)THF2.\boxed{ \mathcal L_D( \mathbf S ) = \frac{1}{M} \left\| \Psi( \mathbf R_H\mathbf S ) - \mathbf T_H \right\|_F^2. }

因此:

EDGt=LD(St)LD(St+1).\boxed{ EDG_t = \mathcal L_D( \mathbf S_t ) - \mathcal L_D( \mathbf S_{t+1} ). }

EDGt>0EDG_t>0 才表示新表示在目前歷史壓力基底上帶來有效改善。

18. Effective Rank

精確 rank 對小噪聲敏感,因此定義:

rϵ(S)=min{r:i>rσi2iσi2ϵ}.\boxed{ r_\epsilon( \mathbf S ) = \min \left\{ r: \frac{ \sum_{i>r}\sigma_i^2 }{ \sum_i\sigma_i^2 } \le \epsilon \right\}. }

若大量新增欄位後 rϵr_\epsilon 幾乎不變,可能表示新內容主要落在既有低維結構中。

但仍需配合 EDGtEDG_t 判定。

19. Rebase 與低維核

建立 encoder:

RtRdt×r\boxed{ \mathbf R_t \in \mathbb R^{d_t\times r} }

與 decoder:

DtRr×dt.\boxed{ \mathbf D_t \in \mathbb R^{r\times d_t}. }

低維表示:

Zt=StRt.\boxed{ \mathbf Z_t = \mathbf S_t\mathbf R_t. }

重建:

S^t=ZtDt.\boxed{ \widehat{\mathbf S}_t = \mathbf Z_t\mathbf D_t. }

這是 Paper 05 的 semantic rebase 與 Paper 06 的生成核在矩陣中的接口。

20. Task-Preserving Compression

只要求:

StS^tF\| \mathbf S_t- \widehat{\mathbf S}_t \|_F

小,可能仍保留很多任務無關細節。

因此更關鍵的是:

LD(S^t)LD(St)+ϵD.\boxed{ \mathcal L_D( \widehat{\mathbf S}_t ) \le \mathcal L_D( \mathbf S_t ) + \epsilon_D. }

即壓縮後仍保持歷史判別能力。

21. 最小矩陣核

矩陣版 minimal kernel 可以寫成:

r=minr\boxed{ r^\ast = \min r }

subject to:

LD(ZD)LD(S)+ϵD.\mathcal L_D( \mathbf Z\mathbf D ) \le \mathcal L_D( \mathbf S ) + \epsilon_D.

若再要求幾何重建:

SZDFSFϵR,\frac{ \| \mathbf S- \mathbf Z\mathbf D \|_F }{ \| \mathbf S \|_F } \le \epsilon_R,

便得到更強的核。

22. Structural Expansion 的矩陣版本

Structural Expansion 不一定增加 dtd_t

可以保持:

dt+1=dtd_{t+1}=d_t

但改變:

St+1=ft(St),\mathbf S_{t+1} = f_t( \mathbf S_t ),

使新的 interaction 或作用域關係被利用。

因此:

feature count fixed⇏representational structure fixed.\boxed{ \text{feature count fixed} \not\Rightarrow \text{representational structure fixed}. }

23. Interaction Expansion

既有兩欄:

si,sj\mathbf s_i, \quad \mathbf s_j

可以生成暫時 interaction:

hij=g(si,sj).\boxed{ \mathbf h_{ij} = g( \mathbf s_i, \mathbf s_j ). }

若它不被永久加入 primitive basis,就不屬於 lexical growth。

這是「固定原子、增加關係」的矩陣形式。

24. Tensor 只在必要時升級

高階關係可以使用:

TRd1××dk.\mathcal T \in \mathbb R^{d_1\times\cdots\times d_k}.

但本文採:

Matrix first, tensor when required.\boxed{ \text{Matrix first, tensor when required}. }

因為目標是最小共同接口,而不是最大形式複雜度。

25. 矩陣欄不等於詞

一個詞可能對應多個座標。

一個座標也可能由多個詞共同實現。

因此:

wordmatrix column.\boxed{ \text{word} \neq \text{matrix column}. }

更合理的是:

lexical item可重用的表示區域或 transformation interface.\boxed{ \text{lexical item} \leftrightarrow \text{可重用的表示區域或 transformation interface}. }

26. 每輪 Matrix Log

可保存:

Mt=(Xt,Ct,Jt,Lt,At,Wt,St).\boxed{ \mathcal M_t = ( \mathbf X_t, \mathbf C_t, \mathcal J_t, \mathbf L_t, \mathbf A_t, \mathbf W_t, \mathbf S_t ). }

並記錄:

rϵ(St),r_\epsilon( \mathbf S_t ), LD(St),\mathcal L_D( \mathbf S_t ), EDGt,EDG_t,

以及 complexity。

如此 100 輪可從 transcript 轉為 time series。

27. Matrix Convergence

若連續 pp 輪:

EDGtϵG,EDG_t\le\epsilon_G,

而:

rϵ(St)r_\epsilon( \mathbf S_t )

不再增加,且存在低維 Zt\mathbf Z_t 能保持 task loss,則可以啟動 Matrix Convergence。

這仍是局部停止。

28. 新案例重新打開矩陣核

新案例矩陣:

Y\mathbf Y

加入:

S=[SY].\mathbf S' = \begin{bmatrix} \mathbf S\\ \mathbf Y \end{bmatrix}.

若:

rϵ(S)>rϵ(S),r_\epsilon( \mathbf S' ) > r_\epsilon( \mathbf S ),

或者 task loss 顯著上升,舊 kernel 必須重新展開或 rebase。

29. 五個核心指標

Dimension Growth:

DGt=dt+1dt.DG_t = d_{t+1}-d_t.

Effective Rank Growth:

ERGt=rϵ(St+1)rϵ(St).ERG_t = r_\epsilon( \mathbf S_{t+1} ) - r_\epsilon( \mathbf S_t ).

Effective Discrimination Gain:

EDGt=LD(St)LD(St+1).EDG_t = \mathcal L_D( \mathbf S_t ) - \mathcal L_D( \mathbf S_{t+1} ).

Compression Gain:

CGt=Complexity(St)Complexity(Zt,Dt).CG_t = \mathrm{Complexity}( \mathbf S_t ) - \mathrm{Complexity}( \mathbf Z_t,\mathbf D_t ).

Reconstruction Distortion:

RDt=StZtDtFStF.RD_t = \frac{ \| \mathbf S_t- \mathbf Z_t\mathbf D_t \|_F }{ \| \mathbf S_t \|_F }.

30. 四種矩陣型態

真維度增加:

DGt>0,ERGt>0,EDGt>0.DG_t>0, \quad ERG_t>0, \quad EDG_t>0.

欄位增加但低秩冗餘:

DGt>0,ERGt=0.DG_t>0, \quad ERG_t=0.

不增維但結構改善:

DGt=0,EDGt>0.DG_t=0, \quad EDG_t>0.

收斂壓縮:

ERGt<0ERG_t<0

或有效維度下降,但:

LD\mathcal L_D

近似保持。

31. Low Rank 的正確解讀

已有工作顯示句子表示與大型語言模型某些輸出矩陣可以呈現低秩或近似低秩結構。這說明「複雜語言行為可能存在低維冗餘」值得測試。

但不能推出:

human semantic ontology is low-rank.\boxed{ \text{human semantic ontology is low-rank}. }

本文只把 low rank 當成收斂診斷。

32. 限制

第一, Xt\mathbf X_tSt\mathbf S_t 的 feature design 依賴建模者。

第二,rank 主要捕捉線性冗餘。

第三,low rank 不等於語義真理,也不等於本體簡單。

第四,norm 與距離都必須由任務定義。

第五,真實自然語言可能需要圖、張量、概率程序、類型理論、模態邏輯與動態語義。

第六,本模型目前是 specification,而不是大規模實證結果。

33. 結論

本文把前六篇主要操作壓進:

XtCtJtLtKtAtEtbt.\boxed{ \mathbf X_t \rightarrow \mathbf C_t \rightarrow \mathcal J_t \rightarrow \mathbf L_t \rightarrow \mathbf K_t \rightarrow \mathbf A_t \rightarrow \mathbf E_t \rightarrow \mathbf b_t. }

再以:

Xt+1=Xt+ηLtEtWt\boxed{ \mathbf X_{t+1} = \mathbf X_t + \eta \mathbf L_t^\top \mathbf E_t \mathbf W_t }

建立動態回饋。

跨輪歷史由:

St\mathbf S_t

表示。

新語義可以:

Δrank>0,\Delta \mathrm{rank}>0,

也可以:

Δrank=0\Delta \mathrm{rank}=0

但具有壓縮價值。

收斂則由:

StZtS^t\boxed{ \mathbf S_t \rightarrow \mathbf Z_t \rightarrow \widehat{\mathbf S}_t }

完成,並要求:

壓縮後仍保留歷史判別能力.\boxed{ \text{壓縮後仍保留歷史判別能力}. }

因此 100 輪自然語言遊戲可以被重寫成:

狀態條件投影判準差異作用回饋跨輪表示低秩收斂重新展開.\boxed{ \text{狀態} \rightarrow \text{條件投影} \rightarrow \text{判準} \rightarrow \text{差異} \rightarrow \text{作用} \rightarrow \text{回饋} \rightarrow \text{跨輪表示} \rightarrow \text{低秩收斂} \rightarrow \text{重新展開}. }

矩陣不是語義的本體;它是目前讓「很接近,但還不夠精準」從自然語言遊戲進入可計算實驗的工作語言。


參考文獻

  1. Coecke, B., Sadrzadeh, M., & Clark, S. (2010/2011). Mathematical Foundations for a Compositional Distributional Model of Meaning. Linguistic Analysis, 36, 345-384. arXiv:1003.4394.

  2. Grefenstette, E., Sadrzadeh, M., Clark, S., Coecke, B., & Pulman, S. (2011). Concrete Sentence Spaces for Compositional Distributional Models of Meaning. IWCS 2011, 125-134.

  3. Mu, J., Bhat, S., & Viswanath, P. (2017). Representing Sentences as Low-Rank Subspaces. EMNLP 2017.

  4. Golowich, N., Liu, A., & Shetty, A. (2026). Sequences of Logits Reveal the Low Rank Structure of Language Models. ICLR 2026.

  5. Tishby, N., Pereira, F. C., & Bialek, W. (2000). The Information Bottleneck Method. arXiv:physics/0004057.

  6. Fei, W., et al. (2024). Extending Context Window of Large Language Models via Semantic Compression. Findings of ACL 2024.

  7. Li, D., et al. (2024). Fundamental Limitation of Semantic Communications: Neural Estimation for Rate-Distortion. arXiv:2401.01176.


系列位置

  • Paper 01:自然語言的無界精細化假說
  • Paper 02:自然語言百輪語義壓力測試方法論
  • Paper 03:自然語言的三種展開機制
  • Paper 04:邊界不是一個詞
  • Paper 05:新詞從何而來
  • Paper 06:語義的展開與收斂
  • Paper 07:自然語言精細化的矩陣表示
  • Paper 08:有限符號與無界語義:自然語言生成、展開與收斂循環