語義的展開與收斂
從無界精細化到最小生成核
系列: 自然語言無界精細化與收斂系列Paper: 06 / 08作者: Neo.KAI 協作整理: GPT-5.6 Sol機構: EveMissLab/一言諾科技有限公司版本: v0.1日期: 2026-08-20類型: 形式語義/資訊理論/概念工程/表示壓縮/語義動力學
摘要
前五篇已經描述自然語言如何在判別壓力下持續展開:先透過詞彙分裂增加 lexical primitive,再透過參數顯式化提高條件解析度,甚至在詞彙與參數固定後,仍能利用否定、條件、模態、嵌套與遞迴形成新的結構判別。然而,若精細化只會增加結構,本系列最終只得到語義膨脹,而不是一套可工作的表示理論。
本文因此研究相反方向:什麼叫「語義收斂」?什麼時候一個經過多輪展開的高複雜度表示,可以被壓縮成較小的生成核,同時仍然重建先前已被證明必要的區分?
令截至第 T T T 輪的歷史壓力案例集合為:
H T = ⋃ t = 0 T X t . H_T
=
\bigcup_{t=0}^{T}X_t. H T = t = 0 ⋃ T X t .
令候選生成核為:
K . K. K .
本文定義一個核不是因為「字數短」而有效,而是必須具有重建充分性。令:
Gen ( K ) \operatorname{Gen}(K) Gen ( K )
表示由 K K K 與既定結構運算可重新生成的表示閉包。若在容許誤差 ϵ \epsilon ϵ 下:
E r r o r ( Gen ( K ) ; H T ) ≤ ϵ , \boxed{
Error(
\operatorname{Gen}(K);
H_T
)
\le
\epsilon,
} E r r or ( Gen ( K ) ; H T ) ≤ ϵ ,
則稱 K K K 對目前歷史案例集合為 ϵ \epsilon ϵ -充分生成核。
若在所有滿足此條件的候選中, K ∗ K^\ast K ∗ 具有最低表示複雜度:
K ∗ ∈ arg min K C o m p l e x i t y ( K ) \boxed{
K^\ast
\in
\arg\min_K
Complexity(K)
} K ∗ ∈ arg K min C o m pl e x i t y ( K )
subject to:
E r r o r ( Gen ( K ) ; H T ) ≤ ϵ , Error(
\operatorname{Gen}(K);
H_T
)
\le
\epsilon, E r r or ( Gen ( K ) ; H T ) ≤ ϵ ,
則稱 K ∗ K^\ast K ∗ 為目前域內的最小生成核候選。
此定義與 minimum description length、minimal sufficient representation、Information Bottleneck、rate-distortion 與 algorithmic sufficient statistics 有明顯親緣關係。本文不宣稱重新發明「最小而充分的表示」;其新位置是把這個壓縮原則嵌入一條反覆語義精細化的動態路徑:
S 0 → S 1 → ⋯ → S T → K ∗ → S T + 1 → ⋯ \boxed{
S_0
\rightarrow
S_1
\rightarrow
\cdots
\rightarrow
S_T
\rightarrow
K^\ast
\rightarrow
S_{T+1}
\rightarrow
\cdots
} S 0 → S 1 → ⋯ → S T → K ∗ → S T + 1 → ⋯
其中 K ∗ K^\ast K ∗ 不是語義終點,而是下一輪可重新展開的低成本入口。
本文進一步區分四種不同收斂:詞彙收斂、參數收斂、結構收斂與生成核收斂;提出判別充分性、回歸充分性、重建充分性、成本優勢與最小性五項檢驗;並指出「最小生成核」一般不必唯一,也不保證是全域最小。更精確的說法是:在指定案例集合、任務、表示語言、運算規則與容許誤差下,形成一個局部最小且可重新展開的表示基底。
關鍵詞: semantic convergence、minimal generating kernel、minimum description length、information bottleneck、minimal sufficient representation、rate-distortion、semantic compression、local convergence、reconstruction、semantic basis
1. 無界展開若沒有收斂,會發生什麼
前五篇一直強調:
語義可展開 \boxed{
\text{語義可展開}
} 語義可展開
不等於:
必須一直增加詞彙 . \boxed{
\text{必須一直增加詞彙}.
} 必須一直增加詞彙 .
但還存在更根本的問題。
即使不增加詞彙,參數也可以增加。
即使參數固定,結構仍可增加。
若:
S 0 → S 1 → S 2 → ⋯ S_0
\rightarrow
S_1
\rightarrow
S_2
\rightarrow
\cdots S 0 → S 1 → S 2 → ⋯
永遠只允許 complexity 上升,而沒有反向壓縮,則「精細化」最終可能退化成:
保留所有歷史細節的無限累加 . \boxed{
\text{保留所有歷史細節的無限累加}.
} 保留所有歷史細節的無限累加 .
這不但成本高,也會使新概念難以調用、比較、傳遞與重新使用。
因此真正完整的語義動力學必須同時允許:
E x p a n d \boxed{
Expand
} E x p an d
與:
C o n v e r g e . \boxed{
Converge.
} C o n v er g e .
2. 收斂不是「再也講不下去」
本文拒絕把語義收斂定義為:
不存在任何可新增細節 . \text{不存在任何可新增細節}. 不存在任何可新增細節 .
對高度抽象問題,這個條件通常過強。
即使目前已經有一個非常好的定義,仍可能加入:
更細尺度;
新邊界案例;
新任務;
新領域;
新歷史條件;
新模態條件。
因此收斂更適合被理解為:
目前條件下,新增精細化的有效收益不再足以抵銷表示成本。 \boxed{
\text{目前條件下,新增精細化的有效收益不再足以抵銷表示成本。}
} 目前條件下,新增精細化的有效收益不再足以抵銷表示成本。
令:
G t G_t G t
為新一輪帶來的判別增益,
C t C_t C t
為新增表示成本。
若:
G t − λ C t ≤ 0 , G_t
-
\lambda C_t
\le
0, G t − λ C t ≤ 0 ,
則可以停止目前支線的繼續展開。
這是局部停止,而不是全域語義終點。
3. 與 Information Bottleneck 的關係
Information Bottleneck 的基本精神是:尋找一個比原始輸入更緊湊的表示,同時盡量保留與目標相關的信息。
令:
X X X
為原始信息,
Y Y Y
為目前任務相關目標,
Z Z Z
為壓縮表示。
經典工作可寫成:
min I ( X ; Z ) − β I ( Z ; Y ) . \boxed{
\min
I(X;Z)
-
\beta
I(Z;Y).
} min I ( X ; Z ) − β I ( Z ; Y ) .
第一項懲罰表示保留過多原始信息,第二項獎勵保留與目標相關的信息。
本文與其相似之處是:
壓縮不應犧牲目前重要的信息。 \boxed{
\text{壓縮不應犧牲目前重要的信息。}
} 壓縮不應犧牲目前重要的信息。
不同之處是,本系列的 Y Y Y 不一定是一個固定預測標籤,而可以是一整組在百輪反例測試中逐步累積的判別約束:
H T . H_T. H T .
因此本文更像是在問:
經過多輪概念精細化後,能否找到一個小表示,使歷史上已證明必要的區分仍然可被重新生成?
4. 與 minimal sufficient representation 的關係
一個表示若保留任務需要的全部信息,可以被稱為 sufficient;若在充分表示中又盡量去除不相關內容,便接近 minimal sufficient representation 的精神。
本文借用這一精神,但把「充分」改寫成可操作的語義回歸條件。
令:
H T = { x 1 , … , x N } H_T
=
\{x_1,\ldots,x_N\} H T = { x 1 , … , x N }
為所有已保留壓力案例。
令:
Q ( K ; H T ) Q(K;H_T) Q ( K ; H T )
表示生成核 K K K 對這些案例的判別品質。
若:
Q ( K ; H T ) ≥ q ∗ − ϵ , Q(K;H_T)
\ge
q^\ast-\epsilon, Q ( K ; H T ) ≥ q ∗ − ϵ ,
其中:
q ∗ q^\ast q ∗
是展開後完整表示可達到的品質,
則稱 K K K 在目前任務下近似充分。
因此:
minimal \boxed{
\text{minimal}
} minimal
與:
sufficient \boxed{
\text{sufficient}
} sufficient
必須同時成立。
只有 minimal 沒有 sufficient,是過度壓縮。
只有 sufficient 沒有 minimal,則只是把整套歷史原樣保存。
5. 與 MDL 和 algorithmic statistics 的關係
Minimum Description Length 的核心直覺是:好的模型應讓「模型本身」加上「資料在模型下的剩餘描述」總長度較短。
工作性地可寫成:
L ( K ) + L ( H T ∣ K ) . \boxed{
L(K)
+
L(H_T\mid K).
} L ( K ) + L ( H T ∣ K ) .
若一個非常複雜的核:
K f u l l K_{\mathrm{full}} K full
幾乎直接記住全部歷史,
則:
L ( H T ∣ K f u l l ) L(H_T\mid K_{\mathrm{full}}) L ( H T ∣ K full )
可能很小,
但:
L ( K f u l l ) L(K_{\mathrm{full}}) L ( K full )
很大。
反過來,極度簡單的核:
K t r i v i a l K_{\mathrm{trivial}} K trivial
本身很短,
但無法解釋歷史案例,因此:
L ( H T ∣ K t r i v i a l ) L(H_T\mid K_{\mathrm{trivial}}) L ( H T ∣ K trivial )
很大。
Algorithmic statistics 中的 sufficient statistic 與 minimal sufficient statistic 同樣研究:能否用一個比資料本身更有結構的模型,保存資料中的規律而不把隨機細節誤當成模型。
本文不重新證明這些結果,而把它們轉成語義精細化路徑的設計約束:
不要把所有歷史句子都當成 kernel;只保留能重新生成必要差異的結構。 \boxed{
\text{不要把所有歷史句子都當成 kernel;只保留能重新生成必要差異的結構。}
} 不要把所有歷史句子都當成 kernel ;只保留能重新生成必要差異的結構。
6. 生成核的工作定義
令:
O \mathcal O O
為目前允許的結構操作集合。
令候選核:
K = ( Σ K , P K , O K ) . K
=
(
\Sigma_K,
P_K,
\mathcal O_K
). K = ( Σ K , P K , O K ) .
由它可產生:
Gen ( K ) = Closure ( Σ K , P K , O K ) . \boxed{
\operatorname{Gen}(K)
=
\operatorname{Closure}
(
\Sigma_K,
P_K,
\mathcal O_K
).
} Gen ( K ) = Closure ( Σ K , P K , O K ) .
注意,生成核不是一份摘要。
摘要只需要大致描述原內容。
生成核要求更強:
它必須能重新生成目前仍被視為必要的區分。 \boxed{
\text{它必須能重新生成目前仍被視為必要的區分。}
} 它必須能重新生成目前仍被視為必要的區分。
因此:
S u m m a r y ( S ) Summary(S) S u mma r y ( S )
與:
K e r n e l ( S ) Kernel(S) K er n e l ( S )
不是同一概念。
7. 判別充分性
第一個檢驗是:
壓縮後還能不能分開原本必須分開的案例?
令:
D K ( x i , x j ) D_K(x_i,x_j) D K ( x i , x j )
表示核 K K K 對案例對 ( x i , x j ) (x_i,x_j) ( x i , x j ) 的判別能力。
若完整表示:
S T S_T S T
能區分:
( x i , x j ) , (x_i,x_j), ( x i , x j ) ,
則要求:
D K ( x i , x j ) ≥ D S T ( x i , x j ) − ϵ D . \boxed{
D_K(x_i,x_j)
\ge
D_{S_T}(x_i,x_j)-\epsilon_D.
} D K ( x i , x j ) ≥ D S T ( x i , x j ) − ϵ D .
若大量早期區分在壓縮後消失,則:
K K K
不是充分核。
8. 回歸充分性
判別充分性還不夠。
一個新核可能只對最後幾輪很好,卻破壞早期重要反例。
因此要求回測:
H T = ⋃ t = 0 T X t . \boxed{
H_T
=
\bigcup_{t=0}^{T}X_t.
} H T = t = 0 ⋃ T X t .
令:
E r r o r ( K ; H T ) Error(K;H_T) E r r or ( K ; H T )
表示利用 Gen ( K ) \operatorname{Gen}(K) Gen ( K ) 重新處理全部歷史案例時的錯誤。
要求:
E r r o r ( K ; H T ) ≤ ϵ R . \boxed{
Error(K;H_T)
\le
\epsilon_R.
} E r r or ( K ; H T ) ≤ ϵ R .
這是 convergence 版的 regression test。
9. 重建充分性
本文最強的要求不是只重跑答案,而是測試:
核能否重新長出先前被保留的中間結構?
令歷史中真正被保留的概念集合:
F T = { f 1 , … , f m } . \mathcal F_T
=
\{
f_1,\ldots,f_m
\}. F T = { f 1 , … , f m } .
令:
F ^ T ( K ) \widehat{\mathcal F}_T(K) F T ( K )
為從核重新生成的結構集合。
定義:
R r e c ( K ) = 1 − d ( F ^ T ( K ) , F T ) . \boxed{
R_{\mathrm{rec}}(K)
=
1
-
d(
\widehat{\mathcal F}_T(K),
\mathcal F_T
).
} R rec ( K ) = 1 − d ( F T ( K ) , F T ) .
若:
R r e c ( K ) ≥ 1 − ϵ r e c , R_{\mathrm{rec}}(K)
\ge
1-\epsilon_{\mathrm{rec}}, R rec ( K ) ≥ 1 − ϵ rec ,
則核具有近似重建充分性。
這比單純「最後答案一樣」更嚴格。
10. 成本優勢
如果:
C o m p l e x i t y ( K ) ≥ C o m p l e x i t y ( S T ) , Complexity(K)
\ge
Complexity(S_T), C o m pl e x i t y ( K ) ≥ C o m pl e x i t y ( S T ) ,
那麼稱它為「收斂」沒有太大意義。
因此要求:
Δ C = C o m p l e x i t y ( S T ) − C o m p l e x i t y ( K ) > 0. \boxed{
\Delta C
=
Complexity(S_T)
-
Complexity(K)
>
0.
} Δ C = C o m pl e x i t y ( S T ) − C o m pl e x i t y ( K ) > 0.
Complexity 可以用:
token length;
symbol count;
graph size;
parameter count;
MDL;
description length;
memory footprint;
inference cost;
等不同方式近似。
本文不規定唯一複雜度量。
11. 最小性
若:
K K K
已經充分,還可以問:
是否存在更小的核?
本文定義:
K ∗ ∈ arg min K C o m p l e x i t y ( K ) \boxed{
K^\ast
\in
\arg\min_K
Complexity(K)
} K ∗ ∈ arg K min C o m pl e x i t y ( K )
subject to:
E r r o r ( K ; H T ) ≤ ϵ R , Error(K;H_T)
\le
\epsilon_R, E r r or ( K ; H T ) ≤ ϵ R ,
以及:
R r e c ( K ) ≥ 1 − ϵ r e c . R_{\mathrm{rec}}(K)
\ge
1-\epsilon_{\mathrm{rec}}. R rec ( K ) ≥ 1 − ϵ rec .
這是本文所稱:
最小生成核候選 . \boxed{
\text{最小生成核候選}.
} 最小生成核候選 .
「候選」二字很重要,因為實際搜尋通常不能保證找到全域最小值。
12. 最小生成核不必唯一
假設:
K 1 K_1 K 1
與:
K 2 K_2 K 2
具有不同 primitive,
但都能在同一誤差下重建:
H T . H_T. H T .
而且:
C o m p l e x i t y ( K 1 ) ≈ C o m p l e x i t y ( K 2 ) . Complexity(K_1)
\approx
Complexity(K_2). C o m pl e x i t y ( K 1 ) ≈ C o m pl e x i t y ( K 2 ) .
則可能同時存在多個:
K ∗ . K^\ast. K ∗ .
因此:
minimal generating kernel ⇏ unique ontology . \boxed{
\text{minimal generating kernel}
\not\Rightarrow
\text{unique ontology}.
} minimal generating kernel ⇒ unique ontology .
這對哲學討論非常重要。
一個概念存在多套近似同等精簡的生成基底,不代表其中只有一套是真實世界唯一正確的切法。
13. Paper 04 的四元核是什麼地位
Paper 04 在邊界案例中得到:
K B = { Δ , C , J , A } . K_B
=
\{
\Delta,
C,
J,
A
\}. K B = { Δ , C , J , A } .
本文現在可以更精確地說:
K B \boxed{
K_B
} K B
不是已證明的最小本體集合。
它只是一個:
對當前 boundary case history 具有高重建能力的局部生成核候選。 \boxed{
\text{對當前 boundary case history 具有高重建能力的局部生成核候選。}
} 對當前 boundary case history 具有高重建能力的局部生成核候選。
若未來找到:
K B ′ K'_B K B ′
使:
C o m p l e x i t y ( K B ′ ) < C o m p l e x i t y ( K B ) Complexity(K'_B)
<
Complexity(K_B) C o m pl e x i t y ( K B ′ ) < C o m pl e x i t y ( K B )
且仍保持相同回歸與重建品質,
則:
K B K_B K B
應被替換。
這讓「最小生成核」保持可修正,而不是變成新的教條。
14. 刪除測試
檢驗 kernel 最簡單的方法之一是逐項刪除。
令:
K = { k 1 , … , k n } . K
=
\{k_1,\ldots,k_n\}. K = { k 1 , … , k n } .
對每一個:
k i , k_i, k i ,
建立:
K − i = K ∖ { k i } . K_{-i}
=
K
\setminus
\{k_i\}. K − i = K ∖ { k i } .
若:
E r r o r ( K − i ; H T ) > ϵ R , Error(K_{-i};H_T)
>
\epsilon_R, E r r or ( K − i ; H T ) > ϵ R ,
則:
k i k_i k i
在目前核中具有必要性證據。
若:
E r r o r ( K − i ; H T ) ≤ ϵ R , Error(K_{-i};H_T)
\le
\epsilon_R, E r r or ( K − i ; H T ) ≤ ϵ R ,
且 reconstruction 不下降,
則 k i k_i k i 可能是冗餘 primitive。
15. 合併測試
除了刪除,也可以合併。
若:
k i k_i k i
與:
k j k_j k j
高度共現,
可以測試:
k i j = M e r g e ( k i , k j ) . k_{ij}
=
Merge(k_i,k_j). k ij = M er g e ( k i , k j ) .
若:
C o m p l e x i t y ( K − { k i , k j } + { k i j } ) < C o m p l e x i t y ( K ) Complexity(
K-\{k_i,k_j\}+\{k_{ij}\}
)
<
Complexity(K) C o m pl e x i t y ( K − { k i , k j } + { k ij }) < C o m pl e x i t y ( K )
且:
E r r o r Error E r r or
沒有超過門檻,
則可以進一步收斂。
這就是 Paper 05 的 crystallization 在 kernel 層的版本。
16. 分解測試
反方向也必須存在。
若一個 primitive:
k k k
造成大量:
E d e c o d e E_{\mathrm{decode}} E decode
或 regression failure,
則將它重新展開:
k → { k 1 , k 2 , … } . k
\rightarrow
\{k_1,k_2,\ldots\}. k → { k 1 , k 2 , … } .
因此:
C o n v e r g e n c e \boxed{
Convergence
} C o n v er g e n ce
不是不可逆壓縮。
一個有效的語義系統必須允許:
C o m p r e s s ⇄ R e − e x p a n d . \boxed{
Compress
\rightleftarrows
Re-expand.
} C o m p r ess ⇄ R e − e x p an d .
17. 四種收斂
本文區分至少四種不同收斂。
17.1 Lexical Convergence
Δ ∣ Σ t ∣ ≈ 0. \Delta|\Sigma_t|
\approx0. Δ∣ Σ t ∣ ≈ 0.
新詞不再增加,但其他表示仍可能繼續變化。
17.2 Parametric Convergence
Δ ∣ P t ∣ ≈ 0. \Delta|P_t|
\approx0. Δ∣ P t ∣ ≈ 0.
不再需要更多顯式條件。
17.3 Structural Convergence
在固定:
Σ , P , O \Sigma,
P,
\mathcal O Σ , P , O
下,
連續多輪:
Δ D t ≤ ϵ S . \Delta D_t
\le
\epsilon_S. Δ D t ≤ ϵ S .
17.4 Kernel Convergence
存在:
K K K
使:
E r r o r ( K ; H T ) ≤ ϵ R , Error(K;H_T)\le\epsilon_R, E r r or ( K ; H T ) ≤ ϵ R ,
R r e c ( K ) ≥ 1 − ϵ r e c , R_{\mathrm{rec}}(K)\ge1-\epsilon_{\mathrm{rec}}, R rec ( K ) ≥ 1 − ϵ rec ,
而且進一步刪除或合併已不能顯著降低 complexity 而不破壞上述條件。
這是四者中最強的局部收斂。
18. 收斂向量
由於不同層可不同步收斂,定義:
c t = ( c L , c P , c S , c K ) . \boxed{
\mathbf c_t
=
(
c_L,
c_P,
c_S,
c_K
).
} c t = ( c L , c P , c S , c K ) .
其中各分量:
c i ∈ [ 0 , 1 ] . c_i\in[0,1]. c i ∈ [ 0 , 1 ] .
例如:
c t = ( 1 , 1 , 0.3 , 0 ) \mathbf c_t
=
(1,1,0.3,0) c t = ( 1 , 1 , 0.3 , 0 )
表示詞彙與參數層已高度穩定,但結構仍在展開,尚未形成可靠 kernel。
因此「這個概念已經收斂」應改成:
它在哪一個表示層收斂到什麼程度? \boxed{
\text{它在哪一個表示層收斂到什麼程度?}
} 它在哪一個表示層收斂到什麼程度?
19. 收斂速度
令:
C t C_t C t
為第 t t t 輪表示複雜度,
D t D_t D t
為有效判別品質。
理想精細化初期:
D t D_t D t
快速增加,
之後邊際增益下降。
可以定義:
g t = D t + 1 − D t . \boxed{
g_t
=
D_{t+1}-D_t.
} g t = D t + 1 − D t .
若:
g t → 0 , g_t
\rightarrow0, g t → 0 ,
且:
C t C_t C t
仍快速上升,
則系統已進入低效率展開區。
此時應優先執行 convergence attack。
20. 收斂不是資訊全部丟掉
極端壓縮:
K = ∅ K=\varnothing K = ∅
具有最低表示成本,
但通常:
E r r o r ( K ; H T ) Error(K;H_T) E r r or ( K ; H T )
最大。
因此真正的 convergence 不是:
C o m p l e x i t y → 0. \boxed{
Complexity\rightarrow0.
} C o m pl e x i t y → 0.
而是 rate-distortion 式折衷:
min C o m p l e x i t y ( K ) + β D i s t o r t i o n ( K ; H T ) . \boxed{
\min
Complexity(K)
+
\beta
Distortion(K;H_T).
} min C o m pl e x i t y ( K ) + β D i s t or t i o n ( K ; H T ) .
這與現代 semantic compression、context compression 與 rate-distortion 研究具有直接方法學親緣。
21. 語義失真
本文定義:
D i s t o r t i o n ( K ; H T ) Distortion(K;H_T) D i s t or t i o n ( K ; H T )
不能只測文字重建差異。
若:
S e n t e n c e ( K ) Sentence(K) S e n t e n ce ( K )
與:
S e n t e n c e ( S T ) Sentence(S_T) S e n t e n ce ( S T )
字面不同,
但所有重要判別都一致,
則語義失真可能很低。
反之,摘要字面非常相似,但丟掉一個關鍵 boundary case,
則語義失真應很高。
因此:
semantic distortion ≠ textual edit distance . \boxed{
\text{semantic distortion}
\neq
\text{textual edit distance}.
} semantic distortion = textual edit distance .
其核心應建立在任務相關的判別、推理、回歸與重建上。
22. 生成核與摘要的差異
令:
A = S u m m a r y ( S T ) . A
=
Summary(S_T). A = S u mma r y ( S T ) .
它可能很好讀,也可能涵蓋主要結論。
但若無法從 A A A 重新推導:
f 1 , … , f m , f_1,\ldots,f_m, f 1 , … , f m ,
則:
A A A
不是生成核。
因此:
K e r n e l = C o m p r e s s i o n + R e − g e n e r a b i l i t y . \boxed{
Kernel
=
Compression
+
Re-generability.
} K er n e l = C o m p r ess i o n + R e − g e n er abi l i t y .
這是本文對普通摘要與理論收斂的最重要區分。
23. 生成核與詞彙表的差異
一份詞彙表:
Σ K \Sigma_K Σ K
也不自動等於 kernel。
若沒有:
O K \mathcal O_K O K
告訴系統如何組合,
以及:
P K P_K P K
告訴系統何時使用不同條件,
則 primitive 只是孤立標籤。
所以:
K = ( Σ K , P K , O K ) \boxed{
K
=
(
\Sigma_K,
P_K,\mathcal O_K
)
} K = ( Σ K , P K , O K )
比:
K = Σ K K=\Sigma_K K = Σ K
更完整。
24. Kernel 的重新展開
形成:
K ∗ K^\ast K ∗
後,下一輪不是停止。
新的壓力案例:
Z Z Z
進入後,
若:
E r r o r ( K ∗ ; Z ) > ϵ , Error(K^\ast;Z)
>
\epsilon, E r r or ( K ∗ ; Z ) > ϵ ,
則 kernel 被重新打開:
K ∗ → E x p a n d ( K ∗ ; Z ) → S T + 1 . \boxed{
K^\ast
\rightarrow
Expand(K^\ast;Z)
\rightarrow
S_{T+1}.
} K ∗ → E x p an d ( K ∗ ; Z ) → S T + 1 .
因此:
收斂態是下一次展開的初始條件。 \boxed{
\text{收斂態是下一次展開的初始條件。}
} 收斂態是下一次展開的初始條件。
25. 局部最小不等於全域最小
假設目前:
K ∗ K^\ast K ∗
在:
H T H_T H T
上最小。
新案例:
Z Z Z
加入:
H T + 1 = H T ∪ Z . H_{T+1}
=
H_T\cup Z. H T + 1 = H T ∪ Z .
則可能:
K ∗ K^\ast K ∗
不再充分。
也可能原本看似必要的 primitive 在新架構下被更高階結構取代。
因此:
K ∗ ( H T ) ≠ K ∗ ( H T + 1 ) \boxed{
K^\ast(H_T)
\neq
K^\ast(H_{T+1})
} K ∗ ( H T ) = K ∗ ( H T + 1 )
完全可能成立。
這是本系列一直強調的:
局部收斂 ⇏ 全域封閉 . \boxed{
\text{局部收斂}
\not\Rightarrow
\text{全域封閉}.
} 局部收斂 ⇒ 全域封閉 .
26. 無界與收斂並不矛盾
表面上:
Unbounded Expansion \text{Unbounded Expansion} Unbounded Expansion
與:
Convergence \text{Convergence} Convergence
像相反命題。
其實兩者可以同時成立。
任何有限時間點:
t t t
都只需要維持有限核:
K t . K_t. K t .
但當新案例出現時:
K t → S t + 1 → K t + 1 . K_t
\rightarrow
S_{t+1}
\rightarrow
K_{t+1}. K t → S t + 1 → K t + 1 .
所以整體路徑:
K 0 → S 1 → K 1 → S 2 → K 2 → ⋯ \boxed{
K_0
\rightarrow
S_1
\rightarrow
K_1
\rightarrow
S_2
\rightarrow
K_2
\rightarrow
\cdots
} K 0 → S 1 → K 1 → S 2 → K 2 → ⋯
可以沒有先驗最大終點。
這就是:
局部有限收斂 + 全域相對無界更新 . \boxed{
\text{局部有限收斂}
+
\text{全域相對無界更新}.
} 局部有限收斂 + 全域相對無界更新 .
27. 一個生成核搜尋演算法
給定:
S T , H T , ϵ , S_T,
\quad
H_T,
\quad
\epsilon, S T , H T , ϵ ,
可以採用以下工作流程。
Step 1
抽取候選 primitive:
K 0 . K_0. K 0 .
Step 2
建立全部 regression cases:
H T . H_T. H T .
Step 3
逐一刪除 primitive,測試:
K − i . K_{-i}. K − i .
Step 4
合併高共現 primitive。
Step 5
對高歧義 primitive 做分解。
Step 6
對每個候選計算:
C o m p l e x i t y ( K ) , Complexity(K), C o m pl e x i t y ( K ) ,
E r r o r ( K ; H T ) , Error(K;H_T), E r r or ( K ; H T ) ,
R r e c ( K ) . R_{\mathrm{rec}}(K). R rec ( K ) .
Step 7
選擇:
K ∗ = arg min K C o m p l e x i t y ( K ) \boxed{
K^\ast
=
\arg\min_K
Complexity(K)
} K ∗ = arg K min C o m pl e x i t y ( K )
subject to:
E r r o r ( K ; H T ) ≤ ϵ R Error(K;H_T)
\le
\epsilon_R E r r or ( K ; H T ) ≤ ϵ R
及:
R r e c ( K ) ≥ 1 − ϵ r e c . R_{\mathrm{rec}}(K)
\ge
1-\epsilon_{\mathrm{rec}}. R rec ( K ) ≥ 1 − ϵ rec .
28. Approximate Kernel
自然語義很可能無法得到真正 lossless kernel。
因此更實用的是:
K ϵ ∗ . \boxed{
K^\ast_{\epsilon}.
} K ϵ ∗ .
即允許:
ϵ > 0. \epsilon>0. ϵ > 0.
如果把 ϵ \epsilon ϵ 降低,
通常:
C o m p l e x i t y ( K ϵ ∗ ) Complexity(K^\ast_{\epsilon}) C o m pl e x i t y ( K ϵ ∗ )
會上升。
因此可以形成一條語義 rate-distortion curve:
R ( ϵ ) = min K C o m p l e x i t y ( K ) \boxed{
R(\epsilon)
=
\min_K
Complexity(K)
} R ( ϵ ) = K min C o m pl e x i t y ( K )
subject to:
D i s t o r t i o n ( K ) ≤ ϵ . Distortion(K)\le\epsilon. D i s t or t i o n ( K ) ≤ ϵ .
這為 Paper 07 的矩陣形式化提供直接接口。
29. 多尺度 Kernel
不同任務需要不同解析度。
可以建立:
K ( 0 ) , K ( 1 ) , … , K ( m ) K^{(0)},
K^{(1)},
\ldots,K^{(m)} K ( 0 ) , K ( 1 ) , … , K ( m )
使:
C o m p l e x i t y ( K ( 0 ) ) < C o m p l e x i t y ( K ( 1 ) ) < ⋯ < C o m p l e x i t y ( K ( m ) ) . Complexity(
K^{(0)}
)
<
Complexity(
K^{(1)}
)
<
\cdots
<
Complexity(
K^{(m)}
). C o m pl e x i t y ( K ( 0 ) ) < C o m pl e x i t y ( K ( 1 ) ) < ⋯ < C o m pl e x i t y ( K ( m ) ) .
同時:
D i s t o r t i o n ( K ( 0 ) ) > D i s t o r t i o n ( K ( 1 ) ) > ⋯ > D i s t o r t i o n ( K ( m ) ) . Distortion(
K^{(0)}
)
>
Distortion(
K^{(1)}
)
>
\cdots
>
Distortion(
K^{(m)}
). D i s t or t i o n ( K ( 0 ) ) > D i s t or t i o n ( K ( 1 ) ) > ⋯ > D i s t or t i o n ( K ( m ) ) .
因此系統不必永遠只保存一個「最精準版本」。
可以有:
日常 kernel;
技術 kernel;
形式 kernel;
完整歷史展開。
這讓語言的粗粒度與精細化不再互斥。
30. Kernel Cache
Paper 05 把 lexical primitive 比喻為 semantic cache。
Paper 06 可以把整個:
K ∗ K^\ast K ∗
理解為更高階 cache。
調用:
K ∗ . K^\ast. K ∗ .
若當前問題落在已知域:
H i t ( K ∗ ) = 1. Hit(K^\ast)=1. H i t ( K ∗ ) = 1.
直接使用低成本 kernel。
若:
E r r o r ( K ∗ ; Z ) > ϵ , Error(K^\ast;Z)>\epsilon, E r r or ( K ∗ ; Z ) > ϵ ,
則:
H i t ( K ∗ ) = 0 , Hit(K^\ast)=0, H i t ( K ∗ ) = 0 ,
進入:
R e E x p a n d . ReExpand. R e E x p an d .
所以:
理論使用 = kernel hit or kernel re-expansion . \boxed{
\text{理論使用}
=
\text{kernel hit}
\quad\text{or}\quad
\text{kernel re-expansion}.
} 理論使用 = kernel hit or kernel re-expansion .
31. 收斂失敗一:過度壓縮
若:
C o m p l e x i t y ( K ) Complexity(K) C o m pl e x i t y ( K )
很低,
但:
E r r o r ( K ; H T ) Error(K;H_T) E r r or ( K ; H T )
顯著增加,
則為:
Over-compression . \boxed{
\text{Over-compression}.
} Over-compression .
典型表現是:
把前面二十個重要區分重新壓成一句漂亮但失去反例處理能力的格言。
這是哲學寫作與理論摘要非常常見的失敗。
32. 收斂失敗二:假最小核
如果 kernel 只是把舊詞換成更抽象的新詞:
k 1 , k 2 , … → z , k_1,k_2,\ldots
\rightarrow
z, k 1 , k 2 , … → z ,
但:
D e c o d e ( z ) Decode(z) D eco d e ( z )
仍需要完整原結構才能運作,
則壓縮只是移動成本。
因此要計算:
T o t a l C o s t ( K ) = C o s t ( K ) + C o s t ( D e c o d e ∣ K ) . \boxed{
TotalCost(K)
=
Cost(K)
+
Cost(Decode\mid K).
} T o t a l C os t ( K ) = C os t ( K ) + C os t ( D eco d e ∣ K ) .
不能只計 primitive 數量。
33. 收斂失敗三:歷史失憶
如果:
K K K
只保留最後版本的定義,
但遺失早期「為什麼需要這個區分」的反例,
則未來可能再次犯相同錯誤。
因此 kernel 至少需要保留:
minimal counterexample anchors . \boxed{
\text{minimal counterexample anchors}.
} minimal counterexample anchors .
不必保留全部聊天紀錄,但要保留足以證明關鍵 primitive 必要性的代表性案例。
34. Counterexample Basis
令全部歷史案例:
H T . H_T. H T .
不一定需要全部保存。
若存在子集:
B T ⊆ H T B_T
\subseteq
H_T B T ⊆ H T
使:
E r r o r ( K ; B T ) ≈ E r r o r ( K ; H T ) Error(K;B_T)
\approx
Error(K;H_T) E r r or ( K ; B T ) ≈ E r r or ( K ; H T )
並足以檢測主要 regression,
則:
B T B_T B T
可作為:
Counterexample Basis . \boxed{
\text{Counterexample Basis}.
} Counterexample Basis .
因此完整收斂可以同時壓縮:
semantic kernel \text{semantic kernel} semantic kernel
與:
test basis . \text{test basis}. test basis .
35. Kernel + Test Basis
本文因此把正式可持續收斂單位改寫成:
K T = ( K T , B T ) . \boxed{
\mathcal K_T
=
(
K_T,
B_T
).
} K T = ( K T , B T ) .
其中:
K T K_T K T
是最小生成核候選,
B T B_T B T
是最小反例基底候選。
沒有 B T B_T B T ,未來修改很難知道 kernel 是否退化。
沒有 K T K_T K T ,只保存測試又不能有效生成表示。
所以兩者互補。
36. 可反駁預測
P1:展開後應存在顯著壓縮空間
在高強度百輪精細化後,若完全找不到:
C o m p l e x i t y ( K ) < C o m p l e x i t y ( S T ) Complexity(K)<Complexity(S_T) C o m pl e x i t y ( K ) < C o m pl e x i t y ( S T )
而保持近似相同判別品質的表示,則最小生成核假說在該題目上失敗。
P2:不同歷史路徑可能收斂到不同但等效 kernel
若:
K 1 ≠ K 2 K_1
\neq
K_2 K 1 = K 2
但:
Q ( K 1 ; H ) ≈ Q ( K 2 ; H ) , Q(K_1;H)
\approx
Q(K_2;H), Q ( K 1 ; H ) ≈ Q ( K 2 ; H ) ,
則支持 kernel 非唯一性。
P3:新案例會重新打開已收斂 kernel
加入跨域反例後:
E r r o r ( K ∗ ; Z ) Error(K^\ast;Z) E r r or ( K ∗ ; Z )
應在部分案例中上升,迫使 re-expansion。
若 kernel 對任意新域都保持完美充分,則本系列的局部收斂觀會受到挑戰。
P4:Counterexample Basis 能保留大部分 regression sensitivity
應存在:
∣ B T ∣ ≪ ∣ H T ∣ |B_T|\ll|H_T| ∣ B T ∣ ≪ ∣ H T ∣
但:
R e g r e s s i o n S e n s i t i v i t y ( B T ) ≈ R e g r e s s i o n S e n s i t i v i t y ( H T ) . RegressionSensitivity(B_T)
\approx
RegressionSensitivity(H_T). R e g r ess i o n S e n s i t i v i t y ( B T ) ≈ R e g r ess i o n S e n s i t i v i t y ( H T ) .
37. 與近年 Semantic Compression 的對照
近年的 LLM semantic compression 工作已顯示,可以先去除長文本中的語義冗餘,以更短表示支援問答、摘要與資訊檢索;Information Bottleneck 也被直接用來建模 query-conditioned context compression,使壓縮保留與任務相關的資訊。
這些研究主要回答:
如何把一段既有輸入壓短,同時保留下游任務表現?
本文的問題不同:
如何把一條經歷多輪批評、概念分裂與反例修訂的理論軌跡,壓成能重新生成歷史有效區分的語義核?
因此本文的 compression target 不是單次 document context,而是:
refinement history . \boxed{
\text{refinement history}.
} refinement history .
38. 理論呼吸
現在可以把整套動力寫成:
S t → E S t + → C K t + 1 . \boxed{
S_t
\xrightarrow{\mathcal E}
S_t^{+}
\xrightarrow{\mathcal C}
K_{t+1}.
} S t E S t + C K t + 1 .
其中:
E \mathcal E E
是展開,
C \mathcal C C
是收斂。
新案例:
X t + 1 X_{t+1} X t + 1
進入後:
K t + 1 → E S t + 1 + . K_{t+1}
\xrightarrow{\mathcal E}
S_{t+1}^{+}. K t + 1 E S t + 1 + .
所以:
B = C ∘ E \boxed{
\mathcal B
=
\mathcal C
\circ
\mathcal E
} B = C ∘ E
形成最簡語義呼吸。
若再加入驗證與固化:
H , \mathcal H, H ,
則可以寫成:
B = H ∘ C ∘ E . \boxed{
\mathcal B
=
\mathcal H
\circ
\mathcal C
\circ
\mathcal E.
} B = H ∘ C ∘ E .
39. 最小生成核的本體論謙抑
即使找到:
K ∗ , K^\ast, K ∗ ,
也不能推出:
K ∗ = 世界真正最底層本體 . \boxed{
K^\ast
=
\text{世界真正最底層本體}.
} K ∗ = 世界真正最底層本體 .
它只意味:
在目前案例、任務、表示語言、運算規則與誤差容忍下, K ∗ K^\ast K ∗ 是一個低成本且足以重新生成目標區分的表示。
因此本文明確區分:
representation minimality \boxed{
\text{representation minimality}
} representation minimality
與:
ontological fundamentality . \boxed{
\text{ontological fundamentality}.
} ontological fundamentality .
前者不推出後者。
40. 結論
本系列前半段回答:
語言怎麼一直變得更細?
本文回答:
變細之後,怎麼不被自己淹死?
真正的收斂不是停止思考,也不是宣稱找到了最後定義。
它是從:
S T S_T S T
尋找:
K ∗ K^\ast K ∗
使:
C o m p l e x i t y ( K ∗ ) ≪ C o m p l e x i t y ( S T ) Complexity(K^\ast)
\ll
Complexity(S_T) C o m pl e x i t y ( K ∗ ) ≪ C o m pl e x i t y ( S T )
但:
E r r o r ( Gen ( K ∗ ) ; H T ) ≤ ϵ . Error(
\operatorname{Gen}(K^\ast);
H_T
)
\le
\epsilon. E r r or ( Gen ( K ∗ ) ; H T ) ≤ ϵ .
也就是:
更少的表示 + 足夠的重建能力 . \boxed{
\text{更少的表示}
+
\text{足夠的重建能力}.
} 更少的表示 + 足夠的重建能力 .
因此完整語義循環不是:
1 → N → ∞ . 1
\rightarrow
N
\rightarrow
\infty. 1 → N → ∞.
而是:
1 t → N t → K t + 1 → N t + 1 → K t + 2 → ⋯ \boxed{
1_t
\rightarrow
N_t
\rightarrow
K_{t+1}
\rightarrow
N_{t+1}
\rightarrow
K_{t+2}
\rightarrow
\cdots
} 1 t → N t → K t + 1 → N t + 1 → K t + 2 → ⋯
其中每個:
K t K_t K t
都是有限、局部、可被重新打開的收斂態。
於是「無界」與「收斂」不再衝突:
全域上不預設最終語義邊界, 局部上持續形成有限可用的生成核。 \boxed{
\text{全域上不預設最終語義邊界,}
\quad
\text{局部上持續形成有限可用的生成核。}
} 全域上不預設最終語義邊界, 局部上持續形成有限可用的生成核。
這正是自然語言既能不斷細化,又不必在每次使用時重新說完整個宇宙的原因之一。
參考文獻
Tishby, N., Pereira, F. C., & Bialek, W. (1999/2000). The Information Bottleneck Method . Proceedings of the 37th Annual Allerton Conference; arXiv:physics/0004057.
Painsky, A., & Tishby, N. (2018). Gaussian Lower Bound for the Information Bottleneck Limit . Journal of Machine Learning Research, 18(213), 1-29.
Gacs, P., Tromp, J. T., & Vitanyi, P. M. B. (2001). Algorithmic Statistics . IEEE Transactions on Information Theory, 47(6), 2443-2463.
Li, M., & Vitanyi, P. (1999). Minimum Description Length Induction, Bayesianism, and Kolmogorov Complexity . arXiv:cs/9901014.
Fei, W., Niu, X., Zhou, P., Hou, L., Bai, B., Deng, L., & Han, W. (2024). Extending Context Window of Large Language Models via Semantic Compression . Findings of ACL 2024, 5169-5181. DOI: 10.18653/v1/2024.findings-acl.306.
Wang, Y., Huang, X., Tian, B., Su, Y., Yu, L., Liao, H., Fan, Y., Guo, J., & Cheng, X. (2025). QUITO-X: A New Perspective on Context Compression from the Information Bottleneck Theory . Findings of EMNLP 2025, 6841-6856. DOI: 10.18653/v1/2025.findings-emnlp.362.
Wang, W., Tong, X., Yu, X., & Huang, S.-L. (2024). On the rate-distortion-perception-semantics tradeoff in low-rate regime for lossy compression . Journal of the Franklin Institute, 361(11), 106873. DOI: 10.1016/j.jfranklin.2024.106873.
系列位置
Paper 01:自然語言的無界精細化假說
Paper 02:自然語言百輪語義壓力測試方法論
Paper 03:自然語言的三種展開機制
Paper 04:邊界不是一個詞
Paper 05:新詞從何而來
Paper 06:語義的展開與收斂:從無界精細化到最小生成核
Paper 07:自然語言精細化的矩陣表示
Paper 08:有限符號與無界語義:自然語言生成、展開與收斂循環