有限符號與無界語義
自然語言生成、展開、收斂與重新基底的統一循環
系列: 自然語言無界精細化與收斂系列Paper: 08 / 08作者: Neo.KAI 協作整理: GPT-5.6 Sol機構: EveMissLab/一言諾科技有限公司版本: v0.1日期: 2026-08-21類型: 系列總論/語言哲學/形式語義/語義動力學/資訊壓縮/符號理論
摘要
本文完成「自然語言無界精細化與收斂系列」的統一模型。系列起點是一個非常簡單的觀察:當一個既有表述被判定為「很接近,但還不夠精準」時,語言系統不一定只會增加更多文字,而可能透過詞彙分裂、條件顯式化、參數化、結構嵌套、遞迴、自指、反例測試與新詞生成持續提高判別力。當這些複合語義結構反覆出現並穩定後,它們又可能被壓縮成新的低成本 primitive;進一步地,大量歷史區分可以被重新收斂成一個能夠重建主要判別的最小生成核候選。
本文將整個循環表示為:
K t → E t S t + → D t S t ♯ → C t K t + 1 \boxed{
K_t
\xrightarrow{\mathcal E_t}
S_t^{+}
\xrightarrow{\mathcal D_t}
S_t^{\sharp}
\xrightarrow{\mathcal C_t}
K_{t+1}
} K t E t S t + D t S t ♯ C t K t + 1
其中:
K t K_t K t :第 t t t 階段的有限生成核;
E t \mathcal E_t E t :語義展開;
S t + S_t^{+} S t + :展開後的高複雜度表示;
D t \mathcal D_t D t :由反例與判別壓力驅動的差異化;
S t ♯ S_t^{\sharp} S t ♯ :已保留有效區分的表示;
C t \mathcal C_t C t :壓縮、晶化、重新基底與生成核收斂;
K t + 1 K_{t+1} K t + 1 :下一階段新的有限入口。
三種主要展開機制為:
E = { E L , E P , E S } , \boxed{
\mathcal E
=
\{
\mathcal E_L,
\mathcal E_P,
\mathcal E_S
\},
} E = { E L , E P , E S } ,
分別對應 Lexical Expansion、Parametric Expansion 與 Structural Expansion。它們可以互相替代,也可以互相轉換。高頻且穩定的 structural pattern 可以晶化為 lexical primitive;過度粗粒度 lexical primitive 可以重新參數化;既有 primitive 亦可被解包回複合結構。
本文將「無界」限定為潛在生成與重新開啟意義:對目前表示不預設一個先驗最大精細層級。它不表示任意議題實際具有無限多有價值的新語義,也不表示有限代理能完成無限輪展開。相反,本系列的核心結構是:
局部有限收斂 + 全域相對無界更新 . \boxed{
\text{局部有限收斂}
+
\text{全域相對無界更新}.
} 局部有限收斂 + 全域相對無界更新 .
每一個有限時間點都可以形成可用的:
K t , K_t, K t ,
但新的反例、尺度、任務或領域可以重新打開:
K t . K_t. K t .
本文進一步將此循環與 compositionality、productivity、lexicalization、Information Bottleneck、Minimum Description Length、semantic compression 與低秩表示等既有研究對照,並明確限制本系列的新意:不是「有限詞彙可以產生大量新表達」,也不是「語言可以被矩陣表示」,而是提出一個判別壓力驅動的語義精細化、局部收斂、primitive 晶化、生成核重建與再次展開之統一動力框架 。
關鍵詞: finite symbols、unbounded semantics、semantic refinement、compositionality、lexicalization、semantic compression、minimal generating kernel、semantic rebase、local convergence、recursive expansion
1. 系列起點:一句「還不夠精準」
本系列不是從一套完整語言理論開始。
起點只是:
一個表述已經很接近,但仍然不夠精準。
若這句話只是修辭評價,它沒有研究價值。
因此 Paper 01 與 Paper 02 把它改造成操作性條件:
若存在:
x , y x,y x , y
使目前表示:
S t ( x ) = S t ( y ) , S_t(x)=S_t(y), S t ( x ) = S t ( y ) ,
但目前任務需要:
T a r g e t ( x ) ≠ T a r g e t ( y ) , Target(x)\neq Target(y), T a r g e t ( x ) = T a r g e t ( y ) ,
則表示存在一個判別缺口。
只有當下一版本:
S t + 1 S_{t+1} S t + 1
能改善這個缺口,才算有效精細化。
即:
D ( S t + 1 ; x , y ) > D ( S t ; x , y ) . \boxed{
D(
S_{t+1};
x,y
)
>
D(
S_t;
x,y
).
} D ( S t + 1 ; x , y ) > D ( S t ; x , y ) .
所以本系列一開始就拒絕:
更長 = 更精準 . \boxed{
\text{更長}
=
\text{更精準}.
} 更長 = 更精準 .
2. 有限符號與巨大表達空間並不是新命題
自然語言 compositionality 與 productivity 的傳統早已強調:有限 lexical resources 與有限 combinatory rules 可以支持極大量、甚至在理想化形式中無界的 complex expressions。
因此,本系列不把:
有限詞彙 + 組合規則 ⇒ 巨大表達空間 \boxed{
\text{有限詞彙}
+
\text{組合規則}
\Rightarrow
\text{巨大表達空間}
} 有限詞彙 + 組合規則 ⇒ 巨大表達空間
當成新發現。
真正的新問題是:
當一個已存在的表達被新的反例證明「解析度不夠」時,表示系統如何改變自己?
這是一個 representation-update 問題,而不只是 sentence-generation 問題。
3. 三種展開自由度
Paper 03 把語義精細化拆成三種自由度。
令:
S t = ( Σ t , P t , O t , E t ) . \mathfrak S_t
=
(
\Sigma_t,
P_t,
\mathcal O_t,
E_t
). S t = ( Σ t , P t , O t , E t ) .
其中:
Σ t \Sigma_t Σ t :可直接調用的 lexical primitive;
P t P_t P t :顯式參數;
O t \mathcal O_t O t :允許的結構操作;
E t E_t E t :由前三者生成的當前表達結構。
因此:
Lexical Expansion
E L : Σ t ⊂ Σ t + 1 . \boxed{
\mathcal E_L:
\Sigma_t
\subset
\Sigma_{t+1}.
} E L : Σ t ⊂ Σ t + 1 .
Parametric Expansion
E P : P t ⊂ P t + 1 . \boxed{
\mathcal E_P:
P_t
\subset
P_{t+1}.
} E P : P t ⊂ P t + 1 .
Structural Expansion
在:
Σ t + 1 = Σ t , \Sigma_{t+1}
=
\Sigma_t, Σ t + 1 = Σ t ,
P t + 1 = P t , P_{t+1}
=
P_t, P t + 1 = P t ,
O t + 1 = O t \mathcal O_{t+1}
=
\mathcal O_t O t + 1 = O t
時仍有:
E t + 1 ≠ E t E_{t+1}
\neq
E_t E t + 1 = E t
且:
Δ D > 0. \Delta D>0. Δ D > 0.
4. 第一個核心結果:字典不增加,語義仍可精細化
百輪測試中特別重要的控制是:
禁止造新詞。
若 lexical growth 是精細化的必要條件,則應立即:
Δ D = 0. \Delta D=0. Δ D = 0.
但實驗仍能藉由參數顯式化增加判別力。
因此:
Δ ∣ Σ ∣ = 0 ⇏ Δ D = 0. \boxed{
\Delta|\Sigma|=0
\not\Rightarrow
\Delta D=0.
} Δ∣Σ∣ = 0 ⇒ Δ D = 0.
接著再禁止新增參數:
Δ ∣ Σ ∣ = 0 , \Delta|\Sigma|=0, Δ∣Σ∣ = 0 ,
Δ ∣ P ∣ = 0. \Delta|P|=0. Δ∣ P ∣ = 0.
固定材料仍可透過否定、條件、模態、嵌套、遞迴與作用域變化產生新的局部判別。
因此:
Δ ∣ Σ ∣ = 0 ∧ Δ ∣ P ∣ = 0 ⇏ Δ D = 0. \boxed{
\Delta|\Sigma|=0
\land
\Delta|P|=0
\not\Rightarrow
\Delta D=0.
} Δ∣Σ∣ = 0 ∧ Δ∣ P ∣ = 0 ⇒ Δ D = 0.
這是本系列的核心 proof-of-concept。
5. Structural Expansion 的意義
假設 primitive 固定:
Σ = { a , b , c } . \Sigma
=
\{a,b,c\}. Σ = { a , b , c } .
仍可生成:
a , a, a ,
¬ a , \neg a, ¬ a ,
a ⇒ b , a\Rightarrow b, a ⇒ b ,
◊ ( a ⇒ b ) , \Diamond(a\Rightarrow b), ◊ ( a ⇒ b ) ,
a ⇒ ( b ⇒ c ) , a\Rightarrow(b\Rightarrow c), a ⇒ ( b ⇒ c ) ,
以及:
J ( a ) , J ( J ( a ) ) , J ( J ( J ( a ) ) ) , … J(a),
\quad
J(J(a)),
\quad
J(J(J(a))),
\ldots J ( a ) , J ( J ( a )) , J ( J ( J ( a ))) , …
形式上可持續增加。
但本系列不把「可一直嵌套」本身等同於有價值的無界語義。
要求始終是:
Δ D > 0. \boxed{
\Delta D>0.
} Δ D > 0.
如果:
D e p t h ( E t + 1 ) > D e p t h ( E t ) Depth(E_{t+1})
>
Depth(E_t) D e pt h ( E t + 1 ) > D e pt h ( E t )
但:
Δ D = 0 , \Delta D=0, Δ D = 0 ,
則只是形式膨脹。
6. 「無界」的嚴格限定
本系列使用的 Unbounded 不等於:
actual infinity completed by an agent . \boxed{
\text{actual infinity completed by an agent}.
} actual infinity completed by an agent .
更精確是:
No fixed a priori maximum refinement depth is assumed. \boxed{
\text{No fixed a priori maximum refinement depth is assumed.}
} No fixed a priori maximum refinement depth is assumed.
對任意當前有限表示:
S t , S_t, S t ,
只要存在新的、任務相關且目前尚未表示的有效差異,就允許:
S t → S t + 1 . S_t
\rightarrow
S_{t+1}. S t → S t + 1 .
如果沒有新差異,
或者新差異的收益低於成本,
則局部支線可以停止。
因此:
formal extensibility ≠ endless useful novelty . \boxed{
\text{formal extensibility}
\neq
\text{endless useful novelty}.
} formal extensibility = endless useful novelty .
7. 百輪 Case Study 提供了什麼
Paper 04 使用「邊界」做完整 case study。
起始只有:
邊界是兩個不同區域或狀態之間的分隔。
反例迫使它分裂出:
物理與規約;
穩定構造與狀態界面;
躍遷與梯度;
內生與判準;
描述與施效;
約束與觸發;
可達與模型終止;
對稱與非對稱;
實際與模態;
對象層與自指層。
這一階段看起來像:
1 → N . 1
\rightarrow
N. 1 → N .
但後續收斂發現,大量 subtype 可以重新表示為較少的生成軸。
8. 邊界案例的局部生成核
Paper 04 暫時得到:
K B = { Δ , C , J , A } . \boxed{
K_B
=
\{
\Delta,
C,
J,
A
\}.
} K B = { Δ , C , J , A } .
其中:
Δ \Delta Δ :目前相關的非等價;
C C C :條件;
J J J :判準;
A A A :作用或後果。
搭配:
K O = { ¬ , ∧ , ∨ , ⇒ , ∘ , R e c u r s i o n } . \boxed{
K_O
=
\{
\neg,
\land,
\lor,
\Rightarrow,
\circ,
Recursion
\}.
} K O = { ¬ , ∧ , ∨ , ⇒ , ∘ , R ec u r s i o n } .
由此大量早期 boundary subtype 可以被重新生成。
重要的是:
K B \boxed{
K_B
} K B
不是聲稱世界最終由四個 primitive 組成。
它只是:
在目前 boundary history 上具有高重建能力的局部生成核候選。
9. 從新詞到 Symbol Crystallization
Paper 05 反過來問:
如果長結構已經可以由舊語言完整表達,為什麼還會需要新詞?
令:
φ \varphi φ
是一個高成本複合語義。
若建立:
z z z
使:
E n c o d e ( φ ) = z , Encode(\varphi)=z, E n co d e ( φ ) = z ,
以及:
D e c o d e ( z ) ≈ φ , Decode(z)\approx\varphi, D eco d e ( z ) ≈ φ ,
則在本系列工作語言中:
Crystallize ( φ ) = z . \boxed{
\operatorname{Crystallize}(\varphi)=z.
} Crystallize ( φ ) = z .
「晶化」不是 lexicalization 的替代名稱,而是表示層上的壓縮操作。
10. Primitive 有兩種不同價值
一個新 primitive:
z z z
可能真的增加新判別軸:
V D ( z ) > 0. V_D(z)>0. V D ( z ) > 0.
也可能不增加新維度,只把反覆長結構壓短:
V C ( z ) > 0. V_C(z)>0. V C ( z ) > 0.
所以:
V ( z ) = V D ( z ) + V C ( z ) . \boxed{
V(z)
=
V_D(z)
+
V_C(z).
} V ( z ) = V D ( z ) + V C ( z ) .
這表示:
new symbol ⇏ new semantic dimension . \boxed{
\text{new symbol}
\not\Rightarrow
\text{new semantic dimension}.
} new symbol ⇒ new semantic dimension .
有些新詞只是新的低成本入口。
11. 晶化效用
Paper 05 定義工作性的:
U c r y s = α R + β D + γ S + η C s a v e − λ E d e c o d e − μ A − ν C d e f i n e . \boxed{
U_{\mathrm{crys}}
=
\alpha R
+
\beta D
+
\gamma S
+
\eta C_{\mathrm{save}}
-
\lambda E_{\mathrm{decode}}
-
\mu A
-
\nu C_{\mathrm{define}}.
} U crys = α R + β D + γ S + η C save − λ E decode − μ A − ν C define .
其中:
R R R :重用收益;
D D D :判別價值;
S S S :語義穩定;
C s a v e C_{\mathrm{save}} C save :成本節省;
E d e c o d e E_{\mathrm{decode}} E decode :解碼誤差;
A A A :歧義負擔;
C d e f i n e C_{\mathrm{define}} C define :建立與維護成本。
若:
U c r y s > 0 , U_{\mathrm{crys}}>0, U crys > 0 ,
建立新 primitive 才有工作性理由。
12. 新詞不是終點
一旦:
φ → z , \varphi
\rightarrow
z, φ → z ,
z z z 可以參加下一輪組合:
z → φ ′ → z ′ . z
\rightarrow
\varphi'
\rightarrow
z'. z → φ ′ → z ′ .
因此:
compound → primitive → compound \boxed{
\text{compound}
\rightarrow
\text{primitive}
\rightarrow
\text{compound}
} compound → primitive → compound
不是矛盾,而是正常表示循環。
這也解釋為何詞彙化與 compositionality 不是互斥:
primitive 是上一輪複合語義的壓縮結果,也可以成為下一輪 compositional process 的輸入。
13. 語義收斂的必要性
如果:
S 0 → S 1 → ⋯ S_0
\rightarrow
S_1
\rightarrow
\cdots S 0 → S 1 → ⋯
只允許 complexity 上升,
最終得到的是:
semantic accumulation . \boxed{
\text{semantic accumulation}.
} semantic accumulation .
不是可工作的知識系統。
因此 Paper 06 引入:
K ∗ \boxed{
K^\ast
} K ∗
作為最小生成核候選。
14. 最小生成核
令歷史壓力案例為:
H T = ⋃ t = 0 T X t . H_T
=
\bigcup_{t=0}^{T}X_t. H T = t = 0 ⋃ T X t .
候選 kernel:
K . K. K .
生成閉包:
Gen ( K ) . \operatorname{Gen}(K). Gen ( K ) .
若:
E r r o r ( Gen ( K ) ; H T ) ≤ ϵ , \boxed{
Error(
\operatorname{Gen}(K);
H_T
)
\le
\epsilon,
} E r r or ( Gen ( K ) ; H T ) ≤ ϵ ,
則 K K K 對目前歷史近似充分。
再尋找:
K ∗ ∈ arg min K C o m p l e x i t y ( K ) \boxed{
K^\ast
\in
\arg\min_K
Complexity(K)
} K ∗ ∈ arg K min C o m pl e x i t y ( K )
subject to regression 與 reconstruction constraints。
這與 Information Bottleneck、MDL、minimal sufficient representation 與 algorithmic statistics 有親緣關係,但被放進本系列的動態 refinement history。
15. Kernel 不是摘要
摘要只要:
S u m m a r i z e ( S ) Summarize(S) S u mma r i z e ( S )
即可。
生成核還必須:
R e G e n e r a t e ( K ) \boxed{
ReGenerate(K)
} R e G e n er a t e ( K )
能重新產生歷史上已被證明重要的區分。
因此:
K e r n e l = C o m p r e s s i o n + R e G e n e r a b i l i t y . \boxed{
Kernel
=
Compression
+
ReGenerability.
} K er n e l = C o m p r ess i o n + R e G e n er abi l i t y .
16. Kernel + Counterexample Basis
只保存 kernel 仍可能造成歷史失憶。
因此 Paper 06 定義:
K T = ( K T , B T ) , \boxed{
\mathcal K_T
=
(
K_T,
B_T
),
} K T = ( K T , B T ) ,
其中:
B T ⊆ H T B_T
\subseteq
H_T B T ⊆ H T
是代表性的 Counterexample Basis。
理想情況:
∣ B T ∣ ≪ ∣ H T ∣ |B_T|
\ll
|H_T| ∣ B T ∣ ≪ ∣ H T ∣
但:
R e g r e s s i o n S e n s i t i v i t y ( B T ) ≈ R e g r e s s i o n S e n s i t i v i t y ( H T ) . RegressionSensitivity(B_T)
\approx
RegressionSensitivity(H_T). R e g r ess i o n S e n s i t i v i t y ( B T ) ≈ R e g r ess i o n S e n s i t i v i t y ( H T ) .
所以真正可持續收斂同時壓縮:
17. 局部收斂與全域更新
若:
K t K_t K t
在目前案例上已經充分,
新的:
Z Z Z
仍可能造成:
E r r o r ( K t ; Z ) > ϵ . Error(K_t;Z)>\epsilon. E r r or ( K t ; Z ) > ϵ .
於是:
K t → E x p a n d ( K t ; Z ) → S t + 1 → K t + 1 . K_t
\rightarrow
Expand(K_t;Z)
\rightarrow
S_{t+1}
\rightarrow
K_{t+1}. K t → E x p an d ( K t ; Z ) → S t + 1 → K t + 1 .
因此:
K t \boxed{
K_t
} K t
是:
temporary stable interface . \boxed{
\text{temporary stable interface}.
} temporary stable interface .
不是終極語義。
18. 統一循環
現在可以把整個系列壓成:
K t → E t S t + → D t S t ♯ → C t K t + 1 . \boxed{
K_t
\xrightarrow{\mathcal E_t}
S_t^{+}
\xrightarrow{\mathcal D_t}
S_t^{\sharp}
\xrightarrow{\mathcal C_t}
K_{t+1}.
} K t E t S t + D t S t ♯ C t K t + 1 .
其中:
展開
E t ∈ { E L , E P , E S } . \mathcal E_t
\in
\{
\mathcal E_L,
\mathcal E_P,
\mathcal E_S
\}. E t ∈ { E L , E P , E S } .
差異化
D t \mathcal D_t D t
由:
counterexamples;
minimal contrasts;
boundary cases;
negation;
direction reversal;
modal variation;
recursion tests;
驅動。
收斂
C t \mathcal C_t C t
包含:
lexical crystallization;
parameter elimination;
structural factorization;
rebase;
low-rank compression;
kernel search。
19. 語義呼吸
因此可以寫:
B t = C t ∘ D t ∘ E t . \boxed{
\mathcal B_t
=
\mathcal C_t
\circ
\mathcal D_t
\circ
\mathcal E_t.
} B t = C t ∘ D t ∘ E t .
若加入驗證與固化:
H t , \mathcal H_t, H t ,
則:
B t = H t ∘ C t ∘ D t ∘ E t . \boxed{
\mathcal B_t
=
\mathcal H_t
\circ
\mathcal C_t
\circ
\mathcal D_t
\circ
\mathcal E_t.
} B t = H t ∘ C t ∘ D t ∘ E t .
一次完整語義呼吸產生:
K t + 1 = B t ( K t ) . K_{t+1}
=
\mathcal B_t(K_t). K t + 1 = B t ( K t ) .
20. 由 1 t 1_t 1 t 到 N t N_t N t 再回到 1 t + 1 1_{t+1} 1 t + 1
整個系列也可以用更抽象的符號表示:
1 t → N t → r t → 1 t + 1 → N t + 1 → ⋯ . \boxed{
1_t
\rightarrow
N_t
\rightarrow
r_t
\rightarrow
1_{t+1}
\rightarrow
N_{t+1}
\rightarrow
\cdots.
} 1 t → N t → r t → 1 t + 1 → N t + 1 → ⋯ .
其中:
1 t 1_t 1 t
不是「真的只有一個詞」,而是可被當成單一低成本入口的 primitive 或 kernel。
N t N_t N t
表示其可展開的高維複合語義空間。
r t r_t r t
表示在目前任務下足以保持主要差異的較低維生成結構。
新的:
1 t + 1 1_{t+1} 1 t + 1
則是經 rebase 或 crystallization 形成的新入口。
21. 為什麼 1 t 1_t 1 t 不等於完整世界
一個 primitive 可以高度壓縮。
但:
z ≠ world . \boxed{
z
\neq
\text{world}.
} z = world .
更合理的是:
z = an interface into a reconstructable semantic structure . \boxed{
z
=
\text{an interface into a reconstructable semantic structure}.
} z = an interface into a reconstructable semantic structure .
因此即使:
z → N z
\rightarrow
N z → N
可以展開很多內容,
也不能推出:
z z z
在本體上包含完整世界。
這是本系列對符號本體化的核心限制。
22. 有限符號與相對無界語義
令:
∣ Σ t ∣ < ∞ |\Sigma_t|<\infty ∣ Σ t ∣ < ∞
且:
∣ O t ∣ < ∞ . |\mathcal O_t|<\infty. ∣ O t ∣ < ∞.
只要允許某些遞迴組合,形式上可能:
∣ Closure ( Σ t , O t ) ∣ |
\operatorname{Closure}
(
\Sigma_t,
\mathcal O_t
)
| ∣ Closure ( Σ t , O t ) ∣
極大或不設固定有限上限。
但本系列真正關心的是其中:
task-relevant distinguishable structures . \boxed{
\text{task-relevant distinguishable structures}.
} task-relevant distinguishable structures .
不是所有形式字串。
所以更精確的無界命題是:
目前不預設可產生有效新區分的最大深度。 \boxed{
\text{目前不預設可產生有效新區分的最大深度。}
} 目前不預設可產生有效新區分的最大深度。
而不是:
任何增加深度都具有新語義 . \boxed{
\text{任何增加深度都具有新語義}.
} 任何增加深度都具有新語義 .
23. 全域無界與局部有限
本系列的核心可以壓成:
∀ t : ∣ K t ∣ < ∞ \boxed{
\forall t:
|K_t|<\infty
} ∀ t : ∣ K t ∣ < ∞
但不要求存在:
T max T_{\max} T m a x
使:
K t = K T max K_t
=
K_{T_{\max}} K t = K T m a x
對所有未來情況永遠成立。
因此:
finite local state + open-ended update path . \boxed{
\text{finite local state}
+
\text{open-ended update path}.
} finite local state + open-ended update path .
這就是:
局部有限收斂 + 全域相對無界 . \boxed{
\text{局部有限收斂}
+
\text{全域相對無界}.
} 局部有限收斂 + 全域相對無界 .
24. 矩陣總模型
Paper 07 把單輪語義處理寫成:
X t → C t → J t → L t → K t → A t → E t → b t . \boxed{
\mathbf X_t
\rightarrow
\mathbf C_t
\rightarrow
\mathcal J_t
\rightarrow
\mathbf L_t
\rightarrow
\mathbf K_t
\rightarrow
\mathbf A_t
\rightarrow
\mathbf E_t
\rightarrow
\mathbf b_t.
} X t → C t → J t → L t → K t → A t → E t → b t .
其中:
X t \mathbf X_t X t :狀態;
C t \mathbf C_t C t :條件投影;
J t \mathcal J_t J t :判準;
L t \mathbf L_t L t :比較;
K t \mathbf K_t K t :判準後差異;
A t \mathbf A_t A t :作用映射;
E t \mathbf E_t E t :有效作用差異;
b t \mathbf b_t b t :有效強度。
25. 動態回饋
Paper 07 進一步加入:
X t + 1 = X t + η L t ⊤ E t W t . \boxed{
\mathbf X_{t+1}
=
\mathbf X_t
+
\eta
\mathbf L_t^\top
\mathbf E_t
\mathbf W_t.
} X t + 1 = X t + η L t ⊤ E t W t .
因此分類與邊界不只描述世界,也可以改變後續狀態。
即:
representation → action → new state . \boxed{
\text{representation}
\rightarrow
\text{action}
\rightarrow
\text{new state}.
} representation → action → new state .
這使語義動力與世界動力至少在模型中可以互相耦合。
26. 跨輪語義矩陣
令:
S t ∈ R N × d t \mathbf S_t
\in
\mathbb R^{N\times d_t} S t ∈ R N × d t
保存截至目前的案例語義表示。
新增語義欄:
z \mathbf z z
若造成:
rank [ S t z ] > rank ( S t ) , \operatorname{rank}
\begin{bmatrix}
\mathbf S_t&\mathbf z
\end{bmatrix}
>
\operatorname{rank}(
\mathbf S_t
), rank [ S t z ] > rank ( S t ) ,
則至少在線性工作模型中增加新的獨立方向。
若 rank 不變,但成本降低,則可能是 compression primitive。
27. Effective Rank 與局部收斂
定義:
r ϵ ( S ) = min { r : ∑ i > r σ i 2 ∑ i σ i 2 ≤ ϵ } . \boxed{
r_\epsilon(
\mathbf S
)
=
\min
\left\{
r:
\frac{
\sum_{i>r}\sigma_i^2
}{
\sum_i\sigma_i^2
}
\le
\epsilon
\right\}.
} r ϵ ( S ) = min { r : ∑ i σ i 2 ∑ i > r σ i 2 ≤ ϵ } .
若 refinement 持續增加欄位,但:
r ϵ ( S t ) r_\epsilon(
\mathbf S_t
) r ϵ ( S t )
不再增加,
而歷史判別 gain:
E D G t EDG_t E D G t
也趨近零,
則適合啟動收斂。
28. Rebase
令:
R t \mathbf R_t R t
為 encoder,
D t \mathbf D_t D t
為 decoder。
低維表示:
Z t = S t R t . \boxed{
\mathbf Z_t
=
\mathbf S_t\mathbf R_t.
} Z t = S t R t .
重建:
S ^ t = Z t D t . \boxed{
\widehat{\mathbf S}_t
=
\mathbf Z_t\mathbf D_t.
} S t = Z t D t .
如果:
L D ( S ^ t ) ≤ L D ( S t ) + ϵ , \mathcal L_D(
\widehat{\mathbf S}_t
)
\le
\mathcal L_D(
\mathbf S_t
)
+
\epsilon, L D ( S t ) ≤ L D ( S t ) + ϵ ,
就得到 task-preserving compression。
29. 收斂不是最低 rank
如果:
r = 0 r=0 r = 0
當然最小,
但語義全失。
因此:
convergence = compression under distortion constraints . \boxed{
\text{convergence}
=
\text{compression under distortion constraints}.
} convergence = compression under distortion constraints .
也就是:
min C o m p l e x i t y ( K ) + β D i s t o r t i o n ( K ) . \boxed{
\min
Complexity(K)
+
\beta
Distortion(K).
} min C o m pl e x i t y ( K ) + β D i s t or t i o n ( K ) .
這與 Information Bottleneck、rate-distortion 與 semantic compression 的精神一致。
30. Compositionality 與 Crystallization 是循環而非競爭
Compositionality 說明:
parts + structure → complex meaning . \text{parts}
+
\text{structure}
\rightarrow
\text{complex meaning}. parts + structure → complex meaning .
Crystallization 則說明:
stable complex meaning → new low-cost primitive . \text{stable complex meaning}
\rightarrow
\text{new low-cost primitive}. stable complex meaning → new low-cost primitive .
所以兩者形成:
primitive → composition → stable compound → primitive . \boxed{
\text{primitive}
\rightarrow
\text{composition}
\rightarrow
\text{stable compound}
\rightarrow
\text{primitive}.
} primitive → composition → stable compound → primitive .
這是本系列對「詞彙」與「組合」關係最核心的統一。
31. 語義經濟的兩個方向
語言系統持續面對兩種相反壓力。
壓力 A:區分不足
要求:
E x p a n d . Expand. E x p an d .
壓力 B:表示過重
要求:
C o m p r e s s . Compress. C o m p r ess .
因此自然語言不是單純追求最大精度,也不是單純追求最短表達。
它是在:
distinguishability ↔ cost \boxed{
\text{distinguishability}
\leftrightarrow
\text{cost}
} distinguishability ↔ cost
之間動態調整。
32. 語義效用函數
可以用一個總工作函數表示:
U t = α D t + β R t + γ T t − λ C t − μ E t − ν A t . \boxed{
U_t
=
\alpha D_t
+
\beta R_t
+
\gamma T_t
-
\lambda C_t
-
\mu E_t
-
\nu A_t.
} U t = α D t + β R t + γ T t − λ C t − μ E t − ν A t .
其中:
D t D_t D t :判別力;
R t R_t R t :重建能力;
T t T_t T t :跨情境/跨案例可轉用性;
C t C_t C t :表示成本;
E t E_t E t :失真;
A t A_t A t :歧義負擔。
不同任務可以有不同權重。
這不是語言心理學定律,而是整個系列的工程性 objective family。
33. 五種失敗模式
33.1 Lexical Explosion
新詞大量增加,但沒有判別或壓縮價值。
33.2 Parameter Explosion
條件一直增加,最後接近完整世界描述。
33.3 Structural Explosion
嵌套一直增加,但:
Δ D → 0. \Delta D
\rightarrow
0. Δ D → 0.
33.4 Over-Compression
Kernel 很短,但大量歷史反例失敗。
33.5 Premature Closure
尚有高價值反例未處理,就宣稱最終定義已完成。
完整模型必須同時防止前四種膨脹與第五種過早停止。
34. 收斂條件
本系列最強的局部收斂至少需要:
E D G t ≤ ϵ G \boxed{
EDG_t
\le
\epsilon_G
} E D G t ≤ ϵ G
連續多輪,
並存在:
K t K_t K t
使:
E r r o r ( Gen ( K t ) ; H t ) ≤ ϵ R Error(
\operatorname{Gen}(K_t);
H_t
)
\le
\epsilon_R E r r or ( Gen ( K t ) ; H t ) ≤ ϵ R
以及:
C o m p l e x i t y ( K t ) < C o m p l e x i t y ( S t ) . Complexity(K_t)
<
Complexity(S_t). C o m pl e x i t y ( K t ) < C o m pl e x i t y ( S t ) .
若還有 Counterexample Basis:
B t , B_t, B t ,
則形成更穩定的:
K t = ( K t , B t ) . \boxed{
\mathcal K_t
=
(
K_t,
B_t
).
} K t = ( K t , B t ) .
35. 再展開條件
只要新案例:
Z Z Z
造成:
E r r o r ( K t ; Z ) > ϵ Z , Error(K_t;Z)
>
\epsilon_Z, E r r or ( K t ; Z ) > ϵ Z ,
則:
R e O p e n ( K t ; Z ) = 1. \boxed{
ReOpen(K_t;Z)=1.
} R e O p e n ( K t ; Z ) = 1.
接著:
K t → S t + 1 + . K_t
\rightarrow
S_{t+1}^{+}. K t → S t + 1 + .
因此:
closed for now ≠ closed forever . \boxed{
\text{closed for now}
\neq
\text{closed forever}.
} closed for now = closed forever .
36. 表示歷史不是聊天全文
完整 transcript:
T t T_t T t
可能非常大。
本系列最終並不主張永久保留每一句話。
更有效結構是:
K t = ( K t , B t , M t ) , \boxed{
\mathcal K_t
=
(
K_t,
B_t,
M_t
),
} K t = ( K t , B t , M t ) ,
其中:
K t K_t K t :生成核;
B t B_t B t :反例基底;
M t M_t M t :必要版本與推導 metadata。
這比保留所有自然語言歷史更接近可持續知識結構。
37. Canonical Source 與 Rendered Language
在實際知識系統中,rendered prose 與 canonical representation 也應被區分。
自然語言長文可以是:
R e n d e r ( K t ) . Render(K_t). R e n d er ( K t ) .
但正式保存應包含:
K t , B t , M t K_t,
\quad
B_t,
\quad
M_t K t , B t , M t
以及必要公式與定義。
因此:
rendering ≠ canonical source . \boxed{
\text{rendering}
\neq
\text{canonical source}.
} rendering = canonical source .
這也與本系列「複合語義可再次展開」的思想一致。
38. 對人類語言的保守解讀
本系列只做了一個 AI self-dialogue proof-of-concept。
因此最多支持:
強語言生成系統能在逐步限制下展示多種有效 refinement 機制。 \boxed{
\text{強語言生成系統能在逐步限制下展示多種有效 refinement 機制。}
} 強語言生成系統能在逐步限制下展示多種有效 refinement 機制。
不能直接推出:
人類語言演化完全遵循本模型 . \boxed{
\text{人類語言演化完全遵循本模型}.
} 人類語言演化完全遵循本模型 .
要支持後者,需要:
人類實驗;
歷史詞彙資料;
多語言;
多模型;
外部 holdout;
固定 contrast sets;
longitudinal data。
39. 對 AI 的保守解讀
本系列也不研究 AI 與 AI 共享語義域。
A/B 角色只是在同一語義壓力流程中的:
P r o p o s e Propose P r o p ose
與:
C r i t i q u e . Critique. C r i t i q u e .
因此本文不從百輪實驗推出:
AI 具有共同內在語言;
AI 共享同一本體;
AI 已形成自主社會 lexicalization。
這些是不同研究問題。
40. 可檢驗總預測
P1
不同題目應呈現不同:
( e L , e P , e S ) . (
e_L,e_P,e_S
). ( e L , e P , e S ) .
P2
禁止新詞後,應仍存在一段:
E D G t > 0. EDG_t>0. E D G t > 0.
P3
禁止新詞與新參數後,Structural Expansion 仍可能暫時:
E D G t > 0. EDG_t>0. E D G t > 0.
P4
高頻穩定複合結構應提高 crystallization 機率。
P5
成熟 refinement history 應存在:
C o m p l e x i t y ( K ) < C o m p l e x i t y ( S ) Complexity(K)
<
Complexity(S) C o m pl e x i t y ( K ) < C o m pl e x i t y ( S )
且保持主要判別的壓縮空間。
P6
不同 refinement paths 可以收斂到不同但近似等效的:
K 1 , K 2 . K_1,
K_2. K 1 , K 2 .
P7
新跨域案例應在部分情況下重新打開舊 kernel。
41. 系列的八篇分工
Paper 01
提出:
自然語言無界精細化假說 . \boxed{
\text{自然語言無界精細化假說}.
} 自然語言無界精細化假說 .
Paper 02
把「很接近,但還不夠精準」變成可回歸測試的百輪方法。
Paper 03
分離:
E L , E P , E S . \mathcal E_L,
\quad
\mathcal E_P,
\quad
\mathcal E_S. E L , E P , E S .
Paper 04
以「邊界」完成百輪 case study。
Paper 05
研究:
complex structure → new primitive . \text{complex structure}
\rightarrow
\text{new primitive}. complex structure → new primitive .
Paper 06
研究:
S T → K ∗ . S_T
\rightarrow
K^\ast. S T → K ∗ .
Paper 07
把 refinement 與 convergence 轉成矩陣 specification。
Paper 08
把所有機制統一為:
K t → S t + → S t ♯ → K t + 1 . \boxed{
K_t
\rightarrow
S_t^{+}
\rightarrow
S_t^{\sharp}
\rightarrow
K_{t+1}.
} K t → S t + → S t ♯ → K t + 1 .
42. 系列最短總模型
若只保留一條式子:
K t → E L ∪ E P ∪ E S S t + → pressure S t ♯ → compress/rebase K t + 1 . \boxed{
K_t
\xrightarrow{
\mathcal E_L
\cup
\mathcal E_P
\cup
\mathcal E_S
}
S_t^{+}
\xrightarrow{
\text{pressure}
}
S_t^{\sharp}
\xrightarrow{
\text{compress/rebase}
}
K_{t+1}.
} K t E L ∪ E P ∪ E S S t + pressure S t ♯ compress/rebase K t + 1 .
若再壓縮:
1 t → N t → r t → 1 t + 1 . \boxed{
1_t
\rightarrow
N_t
\rightarrow
r_t
\rightarrow
1_{t+1}.
} 1 t → N t → r t → 1 t + 1 .
這就是整個系列的 canonical cycle。
43. 系列最重要的否定命題
本系列不主張:
more words = more meaning . \boxed{
\text{more words}
=
\text{more meaning}.
} more words = more meaning .
不主張:
more depth = more distinction . \boxed{
\text{more depth}
=
\text{more distinction}.
} more depth = more distinction .
不主張:
compression = lossless truth . \boxed{
\text{compression}
=
\text{lossless truth}.
} compression = lossless truth .
不主張:
minimal representation = fundamental ontology . \boxed{
\text{minimal representation}
=
\text{fundamental ontology}.
} minimal representation = fundamental ontology .
也不主張:
potentially unbounded = actually infinite . \boxed{
\text{potentially unbounded}
=
\text{actually infinite}.
} potentially unbounded = actually infinite .
這五個否定條件是避免整套模型失控的核心安全邊界。
44. 系列最重要的正命題
本文提出以下工作性正命題:
有限 primitive + 可組合結構 + 判別壓力 + 可逆程度不同的壓縮 \boxed{
\text{有限 primitive}
+
\text{可組合結構}
+
\text{判別壓力}
+
\text{可逆程度不同的壓縮}
} 有限 primitive + 可組合結構 + 判別壓力 + 可逆程度不同的壓縮
可以形成:
不預設最大精細層級的語義更新循環 . \boxed{
\text{不預設最大精細層級的語義更新循環}.
} 不預設最大精細層級的語義更新循環 .
而且:
局部上可以不斷形成有限、可用、可驗證的收斂態 . \boxed{
\text{局部上可以不斷形成有限、可用、可驗證的收斂態}.
} 局部上可以不斷形成有限、可用、可驗證的收斂態 .
45. 結論
系列最初只是一次自然語言遊戲:
「你說得很接近,但還不夠精準。」
一百輪後,真正留下來的不是一百個答案,而是一種表示動力。
首先:
粗粒度 primitive \boxed{
\text{粗粒度 primitive}
} 粗粒度 primitive
遭遇:
判別壓力 . \boxed{
\text{判別壓力}.
} 判別壓力 .
它可以透過:
E L , E P , E S \boxed{
\mathcal E_L,
\quad
\mathcal E_P,
\quad
\mathcal E_S
} E L , E P , E S
增加解析度。
當結構反覆出現時,可以:
Crystallize \boxed{
\operatorname{Crystallize}
} Crystallize
形成新的低成本 primitive。
當整體表示過度膨脹時,可以尋找:
K ∗ \boxed{
K^\ast
} K ∗
作為最小生成核候選。
在矩陣形式中,這變成:
S t → Z t → S ^ t \boxed{
\mathbf S_t
\rightarrow
\mathbf Z_t
\rightarrow
\widehat{\mathbf S}_t
} S t → Z t → S t
並要求壓縮後仍保留歷史判別能力。
新反例出現時,kernel 再次被打開。
因此最終循環是:
K t → S t + → S t ♯ → K t + 1 → S t + 1 + → ⋯ . \boxed{
K_t
\rightarrow
S_t^{+}
\rightarrow
S_t^{\sharp}
\rightarrow
K_{t+1}
\rightarrow
S_{t+1}^{+}
\rightarrow
\cdots.
} K t → S t + → S t ♯ → K t + 1 → S t + 1 + → ⋯ .
所以「有限符號與無界語義」並不意味有限符號神奇地包含一個實際完成的無限世界。
它表示:
有限、局部、可操作的符號基底,可以透過組合、反例壓力、重新分類、壓縮與重新基底,持續進入新的有限表示;而整條更新路徑不需要先驗指定一個最終的最大語義解析度。
最短地說:
有限入口 + 可重開的展開 + 可驗證的收斂 = 相對無界的語義演化 . \boxed{
\text{有限入口}
+
\text{可重開的展開}
+
\text{可驗證的收斂}
=
\text{相對無界的語義演化}.
} 有限入口 + 可重開的展開 + 可驗證的收斂 = 相對無界的語義演化 .
這就是本系列的最終命題。
參考文獻
Stanford Encyclopedia of Philosophy. Compositionality . Current 2025 edition.
Open Encyclopedia of Cognitive Science. Compositionality . MIT Press Direct.
Xu, A., Kemp, C., Frermann, L., & Xu, Y. (2024). Word reuse and combination support efficient communication of emerging concepts . Proceedings of the National Academy of Sciences, 121(46), e2406971121.
Yu, L., & Xu, Y. (2025). Infinite Mixture Chaining: An Efficiency-Based Framework for the Dynamic Construction of Word Meaning . Open Mind: Discoveries in Cognitive Science, 9, 1-24.
Tishby, N., Pereira, F. C., & Bialek, W. (2000). The Information Bottleneck Method . arXiv:physics/0004057.
Gacs, P., Tromp, J. T., & Vitanyi, P. M. B. (2001). Algorithmic Statistics . IEEE Transactions on Information Theory, 47(6), 2443-2463.
Fei, W., Niu, X., Zhou, P., Hou, L., Bai, B., Deng, L., & Han, W. (2024). Extending Context Window of Large Language Models via Semantic Compression . Findings of ACL 2024, 5169-5181.
Coecke, B., Sadrzadeh, M., & Clark, S. (2011). Mathematical Foundations for a Compositional Distributional Model of Meaning . Linguistic Analysis, 36, 345-384.
Mu, J., Bhat, S., & Viswanath, P. (2017). Representing Sentences as Low-Rank Subspaces . EMNLP 2017.
Golowich, N., Liu, A., & Shetty, A. (2026). Sequences of Logits Reveal the Low Rank Structure of Language Models . ICLR 2026.
系列完成
《自然語言的無界精細化假說》
《從「很接近,但還不夠精準」開始:自然語言百輪語義壓力測試方法論》
《自然語言的三種展開機制》
《邊界不是一個詞:邊界本體論的百輪語義壓力測試》
《新詞從何而來:複合語義、重複結構與符號晶化》
《語義的展開與收斂:從無界精細化到最小生成核》
《自然語言精細化的矩陣表示》
《有限符號與無界語義:自然語言生成、展開、收斂與重新基底的統一循環》