自然語言的三種展開機制
詞彙展開、參數展開與結構展開的分離、替代與轉換
系列: 自然語言無界精細化與收斂系列Paper: 03 / 08作者: Neo.KAI 協作整理: GPT-5.6 Sol機構: EveMissLab/一言諾科技有限公司版本: v0.1日期: 2026-08-20類型: 語言哲學/形式語義/概念工程/語義動力學/理論模型
摘要
本文提出自然語言精細化的三機制模型,將一個表示系統在「既有表述已接近,但不足以維持所需判別力」時可能採取的展開方式區分為:詞彙展開(Lexical Expansion)、參數展開(Parametric Expansion)與結構展開(Structural Expansion)。
三者分別對應三種不同的表示修改。詞彙展開改變可直接調用的語義 primitive 集合;參數展開保持主要詞彙不變,但把原本隱含於使用情境中的條件、尺度、時間、角色、容許誤差或作用類型顯式化;結構展開則在詞彙與參數均固定時,利用既有運算與句法資源的否定、條件化、嵌套、遞迴、模態與關係反轉生成新的可區分結構。
本文以統一表示狀態:
S t = ( Σ t , P t , O t , E t ) \mathfrak S_t
=
(
\Sigma_t,
P_t,
\mathcal O_t,
E_t
) S t = ( Σ t , P t , O t , E t )
描述第 t t t 輪語義系統,其中 Σ t \Sigma_t Σ t 是 lexical primitive 集合, P t P_t P t 是顯式參數集合, O t \mathcal O_t O t 是允許的結構運算集合, E t E_t E t 是由前三者生成的當前表達結構。由此可以把三種展開分別表示為:
E L : Σ t ⊂ Σ t + 1 , \mathcal E_L:
\Sigma_t
\subset
\Sigma_{t+1}, E L : Σ t ⊂ Σ t + 1 ,
E P : P t ⊂ P t + 1 , \mathcal E_P:
P_t
\subset
P_{t+1}, E P : P t ⊂ P t + 1 ,
以及在:
Σ t + 1 = Σ t , P t + 1 = P t , O t + 1 = O t \Sigma_{t+1}
=
\Sigma_t,
\qquad
P_{t+1}
=
P_t,
\qquad
\mathcal O_{t+1}
=
\mathcal O_t Σ t + 1 = Σ t , P t + 1 = P t , O t + 1 = O t
條件下仍有:
D e p t h ( E t + 1 ) > D e p t h ( E t ) Depth(E_{t+1})
>
Depth(E_t) D e pt h ( E t + 1 ) > D e pt h ( E t )
或新的有效結構關係被生成。
本文進一步主張,三種展開並非單向層級,而是具有替代、競爭與轉換關係。反覆出現的結構展開可以被壓縮成新 lexical primitive;過度膨脹的 lexical inventory 可以重新展開為參數化結構;參數的反覆共現亦可能形成新詞。本文因此提出一個語義表示選擇問題:對同一判別需求,系統應選擇哪種展開,取決於判別收益、表示成本、重用頻率與重建誤差之間的折衷。
本文不把三機制模型視為現有語言學分類的替代方案,而將它定位為本系列 100 輪語義壓力測試中觀察到的表示更新機制,並提出可供後續實驗比較的形式判準。
關鍵詞: lexical expansion、parametric expansion、structural expansion、compositionality、lexicalization、context sensitivity、語義精細化、表示成本、語義壓縮、符號晶化
1. 問題:當一個詞不夠精準時,究竟改了什麼
「詞不夠精準,所以造一個更精準的詞」只是語言精細化的一種可能。
前兩篇已經得到一個更一般的問題:
S t 無法維持目前需要的判別力時, S t + 1 必須在哪裡發生改變? \boxed{
S_t
\text{ 無法維持目前需要的判別力時,}
S_{t+1}
\text{ 必須在哪裡發生改變?}
} S t 無法維持目前需要的判別力時, S t + 1 必須在哪裡發生改變?
最直觀的答案是增加詞彙。
例如一個粗粒度詞 s s s 同時覆蓋:
x and y , x
\quad\text{and}\quad
y, x and y ,
而研究任務要求:
T a r g e t ( x ) ≠ T a r g e t ( y ) . Target(x)\neq Target(y). T a r g e t ( x ) = T a r g e t ( y ) .
可以造出:
s x , s y . s_x,
\qquad
s_y. s x , s y .
但 100 輪壓力測試顯示,禁止造詞後精細化仍可持續;進一步禁止新增參數後,結構組合仍能產生新的有效區分。
因此,本系列需要把「語言變精準」分解為至少三種表示修改,而不能把所有精細化都歸於 lexical growth。
2. 與既有研究的邊界
近年的 lexical evolution 研究已經明確指出,有限詞彙可以透過詞義延伸、重用與組合支援不斷出現的新概念。Yu 與 Xu 將詞彙描述為一個以有限 vocabulary 表達無界 emerging meanings 的演化符號系統,並以表示精度與記憶複雜度之間的折衷建模動態詞義延伸。
Xu、Kemp、Frermann 與 Xu 對英語、法語與芬蘭語歷史詞彙的研究則指出,word reuse 與 combination 可由溝通效率的折衷理解:重用既有詞通常降低形式成本但犧牲部分精確性,組合詞則增加形式長度但提高資訊性。
這些研究與本文的 Lexical Expansion 高度相鄰。
另一方面,自然語言語義是否以及如何受 context 影響,本身已有龐大哲學與形式語義文獻。本文使用 Parametric Expansion 時,不主張每一個表面上的 context-sensitive 判斷都必須被編碼成語義參數;這正是為何本文把參數化定義為一種「表示策略」,而不是自然語言本體的先驗結論。
本文真正增加的是一個機制分解:
精細化 ≠ 單純 lexicalization . \boxed{
\text{精細化}
\neq
\text{單純 lexicalization}.
} 精細化 = 單純 lexicalization .
而是:
E = { E L , E P , E S } . \boxed{
\mathcal E
=
\{
\mathcal E_L,
\mathcal E_P,
\mathcal E_S
\}.
} E = { E L , E P , E S } .
這三者描述的是在壓力測試中「哪一部分表示系統被修改」。
3. 統一表示狀態
令第 t t t 輪的語義表示系統為:
S t = ( Σ t , P t , O t , E t ) . \boxed{
\mathfrak S_t
=
(
\Sigma_t,
P_t,
\mathcal O_t,
E_t
).
} S t = ( Σ t , P t , O t , E t ) .
其中:
Σ t = { σ 1 , … , σ n } \Sigma_t
=
\{\sigma_1,\ldots,\sigma_n\} Σ t = { σ 1 , … , σ n }
為目前可直接調用的 lexical primitive 或已晶化符號集合;
P t = { p 1 , … , p m } P_t
=
\{p_1,\ldots,p_m\} P t = { p 1 , … , p m }
為當前顯式表示的參數與限定條件;
O t = { o 1 , … , o k } \mathcal O_t
=
\{o_1,\ldots,o_k\} O t = { o 1 , … , o k }
為目前允許使用的組合、否定、條件、比較、嵌套、遞迴與其他結構運算;
E t E_t E t
則為由:
Σ t , P t , O t \Sigma_t,
\quad
P_t,
\quad
\mathcal O_t Σ t , P t , O t
實際生成的表達結構。
因此,精細化不再只問:
∣ Σ t + 1 ∣ > ∣ Σ t ∣ ? |\Sigma_{t+1}|
>
|\Sigma_t|? ∣ Σ t + 1 ∣ > ∣ Σ t ∣ ?
而要問:
是 lexicon 改了、參數空間改了,還是固定材料的結構組合改了?
4. 第一種:詞彙展開
4.1 定義
Lexical Expansion 定義為:
E L : Σ t ⊂ Σ t + 1 . \boxed{
\mathcal E_L:
\Sigma_t
\subset
\Sigma_{t+1}.
} E L : Σ t ⊂ Σ t + 1 .
最典型情況是新增:
z ∉ Σ t . z
\notin
\Sigma_t. z ∈ / Σ t .
新 primitive 可以是新造詞、穩定複合詞、既有詞的新專門義、技術術語,或對高頻長結構的縮寫性命名。
但新名字本身並不自動等於有效 lexical expansion。
若:
D ( Σ t + 1 ) = D ( Σ t ) D(\Sigma_{t+1})=D(\Sigma_t) D ( Σ t + 1 ) = D ( Σ t )
且:
C o s t ( Σ t + 1 ) ≥ C o s t ( Σ t ) , Cost(\Sigma_{t+1})
\ge
Cost(\Sigma_t), C os t ( Σ t + 1 ) ≥ C os t ( Σ t ) ,
則只是 lexical inflation。
5. 詞彙展開的兩種價值
候選新詞 z z z 至少可能具有兩種不同價值。
5.1 判別價值
若新增 z z z 後,一組原本不可分案例變得可分:
S t ( x ) = S t ( y ) , S_t(x)=S_t(y), S t ( x ) = S t ( y ) ,
但:
S t + 1 ( x ) ≠ S t + 1 ( y ) , S_{t+1}(x)\neq S_{t+1}(y), S t + 1 ( x ) = S t + 1 ( y ) ,
則:
V D ( z ) > 0. V_D(z)>0. V D ( z ) > 0.
5.2 壓縮價值
假設某複合結構:
φ = f ( σ 1 , … , σ k ) \varphi
=
f(\sigma_1,\ldots,\sigma_k) φ = f ( σ 1 , … , σ k )
可以完全由既有 lexicon 表達,但反覆出現。
若定義一個:
z z z
使:
D e c o d e ( z ) ≈ φ , Decode(z)\approx\varphi, D eco d e ( z ) ≈ φ ,
且:
C o s t ( z ) < C o s t ( φ ) , Cost(z)<Cost(\varphi), C os t ( z ) < C os t ( φ ) ,
則即使:
V D ( z ) = 0 , V_D(z)=0, V D ( z ) = 0 ,
仍可能有:
V C ( z ) > 0. V_C(z)>0. V C ( z ) > 0.
所以:
V L ( z ) = V D ( z ) + V C ( z ) . \boxed{
V_L(z)
=
V_D(z)
+
V_C(z).
} V L ( z ) = V D ( z ) + V C ( z ) .
這也是為何「新詞沒有新增數學維度」不等於它沒有語言價值。
6. 第二種:參數展開
6.1 定義
Parametric Expansion 不新增 lexical primitive:
Σ t + 1 = Σ t , \Sigma_{t+1}
=
\Sigma_t, Σ t + 1 = Σ t ,
而是:
E P : P t ⊂ P t + 1 . \boxed{
\mathcal E_P:
P_t
\subset
P_{t+1}.
} E P : P t ⊂ P t + 1 .
最簡單的形式是把:
B ( x ) B(x) B ( x )
改寫為:
B ( x ∣ p 1 , … , p m ) . B(x\mid p_1,\ldots,p_m). B ( x ∣ p 1 , … , p m ) .
這不是把「邊界」換成另一個詞,而是問:對什麼作用、在什麼尺度、在什麼條件、允許多大偏差,以及使用什麼身份判準。
同一 primitive 因此可以在不同參數狀態下產生不同判斷。
7. 參數展開不是把整個世界塞進函數
Parametric Expansion 有一個明顯危險。
若不設限制,可以不斷加入:
p 1 , p 2 , … , p n , … p_1,p_2,\ldots,p_n,\ldots p 1 , p 2 , … , p n , …
最後得到:
S ( x ∣ W ) , S(x\mid W), S ( x ∣ W ) ,
其中 W W W 幾乎等於完整世界狀態。
這會讓表示極端精確,卻失去壓縮與一般化功能。
因此本文要求新參數 p p p 至少滿足:
G a i n ( p ) > C o s t ( p ) . \boxed{
Gain(p)>Cost(p).
} G ain ( p ) > C os t ( p ) .
更一般地:
Δ U P = Δ D P − λ P Δ C P . \Delta U_P
=
\Delta D_P
-
\lambda_P\Delta C_P. Δ U P = Δ D P − λ P Δ C P .
只有:
Δ U P > 0 \Delta U_P>0 Δ U P > 0
的參數才值得在目前任務中顯式化。
所以參數展開不是「越多越準越好」,而是尋找足以消除重要混淆的最低條件集合。
8. 參數展開與 context sensitivity 的區別
本文特別避免以下錯誤推論:
不同 context 下判斷不同 ⇒ 語義本體必須新增一個 context parameter . \text{不同 context 下判斷不同}
\Rightarrow
\text{語義本體必須新增一個 context parameter}. 不同 context 下判斷不同 ⇒ 語義本體必須新增一個 context parameter .
這個推論過強。
不同 context 下的差異可能來自語義本身、語用推理、世界知識、注意焦點、任務要求,或對省略條件的不同補全。
因此本文只主張:
當顯式增加參數能穩定消除目標混淆時,它是一種有效表示策略。 \boxed{
\text{當顯式增加參數能穩定消除目標混淆時,它是一種有效表示策略。}
} 當顯式增加參數能穩定消除目標混淆時,它是一種有效表示策略。
這是一個工程與形式化層面的判準,不是對所有自然語言 context sensitivity 的單一路線哲學裁決。
9. 第三種:結構展開
9.1 定義
Structural Expansion 是三種機制中最容易被忽略的一種。
固定:
Σ t + 1 = Σ t , \Sigma_{t+1}
=
\Sigma_t, Σ t + 1 = Σ t ,
P t + 1 = P t , P_{t+1}
=
P_t, P t + 1 = P t ,
以及:
O t + 1 = O t . \mathcal O_{t+1}
=
\mathcal O_t. O t + 1 = O t .
但允許由既有元素形成新的結構:
E t + 1 ≠ E t . E_{t+1}
\neq
E_t. E t + 1 = E t .
例如:
B , B, B ,
¬ B , \neg B, ¬ B ,
◊ B , \Diamond B, ◊ B ,
B ( J ( B ) ) , B(J(B)), B ( J ( B )) ,
以及:
¬ J ( B ) ⇒ B . \neg J(B)\Rightarrow B. ¬ J ( B ) ⇒ B .
沒有新增 lexical primitive,沒有新增 parameter,甚至沒有新增 operator。增加的是結構位置、組合方式與深度。
10. 結構深度與表示數量
令:
D e p t h ( E ) Depth(E) D e pt h ( E )
表示表達樹的最大嵌套深度。
Structural Expansion 可以表現為:
D e p t h ( E t + 1 ) > D e p t h ( E t ) . \boxed{
Depth(E_{t+1})
>
Depth(E_t).
} D e pt h ( E t + 1 ) > D e pt h ( E t ) .
但「更深」不是充分條件。
若:
E t + 1 E_{t+1} E t + 1
只是把:
E t E_t E t
重複包裝而沒有增加任何案例可分性,則:
G a i n ( E t + 1 ) = 0. Gain(E_{t+1})=0. G ain ( E t + 1 ) = 0.
所以真正條件仍是:
Δ D S > 0. \boxed{
\Delta D_S>0.
} Δ D S > 0.
這排除了形式上的無限遞迴被誤當成實質語義無界。
11. 為什麼固定詞彙仍可能相對無界
若:
∣ Σ ∣ < ∞ |\Sigma|<\infty ∣Σ∣ < ∞
且:
∣ O ∣ < ∞ , |\mathcal O|<\infty, ∣ O ∣ < ∞ ,
只要運算規則允許遞迴閉合,形式上仍可能生成:
E 1 , E 2 , … , E n , … E_1,
E_2,
\ldots,
E_n,
\ldots E 1 , E 2 , … , E n , …
因此:
∣ Σ ∣ < ∞ ⇏ ∣ Closure ( Σ , O ) ∣ < ∞ . \boxed{
|\Sigma|<\infty
\not\Rightarrow
|\operatorname{Closure}(\Sigma,\mathcal O)|<\infty.
} ∣Σ∣ < ∞ ⇒ ∣ Closure ( Σ , O ) ∣ < ∞.
本文不把這個一般形式語言事實宣稱為新定理。
本文的實驗性主張更窄:在禁止新增詞彙與參數後,固定材料的結構組合仍曾產生新的、通過反例測試的概念區分。
也就是:
Δ ∣ Σ ∣ = 0 , Δ ∣ P ∣ = 0 , Δ D > 0 \boxed{
\Delta |\Sigma|=0,
\quad
\Delta |P|=0,
\quad
\Delta D>0
} Δ∣Σ∣ = 0 , Δ∣ P ∣ = 0 , Δ D > 0
是可觀察的精細化型態。
12. 三種展開不是三個互斥盒子
同一輪修訂可能是混合型。
因此可以定義展開向量:
e t = ( e L , e P , e S ) \boxed{
\mathbf e_t
=
(
e_L,
e_P,
e_S
)
} e t = ( e L , e P , e S )
其中:
e L , e P , e S ≥ 0. e_L,e_P,e_S\ge0. e L , e P , e S ≥ 0.
純 lexical expansion:
e t = ( 1 , 0 , 0 ) . \mathbf e_t
=
(1,0,0). e t = ( 1 , 0 , 0 ) .
純 parametric expansion:
e t = ( 0 , 1 , 0 ) . \mathbf e_t
=
(0,1,0). e t = ( 0 , 1 , 0 ) .
純 structural expansion:
e t = ( 0 , 0 , 1 ) . \mathbf e_t
=
(0,0,1). e t = ( 0 , 0 , 1 ) .
實際自然語言修訂更可能是:
e t = ( α , β , γ ) . \mathbf e_t
=
(\alpha,\beta,\gamma). e t = ( α , β , γ ) .
因此三分法的功能不是把每句話硬塞進唯一盒子,而是描述一次表示更新主要消耗了哪一類自由度。
13. 三種機制可以互相替代
同一語義需求往往存在多種編碼方式。
假設要表達一個長結構:
φ ( x , p 1 , p 2 ) . \varphi(x,p_1,p_2). φ ( x , p 1 , p 2 ) .
方案 A:保留長結構。
E A = φ ( x , p 1 , p 2 ) . E_A
=
\varphi(x,p_1,p_2). E A = φ ( x , p 1 , p 2 ) .
方案 B:增加新詞:
z ≡ φ . z
\equiv
\varphi. z ≡ φ .
方案 C:保留舊詞,但增加一個參數化模板:
f ( x ∣ p 1 , p 2 ) . f(x\mid p_1,p_2). f ( x ∣ p 1 , p 2 ) .
所以:
E L , E P , E S \boxed{
\mathcal E_L,
\mathcal E_P,
\mathcal E_S
} E L , E P , E S
並非總是增加不同的可表達內容;它們可能只是以不同成本編碼同一語義區域。
14. 表示選擇問題
令三種展開的總成本分別為:
C L , C P , C S . C_L,
\qquad
C_P,
\qquad
C_S. C L , C P , C S .
令它們對目前案例集合的判別增益為:
G L , G P , G S . G_L,
\qquad
G_P,
\qquad
G_S. G L , G P , G S .
再加入可重用頻率:
F L , F P , F S . F_L,
\qquad
F_P,
\qquad
F_S. F L , F P , F S .
可以定義一個工作性效用:
U i = G i + α F i − β C i − γ R i , \boxed{
U_i
=
G_i
+
\alpha F_i
-
\beta C_i
-
\gamma R_i,
} U i = G i + α F i − β C i − γ R i ,
其中:
i ∈ { L , P , S } , i\in\{L,P,S\}, i ∈ { L , P , S } ,
而 R i R_i R i 表示重建或誤解風險。
系統在某一階段選擇:
i ∗ = arg max i U i . i^\ast
=
\arg\max_i U_i. i ∗ = arg i max U i .
這不是人腦的既定心理定律,而是一個後續實驗可操作的表示選擇模型。
15. 何時應該造新詞
假設定義新詞的初始成本為:
C define ( z ) . C_{\text{define}}(z). C define ( z ) .
每次使用長結構的成本:
C ( φ ) . C(\varphi). C ( φ ) .
使用新詞的成本:
C ( z ) . C(z). C ( z ) .
若預期重用:
f f f
次,則 lexicalization 有利的簡化條件可以寫成:
f ( C ( φ ) − C ( z ) ) > C define ( z ) . \boxed{
f
\bigl(
C(\varphi)-C(z)
\bigr)
>
C_{\text{define}}(z).
} f ( C ( φ ) − C ( z ) ) > C define ( z ) .
也就是:一個結構必須足夠昂貴、足夠穩定、足夠常用,才值得晶化成新的 lexical primitive。
這把「詞彙像 semantic cache」的直覺變成一個最小成本條件。
16. 何時應該增加參數
若多個案例共享同一核心結構:
s , s, s ,
而差異主要沿著一組穩定軸:
p 1 , … , p k p_1,\ldots,p_k p 1 , … , p k
變化,則建立:
s ( x ∣ p 1 , … , p k ) s(x\mid p_1,\ldots,p_k) s ( x ∣ p 1 , … , p k )
通常比為每個組合造獨立新詞更緊湊。
若有 m m m 種核心狀態與 k k k 種相對獨立條件維度,直接 lexicalize 大量組合可能快速膨脹;參數化則可把重複結構重新分離為核心與條件。
因此:
參數展開可以避免 lexical explosion. \boxed{
\text{參數展開可以避免 lexical explosion.}
} 參數展開可以避免 lexical explosion.
17. 何時結構展開更有利
若所需的新區分主要來自否定的位置、條件方向、嵌套層級、模態作用域、自指關係或原有元素之間的新組合,那麼新增 primitive 或 parameter 可能都不是必要。
例如:
A ⇒ B A\Rightarrow B A ⇒ B
與:
B ⇒ A B\Rightarrow A B ⇒ A
使用相同 lexical inventory 與參數,卻具有不同含義。
又如:
¬ ◊ B \neg\Diamond B ¬ ◊ B
與:
◊ ¬ B \Diamond\neg B ◊ ¬ B
差異完全由結構作用域產生。
因此:
不是所有新語義差異都需要新的語義原子。 \boxed{
\text{不是所有新語義差異都需要新的語義原子。}
} 不是所有新語義差異都需要新的語義原子。
18. 三機制之間的轉換
18.1 Structural to Lexical
一個長結構:
φ \varphi φ
反覆出現後:
φ → compression z . \varphi
\xrightarrow{\text{compression}}
z. φ compression z .
即:
E S → E L . \mathcal E_S
\rightarrow
\mathcal E_L. E S → E L .
18.2 Parametric to Lexical
某組參數配置:
( p 1 , p 2 , … , p k ) (p_1,p_2,\ldots,p_k) ( p 1 , p 2 , … , p k )
如果長期穩定共現,也可能被晶化為一個新詞:
s ( x ∣ p 1 , … , p k ) → z . s(x\mid p_1,\ldots,p_k)
\rightarrow
z. s ( x ∣ p 1 , … , p k ) → z .
所以:
E P → E L . \mathcal E_P
\rightarrow
\mathcal E_L. E P → E L .
18.3 Lexical to Parametric
一個過度多義或過度粗粒度的詞:
z z z
可能被重新展開成:
z ( x ∣ p 1 , … , p k ) . z(x\mid p_1,\ldots,p_k). z ( x ∣ p 1 , … , p k ) .
所以:
E L → E P . \mathcal E_L
\rightarrow
\mathcal E_P. E L → E P .
18.4 Lexical to Structural
一個技術術語在爭議時可以被取消快取:
z → D e c o d e ( z ) = φ . z
\rightarrow
Decode(z)
=
\varphi. z → D eco d e ( z ) = φ .
因此:
E L → E S . \mathcal E_L
\rightarrow
\mathcal E_S. E L → E S .
三機制不是單向成長,而是一個可逆程度不同的表示網路。
19. 展開矩陣
令:
e t = [ e L e P e S ] . \mathbf e_t
=
\begin{bmatrix}
e_L\\
e_P\\
e_S
\end{bmatrix}. e t = e L e P e S .
一次語義更新可以表示為:
e t + 1 = T t e t + u t , \boxed{
\mathbf e_{t+1}
=
\mathbf T_t
\mathbf e_t
+
\mathbf u_t,
} e t + 1 = T t e t + u t ,
其中:
T t \mathbf T_t T t
表示三種機制之間的轉換傾向,而:
u t \mathbf u_t u t
表示新的外部判別壓力。
本文目前不為 T t \mathbf T_t T t 指定固定數值。它是一個後續跨語言、跨模型、跨任務實驗可估計的結構。
20. 三種失敗型態
三種展開各自有典型病理。
20.1 Lexical Explosion
∣ Σ t ∣ |\Sigma_t| ∣ Σ t ∣
快速成長,但新增詞大多:
V D ≈ 0 , V C ≈ 0. V_D\approx0,
\qquad
V_C\approx0. V D ≈ 0 , V C ≈ 0.
結果是字典膨脹而不是精度提升。
20.2 Parameter Explosion
∣ P t ∣ |P_t| ∣ P t ∣
快速成長,直到表示接近:
S ( x ∣ W ) . S(x\mid W). S ( x ∣ W ) .
結果是每個案例都可以被精確描述,卻喪失一般化。
20.3 Structural Explosion
D e p t h ( E t ) Depth(E_t) D e pt h ( E t )
快速成長,但:
Δ D t → 0. \Delta D_t\rightarrow0. Δ D t → 0.
結果是邏輯與句法越來越深,實際上只是在形式空轉。
因此三種展開都必須受同一基本條件約束:
Δ D + λ Δ C compression > Δ C o s t . \boxed{
\Delta D
+
\lambda\Delta C_{\text{compression}}
>
\Delta Cost.
} Δ D + λ Δ C compression > Δ C os t .
21. 局部收斂如何在三層分別出現
系統可以只在某一層收斂。
Lexical Convergence:
Δ ∣ Σ ∣ = 0. \Delta|\Sigma|=0. Δ∣Σ∣ = 0.
不代表整體停止,因為仍可能:
Δ ∣ P ∣ > 0 \Delta|P|>0 Δ∣ P ∣ > 0
或:
Δ D e p t h ( E ) > 0. \Delta Depth(E)>0. Δ D e pt h ( E ) > 0.
Parametric Convergence:
Δ ∣ P ∣ = 0 \Delta|P|=0 Δ∣ P ∣ = 0
仍不代表 structural expansion 結束。
Structural Convergence 則要求在固定:
Σ , P , O \Sigma,
P,
\mathcal O Σ , P , O
下,新增組合連續多輪:
Δ D ≤ ϵ . \Delta D\le\epsilon. Δ D ≤ ϵ .
因此:
局部收斂必須標明收斂發生在哪一層。 \boxed{
\text{局部收斂必須標明收斂發生在哪一層。}
} 局部收斂必須標明收斂發生在哪一層。
22. 三層無界性的不同含義
「無界」不能混成一個命題。
Lexical unboundedness 指:
∣ Σ t ∣ |\Sigma_t| ∣ Σ t ∣
沒有先驗最大值。
Parametric unboundedness 指:
∣ P t ∣ |P_t| ∣ P t ∣
沒有先驗固定的最大顯式條件集合。
Structural unboundedness 則指:
D e p t h ( E t ) Depth(E_t) D e pt h ( E t )
或可生成結構數量不預設有限上限。
三者完全不同。
一套語言甚至可以:
∣ Σ ∣ < ∞ , |\Sigma|<\infty, ∣Σ∣ < ∞ ,
∣ P ∣ < ∞ , |P|<\infty, ∣ P ∣ < ∞ ,
但:
∣ Closure ( Σ , P , O ) ∣ |\operatorname{Closure}(\Sigma,P,\mathcal O)| ∣ Closure ( Σ , P , O ) ∣
仍原則上無界。
因此,本系列主張的「自然語言無界精細化」首先是:
表示更新空間不被單一 lexical inventory 的大小所封閉。 \boxed{
\text{表示更新空間不被單一 lexical inventory 的大小所封閉。}
} 表示更新空間不被單一 lexical inventory 的大小所封閉。
而不是「字典必須無限增長」。
23. 對 100 輪實驗的重新解讀
百輪測試可以重新解讀為逐步關閉三種自由度。
初始階段:
Δ Σ ≥ 0 , Δ P ≥ 0 , Δ E ≥ 0. \Delta\Sigma
\ge0,
\qquad
\Delta P
\ge0,
\qquad
\Delta E
\ge0. ΔΣ ≥ 0 , Δ P ≥ 0 , Δ E ≥ 0.
禁止造詞後:
Δ Σ = 0 , \Delta\Sigma=0, ΔΣ = 0 ,
但:
Δ P ≥ 0 , Δ E ≥ 0. \Delta P
\ge0,
\qquad
\Delta E
\ge0. Δ P ≥ 0 , Δ E ≥ 0.
禁止新增參數後:
Δ Σ = 0 , Δ P = 0 , \Delta\Sigma=0,
\qquad
\Delta P=0, ΔΣ = 0 , Δ P = 0 ,
只剩:
Δ E ≥ 0. \Delta E\ge0. Δ E ≥ 0.
而實驗仍曾觀察到:
Δ D > 0. \Delta D>0. Δ D > 0.
因此原始 proof-of-concept 的真正信息可以寫成:
Δ Σ = 0 ⇏ Δ D = 0 , \boxed{
\Delta\Sigma=0
\not\Rightarrow
\Delta D=0,
} ΔΣ = 0 ⇒ Δ D = 0 ,
以及:
Δ Σ = 0 ∧ Δ P = 0 ⇏ Δ D = 0. \boxed{
\Delta\Sigma=0
\land
\Delta P=0
\not\Rightarrow
\Delta D=0.
} ΔΣ = 0 ∧ Δ P = 0 ⇒ Δ D = 0.
24. 可檢驗預測
P1:不同題目應呈現不同展開向量
某些題目主要刺激:
e P , e_P, e P ,
另一些題目可能主要刺激:
e S . e_S. e S .
若所有題目永遠以相同比例展開,三機制分解的解釋力會受到質疑。
P2:高重用 structural pattern 應提高 lexicalization 機率
若:
F r e q ( φ ) Freq(\varphi) F r e q ( φ )
提高,
則:
P ( φ → z ) P(
\varphi
\rightarrow
z
) P ( φ → z )
應上升。
P3:禁止 lexical expansion 不應立即使判別增益歸零
應存在:
Δ ∣ Σ ∣ = 0 \Delta|\Sigma|=0 Δ∣Σ∣ = 0
而:
E D G t > 0 EDG_t>0 E D G t > 0
的多輪區間。
P4:禁止 lexical 與 parametric expansion 後,structural gain 應逐步衰減但不必立即消失
即:
E D G t > 0 EDG_t>0 E D G t > 0
可能仍持續若干輪,但更容易最終出現:
E D G t → 0. EDG_t\rightarrow0. E D G t → 0.
25. 限制
第一,三機制分解是表示工程模型,不等於宣稱人腦存在三個獨立神經模組。
第二,lexical、parametric 與 structural 的邊界本身有時模糊。例如一個複合詞究竟算 lexical primitive 還是固定 structural expression,需要由實驗預先規定 operational criterion。
第三,參數化可能把原本應由語用或世界知識處理的內容錯誤塞入形式語義。因此「參數增加」只表示模型表示策略,不自動具有本體或語言學優先性。
第四,Structural Expansion 的形式生成空間可以非常大,但可生成不等於有意義,也不等於有判別收益。
第五,本文目前的成本函數是工作性模型。真實語言中的成本可能同時包含記憶、發音、讀寫、學習、歧義、社會慣例與歷史路徑依賴。
26. 結論
本文將自然語言精細化分成三種可操作機制:
E L = Lexical Expansion \boxed{
\mathcal E_L
=
\text{Lexical Expansion}
} E L = Lexical Expansion
改變:
Σ . \Sigma. Σ.
E P = Parametric Expansion \boxed{
\mathcal E_P
=
\text{Parametric Expansion}
} E P = Parametric Expansion
改變:
P . P. P .
E S = Structural Expansion \boxed{
\mathcal E_S
=
\text{Structural Expansion}
} E S = Structural Expansion
在:
Σ , P , O \Sigma,
P,
\mathcal O Σ , P , O
固定時改變:
E . E. E .
三者共同說明了一個關鍵結果:
語義變精準 ≠ 字典變大 . \boxed{
\text{語義變精準}
\neq
\text{字典變大}.
} 語義變精準 = 字典變大 .
一個系統可以不造新詞而透過參數顯式化增加解析度;可以連參數都不增加,只靠既有元素的結構關係生成新區分;而當某些複合結構反覆出現後,又可以重新收斂成新的 lexical primitive。
因此更完整的動力不是:
word → more words , \text{word}
\rightarrow
\text{more words}, word → more words ,
而是:
E L ⇄ E P ⇄ E S \boxed{
\mathcal E_L
\rightleftarrows
\mathcal E_P
\rightleftarrows
\mathcal E_S
} E L ⇄ E P ⇄ E S
並受:
判別收益 + 重用收益 − 表示成本 − 重建風險 \boxed{
\text{判別收益}
+
\text{重用收益}
-
\text{表示成本}
-
\text{重建風險}
} 判別收益 + 重用收益 − 表示成本 − 重建風險
共同約束。
這使「有限詞彙如何支撐相對無界的語義精細化」不再只是一個 compositionality 口號,而開始可以被拆成不同表示自由度的競爭、替代、壓縮與再展開問題。
參考文獻
Yu, L., & Xu, Y. (2025). Infinite Mixture Chaining: An Efficiency-Based Framework for the Dynamic Construction of Word Meaning . Open Mind: Discoveries in Cognitive Science, 9, 1-24. DOI: 10.1162/opmi_a_00176.
Xu, A., Kemp, C., Frermann, L., & Xu, Y. (2024). Word reuse and combination support efficient communication of emerging concepts . Proceedings of the National Academy of Sciences, 121(46), e2406971121. DOI: 10.1073/pnas.2406971121.
Bowker, M. (2024). Keeping context in mind: a non-semantic explanation of apparent context-sensitivity . Linguistics and Philosophy, 47, 191-209. DOI: 10.1007/s10988-023-09396-z.
Tishby, N., Pereira, F. C., & Bialek, W. (2000). The information bottleneck method . arXiv:physics/0004057.
Zaslavsky, N., Kemp, C., Regier, T., & Tishby, N. (2018). Efficient human-like semantic representations via the Information Bottleneck principle . arXiv:1808.03353.
系列位置
Paper 01:自然語言的無界精細化假說
Paper 02:從「很接近,但還不夠精準」開始:自然語言百輪語義壓力測試方法論
Paper 03:自然語言的三種展開機制
Paper 04:邊界不是一個詞:邊界本體論的百輪語義壓力測試
Paper 05:新詞從何而來:複合語義、重複結構與符號晶化
Paper 06:語義的展開與收斂:從無界精細化到最小生成核
Paper 07:自然語言精細化的矩陣表示
Paper 08:有限符號與無界語義:自然語言生成、展開與收斂循環