新詞從何而來
複合語義、重複結構與符號晶化
系列: 自然語言無界精細化與收斂系列Paper: 05 / 08作者: Neo.KAI 協作整理: GPT-5.6 Sol機構: EveMissLab/一言諾科技有限公司版本: v0.1日期: 2026-08-20類型: 語言哲學/詞彙化理論/形式語義/資訊效率/符號動力學
摘要
本文研究一個比「如何造新詞」更窄也更形式化的問題:當一段原本可以用既有詞彙、參數與句法完整表達的複合語義結構反覆出現時,什麼條件會使它值得被壓縮成一個新的可重用 lexical primitive?
既有 lexicalization 研究已指出,新興概念常透過既有詞義延伸、word reuse、combination、compounding、borrowing 與 coinage 等策略進入詞彙系統;近期資訊效率研究進一步顯示,word reuse 與 combination 可以被理解為形式成本與資訊精度之間的折衷。本文不重新命名這些既有現象,而提出一個系列內部的工作概念:「符號晶化」(symbol crystallization),專指一個高成本複合表示:
φ = f ( σ 1 , σ 2 , … , σ k ; p 1 , … , p m ) \varphi
=
f(
\sigma_1,
\sigma_2,
\ldots,
\sigma_k;
p_1,
\ldots,
p_m
) φ = f ( σ 1 , σ 2 , … , σ k ; p 1 , … , p m )
被重新映射為一個低成本入口:
z , z, z ,
且在需要時可以由 z z z 重新展開回足夠接近的語義結構:
D e c o d e ( z ) ≈ φ . Decode(z)
\approx
\varphi. D eco d e ( z ) ≈ φ .
本文提出,重複頻率不是晶化的唯一條件。若一個複合結構雖然高頻,但高度不穩定、容易與其他結構混淆、解碼誤差高或定義成本過大,將它壓縮成新 primitive 反而可能降低整體語義效率。因此本文定義工作性的晶化效用:
U c r y s ( z ∣ φ ) = α R + β D + γ S + η C s a v e − λ E d e c o d e − μ A − ν C d e f i n e \boxed{
U_{\mathrm{crys}}(z\mid\varphi)
=
\alpha R
+
\beta D
+
\gamma S
+
\eta C_{\mathrm{save}}
-
\lambda E_{\mathrm{decode}}
-
\mu A
-
\nu C_{\mathrm{define}}
} U crys ( z ∣ φ ) = α R + β D + γ S + η C save − λ E decode − μ A − ν C define
其中 R R R 為重用收益, D D D 為新增判別價值, S S S 為語義穩定度, C s a v e C_{\mathrm{save}} C save 為表達成本節省, E d e c o d e E_{\mathrm{decode}} E decode 為解碼重建誤差, A A A 為歧義負擔, C d e f i n e C_{\mathrm{define}} C define 為建立與維持新 primitive 的成本。
當:
U c r y s > 0 U_{\mathrm{crys}}>0 U crys > 0
時,晶化在目前任務條件下具有正效用;當:
U c r y s ≤ 0 , U_{\mathrm{crys}}\le0, U crys ≤ 0 ,
保留原複合結構、使用參數化模板、延伸既有詞義或維持較長表達,可能更有效。
本文進一步指出,新 primitive 並不是語義演化的終點。一旦:
φ → z , \varphi
\rightarrow
z, φ → z ,
新的 z z z 又可以參與下一輪結構組合:
z → φ ′ → z ′ → ⋯ . z
\rightarrow
\varphi'
\rightarrow
z'
\rightarrow
\cdots. z → φ ′ → z ′ → ⋯ .
因此,詞彙化可以被嵌入本系列更一般的循環:
複合 → 重用 → 壓縮 → 新 primitive → 再組合 → 再壓縮 . \boxed{
\text{複合}
\rightarrow
\text{重用}
\rightarrow
\text{壓縮}
\rightarrow
\text{新 primitive}
\rightarrow
\text{再組合}
\rightarrow
\text{再壓縮}.
} 複合 → 重用 → 壓縮 → 新 primitive → 再組合 → 再壓縮 .
本文的主要貢獻是提出一套可操作的「何時值得新建 primitive」判準,並把判別價值與壓縮價值明確分離,以避免把「新詞出現」誤當成「語義維度必然增加」。
關鍵詞: lexicalization、word formation、semantic compression、symbol crystallization、semantic cache、lexical innovation、word reuse、compounding、communicative efficiency、primitive formation
1. 問題:能說出來,為什麼還要造詞
假設一個語義結構:
φ \varphi φ
已經可以用既有語言完整表達。
例如:
φ = f ( σ 1 , σ 2 , σ 3 ) . \varphi
=
f(
\sigma_1,
\sigma_2,
\sigma_3
). φ = f ( σ 1 , σ 2 , σ 3 ) .
如果它已可被表達,表面上似乎沒有新增詞彙的必要。
然而,真實語言並不是只追求「可表達性」。
它還同時受到:
表達長度;
使用頻率;
記憶成本;
可辨識度;
歧義;
學習成本;
重建精度;
社會與技術慣例;
等因素約束。
因此真正的問題不是:
這個複合語義能不能用舊語言表示? \boxed{
\text{這個複合語義能不能用舊語言表示?}
} 這個複合語義能不能用舊語言表示?
而是:
每次都重新展開它,是否仍然值得? \boxed{
\text{每次都重新展開它,是否仍然值得?}
} 每次都重新展開它,是否仍然值得?
2. 與既有 lexicalization 研究的邊界
Lexicalization 是成熟的語言學研究領域,本文不把一般新詞形成重新命名為「符號晶化」。
近期研究尤其適合作為本文背景。
Xu、Kemp、Frermann 與 Xu 對英語、法語與芬蘭語近百年 lexical innovation 的分析顯示,word reuse 與 combination 都可以在形式長度與資訊精度之間形成效率折衷。Reuse 往往避免增加形式長度,但可能降低精確性;combination 通常較長,卻提供更多資訊。
Yu 與 Xu 的 Infinite Mixture Chaining 則從 representational accuracy 與 memory complexity 的折衷出發,研究有限 lexicon 如何動態吸收持續出現的新 meanings,並顯示語義延伸可以由效率原則組織,而非完全任意。
更早的 Zipfian efficiency 與 word-length 研究亦顯示,頻率、資訊量與形式成本之間存在穩定關係。Kanwal 等人的人工語言實驗顯示,當 accuracy 與 efficiency 壓力同時存在時,參與者會形成類似高頻形式較短的 lexicon;Piantadosi、Tily 與 Gibson 則指出,平均資訊量比單純頻率更能預測 word length。
因此,本文不主張:
高頻結構會縮短 \boxed{
\text{高頻結構會縮短}
} 高頻結構會縮短
是新發現。
本文要做的是把本系列前四篇產生的問題明確化:
若一個語義結構已由 lexical、parametric 與 structural resources 生成,什麼時候應把它重新收斂成一個新的 primitive?
3. 「符號晶化」的工作定義
令:
Σ t \Sigma_t Σ t
為第 t t t 時點可直接調用的 primitive 集合。
令:
φ ∈ Closure ( Σ t , P t , O t ) \varphi
\in
\operatorname{Closure}
(
\Sigma_t,
P_t,
\mathcal O_t
) φ ∈ Closure ( Σ t , P t , O t )
為由既有 primitive、參數與操作生成的複合表示。
若系統建立:
z ∉ Σ t , z
\notin
\Sigma_t, z ∈ / Σ t ,
並令:
Σ t + 1 = Σ t ∪ { z } , \Sigma_{t+1}
=
\Sigma_t
\cup
\{z\}, Σ t + 1 = Σ t ∪ { z } ,
同時建立:
E n c o d e ( φ ) = z , Encode(\varphi)=z, E n co d e ( φ ) = z ,
以及近似可逆的:
D e c o d e ( z ) ≈ φ , Decode(z)\approx\varphi, D eco d e ( z ) ≈ φ ,
則本文把此表示操作稱為:
Crystallize ( φ ) = z . \boxed{
\operatorname{Crystallize}(\varphi)=z.
} Crystallize ( φ ) = z .
「晶化」只是本系列的工作術語。
它不預設 z z z 已進入整個自然語言共同體,也不預設它具有長期歷史穩定性。若討論真實語言的社會詞彙化,仍應使用 lexicalization、coinage、compounding、semantic extension、conventionalization 等既有術語。
4. 晶化不是單純縮寫
最弱的壓縮只是:
φ → z \varphi
\rightarrow
z φ → z
其中 z z z 是任意代號。
但一個真正有用的 primitive 至少還需要:
D e c o d e ( z ) Decode(z) D eco d e ( z )
在目前任務中保持足夠穩定。
因此本文要求:
d ( D e c o d e ( z ) , φ ) ≤ ϵ . \boxed{
d(
Decode(z),
\varphi
)
\le
\epsilon.
} d ( D eco d e ( z ) , φ ) ≤ ϵ .
其中:
d d d
是任務相關的語義距離,
ϵ \epsilon ϵ
是允許的重建誤差。
若:
d ( D e c o d e ( z ) , φ ) ≫ ϵ , d(
Decode(z),
\varphi
)
\gg
\epsilon, d ( D eco d e ( z ) , φ ) ≫ ϵ ,
那麼 z z z 不是有效壓縮,而只是產生新的歧義。
5. 第一個壓力:重複頻率
假設每次完整表示 φ \varphi φ 的成本為:
C ( φ ) . C(\varphi). C ( φ ) .
使用新 primitive z z z 的成本為:
C ( z ) . C(z). C ( z ) .
定義 z z z 的一次性成本為:
C d e f i n e ( z ) . C_{\mathrm{define}}(z). C define ( z ) .
若預期未來重用:
f f f
次,
則最簡單的壓縮收益:
R f = f [ C ( φ ) − C ( z ) ] − C d e f i n e ( z ) . \boxed{
R_f
=
f
\left[
C(\varphi)-C(z)
\right]
-
C_{\mathrm{define}}(z).
} R f = f [ C ( φ ) − C ( z ) ] − C define ( z ) .
若:
R f > 0 , R_f>0, R f > 0 ,
則只從長度或操作成本角度看,建立 z z z 有利。
等價地,若:
C ( φ ) > C ( z ) , C(\varphi)>C(z), C ( φ ) > C ( z ) ,
最低重用門檻為:
f ∗ > C d e f i n e ( z ) C ( φ ) − C ( z ) . \boxed{
f^\ast
>
\frac{
C_{\mathrm{define}}(z)
}{
C(\varphi)-C(z)
}.
} f ∗ > C ( φ ) − C ( z ) C define ( z ) .
這是「semantic cache」直覺的第一個形式版本。
6. 但高頻本身仍然不夠
如果一段語義每次出現時都稍微不同,
例如:
φ 1 , φ 2 , … , φ n \varphi_1,
\varphi_2,
\ldots,
\varphi_n φ 1 , φ 2 , … , φ n
只具有表面相似,而沒有穩定共同核心,
則把它們全部壓成:
z z z
可能造成嚴重資訊損失。
因此還需要定義語義穩定度:
S ( Φ ) = 1 − Dispersion ( φ 1 , … , φ n ) . \boxed{
S(\Phi)
=
1
-
\operatorname{Dispersion}
(
\varphi_1,
\ldots,
\varphi_n
).
} S ( Φ ) = 1 − Dispersion ( φ 1 , … , φ n ) .
其中:
Φ = { φ 1 , … , φ n } . \Phi
=
\{
\varphi_1,\ldots,\varphi_n
\}. Φ = { φ 1 , … , φ n } .
若:
S ( Φ ) ≈ 1 , S(\Phi)\approx1, S ( Φ ) ≈ 1 ,
表示重複出現的結構高度穩定。
若:
S ( Φ ) ≈ 0 , S(\Phi)\approx0, S ( Φ ) ≈ 0 ,
建立單一 primitive 的風險很高。
7. 第二個價值:判別力
新 primitive 可能不只壓縮舊結構,還可能建立新的分類軸。
令原表示為:
S t . S_t. S t .
若兩案例:
x , y x,y x , y
原本不可分:
S t ( x ) = S t ( y ) , S_t(x)=S_t(y), S t ( x ) = S t ( y ) ,
而新增 z z z 後:
S t + 1 ( x ) ≠ S t + 1 ( y ) , S_{t+1}(x)\neq S_{t+1}(y), S t + 1 ( x ) = S t + 1 ( y ) ,
則:
D ( z ) > 0. \boxed{
D(z)>0.
} D ( z ) > 0.
此時 z z z 不只是 cache。
它真的增加了目前系統的有效判別能力。
8. 壓縮價值與判別價值必須分開
這是本系列最重要的區分之一。
令案例表示矩陣為:
S ∈ R N × d . \mathbf S
\in
\mathbb R^{N\times d}. S ∈ R N × d .
新增 primitive 欄:
z . \mathbf z. z .
若:
rank [ S z ] > rank ( S ) , \operatorname{rank}
\begin{bmatrix}
\mathbf S&\mathbf z
\end{bmatrix}
>
\operatorname{rank}(\mathbf S), rank [ S z ] > rank ( S ) ,
則 z z z 至少在線性工作模型下增加新的表示方向。
但若:
z ∈ span ( S ) , \mathbf z
\in
\operatorname{span}(\mathbf S), z ∈ span ( S ) ,
仍不能推出 z z z 無用。
只要:
C ( z ) < C ( φ z ) , C(z)
<
C(\varphi_z), C ( z ) < C ( φ z ) ,
它仍有壓縮價值。
因此:
V ( z ) = V D ( z ) + V C ( z ) , \boxed{
V(z)
=
V_D(z)
+
V_C(z),
} V ( z ) = V D ( z ) + V C ( z ) ,
而不是:
V ( z ) = V D ( z ) \boxed{
V(z)
=
V_D(z)
} V ( z ) = V D ( z )
而已。
9. 第三個壓力:歧義成本
壓縮越強,越可能讓不同結構共用同一形式。
若:
φ a ≠ φ b , \varphi_a
\neq
\varphi_b, φ a = φ b ,
但:
E n c o d e ( φ a ) = E n c o d e ( φ b ) = z , Encode(\varphi_a)
=
Encode(\varphi_b)
=
z, E n co d e ( φ a ) = E n co d e ( φ b ) = z ,
則接收或後續推理需要額外條件才能恢復正確語義。
令:
A ( z ) A(z) A ( z )
表示這種歧義負擔。
若 z z z 的使用需要大量額外 disambiguation:
C d i s a m b ( z ) C_{\mathrm{disamb}}(z) C disamb ( z )
則實際壓縮收益應改為:
C n e t ( z ) = C ( φ ) − C ( z ) − C d i s a m b ( z ) . \boxed{
C_{\mathrm{net}}(z)
=
C(\varphi)
-
C(z)
-
C_{\mathrm{disamb}}(z).
} C net ( z ) = C ( φ ) − C ( z ) − C disamb ( z ) .
因此短不一定更有效。
這與既有效率研究中「形式短度與資訊精度存在折衷」相一致。
10. 第四個壓力:解碼誤差
定義:
E d e c o d e ( z ) = E [ d ( D e c o d e ( z ) , φ ) ] . \boxed{
E_{\mathrm{decode}}(z)
=
\mathbb E
\left[
d(
Decode(z),
\varphi
)
\right].
} E decode ( z ) = E [ d ( D eco d e ( z ) , φ ) ] .
若一個新詞很短、很常用,但:
E d e c o d e E_{\mathrm{decode}} E decode
過高,
那麼它可能把表達成本轉換成理解與校正成本。
因此有效晶化不能只追求:
C ( z ) → 0. C(z)\rightarrow0. C ( z ) → 0.
還要保持:
E d e c o d e ≤ ϵ . E_{\mathrm{decode}}
\le
\epsilon. E decode ≤ ϵ .
11. 第五個壓力:建立與維護成本
新 primitive 不是免費的。
它需要:
被定義;
被記住;
被索引;
與既有詞區分;
在語境中被正確調用;
必要時重新解釋。
因此:
C d e f i n e ( z ) C_{\mathrm{define}}(z) C define ( z )
應該更廣義地理解為:
C d e f i n e = C c r e a t e + C l e a r n + C m a i n t a i n + C d i f f e r e n t i a t e . \boxed{
C_{\mathrm{define}}
=
C_{\mathrm{create}}
+
C_{\mathrm{learn}}
+
C_{\mathrm{maintain}}
+
C_{\mathrm{differentiate}}.
} C define = C create + C learn + C maintain + C differentiate .
對單一短暫概念而言,這些成本可能高於直接說完整長句。
12. 晶化效用函數
綜合上述因素,本文提出工作性函數:
U c r y s = α R + β D + γ S + η C s a v e − λ E d e c o d e − μ A − ν C d e f i n e . \boxed{
U_{\mathrm{crys}}
=
\alpha R
+
\beta D
+
\gamma S
+
\eta C_{\mathrm{save}}
-
\lambda E_{\mathrm{decode}}
-
\mu A
-
\nu C_{\mathrm{define}}.
} U crys = α R + β D + γ S + η C save − λ E decode − μ A − ν C define .
其中:
R R R :預期重用收益;
D D D :新增判別價值;
S S S :語義穩定度;
C s a v e C_{\mathrm{save}} C save :表達與操作成本節省;
E d e c o d e E_{\mathrm{decode}} E decode :解碼重建誤差;
A A A :歧義負擔;
C d e f i n e C_{\mathrm{define}} C define :建立與維護成本。
權重:
α , β , γ , η , λ , μ , ν \alpha,
\beta,
\gamma,
\eta,
\lambda,
\mu,
\nu α , β , γ , η , λ , μ , ν
由任務決定。
本文不主張人類真的顯式計算這個函數;它是一個可供實驗估計的表示選擇模型。
13. 晶化門檻
最簡單的接受規則:
U c r y s > 0. \boxed{
U_{\mathrm{crys}}>0.
} U crys > 0.
若:
U c r y s ≤ 0 , U_{\mathrm{crys}}\le0, U crys ≤ 0 ,
系統可以選擇:
保持原長結構;
延伸既有詞義;
使用 compound;
使用參數模板;
使用上下文補全;
暫不建立新 primitive。
所以「有新概念」不等於「必須有新詞」。
14. 與 word reuse 的關係
一個新 meaning 可以不增加:
∣ Σ ∣ . |\Sigma|. ∣Σ∣.
它可以將既有詞:
w w w
延伸到:
m n e w . m_{\mathrm{new}}. m new .
形式上:
Σ t + 1 = Σ t , \Sigma_{t+1}
=
\Sigma_t, Σ t + 1 = Σ t ,
但:
M e a n i n g t ( w ) ⊂ M e a n i n g t + 1 ( w ) . Meaning_t(w)
\subset
Meaning_{t+1}(w). M e anin g t ( w ) ⊂ M e anin g t + 1 ( w ) .
Reuse 的優勢是:
C f o r m C_{\mathrm{form}} C form
低。
但若新 meaning 與舊 meaning 太接近或太多,
則:
A ( w ) A(w) A ( w )
與:
E d e c o d e ( w ) E_{\mathrm{decode}}(w) E decode ( w )
可能上升。
因此 reuse 也是一種壓縮策略,而不是零成本策略。
15. 與 combination / compounding 的關係
Combination 使用既有 primitive:
w 1 , w 2 , … w_1,
w_2,
\ldots w 1 , w 2 , …
生成:
w 1 w 2 . w_1w_2. w 1 w 2 .
它沒有立即要求建立完全任意的新形式,而是利用結構增加資訊性。
因此可以理解為:
Structural Expansion → Lexical Stabilization . \boxed{
\text{Structural Expansion}
\rightarrow
\text{Lexical Stabilization}.
} Structural Expansion → Lexical Stabilization .
當 compound 高頻、穩定並逐步 conventionalize 時,它可能從每次動態組合的 expression 轉向 lexicalized unit。
這正是本系列所稱:
E S → E L \mathcal E_S
\rightarrow
\mathcal E_L E S → E L
的一條自然路徑。
16. Coinage 何時可能值得
若某 emerging concept:
m m m
與既有詞義距離過遠,
使 reuse 造成高:
A , E d e c o d e , A,
\quad
E_{\mathrm{decode}}, A , E decode ,
而 combination 又需要過長結構:
C ( φ ) C(\varphi) C ( φ )
很高,
則全新 primitive:
z z z
可能反而具有較高效用。
工作性比較:
U c o i n a g e > max { U r e u s e , U c o m b i n e } \boxed{
U_{\mathrm{coinage}}
>
\max
\{
U_{\mathrm{reuse}},
U_{\mathrm{combine}}
\}
} U coinage > max { U reuse , U combine }
時,coinage 成為合理候選。
這不是歷史詞彙變化的決定論,只是一個表示策略比較。
17. Semantic Cache 模型
本文可以把 primitive 視為一種語義快取。
長表示:
φ \varphi φ
是完整展開形式。
晶化:
C a c h e ( φ ) = z . Cache(\varphi)=z. C a c h e ( φ ) = z .
調用:
z . z. z .
解碼:
E x p a n d ( z ) = φ ^ . Expand(z)=\widehat\varphi. E x p an d ( z ) = φ .
若:
d ( φ ^ , φ ) ≤ ϵ , d(
\widehat\varphi,
\varphi
)
\le
\epsilon, d ( φ , φ ) ≤ ϵ ,
則 cache 在目前任務中有效。
因此:
primitive ≈ 可重用的低成本語義入口 . \boxed{
\text{primitive}
\approx
\text{可重用的低成本語義入口}.
} primitive ≈ 可重用的低成本語義入口 .
這個比喻不表示人腦真的使用計算機 cache,而是說明表示層的重用結構。
18. Cache Hit 與 Cache Miss
若一個 primitive:
z z z
在新語境中仍能準確重建:
φ , \varphi, φ ,
可以視為:
H i t ( z ) = 1. Hit(z)=1. H i t ( z ) = 1.
若新語境已超出舊 primitive 的有效域:
d ( D e c o d e ( z ) , φ n e w ) > ϵ , d(
Decode(z),
\varphi_{\mathrm{new}}
)
>
\epsilon, d ( D eco d e ( z ) , φ new ) > ϵ ,
則:
H i t ( z ) = 0. Hit(z)=0. H i t ( z ) = 0.
此時系統需要:
Re-expand \boxed{
\text{Re-expand}
} Re-expand
重新打開原本被壓縮的結構。
這解釋了為什麼技術術語即使已成熟,在新的邊界案例出現時仍會重新遭遇定義爭議。
19. 晶化後仍然可以再次分裂
若 z z z 原本壓縮:
Φ 0 \Phi_0 Φ 0
但後來新案例:
X n e w X_{\mathrm{new}} X new
使:
E d e c o d e ( z ) E_{\mathrm{decode}}(z) E decode ( z )
快速上升,
則原 primitive 可以重新展開:
z → { φ 1 , φ 2 , … } . z
\rightarrow
\{
\varphi_1,
\varphi_2,
\ldots
\}. z → { φ 1 , φ 2 , … } .
接著:
φ i \varphi_i φ i
又可以重新形成:
z 1 , z 2 , … . z_1,
z_2,\ldots. z 1 , z 2 , … .
因此 lexical primitive 不是不可逆終點。
20. 從一詞到多詞,再從多詞到高階詞
一個常見語義生命週期可以寫成:
z t → { φ 1 , … , φ n } → { z 1 , … , z k } → z t + 1 . \boxed{
z_t
\rightarrow
\{
\varphi_1,
\ldots,
\varphi_n
\}
\rightarrow
\{
z_1,
\ldots,
z_k
\}
\rightarrow
z_{t+1}.
} z t → { φ 1 , … , φ n } → { z 1 , … , z k } → z t + 1 .
第一步是解包。
第二步是差異化。
第三步則可能重新建立一個新的高階詞。
所以詞彙演化不是單純:
∣ Σ t ∣ → larger . |\Sigma_t|
\rightarrow
\text{larger}. ∣ Σ t ∣ → larger .
而是:
展開 ⇄ 收斂 . \boxed{
\text{展開}
\rightleftarrows
\text{收斂}.
} 展開 ⇄ 收斂 .
21. 符號晶化與低秩表示
令多個高維複合語義案例形成:
S ∈ R N × d . \mathbf S
\in
\mathbb R^{N\times d}. S ∈ R N × d .
若:
S ≈ U r V r \mathbf S
\approx
\mathbf U_r
\mathbf V_r S ≈ U r V r
且:
r ≪ d , r\ll d, r ≪ d ,
則可以把穩定低維方向視為候選 semantic factors。
若其中某一方向:
u k \mathbf u_k u k
在大量案例中高頻出現且具有穩定重建性,則可建立 primitive:
z k . z_k. z k .
因此「新詞」在工作模型中可以被理解成:
高頻穩定語義結構的一個低成本座標名稱 . \boxed{
\text{高頻穩定語義結構的一個低成本座標名稱}.
} 高頻穩定語義結構的一個低成本座標名稱 .
這不是說真實詞彙演化等同於 SVD,而是提供後續計算實驗的一種近似方法。
22. 新詞不一定增加 rank
若:
z ∈ span ( S ) , \mathbf z
\in
\operatorname{span}(\mathbf S), z ∈ span ( S ) ,
那麼:
Δ rank = 0. \Delta \operatorname{rank}=0. Δ rank = 0.
但如果:
L ( z ) < L ( φ z ) , L(\mathbf z)
<
L(\varphi_z), L ( z ) < L ( φ z ) ,
則:
V C ( z ) > 0. V_C(z)>0. V C ( z ) > 0.
因此一個成熟術語可能只是把既有可組合語義變成低成本入口。
這類 lexicalization 的價值不在擴大表達空間,而在改變:
到達某個語義區域的成本 . \boxed{
\text{到達某個語義區域的成本}.
} 到達某個語義區域的成本 .
23. 真正增加新維度的新詞
另一種情況是:
rank [ S z ] > rank ( S ) . \operatorname{rank}
\begin{bmatrix}
\mathbf S&\mathbf z
\end{bmatrix}
>
\operatorname{rank}(\mathbf S). rank [ S z ] > rank ( S ) .
此時 z z z 至少在目前線性表示模型中提供新的獨立區分。
因此新詞至少有兩種理想型:
Compression Primitive \boxed{
\text{Compression Primitive}
} Compression Primitive
與:
Discrimination Primitive . \boxed{
\text{Discrimination Primitive}.
} Discrimination Primitive .
實際詞彙則可能同時具有兩者。
24. 穩定性與晶化延遲
若新概念剛出現時:
S ( Φ t ) S(\Phi_t) S ( Φ t )
很低,
過早 lexicalize 可能導致頻繁重新定義。
因此可以設計晶化延遲:
C r y s t a l l i z e only if S ( Φ t ) ≥ τ S \boxed{
Crystallize
\text{ only if }
S(\Phi_t)\ge\tau_S
} C r y s t a l l i z e only if S ( Φ t ) ≥ τ S
並要求重用頻率:
f t ≥ τ f . f_t\ge\tau_f. f t ≥ τ f .
這相當於:
不要每遇到一個新差異就立即造詞;先等待結構是否真的穩定。
這正好抑制本系列 Paper 02 所定義的 synonym proliferation 與 lexical explosion。
25. 詞彙化與局部收斂
當某個複合語義反覆被壓成:
z , z, z ,
可以理解為該局部表示域形成了:
lexical local convergence . \boxed{
\text{lexical local convergence}.
} lexical local convergence .
這不表示:
M e a n i n g ( z ) Meaning(z) M e anin g ( z )
永久固定。
只表示目前案例集合:
X t X_t X t
與誤差要求:
ϵ \epsilon ϵ
下,使用 z z z 比每次展開 φ \varphi φ 更有效。
若新案例出現:
X t + 1 = X t ∪ Z , X_{t+1}
=
X_t
\cup
Z, X t + 1 = X t ∪ Z ,
則可能重新打開:
z → φ . z
\rightarrow
\varphi. z → φ .
所以 lexicalization 可以被視為可逆程度不同的局部收斂。
26. 晶化決策矩陣
為了讓本模型可以工程化,可對候選 z i z_i z i 建立評估矩陣:
M = [ R 1 D 1 S 1 C 1 E 1 A 1 K 1 R 2 D 2 S 2 C 2 E 2 A 2 K 2 ⋮ ⋮ ⋮ ⋮ ⋮ ⋮ ⋮ R n D n S n C n E n A n K n ] . \mathbf M
=
\begin{bmatrix}
R_1&D_1&S_1&C_1&E_1&A_1&K_1\\
R_2&D_2&S_2&C_2&E_2&A_2&K_2\\
\vdots&\vdots&\vdots&\vdots&\vdots&\vdots&\vdots\\
R_n&D_n&S_n&C_n&E_n&A_n&K_n
\end{bmatrix}. M = R 1 R 2 ⋮ R n D 1 D 2 ⋮ D n S 1 S 2 ⋮ S n C 1 C 2 ⋮ C n E 1 E 2 ⋮ E n A 1 A 2 ⋮ A n K 1 K 2 ⋮ K n .
權重向量:
w = [ α β γ η − λ − μ − ν ] . \mathbf w
=
\begin{bmatrix}
\alpha\\
\beta\\
\gamma\\
\eta\\
-\lambda\\
-\mu\\
-\nu
\end{bmatrix}. w = α β γ η − λ − μ − ν .
得到:
u = M w . \boxed{
\mathbf u
=
\mathbf M
\mathbf w.
} u = Mw .
若:
u i > 0 , u_i>0, u i > 0 ,
則候選 z i z_i z i 進入後續 lexicalization 測試。
這個矩陣只是工程接口,不是假設所有真實語言共同體都以同一線性權重決策。
27. 可反駁預測
P1:重用頻率提高,晶化傾向應上升
在其他條件近似相同時:
∂ P ( Crystallize ) ∂ f > 0. \frac{\partial P(\operatorname{Crystallize})}{\partial f}>0. ∂ f ∂ P ( Crystallize ) > 0.
但如果語義穩定度很低,頻率效果應被削弱。
P2:高歧義應抑制純 reuse
若:
A ( w ) A(w) A ( w )
過高,系統更可能轉向 combination、modifier 或新 primitive。
P3:高資訊精度需求應提高較顯式形式的比例
當任務要求:
ϵ → 0 , \epsilon
\rightarrow0, ϵ → 0 ,
過度壓縮的 primitive 應更常被重新展開。
P4:高頻穩定複合結構應逐漸縮短平均調用成本
這可能透過 abbreviation、lexicalization、專門術語或其他常規化形式實現。
P5:新 primitive 的價值應可拆成判別與壓縮兩類
應觀察到:
Δ rank > 0 \Delta \operatorname{rank}>0 Δ rank > 0
型的新表示,也應觀察到:
Δ rank = 0 \Delta \operatorname{rank}=0 Δ rank = 0
但總表示成本下降的表示。
28. 如何實驗
後續可以建立 controlled artificial lexicon。
給參與者或模型一組 primitive:
Σ 0 . \Sigma_0. Σ 0 .
讓它們反覆表達一組複合 meaning:
Φ . \Phi. Φ.
控制:
repetition frequency;
semantic variance;
ambiguity;
expression length;
penalty for errors;
cost of introducing new labels。
記錄:
T c r y s T_{\mathrm{crys}} T crys
即某個新 primitive 第一次穩定出現的時間。
然後測:
T c r y s = f ( R , D , S , C , E , A , K ) . T_{\mathrm{crys}}
=
f(
R,D,S,C,E,A,K
). T crys = f ( R , D , S , C , E , A , K ) .
若模型預測失敗,可以直接修改權重或否定整個晶化效用框架。
29. 與真實語言研究的區分
本文的「晶化」可能發生於:
個人臨時術語;
技術團隊內部命名;
數學符號;
程式變數;
一篇論文中的局部 primitive;
真實自然語言新詞。
但這些層級不相同。
尤其:
個體表示晶化 ⇏ 社會 lexicalization . \boxed{
\text{個體表示晶化}
\not\Rightarrow
\text{社會 lexicalization}.
} 個體表示晶化 ⇒ 社會 lexicalization .
要成為自然語言共同體的真正 lexical item,還涉及傳播、conventionalization、社會網路、世代傳遞與歷史穩定等額外機制。
本文不處理這些完整社會動力,只處理「表示層為何值得建立低成本入口」。
30. 從 Paper 03 到 Paper 05
Paper 03 提出:
E L , E P , E S . \mathcal E_L,
\quad
\mathcal E_P,
\quad
\mathcal E_S. E L , E P , E S .
Paper 05 現在回答:
Structural 或 Parametric Expansion 何時值得轉回 Lexical Expansion?
最核心轉換為:
E S → E L \boxed{
\mathcal E_S
\rightarrow
\mathcal E_L
} E S → E L
以及:
E P → E L . \boxed{
\mathcal E_P
\rightarrow
\mathcal E_L.
} E P → E L .
但只有當:
U c r y s > 0. U_{\mathrm{crys}}>0. U crys > 0.
所以 lexicalization 不再只是「詞庫增加」,而是整個表示系統中的一種壓縮與重新基底操作。
31. 從 Paper 04 的「界化」看晶化
Paper 04 曾生成中階詞:
B z . \mathcal Bz. B z .
它在早期有價值,因為每次完整說:
某差異在條件與判準作用下形成可辨識的 boundary structure
成本較高。
所以:
φ b o u n d a r y → B z \varphi_{\mathrm{boundary}}
\rightarrow
\mathcal Bz φ boundary → B z
具有:
V C > 0. V_C>0. V C > 0.
但後續收斂時發現:
B z \mathcal Bz B z
不必成為最小 primitive。
這顯示晶化可以是暫時的。
一個詞可以:
先因壓縮價值而生成,再因更高階收斂而被淘汰。 \boxed{
\text{先因壓縮價值而生成,再因更高階收斂而被淘汰。}
} 先因壓縮價值而生成,再因更高階收斂而被淘汰。
這是語義動力學中非常重要的現象。
32. 晶化與再基底
假設舊表示基底:
Σ t = { σ 1 , … , σ n } . \Sigma_t
=
\{
\sigma_1,\ldots,\sigma_n
\}. Σ t = { σ 1 , … , σ n } .
若複合方向:
φ = f ( σ i , σ j , σ k ) \varphi
=
f(
\sigma_i,\sigma_j,\sigma_k
) φ = f ( σ i , σ j , σ k )
反覆穩定出現,
加入:
z z z
相當於建立新的座標。
系統可以保留舊基底:
Σ t + 1 = Σ t ∪ { z } , \Sigma_{t+1}
=
\Sigma_t
\cup
\{z\}, Σ t + 1 = Σ t ∪ { z } ,
也可以在更強收斂時刪除冗餘 primitive,形成:
Σ t + 1 = R e b a s e ( Σ t , z ) . \boxed{
\Sigma_{t+1}
=
Rebase(
\Sigma_t,
z
).
} Σ t + 1 = R e ba se ( Σ t , z ) .
因此真正重要的不只是「新詞增加」,還包括:
semantic basis change . \boxed{
\text{semantic basis change}.
} semantic basis change .
33. Primitive Inflation 與抑制條件
如果每一個複合結構都立即晶化:
φ i → z i , \varphi_i
\rightarrow
z_i, φ i → z i ,
則:
∣ Σ t ∣ |\Sigma_t| ∣ Σ t ∣
會快速爆炸。
因此本文提出最低抑制條件:
R ≥ τ R , \boxed{
R\ge\tau_R,
} R ≥ τ R ,
S ≥ τ S , \boxed{
S\ge\tau_S,
} S ≥ τ S ,
E d e c o d e ≤ τ E , \boxed{
E_{\mathrm{decode}}\le\tau_E,
} E decode ≤ τ E ,
以及:
U c r y s > 0. \boxed{
U_{\mathrm{crys}}>0.
} U crys > 0.
缺一不代表永遠禁止新詞,但表示目前沒有足夠證據將複合結構升級為 primitive。
34. 一個更簡短的晶化判準
如果不需要完整效用函數,可用四項最低測試:
會不會重複?
是不是同一個穩定結構?
縮成一個詞後能不能少付成本?
縮完後會不會丟掉目前重要的差異?
形式化:
C r y s t a l l i z e ( φ ) = 1 \boxed{
Crystallize(\varphi)
=
1
} C r y s t a l l i z e ( φ ) = 1
若:
F r e q ( φ ) ≥ τ f , Freq(\varphi)\ge\tau_f, F r e q ( φ ) ≥ τ f ,
S t a b i l i t y ( φ ) ≥ τ s , Stability(\varphi)\ge\tau_s, S t abi l i t y ( φ ) ≥ τ s ,
C o s t ( z ) < C o s t ( φ ) , Cost(z)<Cost(\varphi), C os t ( z ) < C os t ( φ ) ,
且:
E r r o r ( z ) ≤ ϵ . Error(z)\le\epsilon. E r r or ( z ) ≤ ϵ .
這是最接近工程實作的 v0.1 判準。
35. 本文限制
第一,「符號晶化」是本系列工作術語,不應與既有 lexicalization、conventionalization、grammaticalization 或 terminology formation 混為一談。
第二,本文目前主要研究表示層,不處理完整社會傳播與語言共同體接受機制。
第三, U c r y s U_{\mathrm{crys}} U crys 的權重未經人類實驗估計。
第四,rank、低秩分解與 cache 只是計算比喻與工作模型,不能被當成自然語言認知機制的直接證明。
第五,真實新詞生成也可能受到身份、權力、文化、幽默、時尚、政治、品牌與其他非效率因素影響。本文沒有否認這些因素,只是抽取其中「表示成本與判別收益」的一條可計算軸。
第六,一個詞的歷史穩定並不保證其語義單一;polysemy 本身可能是高效率 lexicon 的結果,而不是失敗。
36. 結論
本文從一個簡單問題開始:
已經能用舊語言說出來的東西,為什麼還需要新詞?
答案不是:
因為舊語言不能表達。 \boxed{
\text{因為舊語言不能表達。}
} 因為舊語言不能表達。
至少不總是如此。
更一般的答案是:
因為每次重新展開的成本可能已經高於建立一個新入口的成本。 \boxed{
\text{因為每次重新展開的成本可能已經高於建立一個新入口的成本。}
} 因為每次重新展開的成本可能已經高於建立一個新入口的成本。
因此一個複合語義:
φ \varphi φ
可以經歷:
φ → repetition → stabilization → compression → z . \boxed{
\varphi
\rightarrow
\text{repetition}
\rightarrow
\text{stabilization}
\rightarrow
\text{compression}
\rightarrow
z.
} φ → repetition → stabilization → compression → z .
但只有在:
U c r y s > 0 \boxed{
U_{\mathrm{crys}}>0
} U crys > 0
時,建立新的 primitive 才有工作性理由。
而 z z z 生成之後,又可以:
z → φ ′ → z ′ → ⋯ . z
\rightarrow
\varphi'
\rightarrow
z'
\rightarrow
\cdots. z → φ ′ → z ′ → ⋯ .
所以新詞不是語義生成的起點,也不是終點。
它更像一個階段性的低成本座標:
高頻穩定複合語義 → 低成本 primitive → 下一輪複合語義 . \boxed{
\text{高頻穩定複合語義}
\rightarrow
\text{低成本 primitive}
\rightarrow
\text{下一輪複合語義}.
} 高頻穩定複合語義 → 低成本 primitive → 下一輪複合語義 .
這使本系列的語言循環進一步清楚:
展開 → 重複 → 穩定 → 晶化 → 再展開 . \boxed{
\text{展開}
\rightarrow
\text{重複}
\rightarrow
\text{穩定}
\rightarrow
\text{晶化}
\rightarrow
\text{再展開}.
} 展開 → 重複 → 穩定 → 晶化 → 再展開 .
也因此,「嘴巴王」真正的能力不是永遠講更多,而是知道何時值得繼續講,何時應該把一大串話壓成一個新詞。
參考文獻
Xu, A., Kemp, C., Frermann, L., & Xu, Y. (2024). Word reuse and combination support efficient communication of emerging concepts . Proceedings of the National Academy of Sciences, 121(46), e2406971121. DOI: 10.1073/pnas.2406971121.
Yu, L., & Xu, Y. (2025). Infinite Mixture Chaining: An Efficiency-Based Framework for the Dynamic Construction of Word Meaning . Open Mind: Discoveries in Cognitive Science, 9, 1-24. DOI: 10.1162/opmi_a_00176.
Kanwal, J., Smith, K., Culbertson, J., & Kirby, S. (2017). Zipf's Law of Abbreviation and the Principle of Least Effort: Language users optimise a miniature lexicon for efficient communication . Cognition, 165, 45-52. DOI: 10.1016/j.cognition.2017.05.001.
Piantadosi, S. T., Tily, H., & Gibson, E. (2011). Word lengths are optimized for efficient communication . Proceedings of the National Academy of Sciences, 108(9), 3526-3529. DOI: 10.1073/pnas.1012551108.
Zaslavsky, N., Kemp, C., Regier, T., & Tishby, N. (2018). Efficient human-like semantic representations via the Information Bottleneck principle . arXiv:1808.03353.
Tishby, N., Pereira, F. C., & Bialek, W. (2000). The information bottleneck method . arXiv:physics/0004057.
系列位置
Paper 01:自然語言的無界精細化假說
Paper 02:從「很接近,但還不夠精準」開始:自然語言百輪語義壓力測試方法論
Paper 03:自然語言的三種展開機制
Paper 04:邊界不是一個詞:邊界本體論的百輪語義壓力測試
Paper 05:新詞從何而來:複合語義、重複結構與符號晶化
Paper 06:語義的展開與收斂:從無界精細化到最小生成核
Paper 07:自然語言精細化的矩陣表示
Paper 08:有限符號與無界語義:自然語言生成、展開與收斂循環