# 新詞從何而來
## 複合語義、重複結構與符號晶化

**系列：** 自然語言無界精細化與收斂系列  
**Paper：** 05 / 08  
**作者：** Neo.K  
**AI 協作整理：** GPT-5.6 Sol  
**機構：** EveMissLab／一言諾科技有限公司  
**版本：** v0.1  
**日期：** 2026-08-20  
**類型：** 語言哲學／詞彙化理論／形式語義／資訊效率／符號動力學

---

## 摘要

本文研究一個比「如何造新詞」更窄也更形式化的問題：當一段原本可以用既有詞彙、參數與句法完整表達的複合語義結構反覆出現時，什麼條件會使它值得被壓縮成一個新的可重用 lexical primitive？

既有 lexicalization 研究已指出，新興概念常透過既有詞義延伸、word reuse、combination、compounding、borrowing 與 coinage 等策略進入詞彙系統；近期資訊效率研究進一步顯示，word reuse 與 combination 可以被理解為形式成本與資訊精度之間的折衷。本文不重新命名這些既有現象，而提出一個系列內部的工作概念：「符號晶化」（symbol crystallization），專指一個高成本複合表示：

$$
\varphi
=
f(
\sigma_1,
\sigma_2,
\ldots,
\sigma_k;
p_1,
\ldots,
p_m
)
$$

被重新映射為一個低成本入口：

$$
z,
$$

且在需要時可以由 $z$ 重新展開回足夠接近的語義結構：

$$
Decode(z)
\approx
\varphi.
$$

本文提出，重複頻率不是晶化的唯一條件。若一個複合結構雖然高頻，但高度不穩定、容易與其他結構混淆、解碼誤差高或定義成本過大，將它壓縮成新 primitive 反而可能降低整體語義效率。因此本文定義工作性的晶化效用：

$$
\boxed{
U_{\mathrm{crys}}(z\mid\varphi)
=
\alpha R
+
\beta D
+
\gamma S
+
\eta C_{\mathrm{save}}
-
\lambda E_{\mathrm{decode}}
-
\mu A
-
\nu C_{\mathrm{define}}
}
$$

其中 $R$ 為重用收益， $D$ 為新增判別價值， $S$ 為語義穩定度， $C_{\mathrm{save}}$ 為表達成本節省， $E_{\mathrm{decode}}$ 為解碼重建誤差， $A$ 為歧義負擔， $C_{\mathrm{define}}$ 為建立與維持新 primitive 的成本。

當：

$$
U_{\mathrm{crys}}>0
$$

時，晶化在目前任務條件下具有正效用；當：

$$
U_{\mathrm{crys}}\le0,
$$

保留原複合結構、使用參數化模板、延伸既有詞義或維持較長表達，可能更有效。

本文進一步指出，新 primitive 並不是語義演化的終點。一旦：

$$
\varphi
\rightarrow
z,
$$

新的 $z$ 又可以參與下一輪結構組合：

$$
z
\rightarrow
\varphi'
\rightarrow
z'
\rightarrow
\cdots.
$$

因此，詞彙化可以被嵌入本系列更一般的循環：

$$
\boxed{
\text{複合}
\rightarrow
\text{重用}
\rightarrow
\text{壓縮}
\rightarrow
\text{新 primitive}
\rightarrow
\text{再組合}
\rightarrow
\text{再壓縮}.
}
$$

本文的主要貢獻是提出一套可操作的「何時值得新建 primitive」判準，並把判別價值與壓縮價值明確分離，以避免把「新詞出現」誤當成「語義維度必然增加」。

**關鍵詞：** lexicalization、word formation、semantic compression、symbol crystallization、semantic cache、lexical innovation、word reuse、compounding、communicative efficiency、primitive formation

---

# 1. 問題：能說出來，為什麼還要造詞

假設一個語義結構：

$$
\varphi
$$

已經可以用既有語言完整表達。

例如：

$$
\varphi
=
f(
\sigma_1,
\sigma_2,
\sigma_3
).
$$

如果它已可被表達，表面上似乎沒有新增詞彙的必要。

然而，真實語言並不是只追求「可表達性」。

它還同時受到：

- 表達長度；
- 使用頻率；
- 記憶成本；
- 可辨識度；
- 歧義；
- 學習成本；
- 重建精度；
- 社會與技術慣例；

等因素約束。

因此真正的問題不是：

$$
\boxed{
\text{這個複合語義能不能用舊語言表示？}
}
$$

而是：

$$
\boxed{
\text{每次都重新展開它，是否仍然值得？}
}
$$

---

# 2. 與既有 lexicalization 研究的邊界

Lexicalization 是成熟的語言學研究領域，本文不把一般新詞形成重新命名為「符號晶化」。

近期研究尤其適合作為本文背景。

Xu、Kemp、Frermann 與 Xu 對英語、法語與芬蘭語近百年 lexical innovation 的分析顯示，word reuse 與 combination 都可以在形式長度與資訊精度之間形成效率折衷。Reuse 往往避免增加形式長度，但可能降低精確性；combination 通常較長，卻提供更多資訊。

Yu 與 Xu 的 Infinite Mixture Chaining 則從 representational accuracy 與 memory complexity 的折衷出發，研究有限 lexicon 如何動態吸收持續出現的新 meanings，並顯示語義延伸可以由效率原則組織，而非完全任意。

更早的 Zipfian efficiency 與 word-length 研究亦顯示，頻率、資訊量與形式成本之間存在穩定關係。Kanwal 等人的人工語言實驗顯示，當 accuracy 與 efficiency 壓力同時存在時，參與者會形成類似高頻形式較短的 lexicon；Piantadosi、Tily 與 Gibson 則指出，平均資訊量比單純頻率更能預測 word length。

因此，本文不主張：

$$
\boxed{
\text{高頻結構會縮短}
}
$$

是新發現。

本文要做的是把本系列前四篇產生的問題明確化：

> 若一個語義結構已由 lexical、parametric 與 structural resources 生成，什麼時候應把它重新收斂成一個新的 primitive？

---

# 3. 「符號晶化」的工作定義

令：

$$
\Sigma_t
$$

為第 $t$ 時點可直接調用的 primitive 集合。

令：

$$
\varphi
\in
\operatorname{Closure}
(
\Sigma_t,
P_t,
\mathcal O_t
)
$$

為由既有 primitive、參數與操作生成的複合表示。

若系統建立：

$$
z
\notin
\Sigma_t,
$$

並令：

$$
\Sigma_{t+1}
=
\Sigma_t
\cup
\{z\},
$$

同時建立：

$$
Encode(\varphi)=z,
$$

以及近似可逆的：

$$
Decode(z)\approx\varphi,
$$

則本文把此表示操作稱為：

$$
\boxed{
\operatorname{Crystallize}(\varphi)=z.
}
$$

「晶化」只是本系列的工作術語。

它不預設 $z$ 已進入整個自然語言共同體，也不預設它具有長期歷史穩定性。若討論真實語言的社會詞彙化，仍應使用 lexicalization、coinage、compounding、semantic extension、conventionalization 等既有術語。

---

# 4. 晶化不是單純縮寫

最弱的壓縮只是：

$$
\varphi
\rightarrow
z
$$

其中 $z$ 是任意代號。

但一個真正有用的 primitive 至少還需要：

$$
Decode(z)
$$

在目前任務中保持足夠穩定。

因此本文要求：

$$
\boxed{
d(
Decode(z),
\varphi
)
\le
\epsilon.
}
$$

其中：

$$
d
$$

是任務相關的語義距離，

$$
\epsilon
$$

是允許的重建誤差。

若：

$$
d(
Decode(z),
\varphi
)
\gg
\epsilon,
$$

那麼 $z$ 不是有效壓縮，而只是產生新的歧義。

---

# 5. 第一個壓力：重複頻率

假設每次完整表示 $\varphi$ 的成本為：

$$
C(\varphi).
$$

使用新 primitive $z$ 的成本為：

$$
C(z).
$$

定義 $z$ 的一次性成本為：

$$
C_{\mathrm{define}}(z).
$$

若預期未來重用：

$$
f
$$

次，

則最簡單的壓縮收益：

$$
\boxed{
R_f
=
f
\left[
C(\varphi)-C(z)
\right]
-
C_{\mathrm{define}}(z).
}
$$

若：

$$
R_f>0,
$$

則只從長度或操作成本角度看，建立 $z$ 有利。

等價地，若：

$$
C(\varphi)>C(z),
$$

最低重用門檻為：

$$
\boxed{
f^\ast
>
\frac{
C_{\mathrm{define}}(z)
}{
C(\varphi)-C(z)
}.
}
$$

這是「semantic cache」直覺的第一個形式版本。

---

# 6. 但高頻本身仍然不夠

如果一段語義每次出現時都稍微不同，

例如：

$$
\varphi_1,
\varphi_2,
\ldots,
\varphi_n
$$

只具有表面相似，而沒有穩定共同核心，

則把它們全部壓成：

$$
z
$$

可能造成嚴重資訊損失。

因此還需要定義語義穩定度：

$$
\boxed{
S(\Phi)
=
1
-
\operatorname{Dispersion}
(
\varphi_1,
\ldots,
\varphi_n
).
}
$$

其中：

$$
\Phi
=
\{
\varphi_1,\ldots,\varphi_n
\}.
$$

若：

$$
S(\Phi)\approx1,
$$

表示重複出現的結構高度穩定。

若：

$$
S(\Phi)\approx0,
$$

建立單一 primitive 的風險很高。

---

# 7. 第二個價值：判別力

新 primitive 可能不只壓縮舊結構，還可能建立新的分類軸。

令原表示為：

$$
S_t.
$$

若兩案例：

$$
x,y
$$

原本不可分：

$$
S_t(x)=S_t(y),
$$

而新增 $z$ 後：

$$
S_{t+1}(x)\neq S_{t+1}(y),
$$

則：

$$
\boxed{
D(z)>0.
}
$$

此時 $z$ 不只是 cache。

它真的增加了目前系統的有效判別能力。

---

# 8. 壓縮價值與判別價值必須分開

這是本系列最重要的區分之一。

令案例表示矩陣為：

$$
\mathbf S
\in
\mathbb R^{N\times d}.
$$

新增 primitive 欄：

$$
\mathbf z.
$$

若：

$$
\operatorname{rank}
\begin{bmatrix}
\mathbf S&\mathbf z
\end{bmatrix}
>
\operatorname{rank}(\mathbf S),
$$

則 $z$ 至少在線性工作模型下增加新的表示方向。

但若：

$$
\mathbf z
\in
\operatorname{span}(\mathbf S),
$$

仍不能推出 $z$ 無用。

只要：

$$
C(z)
<
C(\varphi_z),
$$

它仍有壓縮價值。

因此：

$$
\boxed{
V(z)
=
V_D(z)
+
V_C(z),
}
$$

而不是：

$$
\boxed{
V(z)
=
V_D(z)
}
$$

而已。

---

# 9. 第三個壓力：歧義成本

壓縮越強，越可能讓不同結構共用同一形式。

若：

$$
\varphi_a
\neq
\varphi_b,
$$

但：

$$
Encode(\varphi_a)
=
Encode(\varphi_b)
=
z,
$$

則接收或後續推理需要額外條件才能恢復正確語義。

令：

$$
A(z)
$$

表示這種歧義負擔。

若 $z$ 的使用需要大量額外 disambiguation：

$$
C_{\mathrm{disamb}}(z)
$$

則實際壓縮收益應改為：

$$
\boxed{
C_{\mathrm{net}}(z)
=
C(\varphi)
-
C(z)
-
C_{\mathrm{disamb}}(z).
}
$$

因此短不一定更有效。

這與既有效率研究中「形式短度與資訊精度存在折衷」相一致。

---

# 10. 第四個壓力：解碼誤差

定義：

$$
\boxed{
E_{\mathrm{decode}}(z)
=
\mathbb E
\left[
d(
Decode(z),
\varphi
)
\right].
}
$$

若一個新詞很短、很常用，但：

$$
E_{\mathrm{decode}}
$$

過高，

那麼它可能把表達成本轉換成理解與校正成本。

因此有效晶化不能只追求：

$$
C(z)\rightarrow0.
$$

還要保持：

$$
E_{\mathrm{decode}}
\le
\epsilon.
$$

---

# 11. 第五個壓力：建立與維護成本

新 primitive 不是免費的。

它需要：

- 被定義；
- 被記住；
- 被索引；
- 與既有詞區分；
- 在語境中被正確調用；
- 必要時重新解釋。

因此：

$$
C_{\mathrm{define}}(z)
$$

應該更廣義地理解為：

$$
\boxed{
C_{\mathrm{define}}
=
C_{\mathrm{create}}
+
C_{\mathrm{learn}}
+
C_{\mathrm{maintain}}
+
C_{\mathrm{differentiate}}.
}
$$

對單一短暫概念而言，這些成本可能高於直接說完整長句。

---

# 12. 晶化效用函數

綜合上述因素，本文提出工作性函數：

$$
\boxed{
U_{\mathrm{crys}}
=
\alpha R
+
\beta D
+
\gamma S
+
\eta C_{\mathrm{save}}
-
\lambda E_{\mathrm{decode}}
-
\mu A
-
\nu C_{\mathrm{define}}.
}
$$

其中：

- $R$：預期重用收益；
- $D$：新增判別價值；
- $S$：語義穩定度；
- $C_{\mathrm{save}}$：表達與操作成本節省；
- $E_{\mathrm{decode}}$：解碼重建誤差；
- $A$：歧義負擔；
- $C_{\mathrm{define}}$：建立與維護成本。

權重：

$$
\alpha,
\beta,
\gamma,
\eta,
\lambda,
\mu,
\nu
$$

由任務決定。

本文不主張人類真的顯式計算這個函數；它是一個可供實驗估計的表示選擇模型。

---

# 13. 晶化門檻

最簡單的接受規則：

$$
\boxed{
U_{\mathrm{crys}}>0.
}
$$

若：

$$
U_{\mathrm{crys}}\le0,
$$

系統可以選擇：

- 保持原長結構；
- 延伸既有詞義；
- 使用 compound；
- 使用參數模板；
- 使用上下文補全；
- 暫不建立新 primitive。

所以「有新概念」不等於「必須有新詞」。

---

# 14. 與 word reuse 的關係

一個新 meaning 可以不增加：

$$
|\Sigma|.
$$

它可以將既有詞：

$$
w
$$

延伸到：

$$
m_{\mathrm{new}}.
$$

形式上：

$$
\Sigma_{t+1}
=
\Sigma_t,
$$

但：

$$
Meaning_t(w)
\subset
Meaning_{t+1}(w).
$$

Reuse 的優勢是：

$$
C_{\mathrm{form}}
$$

低。

但若新 meaning 與舊 meaning 太接近或太多，

則：

$$
A(w)
$$

與：

$$
E_{\mathrm{decode}}(w)
$$

可能上升。

因此 reuse 也是一種壓縮策略，而不是零成本策略。

---

# 15. 與 combination / compounding 的關係

Combination 使用既有 primitive：

$$
w_1,
w_2,
\ldots
$$

生成：

$$
w_1w_2.
$$

它沒有立即要求建立完全任意的新形式，而是利用結構增加資訊性。

因此可以理解為：

$$
\boxed{
\text{Structural Expansion}
\rightarrow
\text{Lexical Stabilization}.
}
$$

當 compound 高頻、穩定並逐步 conventionalize 時，它可能從每次動態組合的 expression 轉向 lexicalized unit。

這正是本系列所稱：

$$
\mathcal E_S
\rightarrow
\mathcal E_L
$$

的一條自然路徑。

---

# 16. Coinage 何時可能值得

若某 emerging concept：

$$
m
$$

與既有詞義距離過遠，

使 reuse 造成高：

$$
A,
\quad
E_{\mathrm{decode}},
$$

而 combination 又需要過長結構：

$$
C(\varphi)
$$

很高，

則全新 primitive：

$$
z
$$

可能反而具有較高效用。

工作性比較：

$$
\boxed{
U_{\mathrm{coinage}}
>
\max
\{
U_{\mathrm{reuse}},
U_{\mathrm{combine}}
\}
}
$$

時，coinage 成為合理候選。

這不是歷史詞彙變化的決定論，只是一個表示策略比較。

---

# 17. Semantic Cache 模型

本文可以把 primitive 視為一種語義快取。

長表示：

$$
\varphi
$$

是完整展開形式。

晶化：

$$
Cache(\varphi)=z.
$$

調用：

$$
z.
$$

解碼：

$$
Expand(z)=\widehat\varphi.
$$

若：

$$
d(
\widehat\varphi,
\varphi
)
\le
\epsilon,
$$

則 cache 在目前任務中有效。

因此：

$$
\boxed{
\text{primitive}
\approx
\text{可重用的低成本語義入口}.
}
$$

這個比喻不表示人腦真的使用計算機 cache，而是說明表示層的重用結構。

---

# 18. Cache Hit 與 Cache Miss

若一個 primitive：

$$
z
$$

在新語境中仍能準確重建：

$$
\varphi,
$$

可以視為：

$$
Hit(z)=1.
$$

若新語境已超出舊 primitive 的有效域：

$$
d(
Decode(z),
\varphi_{\mathrm{new}}
)
>
\epsilon,
$$

則：

$$
Hit(z)=0.
$$

此時系統需要：

$$
\boxed{
\text{Re-expand}
}
$$

重新打開原本被壓縮的結構。

這解釋了為什麼技術術語即使已成熟，在新的邊界案例出現時仍會重新遭遇定義爭議。

---

# 19. 晶化後仍然可以再次分裂

若 $z$ 原本壓縮：

$$
\Phi_0
$$

但後來新案例：

$$
X_{\mathrm{new}}
$$

使：

$$
E_{\mathrm{decode}}(z)
$$

快速上升，

則原 primitive 可以重新展開：

$$
z
\rightarrow
\{
\varphi_1,
\varphi_2,
\ldots
\}.
$$

接著：

$$
\varphi_i
$$

又可以重新形成：

$$
z_1,
z_2,\ldots.
$$

因此 lexical primitive 不是不可逆終點。

---

# 20. 從一詞到多詞，再從多詞到高階詞

一個常見語義生命週期可以寫成：

$$
\boxed{
z_t
\rightarrow
\{
\varphi_1,
\ldots,
\varphi_n
\}
\rightarrow
\{
z_1,
\ldots,
z_k
\}
\rightarrow
z_{t+1}.
}
$$

第一步是解包。

第二步是差異化。

第三步則可能重新建立一個新的高階詞。

所以詞彙演化不是單純：

$$
|\Sigma_t|
\rightarrow
\text{larger}.
$$

而是：

$$
\boxed{
\text{展開}
\rightleftarrows
\text{收斂}.
}
$$

---

# 21. 符號晶化與低秩表示

令多個高維複合語義案例形成：

$$
\mathbf S
\in
\mathbb R^{N\times d}.
$$

若：

$$
\mathbf S
\approx
\mathbf U_r
\mathbf V_r
$$

且：

$$
r\ll d,
$$

則可以把穩定低維方向視為候選 semantic factors。

若其中某一方向：

$$
\mathbf u_k
$$

在大量案例中高頻出現且具有穩定重建性，則可建立 primitive：

$$
z_k.
$$

因此「新詞」在工作模型中可以被理解成：

$$
\boxed{
\text{高頻穩定語義結構的一個低成本座標名稱}.
}
$$

這不是說真實詞彙演化等同於 SVD，而是提供後續計算實驗的一種近似方法。

---

# 22. 新詞不一定增加 rank

若：

$$
\mathbf z
\in
\operatorname{span}(\mathbf S),
$$

那麼：

$$
\Delta \operatorname{rank}=0.
$$

但如果：

$$
L(\mathbf z)
<
L(\varphi_z),
$$

則：

$$
V_C(z)>0.
$$

因此一個成熟術語可能只是把既有可組合語義變成低成本入口。

這類 lexicalization 的價值不在擴大表達空間，而在改變：

$$
\boxed{
\text{到達某個語義區域的成本}.
}
$$

---

# 23. 真正增加新維度的新詞

另一種情況是：

$$
\operatorname{rank}
\begin{bmatrix}
\mathbf S&\mathbf z
\end{bmatrix}
>
\operatorname{rank}(\mathbf S).
$$

此時 $z$ 至少在目前線性表示模型中提供新的獨立區分。

因此新詞至少有兩種理想型：

$$
\boxed{
\text{Compression Primitive}
}
$$

與：

$$
\boxed{
\text{Discrimination Primitive}.
}
$$

實際詞彙則可能同時具有兩者。

---

# 24. 穩定性與晶化延遲

若新概念剛出現時：

$$
S(\Phi_t)
$$

很低，

過早 lexicalize 可能導致頻繁重新定義。

因此可以設計晶化延遲：

$$
\boxed{
Crystallize
\text{ only if }
S(\Phi_t)\ge\tau_S
}
$$

並要求重用頻率：

$$
f_t\ge\tau_f.
$$

這相當於：

> 不要每遇到一個新差異就立即造詞；先等待結構是否真的穩定。

這正好抑制本系列 Paper 02 所定義的 synonym proliferation 與 lexical explosion。

---

# 25. 詞彙化與局部收斂

當某個複合語義反覆被壓成：

$$
z,
$$

可以理解為該局部表示域形成了：

$$
\boxed{
\text{lexical local convergence}.
}
$$

這不表示：

$$
Meaning(z)
$$

永久固定。

只表示目前案例集合：

$$
X_t
$$

與誤差要求：

$$
\epsilon
$$

下，使用 $z$ 比每次展開 $\varphi$ 更有效。

若新案例出現：

$$
X_{t+1}
=
X_t
\cup
Z,
$$

則可能重新打開：

$$
z
\rightarrow
\varphi.
$$

所以 lexicalization 可以被視為可逆程度不同的局部收斂。

---

# 26. 晶化決策矩陣

為了讓本模型可以工程化，可對候選 $z_i$ 建立評估矩陣：

$$
\mathbf M
=
\begin{bmatrix}
R_1&D_1&S_1&C_1&E_1&A_1&K_1\\
R_2&D_2&S_2&C_2&E_2&A_2&K_2\\
\vdots&\vdots&\vdots&\vdots&\vdots&\vdots&\vdots\\
R_n&D_n&S_n&C_n&E_n&A_n&K_n
\end{bmatrix}.
$$

權重向量：

$$
\mathbf w
=
\begin{bmatrix}
\alpha\\
\beta\\
\gamma\\
\eta\\
-\lambda\\
-\mu\\
-\nu
\end{bmatrix}.
$$

得到：

$$
\boxed{
\mathbf u
=
\mathbf M
\mathbf w.
}
$$

若：

$$
u_i>0,
$$

則候選 $z_i$ 進入後續 lexicalization 測試。

這個矩陣只是工程接口，不是假設所有真實語言共同體都以同一線性權重決策。

---

# 27. 可反駁預測

## P1：重用頻率提高，晶化傾向應上升

在其他條件近似相同時：

$$
\frac{\partial P(\operatorname{Crystallize})}{\partial f}>0.
$$

但如果語義穩定度很低，頻率效果應被削弱。

## P2：高歧義應抑制純 reuse

若：

$$
A(w)
$$

過高，系統更可能轉向 combination、modifier 或新 primitive。

## P3：高資訊精度需求應提高較顯式形式的比例

當任務要求：

$$
\epsilon
\rightarrow0,
$$

過度壓縮的 primitive 應更常被重新展開。

## P4：高頻穩定複合結構應逐漸縮短平均調用成本

這可能透過 abbreviation、lexicalization、專門術語或其他常規化形式實現。

## P5：新 primitive 的價值應可拆成判別與壓縮兩類

應觀察到：

$$
\Delta \operatorname{rank}>0
$$

型的新表示，也應觀察到：

$$
\Delta \operatorname{rank}=0
$$

但總表示成本下降的表示。

---

# 28. 如何實驗

後續可以建立 controlled artificial lexicon。

給參與者或模型一組 primitive：

$$
\Sigma_0.
$$

讓它們反覆表達一組複合 meaning：

$$
\Phi.
$$

控制：

- repetition frequency；
- semantic variance；
- ambiguity；
- expression length；
- penalty for errors；
- cost of introducing new labels。

記錄：

$$
T_{\mathrm{crys}}
$$

即某個新 primitive 第一次穩定出現的時間。

然後測：

$$
T_{\mathrm{crys}}
=
f(
R,D,S,C,E,A,K
).
$$

若模型預測失敗，可以直接修改權重或否定整個晶化效用框架。

---

# 29. 與真實語言研究的區分

本文的「晶化」可能發生於：

- 個人臨時術語；
- 技術團隊內部命名；
- 數學符號；
- 程式變數；
- 一篇論文中的局部 primitive；
- 真實自然語言新詞。

但這些層級不相同。

尤其：

$$
\boxed{
\text{個體表示晶化}
\not\Rightarrow
\text{社會 lexicalization}.
}
$$

要成為自然語言共同體的真正 lexical item，還涉及傳播、conventionalization、社會網路、世代傳遞與歷史穩定等額外機制。

本文不處理這些完整社會動力，只處理「表示層為何值得建立低成本入口」。

---

# 30. 從 Paper 03 到 Paper 05

Paper 03 提出：

$$
\mathcal E_L,
\quad
\mathcal E_P,
\quad
\mathcal E_S.
$$

Paper 05 現在回答：

> Structural 或 Parametric Expansion 何時值得轉回 Lexical Expansion？

最核心轉換為：

$$
\boxed{
\mathcal E_S
\rightarrow
\mathcal E_L
}
$$

以及：

$$
\boxed{
\mathcal E_P
\rightarrow
\mathcal E_L.
}
$$

但只有當：

$$
U_{\mathrm{crys}}>0.
$$

所以 lexicalization 不再只是「詞庫增加」，而是整個表示系統中的一種壓縮與重新基底操作。

---

# 31. 從 Paper 04 的「界化」看晶化

Paper 04 曾生成中階詞：

$$
\mathcal Bz.
$$

它在早期有價值，因為每次完整說：

> 某差異在條件與判準作用下形成可辨識的 boundary structure

成本較高。

所以：

$$
\varphi_{\mathrm{boundary}}
\rightarrow
\mathcal Bz
$$

具有：

$$
V_C>0.
$$

但後續收斂時發現：

$$
\mathcal Bz
$$

不必成為最小 primitive。

這顯示晶化可以是暫時的。

一個詞可以：

$$
\boxed{
\text{先因壓縮價值而生成，再因更高階收斂而被淘汰。}
}
$$

這是語義動力學中非常重要的現象。

---

# 32. 晶化與再基底

假設舊表示基底：

$$
\Sigma_t
=
\{
\sigma_1,\ldots,\sigma_n
\}.
$$

若複合方向：

$$
\varphi
=
f(
\sigma_i,\sigma_j,\sigma_k
)
$$

反覆穩定出現，

加入：

$$
z
$$

相當於建立新的座標。

系統可以保留舊基底：

$$
\Sigma_{t+1}
=
\Sigma_t
\cup
\{z\},
$$

也可以在更強收斂時刪除冗餘 primitive，形成：

$$
\boxed{
\Sigma_{t+1}
=
Rebase(
\Sigma_t,
z
).
}
$$

因此真正重要的不只是「新詞增加」，還包括：

$$
\boxed{
\text{semantic basis change}.
}
$$

---

# 33. Primitive Inflation 與抑制條件

如果每一個複合結構都立即晶化：

$$
\varphi_i
\rightarrow
z_i,
$$

則：

$$
|\Sigma_t|
$$

會快速爆炸。

因此本文提出最低抑制條件：

$$
\boxed{
R\ge\tau_R,
}
$$

$$
\boxed{
S\ge\tau_S,
}
$$

$$
\boxed{
E_{\mathrm{decode}}\le\tau_E,
}
$$

以及：

$$
\boxed{
U_{\mathrm{crys}}>0.
}
$$

缺一不代表永遠禁止新詞，但表示目前沒有足夠證據將複合結構升級為 primitive。

---

# 34. 一個更簡短的晶化判準

如果不需要完整效用函數，可用四項最低測試：

1. **會不會重複？**
2. **是不是同一個穩定結構？**
3. **縮成一個詞後能不能少付成本？**
4. **縮完後會不會丟掉目前重要的差異？**

形式化：

$$
\boxed{
Crystallize(\varphi)
=
1
}
$$

若：

$$
Freq(\varphi)\ge\tau_f,
$$

$$
Stability(\varphi)\ge\tau_s,
$$

$$
Cost(z)<Cost(\varphi),
$$

且：

$$
Error(z)\le\epsilon.
$$

這是最接近工程實作的 v0.1 判準。

---

# 35. 本文限制

第一，「符號晶化」是本系列工作術語，不應與既有 lexicalization、conventionalization、grammaticalization 或 terminology formation 混為一談。

第二，本文目前主要研究表示層，不處理完整社會傳播與語言共同體接受機制。

第三， $U_{\mathrm{crys}}$ 的權重未經人類實驗估計。

第四，rank、低秩分解與 cache 只是計算比喻與工作模型，不能被當成自然語言認知機制的直接證明。

第五，真實新詞生成也可能受到身份、權力、文化、幽默、時尚、政治、品牌與其他非效率因素影響。本文沒有否認這些因素，只是抽取其中「表示成本與判別收益」的一條可計算軸。

第六，一個詞的歷史穩定並不保證其語義單一；polysemy 本身可能是高效率 lexicon 的結果，而不是失敗。

---

# 36. 結論

本文從一個簡單問題開始：

> 已經能用舊語言說出來的東西，為什麼還需要新詞？

答案不是：

$$
\boxed{
\text{因為舊語言不能表達。}
}
$$

至少不總是如此。

更一般的答案是：

$$
\boxed{
\text{因為每次重新展開的成本可能已經高於建立一個新入口的成本。}
}
$$

因此一個複合語義：

$$
\varphi
$$

可以經歷：

$$
\boxed{
\varphi
\rightarrow
\text{repetition}
\rightarrow
\text{stabilization}
\rightarrow
\text{compression}
\rightarrow
z.
}
$$

但只有在：

$$
\boxed{
U_{\mathrm{crys}}>0
}
$$

時，建立新的 primitive 才有工作性理由。

而 $z$ 生成之後，又可以：

$$
z
\rightarrow
\varphi'
\rightarrow
z'
\rightarrow
\cdots.
$$

所以新詞不是語義生成的起點，也不是終點。

它更像一個階段性的低成本座標：

$$
\boxed{
\text{高頻穩定複合語義}
\rightarrow
\text{低成本 primitive}
\rightarrow
\text{下一輪複合語義}.
}
$$

這使本系列的語言循環進一步清楚：

$$
\boxed{
\text{展開}
\rightarrow
\text{重複}
\rightarrow
\text{穩定}
\rightarrow
\text{晶化}
\rightarrow
\text{再展開}.
}
$$

也因此，「嘴巴王」真正的能力不是永遠講更多，而是知道何時值得繼續講，何時應該把一大串話壓成一個新詞。

---

# 參考文獻

1. Xu, A., Kemp, C., Frermann, L., & Xu, Y. (2024). *Word reuse and combination support efficient communication of emerging concepts*. Proceedings of the National Academy of Sciences, 121(46), e2406971121. DOI: 10.1073/pnas.2406971121.

2. Yu, L., & Xu, Y. (2025). *Infinite Mixture Chaining: An Efficiency-Based Framework for the Dynamic Construction of Word Meaning*. Open Mind: Discoveries in Cognitive Science, 9, 1-24. DOI: 10.1162/opmi_a_00176.

3. Kanwal, J., Smith, K., Culbertson, J., & Kirby, S. (2017). *Zipf's Law of Abbreviation and the Principle of Least Effort: Language users optimise a miniature lexicon for efficient communication*. Cognition, 165, 45-52. DOI: 10.1016/j.cognition.2017.05.001.

4. Piantadosi, S. T., Tily, H., & Gibson, E. (2011). *Word lengths are optimized for efficient communication*. Proceedings of the National Academy of Sciences, 108(9), 3526-3529. DOI: 10.1073/pnas.1012551108.

5. Zaslavsky, N., Kemp, C., Regier, T., & Tishby, N. (2018). *Efficient human-like semantic representations via the Information Bottleneck principle*. arXiv:1808.03353.

6. Tishby, N., Pereira, F. C., & Bialek, W. (2000). *The information bottleneck method*. arXiv:physics/0004057.

---

# 系列位置

- Paper 01：自然語言的無界精細化假說
- Paper 02：從「很接近，但還不夠精準」開始：自然語言百輪語義壓力測試方法論
- Paper 03：自然語言的三種展開機制
- Paper 04：邊界不是一個詞：邊界本體論的百輪語義壓力測試
- **Paper 05：新詞從何而來：複合語義、重複結構與符號晶化**
- Paper 06：語義的展開與收斂：從無界精細化到最小生成核
- Paper 07：自然語言精細化的矩陣表示
- Paper 08：有限符號與無界語義：自然語言生成、展開與收斂循環
