← Archive
lm-003341 · 2026-09

新詞從何而來

下載 MD 檔 ⬇

新詞從何而來

複合語義、重複結構與符號晶化

系列: 自然語言無界精細化與收斂系列
Paper: 05 / 08
作者: Neo.K
AI 協作整理: GPT-5.6 Sol
機構: EveMissLab/一言諾科技有限公司
版本: v0.1
日期: 2026-08-20
類型: 語言哲學/詞彙化理論/形式語義/資訊效率/符號動力學


摘要

本文研究一個比「如何造新詞」更窄也更形式化的問題:當一段原本可以用既有詞彙、參數與句法完整表達的複合語義結構反覆出現時,什麼條件會使它值得被壓縮成一個新的可重用 lexical primitive?

既有 lexicalization 研究已指出,新興概念常透過既有詞義延伸、word reuse、combination、compounding、borrowing 與 coinage 等策略進入詞彙系統;近期資訊效率研究進一步顯示,word reuse 與 combination 可以被理解為形式成本與資訊精度之間的折衷。本文不重新命名這些既有現象,而提出一個系列內部的工作概念:「符號晶化」(symbol crystallization),專指一個高成本複合表示:

φ=f(σ1,σ2,,σk;p1,,pm)\varphi = f( \sigma_1, \sigma_2, \ldots, \sigma_k; p_1, \ldots, p_m )

被重新映射為一個低成本入口:

z,z,

且在需要時可以由 zz 重新展開回足夠接近的語義結構:

Decode(z)φ.Decode(z) \approx \varphi.

本文提出,重複頻率不是晶化的唯一條件。若一個複合結構雖然高頻,但高度不穩定、容易與其他結構混淆、解碼誤差高或定義成本過大,將它壓縮成新 primitive 反而可能降低整體語義效率。因此本文定義工作性的晶化效用:

Ucrys(zφ)=αR+βD+γS+ηCsaveλEdecodeμAνCdefine\boxed{ U_{\mathrm{crys}}(z\mid\varphi) = \alpha R + \beta D + \gamma S + \eta C_{\mathrm{save}} - \lambda E_{\mathrm{decode}} - \mu A - \nu C_{\mathrm{define}} }

其中 RR 為重用收益, DD 為新增判別價值, SS 為語義穩定度, CsaveC_{\mathrm{save}} 為表達成本節省, EdecodeE_{\mathrm{decode}} 為解碼重建誤差, AA 為歧義負擔, CdefineC_{\mathrm{define}} 為建立與維持新 primitive 的成本。

當:

Ucrys>0U_{\mathrm{crys}}>0

時,晶化在目前任務條件下具有正效用;當:

Ucrys0,U_{\mathrm{crys}}\le0,

保留原複合結構、使用參數化模板、延伸既有詞義或維持較長表達,可能更有效。

本文進一步指出,新 primitive 並不是語義演化的終點。一旦:

φz,\varphi \rightarrow z,

新的 zz 又可以參與下一輪結構組合:

zφz.z \rightarrow \varphi' \rightarrow z' \rightarrow \cdots.

因此,詞彙化可以被嵌入本系列更一般的循環:

複合重用壓縮新 primitive再組合再壓縮.\boxed{ \text{複合} \rightarrow \text{重用} \rightarrow \text{壓縮} \rightarrow \text{新 primitive} \rightarrow \text{再組合} \rightarrow \text{再壓縮}. }

本文的主要貢獻是提出一套可操作的「何時值得新建 primitive」判準,並把判別價值與壓縮價值明確分離,以避免把「新詞出現」誤當成「語義維度必然增加」。

關鍵詞: lexicalization、word formation、semantic compression、symbol crystallization、semantic cache、lexical innovation、word reuse、compounding、communicative efficiency、primitive formation


1. 問題:能說出來,為什麼還要造詞

假設一個語義結構:

φ\varphi

已經可以用既有語言完整表達。

例如:

φ=f(σ1,σ2,σ3).\varphi = f( \sigma_1, \sigma_2, \sigma_3 ).

如果它已可被表達,表面上似乎沒有新增詞彙的必要。

然而,真實語言並不是只追求「可表達性」。

它還同時受到:

  • 表達長度;
  • 使用頻率;
  • 記憶成本;
  • 可辨識度;
  • 歧義;
  • 學習成本;
  • 重建精度;
  • 社會與技術慣例;

等因素約束。

因此真正的問題不是:

這個複合語義能不能用舊語言表示?\boxed{ \text{這個複合語義能不能用舊語言表示?} }

而是:

每次都重新展開它,是否仍然值得?\boxed{ \text{每次都重新展開它,是否仍然值得?} }

2. 與既有 lexicalization 研究的邊界

Lexicalization 是成熟的語言學研究領域,本文不把一般新詞形成重新命名為「符號晶化」。

近期研究尤其適合作為本文背景。

Xu、Kemp、Frermann 與 Xu 對英語、法語與芬蘭語近百年 lexical innovation 的分析顯示,word reuse 與 combination 都可以在形式長度與資訊精度之間形成效率折衷。Reuse 往往避免增加形式長度,但可能降低精確性;combination 通常較長,卻提供更多資訊。

Yu 與 Xu 的 Infinite Mixture Chaining 則從 representational accuracy 與 memory complexity 的折衷出發,研究有限 lexicon 如何動態吸收持續出現的新 meanings,並顯示語義延伸可以由效率原則組織,而非完全任意。

更早的 Zipfian efficiency 與 word-length 研究亦顯示,頻率、資訊量與形式成本之間存在穩定關係。Kanwal 等人的人工語言實驗顯示,當 accuracy 與 efficiency 壓力同時存在時,參與者會形成類似高頻形式較短的 lexicon;Piantadosi、Tily 與 Gibson 則指出,平均資訊量比單純頻率更能預測 word length。

因此,本文不主張:

高頻結構會縮短\boxed{ \text{高頻結構會縮短} }

是新發現。

本文要做的是把本系列前四篇產生的問題明確化:

若一個語義結構已由 lexical、parametric 與 structural resources 生成,什麼時候應把它重新收斂成一個新的 primitive?


3. 「符號晶化」的工作定義

令:

Σt\Sigma_t

為第 tt 時點可直接調用的 primitive 集合。

令:

φClosure(Σt,Pt,Ot)\varphi \in \operatorname{Closure} ( \Sigma_t, P_t, \mathcal O_t )

為由既有 primitive、參數與操作生成的複合表示。

若系統建立:

zΣt,z \notin \Sigma_t,

並令:

Σt+1=Σt{z},\Sigma_{t+1} = \Sigma_t \cup \{z\},

同時建立:

Encode(φ)=z,Encode(\varphi)=z,

以及近似可逆的:

Decode(z)φ,Decode(z)\approx\varphi,

則本文把此表示操作稱為:

Crystallize(φ)=z.\boxed{ \operatorname{Crystallize}(\varphi)=z. }

「晶化」只是本系列的工作術語。

它不預設 zz 已進入整個自然語言共同體,也不預設它具有長期歷史穩定性。若討論真實語言的社會詞彙化,仍應使用 lexicalization、coinage、compounding、semantic extension、conventionalization 等既有術語。


4. 晶化不是單純縮寫

最弱的壓縮只是:

φz\varphi \rightarrow z

其中 zz 是任意代號。

但一個真正有用的 primitive 至少還需要:

Decode(z)Decode(z)

在目前任務中保持足夠穩定。

因此本文要求:

d(Decode(z),φ)ϵ.\boxed{ d( Decode(z), \varphi ) \le \epsilon. }

其中:

dd

是任務相關的語義距離,

ϵ\epsilon

是允許的重建誤差。

若:

d(Decode(z),φ)ϵ,d( Decode(z), \varphi ) \gg \epsilon,

那麼 zz 不是有效壓縮,而只是產生新的歧義。


5. 第一個壓力:重複頻率

假設每次完整表示 φ\varphi 的成本為:

C(φ).C(\varphi).

使用新 primitive zz 的成本為:

C(z).C(z).

定義 zz 的一次性成本為:

Cdefine(z).C_{\mathrm{define}}(z).

若預期未來重用:

ff

次,

則最簡單的壓縮收益:

Rf=f[C(φ)C(z)]Cdefine(z).\boxed{ R_f = f \left[ C(\varphi)-C(z) \right] - C_{\mathrm{define}}(z). }

若:

Rf>0,R_f>0,

則只從長度或操作成本角度看,建立 zz 有利。

等價地,若:

C(φ)>C(z),C(\varphi)>C(z),

最低重用門檻為:

f>Cdefine(z)C(φ)C(z).\boxed{ f^\ast > \frac{ C_{\mathrm{define}}(z) }{ C(\varphi)-C(z) }. }

這是「semantic cache」直覺的第一個形式版本。


6. 但高頻本身仍然不夠

如果一段語義每次出現時都稍微不同,

例如:

φ1,φ2,,φn\varphi_1, \varphi_2, \ldots, \varphi_n

只具有表面相似,而沒有穩定共同核心,

則把它們全部壓成:

zz

可能造成嚴重資訊損失。

因此還需要定義語義穩定度:

S(Φ)=1Dispersion(φ1,,φn).\boxed{ S(\Phi) = 1 - \operatorname{Dispersion} ( \varphi_1, \ldots, \varphi_n ). }

其中:

Φ={φ1,,φn}.\Phi = \{ \varphi_1,\ldots,\varphi_n \}.

若:

S(Φ)1,S(\Phi)\approx1,

表示重複出現的結構高度穩定。

若:

S(Φ)0,S(\Phi)\approx0,

建立單一 primitive 的風險很高。


7. 第二個價值:判別力

新 primitive 可能不只壓縮舊結構,還可能建立新的分類軸。

令原表示為:

St.S_t.

若兩案例:

x,yx,y

原本不可分:

St(x)=St(y),S_t(x)=S_t(y),

而新增 zz 後:

St+1(x)St+1(y),S_{t+1}(x)\neq S_{t+1}(y),

則:

D(z)>0.\boxed{ D(z)>0. }

此時 zz 不只是 cache。

它真的增加了目前系統的有效判別能力。


8. 壓縮價值與判別價值必須分開

這是本系列最重要的區分之一。

令案例表示矩陣為:

SRN×d.\mathbf S \in \mathbb R^{N\times d}.

新增 primitive 欄:

z.\mathbf z.

若:

rank[Sz]>rank(S),\operatorname{rank} \begin{bmatrix} \mathbf S&\mathbf z \end{bmatrix} > \operatorname{rank}(\mathbf S),

zz 至少在線性工作模型下增加新的表示方向。

但若:

zspan(S),\mathbf z \in \operatorname{span}(\mathbf S),

仍不能推出 zz 無用。

只要:

C(z)<C(φz),C(z) < C(\varphi_z),

它仍有壓縮價值。

因此:

V(z)=VD(z)+VC(z),\boxed{ V(z) = V_D(z) + V_C(z), }

而不是:

V(z)=VD(z)\boxed{ V(z) = V_D(z) }

而已。


9. 第三個壓力:歧義成本

壓縮越強,越可能讓不同結構共用同一形式。

若:

φaφb,\varphi_a \neq \varphi_b,

但:

Encode(φa)=Encode(φb)=z,Encode(\varphi_a) = Encode(\varphi_b) = z,

則接收或後續推理需要額外條件才能恢復正確語義。

令:

A(z)A(z)

表示這種歧義負擔。

zz 的使用需要大量額外 disambiguation:

Cdisamb(z)C_{\mathrm{disamb}}(z)

則實際壓縮收益應改為:

Cnet(z)=C(φ)C(z)Cdisamb(z).\boxed{ C_{\mathrm{net}}(z) = C(\varphi) - C(z) - C_{\mathrm{disamb}}(z). }

因此短不一定更有效。

這與既有效率研究中「形式短度與資訊精度存在折衷」相一致。


10. 第四個壓力:解碼誤差

定義:

Edecode(z)=E[d(Decode(z),φ)].\boxed{ E_{\mathrm{decode}}(z) = \mathbb E \left[ d( Decode(z), \varphi ) \right]. }

若一個新詞很短、很常用,但:

EdecodeE_{\mathrm{decode}}

過高,

那麼它可能把表達成本轉換成理解與校正成本。

因此有效晶化不能只追求:

C(z)0.C(z)\rightarrow0.

還要保持:

Edecodeϵ.E_{\mathrm{decode}} \le \epsilon.

11. 第五個壓力:建立與維護成本

新 primitive 不是免費的。

它需要:

  • 被定義;
  • 被記住;
  • 被索引;
  • 與既有詞區分;
  • 在語境中被正確調用;
  • 必要時重新解釋。

因此:

Cdefine(z)C_{\mathrm{define}}(z)

應該更廣義地理解為:

Cdefine=Ccreate+Clearn+Cmaintain+Cdifferentiate.\boxed{ C_{\mathrm{define}} = C_{\mathrm{create}} + C_{\mathrm{learn}} + C_{\mathrm{maintain}} + C_{\mathrm{differentiate}}. }

對單一短暫概念而言,這些成本可能高於直接說完整長句。


12. 晶化效用函數

綜合上述因素,本文提出工作性函數:

Ucrys=αR+βD+γS+ηCsaveλEdecodeμAνCdefine.\boxed{ U_{\mathrm{crys}} = \alpha R + \beta D + \gamma S + \eta C_{\mathrm{save}} - \lambda E_{\mathrm{decode}} - \mu A - \nu C_{\mathrm{define}}. }

其中:

  • RR:預期重用收益;
  • DD:新增判別價值;
  • SS:語義穩定度;
  • CsaveC_{\mathrm{save}}:表達與操作成本節省;
  • EdecodeE_{\mathrm{decode}}:解碼重建誤差;
  • AA:歧義負擔;
  • CdefineC_{\mathrm{define}}:建立與維護成本。

權重:

α,β,γ,η,λ,μ,ν\alpha, \beta, \gamma, \eta, \lambda, \mu, \nu

由任務決定。

本文不主張人類真的顯式計算這個函數;它是一個可供實驗估計的表示選擇模型。


13. 晶化門檻

最簡單的接受規則:

Ucrys>0.\boxed{ U_{\mathrm{crys}}>0. }

若:

Ucrys0,U_{\mathrm{crys}}\le0,

系統可以選擇:

  • 保持原長結構;
  • 延伸既有詞義;
  • 使用 compound;
  • 使用參數模板;
  • 使用上下文補全;
  • 暫不建立新 primitive。

所以「有新概念」不等於「必須有新詞」。


14. 與 word reuse 的關係

一個新 meaning 可以不增加:

Σ.|\Sigma|.

它可以將既有詞:

ww

延伸到:

mnew.m_{\mathrm{new}}.

形式上:

Σt+1=Σt,\Sigma_{t+1} = \Sigma_t,

但:

Meaningt(w)Meaningt+1(w).Meaning_t(w) \subset Meaning_{t+1}(w).

Reuse 的優勢是:

CformC_{\mathrm{form}}

低。

但若新 meaning 與舊 meaning 太接近或太多,

則:

A(w)A(w)

與:

Edecode(w)E_{\mathrm{decode}}(w)

可能上升。

因此 reuse 也是一種壓縮策略,而不是零成本策略。


15. 與 combination / compounding 的關係

Combination 使用既有 primitive:

w1,w2,w_1, w_2, \ldots

生成:

w1w2.w_1w_2.

它沒有立即要求建立完全任意的新形式,而是利用結構增加資訊性。

因此可以理解為:

Structural ExpansionLexical Stabilization.\boxed{ \text{Structural Expansion} \rightarrow \text{Lexical Stabilization}. }

當 compound 高頻、穩定並逐步 conventionalize 時,它可能從每次動態組合的 expression 轉向 lexicalized unit。

這正是本系列所稱:

ESEL\mathcal E_S \rightarrow \mathcal E_L

的一條自然路徑。


16. Coinage 何時可能值得

若某 emerging concept:

mm

與既有詞義距離過遠,

使 reuse 造成高:

A,Edecode,A, \quad E_{\mathrm{decode}},

而 combination 又需要過長結構:

C(φ)C(\varphi)

很高,

則全新 primitive:

zz

可能反而具有較高效用。

工作性比較:

Ucoinage>max{Ureuse,Ucombine}\boxed{ U_{\mathrm{coinage}} > \max \{ U_{\mathrm{reuse}}, U_{\mathrm{combine}} \} }

時,coinage 成為合理候選。

這不是歷史詞彙變化的決定論,只是一個表示策略比較。


17. Semantic Cache 模型

本文可以把 primitive 視為一種語義快取。

長表示:

φ\varphi

是完整展開形式。

晶化:

Cache(φ)=z.Cache(\varphi)=z.

調用:

z.z.

解碼:

Expand(z)=φ^.Expand(z)=\widehat\varphi.

若:

d(φ^,φ)ϵ,d( \widehat\varphi, \varphi ) \le \epsilon,

則 cache 在目前任務中有效。

因此:

primitive可重用的低成本語義入口.\boxed{ \text{primitive} \approx \text{可重用的低成本語義入口}. }

這個比喻不表示人腦真的使用計算機 cache,而是說明表示層的重用結構。


18. Cache Hit 與 Cache Miss

若一個 primitive:

zz

在新語境中仍能準確重建:

φ,\varphi,

可以視為:

Hit(z)=1.Hit(z)=1.

若新語境已超出舊 primitive 的有效域:

d(Decode(z),φnew)>ϵ,d( Decode(z), \varphi_{\mathrm{new}} ) > \epsilon,

則:

Hit(z)=0.Hit(z)=0.

此時系統需要:

Re-expand\boxed{ \text{Re-expand} }

重新打開原本被壓縮的結構。

這解釋了為什麼技術術語即使已成熟,在新的邊界案例出現時仍會重新遭遇定義爭議。


19. 晶化後仍然可以再次分裂

zz 原本壓縮:

Φ0\Phi_0

但後來新案例:

XnewX_{\mathrm{new}}

使:

Edecode(z)E_{\mathrm{decode}}(z)

快速上升,

則原 primitive 可以重新展開:

z{φ1,φ2,}.z \rightarrow \{ \varphi_1, \varphi_2, \ldots \}.

接著:

φi\varphi_i

又可以重新形成:

z1,z2,.z_1, z_2,\ldots.

因此 lexical primitive 不是不可逆終點。


20. 從一詞到多詞,再從多詞到高階詞

一個常見語義生命週期可以寫成:

zt{φ1,,φn}{z1,,zk}zt+1.\boxed{ z_t \rightarrow \{ \varphi_1, \ldots, \varphi_n \} \rightarrow \{ z_1, \ldots, z_k \} \rightarrow z_{t+1}. }

第一步是解包。

第二步是差異化。

第三步則可能重新建立一個新的高階詞。

所以詞彙演化不是單純:

Σtlarger.|\Sigma_t| \rightarrow \text{larger}.

而是:

展開收斂.\boxed{ \text{展開} \rightleftarrows \text{收斂}. }

21. 符號晶化與低秩表示

令多個高維複合語義案例形成:

SRN×d.\mathbf S \in \mathbb R^{N\times d}.

若:

SUrVr\mathbf S \approx \mathbf U_r \mathbf V_r

且:

rd,r\ll d,

則可以把穩定低維方向視為候選 semantic factors。

若其中某一方向:

uk\mathbf u_k

在大量案例中高頻出現且具有穩定重建性,則可建立 primitive:

zk.z_k.

因此「新詞」在工作模型中可以被理解成:

高頻穩定語義結構的一個低成本座標名稱.\boxed{ \text{高頻穩定語義結構的一個低成本座標名稱}. }

這不是說真實詞彙演化等同於 SVD,而是提供後續計算實驗的一種近似方法。


22. 新詞不一定增加 rank

若:

zspan(S),\mathbf z \in \operatorname{span}(\mathbf S),

那麼:

Δrank=0.\Delta \operatorname{rank}=0.

但如果:

L(z)<L(φz),L(\mathbf z) < L(\varphi_z),

則:

VC(z)>0.V_C(z)>0.

因此一個成熟術語可能只是把既有可組合語義變成低成本入口。

這類 lexicalization 的價值不在擴大表達空間,而在改變:

到達某個語義區域的成本.\boxed{ \text{到達某個語義區域的成本}. }

23. 真正增加新維度的新詞

另一種情況是:

rank[Sz]>rank(S).\operatorname{rank} \begin{bmatrix} \mathbf S&\mathbf z \end{bmatrix} > \operatorname{rank}(\mathbf S).

此時 zz 至少在目前線性表示模型中提供新的獨立區分。

因此新詞至少有兩種理想型:

Compression Primitive\boxed{ \text{Compression Primitive} }

與:

Discrimination Primitive.\boxed{ \text{Discrimination Primitive}. }

實際詞彙則可能同時具有兩者。


24. 穩定性與晶化延遲

若新概念剛出現時:

S(Φt)S(\Phi_t)

很低,

過早 lexicalize 可能導致頻繁重新定義。

因此可以設計晶化延遲:

Crystallize only if S(Φt)τS\boxed{ Crystallize \text{ only if } S(\Phi_t)\ge\tau_S }

並要求重用頻率:

ftτf.f_t\ge\tau_f.

這相當於:

不要每遇到一個新差異就立即造詞;先等待結構是否真的穩定。

這正好抑制本系列 Paper 02 所定義的 synonym proliferation 與 lexical explosion。


25. 詞彙化與局部收斂

當某個複合語義反覆被壓成:

z,z,

可以理解為該局部表示域形成了:

lexical local convergence.\boxed{ \text{lexical local convergence}. }

這不表示:

Meaning(z)Meaning(z)

永久固定。

只表示目前案例集合:

XtX_t

與誤差要求:

ϵ\epsilon

下,使用 zz 比每次展開 φ\varphi 更有效。

若新案例出現:

Xt+1=XtZ,X_{t+1} = X_t \cup Z,

則可能重新打開:

zφ.z \rightarrow \varphi.

所以 lexicalization 可以被視為可逆程度不同的局部收斂。


26. 晶化決策矩陣

為了讓本模型可以工程化,可對候選 ziz_i 建立評估矩陣:

M=[R1D1S1C1E1A1K1R2D2S2C2E2A2K2RnDnSnCnEnAnKn].\mathbf M = \begin{bmatrix} R_1&D_1&S_1&C_1&E_1&A_1&K_1\\ R_2&D_2&S_2&C_2&E_2&A_2&K_2\\ \vdots&\vdots&\vdots&\vdots&\vdots&\vdots&\vdots\\ R_n&D_n&S_n&C_n&E_n&A_n&K_n \end{bmatrix}.

權重向量:

w=[αβγηλμν].\mathbf w = \begin{bmatrix} \alpha\\ \beta\\ \gamma\\ \eta\\ -\lambda\\ -\mu\\ -\nu \end{bmatrix}.

得到:

u=Mw.\boxed{ \mathbf u = \mathbf M \mathbf w. }

若:

ui>0,u_i>0,

則候選 ziz_i 進入後續 lexicalization 測試。

這個矩陣只是工程接口,不是假設所有真實語言共同體都以同一線性權重決策。


27. 可反駁預測

P1:重用頻率提高,晶化傾向應上升

在其他條件近似相同時:

P(Crystallize)f>0.\frac{\partial P(\operatorname{Crystallize})}{\partial f}>0.

但如果語義穩定度很低,頻率效果應被削弱。

P2:高歧義應抑制純 reuse

若:

A(w)A(w)

過高,系統更可能轉向 combination、modifier 或新 primitive。

P3:高資訊精度需求應提高較顯式形式的比例

當任務要求:

ϵ0,\epsilon \rightarrow0,

過度壓縮的 primitive 應更常被重新展開。

P4:高頻穩定複合結構應逐漸縮短平均調用成本

這可能透過 abbreviation、lexicalization、專門術語或其他常規化形式實現。

P5:新 primitive 的價值應可拆成判別與壓縮兩類

應觀察到:

Δrank>0\Delta \operatorname{rank}>0

型的新表示,也應觀察到:

Δrank=0\Delta \operatorname{rank}=0

但總表示成本下降的表示。


28. 如何實驗

後續可以建立 controlled artificial lexicon。

給參與者或模型一組 primitive:

Σ0.\Sigma_0.

讓它們反覆表達一組複合 meaning:

Φ.\Phi.

控制:

  • repetition frequency;
  • semantic variance;
  • ambiguity;
  • expression length;
  • penalty for errors;
  • cost of introducing new labels。

記錄:

TcrysT_{\mathrm{crys}}

即某個新 primitive 第一次穩定出現的時間。

然後測:

Tcrys=f(R,D,S,C,E,A,K).T_{\mathrm{crys}} = f( R,D,S,C,E,A,K ).

若模型預測失敗,可以直接修改權重或否定整個晶化效用框架。


29. 與真實語言研究的區分

本文的「晶化」可能發生於:

  • 個人臨時術語;
  • 技術團隊內部命名;
  • 數學符號;
  • 程式變數;
  • 一篇論文中的局部 primitive;
  • 真實自然語言新詞。

但這些層級不相同。

尤其:

個體表示晶化⇏社會 lexicalization.\boxed{ \text{個體表示晶化} \not\Rightarrow \text{社會 lexicalization}. }

要成為自然語言共同體的真正 lexical item,還涉及傳播、conventionalization、社會網路、世代傳遞與歷史穩定等額外機制。

本文不處理這些完整社會動力,只處理「表示層為何值得建立低成本入口」。


30. 從 Paper 03 到 Paper 05

Paper 03 提出:

EL,EP,ES.\mathcal E_L, \quad \mathcal E_P, \quad \mathcal E_S.

Paper 05 現在回答:

Structural 或 Parametric Expansion 何時值得轉回 Lexical Expansion?

最核心轉換為:

ESEL\boxed{ \mathcal E_S \rightarrow \mathcal E_L }

以及:

EPEL.\boxed{ \mathcal E_P \rightarrow \mathcal E_L. }

但只有當:

Ucrys>0.U_{\mathrm{crys}}>0.

所以 lexicalization 不再只是「詞庫增加」,而是整個表示系統中的一種壓縮與重新基底操作。


31. 從 Paper 04 的「界化」看晶化

Paper 04 曾生成中階詞:

Bz.\mathcal Bz.

它在早期有價值,因為每次完整說:

某差異在條件與判準作用下形成可辨識的 boundary structure

成本較高。

所以:

φboundaryBz\varphi_{\mathrm{boundary}} \rightarrow \mathcal Bz

具有:

VC>0.V_C>0.

但後續收斂時發現:

Bz\mathcal Bz

不必成為最小 primitive。

這顯示晶化可以是暫時的。

一個詞可以:

先因壓縮價值而生成,再因更高階收斂而被淘汰。\boxed{ \text{先因壓縮價值而生成,再因更高階收斂而被淘汰。} }

這是語義動力學中非常重要的現象。


32. 晶化與再基底

假設舊表示基底:

Σt={σ1,,σn}.\Sigma_t = \{ \sigma_1,\ldots,\sigma_n \}.

若複合方向:

φ=f(σi,σj,σk)\varphi = f( \sigma_i,\sigma_j,\sigma_k )

反覆穩定出現,

加入:

zz

相當於建立新的座標。

系統可以保留舊基底:

Σt+1=Σt{z},\Sigma_{t+1} = \Sigma_t \cup \{z\},

也可以在更強收斂時刪除冗餘 primitive,形成:

Σt+1=Rebase(Σt,z).\boxed{ \Sigma_{t+1} = Rebase( \Sigma_t, z ). }

因此真正重要的不只是「新詞增加」,還包括:

semantic basis change.\boxed{ \text{semantic basis change}. }

33. Primitive Inflation 與抑制條件

如果每一個複合結構都立即晶化:

φizi,\varphi_i \rightarrow z_i,

則:

Σt|\Sigma_t|

會快速爆炸。

因此本文提出最低抑制條件:

RτR,\boxed{ R\ge\tau_R, } SτS,\boxed{ S\ge\tau_S, } EdecodeτE,\boxed{ E_{\mathrm{decode}}\le\tau_E, }

以及:

Ucrys>0.\boxed{ U_{\mathrm{crys}}>0. }

缺一不代表永遠禁止新詞,但表示目前沒有足夠證據將複合結構升級為 primitive。


34. 一個更簡短的晶化判準

如果不需要完整效用函數,可用四項最低測試:

  1. 會不會重複?
  2. 是不是同一個穩定結構?
  3. 縮成一個詞後能不能少付成本?
  4. 縮完後會不會丟掉目前重要的差異?

形式化:

Crystallize(φ)=1\boxed{ Crystallize(\varphi) = 1 }

若:

Freq(φ)τf,Freq(\varphi)\ge\tau_f, Stability(φ)τs,Stability(\varphi)\ge\tau_s, Cost(z)<Cost(φ),Cost(z)<Cost(\varphi),

且:

Error(z)ϵ.Error(z)\le\epsilon.

這是最接近工程實作的 v0.1 判準。


35. 本文限制

第一,「符號晶化」是本系列工作術語,不應與既有 lexicalization、conventionalization、grammaticalization 或 terminology formation 混為一談。

第二,本文目前主要研究表示層,不處理完整社會傳播與語言共同體接受機制。

第三, UcrysU_{\mathrm{crys}} 的權重未經人類實驗估計。

第四,rank、低秩分解與 cache 只是計算比喻與工作模型,不能被當成自然語言認知機制的直接證明。

第五,真實新詞生成也可能受到身份、權力、文化、幽默、時尚、政治、品牌與其他非效率因素影響。本文沒有否認這些因素,只是抽取其中「表示成本與判別收益」的一條可計算軸。

第六,一個詞的歷史穩定並不保證其語義單一;polysemy 本身可能是高效率 lexicon 的結果,而不是失敗。


36. 結論

本文從一個簡單問題開始:

已經能用舊語言說出來的東西,為什麼還需要新詞?

答案不是:

因為舊語言不能表達。\boxed{ \text{因為舊語言不能表達。} }

至少不總是如此。

更一般的答案是:

因為每次重新展開的成本可能已經高於建立一個新入口的成本。\boxed{ \text{因為每次重新展開的成本可能已經高於建立一個新入口的成本。} }

因此一個複合語義:

φ\varphi

可以經歷:

φrepetitionstabilizationcompressionz.\boxed{ \varphi \rightarrow \text{repetition} \rightarrow \text{stabilization} \rightarrow \text{compression} \rightarrow z. }

但只有在:

Ucrys>0\boxed{ U_{\mathrm{crys}}>0 }

時,建立新的 primitive 才有工作性理由。

zz 生成之後,又可以:

zφz.z \rightarrow \varphi' \rightarrow z' \rightarrow \cdots.

所以新詞不是語義生成的起點,也不是終點。

它更像一個階段性的低成本座標:

高頻穩定複合語義低成本 primitive下一輪複合語義.\boxed{ \text{高頻穩定複合語義} \rightarrow \text{低成本 primitive} \rightarrow \text{下一輪複合語義}. }

這使本系列的語言循環進一步清楚:

展開重複穩定晶化再展開.\boxed{ \text{展開} \rightarrow \text{重複} \rightarrow \text{穩定} \rightarrow \text{晶化} \rightarrow \text{再展開}. }

也因此,「嘴巴王」真正的能力不是永遠講更多,而是知道何時值得繼續講,何時應該把一大串話壓成一個新詞。


參考文獻

  1. Xu, A., Kemp, C., Frermann, L., & Xu, Y. (2024). Word reuse and combination support efficient communication of emerging concepts. Proceedings of the National Academy of Sciences, 121(46), e2406971121. DOI: 10.1073/pnas.2406971121.

  2. Yu, L., & Xu, Y. (2025). Infinite Mixture Chaining: An Efficiency-Based Framework for the Dynamic Construction of Word Meaning. Open Mind: Discoveries in Cognitive Science, 9, 1-24. DOI: 10.1162/opmi_a_00176.

  3. Kanwal, J., Smith, K., Culbertson, J., & Kirby, S. (2017). Zipf's Law of Abbreviation and the Principle of Least Effort: Language users optimise a miniature lexicon for efficient communication. Cognition, 165, 45-52. DOI: 10.1016/j.cognition.2017.05.001.

  4. Piantadosi, S. T., Tily, H., & Gibson, E. (2011). Word lengths are optimized for efficient communication. Proceedings of the National Academy of Sciences, 108(9), 3526-3529. DOI: 10.1073/pnas.1012551108.

  5. Zaslavsky, N., Kemp, C., Regier, T., & Tishby, N. (2018). Efficient human-like semantic representations via the Information Bottleneck principle. arXiv:1808.03353.

  6. Tishby, N., Pereira, F. C., & Bialek, W. (2000). The information bottleneck method. arXiv:physics/0004057.


系列位置

  • Paper 01:自然語言的無界精細化假說
  • Paper 02:從「很接近,但還不夠精準」開始:自然語言百輪語義壓力測試方法論
  • Paper 03:自然語言的三種展開機制
  • Paper 04:邊界不是一個詞:邊界本體論的百輪語義壓力測試
  • Paper 05:新詞從何而來:複合語義、重複結構與符號晶化
  • Paper 06:語義的展開與收斂:從無界精細化到最小生成核
  • Paper 07:自然語言精細化的矩陣表示
  • Paper 08:有限符號與無界語義:自然語言生成、展開與收斂循環