← Archive
lm-003352 · 2026-09

自然語言的無界精細化假說

下載 MD 檔 ⬇

自然語言的無界精細化假說

從判別壓力、複合語義到收斂與重新詞彙化

系列: 自然語言無界精細化與收斂系列
Paper: 01 / 08
作者: Neo.K
AI 協作整理: GPT-5.6 Sol
機構: EveMissLab/一言諾科技有限公司
版本: v0.1
日期: 2026-08-20
類型: 語言哲學/形式語義/本體論方法論/語義動力學/理論假說


摘要

本文提出「自然語言的無界精細化假說」。核心問題不是自然語言是否能以有限詞彙與有限規則生成大量乃至原則上無界的新句子;此類 compositionality、productivity 與 recursion 問題已有悠久研究傳統。本文關注的是另一個較窄而動態的問題:當一個既有表述被指出「很接近,但還不夠精準」時,語言系統是否會在持續的判別壓力下,透過限定條件、參數化、結構嵌套、反例分裂、新詞生成與重新壓縮,形成一條可反覆展開與收斂的語義動力鏈。

本文的直接材料來自一個 100 輪結構化概念壓力測試。測試以「邊界是否是一種存在」為非經典本體論起點,先允許自由自然語言精細化,再依序禁止新詞、禁止新增參數、限制為固定概念集合的結構組合,最後將前 80 輪壓縮為矩陣表示。測試顯示,語義精細化至少存在三種不同機制:詞彙展開、參數展開與結構展開;其中後兩者顯示,新詞生成並不是持續增加判別力的必要條件。另一方面,當複合語義結構反覆出現且表達成本升高時,將其重新壓縮為新的 lexical primitive 又可能具有明確的經濟性。

本文因此提出一個暫時性的生成循環:

粗粒度表述判別壓力語義展開有效差異累積局部收斂重新詞彙化新 primitive再次展開\boxed{ \text{粗粒度表述} \rightarrow \text{判別壓力} \rightarrow \text{語義展開} \rightarrow \text{有效差異累積} \rightarrow \text{局部收斂} \rightarrow \text{重新詞彙化} \rightarrow \text{新 primitive} \rightarrow \text{再次展開} }

本文不主張此循環已被證明為人類自然語言的普遍定律,也不把單一 AI 自我對話視為人類語言實驗。本文將其定位為可形式化、可反駁、可進一步以人類語料、歷史詞彙資料與多模型實驗檢驗的理論假說。

關鍵詞: 自然語言、語義精細化、compositionality、productivity、lexicalization、語義壓縮、判別力、遞迴、局部收斂、符號生成


1. 問題:語言為何會從「差不多」走向「還不夠精準」

日常語言大量依賴粗粒度詞彙。人們可以說「存在」、「邊界」、「相同」、「因果」、「身份」、「恢復」、「消失」,而不必在每一次使用時先寫出一套完整形式系統。這種粗粒度並不是語言失敗;相反,它使溝通與思考可以在有限時間內完成。

然而,一旦討論進入哲學、數學、法律、科學、工程或高強度理論建模,粗粒度詞彙很快會遭遇邊界案例。典型壓力不是:

這句話完全錯了。

而是:

這句話很接近,但還不夠精準。

這種批評具有特殊生成力。它不要求立即否定上一句,而是要求保留其有效部分,同時找到上一個表述尚未區分的案例。

令目前語義表示為 StS_t,令一組新反例或邊界案例為 XtX_t。若存在兩個案例 x,yXtx,y\in X_t,使目前表示不能穩定區分它們,即:

St(x)=St(y),S_t(x)=S_t(y),

但目前任務需要:

Target(x)Target(y),Target(x)\neq Target(y),

則系統面臨語義判別壓力。

本文將最基本的精細化要求寫成:

D(St+1;x,y)>D(St;x,y)\boxed{ D(S_{t+1};x,y) > D(S_t;x,y) }

其中 DD 不預設為某一單一統計量,而表示新表示對目前重要案例所增加的有效判別能力。

因此,「更精準」不等於「句子更長」,也不等於「詞彙更多」。只有當新表述實際增加當前任務所需的區分時,本文才把它視為有效精細化。


2. 與既有語言理論的邊界

本文不把以下命題視為新發現:

有限詞彙+組合規則大量或原則上無界的新表達\boxed{ \text{有限詞彙} + \text{組合規則} \Rightarrow \text{大量或原則上無界的新表達} }

自然語言的 compositionality、productivity 與 recursive structure 已有廣泛研究。Paperno 的 interpreted-language 實驗明確以遞迴句法與 compositional semantic interpretation 為核心;近期 Fodor、De Deyne 與 Suzuki 亦將「由詞義組合形成複雜與新穎句義」視為計算語義的重要問題。Futrell 與 Hahn 則從資訊處理瓶頸出發,研究系統性與局部性的語言結構如何在受限處理條件下形成。

本文真正提出的差異在於:研究單位不是「如何由既有詞彙生成一句新句子」,而是「當既有句子不足以區分新案例時,整個表示系統如何反覆修改自己」。

因此本文的核心過程不是單純:

s1+s2++snφ,s_1+s_2+\cdots+s_n \rightarrow \varphi,

而是:

StCritique(St)Refine(St)St+1.\boxed{ S_t \rightarrow Critique(S_t) \rightarrow Refine(S_t) \rightarrow S_{t+1}. }

而當這個過程持續時, St+1S_{t+1} 又成為下一輪被批評與展開的粗粒度起點。


3. 無界精細化假說

本文提出以下假說。

假說 H1:相對無界精細化

對某些具有足夠內部結構、邊界案例與尺度變化的抽象議題,不預設一個有限的最大語義解析度。對任意當前表示 StS_t,只要仍能找到與目前任務相關、且 StS_t 尚不能區分的案例,就可能存在下一表示 St+1S_{t+1}

x,y:St(x)=St(y)Target(x)Target(y)St+1:D(St+1;x,y)>D(St;x,y).\boxed{ \exists x,y: S_t(x)=S_t(y) \land Target(x)\neq Target(y) \Rightarrow \exists S_{t+1}: D(S_{t+1};x,y)>D(S_t;x,y). }

這不是宣稱任何題目都能實際無限展開,也不是宣稱每一輪都必然存在新信息。本文使用「無界」而非「實際無限完成」,意指系統不先驗指定一個最大精細層級。

假說 H2:多路徑精細化

有效精細化至少可透過三條不同路徑完成:

E={EL,EP,ES}\boxed{ \mathcal E = \{ \mathcal E_L, \mathcal E_P, \mathcal E_S \} }

其中:

EL=Lexical Expansion,\mathcal E_L = \text{Lexical Expansion}, EP=Parametric Expansion,\mathcal E_P = \text{Parametric Expansion}, ES=Structural Expansion.\mathcal E_S = \text{Structural Expansion}.

詞彙展開增加或分裂 lexical primitive;參數展開不必造新詞,而是把原先隱含條件顯式化;結構展開則在詞彙與參數都固定時,透過否定、條件、模態、嵌套、遞迴與關係反轉生成新的有效區分。

假說 H3:局部收斂不等於全域終止

若在目前問題集合 XX 與允許誤差 ε\varepsilon 下,新的精細化已不增加足夠判別力,則可形成局部收斂:

Gain(St+1X,ε)Cost(St+1St).\boxed{ Gain(S_{t+1}\mid X,\varepsilon) \le Cost(S_{t+1}\mid S_t). }

但若問題集合擴大為:

X=XZ,X' = X\cup Z,

則原本穩定的表示仍可能重新展開:

Converged(SX)⇏Converged(SX).\boxed{ Converged(S\mid X) \not\Rightarrow Converged(S\mid X'). }

因此,字典定義、技術術語與哲學概念的「完成」可以被理解為域相對的穩定,而非所有未來語境下的語義終點。


4. 100 輪概念壓力測試

本文的初步材料來自一個結構化 AI 自我對話實驗。實驗並非人類受試實驗,也不提供人類心理或語言行為的統計推論。其功能是測試一個強語言生成器在逐步增加限制時,是否仍能產生具有明確判別增益的表示。

實驗選擇的主題為:

邊界究竟是一種存在,還只是不同狀態之間產生的關係結果?

選題刻意避開最經典的本體論案例,以降低對既有固定論證模板的直接依賴。

整個 100 輪可分為五階段。

Phase I:自由精細化

允許使用自然語言、新限定與新詞。每一輪要求指出上一輪「接近但不夠精準」之處,並提出至少一個能證明新區分必要性的反例。

Phase II:新詞判別力約束

新詞只有在能區分舊表示不能穩定區分的案例時才被保留。若只是同義改寫,則淘汰。

Phase III:禁止新詞

停止 lexical expansion,只允許使用既有詞彙、條件、參數與句法結構。精細化仍然持續,顯示詞彙增長不是必要條件。

Phase IV:禁止新增參數

固定概念集合與參數集合,只允許透過:

¬,,,,nesting,recursion\neg,\quad \land,\quad \lor,\quad \Rightarrow,\quad \text{nesting},\quad \text{recursion}

等結構操作繼續生成新區分。

Phase V:矩陣收斂

最後 20 輪停止自然語言擴張,將前 80 輪壓縮成狀態、條件、判準、差異與作用矩陣,再使用 rank、低秩分解與重新基底的方式描述語義展開與收斂。

這個程序的重要性不在於「完成了 100 輪」,而在於限制逐步加強後仍觀察到三種不同的生成機制。


5. 三種語義展開

5.1 詞彙展開

最直觀的情況是既有詞彙把不同案例壓在一起,因此分裂概念或生成新詞。

令原詞 ss 對兩案例給出相同標記:

s(x)=s(y).s(x)=s(y).

新增詞彙後:

sx(x)sy(y).s_x(x)\neq s_y(y).

此時 lexical expansion 增加了可見區分。

然而,本文的 100 輪測試顯示,大量精細化其實可以不經過此步。

5.2 參數展開

一句普通語言:

牆是一個邊界。

可以依次顯式化為:

對哪一種作用?

在什麼尺度?

在什麼時間?

允許多大偏差?

此時字典沒有增加,但判斷函數從:

B(x)B(x)

變為:

B(xc1,c2,,ck).B(x\mid c_1,c_2,\ldots,c_k).

語義精度來自隱含條件的顯式化,而不是新增 lexical primitive。

5.3 結構展開

更強的測試是:連新參數也不准增加。

在固定原子集合下,仍可區分:

B,B, ¬B,\neg B, B,\Diamond B, B(J(B)),B(J(B)),

以及:

¬J(B)B\neg J(B)\Rightarrow B

等不同結構。

因此:

Σ<\boxed{ |\Sigma|<\infty }

不推出:

L(Σ)<.\boxed{ |\mathcal L(\Sigma)|<\infty. }

本文並不把這一點本身宣稱為新的形式語言定理;其意義在於,它解釋了為何「自然語言精細化」不能被簡化為「一直造更多詞」。


6. 判別增益與語言膨脹

若不設限制,「更精準」很容易退化成純粹語言膨脹。因此本文提出一個最低要求:

有效精細化存在可識別的判別增益.\boxed{ \text{有效精細化} \Rightarrow \text{存在可識別的判別增益}. }

令目前案例表示矩陣為:

SRN×d.\mathbf S\in\mathbb R^{N\times d}.

加入一個候選語義維度:

snew.\mathbf s_{\text{new}}.

得到:

S=[Ssnew].\mathbf S' = \begin{bmatrix} \mathbf S & \mathbf s_{\text{new}} \end{bmatrix}.

若:

rank(S)>rank(S),\operatorname{rank}(\mathbf S') > \operatorname{rank}(\mathbf S),

則至少在線性表示意義下,新欄提供新的獨立方向。

但本文同時強調:

Δrank=0\Delta rank=0

不等於新詞沒有價值。

若某個高頻複合結構本可由既有維度重建,但每次完整表達成本很高,那麼對它重新命名仍可能降低總表示成本。

因此新符號至少有兩種可能價值:

Vsymbol=Vdiscrimination+Vcompression.\boxed{ V_{\text{symbol}} = V_{\text{discrimination}} + V_{\text{compression}}. }

第一項增加區分;第二項降低反覆表達既有結構的成本。


7. 從複合語義到新的 lexical primitive

近期 lexicalization 研究顯示,面對新概念時,語言會在重用既有詞與組合既有詞之間進行具有效率特徵的選擇;資訊瓶頸與語義壓縮研究也將詞彙系統描述為在複雜度與準確度之間取得折衷。

本文在此基礎上提出一個不同尺度的動力假說:

假設某複合語義結構:

φ=f(s1,s2,,sk)\varphi = f(s_1,s_2,\ldots,s_k)

在大量情境中反覆出現,且:

Cost(φ)Cost(z),Cost(\varphi) \gg Cost(z),

若新符號 zz 可以在需要時重新展開為足夠接近的 φ\varphi

Decode(z)φ,Decode(z)\approx\varphi,

則可能發生:

φrepeated usez.\boxed{ \varphi \xrightarrow{\text{repeated use}} z. }

本文稱此過程為重新詞彙化或 primitive crystallization,但把「晶化」視為工作性比喻,而非既有語言學術語的替代。

重要的是:

zz

生成之後,不再只是一個終點。

它會成為下一輪新的粗粒度入口:

zExpand(z)φ1,φ2,\boxed{ z \rightarrow Expand(z) \rightarrow \varphi_1,\varphi_2,\ldots }

因此詞彙演化可以被看成壓縮與再展開的循環,而非單向增加。


8. 局部收斂

如果語言可以一直補充細節,為何實際語言不會無限長?

本文的答案不是「因為最終再也沒有差異」,而是:

很多時候仍存在可加入的差異,但其當前判別收益已低於表示、處理或協調成本。

令:

Ut=GtCt,U_t = G_t-C_t,

其中 GtG_t 表示新增精細化帶來的有效判別收益, CtC_t 表示新增表述成本。

若:

Ut>0,U_t>0,

則繼續精細化值得進行。

若:

Ut0,U_t\le0,

則系統可能暫停展開。

因此停止不必表示:

Gt=0.G_t=0.

它可以只表示:

GtCt.G_t\le C_t.

這使「收斂」被重新理解為一個任務與成本相對的局部狀態。


9. 一個最小生成循環

綜合 100 輪測試,本文提出以下暫時循環:

StXtE(St;Xt)St+C(St+)Zt+1St+1\boxed{ S_t \rightarrow X_t \rightarrow \mathcal E(S_t;X_t) \rightarrow S_t^{+} \rightarrow \mathcal C(S_t^{+}) \rightarrow Z_{t+1} \rightarrow S_{t+1} }

其中:

  • StS_t:當前粗粒度語義表示;
  • XtX_t:反例、邊界案例或新的判別需求;
  • E\mathcal E:詞彙、參數或結構展開;
  • St+S_t^{+}:展開後的高複雜度表示;
  • C\mathcal C:收斂與壓縮;
  • Zt+1Z_{t+1}:新形成的低成本表示或 primitive;
  • St+1S_{t+1}:下一輪的語義入口。

以更抽象方式,可寫為:

1tNtrt1t+1Nt+1\boxed{ 1_t \rightarrow N_t \rightarrow r_t \rightarrow 1_{t+1} \rightarrow N_{t+1} \rightarrow\cdots }

其中 1t1_t 不代表字面上只有一個詞,而代表目前可被當成單一入口使用的低成本表示; NtN_t 表示由該入口可展開的複合語義空間; rtr_t 則表示在目前任務下足以保留有效差異的較低維結構。


10. 本文真正提出了什麼

為避免把既有語言理論重新命名,本文將新意限定在以下組合命題。

第一,研究焦點從「組合生成句子」移到「批評驅動的表示更新」。

第二,把「很接近,但還不夠精準」視為一種可形式化的判別壓力,而不是純修辭評價。

第三,區分三種精細化機制:

LexicalParametricStructural.\boxed{ \text{Lexical} \neq \text{Parametric} \neq \text{Structural}. }

第四,把新詞形成理解為兩種可能功能的組合:

增加判別維度+壓縮反覆複合結構.\boxed{ \text{增加判別維度} + \text{壓縮反覆複合結構}. }

第五,把語義收斂定義為域相對、任務相對與成本相對,而不是宣稱已抵達絕對語義終點。

第六,提出反覆循環:

展開差異化收斂重新詞彙化再展開.\boxed{ \text{展開} \rightarrow \text{差異化} \rightarrow \text{收斂} \rightarrow \text{重新詞彙化} \rightarrow \text{再展開}. }

這六點共同構成本文所稱的「自然語言無界精細化假說」。


11. 可反駁預測

一個理論若只能解釋已發生的對話,而不能提出失敗條件,價值有限。因此本文提出以下初步可測預測。

P1:禁止造新詞後仍可持續精細化

若只允許既有詞彙與新增限定,在足夠複雜的議題上仍應觀察到多輪有效判別增益。

若新詞一被禁止,精細化立即停止,則本文的參數展開命題受到削弱。

P2:禁止新詞與新參數後仍存在結構增益

固定詞彙與參數後,只允許嵌套、否定、條件、模態與遞迴,仍應存在部分新案例可被區分。

若所有新增句法都只是同義改寫,則結構展開命題失敗。

P3:新增術語並不總增加維度

大量新術語應可分為至少兩類:

Δrank>0\Delta rank>0

與:

Δrank=0ΔCost<0.\Delta rank=0 \land \Delta Cost<0.

後者不增加表示空間的獨立維度,但降低高頻複合語義的表達成本。

P4:局部收斂可被新案例重新打開

一組已穩定的定義在加入新的跨域案例後,應再次出現概念分裂或限定增長。

若某定義對任意新增案例都保持完備,則至少在該概念上會形成更強的全域收斂反例。


12. 限制

本文目前存在明確限制。

第一,100 輪測試由同一大型語言模型在同一對話上下文中自我生成,不能用來證明人類語言行為,也不能排除模型偏好長推理、學術化措辭或上下文延續造成的特定模式。

第二,「判別力」目前只有工作性定義。後續必須區分分類可分性、預測增益、因果作用差異、信息增益與任務效用,不能把它們永遠壓成單一 DD

第三,rank 與低秩分解只提供一種形式化入口。自然語義具有非線性、上下文敏感、多義與歷史依賴,不能把線性代數表示誤當成完整語義本體。

第四,本文尚未給出人類歷史詞彙演化資料對「反覆複合結構重新詞彙化」的直接因果驗證。既有 lexicalization 與效率研究提供鄰近支持,但不等於已驗證本文提出的完整循環。

第五,「無界」是生成許可意義,而非實際完成無限輪。任何真實語言使用者都具有有限時間、記憶、算力與注意資源。

因此本文的最強合理結論是:

未觀察到一個必須先驗固定的最大語義精細層級\boxed{ \text{未觀察到一個必須先驗固定的最大語義精細層級} }

而不是:

已證明任何自然語言議題都具有實際無限的新語義.\boxed{ \text{已證明任何自然語言議題都具有實際無限的新語義}. }

13. 結論

本文從一個極簡問題出發:

當一句話已經很接近,但仍不夠精準時,接下來會發生什麼?

100 輪概念壓力測試顯示,一個語言系統可以依次採用造詞、增加條件、參數化、結構嵌套、遞迴、自指與矩陣化等方式持續增加區分;即使禁止詞彙擴張與參數擴張,固定語義材料仍能透過結構組合生成部分新的有效差異。

另一方面,無界展開並不意味語言必須永久膨脹。當複合語義反覆出現、判別結構穩定且表達成本升高時,系統可以重新壓縮,將高成本結構轉換為新的低成本入口。

因此本文提出的核心不是:

詞彙數量,\text{詞彙數量} \rightarrow \infty,

而是:

可生成的有效語義區分\boxed{ \text{可生成的有效語義區分} }

在不預設最大層級的條件下可以持續被重新打開。

最終循環為:

有限符號複合展開判別壓力有效精細化局部收斂符號壓縮新的有限入口\boxed{ \text{有限符號} \rightarrow \text{複合展開} \rightarrow \text{判別壓力} \rightarrow \text{有效精細化} \rightarrow \text{局部收斂} \rightarrow \text{符號壓縮} \rightarrow \text{新的有限入口} \rightarrow \cdots }

因此,自然語言的力量未必來自擁有無限詞彙,而更可能來自有限符號、可遞迴結構、條件敏感判別與反覆重新基底之間的動態循環。


參考文獻

  1. Fodor, J., De Deyne, S., & Suzuki, S. (2025). Compositionality and Sentence Meaning: Comparing Semantic Parsing and Transformers on a Challenging Sentence Similarity Dataset. Computational Linguistics, 51(1), 139-190. DOI: 10.1162/coli_a_00536.

  2. Paperno, D. (2018). On learning an interpreted language with recurrent models. arXiv:1809.04128.

  3. Futrell, R., & Hahn, M. (2024). Linguistic Structure from a Bottleneck on Sequential Information Processing. arXiv:2405.12109.

  4. Xu, A., Kemp, C., Frermann, L., & Xu, Y. (2024). Word reuse and combination support efficient communication of emerging concepts. arXiv:2411.05379. Published version: Proceedings of the National Academy of Sciences. DOI: 10.1073/pnas.2406971121.

  5. Zaslavsky, N., Kemp, C., Regier, T., & Tishby, N. (2018). Efficient human-like semantic representations via the Information Bottleneck principle. arXiv:1808.03353. Related published work: Efficient compression in color naming and its evolution. Proceedings of the National Academy of Sciences. DOI: 10.1073/pnas.1800521115.

  6. Tishby, N., Pereira, F. C., & Bialek, W. (2000). The information bottleneck method. arXiv:physics/0004057.


系列位置

本文為系列總論。後續預定:

  • Paper 02:從「很接近,但還不夠精準」開始:自然語言百輪壓力測試方法論
  • Paper 03:自然語言的三種展開機制
  • Paper 04:邊界不是一個詞:邊界本體論的百輪語義壓力測試
  • Paper 05:新詞從何而來:複合語義、重複結構與符號晶化
  • Paper 06:語義的展開與收斂:從無界精細化到最小生成核
  • Paper 07:自然語言精細化的矩陣表示
  • Paper 08:有限符號與無界語義:自然語言生成、展開與收斂循環