LRC–COL-05:基底大小—組合深度—表達能力交換律
The Tradeoff Law of Basis Size, Composition Depth, and Expressive Capacity
系列:LRC–COL — Language–Reality Coupling & Composite Operator Language 中文:語言—現實耦合與複合算子語言系列 版本:v0.1 日期:2026-08-21
作者: Neo.K機構: EveMissLab/一言諾科技有限公司
摘要
LRC–COL-03 與 LRC–COL-04 分別建立了複合符號算子語言的有效下界與有效上界:operator 太少,目標域覆蓋不足、組合深度過高;operator 太多,則出現 selection entropy、semantic collision、context cost、version burden 與 active-set overload。兩篇合起來得到一個靜態有效區間:
N min e f f e c t i v e ≤ N ≤ N max e f f e c t i v e . N_{\min}^{effective}
\le
N
\le
N_{\max}^{effective}. N m i n e f f ec t i v e ≤ N ≤ N m a x e f f ec t i v e .
但這仍沒有回答真正的語言設計核心:
在這個區間內,多增加一個 operator,到底可以換回多少 composition depth、多少語義保真、多少學習成本、多少執行效率與多少 action yield?
本文提出 Basis–Depth–Expressivity Tradeoff(基底—深度—表達能力交換律) ,把 operator 數量 N N N 、組合深度 d d d 、operator 粒度 g g g 、有效表達容量 C e f f C_{eff} C e f f 、語義保真 F s e m F_{sem} F se m 、學習成本 C l e a r n C_{learn} C l e a r n 、選擇成本 C s e l C_{sel} C se l 與 Language Action Yield Y L Y_L Y L 放入同一聯合模型。
本文首先指出:在最粗略的無型別近似中,若一個語言有 N N N 個 operator、最大組合深度 d d d ,可生成的 syntactic structures 數量通常會隨 N N N 與 d d d 超線性甚至指數級成長;因此較大的 N N N 可以用較淺的 d d d 達到相似表達覆蓋。但 syntactic capacity 不等於 effective semantic capacity。大量 expression 可能非法、同義、不可學、不可穩定執行,故真正有效容量必須乘上 validity、semantic distinctness、learnability 與 fidelity 修正。
本文提出一個粗略但有用的容量關係:
C e f f ( N , d , g ) = C s y n ( N , d , g ) ⋅ p v a l i d ⋅ p d i s t i n c t ⋅ p l e a r n ⋅ p f a i t h f u l . \boxed{
C_{eff}(N,d,g)
=
C_{syn}(N,d,g)
\cdot
p_{valid}
\cdot
p_{distinct}
\cdot
p_{learn}
\cdot
p_{faithful}.
} C e f f ( N , d , g ) = C sy n ( N , d , g ) ⋅ p v a l i d ⋅ p d i s t in c t ⋅ p l e a r n ⋅ p f ai t h f u l .
並進一步提出一個候選交換約束:若目標域中至少有 M e f f M_{eff} M e f f 個必須可區分的有效行為,而每個 operator 在平均深度上提供約 log N \log N log N 的選擇資訊,則在簡化條件下可能存在:
d log N ≳ log M e f f , \boxed{
d\log N
\gtrsim
\log M_{eff},
} d log N ≳ log M e f f ,
或:
N ≳ M e f f 1 / d . \boxed{
N
\gtrsim
M_{eff}^{1/d}.
} N ≳ M e f f 1/ d .
這不是普遍定理,而是第一版「基底變大可以換深度下降」的資訊容量近似。
本文另外建立 Depth Fidelity Law :若每一層 composition 的平均條件保真率為 q < 1 q<1 q < 1 ,最簡獨立近似下:
F c o m p ( d ) ≈ q d . F_{comp}(d)
\approx
q^d. F co m p ( d ) ≈ q d .
因此,對目標保真門檻 τ F \tau_F τ F ,存在:
d max F = ln τ F ln q . \boxed{
d_{\max}^{F}
=
\frac{\ln\tau_F}{\ln q}.
} d m a x F = ln q ln τ F .
這使 macro operator、crystallized operator 與 higher-granularity operator 的價值可以第一次用「省下幾層 composition 所換回的 fidelity」來衡量,而不只看 token 壓縮。
本文最終將最佳語言設計寫成:
( N ∗ , d ∗ , g ∗ ) = arg max J ( N , d , g ) \boxed{
(N^*,d^*,g^*)
=
\arg\max
J(N,d,g)
} ( N ∗ , d ∗ , g ∗ ) = arg max J ( N , d , g )
subject to coverage、fidelity、learning、selection、risk 與 active-set constraints。本文主張未來 AI-native composite language 的真正設計對象不是「最小字典」或「最多 operator」,而是一個 Basis–Depth–Granularity Pareto Surface 。
關鍵詞
operator basis;composition depth;expressivity;granularity;semantic fidelity;compositional generalization;macro operator;RISC/CISC;Pareto frontier;AI-native language
1. 上下界之間真正缺的東西
前兩篇已經得到:
N min e f f e c t i v e N_{\min}^{effective} N m i n e f f ec t i v e
與:
N max e f f e c t i v e . N_{\max}^{effective}. N m a x e f f ec t i v e .
但假設:
N min = 20 , N max = 200. N_{\min}=20,
\qquad
N_{\max}=200. N m i n = 20 , N m a x = 200.
那麼到底:
30 好?
60 好?
100 好?
150 好?
仍然不知道。
因為:
N \boxed{
N
} N
本身不是效用。
真正要看:
N → d → F s e m → C l e a r n → C e x e c → Y L . \boxed{
N
\rightarrow
d
\rightarrow
F_{sem}
\rightarrow
C_{learn}
\rightarrow
C_{exec}
\rightarrow
Y_L.
} N → d → F se m → C l e a r n → C e x ec → Y L .
2. 第一條基本交換律
直覺上:
N ↓ ⇒ d ↑ . N\downarrow
\Rightarrow
d\uparrow. N ↓⇒ d ↑ .
因為 primitive 少,高階能力需要更多層 composition。
反之:
N ↑ ⇒ d ↓ . N\uparrow
\Rightarrow
d\downarrow. N ↑⇒ d ↓ .
因為更多中階/高階 operator 可以直接承載常見子程序。
因此:
N ↔ d . \boxed{
N
\leftrightarrow
d.
} N ↔ d .
但這不是嚴格線性,真正關係更像:
d = f ( N , G , g , Ω , A ) . \boxed{
d
=
f(
N,
G,
g,
\Omega,
A
).
} d = f ( N , G , g , Ω , A ) .
3. Workload Distribution
令 Ω \Omega Ω 是目標域,實際 workload 由:
μ ( ω ) \mu(\omega) μ ( ω )
決定。
因此最重要的不是單一 worst-case expression depth,而可能是:
d ˉ O = E ω ∼ μ [ D O ( ω ) ] . \boxed{
\bar d_{\mathcal O}
=
\mathbb E_{\omega\sim\mu}
[
D_{\mathcal O}(\omega)
].
} d ˉ O = E ω ∼ μ [ D O ( ω )] .
其中 D O ( ω ) D_{\mathcal O}(\omega) D O ( ω ) 是使用 basis O \mathcal O O 表達任務 ω \omega ω 所需的最小有效深度。
高風險系統仍需另外追蹤:
d w o r s t = sup ω ∈ Ω c r i t i c a l D O ( ω ) . \boxed{
d_{worst}
=
\sup_{\omega\in\Omega_{critical}}
D_{\mathcal O}(\omega).
} d w or s t = ω ∈ Ω cr i t i c a l sup D O ( ω ) .
4. Expression Length 與 Depth 不同
兩個 expression 可能一個長但平衡、另一個短但串行。
所以:
L e ≠ d e . \boxed{
L_e
\neq
d_e.
} L e = d e .
對 AI 而言,composition depth 會影響:
intermediate state;
dependency chain;
error propagation;
context maintenance;
tool sequencing;
branch recovery。
因此:
same expression length ≠ same cognitive difficulty . \boxed{
\text{same expression length}
\neq
\text{same cognitive difficulty}.
} same expression length = same cognitive difficulty .
5. Syntactic Capacity
最粗略地,若有 N N N 個一元 operators、深度最多 d d d ,sequence 數量約:
∑ k = 1 d N k . \sum_{k=1}^{d}N^k. k = 1 ∑ d N k .
若 N > 1 N>1 N > 1 :
C s y n ∼ O ( N d ) . \boxed{
C_{syn}
\sim
O(N^d).
} C sy n ∼ O ( N d ) .
若 operators 有多種 arity,expression tree 數量還會再乘上 tree-structure 的組合,因此 syntactic capacity 可能增長得更快。
6. Syntax Capacity 極度高估真正能力
很多 combination:
type-invalid;
semantic-equivalent;
Agent 學不會;
execution 不穩定。
所以通常:
C s y n ≫ C e f f . \boxed{
C_{syn}
\gg
C_{eff}.
} C sy n ≫ C e f f .
本文提出:
C e f f = C s y n ⋅ p v a l i d ⋅ p d i s t i n c t ⋅ p l e a r n ⋅ p f a i t h f u l . \boxed{
C_{eff}
=
C_{syn}
\cdot
p_{valid}
\cdot
p_{distinct}
\cdot
p_{learn}
\cdot
p_{faithful}.
} C e f f = C sy n ⋅ p v a l i d ⋅ p d i s t in c t ⋅ p l e a r n ⋅ p f ai t h f u l .
因此:
E x p r e s s i v i t y = f ( N , d , g , G , T , A ) . \boxed{
Expressivity
=
f(
N,d,g,G,T,A
).
} E x p r ess i v i t y = f ( N , d , g , G , T , A ) .
只說「這套語言有 100 個 operator」幾乎沒有足夠資訊。
7. 第一版容量下界近似
假設目標域中至少有 M e f f M_{eff} M e f f 個必須可區分的 target behaviors。
若每層大約提供 log N \log N log N 的 operator identity information,簡化地:
d log N ≳ log M e f f . \boxed{
d\log N
\gtrsim
\log M_{eff}.
} d log N ≳ log M e f f .
因此:
N ≳ M e f f 1 / d . \boxed{
N
\gtrsim
M_{eff}^{1/d}.
} N ≳ M e f f 1/ d .
這不是普遍定理,因為 type system、arity、parameters、recursion 與 memory 都可以改變容量。本文只把它稱為:
Basis–Depth Capacity Heuristic . \boxed{
\text{Basis–Depth Capacity Heuristic}.
} Basis–Depth Capacity Heuristic .
它真正告訴我們的是:
越要求少步完成,越需要更多語義被預先結晶進 operator。
8. Operator Granularity
引入第三個核心量:
g ( O ) . \boxed{
g(O).
} g ( O ) .
表示 operator 承載的語義/行動粒度。
最簡化可以:
g ( O ) = L 0 ( E x p a n d ( O ) ) , \boxed{
g(O)
=
L_0(
Expand(O)
),
} g ( O ) = L 0 ( E x p an d ( O )) ,
即該 operator 展開成最低階 primitives 後,大約相當於多少 primitive operations。
整套 basis 的 usage-weighted 平均 granularity:
g ˉ = E O ∼ u s a g e [ g ( O ) ] . \boxed{
\bar g
=
\mathbb E_{O\sim usage}
[
g(O)
].
} g ˉ = E O ∼ u s a g e [ g ( O )] .
通常 g ˉ ↑ \bar g\uparrow g ˉ ↑ 會讓 d ↓ d\downarrow d ↓ ,但 operator 越粗也會增加 semantic contract、internal branch、parameter schema 與 applicability cost。
因此:
g ↑ ⇏ Y L ↑ . \boxed{
g\uparrow
\not\Rightarrow
Y_L\uparrow.
} g ↑ ⇒ Y L ↑ .
9. 太細 vs 太粗
Too Fine
N N N 小;
d d d 大;
repeated composition;
error accumulation。
Too Coarse
macro 數量增長;
overlap;
poor reuse;
God Operator risk。
因此存在:
g ∗ . \boxed{
g^*.
} g ∗ .
真正要找的是:
( N ∗ , d ∗ , g ∗ ) . \boxed{
(N^*,d^*,g^*).
} ( N ∗ , d ∗ , g ∗ ) .
10. Depth Fidelity Law
假設每一層 composition C i C_i C i 在上游正確的條件下,平均保持語義正確的機率為 q i q_i q i 。
若簡化為:
q i = q , q_i=q, q i = q ,
且近似獨立,則:
F c o m p ( d ) ≈ q d . \boxed{
F_{comp}(d)
\approx
q^d.
} F co m p ( d ) ≈ q d .
例如:
0.99 10 ≈ 0.904 , 0.99^{10}\approx0.904, 0.9 9 10 ≈ 0.904 ,
而:
0.98 20 ≈ 0.668. 0.98^{20}\approx0.668. 0.9 8 20 ≈ 0.668.
所以「每一步只錯一點」在深鏈上仍可能累積成顯著風險。
11. Fidelity-Constrained Depth Ceiling
若最低要求:
F c o m p ≥ τ F , F_{comp}\ge\tau_F, F co m p ≥ τ F ,
則:
q d ≥ τ F . q^d\ge\tau_F. q d ≥ τ F .
因此:
d ≤ d max F = ln τ F ln q . \boxed{
d
\le
d_{\max}^{F}
=
\frac{\ln\tau_F}{\ln q}.
} d ≤ d m a x F = ln q ln τ F .
這代表:
再小的 formal basis,也不能假設可以任意深地展開。
如果 per-step fidelity 有限,composition depth 就存在實際 reliability ceiling。
12. Heterogeneous Fidelity 與 Correlated Error
若不同 operator fidelity 不同:
F c o m p ≈ ∏ i = 1 d q i . \boxed{
F_{comp}
\approx
\prod_{i=1}^{d}q_i.
} F co m p ≈ i = 1 ∏ d q i .
低 fidelity operator 會形成 chain bottleneck。
但實際 error 不一定獨立;早期 interpretation error 可能改變後續所有 branch,因此 q d q^d q d 只是一階 baseline。
可定義:
A d = O b s e r v e d F a i l u r e ( d ) 1 − q d . \boxed{
A_d
=
\frac{
ObservedFailure(d)
}{
1-q^d
}.
} A d = 1 − q d O b ser v e d F ai l u r e ( d ) .
如果 A d > 1 A_d>1 A d > 1 ,代表存在 nonlinear amplification。
13. Macro 可以換回 Fidelity
假設 macro O M O_M O M 把原本 k k k 層 composition 壓成 1 層。
若 macro fidelity:
q M q_M q M
高於:
q k , q^k, q k ,
則:
Δ F M = q M − q k > 0. \boxed{
\Delta F_M
=
q_M-q^k
>0.
} Δ F M = q M − q k > 0.
所以 macro 的收益至少包含:
Δ T o k e n + Δ D e p t h + Δ F i d e l i t y + Δ L a t e n c y . \boxed{
\Delta Token
+
\Delta Depth
+
\Delta Fidelity
+
\Delta Latency.
} Δ T o k e n + Δ D e pt h + Δ F i d e l i t y + Δ L a t e n cy .
不是只有文字縮短。
如果 q M < q k q_M<q^k q M < q k ,則 macro 雖然更短,卻變成語義黑箱:
Depth Compression ≠ Reliability Gain . \boxed{
\text{Depth Compression}
\neq
\text{Reliability Gain}.
} Depth Compression = Reliability Gain .
14. Macro Admission Gate
對 recurring motif m m m ,由 k m k_m k m 個 low-level operations 組成。
第一版 macro gain:
G a i n m = f m [ α ( k m − 1 ) + β Δ F m + γ Δ Y m + η Δ L m ] . \boxed{
Gain_m
=
f_m
[
\alpha(k_m-1)
+
\beta\Delta F_m
+
\gamma\Delta Y_m
+
\eta\Delta L_m
].
} G ai n m = f m [ α ( k m − 1 ) + β Δ F m + γ Δ Y m + η Δ L m ] .
其中:
f m f_m f m :workload frequency;
( k m − 1 ) (k_m-1) ( k m − 1 ) :省下的 depth;
Δ F m \Delta F_m Δ F m :fidelity gain;
Δ Y m \Delta Y_m Δ Y m :action-yield gain;
Δ L m \Delta L_m Δ L m :語言/token 壓縮。
成本:
C o s t m = C d e f i n e + C l e a r n + C s e l e c t + C v e r s i o n + C c o l l i s i o n . \boxed{
Cost_m
=
C_{define}
+
C_{learn}
+
C_{select}
+
C_{version}
+
C_{collision}.
} C os t m = C d e f in e + C l e a r n + C se l ec t + C v er s i o n + C co l l i s i o n .
只有:
G a i n m > C o s t m \boxed{
Gain_m>Cost_m
} G ai n m > C os t m
才適合進 stable macro layer。
15. Frequency–Depth Exchange
這讓前篇的「高頻結晶、低頻組合」得到更清楚的形式。
若 f m f_m f m 高,depth saving 被反覆享受:
G a i n ∝ f m . Gain\propto f_m. G ain ∝ f m .
相反,一個只用一次的 macro 還要被定義、命名、學習與治理,通常不值得永久加入 global language。
因此可分:
Stable Operator
長期高頻,進 global language。
Local Macro
domain / project 內使用。
Ephemeral Macro
session 生成,用完可消失。
16. Basis Size 也會增加 Selection Cost
LRC–COL-04 已定義 selection entropy:
H s e l . H_{sel}. H se l .
粗略可寫:
C s e l ∝ H s e l . \boxed{
C_{sel}
\propto
H_{sel}.
} C se l ∝ H se l .
若候選近似均勻:
p i = 1 N A , p_i=\frac1{N_A}, p i = N A 1 ,
則:
H s e l = log N A . H_{sel}=\log N_A. H se l = log N A .
真實情況中還要加入 semantic collision:
C s e l = f ( N A , H s e l , ρ c o l ) . C_{sel}
=
f(
N_A,
H_{sel},
\rho_{col}
). C se l = f ( N A , H se l , ρ co l ) .
因此新增 macro 是在用:
Δ C s e l ↔ − Δ d \boxed{
\Delta C_{sel}
\leftrightarrow
-\Delta d
} Δ C se l ↔ − Δ d
交換 selection complexity 與 composition depth。
17. RISC / CISC 類比
CPU instruction-set 設計長期存在類似取捨:
少而簡單的 instructions;
多而複雜的 instructions;
code density;
decode complexity;
execution efficiency。
現代 CPU 甚至會把複雜 instruction 內部分解成較簡單 micro-ops。
這不是證明 COL 一定等同 CPU ISA,但提供重要工程類比:
rich surface instruction → simpler internal primitives . \boxed{
\text{rich surface instruction}
\rightarrow
\text{simpler internal primitives}.
} rich surface instruction → simpler internal primitives .
18. COL 可能是雙層 ISA
未來可以:
Surface Operators → Canonical Micro-Operators . \boxed{
\text{Surface Operators}
\rightarrow
\text{Canonical Micro-Operators}.
} Surface Operators → Canonical Micro-Operators .
表面層:
kernel 層:
basis 小;
semantics 穩定;
runtime 可驗證。
因此:
O s u r f a c e → C o m p i l e O k e r n e l ∗ . \boxed{
\mathcal O_{surface}
\xrightarrow{Compile}
\mathcal O_{kernel}^{*}.
} O s u r f a ce C o m p i l e O k er n e l ∗ .
而:
N S > N K N_S>N_K N S > N K
完全合理。
19. Compiler Fidelity
雙層設計把新風險移到:
F c o m p i l e . \boxed{
F_{compile}.
} F co m p i l e .
總 fidelity:
F t o t a l = F p a r s e F c o m p i l e F e x e c u t e . \boxed{
F_{total}
=
F_{parse}
F_{compile}
F_{execute}.
} F t o t a l = F p a r se F co m p i l e F e x ec u t e .
因此 surface vocabulary 雖然好用,仍必須能穩定編譯回 kernel semantics。
20. Surface Depth 與 Kernel Depth
表面:
d S d_S d S
可能很小。
kernel 展開:
d K d_K d K
可能很大。
因此:
d S ≠ d K . \boxed{
d_S
\neq
d_K.
} d S = d K .
兩者都重要。
d S d_S d S 影響 planning、readability、composition burden; d K d_K d K 影響 runtime、latency、verification 與 low-level error。
可以先用:
d e f f = α d S + β d K + γ d t o o l . \boxed{
d_{eff}
=
\alpha d_S
+
\beta d_K
+
\gamma d_{tool}.
} d e f f = α d S + β d K + γ d t oo l .
作為候選有效深度。
21. Expression Depth 不等於 Transformer Depth
本文的 d d d 是 operator expression 的組合深度,不是 Transformer layer depth。
但外部研究提供一個有用提醒:NAACL 2024 在控制總參數量後發現 deeper transformers 的 compositional generalization 通常較好,但額外 depth 的收益快速遞減。
這不能推出 operator expression 越深越好;它反而提醒:
depth capacity and depth burden must be distinguished . \boxed{
\text{depth capacity and depth burden must be distinguished}.
} depth capacity and depth burden must be distinguished .
22. Compositional Complexity 的實證邊界
NAACL 2025 的 morphology compositionality 研究顯示,LLM 在 novel roots 與更高 morphological complexity 下表現明顯下降。
ACL Findings 2024 的 grounded compositionality 工作則發現,模型對 unseen sequence lengths 與 novel combinations of seen base components 仍有困難。
因此:
known primitives + known semantics ⇏ arbitrary depth generalization . \boxed{
\text{known primitives}
+
\text{known semantics}
\not\Rightarrow
\text{arbitrary depth generalization}.
} known primitives + known semantics ⇒ arbitrary depth generalization .
23. Training Envelope 與 Depth Extrapolation
令:
d t r a i n d_{train} d t r ain
是 training / exposure 中常見最大深度。
測試:
d t e s t > d t r a i n d_{test}>d_{train} d t es t > d t r ain
就是:
depth extrapolation . \boxed{
\text{depth extrapolation}.
} depth extrapolation .
可定義:
G d = P e r f o r m a n c e ( d ) . \boxed{
G_d
=
Performance(d).
} G d = P er f or man ce ( d ) .
並找:
d c r i t = min { d : P e r f o r m a n c e ( d ) < τ P } . \boxed{
d_{crit}
=
\min
\{
d:
Performance(d)<\tau_P
\}.
} d cr i t = min { d : P er f or man ce ( d ) < τ P } .
這就是某 Agent 在某 basis 下的實際 depth ceiling。
24. Depth Rescue
如果新增 macro 後,某 task:
D O ( ω ) > d c r i t D_{\mathcal O}(\omega)>d_{crit} D O ( ω ) > d cr i t
變成:
D O ′ ( ω ) ≤ d c r i t , D_{\mathcal O'}(\omega)\le d_{crit}, D O ′ ( ω ) ≤ d cr i t ,
則新增 operator 把原本超過 Agent compositional horizon 的任務壓回可用區。
本文稱:
Depth Rescue . \boxed{
\text{Depth Rescue}.
} Depth Rescue .
這種情況可能造成 basis utility 的離散跳升。
25. Utility 可能出現 Phase Transition
macro 跨過 d c r i t d_{crit} d cr i t 時:
J ( N ) J(N) J ( N )
可能突然上升。
反過來,新增相似 operators 使 ρ c o l \rho_{col} ρ co l 跨過 selection threshold,也可能突然下降。
因此:
J ( N ) \boxed{
J(N)
} J ( N )
可能:
非平滑;
有多個局部 optimum;
出現 phase-transition-like behavior。
26. Pareto Surface
因此最合理結果不是:
最佳 N = 57。
而是:
P = P a r e t o ( N , d , g , F s e m , C l e a r n , C s e l , Y L ) . \boxed{
\mathcal P
=
Pareto(
N,
d,
g,
F_{sem},
C_{learn},
C_{sel},
Y_L
).
} P = P a r e t o ( N , d , g , F se m , C l e a r n , C se l , Y L ) .
27. Workload-Specific Optimum
對 workload μ 1 \mu_1 μ 1 :
( N 1 ∗ , d 1 ∗ , g 1 ∗ ) . (N_1^*,d_1^*,g_1^*). ( N 1 ∗ , d 1 ∗ , g 1 ∗ ) .
對 μ 2 \mu_2 μ 2 :
( N 2 ∗ , d 2 ∗ , g 2 ∗ ) . (N_2^*,d_2^*,g_2^*). ( N 2 ∗ , d 2 ∗ , g 2 ∗ ) .
可能完全不同。
因此:
No workload-free optimum . \boxed{
\text{No workload-free optimum}.
} No workload-free optimum .
28. Motif Distribution 比 Task Identity 更重要
令 m m m 是 recurrent compositional motif,分布:
p ( m ) . p(m). p ( m ) .
macro crystallization 應主要依 recurring motif,而不是 task 名稱。
可建立:
min E ω [ D e p t h ( ω ∣ M ) ] + λ ∣ M ∣ + μ C s e l ( M ) . \boxed{
\min
\mathbb E_{\omega}
[
Depth(\omega\mid\mathcal M)
]
+
\lambda|\mathcal M|
+
\mu C_{sel}(\mathcal M).
} min E ω [ D e pt h ( ω ∣ M )] + λ ∣ M ∣ + μ C se l ( M ) .
這已經接近一個真正可實作的 macro-selection objective。
29. Dictionary Learning 類比
這和:
dictionary learning;
byte-pair merge;
macro compression;
有結構相似處。
都是在找:
哪些 recurring units 值得升格成可重用單位?
但 COL 還多:
semantics;
action;
type;
risk。
所以不能只按 frequency merge。
30. Operator Granularity 需要 Domain / Risk Conditioning
例如:
File System
move_file
可能是合適粒度。
Deployment
release_production
可能太粗,因為包含:
tests;
approvals;
rollback;
migration。
所以:
g ∗ = g ∗ ( D o m a i n , R i s k ) . \boxed{
g^*
=
g^*(Domain,Risk).
} g ∗ = g ∗ ( D o main , R i s k ) .
高風險 domain 可能傾向更細粒度,以提高 verification 與 rollback;高頻低風險 domain 則可能適合較粗 macro。
31. Semantic Depth vs Action Depth
如果 expression 最後只生成文字,depth error 主要是 semantic。
如果每層都直接 action:
O 1 → W 1 → O 2 → W 2 , O_1\rightarrow W_1\rightarrow O_2\rightarrow W_2, O 1 → W 1 → O 2 → W 2 ,
錯誤會立刻進世界。
因此區分:
d s d_s d s
語義 composition depth,
與:
d a d_a d a
外部 action chain depth。
可以:
d r i s k = α d s + β d a , β > α \boxed{
d_{risk}
=
\alpha d_s+\beta d_a,
\qquad
\beta>\alpha
} d r i s k = α d s + β d a , β > α
用於高實體風險 domain。
32. Verification 可以換更深的 d
如果每隔 k k k 層插入:
V e r i f y , Verify, V er i f y ,
可以阻止 error 長鏈無限制累積。
所以:
verification can buy compositional depth . \boxed{
\text{verification can buy compositional depth}.
} verification can buy compositional depth .
這意味著真正交換關係已經擴展成:
N ↔ d ↔ g ↔ v \boxed{
N
\leftrightarrow
d
\leftrightarrow
g
\leftrightarrow
v
} N ↔ d ↔ g ↔ v
其中 v v v 是 verification density。
33. 深本身不是絕對壞
真正高風險的是:
無檢查深鏈;
high-coupling 深鏈;
low-fidelity 深鏈。
因此:
Depth Cost = f ( F i d e l i t y , V e r i f i c a t i o n , R e v e r s i b i l i t y , C o u p l i n g ) . \boxed{
\text{Depth Cost}
=
f(
Fidelity,
Verification,
Reversibility,
Coupling
).
} Depth Cost = f ( F i d e l i t y , V er i f i c a t i o n , R e v er s ibi l i t y , C o u pl in g ) .
sandbox / simulation / rollback 都會改變可接受的 depth。
34. 總成本模型
對 workload μ \mu μ :
C t o t a l = C b a s i s + C l e a r n + C s e l e c t + C c o m p o s e + C v e r i f y + C e x e c u t e + C r i s k . \boxed{
C_{total}
=
C_{basis}
+
C_{learn}
+
C_{select}
+
C_{compose}
+
C_{verify}
+
C_{execute}
+
C_{risk}.
} C t o t a l = C ba s i s + C l e a r n + C se l ec t + C co m p ose + C v er i f y + C e x ec u t e + C r i s k .
通常:
N ↑ ⇒ C b a s i s ↑ , N\uparrow
\Rightarrow
C_{basis}\uparrow, N ↑⇒ C ba s i s ↑ ,
N ↑ ⇒ C s e l e c t ↑ , N\uparrow
\Rightarrow
C_{select}\uparrow, N ↑⇒ C se l ec t ↑ ,
但:
N ↑ ⇒ C c o m p o s e ↓ . N\uparrow
\Rightarrow
C_{compose}\downarrow. N ↑⇒ C co m p ose ↓ .
自然會出現中間 optimum。
35. 聯合最佳化
因此真正最佳設計:
( N ∗ , d ∗ , g ∗ , v ∗ ) = arg min C t o t a l \boxed{
(N^*,d^*,g^*,v^*)
=
\arg\min
C_{total}
} ( N ∗ , d ∗ , g ∗ , v ∗ ) = arg min C t o t a l
subject to:
C o v e r a g e ≥ τ C , Coverage\ge\tau_C, C o v er a g e ≥ τ C ,
F i d e l i t y ≥ τ F , Fidelity\ge\tau_F, F i d e l i t y ≥ τ F ,
Y L ≥ τ Y , Y_L\ge\tau_Y, Y L ≥ τ Y ,
R i s k ≤ R m a x . Risk\le R_{max}. R i s k ≤ R ma x .
36. Basis 必須和 Runtime 一起設計
形式最小只問 N N N 。
工程語言需要:
N + d + g + v + r u n t i m e . \boxed{
N+d+g+v+runtime.
} N + d + g + v + r u n t im e .
完整系統:
O p e r a t o r L i b r a r y → R e t r i e v e r → C o m p o s e r → C o m p i l e r → V e r i f i e r → E x e c u t o r . \boxed{
Operator Library
\rightarrow
Retriever
\rightarrow
Composer
\rightarrow
Compiler
\rightarrow
Verifier
\rightarrow
Executor.
} O p er a t or L ib r a r y → R e t r i e v er → C o m p oser → C o m p i l er → V er i f i er → E x ec u t or .
basis optimum 取決於整條鏈。
37. 本篇十二個正式命題
BD-P1 — Basis–Depth Tradeoff
在固定 coverage 與 granularity family 下, N ↓ ⇒ d ↑ N\downarrow\Rightarrow d\uparrow N ↓⇒ d ↑ 通常成立。
BD-P2 — Effective Capacity Correction
syntactic capacity 必須經 validity、distinctness、learnability、fidelity 修正。
BD-P3 — Fidelity-Constrained Depth
若 per-step fidelity q < 1 q<1 q < 1 ,存在有限 d max F d_{\max}^{F} d m a x F 。
BD-P4 — Macro Depth Rescue
適當 macro 可以把原本超過 Agent depth horizon 的 task 壓回可用區。
BD-P5 — Macro Selection Cost
macro 增加會降低 depth,但提高 selection complexity。
BD-P6 — Optimal Granularity
存在 domain-conditioned g ∗ g^* g ∗ 。
BD-P7 — Dual-Level Basis
surface operator basis 與 kernel micro-operator basis 可以不同。
BD-P8 — Frequency-Weighted Crystallization
高頻 recurrent motifs 更值得永久 macro 化。
BD-P9 — Long-Tail Composition
低頻 long-tail 更適合由 shared basis 動態組合或 ephemeral macro 處理。
BD-P10 — Verification Buys Depth
verification density 上升可以提高可安全支持的有效 composition depth。
BD-P11 — Workload-Conditioned Optimum
不存在脫離 workload distribution 的 universal ( N ∗ , d ∗ , g ∗ ) (N^*,d^*,g^*) ( N ∗ , d ∗ , g ∗ ) 。
BD-P12 — Phase-Transition Utility
basis expansion、collision 與 depth rescue 可能讓效用曲線出現非平滑 phase transition。
38. 第一版實驗設計
固定 target workload:
Ω 0 . \Omega_0. Ω 0 .
建立數個 basis:
N = 8 , 16 , 32 , 64 , 128. N=
8,16,32,64,128. N = 8 , 16 , 32 , 64 , 128.
對每個 basis:
自動找最短 composition;
測平均 depth;
測 max depth;
測 novel composition;
測 fidelity;
測 selection;
測 latency;
測 action yield。
39. Macro Sweep
固定 primitive kernel。
逐步加入 top-frequency motifs:
M = 0 , 5 , 10 , 20 , 40. M=0,5,10,20,40. M = 0 , 5 , 10 , 20 , 40.
測:
d ˉ ( M ) , \bar d(M), d ˉ ( M ) ,
F s e m ( M ) , F_{sem}(M), F se m ( M ) ,
C s e l ( M ) , C_{sel}(M), C se l ( M ) ,
Y L ( M ) . Y_L(M). Y L ( M ) .
找:
M ∗ . M^*. M ∗ .
40. Depth Extrapolation Test
training:
d ≤ d t r a i n . d\le d_{train}. d ≤ d t r ain .
testing:
d = d t r a i n + 1 , … , d t r a i n + k . d=d_{train}+1,\ldots,d_{train}+k. d = d t r ain + 1 , … , d t r ain + k .
找:
d c r i t . d_{crit}. d cr i t .
這會直接告訴我們:
什麼時候需要 macro rescue。
41. Granularity Sweep
同一功能設三種版本:
Fine
小 operators。
Medium
中粒度。
Coarse
macro-heavy。
比較:
learning;
selection;
execution;
transfer;
fidelity。
42. Verification Sweep
同一 composition depth d d d ,設 verification 每:
1 , 2 , 4 , 8 , ∞ 1,2,4,8,\infty 1 , 2 , 4 , 8 , ∞
層一次。
測:
fidelity;
latency;
total yield。
找:
v ∗ . v^*. v ∗ .
43. 期望得到的不是單一最佳點
不同 risk / workload 下:
( N ∗ , d ∗ , g ∗ , v ∗ ) (N^*,d^*,g^*,v^*) ( N ∗ , d ∗ , g ∗ , v ∗ )
不同。
真正產物應是一張 Policy Map,例如:
Low-risk repetitive
→ coarser macros
High-risk irreversible
→ finer operators + dense verification
High-entropy long-tail
→ small core + dynamic composition
High-frequency stable
→ crystallize recurring motifs
44. 靜態交換律的最後形式
本篇把靜態語言設計壓成:
T S : ( N , d , g , v ) ↦ ( C o v e r a g e , F i d e l i t y , L e a r n i n g , S e l e c t i o n , Y i e l d , R i s k ) . \boxed{
\mathcal T_S:
(N,d,g,v)
\mapsto
(
Coverage,
Fidelity,
Learning,
Selection,
Yield,
Risk
).
} T S : ( N , d , g , v ) ↦ ( C o v er a g e , F i d e l i t y , L e a r nin g , S e l ec t i o n , Y i e l d , R i s k ) .
這就是:
Static Basis–Depth Tradeoff Surface . \boxed{
\text{Static Basis–Depth Tradeoff Surface}.
} Static Basis–Depth Tradeoff Surface .
45. 與下一篇的接口
目前假設:
workload 固定;
Agent 固定;
basis 固定;
macro frequency 固定。
實際系統中:
AI 會學;
workload 會變;
macros 會結晶;
operators 會 retire;
Agent capacity 會升級。
因此:
( N ∗ , d ∗ , g ∗ ) (N^*,d^*,g^*) ( N ∗ , d ∗ , g ∗ )
會隨時間變。
下一篇就正式把:
T S \boxed{
\mathcal T_S
} T S
變成:
T D ( t ) . \boxed{
\mathcal T_D(t).
} T D ( t ) .
46. 本篇核心公式組
有效容量:
C e f f = C s y n p v a l i d p d i s t i n c t p l e a r n p f a i t h f u l . \boxed{
C_{eff}
=
C_{syn}
p_{valid}
p_{distinct}
p_{learn}
p_{faithful}.
} C e f f = C sy n p v a l i d p d i s t in c t p l e a r n p f ai t h f u l .
容量近似:
d log N ≳ log M e f f . \boxed{
d\log N
\gtrsim
\log M_{eff}.
} d log N ≳ log M e f f .
深度 fidelity:
F c o m p ( d ) ≈ q d . \boxed{
F_{comp}(d)\approx q^d.
} F co m p ( d ) ≈ q d .
fidelity depth ceiling:
d max F = ln τ F ln q . \boxed{
d_{\max}^{F}
=
\frac{\ln\tau_F}{\ln q}.
} d m a x F = ln q ln τ F .
macro gain:
G a i n m = f m [ α Δ d + β Δ F + γ Δ Y + η Δ L ] . \boxed{
Gain_m
=
f_m[
\alpha\Delta d
+\beta\Delta F
+\gamma\Delta Y
+\eta\Delta L
].
} G ai n m = f m [ α Δ d + β Δ F + γ Δ Y + η Δ L ] .
聯合 optimum:
( N ∗ , d ∗ , g ∗ , v ∗ ) = arg min C t o t a l . \boxed{
(N^*,d^*,g^*,v^*)
=
\arg\min C_{total}.
} ( N ∗ , d ∗ , g ∗ , v ∗ ) = arg min C t o t a l .
47. 非主張
本文不主張:
d log N ≳ log M d\log N\gtrsim\log M d log N ≳ log M 是普遍定理;
composition error 真正獨立;
F = q d F=q^d F = q d 足以描述真實 Agent;
RISC/CISC 與 AI operator language 完全等價;
macro 越多越好;
high-frequency motif 一定要 macro 化;
coarse operators 一定適合低風險工作;
universal ( N ∗ , d ∗ , g ∗ ) (N^*,d^*,g^*) ( N ∗ , d ∗ , g ∗ ) 存在;
Transformer network depth 等於 operator composition depth;
static optimum 會在未來維持不變。
本文只提出:
Basis size, composition depth, operator granularity, and verification density form a coupled design space whose optimum must be evaluated through effective expressivity, fidelity, learning, selection, action yield, and risk. \boxed{
\text{Basis size, composition depth, operator granularity, and verification density form a coupled design space whose optimum must be evaluated through effective expressivity, fidelity, learning, selection, action yield, and risk.}
} Basis size, composition depth, operator granularity, and verification density form a coupled design space whose optimum must be evaluated through effective expressivity, fidelity, learning, selection, action yield, and risk.
48. 文獻錨點
Combinatory Logic / Small Complete Bases 經典 combinatory logic 顯示小型 combinatory basis 可以具有極高生成能力;derived combinators 則說明形式上不必要的高階 unit 可以顯著縮短 expression。這提供「basis size vs expression complexity」的形式錨點。
RISC/CISC Instruction-Set Tradeoff 電腦架構長期存在「較少簡單 instructions vs 較多複雜 instructions」的 code density、decode complexity、execution cost 交換;現代 ISA 亦常將複雜 instructions 內部分解為 micro-operations。本文僅把它作為工程類比,不視為 COL 的直接證明。
The Impact of Depth on Compositional Generalization in Transformer Language Models(NAACL 2024) 在控制總參數量後,較深 Transformer 通常有較好的 compositional generalization,但額外 depth 的收益快速遞減。本文的 expression depth 與 network depth 不同,但此結果提醒「depth capacity」與「depth cost」都需要實證處理。
Evaluating Morphological Compositional Generalization in Large Language Models(NAACL 2025) 顯示 LLM 在 novel roots 與更高 morphological complexity 下 compositional generalization 明顯下降,支持「增加組合複雜度可能降低 effective fidelity」。
Compositional Generalization with Grounded Language Models(ACL Findings 2024) 顯示 grounded language models 對 unseen sequence lengths 與 seen primitives 的 novel combinations 仍有困難,支持對 depth extrapolation 單獨建模。
Exploring Compositional Generalization of Large Language Models(NAACL SRW 2024) 研究 compositional instructions,報告由高階 compositional instructions 向低階的泛化與反向泛化並不對稱,說明 curriculum 與 composition order 對 effective language learning 有實際影響。
49. 下一篇
LRC–COL-06:靜態完備區間與動態完備區間
Static and Dynamic Completeness Intervals of Composite Operator Languages
下一篇將把目前:
I O S = [ N min e f f e c t i v e , N max e f f e c t i v e ] \boxed{
I_{\mathcal O}^{S}
=
[
N_{\min}^{effective},
N_{\max}^{effective}
]
} I O S = [ N m i n e f f ec t i v e , N m a x e f f ec t i v e ]
從固定切片擴張成:
I O D ( t ) = [ N min ( t ) , N max ( t ) ] . \boxed{
I_{\mathcal O}^{D}(t)
=
[
N_{\min}(t),
N_{\max}(t)
].
} I O D ( t ) = [ N m i n ( t ) , N m a x ( t )] .
正式研究:
Agent 學習為何可能讓 N min N_{\min} N m i n 收縮;
新 domain 為何又讓 N min N_{\min} N m i n 擴張;
retriever / context 升級如何推高 N max N_{\max} N m a x ;
operator crystallization / retirement 如何改變區間;
是否存在 interval hysteresis;
語言是否會出現 expansion → saturation → compression → re-expansion 的週期;
( N ∗ , d ∗ , g ∗ ) (N^*,d^*,g^*) ( N ∗ , d ∗ , g ∗ ) 如何成為時間函數。
END — LRC–COL-05 v0.1