智能到底算了一次什麼?:最小智能語意執行單位的候選理論
What Does Intelligence Compute Once? A Candidate Theory of the Minimum Intelligent Semantic Execution Unit
系列:《智能的物理計量:從最小語意執行到成果品質與計算時空》
英文系列: Physical Metrology of Intelligence: From Minimal Semantic Execution to Quality and Computational Spacetime
系列編號: EML-IPM
篇次: Paper 02 / 10
文件編號: EML-IPM-02
作者: Neo.K with Aletheia(GPT-5.6 Sol)
機構: EveMissLab/一言諾科技有限公司
版本: v0.1
日期: 2026-09-02
文件性質: 公開純理論論文
工程狀態: 無 MVP;本文建立候選計量本體,不宣稱已發現唯一神經或模型內部「智能原子」
摘要
如果 token 不是智能的最小計算單位,FLOP 也不是,attention head、neuron activation、layer、forward pass 亦不是,那麼:
智能到底「算了一次」什麼?
這是智能物理計量學最基礎、也最危險的問題。若這一步定義錯誤,後續所有「每焦耳智能」「每秒智能」「單次智能產率」都只會變成把錯誤 proxy 精密化。
本文提出 最小智能語意執行單位:
μI=Minimum Intelligent Semantic Execution Unit
但本文刻意不把 μI 定義成某一種硬體事件,也不把它定義成某一個固定神經結構。相反地, μI 被定義為:
對某個已指定任務之求解狀態,造成最小可辨識、具因果效用、且可被後續推理利用的語意狀態轉換。
形式上:
ztμIzt+1
其中 zt 與 zt+1 是 task-relative semantic solution state。
μI 必須至少滿足七個條件:
Cμ=(CT,CS,CC,CN,CK,CR,CP)
其中:
- CT:Task Relevance,與指定任務相關;
- CS:State Change,確實改變求解狀態;
- CC:Causal Contribution,對後續成果具有因果貢獻;
- CN:Non-decomposability at the chosen semantic resolution,在指定語意解析度下不可再拆而不失去該功能;
- CK:Composability,可組合成更高階認知操作;
- CR:Realization Independence,語意單位不綁死單一模型或硬體;
- CP:Physical Realizability,必須能向下對應到實際物理執行軌跡。
因此:
Token=μI
因為 token 是表達/序列單位,不保證對求解狀態產生有效語意轉換。
同樣:
FLOP=μI
因為 FLOP 是算術原語,沒有 task semantics。
以及:
NeuronActivation=μI
因為一個語意轉換可能分散於大量神經元、層、注意力路徑與記憶存取中;反過來,一個單一 activation 也未必具有可獨立辨識的語意功能。
本文進一步提出:
μI=Thought
因為「想法」通常太大、太語言化、太依賴觀察者切分,無法作為穩定計量原子。
因此 μI 不是 literal atom,而是 最小可用語意解析單位(minimum useful semantic resolution)。它的最小性是:
resolution-relative
而不是宇宙中存在一個唯一、絕對的「智能量子」。
本文提出四個主要候選族:
Mμ=(MB,MR,MC,MI)
其中:
- MB:Belief Update Unit,信念更新單位;
- MR:Relation Construction Unit,關係建立/改寫單位;
- MC:Constraint Resolution Unit,約束消解單位;
- MI:Information-Gain / Uncertainty-Reduction Unit,資訊增益/不確定性下降單位。
本文並主張,真正成熟的 μI 很可能不是以上四者中的單一一種,而是一個共同形式:
μI=Δzsuch thatΔz is task-relevant, causally useful, and semantically non-redundant.
為了避免把「大量內部活動」誤認成「大量有效智能」,本文再定義:
Nμgross
為所有候選語意轉換數,
以及:
Nμeff
為實際對最終成果具有因果效用的有效語意轉換數。
其效率為:
ημ=NμgrossNμeff.
這使我們可以區分:
Semantic Activity=Effective Intelligent Work.
最後,本文建立 μI 的跨層對映:
μI→ρC(μI)→ρP(μI)→ρT(μI)
其中:
- ρC:algorithmic/computational realization;
- ρP:physical execution trace;
- ρT:thermodynamic realization。
因此真正的智能物理學問題不再是:
一個 token 要多少焦耳?
而是:
完成一個有效的最小語意狀態轉換, 在某個模型與硬體上需要多少實際物理計算?
本文終端命題為:
智能的最小計量單位不應由輸出格式決定, 也不應由硬體原語決定; 它應由「對求解狀態造成的最小有效語意改變」決定, 再向下追蹤其物理實現。
關鍵詞: MISEU、Minimum Intelligent Semantic Execution Unit、Semantic State Transition、Belief Update、Constraint Resolution、Information Gain、Physical Metrology of Intelligence
1. 為什麼 token 不是答案
Token 是:
representation / serialization unit.
它適合:
- 計價;
- context budgeting;
- decoding;
- throughput。
但它並不保證代表:
one unit of intelligence.
2. 相同 token 可以沒有相同語意工作
例如:
好的好的好的好的。
和:
因此 A⇒B 與 B⇒C 可推出 A⇒C。
token 數可能相近。
但:
SemanticWork1=SemanticWork2.
3. 同一語意也可以使用不同 token 數表達
所以:
SemanticUnit∝TokenCount.
4. FLOP 也不是答案
FLOP 是 floating-point operation。
它描述:
a+b,a×b
這類算術操作。
5. 但一個 FLOP 沒有 task semantics
FLOP=BeliefUpdate.
FLOP=RelationFormation.
6. 同樣 FLOPs 可以實現不同智能功能
同一矩陣乘法形式:
Y=XW
可以在:
- vision;
- language;
- control;
- protein modeling;
中執行完全不同語意角色。
7. 所以 FLOP 是 implementation primitive
不是 semantic primitive。
8. Neuron activation 也不夠
如果我們說:
一個 neuron fire 就是一個智能單位。
問題立刻出現。
9. 分散表示
現代神經網路中的語意通常不是:
Concept↔OneNeuron.
更常是:
Concept↔DistributedPattern.
10. 一個語意轉換可以跨越多層
例如:
Relation(A,B)
的建立可能涉及:
- attention;
- MLP;
- residual stream;
- memory retrieval;
- routing。
11. 因此:
NeuronActivation=SemanticExecutionUnit.
12. Layer 也不是單位
一層 Transformer block 可以同時完成大量不同功能。
所以:
Layer=OneIntelligentOperation.
13. Forward pass 也太粗
完整 forward pass 可能同時包含:
μ1,μ2,…,μk.
它更像一次大規模物理實現,而不是語意最小單位。
14. 「想法」又太大
人可以說:
我剛剛想到一個方法。
但這個「一個想法」內部可能包含:
- 關係辨識;
- 約束消除;
- 類比;
- 目標重構;
- 結論生成。
15. 所以:
Thought=MinimumSemanticExecution.
16. 我們真正需要的是中間層
即:
PhysicalPrimitive→SemanticPrimitive→TaskAchievement.
17. 定義 task-relative solution state
令:
zt
表示時刻 t 的求解語意狀態。
18. zt 可以包含
zt=(Bt,Rt,Ct,Gt,Ut)
其中:
- Bt:beliefs;
- Rt:relations;
- Ct:constraints;
- Gt:goals/subgoals;
- Ut:uncertainty。
19. 這不是要求模型內部真的有這五個欄位
它是 observer-level semantic state abstraction。
20. 最小智能語意執行單位
本文定義:
μI:zt→zt+1
其中:
zt+1=zt.
21. 但「有變」仍不夠
如果只是:
把句子改寫得更長。
可能:
zt+1
在任務求解上沒有實質進展。
22. 所以需要 Task Relevance
第一條:
CT:Δz must be task-relevant.
23. 第二條:State Change
CS:d(zt,zt+1)>ϵ.
在指定解析度下必須存在可辨識改變。
24. 第三條:Causal Contribution
如果移除該轉換:
do(μI=0)
最終成果會受到可檢出的負面影響。
25. 形式:
Q(Y∣μI)>Q(Y∣do(μI=0))
至少在期望意義下成立。
26. 這使 μI 不只是相關事件
而是有效工作。
27. 第四條:Non-decomposability
在指定 semantic resolution δ 下,
若:
μI=μa⊕μb
且 μa,μb 各自仍能單獨保有同樣可辨識語意功能,
那原本 μI 就不是最小。
28. 但「最小」不是絕對
這是本文最重要的保守條件之一:
Minimality=Minimality(δ,Task,Observer).
29. 為什麼不能要求絕對最小
因為不同觀察尺度下:
- 一個 proof step 可以拆成 algebra steps;
- algebra step 又可拆成 symbolic rewrites;
- symbolic rewrite 又可拆成 machine instructions。
永遠可以往下拆。
30. 所以 μI 是 minimum useful semantic resolution
不是 metaphysical atom。
31. 第五條:Composability
更高階推理必須能表示成:
Π=μ1⊕μ2⊕⋯⊕μn.
32. 否則它不能成為計量學單位
如果每個 μI 都不能組合,就無法建立總工作量。
33. 第六條:Realization Independence
同樣的語意轉換可以在不同架構上實現。
例如:
A>B,B>C⇒A>C.
34. Transformer、symbolic engine、人腦都可能完成
所以:
μI=specific hardware event.
35. 第七條:Physical Realizability
但 realization independence 不代表脫離物理。
每個真正執行的 μI 必須存在:
ρP(μI)
即某個物理 trace。
36. 所以語意不等於非物理
而是:
Semantic Type=Physical Token
但:
Semantic Event⇒Physical Realization.
37. 七條條件總結
Cμ=(CT,CS,CC,CN,CK,CR,CP).
38. Candidate Family A:Belief Update
第一個候選:
MB:Bt→Bt+1.
39. 例子
原本:
P(H)=0.4.
得到新推論後:
P(H)=0.8.
40. 這明顯是一個語意狀態改變
而且與 Bayesian cognition、predictive processing、decision theory 都有天然連結。
41. 優點
Belief update:
- 可形式化;
- 可比較前後;
- 可定義 information gain。
42. 缺點
不是所有智能活動都可自然寫成 belief probability update。
例如:
- 產生新概念;
- 建構資料結構;
- 創造新 relation。
43. Candidate Family B:Relation Construction
第二類:
MR:Rt→Rt+1.
44. 例
原本知道:
A,B
但不知道它們之間關係。
45. 執行後得到:
R(A,B)=causal.
或:
R(A,B)=equivalent under condition C.
46. 這特別適合:
- mathematics;
- analogy;
- causal reasoning;
- conceptual synthesis。
47. 缺點
若 relation space 定義不佳,幾乎所有活動都可以被說成「建立關係」。
所以需要 task-relative restriction。
48. Candidate Family C:Constraint Resolution
第三類:
MC:Ct→Ct+1.
49. 一個問題常可以視為 constraint set
例如:
C={c1,c2,…,cn}.
50. 一次有效執行可能:
- 消除一個不可能分支;
- 固定一個變數;
- 發現一個衝突;
- 合併兩個約束。
51. 例
程式 debugging:
Failure⇒¬H1.
這就消除一個 hypothesis branch。
52. 優點
Constraint resolution 特別適合:
- code;
- proof;
- planning;
- search。
53. 缺點
創意生成中的「增加新可能」不總是 reduction。
有時:
∣Ct+1∣>∣Ct∣.
54. Candidate Family D:Information Gain
第四類:
MI:Ut→Ut+1,Ut+1<Ut.
55. 例如 entropy reduction
IG=H(Zt)−H(Zt+1).
56. 優點
這很容易與:
- information theory;
- neuroscience;
- thermodynamics;
往下接。
57. 缺點
智能不只是在減少 uncertainty。
創造問題、生成候選、增加 hypothesis space 有時會暫時:
H(Zt+1)>H(Zt).
但卻是更高品質推理的重要一步。
58. 所以 Information Gain 不能單獨定義智能
59. 統一形式
本文暫時把四個候選統一為:
μI=Δztask
其中:
Δztask=0
且具有後續因果效用。
60. Semantic State 可以展開為
z=(B,R,C,G,U,Π)
新增:
Π=available procedures / strategies.
61. 因此一個 μI 可以改變任一分量
例如:
ΔB=0
或者:
ΔR=0
或者:
ΔC=0.
62. 甚至允許同時改變多個分量
只要在目前解析度下不能被可靠地拆成更小獨立功能。
63. 語意單位不是固定大小
這一點非常重要。
不同任務:
μImath=μIvision=μIplanning.
64. 但可以共享共同公理
即:
Cμ
相同。
65. 所以我們追求的是 typed semantic units
而不是一個所有領域同字面內容的 operation。
66. Type System
可以寫:
μI:Type[d]
其中 d 是 domain。
67. 例如:
μI:Type[MathRelation]
μI:Type[CodeConstraint]
μI:Type[VisualComposition].
68. Typed 不代表不可比較
因為跨類型仍可比較:
PhysicalCost(μI).
69. 以及對最終成果的 causal contribution
Contribution(μI→Q).
70. Gross Semantic Activity
模型內部可能發生大量:
μ1,μ2,…,μn
候選轉換。
71. 但不是全部都有效
可能存在:
- 重複推理;
- dead-end;
- 自我矛盾;
- 無關聯想;
- 被後續完全撤回的中間工作。
72. 所以定義:
Nμgross
所有識別到的 candidate semantic executions。
73. Effective Semantic Work
定義:
Nμeff
對最終成果具正向因果效用的單位。
74. 語意效率
ημ=NμgrossNμeff.
75. 這可以測「繞路」
如果兩個模型得到相同答案:
QA=QB,
但:
Nμ,Agross≫Nμ,Bgross,
而 effective work 接近,
則 A 的 semantic path 更浪費。
76. 但這不等於物理浪費
因為不同 μI 的物理實現成本可能不同。
所以:
SemanticEfficiency=EnergyEfficiency.
77. 需要跨層對映
本文建立:
μI→ρC(μI)
78. ρC
Algorithmic / Computational Realization。
可能包含:
- attention operations;
- retrieval;
- routing;
- symbolic rewrite;
- recurrent state update。
79. 再往下:
ρC(μI)→ρP(μI)
80. ρP
Physical Execution Trace。
例如:
ρP=(Ops,Bytes,Interconnect,DeviceTime).
81. 再往下:
ρP(μI)→ρT(μI).
82. ρT
Thermodynamic Realization:
ρT=(Energy,Heat,EntropyProduction).
83. 因此完整鏈條
μI→ρC→ρP→ρT.
84. 這不是一對一映射
同樣 μI 在不同架構上:
ρPA(μI)=ρPB(μI).
85. 這恰恰是我們要比較的
因為它讓我們問:
相同語意工作,哪個模型/硬體需要更少物理世界?
86. Semantic Equivalence Class
如果兩個不同物理過程都完成相同 task-relative semantic transition:
μIA∼μIB,
則它們屬於同一語意等價類。
87. 定義:
[μI]={ρ∣ρ realizes the same semantic transition}.
88. 這是跨模型計量的核心
否則我們永遠只能比較:
GPU A 比 GPU B 快多少。
而不能比較:
智能工作本身的物理效率。
89. 如何判斷同一語意轉換?
需要至少三種一致性:
Eμ=(Epre,Epost,Efunction).
90. Epre
前置求解狀態語意等價。
91. Epost
後置求解狀態語意等價。
92. Efunction
對後續任務行為的功能效用等價。
93. 只看輸出字面相同不夠
兩個模型可能都說:
B。
但一個是推理得到,
一個是猜中。
94. 所以:
SameAnswer=SameSemanticExecution.
95. 需要 counterfactual contribution test
移除該中間狀態後:
Q↓?
96. 若沒有任何影響
那它更可能是 epiphenomenal trace。
97. 這裡遇到可觀測性難題
黑箱模型內部的 zt 不一定可直接讀取。
98. 因此 μI 需要兩種版本
μIobs
Observer-Reconstructed Semantic Unit。
99. 以及:
μIint
True Internal Semantic Unit。
100. 現階段我們通常只能近似前者
所以:
μIobs≈μIint
不是已證明等號。
101. 這必須寫在理論裡
否則會犯認識論錯誤:
我們可以描述一個語意步驟,所以模型內部一定就是這樣運算。
不成立。
102. Semantic Instrumentation
未來如果模型提供:
- latent probes;
- causal interventions;
- activation patching;
- mechanistic traces;
則可以逐步提高:
Confidence(μIobs≈μIint).
103. 但 IPM 不依賴完全可解釋性才開始
因為即使無法看透所有 latent computation,
仍可以先做:
- black-box intervention;
- task decomposition;
- ablation;
- paired behavior test。
104. Measurement Ladder
本文提出 μI 的四級量測:
Level 0 — Behavioral Proxy
只從輸入/輸出推斷 semantic steps。
105. Level 1 — Structured Trace
使用可見 reasoning trace、tool trace、symbolic proof steps。
106. Level 2 — Causal Internal Probe
透過 internal intervention 驗證某 latent transition 是否有因果作用。
107. Level 3 — Physical-Semantic Alignment
直接把 semantic event 與 physical trace 對齊。
108. Level 3 才接近完整 IPM
但不應假裝現在所有模型都能做到。
109. μI 與 information bit 的關係
一個 μI 可能帶來:
IG(μI)
資訊增益。
110. 但:
μI=1 bit.
111. 一次語意轉換可能產生多 bits 的 uncertainty reduction
也可能暫時增加 entropy。
112. 所以 bit 是量測某個屬性
不是 μI 本身。
113. μI 與 cognitive operation
認知科學常用 elementary mental operation。
我們可以借其:
- operation;
- cost;
- utility;
三元結構。
114. 但 IPM 多加一層
operation→physical trace→energy.
115. 最小性問題的正式處理
令解析度:
δ.
116. 在 δ 下,
如果任何拆分:
μI→(μa,μb)
都使至少一個子單位失去獨立 task-semantic function,
則:
μI
在 δ 下是最小。
117. 表示:
Minimalδ(μI)=1.
118. 更細解析度:
δ′<δ
可能重新拆開。
119. 所以:
AbsoluteSemanticAtom
不是本文主張。
120. 本文主張的是
operationally minimal semantic unit.
121. 語意單位也可能有粒度層級
μ(0)→μ(1)→μ(2).
122. 例如數學:
Level 0:
x=2.
123. Level 1:
從:
x+1=3
推出:
x=2.
124. Level 2:
完成一個 lemma。
125. Level 3:
完成整個 theorem strategy。
126. 只有最低仍保有 task-semantic function 的層才適合作為當前 μI。
127. Semantic Work Vector
不是所有 μI 功能都一樣。
可以建立:
Nμ=(NB,NR,NC,NI,NG)
其中:
- NB:belief update;
- NR:relation construction;
- NC:constraint resolution;
- NI:information restructuring;
- NG:goal/strategy transformation。
128. 這比只報總數更好
因為兩個系統可能:
Nμ,A=Nμ,B
但工作結構完全不同。
129. 某些模型可能是「關係型」
NR↑.
130. 某些是「搜尋型」
NC↑.
131. 某些是「策略重構型」
NG↑.
132. 這可能形成 Intelligence Work Profile
WI=Nμ.
133. 這讓智能不再只有「多少」
還有:
what kind of semantic work.
134. 與 Paper 01 的連接
Paper 01 定義:
E=(Q,U,G,I,L,R,S,T,E,VCST).
135. 現在插入新的中間層:
E′=(Q,Nμ,U,G,I,L,R,S,T,E,VCST).
136. 這第一次把「做了多少語意工作」放進事件向量。
137. 但仍不能直接拿 Nμ 當智能
因為:
Q
才是最終成果。
138. 如果做了很多 μI 但答案很差
那只是:
large semantic work with low yield.
139. 所以需要 Semantic Yield
Yμ=NμeffQ.
140. 這表示
每一單位有效語意工作產生多少成果品質。
141. 再往物理接
Paper 04–05 之後可定義:
Yμ/J=EmarginalNμeff.
142. 以及:
YQ/J=EmarginalQ.
143. 完整鏈條
Ephysical→Nμeff→Q.
144. 兩個效率可以分開
ηP→μ=CphysNμeff
145. 以及:
ημ→Q=NμeffQ.
146. 概念上:
Q=Cphys⋅ηP→μ⋅ημ→Q.
147. 這很重要
因為一個系統可以:
148. 另一個可能相反
所以總能效相同,不代表智能機制相同。
149. μI 與創造力
創造力常不是只減少 search space。
150. 一次創造性 μI 可能:
introduce a new relation / variable / representation.
151. 因此:
∣Ωt+1∣>∣Ωt∣
不代表退步。
152. 真正判準是
新增空間是否提高後續:
ExpectedQ.
153. 所以 creative semantic execution 也能納入 μI。
154. μI 與錯誤
錯誤推理是否算一個 μI?
155. 如果它改變了語意狀態:
Δz=0,
它可以算:
μIgross.
156. 但若最終被證明無助甚至有害:
μIeff=0
或負貢獻。
157. 因此可以再定義 signed contribution
wiQ=ΔQi.
158. wiQ>0
有效正向智能工作。
159. wiQ=0
語意活動但無結果貢獻。
160. wiQ<0
誤導性智能工作。
161. 所以總有效語意功
可以概念性寫:
Wμ=i∑wiQ.
162. 但本文暫不把 Wμ 當物理 work
避免和 Joule 混淆。
163. Semantic Work 只是功能性計量
Physical Work 才是物理量。
164. 二者必須保持型別分離
Wμsemantic=Wphysical.
165. 這是一條核心 type safety rule
不允許把「語意功」直接當焦耳。
166. 十四個 Canonical Invariants
Invariant 1
Token=μI.
Invariant 2
FLOP=μI.
Invariant 3
NeuronActivation=μI.
Invariant 4
Layer=μI.
Invariant 5
Thought=μI.
Invariant 6
Minimality=Minimality(δ,Task,Observer).
Invariant 7
SemanticUnit=SpecificPhysicalImplementation.
Invariant 8
SemanticEvent⇒PhysicalRealization.
Invariant 9
SemanticActivity=EffectiveIntelligentWork.
Invariant 10
SameAnswer=SameSemanticExecution.
Invariant 11
InformationGain=IntelligenceItself.
Invariant 12
SemanticEfficiency=EnergyEfficiency.
Invariant 13
μIobs=μIint
除非有額外證據支持近似。
Invariant 14
SemanticWork=PhysicalWork.
167. 結論:智能的最小單位應由「有效語意改變」決定
如果我們用 token 當智能單位,
會把語言表示誤認成認知工作。
如果用 FLOP,
會把算術原語誤認成語意工作。
如果用 neuron activation,
又會把特定實現方式誤認成跨架構智能本體。
所以:
智能的最小計量單位必須位於語意與物理之間。
它需要足夠抽象,才能跨:
- Transformer;
- RNN;
- symbolic system;
- neuromorphic hardware;
- biological brain。
但又不能抽象到失去物理落點。
因此本文提出:
μI:zt→zt+1
其中這個狀態轉換必須:
- 對任務有關;
- 真正改變求解狀態;
- 對最終成果有因果效用;
- 在指定語意解析度下不可再有意義地拆分;
- 能與其他單位組合;
- 不綁死單一硬體;
- 但可以向下追到真實物理 trace。
所以 μI 不是:
一個字。
不是:
一次乘法。
不是:
一個 neuron。
也不是:
一個完整想法。
它更接近:
一次最小、有效、可利用的求解語意狀態改變。
而這使 IPM 第一次具有完整中間橋:
Physical Computation→μI→Task Quality.
但現在還有一個極大的空白。
我們提出了語意中間層,
卻仍然不知道生物智能世界過去是怎麼處理這個問題的。
人腦研究已經使用:
- cognitive operation;
- spike;
- synaptic event;
- bits/spike;
- ATP;
- behavioral throughput;
建立跨尺度 proxy。
所以下一篇不再繼續抽象發明。
而要回頭看:
人類到底是怎麼把「認知」一路量到「神經事件」的?
這就是 Paper 03。
系列路徑
- Paper 01|一輪到底是一輪什麼?:使用者回合、隱藏 LOOP 與單次智能的重新定義
- Paper 02|智能到底算了一次什麼?:最小智能語意執行單位的候選理論
- Paper 03|從認知到神經元:人腦如何跨層測量智能計算
- Paper 04|從神經元到焦耳:智能計算的能量、熱力學與物理下界
- Paper 05|計算不是只有 FLOPs:記憶體、互連、硬體占用與計算時空體積
- Paper 06|成果品質到底怎麼量?:從形式化正確性到結構化智能品質
- Paper 07|不要叫人類替自己的感覺打分數:IBQF 二元測量與低負擔品質評估
- Paper 08|自然語言、圖像與創意如何被量?:高歧義成果的結構化品質空間
- Paper 09|拿掉 LOOP 還剩多少智能?:單次智能、鷹架依賴與隱藏計算成本
- Paper 10|一個答案值多少物理世界?:智能產率的統一計量框架