智能計算轉化與分配定律
從物理算力、動態推理到可累積智能成果的統一框架
版本: v0.1日期: 2026-07-23文件性質: 公開理論草案/可檢驗框架英文暫名: The Law of Intelligent Computation Conversion and Allocation (ICCA Law)
摘要
當代人工智慧的能力已無法只用模型參數量、輸入輸出 Token 數、單次延遲或硬體峰值算力描述。同樣數量的可見輸出,可能對應完全不同的隱藏推理深度、候選分支數量、工具執行次數、驗證成本、記憶重建負擔與跨輪狀態累積程度。另一方面,服務系統仍受能源、硬體、併發需求、排程策略與經濟成本約束,因此單一使用者實際取得的智能能力,既不是模型名義能力的直接映射,也不是物理算力的簡單平均分配。
本文提出「智能計算轉化與分配定律」,將人工智慧輸出理解為一個多階段轉化過程:物理計算資源首先經由系統排程分配給特定請求,再經由模型架構、訓練品質、推理策略、工具編排、驗證機制與狀態連續性,被轉化為可用的智能成果;此過程同時受到資源競爭、協調成本、驗證成本、狀態遺失與任務不適配的耗散。
本文保留一條極簡主公式:
I = η C D , I=\frac{\eta C}{D}, I = D η C , 其中 (I) 為有效智能成果,(C) 為實際分配的計算,η \eta η 為計算轉化為智能成果的總效率,(D) 為競爭與耗散。這條式子不是完整模型,而是總綱。其背後可展開為動態分配方程、推理時計算方程、驗證方程、狀態連續方程與累積研究能力方程。
本文進一步提出:可見 Token 與實際計算已發生結構性解耦;「降智」與模型世代能力上升可以同時成立;單次請求能力與長程累積能力必須分開測量;高階 AI 的主要躍遷,不只來自更多算力,也來自更高的計算轉化效率與更低的狀態耗散。本文最後給出可測量指標、可否證命題與實驗設計,將此框架從修辭性描述推進為可逐步驗證的計算科學研究綱領。
關鍵詞: 智能算力、推理時計算、動態算力分配、Token 解耦、計算密度、狀態連續性、驗證成本、累積智能、AI 基礎設施
一、問題:為什麼「模型能力」不再是單一量?
早期對人工智慧能力的描述,往往依賴幾個容易觀察的尺度:
模型參數量;
訓練資料量;
訓練所需 FLOPs;
上下文長度;
輸入與輸出 Token 數;
單次推理延遲;
基準測試分數。
這些尺度仍然有用,但已不足以描述現代 AI 系統。
原因在於,使用者看到的「一次回答」可能只是複雜計算程序的外層介面。系統內部可能包含:
多階段推理;
隱藏推理 Token;
多候選生成;
搜尋與回溯;
程式執行;
外部工具呼叫;
記憶檢索;
長上下文壓縮;
交叉驗證;
錯誤修正;
多模型路由;
專家子網路選擇;
結果重排與安全檢查。
因此,兩個表面上同樣輸出一千個 Token 的請求,背後的物理計算量、有效推理量與可累積成果可能相差數十倍、數百倍,甚至更多。
這導致三個基本問題:
問題一:Token 還能否代表計算量?
不能。Token 是符號輸入輸出的計量單位,不是穩定的物理計算單位。
問題二:模型名義能力是否等於使用者實得能力?
不等於。使用者實得能力還受到服務負載、帳戶優先級、延遲要求、成本限制、任務判定與動態路由影響。
問題三:更多算力是否必然產生更多智能?
不必然。若模型架構、推理策略、工具協調或驗證機制效率低落,新增算力可能被浪費在重複、錯誤或無法累積的計算上。
因此,需要一個同時描述「供給、分配、轉化、耗散與累積」的統一框架。
二、核心命題
本文的核心命題是:
人工智慧的有效能力,不等於模型本身的名義能力,也不等於物理算力本身;它是物理計算資源經由動態分配與多階段轉化後,扣除競爭、協調、驗證與狀態耗散所形成的可用智能成果。
這個命題可以壓縮為:
I = η C D \boxed{
I=\frac{\eta C}{D}
} I = D η C 其中:
(I):有效智能成果;
(C):實際分配到特定任務的計算資源;
η \eta η :計算轉化為有效智能成果的總效率;
(D):競爭、協調、驗證與狀態耗散的合成項。
這條式子是零階主式。它的作用不是直接預測每一次請求,而是確立三個不可省略的基本量:
沒有計算供給,就沒有智能輸出;
有計算供給,不代表能有效轉化;
有效轉化仍會受到多種耗散。
三、零階、第一階與第二階模型
3.1 零階主式
I = η C D I=\frac{\eta C}{D} I = D η C 零階模型適合表達宏觀方向:
(C) 上升,其他條件不變時,(I) 傾向上升;
η \eta η 上升,單位算力產生的有效成果增加;
(D) 上升,使用者實得能力下降。
但零階模型不說明各項如何形成。
3.2 第一階展開
對任務 (x)、使用者 (u)、時間 (t),定義:
I i n s t ( x , u , t ) = C a l l o c ( x , u , t ) η e f f ( x , t ) α t a s k ( x , t ) D e f f ( x , u , t ) \boxed{
I_{\mathrm{inst}}(x,u,t)
=
\frac{
C_{\mathrm{alloc}}(x,u,t)\,
\eta_{\mathrm{eff}}(x,t)\,
\alpha_{\mathrm{task}}(x,t)
}{
D_{\mathrm{eff}}(x,u,t)
}
} I inst ( x , u , t ) = D eff ( x , u , t ) C alloc ( x , u , t ) η eff ( x , t ) α task ( x , t ) 其中:
I i n s t I_{\mathrm{inst}} I inst :單次請求的瞬時有效智能;
C a l l o c C_{\mathrm{alloc}} C alloc :該請求實際取得的計算;
η e f f \eta_{\mathrm{eff}} η eff :計算轉化效率;
α t a s k \alpha_{\mathrm{task}} α task :模型與任務的適配係數;
D e f f D_{\mathrm{eff}} D eff :總耗散。
這裡加入 α t a s k \alpha_{\mathrm{task}} α task ,是因為同一模型在不同任務上的能力差異可能很大。模型對某種符號推理、程式、視覺、長程規劃或專業領域的適配程度,不能全部塞入一般效率項而不加區分。
3.3 第二階展開
計算分配項
C a l l o c = C b a s e + C r e a s o n + C b r a n c h + C t o o l + C v e r i f y + C m e m o r y + C o r c h e s t r a t e C_{\mathrm{alloc}}
=
C_{\mathrm{base}}
+
C_{\mathrm{reason}}
+
C_{\mathrm{branch}}
+
C_{\mathrm{tool}}
+
C_{\mathrm{verify}}
+
C_{\mathrm{memory}}
+
C_{\mathrm{orchestrate}} C alloc = C base + C reason + C branch + C tool + C verify + C memory + C orchestrate 各項分別表示:
C b a s e C_{\mathrm{base}} C base :基本模型前向計算;
C r e a s o n C_{\mathrm{reason}} C reason :隱藏推理與延長思考;
C b r a n c h C_{\mathrm{branch}} C branch :多候選、搜尋、回溯與分支;
C t o o l C_{\mathrm{tool}} C tool :程式、資料庫、搜尋、模擬等工具執行;
C v e r i f y C_{\mathrm{verify}} C verify :檢查、反證、證書與一致性驗證;
C m e m o r y C_{\mathrm{memory}} C memory :記憶檢索、上下文重建與壓縮;
C o r c h e s t r a t e C_{\mathrm{orchestrate}} C orchestrate :跨模型、跨代理與跨工具編排。
轉化效率項
η e f f = Φ η ( A , M , R , O , V , S ) \eta_{\mathrm{eff}}
=
\Phi_{\eta}
\left(
A,M,R,O,V,S
\right) η eff = Φ η ( A , M , R , O , V , S ) 其中:
(A):架構效率;
(M):訓練後模型品質;
(R):推理策略;
(O):工具與流程編排;
(V):驗證機制;
(S):狀態保存與重用能力。
η e f f \eta_{\mathrm{eff}} η eff 不宜簡單視為幾個完全獨立因子的乘積,因為它們之間存在耦合。例如,更好的狀態保存會降低重複推理;更好的驗證器會改變分支搜尋策略;更好的工具編排會讓較小模型完成原本需要更大模型的工作。
耗散項
為避免分母量綱混亂,可以將各耗散項正規化為無量綱比例:
D e f f = ( 1 + δ c o n t e n t i o n ) ( 1 + δ c o o r d i n a t i o n ) ( 1 + δ v e r i f i c a t i o n ) ( 1 + δ s t a t e ) ( 1 + δ l a t e n c y ) D_{\mathrm{eff}}
=
\left(1+\delta_{\mathrm{contention}}\right)
\left(1+\delta_{\mathrm{coordination}}\right)
\left(1+\delta_{\mathrm{verification}}\right)
\left(1+\delta_{\mathrm{state}}\right)
\left(1+\delta_{\mathrm{latency}}\right) D eff = ( 1 + δ contention ) ( 1 + δ coordination ) ( 1 + δ verification ) ( 1 + δ state ) ( 1 + δ latency ) 其中:
δ c o n t e n t i o n \delta_{\mathrm{contention}} δ contention :併發使用者與資源競爭;
δ c o o r d i n a t i o n \delta_{\mathrm{coordination}} δ coordination :多代理、多工具協調成本;
δ v e r i f i c a t i o n \delta_{\mathrm{verification}} δ verification :證明與高可靠度驗證成本;
δ s t a t e \delta_{\mathrm{state}} δ state :遺忘、上下文斷裂與不一致;
δ l a t e n c y \delta_{\mathrm{latency}} δ latency :延遲限制導致的提早截斷與低預算推理。
四、物理算力與請求算力
4.1 物理供給不等於單次請求供給
設整個服務系統在時間 (t) 的物理計算容量為:
C p h y s i c a l ( t ) C_{\mathrm{physical}}(t) C physical ( t ) 對某個使用者與任務,實際分配量為:
C a l l o c ( x , u , t ) = a ( x , u , t ) C p h y s i c a l ( t ) C_{\mathrm{alloc}}(x,u,t)
=
a(x,u,t)\,C_{\mathrm{physical}}(t) C alloc ( x , u , t ) = a ( x , u , t ) C physical ( t ) 其中 (a(x,u,t)) 是動態分配比例。
此比例不只取決於使用者數量,也可能取決於:
a = π ( q x , p u , ℓ t , b u , r x , τ x ) a
=
\pi
\left(
q_x,\,
p_u,\,
\ell_t,\,
b_u,\,
r_x,\,
\tau_x
\right) a = π ( q x , p u , ℓ t , b u , r x , τ x ) 其中:
q x q_x q x :系統估計的任務難度;
p u p_u p u :服務優先級;
ℓ t \ell_t ℓ t :當下負載;
b u b_u b u :預算或配額;
r x r_x r x :任務風險與可靠度要求;
τ x \tau_x τ x :延遲容忍度。
這表示計算分配本身是一個政策函數,而不是自然平均。
4.2 算力稀釋仍然存在
當總供給近似固定、併發需求上升時,單一請求可取得的平均資源傾向下降:
C ˉ a l l o c ∝ C p h y s i c a l N e f f e c t i v e \bar C_{\mathrm{alloc}}
\propto
\frac{C_{\mathrm{physical}}}{N_{\mathrm{effective}}} C ˉ alloc ∝ N effective C physical 但 N e f f e c t i v e N_{\mathrm{effective}} N effective 不等於登入人數,而是經任務成本加權後的有效併發量:
N e f f e c t i v e = ∑ j = 1 N w j N_{\mathrm{effective}}
=
\sum_{j=1}^{N}
w_j N effective = j = 1 ∑ N w j 一個需要長程推理、工具執行與多重驗證的請求,其權重 w j w_j w j 可能遠高於普通問答。
4.3 動態分配下的「降智」
假設新模型的最大能力為 I n e w max I_{\mathrm{new}}^{\max} I new m a x ,動態降配比例為 (d),則:
I n e w s e r v e d = d I n e w max , 0 < d ≤ 1. I_{\mathrm{new}}^{\mathrm{served}}
=
d\,I_{\mathrm{new}}^{\max},
\qquad 0<d\le 1. I new served = d I new m a x , 0 < d ≤ 1. 即使 (d<1),仍可能有:
d I n e w max > I o l d max . d\,I_{\mathrm{new}}^{\max}
>
I_{\mathrm{old}}^{\max}. d I new m a x > I old m a x . 因此以下兩件事可以同時成立:
使用者感覺某些時段或某些請求被降配;
降配後的新世代模型仍超過上一代模型。
這不是矛盾,而是「世代效率上升」與「服務分配波動」同時作用的結果。
五、可見 Token—實際計算解耦
5.1 Token 不是 FLOPs
令:
T i n T_{\mathrm{in}} T in :輸入 Token;
T v i s i b l e T_{\mathrm{visible}} T visible :可見輸出 Token;
T h i d d e n T_{\mathrm{hidden}} T hidden :隱藏推理 Token;
(B):候選分支數;
(V):驗證輪數;
(E):工具執行量。
則單次請求計算可概念化為:
C a l l o c = f ( T i n , T v i s i b l e , T h i d d e n , B , V , E , … ) . C_{\mathrm{alloc}}
=
f
\left(
T_{\mathrm{in}},
T_{\mathrm{visible}},
T_{\mathrm{hidden}},
B,V,E,\ldots
\right). C alloc = f ( T in , T visible , T hidden , B , V , E , … ) . 在現代系統中:
T v i s i b l e ∝̸ C a l l o c . T_{\mathrm{visible}}
\not\propto
C_{\mathrm{alloc}}. T visible ∝ C alloc . 兩個可見輸出長度相同的回答,背後可能有完全不同的計算歷程。
5.2 計算密度
定義每個可見 Token 所承載的物理計算密度:
ρ C = C a l l o c T v i s i b l e . \rho_C
=
\frac{C_{\mathrm{alloc}}}{T_{\mathrm{visible}}}. ρ C = T visible C alloc . 定義每個可見 Token 所承載的有效智能密度:
ρ I = I i n s t T v i s i b l e . \rho_I
=
\frac{I_{\mathrm{inst}}}{T_{\mathrm{visible}}}. ρ I = T visible I inst . 模型世代提升可能同時提高:
ρ C ↑ \rho_C \uparrow ρ C ↑ 以及:
I i n s t C a l l o c = η e f f α t a s k / D e f f ↑ . \frac{I_{\mathrm{inst}}}{C_{\mathrm{alloc}}}
=
\eta_{\mathrm{eff}}\alpha_{\mathrm{task}}/D_{\mathrm{eff}}
\uparrow. C alloc I inst = η eff α task / D eff ↑ . 因此:
ρ I = ρ C ⋅ I i n s t C a l l o c \rho_I
=
\rho_C
\cdot
\frac{I_{\mathrm{inst}}}{C_{\mathrm{alloc}}} ρ I = ρ C ⋅ C alloc I inst 可能出現乘積式增長。
這是為什麼表面輸出長度沒有巨大變化,但實際完成工作的範圍、精度與工程深度可能出現顯著躍升。
六、瞬時智能與累積智能
6.1 單次能力不是長程能力
一次回答表現很好,不代表系統能完成長程研究或工程。長程任務需要把上一輪成果保留下來,並在下一輪中正確重用。
定義狀態:
[
S_k
]
代表第 (k) 輪之後保留下來的:
理論結構;
程式;
數據;
證書;
失敗紀錄;
參數設定;
未解問題;
依賴關係。
狀態演化可寫成:
S k + 1 = F ( S k , E k , V k , F k , R k ) , S_{k+1}
=
\mathcal F
\left(
S_k,
E_k,
V_k,
F_k,
R_k
\right), S k + 1 = F ( S k , E k , V k , F k , R k ) , 其中:
E k E_k E k :本輪探索;
V k V_k V k :本輪驗證;
F k F_k F k :失敗與反例;
R k R_k R k :回溯修正。
6.2 狀態連續係數
定義:
κ s t a t e ∈ [ 0 , 1 ] \kappa_{\mathrm{state}}
\in [0,1] κ state ∈ [ 0 , 1 ] 表示前一輪有效成果有多少能被下一輪正確保留並利用。
κ s t a t e ≈ 0 \kappa_{\mathrm{state}}\approx 0 κ state ≈ 0 :每輪幾乎重新開始;
κ s t a t e ≈ 1 \kappa_{\mathrm{state}}\approx 1 κ state ≈ 1 :大部分成果可穩定累積。
長程累積智能可寫為:
I c u m ( n ) = ∑ k = 1 n ( ∏ j = k + 1 n κ s t a t e , j ) I i n s t , k + G r e u s e − L i n c o n s i s t e n c y . I_{\mathrm{cum}}(n)
=
\sum_{k=1}^{n}
\left(
\prod_{j=k+1}^{n}
\kappa_{\mathrm{state},j}
\right)
I_{\mathrm{inst},k}
+
G_{\mathrm{reuse}}
-
L_{\mathrm{inconsistency}}. I cum ( n ) = k = 1 ∑ n j = k + 1 ∏ n κ state , j I inst , k + G reuse − L inconsistency . 其中:
G r e u s e G_{\mathrm{reuse}} G reuse :工具、程式、證書和資料結構的重用增益;
L i n c o n s i s t e n c y L_{\mathrm{inconsistency}} L inconsistency :跨輪矛盾、版本漂移與錯誤繼承造成的損失。
此式說明:長程能力不是瞬時能力的簡單加總,而是被狀態連續性加權的累積。
6.3 連續性的超線性效應
當狀態可以重用時,前一輪建立的工具可能降低後續多輪成本:
C k + 1 r e q u i r e d < C k r e q u i r e d C_{k+1}^{\mathrm{required}}
<
C_k^{\mathrm{required}} C k + 1 required < C k required 或者在相同成本下提高產出:
[
I_{k+1}
I_k.
]
因此,狀態連續性不只防止遺忘,也可能帶來超線性增益:
I c u m ( n ) > ∑ k = 1 n I i s o l a t e d , k . I_{\mathrm{cum}}(n)
>
\sum_{k=1}^{n} I_{\mathrm{isolated},k}. I cum ( n ) > k = 1 ∑ n I isolated , k . 這是代理系統、長期記憶、版本控制與可重現工程對智能能力的根本價值。
七、驗證:成本、稅與增益
7.1 驗證不是免費的
對高可靠度任務,新增算力往往不直接用於產生新答案,而是用於:
交叉檢查;
反例搜尋;
精確算術;
單元測試;
形式化證明;
證書生成;
獨立實作;
錯誤界估計。
因此驗證會形成成本:
C v e r i f y > 0. C_{\mathrm{verify}}>0. C verify > 0. 若只看輸出速度,驗證似乎降低效率;但若考慮錯誤率,它可能提高有效成果:
I u s a b l e = I r a w ⋅ ( 1 − ε ) , I_{\mathrm{usable}}
=
I_{\mathrm{raw}}
\cdot
(1-\varepsilon), I usable = I raw ⋅ ( 1 − ε ) , 其中 ε \varepsilon ε 為錯誤或不可採信比例。
7.2 驗證稅與驗證增益
定義驗證稅:
τ V = C v e r i f y C a l l o c . \tau_V
=
\frac{C_{\mathrm{verify}}}{C_{\mathrm{alloc}}}. τ V = C alloc C verify . 定義驗證增益:
g V = I u s a b l e v e r i f i e d I u s a b l e u n v e r i f i e d . g_V
=
\frac{
I_{\mathrm{usable}}^{\mathrm{verified}}
}{
I_{\mathrm{usable}}^{\mathrm{unverified}}
}. g V = I usable unverified I usable verified . 在低風險任務中,過高的 τ V \tau_V τ V 可能不經濟;在數學、醫療、法律、安全與基礎科學中,即使驗證成本高,g V g_V g V 仍可能遠大於一。
因此不存在對所有任務通用的最佳驗證比例。最佳配置取決於錯誤成本:
τ V ∗ = arg max τ V [ I u s a b l e ( τ V ) − λ c o s t C v e r i f y ( τ V ) ] . \tau_V^*
=
\arg\max_{\tau_V}
\left[
I_{\mathrm{usable}}(\tau_V)
-
\lambda_{\mathrm{cost}}C_{\mathrm{verify}}(\tau_V)
\right]. τ V ∗ = arg τ V max [ I usable ( τ V ) − λ cost C verify ( τ V ) ] .
八、工具與編排
8.1 外部工具是計算的延伸
模型能力不應只測量其內部權重所完成的推理。現代 AI 系統可以調用:
程式執行器;
定理證明器;
搜尋引擎;
資料庫;
模擬器;
試算表;
圖像與影片處理器;
專用科學軟體;
其他模型或代理。
因此整體能力是:
I s y s t e m = I m o d e l + I t o o l + I o r c h e s t r a t i o n − D c o o r d i n a t i o n . I_{\mathrm{system}}
=
I_{\mathrm{model}}
+
I_{\mathrm{tool}}
+
I_{\mathrm{orchestration}}
-
D_{\mathrm{coordination}}. I system = I model + I tool + I orchestration − D coordination . 工具越多,不一定越強。若協調失敗、資料格式不一致、錯誤無法回傳,工具數量反而增加耗散。
8.2 編排閾值
定義工具與代理數量為 (m)。當 (m) 很小時,新增工具可能提高能力;但超過某個閾值後,協調成本可能快速上升:
D c o o r d i n a t i o n ( m ) ∼ O ( m γ ) , γ > 1. D_{\mathrm{coordination}}(m)
\sim
O(m^\gamma),
\qquad \gamma>1. D coordination ( m ) ∼ O ( m γ ) , γ > 1. 若編排效率隨系統進步,則可以把臨界閾值向外推:
m c r i t i c a l , t + 1 > m c r i t i c a l , t . m_{\mathrm{critical},\,t+1}
>
m_{\mathrm{critical},\,t}. m critical , t + 1 > m critical , t . 因此模型世代進步的一個重要表徵,不只是單模型推理更強,而是能穩定控制更多工具、更多狀態與更長依賴鏈。
九、非線性、閾值與飽和
9.1 更多計算不是永遠線性有效
對固定模型與任務,計算增加通常存在邊際遞減:
∂ I ∂ C > 0 , ∂ 2 I ∂ C 2 < 0 \frac{\partial I}{\partial C}>0,
\qquad
\frac{\partial^2 I}{\partial C^2}<0 ∂ C ∂ I > 0 , ∂ C 2 ∂ 2 I < 0 但某些任務可能存在門檻。當計算不足時,系統無法完成最小閉環;一旦越過門檻,能力突然上升:
I ( C ) ≈ { I l o w , C < C ∗ , I h i g h , C ≥ C ∗ . I(C)
\approx
\begin{cases}
I_{\mathrm{low}}, & C<C^*,\\
I_{\mathrm{high}}, & C\ge C^*.
\end{cases} I ( C ) ≈ { I low , I high , C < C ∗ , C ≥ C ∗ . 例如,只有當系統有足夠預算同時完成探索、程式執行與驗證時,才能產生可靠成果。少一個環節,整體價值可能接近零。
9.2 架構提升會移動門檻
新模型可能以較少計算完成舊模型無法完成的閉環:
C n e w ∗ < C o l d ∗ . C_{\mathrm{new}}^*
<
C_{\mathrm{old}}^*. C new ∗ < C old ∗ . 同時,新模型也可能獲得更高最大預算:
C n e w max > C o l d max . C_{\mathrm{new}}^{\max}
>
C_{\mathrm{old}}^{\max}. C new m a x > C old m a x . 因此世代提升可能同時表現為:
更低的最低可行計算;
更高的最大可用計算;
更高的單位計算效率;
更強的狀態累積;
更低的工具協調損失。
這五者疊加時,能力可能呈現非線性躍升。
十、智能計算轉化與分配定律的正式陳述
定律一:計算供給約束
對任何可執行 AI 系統,若其他條件固定,有效智能成果受到實際可用計算資源上界約束:
I e f f e c t i v e ≤ η max C a l l o c . I_{\mathrm{effective}}
\le
\eta_{\max}C_{\mathrm{alloc}}. I effective ≤ η m a x C alloc . 沒有物理計算供給,就不存在無成本智能輸出。
定律二:轉化效率非恆定
同一物理計算量在不同模型、不同推理策略、不同工具配置與不同任務上,可轉化為不同的有效智能成果:
η e f f = η e f f ( A , M , R , O , V , S , x ) . \eta_{\mathrm{eff}}
=
\eta_{\mathrm{eff}}(A,M,R,O,V,S,x). η eff = η eff ( A , M , R , O , V , S , x ) . 因此 FLOPs 不能單獨決定智能能力。
定律三:分配非中性
單一使用者與單一請求取得的計算資源,是由負載、優先級、預算、風險、延遲與任務難度共同決定的動態量:
C a l l o c = π ( x , u , t ) . C_{\mathrm{alloc}}
=
\pi(x,u,t). C alloc = π ( x , u , t ) . 因此模型名義能力不等於服務時實得能力。
定律四:可見 Token 解耦
可見 Token 數與實際計算量之間不存在跨模型、跨模式、跨任務穩定的線性比例:
T v i s i b l e ∝̸ C a l l o c . T_{\mathrm{visible}}
\not\propto
C_{\mathrm{alloc}}. T visible ∝ C alloc . Token 可作為文字長度尺度,但不能直接作為智能算力尺度。
定律五:狀態連續放大
當中間成果能被正確保存、驗證與重用時,多輪智能成果可超過孤立單輪成果的線性總和:
I c u m > ∑ I i s o l a t e d I_{\mathrm{cum}}
>
\sum I_{\mathrm{isolated}} I cum > ∑ I isolated 在高 κ s t a t e \kappa_{\mathrm{state}} κ state 條件下,智能系統會由回答器轉變為持續研究與工程系統。
定律六:耗散不可消失
任何複雜智能系統都存在競爭、驗證、協調、延遲與狀態耗散:
D e f f ≥ 1. D_{\mathrm{eff}}\ge 1. D eff ≥ 1. 提升能力不只依靠增加算力,也依靠降低耗散。
十一、可推導命題
命題一:降配與世代超越可以共存
若:
d η t + 1 C t + 1 > η t C t , d\eta_{t+1}C_{t+1}
>
\eta_tC_t, d η t + 1 C t + 1 > η t C t , 則新世代模型即使被動態降配,仍可超過上一代完整狀態。
命題二:短輸出可以具有高計算密度
若隱藏推理、分支與驗證量增加,而可見輸出長度不變,則:
ρ C = C a l l o c T v i s i b l e ↑ . \rho_C
=
\frac{C_{\mathrm{alloc}}}{T_{\mathrm{visible}}}
\uparrow. ρ C = T visible C alloc ↑ . 因此答案短不代表計算少。
命題三:更多算力可能被低效率抵消
若:
η 2 D 2 < η 1 D 1 ⋅ C 1 C 2 , \frac{\eta_2}{D_2}
<
\frac{\eta_1}{D_1}
\cdot
\frac{C_1}{C_2}, D 2 η 2 < D 1 η 1 ⋅ C 2 C 1 , 則即使 C 2 > C 1 C_2>C_1 C 2 > C 1 ,系統二的有效智能仍可能較低。
命題四:驗證可能降低速度但提高有效產出
若驗證使錯誤率下降幅度大於其資源成本造成的產出下降,則:
I u s a b l e v e r i f i e d > I u s a b l e u n v e r i f i e d . I_{\mathrm{usable}}^{\mathrm{verified}}
>
I_{\mathrm{usable}}^{\mathrm{unverified}}. I usable verified > I usable unverified .
命題五:長程狀態是獨立能力維度
兩個模型即使瞬時能力相同,只要:
κ s t a t e , A > κ s t a t e , B , \kappa_{\mathrm{state},A}
>
\kappa_{\mathrm{state},B}, κ state , A > κ state , B , 模型 A 在長程任務上的累積成果就可能顯著超過模型 B。
命題六:工具數量存在最佳區間
若工具收益為 (G(m)),協調成本為 (D(m)),則存在:
m ∗ = arg max m [ G ( m ) − D ( m ) ] . m^*
=
\arg\max_m
\left[G(m)-D(m)\right]. m ∗ = arg m max [ G ( m ) − D ( m ) ] . 因此無限制增加代理與工具,不會自動增加有效智能。
十二、測量框架
要讓本理論成為可檢驗框架,需要把抽象量轉化為代理指標。
12.1 物理與服務層
可測量:
單次請求延遲;
GPU/TPU 使用時間;
峰值與平均記憶體;
能源消耗;
工具執行時間;
併發負載;
排隊時間;
超時與截斷率。
12.2 推理層
可測量:
隱藏推理長度;
候選分支數;
回溯次數;
自我修正次數;
工具呼叫數;
驗證器執行數;
搜尋深度;
重複計算比例。
12.3 成果層
可測量:
正確率;
可重現率;
測試通過率;
證書完整度;
錯誤發現率;
新增可用程式量;
新增可驗證命題量;
對後續任務的重用率;
人工修正時間。
12.4 狀態層
可測量:
跨輪一致性;
依賴關係保存率;
已解問題重複發生率;
版本衝突率;
前輪成果調用成功率;
錯誤回溯成功率;
中間產物可讀性與可遷移性。
12.5 建議指標
有效計算密度
ρ C = 估計計算量 可見輸出 Token \rho_C
=
\frac{\text{估計計算量}}{\text{可見輸出 Token}} ρ C = 可見輸出 Token 估計計算量 有效智能密度
ρ I = 可驗證成果量 可見輸出 Token \rho_I
=
\frac{\text{可驗證成果量}}{\text{可見輸出 Token}} ρ I = 可見輸出 Token 可驗證成果量 單位計算產出率
η e m p = 可驗證成果量 估計計算量 \eta_{\mathrm{emp}}
=
\frac{\text{可驗證成果量}}{\text{估計計算量}} η emp = 估計計算量 可驗證成果量 狀態保留率
κ e m p = 下一輪成功重用的前輪成果 前輪可重用成果總量 \kappa_{\mathrm{emp}}
=
\frac{\text{下一輪成功重用的前輪成果}}
{\text{前輪可重用成果總量}} κ emp = 前輪可重用成果總量 下一輪成功重用的前輪成果 驗證報酬率
R V = 因驗證避免的錯誤成本 驗證計算成本 R_V
=
\frac{\text{因驗證避免的錯誤成本}}
{\text{驗證計算成本}} R V = 驗證計算成本 因驗證避免的錯誤成本
十三、實驗設計
實驗一:同 Token、不同推理預算
固定:
只改變推理預算,測量:
正確率;
工具使用;
驗證結果;
延遲;
可重現性。
若可見 Token 接近不變,但成果顯著改變,即支持 Token—計算解耦。
實驗二:同模型、不同負載
在不同服務負載或不同時段,重複執行同一批任務,測量:
延遲;
完成率;
推理深度;
工具調用;
回答穩定性。
若系統實得能力隨負載顯著波動,即支持動態分配與算力稀釋。
實驗三:同算力、不同編排
固定總計算預算,比較:
單模型直接回答;
單模型加工具;
多代理協作;
多代理加獨立驗證。
觀察有效成果與協調成本,估計最佳工具/代理數量 m ∗ m^* m ∗ 。
實驗四:狀態連續性
比較兩組:
A 組每輪保存程式、證書、失敗紀錄與依賴;
B 組每輪只保存自然語言摘要。
在長程任務中測量:
重複工作量;
錯誤繼承;
推進速度;
最終可驗證成果。
若 A 組出現顯著累積增益,即支持狀態連續放大定律。
實驗五:驗證配置曲線
逐步提高驗證預算比例 τ V \tau_V τ V ,測量:
初始產出速度;
錯誤率;
最終可採用成果;
人工修正成本。
由此估計不同任務的最佳驗證比例。
十四、可否證條件
本理論不能只吸收所有現象而不允許被推翻。以下結果會削弱或否定本文的重要部分:
在控制模型、任務與輸出長度後,改變推理預算不影響成果品質;
不同服務負載下,實得能力完全不受分配影響;
可見 Token 與實際計算在跨模型、跨任務下保持穩定線性比例;
狀態保存與工程化中間產物對長程任務沒有可測增益;
增加驗證只增加成本,從不提高可用成果;
工具與多代理編排的能力完全可由單模型內部能力解釋;
單位計算效率在模型世代間沒有系統性變化。
若未來實驗反覆得到這些結果,本文框架就必須大幅修正。
十五、與傳統算力尺度的關係
本文不否定 FLOPs、參數量、Token 數或基準測試,而是重新安排它們的位置。
FLOPs 描述物理計算;
參數量描述模型容量的一部分;
Token 描述符號介面長度;
基準測試描述特定任務的外部表現;
本定律描述這些要素如何經由分配與轉化形成使用者實得的智能成果。
因此:
FLOPs ≠ Intelligence , \text{FLOPs}
\neq
\text{Intelligence}, FLOPs = Intelligence , 但:
Intelligence ⊥̸ FLOPs . \text{Intelligence}
\not\perp
\text{FLOPs}. Intelligence ⊥ FLOPs . 智能不是算力的同義詞,卻不能脫離算力而存在。真正需要研究的是兩者之間的轉化函數。
十六、經濟與治理含義
16.1 名義模型相同,不代表服務相同
同一模型名稱可能對應不同:
推理預算;
服務優先級;
工具權限;
記憶深度;
驗證配置;
延遲上限;
併發資源。
因此 AI 服務透明度不能只公布模型名稱,也應逐步公布可理解的服務級別與計算配置。
16.2 Token 定價可能失真
若:
T v i s i b l e ∝̸ C a l l o c , T_{\mathrm{visible}}
\not\propto
C_{\mathrm{alloc}}, T visible ∝ C alloc , 則單純按可見 Token 計價,無法精確反映後端成本。未來定價可能轉向:
推理強度;
工具執行量;
驗證級別;
記憶保存量;
延遲優先級;
可重現性要求;
任務風險等級。
16.3 智能資源分配會成為治理問題
當高強度智能請求需要大量能源與計算時,系統必須決定:
哪些任務獲得更多推理預算;
哪些使用者享有較高優先級;
高風險任務是否強制驗證;
公共研究是否應獲得基礎算力保障;
如何避免智能資源過度集中。
這表示智能算力不只是工程資源,也是新的公共資源與權力結構。
十七、適用範圍與限制
本理論目前是一個跨層級框架,而不是已完成參數估計的自然定律。其主要限制包括:
許多商業模型不公開內部推理與實際算力;
「有效智能成果」需要依任務定義,難以使用單一尺度;
不同硬體的 FLOPs 不一定具有相同實際效用;
工具與模型能力容易互相混淆;
長程成果存在品質與數量不可直接等價的問題;
狀態連續性可能同時保存錯誤;
驗證器本身也可能錯誤;
人類參與程度會影響成果歸因;
不同服務平台的動態分配政策通常不可見。
因此,本文主張建立測量框架,而不是假裝目前已能精確反推出所有隱藏計算。
十八、研究綱領
後續可分為六個方向:
18.1 計算密度測量
研究如何由延遲、工具執行、能耗、硬體利用率與結果結構,估計單次請求的實際計算密度。
18.2 智能轉化效率
建立不同模型、不同任務下的:
η e f f \eta_{\mathrm{eff}} η eff 經驗估計方法。
18.3 狀態連續動力學
研究記憶、版本控制、中間產物與錯誤回溯如何影響:
κ s t a t e . \kappa_{\mathrm{state}}. κ state . 18.4 驗證經濟學
研究不同風險任務的最佳驗證預算與錯誤成本。
18.5 動態分配公平性
研究 AI 服務的資源分配是否可被稽核、比較與治理。
18.6 能源—計算—智能閉環
將本定律與能源供給、資料中心、電網、硬體製造及 AI 自動化基礎設施連接,形成更完整的智能物理代謝模型。
十九、結論
智能計算不能再被理解為「模型收到 Token,再輸出 Token」的單純映射。
更接近現實的描述是:
物理供給 → 動態分配 → 模型推理 → 工具與搜尋 → 驗證 → 狀態保存 → 可累積智能成果 . \text{物理供給}
\rightarrow
\text{動態分配}
\rightarrow
\text{模型推理}
\rightarrow
\text{工具與搜尋}
\rightarrow
\text{驗證}
\rightarrow
\text{狀態保存}
\rightarrow
\text{可累積智能成果}. 物理供給 → 動態分配 → 模型推理 → 工具與搜尋 → 驗證 → 狀態保存 → 可累積智能成果 . 本文提出的零階主式:
I = η C D \boxed{
I=\frac{\eta C}{D}
} I = D η C 應被理解為總綱,而不是終點。
其完整含義是:
有效智能成果等於實際分配的物理與外部計算,經由模型架構、推理、工具、驗證與狀態連續性轉化後,再扣除資源競爭、協調、延遲與狀態耗散所得的結果。
這個框架同時解釋了:
為何同樣 Token 可能承載不同計算量;
為何降配與世代能力上升可以並存;
為何更多算力不必然帶來更多成果;
為何驗證會變慢卻提高可用性;
為何長程狀態保存會造成能力躍遷;
為何現代 AI 正從回答器轉變為動態研究與工程系統。
真正值得測量的,不再只是模型有多少參數或輸出了多少字,而是:
每一單位物理計算,最終被轉化成多少可驗證、可重用、可累積的智能成果。 \boxed{
\text{每一單位物理計算,最終被轉化成多少可驗證、可重用、可累積的智能成果。}
} 每一單位物理計算,最終被轉化成多少可驗證、可重用、可累積的智能成果。 這正是「智能計算轉化與分配定律」所要描述的核心對象。
附錄 A:符號表
符號
含義
(I)
有效智能成果
I i n s t I_{\mathrm{inst}} I inst
瞬時有效智能
I c u m I_{\mathrm{cum}} I cum
累積智能成果
C p h y s i c a l C_{\mathrm{physical}} C physical
系統物理計算供給
C a l l o c C_{\mathrm{alloc}} C alloc
單次請求實際分配計算
η e f f \eta_{\mathrm{eff}} η eff
計算轉化效率
α t a s k \alpha_{\mathrm{task}} α task
任務適配係數
D e f f D_{\mathrm{eff}} D eff
合成耗散
ρ C \rho_C ρ C
每可見 Token 的計算密度
ρ I \rho_I ρ I
每可見 Token 的智能密度
κ s t a t e \kappa_{\mathrm{state}} κ state
狀態連續係數
τ V \tau_V τ V
驗證預算比例
m ∗ m^* m ∗
最佳工具/代理數量
S k S_k S k
第 (k) 輪累積狀態
附錄 B:最小公式組
總綱
I = η C D I=\frac{\eta C}{D} I = D η C 瞬時智能
I i n s t = C a l l o c η e f f α t a s k D e f f I_{\mathrm{inst}}
=
\frac{
C_{\mathrm{alloc}}
\eta_{\mathrm{eff}}
\alpha_{\mathrm{task}}
}{
D_{\mathrm{eff}}
} I inst = D eff C alloc η eff α task 計算分配
C a l l o c = C b a s e + C r e a s o n + C b r a n c h + C t o o l + C v e r i f y + C m e m o r y + C o r c h e s t r a t e C_{\mathrm{alloc}}
=
C_{\mathrm{base}}
+
C_{\mathrm{reason}}
+
C_{\mathrm{branch}}
+
C_{\mathrm{tool}}
+
C_{\mathrm{verify}}
+
C_{\mathrm{memory}}
+
C_{\mathrm{orchestrate}} C alloc = C base + C reason + C branch + C tool + C verify + C memory + C orchestrate Token 解耦
T v i s i b l e ∝̸ C a l l o c T_{\mathrm{visible}}
\not\propto
C_{\mathrm{alloc}} T visible ∝ C alloc 計算密度
ρ C = C a l l o c T v i s i b l e \rho_C
=
\frac{C_{\mathrm{alloc}}}{T_{\mathrm{visible}}} ρ C = T visible C alloc 狀態演化
S k + 1 = F ( S k , E k , V k , F k , R k ) S_{k+1}
=
\mathcal F(S_k,E_k,V_k,F_k,R_k) S k + 1 = F ( S k , E k , V k , F k , R k ) 累積智能
I c u m ( n ) = ∑ k = 1 n ( ∏ j = k + 1 n κ s t a t e , j ) I i n s t , k + G r e u s e − L i n c o n s i s t e n c y I_{\mathrm{cum}}(n)
=
\sum_{k=1}^{n}
\left(
\prod_{j=k+1}^{n}
\kappa_{\mathrm{state},j}
\right)
I_{\mathrm{inst},k}
+
G_{\mathrm{reuse}}
-
L_{\mathrm{inconsistency}} I cum ( n ) = k = 1 ∑ n j = k + 1 ∏ n κ state , j I inst , k + G reuse − L inconsistency
版本結語: v0.1 建立總綱、基本方程、六條定律、可推導命題、測量框架與可否證條件。後續版本可進一步加入量綱分析、經驗資料、模擬模型、服務負載實驗與跨模型比較。