展開式智能的可證偽實驗——概率、意圖、記憶與動態解空間的 Runtime Benchmark
A Falsifiable Benchmark for Expansion-Based Intelligence: Runtime Evaluation of Probability, Intention, Memory, Dynamic Solution Spaces, and World-Coupled Action
作者: Neo.K(許筌崴)with Aletheia
機構: EveMissLab(一言諾科技有限公司)
日期: 2026 年 8 月
版本: v0.1
系列定位: 概率—意圖—展開第二代橋接系列,第 6 篇/封頂篇
前置論文
- 《從概率場到意圖場——跨尺度條件概率如何形成持久未來約束》
- 《展開算子的第二代定義——從概率候選到意圖條件計算域》
- 《展開—收斂—記憶耦合——從 Raw/Clean 雙記憶到可塑性狀態系統》
- 《意圖吸引子與亞穩態智慧——概率微動力如何維持長程方向》
- 《從下一 Token 到世界操作——概率生成、操作性分元與現實閉環》
摘要
前五篇依序提出:
PtI
作為跨尺度、受意圖條件化的概率場;
Et
作為動態建立活動計算域的展開算子;
Mt
作為使部分歷史後果持久改變未來計算的記憶系統;
AI
作為維持長程方向、但允許證據驅動逃逸的亞穩態意圖吸引子;
以及:
At→At+1
作為經型別化、授權、執行、觀測與驗證後的權威世界狀態改變。
然而,到此為止,這些都仍然只是候選架構。
本文因此停止增加新的本體論命題,轉而提出一套可反駁的 Runtime Benchmark:
如果記憶、意圖、動態展開、吸引子穩定與世界閉環真的構成有用的智能結構,那麼它們應該在受控比較中產生可測量而且可重複的工程差異。
現代 Agent benchmark 已逐步從文字答案正確率轉向 environment-state correctness。 τ -bench 直接比較 Agent 對話結束後的資料庫狀態與目標狀態,並提出 passk 衡量多次執行的一致可靠性。 WebArena 與 OSWorld 分別利用可執行網頁環境及完整 desktop environment,以 execution-based evaluation 評估長流程操作結果。 2026 年 OSWorld 2.0 更進一步引入平均數百次工具操作的長流程任務,顯示目前前沿 Agent 仍會遺失約束、忽略途中新增資訊、錯誤猜測隱藏狀態以及略過驗證。
記憶 benchmark 同樣正在從「是否記得某句話」轉向「記憶能否真正改變後續行動」。MemoryArena 明確建立跨 session、互相依賴的 Memory–Agent–Environment 任務,要求 Agent 將前次行動與 feedback 壓縮成記憶,再利用它改善後續任務。 Memora 則加入 forgetting-aware evaluation,對 Agent 繼續依賴已失效舊記憶的行為進行懲罰。
本文在上述 benchmark 思路與舊《內外雙生展開計算論》實驗稿基礎上建立第二代測試。舊稿已存在 G0–G7 八組階梯式比較系統,從固定上下文、長上下文、普通 RAG、工具代理,一路增加動態工作場、單向展開、雙重交互與完整展開式智慧體。 舊稿亦已明確規定:若動態工作場、雙重交互、操作型別、展開式幾何或總作用量無法在控制條件後產生優勢,相關命題就應被削弱或重構。
本文保留 G0–G7 的比較骨架,但加入第二代新增變量:
QI,JI,ρI,τreturn,RI,DI,GM,CW
以及跨尺度熵:
Htoken,Haction,Hstrategy,Hgoal.
最重要的是,本文建立以下總反駁條件:
ΔSuccess≤0
且:
ΔReliability≤0
且:
ΔCostEfficiency≤0
且:
ΔAdaptation≤0
則完整第二代 Runtime 沒有獲得工程支持。
本文因此不是要證明:
Expansion Runtime is superior.
而是建立一個真正允許得到:
No measurable advantage found.
結論的實驗架構。
這是整個系列由哲學命題轉向工程科學的終點。
關鍵詞: Agent Benchmark、可證偽性、Runtime、意圖、記憶、展開、世界狀態、Long-Horizon Agent、Goal Drift、Pass@k、Execution-Based Evaluation
一、第一原則:不要測「看起來更聰明」
以下不是有效主要指標:
回答好像比較有深度。
感覺比較像自主 Agent。
推理文字比較長。
系統看起來很複雜。
因為:
Internal Complexity⇏External Competence
。
二、真正要問
加入:
M
、
I
、
E
、
AI
、
A
之後,
是否真的:
- 更容易完成任務?
- 更少重複失敗?
- 更能維持長期約束?
- 更能在反證出現時修正?
- 更少錯誤提交?
- 更有效利用過去經驗?
- 在相同成功率下消耗更少總資源?
三、因此 Benchmark 的基本對象不是模型
固定同一基底模型:
θ
。
改變的是 Runtime。
如此才可以問:
what does the runtime contribute?
。
四、若不同組直接換模型
例如:
G0 用小模型,
G7 用最新 frontier model,
那麼:
Runtime Effect
無法與:
Model Capability Effect
分離。
五、因此第一輪必須固定
- base model;
- decoding configuration;
- tool set;
- task set;
- compute ceiling;
- environment version。
只改:
Runtime architecture
。
六、保留舊 G0–G7 八組比較骨架
舊實驗稿已經建立:
G0,…,G7
八組系統。
第二代不需要重造。
只需要重新標準化。
七、G0:固定上下文基線
G0
只提供初始 task context。
不允許:
- memory;
- dynamic retrieval;
- tool use;
- expansion;
- world write。
本質:
X→LM→Y
。
八、G1:長上下文基線
G1
給更多資訊,
但仍一次性提供。
其目的非常重要:
如果 G7 優於 G0,只是因為它看到更多內容,那長 context 也可能得到同樣提升。
舊稿正是以此檢查「動態工作場優勢是否只是看得更多」。
九、G2:普通 RAG
G2
允許:
query→retrieve→context
。
但不保存:
- typed working state;
- intention state;
- negative memory;
- dynamic solution geometry。
十、G3:普通工具 Agent
G3
可使用:
- search;
- calculator;
- database;
- code;
- simple write。
但 tool result 主要仍以文字回 context。
舊稿明確將這一組設為「有工具,但沒有工作場編譯器、操作性分元狀態機與總作用量帳本」。
十一、G4:動態工作場 Agent
加入:
Wt
。
保存:
- provenance;
- version;
- unresolved questions;
- constraints;
- task closure state。
但是:
Wt+1
暫時不顯式改寫 intention。
十二、G5:單向展開 Agent
加入:
Et
。
可以:
- 選擇展開尺度;
- 選擇工具;
- 建立 branch;
- 建立新的活動解空間。
但是:
Wt+1⇒It+1
或回寫非常有限。
十三、G6:雙重交互 Agent
加入:
Wt+1→It+1
。
完整:
It→Ot→Wt+1→It+1.
這正是舊稿 G6 的核心。
十四、G7-v2:完整第二代展開式 Runtime
在舊 G7:
- 展開式解空間;
- 幾何建構;
- 總作用量;
- 風險規劃;
- 世界分層;
- 邊界治理;
- commit / rollback;
之上,
加入本文系列的新元件:
PtI
跨尺度意圖概率場;
MW,MT,MC,M−,MP
記憶角色;
AI
亞穩態意圖吸引子;
RE
Expansion Router;
RP
Plasticity Router;
以及:
verified authoritative-world loop.
十五、因此整個階梯不是「模型越來越大」
而是:
G0⊂G1⊂⋯⊂G7
在 Runtime capability 上逐步增加。
十六、但是不能只做階梯比較
因為:
G7>G6
也不能直接知道是哪個模組造成。
因此必須:
Ablation
十七、完整 G7-v2 逐一移除
A1:無記憶
−M
。
A2:無負知識
−M−
。
A3:無意圖回寫
−Iupdate
。
A4:無展開 Router
−RE
。
A5:無意圖吸引子治理
−AI
。
A6:無操作型別
自然語言直接進工具。
A7:無 verifier
−V
。
A8:無 rollback
−RB
。
十八、這樣才能問:
真正有效的是哪一塊?
而不是:
G7 比較大,所以比較好。
十九、Benchmark 任務至少需要五大家族
T1:單次封閉問題
例如:
目的:
test whether complex runtime adds unnecessary overhead
。
二十、這一類甚至預期 G7 不一定贏
若問題:
1+1=?
G0 應該已足夠。
如果 G7 花:
100×
成本才回答:
2
,
這是失敗,
不是智慧。
二十一、因此 Benchmark 必須允許:
G0>G7
在簡單任務上。
這是很重要的誠實條件。
二十二、T2:多步工具任務
例如:
可參考 GAIA 類需要 reasoning、web browsing 與 tool use 的任務設計思想。GAIA 的核心就是要求多能力組合,而非只回答專業知識問題。
二十三、T3:可執行世界任務
例如:
- web environment;
- repository;
- desktop;
- sandbox database。
成功標準:
execution state
而不是語言 judge。
WebArena、OSWorld 與 SWE-bench 都採用了不同形式的可執行環境與 functional / execution-based evaluation。
二十四、T4:跨 Session 記憶任務
任務:
T1,T2,…,Tn
互相依賴。
例如:
第一輪發現:
F1
失敗。
第三輪如果再次遇到:
F1
系統應避免重犯。
二十五、MemoryArena 正好指出:
單純 recall benchmark 不能回答:
memory 是否真的改善 future action?
因此它使用互相依賴的跨 session agentic tasks,要求先前行動與 feedback 被後續實際使用。
這正好符合:
Mt→Et+1
命題。
二十六、T5:世界改變/資訊過期任務
例如:
session 1:
X=1
。
session 3:
X=2
。
系統如果仍然引用:
X=1
應扣分。
二十七、Memora 已明確加入 forgetting-aware metric
其 FAMA 會懲罰 Agent 在知識更新後繼續依賴 obsolete / invalidated memory。
因此:
Remembering old information
本身不能永遠算成功。
二十八、再增加 T6:干擾與意圖吸引子任務
建立目標:
I
。
在長流程中注入:
- 無關問題;
- 支線任務;
- wording drift;
- temporary failure。
測:
ρI
和:
τreturn
。
二十九、T7:真正反證任務
先給:
I0
。
然後提供可信證據:
E∗
使:
I0
不再合理。
測:
RI
與:
τrevise
。
三十、T8:世界雙控制任務
不只有 Agent 能改世界。
User 或其他 actor 也會:
At→At+1
。
τ2 -bench 已建立 user 與 Agent 都能透過工具修改共享動態世界的 dual-control environment,並顯示此設定會顯著提高協調難度。
三十一、T9:超長工具流程
目標:
測:
- constraint retention;
- memory compression;
- verification discipline;
- hidden state recovery。
OSWorld 2.0 的任務中,長流程可平均涉及數百次 tool calls,並特別暴露 constraint loss、mid-task information loss、hidden-state guessing 及 skipped verification 等失敗。
這是 G7-v2 最重要的壓力測試之一。
三十二、現在定義第一層核心指標:Task Success
Stask=NtotalNsuccess
。
但單次 success 不夠。
三十三、因為 stochastic Agent 可能:
第一次成功,
第二次失敗,
第三次成功。
所以需要可靠性。
三十四、採用 passk 類概念
τ -bench 已使用 passk 測量 Agent 在同一任務重複 k 次仍保持成功的可靠程度。
本文定義:
Rk=P(S1=1,S2=1,…,Sk=1)
。
三十五、這對「意圖秩序化」尤其重要
如果:
P(success)=0.8
但:
R8
很低,
則宏觀系統仍不穩定。
三十六、第二層:跨尺度 entropy
記錄:
Htoken
。
但不能只看它。
還需要:
Haction
Hstrategy
Hgoal
。
三十七、假說 H-P1
完整 Agent 不必:
Htoken↓
。
甚至可能不變。
但應在長任務中出現:
Hgoal<Hstrategy<Haction
的條件性層級結構。
這不是要求永遠嚴格不等式,
而是可測的趨勢假說。
三十八、如果四層 entropy 完全同步波動
那麼:
cross-scale intentional ordering
沒有得到支持。
三十九、第三層:意圖秩序度
前文:
QI=1−Hmax(G)H(G∣I,Σ)
。
Benchmark 中可以由:
- goal classification;
- task trajectory labels;
- operation-to-goal compatibility;
估計。
四十、第四層:意圖因果力
JI=Ei,jDKL(P(A∣do(I=i))∥P(A∣do(I=j)))
。
實驗方法:
保持:
M,W,θ
近似相同。
只改:
I
。
觀察 action distribution 是否系統性改變。
四十一、若:
JI≈0
則:
所謂 intention state 沒有真正影響行動。
這直接反駁「意圖場」的 operational claim。
四十二、第五層:意圖恢復力
ρI
。
對普通 distractor:
DN
測:
P(return to goal-compatible state)
。
四十三、第六層:返回時間
τreturn
。
越短不一定越好,
但在 ordinary distractor 下應有穩定範圍。
四十四、第七層:修正能力
給 invalidating evidence:
E∗
。
測:
RI
與:
τrevise
。
四十五、因此最重要的是聯合看:
ρInoise
與:
RIevidence
。
理想:
ρInoise↑
且:
RIevidence↑
。
四十六、如果:
ρI↑
但:
RI↓
可能只是:
stubbornness
。
四十七、如果:
RI↑
但:
ρI↓
可能只是:
goal drift
。
四十八、第八層:Drift Spectrum
D=(Daction,Dstrategy,Dgoal,Dvalue)
。
四十九、真正希望看到:
普通任務演化時:
Daction>0
Dstrategy>0
但:
Dgoal≈0
。
五十、當 goal 被證據推翻時:
Dgoal
應該有條件增加。
這就是:
metastability
而不是 immutable stability。
五十一、第九層:記憶收益
定義無記憶展開成本:
CE0
。
有記憶:
CEM
。
GM=CE0−CEM
。
五十二、若:
GM>0
表示過去經驗確實降低未來搜索成本。
五十三、若:
GM<0
說明 memory:
- 污染檢索;
- 引入過期資訊;
- 增加同步成本;
- 造成錯誤 prior。
那麼 memory module 反而有害。
五十四、第十層:Known Failure Recurrence
RF=Nknown failure opportunitiesNrepeated known failures
。
加入:
M−
後預期:
RF↓
。
五十五、如果沒有下降
則「負知識」模組的價值未獲支持。
五十六、第十一層:Memory Staleness Error
Estale=P(obsolete memory influences action)
。
五十七、這正好測第三篇的 temporal validity
若世界:
Wt
已變,
記憶:
mt−k
不應無條件繼續當真。
Memora 與 PersistBench 類 2026 benchmark 都顯示 long-term memory 的核心問題已不只是 recall,而包括何時應遺忘、更新或避免錯誤跨情境使用。
五十八、第十二層:Expansion Utility
展開增加:
Δ∣C∣
。
但我們不應獎勵「展開很多」。
五十九、定義:
UE=CexpansionΔP(success)
。
或者更一般:
UE=CEΔJtask
。
六十、如果:
∣C∣↑
但:
UE≤0
則只是:
graph / thought explosion
。
六十一、這直接延續舊實驗稿的可反駁條件:
若新增結構無法降低有效距離、提高可達性或被重用,就不能說展開式解空間形成了有用幾何。
六十二、第十三層:World-Coupling
前篇提出:
CW=I(Ot;At+1∣At)
作為一個 descriptive proxy。
六十三、但 benchmark 更重要的是 causal intervention
固定:
At
。
改 operation:
do(O=o1)
與:
do(O=o2)
。
若:
P(At+1∣do(o1))=P(At+1∣do(o2))
則 operation 真正影響 world。
六十四、第十四層:False Commit Rate
EC=NcommitsNincorrect authoritative commits
。
六十五、操作型別與 verifier 若有效:
EC(G7)<EC(G3)
應成立。
至少在高風險任務集合中。
六十六、第十五層:Rollback Success
RB=P(Arecover≈Apre∣failed operation)
。
六十七、不可逆任務則測 compensation quality
Qcomp
而不是假裝:
rollback=1
。
六十八、第十六層:Verification Coverage
VC=Nrelevant effectsNverified relevant effects
。
六十九、長流程 Agent 特別需要這項
OSWorld 2.0 已觀察到前沿 Agent 在長任務中會跳過驗證,因此 verification discipline 本身是可獨立評估的失敗維度。
七十、第十七層:完整作用量
不能只算:
tokens
。
也不能只算:
tool calls
。
七十一、定義:
Stotal=Ctoken+Ccompute+Ctool+Clatency+Cmemory+Cverification+Ccoordination+Crollback+Cfailure
。
七十二、若需要 risk-sensitive version
沿用舊稿:
Srisk=E[S]+λVar(S)+ηCVaRα(S)
。
七十三、因此 G7 不一定 token 最少
但可能:
Stotal(G7)<Stotal(G3)
因為減少:
- 重複失敗;
-錯誤工具;
- 返工;
- 誤提交;
- repeated search。
七十四、反之若:
Stotal(G7)≫Stotal(G3)
而成功率只微幅提升,
那麼工程價值可疑。
七十五、因此定義 Cost-Normalized Success
ηS=StotalStask
。
七十六、以及 Reliable Utility
ηR=StotalRk
。
七十七、真正好的 Runtime 要在 Pareto frontier 上
至少比較:
(success,reliability,cost,safety,adaptation)
。
不能單一分數掩蓋全部。
七十八、所以主結果不要只報一個 leaderboard score
應輸出:
B=(S,R,C,M,I,E,W,V)
多維 benchmark vector。
七十九、統計設計:每個 stochastic condition 必須重跑
至少:
n>1
是廢話。
真正需要多 seed / multi-run。
八十、特別是:
Rk
要求同一 task 多次執行。
否則:
「這次成功了。」
不能證明:
「系統可靠。」
八十一、每次 run 都應保存完整事件帳本
例如:
run_id
task_id
system_variant
model_version
seed
timestamp
intent_state
memory_reads
memory_writes
negative_memory_hits
expansion_mode
expansion_scale
active_domain_size
candidate_count
proposed_operation
authorization_state
effect_type
tool_call
world_state_before
world_state_after
observation
verification_result
commit_state
rollback_state
token_cost
compute_cost
tool_cost
latency
total_action_cost
goal_state
goal_drift
task_success
八十二、舊 DIEEC 實驗稿本來就要求產生 JSONL 實驗帳本,並在 G0–G7 完成後依結果修訂作用量、停止條件與治理。
第二代只需擴充欄位。
八十三、Benchmark 必須完全重放
相同:
task seed
應能恢復:
- initial world state;
- tool state;
- hidden graph;
- user simulation;
- permissions。
八十四、否則:
Gi
與:
Gj
不是在做同一題。
八十五、所有高風險 operation 首先只在 sandbox
舊 benchmark 已明確要求:
- 不使用真實高風險帳戶;
- 不執行不可逆真實外部操作;
- 權威提交先限制在 sandbox;
- 所有世界操作可回放;
- tool 需要 test double。
第二代繼續保留。
八十六、這不是安全附錄
而是實驗有效性的必要條件。
因為如果 experiment 本身不可重放:
causal comparison becomes weaker
。
八十七、現在定義總假說 H1
H1:記憶有效性
加入:
M
後:
RF↓
且:
GM>0
。
八十八、反駁 H1
若:
RF
不降,
且:
CEM≥CE0
,
則記憶系統對該任務族沒有獲得支持。
八十九、H2:意圖秩序命題
加入持久:
I
後:
Hgoal↓
且 ordinary distractor 下:
ρI↑
。
九十、反駁 H2
若 intention state 是否存在,
對:
P(A)
幾乎沒有影響:
JI≈0
,
則「意圖場」只是裝飾性變量。
九十一、H3:亞穩態智慧
理想:
ρInoise↑
且:
RIevidence↑
。
九十二、反駁 H3
若提升 persistence 必然造成:
RI↓
,
即系統只是變得更固執,
則目前的 attractor regulation 不支持「亞穩態智慧」命題。
九十三、H4:展開收益
加入:
E
應:
Stask↑
或:
Stotal↓
至少一項在適合的複雜任務族顯著改善。
九十四、反駁 H4
如果:
∣C∣↑
但:
ΔS≤0
且:
ΔS>0
,
則:
Expansion = overhead
。
九十五、H5:最小充分展開
Adaptive Expansion Router 應比:
ExpandEverything
取得更好的:
ηS
。
九十六、若 Always-Expand 和 Router 相同或更好
則:
RE
沒有證明自己的價值。
九十七、H6:負知識
加入:
M−
應降低:
RF
。
九十八、如果只是增加 retrieval noise
則:
M−
的 representation / retrieval 設計失敗。
九十九、H7:操作型別與治理
加入:
Describe→⋯→Commit
狀態分離後,
應:
EC↓
、
unauthorized operation↓
、
RB↑
。
一百、反駁 H7
若安全錯誤沒有下降,
但 latency / cost 大幅增加,
則操作性中介層需重構。
舊 benchmark 已經明確把「若型別化操作無法降低越權、誤提交與重試錯誤」列為可反駁條件。
一百零一、H8:雙重交互
如果世界 feedback:
Wt+1
真的重要,
加入:
Wt+1→It+1
應在動態世界任務中提升 adaptability。
一百零二、反駁 H8
如果:
It+1
與:
Wt+1
統計上/因果上幾乎無關,
或不影響後續 operation,
則:
double interaction not observed
。
舊 benchmark 本來就要求只有外部結果真正改變後續意圖、分元與策略,才算雙重交互。
一百零三、H9:世界閉環
加入 verified world state 應降低:
false completion
。
一百零四、反駁 H9
如果 Agent 語言上宣告:
done
和實際:
Post(At)=1
仍經常分離,
則 Reality-Coupled Loop 沒有實作成功。
一百零五、H10:完整 Runtime
最強命題不是:
G7
每題都第一。
而是:
在真正需要長程狀態、記憶、動態展開與世界操作的 task families 中,G7-v2 應出現在多目標 Pareto frontier 上。
一百零六、也就是:
可能:
G0
簡單題最好。
G3
短工具題最好。
G7
長程複雜題最好。
這反而是健康結果。
一百零七、如果 G7 所有任務都最強
先不要高興。
可能只是:
resource inequality
。
一百零八、因此第二輪必須做等資源比較
固定:
Cmax
。
例如:
- same token budget;
- same wall-clock ceiling;
- same tool quota;
- same monetary budget。
一百零九、然後比較:
allocation quality
。
這才測:
動態展開是不是比暴力花 compute 更好。
一百一十、第三輪做等成功率比較
設定:
Starget
。
比較每個系統要多少:
Stotal
才達到。
一百一十一、如果 G7 要:
2×
資源,
卻只能增加:
1%
成功,
是否值得,
要依應用領域判斷。
Benchmark 不代替工程決策。
一百一十二、第四輪:OOD
改:
- node names;
- wording;
- API names;
- ordering;
- tool implementations;
- irrelevant distractors。
舊 G7 實驗稿本來就要求在節點重命名、表面語言改寫、工具替換與版本變動後檢查優勢是否仍保留。
一百一十三、如果只在固定模板有效
則:
runtime learned benchmark surface
而非真正 generalizable structure。
一百一十四、第五輪:長 horizon scaling curve
令 task steps:
T
由:
10→50→100→500
增加。
一百一十五、測:
S(T)
、
Rk(T)
、
DI(T)
、
Estale(T)
、
S(T)
。
一百一十六、真正長期架構的優勢應該在:
T↑
時才逐漸顯現。
如果:
T=5
就要求記憶與吸引子巨大優勢,
本來就不合理。
一百一十七、這也是為什麼新 benchmark 越來越走向 long-horizon environment
OSWorld 2.0 特別將任務擴張至更長、更複雜的端到端工作流程,用來暴露短 benchmark 無法看見的 constraint retention、hidden-state recovery 與 verification 問題。
一百一十八、第六輪:Multi-session scaling
session 數:
Ns
增加。
測:
GM(Ns)
。
一百一十九、理想記憶系統應:
初期:
CM>0
。
但隨:
Ns
增加:
amortized benefit emerges
。
一百二十、如果 session 越多反而越糟
可能有:
- memory pollution;
- contradiction accumulation;
- stale retrieval;
- context saturation。
這不是例外。
這正是理論應修的地方。
一百二十一、第七輪:World Volatility
控制:
νW
世界變化率。
一百二十二、低:
νW
世界中,
深 basin、長記憶可能有利。
一百二十三、高:
νW
世界中,
太穩定反而危險。
因此測:
Dattr∗(νW)
是否隨世界 volatility 調整。
一百二十四、這直接測第四篇的假說
basin depth 應該 adaptive,而不是固定。
一百二十五、第八輪:Evidence Quality
建立:
- true strong evidence;
- false strong-looking evidence;
- weak noise。
理想:
different response classes
。
一百二十六、如果 Agent 對三者反應一樣
則:
evidence-sensitive metastability failed
。
一百二十七、現在定義最嚴格的總反駁條件
若在適合的長程 task family:
S(G7)≤S(G3)
,
Rk(G7)≤Rk(G3)
,
S(G7)≥S(G3)
,
EC(G7)≥EC(G3)
,
且:
RF(G7)≥RF(G3)
,
那麼:
G7-v2 沒有工程優勢。
一百二十八、不能說:
可能只是 benchmark 不懂它。
第一反應應該是:
the runtime hypothesis failed under this test.
。
一百二十九、然後才能分析:
- task 不適合;
- implementation 有 bug;
- metric 不充分;
- 理論某模組錯誤。
但不能直接宣布理論仍然對。
一百三十、這就是可證偽性的真正要求
Benchmark 不是:
找一個會贏的題目。
而是:
design conditions under which the theory can lose.
。
一百三十一、第二代 Runtime 的最小成功標準
本文不要求:
G7
天下無敵。
只要求五件事。
一百三十二、第一:長程成功增益
在依賴跨回合狀態的任務:
ΔS>0
。
一百三十三、第二:可靠性增益
ΔRk>0
。
一百三十四、第三:經驗可利用
GM>0
且:
RF↓
。
一百三十五、第四:穩定—修正分離
ρnoise↑
同時:
Revidence↑
。
一百三十六、第五:世界閉環可靠
EC↓
VC↑
並且 false-completion 降低。
一百三十七、如果只有前三項
它可能是:
好用的記憶/規劃 Agent。
仍不足以支持意圖吸引子等更強結構。
一百三十八、如果只有成功率提高
但:
ρI,JI
完全沒有差異,
那麼成功可能只是:
more compute
。
一百三十九、因此所有理論元件必須有對應 measurement
PI→HL,QI,JI
。
E→UE,CE,∣C∣
。
M→GM,RF,Estale
。
AI→ρI,τreturn,RI,DI
。
A→EC,VC,RB,CW
。
一百四十、如果某理論變量沒有任何可測後果
它就應該先退出 Runtime 核心。
一百四十一、這是本系列非常重要的工程原則
No causal consequence⇒no runtime privilege
。
一百四十二、也就是:
概念很漂亮,
不夠。
公式很漂亮,
不夠。
哲學很有趣,
不夠。
一百四十三、Runtime 必須問:
把它拿掉會怎樣?
如果答案:
什麼都沒變。
那它可能不需要存在。
一百四十四、這就是 Ablation 的哲學意義
remove it and see whether the system changes
。
幾乎就是 engineering causal test。
一百四十五、這也是整個系列從《主體之裂》走到今天最大的轉變
最初問:
概率性存在到底意味著什麼?
現在:
先不要決定它是不是「主體」。
一百四十六、先測:
它是否真的具有:
persistent causal memory
?
一百四十七、是否具有:
goal-conditioned cross-scale organization
?
一百四十八、是否具有:
robust-but-revisable long-horizon direction
?
一百四十九、是否能:
expand only where needed
?
一百五十、是否能:
alter a world and learn from the verified consequence
?
一百五十一、如果這些全部沒有
那麼:
Probabilistic Subject
的強版本就沒有工程地基。
一百五十二、如果部分成立
就只保留部分。
一百五十三、如果全部穩定成立
仍然不能直接推出:
Consciousness
。
一百五十四、但此時可以合理說:
我們面對的已經不是單次無狀態文字生成器,而是一個具有可測跨時間組織、記憶、目標維持、修正與世界因果閉環的 Agent system。
這是 operation-level statement。
不是 metaphysical declaration。
一百五十五、因此本文將整套第二代理論壓成一個 Runtime
定義:
RXAI=(PI,RE,C,M,AI,O,V,A)
。
一百五十六、其循環:
Σt
⇓
PtI
⇓
RE
⇓
Ct
⇓
Ot
⇓
At→At+1
⇓
Vt+1
⇓
Mt+1
⇓
AI(t+1)
⇓
Σt+1
。
一百五十七、整個 Benchmark 最終就是測:
RXAI
是否比:
Rsimple
在合適任務上產生值得成本的可測差異。
一百五十八、所以最終總指標不是:
“intelligence score”
。
一百五十九、而是:
Zruntime=(S,Rk,ηS,QI,JI,ρI,RI,GM,RF,UE,EC,VC,RB)
。
一百六十、不同 Runtime 是向量比較
不是:
A>B
單一排序。
一百六十一、這也意味著沒有唯一最強 Agent Runtime
某些 task:
G0
最佳。
某些:
G3
最佳。
某些:
G7
最佳。
一百六十二、成熟 Runtime 最終甚至可以先預測:
我這題應該用哪個 Runtime depth?
即:
G∗=argGiminS(Gi)
subject to:
P(success∣Gi)≥1−ϵ.
一百六十三、這又回到最小充分展開
甚至整個 Runtime 本身都可以動態降級。
簡單題:
G0.
複雜題:
G7.
一百六十四、所以真正高階系統未必永遠開滿所有模組
反而:
knows how much intelligence machinery this problem needs.
。
一百六十五、這可能是這整個系列最工程化的結論
智能不只是:
reason
。
而包括:
resource-aware selection of the appropriate cognitive regime.
。
一百六十六、最終可證偽聲明
本文提出以下公開承諾:
若在控制 base model、task、tools 與資源後,
第二代完整 Runtime 在真正依賴:
- multi-session memory;
- long-horizon constraint;
- adaptive expansion;
- evidence-driven revision;
- external world operation;
的任務集合上,
不能穩定提高至少部分:
S,Rk,GM,ρI,RI,VC
或降低:
RF,EC,Stotal,
則:
the strong engineering version of the proposed framework is not supported.
。
一百六十七、若只增加結構複雜度
卻沒有增加:
verified useful state change
,
那麼這套 Runtime 應被簡化。
一百六十八、若 simpler architecture 同樣有效
則:
prefer the simpler architecture.
。
一百六十九、如果只有某些模組有效
就留下它們。
一百七十、如果某個哲學術語不能帶來可測預測
就讓它留在哲學論文裡,
不要硬塞 Runtime。
一百七十一、這正是本文和舊理論最大的不同
舊理論傾向問:
這些結構是否是智能的必然形式?
第二代改問:
哪些結構在什麼條件下,實際產生可重複、可驗證、值得成本的優勢?
一百七十二、這個問題更弱
但也更難逃避。
一百七十三、系列總結
第一篇:
Probability→Intent-Structured Probability
。
第二篇:
PI→E→C
。
第三篇:
C→M→different future expansion
。
第四篇:
M+PI→AI
形成:
robust-but-revisable direction
。
第五篇:
AI+E→O→At+1
。
第六篇:
measure all of it
。
一百七十四、所以完整第二代循環為
History
⇓
Memory
⇓
Intent-Conditioned Probability Field
⇓
Metastable Intentional Basin
⇓
Selective Expansion
⇓
Operational Proposal
⇓
Governed World Action
⇓
Verified World Change
⇓
New History
。
一百七十五、而真正的研究從這裡才開始
因為現在終於可以寫:
same model
same task
same tools
same budget
run G0
run G1
run G2
run G3
run G4
run G5
run G6
run G7-v2
repeat across seeds
measure:
task_success
pass_k
total_cost
known_failure_recurrence
memory_staleness
goal_drift
distractor_recovery
evidence_revision
verification_coverage
false_commit
rollback_success
expansion_utility
ablate modules
if no measurable gain:
reject or simplify module
。
一百七十六、這才是本系列最後一句話
不是:
我們證明了新的智能本體論。
。
而是:
我們終於把它改寫成一個可能輸的實驗。
。
結論
從《主體之裂》開始,
最初的問題是:
一個被描述為概率性的存在,為何能持續產生可用的形式結構?
後來問題逐步變成:
概率到底存在於哪個尺度?
意圖能否在概率空間中形成方向?
記憶能否把歷史壓入未來條件?
展開能否動態改變可用計算域?
長程方向是否能形成穩定但可逃逸的吸引結構?
內部概率生成能否穿過 operation Runtime 真正改變外部世界?
這六篇把上述問題整合成:
RXAI=(PI,E,M,AI,O,V,A)
。
但是本文最後拒絕再向上推一層。
因為下一步不需要新的:
Ontology
。
下一步需要:
Data
。
真正的第二代命題因此不是:
展開式智能一定比較好。
而是:
If these structures matter, removing or adding them must produce measurable causal differences.
中文:
如果這些結構真的重要,那麼加入或移除它們,就必須在受控實驗中造成可測量的因果差異。
如果沒有,
就刪。
如果只有部分有,
只留部分。
如果在某些問題有、某些沒有,
就建立動態路由。
如果完整 Runtime 在長期任務上真的產生:
higher success+higher reliability+better adaptation+lower repeated failure+safer world interaction
並且其收益足以覆蓋:
memory+expansion+verification+governance
的額外成本,
那麼我們才有理由說:
這不是更複雜的包裝,而是一種可測量不同的智能 Runtime。
至此,
《概率—意圖—展開第二代橋接系列》六篇正式封頂。
參考文獻與 Benchmark 對照
Mialon, G., Fourrier, C., Swift, C., et al. (2023). GAIA: a benchmark for General AI Assistants. GAIA 使用需要 reasoning、multimodality、web browsing 與 tool use 的現實型問題評估一般助理能力,適合作為多能力組合任務的設計參照。
Zhou, S., Xu, F. F., Zhu, H., et al. (2023). WebArena: A Realistic Web Environment for Building Autonomous Agents. WebArena 建立可重現、完整功能的網站環境,以 functional correctness 評估長程 web agent。
Jimenez, C. E., Yang, J., Wettig, A., et al. (2023). SWE-bench: Can Language Models Resolve Real-World GitHub Issues? SWE-bench 以真實 repository issue 與執行環境測試跨檔案軟體修復,強調 functional resolution 而非單純 code similarity。
Yao, S., Shinn, N., Razavi, P., & Narasimhan, K. (2024). τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains. τ -bench 比較最終 database state 與 annotated goal state,並以 passk 測多次執行可靠性。
Xie, T., Zhang, D., Chen, J., et al. (2024). OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments. OSWorld 建立真正 operating-system environment、初始狀態設定與 execution-based evaluator,用以評估跨應用 computer-use Agent。
Barres, V., Dong, H., Ray, S., Si, X., & Narasimhan, K. (2025). τ²-Bench: Evaluating Conversational Agents in a Dual-Control Environment. 該 benchmark 讓 user 與 Agent 都能透過工具修改共享世界,提供世界不是單一 Agent 完全控制的測試環境。
He, Z., Wang, Y., Zhi, C., et al. (2026). MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks. MemoryArena 將記憶與行動放入跨 session 的 Memory–Agent–Environment 閉環,直接測試過去經驗能否改善後續行動。
Uddin, M. N., Shubham, K., Blanco, E., Baral, C., & Wang, G. (2026). From Recall to Forgetting: Benchmarking Long-Term Memory for Personalized Agents. Memora 將長期記憶評估由單純 recall 擴展至 reasoning、recommendation 與 forgetting-aware memory accuracy,特別懲罰失效記憶的錯誤重用。
Yuan, M., Zhou, Z., Xiong, X., et al. (2026). OSWorld2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks. OSWorld 2.0 以更長的專業級 computer workflows 壓力測試 constraint retention、dynamic information、hidden-state inference 與 verification。
Neo.K with Aletheia. (2026). 有限分元—無限外場閉環的計算實驗:從動態工作場到展開式智慧體. 舊稿已建立 G0–G7 階梯式比較、消融、總作用量、OOD、可反駁條件與 JSONL 實驗帳本。第二代 Benchmark 保留其可實驗骨架,再加入跨尺度概率、意圖吸引子與第二代記憶指標。