一輪到底是一輪什麼?:使用者回合、隱藏 LOOP 與單次智能的重新定義
What Is a “Single Turn,” Really? User Turns, Hidden Loops, and the Redefinition of Single-Pass Intelligence
系列:《智能的物理計量:從最小語意執行到成果品質與計算時空》
英文系列: Physical Metrology of Intelligence: From Minimal Semantic Execution to Quality and Computational Spacetime
系列編號: EML-IPM
篇次: Paper 01 / 10
文件編號: EML-IPM-01
作者: Neo.K with Aletheia(GPT-5.6 Sol)
機構: EveMissLab/一言諾科技有限公司
版本: v0.1
日期: 2026-09-02
文件性質: 公開純理論論文
摘要
當代 AI 評測與產品敘事經常使用「一輪完成」「one-shot」「single turn」描述能力,但這些詞在介面、Agent、模型推理與物理計算層面不是同一件事。
使用者只輸入一次:
U1→A1
背後仍可能實際展開為:
M1→Tool1→M2→Verifier1→M3→⋯→Mn.
因此:
One User Turn=One Model Invocation=One Generation Trajectory=One Agent Loop=One Physical Computation.
本文提出 AI 回合分解框架(Turn Decomposition Framework):
T=(U,G,I,L,R,S,P)
其中:
- U:User Interaction Turns;
- G:Generation Trajectories;
- I:Model Invocations;
- L:External Feedback Loops;
- R:Retries / Rollouts;
- S:Selection / Verification;
- P:Physical Execution Trace。
本文認為「一輪」最大的概念錯誤,是把:
Interaction Compression
誤認為:
Computation Compression.
當 300 次內部 Agent 互動被藏進一個聊天泡泡裡,使用者確實只互動一次,但物理世界並沒有只計算一次。
本文進一步定義 Externally Loopless Intelligence(ELI,外部無迴圈智能):在一個任務執行期間,系統不能根據外部世界、工具輸出、獨立 verifier、另一候選答案或 retry 結果重新修正求解方向。
這不表示模型內部沒有時間序列。自回歸模型仍然:
y1→y2→⋯→yn.
所以:
No External Loop=No Sequential Computation.
真正被排除的是:
Action→New Evidence→Replanning.
本文將最乾淨的單次成果記為:
XSP:xτno external feedbacky.
最後建立後續 IPM 系列共用事件向量:
E=(Q,U,G,I,L,R,S,T,E,VCST)
其中 Q 是成果品質, T 是實際時間, E 是能源, VCST 是 Computational Spacetime Volume。
因此,真正值得問的已不再是:
AI 是否「一輪」完成?
而是:
這個成果是在幾次互動、幾條生成軌跡、幾層 LOOP、 多少計算時空與多少物理能源下產生的?
1. User Turn 是介面單位,不是智能單位
最表面的「一輪」是:
U=1.
它只代表使用者:
因此 User Turn 本質上是:
UX event.
它沒有告訴我們背後到底發生多少計算。
2. 一個 User Turn 可以包含大量 Model Invocation
定義:
I=Model Invocation Count.
可能:
U=1,I=1,
也可能:
U=1,I=300.
所以:
U=1⇒I=1.
3. Model Invocation 也不是物理計算原子
即使:
I=1,
仍可能有:
- 長 context;
- 大模型;
- MoE routing;
- 多 GPU;
- 大量 memory traffic;
- 很長的自回歸生成。
因此:
I=1⇒P=1.
4. Generation Trajectory 必須獨立計數
定義:
G=Generation Trajectory Count.
如果同一題生成:
τ1,τ2,…,τ16
再選一個最好結果,那:
G=16.
即使最後只顯示一個回答。
所以:
One Visible Answer=One Generated Candidate.
5. Rollout 與 Pass@k 不能混入 Pass@1
若單次成功率為:
p,
允許 k 次獨立 rollout,至少成功一次的機率為:
1−(1−p)k.
例如:
p=0.2,k=16,
則至少成功一次約為:
1−(0.8)16≈0.972.
因此:
Pass@1=Pass@16.
以及:
BestOfN=MedianUserExperience.
6. Selection 本身就是額外能力來源
若先生成:
Y1,…,Yn
再透過 judge / verifier 選出:
Y∗,
那最終品質是:
Qfinal=F(Qgeneration distribution,Qselection).
它不是單一生成軌跡的能力。
7. LOOP 的真正定義不是「多講幾次」
本文把 External Feedback Loop 定義為:
Statet→Actiont→NewEvidencet+1→Statet+1.
核心是:
新資訊重新進入求解狀態.
8. Tool Loop
例如:
Model→Search→Evidence→Model.
或:
Code→Run→Error→Fix.
都屬於外部 LOOP。
9. Verifier Loop
Draft→Verifier→Critique→Revision.
這也不是 single-pass。
10. Retry Loop
Failure→Restart.
新的 trajectory 從頭再來,也是一種外部鷹架增益。
11. Candidate Loop
GenerateMany→Compare→Choose.
即使沒有修改候選,也已經增加了系統層能力。
12. LOOP Taxonomy
本文第一版分類:
L=(LT,LE,LV,LR,LC)
其中:
- LT:Tool Loop;
- LE:Environment Loop;
- LV:Verifier Loop;
- LR:Retry Loop;
- LC:Candidate / Selection Loop。
它們之後都應獨立計價。
13. 自回歸生成本身不是本文要排除的 LOOP
Transformer 仍然逐步產生:
P(yt∣x,y<t).
所以物理上當然有時間序列。
但若沒有新的外部證據進入:
Internal Sequential Generation=External Feedback Loop.
否則「No-Loop」會荒謬地變成「只准做一次矩陣乘法」。
14. Externally Loopless Intelligence
本文因此使用:
ELI=Externally Loopless Intelligence.
ELI 禁止:
- tool 回傳新證據;
- environment re-observation;
- retry;
- parallel rollout;
- independent verifier critique;
- best-of-N;
- 完整候選產生後再重新生成。
但允許同一 trajectory 內部的自回歸與 latent computation。
15. 最乾淨的 Single-Pass 條件
本文暫定:
U=1,G=1,R=1,L=0,S=0.
這才接近日常語言真正想表達的:
一次直接生成。
16. Interaction Compression
Agent 產品可以把大量內部工作壓縮成一次使用者互動。
定義:
CU=UNinternal interactions.
若:
CU≫1,
代表產品替使用者吸收了大量操作負擔。
這是很好的 UX。
17. 但 Interaction Compression 不是 Computation Compression
若 300 次工作被藏在一個 UI turn:
U=1,
仍不能推出:
Computation=1.
所以:
Interaction Compression=Computation Compression.
這是 IPM 系列第一條核心原則。
18. Scaffolding Separation Principle
系統成果可以表示為:
Qsystem=F(M,L,Tool,R,S,Env).
其中 M 是模型本身能力。
因此:
Qsystem=QM.
高品質 Agent 系統不等於底層模型 single-pass 也同樣強。
19. 四種能力層必須分開
本文區分:
Cintrinsic
模型在最小鷹架下的能力;
Celicited
透過 prompt、context、reasoning budget 被引出的能力;
Csystem
加入 tool、memory、loop、verifier 後的能力;
Cproduct
最終受到 UI、policy、quota、latency 等限制後的使用者能力。
所以:
Cbenchmark=Cuser.
20. LOOP 不是作弊
本文並不反對 LOOP。
有些問題本體就需要:
Action→World→Observation→Replan.
例如:
- debugging;
- 科學實驗;
- 機器人控制;
- 即時搜尋;
- 動態決策。
真正的錯誤只是:
Loop-Assisted Capability
被描述成:
Single-Pass Capability.
21. Single-Pass Intelligence 與 Loop Intelligence
因此至少需要兩條軸:
ISP=Single-Pass Intelligence
以及:
IL=Loop Intelligence.
ISP 問:
沒有外部重新餵答案時,第一條求解軌跡能直接做多好?
IL 問:
得到新證據之後,系統能不能有效修正?
真正強大的系統可能:
ISP↑+IL↑.
但兩者不能被一個 benchmark 分數混掉。
22. 物理世界還有第三種「一輪」
從任務開始 t0 到結果完成 tf,所有被此任務因果占用的物理計算資源形成:
Ptask={resource(t)∣t0≤t≤tf}.
這可以叫:
Physical Execution Episode.
它才接近物理世界真正付出的「一輪」。
23. Physical Execution 至少包含
P=(Ops,Memory,Interconnect,Device,Time,Energy).
因此:
Physical Turn=UI Turn.
24. Computational Spacetime Volume
若一個任務使用:
8 GPU×10s,
粗略 hardware-time volume 為:
80 GPU⋅s.
另一任務使用:
1 GPU×80s
也可能是:
80 GPU⋅s.
但 latency 不同。
因此 VCST 與 T 必須同時保留。
25. 不要太早壓成單一分數
智能計量更應先保留 Pareto 結構:
Q↑,E↓,T↓,VCST↓,L,R,S↓.
如果 A 在所有軸都更好,才有明確 dominance。
若各有優劣,就保留 trade-off。
26. 統一事件向量
本文最終定義:
E=(Q,U,G,I,L,R,S,T,E,VCST).
未來任何聲稱「一輪完成」的系統,至少都可以投影到這個事件向量。
27. 一個簡單比較
假設:
System A
EA=(0.95,1,1,1,0,1,0,5s,EA,VA).
System B
EB=(0.95,1,16,48,30,16,1,120s,EB,VB).
兩者:
QA=QB,UA=UB=1.
從聊天介面看完全可以都叫「一輪完成」。
但:
EA=EB.
甚至可能具有幾個數量級不同的智能物理效率。
28. 十二個 Canonical Invariants
Invariant 1
UserTurn=PhysicalTurn.
Invariant 2
UserTurn=ModelInvocation.
Invariant 3
ModelInvocation=GenerationTrajectory.
Invariant 4
GenerationTrajectory=ExternalLoop.
Invariant 5
SingleInteraction=SinglePassIntelligence.
Invariant 6
NoExternalLoop=NoSequentialComputation.
Invariant 7
Pass@k=Pass@1.
Invariant 8
BestOfN=MedianExperience.
Invariant 9
SystemCapability=ModelNativeCapability.
Invariant 10
InteractionCompression=ComputationCompression.
Invariant 11
SameFinalQuality=SameIntelligenceEfficiency.
Invariant 12
TokenCount=PhysicalComputationCost.
29. 結論:一個聊天泡泡不是智能的自然單位
「一輪」長期造成混亂,是因為同一詞被同時拿來描述:
- 使用者操作;
- Agent 執行;
- 模型呼叫;
- 自回歸生成;
- 物理資源消耗。
如果使用者只輸入一次:
U=1,
我們最多只能說:
這是 single-interaction UX。
不能直接推出:
這是 single-pass intelligence。
如果系統在背後搜尋、執行、驗證、重試、生成多個候選,再挑出最好的一個,那麼:
U=1
只是介面壓縮。
真正的:
L,R,S,VCST,E
仍然可能很大。
因此 IPM 系列從第一篇開始拒絕把聊天 UI 當成智能計量單位。
真正應被記錄的是:
E=(Q,U,G,I,L,R,S,T,E,VCST).
而如果我們想知道:
拿掉 LOOP 後,模型自己還剩多少智能?
就必須先把條件壓到:
U=1,G=1,R=1,L=0,S=0,
再測:
QSP.
但這仍不是終點。
因為即使我們成功隔離出一條 single-pass trajectory,仍然沒有回答:
這條軌跡裡,AI 究竟「算了多少次智能」?
Token 不能回答。
FLOP 也不能回答。
所以 Paper 02 必須進入整套 IPM 最困難的問題:
智能到底算了一次什麼?
也就是:
μI=Minimum Intelligent Semantic Execution Unit.
系列路徑
- Paper 01|一輪到底是一輪什麼?:使用者回合、隱藏 LOOP 與單次智能的重新定義
- Paper 02|智能到底算了一次什麼?:最小智能語意執行單位的候選理論
- Paper 03|從認知到神經元:人腦如何跨層測量智能計算
- Paper 04|從神經元到焦耳:智能計算的能量、熱力學與物理下界
- Paper 05|計算不是只有 FLOPs:記憶體、互連、硬體占用與計算時空體積
- Paper 06|成果品質到底怎麼量?:從形式化正確性到結構化智能品質
- Paper 07|不要叫人類替自己的感覺打分數:IBQF 二元測量與低負擔品質評估
- Paper 08|自然語言、圖像與創意如何被量?:高歧義成果的結構化品質空間
- Paper 09|拿掉 LOOP 還剩多少智能?:單次智能、鷹架依賴與隱藏計算成本
- Paper 10|一個答案值多少物理世界?:智能產率的統一計量框架