IPM v0.1 Canonical Index:智能物理計量學系列總論、統一符號表與 v0.2 實驗入口
Intelligence Physical Metrology v0.1 — Canonical Series Index, Unified Notation, and Experimental Entry Point
系列:《智能的物理計量:從最小語意執行到成果品質與計算時空》
英文系列: Physical Metrology of Intelligence: From Minimal Semantic Execution to Quality and Computational Spacetime
系列代號: EML-IPM
作者: Neo.K with Aletheia(GPT-5.6 Sol)
機構: EveMissLab/一言諾科技有限公司
版本: v0.1 Canonical Index
日期: 2026-09-02
狀態: Theoretical Series 10/10 COMPLETE
用途: 網站系列首頁、GitHub README、後續實驗與 v0.2 reference implementation 的 canonical entry point
0. 一句話版本
IPM 研究的不是「AI 有幾分聰明」,而是:
一個智能系統在指定任務下, 以多少物理計算時空與多少外部鷹架, 完成多少有效語意工作, 最後產生多少可驗證品質?
1. IPM Canonical Intelligence Event
IIPM=(T,QIPM,Nμ,Pcompute,SC,M).
其中:
- T:Task / Specification Object;
- QIPM:Quality Object;
- Nμ:Semantic Work Object;
- Pcompute:Physical Computation Object;
- SC:Scaffolding Capability Record;
- M:Measurement Metadata。
IPM 的核心不是找一個 AI IQ,而是比較:
Pcompute→Nμ→QIPM.
2. 系列依賴圖
Paper 01 Turn / LOOP / Single Pass
│
├──> Paper 02 μI Semantic Execution
│ └──> Paper 03 Cognition ↔ Neural Evidence
│ └──> Paper 04 ATP / Joule / Thermodynamics
│ └──> Paper 05 Physical Cost + CST
│
├──> Paper 06 Formal / Structured Quality
│ └──> Paper 07 IBQF / Binary Human Residual
│ └──> Paper 08 High-Ambiguity Quality Ontology
│
└──────── Paper 05 + Paper 08 ───────> Paper 09 Scaffolding
└──> Paper 10 Unified IPM
三條主線:
P01→P02→P03→P04→P05
為 Execution / Physical Line;
P06→P07→P08
為 Quality Line;
(P01,P05,P08)→P09→P10
為 Capability / Integration Line。
3. Paper 01–10 Canonical Map
| Paper |
核心問題 |
Canonical 輸出 |
| 01 |
一輪到底是哪一種一輪? |
U,G,I,L,R,S,P ;ELI;Interaction Compression |
| 02 |
智能「算一次」是什麼? |
μI ; Nμgross/eff ;semantic state transition |
| 03 |
認知如何跨層對到神經事件? |
Cross-Level Triangulation;measurement grade |
| 04 |
神經事件如何對到 Joule? |
gross/base/marginal/attributed energy;Landauer type safety |
| 05 |
FLOPs 之外的物理成本是什麼? |
CP ; VCST ; ΘCST |
| 06 |
成果品質怎麼客觀量? |
Formal / Structured / Residual Quality;Hard Gate |
| 07 |
人類主觀品質怎麼低負擔量? |
IBQF/BRQM;binary/pairwise → latent quality |
| 08 |
高歧義成果有哪些品質維度? |
Typed Quality Ontology;Construct Graph |
| 09 |
拿掉 LOOP 還剩多少 native capability? |
SSR、SDR、SCM、scaffolding ablation |
| 10 |
如何統一比較智能產率? |
IIPM ;Pareto frontier;reporting standard |
4. Canonical Layer Stack
L4L3L2L1L0:Task Achievement / Quality:Semantic Execution:Algorithmic / Representational Realization:Physical Computation:Thermodynamic Realization.
重要:
L4=L3=L2=L1=L0.
各層可以建立映射,但不可互相偷換。
5. 統一符號:Turn / Execution
| 符號 |
定義 |
| X |
Task input |
| S |
Success specification |
| W |
Evaluation environment |
| U |
User Interaction Turns |
| G |
Generation Trajectories |
| I |
Model Invocations |
| L |
External Feedback Loops |
| R |
Retries / Rollouts |
| S |
Selection / Verification |
| τ |
Single solving trajectory |
| ELI |
Externally Loopless Intelligence |
最乾淨的 single-pass 條件:
U=1,G=1,R=1,L=0,S=0.
但:
NoExternalLoop=NoSequentialComputation.
6. 統一符號:Semantic Work
μI=Minimum Intelligent Semantic Execution Unit.
Operationally:
μI:zt→zt+1
其中該 transition 必須是 task-relevant、causally useful、在指定 semantic resolution 下 operationally minimal。
Token=μI=FLOP.
Nμgross
表示候選語意活動總量;
Nμeff
表示對成果具有有效因果貢獻的語意工作量。
ημ=NμgrossNμeff.
7. 統一符號:Cross-Level Realization
μI→ρC(μI)→ρP(μI)→ρT(μI).
- ρC:algorithmic/computational realization;
- ρP:physical trace;
- ρT:thermodynamic realization。
因此:
1μI=Constant FLOPs
且:
1μI=Constant Joule.
8. 統一符號:Energy
E=(Egross,Ebase,Emarg,Eattrib,Ethermo,min).
Egross=∫t0tfPsystem(t)dt
Emarg=∫t0tf[Psystem(t)−Pbaseline(t)]dt.
Landauer:
Eerase,min=kBTln2
但:
LandauerBound=ActualIntelligenceCost.
9. 統一符號:Physical Computation
CP=(O,BM,BI,BN,VM,VC,T,E).
其中:
O=(OFP64,OFP32,OBF16,OFP16,OINT8,…)
BM=(Breg,Bcache,Bsram,Bhbm,Bhost).
Memory residency:
VM=∫Mresident(t)dt.
Device time:
VC=∫D(t)dt.
10. Computational Spacetime
資源場:
R(t)=(rC(t),rM(t),rN(t),rS(t)).
Raw CST:
VCST=∫R(t)dt=(VC,VM,VN,VS).
IPM v0.1 的重要 type-safety rule:
VC+VM+VN+VS
在沒有 normalization 前沒有物理意義。
因此:
CST=VectorFirst.
11. Computational Spacetime Topology
ΘCST=(Twall,Tserial,Pparallel,Dpeak,Mpeak,Bpeak,Γcomm).
所以:
SameCSTVolume=SameCSTTopology.
8GPU×10s 與 1GPU×80s 可以具有相同 device-time volume,但 latency、peak capacity、communication 與 deployability 不相同。
12. 統一符號:Quality
Structured Quality:
QS=(QC,QA,QK,QR,QB,QV,QP).
對應:
- Correctness;
- Alignment;
- Completeness;
- Consistency;
- Robustness;
- Verifiability;
- Provenance。
三層品質:
QL=(QF,QS,QH).
- QF:Formal Objective;
- QS:Structured Objective / Semi-Objective;
- QH:Human Residual。
13. High-Ambiguity Quality Ontology
Q[d,τ,c,a]
其中:
- d:domain / modality;
- τ:task;
- c:context;
- a:audience / evaluator population。
Q=Qcore⊕Qdomain⊕Qtask.
品質測量鏈:
Task→Construct→Indicator→Item→Observation→LatentEstimate.
因此:
Construct=Indicator=Item=Metric.
14. IBQF / BRQM
微觀回答:
bi∈{0,1}.
宏觀 latent quality:
θ∈Rd.
因此:
BinaryObservation=BinaryPhenomenon.
基本映射:
{0,1}N→θH.
母原則:
評分者負責做容易、局部、具體的判斷; 測量系統負責做困難、全域、連續的量化。
15. Scaffolding
S=(ST,SR,SN,SV,SE,SM,SP).
- ST:Tool / External Information;
- SR:Retry;
- SN:Multi-sample / Best-of-N / Self-Consistency;
- SV:Verifier / Critic;
- SE:Environment Feedback;
- SM:External / Persistent Memory;
- SP:Planner / Controller。
Single-pass:
QSP=Q(M,0).
Full system:
QF=Q(M,SF).
16. SSR / SDR / SCM
SSR=QFQSP
SDR=1−SSR.
SCMj=CjSPCjF.
SSR/SDR 必須與 physical overhead 一起解讀,不能把 scaffold dependence 本身當成缺陷。
Loop=Cheating.
真正需要避免的是能力來源與成本被隱藏。
17. Intelligence Yield
若品質 projection 已公開:
Q∗=ΠQ(Q),
則:
YI=(EmargQ∗,VCQ∗,VMQ∗,BMQ∗,BNQ∗,TQ∗).
語意產率:
Yμ/E=EmargNμeff
YQ/μ=NμeffQ∗.
18. No Premature Scalarization Principle
能保留向量時,不先壓成總分; 能保留結構時,不先壓成平均; 能保留不確定性時,不先假裝精確。
Scalarization 只有在 task、policy、weights、gates 與 boundary 明示後才合法。
19. Pareto Comparison
若:
QA⪰QB
且所有 relevant cost axes:
CA,j≤CB,j
並至少一軸嚴格較優,則:
A≻IPMB.
若不是 dominance:
保留 trade-off,不強迫總排名。
20. IPM Minimum Reporting Standard v0.1
最低報告欄位:
Task
- Task ID / Task Text
- Success Specification
- Evaluation Environment
- Quality Boundary
- Physical Boundary
Quality
- Quality Schema
- Ontology Version
- Hard Gates
- Objective Verification
- Human Residual Protocol
- Quality Uncertainty
Execution
- Single-Pass / Full-System Flag
- Model Invocation Count
- Trajectory Count
- Retry Count
- Tool Calls
- Verifier / Selector Class
Physical
- Hardware
- Software / Runtime
- Wall Time
- Device Occupancy
- Peak Memory
- Memory Residency
- Memory Traffic
- Interconnect Traffic
- Energy Type
- Energy Boundary
Hidden / Discarded Work
- Candidate Count
- Discarded Attempts
- Wasted Physical Cost
Measurement
- Quality Grade
- Semantic Grade
- Energy Grade
- CST Grade
- Scaffolding Grade
- Scalarization / Projection Rule,如有。
21. Canonical Comparison Protocol
- Freeze Task: T。
- Freeze Quality Ontology: Qschema,VersionQ。
- Run Single Pass: (QSP,PSP)。
- Run Scaffolded: (QF,PF)。
- Compute SSR / SDR / SCM / ΔP。
- 可行時估 Nμ。
- 建立 FIPM。
- 若決策真的需要 scalar,才公開 ΠQ,ΠC。
- 報 measurement grades 與 uncertainty。
- 保存 raw trace / provenance。
22. 系列核心 Invariants
Token=μI=FLOP.
OneUserTurn=OnePhysicalTurn.
NoExternalLoop=NoSequentialComputation.
Pass@k=Pass@1.
SystemCapability=ModelNativeCapability.
SemanticWork=PhysicalWork.
FLOPs=PhysicalComputationalCost.
GrossEnergy=MarginalEnergy.
LandauerBound=ActualIntelligenceCost.
Quality=UniversalScalar.
FormalVerification=RealWorldGoalCorrectness.
BinaryObservation=BinaryPhenomenon.
Reliability=Validity.
Novelty=Creativity.
Loop=Cheating.
InvisibleOutput=ZeroCost.
SameQuality=SamePhysicalCost.
Scalarization⇒DeclaredPolicy.
Measurement⇒Uncertainty+Boundary+Version.
23. 五個 v0.1 可證偽命題
F1 — Token Hypothesis
若 token 是良好普適智能工作單位,則:
TokenCountNμeff
應跨 model / language / phrasing 相對穩定。
F2 — FLOPs Sufficiency
若 FLOPs 足夠描述物理成本,控制 FLOPs 後:
T,E,BM,BN,VM
不應仍有巨大獨立差異。
F3 — Binary Burden Hypothesis
若 BRQM 的低負擔假說成立,適當 binary / pairwise protocol 應在至少部分場景改善 response time、consistency、dropout、predictive validity 或 fatigue。
F4 — Scaffolding Separation
若 QF−QSP 在多數任務與 compute budgets 顯著存在,則 native / system capability separation 具有實證必要性。
F5 — Semantic Intermediate Utility
若 Nμ 無法改善 efficiency prediction、error explanation、scaffold analysis 或 cross-architecture comparison,則 μI 應被修正甚至淘汰。
24. IPM v0.2:不要先做大平台
v0.2 的第一步應是最小可證偽實驗,而不是立刻做完整產品。
Experiment A — Single-Pass vs Scaffolded
優先用 math / code / structured reasoning,因為 Q 容易客觀驗證。
條件:
- A0:single pass;
- A1:longer internal budget;
- A2:multi-sample;
- A3:verifier;
- A4:tool / environment;
- A5:full agentic loop。
每層記:
(Qk,Ek,Tk,VC,k,VM,k,BM,k,BN,k).
Experiment B — Binary vs Numeric Human Measurement
比較:
- direct 0–10;
- structured Yes/No;
- adaptive pairwise。
量:response time、missingness、inconsistency、test-retest、predictive validity、fatigue。
Experiment C — μI Operational Identification
選 proof steps、code repair、constraint puzzle,建立 candidate semantic transition,再做 ablation / counterfactual replacement。
Experiment D — Physical Trace Alignment
先從同一台機器的:GPU power telemetry、latency、memory peak、memory bandwidth、device occupancy 做起。
v0.2 不必一開始宣稱 data-center-level energy。
Experiment E — Token / FLOPs Proxy Failure Test
選相同 task quality、不同 language / verbosity / context / memory pressure 的執行,比較:
TokenCount,FLOPs,E,T,BM,Nμeff.
25. v0.2 推進順序
推薦:
A→D→B→C→E.
原因:
- 先確認 scaffolding gap 是否穩定存在;
- 建立 physical telemetry;
- 驗證 IBQF/BRQM 的人類測量負擔假說;
- 再攻最難的 μI ;
- 最後挑戰 token / FLOPs proxy。
26. v0.2 最小 Run Schema
ipm_version: "0.2-experimental"
task:
id:
specification_version:
quality_schema_version:
execution:
mode: single_pass | scaffolded
trajectories:
retries:
tool_calls:
verifier_passes:
quality:
hard_gate:
structured_vector:
human_residual:
uncertainty:
grade:
semantic:
mu_count_gross:
mu_count_effective:
confidence:
grade:
physical:
wall_time_s:
energy_type:
energy_j:
device_time:
memory_peak_bytes:
memory_residency_byte_s:
memory_traffic_bytes:
interconnect_bytes:
boundary:
grade:
provenance:
model:
hardware:
software:
timestamp:
27. Versioning Rule
任何下列定義改變都應 bump version:
- μI definition;
- quality ontology;
- CST normalization;
- scaffold taxonomy;
- reporting schema。
因此:
MeasurementDefinitionChange⇒VersionChange.
28. 系列最終母命題
智能不只在於能否得到答案, 還在於一個物理世界中的系統, 為了得到這個答案, 究竟必須執行多少有效語意工作, 占用多少計算時空, 消耗多少能量, 依賴多少外部鷹架, 最後換回多少可驗證品質。
29. Canonical Status
EML-IPM v0.1=10 Papers+Canonical Index+Unified Notation+Experimental Entry Point.
下一個 canonical milestone:
IPM v0.2 — Experimental Measurement Protocol
它的目的不是證明 IPM v0.1 正確,而是讓 IPM 的核心命題第一次真正有機會被:
支持、修正、或證偽。