ESC-EXP-28:Automatic Semantic Residual Factor Discovery / Provenance Factor Compiler
系列: Extensional Structural Convergence — Experimental Phase
文件編號: ESC-EXP-28
版本: v0.1
日期: 2026-09-23
前置: ESC-00 ~ ESC-06、ESC-EXP-00 ~ ESC-EXP-27
狀態: Automatic Residual Factor Discovery / Provenance Compiler Experiment
作者: Neo.K
機構: EveMissLab/一言諾科技有限公司
摘要
ESC-EXP-27 已經證明:
如果多個 future tasks 共用同一批 latent distinctions,provenance code 應沿 shared latent dependency 分解,而不應只沿 task/API boundary 重複保存。
但是 EXP-27 的:
ZA-only,Zshared,ZB-only
仍然是人工指定。
本輪拿掉這個人工 factor design。
runtime 只收到:
- Hot representation:H;
- primitive residual atoms;
future task family:
$$
\mathcal J
{J_1,\dots,J_m};
$$
- query workload;
- 每個 factor 的 metadata/index cost:κ.
然後自動編譯 provenance factors。
本輪首先定義每個 primitive residual atom:
r
的 task-incidence signature:
σ(r)=(1[r∈J1],…,1[r∈Jm]).
再定義:
ri∼taskrj⟺σ(ri)=σ(rj).
其 quotient:
Zinc=R/∼task
就是:
所有被完全相同 task subset 使用的 primitive residual atoms 自動合併成同一 shared factor。
在 EXP-27 的 A/B task family 中,compiler沒有任何人工提示就自動找回:
{R00},{R01,R10},{R11}.
也就是:
A-only,Shared,B-only.
更重要的是:
在完整 4-atom Bell partition space中共有:
B4=15
種 factorization。
對 A/B family:
- zero-overread factorizations共有:2;
- 最少 factor count:3;
- 唯一 canonical 3-factor minimum正是 task-incidence quotient。
因此本 finite separable residual model中:
Task-Incidence Quotient=coarsest zero-overread factorization.
加入第三個 task:
C
後,原本:
R01
與:
R10
不再具有同一 incidence signature。
所以 compiler自動把原本 shared factor拆開:
3→4 factors.
這表示:
factorization is task-family-relative.
同一 latent state structure,在 task family改變後,最佳 factor boundaries也會改變。
本輪第二條主線則加入 factor metadata cost:
Cκ(Z)=E[read bits]+κ∣Z∣.
當:
κ=0,
compiler偏好 zero-overread factorization。
當:
κ
升高,runtime會接受部分 semantic over-read,以換取更少 factors。
因此 factor compiler本身出現 phase transitions。
A/B Uniform
3→1
在:
κ=0.1125
發生。
2-factor states只在 breakpoint tie,不具有正寬度最優區間。
A/B Skewed
則真正出現:
3→2→1.
breakpoints:
0.073299438193,0.166378089866.
A/B/C Uniform
由於完全對稱:
4→1
並在:
κ=0.0625
出現 4 / 3 / 2 / 1 factor 多重 tie。
A/B/C Skewed
對稱性被 prior 打破後,完整 sequence變成:
4→3→2→1.
breakpoints:
0.040721910107,
0.042014669158,
0.092432272148.
所以:
nonuniform information mass can resolve factorization degeneracy and create genuine intermediate compiler regimes.
這是 EXP-28 的主要結果。
1. Runtime
EXP-28 regression:
6 passed
測試包括:
- 4 primitive residual atoms共有 15 種 set partitions;
- A/B compiler自動找回 EXP-27 三因素結構;
- incidence quotient確實為 coarsest zero-overread factorization;
- A/B/C family自動碎裂成 4 factors;
- 任意正 metadata cost會讓 A/B 選 3-factor incidence quotient而非 4 primitive factors;
- sufficiently large metadata cost最終使 compiler選 monolithic single factor。
2. Primitive Residual Atoms
H4 的四個 Hot regions:
00,01,10,11.
每區都有一個 hidden:
G
distinction。
因此 primitive residual atoms:
R={R00,R01,R10,R11}.
3. Uniform Atom Information
Uniform prior:
I(R00)=I(R01)=I(R10)=I(R11)=0.25 bit.
所以 total universal residual:
1 bit.
4. Skewed Atom Information
Skewed:
I(R00)=0.369729088590,
I(R01)=0.168058676632,
I(R10)=0.110602718809,
I(R11)=0.162887640428.
總和:
0.811278124459.
與 EXP-25:
H(S∣H4)
完全一致。
5. A/B Task Family
Task A:
{R00,R01,R10}.
Task B:
{R01,R10,R11}.
所以 incidence signatures:
σ(R00)=(1,0),
σ(R01)=(1,1),
σ(R10)=(1,1),
σ(R11)=(0,1).
因此:
R01∼taskR10.
其它 atoms皆不同類。
6. Automatic A/B Factorization
compiler得到:
Z1={R00},
Z2={R01,R10},
Z3={R11}.
沒有任何:
語義標籤被硬寫進 compiler。
這些語義完全由:
σ(r)
自動產生。
7. 自動重建 EXP-27
因此 EXP-27 的人工 factorization:
A-only,Shared,B-only
在 EXP-28 被重新導出為:
task-incidence equivalence classes.
這表示 shared semantic layer不是任意 human design。
至少在目前 separable finite domain中,它具有 canonical combinatorial construction。
8. Coarsest Zero-Overread Theorem — Finite Model
定義 factorization:
Z
為 zero-overread,若每個 task只讀它真正需要的 residual atoms:
Eoverread(Z)=0.
若同一 factor中含有:
ri,rj
而:
σ(ri)=σ(rj),
必存在某個 task:
該 task一旦讀此 factor,就必 over-read。
因此 zero-overread要求:
每個 factor只能包含同一 incidence signature 的 atoms。
所以最粗的 zero-overread factorization就是 incidence quotient。
9. A/B Exhaustive Verification
4 atoms所有 set partitions:
15.
A/B zero-overread:
2.
分別是:
Fully Atomic
4 factors.
Incidence Quotient
3 factors.
而 minimum:
3.
與 compiler quotient完全一致。
10. 為什麼 4-Factor 也 Zero-Overread?
因把:
R01
與:
R10
分開存當然仍可精確 selective read。
只是它多付一個:
factor metadata / index boundary.
所以只要:
κ>0,
且不產生其它差異,
3-factor quotient嚴格優於 4-factor primitive representation。
11. Task-Incidence Quotient Principle
因此可以提出:
Task-Incidence Quotient Principle.
在 primitive residual atoms可分離、task dependency已知、且要求 zero-overread時:
把所有具有相同 task-incidence signature 的 residual atoms合併,得到 coarsest zero-overread semantic factorization。
12. A/B Storage Compression
Uniform:
naive task-wise storage:
1.5.
compiler factor storage:
1.
下降:
33.33%.
Skewed:
1.089939519900→0.811278124459.
下降:
25.57%.
精確重現 EXP-27。
13. A/B Expected Selective Read
workload仍沿用:
P(A)=0.45,
P(B)=0.45,
P(AB)=0.10.
incidence quotient沒有 over-read。
Uniform:
0.775 bits/query.
Skewed:
0.571600596401.
14. 加入第三個 Task C
定義:
C={R00,R10,R11}.
此時 signatures:
R00:(1,0,1),
R01:(1,1,0),
R10:(1,1,1),
R11:(0,1,1).
四個全部不同。
15. Shared Factor 被 Task Family 拆開
A/B 時:
R01∼R10.
加入 C 後:
σ(R01)=(1,1,0),
σ(R10)=(1,1,1).
所以:
R01∼R10.
原本 shared factor:
{R01,R10}
被自動拆成兩個。
因此:
3→4 factors.
16. Factorization 不是 Latent Space 的固定真相
這是一個重要概念:
同一 underlying residual:
R
在不同 task family:
J
下具有不同 canonical factorization。
因此應寫:
Z∗=Z∗(R,J).
而不是:
Z∗(R)
而已。
17. 三 Task Storage 去重
A/B/C 三個 tasks如果各存完整 task-specific residual:
Uniform:
2.25 bits.
factorized universal residual仍只:
1.
下降:
55.56%.
Skewed:
1.733158967727→0.811278124459.
下降:
53.19%.
18. 更多 Tasks 可以提高 Storage Duplication Tax
增加 task count並不增加 underlying universal residual資訊:
H(S∣H)
本身。
但 naive task-wise coding會隨 task overlap反覆複製相同 residual atoms。
所以:
task count↑⇒true latent information↑,
但:
naive task-boundary storage
可能快速膨脹。
19. Factor Metadata Cost
真正 runtime每個 factor都不是免費的。
可能需要:
- ID;
- offset;
- checksum;
- index entry;
- routing metadata;
- access-control tag;
- compression header;
- dependency metadata。
所以定義:
κ=per-factor overhead.
20. Compiler Objective
本輪:
Cκ(Z)=E[Lread]+κ∣Z∣.
其中 storage information本身在完整 universal residual factorization間保持不變,
所以本輪專注:
selective read↔factor count.
21. Factor Merge 會造成 Over-Read
假設把:
A-only
與:
Shared
合併。
B task需要 Shared,但不需要 A-only。
現在讀 merged factor時:
B 必須 over-read A-only bits.
所以 factor reduction不是免費。
22. Compiler Trade-Off
因此:
細 Factorization
優點:
- selective read精確;
- over-read低。
缺點:
- metadata多;
- index多;
- routing複雜。
粗 Factorization
優點:
- factor count少;
- metadata低。
缺點:
23. A/B Uniform Phase
Uniform:
incidence quotient:
3 factors,
read:
0.775.
monolithic:
1 factor,
read:
1.
差:
0.225.
少兩個 factors。
所以 break-even:
0.775+3κ=1+1κ.
得到:
κ=0.1125.
24. A/B Uniform Degeneracy
在:
κ=0.1125
3-factor、某些 2-factor、以及 1-factor方案全部同 cost。
但 2-factor沒有正寬度 optimal interval。
所以:
3→1
是實際 regime transition。
25. A/B Skewed:真正三階 Phase
Skewed:
3-Factor
E[L]=0.571600596401.
2-Factor
compiler自動選:
{R00},{R01,R10,R11}.
read:
0.644900034594.
over-read:
0.073299438193.
26. 為什麼 Skewed 先 Merge B-Only?
因:
R11
information mass:
0.162887640428
而與 shared factor合併後,主要讓不需要它的 query多讀這部分。
相較其它 merge candidates,這在目前:
- atom information;
- query frequencies;
組合下 penalty最低。
所以 compiler不是在數 atoms。
它在做:
information-weighted workload optimization.
27. A/B Skewed Breakpoint 1
3-factor與2-factor:
0.571600596401+3κ
與:
0.644900034594+2κ.
交點:
κ=0.073299438193.
28. A/B Skewed Breakpoint 2
2-factor與monolithic:
0.644900034594+2κ
與:
0.811278124459+κ.
得到:
κ=0.166378089866.
29. A/B Skewed Phase Sequence
因此:
κ<0.0732994:3,
0.0732994<κ<0.1663781:2,
κ>0.1663781:1.
即:
3→2→1.
30. Prior 會改變 Compiler Topology
Uniform:
3→1.
Skewed:
3→2→1.
同一 tasks、同一 latent atoms、同一 metadata model,
只改 probability prior,
factorization phase geometry就改變。
所以:
factor topology is prior-sensitive.
31. A/B/C Uniform
三 task下 zero-overread必須:
4 factors.
expected exact read:
0.8125.
monolithic:
1.
差:
0.1875.
少:
3
個 factors。
因此:
30.1875=0.0625.
32. Symmetry-Induced Multiway Tie
Uniform A/B/C在:
κ=0.0625
出現:
4,3,2,1
factor方案的多重 lower-envelope tie。
所以沒有正寬度 intermediate regimes。
這是一種:
symmetry degeneracy.
33. A/B/C Skewed 解除 Degeneracy
Skewed atom bits不等。
結果完整:
4→3→2→1.
breakpoints:
0.040721910107,
0.042014669158,
0.092432272148.
34. 第一個 3-Factor Merge
compiler先選:
{R10,R11}
合併。
這兩者 task signatures:
(1,1,1),
與:
(0,1,1).
差異只在 Task A。
所以只有需要:
R10
但不需要:
R11
的 A-side queries會 over-read。
35. 第一個 Over-Read Penalty
4-factor exact:
0.636109273047.
3-factor:
0.676831183154.
所以:
Δread=0.040721910107.
正好等於第一個:
κ
breakpoint。
36. 第二個 2-Factor State
再把:
R01
併入:
R10,R11,
得到:
{R00},{R01,R10,R11}.
expected read:
0.718845852312.
over-read:
0.082736579265.
37. Final Monolithic State
全部 residual atoms:
{R00,R01,R10,R11}
變成單 factor。
任何 nontrivial task都讀完整 residual:
0.811278124459.
expected over-read:
0.175168851413.
但 metadata只剩一份。
38. Automatic Compiler 已經做了什麼?
本輪 runtime已自動完成:
- primitive residual extraction;
- task-incidence signature;
- zero-overread quotient;
- exhaustive factorization enumeration;
- expected read evaluation;
- semantic over-read measurement;
- metadata/read trade-off;
- lower-envelope breakpoint search;
- prior-conditioned phase selection。
這已經是第一個非常小型的:
Provenance Factor Compiler.
39. Compiler Input / Output
輸入:
(H,R,J,πquery,pS,κ).
輸出:
Z∗={Z1,…,Zk}.
以及每個 task/query應讀哪些 factors。
40. Zero-Overread Mode
若:
κ
很低,
或 application要求 strict semantic isolation,
compiler可使用:
Zinc
task-incidence quotient。
這是:
exact selective decode mode.
41. Metadata-Constrained Mode
若:
- factor index很昂貴;
- storage object count有限;
- random-access descriptors太重;
則:
κ
上升。
compiler可以選:
controlled over-read
以換取更少 factors。
42. Over-Read 是新的 Rate
定義:
O(Z)=E[LZ]−E[Lexact].
所以 compiler不再只看:
stored bits.
還要看:
unnecessary fetched bits.
43. Storage、Read、Metadata 三軸
更完整 cost:
C=(Cstore,Cread,Cmeta).
EXP-28目前 universal residual storage固定,
所以主要研究:
(Cread,Cmeta).
未來若允許 factor-specific compression,三軸都會變。
44. Factor Count 不是越少越好
Monolithic residual:
k=1
metadata最少。
但 selective read最差。
Primitive:
k=4
read最精細。
但 metadata可能浪費。
所以:
optimal factor granularity
是一個 resource-dependent quantity。
45. Task Family 增加可能使 Factorization 變細
A/B:
3 zero-overread factors.
A/B/C:
4.
原因不是 underlying state更複雜。
而是新的 task讓原本兩個 atoms的 incidence signatures分離。
所以:
more semantic obligations can increase required factor resolution.
46. Task Removal 則可以重新 Merge
反過來,如果 Task C消失:
R01
與:
R10
signature再次相同。
compiler可重新 merge。
因此 factor architecture可隨 workload/task family動態演化。
這直接接回 EXP-19:
Dynamic Abstraction Control.
47. Compiler Churn 問題重新出現
如果 tasks持續進出,
factorization:
Zt
也會改變。
這會產生:
- factor migration;
- code rewrite;
- index rebuild;
- provenance remap。
所以未來 dynamic compiler也應加入:
Churn(Zt,Zt+1).
48. ESC 的閉環越來越完整
EXP-18:
partition canonicalization.
EXP-19:
dynamic partition control.
EXP-24:
tier placement.
EXP-25:
bit-level provenance cost.
EXP-26:
task-selective read.
EXP-27:
shared latent factors.
EXP-28:
automatic factor compilation.
這些已經開始形成完整 representation compiler stack。
49. Incidence Quotient 與 Contextual Equivalence
primitive atoms:
ri,rj
若對所有目前 tasks具有完全相同的使用 signature:
σ(ri)=σ(rj),
則在:
current task context family
下,它們對 factor-routing行為不可區分。
這其實是一種新的 contextual equivalence。
50. Future Task 可以打破 Factor Equivalence
A/B 時:
R01≡taskR10.
加入 C:
R01≡taskR10.
所以:
current factor equivalence=future factor equivalence.
這又直接呼應 EXP-15:
current zero distinction=future zero capability difference.
51. Factor Compression 也需要 Future Obligation
如果未來 task family未知,
過早 merge factors可能讓新的 task產生 over-read或必須重構 factor store。
因此 provenance factorization同樣有:
future obligation price.
整條 ESC 線又重新接在一起。
52. 本輪錨點
ESC-EXP-28.Ari∼taskrj⟺σ(ri)=σ(rj)
在本 finite separable model中生成 coarsest zero-overread factorization。
ESC-EXP-28.Bcompiler無人工 factor 標籤即可重建 EXP-27 的 A-only / Shared / B-only。
ESC-EXP-28.C加入新 task 可打破既有 factor equivalence 並使 zero-overread factorization 變細。
ESC-EXP-28.DCκ=E[Lread]+κ∣Z∣
產生 factor-granularity phase transitions。
ESC-EXP-28.Eskewed prior可解除 uniform symmetry degeneracy,產生真正的 intermediate factor regimes。
53. 下一輪:ESC-EXP-29
EXP-28 已經會:
已知 primitive residual atoms後,自動決定怎麼 grouping。
但它仍假設:
primitive residual atoms本身已知。
也就是我們已經知道:
R00,R01,R10,R11
是底層可分解單位。
真正更難的一步是:
Automatic Residual Atom Discovery.
只給 runtime:
- underlying state observations;
- Hot projection;
- future task outputs;
不告訴它:
hidden residual究竟由哪些 primitive distinctions構成。
讓它自己找最小 residual basis:
R∗={r1,…,rk}
再做 EXP-28 的 factor compiler。
也就是從:
Factor Discovery Given Atoms
推進成:
Atom Discovery + Factor Compilation.
這會開始碰到真正的:
- minimal sufficient latent basis;
- residual dictionary learning;
- Boolean / information factorization;
- task-conditioned latent decomposition;
- provenance compiler front-end。
也就是 ESC 第一個真正「從 observations 自己長出 representation primitives」的實驗。