ESC-EXP-26:Task-Adaptive / Selective Provenance Coding
系列: Extensional Structural Convergence — Experimental Phase
文件編號: ESC-EXP-26
版本: v0.1
日期: 2026-09-23
前置: ESC-00 ~ ESC-06、ESC-EXP-00 ~ ESC-EXP-25
狀態: Task-Conditioned / Progressive Semantic Provenance Experiment
作者: Neo.K
機構: EveMissLab/一言諾科技有限公司
摘要
ESC-EXP-25 已經建立:
Ratomic(H)=H(S∣H)
也就是:
如果要求從 Hot representation 完整恢復 underlying atomic state,Cold provenance 的最小 asymptotic average rate就是 residual conditional entropy。
但真實 future task 未必每次都要求完整:
S.
某個 future task:
J=J(S)
可能只需要 underlying state 的一小部分 distinction。
因此本輪正式定義:
RJ(H)=H(J∣H)
為:
在 Hot representation H 已知時,精確回答 task J 所需要的最小 selective provenance rate。
更一般,對 task family:
F={J1,…,Jk},
定義:
RF(H)=H(J1,…,Jk∣H).
這使 Cold provenance 不必再被視為:
一次解碼整個 universal residual。
而可以做成:
按 future task 選擇性解鎖的 progressive semantic residual layers.
本輪沿用 H4 Hot partition:
{{∅,G},{D,DG},{T,TG},{TD,TDG}}.
它其實等價於:
Hot 已經完整知道 T,D,但仍隱藏 G。
所以設計四種核心 tasks:
Hot-native task
JH=T⊕D.
Hot 已經知道答案。
所以:
H(JH∣H)=0.
MID selective task
只在:
T⊕D=1
時需要知道 G。
OUTER selective task
只在:
T⊕D=0
時需要知道 G。
FULL task
需要完整:
G.
兩個 selective tasks:
JMID,JOUTER
恰好互補。
本輪得到:
H(JMID,JOUTER∣H)=H(G∣H).
而且在目前 finite domain:
H(JMID∣H)+H(JOUTER∣H)=H(G∣H).
所以兩個 selective layers可以無重疊地拼成 universal residual。
這重新形成一個:
B2
task-recoverability lattice。
更實際的是:
在同一份 universal provenance資訊總量不變的前提下,若 future tasks不總是需要 full residual,而是只 fetch 自己需要的 layer,
平均 provenance read cost 明顯下降。
本輪 experimental task prior:
P(JH)=0.4,
P(JMID)=0.3,
P(JOUTER)=0.2,
P(JFULL)=0.1.
Uniform prior:
universal monolithic:
0.6 bits/query,
progressive selective:
0.35 bits/query.
下降:
41.67%.
Skewed prior:
universal monolithic:
0.486766874675 bits/query,
progressive selective:
0.271249576882 bits/query.
下降:
44.28%.
one-shot Huffman 版本也得到同樣相對下降比例:
0.6→0.334348441926.
所以:
universal storage=universal read.
這是 EXP-26 最重要的 operational 結論。
1. Runtime
EXP-26 regression:
7 passed
測試包含:
- Hot-native task selective rate 必須為 0;
- MID / OUTER joint rate 精確等於 FULL residual;
- MID / OUTER 在目前 domain componentwise additive;
- uniform MID / OUTER 各為 0.5 bit;
- progressive retrieval必須優於 monolithic retrieval;
- task-family lattice 必須形成四節點 B2 ;
- triple parity在給定 Hot T,D 後,與 full G 需要相同 provenance rate。
2. Task-Conditioned Recoverability
完整 atomic recovery:
S
不是唯一 recoverability target。
若 future只要求:
J(S),
provenance只需滿足:
H(J∣H,ZJ)=0.
由 source coding lower bound:
H(ZJ∣H)≥H(J∣H).
所以:
RJ(H)=H(J∣H)
是 task-specific exact recovery 的理論最小 rate。
3. Hot-Native Task
如果:
J=f(H),
則:
H(J∣H)=0.
所以不需要任何 Cold provenance。
本輪:
JH=T⊕D.
因 H4 已經區分四個:
(T,D)
組合,
因此:
RJH=0.
Uniform 與 Skewed prior都完全成立。
4. Selective Hidden-Distinction Task
Hot H4只隱藏:
G.
但不是每個 task都需要所有 Hot classes中的 G。
所以 selective task可以只要求:
在某些 Hot classes裡拆開 hidden pair,其餘 classes保持 merge。
這就是 task-induced refinement。
5. MID Task
定義:
JMID={G,0,T⊕D=1,T⊕D=0.
所以只需要拆:
{D,DG}
與:
{T,TG}.
induced partition為:
6 classes.
這正好對應:
H6known.
6. OUTER Task
定義:
JOUTER={G,0,T⊕D=0,T⊕D=1.
所以只拆:
{∅,G}
與:
{TD,TDG}.
也形成另一個:
6-class refinement.
它與 MID refinement互補。
7. FULL Task
JFULL=G.
因每一個 H4 pair都只差:
G,
所以要完整回答 G 就等於恢復 atomic 8-state identity。
因此:
H(G∣H4)=H(S∣H4).
8. Triple Parity Task
J⊕3=T⊕D⊕G.
乍看它只是 1-bit task,不是 full identity。
但 Hot 已知:
T⊕D.
所以:
G=J⊕3⊕(T⊕D).
因此給定 H4:
J⊕3⟺G.
所以:
H(J⊕3∣H4)=H(G∣H4).
這提醒:
task output看起來簡單,不代表 task-specific provenance便宜。
必須看它與 Hot side information 的關係。
9. Uniform Task Rates
Uniform prior:
RH=0.
MID:
RMID=0.5.
OUTER:
ROUTER=0.5.
FULL:
RFULL=1.
Triple parity:
R⊕3=1.
10. Skewed Task Rates
Skewed:
Hot-native:
0.
MID:
0.278661395441
OUTER:
0.532616729018
FULL:
0.811278124459
Triple parity:
0.811278124459.
所以 selective task cost差異非常明顯。
11. Complementary Selective Layers
本輪:
JMID
與:
JOUTER
作用在 disjoint Hot-class sets。
因此:
H(JMID,JOUTER∣H)=H(JMID∣H)+H(JOUTER∣H).
Uniform:
0.5+0.5=1.
Skewed:
0.278661395441+0.532616729018=0.811278124459.
12. Joint Selective Tasks Recover FULL G
因每一個 Hot class:
- MID task負責一半 hidden pairs;
- OUTER task負責另一半;
兩者合併後:
(JMID,JOUTER)⟺G
在給定 H4 時成立。
所以:
RMID∨OUTER=RFULL.
13. Task-Recoverability Lattice
因此四個 effect levels:
E0,
EMID,
EOUTER,
EFULL
形成:
B2.
Hasse diagram:
EFULL/\EMIDEOUTER\/E0
14. Task Lattice 與 EXP-14 Effect Lattice
EXP-14曾得到:
EP,Eπ
兩個 primitive epistemic effects形成 B2。
EXP-26現在得到另一個 B2:
selective recoverability task lattice.
兩者形式相同,但語義不同。
EXP-14:
repair effects。
EXP-26:
provenance layers / task requirements。
這顯示:
Boolean effect structure
在 ESC 不同層次反覆出現。
15. Universal Monolithic Provenance
若 Cold code只保存一個 monolithic universal residual:
Zfull,
那任何需要 hidden G 的 task都必須讀完整:
RFULL.
即:
retrieve full residual even if task only needs MID or OUTER.
這是 over-read。
16. Progressive Provenance
若把 universal residual拆成兩個 semantic layers:
ZMID,
ZOUTER,
則:
MID task只讀:
ZMID.
OUTER task只讀:
ZOUTER.
FULL task讀:
ZMID+ZOUTER.
Hot-native task:
0 bits.
17. Storage 總資訊不變
因:
RMID+ROUTER=RFULL,
所以 ideal total Cold storage:
progressive=universal.
也就是:
progressive coding在本例不是靠少存資訊取勝,而是靠 selective read。
18. Experimental Task Prior
本輪 task workload:
P(HOT)=0.4,
P(MID)=0.3,
P(OUTER)=0.2,
P(FULL)=0.1.
這只是 finite benchmark workload,不是 empirical claim。
19. Uniform Monolithic Retrieval
非-Hot tasks總 probability:
0.3+0.2+0.1=0.6.
每次讀:
1 bit.
所以:
E[Lmono]=0.6.
20. Uniform Progressive Retrieval
MID:
0.3×0.5=0.15.
OUTER:
0.2×0.5=0.10.
FULL:
0.1×1=0.10.
總:
0.35.
下降:
1−0.60.35=41.67%.
21. Skewed Monolithic Retrieval
FULL residual:
0.811278124459.
非-Hot probability:
0.6.
所以:
E[Lmono]=0.486766874675.
22. Skewed Progressive Retrieval
MID:
0.3×0.278661395441.
OUTER:
0.2×0.532616729018.
FULL:
0.1×0.811278124459.
總:
0.271249576882.
下降:
44.2753%.
23. One-Shot Huffman Progressive
Skewed one-shot:
MID layer:
0.343484419263.
OUTER:
0.656515580737.
FULL:
1.
monolithic workload:
0.6.
progressive:
0.334348441926.
同樣相對下降:
44.2753%.
24. Universal Storage 不等於 Universal Read
所以:
universal provenance may still be stored once, but need not be decoded/read in full for every task.
這把:
storage rate
與:
task retrieval rate
正式拆開。
25. Selective Decode Rate
對 task distribution:
π(J),
progressive code expected retrieval:
Rread=J∑π(J)RJneeded.
而 monolithic:
Rmono=Pr[J requires hidden state]Rfull.
差距由:
- task locality;
- layer overlap;
- task frequency;
共同決定。
26. Task Family Rate
若 future需要同時回答一組 tasks:
F,
不能單純把 individual rates全部相加。
正確量:
RF=H(JF∣H).
如果 tasks重複攜帶同一 hidden distinction,
會有 redundancy。
如果互補且 disjoint,
可能 additive。
27. Task Redundancy
定義兩 tasks:
J1,J2
的 conditional redundancy:
R(J1,J2∣H)=H(J1∣H)+H(J2∣H)−H(J1,J2∣H).
本輪 MID / OUTER:
R=0.
因它們作用在 disjoint Hot regions。
28. Selective Task Synergy
如果未來設計 task functions:
- 單獨幾乎不 reveal hidden state;
- 但 joint task vector能 reveal大量 hidden information;
則:
H(J1,J2∣H)
可能展現 interaction structure。
這會重新連回 EXP-15 的 synergy algebra。
本輪 MID / OUTER刻意選 separable case,先建立 baseline。
29. Task Sufficiency
若:
H(S∣H,J)=0,
則 task output:
J
相對 Hot 已經足以 reconstruct atomic state。
此時:
H(J∣H)=H(S∣H).
FULL_G 與 TRIPLE_PARITY 都屬於這一類。
30. Task Equivalence Under Hot Side Information
兩個 tasks:
J1,J2
即使 raw output完全不同,
若給定 Hot:
H
後互相可計算:
J1=f(H,J2),
J2=g(H,J1),
則:
H(J1∣H)=H(J2∣H).
FULL_G 與 TRIPLE_PARITY就是實例。
所以 task provenance cost是:
Hot-conditioned semantic property.
31. Hot Upgrade 可以降低未來 Task Rate
若 Hot representation從:
H4
升到更細:
H6,
某些 task的:
H(J∣H)
會下降甚至變:
0.
所以:
Hot storage↔future selective provenance bandwidth
可以直接交換。
這是 EXP-24 tier economics 的 bit-level版本。
32. Task-Aware Tier Placement
若 MID task非常常見,
可以把:
ZMID
升到 Hot / Warm。
OUTER task較少見,
留 Cold。
FULL極少見,
需要時兩層一起讀。
所以 bit-level temperature可以依:
π(J)
做 task-aware placement。
33. Semantic Layer 不一定等於 Bit Plane
這裡的 layer不是:
第一個 physical bit、第二個 physical bit。
它是:
一組具有明確 future-task semantics 的 residual information.
physical entropy coding後,它可能跨多個 bytes / blocks。
34. Progressive Semantic Code
因此可定義:
Z=(Z1,…,Zk)
每個:
Zi
對應一組 semantic distinctions。
task:
J
只需要讀 subset:
I(J)⊆{1,…,k}.
exact recovery:
H(J∣H,ZI(J))=0.
這就是 progressive semantic provenance code。
35. Storage-Minimal vs Access-Minimal
Universal entropy code追求:
minH(Z).
但 progressive system真正想要:
min[H(Z),EJH(ZI(J))].
兩者可能衝突。
所以 future coding problem開始成為 multi-objective。
36. Random Access Overhead
真正 storage system為了 selective fetch,可能需要:
- layer index;
- block boundary;
- checksums;
- pointers;
- alignment。
因此 progressive code的 physical size可能略高於 pure monolithic entropy code。
需要比較:
extra metadata
與:
saved retrieval bandwidth.
EXP-26目前先忽略 metadata,研究理論可行性。
37. Universal vs Selective Provenance Contract
可以分:
Universal Provenance Contract
must recover S.
rate:
H(S∣H).
Task Provenance Contract
must recover J(S).
rate:
H(J∣H).
Task-Family Contract
must support F.
rate:
H(JF∣H).
38. Recoverability Contract 決定 Code Length
所以「Cold 要存多少 bits?」仍然沒有單一答案。
必須先問:
Recover what?
這與 ESC 一路形成的 semantic-obligation-first 原則完全一致。
39. Task-Conditioned Recoverability Gap
定義:
GR(J∣H)=H(J∣H).
這是:
Hot representation相對 task J 還缺多少 bits。
Universal gap:
GR(S∣H)
只是其中最強的一個 contract。
40. Task Coverage Spectrum
一個 Hot representation可以對不同 tasks具有:
0≤GR(J∣H)≤H(S∣H).
所以 Hot representation不是:
recoverable / unrecoverable。
而是具有:
task-conditioned recoverability spectrum.
41. Selective Provenance 與 Bridge Cost
EXP-06 bridge cost問:
projection缺的共同 invariant需要補多少資訊?
EXP-26 task provenance問:
Hot projection缺的 task output需要補多少資訊?
兩者形式:
H(target∣current representation).
已經完全一致。
42. Selective Provenance 與 Epistemic Gain
如果加入 provenance layer:
ZJ
使:
H(J∣H,ZJ)=0,
那 epistemic gain:
GJ=H(J∣H).
理想 minimum code rate也:
RJ=H(J∣H).
所以在 perfect task-specific coding 下:
epistemic gain per ideal provenance bit=1.
這再次接回 EXP-12 的 gain-efficiency。
43. Information Conservation 的另一種形式
對 exact selective code:
每消除 1 bit target uncertainty, 理論上至少需要 1 bit target-relevant side information.
如果 physical code用超過:
H(J∣H),
多出的是 implementation overhead。
44. 本輪錨點
ESC-EXP-26.ARJ(H)=H(J∣H).
ESC-EXP-26.BHot-native task有 RJ=0.
ESC-EXP-26.CRMID+ROUTER=RFULL
在本 finite benchmark成立。
ESC-EXP-26.Dprogressive selective retrieval相對 monolithic universal read降低約 41.7%~44.3%.
ESC-EXP-26.Euniversal provenance storage可以與 task-selective decoding共存。
45. 從 EXP-25 到 EXP-26 的真正提升
EXP-25 問:
Cold 最少要存多少 bits 才能恢復全部?
EXP-26 問:
未來 task 到底需要解鎖其中哪些 bits?
因此:
Minimal Provenance Coding→Semantic Progressive Provenance Coding.
46. 下一輪:ESC-EXP-27
EXP-26目前 deliberately 使用兩個互補、可分離 selective tasks:
MID,OUTER.
所以 task lattice很乾淨。
真正下一步應該加入:
overlapping / synergistic task families.
也就是研究:
- H(J1,J2∣H) 是否小於 individual rates相加;
- tasks是否共享同一 residual bits;
- 一個 layer是否同時服務多個 tasks;
- semantic code layer該按 task拆,還是按 shared latent factor拆;
- minimum task-family codebook;
- rate region / common information;
- task demand distribution下最好的 residual factorization。
真正問題會變成:
Cold provenance應按「task」切層,還是按「多個 tasks 共用的 latent distinction」切層?
這會把 progressive provenance從簡單 B2 baseline推進到:
shared semantic residual factorization.