反事實觀察展開空間算子族:從介入、觀察價值到決策相關的可能空間收縮
Counterfactual Observation Expansion Operators: From Intervention and Observation Value to Decision-Relevant Possibility-Space Contraction
系列:Adaptive Possibility-Space Cognition(APSC)/Paper 03 of 06
版本:v0.1
日期:2026-08-24
作者:Neo.K
機構:EveMissLab / EVEMISS Technology
摘要
在多步推演、部分觀察、因果不完備與有限計算資源的環境中,智能系統面臨一個經常被忽略的問題:當目前可能空間仍然過大時,是否應繼續內部推演,還是先取得新的觀察?傳統反事實推理主要處理「若世界中的某變量被改變,結果會如何」,而主動觀察方法則通常直接評估「查詢某資訊是否有價值」。本文提出更一般化的 反事實觀察展開(Counterfactual Observation Expansion, COE)概念:在真正執行觀察之前,先展開該觀察可能返回的結果,以及每個結果將如何重構、壓縮、分裂、合併或重新排序當前工作可能空間。
本文將觀察視為一種改變認知狀態而不必直接改變世界狀態的操作,並正式區分 intervention、observation、counterfactual intervention 與 counterfactual observation expansion。本文提出觀察結果分支、後驗工作空間、資訊增益、決策價值、風險分辨力、成本與延遲等評估量,並建立一組觀察相關算子族,包括:候選觀察生成、觀察結果展開、空間更新、資訊價值評估、決策相關性評估、觀察選擇、觀察執行與觀察後重規劃。
本文進一步指出:高資訊量觀察不一定是高決策價值觀察;低熵結果不一定改善決策;而某些低機率觀察雖然不大幅降低不確定性,卻可能在高風險情境中具有極高價值。故本文提出 Decision-Relevant Observation Value、Risk-Sensitive Observation Value 與 Observation Regret 等概念,並將「觀察前模擬觀察」視為 APSC 中降低組合爆炸的重要機制。
本文主張,成熟智能系統不應只在內部一直「想」,而應能在適當時機選擇:
Think→Counterfactually evaluate observation→Observe→Collapse or reshape possibility space→Think again.
這種能力使觀察成為認知計算的一部分,而不是推理流程之外的附屬輸入。
關鍵詞: 反事實觀察、主動觀察、可能空間、資訊增益、決策價值、部分觀察、因果推演、認知算子、觀察成本、觀察後驗、風險敏感觀察、APSC
1. 問題的提出
1.1 一直內部推演不是普遍最優
在 APSC Paper 02 中,工作可能空間記為:
Ωt.
若:
∣Ωt∣
很大,最直接的做法是繼續展開:
ΩtEΩt+1.
但這可能產生:
∣Ωt+1∣>∣Ωt∣.
也就是越想越多。
因此,智能系統需要另一種能力:
在繼續展開之前,先判斷是否存在某個觀察,可以以較低成本直接縮小或重新組織可能空間。
1.2 「觀察」不是單純讀入更多資料
令世界真實狀態為:
StW.
智能體目前的工作認知狀態為:
Bt.
觀察:
q
產生結果:
o.
世界本身可能完全不變:
St+1W=StW,
但認知狀態會改變:
Btq,oBt+1.
因此,觀察是一種:
epistemic state transition
而不是必然的世界狀態轉移。
2. 四種不同操作
2.1 Intervention
介入直接改變世界:
do(X=x′).
其核心問題是:
如果我讓某變量改變,後果是什麼?
2.2 Observation
觀察不直接設定世界變量,而取得:
o∼P(O∣S).
其核心問題是:
世界現在呈現什麼資訊?
2.3 Counterfactual Intervention
反事實介入在不真正執行介入時,先模擬:
do(X=x′)⇒Y.
這是一種假設性世界改變。
2.4 Counterfactual Observation Expansion
本文提出:
OqCF
其目的不是改變世界,也不是立刻去看,而是:
在觀察 q 真正發生以前,先展開它可能得到的觀察結果,以及每個結果對工作可能空間、決策與風險的影響。
因此:
OqCF:Ωt→{(oi,Ωt∣oi)}i=1n.
3. 觀察候選空間
3.1 不是所有東西都值得觀察
令候選觀察集合為:
Qt={q1,q2,…,qm}.
例如:
- 搜尋某份文件;
- 詢問某個感測器;
- 查看遊戲畫面;
- 檢查某程序狀態;
- 讀取對手最近行動;
- 執行一次測試;
- 查詢外部 API;
- 重新觀察同一對象;
- 對某未知變量進行量測。
3.2 觀察可供性
候選觀察不是任意產生。
可以定義:
Afford(q∣Bt,Gt)
表示觀察 q 對當前認知狀態與目標是否具有可供性。
只有:
Afford(q)≥τq
的觀察,才進入候選集合。
4. 觀察結果展開
4.1 結果空間
對某候選觀察 q:
O(q)={o1,o2,…,on}.
每一結果可有權重:
pi=P(oi∣Bt,q).
4.2 後驗工作可能空間
若觀察到 oi,則工作空間更新為:
Ωt∣oi=Update(Ωt,q,oi).
因此反事實觀察展開可寫為:
OqCF(Ωt)={(oi,pi,Ωt∣oi)}i=1n.
5. 觀察造成的空間變化
5.1 空間收縮
最典型情況:
∣Ωt∣oi∣<∣Ωt∣.
這代表觀察排除了部分候選世界。
5.2 空間分裂
有時觀察會揭露以前未區分的結構:
Ωt→Ωt(A)∪Ωt(B).
這不一定降低總節點數,但提高結構辨識。
5.3 空間擴張
新觀察也可能揭露之前未考慮的可能:
∣Ωt+1∣>∣Ωt∣.
因此:
Observation⇒Compression.
有價值的觀察可能先擴張空間,再讓後續決策更正確。
5.4 空間重排序
即使候選集合不變,也可能有:
Priorityt(ωi)=Priorityt+1(ωi).
因此觀察價值不能只看:
∣Ω∣.
6. 資訊增益
6.1 熵式資訊價值
若使用機率分佈,可以定義:
IG(q)=H(Ωt)−Eo[H(Ωt∣o)].
其中:
H(Ω)=−i∑pilogpi.
6.2 資訊增益的限制
高資訊增益不一定改善決策。
假設:
qA
能讓系統知道 100 個與任務無關的變量,而:
qB
只確認一個關鍵變量。
可能有:
IG(qA)>IG(qB),
但:
DecisionValue(qA)<DecisionValue(qB).
因此 APSC 需要決策相關的觀察價值。
7. 決策相關觀察價值
7.1 決策價值
令目前最佳決策品質為:
Q∗(Bt).
取得觀察 q 後:
Q∗(Bt∣o).
則定義:
DROV(q)=Eo[Q∗(Bt∣o)]−Q∗(Bt).
其中 DROV 表示:
Decision-Relevant Observation Value。
7.2 淨觀察價值
考慮成本:
NOV(q)=DROV(q)−Cobs(q).
其中:
Cobs=Ctime+Ccompute+Cmoney+Clatency+Crisk.
若:
NOV(q)>0,
則觀察在期望上值得執行。
8. 風險敏感觀察
8.1 低機率結果也可能重要
假設某觀察主要結果機率為:
0.99,
但另有:
0.01
機率揭露災難性狀態。
若只用平均資訊增益,可能低估該觀察。
8.2 風險敏感價值
本文定義:
RSOV(q)=DROV(q)+λrEo[RiskReduction(o)]−Cobs(q).
其中:
λr
依任務風險敏感度調整。
因此:
low probability⇒low observation value.
9. 反事實觀察算子族
本文提出第一版算子族:
Fobs={Q,OCF,U,IG,DV,RV,SO,O,RP}.
其中:
- Q:Candidate Observation Generation;
- OCF:Counterfactual Observation Expansion;
- U:Belief / Possibility Update;
- IG:Information Gain Evaluation;
- DV:Decision Value Evaluation;
- RV:Risk-Sensitive Value Evaluation;
- SO:Observation Selection;
- O:Observation Execution;
- RP:Post-Observation Replanning。
10. 候選觀察生成算子
10.1 定義
Q:(Bt,Gt,Ωt)→Qt.
10.2 生成原則
候選觀察應優先來自:
- 高不確定變量;
- 高決策敏感變量;
- 高風險分支;
- 互斥世界的關鍵分辨點;
- 因果模型中的未知邊;
- 對手策略中的不確定節點;
- 驗證成本低但能排除大量分支的檢查。
11. 觀察分辨力
11.1 Pairwise Discrimination
對兩個候選世界:
ωa,ωb,
若觀察 q 對兩者產生不同結果:
P(o∣ωa,q)=P(o∣ωb,q),
則 q 具有分辨力。
11.2 Discrimination Score
可定義:
Disc(q)=a<b∑wabD(P(O∣ωa,q),P(O∣ωb,q)).
其中 D 可為某種分佈距離。
12. 觀察與因果
12.1 看見不等於干預
若觀察:
X=x
不能直接推出:
do(X=x).
因此:
P(Y∣X=x)
與:
P(Y∣do(X=x))
必須區分。
12.2 觀察選擇也可能有偏差
某些觀察只在特定條件下可得:
P(q available∣S)=constant.
因此「能觀察到」本身也可能包含資訊。
這表示 observation policy 可能產生 selection bias。
13. 觀察成本模型
13.1 成本不是只有時間
令:
Cobs(q)=αtCt+αcCc+αmCm+αeCe+αrCr.
其中:
- Ct:時間成本;
- Cc:計算成本;
- Cm:金錢或資源成本;
- Ce:執行/操作成本;
- Cr:觀察本身帶來的風險。
13.2 某些觀察會改變世界
例如:
- 主動掃描可能暴露自身;
- 詢問對手可能改變對手策略;
- 執行測試可能消耗樣本;
- 檢查系統可能造成延遲;
- 進入某畫面可能觸發事件。
因此觀察不一定是:
WorldNeutral.
可以定義:
ObserverEffect(q).
14. 觀察前展開深度
14.1 觀察本身也不能無限模擬
如果每個候選觀察有 n 個可能結果,而每個結果後又展開 k 步:
m×n×bk
同樣可能爆炸。
14.2 有界觀察展開
因此定義:
DepthCOE≤dobs.
通常只需要估計:
- 可能結果;
- 結果後的空間收縮;
- 是否改變首選決策;
- 是否排除高風險分支。
不必把每個觀察結果後的全部未來算到底。
15. 觀察選擇
15.1 單一觀察
最簡單情況:
q∗=argq∈QtmaxNOV(q).
15.2 風險敏感觀察
q∗=argq∈QtmaxRSOV(q).
15.3 多觀察序列
若觀察可以串接:
q1→o1→q2→o2.
則觀察策略本身形成政策:
πO:Bt→qt.
這會在未來工程中形成 Active Observation Runtime。
16. 觀察停止條件
16.1 不需要把所有未知都查清楚
若:
q∈QtmaxNOV(q)≤0,
則:
StopObserve=1.
16.2 決策穩定停止
若對所有主要候選觀察:
Decision∗(Bt)=Decision∗(Bt∣o),
則即使仍有資訊未知,也可能不值得觀察。
因此:
epistemic completeness is not required for decision sufficiency.
17. 觀察後重規劃
17.1 觀察不是終點
取得:
ot
後:
Bt+1=Update(Bt,qt,ot).
接著重新計算:
Ωt+1,
並再次選擇:
ut+1∗∈F.
17.2 閉環
因此形成:
Think→COE→Observe→Update→Replan→Think.
正式寫為:
BtOCFQtSOqtOotUBt+1.
18. 觀察與剪枝耦合
18.1 觀察可以替代大量剪枝計算
假設原空間:
∣Ωt∣=105.
一個觀察可能將其壓至:
102.
此時:
Costobserve<Costdeep prune
則觀察優先。
18.2 觀察也可能救回被錯剪的分支
若某分支原本因低機率被降權,但新觀察支持它:
Pt+1(ω)≫Pt(ω),
則系統必須允許:
Resurrect(ω).
因此剪枝最好區分:
Discard
與:
Dormant.
19. 反事實觀察與對手建模
19.1 對手也可能被觀察
例如:
q=observe opponent action.
可能結果:
{rush,defend,expand,feint}.
每一結果改變:
ΩA.
19.2 觀察可能暴露意圖
若對手知道自己被觀察,則:
q→ReactionB.
因此:
Outcome(q)
不只是資訊返回,也可能包含反作用。
這可寫為:
Oqinteractive.
20. 觀察可信度
20.1 觀察不一定正確
令:
Rel(o)∈[0,1].
低可信觀察不應直接覆蓋原空間。
20.2 誤觀察模型
若感測器錯誤率為:
ϵq,
則:
P(o∣S,q)
應包含噪聲模型。
因此:
Observation=Truth.
21. 觀察後驗更新
21.1 機率式更新
如果可用 Bayes:
P(ω∣o,q)∝P(o∣ω,q)P(ω).
21.2 非機率式更新
若沒有可靠機率,也可以使用:
- supported;
- contradicted;
- compatible;
- unresolved;
- newly-generated;
等狀態更新。
APSC 不要求所有可能空間都必須概率化。
22. 觀察價值的多目標形式
觀察選擇可寫為:
Vobs(q)=wIIG(q)+wDDROV(q)+wRRiskReduction(q)+wCCompression(q)−wKCost(q).
權重依 Cognitive Operating Profile 調整。
23. 與 Cognitive Operating Profile 的接口
若使用者偏好快速回答:
θo↓.
若高風險任務:
θo↑,θr↑.
若研究探索:
θo↑,θcf↑.
因此觀察政策不是固定常數,而受:
Θ
控制。
24. 觀察後悔
24.1 錯過觀察
若本來有高價值觀察 q∗,系統沒有執行,造成決策損失:
Rmiss=Qwith q∗∗−Qactual.
24.2 浪費觀察
若執行了低價值觀察:
Rwaste=Cobs(q)−DROV(q).
24.3 總觀察後悔
Robs=Rmiss+Rwaste.
25. 觀察選擇的失敗模式
主要包括:
- High-Entropy Distraction:選擇資訊很多但與決策無關的觀察;
- Decision Blindness:忽略真正會改變決策的變量;
- Risk Blindness:忽略低機率高風險結果;
- Observer Effect Neglect:忽略觀察會改變世界;
- Noisy Observation Overtrust:過度相信不可靠觀察;
- Infinite Checking:陷入無限查證;
- Redundant Observation:重複取得高度相關資訊;
- Premature Observation:在內部已有足夠資訊時仍去查;
- Late Observation:已花大量推演成本後才查一個本可早期排除大量分支的資訊;
- Reactive Opponent Error:忽略對手會因被觀察而改變行為。
26. 實驗設計
26.1 Baseline A:Pure Rollout
只允許:
Expand+Prune.
26.2 Baseline B:Reactive Observation
只有在不確定性超過閾值時直接觀察,不做反事實觀察展開。
26.3 APSC-COE
先:
OqCF
估計觀察價值,再決定是否觀察。
26.4 評估
比較:
Qdecision,
Ccompute,
Cobservation,
Latency,
Robs,
Recallcritical.
27. 可否證命題
命題一:COE 應改善觀察選擇
若:
APSC-COE
長期不能比簡單 heuristic 更有效選擇觀察,則 COE 的工程價值受到否證。
命題二:高資訊不等於高決策價值
應能構造任務使:
IG(qA)>IG(qB)
但:
DROV(qA)<DROV(qB).
若所有任務都無法區分兩者,則引入 DROV 的必要性需要重新評估。
命題三:觀察應降低部分深度推演需求
若在適當任務中:
COE+Observe
不能比:
DeepRollout
以更低成本達到相近或更高決策品質,則其核心效率主張受到挑戰。
28. 正式 COE 模型
本文提出:
COEt=⟨Bt,Ωt,Qt,O,PO,OCF,Vobs,Cobs,πO⟩.
其中:
- Bt:認知/信念狀態;
- Ωt:工作可能空間;
- Qt:候選觀察;
- O:觀察結果空間;
- PO:結果權重模型;
- OCF:反事實觀察展開;
- Vobs:觀察價值;
- Cobs:觀察成本;
- πO:觀察政策。
29. 核心命題總結
命題一:觀察是認知狀態轉移
Observation:Bt→Bt+1.
命題二:觀察可以先被反事實展開
OqCF occurs before Oq.
命題三:資訊增益不等於決策價值
IG(q)≡DROV(q).
命題四:低機率觀察結果可能具高價值
P(o)≪1⇒Value(o)≪1.
命題五:觀察不必使空間縮小才有價值
∣Ωt+1∣>∣Ωt∣⇒ObservationFailure.
命題六:觀察本身也需要停止規則
qmaxNOV(q)≤0⇒StopObserve.
30. 與前兩篇的關係
Paper 01 建立:
APSC.
Paper 02 回答:
哪些未來值得展開?
本文回答:
在繼續展開以前,有沒有更值得先取得的觀察?
因此三篇形成:
State→PossibilitySpace→CounterfactualObservation→UpdatedPossibilitySpace.
31. 結論
本文提出反事實觀察展開空間算子族,將「觀察」從外部輸入行為提升為 APSC 內部的正式認知操作。
其核心循環為:
Think→simulate possible observations→estimate their value→observe selectively→update possibility space→replan.
這一架構的重要性在於:當未來空間快速爆炸時,智能系統不必只靠更深 rollout 解決不確定性。
它可以先問:
哪一個觀察最值得做?
再問:
如果我看到 A,我會怎麼改變判斷?
如果看到 B,我會怎麼改變判斷?
哪一個觀察會真正改變我的決策?
哪一個觀察只是資訊很多,卻沒有決策價值?
哪一個低機率結果雖少見,卻能避免重大風險?
因此,APSC 的智能不再只存在於模型內部的推演長度,而存在於:
thinking+knowing what to observe+knowing when observation is worth more than further thought.
下一篇將接續處理:即使系統已能選擇展開與觀察,它仍然需要在時間、算力、記憶與觀察預算之間做統一調度。這將導向 APSC Paper 04:有限認知時空與自適應計算控制。
版本記錄
v0.1 — 2026-08-24
本版首次固定:
- Counterfactual Observation Expansion(COE)canonical 定義;
- intervention / observation / counterfactual intervention / COE 四分;
- Candidate Observation Space;
- Observation Affordance;
- Observation Outcome Expansion;
- Posterior Working Possibility Space;
- 空間收縮、分裂、擴張與重排序;
- Information Gain;
- Decision-Relevant Observation Value(DROV);
- Net Observation Value(NOV);
- Risk-Sensitive Observation Value(RSOV);
- Observation Operator Family;
- Observation Discrimination;
- Observation Cost Model;
- Observer Effect;
- Bounded COE Depth;
- Observation Policy;
- StopObserve;
- Post-Observation Replanning;
- Observation-Pruning Coupling;
- Interactive Observation;
- Observation Reliability;
- Probabilistic / Non-Probabilistic Update;
- Multi-Objective Observation Value;
- Cognitive Operating Profile interface;
- Observation Regret;
- Baseline / COE experiment design;
- Formal COE model;
- 可否證命題。