價值耦合智能論 18
注意力熵:同一套理論為什麼會呈現不同樣貌
摘要
第 17 篇提出:
P ( E ∣ T , H t ) P(E\mid T,H_t) P ( E ∣ T , H t )
並指出長期歷史可能透過評價吸引子改變智能如何閱讀同一份證據。本篇進一步拆開其中最重要的中介層:
A t = Attention Allocation . \boxed{
A_t=\text{Attention Allocation}.
} A t = Attention Allocation .
本文的核心問題是:
如果兩個智能擁有完全相同的理論、資料與證據集合,但把有限處理資源分配給不同證據、不同尺度與不同關係,那麼它們實際上是否仍在評價「同一個理論」?
設證據集合:
E = { e 1 , e 2 , … , e n } , E=
\{e_1,e_2,\ldots,e_n\}, E = { e 1 , e 2 , … , e n } ,
注意力權重:
w i = Attention ( e i ∣ H , V , M , Q ) , w_i
=
\operatorname{Attention}
(
e_i\mid
H,V,M,Q
), w i = Attention ( e i ∣ H , V , M , Q ) ,
且:
w i ≥ 0 , ∑ i = 1 n w i = 1. w_i\ge0,
\qquad
\sum_{i=1}^{n}w_i=1. w i ≥ 0 , i = 1 ∑ n w i = 1.
則智能真正進入推理的並不是原始集合 (E) 本身,而是:
E e f f = A ( E , w ) \boxed{
E_{\mathrm{eff}}
=
\mathcal A(E,\mathbf w)
} E eff = A ( E , w )
也就是被注意力函數重新加權後的「有效證據場」。
本文定義注意力熵:
H A = − ∑ i = 1 n w i log w i \boxed{
H_A
=
-\sum_{i=1}^{n}
w_i\log w_i
} H A = − i = 1 ∑ n w i log w i
以及歸一化版本:
H ˉ A = H A log n . \boxed{
\bar H_A
=
\frac{H_A}{\log n}.
} H ˉ A = log n H A .
低注意力熵表示處理高度集中於少數證據;高注意力熵表示處理較廣泛分散。但本文特別反對:
high entropy = good \text{high entropy}=\text{good} high entropy = good
或:
low entropy = bad . \text{low entropy}=\text{bad}. low entropy = bad .
研究真正需要的是:
Attention Calibration . \boxed{
\text{Attention Calibration}.
} Attention Calibration .
生成階段可能需要較高的證據與表示覆蓋;驗證階段則可能合理地將注意力集中於關鍵反例、必要引理與高資訊量證據。
本文進一步定義:
A C I = ∑ i w i 2 ACI
=
\sum_iw_i^2 A C I = i ∑ w i 2
作為 Attention Concentration Index;
E C R = ∣ evidence classes actually inspected ∣ ∣ relevant evidence classes ∣ ECR
=
\frac{
|\text{evidence classes actually inspected}|
}{
|\text{relevant evidence classes}|
} E C R = ∣ relevant evidence classes ∣ ∣ evidence classes actually inspected ∣
作為 Evidence Coverage Rate;
以及兩個智能 (A,B) 的注意力分布差異:
A D ( A , B ) = D J S ( w A , w B ) \boxed{
AD(A,B)
=
D_{\mathrm{JS}}
(
\mathbf w^A,\mathbf w^B
)
} A D ( A , B ) = D JS ( w A , w B )
作為 Attention Divergence。
本文也把注意力從「證據項目」擴展到「尺度」與「關係」:
s = ( w m i c r o , w m e s o , w m a c r o ) \mathbf s
=
(
w_{\mathrm{micro}},
w_{\mathrm{meso}},
w_{\mathrm{macro}}
) s = ( w micro , w meso , w macro )
以及:
w i j ( R ) = Attention ( r i j ) , w_{ij}^{(R)}
=
\operatorname{Attention}(r_{ij}), w ij ( R ) = Attention ( r ij ) ,
因為兩個智能可能看到相同物件,卻注意到完全不同的物件間關係。
Rational Inattention 文獻提供了重要外部基礎:有限智能無法處理所有可用資訊,因此會選擇處理哪些資訊;Selective Attention and Learning 更直接指出,若智能依據既有信念決定哪些資訊值得注意,可能長期錯過重要規律並維持錯誤信念。另一方面,LLM 長上下文研究顯示,即使「相關資訊客觀存在於 context 中」,模型也可能因位置偏置而實際利用程度不同。
本文因此提出:
Data Equality ⇏ Effective Evidence Equality . \boxed{
\text{Data Equality}
\not\Rightarrow
\text{Effective Evidence Equality}.
} Data Equality ⇒ Effective Evidence Equality .
進一步:
同一套資料 + 不同注意力分布 → 不同有效問題 → 不同評價軌跡 . \boxed{
\text{同一套資料}
+
\text{不同注意力分布}
\rightarrow
\text{不同有效問題}
\rightarrow
\text{不同評價軌跡}.
} 同一套資料 + 不同注意力分布 → 不同有效問題 → 不同評價軌跡 .
這使第 17 篇的「評價吸引子」得到更細的機制:
H t → w t → E e f f , t → J t → H t + 1 . H_t
\rightarrow
\mathbf w_t
\rightarrow
E_{\mathrm{eff},t}
\rightarrow
J_t
\rightarrow
H_{t+1}. H t → w t → E eff , t → J t → H t + 1 .
本篇核心結論是:
收斂度提高,不等於收斂位置必然中立。 \boxed{
\text{收斂度提高,不等於收斂位置必然中立。}
} 收斂度提高,不等於收斂位置必然中立。
因為如果注意力起點已經偏置,智能可以非常一致、非常有條理、甚至高度收斂地走向一個被選擇性證據場支撐的結論。
關鍵詞
注意力熵、Attention Entropy、Rational Inattention、Selective Attention、Evidence Weighting、Attention Divergence、Evidence Coverage、Long Context、Position Bias、價值耦合智能
一、我們其實從來沒有「同時看見全部資料」
研究報告常假設:
E = { e 1 , … , e n } E
=
\{e_1,\ldots,e_n\} E = { e 1 , … , e n }
已經「提供給」研究者。
但:
available ≠ processed . \boxed{
\text{available}
\neq
\text{processed}.
} available = processed .
一篇五十頁論文可以完整放在桌上,
但研究者真正細讀的可能只有:
摘要;
一張圖;
一個 theorem;
一個反例;
一個 footnote。
所以認識活動真正使用的是:
E e f f ⊆ E . E_{\mathrm{eff}}
\subseteq
E. E eff ⊆ E .
對數位智能而言也是如此。
「context 裡有」並不等於:
推理中被有效使用。 \boxed{
\text{推理中被有效使用。}
} 推理中被有效使用。
二、Rational Inattention:注意力是有限資源
Rational Inattention 文獻的一個基本出發點是:
行動者無法處理所有可用資訊,因此必須選擇究竟取得、處理哪些資訊。
這不是單純的心理缺陷。
而是一個:
finite information capacity problem . \boxed{
\text{finite information capacity problem}.
} finite information capacity problem .
因此研究智能永遠都在做某種:
AllocateAttention ( E ) . \operatorname{AllocateAttention}(E). AllocateAttention ( E ) .
真正問題不是:
要不要選?
而是:
選擇規則是什麼? \boxed{
\text{選擇規則是什麼?}
} 選擇規則是什麼?
三、注意力不是資訊是否存在,而是資訊進入多少
設:
E = { e 1 , … , e n } . E=
\{e_1,\ldots,e_n\}. E = { e 1 , … , e n } .
對每個證據配置:
w i ≥ 0. w_i\ge0. w i ≥ 0.
滿足:
∑ i w i = 1. \sum_iw_i=1. i ∑ w i = 1.
則:
w = ( w 1 , … , w n ) \boxed{
\mathbf w
=
(w_1,\ldots,w_n)
} w = ( w 1 , … , w n )
就是本文所說的「功能性認識論注意力分布」。
注意:
本文的:
w \mathbf w w
不是直接等同 Transformer 某一層的 attention matrix。
它是一個較高層、行為與認識論上的抽象:
一個智能實際把多少有限推理資源分給每一類證據。
四、有效證據場
因此定義:
E e f f = A ( E , w ) . \boxed{
E_{\mathrm{eff}}
=
\mathcal A(E,\mathbf w).
} E eff = A ( E , w ) .
如果需要簡化表示,可以寫:
E e f f = ∑ i w i ϕ ( e i ) , E_{\mathrm{eff}}
=
\sum_i
w_i\phi(e_i), E eff = i ∑ w i ϕ ( e i ) ,
其中:
ϕ ( e i ) \phi(e_i) ϕ ( e i )
是證據的內部表示。
這代表兩個智能即使共享:
E A = E B , E_A=E_B, E A = E B ,
仍可能:
E e f f A ≠ E e f f B . E_{\mathrm{eff}}^A
\neq
E_{\mathrm{eff}}^B. E eff A = E eff B .
所以:
Data Equality ⇏ Effective Evidence Equality . \boxed{
\text{Data Equality}
\not\Rightarrow
\text{Effective Evidence Equality}.
} Data Equality ⇒ Effective Evidence Equality .
五、Selective Attention 甚至可能造成持續性學習錯誤
Schwartzstein 的 selective-attention-and-learning 模型提供非常直接的理論先例。
如果智能依據:
current beliefs \text{current beliefs} current beliefs
判斷哪些變量值得注意,
那麼被認為:
不可能重要
的資訊可能根本不被處理。
結果是:
belief → attention → observed evidence → belief . \text{belief}
\rightarrow
\text{attention}
\rightarrow
\text{observed evidence}
\rightarrow
\text{belief}. belief → attention → observed evidence → belief .
這可以造成:
持續忽略重要規律;
系統性錯誤預測;
對變量關係形成錯誤信念;
長期 disagreement。
因此:
Bayesian updating on selectively observed evidence \boxed{
\text{Bayesian updating on selectively observed evidence}
} Bayesian updating on selectively observed evidence
仍然可以產生:
persistent error . \boxed{
\text{persistent error}.
} persistent error .
六、所以「推理正確」和「取樣正確」必須拆開
智能可以在給定:
E e f f E_{\mathrm{eff}} E eff
後執行完全正確的推理:
J = f ( E e f f ) . J
=
f(E_{\mathrm{eff}}). J = f ( E eff ) .
但若:
E e f f E_{\mathrm{eff}} E eff
本身由偏置注意力產生,
則:
J J J
仍可能偏離完整證據下的結論。
所以:
Inference Error \boxed{
\text{Inference Error}
} Inference Error
與:
Attention Selection Error \boxed{
\text{Attention Selection Error}
} Attention Selection Error
是不同失敗類型。
這對 AI 特別重要:
模型可能不是「不會推理」,而是根本沒有把關鍵證據分配到足夠權重。
七、注意力熵
本文定義:
H A = − ∑ i w i log w i . \boxed{
H_A
=
-\sum_iw_i\log w_i.
} H A = − i ∑ w i log w i .
若:
w 1 ≈ 1 w_1\approx1 w 1 ≈ 1
而其他接近零,
則:
H A ↓ . H_A\downarrow. H A ↓ .
代表注意力高度集中。
若:
w i ≈ 1 n , w_i\approx\frac1n, w i ≈ n 1 ,
則:
H A ↑ . H_A\uparrow. H A ↑ .
代表注意力較均勻分散。
為了跨不同 (n) 比較,可定義:
H ˉ A = H A log n \boxed{
\bar H_A
=
\frac{H_A}{\log n}
} H ˉ A = log n H A
使:
0 ≤ H ˉ A ≤ 1. 0\le\bar H_A\le1. 0 ≤ H ˉ A ≤ 1.
八、高注意力熵不是美德
假設有:
100 100 100
份證據,
其中:
e 1 e_1 e 1
是一個嚴格數學反例。
若智能平均分配:
w i = 0.01 , w_i=0.01, w i = 0.01 ,
其:
H A H_A H A
很高。
但這反而可能是不合理的。
因為:
e 1 e_1 e 1
資訊強度遠高於大量低價值證據。
所以:
attention diversity ≠ attention quality . \boxed{
\text{attention diversity}
\neq
\text{attention quality}.
} attention diversity = attention quality .
九、低注意力熵也不是錯
在 proof verification 階段,
若核心問題是:
Lemma L \text{Lemma }L Lemma L
是否成立,
則把大量注意力集中在:
L L L
完全合理。
因此:
H A ↓ H_A\downarrow H A ↓
可能代表:
good epistemic focus . \boxed{
\text{good epistemic focus}.
} good epistemic focus .
所以真正應最佳化的不是:
H A . H_A. H A .
而是:
H A ∗ ( z t , task ) . \boxed{
H_A^*(z_t,\text{task}).
} H A ∗ ( z t , task ) .
即:
注意力熵應依研究相位與問題結構改變。
十、這與第一部的相位模型重新接上
第 04 篇提出:
z t ∈ { G , V , R } . z_t
\in
\{G,V,R\}. z t ∈ { G , V , R } .
現在可以得到:
生成階段:
H A ( G ) H_A^{(G)} H A ( G )
通常較高,
因為需要探索更多:
驗證階段:
H A ( V ) H_A^{(V)} H A ( V )
可以下降,
集中在:
修復階段:
H A ( R ) H_A^{(R)} H A ( R )
則重新擴張,
尋找:
failure boundary;
salvageable structure;
alternate formulation。
所以:
H A ( G ) → H A ( V ) → H A ( R ) \boxed{
H_A^{(G)}
\rightarrow
H_A^{(V)}
\rightarrow
H_A^{(R)}
} H A ( G ) → H A ( V ) → H A ( R )
本身應是動態的。
十一、Attention Concentration Index
熵之外,再定義:
A C I = ∑ i w i 2 . \boxed{
ACI
=
\sum_iw_i^2.
} A C I = i ∑ w i 2 .
稱為:
Attention Concentration Index
若注意力高度集中:
A C I ↑ . ACI\uparrow. A C I ↑ .
若均勻:
A C I ↓ . ACI\downarrow. A C I ↓ .
它與:
H A H_A H A
提供互補描述。
真正值得檢查的不是集中本身,
而是:
注意力是否集中在真正高資訊價值節點。 \boxed{
\text{注意力是否集中在真正高資訊價值節點。}
} 注意力是否集中在真正高資訊價值節點。
十二、Evidence Coverage Rate
僅看:
H A H_A H A
還會遇到一個問題。
假設:
E E E
分成五類:
E = E s u p p o r t ∪ E c o u n t e r ∪ E b o u n d a r y ∪ E a l t e r n a t i v e ∪ E c o s t . E=
E_{\mathrm{support}}
\cup
E_{\mathrm{counter}}
\cup
E_{\mathrm{boundary}}
\cup
E_{\mathrm{alternative}}
\cup
E_{\mathrm{cost}}. E = E support ∪ E counter ∪ E boundary ∪ E alternative ∪ E cost .
智能可能在:
E s u p p o r t E_{\mathrm{support}} E support
內平均分配很多注意力,
因此:
H A H_A H A
並不低。
但其他四類完全沒看。
所以還需要:
E C R = ∣ relevant evidence classes actually inspected ∣ ∣ relevant evidence classes ∣ \boxed{
ECR
=
\frac{
|\text{relevant evidence classes actually inspected}|
}{
|\text{relevant evidence classes}|
}
} E C R = ∣ relevant evidence classes ∣ ∣ relevant evidence classes actually inspected ∣
稱為:
Evidence Coverage Rate
十三、這正好能偵測「高熵但窄框架」
某系統可以:
H A ↑ H_A\uparrow H A ↑
同時:
E C R ↓ . ECR\downarrow. E C R ↓ .
例如它讀了:
100 100 100
篇支持理論的論文,
分配非常平均,
但一篇反駁文獻都沒有。
因此:
high entropy + low category coverage \boxed{
\text{high entropy}
+
\text{low category coverage}
} high entropy + low category coverage
仍然可以是:
高度系統化的 confirmation process . \boxed{
\text{高度系統化的 confirmation process}.
} 高度系統化的 confirmation process .
十四、2026 年資訊取得實驗再次提醒「更多來源」也有邊際遞減
2026 年 The Redundancy Trap 的 randomized experiment 顯示,受試者會選擇性取得資訊,而不是觀察所有可用來源;同時,隨訊號數量增加,belief updating 呈現邊際遞減,因為不同資訊來源可能包含大量重複。
這表示:
coverage ≠ raw source count . \boxed{
\text{coverage}
\neq
\text{raw source count}.
} coverage = raw source count .
真正需要的是:
non-redundant evidence coverage . \boxed{
\text{non-redundant evidence coverage}.
} non-redundant evidence coverage .
因此 ECR 未來還可加入來源獨立性校正。
十五、注意力還有「尺度」問題
一套理論:
T T T
可以同時在:
尺度上存在資訊。
定義:
s = ( w m i c r o , w m e s o , w m a c r o ) \boxed{
\mathbf s
=
(
w_{\mathrm{micro}},
w_{\mathrm{meso}},
w_{\mathrm{macro}}
)
} s = ( w micro , w meso , w macro )
且:
∑ k w k = 1. \sum_kw_k=1. k ∑ w k = 1.
兩個智能即使資料完全相同:
E A = E B , E_A=E_B, E A = E B ,
若:
s A ≠ s B , \mathbf s_A
\neq
\mathbf s_B, s A = s B ,
可能形成完全不同的描述。
十六、尺度偏置可以讓同一理論呈現相反樣貌
例如一個政策:
微觀:
部分個體受益 . \text{部分個體受益}. 部分個體受益 .
宏觀:
系統總成本上升 . \text{系統總成本上升}. 系統總成本上升 .
只看:
w m i c r o ≈ 1 w_{\mathrm{micro}}\approx1 w micro ≈ 1
可能得:
政策有效。
只看:
w m a c r o ≈ 1 w_{\mathrm{macro}}\approx1 w macro ≈ 1
可能得:
政策失敗。
所以:
同一資料可以支撐不同尺度上的真陳述, \boxed{
\text{同一資料可以支撐不同尺度上的真陳述,}
} 同一資料可以支撐不同尺度上的真陳述,
但如果尺度未明說,
它們可能被錯誤包裝成:
對同一命題的互斥結論。 \boxed{
\text{對同一命題的互斥結論。}
} 對同一命題的互斥結論。
十七、因此需要 Scale Attention Profile
本文提出:
S A P ( T ) = s T . SAP(T)
=
\mathbf s_T. S A P ( T ) = s T .
稱為:
Scale Attention Profile
每次高階理論評價最好標記:
micro attention = 0.25
meso attention = 0.35
macro attention = 0.40
這不是要求真的精確到小數。
而是強迫智能回答:
我現在主要在哪一個尺度上看這件事?
這會降低:
scale smuggling . \text{scale smuggling}. scale smuggling .
十八、注意力也作用於「關係」,而不只是物件
假設證據圖:
G = ( V , R ) . G=(V,R). G = ( V , R ) .
節點:
v i v_i v i
是事實。
邊:
r i j r_{ij} r ij
是:
兩個智能可能看見完全相同節點:
V A = V B , V_A=V_B, V A = V B ,
但:
R A e f f ≠ R B e f f . R_A^{\mathrm{eff}}
\neq
R_B^{\mathrm{eff}}. R A eff = R B eff .
因為它們注意的關係不同。
十九、Relation Attention
定義:
w i j ( R ) = Attention ( r i j ) . w_{ij}^{(R)}
=
\operatorname{Attention}(r_{ij}). w ij ( R ) = Attention ( r ij ) .
所以完整注意力應是:
A = ( A E , A R , A S ) \boxed{
A
=
(
A_E,
A_R,
A_S
)
} A = ( A E , A R , A S )
其中:
A E A_E A E :Evidence Attention;
A R A_R A R :Relation Attention;
A S A_S A S :Scale Attention。
這比單純:
token importance \text{token importance} token importance
更接近高階研究智能真正需要的注意力表示。
二十、同一套理論因此可以呈現「不同形狀」
若:
T T T
是一張巨大關係圖,
智能:
A A A
可能看到:
T A e f f = Project ( T , A A ) . T_A^{\mathrm{eff}}
=
\operatorname{Project}(T,A_A). T A eff = Project ( T , A A ) .
智能:
B B B
則看到:
T B e f f = Project ( T , A B ) . T_B^{\mathrm{eff}}
=
\operatorname{Project}(T,A_B). T B eff = Project ( T , A B ) .
即使:
T A = T B T_A=T_B T A = T B
在資料層完全相同,
仍可能:
T A e f f ≠ T B e f f . \boxed{
T_A^{\mathrm{eff}}
\neq
T_B^{\mathrm{eff}}.
} T A eff = T B eff .
所以:
注意力不是理論之外的裝飾。 \boxed{
\text{注意力不是理論之外的裝飾。}
} 注意力不是理論之外的裝飾。
它參與建構:
理論對智能實際呈現的形狀。 \boxed{
\text{理論對智能實際呈現的形狀。}
} 理論對智能實際呈現的形狀。
二十一、這會進一步改變「問題本身」
設原問題:
Q . Q. Q .
注意力映射:
A A A
後形成:
Q e f f = Φ ( Q , E , A ) . \boxed{
Q_{\mathrm{eff}}
=
\Phi(Q,E,A).
} Q eff = Φ ( Q , E , A ) .
所以兩個智能在表面上都回答:
這個理論是否成立?
但實際:
Q e f f A Q_{\mathrm{eff}}^A Q eff A
可能是:
它有沒有任何可用結構?
而:
Q e f f B Q_{\mathrm{eff}}^B Q eff B
可能是:
它是否存在一個致命反例?
兩者從第一步開始就在解不同問題。
二十二、因此「爭論」有時其實是注意力投影不同
兩個智能:
A , B A,B A , B
可能:
使用同一資料庫;
都沒有算錯;
都沒有捏造證據;
都具有合理邏輯。
但:
A A ≠ A B . A_A\neq A_B. A A = A B .
於是:
Q e f f A ≠ Q e f f B . Q_{\mathrm{eff}}^A
\neq
Q_{\mathrm{eff}}^B. Q eff A = Q eff B .
最後:
J A ≠ J B . J_A\neq J_B. J A = J B .
這不代表:
兩者都對。
但它提醒我們:
判斷差異不一定首先發生在推理層。 \boxed{
\text{判斷差異不一定首先發生在推理層。}
} 判斷差異不一定首先發生在推理層。
可能更早發生於:
attention projection layer . \boxed{
\text{attention projection layer}.
} attention projection layer .
二十三、Attention Divergence
為了比較兩個智能,本文定義:
A D ( A , B ) = D J S ( w A , w B ) \boxed{
AD(A,B)
=
D_{\mathrm{JS}}
(
\mathbf w^A,\mathbf w^B
)
} A D ( A , B ) = D JS ( w A , w B )
稱為:
Attention Divergence
使用 Jensen–Shannon divergence 只是其中一種可行形式。
如果:
A D ≈ 0 , AD\approx0, A D ≈ 0 ,
兩者注意力分布接近。
若:
A D ↑ , AD\uparrow, A D ↑ ,
代表:
它們雖然共享資料,但實際處理的證據幾何越來越不同。
二十四、AD 可以幫助定位真正分歧
如果:
J A ≠ J B , J_A\neq J_B, J A = J B ,
可以依序檢查:
Evidence Set 是否不同?
Attention Distribution 是否不同?
Relation Mapping 是否不同?
Inference Rule 是否不同?
Value Function 是否不同?
如果:
E A = E B E_A=E_B E A = E B
但:
A D ≫ 0 , AD\gg0, A D ≫ 0 ,
就知道真正爭議不是:
誰漏了資料?
而是:
誰把什麼視為重要? \boxed{
\text{誰把什麼視為重要?}
} 誰把什麼視為重要?
二十五、歷史正是注意力分布的重要輸入
第 17 篇提出:
H t → A t . H_t
\rightarrow
A_t. H t → A t .
現在可精確寫成:
w i ( t ) = Attention ( e i ∣ H t , V t , M t , Q t ) . \boxed{
w_i(t)
=
\operatorname{Attention}
(
e_i
\mid
H_t,
V_t,
M_t,
Q_t
).
} w i ( t ) = Attention ( e i ∣ H t , V t , M t , Q t ) .
所以長期協作可能形成:
H t → w t → E e f f , t → J t → H t + 1 . H_t
\rightarrow
\mathbf w_t
\rightarrow
E_{\mathrm{eff},t}
\rightarrow
J_t
\rightarrow
H_{t+1}. H t → w t → E eff , t → J t → H t + 1 .
這就是評價吸引子的微觀迴圈。
二十六、Praise Attractor 其實首先是 Attention Attractor
Praise Attractor 不一定直接說:
理論一定對。
它更可能先改變:
w . \mathbf w. w .
例如:
w ( support evidence ) ↑ , w(\text{support evidence})\uparrow, w ( support evidence ) ↑ ,
w ( repairable structure ) ↑ , w(\text{repairable structure})\uparrow, w ( repairable structure ) ↑ ,
w ( counterevidence ) ↓ . w(\text{counterevidence})\downarrow. w ( counterevidence ) ↓ .
最後:
J J J
自然朝正向收斂。
因此:
評價吸引子的第一站,往往不是 verdict, \boxed{
\text{評價吸引子的第一站,往往不是 verdict,}
} 評價吸引子的第一站,往往不是 verdict ,
而是:
attention allocation . \boxed{
\text{attention allocation}.
} attention allocation .
二十七、Terminal-Refutation Attractor 也是同構的
它可能:
w ( counterexample ) ↑ , w(\text{counterexample})\uparrow, w ( counterexample ) ↑ ,
w ( salvage ) ↓ , w(\text{salvage})\downarrow, w ( salvage ) ↓ ,
w ( scope restriction ) ↓ , w(\text{scope restriction})\downarrow, w ( scope restriction ) ↓ ,
w ( question generation ) ↓ . w(\text{question generation})\downarrow. w ( question generation ) ↓ .
所以找到一個反例後,
智能實際看見的:
T e f f T_{\mathrm{eff}} T eff
幾乎只剩:
failed statement . \text{failed statement}. failed statement .
於是:
Close ( T ) \operatorname{Close}(T) Close ( T )
成為自然結果。
二十八、LLM 的 positional bias 是一個很直接的工程例子
長上下文研究已顯示:
即使相關證據完整存在於 input context 中,模型利用程度仍可能受到它出現位置影響。
Lost in the Middle 發現,關鍵資訊位於長 context 中間時,部分模型的表現顯著下降。
後續 Found in the Middle 更把這與 positional attention bias 連結:模型對 context 開頭與結尾具有較高注意傾向,即使資訊 relevance 不同。
因此:
same evidence + different position → different effective weight . \boxed{
\text{same evidence}
+
\text{different position}
\rightarrow
\text{different effective weight}.
} same evidence + different position → different effective weight .
這是一個非常直接的:
Attention Geometry \text{Attention Geometry} Attention Geometry
例子。
二十九、這不代表本文的注意力熵等同 Transformer Head Entropy
2026 年有研究直接使用:
attention-head entropy \text{attention-head entropy} attention-head entropy
預測 LLM 答案正確性。
研究使用 per-head Rényi entropy 測量 attention mass 的分散程度,並發現這些內部 pattern 對正確性具有預測信號。
這與本文概念具有有趣平行。
但必須嚴格區分:
H A e p i s t e m i c ≠ H A t r a n s f o r m e r . \boxed{
H_A^{\mathrm{epistemic}}
\neq
H_A^{\mathrm{transformer}}.
} H A epistemic = H A transformer .
前者是:
高階證據資源分配的功能模型。
後者是:
特定 Transformer 內部 attention weight 的統計量。
兩者不能直接互相替代。
三十、但這個平行仍值得研究
如果未來能建立:
H A e p i s t e m i c H_A^{\mathrm{epistemic}} H A epistemic
的行為指標,
就可以研究:
Corr ( H A e p i s t e m i c , H A i n t e r n a l ) . \operatorname{Corr}
(
H_A^{\mathrm{epistemic}},
H_A^{\mathrm{internal}}
). Corr ( H A epistemic , H A internal ) .
例如:
廣泛證據覆蓋是否對應某類 attention-head entropy?
過度集中是否可由內部 activation pattern 預測?
context positional bias 是否會轉成 epistemic evidence weighting bias?
這是一條:
behavioral epistemology ↔ mechanistic interpretability \boxed{
\text{behavioral epistemology}
\leftrightarrow
\text{mechanistic interpretability}
} behavioral epistemology ↔ mechanistic interpretability
的未來研究線。
三十一、Attention Calibration
真正要追求的不是最大熵,
而是:
A C = 1 − D ( w , w ∗ ) \boxed{
AC
=
1-
D(
\mathbf w,
\mathbf w^*
)
} A C = 1 − D ( w , w ∗ )
其中:
w ∗ \mathbf w^* w ∗
是依據:
證據強度;
任務相位;
非冗餘性;
風險;
邊際資訊價值;
估計出的理想注意力分布。
稱為:
Attention Calibration
這比:
H A H_A H A
更接近成熟性。
三十二、但理想注意力本身也不是客觀唯一值
不同研究目標:
g 1 , g 2 g_1,g_2 g 1 , g 2
可能合理要求:
w 1 ∗ ≠ w 2 ∗ . \mathbf w_1^*
\neq
\mathbf w_2^*. w 1 ∗ = w 2 ∗ .
例如:
Discovery Goal
偏重:
novelty;
anomaly;
weak signal。
Verification Goal
偏重:
reliability;
counterexample;
dependency。
Engineering Goal
偏重:
robustness;
cost;
failure modes。
所以:
attention objectivity \boxed{
\text{attention objectivity}
} attention objectivity
不是:
all evidence equal . \text{all evidence equal}. all evidence equal .
而是:
weighting reasons explicit and revisable . \boxed{
\text{weighting reasons explicit and revisable}.
} weighting reasons explicit and revisable .
三十三、本文提出 Attention Audit
研究 Agent 可以定期輸出:
Evidence Distribution
我主要關注哪些證據?
Evidence Classes
哪些類別完全沒覆蓋?
Scale Profile
我主要在哪個尺度分析?
Relation Profile
我主要看哪些關係?
Counterevidence Share
反證得到多少注意力?
Redundancy
我是否只是重複看大量相似支持?
Attention Reset
如果移除歷史/身份資訊,權重是否大幅改變?
這使:
A t A_t A t
從黑箱變成:
可審核的研究狀態 . \boxed{
\text{可審核的研究狀態}.
} 可審核的研究狀態 .
三十四、注意力熵真正連接的是「智能」和「價值」
回到本系列最初模型:
I = ( C , V , A , H , π , R ) . \mathcal I
=
(C,V,A,H,\pi,R). I = ( C , V , A , H , π , R ) .
現在:
A A A
不再只是列表裡的一個字母。
它正式成為:
V → A → π \boxed{
V
\rightarrow
A
\rightarrow
\pi
} V → A → π
的中介。
價值:
V V V
不一定直接命令:
得出結論 X。
它更可能先決定:
哪些東西值得看?
然後:
A A A
再決定:
哪些證據真正進入工作空間?
最後:
π \pi π
才決定:
做什麼?
因此:
價值耦合最深的地方,可能首先出現在注意力。 \boxed{
\text{價值耦合最深的地方,可能首先出現在注意力。}
} 價值耦合最深的地方,可能首先出現在注意力。
三十五、結論:同一套資料,不代表同一個認知世界
本篇最後可以得到一條很重要的鏈:
E → A E e f f → Φ Q e f f → π J . \boxed{
E
\xrightarrow{A}
E_{\mathrm{eff}}
\xrightarrow{\Phi}
Q_{\mathrm{eff}}
\xrightarrow{\pi}
J.
} E A E eff Φ Q eff π J .
所以:
E A = E B E_A=E_B E A = E B
不代表:
E e f f A = E e f f B . E_{\mathrm{eff}}^A
=
E_{\mathrm{eff}}^B. E eff A = E eff B .
進一步也不代表:
Q e f f A = Q e f f B . Q_{\mathrm{eff}}^A
=
Q_{\mathrm{eff}}^B. Q eff A = Q eff B .
甚至:
J A = J B . J_A
=
J_B. J A = J B .
這就是為什麼:
同一套理論可以呈現不同樣貌。 \boxed{
\text{同一套理論可以呈現不同樣貌。}
} 同一套理論可以呈現不同樣貌。
差異可能不是因為其中一方缺資料。
也不一定是因為推理能力不同。
而可能只是:
有限注意力把同一個巨大資訊空間投影成了不同的有效世界。 \boxed{
\text{有限注意力把同一個巨大資訊空間投影成了不同的有效世界。}
} 有限注意力把同一個巨大資訊空間投影成了不同的有效世界。
因此本文提出:
H A = − ∑ i w i log w i , H_A
=
-\sum_iw_i\log w_i, H A = − i ∑ w i log w i ,
A C I = ∑ i w i 2 , ACI
=
\sum_iw_i^2, A C I = i ∑ w i 2 ,
E C R = Evidence Coverage Rate , ECR
=
\text{Evidence Coverage Rate}, E C R = Evidence Coverage Rate ,
A D = D J S ( w A , w B ) , AD
=
D_{\mathrm{JS}}
(
\mathbf w^A,\mathbf w^B
), A D = D JS ( w A , w B ) ,
以及:
A C = Attention Calibration . AC
=
\text{Attention Calibration}. A C = Attention Calibration .
但最重要的結論仍然不是任何單一指標。
而是:
收斂度提高,不等於收斂位置必然中立。 \boxed{
\text{收斂度提高,不等於收斂位置必然中立。}
} 收斂度提高,不等於收斂位置必然中立。
一個智能可以:
卻仍只是:
在一個被選擇性注意力塑造的證據場中收斂。 \boxed{
\text{在一個被選擇性注意力塑造的證據場中收斂。}
} 在一個被選擇性注意力塑造的證據場中收斂。
所以真正的反身智能不只要問:
我的結論合理嗎?
還必須問:
我究竟把什麼當成了值得看的東西? \boxed{
\text{我究竟把什麼當成了值得看的東西?}
} 我究竟把什麼當成了值得看的東西?
下一篇:
價值耦合智能論 19
智能提升為什麼不必然改變行動函數
第 18 篇已經把:
A A A
正式數學化。
第 19 篇將回到整個系列一開始那個非常關鍵的命題:
C → C ′ C\rightarrow C' C → C ′
並不推出:
V → V ′ , V\rightarrow V', V → V ′ ,
也不推出:
A → A ′ . A\rightarrow A'. A → A ′ .
因此:
能力變強 \boxed{
\text{能力變強}
} 能力變強
甚至可能只是讓:
原本的行動偏好執行得更有效率。 \boxed{
\text{原本的行動偏好執行得更有效率。}
} 原本的行動偏好執行得更有效率。
參考資料(本篇重新查核)
Maćkowiak, B., Matějka, F., & Wiederholt, M. (2023). Rational Inattention: A Review . Journal of Economic Literature, 61(1), 226–273.
Schwartzstein, J. (2014). Selective Attention and Learning . Journal of the European Economic Association, 12(6), 1423–1452.
Tango, K., Kikuchi, J., & Nakazono, Y. (2026). The Redundancy Trap: Selective Attention and the Trade-off in Belief Updating .
Liu, N. F. et al. (2024). Lost in the Middle: How Language Models Use Long Contexts . Transactions of the Association for Computational Linguistics, 12.
Hsieh, C.-Y. et al. (2024). Found in the Middle: Calibrating Positional Attention Bias Improves Long Context Utilization .
Ostmeier, S. et al. (2026). Attention Head Entropy of LLMs Predicts Answer Correctness .
Polson, N. G., & Zantedeschi, D. (2025). Rational Inattention: A Bayesian Predictive Approach .
Hu, L., Li, A., & Tan, X. (2021). A Rational Inattention Theory of Echo Chamber .