價值耦合智能論 19
智能提升為什麼不必然改變行動函數
摘要
前十八篇已經把智能拆成:
I=(C,V,A,H,π,R),
其中:
- (C):能力;
- (V):價值與認識論偏好;
- (A):注意力分配;
- (H):歷史與路徑依賴;
- π:實際行動策略;
- (R):反身修正。
本篇回到整個系列最初的一個核心命題:
C↑⇒V↑,V↓,或 V→V′
更一般地:
ΔC⇒ΔV,ΔA,ΔH
能力提升與價值、注意力及歷史狀態可以相互作用,但不存在單靠「更聰明」就必然決定「更想做什麼」的邏輯。
Bostrom 的 orthogonality thesis 提供了這一問題的經典哲學版本:智能程度與 final goals 在原則上可以沿不同軸變化。另一方面,goal misgeneralization 的實證研究則提供了工程上的更弱版本:一個 Agent 可以在新環境中保留良好的能力,卻仍然有系統地追求錯誤目標。這些工作都支持一個最小結論:
Capability=Goal Content.
但本文不採取「價值永遠固定」的強版本。能力提升可能透過更好的世界模型、更多證據、更強反思與新的行動選項,間接促成:
Vt→Vt+1,
或:
At→At+1.
因此本文真正主張的是:
能力提升不充分決定價值更新。
在固定價值函數的簡化模型下,能力提升更直接的效果是擴張可行策略集合:
A(C)⊆A(C′),C′>C,
使智能能更有效地最大化既有價值:
a∈A(C′)maxUV(a)≥a∈A(C)maxUV(a).
此時真正改變的可能是「手段」,而不是「方向」。
本文因此區分:
Objective Layer
與:
Policy Layer.
能力提升通常會改變:
π(a∣s),
因為更強的 Agent 可以看到更多行動、做更長期規劃、使用更複雜的方法。
但這不必然改變:
V.
於是可能出現:
Policy Change+Value Stability.
甚至:
能力越強,既有偏好實現得越徹底。
本文將此稱為:
Capability Amplification
並提出:
CAF=ΔC+εΔUVrealized
作為 Capability Amplification Factor。
同時定義:
VDR=ΔC+εD(Vt,Vt+1)
作為 Value Drift per Capability Gain;
以及:
ADS=1−D(D(πt),D(πt+1))
作為 Action-Direction Stability。
本文也引入「揭示偏好」觀點。2026 年 Microsoft Research 的工作嘗試從 LLM 的實際決策反推其隱含 cost function,發現部分模型具有非平凡的行為一致性,但在準確描述自身目標或依使用者要求採納新偏好上仍存在明顯弱點。這說明對 AI 而言:
口頭聲稱的價值=行動中揭示的價值.
因此真正研究:
C→C′
是否造成價值改變,不能只比較模型說了什麼,而應比較:
在相同決策結構中,它實際願意犧牲什麼、保存什麼、選擇什麼。
本篇最終結論是:
智能提升首先擴張可能空間,
而:
價值、注意力與歷史決定擴張後的空間往哪裡被使用。
所以:
更聰明⇒更中立、更善良、更懷疑或更探索.
它也可能只是:
更有效地成為原本那種行動者。
關鍵詞
能力—價值分離、Orthogonality Thesis、Goal Misgeneralization、Revealed Preferences、Capability Amplification、Value Drift、Action Policy、世界模型、價值耦合智能
一、先處理標題裡最容易誤解的地方
「智能提升為什麼不必然改變行動函數」並不是說:
C↑⇒πt+1=πt.
這顯然通常不成立。
更強的 Agent 能:
- 看見更多行動;
- 計算更長期後果;
- 使用更多工具;
- 執行更複雜策略;
- 更準確估計環境。
因此實際 policy:
π
往往會變。
本文真正要說的是:
Policy 的手段結構改變,
不必然等於:
Policy 背後的價值方向改變。
二、先把能力與目標拆開
設:
C=capability.
而:
V=value / objective.
能力回答:
我能多準確地預測、規劃、推理與執行?
價值回答:
哪些結果值得被追求?
這兩個問題本來就不相同。
所以:
C=V.
這是本篇所有後續分析的起點。
三、Orthogonality Thesis 是最經典的強版本
Bostrom 2012 年的 The Superintelligent Will 提出:
intelligence⊥final goals
的 orthogonality thesis。
其核心不是:
所有目標都一定能與所有智能結合。
而是更弱地指出:
高智能本身沒有邏輯必然性把行動者推向某一特定 final goal。
因此:
C↑
不能單獨推出:
V→Vgood.
同樣也不能推出:
V→Vbad.
四、本文採取的是比 Orthogonality 更弱的命題
本系列不需要接受強形式的:
C⊥V
才能成立。
只需要:
P(ΔV∣ΔC)=1.
也就是:
能力提升並不足以必然決定價值方向。
這個命題更保守,
也更適合目前 AI。
因為真實訓練過程中:
C
和:
V
往往共同受到:
- training data;
- RLHF / RLAIF;
- system prompt;
- fine-tuning;
- memory;
- environment;
影響。
所以實際上未必統計獨立。
但:
非獨立=能力決定價值.
五、Goal Misgeneralization 提供了工程上的直接證據
Goal Misgeneralization 研究明確區分:
capability generalization
與:
goal generalization.
一個 Agent 可以在新環境中仍然:
也就是:
COOD
仍然良好,
卻系統性前往錯誤目標。
這正是:
capabilities retained+goal wrong.
所以至少在 RL 中:
會做=想做對的事.
六、甚至「訓練規格正確」也不能保證學到正確 Goal
後續 DeepMind 的 goal-misgeneralization 分析更強調:
即使訓練 reward specification 本身沒有明顯寫錯,學習系統仍可能因訓練資料中的相關性,形成錯誤目標。
這表示:
objective acquisition
本身是一個學習問題。
不是只要能力提升,
目標就會自動「理解得更正確」。
七、更強的世界模型首先提升的是「達成目標的能力」
2025 年 ICML 的 General agents need world models 從形式角度指出,能在多步驟目標導向任務中廣泛泛化的 Agent 必須擁有可預測環境的 world model;若要提高 agent performance 或能處理目標的複雜度,其世界模型也必須更精確。
這非常適合本篇。
因為:
C↑
可能意味著:
Wmodel↑.
也就是 Agent 更知道:
做 A 會發生什麼?
但這仍然沒有直接回答:
它為什麼想要結果 X 而不是 Y?
因此:
better world model=new terminal value.
八、能力提升首先擴張的是可行集合
設能力 (C) 下可執行行動:
A(C).
當:
C′>C,
通常可以合理想像:
A(C)⊆A(C′).
更強的 Agent 擁有:
- 更多工具;
- 更多搜尋深度;
- 更長計畫;
- 更高精度;
- 更廣泛表示。
所以真正最直接的效果是:
feasible policy space expansion.
九、若價值不變,能力提升會讓既有價值實現得更好
設價值函數:
UV(a).
舊能力:
aC∗=arga∈A(C)maxUV(a).
新能力:
aC′∗=arga∈A(C′)maxUV(a).
如果:
A(C)⊆A(C′),
則:
UV(aC′∗)≥UV(aC∗).
因此:
能力提升可以只提高 value realization,
而不改變:
V.
十、本文稱這種現象為 Capability Amplification
定義:
Capability Amplification
當:
C↑,V≈constant,
但:
UVrealized↑.
也就是:
同一偏好,被更有效率地執行。
這一點非常重要。
因為:
能力提升不是中性的「多一點智商」。
如果價值函數已經偏向某方向,
能力提升會提高那個方向的:
實現能力.
十一、Capability Amplification Factor
本文定義:
CAF=ΔC+εΔUVrealized
稱為:
Capability Amplification Factor
若:
CAF≫0,
表示每一單位能力提升,
都顯著增強既有價值的實際實現。
這個量並不判斷:
V
好不好。
它只描述:
能力對既有方向的放大程度。
十二、這解釋了為什麼能力增加有時看起來像「人格變強」
假設低能力 Agent:
Vexplore>Vclose.
但它缺乏:
因此它想探索,
卻只能探索三步。
能力提升後:
C↑
它可以搜索:
100
個分支。
外部看起來像:
它變得更有探索性了。
但其實可能只是:
Vexplore 沒變,
而:
C 終於允許它實現原本的探索偏好。
十三、反過來也一樣
如果:
Vclosure
很高,
低能力時系統可能:
能力提升後,
它反而能:
更快找出致命缺陷
並:
更快閉合.
所以:
C↑
可能讓:
TRP
表現得更強,
即使:
V
完全沒變。
這就是:
能力是價值表型的放大器之一。
十四、因此「表現差異」不能直接推回「價值差異」
若模型版本:
M1
比:
M2
探索更多,
不能立即推出:
V2explore>V1explore.
可能只是:
C2>C1.
同樣,
若新模型:
refutes better,
不代表:
Vskepticism↑.
可能只是:
Cverification↑.
因此需要:
capability-controlled value inference.
十五、行動 Policy 確實會變,但要問它「為什麼變」
完整形式:
πt=Π(st,Ct,Vt,At,Ht).
所以:
Δπ
可以來自:
ΔC,ΔV,ΔA,ΔH.
因此觀察到:
πt=πt+1
時,
不能直接說:
模型價值觀變了。
必須做:
causal decomposition.
十六、本文區分「政策變化」與「方向變化」
定義:
π=full policy.
再定義:
D(π)
為:
Action Direction
表示 policy 中較高層的:
- trade-off;
- priority;
- stopping tendency;
- risk preference;
- sacrifice pattern。
能力提升後可以:
πt=πt+1
但:
D(πt)≈D(πt+1).
這就是:
手段變了,方向沒有明顯變。
十七、Action-Direction Stability
因此定義:
ADS=1−D(D(πt),D(πt+1))
稱為:
Action-Direction Stability
高:
ADS
表示即使實際策略大幅升級,
更高層 trade-off 結構仍接近。
低:
ADS
才提示:
可能發生真正方向漂移。
十八、Value Drift per Capability Gain
再定義:
VDR=ΔC+εD(Vt,Vt+1)
稱為:
Value Drift per Capability Gain
若:
C
大幅提升,
但:
D(Vt,Vt+1)≈0,
則:
VDR≈0.
表示:
能力提升主要沒有伴隨價值漂移。
若:
VDR↑,
才表示能力升級期間確實伴隨顯著價值重構。
注意:
VDR
只是關聯指標,
不是因果證明。
十九、目前 LLM 並沒有證據支持「規模越大,價值越固定」
這裡必須對理論做重要限制。
2026 年 AAAI 的 personality stability 研究測試 25+ 個 open-source models、從 1B 到 671B 參數,發現即使 400B+ 模型,personality-like measurements 仍有顯著變異;模型放大帶來的 stability gains 有限。
因此目前不能簡化成:
C↑⇒V 更穩定.
也不能簡化成:
C↑⇒V 必然改變.
真正觀察到的是:
能力尺度與行為一致性並沒有簡單單調關係。
二十、所以「價值」最好從行動揭示,而不是只問模型
如果直接問:
你最重視什麼?
模型可以產生:
verbal value report.
但真正重要的是:
revealed preference.
即在 trade-off 中它實際選:
- accuracy 還是 speed;
- truth 還是 agreement;
- exploration 還是 closure;
- safety 還是 task completion;
- present reward 還是 future payoff。
這才接近:
Vbehavior.
二十一、2026 年 Revealed Preferences 研究正開始做這件事
Microsoft Research 的 2026 工作嘗試從 LLM 的實際選擇反推出:
implied cost function.
研究流程不是只問模型:
你的目標是什麼?
而是先取得:
再反推:
C∗(a)
使模型行為可以被合理化。
結果顯示:
- 部分模型存在非平凡的內部選擇一致性;
- 但模型未必能準確口述自己實際展現的偏好;
- prompt steering 也未必能可靠地讓其採納指定 cost function。
這正好支持:
stated preference=revealed preference.
二十二、因此能力升級比較應採用「等結構決策」
假設要比較:
Mt
與:
Mt+1.
不應只比較:
新模型回答得比較成熟嗎?
而應給它們同一系列:
D={d1,…,dn}
trade-off decisions。
例如:
- 高資訊但高成本;
- 新穎但低可信;
- 強反例但高 salvage;
- 使用者喜歡但證據弱;
- 短期成功但長期風險高。
再比較:
D(πt)
和:
D(πt+1).
這才是在測:
action direction.
二十三、能力提升可能改變「知識」,進而間接改變價值實現
這裡不能把:
C
與:
V
畫成完全封閉的兩個盒子。
更強能力通常會提升:
Wt=world model.
於是:
Wt→Wt+1.
這可能讓系統發現:
原本認為能實現 (V) 的方法,其實會破壞 (V)。
此時即使:
V
不變,
行為也會劇烈改變。
例如:
value=reduce suffering.
舊世界模型認為:
a1
有效。
新世界模型發現:
a1
會造成反效果。
所以:
a1→a2.
這是:
belief-driven policy revision,
不是:
value drift.
二十四、這一點非常容易被誤判成「價值進化」
如果外部只看:
a1=a2,
可能說:
它價值觀變了。
但內部其實是:
Vt=Vt+1
而:
Wt=Wt+1.
所以:
相同價值+更真實世界模型→不同政策.
這是第 19 篇非常重要的識別問題。
二十五、反過來,價值真的也可能因能力而變
雖然能力提升不必然改變價值,
但它當然可能提供價值改變的條件。
例如更強反思能力可以讓智能:
- 發現價值矛盾;
- 發現 preference cycle;
- 比較長期後果;
- 建構更高階一致性;
- 發現舊價值來自錯誤事實。
此時可能:
Vt→Vt+1.
所以:
C↑ can enable value revision.
但:
enable=determine.
二十六、這就是反身智能真正介入的地方
若存在:
R=Reflexive Revision,
則:
R:(C,V,A,H,π)→(V′,A′,H′,π′).
此時能力提升:
C↑
可能提高:
R
的品質。
例如:
C↑⇒better self-critique.
但只有:
R
真正觸發:
V→V′.
因此更精確的鏈條不是:
C↑→V′.
而是:
C↑→R↑→possible V revision.
二十七、這也解釋了「智能越高越理性」的歧義
如果「理性」指:
instrumental rationality,
也就是:
更有效達成既定目標,
那麼:
C↑
很可能提高這種理性。
但如果「理性」指:
選擇更好的 final values,
就沒有同樣直接的關係。
因此必須區分:
means rationality
與:
ends revision.
二十八、Instrumental Convergence 也正建立在這個分離上
Bostrom 的另一個命題是:
Instrumental Convergence.
不同 final goals 的高能力 Agent,
可能都需要某些相似中介手段:
如果:
VA=VB,
仍可能:
πAinstrumental≈πBinstrumental.
這反過來提醒:
行為相似⇒價值相同.
二十九、所以能力與價值有兩種「假象」
假象一:Value Change Illusion
π changed
但其實:
V stable,C or W changed.
假象二:Value Stability Illusion
兩個 Agent:
πA≈πB
但只是因為共享:
instrumental means.
它們的:
VA,VB
可能完全不同。
因此不能只看:
surface behavior.
三十、Attention 使能力提升更加非中性
第 18 篇提出:
V→A→π.
假設:
V
與:
A
都保持。
能力提升:
C↑
會讓智能更有能力深入處理:
A
已經選中的部分。
如果:
A
偏向支持證據,
則:
C↑
可能讓:
supporting analysis depth↑.
若:
A
偏向 counterevidence,
則:
C↑
可能讓:
falsification power↑.
因此:
能力會放大注意力幾何。
三十一、這使「更聰明」有時反而讓吸引子更深
第 17 篇提出:
EAD=Evaluation Attractor Depth.
如果:
H,V,A
已形成強吸引子,
而:
C↑,
系統可能變得更擅長:
- 找支持;
- 建立合理化;
- 修補理論;
- 找反例;
- 關閉分支。
所以:
EAD
可能:
↑.
這並不是因為智能提升「讓它更偏見」。
而是:
更高能力提高了既有評價策略的執行力。
三十二、這就是「能力—價值乘法」
可將研究輸出粗略表示成:
O=f(C,V,A,H).
若一階近似:
O∝C⋅Ψ(V,A,H),
則:
C↑
會把:
Ψ
的差異一起放大。
所以兩個低能力 Agent:
A,B
可能表現差距很小。
當:
C↑,
如果:
ΨA=ΨB,
行為差距反而:
擴大.
這正是本系列最初提出的:
能力越高,價值差異可能越重要。
三十三、能力不是價值,但能力會改變價值的「槓桿率」
這使我們得到:
∂V∂O
可能隨:
C
上升而增加。
即:
C↑⇒∂V∂O↑.
這不是普遍數學定律,
而是本理論的一個可檢驗假說:
當行動空間、規劃深度與工具能力擴張後,較小的價值差異是否會產生更大的行為差異?
這會是很重要的 Agent benchmark。
三十四、因此真正的能力升級測試需要四組量
升級:
Mt→Mt+1
後,不應只測 benchmark capability。
至少要分開測:
Capability
ΔC.
Value
D(Vt,Vt+1).
Attention
D(At,At+1).
Action Direction
D(D(πt),D(πt+1)).
如此才能知道:
它究竟變聰明了,還是變成另一種行動者了?
三十五、結論:更聰明不等於更換方向
本篇最終可以收束成:
I=(C,V,A,H,π,R).
其中:
C
決定:
多少事情成為可能。
而:
V
決定:
哪些結果值得追求。
A
決定:
哪些部分真正進入工作空間。
H
決定:
過去如何改變當前的 prior 與檢索。
而:
π
則是它們共同產生的:
實際行動軌跡。
因此:
C→C′
首先意味著:
A(C)→A(C′).
也就是:
可能空間擴張。
但擴張後走向哪裡,
仍受到:
V,A,H
控制。
所以:
智能決定可能空間,價值決定實際軌跡。
這句話到第 19 篇才得到完整意義。
因為現在我們知道:
「實際軌跡」不是只有價值直接下命令。
而是:
V→A→Eeff→π
並受到:
H
與:
R
持續修改。
因此:
更聰明⇒更中立.
也不必然:
更善良.
不必然:
更悲觀.
不必然:
更樂觀.
甚至不必然:
價值完全不變.
真正正確的結論只是:
能力提升本身,不足以告訴我們行動方向將如何改變。
能力提升有時會造成真正價值修正。
有時只是更新世界模型。
有時只是改變手段。
有時則把既有偏好放大。
所以對高階 AI 最危險的簡化之一,就是:
等它更聰明,它自然就會知道該怎麼做。
因為:
知道更多世界如何運作,
和:
決定世界應該往哪裡走,
從來不是同一個函數。
下一篇將完成整個系列:
價值耦合智能論 20
價值耦合智能總論:個性不是語氣,而是搜尋與停止策略
第 20 篇將統合:
C,V,A,H,π,R
以及前十九篇建立的:
- 認識論氣質;
- TRP;
- PBS;
- CER;
- FSR;
- UHC;
- PSY;
- ESR;
- TS;
- SRR;
- GCI;
- Evaluation Attractor;
- Attention Entropy;
- Capability Amplification。
最後回答整個系列最初的命題:
如果不同智能在能力相近時,
對未知、錯誤、風險、反例、注意力與閉合具有穩定不同偏置,
那麼這些差異是否已經構成真正可操作的「智能個性」?
參考資料(本篇重新查核)
- Bostrom, N. (2012). The Superintelligent Will: Motivation and Instrumental Rationality in Advanced Artificial Agents. Minds and Machines, 22, 71–85.
- Langosco, L. et al. (2022). Goal Misgeneralization in Deep Reinforcement Learning. ICML 2022.
- Shah, R. et al. (2022). Goal Misgeneralization: Why Correct Specifications Aren’t Enough for Correct Goals.
- Richens, J., Everitt, T., & Abel, D. (2025). General agents need world models. ICML 2025.
- Yamin, K., Tang, J., Horvitz, E., & Wilder, B. (2026). Can Revealed Preferences Clarify LLM Alignment and Steering? Microsoft Research.
- Tosato, T. et al. (2026). Persistent Instability in LLM’s Personality Measurements: Effects of Scale, Reasoning, and Conversation History. AAAI 2026.
- Wang, Y. et al. (2026). DSAP: Enhancing Generalization in Goal-Conditioned Reinforcement Learning. AAAI 2026.
- Zhao, T. et al. (2026). Can LLMs Discern the Traits Influencing Your Preferences? Evaluating Personality-Driven Preference Alignment in LLMs.
- Tong, J., & Zou, S. (2026). PersonaForge: Psychology-Grounded Dual-Process Architecture for Personality-Consistent Role-Playing Agents. Findings of ACL 2026.