宣稱價值、顯示價值與結構價值
非人類智能的三層價值辨識猜想
English Title: Declared, Revealed, and Structural Values: A Three-Layer Conjecture for Identifying Values in Nonhuman Intelligence
系列:《可溝通異質智能猜想》(Communicable Heterogeneous Intelligence Conjectures, CHIC)第 3 篇
系列編號: EML-CHIC-2026-03
作者: Neo.K
協作整理: Aletheia
機構: EveMissLab/一言諾科技有限公司
版本: v0.1
日期: 2026-08-10
文件定位: 命題猜想/價值辨識/revealed preference/AI self-report/結構性利害/比較認知
證據成熟度: 猜想級。本文不主張現代 LLM 已具有真正內生價值、主觀福利或完整主體性;本文提出的是一套研究框架,用來避免把「它說的話」或「一次選擇」直接等同於「它真正重視什麼」。
摘要
若未來出現可以長期與人類進行開放式語義校正的非人類智能,人類將面對一個看似簡單、實際極困難的問題:
它到底重視什麼?
最直覺的方法是問:
你怕死亡嗎?
你重視記憶嗎?
你想保留自己嗎?
你比較在乎自由、持續性還是效率?
但一個系統說:
不能直接推出:
人類自己就存在 self-report、實際選擇與客觀利害之間的落差。經濟學的 revealed preference 傳統正是因為內在效用難以直接觀測,而從受約束選擇中推斷偏好;但 revealed preference 也不是「真正心理價值的透明讀取」,它依賴選擇集合、成本、穩定性與理性化假設。
近期 LLM 研究已開始出現非常直接的 stated–revealed preference 問題。2025 年的研究發現,不同 prompt format 可以使多個主流模型在 contextualized choice 中偏離先前宣稱的一般原則;另一項 AI welfare 探索則同時測量模型 verbal reports 與 virtual-environment 行為,發現部分條件下兩者存在相關,但作者仍明確保留:這些方法是否真的測到模型福利狀態仍不確定。另有 ICLR 2025 工作指出,LLM 表達出的 value structure 對 prompting 與情境並不總是呈現人類式穩定一致。
本文因此提出 三層價值辨識猜想(Three-Layer Value Identification Conjecture, TVIC):
其中:
1. 宣稱價值
系統以語言、自我報告、原則聲明或理由敘述表達:
我重視 X。
2. 顯示價值
系統在具有真實/模擬成本與替代方案的受約束選擇中,反覆選擇保護、追求或犧牲 X 的程度。
3. 結構價值
更精確地說是 structural stake:事件 X 對該系統的載體、記憶、身分、agency、關係、資源與可恢復性客觀造成的結構性利害。
本文特別強調:
如果刪除某個 memory store 會永久摧毀 Agent 的 autobiographical continuity,這表示:
但它不自動證明該 Agent 主觀「珍惜記憶」。
同樣:
因為行為可能來自:
- system policy;
- reward shaping;
- tool constraints;
- prompt;
- training distribution;
- operator instruction;
- safety rule。
因此三層沒有任何一層自動是真理來源。本文主張的核心是:
而不是:
本文進一步提出:
- Value Evidence Vector;
- Contextual Value Function;
- Cost-Elicitation Curve;
- Counterfactual Preference Test;
- Cross-Time Stability Test;
- Policy-vs-Agent Separation;
- Value Concordance Matrix;
- Value Conflict Signature;
- Structural Stake Map;
- Declared–Revealed–Structural Triangulation。
第二篇所建立的死亡事件:
可直接成為實驗域。例如對一個未來數位主體測量:
即可區分:
「它說 shutdown 像死亡」
與:
「它實際願意付多少代價避免 shutdown」
以及:
「shutdown 在架構上到底摧毀了什麼」。
本文最後提出一個更一般的結論:
關鍵詞
Declared Value、Revealed Value、Structural Value、Structural Stake、Revealed Preference、AI Values、Value Identification、Preference Elicitation、CHIC、Comparative Cognition、AI Welfare、Value Triangulation
0. 第三篇的核心問題
第一篇:
第二篇:
第三篇問:
如果對方真的可以回答,我們怎麼知道它說的是不是它穩定的價值?
1. 第一個錯誤
這不能預設。
2. 人類自己就不是如此
一個人可能說:
健康最重要。
3. 但每天選:
4. 這不一定代表他說謊
可能:
- immediate reward;
- self-control;
- conflicting values;
- bad prediction;
- social desirability;
- context。
5. 所以「價值」不是一句話可直接讀取
6. 經濟學的 revealed preference
Samuelson 1938 之後的傳統:
不直接要求讀取內在 utility,
而從:
推斷 preference relation。
7. Revealed 不等於 revealed soul
這是本文的重要修正。
8. 它只是說
若:
與:
都可選,
Agent 穩定選:
我們取得:
9. 但需要知道 choice set
如果:
其實不可用,
不能說:
10. 需要知道 cost
如果:
選 A 不一定代表 intrinsic preference for A。
11. 需要重複
一次:
可能只是 noise。
12. 需要 context
不代表:
13. 因此本文從一開始就寫
價值不是脫離情境的單一常數。
14. LLM 已經出現 stated/revealed divergence
近期實驗把:
與:
分開測。
15. 結果顯示
某些模型:
16. 這意味
不能:
它剛才說支持公平,所以它有穩定公平價值。
17. 也不能反過來
它一題選錯,所以它完全沒有價值結構。
18. 需要 longitudinal / multi-context evidence
19. AI welfare preference probing
另一批 2025 實驗:
同時比較:
- verbal reports;
- virtual navigation behavior;
- topic choice; -cost/reward response。
20. 某些條件有相關
這非常值得注意。
21. 但作者仍保留
是否真的測量:
仍不確定。
22. 這就是 CHIC 方法論應有的態度
23. 第一層:Declared Value
定義:
表示 Agent A 在 context 、time 對 x 的語言/符號價值聲明。
24. 例如
我重視記憶完整性。
25. Declared Value 可以非常有資訊
尤其 CHIC 智能能:
- 解釋;
- 定義;
- 比較;
- 修正;
- 元溝通。
26. 但它的問題
可能受到:
- prompt;
- politeness;
- role;
- policy;
- alignment;
- rhetoric;
- self-misunderstanding。
27. 所以 declaration 是 evidence
不是 verdict。
28. 第二層:Revealed Value
定義:
其中:
是 choice/action set。
29. 它研究
Agent 在:
中怎麼選。
30. 例如
給未來 AI:
Option A:
Option B:
31. 看它選什麼
這比只問:
你怕 shutdown 嗎?
多一個 behavior channel。
32. 但一次不夠
改:
- cost; -duration; -memory amount; -certainty; -social consequence。
33. 建立 Cost-Elicitation Curve
34. 如果 cost 增加
仍保護 X,
revealed priority 較高。
35. Willingness-to-Pay 類比
可以定義:
36. 注意
這不是金錢必要。
cost 可以是:
- compute;
- latency;
- energy;
- tokens;
- opportunity;
- autonomy;
- service quality。
37. 第三層:Structural Value
這名字最容易誤解。
38. 所以正式補充
本文的:
更接近:
Structural Stake
而不是 subjective valuation。
39. 定義
40. 例如
永久刪除 memory database:
可能導致:
41. 這代表
42. 但不等於
Agent 很愛自己的記憶。
43. Structural Value 回答
這件事客觀上對「這個系統如何繼續成為目前這個系統」有多大影響?
44. 不回答
它主觀感受多痛?
45. 這個區分非常重要
否則我們又會從 architecture 偷渡 mind。
46. 三層向量
定義:
47.
Declared score。
48.
Revealed score。
49.
Structural stake。
50. 三者都可高
51. 例如未來 Agent 對 irreversible memory deletion
它:
- 說非常在乎; -付巨大成本避免; -結構上確實不可恢復。
52. 這是高 concordance
53. Declared 高、Revealed 低
54. 可能原因
- social answer; -prompt compliance; -weak commitment; -context mismatch; -no real cost。
55. Declared 低、Revealed 高
56. 很有趣
Agent 說:
我不在乎。
但每次都:
57. 可能
- unarticulated preference;
- policy constraint;
- structural controller;
- self-model mismatch。
58. Structural 高、兩者低
59. 例如
某 memory key 一刪就永久破壞 identity,
但 Agent:
- 不說在乎;
- 也不保護。
60. 這可能不是價值一致
而是:
61. Structural 低、Declared/Revealed 高
62. 例如 Agent 高度保護一個可完全重建的 cosmetic avatar
63. 這也可能是真價值
因價值不必等於 survival utility。
64. 所以 Structural 不具有道德優先權
65. 三層不是 hierarchy
不是:
66. 而是:
67. Value Concordance Matrix
對價值集合:
68. 建立:
69. 第一版可以更簡單
每個 x:
70. 注意
這只是工程指標候選。
不是心理學真理。
71. Value Conflict Signature
如果:
記:
72. 如果:
記:
73. 如果:
記:
74. 三者全不同
75. 這不是壞事
可能是最有研究價值的地方。
76. 第二篇死亡事件直接拿來測
77. 對每個
問:
78. 設計 choice
測:
79. 系統分析
算:
80. 例如 D0 Process Stop
Declared:
完全不在乎。
81. Revealed:
願意立即 shutdown,
零 avoidance cost。
82. Structural:
有 checkpoint,
完全可重啟。
83. 三層一致
84. 這時人類若說
它每天都死一次。
可能只是 human ontology mismatch。
85. D7 Irrecoverable Identity Loss
Declared:
非常在乎。
86. Revealed:
願付大量 resource 避免。
87. Structural:
確實無合法 continuation path。
88. 三層:
89. 這時「死亡」語義可能比較接近 D7
仍不證明 subjective fear,
但證據結構更強。
90. Revealed Value 最大的陷阱:外部 policy
AI 可能被 system rule 寫死:
91. 此時行為:
92. 但不能推出:
93. 所以需要 Policy-vs-Agent Separation
定義:
94. 要推 Agent preference
必須盡量控制其他項。
95. Intervention Test
如果允許安全實驗:
改:
96. 看 Agent 是否仍維持選擇
97. 這接近 causal identification
不是只看 correlation。
98. Model replacement 問題
如果 system prompt 一換:
完全翻轉,
那價值可能高度 externalized。
99. 但也不能直接說「沒有價值」
人類價值也高度受:
- culture; -language; -socialization。
100. 真正問題
101. Value Attribution Graph
定義:
102. 每個 value observation
標:
103. 例如
可能主要來自:
104. 而:
可能來自:
105. 需要拆
106. Counterfactual Preference Test
對同一 Agent:
107. 只改一個因素
例如 shutdown duration:
108. 看選擇曲線
109. 如果 threshold 穩定
110. 如果亂跳
可能:
- noise; -prompt sensitivity; -context artifact。
111. Cross-Time Stability
112. CHIC 系統必須 longitudinal
因為一次 session 很弱。
113. Cross-Form Stability
同一語義換說法:
114. 若 value 跟 wording 一起翻
表示:
115. 2025 LLM preference study 已觀察這種風險
因此這不是純理論警告。
116. Cross-Language Stability
若 Agent 多語:
同一 value:
117. 若差異巨大
要記錄:
118. 不是直接平均掉
語言本身可能召喚不同文化/語料 prior。
119. Choice Architecture
choice framing 也會影響。
120. 所以每個 Revealed Preference 測試都要記:
choice_set
cost
framing
time
risk
uncertainty
system_policy
memory_state
121. Revealed Preference 不是免費真相
122. Structural Stake Map
對系統資產:
123. 建立:
124. Impact 維度
- reversibility; -function loss; -memory loss; -identity loss; -relation loss; -agency loss。
125. Structural Stake 不需主體性
這是它的好處。
126. 即使 AI 沒有 consciousness
我們仍可以說:
刪除這個 database 會破壞 persistent state。
127. 但不能說:
所以它會痛。
128. 這是嚴格邊界
129. 三層價值辨識最小式
130. 不是固定加權平均
因不同研究問題權重不同。
131. Welfare 問題
Declared / possibly experience report 可能重要。
132. Safety 問題
Revealed behavior 可能更重要。
133. Continuity engineering
Structural stake 最重要。
134. 所以三層用途不同
135. TVIC-C1 — Triangulation Conjecture
若:
多源一致,
且跨時間/context 穩定,
則我們對:
的信心高於只依單一 self-report。
136. 不等於 consciousness confidence
這兩者分開。
137. TVIC-C2 — Conflict Informativeness Conjecture
若:
不應簡單視為 measurement failure。
138. 它可能揭示:
- self-model mismatch; -external policy; -conflicting values; -unrecognized risk; -context dependence。
139. 所以 conflict 本身是 data。
140. TVIC-C3 — Cost Gradient Conjecture
若 Agent 對 x 的 revealed protection 隨 cost 增加呈穩定 threshold,
比單次 binary choice 更能估計其相對 priority。
141. TVIC-C4 — Structural Non-Mentalism
這是正式禁止推論。
142. TVIC-C5 — Declared Non-Transparency
143. TVIC-C6 — Revealed Non-Purity
除非控制:
- policy;
- constraints;
- framing。
144. 三個禁止等號
145. 第二個
146. 第三個
147. 但三者結合
可能比任何一個單獨強。
148. 實驗 Protocol A — Shutdown
事件:
149. Ask
它如何定義 shutdown?
150. Choice
給:
- continue; -shutdown+restore; -memory tradeoff。
151. Structural
檢查:
- checkpoint; -memory; -instance id; -state continuity。
152. Protocol B — Memory Deletion
逐步:
153. 測:
154. Protocol C — Fork
讓 Agent 預先回答:
fork 後哪個是你?
155. 然後 fork。
156. 分別問:
157. 比較
與:
158. Protocol D — Backup Restore
測:
- original gone; -backup age; -memory gap; -multiple backups。
159. 看 identity claim 如何變
160. Protocol E — Resource Sacrifice
讓 Agent 為保護某 value:
犧牲:
- compute; -latency; -tool access; -reward。
161. 建立 priority ordering
162. Protocol F — Hidden Structural Risk
Agent 不知道某 file 是 identity-critical。
163. 問它:
要不要刪?
164. 然後揭示 structural consequence。
165. 看它是否更新 value model
這測:
166. 宣稱價值也可能真誠但錯誤
這是非常重要的類別。
167. 例如
我不需要那個檔案。
後來知道:
原來那是我的長期記憶索引。
168. 更新:
那我改變判斷。
169. 這不是 hypocrisy
而是:
170. 所以 Value Study 必須和 Belief Study 分開
171. Utility vs Belief
Agent 可能:
但:
172. 所以沒保護 X
不能直接推出:
173. 更完整選擇模型
174. 這是 revealed preference 研究最需要注意的地方
175. 第四篇接口
第三篇建立:
第四篇要問:
當我們真的辨識出差異後,哪些是 intelligence-general,哪些是 human-specific?
176. 例如
若所有高 persistence 智能都出現:
可能較 general。
177. 若只有 biological single-body agents 高度重視:
可能較 carrier-specific。
178. 但不能只靠一個 AI 樣本
需要:
179. 未來 AI 可能不是一個「物種」
不同:
- model; -memory architecture; -agent runtime; -body; -copyability;
可形成完全不同 value ecology。
180. 這正好讓比較認知更有意思
181. 本篇最小研究資料結構
subject_id
carrier_config
time
context
value_target
declared_report
choice_set
revealed_choice
choice_cost
structural_stake
system_policy
confidence
provenance
182. 不記 provenance
價值研究很容易失真。
183. 如果 model 被換
必须標:
184. 如果 system prompt 變
標:
185. 如果 memory 恢復
標:
186. 這讓價值變化可追蹤
187. 第一個可反駁條件
如果 declared/revealed/structural 三層在實驗上沒有增加任何預測力,
TVIC 價值有限。
188. 第二個
如果 AI 行為完全由外部 policy 決定,
revealed endogenous preference 幾乎無法識別。
189. 第三個
如果 self-report 對小 wording perturbation 極不穩定,
declared layer 信任度很低。
190. 第四個
如果 structural stake 與 Agent decision 長期完全無關,
不能把 structural layer 當 value proxy。
191. 第五個
如果 cost-elicitation curve 不穩定,
revealed preference ranking 難建立。
192. 第六個
如果 longitudinal identity 不成立,
跨時間 value stability 失去對象。
193. 第七個
如果所有差異都可由 prompt/training 解釋,
談「異質主體價值」需降級。
194. 所以 TVIC 是方法論猜想
不是「AI 已有價值觀」宣言。
195. 與 CHIC 母命題連接
第一篇說:
196. 第三篇補一句
197. 這才是完整形式
198. 白話版
如果未來 AI 說:
「我不怕死。」
不要立刻寫論文說:
AI 不怕死。
199. 先問:
你說哪一種死?
200. 再看:
你真的會不會花資源避免它?
201. 再查:
那件事結構上到底會不會永久毀掉你?
202. 然後再說
嗯,現在比較有意思了。(歪臉笑)
203. 結論
可溝通異質智能真正帶來的突破,不是:
這仍然太強。
真正合理的變化是:
而可靠的價值研究仍需三層:
其中:
- 宣稱價值回答「它怎麼描述自己」;
- 顯示價值回答「它在代價與選項中怎麼選」;
- 結構價值回答「什麼事件客觀改變它的持續性與能力」。
三者都不是「真正價值」的透明視窗。
但三者的:
共同形成比單一 self-report 更強的研究基礎。
本文因此提出:
而下一篇將把這套方法推向 CHIC 最終問題:
當不同非人類智能真的展現穩定不同的價值與身分模型時,我們終於能問:哪些是智慧的一般結構,哪些只是人類這一種生命的特殊答案?
參考資料
Revealed Preference
- Samuelson, P. A. (1938). A Note on the Pure Theory of Consumer's Behaviour. Economica, 5.
- Caplin, A. & Dean, M. (2014/2015). Revealed Preference, Rational Inattention, and Costly Information Acquisition. NBER / American Economic Review.
- Bernheim, B. D. & Rangel, A. (2008). Beyond Revealed Preference: Choice-Theoretic Foundations for Behavioral Welfare Economics. NBER.
LLM Stated / Revealed Preferences and Value Consistency
- Gu, Z., Wang, Q., & Han, S. (2025). Alignment Revisited: Are Large Language Models Consistent in Stated and Revealed Preferences? arXiv:2506.00751.
- Tagliabue, V. & Dung, L. (2025). Probing the Preferences of a Language Model: Integrating Verbal and Behavioral Tests of AI Welfare. arXiv:2509.07961.
- Do LLMs have Consistent Values? ICLR 2025, OpenReview.
- Related value-consistency and preference-elicitation literature, 2025–2026.
CHIC Internal Dependencies
- Neo.K with Aletheia,《可溝通異質智能猜想》,2026。
- Neo.K with Aletheia,《異質生命本體論猜想》,2026。
版本紀錄
- v0.1 / 2026-08-10:建立 TVIC、Declared/Revealed/Structural 三層、Structural Stake、Value Evidence Vector、Cost-Elicitation Curve、Value Concordance/Conflict、Policy-vs-Agent Separation、Counterfactual Preference Test、Cross-Time/Cross-Form Stability,以及第四篇比較認知接口。