理解共享域算子族:跨觀察者的視覺關係語義
Understanding Shared-Domain Operators for Cross-Observer Visual Semantics
——從人類高階感受詞,走向可組合、可比較、可反事實推理的視覺關係結構
VUSD Series — Paper 03 / 05
作者: Neo.K
機構: EveMissLab/一言諾科技有限公司
版本: v0.1
日期: 2026-08-31
定位: 基礎理論 / Shared-Domain Semantics / Operator Theory
研究狀態: 理論原型;目前提出的是 bootstrap operator family,而非宣稱完成全部視覺本體
摘要
Visual Understanding Shared-Domain Theory(VUSD)在 Paper 01 中提出:
其中:
- :Visual Decision;
- :Perceptual / Relational Mechanism;
- :Understanding Shared Domain;
- :Observer Projection;
- :Experienced Meaning。
Paper 02 進一步區分:
本文專門處理其中最重要、也最容易被混淆的一層:
Understanding Shared Domain
理解共享域
核心問題是:
若我們暫時不把「性感、神聖、威嚴、可愛、恐怖、優雅」等人類高階感受詞當作最底層 primitive,是否能建立一組較底層、可跨觀察者描述的視覺關係算子?
本文提出第一版:
但強調:
這些算子不是「宇宙終極美學字典」,而是可供 AI 與人類共同推理的初始共享描述域。
本文主張:
同一個 Shared-domain State 可以被不同 observer 投影成不同 Experienced Meaning。
例如:
可能被某個 observer 感受為「誘惑」,被另一個 observer 感受為「神秘」,也可能被第三個 observer 解讀為「不安」。
因此:
而不是:
VUSD 的目標不是消除主觀性,而是在主觀經驗之前建立一層較可共享、可計算、可反事實比較的關係語義。
1. 為什麼需要 Shared Domain?
AI 視覺分析常直接輸出:
這張圖很性感
這張圖很莊嚴
這張圖很有壓迫感
這張圖很可愛
這張圖很孤獨
這些描述具有實用價值。
但如果把它們直接當作底層變量,就會出現三個問題。
1.1 同一視覺形式可能被不同 observer 解讀不同
例如:
黑色大面積背景
可能被描述為:
神秘
高級
孤獨
壓迫
死亡
極簡
因此:
1.2 同一高階感受可由不同形式產生
例如:
威嚴
可能來自:
低視角
大尺度
中央構圖
對稱
距離
高垂直線
低頻動作
高材質重量
所以:
1.3 高階感受詞往往包含文化與語言投影
例如:
性感
並不是單一物理或知覺量。
它可能涉及:
身體可讀性
距離
視線
互惠
遮蔽 / 揭露
姿態
文化規範
性別角色
時代審美
個人偏好
因此:
2. Shared Domain 的定義
本文暫定:
Understanding Shared Domain
為:
一組位於純像素/幾何描述與具體 observer 主觀經驗之間,能描述視覺關係、注意力配置、方向、距離、衝突、遮蔽、群組、節奏等結構的中介語義域。
形式:
其中:
3. Shared 不代表所有觀察者完全一致
「Shared」不是:
所有 observer 看見同一感覺。
而是:
不同 observer 或不同智能系統有可能對某些較底層關係達成較高程度的一致描述。
例如:
A 比 B 更亮
人物比背景更突出
視線指向觀者
兩個主要形體重複
臉與身體朝向不同
某物被部分遮住
這些描述通常比:
性感
神聖
漂亮
更容易跨 observer 對齊。
所以:
而不是:
4. 三層語義結構
VUSD 建議將視覺語義拆成:
L1 — Artifact / Structural State
例如:
亮度
位置
角度
面積
遮擋
輪廓
顏色
姿態
材質
透明度
L2 — Shared-Domain Relation
例如:
salience
contrast
distance
repetition
reveal
conceal
directional conflict
reciprocity
dominance
uncertainty
L3 — Observer Meaning
例如:
性感
恐怖
神聖
溫柔
壓迫
可愛
優雅
危險
因此:
5. Primitive 不應定義得太快
本文使用「operator」而不是「emotion primitive」。
原因是:
Attention
Contrast
Reveal
Distance
仍可能不是不可再分解的真正 primitive。
它們只是目前足夠有用的:
Operational Primitives
即:
工程上暫時可操作、可測量、可組合的基礎單位。
因此:
6. 第一類:Attention / Salience Operators
這一類描述:
什麼更容易被觀察系統優先選取。
包括:
ATTENTION
SALIENCE
FOCALITY
COMPETITION
DISTRACTION
例如:
在某些條件下成立。
但不表示:
7. 第二類:Contrast / Difference Operators
視覺系統大量依賴差異。
包括:
LUMINANCE_CONTRAST
COLOR_CONTRAST
SCALE_CONTRAST
TEXTURE_CONTRAST
MATERIAL_CONTRAST
DENSITY_CONTRAST
DIRECTION_CONTRAST
SEMANTIC_CONTRAST
可以統合成:
例如:
柔軟皮膚
vs
蛇鱗
不只是材質不同。
它還可能造成:
surface contrast
tactile contrast
semantic contrast
8. 第三類:Distance / Proximity Operators
包括:
DISTANCE
PROXIMITY
SEPARATION
CONTACT
OVERLAP
ENCLOSURE
它們不必先被解釋成:
親密
疏離
而是描述:
元素之間的空間與關係距離。
例如:
可能影響:
但「親密感」仍需 Observer Projection。
9. 第四類:Direction / Orientation Operators
包括:
DIRECTION
ALIGNMENT
OPPOSITION
CONVERGENCE
DIVERGENCE
DIRECTIONAL_CONFLICT
GAZE_DIRECTION
BODY_DIRECTION
FLOW_DIRECTION
例如:
可以產生:
DIRECTIONAL_CONFLICT
再與:
RECIPROCITY
DISTANCE
形成更高階關係。
10. 第五類:Reciprocity / Relation Operators
這類算子描述:
畫面元素是否建立「互相指向」或「對 observer 回應」的關係。
包括:
RECIPROCITY
ADDRESS
RESPONSE
MUTUAL_ORIENTATION
VIEWER_BINDING
例如角色直視鏡頭:
可建立較高:
但:
ViewerBinding
不自動等於:
誘惑
威脅
親密
這些取決於其他 state。
11. 第六類:Approach / Avoidance Operators
包括:
APPROACH
AVOIDANCE
INVITATION
WITHDRAWAL
ACCESSIBILITY
INACCESSIBILITY
這裡必須小心。
Invitation 已比純幾何更高階。
所以 VUSD v0.1 將它視為:
Composite Shared Operator
例如:
而不是 primitive。
12. 第七類:Reveal / Conceal Operators
這一類對人物設計尤其重要。
包括:
REVEAL
CONCEAL
PARTIAL_VISIBILITY
OCCLUSION
TRANSPARENCY
LAYERED_VISIBILITY
例如薄紗:
但:
所以:
可以同時存在。
這比:
透明 = 性感
更精確。
13. 第八類:Expectation / Violation Operators
包括:
EXPECTATION
PREDICTABILITY
VIOLATION
SURPRISE
NOVELTY
DEVIATION
這些 operator 必須依賴:
observer prior
genre prior
historical prior
所以:
因此它是:
Observer-conditioned Shared Operator
不是完全 observer-independent。
14. Shared Domain 也有條件式算子
這表示 Shared Domain 並非全部都是:
observer-free
更合理是分成:
Type A — Mostly Structural
例如:
overlap
direction
scale contrast
repetition
Type B — Observer-conditioned
例如:
expectation
novelty
familiarity
semantic violation
所以:
其中:
- :structural shared operators;
- :observer-conditioned operators。
15. 第九類:Symmetry / Asymmetry Operators
包括:
SYMMETRY
ASYMMETRY
BALANCE
IMBALANCE
CENTERING
OFFSET
必須再次強調:
對稱可能提高:
stability
formality
predictability
但也可能降低:
dynamic tension
novelty
視 task 而定。
16. 第十類:Rhythm / Repetition Operators
包括:
RHYTHM
REPETITION
ALTERNATION
INTERVAL
ACCELERATION
DECELERATION
CADENCE
例如:
蛇的曲線
髮絲曲線
衣帶曲線
若方向相互呼應:
可形成:
visual rhythm
thematic coherence
17. 第十一類:Coherence / Conflict Operators
包括:
COHERENCE
INCOHERENCE
COMPATIBILITY
CONFLICT
STYLE_CONFLICT
SEMANTIC_CONFLICT
例如同一角色:
古風服裝
+
科幻槍械
不一定 incoherent。
若世界觀支持,它可以 coherence 很高。
因此:
而不是單純:
元素相似
18. 第十二類:Grouping / Segmentation Operators
包括:
GROUPING
SEPARATION
FIGURE_GROUND
ENCLOSURE
SIMILARITY_GROUP
PROXIMITY_GROUP
CONTINUITY_GROUP
它們回答:
觀察系統把哪些東西視為同一群?
這對:
構圖
服裝
UI
群像
背景
都非常重要。
19. 第十三類:Scale / Dominance Operators
包括:
SCALE
DOMINANCE
SUBORDINATION
OCCUPANCY
VISUAL_WEIGHT
HIERARCHY
例如:
可能提高:
visual dominance
但:
權力感
仍是更高階 Observer Meaning。
20. Dominance ≠ Social Meaning
這是一個典型去混淆:
一個物件在畫面上最大,
不代表它在故事中權力最高。
兩者可能相關,但需 context。
21. 第十四類:Density / Complexity Operators
包括:
DENSITY
SPARSITY
DETAIL
CLUTTER
COMPLEXITY
REDUNDANCY
例如:
可能:
但:
簡潔 = 高級
仍是 observer/context-dependent projection。
22. 第十五類:Continuity / Interruption Operators
包括:
CONTINUITY
INTERRUPTION
BREAK
FLOW
DISCONTINUITY
例如:
長髮流線
突然被武器切斷
可能形成:
flow interruption
並提高某區域 attention。
23. 第十六類:Uncertainty Operators
包括:
UNCERTAINTY
AMBIGUITY
INCOMPLETENESS
MULTISTABILITY
INDETERMINACY
例如:
表情似笑非笑
視線不完全對準
物件被遮擋一部分
可提高:
這不等於:
神秘
但可以成為神秘感的一部分。
24. 第十七類:Tension Operators
Tension 不應是一個單一數字。
可以拆成:
DIRECTIONAL_TENSION
SPATIAL_TENSION
RELATIONAL_TENSION
BALANCE_TENSION
EXPECTATION_TENSION
REVEAL_CONCEAL_TENSION
APPROACH_AVOIDANCE_TENSION
因此:
而不是:
25. Tension 是 composite operator
例如:
所以:
這與既有角色魅力研究中:
完全相容。
26. Shared-Domain Operator 的四種類型
VUSD v0.1 建議:
Type S — Structural
主要從 artifact 結構計算。
overlap
scale
direction
repetition
symmetry
Type P — Perceptual
依賴基本 observer / perceptual model。
salience
figure-ground
grouping
Type R — Relational
依賴元素之間交互。
reciprocity
dominance
distance tension
reveal-conceal
Type C — Context-conditioned
依賴文化、歷史、observer prior。
expectation
novelty
semantic violation
symbolic distance
27. Operator 不是詞彙表,而是可執行關係
若只把:
reveal
contrast
distance
存成文字,
價值有限。
真正 Operator 應至少有:
例如:
REVEAL_CONCEAL
可以定義:
Inputs:
foreground coverage
underlying feature visibility
material transparency
Condition:
partial occlusion
Output:
reveal_conceal_state
Scope:
layered visual structure
28. Operator Schema
建議:
{
"operatorId": "vusd.shared.reveal_conceal.v0.1",
"class": "RELATIONAL",
"inputs": [
"occlusion_map",
"visibility_map",
"transparency_map"
],
"outputs": [
"reveal",
"conceal",
"partial_visibility"
],
"scope": [
"character_art",
"material_layers"
],
"observerConditioned": false,
"confidence": 0.81
}
29. Composite Operator
高階關係可由低階組合。
例如:
這樣可以避免:
性感
變成黑盒 primitive。
30. Experienced Meaning 作為 Projection
假設:
不同 observer:
可能得到:
因此:
31. 共享域不是去除人類經驗
VUSD 不是要說:
「性感、可愛、恐怖」都不重要。
相反,它們仍然重要。
只是它們應位於:
Experienced Meaning
或:
Observer-conditioned semantic layer
而不是被錯當成:
pixel-native universal property
32. Human Meaning 可以作為高階 Operator Family
例如:
SENSUALITY
MAJESTY
CUTENESS
HORROR
SACRALITY
ELEGANCE
可以建立成:
Observer-domain Composite Operators
其形式:
33. 「性感」範例
不應:
更合理:
因此:
34. 「威嚴」範例
可能:
但沒有必要每個作品都用相同組合。
所以:
35. 「可愛」範例
可能涉及:
small scale
rounded contour
large head/body ratio
high reciprocity
low threat cue
soft material
predictability
但:
大眼只是某些文化與風格中的常見實現。
36. 「恐怖」範例
可能涉及:
uncertainty
expectation violation
low visibility
scale mismatch
body deformation
approach ambiguity
semantic conflict
因此:
37. Shared Domain 對 AI 的意義
若 AI 只知道:
這張比較性感
它很難知道應該改什麼。
若知道:
reciprocity 太低
reveal-conceal 降低
bodyline salience 被衣服吞掉
distance tension 消失
就可以更精確地選 Operator。
因此:
38. 與 AADS 的關係
AADS 可以把 Intent:
保留危險魅力但不要改變角色身份
編譯成 shared-domain targets:
retain:
reciprocity
uncertainty
reveal_conceal
body_salience
do not modify:
identity
garment topology
再選擇 Operator。
因此:
39. 與 RVGR 的關係
Reflexive Visual Generation 可以在中途觀察:
reciprocity drift
silhouette dominance drift
reveal-conceal collapse
比只說:
looks less attractive
更適合生成改寫。
40. 與 Style Control 的關係
Style Control 的:
Surface
Shape Syntax
Volume Syntax
Composition Rhythm
Palette
可以映射到 Shared Domain。
例如:
Composition Rhythm
→ rhythm / repetition / interval
Shape Syntax
→ continuity / scale / dominance
Palette
→ contrast / grouping / salience
因此 Style 不只是 feature vector。
它可以被理解成:
41. Artist Style 的更深表示
某畫家的風格不只是:
常用黃色
常用粗筆觸
也可能是:
反覆建立高 directional rhythm
偏好高 salience contrast
偏好不穩定 asymmetry
偏好 figure-ground compression
因此:
42. 風格相似 ≠ Shared-Domain 相同
兩張圖可能:
同筆觸
同色盤
但:
composition rhythm
dominance
distance
tension
不同。
因此:
這解釋了為什麼某些「畫風轉換」看起來像同一畫家,卻不像同一系列。
43. Observer Profile
Observer Projection 至少可包含:
culture
era
domain expertise
genre familiarity
age
task
preference
visual ability
AI model/version
形式:
44. AI 也可以是 Observer
這是 VUSD 的重要延伸。
Observer 不必限定為人類。
可以:
AI 的 projection 可能不具有:
人類現象意識
但仍可以進行:
relation detection
ranking
similarity
counterfactual prediction
semantic mapping
因此:
45. 不需要先解決「AI 是否真的有感覺」
VUSD 可以先保持不可知。
即:
AI may or may not have phenomenal experience
不影響:
AI can model shared-domain relations
所以:
46. Cross-Observer Agreement
可測量不同 observer 對 的一致度:
例如:
人物比背景更突出
可能 agreement 很高。
而:
人物很性感
agreement 可能較低。
這可以成為 Shared Domain 的實證基礎。
47. Sharedness Score
對 operator :
如果:
跨人類
跨 AI
跨文化
跨作品
都高度穩定,
可視為較強 shared operator。
48. Shared 不代表 Immutable
即使一個 operator 現在 agreement 很高:
未來也可能:
因為:
文化
媒介
AI
observer
都會演化。
這會在 Paper 05 正式處理。
49. Cross-Model Convergence Experiment
可以讓多個不同 AI:
在沒有共享固定詞表的情況下
分析同一批作品
要求:
找出最少的中介關係,用來解釋視覺效果。
觀察它們是否獨立收斂到:
contrast
distance
repetition
salience
symmetry
uncertainty
等概念。
若有收斂:
可能成為 Shared Domain 的一種證據。
50. Human–AI Alignment Experiment
給人類分析者與 AI 相同作品。
分別標註:
Visual Decision
Shared Relation
Experienced Meaning
如果發現:
Decision agreement > Meaning agreement
或:
Shared Relation agreement > Meaning agreement
則支持:
具有實際中介價值。
51. Counterfactual Test
例如原圖:
backward glance
修改成:
front gaze
問不同 observer:
reciprocity 是否改變?
directional conflict 是否改變?
mystery 是否改變?
若:
reciprocity agreement 高
mystery agreement 低
這正是 VUSD 預測。
52. Operator Discovery
不能只由研究者先寫死。
未來 AI 應能:
observe
cluster
hypothesize
name
test
split
merge
新的 Shared Operator。
因此:
53. Operator Split
例如目前:
TENSION
過於寬廣。
未來可能拆成:
directional tension
spatial tension
social tension
expectation tension
material tension
因此:
54. Operator Merge
反過來,若兩個 operator 長期:
高度共變
功能重疊
不可穩定區分
可能:
55. Operator Scope
每個 operator 必須標:
scope
例如:
character_art
landscape
film
UI
architecture
abstract_art
避免:
在角色立繪成立
→ 宣稱全藝術成立
56. Domain-Specific Shared Operators
例如人物角色可以有:
BODYLINE_SALIENCE
GAZE_RECIPROCITY
POSE_OPENNESS
GARMENT_REVEAL_CONCEAL
IDENTITY_SALIENCE
而 UI 可能有:
ACTION_SALIENCE
NAVIGATION_HIERARCHY
CONTROL_GROUPING
它們可以共享底層 operator,但 domain composite 不同。
57. Shared Operator 與文化符號必須分開
例如:
紅色
是 artifact feature。
high chromatic salience
可能是 shared-domain relation。
喜慶
可能是 culture-conditioned meaning。
所以:
58. Symbolic Operator
符號本身可以建模:
SYMBOL_RECOGNITION
SYMBOL_ASSOCIATION
CULTURAL_BINDING
但這些屬於:
Context-conditioned operator
而不是普適視覺 primitive。
59. Dynamic Shared-Domain State
一張作品可表示為:
但不同區域可不同:
因此:
臉
衣服
背景
武器
都可以有局部 shared-domain state。
60. Spatial Graph
更完整可用:
其中:
- :視覺實體/區域;
- :空間與語義關係;
- :Shared-domain operators。
這比單一 vector 更適合表示:
誰支配誰
誰指向誰
誰遮蔽誰
誰與誰重複
61. Temporal Visual Shared Domain
對動畫/影片:
還要加入:
motion
anticipation
delay
tempo
acceleration
temporal repetition
temporal interruption
因此 VUSD 並不限於靜態圖像。
62. 跨模態延伸
未來也可研究:
視覺節奏
音樂節奏
語言節奏
動作節奏
是否存在更高階共享域。
但本文暫不宣稱:
所有 modality 已統一
只保留接口。
63. Shared-Domain Loss
對 style transformation,可定義:
如果使用者只要求 renderer 改變,
可能希望:
對某些 selected dimensions。
64. Targeted Shared-Domain Edit
如果使用者要求:
更有威嚴。
系統不一定直接改「威嚴」。
可以先推導:
dominance ↑
distance ↑
symmetry ↑
visual hierarchy ↑
但應作為:
candidate realization
不是硬規則。
65. Operator Planning
因此 AADS 可以:
例如:
Goal:
增加疏離感
Possible Shared Targets:
viewer distance ↑
reciprocity ↓
accessibility ↓
Candidate Decisions:
turn gaze away
increase negative space
reduce frontal orientation
66. Multi-objective Shared State
一個作品可以同時要求:
danger ↑
appeal ↑
identity stable
readability stable
所以 shared-domain target:
是一個多目標狀態。
67. Conflict Detection
例如:
distance ↑
可能降低:
facial readability
因此:
內部也會衝突。
VUSD 不把美術變成「最大化所有變量」。
68. Pareto Visual Design
可將設計視為:
這比:
beauty score = 9.2
更接近真實設計。
69. Shared-Domain Explainability
理想 AI 不只是說:
我把這張圖改得更好看。
而是:
我提高了人物與背景的 salience contrast,
保留原本 reveal-conceal,
減少袖口細節的 competition,
因此主體可讀性提高,
但角色原有 tension state 未被削弱。
這就是 Shared-Domain Explainability。
70. Failure Taxonomy
U-F01 — Meaning Collapse
把:
高階感受
直接當成底層 property。
U-F02 — Cultural Universalization
把特定文化意味宣稱為普適。
U-F03 — Operator Overcompression
用一個:
tension
吞掉太多不同關係。
U-F04 — Operator Explosion
反過來建立數千個幾乎無法泛化的微型 operator。
U-F05 — Observer Erasure
忽略 observer 差異。
U-F06 — Structure Erasure
只談 observer 主觀感覺,完全不分析 artifact relation。
U-F07 — Static Ontology
把當前 operator set 永久固定。
71. Minimal Shared-Domain Runtime Interface
observe(artifact)
decompose_visual_relations()
infer_shared_state()
bind_observer(observer_profile)
project_meaning()
compare_states()
run_counterfactual()
propose_operator_update()
72. Core Invariants
VUSD-U1
VUSD-U2
VUSD-U3
VUSD-U4
VUSD-U5
VUSD-U6
VUSD-U7
VUSD-U8
VUSD-U9
VUSD-U10
73. 實驗路線
VUSD Shared Domain 應至少進行:
E1 — Human–Human Agreement
不同人類分析者對:
Decision
Shared Relation
Meaning
分層標註。
E2 — AI–AI Convergence
不同多模態模型獨立提出最小視覺關係詞彙。
E3 — Human–AI Alignment
比較人類與 AI shared-domain state。
E4 — Counterfactual Stability
改動單一 Decision,檢查預測 。
E5 — Cross-Cultural Projection
固定 ,觀察不同 observer 對 的差異。
E6 — Revision Utility
測試使用 Shared-domain diagnosis 是否比單純自然語言評語更能改善生成修正。
74. 與 Paper 04 的接口
本篇建立:
Paper 04 將反過來問:
也就是:
如果不這樣畫,會發生什麼?
因此 Counterfactual Reasoning 是 Shared-domain Theory 的直接驗證工具。
75. 與 Paper 05 的接口
本文只提出:
但 Paper 05 必須處理:
也就是:
新的美術
新的媒介
新的 AI
新的文化
新的觀察者
如何讓 Shared-domain operator:
出現
分裂
合併
失效
再解釋
復興
76. 結論
人類藝術語言擁有大量有價值的高階詞彙:
優雅
神聖
性感
可愛
壓迫
荒涼
危險
浪漫
VUSD 並不想消滅它們。
真正的目標是:
不要讓這些高階結果詞,遮蔽作品中可被分析、比較與反事實測試的中介結構。
因此本文提出:
在這個模型中:
contrast
distance
direction
reciprocity
reveal-conceal
repetition
symmetry
uncertainty
dominance
rhythm
不是美感真理。
它們是:
可供不同智能共同操作的候選理解語彙。
真正重要的是它們是否:
可觀察
可區分
可組合
可反事實測試
可跨 observer 比較
可支持生成修正
可隨新證據演化
如果成立,AI 就不再只能說:
「這張圖比較性感。」
而可以進一步說:
「它保留了高 reciprocity、較強 reveal-conceal、清楚 bodyline salience 與不完全的 approach–avoidance tension,因此對這個 observer profile 而言,更容易投影成既危險又具吸引力的角色關係。」
這不是宣稱 AI 已經獲得人類的全部審美經驗。
而是開始建立:
而一旦這一層存在,
生成、評估、反事實、藝術史分析、Style Atlas、AADS 與 Reflexive Visual Generation 才能真正共享同一套「為什麼」語言。
End of VUSD Paper 03 / 05 — v0.1