創作意圖與視覺理由:從作者意圖到視覺決策的證據模型
Creator Intent, Visual Rationale, and Evidence Provenance
——如何讓 AI 解釋「為什麼這樣畫」,又不把推論偽裝成作者史實
VUSD Series — Paper 02 / 05
作者: Neo.K
機構: EveMissLab/一言諾科技有限公司
版本: v0.1
日期: 2026-08-31
定位: 基礎理論 / Evidence Model / Intent–Rationale Theory
研究狀態: 理論模型;供藝術史分析、AI 視覺理解、SEDB-Visual、Style Atlas、AADS 與 Visual Theory Runtime 使用
摘要
Visual Understanding Shared-Domain Theory(VUSD)在 Paper 01 中提出:
其中 表示 Creator Intent, 表示 Context / Constraints, 表示 Visual Decisions。
但若系統要進一步回答:
「作者為什麼這樣畫?」
就立即遇到一個核心認識論問題:
因此:
其中 表示由作品、歷史資料、文本、評論或模型推得的 Inferred Intent。
本文建立一套 Creator Intent–Visual Rationale Evidence Model,用以區分:
已知作者陳述
委託/設計 brief
同時代文獻
歷史證據
後世學術解讀
分析者推論
模型推論
未知
並進一步將「作者為什麼這樣做」拆成三個不同問題:
- Creator Intent:作者主觀上希望達成什麼;
- Contextual Cause / Constraint:哪些歷史、媒介、技術、經濟、政治與市場條件影響選擇;
- Functional Rationale:無論作者是否意識到,某個視覺決策實際可能透過什麼機制造成什麼效果。
因此:
本文的目的不是讓 AI 更會「替畫家編故事」,而是建立一套 Evidence-first 視覺解釋框架,使系統在證據足夠時可以提出強解釋,在證據不足時保留多重假說,並在未知時明確輸出 UNKNOWN。
1. 「為什麼這樣畫?」其實包含至少三個不同問題
一句:
為什麼作者要這樣畫?
表面看起來只有一個問題。
實際上可能包含三類不同因果。
1.1 作者自己的理由
例如作者可能明確說:
我想讓角色看起來疏離。
我想讓觀者先看到臉。
我故意把背景壓暗。
我想反抗當時的學院派。
我只是喜歡這種顏色。
這是:
Creator-Reported Rationale
若有可靠來源,證據強度很高。
1.2 外部條件造成的選擇
作者可能沒有主動說:
我因為印刷技術限制,所以這樣構圖。
但媒介、材料、成本、政治或市場仍可能塑造結果。
例如:
印刷色數有限
畫布尺寸固定
遊戲 UI 需要角色置中
贊助者要求宗教題材
手機螢幕要求高辨識輪廓
動畫成本限制細節
平台規範限制某些表現
這是:
Contextual Causation / Constraint
1.3 視覺決策的作用理由
作者可能從未理論化某個決策。
例如作者只是憑直覺把角色的臉轉向觀看者。
但分析可以指出:
身體方向與視線方向分離
→ directional conflict
→ reciprocity 上升
→ distance tension 增加
這是:
Functional Rationale
它回答:
這個視覺決策「可能如何運作」。
而不是:
作者當時腦中是不是這樣想。
2. 三種理由不能合併
因此本文提出:
其中:
- :Creator Rationale;
- :Contextual Rationale / Cause;
- :Functional Rationale。
2.1 Creator Rationale
表示:
作者想達成某個 Intent,所以選擇某個 Decision。
2.2 Contextual Cause
表示:
歷史/技術/市場/媒介條件促成或限制某個 Decision。
2.3 Functional Rationale
表示:
某個 Decision 經由 Perceptual Mechanism 產生 Shared-domain Effect。
3. Known Intent 與 Inferred Intent
VUSD 對 Intent 的第一條硬規則:
3.1 Known Intent
只有在存在足夠 evidence 時,才可表示為:
KNOWN
DOCUMENTED
DIRECTLY_STATED
例如:
- 作者訪談;
- 書信;
- 設計文件;
- 創作說明;
- 委託 brief;
- 同時代工作筆記。
3.2 Inferred Intent
從作品或間接資料推測:
LIKELY
PLAUSIBLE
SPECULATIVE
MODEL_INFERRED
例如:
角色被放在畫面中央,因此作者「可能」希望提高人物主導性。
這是可分析的。
但不能寫成:
作者就是為了提高人物主導性。
4. Intent Evidence Hierarchy
本文提出第一版 Intent Evidence Hierarchy:
E0 — Unknown
UNKNOWN
無足夠 evidence。
E1 — Model Inference
MODEL_INFERENCE
由 AI 根據作品或上下文提出。
不能當成史實。
E2 — Human Analyst Inference
HUMAN_ANALYST_INFERENCE
由分析者提出,但未有直接歷史證據。
E3 — Scholarly Interpretation
SCHOLARLY_INTERPRETATION
具有公開論證、脈絡與學術來源,但仍可能是 interpretation。
E4 — Historical Context Evidence
HISTORICAL_DOCUMENT
CONTEMPORARY_RECORD
MARKET_RECORD
TECHNICAL_RECORD
能支持當時存在某種限制或動機背景。
E5 — Commission / Design Evidence
COMMISSION_BRIEF
DESIGN_SPEC
CLIENT_REQUEST
PRODUCTION_DOCUMENT
可以直接支持作品功能需求。
E6 — Explicit Creator Evidence
EXPLICIT_AUTHOR_STATEMENT
AUTHOR_NOTE
AUTHOR_LETTER
AUTHOR_INTERVIEW
最接近作者自述。
但仍要注意:
作者事後陳述不一定完整等同於創作當下全部心理狀態。
所以 E6 也不是「不可質疑真理」。
5. Evidence Strength 不等於 Truth
即使是作者本人陳述:
我當時只是隨便畫。
也可能:
- 忘記;
- 事後合理化;
- 簡化複雜決策;
- 出於宣傳目的;
- 不願公開真實理由。
因此:
VUSD 所做的是:
建立證據層級與來源,而不是建立不可質疑的作者心理讀心術。
6. Intent Record
建議 Intent Record:
{
"intentId": "intent:...",
"artifactRef": "artifact:...",
"statement": "建立疏離但仍具吸引力的角色",
"status": "INFERRED",
"evidenceClass": "MODEL_INFERENCE",
"sourceRefs": [],
"confidence": 0.54,
"alternatives": [
"主要目標可能只是角色辨識",
"可能受到類型市場慣例影響"
]
}
若有作者陳述:
{
"status": "DOCUMENTED",
"evidenceClass": "EXPLICIT_AUTHOR_STATEMENT",
"sourceRefs": ["source:interview:..."]
}
7. 不只作者有 Intent
很多作品不是單一作者。
Intent 可能來自:
藝術家
導演
美術總監
委託人
品牌
製作人
遊戲策劃
市場部門
宗教機構
贊助者
共同創作團隊
AI Agent
使用者
因此:
有時甚至互相衝突:
導演想藝術化
市場部想更大眾
角色設計想保留辨識度
平台要求降低某些風險
所以作品可能是:
8. Intent Conflict
本文建議記錄:
PRIMARY_INTENT
SECONDARY_INTENT
CONFLICTING_INTENT
CONSTRAINT_DERIVED_INTENT
UNKNOWN_PRIORITY
例如:
Primary:
角色辨識
Secondary:
受眾魅力
Constraint:
UI 小尺寸可讀性
Conflict:
過多裝飾會降低小尺寸辨識
這使 AI 能理解:
為什麼作品不是把所有美學目標都最大化。
9. 視覺設計是一個取捨問題
Visual Decision 通常是 multi-objective。
例如:
不可能全部無限提高。
例如:
可能造成:
又例如:
可能:
但:
因此:
10. Context Layer 的正式拆分
本文將 拆成:
其中:
- :Medium;
- :Technology;
- :Historical;
- :Cultural;
- :Economic / Market;
- :Political / Institutional;
- :Audience / Distribution。
11. Medium Constraint
不同媒介允許不同 Decision。
例如:
油畫
木刻
動畫
遊戲立繪
手機 UI
電影鏡頭
生成模型
VR
具有不同限制。
所以:
同一 Intent:
強調臉部。
在:
電影
可能用特寫;
在:
遊戲立繪
可能用高對比臉部與極簡背景;
在:
32x32 icon
則可能簡化五官與輪廓。
12. Technology Constraint
技術進步會改變可用 Decision Set。
例如:
新顏料
攝影
印刷
數位繪圖
3D
實時 shader
生成 AI
ControlNet
高解析螢幕
因此:
這也是 Paper 05「視覺演化與自適應算子生態」的重要前置。
13. Historical Constraint
某種 visual decision 可能是:
延續傳統
反抗傳統
重組傳統
引用傳統
市場慣例
宗教規範
政治象徵
因此若脫離時間:
只分析形式。
就可能失去真正的 contextual cause。
14. Market / Audience Constraint
Appeal-Preserving 研究已指出:
Audience Appeal
本身可能是角色語義。
這意味:
某些設計不是「多餘性感」或「多餘漂亮」,而是作品原本的 audience-facing language。
因此:
這不表示:
市場是唯一藝術原因。
而是:
市場也可以是 Context 的一部分。
15. Creator Rationale Record
若有直接理由:
{
"decision": "use_dark_background",
"creatorRationale": {
"statement": "希望人物輪廓更突出",
"evidenceClass": "EXPLICIT_AUTHOR_STATEMENT",
"confidence": 0.96
}
}
若沒有:
{
"creatorRationale": {
"statement": null,
"evidenceClass": "UNKNOWN"
}
}
不能因為 Functional Rationale 很合理就補成 Creator Rationale。
16. Functional Rationale Record
例如深色背景:
Decision:
dark minimal background
Mechanism:
figure-ground separation
contrast
Shared-domain effect:
subject salience ↑
background competition ↓
這是:
即使作者沒有相關說明,也可以作為 functional analysis。
17. 同一 Decision 可以有多個 Rationale
例如:
角色露肩
可能同時服務:
服裝設計辨識
身體輪廓閱讀
市場魅力
材質對比
角色階級
文化設定
氣候設定
純粹造型偏好
因此:
不能強迫:
one visual choice
=
one reason
18. 同一 Intent 也可以由不同 Decision 實現
例如 Intent:
建立威嚴
可能用:
低視角
對稱
大尺度
高垂直線
低彩度
距離
中央構圖
空間占有
所以:
這代表:
VUSD 不是 visual recipe book。
它描述的是:
many-to-many causal relation
19. Intent–Decision Graph
因此建議使用 Graph:
Intent
↓
Rationale
↓
Decision
↓
Mechanism
↓
Shared Effect
但任一節點可以:
one-to-many
many-to-one
所以:
比線性 chain 更適合實作。
20. Alternative Explanation Set
對未知作品,AI 不應只輸出一個故事。
應保留:
例如:
H1:
為了主體 salience
H2:
受到當代視覺慣例影響
H3:
純粹是作者重複偏好
H4:
受媒介限制
並標:
supporting evidence
contradicting evidence
confidence
21. Abduction,而不是讀心
從作品推意圖,本質上更接近:
Abductive Reasoning
即:
不是:
因此:
而不是 mind-reading。
22. Visual Rationale 的反事實檢驗
一個 rationale 若有因果價值,應能接受:
如果不這樣做會怎樣?
例如:
dark background
改成:
high-detail bright background
若預測:
subject salience ↓
competition ↑
並可在實驗中觀察,
則 Functional Rationale 得到更多支持。
所以:
23. Creator Rationale 也可能和 Functional Effect 不一致
例如作者說:
我用紅色只是因為喜歡。
但作品在特定文化脈絡中,紅色仍可能產生:
ritual
danger
celebration
等 interpretation。
因此:
創作者並不壟斷作品所有可能意義。
24. Observer 也不壟斷作者意圖
反過來:
某個 observer 覺得作品悲傷。
不代表:
作者就是想表達悲傷。
所以:
這是 VUSD 最重要的雙向去混淆。
25. Intent / Effect Matrix
建議使用:
| Known | Inferred | Unknown | |
|---|---|---|---|
| Creator Intent | 有直接 evidence | 由資料推論 | 無法判定 |
| Context Cause | 有歷史資料 | 有合理推論 | 無法判定 |
| Functional Effect | 有實驗/理論支持 | 模型推論 | 無法判定 |
| Observer Meaning | 有 observer report | 預測 | 無法判定 |
這避免所有問題被壓成:
AI 說這張圖代表...
26. Historical Analysis 的最低要求
若分析歷史作品,至少應分:
artifact evidence
creator evidence
contemporary context
later interpretation
modern interpretation
model inference
例如:
這個構圖在今天看起來很 cinematic。
可能是現代 interpretation。
不能因此說:
當時作者使用 cinematic composition。
因為「cinematic」本身可能晚於作品。
這是:
anachronism risk
27. 時代錯置防護
VUSD 建議:
CONTEXT_MISMATCH
ANACHRONISTIC_TERM
LATE_INTERPRETATION
等標籤。
系統應能說:
這是用現代視覺語言描述的效果,不代表作者或當代觀眾使用相同概念。
28. Artist Style Archive 的升級
未來畫家建檔不只:
palette
brush
composition
還要保存:
KnownIntentEvidence
RecurringDecision
DocumentedRationale
ContextConstraint
FunctionalRationale
InterpretationHistory
CounterfactualBoundary
例如:
某畫家反覆使用某種構圖
可建立:
RecurringDecision
但只有在有資料時,才建立:
KnownCreatorRationale
29. Recurring Decision ≠ Explicit Theory
一個畫家可能重複做某件事,但從未寫出理論。
因此:
AI 可以發現:
作品中反覆出現某種非對稱重心。
但不能自動寫:
這位畫家的美學理論就是非對稱重心。
除非有 evidence。
30. Tacit Knowledge
許多藝術家的知識屬於:
Tacit Knowledge
即:
會做
會判斷
但不一定能完整語言化
所以作者沒有留下完整 rationale 並不奇怪。
VUSD 的任務之一,就是:
在不冒充作者自述的前提下,將 tacit visual practice 建模成 Functional Rationale。
31. Tacit → Explicit 的 AI 角色
AI 可以協助:
作品聚類
重複 pattern 發現
visual decision extraction
counterfactual simulation
自然語言 explanation
把部分 tacit practice 轉成:
explicit candidate theory
但輸出必須標:
MODEL_INFERRED_THEORY
不是:
ARTIST_CONFIRMED_THEORY
32. Creator Intent 的時間問題
Intent 也可能變。
同一創作者:
甚至同一作品在不同製作階段:
初稿
中稿
完成稿
後期修訂
可能具有不同 Intent。
所以 Intent Record 應有:
time
phase
version
33. Team Intent 的演化
大型遊戲/動畫/電影作品更明顯。
例如:
CharacterDesignerIntent
ArtDirectorIntent
MarketingIntent
NarrativeIntent
PlatformConstraint
在製作過程中可能反覆協商。
因此作品不是:
更可能是:
34. AI 作為 Creator 時
未來 AI 也可能成為 Intent source。
但要區分:
User Intent
AADS Derived Intent
AI Proposed Subgoal
Provider Behavior
Model Prior
尤其:
例如模型自動把所有角色畫得更保守,
那可能只是:
default prior / safety-style entanglement
不是使用者 Intent。
35. AI Proposed Rationale
AI 可能在創作時提出:
為了保留角色危險感,我建議保留蛇的輪廓與高飽和綠色焦點。
這可以成為:
AI_PROPOSED_RATIONALE
若使用者接受:
USER_ACCEPTED_RATIONALE
但仍要保留 lineage。
36. 對 AADS 的意義
AADS 的 Visual Plan 不應只有:
Operator 1
Operator 2
Operator 3
應附:
why
target effect
constraint
evidence
trade-off
例如:
{
"operator": "REGION_REPAIR",
"target": "hand:right",
"rationale": "local artifact only; global identity/style remain accepted",
"evidenceRefs": [
"eval:artifact:..."
]
}
37. 對 Reflexive Generation 的意義
RVGR 中若 Observer 說:
garment volume drifting
Rewrite Compiler 不應只是:
change prompt
還應知道:
why garment volume matters
例如:
same-series silhouette
character elegance
body proportion readability
這些 rationale 可以幫助決定:
repair
vs
continue
vs
accept
38. 對 Visual Evaluation 的意義
Evaluator 也需要回答:
哪一個 constraint 被破壞?
與:
為什麼它重要?
因此:
而不是:
score = 0.73
39. 對美術教育的意義
VUSD 不取代美術教育。
它可能補足:
很多教學中「這樣比較有張力」「這樣比較穩」「這樣比較好看」之間缺少的中介解釋。
例如從:
使用三角構圖
走向:
三角關係如何影響重心
如何形成穩定性
在哪些情況反而會降低動勢
這使 AI 可以把:
rule
轉成:
conditional rationale
40. Rule ≠ Rationale
這是本文重要命題:
「三分法」是一個 Rule。
但:
為什麼這一張圖使用三分法有效?
需要:
goal
subject placement
visual weight
observer path
context
共同回答。
41. Good Practice ≠ Universal Law
因此:
某種做法只在特定:
goal
medium
audience
era
style
成立。
這與 Paper 05 的動態 Operator Ecology 完全一致。
42. Evidence Graph
VUSD 建議建立:
IntentEvidence
ContextEvidence
DecisionEvidence
RationaleEvidence
EffectEvidence
ObserverEvidence
CounterfactualEvidence
透過:
supports
contradicts
derived_from
interprets
measured_by
observed_at
連接。
43. Minimum Evidence Node
{
"evidenceId": "evidence:...",
"type": "SCHOLARLY_INTERPRETATION",
"sourceRef": "source:...",
"time": "2026-08-31",
"supports": [
"rationale:..."
],
"confidence": 0.74
}
44. Confidence 不是證據類型
不能把:
confidence = 0.95
當作:
這一定是真的。
Confidence 只是模型/分析者的內部估計。
所以:
兩者都要記。
45. Falsification
對每個 Inferred Rationale,應問:
什麼 evidence 會推翻它?
是否存在更簡單解釋?
是否存在相反作品?
是否是時代錯置?
是否只是模型習慣說法?
因此:
46. 一個完整分析範例
Artifact:
角色回眸、露肩、薄紗、蛇、黑背景
Decision
D1 backward glance
D2 exposed shoulder
D3 translucent garment
D4 serpentine motif
D5 black background
Functional Rationale
D1 → directional conflict / reciprocity
D2 → surface salience
D3 → reveal-conceal
D4 → contour repetition / thematic danger cue
D5 → figure-ground separation
Creator Intent
若沒有直接資料:
UNKNOWN
可以另外提出:
MODEL_INFERENCE:
可能意圖為危險 + 吸引 + 神秘
但不得標為 documented intent。
Context
fantasy character-art market
game portrait / character display
SFW sensual visual language
若有來源再提升 evidence class。
47. 一個歷史作品分析範例
若 AI 分析古代作品,不應:
直接使用現代心理學詞彙
→ 宣稱作者採用該理論
而應:
Artifact effect:
modern analysis suggests...
Historical context:
documented evidence suggests...
Creator intent:
unknown / documented...
Later interpretation:
scholars have argued...
把不同時間層分開。
48. Core Invariants
VUSD-R1
VUSD-R2
VUSD-R3
VUSD-R4
VUSD-R5
VUSD-R6
VUSD-R7
VUSD-R8
VUSD-R9
VUSD-R10
49. 對未來 Visual Theory Knowledge Runtime 的要求
未來知識庫至少需要:
Creator
Artifact
IntentRecord
IntentEvidence
ContextRecord
ContextEvidence
VisualDecision
CreatorRationale
FunctionalRationale
RationaleEvidence
AlternativeExplanation
Counterevidence
CounterfactualTest
ObserverInterpretation
InterpretationHistory
並全部版本化。
50. 結論
「作者為什麼這樣畫?」不是一個可以靠 AI 看圖後直接猜一句話回答的問題。
更合理的模型是:
共同構成視覺創作理解。
本文最重要的不是增加更多藝術術語,而是建立一條認識論邊界:
AI 可以提出理由,但必須知道自己提出的是哪一種理由。
如果是作者明說:
documented creator intent
就如實記錄。
如果只是歷史脈絡支持:
context-supported explanation
就如此標記。
如果只是作品功能分析:
functional rationale
就不要假裝成作者心理。
如果只是 AI 推論:
model inference
就必須承認它是推論。
如果不知道:
UNKNOWN
本身就是正確答案。
因此:
這讓 VUSD 可以在藝術理論、藝術史、AI 美術生成與視覺評估之間建立一個共同的證據層。
下一篇將進一步處理:
理解共享域算子族
也就是:
當我們暫時不依賴「性感、神聖、可愛、恐怖」這些人類高階感受詞時,是否可以先建立一組更底層、跨觀察者可共享描述的視覺關係算子?
End of VUSD Paper 02 / 05 — v0.1