生成可達域與未實現視覺
AI、模型可達空間與人類既有圖像集合的關係
英文題名: Generative Reachability and Unrealized Visuals: Relating AI Reachable Space, Human-Realized Images, and the Representable Visual State Space
作者: Neo.K / EveMissLab
版本: v0.1-draft
日期: 2026-08-12
系列: Global Visual Space & Generative Navigation — Paper 03
前篇:
- Paper 01《全域視覺空間假說:從量化灰階方塊到高維圖像狀態空間》
- Paper 02《視覺生成作為約束域求解:從人類意圖到高維圖像空間導航》
文件性質: 理論論文/生成模型可達域、視覺新穎性、記憶、泛化與多樣性研究
關鍵詞: 生成可達域、未實現視覺、模型覆蓋、視覺新穎性、擴散模型、記憶、泛化、mode coverage、style diversity、visual manifold、AI creativity
摘要
前兩篇論文分別建立了兩個層次。
Paper 01 定義固定數位 raster specification 下的完整可表示圖像狀態空間:
Paper 02 則將生成重新描述為:在模型可達域與多重約束域中搜尋、優化與採樣。
本篇處理由此產生的第三個問題:
AI 生成模型實際能到達多大的視覺區域?這個區域和人類歷史上已經實現過的圖像集合有什麼關係?AI 是否已經能生成大量「從未被人類畫過,但仍具有語意與美學合法性」的視覺?
本文首先指出,「人類沒畫過」必須被嚴格拆解。
若只以 raw raster 完全一致作為判準,則由於數位圖像狀態空間極端巨大,生成一張從未與既有圖像逐像素完全一致的圖片相對容易。這種 Exact Novelty 幾乎沒有足夠的藝術或認知含義。
真正重要的是更高層的新穎性:
- Exact Novelty:像素狀態不曾出現;
- Perceptual Novelty:感知表徵上不只是既有作品的近鄰;
- Semantic / Compositional Novelty:物件、關係、構圖與概念組合形成新的有效模式;
- Style-Mode Novelty:作品落入既有參考集合沒有覆蓋的穩定視覺語法/風格模式;
- Visual-Grammar Novelty:可能形成新的、可被人類理解但既有分類系統尚未描述的視覺生成規則。
因此本文區分:
——所有可表示圖像;
——截止時間 ,人類實際實現且映射至規格 的圖像集合;
——研究者實際可取得的人類作品資料集;
——某一生成系統在指定模型、控制面、有限精度與有限操作條件下的 operational reachable set;
——理想概率模型的數學支持域;
以及:
——具有非可忽略概率/可接受生成成本的 effective reachable domain。
本文主張:在一般情況下,不能假設:
也不能假設:
兩者都只是:
中的不同子集,具有重疊、缺口與不同密度結構。
近期生成模型研究也顯示:高畫質並不等同完整 distribution coverage;生成模型仍可能集中在有限 modes、放大訓練偏差、發生同質化、記憶個別樣本,也可以在其他區域產生未出現在訓練集中的新樣本。這表示「記憶」與「新穎生成」不是非黑即白的模型全域屬性,而可能在同一生成模型的不同局部資料幾何中共存。
本文據此提出「未實現視覺前沿」(Unrealized Visual Frontier, UVF):
其中:
- :具有可辨識結構/語意/美學的視覺子域;
- :可觀測的人類實現參考集合;
- :依感知、語意、風格或結構距離定義的既有作品鄰域。
此集合不是「證明全人類從未畫過」的絕對集合,而是可操作地表示:
相對於明確參考語料與明確距離定義,模型可達、具有意義、但不只是既有模式近鄰的視覺區域。
最終本文提出四級「AI 未實現視覺假說」:
- 弱命題 W1:AI 可以產生新的精確 raster states;
- 弱命題 W2:AI 可以產生既有視覺元素的新組合;
- 中命題 W3:AI 可以產生參考人類資料集中未覆蓋的穩定語意/構圖/風格 modes;
- 強命題 W4:AI 可以形成超出既有人類視覺語法而仍可被人類理解與採納的新視覺生成規則。
W1 幾乎是組合空間的直接結果;W2 已有大量實務證據;W3 是可被 benchmark 驗證的重要研究命題;W4 仍屬強假說。
本篇因此將問題從:
「AI 能不能畫出從沒有人畫過的圖?」
修正為:
AI 的有效可達域中,有多少部分真正超出了既有視覺 modes,而不只是像素級排列的新奇?
1. 引言:第三層問題
Paper 01 回答:
所有可表示圖像在哪裡?
形式上:
Paper 02 回答:
如何利用條件與約束導航?
形式上:
本篇進一步問:
某一 AI 模型到底能到達 的哪一部分?
2. 四個基本集合
2.1 可表示域
固定 digital raster specification:
完整圖像狀態空間:
2.2 人類已實現域
定義截止時間 :
3. 人類已實現域不是「所有人類可想像域」
必須區分:
與:
前者是實際歷史狀態。
後者是:
人類理論上可能創作、理解或接受的視覺。
後者無法直接枚舉。
4. 可觀測人類資料集
研究中真正可拿到的通常只是:
例如:
博物館數位藏品
網路藝術作品
攝影資料集
遊戲素材
動畫影格
插畫資料
5. Dataset 不等於 Humanity
因此:
只能說:
沒有出現在資料集。
不能推出:
6. 模型 operational reachable set
對生成系統:
指定:
- 模型權重;
- 可用 Prompt;
- LoRA / Adapter;
- Reference;
- Control;
- Seed 範圍;
- Sampler;
- finite precision;
- allowed workflow;
- bounded compute。
定義:
為所有在此操作規格下實際可生成的 raster outputs。
7. Operational Reachability 是工程概念
如果所有:
seed
float
parameter
workflow
都在有限計算機表示中,
則在固定最大輸出規格下:
雖然巨大。
8. 理想連續模型的 Support
理論概率模型可定義:
其支持域:
或連續情況的 support closure。
9. Support 可能誤導
對某些連續生成/擴散模型,數學 support 可能很寬。
但:
在大量區域可能極低。
因此:
「數學上有正概率」
不等於:
「工程上可實際找到」。
10. Effective Reachable Domain
定義 threshold:
最簡離散形式:
更一般可使用:
minimum generation probability
maximum search cost
maximum inference budget
maximum rarity
定義有效可達域。
11. Search-cost Reachability
定義找到 的最小代價:
則:
是生成預算。
12. 因此「模型會不會畫」也有程度
不是單純:
而可能問:
13. 三層可達性
Mathematical
Effective
Practical
14. 可達性不是均勻的
生成模型通常具有高概率 modes:
常見 AI 臉、光影、構圖同質化就可以理解為:
概率質量集中在少數高回報/高密度 modes。
15. Quality 與 Coverage 不同
生成品質:
高,
不代表:
高。
這兩者必須分開。
16. 現代 diffusion 仍存在 coverage 問題
近期研究顯示,即使 diffusion 的 individual sample quality 極高,其生成分佈仍可能只覆蓋真實資料分佈的有限部分。
這支持:
17. Default Mode
對簡單或模糊 Prompt:
會形成 default modes。
模型可能總是偏向:
某種臉
某種鏡頭
某種性別/年齡
某種光線
某種美學
18. Scaling 也不保證 Default Diversity
大型模型的 generalization 可能提高,
但:
不一定一起提高。
所以:
19. Reward Optimization 甚至可能使輸出更同質
若 reward 只獎勵單張品質:
模型可能把概率集中到少數高 reward modes。
因此:
同時:
20. 這重新支持「通用漂亮」概念
模型最安全的策略可能是:
反覆產生已知容易獲得高分的視覺語法。
這形成:
21. Memorization
另一個極端是:
模型可能重現訓練樣本。
22. 記憶不是純粹理論風險
擴散模型已經被實證觀察到:
training sample replication
memorization neurons
caption-dependent copying
所以:
可能非空。
23. 但模型也會生成 Novel Samples
如果生成模型只會記憶:
那就不存在真正生成泛化。
實際研究顯示 diffusion 同時具有:
memorization
interpolation
generalization
行為。
24. Local Coverage
2026 的理論工作提出一個重要局部視角:
是否記憶與訓練資料在局部鄰域的 coverage 有關。
稀疏區:
孤立樣本
→ 更容易 memorization
密集區:
多樣近鄰
→ 更支持 interpolation / generalization
25. Memorization 與 Novelty 可以同模型共存
因此不應把模型分類成:
memorizing model
or
creative model
更合理的是:
26. 三種局部生成區
可以初步分:
Memorization Basin
Generalization / Interpolation Region
Low-validity / Artifact Region
27. Meaningful Reachable Domain
定義:
則:
我們真正關心的是:
而不是模型所有可輸出的亂碼。
28. 「人類沒畫過」的最弱版本
定義:
即:
逐像素 exact raster state 在歷史上沒出現。
29. Exact Novelty 幾乎太容易
由於:
極端巨大,
而:
在物理歷史中有限,
因此:
仍極端巨大。
30. 這不代表藝術新穎
一張舊圖改一個幾乎不可見 pixel:
就可能:
但:
31. 因此 Exact Novelty 不足
定義:
只能作最底層判定。
32. Perceptual Novelty
選擇感知 embedding:
定義與參考人類集合最近距離:
若:
稱具有 -Perceptual Novelty。
33. Semantic Novelty
抽取:
描述:
objects
relations
actions
scene
attributes
若組合落在參考資料之外:
34. Compositional Novelty
例如:
已知人物
已知建築
已知機械
但產生新的:
關係
空間組合
結構配置
可視為:
35. Style-Mode Novelty
Style embedding:
對人類 reference style clusters:
若生成樣本形成穩定 cluster:
且:
對所有 成立,
則可稱:
相對 reference corpus 的 Style-Mode Novelty。
36. Visual-Grammar Novelty
更強的情況是:
不只換 palette 或筆觸,而形成新的視覺生成規則。
例如新的:
shape grammar
spatial grammar
multi-scale relation
symbolic convention
定義:
目前缺乏通用測量方式。
37. 五層新穎性
因此:
38. 「從未有人畫過」的證明問題
全人類歷史集合:
實際不可完整取得。
因此:
絕對證明某張圖從未被任何人類畫過
通常不可操作。
39. 科學上更好的表述
使用:
Novel relative to reference corpus .
而不是:
Never before created by humanity.
40. Reference-relative Novelty
定義:
所有研究報告必須附:
reference corpus
embedding
metric
threshold
41. 未實現視覺前沿
定義:
42. 鄰域
43. 距離不是單一像素距離
可以使用向量:
其中:
- :perceptual;
- :semantic;
- :style kernel;
- :composition。
44. Multi-Axis Frontier
真正的未實現視覺可以要求:
且至少一個:
45. Meaningfulness Gate
如果只追求離既有資料遠:
很容易生成 nonsense。
所以必須要求:
46. Novelty–Meaningfulness Trade-off
目標:
subject to:
47. 再加 Quality
真正作品:
subject to meaningfulness。
48. 這和 AADS Anti-Homogenization 直接相連
AADS 原本希望:
風格一致
但角色/構圖不要重複
就是在固定:
時,
提高:
49. 模型可達域是否包含人類全部作品?
不能假設:
50. 為何不一定?
模型可能缺少:
某些極少見風格
特殊文字
精密幾何
長尾文化符號
特殊媒介
奇怪比例
51. GAN inversion 的 out-of-range 問題就是早期證據
若真實圖像:
無法被某 GAN latent space 精確重建,
它就是:
對該模型而言 out-of-range。
52. 因此人類域可有模型缺口
定義:
53. 模型也可能有超出已觀測人類資料的區域
定義:
但這裡仍包含:
pixel-novel trivial variants
artifacts
nonsense
54. 有效 extra set
所以:
55. 三集合沒有簡單包含關係
最安全的圖:
ΩΣ
├── Human Realized
├── Model Reachable
└── Meaningful Visual Domain
它們互相重疊。
56. 特殊情況下才可能有包含
某個很窄 Domain:
anime headshots
大型模型的有效可達域可能覆蓋資料集大部分 modes。
但不能推廣成:
的普遍命題。
57. 模型可達域也不是固定
加入:
LoRA
fine-tuning
reference adapter
ControlNet
new prompt
new workflow
會改變:
58. Dynamic Reachable Set
定義時間:
模型升級後:
59. Generative Asset 是可達域變換器
LoRA:
60. Reference 也是條件域變換器
61. Model Ensemble 擴張可達域
若有:
則平台整體可達域:
62. 這正是 AADS 多 Provider 的理論價值
AADS 不綁單一模型,不只是工程方便。
而是:
多模型聯集可能顯著增加有效視覺可達域。
63. Router 的作用
對 Intent:
選:
64. 模型選擇因此也是幾何問題
不是:
哪個模型分數最高?
而是:
哪個模型的可達域最可能和目標約束域相交?
65. Reachability Score
定義:
可以是概率質量 proxy。
66. 這也解釋 Domain-Specific Model 的價值
一個 anime model 的:
可能很窄,
但對:
具有很高 density。
67. 通用模型與專用模型不是簡單強弱
General model:
breadth high
local density lower
Specialist:
breadth low
domain density high
68. 可達域 Breadth–Density Trade-off
定義:
與:
69. 人類創作域也在擴張
隨時間:
單調不減。
70. AI 生成圖被人類採納後發生什麼?
一張 AI 圖:
一旦被人類:
選擇
發布
納入遊戲
修改
使用
是否成為:
71. 「人類已實現」需要定義作者性嗎?
本文採實現域而非著作權作者域。
只要圖像進入人類文化系統並被實際固定:
這不等於判斷法律 authorship。
72. AI 擴張後,人類域會吸收 AI 域
如果大量 AI 圖被採納:
其中:
是被採納的 AI outputs。
73. 因此 Frontier 會移動
今天新:
明天被使用後:
所以:
是動態前沿。
74. 未實現視覺不是永久身份
它是一個:
歷史時間依賴狀態。
75. Weak Hypothesis W1:Exact Novelty
AI 能產生:
這在巨大狀態空間中幾乎是最弱命題。
76. W1 的研究價值低
因為:
改一個像素
就能成立。
所以不能把 W1 當「AI 創造力」證據。
77. Weak Hypothesis W2:Novel Composition
AI 可以將既有語意 primitive:
重新組合成:
而此具體組合不在 reference corpus。
78. W2 很可能普遍成立
大模型的組合式生成正是大量 controllable generation 研究對象。
但:
新組合
仍不等於:
新風格語法。
79. Medium Hypothesis W3:Novel Visual Mode
存在模型生成集合:
使其形成穩定 cluster:
且不落入 reference human clusters 的 鄰域。
80. W3 可被 benchmark
要求:
- 多個獨立生成樣本;
- cluster stability;
- 人類判斷其共同風格;
- 與 reference corpus 有顯著距離;
- 仍有 meaningfulness。
81. Strong Hypothesis W4:Novel Visual Grammar
存在:
是一組此前 reference corpus 未描述的視覺生成規則,
但人類可:
辨識
學習
重用
欣賞
82. W4 不應輕易宣稱
因為:
- 人類歷史 corpus 不完整;
- 很多「新」其實是混合;
- embedding metric 可能看不見真正 antecedent;
- 人類文化有大量長尾風格。
83. 真正強的新穎性需要可傳授性
如果一個生成模式:
可以讓另一個人/模型:
辨識
模仿
再生成
則它更像:
新的 visual grammar,
而不是一次性怪圖。
84. Style Recipe Test
如果能從新 cluster 提煉:
並穩定生成:
則支持:
85. AI 是否能「想出」人類沒想過的風格?
這個問題最好改寫為:
AI 是否能搜尋到既有 reference distribution 低密度區,形成可重用、可被人類認知的新視覺 mode?
86. Search for Frontier
AADS 可以主動優化:
subject to:
和:
87. Frontier Mode
新增生成模式:
Conservative
Project
Diverse
Frontier
88. Frontier Mode 的目標
不是:
隨機變怪。
而是:
subject to:
semantic validity
style coherence
human acceptance
technical quality
89. Novelty Search 可能找到 nonsense
所以必須有:
與:
90. Novelty–Quality Pareto Front
過度追求 Novelty:
過度追求 Quality:
91. 這和 2026 diversity RL 問題直接呼應
當 reward 只獎勵單張品質時,生成模式會往少數高 reward modes 收縮。
因此需要:
distribution-level diversity reward。
92. Style Entropy
對生成集:
定義:
Frontier Search 可以提高它,
但專案生成則要求:
保持。
93. Global Diversity 與 Project Diversity 不同
全域模型希望:
單一遊戲專案希望:
受控,
但:
不能崩。
94. Model Diversity Evaluation
因此至少分:
global mode coverage
prompt-conditioned diversity
project-conditioned diversity
intra-subject diversity
95. DIMCIM 類研究的啟示
不能只問:
這個模型能不能生成某 attribute?
還要問:
在沒有明確要求時,它是否只會反覆落入 default modes?
96. 「能力存在」和「自然可達」不同
某模式可能:
但需要非常特殊 Prompt:
所以它不是 default reachable。
97. Prompt Accessibility
定義:
使模型高概率生成 類模式。
98. Agent 可以降低 Accessibility Cost
如果 AI Art Director 自動找到:
Prompt
LoRA
Reference
Control
則:
99. 這支持原始直覺
很多視覺不是 AI 畫不出,而是人類不知道怎麼把意圖映射到生成控制面。
這可以形式化成:
但:
100. Agent-Expanded Practical Reachability
加入 Agent:
可能有:
101. 注意:不是模型本體能力變強
Agent 沒改模型時:
可能不變。
改變的是:
有限預算內能被找到的區域。
102. Search Intelligence
因此定義:
103. Model Intelligence 與 Search Intelligence 分離
104. LoRA 則真的改變 Reachability
若 Agent 自動訓練 LoRA:
則:
105. 因此完整 AADS 可以同時做兩件事
- 搜索既有域;
- 需要時修改域。
106. Search vs Adapt
若:
優先 Search。
若:
考慮:
LoRA
fine-tuning
new model
new reference provider
107. 這是 Training Agent 的理論判定式
Training 不應因為:
想更厲害
就啟動。
而應因:
current reachable domain insufficient。
108. Reachability Gap
定義:
若:
才需要 Adapt。
109. 實驗框架一:Memorization–Novelty Map
對每個生成樣本:
計算:
nearest training image
nearest reference human image
semantic distance
style distance
quality
建立二維/多維圖:
110. 實驗框架二:Coverage Map
在 embedding 空間 cluster:
測模型覆蓋:
111. 實驗框架三:Unrealized Frontier Search
讓 Agent 主動搜尋:
subject to quality / meaningfulness。
112. 實驗框架四:Human Adoption
讓人類評審:
像已知風格
像混合風格
像新的穩定風格
只是怪
113. 實驗框架五:Reproducible Grammar
對被判「可能新風格」的 cluster:
- 抽出 Style Recipe;
- 換 20 個不同內容 Prompt;
- 再生成;
- 測風格一致性;
- 測內容多樣性。
114. 新 Style Mode Gate
只有當:
且:
且:
才稱 candidate novel style mode。
115. 訓練資料泄漏檢查
任何 novelty claim 必須先排除:
近重複 training example
直接 memorization
reference leakage
116. Memorization Test
可以使用:
nearest-neighbor
copy detection
feature similarity
training-set auditing
避免把複製叫創造。
117. Novelty 不等於 Valuable
即使:
也可能:
118. Value 是另一個軸
定義:
119. Novel Visual Innovation
更完整:
120. 強命題的判定
若 AI 產生一個 Style Mode:
- 相對 corpus 顯著新;
- 可重複;
- 可學習;
- 被人類採用;
- 形成後續作品;
它才接近:
真正視覺創新。
121. 人機共同創新
一旦人類選擇、修正、命名 AI 新風格,
它進入:
因此未來創新可能是:
122. AI 的角色可能像「視覺空間探勘器」
這比「畫家替代品」更抽象。
AI 可以:
在人類不可能暴力探索的高維視覺域中,主動搜尋低密度但有意義的區域。
123. Human as Selection Pressure
人類偏好:
在大量生成中形成選擇壓力。
124. Co-Evolution Loop
125. 這會讓 Frontier 不斷外移
126. 與 Paper 01 的統一
Paper 01:
是所有可表示狀態。
Paper 03:
只是其中一部分。
127. 與 Paper 02 的統一
Paper 02:
是人類要求的目標域。
真正生成成功:
128. 新增 Frontier 要求
若同時:
則:
129. 與 Generative Asset Registry 的統一
Model、LoRA、Adapter、Reference、Control、Recipe 的共同作用是:
改變 R_G
改變 p_G
改變有效 Reachability Cost
改變 Constraint Intersection
所以 Paper 04 可以統一抽象為:
Generative Navigation Assets。
130. 本文核心集合圖
ΩΣ — 所有可表示 raster states
│
├── M — 有意義視覺域
│
├── H_T — 人類歷史實現域
│
├── R_G — 模型可達域
│
└── Ω_C — 當前意圖約束域
有效生成:
R_G ∩ Ω_C
有意義生成:
R_G ∩ Ω_C ∩ M
未實現視覺候選:
R_G ∩ Ω_C ∩ M \ Nε(H_ref)
131. 四級假說正式版
W1 — Exact-State Novelty
狀態: 幾乎平凡,藝術意義有限。
W2 — Novel Composition
具有 reference corpus 中未出現的有效語意/空間組合。
狀態: 高度可驗,已有廣泛生成實務支持。
W3 — Novel Stable Visual Mode
存在穩定生成 cluster:
與人類 reference modes 顯著分離,且:
有意義
可重現
可辨識
內容可變
狀態: 重要可驗命題。
W4 — Novel Visual Grammar
AI 發現可被人類採用的新視覺生成規則,不只是混合既有 style tokens。
狀態: 強命題,未證明。
132. 結論
「AI 是否已經可以生成幾乎所有人類畫過甚至沒畫過的圖」若不拆分,容易同時包含一個太弱命題與一個太強命題。
太弱的版本是:
AI 可以產生一張逐像素從沒出現過的圖。
在:
極端巨大的條件下,這幾乎沒有足夠研究價值。
太強的版本是:
現有 AI 已覆蓋所有人類可能的視覺創造。
目前沒有證據支持。
真正值得研究的中間問題是:
以及:
因此本文提出:
作為「未實現視覺前沿」。
模型的能力也應拆成:
其中:
- ReachableDomain:理論上/工程上能生成什麼;
- ModeCoverage:概率質量實際覆蓋多少有效模式;
- SearchIntelligence:能否在有限預算下找到人類想要的低概率模式。
這也修正了「AI 畫不出」的語意。
某一畫面可能:
但人工操作成本:
太高。
加入 AI Art Director 後:
於是對使用者而言:
原本「幾乎畫不出」的視覺,變成實際可達。
這正是 AI 配合生成工具、LoRA、Reference、Control 與自動工作流的真正價值之一。
最終,AI 的長期角色可能不只是「替人類畫畫」,而是:
——在完整可表示視覺空間中,以模型先驗、約束求解、生成資產與人類偏好作導航工具,探索那些人類無法靠暴力枚舉,但可能有意義、可被採納、甚至形成新視覺語法的區域。
參考文獻
- Dombrowski, M. et al. Image Generation Diversity Issues and How to Tame Them. CVPR 2025.
- Teotia, R. et al. DIMCIM: A Quantitative Evaluation Framework for Default-mode Diversity and Generalization in Text-to-Image Generative Models. ICCV 2025.
- Liu, H. et al. DiverseGRPO: Mitigating Mode Collapse in Image Generation via Diversity-Aware GRPO. CVPR 2026.
- Miao, Z. et al. Training Diffusion Models Towards Diverse Image Generation with Reinforcement Learning. CVPR 2024.
- Hintersdorf, D. et al. Finding NeMo: Localizing Neurons Responsible For Memorization in Diffusion Models. NeurIPS 2024.
- Somepalli, G. et al. Understanding and Mitigating Copying in Diffusion Models. NeurIPS 2023.
- Merger, C., Goldt, S. Local Coverage Governs Memorization in Diffusion Models. arXiv:2606.14390, 2026.
- He, Y., Qiu, Y., Tao, M. Diffusion Model's Generalization Can Be Characterized by Inductive Biases toward a Data-Dependent Ridge Manifold. arXiv:2602.06021, 2026.
- Pham, B. et al. Memorization to Generalization: Emergence of Diffusion Models from Associative Memory. arXiv:2505.21777, 2025.
- Kang, K. et al. GAN Inversion for Out-of-Range Images With Geometric Transformations. ICCV 2021.
- Parmar, G. et al. Spatially-Adaptive Multilayer Selection for GAN Inversion and Editing. CVPR 2022.
- Morshed, M. M., Boddeti, V. DiverseFlow: Sample-Efficient Diverse Mode Coverage in Flows. CVPR 2025.
- Duym, J. et al. Quantifying Generative Stability: Mode Collapse Entropy Score for Mode Diversity Evaluation. WACV Workshops 2025.
- Stein, G. et al. Exposing Flaws of Generative Model Evaluation Metrics and Their Unfair Treatment of Diffusion Models. NeurIPS 2023.
研究狀態與宣稱邊界
本文不主張:
- 現有 AI 已覆蓋全部人類藝術;
- 可以被完整收集;
- 一個 embedding distance 足以定義藝術新穎性;
- 未出現在訓練集即等於真正創新;
- 混合兩種既有風格一定構成新 Style Mode;
- AI 已證明能創造全新人類視覺語法;
- 模型 mathematical support 等於 practical reachability。
本文真正建立的是一個更精確的研究問題:
把「所有可表示」、「人類已實現」、「資料集中可觀測」、「模型理論支持」、「模型實際可達」、「模型高概率常用」與「真正新穎且有意義」分開。
只有做完這些區分後,「AI 是否已能生成未實現視覺」才成為可以被嚴格討論與實驗的命題。