← Archive
lm-003069 · 2026-08

生成可達域與未實現視覺

下載 MD 檔 ⬇

生成可達域與未實現視覺

AI、模型可達空間與人類既有圖像集合的關係

英文題名: Generative Reachability and Unrealized Visuals: Relating AI Reachable Space, Human-Realized Images, and the Representable Visual State Space
作者: Neo.K / EveMissLab
版本: v0.1-draft
日期: 2026-08-12
系列: Global Visual Space & Generative Navigation — Paper 03
前篇:

  • Paper 01《全域視覺空間假說:從量化灰階方塊到高維圖像狀態空間》
  • Paper 02《視覺生成作為約束域求解:從人類意圖到高維圖像空間導航》

文件性質: 理論論文/生成模型可達域、視覺新穎性、記憶、泛化與多樣性研究

關鍵詞: 生成可達域、未實現視覺、模型覆蓋、視覺新穎性、擴散模型、記憶、泛化、mode coverage、style diversity、visual manifold、AI creativity


摘要

前兩篇論文分別建立了兩個層次。

Paper 01 定義固定數位 raster specification Σ\Sigma 下的完整可表示圖像狀態空間:

ΩΣ.\Omega_\Sigma.

Paper 02 則將生成重新描述為:在模型可達域與多重約束域中搜尋、優化與採樣。

本篇處理由此產生的第三個問題:

AI 生成模型實際能到達多大的視覺區域?這個區域和人類歷史上已經實現過的圖像集合有什麼關係?AI 是否已經能生成大量「從未被人類畫過,但仍具有語意與美學合法性」的視覺?

本文首先指出,「人類沒畫過」必須被嚴格拆解。

若只以 raw raster 完全一致作為判準,則由於數位圖像狀態空間極端巨大,生成一張從未與既有圖像逐像素完全一致的圖片相對容易。這種 Exact Novelty 幾乎沒有足夠的藝術或認知含義。

真正重要的是更高層的新穎性:

  1. Exact Novelty:像素狀態不曾出現;
  2. Perceptual Novelty:感知表徵上不只是既有作品的近鄰;
  3. Semantic / Compositional Novelty:物件、關係、構圖與概念組合形成新的有效模式;
  4. Style-Mode Novelty:作品落入既有參考集合沒有覆蓋的穩定視覺語法/風格模式;
  5. Visual-Grammar Novelty:可能形成新的、可被人類理解但既有分類系統尚未描述的視覺生成規則。

因此本文區分:

ΩΣ\Omega_\Sigma

——所有可表示圖像;

HTΣ\mathcal H_T^\Sigma

——截止時間 TT,人類實際實現且映射至規格 Σ\Sigma 的圖像集合;

D\mathcal D

——研究者實際可取得的人類作品資料集;

RG\mathcal R_G

——某一生成系統在指定模型、控制面、有限精度與有限操作條件下的 operational reachable set;

supp(pG)\operatorname{supp}(p_G)

——理想概率模型的數學支持域;

以及:

RG(τ)\mathcal R_G^{(\tau)}

——具有非可忽略概率/可接受生成成本的 effective reachable domain。

本文主張:在一般情況下,不能假設:

HTΣRG\mathcal H_T^\Sigma \subseteq \mathcal R_G

也不能假設:

RGHTΣ.\mathcal R_G \subseteq \mathcal H_T^\Sigma.

兩者都只是:

ΩΣ\Omega_\Sigma

中的不同子集,具有重疊、缺口與不同密度結構。

近期生成模型研究也顯示:高畫質並不等同完整 distribution coverage;生成模型仍可能集中在有限 modes、放大訓練偏差、發生同質化、記憶個別樣本,也可以在其他區域產生未出現在訓練集中的新樣本。這表示「記憶」與「新穎生成」不是非黑即白的模型全域屬性,而可能在同一生成模型的不同局部資料幾何中共存。

本文據此提出「未實現視覺前沿」(Unrealized Visual Frontier, UVF):

FUV=RGMmeaningfulNϵ(Href),\mathcal F_{\text{UV}} = \mathcal R_G \cap \mathcal M_{\text{meaningful}} \setminus \mathcal N_\epsilon(\mathcal H_{\text{ref}}),

其中:

  • Mmeaningful\mathcal M_{\text{meaningful}}:具有可辨識結構/語意/美學的視覺子域;
  • Href\mathcal H_{\text{ref}}:可觀測的人類實現參考集合;
  • Nϵ\mathcal N_\epsilon:依感知、語意、風格或結構距離定義的既有作品鄰域。

此集合不是「證明全人類從未畫過」的絕對集合,而是可操作地表示:

相對於明確參考語料與明確距離定義,模型可達、具有意義、但不只是既有模式近鄰的視覺區域。

最終本文提出四級「AI 未實現視覺假說」:

  • 弱命題 W1:AI 可以產生新的精確 raster states;
  • 弱命題 W2:AI 可以產生既有視覺元素的新組合;
  • 中命題 W3:AI 可以產生參考人類資料集中未覆蓋的穩定語意/構圖/風格 modes;
  • 強命題 W4:AI 可以形成超出既有人類視覺語法而仍可被人類理解與採納的新視覺生成規則。

W1 幾乎是組合空間的直接結果;W2 已有大量實務證據;W3 是可被 benchmark 驗證的重要研究命題;W4 仍屬強假說。

本篇因此將問題從:

「AI 能不能畫出從沒有人畫過的圖?」

修正為:

AI 的有效可達域中,有多少部分真正超出了既有視覺 modes,而不只是像素級排列的新奇?


1. 引言:第三層問題

Paper 01 回答:

所有可表示圖像在哪裡?

形式上:

IΩΣ.I\in\Omega_\Sigma.

Paper 02 回答:

如何利用條件與約束導航?

形式上:

IΩGΩC.I^\star \in \Omega_G \cap \Omega_C.

本篇進一步問:

某一 AI 模型到底能到達 ΩΣ\Omega_\Sigma 的哪一部分?


2. 四個基本集合

2.1 可表示域

固定 digital raster specification:

Σ.\Sigma.

完整圖像狀態空間:

ΩΣ.\Omega_\Sigma.

2.2 人類已實現域

定義截止時間 TT

HTΣ={IΩΣ:I 已由人類創作/攝影/渲染/選擇並實際實現}.\mathcal H_T^\Sigma = \{ I\in\Omega_\Sigma: I \text{ 已由人類創作/攝影/渲染/選擇並實際實現} \}.

3. 人類已實現域不是「所有人類可想像域」

必須區分:

HTΣ\mathcal H_T^\Sigma

與:

HpossibleΣ.\mathcal H_{\text{possible}}^\Sigma.

前者是實際歷史狀態。

後者是:

人類理論上可能創作、理解或接受的視覺。

後者無法直接枚舉。


4. 可觀測人類資料集

研究中真正可拿到的通常只是:

DHTΣ.\mathcal D \subset \mathcal H_T^\Sigma.

例如:

博物館數位藏品
網路藝術作品
攝影資料集
遊戲素材
動畫影格
插畫資料

5. Dataset 不等於 Humanity

因此:

IDI\notin\mathcal D

只能說:

沒有出現在資料集。

不能推出:

IHTΣ.I\notin\mathcal H_T^\Sigma.

6. 模型 operational reachable set

對生成系統:

G.G.

指定:

  • 模型權重;
  • 可用 Prompt;
  • LoRA / Adapter;
  • Reference;
  • Control;
  • Seed 範圍;
  • Sampler;
  • finite precision;
  • allowed workflow;
  • bounded compute。

定義:

RG\mathcal R_G

為所有在此操作規格下實際可生成的 raster outputs。


7. Operational Reachability 是工程概念

如果所有:

seed
float
parameter
workflow

都在有限計算機表示中,

則在固定最大輸出規格下:

RG<.|\mathcal R_G|<\infty.

雖然巨大。


8. 理想連續模型的 Support

理論概率模型可定義:

pG(I).p_G(I).

其支持域:

supp(pG)={I:pG(I)>0}\operatorname{supp}(p_G) = \{I:p_G(I)>0\}

或連續情況的 support closure。


9. Support 可能誤導

對某些連續生成/擴散模型,數學 support 可能很寬。

但:

pG(I)p_G(I)

在大量區域可能極低。

因此:

「數學上有正概率」

不等於:

「工程上可實際找到」。


10. Effective Reachable Domain

定義 threshold:

τ>0.\tau>0.

最簡離散形式:

RG(τ)={I:pG(I)τ}.\mathcal R_G^{(\tau)} = \{I:p_G(I)\geq\tau\}.

更一般可使用:

minimum generation probability
maximum search cost
maximum inference budget
maximum rarity

定義有效可達域。


11. Search-cost Reachability

定義找到 II 的最小代價:

CostG(I).Cost_G(I).

則:

RG(B)={I:CostG(I)B}.\mathcal R_G(B) = \{ I: Cost_G(I)\leq B \}.

BB 是生成預算。


12. 因此「模型會不會畫」也有程度

不是單純:

IRG?I\in\mathcal R_G?

而可能問:

CostG(I)=?Cost_G(I)=?

13. 三層可達性

Mathematical

Isupp(pG).I\in\operatorname{supp}(p_G).

Effective

IRG(τ).I\in\mathcal R_G^{(\tau)}.

Practical

IRG(B).I\in\mathcal R_G(B).

14. 可達性不是均勻的

生成模型通常具有高概率 modes:

M1,M2,,Mk.M_1,M_2,\dots,M_k.

常見 AI 臉、光影、構圖同質化就可以理解為:

概率質量集中在少數高回報/高密度 modes。


15. Quality 與 Coverage 不同

生成品質:

QGQ_G

高,

不代表:

CoverageGCoverage_G

高。

這兩者必須分開。


16. 現代 diffusion 仍存在 coverage 問題

近期研究顯示,即使 diffusion 的 individual sample quality 極高,其生成分佈仍可能只覆蓋真實資料分佈的有限部分。

這支持:

High FidelityHigh Coverage.\boxed{ \text{High Fidelity} \neq \text{High Coverage}. }

17. Default Mode

對簡單或模糊 Prompt:

pG(Ipgeneric)p_G(I\mid p_{\text{generic}})

會形成 default modes。

模型可能總是偏向:

某種臉
某種鏡頭
某種性別/年齡
某種光線
某種美學

18. Scaling 也不保證 Default Diversity

大型模型的 generalization 可能提高,

但:

DdefaultD_{\text{default}}

不一定一起提高。

所以:

Capability ScaleAutomatic Mode Diversity.\boxed{ \text{Capability Scale} \neq \text{Automatic Mode Diversity}. }

19. Reward Optimization 甚至可能使輸出更同質

若 reward 只獎勵單張品質:

R(I),R(I),

模型可能把概率集中到少數高 reward modes。

因此:

QualityQuality\uparrow

同時:

Diversity.Diversity\downarrow.

20. 這重新支持「通用漂亮」概念

模型最安全的策略可能是:

反覆產生已知容易獲得高分的視覺語法。

這形成:

Bgeneric-beauty.\mathcal B_{\text{generic-beauty}}.

21. Memorization

另一個極端是:

IGItrain.I_G \approx I_{\text{train}}.

模型可能重現訓練樣本。


22. 記憶不是純粹理論風險

擴散模型已經被實證觀察到:

training sample replication
memorization neurons
caption-dependent copying

所以:

RGDtrain\mathcal R_G \cap \mathcal D_{\text{train}}

可能非空。


23. 但模型也會生成 Novel Samples

如果生成模型只會記憶:

RGDtrain,\mathcal R_G \subseteq \mathcal D_{\text{train}},

那就不存在真正生成泛化。

實際研究顯示 diffusion 同時具有:

memorization
interpolation
generalization

行為。


24. Local Coverage

2026 的理論工作提出一個重要局部視角:

是否記憶與訓練資料在局部鄰域的 coverage 有關。

稀疏區:

孤立樣本
→ 更容易 memorization

密集區:

多樣近鄰
→ 更支持 interpolation / generalization

25. Memorization 與 Novelty 可以同模型共存

因此不應把模型分類成:

memorizing model
or
creative model

更合理的是:

Behavior=Behavior(x,ρlocal,θ).Behavior = Behavior(x,\rho_{\text{local}},\theta).

26. 三種局部生成區

可以初步分:

Memorization Basin

Rmem.\mathcal R_{\text{mem}}.

Generalization / Interpolation Region

Rgen.\mathcal R_{\text{gen}}.

Low-validity / Artifact Region

Rbad.\mathcal R_{\text{bad}}.

27. Meaningful Reachable Domain

定義:

M=Mmeaningful.\mathcal M = \mathcal M_{\text{meaningful}}.

則:

RGM=RGM.\mathcal R_G^M = \mathcal R_G \cap \mathcal M.

我們真正關心的是:

RGM,\mathcal R_G^M,

而不是模型所有可輸出的亂碼。


28. 「人類沒畫過」的最弱版本

定義:

IGHTΣ.I_G\notin\mathcal H_T^\Sigma.

即:

逐像素 exact raster state 在歷史上沒出現。


29. Exact Novelty 幾乎太容易

由於:

ΩΣ|\Omega_\Sigma|

極端巨大,

而:

HTΣ|\mathcal H_T^\Sigma|

在物理歷史中有限,

因此:

ΩΣHTΣ|\Omega_\Sigma\setminus\mathcal H_T^\Sigma|

仍極端巨大。


30. 這不代表藝術新穎

一張舊圖改一個幾乎不可見 pixel:

II'

就可能:

IHTΣ.I'\notin\mathcal H_T^\Sigma.

但:

Novelart(I)0.Novel_{\text{art}}(I')\approx0.

31. 因此 Exact Novelty 不足

定義:

Nexact(I)=1[IHTΣ].N_{\text{exact}}(I) = \mathbf1[ I\notin\mathcal H_T^\Sigma ].

只能作最底層判定。


32. Perceptual Novelty

選擇感知 embedding:

Ep(I).E_p(I).

定義與參考人類集合最近距離:

dp(I,Href)=minJHrefd(Ep(I),Ep(J)).d_p(I,\mathcal H_{\text{ref}}) = \min_{J\in\mathcal H_{\text{ref}}} d( E_p(I),E_p(J) ).

若:

dp>ϵp,d_p>\epsilon_p,

稱具有 ϵp\epsilon_p -Perceptual Novelty。


33. Semantic Novelty

抽取:

Es(I)E_s(I)

描述:

objects
relations
actions
scene
attributes

若組合落在參考資料之外:

Nsem>0.N_{\text{sem}}>0.

34. Compositional Novelty

例如:

已知人物
已知建築
已知機械

但產生新的:

關係
空間組合
結構配置

可視為:

Ncomp.N_{\text{comp}}.

35. Style-Mode Novelty

Style embedding:

Ek(I).E_k(I).

對人類 reference style clusters:

K1,,Km.K_1,\dots,K_m.

若生成樣本形成穩定 cluster:

KGK_G

且:

d(KG,Ki)>ϵkd(K_G,K_i)>\epsilon_k

對所有 ii 成立,

則可稱:

相對 reference corpus 的 Style-Mode Novelty。


36. Visual-Grammar Novelty

更強的情況是:

不只換 palette 或筆觸,而形成新的視覺生成規則。

例如新的:

shape grammar
spatial grammar
multi-scale relation
symbolic convention

定義:

Ngrammar.N_{\text{grammar}}.

目前缺乏通用測量方式。


37. 五層新穎性

因此:

N(I)=(Nexact,Npercept,Nsem,Nstyle,Ngrammar).N(I) = ( N_{\text{exact}}, N_{\text{percept}}, N_{\text{sem}}, N_{\text{style}}, N_{\text{grammar}} ).

38. 「從未有人畫過」的證明問題

全人類歷史集合:

HTΣ\mathcal H_T^\Sigma

實際不可完整取得。

因此:

絕對證明某張圖從未被任何人類畫過

通常不可操作。


39. 科學上更好的表述

使用:

Novel relative to reference corpus D\mathcal D.

而不是:

Never before created by humanity.


40. Reference-relative Novelty

定義:

Nϵ(ID).N_\epsilon(I\mid\mathcal D).

所有研究報告必須附:

reference corpus
embedding
metric
threshold

41. 未實現視覺前沿

定義:

FUV=RGMNϵ(Href)\boxed{ \mathcal F_{\text{UV}} = \mathcal R_G^M \setminus \mathcal N_\epsilon(\mathcal H_{\text{ref}}) }

42. 鄰域

Nϵ(H)={I:d(I,H)ϵ}.\mathcal N_\epsilon(\mathcal H) = \{ I: d(I,\mathcal H)\leq\epsilon \}.

43. 距離不是單一像素距離

可以使用向量:

d=(dp,ds,dk,dc)d= ( d_p, d_s, d_k, d_c )

其中:

  • dpd_p:perceptual;
  • dsd_s:semantic;
  • dkd_k:style kernel;
  • dcd_c:composition。

44. Multi-Axis Frontier

真正的未實現視覺可以要求:

dp>ϵpd_p>\epsilon_p

且至少一個:

ds>ϵs,d_s>\epsilon_s, dk>ϵk,d_k>\epsilon_k, dc>ϵc.d_c>\epsilon_c.

45. Meaningfulness Gate

如果只追求離既有資料遠:

d,d\rightarrow\infty,

很容易生成 nonsense。

所以必須要求:

M(I)τM.M(I)\geq\tau_M.

46. Novelty–Meaningfulness Trade-off

目標:

maxN(I)\max N(I)

subject to:

M(I)τ.M(I)\geq\tau.

47. 再加 Quality

真正作品:

max[N(I)+λQ(I)]\max \left[ N(I)+\lambda Q(I) \right]

subject to meaningfulness。


48. 這和 AADS Anti-Homogenization 直接相連

AADS 原本希望:

風格一致
但角色/構圖不要重複

就是在固定:

KcτKK_c\geq\tau_K

時,

提高:

Nintra-project.N_{\text{intra-project}}.

49. 模型可達域是否包含人類全部作品?

不能假設:

HTΣRG.\mathcal H_T^\Sigma \subset \mathcal R_G.

50. 為何不一定?

模型可能缺少:

某些極少見風格
特殊文字
精密幾何
長尾文化符號
特殊媒介
奇怪比例

51. GAN inversion 的 out-of-range 問題就是早期證據

若真實圖像:

IrealI_{\text{real}}

無法被某 GAN latent space 精確重建,

它就是:

對該模型而言 out-of-range。


52. 因此人類域可有模型缺口

定義:

Hmiss=HTΣRG.\mathcal H_{\text{miss}} = \mathcal H_T^\Sigma \setminus \mathcal R_G.

53. 模型也可能有超出已觀測人類資料的區域

定義:

Rextra=RGHref.\mathcal R_{\text{extra}} = \mathcal R_G \setminus \mathcal H_{\text{ref}}.

但這裡仍包含:

pixel-novel trivial variants
artifacts
nonsense

54. 有效 extra set

所以:

RextraM=(RGNϵ(Href))M.\mathcal R_{\text{extra}}^M = ( \mathcal R_G \setminus \mathcal N_\epsilon(\mathcal H_{\text{ref}}) ) \cap \mathcal M.

55. 三集合沒有簡單包含關係

最安全的圖:

ΩΣ
├── Human Realized
├── Model Reachable
└── Meaningful Visual Domain

它們互相重疊。


56. 特殊情況下才可能有包含

某個很窄 Domain:

anime headshots

大型模型的有效可達域可能覆蓋資料集大部分 modes。

但不能推廣成:

HRG\mathcal H\subset\mathcal R_G

的普遍命題。


57. 模型可達域也不是固定

加入:

LoRA
fine-tuning
reference adapter
ControlNet
new prompt
new workflow

會改變:

RG.\mathcal R_G.

58. Dynamic Reachable Set

定義時間:

RG(t).\mathcal R_G(t).

模型升級後:

RG(t+1)RG(t).\mathcal R_G(t+1) \neq \mathcal R_G(t).

59. Generative Asset 是可達域變換器

LoRA:

TL:RGRG+L.T_L: \mathcal R_G \rightarrow \mathcal R_{G+L}.

60. Reference 也是條件域變換器

pG(I)pG(IR).p_G(I) \rightarrow p_G(I\mid R).

61. Model Ensemble 擴張可達域

若有:

G1,,Gn,G_1,\dots,G_n,

則平台整體可達域:

Rplatform=iRGi.\mathcal R_{\text{platform}} = \bigcup_i \mathcal R_{G_i}.

62. 這正是 AADS 多 Provider 的理論價值

AADS 不綁單一模型,不只是工程方便。

而是:

多模型聯集可能顯著增加有效視覺可達域。


63. Router 的作用

對 Intent:

C,C,

選:

G=argmaxGReachability(ΩC,G).G^\star = \arg\max_G Reachability( \Omega_C, G ).

64. 模型選擇因此也是幾何問題

不是:

哪個模型分數最高?

而是:

哪個模型的可達域最可能和目標約束域相交?


65. Reachability Score

定義:

RScore(G,C)=Estimate[μ(RGΩC)].RScore(G,C) = Estimate[ \mu( \mathcal R_G \cap \Omega_C ) ].

μ\mu 可以是概率質量 proxy。


66. 這也解釋 Domain-Specific Model 的價值

一個 anime model 的:

RG\mathcal R_G

可能很窄,

但對:

Ωanime\Omega_{\text{anime}}

具有很高 density。


67. 通用模型與專用模型不是簡單強弱

General model:

breadth high
local density lower

Specialist:

breadth low
domain density high

68. 可達域 Breadth–Density Trade-off

定義:

BG=Breadth(RG)B_G = Breadth(\mathcal R_G)

與:

ρG(D)=Density(RGD).\rho_G(D) = Density(\mathcal R_G\mid D).

69. 人類創作域也在擴張

HTΣ\mathcal H_T^\Sigma

隨時間:

TT

單調不減。


70. AI 生成圖被人類採納後發生什麼?

一張 AI 圖:

IGI_G

一旦被人類:

選擇
發布
納入遊戲
修改
使用

是否成為:

HT+1Σ?\mathcal H_{T+1}^\Sigma?

71. 「人類已實現」需要定義作者性嗎?

本文採實現域而非著作權作者域。

只要圖像進入人類文化系統並被實際固定:

IHTΣ.I\in\mathcal H_T^\Sigma.

這不等於判斷法律 authorship。


72. AI 擴張後,人類域會吸收 AI 域

如果大量 AI 圖被採納:

HT+1=HTAG,\mathcal H_{T+1} = \mathcal H_T \cup \mathcal A_G,

其中:

AG\mathcal A_G

是被採納的 AI outputs。


73. 因此 Frontier 會移動

今天新:

IHT.I\notin\mathcal H_T.

明天被使用後:

IHT+1.I\in\mathcal H_{T+1}.

所以:

FUV(T)\mathcal F_{\text{UV}}(T)

是動態前沿。


74. 未實現視覺不是永久身份

它是一個:

歷史時間依賴狀態。


75. Weak Hypothesis W1:Exact Novelty

AI 能產生:

IGHTΣ.I_G\notin\mathcal H_T^\Sigma.

這在巨大狀態空間中幾乎是最弱命題。


76. W1 的研究價值低

因為:

改一個像素

就能成立。

所以不能把 W1 當「AI 創造力」證據。


77. Weak Hypothesis W2:Novel Composition

AI 可以將既有語意 primitive:

a,b,ca,b,c

重新組合成:

f(a,b,c)f(a,b,c)

而此具體組合不在 reference corpus。


78. W2 很可能普遍成立

大模型的組合式生成正是大量 controllable generation 研究對象。

但:

新組合

仍不等於:

新風格語法。


79. Medium Hypothesis W3:Novel Visual Mode

存在模型生成集合:

SGS_G

使其形成穩定 cluster:

KG,K_G,

且不落入 reference human clusters 的 ϵ\epsilon 鄰域。


80. W3 可被 benchmark

要求:

  1. 多個獨立生成樣本;
  2. cluster stability;
  3. 人類判斷其共同風格;
  4. 與 reference corpus 有顯著距離;
  5. 仍有 meaningfulness。

81. Strong Hypothesis W4:Novel Visual Grammar

存在:

GvG_v

是一組此前 reference corpus 未描述的視覺生成規則,

但人類可:

辨識
學習
重用
欣賞

82. W4 不應輕易宣稱

因為:

  • 人類歷史 corpus 不完整;
  • 很多「新」其實是混合;
  • embedding metric 可能看不見真正 antecedent;
  • 人類文化有大量長尾風格。

83. 真正強的新穎性需要可傳授性

如果一個生成模式:

KGK_G

可以讓另一個人/模型:

辨識
模仿
再生成

則它更像:

新的 visual grammar,

而不是一次性怪圖。


84. Style Recipe Test

如果能從新 cluster 提煉:

RecipeGRecipe_G

並穩定生成:

I1,,In,I_1,\dots,I_n,

則支持:

Nstyle-mode>0.N_{\text{style-mode}}>0.

85. AI 是否能「想出」人類沒想過的風格?

這個問題最好改寫為:

AI 是否能搜尋到既有 reference distribution 低密度區,形成可重用、可被人類認知的新視覺 mode?


86. Search for Frontier

AADS 可以主動優化:

maxNovelty(I)\max Novelty(I)

subject to:

Meaningful(I)τMMeaningful(I)\geq\tau_M

和:

Quality(I)τQ.Quality(I)\geq\tau_Q.

87. Frontier Mode

新增生成模式:

Conservative
Project
Diverse
Frontier

88. Frontier Mode 的目標

不是:

隨機變怪。

而是:

maxd(I,Href)\max d(I,\mathcal H_{\text{ref}})

subject to:

semantic validity
style coherence
human acceptance
technical quality

89. Novelty Search 可能找到 nonsense

所以必須有:

M(I)M(I)

與:

Q(I).Q(I).

90. Novelty–Quality Pareto Front

PNQ.\mathcal P_{NQ}.

過度追求 Novelty:

Quality.Quality\downarrow.

過度追求 Quality:

ModeCollapse.ModeCollapse\uparrow.

91. 這和 2026 diversity RL 問題直接呼應

當 reward 只獎勵單張品質時,生成模式會往少數高 reward modes 收縮。

因此需要:

distribution-level diversity reward。


92. Style Entropy

對生成集:

G.\mathcal G.

定義:

Hstyle(G).H_{\text{style}}(\mathcal G).

Frontier Search 可以提高它,

但專案生成則要求:

KcK_c

保持。


93. Global Diversity 與 Project Diversity 不同

全域模型希望:

Hglobal.H_{\text{global}}\uparrow.

單一遊戲專案希望:

HprojectH_{\text{project}}

受控,

但:

Hcharacter/compositionH_{\text{character/composition}}

不能崩。


94. Model Diversity Evaluation

因此至少分:

global mode coverage
prompt-conditioned diversity
project-conditioned diversity
intra-subject diversity

95. DIMCIM 類研究的啟示

不能只問:

這個模型能不能生成某 attribute?

還要問:

在沒有明確要求時,它是否只會反覆落入 default modes?


96. 「能力存在」和「自然可達」不同

某模式可能:

IRGI\in\mathcal R_G

但需要非常特殊 Prompt:

CostG(I)1.Cost_G(I)\gg1.

所以它不是 default reachable。


97. Prompt Accessibility

定義:

Ap(I)=minLength/Complexity(p)A_p(I) = \min Length/Complexity(p)

使模型高概率生成 II 類模式。


98. Agent 可以降低 Accessibility Cost

如果 AI Art Director 自動找到:

Prompt
LoRA
Reference
Control

則:

Costhuman.Cost_{\text{human}} \downarrow.

99. 這支持原始直覺

很多視覺不是 AI 畫不出,而是人類不知道怎麼把意圖映射到生成控制面。

這可以形式化成:

IRGI\in\mathcal R_G

但:

IRG(Bhuman-manual).I\notin\mathcal R_G(B_{\text{human-manual}}).

100. Agent-Expanded Practical Reachability

加入 Agent:

RG+A(B).\mathcal R_{G+A}(B).

可能有:

RG(B)RG+A(B).\mathcal R_G(B) \subset \mathcal R_{G+A}(B).

101. 注意:不是模型本體能力變強

Agent 沒改模型時:

supp(pG)\operatorname{supp}(p_G)

可能不變。

改變的是:

有限預算內能被找到的區域。


102. Search Intelligence

因此定義:

SI=ability to locate desired modes in an existing reachable domain.S_I = \text{ability to locate desired modes in an existing reachable domain}.

103. Model Intelligence 與 Search Intelligence 分離

Capability=ModelReachability+SearchIntelligence.Capability = ModelReachability + SearchIntelligence.

104. LoRA 則真的改變 Reachability

若 Agent 自動訓練 LoRA:

GG,G \rightarrow G',

則:

RGRG.\mathcal R_G \rightarrow \mathcal R_{G'}.

105. 因此完整 AADS 可以同時做兩件事

  1. 搜索既有域;
  2. 需要時修改域。

106. Search vs Adapt

若:

ΩCRG,\Omega_C \cap \mathcal R_G \neq\varnothing,

優先 Search。

若:

ΩCRG,\Omega_C \cap \mathcal R_G \approx\varnothing,

考慮:

LoRA
fine-tuning
new model
new reference provider

107. 這是 Training Agent 的理論判定式

Training 不應因為:

想更厲害

就啟動。

而應因:

current reachable domain insufficient。


108. Reachability Gap

定義:

Gap(C,G)=d(ΩC,RG).Gap(C,G) = d( \Omega_C, \mathcal R_G ).

若:

Gap>τ,Gap>\tau,

才需要 Adapt。


109. 實驗框架一:Memorization–Novelty Map

對每個生成樣本:

計算:

nearest training image
nearest reference human image
semantic distance
style distance
quality

建立二維/多維圖:

(Memorization,Novelty).(Memorization,Novelty).

110. 實驗框架二:Coverage Map

在 embedding 空間 cluster:

Dhuman.\mathcal D_{\text{human}}.

測模型覆蓋:

Coverage(G,D).Coverage(G,D).

111. 實驗框架三:Unrealized Frontier Search

讓 Agent 主動搜尋:

maxd(I,D)\max d(I,\mathcal D)

subject to quality / meaningfulness。


112. 實驗框架四:Human Adoption

讓人類評審:

像已知風格
像混合風格
像新的穩定風格
只是怪

113. 實驗框架五:Reproducible Grammar

對被判「可能新風格」的 cluster:

  1. 抽出 Style Recipe;
  2. 換 20 個不同內容 Prompt;
  3. 再生成;
  4. 測風格一致性;
  5. 測內容多樣性。

114. 新 Style Mode Gate

只有當:

KcτKK_c\geq\tau_K

且:

DvτDD_v\geq\tau_D

且:

d(KG,KH)>ϵd(K_G,\mathcal K_H)>\epsilon

才稱 candidate novel style mode。


115. 訓練資料泄漏檢查

任何 novelty claim 必須先排除:

近重複 training example
直接 memorization
reference leakage

116. Memorization Test

可以使用:

nearest-neighbor
copy detection
feature similarity
training-set auditing

避免把複製叫創造。


117. Novelty 不等於 Valuable

即使:

N(I)0,N(I)\gg0,

也可能:

V(I)0.V(I)\approx0.

118. Value 是另一個軸

定義:

A(I)=adoption / aesthetic / utility value.A(I) = \text{adoption / aesthetic / utility value}.

119. Novel Visual Innovation

更完整:

Innovation(I)=f(Novelty,Meaningfulness,Quality,Adoptability).Innovation(I) = f( Novelty, Meaningfulness, Quality, Adoptability ).

120. 強命題的判定

若 AI 產生一個 Style Mode:

  1. 相對 corpus 顯著新;
  2. 可重複;
  3. 可學習;
  4. 被人類採用;
  5. 形成後續作品;

它才接近:

真正視覺創新。


121. 人機共同創新

一旦人類選擇、修正、命名 AI 新風格,

它進入:

HT+1.\mathcal H_{T+1}.

因此未來創新可能是:

AI Search+Human Selection+Cultural Stabilization.AI\ Search + Human\ Selection + Cultural\ Stabilization.

122. AI 的角色可能像「視覺空間探勘器」

這比「畫家替代品」更抽象。

AI 可以:

在人類不可能暴力探索的高維視覺域中,主動搜尋低密度但有意義的區域。


123. Human as Selection Pressure

人類偏好:

RH(I).R_H(I).

在大量生成中形成選擇壓力。


124. Co-Evolution Loop

ModelNovelCandidatesHumanSelectionDataset/CultureNextModel.Model \rightarrow NovelCandidates \rightarrow HumanSelection \rightarrow Dataset/Culture \rightarrow NextModel.

125. 這會讓 Frontier 不斷外移

FUV(T)FUV(T+1).\mathcal F_{\text{UV}}(T) \rightarrow \mathcal F_{\text{UV}}(T+1).

126. 與 Paper 01 的統一

Paper 01:

ΩΣ\Omega_\Sigma

是所有可表示狀態。

Paper 03:

RG\mathcal R_G

只是其中一部分。


127. 與 Paper 02 的統一

Paper 02:

ΩC\Omega_C

是人類要求的目標域。

真正生成成功:

IRGΩC.I \in \mathcal R_G \cap \Omega_C.

128. 新增 Frontier 要求

若同時:

INϵ(Href),I\notin \mathcal N_\epsilon( \mathcal H_{\text{ref}} ),

則:

IFUV.I \in \mathcal F_{\text{UV}}.

129. 與 Generative Asset Registry 的統一

Model、LoRA、Adapter、Reference、Control、Recipe 的共同作用是:

改變 R_G
改變 p_G
改變有效 Reachability Cost
改變 Constraint Intersection

所以 Paper 04 可以統一抽象為:

Generative Navigation Assets。


130. 本文核心集合圖

ΩΣ  — 所有可表示 raster states
│
├── M — 有意義視覺域
│
├── H_T — 人類歷史實現域
│
├── R_G — 模型可達域
│
└── Ω_C — 當前意圖約束域

有效生成:
R_G ∩ Ω_C

有意義生成:
R_G ∩ Ω_C ∩ M

未實現視覺候選:
R_G ∩ Ω_C ∩ M \ Nε(H_ref)

131. 四級假說正式版

W1 — Exact-State Novelty

IGRG:IGHTΣ.\exists I_G\in\mathcal R_G: I_G\notin\mathcal H_T^\Sigma.

狀態: 幾乎平凡,藝術意義有限。


W2 — Novel Composition

IG\exists I_G

具有 reference corpus 中未出現的有效語意/空間組合。

狀態: 高度可驗,已有廣泛生成實務支持。


W3 — Novel Stable Visual Mode

存在穩定生成 cluster:

KGK_G

與人類 reference modes 顯著分離,且:

有意義
可重現
可辨識
內容可變

狀態: 重要可驗命題。


W4 — Novel Visual Grammar

AI 發現可被人類採用的新視覺生成規則,不只是混合既有 style tokens。

狀態: 強命題,未證明。


132. 結論

「AI 是否已經可以生成幾乎所有人類畫過甚至沒畫過的圖」若不拆分,容易同時包含一個太弱命題與一個太強命題。

太弱的版本是:

AI 可以產生一張逐像素從沒出現過的圖。

在:

ΩΣ|\Omega_\Sigma|

極端巨大的條件下,這幾乎沒有足夠研究價值。

太強的版本是:

現有 AI 已覆蓋所有人類可能的視覺創造。

目前沒有證據支持。

真正值得研究的中間問題是:

How much meaningful visual mode space is effectively reachable by a generative system?\boxed{ \text{How much meaningful visual mode space is effectively reachable by a generative system?} }

以及:

Does that reachable domain contain stable visual modes outside the observed human-realized corpus?\boxed{ \text{Does that reachable domain contain stable visual modes outside the observed human-realized corpus?} }

因此本文提出:

FUV=RGMNϵ(Href)\boxed{ \mathcal F_{\text{UV}} = \mathcal R_G \cap \mathcal M \setminus \mathcal N_\epsilon(\mathcal H_{\text{ref}}) }

作為「未實現視覺前沿」。

模型的能力也應拆成:

GenerativeCapability=ReachableDomain+ModeCoverage+SearchIntelligence\boxed{ GenerativeCapability = ReachableDomain + ModeCoverage + SearchIntelligence }

其中:

  • ReachableDomain:理論上/工程上能生成什麼;
  • ModeCoverage:概率質量實際覆蓋多少有效模式;
  • SearchIntelligence:能否在有限預算下找到人類想要的低概率模式。

這也修正了「AI 畫不出」的語意。

某一畫面可能:

IRGI\in\mathcal R_G

但人工操作成本:

Costmanual(I)Cost_{\text{manual}}(I)

太高。

加入 AI Art Director 後:

Costagent(I)<Costmanual(I).Cost_{\text{agent}}(I) < Cost_{\text{manual}}(I).

於是對使用者而言:

原本「幾乎畫不出」的視覺,變成實際可達。

這正是 AI 配合生成工具、LoRA、Reference、Control 與自動工作流的真正價值之一。

最終,AI 的長期角色可能不只是「替人類畫畫」,而是:

Explorer of High-Dimensional Visual Possibility Space\boxed{ \text{Explorer of High-Dimensional Visual Possibility Space} }

——在完整可表示視覺空間中,以模型先驗、約束求解、生成資產與人類偏好作導航工具,探索那些人類無法靠暴力枚舉,但可能有意義、可被採納、甚至形成新視覺語法的區域。


參考文獻

  1. Dombrowski, M. et al. Image Generation Diversity Issues and How to Tame Them. CVPR 2025.
  2. Teotia, R. et al. DIMCIM: A Quantitative Evaluation Framework for Default-mode Diversity and Generalization in Text-to-Image Generative Models. ICCV 2025.
  3. Liu, H. et al. DiverseGRPO: Mitigating Mode Collapse in Image Generation via Diversity-Aware GRPO. CVPR 2026.
  4. Miao, Z. et al. Training Diffusion Models Towards Diverse Image Generation with Reinforcement Learning. CVPR 2024.
  5. Hintersdorf, D. et al. Finding NeMo: Localizing Neurons Responsible For Memorization in Diffusion Models. NeurIPS 2024.
  6. Somepalli, G. et al. Understanding and Mitigating Copying in Diffusion Models. NeurIPS 2023.
  7. Merger, C., Goldt, S. Local Coverage Governs Memorization in Diffusion Models. arXiv:2606.14390, 2026.
  8. He, Y., Qiu, Y., Tao, M. Diffusion Model's Generalization Can Be Characterized by Inductive Biases toward a Data-Dependent Ridge Manifold. arXiv:2602.06021, 2026.
  9. Pham, B. et al. Memorization to Generalization: Emergence of Diffusion Models from Associative Memory. arXiv:2505.21777, 2025.
  10. Kang, K. et al. GAN Inversion for Out-of-Range Images With Geometric Transformations. ICCV 2021.
  11. Parmar, G. et al. Spatially-Adaptive Multilayer Selection for GAN Inversion and Editing. CVPR 2022.
  12. Morshed, M. M., Boddeti, V. DiverseFlow: Sample-Efficient Diverse Mode Coverage in Flows. CVPR 2025.
  13. Duym, J. et al. Quantifying Generative Stability: Mode Collapse Entropy Score for Mode Diversity Evaluation. WACV Workshops 2025.
  14. Stein, G. et al. Exposing Flaws of Generative Model Evaluation Metrics and Their Unfair Treatment of Diffusion Models. NeurIPS 2023.

研究狀態與宣稱邊界

本文不主張:

  1. 現有 AI 已覆蓋全部人類藝術;
  2. HTΣ\mathcal H_T^\Sigma 可以被完整收集;
  3. 一個 embedding distance 足以定義藝術新穎性;
  4. 未出現在訓練集即等於真正創新;
  5. 混合兩種既有風格一定構成新 Style Mode;
  6. AI 已證明能創造全新人類視覺語法;
  7. 模型 mathematical support 等於 practical reachability。

本文真正建立的是一個更精確的研究問題:

把「所有可表示」、「人類已實現」、「資料集中可觀測」、「模型理論支持」、「模型實際可達」、「模型高概率常用」與「真正新穎且有意義」分開。

只有做完這些區分後,「AI 是否已能生成未實現視覺」才成為可以被嚴格討論與實驗的命題。