← Archive
lm-003065 · 2026-08

全域視覺空間假說

下載 MD 檔 ⬇

全域視覺空間假說

從量化灰階方塊到高維圖像狀態空間

英文題名: The Global Visual State Space Hypothesis: From Quantized Grayscale Squares to High-Dimensional Image State Spaces
作者: Neo.K / EveMissLab
版本: v0.1-draft
日期: 2026-08-12
系列: Global Visual Space & Generative Navigation — Paper 01
文件性質: 理論論文/數位影像、計算表示與生成空間研究

關鍵詞: 全域視覺空間、圖像狀態空間、灰階量化、高維離散空間、像素、圖像枚舉、視覺流形、生成模型、約束域、計算幾何


摘要

本文提出「全域視覺空間假說」(Global Visual State Space Hypothesis, GVSS),從一個極小而可形式化的問題出發:若一張數位圖像的解析度、通道數與每通道量化位元數皆固定,則每一張可被該格式表示的圖像,都只是有限高維離散空間中的一個資料點。

設圖像寬高為 W,HW,H,通道數為 CC,每通道量化位元數為 bb,則每個 sample 有:

L=2bL=2^b

個可能值,而整張圖的全狀態空間為:

Ω(W,H,C,b)={0,1,,L1}WHC,\Omega(W,H,C,b) = \{0,1,\dots,L-1\}^{WHC},

其基數為:

Ω=LWHC=2bWHC.|\Omega| = L^{WHC} = 2^{bWHC}.

以本文的最小思考實驗—— 100×100100\times100 、8-bit 灰階圖像——為例,若整張圖所有像素保持同一灰階值,則只有 256256 張「純色灰階方塊」;但若每個像素都可以獨立取 256 個灰階值,則圖像總數為:

25610000=2800001024082.4,256^{10000} = 2^{80000} \approx 10^{24082.4},

亦即每一個可能圖像若按十進位整數編號,需要約 24,083 位十進位數才能覆蓋完整索引範圍。

本文進一步證明:一旦固定像素掃描順序與通道順序,每一張離散圖像都可以與一個整數地址一一對應;因此「某一幅具體畫面」在計算表示層面並非不可定位之物,而是高維離散狀態空間中的精確元素。圖像修改則可被描述為此狀態空間中的路徑;生成可以被描述為對某一點、某一子域或某一概率分佈的搜尋與取樣。

然而,完整可表示圖像空間與「人類可理解、自然、藝術或具有專案風格」的圖像集合並不相同。後者可能只佔據前者極小且高度結構化的子域。這與電腦視覺中長期使用的自然圖像流形觀點相容:生成與編輯並非均勻探索所有像素組合,而是在高維 ambient image space 中尋找高度受限的有效區域。

本文因此建立四個層次:可表示空間、結構化視覺子域、生成可達域、特定約束解。本篇只形式化前兩者,將「AI 如何導航」、「模型可達域是否超過人類既有圖像集合」分別留給本系列後續論文。

本文的核心結論可以濃縮為:

Digital Image=A Point in a Finite High-Dimensional State Space\boxed{ \text{Digital Image} = \text{A Point in a Finite High-Dimensional State Space} }

以及:

Image Generation can be studied as navigation over constrained subsets of that space.\boxed{ \text{Image Generation} \text{ can be studied as navigation over constrained subsets of that space.} }

1. 引言

1.1 從一個「很廢話」的方塊開始

假設要求一台計算機產生一個 100×100100\times100 的灰階正方形。

第一個版本非常簡單:

第一張:全黑
第二張:比全黑亮一級
第三張:再亮一級
……
最後一張:全白

若每一個像素使用 8-bit 灰階,則一個 sample 可取:

0,1,2,,255.0,1,2,\dots,255.

如果整張圖所有像素都必須相同,只有:

256256

種圖像。

這個例子幾乎沒有任何藝術性可言,卻提供了一個極乾淨的理論起點:

一張數位圖像只要被完全量化,它就是有限資料。


1.2 第二步:解除「所有像素相同」限制

現在允許 1000010000 個像素各自獨立取灰階值:

Iij{0,,255}.I_{ij}\in\{0,\dots,255\}.

這時每一個像素都提供 256 種分支。

因此:

Ω=25610000.|\Omega| = 256^{10000}.

從「只有 256 張灰色方塊」到「 25610000256^{10000} 張可能圖像」,唯一改變的是:

各像素由共享一個變量,改為擁有獨立自由度。

這一步立即產生組合爆炸。


2. 數位圖像的最小形式化

2.1 像素域

定義像素座標集合:

XH,W={0,,W1}×{0,,H1}.X_{H,W} = \{0,\dots,W-1\} \times \{0,\dots,H-1\}.

2.2 量化值域

bb -bit sample:

Qb={0,1,,2b1}.Q_b = \{0,1,\dots,2^b-1\}.

其大小:

Qb=2b.|Q_b|=2^b.

對 8-bit:

Q8={0,,255}.Q_8=\{0,\dots,255\}.

2.3 灰階圖像

灰階圖像可定義為函數:

I:XH,WQb.I: X_{H,W} \rightarrow Q_b.

因此所有可能灰階圖像的集合為:

Ωgray(H,W,b)=QbHW.\Omega_{\text{gray}}(H,W,b) = Q_b^{HW}.

2.4 多通道圖像

若通道數為 CC

I:XH,W×{1,,C}Qb.I: X_{H,W}\times\{1,\dots,C\} \rightarrow Q_b.

因此:

Ω(H,W,C,b)=QbHWC.\Omega(H,W,C,b) = Q_b^{HWC}.

3. 命題一:固定格式下的圖像空間是有限的

命題 3.1

對固定的有限:

H,W,C,bN+,H,W,C,b\in\mathbb N^+,

數位 raster 圖像狀態空間:

Ω(H,W,C,b)\Omega(H,W,C,b)

為有限集合,且:

Ω=2bHWC.|\Omega| = 2^{bHWC}.

證明

每個 sample 有:

2b2^b

種取值。

總 sample 數為:

N=HWC.N=HWC.

各 sample 可獨立選值,因此由乘法原理:

Ω=(2b)N=2bHWC.|\Omega| = (2^b)^N = 2^{bHWC}.

證畢。


4. 100×100100\times100 灰階最小模型

令:

H=W=100,C=1,b=8.H=W=100,\quad C=1,\quad b=8.

則:

N=10000.N=10000.

全狀態空間:

Ω100=Q810000.\Omega_{100} = Q_8^{10000}.

基數:

Ω100=25610000=280000.|\Omega_{100}| = 256^{10000} = 2^{80000}.

近似:

2800001024082.39965.2^{80000} \approx 10^{24082.39965}.

因此完整索引範圍具有約:

2408324083

位十進位數。


5. 「純白到純黑」其實有兩種問題

這是本論文必須特別澄清的地方。


5.1 全圖單值灰階鏈

若所有像素共享同一灰階變量:

Ig(x,y)=g,I_g(x,y)=g,

其中:

gQ8,g\in Q_8,

則集合:

U100={Ig:gQ8}.U_{100} = \{I_g:g\in Q_8\}.

因此:

U100=256.|U_{100}|=256.

這就是:

全黑
→ 深灰
→ 中灰
→ 淺灰
→ 全白

的完整 8-bit 純色漸變鏈。


5.2 每像素獨立灰階空間

如果:

I(x,y)I(x,y)

可各自獨立取值,則:

Ω100=25610000.| \Omega_{100} | = 256^{10000}.

所以:

U100Ω100.U_{100} \subsetneq \Omega_{100}.

純白到純黑的全圖漸變,只是巨大圖像空間中的一條極小一維鏈。


6. 命題二:每張圖可以有精確整數地址

如果圖像只是有限離散資料,那麼可以建立一個一一對應地址。


6.1 向量化

固定掃描順序,例如:

row-major

將圖像攤平成:

p=(p0,p1,,pN1),\mathbf p = (p_0,p_1,\dots,p_{N-1}),

其中:

piQb.p_i\in Q_b.

6.2 基數編碼

令:

L=2b.L=2^b.

定義:

Ψ(I)=i=0N1piLi.\Psi(I) = \sum_{i=0}^{N-1} p_iL^i.

則:

0Ψ(I)<LN.0 \leq \Psi(I) < L^N.

命題 6.1

映射:

Ψ:Ω{0,1,,LN1}\Psi: \Omega \rightarrow \{0,1,\dots,L^N-1\}

為雙射。

證明概要

每個整數:

0n<LN0\leq n<L^N

皆具有唯一的 LL 進位表示:

n=ipiLi,n = \sum_i p_iL^i,

其中:

0pi<L.0\leq p_i<L.

這些 digit 唯一對應各像素 sample,因此每一個整數只對應一張圖,每一張圖也只對應一個整數。

證畢。


7. 圖像因此可以被「編號」

在固定:

解析度
通道順序
bit depth
pixel order

後,理論上可以寫:

Image #0
Image #1
Image #2
...
Image #(L^N - 1)

因此「一個特定畫面」可以具有精確離散地址。

這裡的地址不是藝術語意座標,而是:

raw raster state address。


8. 地址不等於有意義的座標系

雖然:

Ψ(I)\Psi(I)

提供一對一索引,但相鄰整數不一定代表視覺上相似的圖。

例如進位造成:

...255
→
...000 with carry

可能改變多個 digit。

因此還需要定義「圖像空間幾何」。


9. 圖像空間的距離

可定義多種距離。

9.1 L1L_1

d1(I,J)=ipiqi.d_1(I,J) = \sum_i|p_i-q_i|.

9.2 L2L_2

d2(I,J)=i(piqi)2.d_2(I,J) = \sqrt{ \sum_i(p_i-q_i)^2 }.

9.3 LL_\infty

d(I,J)=maxipiqi.d_\infty(I,J) = \max_i|p_i-q_i|.

10. 像素狀態圖

也可以直接建立圖:

GΩ=(V,E),G_\Omega=(V,E),

其中:

V=Ω.V=\Omega.

定義兩張圖相鄰,若它們只差一個 sample 的一個量化級:

d1(I,J)=1.d_1(I,J)=1.

11. 命題三:量化圖像狀態圖連通

命題 11.1

在上述鄰接定義下:

GΩG_\Omega

是連通圖。

證明

任意兩張圖:

I,JI,J

的每個 sample 均為有限整數。

可依序選取每一個 sample,將:

pip_i

以:

±1\pm1

逐級調整至:

qi.q_i.

每一步皆是合法鄰接邊。

有限個 sample、有限差值之後必到達 JJ

故任意兩頂點間皆存在有限路徑。

證畢。


12. 「一張畫變成另一張畫」就是路徑

這提供一個非常直接的計算幾何詮釋。

若:

I0I_0

是純黑圖,

ITI_T

是任意目標圖,

則存在:

I0I1IT.I_0 \rightarrow I_1 \rightarrow \dots \rightarrow I_T.

每一步只需要改一個量化單位。

因此:

Image Transformation=Path in Image State Space\boxed{ \text{Image Transformation} = \text{Path in Image State Space} }

至少在離散 raster 表示層上成立。


13. 最短像素路徑

d1=1d_1=1 鄰接圖上,從 IIJJ 的最短步數正好是:

d1(I,J).d_1(I,J).

因為每一步最多將總 L1L_1 差距降低 1。

所以:

distG(I,J)=d1(I,J).dist_G(I,J)=d_1(I,J).

這使數位圖像空間具有非常直接的組合幾何。


14. 純黑到純白需要多少步?

100×100100\times100 、8-bit 灰階:

全黑:

IB=(0,,0).I_B=(0,\dots,0).

全白:

IW=(255,,255).I_W=(255,\dots,255).

因此:

d1(IB,IW)=10000×255=2,550,000.d_1(I_B,I_W) = 10000\times255 = 2,550,000.

所以若每一步只允許一個 pixel 改一級,最短路徑需要:

2.55×1062.55\times10^6

步。


15. 但全圖同步灰階路徑只需 255 步

若允許一次把所有像素:

gg+1,g\rightarrow g+1,

則:

black
→
gray 1
→
...
→
white

只需:

255255

次狀態轉移。

這說明:

路徑長度依賴允許的「算子」。

因此算子集合:

A\mathcal A

本身會決定視覺空間的有效幾何。


16. 算子誘導幾何

若允許的操作集合為:

A={A1,,Am},\mathcal A = \{A_1,\dots,A_m\},

則可建立新的鄰接關係:

IAJI\sim_\mathcal A J

若存在:

Ak(I)=J.A_k(I)=J.

此時圖像空間幾何不只是像素距離,而是:

由可用生成/編輯算子決定的可達幾何。

這一點將在後續「生成導航」論文中展開。


17. 暴力窮舉作為概念實驗

理論上,由於:

Ω<,|\Omega|<\infty,

完整枚舉存在。

最簡單方式:

for n in 0 .. L^N-1:
    I = decode_base_L(n)
    inspect(I)

因此:

FiniteEnumerable in principle\boxed{ \text{Finite} \Rightarrow \text{Enumerable in principle} }

18. 但「可枚舉」不等於「可實行」

100×100100\times100 8-bit 灰階:

2800002^{80000}

個狀態。

即使只保存 raw pixel samples,每張圖至少需要:

1000010000

bytes。

所以全部 raw 資料量約:

10000×28000010000\times2^{80000}

bytes。

這不是一個需要更快 GPU 就可以暴力解決的普通規模問題。


19. 組合爆炸

固定:

b,Cb,C

時:

Ω=2bCWH.|\Omega| = 2^{bCWH}.

因此其對像素數:

P=WHP=WH

呈:

Ω=2bCP.|\Omega|=2^{bCP}.

也就是指數成長。

解析度只線性增加,狀態數卻指數爆炸。


20. RGB 空間更巨大

100×100100\times100 、8-bit RGB:

C=3.C=3.

因此:

ΩRGB=25630000=2240000.|\Omega_{\text{RGB}}| = 256^{30000} = 2^{240000}.

單純從灰階增加到 RGB,就把 exponent 從:

8000080000

提高到:

240000.240000.

21. 更高 bit depth

若 16-bit 灰階:

Ω=6553610000=2160000.|\Omega| = 65536^{10000} = 2^{160000}.

所以「更多漸層」在數學上不是增加一些顏色而已,而是直接增加每個 sample 的狀態基數。


22. 多通道不是只有 RGB

如果圖像 representation 還含:

alpha
depth
normal
material
spectral bands
motion
semantic channels

則可把通道數擴充為:

C>C.C'>C.

完整狀態空間繼續指數增大。


23. 固定數位表示與數學連續空間必須區分

本文的「有限」結論建立在:

固定 H
固定 W
固定 C
固定 finite bit depth

之上。

若改成理想化實數色彩:

I[0,1]HWC,I\in[0,1]^{HWC},

則即使固定解析度,狀態空間也為不可數無限。


24. 實際計算機仍是有限表示

有限記憶體中的實際 digital sample 使用有限 bit pattern。

因此對具體:

file format
framebuffer
tensor dtype

其實際可表示狀態依然有限。

這是本文討論的「計算機視覺狀態空間」。


25. 若解析度不設上限

若允許任意有限:

H,W,H,W,

但每張圖仍只能有有限解析度與有限 bit depth,則所有有限圖像集合可以寫為:

Ω=H=1W=1Ω(H,W,C,b).\Omega_\infty = \bigcup_{H=1}^\infty \bigcup_{W=1}^\infty \Omega(H,W,C,b).

每個子集合有限,且索引集合可數,因此:

Ω\Omega_\infty

為可數無限集合。


26. 「全域」的精確含義

因此本文所說:

全域視覺空間

不是宣稱存在一個固定有限集合包含所有可能物理視覺經驗。

而是:

相對於一組明確數位表示規格 Σ\Sigma,存在完整的所有可表示 raster states 集合。

定義:

Σ=(H,W,C,b,channel order,encoding).\Sigma = (H,W,C,b,\text{channel order},\text{encoding}).

則:

ΩΣ\Omega_\Sigma

稱為此規格下的全域數位視覺狀態空間。


27. Raw State 與檔案格式不同

兩個不同 PNG 檔案可能:

metadata 不同
compression 不同
chunk order 不同

但 decode 後像素相同。

本文中的:

IΩΣI\in\Omega_\Sigma

指的是解碼後 raster state,不是檔案 byte sequence。


28. 同一畫面可以有不同編碼

因此:

File1File2File_1\neq File_2

仍可能:

Decode(File1)=Decode(File2)=I.Decode(File_1)=Decode(File_2)=I.

本文研究的是:

I,I,

而不是檔案容器身份。


29. 圖像空間不等於自然圖像空間

完整:

ΩΣ\Omega_\Sigma

中的絕大多數點,直觀上可能只是高熵雜訊。

自然圖像與藝術圖像不是均勻填滿:

ΩΣ.\Omega_\Sigma.

30. 結構化視覺子域

定義:

MmeaningfulΩΣ\mathcal M_{\text{meaningful}} \subset \Omega_\Sigma

為對某一觀察者/辨識系統而言具有結構或語意的圖像集合。

再定義:

MartMmeaningful.\mathcal M_{\text{art}} \subseteq \mathcal M_{\text{meaningful}}.

31. 「流形」是一種模型,不是本文預先證明的事實

電腦視覺中常使用 natural image manifold 的語言,假設真實/自然圖像集中於高維像素空間中的低維結構。

本文接受它作為有用的建模方向,但不把:

Mmeaningful\mathcal M_{\text{meaningful}}

必然是光滑微分流形作為本文前提。

更保守的名稱是:

結構化視覺子域。


32. 自然圖像流形與本假說的關係

Zhu 等人的 Generative Visual Manipulation on the Natural Image Manifold,直接把真實圖像編輯描述為:在高維圖像空間中學得自然圖像 manifold,並將操作限制在其上,以避免生成不自然圖像。

這與本文的層次非常一致:

MnaturalΩΣ.\mathcal M_{\text{natural}} \subset \Omega_\Sigma.

33. PULSE 的直接類比

PULSE 的超解析策略並不是逐像素猜高頻,而是在生成模型的高解析 natural image manifold 中搜尋,使其 downscale 後與低解析輸入相符的高解析候選。

形式上可以理解為:

HMnaturalH^\star \in \mathcal M_{\text{natural}}

且:

D(H)L.D(H^\star)\approx L.

這已經非常接近:

「在視覺子域中做受約束搜尋。」


34. 因此 AI 生成可以被重新理解

不是:

NothingImage.\text{Nothing}\rightarrow\text{Image}.

而是:

Model State / Latent / ConditionsIΩΣ.\text{Model State / Latent / Conditions} \rightarrow I\in\Omega_\Sigma.

換句話說:

AI 最終仍必須輸出某一個合法 raster state。


35. 每個最終畫面都是一組數據

不論圖像來源是:

人畫
攝影
3D 渲染
程序生成
擴散模型
GAN
遊戲引擎

當它落地成固定格式 raster image 時,都可以表示成:

p=(p0,,pN1).\mathbf p = (p_0,\dots,p_{N-1}).

其在 raw raster 層面沒有本體論差別。


36. 「AI 畫」與「人類畫」的差別存在於生成歷史,不在最終 raster datatype

若:

Ihuman=IAII_{\text{human}} = I_{\text{AI}}

逐 sample 完全相同,

則從 raster state 本身:

Ihuman=IAI.I_{\text{human}} = I_{\text{AI}}.

差異存在於:

provenance
intent
process
authorship
training
tool use

而不在像素矩陣自身。


37. 這導出一個重要分離

Image StateImage Provenance\boxed{ \text{Image State} \neq \text{Image Provenance} }

同一 state 可以有不同來源。

這對未來 AI 生成內容研究非常重要。


38. 「人類沒畫過」不等於「空間中不存在」

若某張圖:

IΩΣI^\star\in\Omega_\Sigma

但歷史上從未被人類實現,

它仍是該數位表示空間中的合法狀態。

因此:

Not previously realizedNot representable.\text{Not previously realized} \neq \text{Not representable}.

39. 但「可表示」也不等於「模型可生成」

即使:

IΩΣ,I^\star\in\Omega_\Sigma,

某個生成模型:

GθG_\theta

仍可能無法到達它。

所以必須區分:

Ωrepresentable\Omega_{\text{representable}}

與:

Ωreachable(Gθ).\Omega_{\text{reachable}}(G_\theta).

本文只建立前者。

模型可達域留待 Paper 03。


40. Seed 不是全域圖像地址

生成系統常使用 seed。

但:

seedseed

通常只決定 PRNG / latent initialization。

輸出仍取決於:

I=Gθ,π(seed,c),I = G_{\theta,\pi}(seed,c),

其中:

  • θ\theta:模型;
  • π\pi:Sampler / Scheduler / Workflow;
  • cc:Prompt / Reference / Adapter 等條件。

因此:

SeedΨ(I)\boxed{ Seed \neq \Psi(I) }

它不是全域 raster address。


41. 真正的絕對地址是 raster encoding

對固定:

Σ,\Sigma,

完整像素向量:

p\mathbf p

本身就是直接座標。

或使用:

Ψ(I)\Psi(I)

將其映射成唯一整數。

這比 seed 更接近:

「一張圖的絕對資料地址。」


42. 但是這種地址沒有語意壓縮

如果你知道:

Ψ(I)=1010000,\Psi(I)=10^{10000}\dots,

人仍然不知道圖裡是:

一個人
一棵樹
黑白格
武俠場景

所以:

State AddressSemantic Address.\text{State Address} \neq \text{Semantic Address}.

43. AI 真正提供的是結構化導航

AI 不需要知道:

Ψ(I)\Psi(I^\star)

的完整整數值才能生成。

它學的是:

哪些區域像人
哪些區域像樹
哪些 latent direction 對應風格
哪些條件能縮小候選集

即:

利用結構與分佈跳過幾乎全部無效狀態。


44. 暴力窮舉與智能生成的差別

暴力:

Search(ΩΣ).Search(\Omega_\Sigma).

AI:

Search(MΩC).Search( \mathcal M \cap \Omega_C ).

其中:

  • M\mathcal M:模型學到的結構化視覺域;
  • ΩC\Omega_C:條件約束子域。

45. 組合爆炸正是智能導航必要性的原因

如果完整空間只有幾百張圖,根本不需要 AI。

正因:

Ω|\Omega|

極端巨大,才需要:

先驗
表示學習
latent
constraint
search
sampling
optimization

46. 最小枚舉實驗梯

雖然 100×100100\times100 不可能實際完整枚舉,但可以建立逐級實驗。


E0:1×1, 8-bit 灰階

2561=256.256^1=256.

可以完整生成。


E1:2×2, 2-bit 灰階

每 pixel:

44

級。

總數:

44=256.4^4=256.

仍可完整生成與展示。


E2:3×3, 2-bit 灰階

49=262144.4^9 = 262144.

仍可離線完整枚舉。


E3:4×4, 1-bit

216=65536.2^{16} = 65536.

非常適合觀察「圖像語意」何時開始出現。


E4:8×8, 1-bit

264.2^{64}.

已不適合暴力完整枚舉。


47. 實驗意義

這個實驗梯可以直接展示:

從「完全可枚舉」到「雖有限但不可暴力」的相變。

並研究:

對稱圖案
文字
幾何
人臉-like pattern
connected shapes

在小型空間中的比例。


48. Gray Code 路徑

若使用 binary image:

Q1={0,1},Q_1=\{0,1\},

可以利用 Gray Code 建立:

每一張圖與下一張圖只改一個 bit。

因此在:

2N2^N

個狀態間建立 Hamiltonian path。


49. 這提供「全空間動畫」的極小版本

例如 4×44\times4 binary image:

216=65536.2^{16}=65536.

可以真的生成一段序列:

Image 0
→ Image 1
→ ...
→ Image 65535

且每幀只改一個 pixel。

這幾乎就是:

有限視覺宇宙的完整遍歷動畫。


50. 多級灰階也可構造最小變化遍歷

對:

QLN,Q_L^N,

可以研究 generalized Gray code,使相鄰狀態只改一個 sample 一級或有限變化。

這將「枚舉」提升為:

圖像狀態空間路徑設計問題。


51. 圖像生成與計算幾何

至此,圖像問題已可以被重新表示為:

  • 點;
  • 子域;
  • 距離;
  • 鄰接;
  • 路徑;
  • 可達性;
  • 搜尋;
  • 採樣。

因此數位圖像生成天然具有一個:

Computational Geometry of Visual States\boxed{ \text{Computational Geometry of Visual States} }

52. GVSS 假說的正式陳述

GVSS-H1:有限表示假說

對任一固定有限數位 raster specification:

Σ,\Sigma,

其完整圖像狀態集合:

ΩΣ\Omega_\Sigma

為有限集合。


GVSS-H2:唯一狀態地址假說

存在雙射:

Ψ:ΩΣ{0,,ΩΣ1}.\Psi: \Omega_\Sigma \leftrightarrow \{0,\dots,|\Omega_\Sigma|-1\}.

GVSS-H3:路徑存在假說

若允許逐 sample 單級修改,任意:

I,JΩΣI,J\in\Omega_\Sigma

之間存在有限路徑。


GVSS-H4:結構稀疏假說

人類可理解/自然/藝術圖像只佔:

ΩΣ\Omega_\Sigma

中的高度受限子域。

這一點是研究假說,不由 H1–H3 自動推出。


53. H1–H3 的地位

H1–H3 實際上不是需要 AI 實驗確認的經驗猜想,而是由有限離散表示直接得到的數學性質。

真正具有研究不確定性的是:

H4H4

以及後續:

結構域如何表示?
模型可達域多大?
人類畫過的域多大?
意圖如何壓縮搜尋?

54. 與「圖像創造」概念的關係

本文不主張:

藝術創造只是查表。

因為創造過程仍包含:

意圖
選擇
評估
組合
文化
語意
歷史

本文只主張:

最終 raster 結果在固定 digital representation 下必然是全狀態空間的一個元素。


55. 形式空間先於生成歷史

如果:

ΩΣ\Omega_\Sigma

由格式規格決定,

那麼某張未來才被生成的圖:

IfutureI_{future}

在數學上早已是:

IfutureΩΣ.I_{future}\in\Omega_\Sigma.

只是:

尚未被實際求得/選取/生成。


56. 這不是宿命論

「狀態可表示」不代表:

未來創作已被決定

因為:

  • 哪個 state 被選到;
  • 哪條 path 被走;
  • 哪些 constraint 被施加;
  • 哪個人認為它有意義;

仍然是開放過程。


57. 類比:字串空間

固定長度 nn 、字母表 ΣA\Sigma_A

ΣAn|\Sigma_A|^n

包含所有可能字串。

某篇尚未寫出的小說,其字元序列在形式上也是字串空間中的一點。

但這不意味著:

寫小說只是枚舉。

圖像同理。


58. 壓縮與語意的提示

完整 raster address 可能需要:

bHWCbHWC

bits。

但高度規則化圖像可以用很短的程序描述。

例如:

全黑 100×100100\times100

其程序描述遠短於:

8000080000

bits raw data。


59. 這暗示結構化子域具有可壓縮性

有意義圖像往往含:

重複
對稱
物件
邊界
語法
風格

這些結構使它們可能具有較短描述。

因此未來可以研究:

K(I)K(I)

即 Kolmogorov-like description complexity 的近似。

本文不進一步展開。


60. AI 與壓縮導航

生成模型可以被理解成:

對大量結構化視覺狀態建立壓縮生成規則。

模型參數:

θ\theta

加條件:

cc

加 latent:

zz

可以產生:

I.I.

這比直接保存所有 II 更高效。


61. 生成模型不是全空間查表

因此:

GθG_\theta

不需要記住:

ΩΣ\Omega_\Sigma

的所有元素。

它只需要學得:

某些高概率、高結構化區域的生成映射。


62. 從「全域空間」到「可導航空間」

這提供本系列下一篇的直接入口:

ΩΣMΩC.\Omega_\Sigma \supset \mathcal M \supset \Omega_C.

問題從:

所有圖在哪?

轉成:

如何從人類 Intent 建立 ΩC\Omega_C,並高效找到 II^\star


63. 與 AI Art Direction 的連接

先前的多重約束域:

Ω=iΩi\Omega^\star = \bigcap_i\Omega_i

現在得到更底層的本體基座:

ΩiΩΣ.\Omega_i \subset \Omega_\Sigma.

因此:

AI Art Direction=Navigation Policy over constrained visual state space\boxed{ AI\ Art\ Direction = \text{Navigation Policy over constrained visual state space} }

64. 與 Generative Asset Registry 的連接

LoRA、Reference、ControlNet、Style Recipe 等不再只是「工具資產」。

它們可以被重新理解為:

改變搜索分佈、路徑或約束域形狀的導航資產。


65. LoRA 的空間詮釋

LoRA 改變:

GθGθ+Δθ.G_\theta \rightarrow G_{\theta+\Delta\theta}.

因此它改變的不是:

ΩΣ\Omega_\Sigma

本身,

而是:

Ωreachable(Gθ)\Omega_{\text{reachable}}(G_\theta)

及其中的概率密度。


66. Reference 的空間詮釋

Reference 不改變所有可表示圖像,而是縮小條件分佈:

p(I)p(IR).p(I) \rightarrow p(I\mid R).

67. Prompt 的空間詮釋

同理:

p(I)p(Ip).p(I) \rightarrow p(I\mid p).

Prompt 是導航條件,而不是 raster address。


68. 最小理論層級圖

Digital Representation Specification Σ
                ↓
Global Visual State Space ΩΣ
                ↓
Structured / Meaningful Visual Domain M
                ↓
Model Reachable Domain ΩG
                ↓
Constraint Domain ΩC
                ↓
Selected / Generated Image I*

本篇正式建立前兩層。


69. 可證偽性與可驗證性

H1

由計數可直接驗證。

H2

可實作 encode/decode 驗證雙射。

H3

可用 small-state graph 全遍歷驗證。

H4

需要經驗研究。


70. 建議程式實驗

建立一個極小 GVSS Explorer:

1x1 8-bit
2x2 2-bit
3x3 2-bit
4x4 binary

功能:

enumerate
integer address
decode
distance
Gray-code traversal
frequency statistics
pattern viewer

71. 實驗一:完整 2×2 空間

2×22\times2 、2-bit:

256256

張。

可以把 256 張全部排成:

16×1616\times16

圖冊。

這是非常直觀的「完整視覺宇宙」。


72. 實驗二:完整 4×4 binary 空間

6553665536

張。

可以計算:

黑像素數分布
connected components
symmetry
edge count

看結構圖像在完整空間裡如何分布。


73. 實驗三:人類分類

隨機抽:

有結構
無結構
像字
像物件
有美感

建立:

Mhuman\mathcal M_{\text{human}}

的微型經驗近似。


74. 實驗四:AI 分類

讓 AI 對同一批圖做分類。

比較:

MAI\mathcal M_{\text{AI}}

與:

Mhuman.\mathcal M_{\text{human}}.

這可能成為後續有趣研究。


75. 「畫面空間」與「光譜空間」

本文使用灰階,是為了最小化維度。

若每 pixel 不只是灰階,而是多波段:

piQbS,p_i\in Q_b^S,

SS 為 spectral bands。

則:

Ω=2bSHW.|\Omega| = 2^{bSHW}.

因此「光譜量化塗色方塊」是 GVSS 的自然擴張。


76. 色彩本質仍是 sample vector

RGB:

p=(r,g,b).p=(r,g,b).

光譜:

p=(s1,,sk).p=(s_1,\dots,s_k).

所以整個理論不依賴 RGB。


77. 動畫與影片

若加入時間:

TT

幀,

則:

Ωvideo=QbHWCT.\Omega_{\text{video}} = Q_b^{HWC T}.

基數:

2bHWCT.2^{bHWCT}.

時間維度再次使狀態空間指數擴張。


78. 3D / 多模態視覺

若未來把:

depth
normal
geometry
material
time

全部納入,

則研究對象從 image state space 擴展為:

Ωvisual-world.\Omega_{\text{visual-world}}.

本篇不宣稱已完成這個擴張。


79. 研究邊界

本文不主張:

  1. 所有有意義圖像都形成光滑流形;
  2. 現有 AI 能到達所有可表示圖像;
  3. 人類意圖可以唯一指定任意 raster state;
  4. Seed 是全域圖像座標;
  5. 暴力枚舉是實際生成方法;
  6. 數位可表示性等同藝術創造性。

80. 本文真正主張

本文只建立一個非常基礎但重要的層:

固定有限 digital raster specification 下,所有可能圖像形成一個有限、高維、可一一編碼、具有可定義鄰接與路徑的離散狀態空間。


81. 理論意義

這個看似「廢話」的結論提供了一個很有用的共同地基。

因為它允許我們把:

畫
風格
生成
編輯
約束
AI

全部放回同一個 state-space 語言裡討論。


82. 後續論文接口

Paper 02

視覺生成作為約束域求解

研究:

IntentΩCI.Intent \rightarrow \Omega_C \rightarrow I^\star.

Paper 03

生成可達域與未實現視覺

研究:

Ωhuman?ΩmodelΩrepresentable.\Omega_{\text{human}} \subseteq? \Omega_{\text{model}} \subseteq \Omega_{\text{representable}}.

Paper 04

Generative Asset Registry

將:

model
LoRA
adapter
reference
recipe
control

抽象為視覺空間導航資產。


83. 結論

如果一張 100×100100\times100 灰階圖使用 8-bit sample,那麼它就是:

1000010000

個取值範圍為:

02550\dots255

的離散變量。

因此一張圖可以被寫成:

I=(p0,p1,,p9999),I=(p_0,p_1,\dots,p_{9999}),

並且完整可能圖像空間為:

Ω100={0,,255}10000\boxed{ \Omega_{100} = \{0,\dots,255\}^{10000} }

其大小:

Ω100=25610000=280000\boxed{ |\Omega_{100}| = 256^{10000} = 2^{80000} }

整張同一灰階值的「純色方塊」只有:

256256

種,這只是全空間中的一條極小鏈:

U100Ω100.U_{100} \subsetneq \Omega_{100}.

更重要的是,固定 raster specification 後,每一張圖都可被唯一地址化:

Ψ:ΩΣ{0,,ΩΣ1}\boxed{ \Psi: \Omega_\Sigma \leftrightarrow \{0,\dots,|\Omega_\Sigma|-1\} }

因此:

任何一張可以由該數位格式表示的具體畫面,在 raw raster 層面都只是一個有限高維狀態空間中的特定資料點。

但完整空間極端巨大,暴力枚舉雖在形式上可能,在計算上迅速失去實際意義。

因此真正重要的問題自然變成:

哪些區域有結構?哪些區域有語意?哪些區域是人類藝術?AI 可以到達哪些區域?人類意圖如何被編譯成能把搜尋快速壓縮到目標區域的約束?

這就是本系列下一篇——「視覺生成作為約束域求解」——真正要開始處理的問題。


參考文獻

  1. W3C. Portable Network Graphics (PNG) Specification (Third Edition). W3C Recommendation. Grayscale PNG uses one sample per pixel; PNG supports finite sample bit depths including 8-bit grayscale.
  2. Zhu, J.-Y., Krähenbühl, P., Shechtman, E., Efros, A. A. Generative Visual Manipulation on the Natural Image Manifold. ECCV 2016 / arXiv:1609.03552.
  3. Menon, S., Damian, A., Hu, S., Ravi, N., Rudin, C. PULSE: Self-Supervised Photo Upsampling via Latent Space Exploration of Generative Models. CVPR 2020.
  4. Gong, S., Boddeti, V. N., Jain, A. K. On the Intrinsic Dimensionality of Image Representations. CVPR 2019.

研究狀態

本文中的 H1–H3 可由離散組合結構直接建立。

以下仍屬待驗研究方向:

結構化視覺子域的實際測度
自然圖像是否可被最佳描述為低維流形
人類與 AI 對「有意義狀態」的分類差異
生成模型在 GVSS 中的真正可達域
不同視覺算子所誘導的幾何與路徑

因此本文不是在聲稱「已解決所有圖像生成」。

它提供的是一個最底層的座標系:

先知道所有可能 raster states 構成什麼空間, 再研究智能如何在其中導航。\boxed{ \text{先知道所有可能 raster states 構成什麼空間, 再研究智能如何在其中導航。} }