# 全域視覺空間假說
## 從量化灰階方塊到高維圖像狀態空間

**英文題名：** The Global Visual State Space Hypothesis: From Quantized Grayscale Squares to High-Dimensional Image State Spaces  
**作者：** Neo.K / EveMissLab  
**版本：** v0.1-draft  
**日期：** 2026-08-12  
**系列：** Global Visual Space & Generative Navigation — Paper 01  
**文件性質：** 理論論文／數位影像、計算表示與生成空間研究

**關鍵詞：** 全域視覺空間、圖像狀態空間、灰階量化、高維離散空間、像素、圖像枚舉、視覺流形、生成模型、約束域、計算幾何

---

# 摘要

本文提出「**全域視覺空間假說**」（Global Visual State Space Hypothesis, GVSS），從一個極小而可形式化的問題出發：若一張數位圖像的解析度、通道數與每通道量化位元數皆固定，則每一張可被該格式表示的圖像，都只是有限高維離散空間中的一個資料點。

設圖像寬高為 $W,H$，通道數為 $C$，每通道量化位元數為 $b$，則每個 sample 有：

$$
L=2^b
$$

個可能值，而整張圖的全狀態空間為：

$$
\Omega(W,H,C,b)
=
\{0,1,\dots,L-1\}^{WHC},
$$

其基數為：

$$
|\Omega|
=
L^{WHC}
=
2^{bWHC}.
$$

以本文的最小思考實驗—— $100\times100$ 、8-bit 灰階圖像——為例，若整張圖所有像素保持同一灰階值，則只有 $256$ 張「純色灰階方塊」；但若每個像素都可以獨立取 256 個灰階值，則圖像總數為：

$$
256^{10000}
=
2^{80000}
\approx
10^{24082.4},
$$

亦即每一個可能圖像若按十進位整數編號，需要約 24,083 位十進位數才能覆蓋完整索引範圍。

本文進一步證明：一旦固定像素掃描順序與通道順序，每一張離散圖像都可以與一個整數地址一一對應；因此「某一幅具體畫面」在計算表示層面並非不可定位之物，而是高維離散狀態空間中的精確元素。圖像修改則可被描述為此狀態空間中的路徑；生成可以被描述為對某一點、某一子域或某一概率分佈的搜尋與取樣。

然而，完整可表示圖像空間與「人類可理解、自然、藝術或具有專案風格」的圖像集合並不相同。後者可能只佔據前者極小且高度結構化的子域。這與電腦視覺中長期使用的自然圖像流形觀點相容：生成與編輯並非均勻探索所有像素組合，而是在高維 ambient image space 中尋找高度受限的有效區域。

本文因此建立四個層次：**可表示空間、結構化視覺子域、生成可達域、特定約束解**。本篇只形式化前兩者，將「AI 如何導航」、「模型可達域是否超過人類既有圖像集合」分別留給本系列後續論文。

本文的核心結論可以濃縮為：

$$
\boxed{
\text{Digital Image}
=
\text{A Point in a Finite High-Dimensional State Space}
}
$$

以及：

$$
\boxed{
\text{Image Generation}
\text{ can be studied as navigation over constrained subsets of that space.}
}
$$

---

# 1. 引言

## 1.1 從一個「很廢話」的方塊開始

假設要求一台計算機產生一個 $100\times100$ 的灰階正方形。

第一個版本非常簡單：

```text
第一張：全黑
第二張：比全黑亮一級
第三張：再亮一級
……
最後一張：全白
```

若每一個像素使用 8-bit 灰階，則一個 sample 可取：

$$
0,1,2,\dots,255.
$$

如果整張圖所有像素都必須相同，只有：

$$
256
$$

種圖像。

這個例子幾乎沒有任何藝術性可言，卻提供了一個極乾淨的理論起點：

> 一張數位圖像只要被完全量化，它就是有限資料。

---

## 1.2 第二步：解除「所有像素相同」限制

現在允許 $10000$ 個像素各自獨立取灰階值：

$$
I_{ij}\in\{0,\dots,255\}.
$$

這時每一個像素都提供 256 種分支。

因此：

$$
|\Omega|
=
256^{10000}.
$$

從「只有 256 張灰色方塊」到「 $256^{10000}$ 張可能圖像」，唯一改變的是：

> 各像素由共享一個變量，改為擁有獨立自由度。

這一步立即產生組合爆炸。

---

# 2. 數位圖像的最小形式化

## 2.1 像素域

定義像素座標集合：

$$
X_{H,W}
=
\{0,\dots,W-1\}
\times
\{0,\dots,H-1\}.
$$

---

## 2.2 量化值域

對 $b$ -bit sample：

$$
Q_b
=
\{0,1,\dots,2^b-1\}.
$$

其大小：

$$
|Q_b|=2^b.
$$

對 8-bit：

$$
Q_8=\{0,\dots,255\}.
$$

---

## 2.3 灰階圖像

灰階圖像可定義為函數：

$$
I:
X_{H,W}
\rightarrow
Q_b.
$$

因此所有可能灰階圖像的集合為：

$$
\Omega_{\text{gray}}(H,W,b)
=
Q_b^{HW}.
$$

---

## 2.4 多通道圖像

若通道數為 $C$：

$$
I:
X_{H,W}\times\{1,\dots,C\}
\rightarrow
Q_b.
$$

因此：

$$
\Omega(H,W,C,b)
=
Q_b^{HWC}.
$$

---

# 3. 命題一：固定格式下的圖像空間是有限的

## 命題 3.1

對固定的有限：

$$
H,W,C,b\in\mathbb N^+,
$$

數位 raster 圖像狀態空間：

$$
\Omega(H,W,C,b)
$$

為有限集合，且：

$$
|\Omega|
=
2^{bHWC}.
$$

### 證明

每個 sample 有：

$$
2^b
$$

種取值。

總 sample 數為：

$$
N=HWC.
$$

各 sample 可獨立選值，因此由乘法原理：

$$
|\Omega|
=
(2^b)^N
=
2^{bHWC}.
$$

證畢。

---

# 4. $100\times100$ 灰階最小模型

令：

$$
H=W=100,\quad C=1,\quad b=8.
$$

則：

$$
N=10000.
$$

全狀態空間：

$$
\Omega_{100}
=
Q_8^{10000}.
$$

基數：

$$
|\Omega_{100}|
=
256^{10000}
=
2^{80000}.
$$

近似：

$$
2^{80000}
\approx
10^{24082.39965}.
$$

因此完整索引範圍具有約：

$$
24083
$$

位十進位數。

---

# 5. 「純白到純黑」其實有兩種問題

這是本論文必須特別澄清的地方。

---

## 5.1 全圖單值灰階鏈

若所有像素共享同一灰階變量：

$$
I_g(x,y)=g,
$$

其中：

$$
g\in Q_8,
$$

則集合：

$$
U_{100}
=
\{I_g:g\in Q_8\}.
$$

因此：

$$
|U_{100}|=256.
$$

這就是：

```text
全黑
→ 深灰
→ 中灰
→ 淺灰
→ 全白
```

的完整 8-bit 純色漸變鏈。

---

## 5.2 每像素獨立灰階空間

如果：

$$
I(x,y)
$$

可各自獨立取值，則：

$$
| \Omega_{100} |
=
256^{10000}.
$$

所以：

$$
U_{100}
\subsetneq
\Omega_{100}.
$$

純白到純黑的全圖漸變，只是巨大圖像空間中的一條極小一維鏈。

---

# 6. 命題二：每張圖可以有精確整數地址

如果圖像只是有限離散資料，那麼可以建立一個一一對應地址。

---

## 6.1 向量化

固定掃描順序，例如：

```text
row-major
```

將圖像攤平成：

$$
\mathbf p
=
(p_0,p_1,\dots,p_{N-1}),
$$

其中：

$$
p_i\in Q_b.
$$

---

## 6.2 基數編碼

令：

$$
L=2^b.
$$

定義：

$$
\Psi(I)
=
\sum_{i=0}^{N-1}
p_iL^i.
$$

則：

$$
0
\leq
\Psi(I)
<
L^N.
$$

---

## 命題 6.1

映射：

$$
\Psi:
\Omega
\rightarrow
\{0,1,\dots,L^N-1\}
$$

為雙射。

### 證明概要

每個整數：

$$
0\leq n<L^N
$$

皆具有唯一的 $L$ 進位表示：

$$
n
=
\sum_i p_iL^i,
$$

其中：

$$
0\leq p_i<L.
$$

這些 digit 唯一對應各像素 sample，因此每一個整數只對應一張圖，每一張圖也只對應一個整數。

證畢。

---

# 7. 圖像因此可以被「編號」

在固定：

```text
解析度
通道順序
bit depth
pixel order
```

後，理論上可以寫：

```text
Image #0
Image #1
Image #2
...
Image #(L^N - 1)
```

因此「一個特定畫面」可以具有精確離散地址。

這裡的地址不是藝術語意座標，而是：

> **raw raster state address。**

---

# 8. 地址不等於有意義的座標系

雖然：

$$
\Psi(I)
$$

提供一對一索引，但相鄰整數不一定代表視覺上相似的圖。

例如進位造成：

```text
...255
→
...000 with carry
```

可能改變多個 digit。

因此還需要定義「圖像空間幾何」。

---

# 9. 圖像空間的距離

可定義多種距離。

## 9.1 $L_1$

$$
d_1(I,J)
=
\sum_i|p_i-q_i|.
$$

## 9.2 $L_2$

$$
d_2(I,J)
=
\sqrt{
\sum_i(p_i-q_i)^2
}.
$$

## 9.3 $L_\infty$

$$
d_\infty(I,J)
=
\max_i|p_i-q_i|.
$$

---

# 10. 像素狀態圖

也可以直接建立圖：

$$
G_\Omega=(V,E),
$$

其中：

$$
V=\Omega.
$$

定義兩張圖相鄰，若它們只差一個 sample 的一個量化級：

$$
d_1(I,J)=1.
$$

---

# 11. 命題三：量化圖像狀態圖連通

## 命題 11.1

在上述鄰接定義下：

$$
G_\Omega
$$

是連通圖。

### 證明

任意兩張圖：

$$
I,J
$$

的每個 sample 均為有限整數。

可依序選取每一個 sample，將：

$$
p_i
$$

以：

$$
\pm1
$$

逐級調整至：

$$
q_i.
$$

每一步皆是合法鄰接邊。

有限個 sample、有限差值之後必到達 $J$。

故任意兩頂點間皆存在有限路徑。

證畢。

---

# 12. 「一張畫變成另一張畫」就是路徑

這提供一個非常直接的計算幾何詮釋。

若：

$$
I_0
$$

是純黑圖，

$$
I_T
$$

是任意目標圖，

則存在：

$$
I_0
\rightarrow
I_1
\rightarrow
\dots
\rightarrow
I_T.
$$

每一步只需要改一個量化單位。

因此：

$$
\boxed{
\text{Image Transformation}
=
\text{Path in Image State Space}
}
$$

至少在離散 raster 表示層上成立。

---

# 13. 最短像素路徑

在 $d_1=1$ 鄰接圖上，從 $I$ 到 $J$ 的最短步數正好是：

$$
d_1(I,J).
$$

因為每一步最多將總 $L_1$ 差距降低 1。

所以：

$$
dist_G(I,J)=d_1(I,J).
$$

這使數位圖像空間具有非常直接的組合幾何。

---

# 14. 純黑到純白需要多少步？

對 $100\times100$ 、8-bit 灰階：

全黑：

$$
I_B=(0,\dots,0).
$$

全白：

$$
I_W=(255,\dots,255).
$$

因此：

$$
d_1(I_B,I_W)
=
10000\times255
=
2,550,000.
$$

所以若每一步只允許一個 pixel 改一級，最短路徑需要：

$$
2.55\times10^6
$$

步。

---

# 15. 但全圖同步灰階路徑只需 255 步

若允許一次把所有像素：

$$
g\rightarrow g+1,
$$

則：

```text
black
→
gray 1
→
...
→
white
```

只需：

$$
255
$$

次狀態轉移。

這說明：

> 路徑長度依賴允許的「算子」。

因此算子集合：

$$
\mathcal A
$$

本身會決定視覺空間的有效幾何。

---

# 16. 算子誘導幾何

若允許的操作集合為：

$$
\mathcal A
=
\{A_1,\dots,A_m\},
$$

則可建立新的鄰接關係：

$$
I\sim_\mathcal A J
$$

若存在：

$$
A_k(I)=J.
$$

此時圖像空間幾何不只是像素距離，而是：

> **由可用生成／編輯算子決定的可達幾何。**

這一點將在後續「生成導航」論文中展開。

---

# 17. 暴力窮舉作為概念實驗

理論上，由於：

$$
|\Omega|<\infty,
$$

完整枚舉存在。

最簡單方式：

```text
for n in 0 .. L^N-1:
    I = decode_base_L(n)
    inspect(I)
```

因此：

$$
\boxed{
\text{Finite}
\Rightarrow
\text{Enumerable in principle}
}
$$

---

# 18. 但「可枚舉」不等於「可實行」

對 $100\times100$ 8-bit 灰階：

$$
2^{80000}
$$

個狀態。

即使只保存 raw pixel samples，每張圖至少需要：

$$
10000
$$

bytes。

所以全部 raw 資料量約：

$$
10000\times2^{80000}
$$

bytes。

這不是一個需要更快 GPU 就可以暴力解決的普通規模問題。

---

# 19. 組合爆炸

固定：

$$
b,C
$$

時：

$$
|\Omega|
=
2^{bCWH}.
$$

因此其對像素數：

$$
P=WH
$$

呈：

$$
|\Omega|=2^{bCP}.
$$

也就是指數成長。

解析度只線性增加，狀態數卻指數爆炸。

---

# 20. RGB 空間更巨大

若 $100\times100$ 、8-bit RGB：

$$
C=3.
$$

因此：

$$
|\Omega_{\text{RGB}}|
=
256^{30000}
=
2^{240000}.
$$

單純從灰階增加到 RGB，就把 exponent 從：

$$
80000
$$

提高到：

$$
240000.
$$

---

# 21. 更高 bit depth

若 16-bit 灰階：

$$
|\Omega|
=
65536^{10000}
=
2^{160000}.
$$

所以「更多漸層」在數學上不是增加一些顏色而已，而是直接增加每個 sample 的狀態基數。

---

# 22. 多通道不是只有 RGB

如果圖像 representation 還含：

```text
alpha
depth
normal
material
spectral bands
motion
semantic channels
```

則可把通道數擴充為：

$$
C'>C.
$$

完整狀態空間繼續指數增大。

---

# 23. 固定數位表示與數學連續空間必須區分

本文的「有限」結論建立在：

```text
固定 H
固定 W
固定 C
固定 finite bit depth
```

之上。

若改成理想化實數色彩：

$$
I\in[0,1]^{HWC},
$$

則即使固定解析度，狀態空間也為不可數無限。

---

# 24. 實際計算機仍是有限表示

有限記憶體中的實際 digital sample 使用有限 bit pattern。

因此對具體：

```text
file format
framebuffer
tensor dtype
```

其實際可表示狀態依然有限。

這是本文討論的「計算機視覺狀態空間」。

---

# 25. 若解析度不設上限

若允許任意有限：

$$
H,W,
$$

但每張圖仍只能有有限解析度與有限 bit depth，則所有有限圖像集合可以寫為：

$$
\Omega_\infty
=
\bigcup_{H=1}^\infty
\bigcup_{W=1}^\infty
\Omega(H,W,C,b).
$$

每個子集合有限，且索引集合可數，因此：

$$
\Omega_\infty
$$

為可數無限集合。

---

# 26. 「全域」的精確含義

因此本文所說：

> 全域視覺空間

不是宣稱存在一個固定有限集合包含所有可能物理視覺經驗。

而是：

> **相對於一組明確數位表示規格 $\Sigma$，存在完整的所有可表示 raster states 集合。**

定義：

$$
\Sigma
=
(H,W,C,b,\text{channel order},\text{encoding}).
$$

則：

$$
\Omega_\Sigma
$$

稱為此規格下的全域數位視覺狀態空間。

---

# 27. Raw State 與檔案格式不同

兩個不同 PNG 檔案可能：

```text
metadata 不同
compression 不同
chunk order 不同
```

但 decode 後像素相同。

本文中的：

$$
I\in\Omega_\Sigma
$$

指的是**解碼後 raster state**，不是檔案 byte sequence。

---

# 28. 同一畫面可以有不同編碼

因此：

$$
File_1\neq File_2
$$

仍可能：

$$
Decode(File_1)=Decode(File_2)=I.
$$

本文研究的是：

$$
I,
$$

而不是檔案容器身份。

---

# 29. 圖像空間不等於自然圖像空間

完整：

$$
\Omega_\Sigma
$$

中的絕大多數點，直觀上可能只是高熵雜訊。

自然圖像與藝術圖像不是均勻填滿：

$$
\Omega_\Sigma.
$$

---

# 30. 結構化視覺子域

定義：

$$
\mathcal M_{\text{meaningful}}
\subset
\Omega_\Sigma
$$

為對某一觀察者／辨識系統而言具有結構或語意的圖像集合。

再定義：

$$
\mathcal M_{\text{art}}
\subseteq
\mathcal M_{\text{meaningful}}.
$$

---

# 31. 「流形」是一種模型，不是本文預先證明的事實

電腦視覺中常使用 natural image manifold 的語言，假設真實／自然圖像集中於高維像素空間中的低維結構。

本文接受它作為有用的建模方向，但不把：

$$
\mathcal M_{\text{meaningful}}
$$

必然是光滑微分流形作為本文前提。

更保守的名稱是：

> **結構化視覺子域。**

---

# 32. 自然圖像流形與本假說的關係

Zhu 等人的 Generative Visual Manipulation on the Natural Image Manifold，直接把真實圖像編輯描述為：在高維圖像空間中學得自然圖像 manifold，並將操作限制在其上，以避免生成不自然圖像。

這與本文的層次非常一致：

$$
\mathcal M_{\text{natural}}
\subset
\Omega_\Sigma.
$$

---

# 33. PULSE 的直接類比

PULSE 的超解析策略並不是逐像素猜高頻，而是在生成模型的高解析 natural image manifold 中搜尋，使其 downscale 後與低解析輸入相符的高解析候選。

形式上可以理解為：

$$
H^\star
\in
\mathcal M_{\text{natural}}
$$

且：

$$
D(H^\star)\approx L.
$$

這已經非常接近：

> 「在視覺子域中做受約束搜尋。」

---

# 34. 因此 AI 生成可以被重新理解

不是：

$$
\text{Nothing}\rightarrow\text{Image}.
$$

而是：

$$
\text{Model State / Latent / Conditions}
\rightarrow
I\in\Omega_\Sigma.
$$

換句話說：

> **AI 最終仍必須輸出某一個合法 raster state。**

---

# 35. 每個最終畫面都是一組數據

不論圖像來源是：

```text
人畫
攝影
3D 渲染
程序生成
擴散模型
GAN
遊戲引擎
```

當它落地成固定格式 raster image 時，都可以表示成：

$$
\mathbf p
=
(p_0,\dots,p_{N-1}).
$$

其在 raw raster 層面沒有本體論差別。

---

# 36. 「AI 畫」與「人類畫」的差別存在於生成歷史，不在最終 raster datatype

若：

$$
I_{\text{human}}
=
I_{\text{AI}}
$$

逐 sample 完全相同，

則從 raster state 本身：

$$
I_{\text{human}}
=
I_{\text{AI}}.
$$

差異存在於：

```text
provenance
intent
process
authorship
training
tool use
```

而不在像素矩陣自身。

---

# 37. 這導出一個重要分離

$$
\boxed{
\text{Image State}
\neq
\text{Image Provenance}
}
$$

同一 state 可以有不同來源。

這對未來 AI 生成內容研究非常重要。

---

# 38. 「人類沒畫過」不等於「空間中不存在」

若某張圖：

$$
I^\star\in\Omega_\Sigma
$$

但歷史上從未被人類實現，

它仍是該數位表示空間中的合法狀態。

因此：

$$
\text{Not previously realized}
\neq
\text{Not representable}.
$$

---

# 39. 但「可表示」也不等於「模型可生成」

即使：

$$
I^\star\in\Omega_\Sigma,
$$

某個生成模型：

$$
G_\theta
$$

仍可能無法到達它。

所以必須區分：

$$
\Omega_{\text{representable}}
$$

與：

$$
\Omega_{\text{reachable}}(G_\theta).
$$

本文只建立前者。

模型可達域留待 Paper 03。

---

# 40. Seed 不是全域圖像地址

生成系統常使用 seed。

但：

$$
seed
$$

通常只決定 PRNG / latent initialization。

輸出仍取決於：

$$
I
=
G_{\theta,\pi}(seed,c),
$$

其中：

- $\theta$：模型；
- $\pi$：Sampler / Scheduler / Workflow；
- $c$：Prompt / Reference / Adapter 等條件。

因此：

$$
\boxed{
Seed
\neq
\Psi(I)
}
$$

它不是全域 raster address。

---

# 41. 真正的絕對地址是 raster encoding

對固定：

$$
\Sigma,
$$

完整像素向量：

$$
\mathbf p
$$

本身就是直接座標。

或使用：

$$
\Psi(I)
$$

將其映射成唯一整數。

這比 seed 更接近：

> 「一張圖的絕對資料地址。」

---

# 42. 但是這種地址沒有語意壓縮

如果你知道：

$$
\Psi(I)=10^{10000}\dots,
$$

人仍然不知道圖裡是：

```text
一個人
一棵樹
黑白格
武俠場景
```

所以：

$$
\text{State Address}
\neq
\text{Semantic Address}.
$$

---

# 43. AI 真正提供的是結構化導航

AI 不需要知道：

$$
\Psi(I^\star)
$$

的完整整數值才能生成。

它學的是：

```text
哪些區域像人
哪些區域像樹
哪些 latent direction 對應風格
哪些條件能縮小候選集
```

即：

> 利用結構與分佈跳過幾乎全部無效狀態。

---

# 44. 暴力窮舉與智能生成的差別

暴力：

$$
Search(\Omega_\Sigma).
$$

AI：

$$
Search(
\mathcal M
\cap
\Omega_C
).
$$

其中：

- $\mathcal M$：模型學到的結構化視覺域；
- $\Omega_C$：條件約束子域。

---

# 45. 組合爆炸正是智能導航必要性的原因

如果完整空間只有幾百張圖，根本不需要 AI。

正因：

$$
|\Omega|
$$

極端巨大，才需要：

```text
先驗
表示學習
latent
constraint
search
sampling
optimization
```

---

# 46. 最小枚舉實驗梯

雖然 $100\times100$ 不可能實際完整枚舉，但可以建立逐級實驗。

---

## E0：1×1, 8-bit 灰階

$$
256^1=256.
$$

可以完整生成。

---

## E1：2×2, 2-bit 灰階

每 pixel：

$$
4
$$

級。

總數：

$$
4^4=256.
$$

仍可完整生成與展示。

---

## E2：3×3, 2-bit 灰階

$$
4^9
=
262144.
$$

仍可離線完整枚舉。

---

## E3：4×4, 1-bit

$$
2^{16}
=
65536.
$$

非常適合觀察「圖像語意」何時開始出現。

---

## E4：8×8, 1-bit

$$
2^{64}.
$$

已不適合暴力完整枚舉。

---

# 47. 實驗意義

這個實驗梯可以直接展示：

> 從「完全可枚舉」到「雖有限但不可暴力」的相變。

並研究：

```text
對稱圖案
文字
幾何
人臉-like pattern
connected shapes
```

在小型空間中的比例。

---

# 48. Gray Code 路徑

若使用 binary image：

$$
Q_1=\{0,1\},
$$

可以利用 Gray Code 建立：

> 每一張圖與下一張圖只改一個 bit。

因此在：

$$
2^N
$$

個狀態間建立 Hamiltonian path。

---

# 49. 這提供「全空間動畫」的極小版本

例如 $4\times4$ binary image：

$$
2^{16}=65536.
$$

可以真的生成一段序列：

```text
Image 0
→ Image 1
→ ...
→ Image 65535
```

且每幀只改一個 pixel。

這幾乎就是：

> **有限視覺宇宙的完整遍歷動畫。**

---

# 50. 多級灰階也可構造最小變化遍歷

對：

$$
Q_L^N,
$$

可以研究 generalized Gray code，使相鄰狀態只改一個 sample 一級或有限變化。

這將「枚舉」提升為：

> 圖像狀態空間路徑設計問題。

---

# 51. 圖像生成與計算幾何

至此，圖像問題已可以被重新表示為：

- 點；
- 子域；
- 距離；
- 鄰接；
- 路徑；
- 可達性；
- 搜尋；
- 採樣。

因此數位圖像生成天然具有一個：

$$
\boxed{
\text{Computational Geometry of Visual States}
}
$$

---

# 52. GVSS 假說的正式陳述

## GVSS-H1：有限表示假說

對任一固定有限數位 raster specification：

$$
\Sigma,
$$

其完整圖像狀態集合：

$$
\Omega_\Sigma
$$

為有限集合。

---

## GVSS-H2：唯一狀態地址假說

存在雙射：

$$
\Psi:
\Omega_\Sigma
\leftrightarrow
\{0,\dots,|\Omega_\Sigma|-1\}.
$$

---

## GVSS-H3：路徑存在假說

若允許逐 sample 單級修改，任意：

$$
I,J\in\Omega_\Sigma
$$

之間存在有限路徑。

---

## GVSS-H4：結構稀疏假說

人類可理解／自然／藝術圖像只佔：

$$
\Omega_\Sigma
$$

中的高度受限子域。

這一點是研究假說，不由 H1–H3 自動推出。

---

# 53. H1–H3 的地位

H1–H3 實際上不是需要 AI 實驗確認的經驗猜想，而是由有限離散表示直接得到的數學性質。

真正具有研究不確定性的是：

$$
H4
$$

以及後續：

```text
結構域如何表示？
模型可達域多大？
人類畫過的域多大？
意圖如何壓縮搜尋？
```

---

# 54. 與「圖像創造」概念的關係

本文不主張：

> 藝術創造只是查表。

因為創造過程仍包含：

```text
意圖
選擇
評估
組合
文化
語意
歷史
```

本文只主張：

> **最終 raster 結果在固定 digital representation 下必然是全狀態空間的一個元素。**

---

# 55. 形式空間先於生成歷史

如果：

$$
\Omega_\Sigma
$$

由格式規格決定，

那麼某張未來才被生成的圖：

$$
I_{future}
$$

在數學上早已是：

$$
I_{future}\in\Omega_\Sigma.
$$

只是：

> 尚未被實際求得／選取／生成。

---

# 56. 這不是宿命論

「狀態可表示」不代表：

```text
未來創作已被決定
```

因為：

- 哪個 state 被選到；
- 哪條 path 被走；
- 哪些 constraint 被施加；
- 哪個人認為它有意義；

仍然是開放過程。

---

# 57. 類比：字串空間

固定長度 $n$ 、字母表 $\Sigma_A$：

$$
|\Sigma_A|^n
$$

包含所有可能字串。

某篇尚未寫出的小說，其字元序列在形式上也是字串空間中的一點。

但這不意味著：

> 寫小說只是枚舉。

圖像同理。

---

# 58. 壓縮與語意的提示

完整 raster address 可能需要：

$$
bHWC
$$

bits。

但高度規則化圖像可以用很短的程序描述。

例如：

> 全黑 $100\times100$。

其程序描述遠短於：

$$
80000
$$

bits raw data。

---

# 59. 這暗示結構化子域具有可壓縮性

有意義圖像往往含：

```text
重複
對稱
物件
邊界
語法
風格
```

這些結構使它們可能具有較短描述。

因此未來可以研究：

$$
K(I)
$$

即 Kolmogorov-like description complexity 的近似。

本文不進一步展開。

---

# 60. AI 與壓縮導航

生成模型可以被理解成：

> 對大量結構化視覺狀態建立壓縮生成規則。

模型參數：

$$
\theta
$$

加條件：

$$
c
$$

加 latent：

$$
z
$$

可以產生：

$$
I.
$$

這比直接保存所有 $I$ 更高效。

---

# 61. 生成模型不是全空間查表

因此：

$$
G_\theta
$$

不需要記住：

$$
\Omega_\Sigma
$$

的所有元素。

它只需要學得：

> 某些高概率、高結構化區域的生成映射。

---

# 62. 從「全域空間」到「可導航空間」

這提供本系列下一篇的直接入口：

$$
\Omega_\Sigma
\supset
\mathcal M
\supset
\Omega_C.
$$

問題從：

> 所有圖在哪？

轉成：

> 如何從人類 Intent 建立 $\Omega_C$，並高效找到 $I^\star$？

---

# 63. 與 AI Art Direction 的連接

先前的多重約束域：

$$
\Omega^\star
=
\bigcap_i\Omega_i
$$

現在得到更底層的本體基座：

$$
\Omega_i
\subset
\Omega_\Sigma.
$$

因此：

$$
\boxed{
AI\ Art\ Direction
=
\text{Navigation Policy over constrained visual state space}
}
$$

---

# 64. 與 Generative Asset Registry 的連接

LoRA、Reference、ControlNet、Style Recipe 等不再只是「工具資產」。

它們可以被重新理解為：

> 改變搜索分佈、路徑或約束域形狀的導航資產。

---

# 65. LoRA 的空間詮釋

LoRA 改變：

$$
G_\theta
\rightarrow
G_{\theta+\Delta\theta}.
$$

因此它改變的不是：

$$
\Omega_\Sigma
$$

本身，

而是：

$$
\Omega_{\text{reachable}}(G_\theta)
$$

及其中的概率密度。

---

# 66. Reference 的空間詮釋

Reference 不改變所有可表示圖像，而是縮小條件分佈：

$$
p(I)
\rightarrow
p(I\mid R).
$$

---

# 67. Prompt 的空間詮釋

同理：

$$
p(I)
\rightarrow
p(I\mid p).
$$

Prompt 是導航條件，而不是 raster address。

---

# 68. 最小理論層級圖

```text
Digital Representation Specification Σ
                ↓
Global Visual State Space ΩΣ
                ↓
Structured / Meaningful Visual Domain M
                ↓
Model Reachable Domain ΩG
                ↓
Constraint Domain ΩC
                ↓
Selected / Generated Image I*
```

本篇正式建立前兩層。

---

# 69. 可證偽性與可驗證性

## H1

由計數可直接驗證。

## H2

可實作 encode/decode 驗證雙射。

## H3

可用 small-state graph 全遍歷驗證。

## H4

需要經驗研究。

---

# 70. 建議程式實驗

建立一個極小 GVSS Explorer：

```text
1x1 8-bit
2x2 2-bit
3x3 2-bit
4x4 binary
```

功能：

```text
enumerate
integer address
decode
distance
Gray-code traversal
frequency statistics
pattern viewer
```

---

# 71. 實驗一：完整 2×2 空間

 $2\times2$ 、2-bit：

$$
256
$$

張。

可以把 256 張全部排成：

$$
16\times16
$$

圖冊。

這是非常直觀的「完整視覺宇宙」。

---

# 72. 實驗二：完整 4×4 binary 空間

$$
65536
$$

張。

可以計算：

```text
黑像素數分布
connected components
symmetry
edge count
```

看結構圖像在完整空間裡如何分布。

---

# 73. 實驗三：人類分類

隨機抽：

```text
有結構
無結構
像字
像物件
有美感
```

建立：

$$
\mathcal M_{\text{human}}
$$

的微型經驗近似。

---

# 74. 實驗四：AI 分類

讓 AI 對同一批圖做分類。

比較：

$$
\mathcal M_{\text{AI}}
$$

與：

$$
\mathcal M_{\text{human}}.
$$

這可能成為後續有趣研究。

---

# 75. 「畫面空間」與「光譜空間」

本文使用灰階，是為了最小化維度。

若每 pixel 不只是灰階，而是多波段：

$$
p_i\in Q_b^S,
$$

 $S$ 為 spectral bands。

則：

$$
|\Omega|
=
2^{bSHW}.
$$

因此「光譜量化塗色方塊」是 GVSS 的自然擴張。

---

# 76. 色彩本質仍是 sample vector

RGB：

$$
p=(r,g,b).
$$

光譜：

$$
p=(s_1,\dots,s_k).
$$

所以整個理論不依賴 RGB。

---

# 77. 動畫與影片

若加入時間：

$$
T
$$

幀，

則：

$$
\Omega_{\text{video}}
=
Q_b^{HWC T}.
$$

基數：

$$
2^{bHWCT}.
$$

時間維度再次使狀態空間指數擴張。

---

# 78. 3D / 多模態視覺

若未來把：

```text
depth
normal
geometry
material
time
```

全部納入，

則研究對象從 image state space 擴展為：

$$
\Omega_{\text{visual-world}}.
$$

本篇不宣稱已完成這個擴張。

---

# 79. 研究邊界

本文不主張：

1. 所有有意義圖像都形成光滑流形；
2. 現有 AI 能到達所有可表示圖像；
3. 人類意圖可以唯一指定任意 raster state；
4. Seed 是全域圖像座標；
5. 暴力枚舉是實際生成方法；
6. 數位可表示性等同藝術創造性。

---

# 80. 本文真正主張

本文只建立一個非常基礎但重要的層：

> **固定有限 digital raster specification 下，所有可能圖像形成一個有限、高維、可一一編碼、具有可定義鄰接與路徑的離散狀態空間。**

---

# 81. 理論意義

這個看似「廢話」的結論提供了一個很有用的共同地基。

因為它允許我們把：

```text
畫
風格
生成
編輯
約束
AI
```

全部放回同一個 state-space 語言裡討論。

---

# 82. 後續論文接口

## Paper 02

**視覺生成作為約束域求解**

研究：

$$
Intent
\rightarrow
\Omega_C
\rightarrow
I^\star.
$$

---

## Paper 03

**生成可達域與未實現視覺**

研究：

$$
\Omega_{\text{human}}
\subseteq?
\Omega_{\text{model}}
\subseteq
\Omega_{\text{representable}}.
$$

---

## Paper 04

**Generative Asset Registry**

將：

```text
model
LoRA
adapter
reference
recipe
control
```

抽象為視覺空間導航資產。

---

# 83. 結論

如果一張 $100\times100$ 灰階圖使用 8-bit sample，那麼它就是：

$$
10000
$$

個取值範圍為：

$$
0\dots255
$$

的離散變量。

因此一張圖可以被寫成：

$$
I=(p_0,p_1,\dots,p_{9999}),
$$

並且完整可能圖像空間為：

$$
\boxed{
\Omega_{100}
=
\{0,\dots,255\}^{10000}
}
$$

其大小：

$$
\boxed{
|\Omega_{100}|
=
256^{10000}
=
2^{80000}
}
$$

整張同一灰階值的「純色方塊」只有：

$$
256
$$

種，這只是全空間中的一條極小鏈：

$$
U_{100}
\subsetneq
\Omega_{100}.
$$

更重要的是，固定 raster specification 後，每一張圖都可被唯一地址化：

$$
\boxed{
\Psi:
\Omega_\Sigma
\leftrightarrow
\{0,\dots,|\Omega_\Sigma|-1\}
}
$$

因此：

> **任何一張可以由該數位格式表示的具體畫面，在 raw raster 層面都只是一個有限高維狀態空間中的特定資料點。**

但完整空間極端巨大，暴力枚舉雖在形式上可能，在計算上迅速失去實際意義。

因此真正重要的問題自然變成：

> **哪些區域有結構？哪些區域有語意？哪些區域是人類藝術？AI 可以到達哪些區域？人類意圖如何被編譯成能把搜尋快速壓縮到目標區域的約束？**

這就是本系列下一篇——「視覺生成作為約束域求解」——真正要開始處理的問題。

---

# 參考文獻

1. W3C. **Portable Network Graphics (PNG) Specification (Third Edition).** W3C Recommendation. Grayscale PNG uses one sample per pixel; PNG supports finite sample bit depths including 8-bit grayscale.
2. Zhu, J.-Y., Krähenbühl, P., Shechtman, E., Efros, A. A. **Generative Visual Manipulation on the Natural Image Manifold.** ECCV 2016 / arXiv:1609.03552.
3. Menon, S., Damian, A., Hu, S., Ravi, N., Rudin, C. **PULSE: Self-Supervised Photo Upsampling via Latent Space Exploration of Generative Models.** CVPR 2020.
4. Gong, S., Boddeti, V. N., Jain, A. K. **On the Intrinsic Dimensionality of Image Representations.** CVPR 2019.

---

# 研究狀態

本文中的 H1–H3 可由離散組合結構直接建立。

以下仍屬待驗研究方向：

```text
結構化視覺子域的實際測度
自然圖像是否可被最佳描述為低維流形
人類與 AI 對「有意義狀態」的分類差異
生成模型在 GVSS 中的真正可達域
不同視覺算子所誘導的幾何與路徑
```

因此本文不是在聲稱「已解決所有圖像生成」。

它提供的是一個最底層的座標系：

$$
\boxed{
\text{先知道所有可能 raster states 構成什麼空間，
再研究智能如何在其中導航。}
}
$$
