全域視覺空間假說
從量化灰階方塊到高維圖像狀態空間
英文題名: The Global Visual State Space Hypothesis: From Quantized Grayscale Squares to High-Dimensional Image State Spaces
作者: Neo.K / EveMissLab
版本: v0.1-draft
日期: 2026-08-12
系列: Global Visual Space & Generative Navigation — Paper 01
文件性質: 理論論文/數位影像、計算表示與生成空間研究
關鍵詞: 全域視覺空間、圖像狀態空間、灰階量化、高維離散空間、像素、圖像枚舉、視覺流形、生成模型、約束域、計算幾何
摘要
本文提出「全域視覺空間假說」(Global Visual State Space Hypothesis, GVSS),從一個極小而可形式化的問題出發:若一張數位圖像的解析度、通道數與每通道量化位元數皆固定,則每一張可被該格式表示的圖像,都只是有限高維離散空間中的一個資料點。
設圖像寬高為 ,通道數為 ,每通道量化位元數為 ,則每個 sample 有:
個可能值,而整張圖的全狀態空間為:
其基數為:
以本文的最小思考實驗—— 、8-bit 灰階圖像——為例,若整張圖所有像素保持同一灰階值,則只有 張「純色灰階方塊」;但若每個像素都可以獨立取 256 個灰階值,則圖像總數為:
亦即每一個可能圖像若按十進位整數編號,需要約 24,083 位十進位數才能覆蓋完整索引範圍。
本文進一步證明:一旦固定像素掃描順序與通道順序,每一張離散圖像都可以與一個整數地址一一對應;因此「某一幅具體畫面」在計算表示層面並非不可定位之物,而是高維離散狀態空間中的精確元素。圖像修改則可被描述為此狀態空間中的路徑;生成可以被描述為對某一點、某一子域或某一概率分佈的搜尋與取樣。
然而,完整可表示圖像空間與「人類可理解、自然、藝術或具有專案風格」的圖像集合並不相同。後者可能只佔據前者極小且高度結構化的子域。這與電腦視覺中長期使用的自然圖像流形觀點相容:生成與編輯並非均勻探索所有像素組合,而是在高維 ambient image space 中尋找高度受限的有效區域。
本文因此建立四個層次:可表示空間、結構化視覺子域、生成可達域、特定約束解。本篇只形式化前兩者,將「AI 如何導航」、「模型可達域是否超過人類既有圖像集合」分別留給本系列後續論文。
本文的核心結論可以濃縮為:
以及:
1. 引言
1.1 從一個「很廢話」的方塊開始
假設要求一台計算機產生一個 的灰階正方形。
第一個版本非常簡單:
第一張:全黑
第二張:比全黑亮一級
第三張:再亮一級
……
最後一張:全白
若每一個像素使用 8-bit 灰階,則一個 sample 可取:
如果整張圖所有像素都必須相同,只有:
種圖像。
這個例子幾乎沒有任何藝術性可言,卻提供了一個極乾淨的理論起點:
一張數位圖像只要被完全量化,它就是有限資料。
1.2 第二步:解除「所有像素相同」限制
現在允許 個像素各自獨立取灰階值:
這時每一個像素都提供 256 種分支。
因此:
從「只有 256 張灰色方塊」到「 張可能圖像」,唯一改變的是:
各像素由共享一個變量,改為擁有獨立自由度。
這一步立即產生組合爆炸。
2. 數位圖像的最小形式化
2.1 像素域
定義像素座標集合:
2.2 量化值域
對 -bit sample:
其大小:
對 8-bit:
2.3 灰階圖像
灰階圖像可定義為函數:
因此所有可能灰階圖像的集合為:
2.4 多通道圖像
若通道數為 :
因此:
3. 命題一:固定格式下的圖像空間是有限的
命題 3.1
對固定的有限:
數位 raster 圖像狀態空間:
為有限集合,且:
證明
每個 sample 有:
種取值。
總 sample 數為:
各 sample 可獨立選值,因此由乘法原理:
證畢。
4. 灰階最小模型
令:
則:
全狀態空間:
基數:
近似:
因此完整索引範圍具有約:
位十進位數。
5. 「純白到純黑」其實有兩種問題
這是本論文必須特別澄清的地方。
5.1 全圖單值灰階鏈
若所有像素共享同一灰階變量:
其中:
則集合:
因此:
這就是:
全黑
→ 深灰
→ 中灰
→ 淺灰
→ 全白
的完整 8-bit 純色漸變鏈。
5.2 每像素獨立灰階空間
如果:
可各自獨立取值,則:
所以:
純白到純黑的全圖漸變,只是巨大圖像空間中的一條極小一維鏈。
6. 命題二:每張圖可以有精確整數地址
如果圖像只是有限離散資料,那麼可以建立一個一一對應地址。
6.1 向量化
固定掃描順序,例如:
row-major
將圖像攤平成:
其中:
6.2 基數編碼
令:
定義:
則:
命題 6.1
映射:
為雙射。
證明概要
每個整數:
皆具有唯一的 進位表示:
其中:
這些 digit 唯一對應各像素 sample,因此每一個整數只對應一張圖,每一張圖也只對應一個整數。
證畢。
7. 圖像因此可以被「編號」
在固定:
解析度
通道順序
bit depth
pixel order
後,理論上可以寫:
Image #0
Image #1
Image #2
...
Image #(L^N - 1)
因此「一個特定畫面」可以具有精確離散地址。
這裡的地址不是藝術語意座標,而是:
raw raster state address。
8. 地址不等於有意義的座標系
雖然:
提供一對一索引,但相鄰整數不一定代表視覺上相似的圖。
例如進位造成:
...255
→
...000 with carry
可能改變多個 digit。
因此還需要定義「圖像空間幾何」。
9. 圖像空間的距離
可定義多種距離。
9.1
9.2
9.3
10. 像素狀態圖
也可以直接建立圖:
其中:
定義兩張圖相鄰,若它們只差一個 sample 的一個量化級:
11. 命題三:量化圖像狀態圖連通
命題 11.1
在上述鄰接定義下:
是連通圖。
證明
任意兩張圖:
的每個 sample 均為有限整數。
可依序選取每一個 sample,將:
以:
逐級調整至:
每一步皆是合法鄰接邊。
有限個 sample、有限差值之後必到達 。
故任意兩頂點間皆存在有限路徑。
證畢。
12. 「一張畫變成另一張畫」就是路徑
這提供一個非常直接的計算幾何詮釋。
若:
是純黑圖,
是任意目標圖,
則存在:
每一步只需要改一個量化單位。
因此:
至少在離散 raster 表示層上成立。
13. 最短像素路徑
在 鄰接圖上,從 到 的最短步數正好是:
因為每一步最多將總 差距降低 1。
所以:
這使數位圖像空間具有非常直接的組合幾何。
14. 純黑到純白需要多少步?
對 、8-bit 灰階:
全黑:
全白:
因此:
所以若每一步只允許一個 pixel 改一級,最短路徑需要:
步。
15. 但全圖同步灰階路徑只需 255 步
若允許一次把所有像素:
則:
black
→
gray 1
→
...
→
white
只需:
次狀態轉移。
這說明:
路徑長度依賴允許的「算子」。
因此算子集合:
本身會決定視覺空間的有效幾何。
16. 算子誘導幾何
若允許的操作集合為:
則可建立新的鄰接關係:
若存在:
此時圖像空間幾何不只是像素距離,而是:
由可用生成/編輯算子決定的可達幾何。
這一點將在後續「生成導航」論文中展開。
17. 暴力窮舉作為概念實驗
理論上,由於:
完整枚舉存在。
最簡單方式:
for n in 0 .. L^N-1:
I = decode_base_L(n)
inspect(I)
因此:
18. 但「可枚舉」不等於「可實行」
對 8-bit 灰階:
個狀態。
即使只保存 raw pixel samples,每張圖至少需要:
bytes。
所以全部 raw 資料量約:
bytes。
這不是一個需要更快 GPU 就可以暴力解決的普通規模問題。
19. 組合爆炸
固定:
時:
因此其對像素數:
呈:
也就是指數成長。
解析度只線性增加,狀態數卻指數爆炸。
20. RGB 空間更巨大
若 、8-bit RGB:
因此:
單純從灰階增加到 RGB,就把 exponent 從:
提高到:
21. 更高 bit depth
若 16-bit 灰階:
所以「更多漸層」在數學上不是增加一些顏色而已,而是直接增加每個 sample 的狀態基數。
22. 多通道不是只有 RGB
如果圖像 representation 還含:
alpha
depth
normal
material
spectral bands
motion
semantic channels
則可把通道數擴充為:
完整狀態空間繼續指數增大。
23. 固定數位表示與數學連續空間必須區分
本文的「有限」結論建立在:
固定 H
固定 W
固定 C
固定 finite bit depth
之上。
若改成理想化實數色彩:
則即使固定解析度,狀態空間也為不可數無限。
24. 實際計算機仍是有限表示
有限記憶體中的實際 digital sample 使用有限 bit pattern。
因此對具體:
file format
framebuffer
tensor dtype
其實際可表示狀態依然有限。
這是本文討論的「計算機視覺狀態空間」。
25. 若解析度不設上限
若允許任意有限:
但每張圖仍只能有有限解析度與有限 bit depth,則所有有限圖像集合可以寫為:
每個子集合有限,且索引集合可數,因此:
為可數無限集合。
26. 「全域」的精確含義
因此本文所說:
全域視覺空間
不是宣稱存在一個固定有限集合包含所有可能物理視覺經驗。
而是:
相對於一組明確數位表示規格 ,存在完整的所有可表示 raster states 集合。
定義:
則:
稱為此規格下的全域數位視覺狀態空間。
27. Raw State 與檔案格式不同
兩個不同 PNG 檔案可能:
metadata 不同
compression 不同
chunk order 不同
但 decode 後像素相同。
本文中的:
指的是解碼後 raster state,不是檔案 byte sequence。
28. 同一畫面可以有不同編碼
因此:
仍可能:
本文研究的是:
而不是檔案容器身份。
29. 圖像空間不等於自然圖像空間
完整:
中的絕大多數點,直觀上可能只是高熵雜訊。
自然圖像與藝術圖像不是均勻填滿:
30. 結構化視覺子域
定義:
為對某一觀察者/辨識系統而言具有結構或語意的圖像集合。
再定義:
31. 「流形」是一種模型,不是本文預先證明的事實
電腦視覺中常使用 natural image manifold 的語言,假設真實/自然圖像集中於高維像素空間中的低維結構。
本文接受它作為有用的建模方向,但不把:
必然是光滑微分流形作為本文前提。
更保守的名稱是:
結構化視覺子域。
32. 自然圖像流形與本假說的關係
Zhu 等人的 Generative Visual Manipulation on the Natural Image Manifold,直接把真實圖像編輯描述為:在高維圖像空間中學得自然圖像 manifold,並將操作限制在其上,以避免生成不自然圖像。
這與本文的層次非常一致:
33. PULSE 的直接類比
PULSE 的超解析策略並不是逐像素猜高頻,而是在生成模型的高解析 natural image manifold 中搜尋,使其 downscale 後與低解析輸入相符的高解析候選。
形式上可以理解為:
且:
這已經非常接近:
「在視覺子域中做受約束搜尋。」
34. 因此 AI 生成可以被重新理解
不是:
而是:
換句話說:
AI 最終仍必須輸出某一個合法 raster state。
35. 每個最終畫面都是一組數據
不論圖像來源是:
人畫
攝影
3D 渲染
程序生成
擴散模型
GAN
遊戲引擎
當它落地成固定格式 raster image 時,都可以表示成:
其在 raw raster 層面沒有本體論差別。
36. 「AI 畫」與「人類畫」的差別存在於生成歷史,不在最終 raster datatype
若:
逐 sample 完全相同,
則從 raster state 本身:
差異存在於:
provenance
intent
process
authorship
training
tool use
而不在像素矩陣自身。
37. 這導出一個重要分離
同一 state 可以有不同來源。
這對未來 AI 生成內容研究非常重要。
38. 「人類沒畫過」不等於「空間中不存在」
若某張圖:
但歷史上從未被人類實現,
它仍是該數位表示空間中的合法狀態。
因此:
39. 但「可表示」也不等於「模型可生成」
即使:
某個生成模型:
仍可能無法到達它。
所以必須區分:
與:
本文只建立前者。
模型可達域留待 Paper 03。
40. Seed 不是全域圖像地址
生成系統常使用 seed。
但:
通常只決定 PRNG / latent initialization。
輸出仍取決於:
其中:
- :模型;
- :Sampler / Scheduler / Workflow;
- :Prompt / Reference / Adapter 等條件。
因此:
它不是全域 raster address。
41. 真正的絕對地址是 raster encoding
對固定:
完整像素向量:
本身就是直接座標。
或使用:
將其映射成唯一整數。
這比 seed 更接近:
「一張圖的絕對資料地址。」
42. 但是這種地址沒有語意壓縮
如果你知道:
人仍然不知道圖裡是:
一個人
一棵樹
黑白格
武俠場景
所以:
43. AI 真正提供的是結構化導航
AI 不需要知道:
的完整整數值才能生成。
它學的是:
哪些區域像人
哪些區域像樹
哪些 latent direction 對應風格
哪些條件能縮小候選集
即:
利用結構與分佈跳過幾乎全部無效狀態。
44. 暴力窮舉與智能生成的差別
暴力:
AI:
其中:
- :模型學到的結構化視覺域;
- :條件約束子域。
45. 組合爆炸正是智能導航必要性的原因
如果完整空間只有幾百張圖,根本不需要 AI。
正因:
極端巨大,才需要:
先驗
表示學習
latent
constraint
search
sampling
optimization
46. 最小枚舉實驗梯
雖然 不可能實際完整枚舉,但可以建立逐級實驗。
E0:1×1, 8-bit 灰階
可以完整生成。
E1:2×2, 2-bit 灰階
每 pixel:
級。
總數:
仍可完整生成與展示。
E2:3×3, 2-bit 灰階
仍可離線完整枚舉。
E3:4×4, 1-bit
非常適合觀察「圖像語意」何時開始出現。
E4:8×8, 1-bit
已不適合暴力完整枚舉。
47. 實驗意義
這個實驗梯可以直接展示:
從「完全可枚舉」到「雖有限但不可暴力」的相變。
並研究:
對稱圖案
文字
幾何
人臉-like pattern
connected shapes
在小型空間中的比例。
48. Gray Code 路徑
若使用 binary image:
可以利用 Gray Code 建立:
每一張圖與下一張圖只改一個 bit。
因此在:
個狀態間建立 Hamiltonian path。
49. 這提供「全空間動畫」的極小版本
例如 binary image:
可以真的生成一段序列:
Image 0
→ Image 1
→ ...
→ Image 65535
且每幀只改一個 pixel。
這幾乎就是:
有限視覺宇宙的完整遍歷動畫。
50. 多級灰階也可構造最小變化遍歷
對:
可以研究 generalized Gray code,使相鄰狀態只改一個 sample 一級或有限變化。
這將「枚舉」提升為:
圖像狀態空間路徑設計問題。
51. 圖像生成與計算幾何
至此,圖像問題已可以被重新表示為:
- 點;
- 子域;
- 距離;
- 鄰接;
- 路徑;
- 可達性;
- 搜尋;
- 採樣。
因此數位圖像生成天然具有一個:
52. GVSS 假說的正式陳述
GVSS-H1:有限表示假說
對任一固定有限數位 raster specification:
其完整圖像狀態集合:
為有限集合。
GVSS-H2:唯一狀態地址假說
存在雙射:
GVSS-H3:路徑存在假說
若允許逐 sample 單級修改,任意:
之間存在有限路徑。
GVSS-H4:結構稀疏假說
人類可理解/自然/藝術圖像只佔:
中的高度受限子域。
這一點是研究假說,不由 H1–H3 自動推出。
53. H1–H3 的地位
H1–H3 實際上不是需要 AI 實驗確認的經驗猜想,而是由有限離散表示直接得到的數學性質。
真正具有研究不確定性的是:
以及後續:
結構域如何表示?
模型可達域多大?
人類畫過的域多大?
意圖如何壓縮搜尋?
54. 與「圖像創造」概念的關係
本文不主張:
藝術創造只是查表。
因為創造過程仍包含:
意圖
選擇
評估
組合
文化
語意
歷史
本文只主張:
最終 raster 結果在固定 digital representation 下必然是全狀態空間的一個元素。
55. 形式空間先於生成歷史
如果:
由格式規格決定,
那麼某張未來才被生成的圖:
在數學上早已是:
只是:
尚未被實際求得/選取/生成。
56. 這不是宿命論
「狀態可表示」不代表:
未來創作已被決定
因為:
- 哪個 state 被選到;
- 哪條 path 被走;
- 哪些 constraint 被施加;
- 哪個人認為它有意義;
仍然是開放過程。
57. 類比:字串空間
固定長度 、字母表 :
包含所有可能字串。
某篇尚未寫出的小說,其字元序列在形式上也是字串空間中的一點。
但這不意味著:
寫小說只是枚舉。
圖像同理。
58. 壓縮與語意的提示
完整 raster address 可能需要:
bits。
但高度規則化圖像可以用很短的程序描述。
例如:
全黑 。
其程序描述遠短於:
bits raw data。
59. 這暗示結構化子域具有可壓縮性
有意義圖像往往含:
重複
對稱
物件
邊界
語法
風格
這些結構使它們可能具有較短描述。
因此未來可以研究:
即 Kolmogorov-like description complexity 的近似。
本文不進一步展開。
60. AI 與壓縮導航
生成模型可以被理解成:
對大量結構化視覺狀態建立壓縮生成規則。
模型參數:
加條件:
加 latent:
可以產生:
這比直接保存所有 更高效。
61. 生成模型不是全空間查表
因此:
不需要記住:
的所有元素。
它只需要學得:
某些高概率、高結構化區域的生成映射。
62. 從「全域空間」到「可導航空間」
這提供本系列下一篇的直接入口:
問題從:
所有圖在哪?
轉成:
如何從人類 Intent 建立 ,並高效找到 ?
63. 與 AI Art Direction 的連接
先前的多重約束域:
現在得到更底層的本體基座:
因此:
64. 與 Generative Asset Registry 的連接
LoRA、Reference、ControlNet、Style Recipe 等不再只是「工具資產」。
它們可以被重新理解為:
改變搜索分佈、路徑或約束域形狀的導航資產。
65. LoRA 的空間詮釋
LoRA 改變:
因此它改變的不是:
本身,
而是:
及其中的概率密度。
66. Reference 的空間詮釋
Reference 不改變所有可表示圖像,而是縮小條件分佈:
67. Prompt 的空間詮釋
同理:
Prompt 是導航條件,而不是 raster address。
68. 最小理論層級圖
Digital Representation Specification Σ
↓
Global Visual State Space ΩΣ
↓
Structured / Meaningful Visual Domain M
↓
Model Reachable Domain ΩG
↓
Constraint Domain ΩC
↓
Selected / Generated Image I*
本篇正式建立前兩層。
69. 可證偽性與可驗證性
H1
由計數可直接驗證。
H2
可實作 encode/decode 驗證雙射。
H3
可用 small-state graph 全遍歷驗證。
H4
需要經驗研究。
70. 建議程式實驗
建立一個極小 GVSS Explorer:
1x1 8-bit
2x2 2-bit
3x3 2-bit
4x4 binary
功能:
enumerate
integer address
decode
distance
Gray-code traversal
frequency statistics
pattern viewer
71. 實驗一:完整 2×2 空間
、2-bit:
張。
可以把 256 張全部排成:
圖冊。
這是非常直觀的「完整視覺宇宙」。
72. 實驗二:完整 4×4 binary 空間
張。
可以計算:
黑像素數分布
connected components
symmetry
edge count
看結構圖像在完整空間裡如何分布。
73. 實驗三:人類分類
隨機抽:
有結構
無結構
像字
像物件
有美感
建立:
的微型經驗近似。
74. 實驗四:AI 分類
讓 AI 對同一批圖做分類。
比較:
與:
這可能成為後續有趣研究。
75. 「畫面空間」與「光譜空間」
本文使用灰階,是為了最小化維度。
若每 pixel 不只是灰階,而是多波段:
為 spectral bands。
則:
因此「光譜量化塗色方塊」是 GVSS 的自然擴張。
76. 色彩本質仍是 sample vector
RGB:
光譜:
所以整個理論不依賴 RGB。
77. 動畫與影片
若加入時間:
幀,
則:
基數:
時間維度再次使狀態空間指數擴張。
78. 3D / 多模態視覺
若未來把:
depth
normal
geometry
material
time
全部納入,
則研究對象從 image state space 擴展為:
本篇不宣稱已完成這個擴張。
79. 研究邊界
本文不主張:
- 所有有意義圖像都形成光滑流形;
- 現有 AI 能到達所有可表示圖像;
- 人類意圖可以唯一指定任意 raster state;
- Seed 是全域圖像座標;
- 暴力枚舉是實際生成方法;
- 數位可表示性等同藝術創造性。
80. 本文真正主張
本文只建立一個非常基礎但重要的層:
固定有限 digital raster specification 下,所有可能圖像形成一個有限、高維、可一一編碼、具有可定義鄰接與路徑的離散狀態空間。
81. 理論意義
這個看似「廢話」的結論提供了一個很有用的共同地基。
因為它允許我們把:
畫
風格
生成
編輯
約束
AI
全部放回同一個 state-space 語言裡討論。
82. 後續論文接口
Paper 02
視覺生成作為約束域求解
研究:
Paper 03
生成可達域與未實現視覺
研究:
Paper 04
Generative Asset Registry
將:
model
LoRA
adapter
reference
recipe
control
抽象為視覺空間導航資產。
83. 結論
如果一張 灰階圖使用 8-bit sample,那麼它就是:
個取值範圍為:
的離散變量。
因此一張圖可以被寫成:
並且完整可能圖像空間為:
其大小:
整張同一灰階值的「純色方塊」只有:
種,這只是全空間中的一條極小鏈:
更重要的是,固定 raster specification 後,每一張圖都可被唯一地址化:
因此:
任何一張可以由該數位格式表示的具體畫面,在 raw raster 層面都只是一個有限高維狀態空間中的特定資料點。
但完整空間極端巨大,暴力枚舉雖在形式上可能,在計算上迅速失去實際意義。
因此真正重要的問題自然變成:
哪些區域有結構?哪些區域有語意?哪些區域是人類藝術?AI 可以到達哪些區域?人類意圖如何被編譯成能把搜尋快速壓縮到目標區域的約束?
這就是本系列下一篇——「視覺生成作為約束域求解」——真正要開始處理的問題。
參考文獻
- W3C. Portable Network Graphics (PNG) Specification (Third Edition). W3C Recommendation. Grayscale PNG uses one sample per pixel; PNG supports finite sample bit depths including 8-bit grayscale.
- Zhu, J.-Y., Krähenbühl, P., Shechtman, E., Efros, A. A. Generative Visual Manipulation on the Natural Image Manifold. ECCV 2016 / arXiv:1609.03552.
- Menon, S., Damian, A., Hu, S., Ravi, N., Rudin, C. PULSE: Self-Supervised Photo Upsampling via Latent Space Exploration of Generative Models. CVPR 2020.
- Gong, S., Boddeti, V. N., Jain, A. K. On the Intrinsic Dimensionality of Image Representations. CVPR 2019.
研究狀態
本文中的 H1–H3 可由離散組合結構直接建立。
以下仍屬待驗研究方向:
結構化視覺子域的實際測度
自然圖像是否可被最佳描述為低維流形
人類與 AI 對「有意義狀態」的分類差異
生成模型在 GVSS 中的真正可達域
不同視覺算子所誘導的幾何與路徑
因此本文不是在聲稱「已解決所有圖像生成」。
它提供的是一個最底層的座標系: