載體幾何 2.0(A02)
平面為何能產生立體感?
透視、錯視與 2 D → 2.5 D 2D\rightarrow2.5D 2 D → 2.5 D 感知升維的形式化
作者:Neo.K 機構:EveMissLab/一言諾科技有限公司 系列:載體幾何 2.0:從 2.5D 視覺到高維符號實在 版本:v0.1 日期:2026-08-23 理論定位:視覺科學 × 認知幾何 × 藝術技法形式化 × 載體本體論
摘要
如果人類視覺原生地直接取得完整三維體積世界,那麼一個物理上近似二維的平面載體——紙張、牆面、畫布、照片或一般顯示器——理應很難產生穩定而強烈的立體感。然而,人類只需線性透視、遮擋、明暗、紋理梯度、相對大小、輪廓、陰影與其他圖像線索,便能在平面上形成具有顯著深度、表面起伏、前後層次甚至空間延伸感的知覺結果。某些變形透視與街頭錯視作品更能在特定觀察點產生強烈的「空間穿透」或「物體凸出」感。
本文提出:這一現象不宜只被描述為「二維圖片假裝成三維」,而應被重新形式化為一種感知升維(perceptual dimensional lifting) 。物理載體保持二維,但其上被編碼的深度線索場,經由觀察者的視覺重建系統後,可生成觀察者中心的準 2.5 D 2.5D 2.5 D 表面表示,並進一步與記憶、先驗和空間模型整合成 3 D 3D 3 D -like 世界經驗。
本文建立四層模型:
2D carrier → cue field → G 2.5 D → W ^ 3 D . \text{2D carrier}
\rightarrow
\text{cue field}
\rightarrow
\mathcal{G}_{2.5D}
\rightarrow
\widehat{W}_{3D}. 2D carrier → cue field → G 2.5 D → W 3 D .
在此框架中,透視法不再只是「把三維投影到二維」的投影幾何;從知覺端反看,它同時是一種針對人類視覺載體設計的逆向感知工程 :在二維表面上安排足以觸發特定深度解讀的線索,使觀察者的視覺系統自行完成準三維重建。
本文並提出「線索一致性假說」:立體感強度不必與物理厚度單調對應,而可能在一定條件下更依賴深度線索的一致性、可讀性、權重分布與觀察條件。由此可解釋為何某些經過高度設計的平面圖像,在主觀上可能呈現比某些雜亂、低對比或深度線索衝突的真實場景更強的立體效果。此命題目前應視為可測試的認知假說,而非既成定理。
本篇將傳統繪畫與錯視技法重新寫入載體幾何框架,並為後續從 2.5 D 2.5D 2.5 D 向 4 D 4D 4 D 動態切片、投影與高維想像的研究建立感知基礎。
關鍵詞: 透視、2.5D、立體感、感知升維、pictorial space、shape from shading、anamorphosis、載體幾何、深度線索、視覺錯視
1. 問題:為什麼一張平面會「看起來有深度」?
最簡單的事實是:
A ⊂ R 2 A
\subset
\mathbb{R}^2 A ⊂ R 2
的一張平面圖片,可以被人類報告為:
有前景與背景;
有遠近;
有凸起與凹陷;
有空間延伸;
有物體位於另一物體後方;
有一個表面向遠處傾斜;
甚至像是某物穿出紙面或地面。
因此必須區分:
physical support dimension \text{physical support dimension} physical support dimension
與
perceived spatial dimensionality . \text{perceived spatial dimensionality}. perceived spatial dimensionality .
一張畫的物理表面可以近似二維,但其知覺結果未必只有平面性。
若以 A A A 表示畫面載體,以 Ψ H \Psi_H Ψ H 表示人類視覺重建算子,則:
A ⊂ R 2 A
\subset
\mathbb{R}^2 A ⊂ R 2
並不推出:
Ψ H ( A ) ⊂ R 2 . \Psi_H(A)
\subset
\mathbb{R}^2. Ψ H ( A ) ⊂ R 2 .
更合理的是:
Ψ H ( A ) = V 2.5 D \Psi_H(A)
=
V_{2.5D} Ψ H ( A ) = V 2.5 D
在某些條件下成立。
這就是本文所謂的感知升維問題。
2. 四層模型:載體、線索、準三維表示、世界感
本文將平面立體感拆成四層。
2.1 第一層:物理載體
令:
A = ( D , I ) , A
=
(D,I), A = ( D , I ) ,
其中:
D ⊆ R 2 D\subseteq\mathbb{R}^2 D ⊆ R 2 為平面域;
I : D → C I:D\rightarrow\mathcal{C} I : D → C 為圖像值,例如亮度、顏色、紋理或其他可視屬性。
此層沒有必要假定任何真正的物理凸起。
2.2 第二層:深度線索場
視覺系統不是直接從「圖片」得到深度,而是從圖像結構中抽取多種線索。
定義:
C ( A ) = { c p e r s p , c o c c , c s h a d e , c s h a d o w , c t e x t u r e , c s i z e , c c o n t o u r , c b l u r , … } . \mathcal{C}(A)
=
\left\{
c_{\mathrm{persp}},
c_{\mathrm{occ}},
c_{\mathrm{shade}},
c_{\mathrm{shadow}},
c_{\mathrm{texture}},
c_{\mathrm{size}},
c_{\mathrm{contour}},
c_{\mathrm{blur}},
\ldots
\right\}. C ( A ) = { c persp , c occ , c shade , c shadow , c texture , c size , c contour , c blur , … } .
這裡 C ( A ) \mathcal{C}(A) C ( A ) 不是一個簡單向量,而是一組具有空間位置、尺度與可靠度的線索場。
2.3 第三層:準 2.5 D 2.5D 2.5 D 表示
視覺系統利用線索場建立:
V 2.5 D = Ψ H ( C ( A ) , q , M , P ) , V_{2.5D}
=
\Psi_H
\left(
\mathcal{C}(A),
q,
M,
P
\right), V 2.5 D = Ψ H ( C ( A ) , q , M , P ) ,
其中:
q q q :觀察位置、頭眼姿態、觀看距離;
M M M :既有記憶;
P P P :物體、光照、重力與場景先驗。
2.4 第四層: 3 D 3D 3 D -like 世界經驗
準三維表示再被整合成更完整的空間經驗:
W ^ 3 D = I ( V 2.5 D , M , A b o d y , T ) . \widehat{W}_{3D}
=
\mathcal{I}
\left(
V_{2.5D},
M,
A_{\mathrm{body}},
T
\right). W 3 D = I ( V 2.5 D , M , A body , T ) .
因此最小鏈條為:
2 D → depth-cue field → 2.5 D → 3 D -like experience \boxed{
2D
\rightarrow
\text{depth-cue field}
\rightarrow
2.5D
\rightarrow
3D\text{-like experience}
} 2 D → depth-cue field → 2.5 D → 3 D -like experience
物理升維沒有發生;發生的是表示升維。
3. 「感知升維」的正式定義
本文定義:
定義 A02-1:感知升維
若物理載體 A A A 的幾何維度為 d c d_c d c ,而某觀察者經由感知算子 Ψ L \Psi_L Ψ L 對其建立的有效空間表示具有額外的深度自由度或表面幾何屬性,使:
DimEff ( Ψ L ( A ) ) > d c , \operatorname{DimEff}
\left(
\Psi_L(A)
\right)
>
d_c, DimEff ( Ψ L ( A ) ) > d c ,
則稱此過程為感知升維。
對典型平面視覺而言:
d c = 2 , d_c=2, d c = 2 ,
而:
Ψ H ( A ) ≈ G 2.5 D . \Psi_H(A)
\approx
\mathcal{G}_{2.5D}. Ψ H ( A ) ≈ G 2.5 D .
因此:
Λ H : A 2 D → G 2.5 D H \boxed{
\Lambda_H:
\mathcal{A}_{2D}
\rightarrow
\mathcal{G}^{H}_{2.5D}
} Λ H : A 2 D → G 2.5 D H
可視為人類平面感知升維算子。
此處的「升維」不是物理空間維度變化,而是:
representation-space enrichment . \text{representation-space enrichment}. representation-space enrichment .
4. 線性透視:不只是 3 D → 2 D 3D\rightarrow2D 3 D → 2 D
傳統幾何常將透視寫成投影:
Π q : R 3 → R 2 . \Pi_q:
\mathbb{R}^3
\rightarrow
\mathbb{R}^2. Π q : R 3 → R 2 .
對三維點:
( X , Y , Z ) (X,Y,Z) ( X , Y , Z )
在理想 pinhole 模型中,可以得到類似:
x = f X Z , y = f Y Z . x=f\frac{X}{Z},
\qquad
y=f\frac{Y}{Z}. x = f Z X , y = f Z Y .
這個方向是:
3 D → 2 D . 3D
\rightarrow
2D. 3 D → 2 D .
但對觀看者而言,知覺問題恰恰反過來:
2 D → ? → 3 D -like . 2D
\rightarrow
?
\rightarrow
3D\text{-like}. 2 D → ? → 3 D -like .
因此藝術家真正操作的不只是投影,而是在求一個畫面 A A A ,使:
Ψ H ( A ; q ) \Psi_H(A;q) Ψ H ( A ; q )
產生期望的空間解讀。
若目標知覺為 T T T ,則可寫:
A ⋆ = arg max A Γ ( Ψ H ( A ; q ) , T ) , A^\star
=
\arg\max_A
\Gamma
\left(
\Psi_H(A;q),
T
\right), A ⋆ = arg A max Γ ( Ψ H ( A ; q ) , T ) ,
其中 Γ \Gamma Γ 為知覺匹配函數。
所以從感知端看,透視法可重新定義為:
observer-conditioned inverse perceptual design . \boxed{
\text{observer-conditioned inverse perceptual design}.
} observer-conditioned inverse perceptual design .
也就是「觀察者條件化的逆向感知設計」。
5. 遮擋:最廉價但極強的深度排序器
若圖形 a a a 的邊界終止於圖形 b b b ,而 b b b 的輪廓在交界處保持連續,視覺系統通常傾向形成:
b ≺ f r o n t a . b
\prec_{\mathrm{front}}
a. b ≺ front a .
亦即 b b b 在前、 a a a 在後。
這種遮擋線索甚至不要求完整度量深度,只需建立部分序:
O : E → { front , behind } . O:
\mathcal{E}
\rightarrow
\{\text{front},\text{behind}\}. O : E → { front , behind } .
因此它提供的不是完整 z z z 座標,而是:
z i < z j z_i<z_j z i < z j
形式的相對關係。
這非常符合準 2.5 D 2.5D 2.5 D 載體模型:
人類不必先重建完整三維體素場,便能藉由局部遮擋建立足以行動的深度排序。
所以:
ordinal depth < metric 3D reconstruction \boxed{
\text{ordinal depth}
<
\text{metric 3D reconstruction}
} ordinal depth < metric 3D reconstruction
在計算成本上可能更低,卻已足以產生強烈的立體結構。
6. 明暗與 Shape-from-Shading:亮度並不是深度,卻可以生成深度
一個表面的亮度變化可能來自:
形狀;
光源方向;
材質;
反射;
色素;
陰影;
多重光源。
因此由亮度反推出形狀本質上是欠定問題。
簡化表示:
I = F ( S , L , M , V ) , I
=
F
\left(
S,L,M,V
\right), I = F ( S , L , M , V ) ,
其中:
S S S :surface shape;
L L L :lighting;
M M M :material;
V V V :viewpoint。
反問題:
I → S I
\rightarrow
S I → S
一般不唯一。
但人類仍能非常有效地從 shading 推斷表面曲率與方向。經典心理物理研究顯示,單靠明暗便可產生強烈三維形狀知覺;近期 2026 年的視覺科學綜述又提出,shading、texture、highlights 等不同線索,可能在早期共享某種由二維局部方向場導出的「共同貨幣」,再對三維表面性質進行估計。
因此:
local 2D statistics → organized orientation field → 3D surface estimate \boxed{
\text{local 2D statistics}
\rightarrow
\text{organized orientation field}
\rightarrow
\text{3D surface estimate}
} local 2D statistics → organized orientation field → 3D surface estimate
是一條非常重要的現代研究方向。
這和本文的感知升維框架高度相容。
7. 陰影:視覺系統甚至容忍「物理不完全正確」的線索
陰影提供:
物體與地面的分離;
物體高度;
光源方向;
表面曲率;
接觸關係;
前後位置。
但經典研究發現,人類視覺對某些 physically impossible shadow patterns 仍可產生深度解讀,只要邊界與亮暗關係滿足若干簡化條件。
因此必須區分:
physical correctness \text{physical correctness} physical correctness
與
perceptual acceptability . \text{perceptual acceptability}. perceptual acceptability .
這對本文非常重要。
如果視覺只是在「真實三維世界」上做精確逆運算,那麼不物理的陰影應很容易全面失效。
但若視覺採用的是:
heuristics + priors + cue consistency \text{heuristics}
+
\text{priors}
+
\text{cue consistency} heuristics + priors + cue consistency
則某些不完全符合物理的圖像仍可能成功生成穩定立體感。
所以藝術家不必每次求解完整光傳輸方程。
只要落在:
C a c c e p t a b l e H \mathcal{C}_{\mathrm{acceptable}}^{H} C acceptable H
——人類可接受的線索區域——就可能工作。
8. 紋理梯度與表面延展
當重複紋理元素在圖像上逐漸縮小、密度增加或方向發生規律變化時,人類會傾向將其解讀為表面向遠處延伸。
設紋理局部尺度為:
s ( u , v ) . s(u,v). s ( u , v ) .
若沿某方向:
∂ s ∂ r < 0 , \frac{\partial s}{\partial r}<0, ∂ r ∂ s < 0 ,
則可能形成:
distance ( r ) ↑ \text{distance}(r)\uparrow distance ( r ) ↑
的知覺。
這裡仍然不是從圖像直接「讀取真實距離」,而是在透視與先驗條件下,將規律的二維尺度變化重新解讀成三維表面結構。
因此:
texture gradient \text{texture gradient} texture gradient
可被視為一種:
2 D differential field → 2.5 D surface slant estimate 2D\text{ differential field}
\rightarrow
2.5D\text{ surface slant estimate} 2 D differential field → 2.5 D surface slant estimate
的映射。
9. Pictorial Relief:圖畫裡真的存在一種「非物理深度」
pictorial space 與 pictorial relief 研究長期處理一個特殊現象:
畫布本身仍然是平面,但觀看者報告的圖像空間具有連續變化的深度。
可寫為:
r A : D → R , r_A:
D
\rightarrow
\mathbb{R}, r A : D → R ,
其中:
r A ( u , v ) r_A(u,v) r A ( u , v )
表示觀察者對畫面位置 ( u , v ) (u,v) ( u , v ) 所感知的 relief depth。
這個 r A r_A r A 並不是畫布物理高度:
r A ( u , v ) ≠ h c a n v a s ( u , v ) . r_A(u,v)
\neq
h_{\mathrm{canvas}}(u,v). r A ( u , v ) = h canvas ( u , v ) .
對平整畫布而言:
h c a n v a s ≈ 0 , h_{\mathrm{canvas}}
\approx
0, h canvas ≈ 0 ,
但:
r A ≢ 0. r_A
\not\equiv
0. r A ≡ 0.
因此「圖像空間」可以被正式視為一種由感知建立的有效幾何。
這正是載體幾何理論所需要的實例:
physical geometry ≠ perceptual geometry . \boxed{
\text{physical geometry}
\neq
\text{perceptual geometry}.
} physical geometry = perceptual geometry .
10. Anamorphosis:把觀察位置寫進作品本身
變形透視最能揭露「立體感不是圖像的單獨屬性」。
令觀察位置為:
q . q. q .
同一幅作品 A A A 在不同 q q q 下:
Ψ H ( A ; q 1 ) ≠ Ψ H ( A ; q 2 ) . \Psi_H(A;q_1)
\neq
\Psi_H(A;q_2). Ψ H ( A ; q 1 ) = Ψ H ( A ; q 2 ) .
存在一個特殊視點:
q ⋆ q^\star q ⋆
使:
Γ ( Ψ H ( A ; q ⋆ ) , T ) \Gamma
\left(
\Psi_H(A;q^\star),
T
\right) Γ ( Ψ H ( A ; q ⋆ ) , T )
達到局部最大值。
因此變形透視可以形式化為:
A ⋆ = arg max A Γ ( Ψ H ( A ; q ⋆ ) , T ) . \boxed{
A^\star
=
\arg\max_A
\Gamma
\left(
\Psi_H(A;q^\star),
T
\right).
} A ⋆ = arg A max Γ ( Ψ H ( A ; q ⋆ ) , T ) .
離開 q ⋆ q^\star q ⋆ :
∥ q − q ⋆ ∥ ↑ ⇒ Γ ↓ \|q-q^\star\|\uparrow
\quad\Rightarrow\quad
\Gamma\downarrow ∥ q − q ⋆ ∥ ↑ ⇒ Γ ↓
在典型情況下成立。
實驗研究確實發現,anamorphic image 的辨識與形狀知覺會隨觀察位置偏離 regularization point 而明顯變化。
因此街頭「3D 地畫」不是把地面真正變成立體世界;它是在設計:
image + viewpoint \text{image}
+
\text{viewpoint} image + viewpoint
這個聯合系統。
11. 重新形式化傳統繪畫技法
傳統繪畫技巧可以重新看成對不同深度線索通道的調控。
11.1 線性透視
控制:
c p e r s p . c_{\mathrm{persp}}. c persp .
功能:建立視線收束、尺度衰減與遠近方向。
11.2 遮擋
控制:
c o c c . c_{\mathrm{occ}}. c occ .
功能:建立 ordinal depth 與前後偏序。
11.3 明暗塑形
控制:
c s h a d e . c_{\mathrm{shade}}. c shade .
功能:誘發表面曲率、凸凹、傾斜與體積感。
11.4 投影陰影
控制:
c s h a d o w . c_{\mathrm{shadow}}. c shadow .
功能:建立物體與承載表面的距離及接觸關係。
11.5 紋理梯度
控制:
c t e x t u r e . c_{\mathrm{texture}}. c texture .
功能:建立表面朝遠方延展的局部尺度場。
11.6 空氣透視
控制:
c a e r i a l . c_{\mathrm{aerial}}. c aerial .
功能:以對比、飽和度與清晰度衰減建立大尺度距離感。
11.7 輪廓與形狀先驗
控制:
c c o n t o u r . c_{\mathrm{contour}}. c contour .
功能:利用已知物體形狀與輪廓關係推斷表面結構。
因此可以定義藝術作品的深度控制向量:
C A = ( c p e r s p , c o c c , c s h a d e , c s h a d o w , c t e x t u r e , c a e r i a l , c c o n t o u r , … ) . \mathbf{C}_A
=
\left(
c_{\mathrm{persp}},
c_{\mathrm{occ}},
c_{\mathrm{shade}},
c_{\mathrm{shadow}},
c_{\mathrm{texture}},
c_{\mathrm{aerial}},
c_{\mathrm{contour}},
\ldots
\right). C A = ( c persp , c occ , c shade , c shadow , c texture , c aerial , c contour , … ) .
藝術技巧就是在調整:
C A . \mathbf{C}_A. C A .
12. 線索一致性假說
本文提出一個需要後續實驗的強命題。
命題 A02-2:線索一致性假說
立體感強度 Δ H \Delta_H Δ H 不一定與物理厚度或真實三維複雜度單調對應,而可能在特定條件下主要取決於:
Δ H = F ( Coh ( C A ) , w H , q , P , M ) , \Delta_H
=
F
\left(
\operatorname{Coh}(\mathbf C_A),
\mathbf w_H,
q,
P,
M
\right), Δ H = F ( Coh ( C A ) , w H , q , P , M ) ,
其中:
Coh ( C A ) \operatorname{Coh}(\mathbf C_A) Coh ( C A ) :深度線索間的一致性;
w H \mathbf w_H w H :觀察者對各線索的權重;
q q q :視點;
P P P :先驗;
M M M :記憶與物體知識。
因此可能存在:
A 2 D A_{2D} A 2 D
與某個真實場景:
R 3 D R_{3D} R 3 D
使:
Δ H ( A 2 D ) > Δ H ( R 3 D ) . \Delta_H(A_{2D})
>
\Delta_H(R_{3D}). Δ H ( A 2 D ) > Δ H ( R 3 D ) .
這不是說平面「比真實更三維」。
而是說:
subjective depth strength ≠ physical dimensionality . \boxed{
\text{subjective depth strength}
\neq
\text{physical dimensionality}.
} subjective depth strength = physical dimensionality .
經過高度設計的畫面可以:
提升關鍵深度線索對比;
去除背景噪聲;
消除互相衝突的 cue;
誇張陰影與遮擋;
強化尺度梯度;
選擇最佳視角;
壓縮無關資訊。
因此它可能比某些真實場景更有效地驅動:
Ψ H . \Psi_H. Ψ H .
此命題應以心理物理方法測試,而不是僅靠主觀舉例。
13. 「比真實更立體」應如何實驗?
可以設計兩組刺激:
A 2 D A_{2D} A 2 D
與:
R 3 D . R_{3D}. R 3 D .
對同一目標形狀控制內容後,量測:
perceived depth magnitude;
surface slant accuracy;
curvature discrimination;
reaction time;
confidence;
eye movement;
viewpoint sensitivity。
定義:
Δ H = α 1 D p + α 2 S a + α 3 C d − α 4 R T + α 5 C o n f . \Delta_H
=
\alpha_1D_p
+
\alpha_2S_a
+
\alpha_3C_d
-
\alpha_4RT
+
\alpha_5Conf. Δ H = α 1 D p + α 2 S a + α 3 C d − α 4 R T + α 5 C o n f .
若在控制條件下:
Δ H ( A 2 D ) > Δ H ( R 3 D ) , \Delta_H(A_{2D})
>
\Delta_H(R_{3D}), Δ H ( A 2 D ) > Δ H ( R 3 D ) ,
即可證明至少在該操作定義下:
designed pictorial depth > unoptimized physical depth cue effectiveness . \text{designed pictorial depth}
>
\text{unoptimized physical depth cue effectiveness}. designed pictorial depth > unoptimized physical depth cue effectiveness .
這不會證明「2D 比 3D 更真」,但會支持:
depth phenomenology \text{depth phenomenology} depth phenomenology
主要依賴 cue organization,而非只依賴物理維度本身。
14. 感知升維不是欺騙,而是正常視覺機制的重用
將平面立體感稱為「騙眼睛」容易造成錯誤理解。
如果正常視覺本來就是:
image structure → depth inference , \text{image structure}
\rightarrow
\text{depth inference}, image structure → depth inference ,
那麼平面圖像只是提供另一組可以進入同一推理機制的輸入。
因此:
illusion \text{illusion} illusion
與:
normal perception \text{normal perception} normal perception
未必使用完全不同的底層演算法。
更合理的是:
pictorial depth = normal depth reconstruction under altered causal origin . \boxed{
\text{pictorial depth}
=
\text{normal depth reconstruction under altered causal origin}.
} pictorial depth = normal depth reconstruction under altered causal origin .
也就是:
真正場景中的 cue 通常由物理三維結構自然生成;
圖畫中的 cue 則由藝術家、人類設計或生成系統人工建立。
視覺系統收到的卻可能具有相似的局部統計與關係結構。
15. 從藝術史到「知覺編譯器」
由此,藝術家的角色可以被重新描述。
傳統敘述:
artist → draws object . \text{artist}
\rightarrow
\text{draws object}. artist → draws object .
本文提出另一個版本:
artist → designs perceptual code . \boxed{
\text{artist}
\rightarrow
\text{designs perceptual code}.
} artist → designs perceptual code .
作品 A A A 是一個對特定載體 L H L_H L H 編碼的結構:
A = Encode L H ( T ) . A
=
\operatorname{Encode}_{L_H}(T). A = Encode L H ( T ) .
觀看時:
Decode L H ( A ) ≈ T . \operatorname{Decode}_{L_H}(A)
\approx
T. Decode L H ( A ) ≈ T .
所以畫家、攝影師、遊戲美術與錯視藝術家實際上都在做某種:
substrate-specific perceptual compilation . \boxed{
\text{substrate-specific perceptual compilation}.
} substrate-specific perceptual compilation .
這也是為什麼某些藝術技巧跨時代仍然有效:
它們利用的不是文化語言而已,而是相對穩定的人類感知偏置與線索整合機制。
16. 對 AI 與機器視覺的延伸
本文不能把人類結果直接普遍化到 AI。
對任意觀察載體 L L L ,應寫:
Λ L : A 2 D → G L . \Lambda_L:
\mathcal A_{2D}
\rightarrow
\mathcal G_L. Λ L : A 2 D → G L .
不同載體可能有:
Λ H ≠ Λ A I . \Lambda_H
\neq
\Lambda_{AI}. Λ H = Λ A I .
人類會因透視、陰影、遮擋形成強烈立體感,不代表 AI 必須用同樣方式。
反之,AI 也可能從:
depth map;
LiDAR;
multi-view geometry;
event camera;
polarization;
hyperspectral data;
建立人類無法原生取得的幾何表示。
所以本文的真正普適命題不是:
所有智能都把 2D 看成 2.5D。
而是:
載體幾何由感測通道、先驗、解碼器與任務共同決定。 \boxed{
\text{載體幾何由感測通道、先驗、解碼器與任務共同決定。}
} 載體幾何由感測通道、先驗、解碼器與任務共同決定。
人類的 2 D → 2.5 D 2D\rightarrow2.5D 2 D → 2.5 D 只是其中一個具體實例。
17. 與 A01 的關係
A01 提出:
NativeVisualGeometry ( H ) ≈ G 2.5 D , e g o H . \operatorname{NativeVisualGeometry}(H)
\approx
\mathcal G^{H}_{2.5D,\mathrm{ego}}. NativeVisualGeometry ( H ) ≈ G 2.5 D , ego H .
A02 提供一個重要支持理由:
如果人類的視覺重建本來就是 cue-driven、surface-oriented、observer-relative,那麼物理 2 D 2D 2 D 平面只要保存足夠的 cue structure,就有能力重新觸發:
G 2.5 D , e g o H . \mathcal G^{H}_{2.5D,\mathrm{ego}}. G 2.5 D , ego H .
因此:
2 D pictorial depth \boxed{
2D\text{ pictorial depth}
} 2 D pictorial depth
不是 A01 的例外,而可能恰恰是 A01 的預測。
18. 核心命題整理
命題 A02-1:平面感知升維
存在物理上近似二維的圖像 A A A ,使:
Λ H ( A ) ∈ G 2.5 D H . \boxed{
\Lambda_H(A)
\in
\mathcal G^{H}_{2.5D}.
} Λ H ( A ) ∈ G 2.5 D H .
命題 A02-2:線索一致性假說
在固定觀察者與任務下,立體感強度主要取決於深度線索結構及其一致性,而不與物理厚度一一對應:
Δ H ∝̸ PhysicalThickness . \boxed{
\Delta_H
\not\propto
\operatorname{PhysicalThickness}.
} Δ H ∝ PhysicalThickness .
命題 A02-3:視點條件化
對變形透視類作品:
Ψ H ( A ; q ) \boxed{
\Psi_H(A;q)
} Ψ H ( A ; q )
強烈依賴 q q q ,且存在最佳視點 q ⋆ q^\star q ⋆ 。
命題 A02-4:表示成功非物理同一
若:
Ψ H ( A ) ≈ Ψ H ( R ) , \Psi_H(A)
\approx
\Psi_H(R), Ψ H ( A ) ≈ Ψ H ( R ) ,
不能推出:
A = R . A=R. A = R .
知覺等價不代表物理同一。
19. 方法論警告
本文有四個重要限制。
第一,不能把「2D 可以產生立體感」推成「外部世界就是 2D」。
第二,不能把 pictorial relief 誤認為畫布真的多出一個物理維度。
第三,不能因為某些錯視成功,就說所有知覺都是錯覺。
第四,不能把人類深度線索模型直接套到所有 AI、機器或其他觀察者。
因此:
perceptual dimensional lifting ≠ physical dimensional creation . \boxed{
\text{perceptual dimensional lifting}
\neq
\text{physical dimensional creation}.
} perceptual dimensional lifting = physical dimensional creation .
本文研究的是表示與知覺,不是憑空製造空間。
20. 結論
平面能產生立體感,不應只被當作藝術技巧、視覺魔術或感官缺陷。
它暴露了一個更深層的事實:
人類知覺中的深度, 至少部分是由可被重新編碼的線索結構所生成。 \boxed{
\text{人類知覺中的深度,
至少部分是由可被重新編碼的線索結構所生成。}
} 人類知覺中的深度, 至少部分是由可被重新編碼的線索結構所生成。
因此完整鏈條是:
A 2 D → C C A → Ψ H V 2.5 D → I W ^ 3 D . \boxed{
A_{2D}
\xrightarrow{\mathcal C}
\mathbf C_A
\xrightarrow{\Psi_H}
V_{2.5D}
\xrightarrow{\mathcal I}
\widehat W_{3D}.
} A 2 D C C A Ψ H V 2.5 D I W 3 D .
這重新定義了透視:
它不只是:
R 3 → R 2 , \mathbb R^3
\rightarrow
\mathbb R^2, R 3 → R 2 ,
同時也是:
R 2 → G 2.5 D H \boxed{
\mathbb R^2
\rightarrow
\mathcal G_{2.5D}^{H}
} R 2 → G 2.5 D H
的感知工程。
藝術家因此不只是「把三維畫到二維」。
他也在做:
用二維符號配置, 編譯人類準三維世界感。 \boxed{
\text{用二維符號配置,
編譯人類準三維世界感。}
} 用二維符號配置, 編譯人類準三維世界感。
而當這個結論成立後,下一個問題便自然出現:
如果人類可以利用動態變化、投影、切片與時間整合,從準 2.5 D 2.5D 2.5 D 載體建立超出靜態三維圖像的結構感,那麼 4 D 4D 4 D 是否存在某些「可被部分感覺到」的動態表示?
這正是下一篇 A03 的問題。
參考文獻
Marr, D. (1982/2010). Vision: A Computational Investigation into the Human Representation and Processing of Visual Information . MIT Press.
Ramachandran, V. S. (1988). Perception of shape from shading. Nature , 331, 163–166. DOI: 10.1038/331163a0.
Cavanagh, P. & Leclerc, Y. G. (1989). Shape from shadows. Journal of Experimental Psychology: Human Perception and Performance , 15(1), 3–27. DOI: 10.1037/0096-1523.15.1.3.
Pentland, A. (1989). Shape information from shading: a theory about human perception. Spatial Vision , 4(2–3), 165–182. DOI: 10.1163/156856889X00103.
Massironi, M. & Savardi, U. (1991). Why anamorphoses look as they do: An experimental study. Acta Psychologica , 76(3), 213–239. DOI: 10.1016/0001-6918(91)90021-Q.
Kleffner, D. A. & Ramachandran, V. S. (1992). On the perception of shape from shading. Perception & Psychophysics , 52(1), 18–36. DOI: 10.3758/BF03206757.
Johnston, A. & Passmore, P. J. (1994). Shape from shading. I: Surface curvature and orientation. Perception , 23(2), 169–189. DOI: 10.1068/p230169.
Mallot, H. A. (1997). Spatial scale in stereo and shape from shading: image input, mechanisms, and tasks. Perception , 26(9), 1137–1146. DOI: 10.1068/p261137.
Jenkin, H. L., Jenkin, M. R., Dyde, R. T. & Harris, L. R. (2004). Shape-from-shading depends on visual, gravitational, and body-orientation cues. Perception , 33(12), 1453–1461. DOI: 10.1068/p5285.
Koenderink, J. J., van Doorn, A. J. & Wagemans, J. (2018). Geometry of Pictorial Relief. Annual Review of Vision Science , 4, 451–474. DOI: 10.1146/annurev-vision-091517-034250.
Marlow, P. J., Mooney, S. W. J. & Anderson, B. L. (2019). Photogeometric Cues to Perceived Surface Shading. Current Biology , 29(2), 306–311.e3. DOI: 10.1016/j.cub.2018.11.041.
Fleming, R. W. & Storrs, K. R. (2024). Interactions Between 3D Surface Shape and Material Perception. Annual Review of Vision Science . DOI: 10.1146/annurev-vision-102122-094213.
Wang, M. W. X. & Troje, N. F. (2024). Relating visual and pictorial space: Integration of binocular disparity and motion parallax. Journal of Vision , 24(13), 7. DOI: 10.1167/jov.24.13.7.
Aubuchon, C. & Fleming, R. W. (2026). Visual Perception of 3D Shape: From Local 2D Image Measurements to 3D Surface Properties. Annual Review of Vision Science , 12, in press. DOI: 10.1146/annurev-vision-121225-090634.
Neo.K (2026). 人類其實看見 3D 嗎?從 Marr 的 2.5D Sketch 到觀察者中心的準三維載體幾何 . 載體幾何 2.0 A01, v0.1.
系列接口
下一篇:
A03《從 2.5 D 2.5D 2.5 D 到 4 D 4D 4 D :動態切片、投影與高維直觀的有限生成》
將處理:
G 2.5 D + T + dynamic projection → partial 4D intuition , \mathcal G_{2.5D}
+
T
+
\text{dynamic projection}
\rightarrow
\text{partial 4D intuition}, G 2.5 D + T + dynamic projection → partial 4D intuition ,
並嚴格區分:
原生高維感知;
動態投影;
時間切片;
三維投影動畫;
高維形式理解;
「感覺自己理解了 4 D 4D 4 D 」與真正具有 4 D 4D 4 D 原生表徵之間的差異。