← Archive
lm-003740 · 2026-09

載體幾何 2.0(A01)

下載 MD 檔 ⬇

載體幾何 2.0(A01)

人類其實看見 3D 嗎?

從 Marr 的 2.5D Sketch 到觀察者中心的準三維載體幾何

作者:Neo.K
機構:EveMissLab/一言諾科技有限公司
系列:載體幾何 2.0:從 2.5D 視覺到高維符號實在
版本:v0.1
日期:2026-08-23
理論定位:認知科學 × 視覺科學 × 數學哲學 × 載體本體論


摘要

「人類生活在三維空間,因此人類原生地看見三維世界」是一個極其自然、卻未必成立的推論。本文在既有「載體幾何—本體幾何」區分上提出一次重要修正:人類視覺的原生在線表徵不應直接等同於完整的三維歐幾里得空間 R3\mathbb{R}^3 ;更保守且更符合既有視覺科學的描述,是將其建模為一類觀察者中心、表面優先、深度附著且隨時間更新的準 2.5D2.5D 表徵族。

本文並不主張神經系統中存在一張字面意義上的「2.5 維圖片」,也不主張所有視覺處理都能被單一 Marr 式 2.5D sketch 完整描述。本文採取的立場是: 2.5D2.5D 應被理解為一種表示類型,其核心條件包括觀察者中心性、可見表面優先、深度/方向/遮擋等屬性附著,以及對不可見部分的非直接取得。這與完整體積式 3D3D 世界模型不同。

Marr 將 2.5D sketch 視為由早期視覺加工導出的可見表面中介表示;後續研究則顯示,人類三維知覺可能由多個彼此可分離、針對不同距離與行動尺度最佳化的空間編碼共同支撐,而非由單一、全域、客觀且近似忠實的 R3\mathbb{R}^3 內部模型統一承載。本文據此提出「準三維載體命題」:人類主觀上穩定的三維世界感,可能是由準 2.5D2.5D 視覺表徵、記憶、先驗、運動與跨時間整合共同產生的世界模型,而非視覺系統直接讀取一個完整三維幾何的結果。

此修正對高維幾何具有直接後果。如果人類甚至不是以完整 3D3D 作為原生視覺載體,那麼「人類無法原生視覺化 4D4D 或更高維」便不應被理解為從 3D3D4D4D 的單一步驟失敗,而應被理解為從一種有限、觀察者中心、線索驅動的準三維載體,試圖對更高維形式結構建立投影、切片、動態類比與符號延伸。這為後續「高維符號實在」與「可達性宇宙論」提供新的認知基礎。

關鍵詞: 2.5D、三維知覺、載體幾何、觀察者中心表徵、深度知覺、Marr、視覺空間、本體幾何、高維幾何、認知可達性


1. 問題:把「生活在 3D」偷換成「原生看見 3D」

在日常語言裡,人類會說:

我看到一張桌子。
我看到一顆球。
我看到前方是一個三維空間。

這些敘述在行動層面完全合理。然而,它們容易產生一個沒有被充分標記的推論:

外部世界可被三維幾何有效描述人類視覺內部原生表徵就是完整三維幾何.\text{外部世界可被三維幾何有效描述} \Longrightarrow \text{人類視覺內部原生表徵就是完整三維幾何}.

本文拒絕這個直接推論。

視覺系統首先取得的不是一個可以任意旋轉、查詢與遍歷的完整三維資料庫。每隻眼睛取得的是經由光學系統映射到視網膜上的訊號;深度、表面方向、遮擋、距離、物體形狀與空間配置則必須依賴雙眼視差、運動視差、透視、紋理梯度、遮擋、光照等多種線索進一步建立。

因此,即使最終主體形成穩定的「我位於三維世界中」的經驗,也不能直接推出:

NativeVisualGeometry(H)R3.\operatorname{NativeVisualGeometry}(H) \cong \mathbb{R}^3.

本文要處理的正是這個等號是否成立。


2. 必須先拆開四種不同的「三維」

「3D」在日常與學術語境中至少可能指四種不同東西。

2.1 物理描述維度

設外部物理環境在某尺度下可由三個空間座標有效描述:

XphysR3.X_{\mathrm{phys}} \subseteq \mathbb{R}^3.

這是一個物理/幾何模型層的敘述。

2.2 感測輸入維度

每隻眼睛取得的視網膜訊號可粗略寫為:

IL(u,v,t),IR(u,v,t).I_L(u,v,t), \qquad I_R(u,v,t).

這不是說視覺資訊只有兩個自由度,而是指出光學成像首先把外部環境映射到感光表面,之後才由多種線索推導深度與結構。

2.3 知覺表徵

視覺系統可能建立某種包含深度與表面屬性的觀察者中心表示:

VH(t).V_H(t).

它未必等於完整的三維體積場。

2.4 認知世界模型

主體最後可能維持一個比當下可見表面更完整的世界模型:

W^H(t).\widehat{W}_H(t).

它包含物體恆常性、不可見表面、記憶、預期、行動可能性與跨時間整合。

因此應明確區分:

Xphys(IL,IR)VHW^H.X_{\mathrm{phys}} \neq (I_L,I_R) \neq V_H \neq \widehat{W}_H.

上述各層可以高度耦合,但不能在沒有論證時直接視為同一物件。


3. Marr 的 2.5D:不是新詞,而是尚未被推到本體論盡頭的舊洞見

David Marr 的視覺計算框架早已區分 primal sketch、2.5D sketch 與更高階的 3D object representation。2.5D sketch 的核心不是「二維半」這種字面幾何,而是:在觀察者中心座標中,對當前可見表面建立深度、方向、邊界等結構化表示。

Marr 與 Poggio 的立體視覺模型更直接把雙眼對應所建立的資訊放入動態 2.5D sketch。這說明「深度已被計算」與「已經擁有完整物體中心三維模型」不是同一件事。

因此本文採用一個重要澄清:

2.5Dfractional physical dimension.2.5D \neq \text{fractional physical dimension}.

本文中的 2.5D2.5D 是一種表示類型標籤:

G2.5D=viewer-centered surface-plus-depth representation class.\mathcal{G}_{2.5D} = \text{viewer-centered surface-plus-depth representation class}.

它強調的是:

  1. 表示有一個主要的視圖/表面域;
  2. 深度或表面方向等屬性附著於該域;
  3. 可見與不可見部分具有不對稱的資訊來源;
  4. 表示與觀察者位置、姿態與感測條件相關;
  5. 它可以支持強烈立體感,但不必等同於完整體積式三維世界資料庫。

4. 現代證據為何讓「單一完整 3D 內部世界」變得可疑

本文不主張 Marr 的 1982 架構就是現代視覺神經科學的最終答案。相反地,後續研究使問題變得更複雜。

Vishwanath 對三維知覺的綜述指出,傳統物理主義式模型常假設視覺系統推導出一個客觀、單一且大致忠實的外部三維世界表示;但現象學、心理物理與神經生理證據更支持至少三種可分離的空間編碼:相對/未定尺度深度、近空間的物體間尺度深度,以及較大行動尺度上的自我中心距離。這意味著:

3D perception⇏one unified 3D metric.\text{3D perception} \not\Rightarrow \text{one unified 3D metric}.

此外,人類知覺空間並不必然服從單一歐幾里得度量。Fernandez 與 Farell 的分析顯示,在常見的多線索整合假設下,知覺空間可能更適合由可變曲率的 Riemannian 結構描述。這至少說明:

perceived geometryphysical Euclidean geometry\text{perceived geometry} \neq \text{physical Euclidean geometry}

不是一個荒謬的可能性,而是一個可以被心理物理研究正式處理的問題。

2024 年關於 binocular disparity 與 motion parallax 的研究也顯示,不同深度資訊來源可以對知覺空間施加不同的幾何轉換,而某些三維性質在不同條件下保持不變。這更支持「視覺空間是一個由多種線索與轉換共同形成的表示系統」,而不是單純把外部 R3\mathbb{R}^3 複製進腦內。


5. 對《載體幾何與本體幾何》的修正

既有載體幾何框架曾提出:

Geom(Lhuman)R3,\operatorname{Geom}(L_{\mathrm{human}}) \approx \mathbb{R}^3,

並以此反駁「 R3\mathbb{R}^3 是宇宙中立背景」的預設。

本文認為這個版本仍然過度給予人類視覺一個完整三維地位。

更保守的修正版是:

NativeVisualGeometry(LH)G2.5D,egoH\boxed{ \operatorname{NativeVisualGeometry}(L_H) \approx \mathcal{G}^{H}_{2.5D,\mathrm{ego}} }

其中:

  • LHL_H 為人類視覺載體;
  • G2.5D,egoH\mathcal{G}^{H}_{2.5D,\mathrm{ego}} 不是單一固定幾何,而是一族觀察者中心、表面優先、深度附著的表示;
  • \approx 」表示模型層的結構近似,而不是神經實體同一性宣稱。

人類最後形成的世界模型則可寫為:

W^H(t)=I(VH(t),M<t,Pt,At,Qt),\widehat{W}_H(t) = \mathcal{I} \left( V_H(t), M_{<t}, P_t, A_t, Q_t \right),

其中:

  • VH(t)V_H(t):當前視覺表徵;
  • M<tM_{<t}:先前觀察與記憶;
  • PtP_t:物體與世界先驗;
  • AtA_t:身體行動與感覺運動資訊;
  • QtQ_t:任務、注意與觀察條件;
  • I\mathcal{I}:跨來源整合算子。

因此:

VH(t)W^H(t).\boxed{ V_H(t) \neq \widehat{W}_H(t). }

「當下視覺表示」與「我所經驗到的完整世界」不是必然同一層。


6. 準 2.5D 表徵的最小形式

為避免把 2.5D 誤解成一張固定深度圖,本文只給出最小抽象形式。

令當前視覺域為:

DtR2.D_t \subseteq \mathbb{R}^2.

在每個可視位置 pDtp\in D_t 上,視覺系統可估計一組屬性:

Φt(p)=(d^t,n^t,o^t,m^t,c^t,),\Phi_t(p) = \left( \hat{d}_t, \hat{n}_t, \hat{o}_t, \hat{m}_t, \hat{c}_t, \ldots \right),

其中可以分別代表:

  • d^t\hat{d}_t:深度或相對距離估計;
  • n^t\hat{n}_t:表面方向/法向相關資訊;
  • o^t\hat{o}_t:遮擋與前後次序;
  • m^t\hat{m}_t:運動/光流資訊;
  • c^t\hat{c}_t:估計信心、可靠度或線索權重。

則一個最小準 2.5D 表示可寫為:

VH(t)=(Dt,Φt,qt),V_H(t) = \left( D_t, \Phi_t, q_t \right),

其中 qtq_t 為觀察者狀態,例如頭部姿態、眼球位置、身體位置與注意條件。

這個表示有深度,但它仍然與「在 R3\mathbb{R}^3 每一個位置都維持完整世界狀態」不同。

後者更接近:

ρt:R3F,\rho_t: \mathbb{R}^3 \rightarrow \mathcal{F},

其中 ρt(x,y,z)\rho_t(x,y,z) 對整個體積域都給出狀態。本文沒有足夠理由假定人類視覺在任何時刻都維持如此完整、高解析度、全域一致的內部場。


7. 可見表面與完整物體:資訊來源並不對稱

考慮一個球形物體。

當前觀察者直接取得的是某個可見表面集合:

Svis(qt)S.S_{\mathrm{vis}}(q_t) \subset S.

其餘部分:

Shid(qt)=SSvis(qt)S_{\mathrm{hid}}(q_t) = S \setminus S_{\mathrm{vis}}(q_t)

在當下並未直接形成同樣的光學輸入。

然而主體通常仍會報告:

我看到一顆完整的球。

這表示主觀物體完整性至少可能包含:

visible evidence+object prior+memory+completion.\text{visible evidence} + \text{object prior} + \text{memory} + \text{completion}.

因此:

phenomenal object completeness>current directly sampled surface completeness\text{phenomenal object completeness} > \text{current directly sampled surface completeness}

在一般情況下是合理的。

本文將這個差異稱為:

Phenomenal Completion Gap\boxed{ \text{Phenomenal Completion Gap} }

現象完整性缺口:主體經驗中的物體或世界完整性,大於當前感測通道直接提供的結構完整性。

這不是「幻覺」;它可能正是正常視覺能夠穩定行動的必要機制。


8. 為什麼純 2D 平面能產生強烈立體感

這一點將在系列 A02 專門展開,但在本文必須先指出其理論意義。

如果立體感要求視覺系統直接取得完整物理三維體積,那麼平面繪畫、照片與單眼透視圖應該極難產生穩定的空間深度感。

然而人類可以只靠:

perspective+occlusion+texture gradient+relative size+shading\text{perspective} + \text{occlusion} + \text{texture gradient} + \text{relative size} + \text{shading}

在平面中形成相當強的三維形狀與空間配置感。

Vishwanath 特別將「二維圖像仍可產生三維性」視為理解三維知覺現象學的重要事實。近期對 pictorial space、binocular disparity 與 motion parallax 的比較,也顯示不同線索集合可以產生不同但有結構關係的知覺空間。

因此更自然的描述不是:

2D imagefake 3D,2D\text{ image} \rightarrow \text{fake 3D},

而是:

2D carrierdepth cuesG2.5Dintegration3D-like world experience.2D\text{ carrier} \xrightarrow{\text{depth cues}} \mathcal{G}_{2.5D} \xrightarrow{\text{integration}} \text{3D-like world experience}.

這說明人類的「立體感」更可能是一種可由特定線索結構觸發的建構結果,而不是物理三維體積本身直接灌入意識。


9. 核心命題:準三維載體命題

本文提出以下待驗證命題,而非既成神經科學定理。

命題 A01-1:原生三維非同一性

人類主觀具有穩定三維世界感,不足以推出其原生在線視覺表徵與完整歐幾里得三維空間同構:

3D phenomenology⇏NativeVisualGeometry(H)R3.\boxed{ \text{3D phenomenology} \not\Rightarrow \operatorname{NativeVisualGeometry}(H) \cong \mathbb{R}^3. }

命題 A01-2:準 2.5D 載體假說

人類在線視覺表徵可被一類觀察者中心、可見表面優先且附帶深度/方向/遮擋資訊的表示族更好地近似:

NativeVisualGeometry(H)G2.5D,egoH.\boxed{ \operatorname{NativeVisualGeometry}(H) \approx \mathcal{G}^{H}_{2.5D,\mathrm{ego}}. }

命題 A01-3:三維世界感的整合生成

完整三維世界感可能主要由當前準三維表示與跨時間、跨感官、記憶及行動資訊整合而成:

W^H=I(V2.5D,M,P,A,T).\boxed{ \widehat{W}_H = \mathcal{I} \left( V_{2.5D}, M, P, A, T \right). }

其中 TT 表示跨時間整合。


10. 這個命題不是什麼

為避免不必要的過度宣稱,本文明確排除以下解讀。

10.1 不是「大腦只有 2D」

錯。本文恰恰承認深度、表面方向、距離與空間配置會被神經系統建立。

10.2 不是「Marr 已經證明一切」

錯。Marr 提供的是重要的計算框架與歷史起點,不是今天所有視覺神經科學問題的最終答案。

10.3 不是「人類沒有 3D 知覺」

錯。人類具有強烈且功能上有效的三維知覺。本文質問的是它的表示構成方式,不是否認現象。

10.4 不是「外部世界一定不是 3D」

錯。從知覺載體的結構,不能直接推出物理世界的最終維度。

10.5 不是「2.5D 是真正物理維度」

錯。本文把 2.5D2.5D 當作表示類型,不是宇宙維數。


11. 可反駁性與經驗判準

一個有價值的強命題必須告訴我們什麼證據會削弱它。

11.1 若存在穩定、任務無關的單一完整三維度量

如果未來研究能證明人類視覺始終維持一個:

  1. 全域一致;
  2. 視角不依賴;
  3. 任務不依賴;
  4. 對不可見區域具有與可見區域相近即時表示;
  5. 服從單一穩定三維度量;

的內部空間模型,則本文的準 2.5D2.5D 載體假說會被大幅削弱。

11.2 若不同深度線索不產生表示解離

本文預期 binocular disparity、motion parallax、pictorial cues、active movement 等來源,不只是為同一三維座標加入更多精度,而可能在不同條件下形成不同權重、不同尺度甚至不同局部幾何。

如果未來證據顯示所有線索都只是在一個固定 R3\mathbb{R}^3 座標系中增加無偏估計精度,則本文需要修正。

11.3 若不可見部分具有完整即時體積表示

本文預期不可見物體部分更多依賴記憶、先驗與結構補完,而非與當下可見表面完全同質的感測表示。

這可以透過遮擋、快速視角變換、物體旋轉、change detection 與跨眼動更新實驗進一步檢驗。


12. 從 2.5D 回看「3D 是人類中心主義」

舊版載體幾何曾提出:

R3\mathbb{R}^3 不應被視為宇宙中性的本體背景,而應被視為人類載體的一種投影。

本文現在必須再修正一次:

甚至把 R3\mathbb{R}^3 當成人類視覺的「原生幾何」,都可能過度簡化。

因此更完整的鏈條可能是:

Rphysical couplingSHsensory encodingV2.5DintegrationW^3DformalizationR3,\mathcal{R} \xrightarrow{\text{physical coupling}} S_H \xrightarrow{\text{sensory encoding}} V_{2.5D} \xrightarrow{\text{integration}} \widehat{W}_{3D} \xrightarrow{\text{formalization}} \mathbb{R}^3,

其中:

  • R\mathcal{R}:未知實在;
  • SHS_H:人類可耦合的感測訊號;
  • V2.5DV_{2.5D}:準三維知覺表示;
  • W^3D\widehat{W}_{3D}:認知上的三維世界模型;
  • R3\mathbb{R}^3:形式化後的數學表示。

這意味著:

R3W^3DV2.5DR.\boxed{ \mathbb{R}^3 \neq \widehat{W}_{3D} \neq V_{2.5D} \neq \mathcal{R}. }

它們之間存在成功映射,不代表它們具有本體同一性。


13. 對高維幾何問題的第一個後果

如果本文的修正成立,那麼人類面對 4D4D5D5D 或更高維結構時,問題不再是:

3D4D5D.3D \rightarrow 4D \rightarrow 5D.

因為人類的原生感知起點可能本來就不是一個完整的 3D3D 內部流形。

更合理的描述是:

G2.5DHprojection / animation / analogy / symbolMn,n4,\mathcal{G}^{H}_{2.5D} \xrightarrow{\text{projection / animation / analogy / symbol}} \mathcal{M}_n, \qquad n\geq 4,

其中 Mn\mathcal{M}_n 是某個高維形式模型。

因此:

formal access to Mn\text{formal access to } \mathcal{M}_n

和:

native phenomenal access to Mn\text{native phenomenal access to } \mathcal{M}_n

從一開始就是不同問題。

這將直接導向本系列 A03–A06 所處理的高維視覺化、候選爆炸、符號實在與高維逆問題。


14. 方法論原則:不要把方便的表示誤認為世界本身

本文最終要建立的不是一句「人類只看 2.5D」,而是一條更一般的方法論:

Representation Success⇏Ontological Identity.\boxed{ \text{Representation Success} \not\Rightarrow \text{Ontological Identity}. }

一個表示可以:

  • 導航非常成功;
  • 抓取非常成功;
  • 預測非常成功;
  • 數學上非常精確;

卻仍不需要與其所表示的本體具有一一同構。

對視覺如此,對高維幾何亦然。

因此,比「人類到底看幾維」更重要的問題是:

某個載體為完成其任務,究竟需要保留哪些幾何不變量?\boxed{ \text{某個載體為完成其任務,究竟需要保留哪些幾何不變量?} }

也許生物演化根本沒有理由維護一份昂貴、全域、體積式、客觀座標化的三維世界副本;只要能穩定支援:

避障+抓取+導航+辨識+預測\text{避障} + \text{抓取} + \text{導航} + \text{辨識} + \text{預測}

就已經足夠。

這是載體幾何從「維度哲學」轉向「可操作表示論」的重要一步。


15. 結論

本文對既有《載體幾何與本體幾何》做出第一個正式修正。

原命題過度簡化地寫成:

Geom(LH)R3.\operatorname{Geom}(L_H) \approx \mathbb{R}^3.

本文建議改為:

NativeVisualGeometry(LH)G2.5D,egoH,\boxed{ \operatorname{NativeVisualGeometry}(L_H) \approx \mathcal{G}^{H}_{2.5D,\mathrm{ego}}, }

並把人類穩定的三維世界感建模為:

W^3D=I(V2.5D,M,P,A,T).\boxed{ \widehat{W}_{3D} = \mathcal{I} \left( V_{2.5D}, M, P, A, T \right). }

因此,「人類看到三維世界」可以在行動與現象學上為真,但「人類原生視覺維持完整 R3\mathbb{R}^3 世界模型」並不能由前者直接推出。

這一修正帶來的最深後果不是降低人類視覺能力,而是取消一個隱藏已久的等號:

世界感感測表示數學幾何本體實在.\boxed{ \text{世界感} \neq \text{感測表示} \neq \text{數學幾何} \neq \text{本體實在}. }

而一旦這四者被拆開,我們才真正有資格重新討論 4D4D5D5DXDXD 高維幾何究竟是感知延伸、形式延伸、物理候選,還是本體結構。


參考文獻

  1. Marr, D. & Nishihara, H. K. (1978). Representation and recognition of the spatial organization of three-dimensional shapes. Proceedings of the Royal Society of London. Series B, 200(1140), 269–294. DOI: 10.1098/rspb.1978.0020.
  2. Marr, D. & Poggio, T. (1979). A computational theory of human stereo vision. Proceedings of the Royal Society of London. Series B, 204(1156), 301–328. DOI: 10.1098/rspb.1979.0029.
  3. Marr, D. (1982/2010). Vision: A Computational Investigation into the Human Representation and Processing of Visual Information. MIT Press.
  4. Fernandez, J. M. & Farell, B. (2009). Is perceptual space inherently non-Euclidean? Journal of Mathematical Psychology, 53(2), 86–91. DOI: 10.1016/j.jmp.2008.12.006.
  5. Ağaoğlu, M. N., Herzog, M. H. & Öğmen, H. (2012). Non-retinotopic feature processing in the absence of retinotopic spatial layout and the construction of perceptual space from motion. Vision Research, 71, 10–17. DOI: 10.1016/j.visres.2012.08.009.
  6. Hisakata, R., Nishida, S. & Johnston, A. (2016). An Adaptable Metric Shapes Perceptual Space. Current Biology, 26(14), 1911–1915. DOI: 10.1016/j.cub.2016.05.047.
  7. Lappin, J. S. & Bell, H. H. (2021). Form and Function in Information for Visual Perception. i-Perception. DOI: 10.1177/20416695211053352.
  8. Vishwanath, D. (2023). From pictures to reality: modelling the phenomenology and psychophysics of 3D perception. Philosophical Transactions of the Royal Society B, 378(1869), 20210454. DOI: 10.1098/rstb.2021.0454.
  9. Wang, M. W. X. & Troje, N. F. (2024). Relating visual and pictorial space: Integration of binocular disparity and motion parallax. Journal of Vision, 24(13), 7. DOI: 10.1167/jov.24.13.7.
  10. Neo.K (2026). 載體幾何與本體幾何——閉合性 Cl 的維度無關性與對人類視覺直觀的本體論去自然化. v1.0, Dynamic Closure Ontology / EveMissLab internal research series.

系列接口

下一篇:

A02《平面為何能產生立體感:透視、錯視與 2D→2.5D 感知升維》

將正式處理:

2D carrierdepth-cue fieldG2.5D3D-like phenomenology,2D\text{ carrier} \rightarrow \text{depth-cue field} \rightarrow \mathcal{G}_{2.5D} \rightarrow \text{3D-like phenomenology},

並重新形式化透視法、明暗法、遮擋、紋理梯度與 anamorphosis,使其從「藝術技巧」提升為可比較的感知幾何工程。