# 載體幾何 2.0（A01）
## 人類其實看見 3D 嗎？
### 從 Marr 的 2.5D Sketch 到觀察者中心的準三維載體幾何

**作者：Neo.K**  
**機構：EveMissLab／一言諾科技有限公司**  
**系列：載體幾何 2.0：從 2.5D 視覺到高維符號實在**  
**版本：v0.1**  
**日期：2026-08-23**  
**理論定位：認知科學 × 視覺科學 × 數學哲學 × 載體本體論**

---

## 摘要

「人類生活在三維空間，因此人類原生地看見三維世界」是一個極其自然、卻未必成立的推論。本文在既有「載體幾何—本體幾何」區分上提出一次重要修正：人類視覺的原生在線表徵不應直接等同於完整的三維歐幾里得空間 $\mathbb{R}^3$ ；更保守且更符合既有視覺科學的描述，是將其建模為一類觀察者中心、表面優先、深度附著且隨時間更新的準 $2.5D$ 表徵族。

本文並不主張神經系統中存在一張字面意義上的「2.5 維圖片」，也不主張所有視覺處理都能被單一 Marr 式 2.5D sketch 完整描述。本文採取的立場是： $2.5D$ 應被理解為一種**表示類型**，其核心條件包括觀察者中心性、可見表面優先、深度／方向／遮擋等屬性附著，以及對不可見部分的非直接取得。這與完整體積式 $3D$ 世界模型不同。

Marr 將 2.5D sketch 視為由早期視覺加工導出的可見表面中介表示；後續研究則顯示，人類三維知覺可能由多個彼此可分離、針對不同距離與行動尺度最佳化的空間編碼共同支撐，而非由單一、全域、客觀且近似忠實的 $\mathbb{R}^3$ 內部模型統一承載。本文據此提出「準三維載體命題」：人類主觀上穩定的三維世界感，可能是由準 $2.5D$ 視覺表徵、記憶、先驗、運動與跨時間整合共同產生的世界模型，而非視覺系統直接讀取一個完整三維幾何的結果。

此修正對高維幾何具有直接後果。如果人類甚至不是以完整 $3D$ 作為原生視覺載體，那麼「人類無法原生視覺化 $4D$ 或更高維」便不應被理解為從 $3D$ 到 $4D$ 的單一步驟失敗，而應被理解為從一種有限、觀察者中心、線索驅動的準三維載體，試圖對更高維形式結構建立投影、切片、動態類比與符號延伸。這為後續「高維符號實在」與「可達性宇宙論」提供新的認知基礎。

**關鍵詞：** 2.5D、三維知覺、載體幾何、觀察者中心表徵、深度知覺、Marr、視覺空間、本體幾何、高維幾何、認知可達性

---

# 1. 問題：把「生活在 3D」偷換成「原生看見 3D」

在日常語言裡，人類會說：

> 我看到一張桌子。  
> 我看到一顆球。  
> 我看到前方是一個三維空間。

這些敘述在行動層面完全合理。然而，它們容易產生一個沒有被充分標記的推論：

$$
\text{外部世界可被三維幾何有效描述}
\Longrightarrow
\text{人類視覺內部原生表徵就是完整三維幾何}.
$$

本文拒絕這個直接推論。

視覺系統首先取得的不是一個可以任意旋轉、查詢與遍歷的完整三維資料庫。每隻眼睛取得的是經由光學系統映射到視網膜上的訊號；深度、表面方向、遮擋、距離、物體形狀與空間配置則必須依賴雙眼視差、運動視差、透視、紋理梯度、遮擋、光照等多種線索進一步建立。

因此，即使最終主體形成穩定的「我位於三維世界中」的經驗，也不能直接推出：

$$
\operatorname{NativeVisualGeometry}(H)
\cong
\mathbb{R}^3.
$$

本文要處理的正是這個等號是否成立。

---

# 2. 必須先拆開四種不同的「三維」

「3D」在日常與學術語境中至少可能指四種不同東西。

## 2.1 物理描述維度

設外部物理環境在某尺度下可由三個空間座標有效描述：

$$
X_{\mathrm{phys}}
\subseteq
\mathbb{R}^3.
$$

這是一個物理／幾何模型層的敘述。

## 2.2 感測輸入維度

每隻眼睛取得的視網膜訊號可粗略寫為：

$$
I_L(u,v,t),
\qquad
I_R(u,v,t).
$$

這不是說視覺資訊只有兩個自由度，而是指出光學成像首先把外部環境映射到感光表面，之後才由多種線索推導深度與結構。

## 2.3 知覺表徵

視覺系統可能建立某種包含深度與表面屬性的觀察者中心表示：

$$
V_H(t).
$$

它未必等於完整的三維體積場。

## 2.4 認知世界模型

主體最後可能維持一個比當下可見表面更完整的世界模型：

$$
\widehat{W}_H(t).
$$

它包含物體恆常性、不可見表面、記憶、預期、行動可能性與跨時間整合。

因此應明確區分：

$$
X_{\mathrm{phys}}
\neq
(I_L,I_R)
\neq
V_H
\neq
\widehat{W}_H.
$$

上述各層可以高度耦合，但不能在沒有論證時直接視為同一物件。

---

# 3. Marr 的 2.5D：不是新詞，而是尚未被推到本體論盡頭的舊洞見

David Marr 的視覺計算框架早已區分 primal sketch、2.5D sketch 與更高階的 3D object representation。2.5D sketch 的核心不是「二維半」這種字面幾何，而是：在觀察者中心座標中，對**當前可見表面**建立深度、方向、邊界等結構化表示。

Marr 與 Poggio 的立體視覺模型更直接把雙眼對應所建立的資訊放入動態 2.5D sketch。這說明「深度已被計算」與「已經擁有完整物體中心三維模型」不是同一件事。

因此本文採用一個重要澄清：

$$
2.5D
\neq
\text{fractional physical dimension}.
$$

本文中的 $2.5D$ 是一種表示類型標籤：

$$
\mathcal{G}_{2.5D}
=
\text{viewer-centered surface-plus-depth representation class}.
$$

它強調的是：

1. 表示有一個主要的視圖／表面域；
2. 深度或表面方向等屬性附著於該域；
3. 可見與不可見部分具有不對稱的資訊來源；
4. 表示與觀察者位置、姿態與感測條件相關；
5. 它可以支持強烈立體感，但不必等同於完整體積式三維世界資料庫。

---

# 4. 現代證據為何讓「單一完整 3D 內部世界」變得可疑

本文不主張 Marr 的 1982 架構就是現代視覺神經科學的最終答案。相反地，後續研究使問題變得更複雜。

Vishwanath 對三維知覺的綜述指出，傳統物理主義式模型常假設視覺系統推導出一個客觀、單一且大致忠實的外部三維世界表示；但現象學、心理物理與神經生理證據更支持至少三種可分離的空間編碼：相對／未定尺度深度、近空間的物體間尺度深度，以及較大行動尺度上的自我中心距離。這意味著：

$$
\text{3D perception}
\not\Rightarrow
\text{one unified 3D metric}.
$$

此外，人類知覺空間並不必然服從單一歐幾里得度量。Fernandez 與 Farell 的分析顯示，在常見的多線索整合假設下，知覺空間可能更適合由可變曲率的 Riemannian 結構描述。這至少說明：

$$
\text{perceived geometry}
\neq
\text{physical Euclidean geometry}
$$

不是一個荒謬的可能性，而是一個可以被心理物理研究正式處理的問題。

2024 年關於 binocular disparity 與 motion parallax 的研究也顯示，不同深度資訊來源可以對知覺空間施加不同的幾何轉換，而某些三維性質在不同條件下保持不變。這更支持「視覺空間是一個由多種線索與轉換共同形成的表示系統」，而不是單純把外部 $\mathbb{R}^3$ 複製進腦內。

---

# 5. 對《載體幾何與本體幾何》的修正

既有載體幾何框架曾提出：

$$
\operatorname{Geom}(L_{\mathrm{human}})
\approx
\mathbb{R}^3,
$$

並以此反駁「 $\mathbb{R}^3$ 是宇宙中立背景」的預設。

本文認為這個版本仍然過度給予人類視覺一個完整三維地位。

更保守的修正版是：

$$
\boxed{
\operatorname{NativeVisualGeometry}(L_H)
\approx
\mathcal{G}^{H}_{2.5D,\mathrm{ego}}
}
$$

其中：

- $L_H$ 為人類視覺載體；
- $\mathcal{G}^{H}_{2.5D,\mathrm{ego}}$ 不是單一固定幾何，而是一族觀察者中心、表面優先、深度附著的表示；
- 「 $\approx$ 」表示模型層的結構近似，而不是神經實體同一性宣稱。

人類最後形成的世界模型則可寫為：

$$
\widehat{W}_H(t)
=
\mathcal{I}
\left(
V_H(t),
M_{<t},
P_t,
A_t,
Q_t
\right),
$$

其中：

- $V_H(t)$：當前視覺表徵；
- $M_{<t}$：先前觀察與記憶；
- $P_t$：物體與世界先驗；
- $A_t$：身體行動與感覺運動資訊；
- $Q_t$：任務、注意與觀察條件；
- $\mathcal{I}$：跨來源整合算子。

因此：

$$
\boxed{
V_H(t)
\neq
\widehat{W}_H(t).
}
$$

「當下視覺表示」與「我所經驗到的完整世界」不是必然同一層。

---

# 6. 準 2.5D 表徵的最小形式

為避免把 2.5D 誤解成一張固定深度圖，本文只給出最小抽象形式。

令當前視覺域為：

$$
D_t
\subseteq
\mathbb{R}^2.
$$

在每個可視位置 $p\in D_t$ 上，視覺系統可估計一組屬性：

$$
\Phi_t(p)
=
\left(
\hat{d}_t,
\hat{n}_t,
\hat{o}_t,
\hat{m}_t,
\hat{c}_t,
\ldots
\right),
$$

其中可以分別代表：

- $\hat{d}_t$：深度或相對距離估計；
- $\hat{n}_t$：表面方向／法向相關資訊；
- $\hat{o}_t$：遮擋與前後次序；
- $\hat{m}_t$：運動／光流資訊；
- $\hat{c}_t$：估計信心、可靠度或線索權重。

則一個最小準 2.5D 表示可寫為：

$$
V_H(t)
=
\left(
D_t,
\Phi_t,
q_t
\right),
$$

其中 $q_t$ 為觀察者狀態，例如頭部姿態、眼球位置、身體位置與注意條件。

這個表示有深度，但它仍然與「在 $\mathbb{R}^3$ 每一個位置都維持完整世界狀態」不同。

後者更接近：

$$
\rho_t:
\mathbb{R}^3
\rightarrow
\mathcal{F},
$$

其中 $\rho_t(x,y,z)$ 對整個體積域都給出狀態。本文沒有足夠理由假定人類視覺在任何時刻都維持如此完整、高解析度、全域一致的內部場。

---

# 7. 可見表面與完整物體：資訊來源並不對稱

考慮一個球形物體。

當前觀察者直接取得的是某個可見表面集合：

$$
S_{\mathrm{vis}}(q_t)
\subset
S.
$$

其餘部分：

$$
S_{\mathrm{hid}}(q_t)
=
S
\setminus
S_{\mathrm{vis}}(q_t)
$$

在當下並未直接形成同樣的光學輸入。

然而主體通常仍會報告：

> 我看到一顆完整的球。

這表示主觀物體完整性至少可能包含：

$$
\text{visible evidence}
+
\text{object prior}
+
\text{memory}
+
\text{completion}.
$$

因此：

$$
\text{phenomenal object completeness}
>
\text{current directly sampled surface completeness}
$$

在一般情況下是合理的。

本文將這個差異稱為：

$$
\boxed{
\text{Phenomenal Completion Gap}
}
$$

即**現象完整性缺口**：主體經驗中的物體或世界完整性，大於當前感測通道直接提供的結構完整性。

這不是「幻覺」；它可能正是正常視覺能夠穩定行動的必要機制。

---

# 8. 為什麼純 2D 平面能產生強烈立體感

這一點將在系列 A02 專門展開，但在本文必須先指出其理論意義。

如果立體感要求視覺系統直接取得完整物理三維體積，那麼平面繪畫、照片與單眼透視圖應該極難產生穩定的空間深度感。

然而人類可以只靠：

$$
\text{perspective}
+
\text{occlusion}
+
\text{texture gradient}
+
\text{relative size}
+
\text{shading}
$$

在平面中形成相當強的三維形狀與空間配置感。

Vishwanath 特別將「二維圖像仍可產生三維性」視為理解三維知覺現象學的重要事實。近期對 pictorial space、binocular disparity 與 motion parallax 的比較，也顯示不同線索集合可以產生不同但有結構關係的知覺空間。

因此更自然的描述不是：

$$
2D\text{ image}
\rightarrow
\text{fake 3D},
$$

而是：

$$
2D\text{ carrier}
\xrightarrow{\text{depth cues}}
\mathcal{G}_{2.5D}
\xrightarrow{\text{integration}}
\text{3D-like world experience}.
$$

這說明人類的「立體感」更可能是一種可由特定線索結構觸發的建構結果，而不是物理三維體積本身直接灌入意識。

---

# 9. 核心命題：準三維載體命題

本文提出以下**待驗證命題**，而非既成神經科學定理。

## 命題 A01-1：原生三維非同一性

人類主觀具有穩定三維世界感，不足以推出其原生在線視覺表徵與完整歐幾里得三維空間同構：

$$
\boxed{
\text{3D phenomenology}
\not\Rightarrow
\operatorname{NativeVisualGeometry}(H)
\cong
\mathbb{R}^3.
}
$$

## 命題 A01-2：準 2.5D 載體假說

人類在線視覺表徵可被一類觀察者中心、可見表面優先且附帶深度／方向／遮擋資訊的表示族更好地近似：

$$
\boxed{
\operatorname{NativeVisualGeometry}(H)
\approx
\mathcal{G}^{H}_{2.5D,\mathrm{ego}}.
}
$$

## 命題 A01-3：三維世界感的整合生成

完整三維世界感可能主要由當前準三維表示與跨時間、跨感官、記憶及行動資訊整合而成：

$$
\boxed{
\widehat{W}_H
=
\mathcal{I}
\left(
V_{2.5D},
M,
P,
A,
T
\right).
}
$$

其中 $T$ 表示跨時間整合。

---

# 10. 這個命題不是什麼

為避免不必要的過度宣稱，本文明確排除以下解讀。

## 10.1 不是「大腦只有 2D」

錯。本文恰恰承認深度、表面方向、距離與空間配置會被神經系統建立。

## 10.2 不是「Marr 已經證明一切」

錯。Marr 提供的是重要的計算框架與歷史起點，不是今天所有視覺神經科學問題的最終答案。

## 10.3 不是「人類沒有 3D 知覺」

錯。人類具有強烈且功能上有效的三維知覺。本文質問的是它的**表示構成方式**，不是否認現象。

## 10.4 不是「外部世界一定不是 3D」

錯。從知覺載體的結構，不能直接推出物理世界的最終維度。

## 10.5 不是「2.5D 是真正物理維度」

錯。本文把 $2.5D$ 當作表示類型，不是宇宙維數。

---

# 11. 可反駁性與經驗判準

一個有價值的強命題必須告訴我們什麼證據會削弱它。

## 11.1 若存在穩定、任務無關的單一完整三維度量

如果未來研究能證明人類視覺始終維持一個：

1. 全域一致；
2. 視角不依賴；
3. 任務不依賴；
4. 對不可見區域具有與可見區域相近即時表示；
5. 服從單一穩定三維度量；

的內部空間模型，則本文的準 $2.5D$ 載體假說會被大幅削弱。

## 11.2 若不同深度線索不產生表示解離

本文預期 binocular disparity、motion parallax、pictorial cues、active movement 等來源，不只是為同一三維座標加入更多精度，而可能在不同條件下形成不同權重、不同尺度甚至不同局部幾何。

如果未來證據顯示所有線索都只是在一個固定 $\mathbb{R}^3$ 座標系中增加無偏估計精度，則本文需要修正。

## 11.3 若不可見部分具有完整即時體積表示

本文預期不可見物體部分更多依賴記憶、先驗與結構補完，而非與當下可見表面完全同質的感測表示。

這可以透過遮擋、快速視角變換、物體旋轉、change detection 與跨眼動更新實驗進一步檢驗。

---

# 12. 從 2.5D 回看「3D 是人類中心主義」

舊版載體幾何曾提出：

> $\mathbb{R}^3$ 不應被視為宇宙中性的本體背景，而應被視為人類載體的一種投影。

本文現在必須再修正一次：

> 甚至把 $\mathbb{R}^3$ 當成人類視覺的「原生幾何」，都可能過度簡化。

因此更完整的鏈條可能是：

$$
\mathcal{R}
\xrightarrow{\text{physical coupling}}
S_H
\xrightarrow{\text{sensory encoding}}
V_{2.5D}
\xrightarrow{\text{integration}}
\widehat{W}_{3D}
\xrightarrow{\text{formalization}}
\mathbb{R}^3,
$$

其中：

- $\mathcal{R}$：未知實在；
- $S_H$：人類可耦合的感測訊號；
- $V_{2.5D}$：準三維知覺表示；
- $\widehat{W}_{3D}$：認知上的三維世界模型；
- $\mathbb{R}^3$：形式化後的數學表示。

這意味著：

$$
\boxed{
\mathbb{R}^3
\neq
\widehat{W}_{3D}
\neq
V_{2.5D}
\neq
\mathcal{R}.
}
$$

它們之間存在成功映射，不代表它們具有本體同一性。

---

# 13. 對高維幾何問題的第一個後果

如果本文的修正成立，那麼人類面對 $4D$ 、 $5D$ 或更高維結構時，問題不再是：

$$
3D
\rightarrow
4D
\rightarrow
5D.
$$

因為人類的原生感知起點可能本來就不是一個完整的 $3D$ 內部流形。

更合理的描述是：

$$
\mathcal{G}^{H}_{2.5D}
\xrightarrow{\text{projection / animation / analogy / symbol}}
\mathcal{M}_n,
\qquad
n\geq 4,
$$

其中 $\mathcal{M}_n$ 是某個高維形式模型。

因此：

$$
\text{formal access to } \mathcal{M}_n
$$

和：

$$
\text{native phenomenal access to } \mathcal{M}_n
$$

從一開始就是不同問題。

這將直接導向本系列 A03–A06 所處理的高維視覺化、候選爆炸、符號實在與高維逆問題。

---

# 14. 方法論原則：不要把方便的表示誤認為世界本身

本文最終要建立的不是一句「人類只看 2.5D」，而是一條更一般的方法論：

$$
\boxed{
\text{Representation Success}
\not\Rightarrow
\text{Ontological Identity}.
}
$$

一個表示可以：

- 導航非常成功；
- 抓取非常成功；
- 預測非常成功；
- 數學上非常精確；

卻仍不需要與其所表示的本體具有一一同構。

對視覺如此，對高維幾何亦然。

因此，比「人類到底看幾維」更重要的問題是：

$$
\boxed{
\text{某個載體為完成其任務，究竟需要保留哪些幾何不變量？}
}
$$

也許生物演化根本沒有理由維護一份昂貴、全域、體積式、客觀座標化的三維世界副本；只要能穩定支援：

$$
\text{避障}
+
\text{抓取}
+
\text{導航}
+
\text{辨識}
+
\text{預測}
$$

就已經足夠。

這是載體幾何從「維度哲學」轉向「可操作表示論」的重要一步。

---

# 15. 結論

本文對既有《載體幾何與本體幾何》做出第一個正式修正。

原命題過度簡化地寫成：

$$
\operatorname{Geom}(L_H)
\approx
\mathbb{R}^3.
$$

本文建議改為：

$$
\boxed{
\operatorname{NativeVisualGeometry}(L_H)
\approx
\mathcal{G}^{H}_{2.5D,\mathrm{ego}},
}
$$

並把人類穩定的三維世界感建模為：

$$
\boxed{
\widehat{W}_{3D}
=
\mathcal{I}
\left(
V_{2.5D},
M,
P,
A,
T
\right).
}
$$

因此，「人類看到三維世界」可以在行動與現象學上為真，但「人類原生視覺維持完整 $\mathbb{R}^3$ 世界模型」並不能由前者直接推出。

這一修正帶來的最深後果不是降低人類視覺能力，而是取消一個隱藏已久的等號：

$$
\boxed{
\text{世界感}
\neq
\text{感測表示}
\neq
\text{數學幾何}
\neq
\text{本體實在}.
}
$$

而一旦這四者被拆開，我們才真正有資格重新討論 $4D$ 、 $5D$ 、 $XD$ 高維幾何究竟是感知延伸、形式延伸、物理候選，還是本體結構。

---

# 參考文獻

1. Marr, D. & Nishihara, H. K. (1978). *Representation and recognition of the spatial organization of three-dimensional shapes*. Proceedings of the Royal Society of London. Series B, 200(1140), 269–294. DOI: 10.1098/rspb.1978.0020.
2. Marr, D. & Poggio, T. (1979). *A computational theory of human stereo vision*. Proceedings of the Royal Society of London. Series B, 204(1156), 301–328. DOI: 10.1098/rspb.1979.0029.
3. Marr, D. (1982/2010). *Vision: A Computational Investigation into the Human Representation and Processing of Visual Information*. MIT Press.
4. Fernandez, J. M. & Farell, B. (2009). *Is perceptual space inherently non-Euclidean?* Journal of Mathematical Psychology, 53(2), 86–91. DOI: 10.1016/j.jmp.2008.12.006.
5. Ağaoğlu, M. N., Herzog, M. H. & Öğmen, H. (2012). *Non-retinotopic feature processing in the absence of retinotopic spatial layout and the construction of perceptual space from motion*. Vision Research, 71, 10–17. DOI: 10.1016/j.visres.2012.08.009.
6. Hisakata, R., Nishida, S. & Johnston, A. (2016). *An Adaptable Metric Shapes Perceptual Space*. Current Biology, 26(14), 1911–1915. DOI: 10.1016/j.cub.2016.05.047.
7. Lappin, J. S. & Bell, H. H. (2021). *Form and Function in Information for Visual Perception*. i-Perception. DOI: 10.1177/20416695211053352.
8. Vishwanath, D. (2023). *From pictures to reality: modelling the phenomenology and psychophysics of 3D perception*. Philosophical Transactions of the Royal Society B, 378(1869), 20210454. DOI: 10.1098/rstb.2021.0454.
9. Wang, M. W. X. & Troje, N. F. (2024). *Relating visual and pictorial space: Integration of binocular disparity and motion parallax*. Journal of Vision, 24(13), 7. DOI: 10.1167/jov.24.13.7.
10. Neo.K (2026). *載體幾何與本體幾何——閉合性 Cl 的維度無關性與對人類視覺直觀的本體論去自然化*. v1.0, Dynamic Closure Ontology / EveMissLab internal research series.

---

# 系列接口

下一篇：

**A02《平面為何能產生立體感：透視、錯視與 2D→2.5D 感知升維》**

將正式處理：

$$
2D\text{ carrier}
\rightarrow
\text{depth-cue field}
\rightarrow
\mathcal{G}_{2.5D}
\rightarrow
\text{3D-like phenomenology},
$$

並重新形式化透視法、明暗法、遮擋、紋理梯度與 anamorphosis，使其從「藝術技巧」提升為可比較的感知幾何工程。
