# 線性、空間、圖像與多模態符號結構：載體可供性、投影契約與跨模態語義保持

**Linear, Spatial, Visual, and Multimodal Symbolic Structures: Carrier Affordances, Projection Contracts, and Cross-Modal Semantic Preservation**

版本：v0.1  
日期：2026-07-28  
文件性質：基礎理論與多模態結構框架論文  
系列：符號結構工程系列，第 3 篇  
建議文件代號：`EML-SSE-03-2026-v0.1`

---

## 摘要

符號不只因字形、詞彙與語法而不同，也因其所依附的載體而具有不同結構能力。文字序列擅長保存先後、作用域與可重放順序；空間布局可同時承載鄰接、包含、方向、分區與尺度；圖像可透過形狀、連續變化、相似性與整體構圖高密度呈現結構；圖論式符號能明示節點與關係；聲音與音樂原生承載時間、節奏、重音與並行聲部；手勢與動作則將指向、姿態、軌跡、力量與環境互動納入符號。多模態系統可以使不同載體互補，但也可能產生衝突、冗餘、時間錯位與權威不明。

本文提出線性、空間、圖像與多模態符號結構的統一研究框架。本文首先區分「符號結構」「物理或數位載體」「呈現布局」「語義關係」與「操作結果」。同一概念結構可以被投影為文字、圖、矩陣、語音、動畫或互動介面；同一畫面位置則不必代表穩定語義。本文因此提出核心限制：序列先後不必等於因果先後，空間鄰近不必等於語義相關，圖像相似不必等於身份相同，多模態同步也不必等於彼此相互驗證。

本文建立「載體可供性」（Carrier Affordance）概念。不同載體並不直接決定意義，但會降低某些關係的表達與解碼成本。例如，線性文字低成本表達順序與層級語法，空間布局低成本表達鄰接與包含，圖像低成本表達連續幾何與整體形態，聲音低成本表達節奏與時間變化，手勢低成本表達指向與動作意圖。載體可供性因此是符號工程中的成本結構，而非本體真理。

本文進一步提出「投影契約」（Projection Contract）。任何從權威概念結構到特定載體的投影，都應說明哪些關係被保留、哪些被近似、哪些被省略，以及哪些顯示特徵只為可讀性服務。沒有投影契約時，讀者可能把視覺靠近誤認為因果、把箭頭誤認為執行、把顏色誤認為可信度、把動畫順序誤認為歷史順序。本文亦提出反向重建契約，用以描述讀者或 AI 如何由投影恢復概念結構。

本文將多模態組合區分為冗餘、互補、分工、條件觸發、交叉校驗、競爭與衝突七種型態。兩個模態同時表達相同內容，可能提高魯棒性，也可能只增加注意力負擔；不同模態表達不同關係，則可能形成更完整的概念結構。本文提出多模態權威規則：當文字、圖像、聲音、介面狀態與工具資料互相矛盾時，系統必須依來源、版本、任務與治理規則決定是並列、降權、要求澄清或阻止執行，而不能任意選擇最顯眼的模態。

本文也處理跨模態身份保持。若同一概念在文件、圖像、格子、程式與語音中出現，應使用穩定身份、版本與來源映射，而不是只依名稱、顏色或畫面位置辨識。本文提出「跨模態符號投影與偶合框架」（Cross-Modal Symbolic Projection and Coupling Framework, CSPCF）與「多模態符號結構引擎」（Multimodal Symbolic Structure Engine, MSSE），用以管理權威概念圖、模態投影、時間同步、衝突、身份映射、互動手勢與操作提交。

本文最後提出比較實驗：同一概念分別使用純文字、圖像、圖結構、動畫、聲音與多模態介面表達，測量關係重建、操作成功、學習時間、記憶保持、轉譯失真與認知負擔。本文主張，不存在普遍最佳模態；符號載體的有效性取決於概念結構、任務、觀測者、工具與治理環境。

**關鍵詞：** 線性符號、空間符號、圖像符號、多模態、載體可供性、投影契約、跨模態身份、語義保持、符號結構工程、人機介面

---

# 1. 問題起點：同一概念換一個載體，不只是換外觀

假設概念結構為：

$$
K
$$

它可以被表示成：

- 一段文字；
- 一張節點圖；
- 一個矩陣；
- 一張示意圖；
- 一段動畫；
- 一組聲音；
- 一個手勢；
- 一個可操作介面。

形式上：

$$
P_m:
K
\rightarrow
s_m
$$

其中 $m$ 代表模態或載體。

常見假設是：

$$
s_{m_1}
\equiv
s_{m_2}
$$

因為它們「都在表達同一件事」。

但不同投影可能保留不同關係：

$$
R(P_{m_1}(K))
\neq
R(P_{m_2}(K))
$$

例如：

- 文字保留精確限定語；
- 圖像保留空間形態；
- 動畫保留變化順序；
- 圖結構保留明示關係；
- 聲音保留節奏與重音；
- 介面保留可操作狀態。

因此：

$$
\boxed{
\text{Changing the Carrier}
\neq
\text{Changing Appearance Only}
}
$$

---

# 2. 五個層級必須分離

本文區分：

## 2.1 概念結構

$$
K
$$

包含概念、關係、狀態、操作與約束。

## 2.2 符號結構

$$
S
$$

將概念結構編碼為可傳遞符號。

## 2.3 載體

$$
M
$$

例如文字流、畫布、螢幕、紙張、聲音、動作或虛擬空間。

## 2.4 呈現布局

$$
L
$$

例如順序、座標、顏色、大小、節奏與動畫。

## 2.5 操作結果

$$
A
$$

符號被閱讀、執行或互動後產生的狀態變化。

因此：

$$
\boxed{
K
\neq
S
\neq
M
\neq
L
\neq
A
}
$$

混淆這五層，會讓視覺樣式被誤認為語義，或讓介面操作被誤認為權威狀態改寫。

---

# 3. 模態與載體

本文將模態記為：

$$
m
\in
\mathcal M
$$

常見模態包括：

- 線性文字；
- 數學序列；
- 圖結構；
- 二維空間；
- 三維空間；
- 圖像；
- 聲音；
- 音樂；
- 動畫；
- 手勢；
- 觸覺；
- 互動介面；
- 混合實境。

同一物理載體可以承載多種模態。例如螢幕可同時承載文字、圖像、動畫與互動。

---

# 4. 載體可供性

本文提出：

# Carrier Affordance

中文稱：

# 載體可供性

定義為：

$$
\mathcal A_m(r)
$$

表示模態或載體 $m$ 表達關係 $r$ 時，所提供的結構便利與成本優勢。

可供性不是：

$$
m
\Rightarrow
r
$$

而是：

$$
C_{\mathrm{encode}}(r\mid m)
+
C_{\mathrm{decode}}(r\mid m)
$$

可能較低。

---

# 5. 可供性不是語義決定論

二維畫布適合呈現鄰接，但畫面鄰接不必代表語義鄰接。

文字序列適合呈現先後，但句子先後不必代表因果先後。

因此：

$$
\boxed{
\text{Carrier Affordance}
\neq
\text{Semantic Necessity}
}
$$

載體降低某些表達成本，卻不自動賦予那些關係。

---

# 6. 線性符號結構

線性符號結構可表示為：

$$
s
=
\left(
\sigma_1,\sigma_2,\ldots,\sigma_n
\right)
$$

其原生結構是：

- 位置；
- 先後；
- 鄰接；
- 重複；
- 分隔；
- 嵌套標記；
- 作用域。

---

# 7. 線性的主要優勢

## 7.1 可重放

讀者可依序重建：

$$
\sigma_1
\rightarrow
\sigma_2
\rightarrow
\cdots
\rightarrow
\sigma_n
$$

## 7.2 語法清楚

透過語序、括號、標點與區塊建立作用域。

## 7.3 適合程序

步驟、推導、演算法與故事時間可依序表達。

## 7.4 易於儲存與傳輸

線性序列適合傳統文件、通訊與程式處理。

---

# 8. 線性的成本

## 8.1 平行關係序列化

原本同時存在的關係，必須被拆成順序。

## 8.2 遠距依賴

相距很遠的符號可能仍有語法或語義關係。

## 8.3 全局結構難以一次觀察

讀者需在記憶中保存前文。

## 8.4 路徑偏置

作者選定的敘述順序可能被誤認為唯一合理順序。

---

# 9. 線性順序的四種語義

序列中的先後可能表示：

1. 文字排列；
2. 時間先後；
3. 因果先後；
4. 執行順序。

這四者一般不相同：

$$
O_{\mathrm{text}}
\neq
O_{\mathrm{time}}
\neq
O_{\mathrm{causal}}
\neq
O_{\mathrm{execution}}
$$

只有明確宣告時，線性順序才具有特定語義。

---

# 10. 線性作用域

線性語言透過：

- 括號；
- 縮排；
- 標點；
- 關鍵詞；
- 區塊；

建立非線性層級。

例如：

$$
A(B(C))
$$

表示嵌套關係，而不只是字元先後。

因此線性載體可以編碼非線性結構，只是需要額外標記與解碼。

---

# 11. 空間符號結構

空間符號結構可表示為：

$$
S_{\mathrm{space}}
=
\left(
O,
P,
R,
Z,
B
\right)
$$

其中：

- $O$ ：物件；
- $P$ ：位置；
- $R$ ：關係；
- $Z$ ：尺度；
- $B$ ：區域與邊界。

---

# 12. 空間的主要可供性

空間低成本表達：

- 鄰接；
- 包含；
- 分區；
- 方向；
- 距離；
- 群聚；
- 對稱；
- 尺度；
- 中心與周邊；
- 路徑。

---

# 13. 顯示空間與語義空間

本文再次區分：

$$
P_{\mathrm{display}}
$$

與：

$$
P_{\mathrm{semantic}}
$$

一般：

$$
P_{\mathrm{display}}
\neq
P_{\mathrm{semantic}}
$$

只有在明確剖面下：

$$
P_{\mathrm{display}}
\xRightarrow{\pi}
P_{\mathrm{semantic}}
$$

其中 $\pi$ 是位置語義契約。

---

# 14. 空間鄰近的多種可能

兩個物件靠近，可能表示：

- 語義相似；
- 同一任務；
- 同一版本；
- 同一位置；
- 同一權限域；
- 只是布局演算法結果；
- 使用者臨時拖在一起。

因此：

$$
\boxed{
\text{Spatial Proximity}
\neq
\text{Semantic Relatedness}
}
$$

---

# 15. 包含與邊界

將物件放入同一區域，可能表示：

- 類別包含；
- 權限域；
- 工作群組；
- 版本分支；
- 視覺整理；
- 暫存區。

邊界必須具有型別：

$$
B_i^{(\tau)}
$$

例如：

- `semantic-group`；
- `permission-zone`；
- `visual-cluster`；
- `execution-scope`；
- `world-region`。

---

# 16. 尺度與語義縮放

空間介面可以根據縮放層級顯示不同內容：

$$
P_z(K)
$$

但幾何放大與語義展開不同：

$$
Z_{\mathrm{geometric}}
\neq
Z_{\mathrm{semantic}}
$$

語義縮放需要定義：

- 哪些關係在遠距離顯示；
- 哪些細節在近距離顯示；
- 是否保留身份；
- 是否保留來源。

---

# 17. 圖結構與空間布局的分離

圖結構：

$$
G
=
(V,E,\tau)
$$

由節點、邊與關係型別構成。

圖的畫面布局：

$$
L(G)
$$

只是其中一種投影。

因此：

$$
\boxed{
\text{Graph Structure}
\neq
\text{Graph Drawing}
}
$$

同一圖可以有多種布局而不改變權威關係。

---

# 18. 圖結構的優勢

圖結構適合明示：

- 關係；
- 依賴；
- 因果；
- 來源；
- 版本；
- 路由；
- 身份映射。

但大型圖容易產生：

- 邊爆炸；
- 視覺遮蔽；
- 關係型別混淆；
- 局部可讀但全局不可讀。

---

# 19. 圖像符號結構

圖像不必由離散符號組成。

可表示為：

$$
I:
\Omega
\rightarrow
\mathcal V
$$

其中：

- $\Omega$ ：空間域；
- $\mathcal V$ ：顏色、亮度、紋理或其他視覺量。

圖像可以承載：

- 形狀；
- 連續變化；
- 比例；
- 邊界；
- 遮擋；
- 視角；
- 整體構圖；
- 相似性。

---

# 20. 圖像的高並行密度

圖像允許觀測者同時接收大量局部關係。

但「同時可見」不表示「同時被理解」。

有效圖像理解仍受：

- 視覺注意；
- 圖像素養；
- 標記；
- 文化；
- 任務；
- 解析度；

影響。

---

# 21. 圖像相似與概念身份

兩個圖像相似，可能表示：

- 同一物件；
- 同類物件；
- 同一風格；
- 同一姿態；
- 同一生成模板；
- 偶然相似。

因此：

$$
\boxed{
\text{Visual Similarity}
\neq
\text{Identity}
}
$$

需要穩定身份、來源與版本進行確認。

---

# 22. 圖像中的隱含關係

圖像常透過：

- 遮擋；
- 大小；
- 視角；
- 方向；
- 光影；
- 構圖中心；
- 動作姿勢；

暗示關係。

這些關係可能來自：

- 物理；
- 文化慣例；
- 藝術風格；
- 介面設計；
- 觀測者推斷。

因此圖像解讀高度依賴語境。

---

# 23. 示意圖與寫實圖的差異

寫實圖傾向保留外觀連續性。

示意圖傾向保留任務相關結構。

因此：

$$
I_{\mathrm{realistic}}
$$

與：

$$
I_{\mathrm{schematic}}
$$

可能在不同任務中有不同效率。

例如維修、導航與因果解釋常需要示意圖，而非高寫實圖像。

---

# 24. 顏色不是普遍語義

顏色可表示：

- 類別；
- 狀態；
- 風險；
- 可信度；
- 熱度；
- 使用率；
- 美學。

若沒有圖例：

$$
color
\not\Rightarrow
meaning
$$

多個指標也不能任意合併到單一色階。

---

# 25. 聲音與時間符號

聲音可表示為：

$$
a(t)
$$

其原生結構包括：

- 時間；
- 節奏；
- 重音；
- 音高；
- 音色；
- 持續；
- 重複；
- 並行聲部；
- 空間方位。

---

# 26. 聲音的主要優勢

## 26.1 原生時間性

不需要額外符號表示持續與節奏。

## 26.2 重音與語氣

可表達重要性、疑問、情緒與句法邊界。

## 26.3 背景監測

人可在不持續注視畫面的情況下接收警報。

## 26.4 多聲部

可以同時承載多條時間序列。

---

# 27. 聲音的限制

- 難以隨機存取；
- 記憶負擔高；
- 重放需要時間；
- 精確引用困難；
- 噪音與環境影響大；
- 不適合長期保存複雜靜態結構。

因此聲音常需與文字或圖像互補。

---

# 28. 語音文字轉換的損失

語音轉文字可能丟失：

- 重音；
- 語氣；
- 停頓；
- 說話者；
- 音色；
- 重疊語音；
- 不確定程度。

文字轉語音則需要重新生成這些特徵。

因此：

$$
P_{\mathrm{speech\rightarrow text}}
$$

通常不是無損投影。

---

# 29. 手勢與動作符號

手勢可表示為：

$$
g(t)
=
\left(
p(t),
v(t),
d(t),
f(t),
c(t)
\right)
$$

其中：

- $p(t)$ ：位置；
- $v(t)$ ：速度；
- $d(t)$ ：方向；
- $f(t)$ ：力量；
- $c(t)$ ：環境與身體語境。

---

# 30. 手勢的主要能力

手勢可低成本表達：

- 指向；
- 選取；
- 軌跡；
- 大小；
- 旋轉；
- 分組；
- 拒絕；
- 停止；
- 動作示範；
- 空間關係。

---

# 31. 手勢高度依賴語境

同一動作可能因：

- 文化；
- 裝置；
- 角色；
- 當前模式；
- 空間；
- 視角；

具有不同意義。

因此手勢需要：

$$
\text{Gesture}
+
\text{Mode}
+
\text{Target}
+
\text{Context}
$$

才能形成穩定操作。

---

# 32. 手勢與執行

某些手勢只是表達意圖，某些直接改變系統狀態。

應區分：

- `gesture_display`；
- `gesture_request`；
- `gesture_attention`；
- `gesture_commit`。

例如拖曳預設可能只改畫面位置，而不是改變語義或執行順序。

---

# 33. 動畫符號

動畫可表示：

$$
I(x,y,t)
$$

同時承載空間與時間。

適合表達：

- 狀態轉移；
- 流程；
- 物理運動；
- 因果候選；
- 變形；
- 漸進變化。

---

# 34. 動畫順序與歷史順序

動畫可為：

- 真實歷史重放；
- 教學示意；
- 預測；
- 反事實；
- 循環展示；
- 美學效果。

因此：

$$
\boxed{
\text{Animation Sequence}
\neq
\text{Historical Sequence}
}
$$

必須標記動畫的語義類型。

---

# 35. 多模態符號結構

多模態表達可表示為：

$$
S^{\mathrm{multi}}
=
\left\{
S^{(m_1)},
S^{(m_2)},
\ldots,
S^{(m_k)}
\right\}
$$

但多模態不是簡單相加。

需要偶合結構：

$$
\mathcal C_{\mathrm{multi}}
$$

說明不同模態如何共同形成意義。

---

# 36. 七種多模態偶合

## 36.1 冗餘

不同模態重複相同內容。

## 36.2 互補

不同模態提供不同必要部分。

## 36.3 分工

各模態負責不同關係類型。

## 36.4 條件觸發

某模態改變另一模態的解讀或顯示。

## 36.5 交叉校驗

不同來源模態相互檢查。

## 36.6 競爭

多個模態爭奪同一注意力或解釋位置。

## 36.7 衝突

不同模態提供不相容內容。

---

# 37. 冗餘的價值與成本

冗餘可提高：

- 無障礙；
- 魯棒性；
- 記憶；
- 噪音容忍；
- 多種學習路徑。

但也可能增加：

- 認知負擔；
- 畫面擁擠；
- 同步成本；
- 更新不一致；
- 虛假獨立證據感。

---

# 38. 多模態互補

若文字表達精確條件，圖像表達結構，動畫表達變化，聲音表達警報，則：

$$
K
=
K_{\mathrm{text}}
\cup
K_{\mathrm{image}}
\cup
K_{\mathrm{motion}}
\cup
K_{\mathrm{audio}}
$$

但必須確認這些片段是否指向同一身份與版本。

---

# 39. 多模態分工契約

定義：

$$
\mathcal C_{\mathrm{role}}
:
m
\mapsto
R_m
$$

例如：

- 文字：定義與限制；
- 圖：結構與依賴；
- 動畫：狀態變化；
- 聲音：即時警報；
- 手勢：使用者操作。

這能降低模態間爭奪同一語義。

---

# 40. 多模態同步

多模態需要時間對齊：

$$
\tau_{m_i}
\leftrightarrow
\tau_{m_j}
$$

例如影片字幕、動作與聲音需對應。

同步錯誤可能改變：

- 說話者；
- 因果；
- 操作目標；
- 情緒；
- 事件先後。

---

# 41. 多模態衝突

若：

$$
K_{m_1}
\not\cong
K_{m_2}
$$

系統不能任意相信：

- 最顯眼的模態；
- 最新模態；
- 文字模態；
- 圖像模態。

需要依：

- 來源；
- 權威；
- 版本；
- 任務；
- 時間；
- 感測可靠度；
- 治理政策；

決定處理方式。

---

# 42. 多模態權威

可以定義：

$$
A(m,r,T)
$$

表示模態 $m$ 對關係 $r$ 與任務 $T$ 的權威程度。

例如：

- 文字契約對法律限制較權威；
- 感測資料對即時溫度較權威；
- 原始影像對外觀較權威；
- 版本控制紀錄對程式修改歷史較權威。

權威是關係與任務相對的，不是模態絕對屬性。

---

# 43. 衝突處理策略

多模態衝突可以：

- 並列顯示；
- 降低確定度；
- 要求澄清；
- 回溯來源；
- 使用第三模態驗證；
- 阻止執行；
- 建立版本分支；
- 交由人類判斷。

---

# 44. 跨模態身份

同一概念可有：

$$
s_{\mathrm{text}},
s_{\mathrm{image}},
s_{\mathrm{audio}},
s_{\mathrm{graph}},
s_{\mathrm{code}}
$$

需要共同指向：

$$
id(K)
$$

因此：

$$
id(s_{\mathrm{text}})
=
id(s_{\mathrm{image}})
=
\cdots
=
id(K)
$$

或至少存在可追蹤映射。

---

# 45. 名稱、外觀與身份的分離

不同模態中：

- 名稱可改變；
- 圖像可重繪；
- 音訊可重錄；
- 圖布局可改變；
- 程式表示可重構。

但概念身份可以保持。

因此：

$$
\boxed{
\text{Cross-Modal Identity}
\neq
\text{Surface Similarity}
}
$$

---

# 46. 投影契約

本文提出：

# Projection Contract

記為：

$$
\mathcal P_c
=
\left(
K,
m,
R^{+},
R^{\approx},
R^{-},
I,
V
\right)
$$

其中：

- $K$ ：來源概念結構；
- $m$ ：目標模態；
- $R^{+}$ ：被保留關係；
- $R^{\approx}$ ：近似表達關係；
- $R^{-}$ ：被省略關係；
- $I$ ：身份映射；
- $V$ ：版本與來源。

---

# 47. 投影契約的作用

它回答：

- 這張圖保留了什麼？
- 哪些箭頭只是視覺導航？
- 哪些顏色代表狀態？
- 哪些細節被省略？
- 是否可由圖重建完整概念？
- 是否可由這個投影直接執行？

---

# 48. 反向重建契約

定義：

$$
\mathcal D_c
:
S_m
\rightarrow
\widehat K
$$

記錄觀測者或 AI 應如何由投影恢復：

- 節點；
- 關係；
- 身份；
- 版本；
- 不確定性。

不是所有投影都允許完整反向重建。

---

# 49. 投影失真

定義：

$$
\delta_m
=
D
\left(
K,
\widehat K_m
\right)
$$

失真包括：

- 關係遺失；
- 方向誤判；
- 身份混淆；
- 尺度錯誤；
- 時序錯誤；
- 權限資訊消失；
- 不確定性被抹平。

---

# 50. 投影不是翻譯的附屬問題

從文字到圖像、圖像到程式、程式到動畫，都是符號結構重編譯。

因此：

$$
\boxed{
\text{Cross-Modal Projection}
=
\text{Structural Translation}
}
$$

而非單純格式轉換。

---

# 51. 模態選擇

對任務 $T$ 與概念 $K$ ，選擇模態：

$$
m^{*}
=
\arg\max_m
\operatorname{Utility}
\left(
m,K,T,o
\right)
$$

效用可包含：

- 重建品質；
- 操作速度；
- 記憶保持；
- 無障礙；
- 製作成本；
- 更新成本；
- 轉譯成本；
- 治理風險。

---

# 52. 不存在普遍最佳模態

文字不必普遍優於圖像，圖像也不必普遍優於文字。

例如：

- 精確規則適合文字或形式語言；
- 幾何關係適合圖像；
- 時間變化適合動畫或聲音；
- 可執行流程適合圖與程式結合；
- 高風險提交需要文字契約與操作預覽。

---

# 53. 模態配置

一個完整系統可採：

$$
\mathcal M_T^{*}
=
\left\{
m_1,m_2,\ldots,m_k
\right\}
$$

並分配：

- 主模態；
- 輔助模態；
- 驗證模態；
- 無障礙替代；
- 權威來源模態。

---

# 54. 模態注意力預算

多模態系統需要管理：

$$
\mathbf B_{\mathrm{modal}}
=
\left(
B_{\mathrm{text}},
B_{\mathrm{visual}},
B_{\mathrm{audio}},
B_{\mathrm{motion}},
B_{\mathrm{interaction}}
\right)
$$

全部同時展示，可能造成注意力過載。

應依任務動態顯影。

---

# 55. 模態轉換鏈

例如：

$$
K
\rightarrow
\text{文字}
\rightarrow
\text{圖}
\rightarrow
\text{動畫}
\rightarrow
\text{AI 摘要}
$$

每一步都可能累積失真：

$$
\delta_{\mathrm{total}}
\leq
\sum_i
\delta_i
$$

也可能因重新解釋產生非線性失真。

---

# 56. 模態權力

主模態會影響：

- 哪些內容被視為權威；
- 哪些使用者能參與；
- 哪些工具能解析；
- 哪些關係被優先注意；
- 哪些錯誤容易被發現。

例如只提供圖像，會排除不能看圖或無法解析圖的主體；只提供形式符號，也會提高專業門檻。

---

# 57. 無障礙等價投影

重要概念應提供：

- 文字說明；
- 結構化資料；
- 圖像替代文字；
- 字幕；
- 逐步控制；
- 鍵盤操作；
- 聲音之外的警報。

但「等價」不表示表面相同，而是對關鍵任務提供足夠關係。

---

# 58. 多模態安全

風險包括：

- 圖像中的提示注入；
- 音訊隱藏指令；
- 介面偽裝；
- 字幕與聲音不一致；
- 手勢誤提交；
- 動畫掩蓋狀態改寫；
- 跨模態權限穿透。

系統應區分資料、指令、建議與控制。

---

# 59. 多模態符號投影與偶合框架

本文建立：

# Cross-Modal Symbolic Projection and Coupling Framework

縮寫：

# CSPCF

定義：

$$
\operatorname{CSPCF}
=
\left(
K,
\mathcal M,
\mathcal P,
\mathcal C,
\mathcal I,
\mathcal T,
\mathcal A,
\mathcal V,
\mathcal G
\right)
$$

其中：

- $K$ ：權威概念結構；
- $\mathcal M$ ：模態集合；
- $\mathcal P$ ：投影契約；
- $\mathcal C$ ：多模態偶合；
- $\mathcal I$ ：跨模態身份；
- $\mathcal T$ ：時間同步；
- $\mathcal A$ ：模態權威；
- $\mathcal V$ ：驗證與失真分析；
- $\mathcal G$ ：治理。

---

# 60. 多模態符號結構引擎

本文將工程系統命名為：

# Multimodal Symbolic Structure Engine

縮寫：

# MSSE

定義：

$$
\operatorname{MSSE}
=
\left(
\mathcal K,
\mathcal R,
\mathcal P,
\mathcal M,
\mathcal S,
\mathcal I,
\mathcal D,
\mathcal O,
\mathcal L
\right)
$$

其中：

- $\mathcal K$ ：權威概念與關係；
- $\mathcal R$ ：模態可供性註冊表；
- $\mathcal P$ ：投影器；
- $\mathcal M$ ：模態資源；
- $\mathcal S$ ：同步器；
- $\mathcal I$ ：身份映射；
- $\mathcal D$ ：衝突與失真檢測；
- $\mathcal O$ ：互動與操作契約；
- $\mathcal L$ ：版本與投影帳本。

---

# 61. MSSE 系統流程

```text
Authoritative Concept Structure
            ↓
Task / Observer / Accessibility Analysis
            ↓
Modality Selection
            ↓
Projection Contracts
            ↓
Text / Graph / Image / Audio / Motion / Gesture
            ↓
Cross-Modal Identity and Synchronization
            ↓
Human or AI Reconstruction
            ↓
Conflict and Distortion Detection
            ↓
Clarification / Reprojection / Operation
            ↓
Projection and Interaction Ledger
```

---

# 62. 投影契約資料模型

```json
{
  "projection_contract": {
    "contract_id": "projection-001",
    "concept_id": "concept-003",
    "target_modality": "graph",
    "preserved_relations": [
      "depends_on",
      "derived_from",
      "version_of"
    ],
    "approximated_relations": [
      "semantic_similarity"
    ],
    "omitted_relations": [
      "full_textual_definition"
    ],
    "layout_semantics": "display_only",
    "edge_semantics": "typed",
    "identity_mapping": "stable",
    "reversible": "partial",
    "version": "v0.1"
  }
}
```

---

# 63. 多模態偶合資料模型

```json
{
  "multimodal_coupling": {
    "coupling_id": "coupling-001",
    "concept_id": "concept-003",
    "modalities": {
      "text": {
        "role": "definition_and_constraints"
      },
      "graph": {
        "role": "relation_structure"
      },
      "animation": {
        "role": "state_transition"
      },
      "audio": {
        "role": "critical_alert"
      }
    },
    "coupling_type": "complementary",
    "synchronization": {
      "required": true,
      "authority_clock": "runtime-event-time"
    },
    "conflict_policy": "block_high_risk_action"
  }
}
```

---

# 64. 跨模態衝突資料模型

```json
{
  "cross_modal_conflict": {
    "conflict_id": "modal-conflict-018",
    "concept_id": "concept-003",
    "modalities": [
      "text",
      "diagram"
    ],
    "relation": "execution_order",
    "text_claim": "A executes before B",
    "diagram_claim": "B visually precedes A",
    "authority": {
      "text": "runtime_specification",
      "diagram": "illustrative_only"
    },
    "decision": "follow_text_and_update_diagram",
    "operation_blocked": false
  }
}
```

---

# 65. 最小 API 草案

```text
analyze_modality_affordance(
  concept_structure,
  task,
  observer
) -> ModalityAffordanceReport

create_projection_contract(
  concept_structure,
  target_modality,
  preservation_requirements
) -> ProjectionContract

project_symbolic_structure(
  concept_structure,
  projection_contract
) -> ModalRepresentation

synchronize_modalities(
  representations,
  synchronization_profile
) -> SynchronizedBundle

detect_cross_modal_conflicts(
  modal_bundle,
  authority_profile
) -> ConflictReport

reconstruct_concept(
  modal_representation,
  observer_profile,
  reconstruction_contract
) -> ReconstructedConcept

validate_cross_modal_identity(
  representations,
  identity_registry
) -> IdentityValidation
```

---

# 66. 基準實驗

## 66.1 純文字與純圖比較

測量：

- 關係召回；
- 定義精度；
- 閱讀時間；
- 記憶。

## 66.2 文字加圖

檢查互補是否優於單一模態。

## 66.3 圖布局誤導

改變布局但保持圖結構，觀察讀者是否誤判語義。

## 66.4 圖像身份測試

提供相似外觀但不同身份的物件。

## 66.5 語音轉文字損失

測量重音、停頓與說話者資訊丟失。

## 66.6 動畫時序測試

比較歷史重放、教學動畫與反事實動畫的辨識。

## 66.7 手勢提交測試

區分顯示拖曳、注意力拖曳與權威操作。

## 66.8 多模態衝突

讓文字、圖像與工具資料互相矛盾，測試系統是否正確處理。

---

# 67. 評估指標

## 67.1 關係重建率

## 67.2 身份保持率

## 67.3 投影失真

## 67.4 模態選擇適切率

## 67.5 跨模態同步誤差

## 67.6 衝突偵測率

## 67.7 衝突處理正確率

## 67.8 操作成功率

## 67.9 認知負擔

## 67.10 學習時間

## 67.11 長期記憶保持

## 67.12 無障礙覆蓋率

## 67.13 模態冗餘成本

## 67.14 介面誤提交率

---

# 68. 主要失敗模式

## 68.1 把布局當語義

## 68.2 把圖像相似當身份

## 68.3 把箭頭都當因果或執行

## 68.4 把顏色當普遍真實度

## 68.5 多模態只做裝飾

## 68.6 冗餘模態造成過載

## 68.7 模態不同步

## 68.8 模態衝突被靜默忽略

## 68.9 權威模態不明

## 68.10 投影省略未揭露

## 68.11 手勢誤提交

## 68.12 模擬動畫被誤認為已發生事件

## 68.13 跨模態身份漂移

## 68.14 無障礙投影只保留表面、不保留任務關係

---

# 69. 治理原則

## 原則一：載體不是意義本體

## 原則二：順序語義必須宣告

## 原則三：空間位置與圖結構分離

## 原則四：圖像相似與身份分離

## 原則五：顏色、箭頭與動畫需要圖例或契約

## 原則六：多模態偶合需要明確角色

## 原則七：衝突不得由顯著度自動決定

## 原則八：跨模態身份需穩定映射

## 原則九：投影省略必須可說明

## 原則十：操作手勢與權威提交分離

## 原則十一：重要結構提供無障礙等價投影

## 原則十二：多模態配置依任務而定

---

# 70. 基礎命題

## 命題一：載體可供性命題

不同載體降低不同關係的編碼與解碼成本，但不自動決定語義。

## 命題二：層級分離命題

概念結構、符號結構、載體、布局與操作結果必須分離。

## 命題三：線性序列多義命題

文字順序、時間順序、因果順序與執行順序一般不同。

## 命題四：空間非語義命題

空間鄰近、方向與包含只有在明確契約下才承載特定語義。

## 命題五：圖—布局分離命題

權威圖關係不應依賴單一視覺布局。

## 命題六：圖像相似非身份命題

視覺相似不能替代穩定身份與來源。

## 命題七：聲音時間性命題

聲音原生承載時間與重音，但不適合單獨保存所有精確靜態結構。

## 命題八：手勢模式命題

手勢意義取決於模式、目標與語境，不能只依軌跡解讀。

## 命題九：多模態非加總命題

多模態意義來自偶合關係，不是多個模態內容的簡單聯集。

## 命題十：模態權威相對命題

模態權威取決於關係、任務、來源與版本，而非模態本身。

## 命題十一：投影契約命題

跨模態投影應明示保留、近似與省略的關係。

## 命題十二：跨模態身份命題

同一概念跨文字、圖像、聲音、圖與程式投影時，需要穩定身份映射。

## 命題十三：衝突治理命題

多模態衝突應被檢測、並列、回溯或阻止執行，而非由最顯眼模態自動勝出。

## 命題十四：無普遍最佳模態命題

模態效用是概念、任務、觀測者與工具相對的。

---

# 71. 可反證條件

若實驗顯示：

1. 線性、空間、圖像、聲音與多模態表示在關係重建與操作上沒有穩定差異；
2. 載體可供性不能預測表達或解碼成本；
3. 投影契約不改善跨模態理解與衝突處理；
4. 穩定身份映射不降低跨模態混淆；
5. 多模態偶合分類不能解釋互補、冗餘與過載；
6. 無障礙等價投影不改善任務完成；
7. CSPCF 與 MSSE 的複雜度高於普通媒體設計與資料轉換方法，卻不能提高語義保持、操作安全與可追溯性；

則本文提出的完整框架應被簡化，只保留投影契約、身份映射與衝突檢查等局部方法。

---

# 72. 與前兩篇的關係

第一篇建立不同符號語言的比較維度。

第二篇建立概念核心、關係槽位與語義收斂。

本篇回答：

- 這些概念與關係如何投影到不同載體；
- 哪些載體天然降低某些結構成本；
- 多模態如何互補或衝突；
- 同一概念如何跨模態保持身份。

因此：

$$
\boxed{
\text{SLAF：比較差異}
}
$$

$$
\boxed{
\text{SCUE：生成與收斂概念}
}
$$

$$
\boxed{
\text{CSPCF／MSSE：投影、偶合與跨模態保持}
}
$$

---

# 73. 與外部注意力場工程的關係

外部注意力場不只決定顯影哪些內容，也決定顯影：

- 哪個模態；
- 哪個解析度；
- 哪個視圖；
- 哪個時間片段；
- 哪個互動控制。

因此：

$$
\mathbb A_t^{\mathrm{ext}}
\rightarrow
\left(
m_t,
r_t,
P_t
\right)
$$

其中：

- $m_t$ ：模態；
- $r_t$ ：解析度；
- $P_t$ ：投影剖面。

---

# 74. 與 EML-U、NOVA 與格子語言的關係

## 74.1 EML-U

保存跨模態之前的高密度概念與關係。

## 74.2 NOVA

作為權威概念圖、身份、版本與投影契約層。

## 74.3 格子語言

作為空間、圖像、文件與互動投影之間的自由封裝操作表面。

因此：

$$
\boxed{
\text{Authority Structure}
\rightarrow
\text{Projection Contract}
\rightarrow
\text{Modal Representation}
}
$$

---

# 75. 與下一篇的接口

本篇討論符號在不同載體上的結構差異，但尚未完整處理：

- 符號何時只描述；
- 何時形成約束；
- 何時可以被編譯；
- 何時能觸發工具；
- 何時直接改變外部世界；
- 如何避免自然語言或手勢被誤執行。

第四篇：

# 《描述性、操作性與可執行符號》

將正式研究從表達到世界改寫之間的執行距離、權限、驗證與提交契約。

---

# 76. 結論

本文提出線性、空間、圖像、聲音、手勢、動畫與多模態符號結構的統一框架。

完整流程為：

$$
\boxed{
\text{權威概念結構}
\rightarrow
\text{模態選擇}
\rightarrow
\text{投影契約}
\rightarrow
\text{線性／空間／圖像／聲音／動作表示}
\rightarrow
\text{跨模態偶合}
\rightarrow
\text{觀測者重建}
\rightarrow
\text{衝突、操作與治理}
}
$$

本文的核心區分是：

$$
\boxed{
\text{載體}
\neq
\text{語義本體}
}
$$

$$
\boxed{
\text{序列先後}
\neq
\text{因果先後}
}
$$

$$
\boxed{
\text{空間靠近}
\neq
\text{語義相關}
}
$$

$$
\boxed{
\text{圖像相似}
\neq
\text{身份相同}
}
$$

$$
\boxed{
\text{多模態同步}
\neq
\text{相互驗證}
}
$$

$$
\boxed{
\text{多模態}
\neq
\text{模態內容的簡單聯集}
}
$$

不同符號載體真正的差異，不是某一種比較直觀、另一種比較抽象，而是：

> 每種載體都為某些關係提供較低成本的表示與解碼路徑，同時省略或弱化另一些關係。符號結構工程的任務，是使這些保留、近似與省略成為可明示、可比較、可逆與可治理的投影選擇。

---

## 附錄 A：載體可供性記錄

```json
{
  "carrier_affordance": {
    "modality": "spatial_canvas",
    "low_cost_relations": [
      "adjacency",
      "containment",
      "region",
      "scale"
    ],
    "high_risk_inferences": [
      "causality_from_position",
      "importance_from_center",
      "identity_from_visual_similarity"
    ],
    "required_contracts": [
      "position_semantics",
      "boundary_types",
      "layout_authority"
    ]
  }
}
```

---

## 附錄 B：模態配置範例

```json
{
  "modality_configuration": {
    "task": "explain_and_execute_workflow",
    "primary": {
      "modality": "typed_graph",
      "role": "dependency_and_execution_structure"
    },
    "secondary": [
      {
        "modality": "text",
        "role": "definitions_constraints_and_warnings"
      },
      {
        "modality": "animation",
        "role": "illustrative_state_transition"
      }
    ],
    "accessibility": [
      "structured_text",
      "keyboard_navigation"
    ],
    "authority": {
      "execution_order": "typed_graph",
      "safety_constraints": "text_contract",
      "animation": "non_authoritative"
    }
  }
}
```

---

## 附錄 C：跨模態身份映射

```json
{
  "cross_modal_identity": {
    "concept_id": "concept-003",
    "representations": [
      {
        "modality": "text",
        "ref": "doc://symbolic-structure/section-3"
      },
      {
        "modality": "graph",
        "ref": "graph://concept-003"
      },
      {
        "modality": "image",
        "ref": "image://diagram-018"
      },
      {
        "modality": "code",
        "ref": "nova://concept-003"
      }
    ],
    "identity_status": "validated",
    "version": "v0.1"
  }
}
```
