---
title: "共享符號不等於共享世界：異質智慧間的多層世界分離與任務充分耦合"
english_title: "Shared Symbols Do Not Imply Shared Worlds: Multi-Layer World Separation and Task-Sufficient Coupling Across Heterogeneous Intelligences"
author: "Neo.K（許筌崴）"
institution: "EveMissLab（一言諾科技有限公司）"
series: "異質智慧動態協議生成系列"
paper_no: "01"
version: "v0.1"
date: "2026-08-14"
status: "正式研究草稿"
canonical_source_encoding: "UTF-8"
---

# 共享符號不等於共享世界：異質智慧間的多層世界分離與任務充分耦合

**Shared Symbols Do Not Imply Shared Worlds: Multi-Layer World Separation and Task-Sufficient Coupling Across Heterogeneous Intelligences**

作者：Neo.K（許筌崴）  
機構：EveMissLab（一言諾科技有限公司）  
系列：異質智慧動態協議生成系列，第 1 篇  
版本：v0.1  
日期：2026 年 8 月 14 日

---

## 摘要

人類與人工智慧可以共同使用自然語言、數學符號、程式碼、JSON、圖結構、形式語言與其他可共享符號載體。然而，共享同一符號，不代表不同智慧體以同一方式看見世界、表示世界、賦予符號意義，或以同一方式使符號進入行動。本文提出一個最低限度但重要的分離命題：

$$
\boxed{
\text{Shared Symbols}
\not\Rightarrow
\text{Shared Worlds}
}
$$

本文不把「世界」限制為現象學或意識經驗，而以功能性方式將智慧體 $A_i$ 的可交互世界分為四層：可觀測／可接取世界 $\mathcal W_i^{P}$ 、內部表徵世界 $\mathcal W_i^{R}$ 、語義—判定世界 $\mathcal W_i^{S}$ 、操作—狀態轉移世界 $\mathcal W_i^{O}$。不同主體可以在公共符號空間 $\mathcal L$ 中交換相同符號 $s$，卻由不同解碼映射產生不同內部狀態：

$$
D_A(s)\neq D_B(s).
$$

因此，符號同一不推出表徵同一；表徵同一也不自動推出操作同一。本文進一步承接既有「符號瞬時判定域」與「任務充分對齊」框架，把跨智慧理解改寫為任務條件下的局部耦合問題：兩個智慧體不必共享完整內部世界，只要在任務 $T$ 的關鍵探針、判定與操作上形成足以共同工作的跨世界映射，即可稱為「任務充分耦合」。

近期研究已顯示，異質視覺代理可以在不同私有視覺表徵下形成共享離散符號，但表徵差異增大時，共享符號會減少、變粗並更不對稱；人類與大型視覺語言模型在重複指稱任務中的 grounding 方式也存在系統性差異；此外，共享感知資訊本身並不保證已建立共同理解。這些結果與本文的最小命題相容，但本文進一步把問題從「私有感知 vs 共享符號」推廣至「感知／表徵／語義／操作」四層異質世界，並將其與任務充分判定耦合相連。

本文最後提出七項可證偽命題與一組最低實驗設計，並指出本系列後續問題：若不存在單一固定符號載體能跨越所有異質世界，是否存在一種足夠一般的**協議生成機制**，能對每一組可耦合智慧體與給定任務，逐步生成任務充分的共享符號介面？該問題將於下一篇以全域量詞換序形式處理。

**關鍵詞：** 異質智慧、共享符號、共享世界、符號奠基、任務充分耦合、任務充分對齊、跨世界映射、emergent communication、common ground、representational alignment、AI-native interface

---

# 0. 研究位置與命題邊界

## 0.1 本系列母問題

本系列的母問題不是：

> 「AI 最適合用哪一種語言？」

也不是：

> 「人類與 AI 是否真正具有相同理解？」

而是：

> **是否存在一種足夠一般的協議生成機制，使任意「可互相建立某種耦合」的異質智慧，在給定任務下，都能逐步建立任務充分的共享符號介面？**

本文不直接回答這個帶有強全域量詞的問題，而先建立它的第一個必要前提：

$$
\boxed{
\text{符號介面可共享，不代表內部世界必須同一。}
}
$$

如果這一點不先分開，後續所有「通用協議」討論都容易把「共同使用一種格式」誤寫成「共同擁有一種認知」。

---

## 0.2 內部理論承接

本文直接承接兩項既有內部研究。

第一，《符號瞬時判定域：從語義同一到任務下判定等價》已提出：

$$
\mathcal B_A\neq\mathcal B_B
$$

並不妨礙兩個主體在任務 $T$ 上達到：

$$
A\approx_T^\delta B.
$$

其核心思想是：完整內部語義同一不是所有協作任務的必要條件；在特定任務、尺度、時間與風險條件下，足夠的判定等價可能已足以支撐共同工作。

第二，《共享參照場與任務充分對齊：為何共同文件不等於共同認知》已區分：

$$
\boxed{
\text{Shared Reference}
\neq
\text{Shared Representation}
\neq
\text{Shared Judgment}
\neq
\text{Shared Memory}
}
$$

本文把這一分離再向下推至「主體世界」層：即使雙方不只共享文件，而是共享同一符號、同一畫面、同一物件甚至同一任務，也不能直接推出其內部表徵、語義與操作狀態相同。

---

## 0.3 「世界」不是意識宣告

本文使用：

$$
\mathcal W_i
$$

描述智慧體 $A_i$ 可存取、表示、判定與操作的狀態域。

這裡的「世界」是**功能性／計算性分析詞**，不預設：

1. AI 具有與人類同型的主觀經驗；
2. AI 具有現象學意識；
3. 模型內部表徵可直接等同人類概念；
4. 人類的內部世界可以被完整形式化；
5. 任一當前模型真的使用本文所寫的四層資料結構。

因此：

$$
\mathcal W_A\neq\mathcal W_H
$$

在本文中只代表：

> 兩個系統的可觀測輸入、內部表徵、判定映射或可執行操作可以不同。

不是形上學的意識判決。

---

# 1. 外部研究：共享符號問題已經出現，但尚未等於本文問題

## 1.1 符號奠基：符號不只需要符號對符號

Harnad 的符號奠基問題指出，純形式符號系統中的符號意義不能只靠另一組符號無限循環地解釋；至少必須面對符號如何與非符號層的辨識、分類或世界關聯建立聯繫的問題。[1]

本文與此相連，但問題方向不同。

符號奠基主要問：

$$
\text{symbol}
\rightarrow
\text{grounded meaning}
$$

本文進一步問：

$$
\text{同一 symbol}
\rightarrow
\begin{cases}
\text{world}_A\\
\text{world}_B
\end{cases}
$$

當不同智慧體都能「使用」同一符號時，它們是否必須具有相同奠基、相同表徵或相同操作效果？

本文回答：不必。

---

## 1.2 成功溝通不等於人類式概念表徵

Bouchacourt 與 Baroni 在 emergent communication 的視覺指稱遊戲中發現，代理在互動後可以形成高度對齊的視覺表徵並成功溝通，但這些表徵未必捕捉輸入影像的人類概念性屬性。[2]

這個結果很重要，因為它直接拆開：

$$
\text{communication success}
$$

與：

$$
\text{human-conceptual representation}.
$$

本文不把該實驗泛化成「所有成功溝通都不需要共同表徵」；相反地，它顯示至少存在一類任務，其中**成功溝通與我們直覺期待的概念對齊並不同步**。

---

## 1.3 不同視角仍可形成共同指稱

Tang、Mao 與 Suhr 的多視角指稱研究讓兩個代理位於同一場景但具有不同視覺位置，並要求它們生成與理解物件及空間關係的指稱語句。[3]

這顯示「共同場景」並不等於：

$$
P_A=P_B.
$$

即使兩個主體處於同一外部環境，它們可取得的觀察也可能不同；要成功溝通，必須把他者視角納入指稱過程。

---

## 1.4 2026：共享符號、私有表徵已成直接研究問題

Ochiai、Nagano 與 Taniguchi 在 2026 年預印本中直接研究「異質視覺代理」：代理具有不同 frozen visual encoders，不共享外部 communicative objective，只交換離散 token sequences，並依各自私有視覺證據更新。[4]

其實驗顯示，共享符號仍可以形成；然而，隨視覺 encoder mismatch 增加，跨代理指標下降，共享序列變少、變粗且更不對稱。[4]

這是與本文最接近的外部工作之一。

但本文的研究域更廣：

$$
\text{private perception}
\subset
\text{heterogeneous world}.
$$

即使感知層高度相似，智慧體仍可能在：

- 表徵；
- 語義；
- 判定；
- 操作；

等層面異質。

---

## 1.5 人類與 LVLM 可能用不同方式建立 grounding

Zeng 等人在 ACL 2026 的人類—LVLM 指稱實驗中比較 human-human、human-AI、AI-human、AI-AI 四種配對，結果顯示現有 LVLM 在互動式生成與解析指稱語句、逐輪建立共同 grounding 的能力仍與人類不同。[5]

因此，若人與 AI 最後輸出相同詞彙或選中相同物件，也不能只憑輸出同一，推定雙方使用了相同 grounding process。

---

## 1.6 「看見同樣資訊」仍不等於「已共享理解」

Li、Gatt 與 Poesio 在 SIGDIAL 2026 的研究進一步指出，共享感知資訊本身不能保證共享詮釋；部分 VLM 甚至會把「可能共享的地圖內容」過度當成「已建立的共同基礎」。[6]

這與本文的核心分離非常接近：

$$
\boxed{
\text{Potentially Shareable}
\neq
\text{Actually Shared}
}
$$

也就是：

$$
\text{同一外部資訊}
\not\Rightarrow
\text{同一內部狀態}.
$$

---

# 2. 四層異質世界模型

## 2.1 智慧體世界四元組

對任一智慧體／代理／主體 $A_i$，定義：

$$
\boxed{
\mathfrak W_i
=
\left(
\mathcal W_i^{P},
\mathcal W_i^{R},
\mathcal W_i^{S},
\mathcal W_i^{O}
\right)
}
$$

其中：

### 第一層：可觀測／可接取世界

$$
\mathcal W_i^{P}
$$

表示 $A_i$ 能夠取得的輸入、訊號與狀態。

對人類可以包括：

- 視覺；
- 聽覺；
- 身體感覺；
- 語言；
- 記憶回取。

對 AI／Agent 可以包括：

- token context；
- image embeddings；
- tool outputs；
- files；
- API responses；
- retrieved chunks；
- runtime state。

「可接取」比「感知」更一般，以避免把所有計算輸入人化。

---

### 第二層：表徵世界

$$
\mathcal W_i^{R}
$$

表示主體對可接取內容形成的內部表示。

本文不要求其具有人類可讀形式。

可以是：

- 概念；
- 空間模型；
- 關聯圖；
- latent representation；
- hidden state；
- memory structure；
- rule state；
- 其他未知內部表示。

---

### 第三層：語義—判定世界

$$
\mathcal W_i^{S}
$$

表示哪些內部差異會影響：

- 「這是什麼」；
- 「此符號指向何物」；
- 「哪一個解釋成立」；
- 「哪一個答案可接受」；
- 「何時需要澄清」；
- 「是否已足夠確定」。

這一層不等同自然語言詞義，而是包含任務條件下的**判定結構**。

---

### 第四層：操作—狀態轉移世界

$$
\mathcal W_i^{O}
$$

表示哪些符號、判定或內部狀態可以導致什麼行動與狀態變化。

對人類：

> 「打開門」

可能先進入意圖、肌肉控制與物理行動。

對 Agent：

```json
{"action":"open_file","path":"..."}
```

可能進入 schema validation、tool routing、permission checking 與 runtime execution。

兩者可以理解「打開」這個公共詞，但：

$$
O_H(\text{open})
\neq
O_A(\text{open})
$$

---

# 3. 公共符號空間

## 3.1 可共享符號載體

令：

$$
\mathcal L
$$

表示至少兩個智慧體可以交換、觀察或解析的一個公共符號空間。

 $\mathcal L$ 可以是：

- 自然語言；
- 數學；
- 程式碼；
- JSON；
- YAML；
- 圖；
- 音訊符號；
- 視覺符號；
- operator DSL；
- AI-oriented format；
- 多模態混合協議。

本文不給任何現有格式本體上的優先地位。

---

## 3.2 編碼與解碼

對智慧體 $A_i$，定義：

$$
E_i:
\mathfrak W_i
\rightarrow
\mathcal L
$$

為外部化／編碼映射。

再定義：

$$
D_i:
\mathcal L
\rightarrow
\widehat{\mathfrak W}_i
$$

為接收／解碼映射。

因此，一個共享符號：

$$
s\in\mathcal L
$$

被 $A$ 與 $B$ 同時接收時：

$$
D_A(s)
$$

與：

$$
D_B(s)
$$

不必相同。

即：

$$
\boxed{
s_A=s_B
\not\Rightarrow
D_A(s)=D_B(s)
}
$$

這就是本文第一個基本命題。

---

# 4. 共享符號非共享世界原理

## 4.1 弱式原理

### 原理 1：符號同一不推出表徵同一

存在：

$$
s\in\mathcal L
$$

使：

$$
s_A=s_B=s
$$

但：

$$
D_A^{R}(s)
\neq
D_B^{R}(s).
$$

---

## 4.2 語義版本

### 原理 2：符號同一不推出判定函數同一

即使：

$$
s_A=s_B,
$$

仍可能：

$$
J_A(s,c)
\neq
J_B(s,c)
$$

其中 $c$ 為上下文。

因此「使用同一詞」不能單獨作為共享語義的充分證據。

---

## 4.3 操作版本

### 原理 3：符號同一不推出狀態轉移同一

令：

$$
\Gamma_i:
\mathcal W_i^{S}\times\mathcal W_i^{O}
\rightarrow
\mathcal W_i^{O}
$$

為操作轉移函數。

則：

$$
D_A(s)=D_B(s)
$$

即使在某種語義度量下成立，也不必推出：

$$
\Gamma_A(s)=\Gamma_B(s).
$$

例如同一段程式碼：

- 對人類可以是可閱讀的形式物；
- 對某執行環境可以直接成為機器狀態轉移的來源；
- 對另一個沒有相應 runtime 的系統則只是純文字。

因此：

$$
\boxed{
\text{Shared Meaning}
\not\Rightarrow
\text{Shared Operability}
}
$$

---

# 5. 表面模仿與操作本體的分離

## 5.1 人類可以模仿 AI 文風

一個人可以刻意寫：

```text
Constraints:
1. Preserve X.
2. Output JSON.
3. Return only valid schema.
```

或者模仿某一時期 LLM 的：

- 條列格式；
- 對稱小標；
- 「核心洞見」；
- 總結句；
- Markdown；
- 典型 transition phrase。

因此：

$$
\text{AI-like surface}
\not\Rightarrow
\text{AI source}.
$$

---

## 5.2 AI 也可以模仿人類文風

同理，AI 可以生成：

- 散文；
- 文言；
- 小說；
- 學術論證；
- 個人風格；
- 歷史文體。

因此：

$$
\text{human-like surface}
\not\Rightarrow
\text{human source}.
$$

---

## 5.3 但符號模仿不等於世界模仿

定義：

$$
\operatorname{Imitate}_{\mathcal L}(A,B)
$$

表示 $A$ 可以在公共符號層模仿 $B$ 的輸出分布。

即使：

$$
\operatorname{Imitate}_{\mathcal L}(A,B)\approx1,
$$

也不能推出：

$$
\mathfrak W_A
\approx
\mathfrak W_B.
$$

因此提出：

$$
\boxed{
\text{Symbolic Imitation}
\neq
\text{Operational-World Identity}
}
$$

這是 AI attribution 問題與異質智慧通訊問題必須分開的原因。

---

# 6. 任務充分跨世界耦合

## 6.1 不要求世界同一

若要求：

$$
\mathfrak W_A=\mathfrak W_B
$$

才能合作，則人—人之間很多交流也難以滿足。

因此，本文改採任務條件。

令：

$$
T
$$

為任務，

$$
\mathcal Q_T
=
\{q_1,\ldots,q_m\}
$$

為任務相關 probe 集。

每個 probe 有風險／重要性權重：

$$
w_k\ge0.
$$

---

## 6.2 判定對齊函數

令：

$$
J_i(q_k)
$$

表示主體 $A_i$ 對 probe $q_k$ 的任務判定。

定義：

$$
\operatorname{TSA}_T(A,B)
=
1-
\frac{
\sum_{k=1}^{m}
w_k
d_T
\left(
J_A(q_k),
J_B(q_k)
\right)
}{
\sum_{k=1}^{m}w_k
},
$$

其中：

$$
0\le d_T\le1.
$$

若：

$$
\operatorname{TSA}_T(A,B)
\ge
1-\delta,
$$

則稱：

$$
A
\approx_T^\delta
B.
$$

這只是任務充分對齊。

---

## 6.3 加入操作結果

然而跨智慧介面還需要操作層。

令：

$$
a_i(q_k)
$$

為主體在 probe 下採取的行動，

$$
R_T(a_i)
$$

為任務結果。

定義操作差：

$$
d_O
\left(
R_T(a_A),
R_T(a_B)
\right).
$$

若同時：

$$
\operatorname{TSA}_T(A,B)
\ge1-\delta_S
$$

且：

$$
\frac{
\sum_k w_k d_O(R_T(a_A^k),R_T(a_B^k))
}{
\sum_k w_k
}
\le\delta_O,
$$

則稱 $A$ 與 $B$ 達到：

$$
\boxed{
\delta\text{-任務充分跨世界耦合}
}
$$

記為：

$$
A
\bowtie_T^{\delta_S,\delta_O}
B.
$$

---

# 7. 跨世界符號橋

## 7.1 橋不是同構

定義任務 $T$ 下的跨世界符號橋：

$$
\mathcal B_{A\rightarrow B}^{T}
=
D_B
\circ
E_A.
$$

它把：

$$
\mathfrak W_A
$$

中的某些任務相關狀態，經公共符號空間映射至：

$$
\widehat{\mathfrak W}_B.
$$

但不要求：

$$
\mathcal B_{A\rightarrow B}^{T}
$$

是雙射。

甚至不要求它在所有狀態上有定義。

只要求對：

$$
\Omega_T\subseteq\mathfrak W_A
$$

的任務相關子域足夠有效。

---

## 7.2 局部同態而非全域同構

本文因此主張：

$$
\boxed{
\text{Cross-world communication}
\text{ needs local task homomorphism, not global world isomorphism.}
}
$$

形式上，希望在任務子域：

$$
x,y\in\Omega_T
$$

中，某些任務相關關係：

$$
R_A(x,y)
$$

能被橋接後保持：

$$
R_B
\left(
\mathcal B(x),
\mathcal B(y)
\right).
$$

但對任務外結構：

$$
\Omega_{\neg T}
$$

可以完全不保證。

---

# 8. 為什麼「同一世界」反而可能是不必要要求

## 8.1 人—人已經不是完全同一

兩個人使用「紅色」，不代表：

- 視網膜反應相同；
- 主觀感受相同；
- 色彩記憶相同；
- 美學聯想相同；
- 行動傾向相同。

但在交通號誌任務：

$$
T_{\text{traffic}}
$$

中，只要雙方都能穩定判定：

$$
\text{red}
\rightarrow
\text{stop},
$$

即可達到任務充分耦合。

---

## 8.2 人—AI 的異質性只是更顯著

人類說：

> 「把這個檔案打開。」

對人類而言，「打開」可能是一個意圖與物理介面行為。

對 Agent 而言，同一句話可能需要：

$$
\text{intent parse}
\rightarrow
\text{path resolution}
\rightarrow
\text{permission}
\rightarrow
\text{tool invocation}
\rightarrow
\text{result state}.
$$

所以雙方共享的是：

$$
s=\text{「打開」},
$$

不是：

$$
O_H=O_A.
$$

---

## 8.3 AI—AI 也可能異質

不同 AI 系統可以具有：

- 不同 encoder；
- 不同 memory；
- 不同 tools；
- 不同 schema；
- 不同 latent geometry；
- 不同 state machine；
- 不同 action space。

因此「AI 與 AI」也不能被假設為同一世界。

2026 年異質視覺代理的結果已直接顯示，encoder mismatch 的增加會改變可形成共享符號的內容、數量與對稱性。[4]

---

# 9. 七項可證偽命題

## 命題一：共享符號非共享表徵命題

存在任務 $T$ 與主體 $A,B$，使：

$$
s_A=s_B
$$

但：

$$
D_A^{R}(s)\neq D_B^{R}(s),
$$

同時仍：

$$
A\bowtie_T B.
$$

### 否證條件

若所有成功使用共享符號的系統，都必然收斂到可證明同構的內部表徵，則此命題失敗。

---

## 命題二：共享感知非共享語義命題

即使：

$$
\mathcal W_A^P
\approx
\mathcal W_B^P,
$$

仍可能：

$$
\mathcal W_A^S
\not\approx
\mathcal W_B^S.
$$

近期 VLM common-ground 研究已提供與此相容的實例：可取得相同地圖資訊的模型仍可能把「可能共享」誤判為「已共同理解」。[6]

---

## 命題三：任務充分弱於世界同一

存在：

$$
A\bowtie_T^\delta B
$$

但：

$$
\mathfrak W_A\not\cong\mathfrak W_B.
$$

這是整個系列的重要可行性條件。

---

## 命題四：異質度—橋接成本命題

定義異質度：

$$
H(A,B)
$$

若其他條件固定，則存在某些任務族使：

$$
H(A,B)\uparrow
\Rightarrow
C_{\text{bridge}}(A,B,T)\uparrow.
$$

2026 年異質視覺代理實驗中，encoder mismatch 增大時跨代理溝通指標下降，與此方向一致。[4]

但本文不主張單調律對所有智慧與任務成立。

---

## 命題五：格式非本體命題

沒有理由由：

$$
L=\text{JSON}
$$

推出：

$$
L
$$

是 AI 的「內在語言」。

同樣，由：

$$
L=\text{自然語言}
$$

也不能推出它就是人類全部內部認知的原生資料格式。

本文只把格式視為：

$$
\boxed{
\text{interface carrier}
}
$$

而非內在世界本體。

---

## 命題六：操作不對稱命題

同一符號：

$$
s
$$

對兩個智慧體可能具有不同 operation distance：

$$
C_A^{O}(s)\neq C_B^{O}(s).
$$

因此，未來跨智慧介面的最佳化不能只看：

- token 長度；
- 語法；
- 可讀性；

還必須看符號到可執行狀態的轉換成本。

---

## 命題七：共享符號可先於共享世界收斂

在互動學習中可能出現：

$$
\mathcal L_{AB}
\text{ 已足以支援 }T
$$

但：

$$
\mathfrak W_A,\mathfrak W_B
$$

仍保持顯著異質。

若此現象可穩定重現，將支持：

$$
\boxed{
\text{protocol convergence}
\neq
\text{world convergence}.
}
$$

---

# 10. 最低實驗框架

## 10.1 三類主體

至少建立：

1. 同質 AI pair；
2. 異質 AI pair；
3. human–AI pair。

之後再加入：

4. human–human；
5. multi-agent population。

---

## 10.2 控制異質度

可控制：

- 不同視覺 encoder；
- 不同語言模型；
- 不同 memory access；
- 不同 tools；
- 不同 action space；
- 不同資料來源；
- 不同觀測解析度。

建立：

$$
H(A,B)\in[0,1]
$$

的代理指標。

---

## 10.3 共享符號條件

比較：

### Condition A：自然語言

$$
L_A=\text{NL}
$$

### Condition B：固定形式格式

$$
L_B=\text{schema}
$$

### Condition C：自適應符號介面

$$
L_{t+1}=F(L_t,\text{feedback}).
$$

本篇不要求 Condition C 已有一般解；它將成為後續系列核心。

---

## 10.4 測量

至少測：

### 任務成功率

$$
S_T
$$

### 符號成本

$$
C_L
$$

### 解碼錯誤

$$
E_S
$$

### 執行錯誤

$$
E_O
$$

### 修復輪數

$$
N_{\text{repair}}
$$

### 表徵相似度

$$
R_{\text{sim}}
$$

最後檢查：

$$
S_T
$$

是否能在：

$$
R_{\text{sim}}<1
$$

甚至較低情況下仍維持高值。

---

# 11. 與 emergent communication 的差別

本文與 emergent communication 高度相關，但研究問題不完全相同。

傳統 emergent communication 常問：

> 代理能否透過互動發明一種有助任務的溝通協議？

本文問：

> **當代理本身的可觀測、表徵、語義與操作世界都可能異質時，什麼程度的共享才足以稱為可工作的跨世界介面？**

因此本文將研究單位從：

$$
\text{message protocol}
$$

擴展為：

$$
\boxed{
\text{world}
\leftrightarrow
\text{interface}
\leftrightarrow
\text{world}.
}
$$

這一擴展使人類—AI、AI—AI 與未來未知智慧體可以進入同一分析框架。

---

# 12. 與 common ground 的差別

common ground 研究通常關注參與者如何建立、更新與追蹤彼此認為已共同接受的資訊。

本文不否定 common ground。

但本文指出，在 common ground 之前還存在一個更底層問題：

$$
\boxed{
\text{雙方用來建立 ground 的世界結構本身可能不同。}
}
$$

因此：

$$
\text{Grounding}
$$

不是把兩個世界變成同一世界，

而可能只是建立：

$$
\mathcal B_{A\leftrightarrow B}^{T}
$$

使任務相關部分足以互譯。

Zeng 等人的 human/LVLM 實驗與 Li 等人的 asymmetric dialogue 實驗都顯示：模型可能完成部分 referential matching，卻仍沒有以人類方式逐步建立或追蹤 common ground。[5][6]

---

# 13. 一個更強但尚不採用的命題

很容易把本文誤讀成：

$$
\forall A,B,T,
\exists L:
A\bowtie_T B.
$$

本文**不主張**這件事。

因為可能存在：

- 完全無共同通道；
- 不可觀測狀態；
- 不可表達的任務差異；
- 計算不可行；
- 行動空間不相容；
- 無法建立回饋；
- 惡意或非合作；
- 符號頻寬不足。

因此本篇只建立：

$$
\boxed{
\text{世界可以異質，而共享符號仍可能形成局部任務耦合。}
}
$$

至於：

> 對「所有可耦合智慧體」，是否總能生成某種任務充分介面？

那是一個更強的量詞問題，留待下一篇。

---

# 14. 下一篇：量詞換序

下一篇將比較：

$$
\boxed{
\exists L^\ast
\forall(A,B,T)
}
$$

與：

$$
\boxed{
\forall(A,B,T)
\exists L_{A,B,T}
}
$$

以及更重要的：

$$
\boxed{
\exists\mathcal M
\forall(A,B,T)\in\mathcal C
\;
\exists L_{A,B,T}
}
$$

其中：

$$
\mathcal M
$$

不是一個固定語言，而是：

> **動態共享協議生成器。**

因此本系列真正尋找的可能從來不是：

$$
\text{Universal Language},
$$

而是：

$$
\boxed{
\text{Universal-enough Protocol Constructor}.
}
$$

---

# 15. 結論

本文建立了異質智慧動態協議生成系列的最低本體分離：

$$
\boxed{
\text{Shared Symbols}
\not\Rightarrow
\text{Shared Worlds}.
}
$$

不同智慧體可以：

- 看見不同資訊；
- 使用不同內部表徵；
- 形成不同語義結構；
- 具有不同操作世界；

卻仍在公共符號層：

$$
\mathcal L
$$

相遇。

真正的跨智慧溝通不必要求：

$$
\mathfrak W_A=\mathfrak W_B,
$$

而可以只要求：

$$
\boxed{
A
\bowtie_T^\delta
B.
}
$$

即：在任務相關子域內，符號橋已足以支援需要的判定與行動。

因此，未來人類與 AI 的共同科學、共同數學、共同程式設計與共同知識系統，也不應被迫二選一：

> 要嘛 AI 永遠只能使用人類原生表示；  
> 要嘛 AI 進入人類完全不可理解的黑箱世界。

第三條路是：

$$
\boxed{
\text{異質世界保留}
+
\text{共享介面生成}
+
\text{任務充分互譯}.
}
$$

本篇證明不了這條路對所有可耦合智慧都存在。

但它先把問題改寫成一個可以研究、可以否證、也可以工程化的形式。

---

# 參考文獻

[1] Harnad, S. (1990). **The Symbol Grounding Problem.** *Physica D: Nonlinear Phenomena*, 42(1–3), 335–346.

[2] Bouchacourt, D., & Baroni, M. (2018). **How agents see things: On visual representations in an emergent language game.** *Proceedings of EMNLP 2018*, 981–985.

[3] Tang, Z., Mao, L., & Suhr, A. (2024). **Grounding Language in Multi-Perspective Referential Communication.** *Proceedings of EMNLP 2024*, 19727–19741. DOI: 10.18653/v1/2024.emnlp-main.1100.

[4] Ochiai, M., Nagano, M., & Taniguchi, T. (2026). **Emergent Communication between Heterogeneous Visual Agents through Decentralized Learning.** arXiv:2605.11695. Preprint.

[5] Zeng, P., Li, W., Paige, A. J., Wang, Z., Kaliosis, P., Samaras, D., Zelinsky, G. J., Brennan, S., & Rambow, O. (2026). **LVLMs and Humans Ground Differently in Referential Communication.** *Proceedings of ACL 2026*, 9061–9087. DOI: 10.18653/v1/2026.acl-long.410.

[6] Li, N., Gatt, A., & Poesio, M. (2026). **Seeing Is Not Sharing: Some Vision-Language Models Overestimate Common Ground in Asymmetric Dialogue.** *Proceedings of SIGDIAL 2026*.

[7] Evtimova, K., Drozdov, A., Kiela, D., & Cho, K. (2017). **Emergent Communication in a Multi-Modal, Multi-Step Referential Game.** arXiv:1705.10369.

[8] Harding Graesser, L., Cho, K., & Kiela, D. (2019). **Emergent Linguistic Phenomena in Multi-Agent Communication Games.** *Proceedings of EMNLP-IJCNLP 2019*, 3700–3710. DOI: 10.18653/v1/D19-1384.

[9] Feng, Y., & Lu, Z. (2023). **Multi-Agent Language Learning: Symbolic Mapping.** *Findings of ACL 2023*, 7756–7770. DOI: 10.18653/v1/2023.findings-acl.491.

---

# 內部理論依賴

- Neo.K（2026-08-12），《符號瞬時判定域：從語義同一到任務下判定等價》，符號—記憶—判定耦合系列 Paper 01。
- Neo.K（2026-08-12），《共享參照場與任務充分對齊：為何共同文件不等於共同認知》，符號—記憶—判定耦合系列 Paper 04。
- 本系列前置對話命題：共享符號—異質世界、跨世界映射、任務充分共享介面、動態協議生成與全域量詞換序。
