← Archive
lm-002980 · 2026-08

共享符號不等於共享世界:異質智慧間的多層世界分離與任務充分耦合

下載 MD 檔 ⬇

title: "共享符號不等於共享世界:異質智慧間的多層世界分離與任務充分耦合" english_title: "Shared Symbols Do Not Imply Shared Worlds: Multi-Layer World Separation and Task-Sufficient Coupling Across Heterogeneous Intelligences" author: "Neo.K(許筌崴)" institution: "EveMissLab(一言諾科技有限公司)" series: "異質智慧動態協議生成系列" paper_no: "01" version: "v0.1" date: "2026-08-14" status: "正式研究草稿" canonical_source_encoding: "UTF-8"

共享符號不等於共享世界:異質智慧間的多層世界分離與任務充分耦合

Shared Symbols Do Not Imply Shared Worlds: Multi-Layer World Separation and Task-Sufficient Coupling Across Heterogeneous Intelligences

作者:Neo.K(許筌崴)
機構:EveMissLab(一言諾科技有限公司)
系列:異質智慧動態協議生成系列,第 1 篇
版本:v0.1
日期:2026 年 8 月 14 日


摘要

人類與人工智慧可以共同使用自然語言、數學符號、程式碼、JSON、圖結構、形式語言與其他可共享符號載體。然而,共享同一符號,不代表不同智慧體以同一方式看見世界、表示世界、賦予符號意義,或以同一方式使符號進入行動。本文提出一個最低限度但重要的分離命題:

Shared Symbols⇏Shared Worlds\boxed{ \text{Shared Symbols} \not\Rightarrow \text{Shared Worlds} }

本文不把「世界」限制為現象學或意識經驗,而以功能性方式將智慧體 AiA_i 的可交互世界分為四層:可觀測/可接取世界 WiP\mathcal W_i^{P} 、內部表徵世界 WiR\mathcal W_i^{R} 、語義—判定世界 WiS\mathcal W_i^{S} 、操作—狀態轉移世界 WiO\mathcal W_i^{O}。不同主體可以在公共符號空間 L\mathcal L 中交換相同符號 ss,卻由不同解碼映射產生不同內部狀態:

DA(s)DB(s).D_A(s)\neq D_B(s).

因此,符號同一不推出表徵同一;表徵同一也不自動推出操作同一。本文進一步承接既有「符號瞬時判定域」與「任務充分對齊」框架,把跨智慧理解改寫為任務條件下的局部耦合問題:兩個智慧體不必共享完整內部世界,只要在任務 TT 的關鍵探針、判定與操作上形成足以共同工作的跨世界映射,即可稱為「任務充分耦合」。

近期研究已顯示,異質視覺代理可以在不同私有視覺表徵下形成共享離散符號,但表徵差異增大時,共享符號會減少、變粗並更不對稱;人類與大型視覺語言模型在重複指稱任務中的 grounding 方式也存在系統性差異;此外,共享感知資訊本身並不保證已建立共同理解。這些結果與本文的最小命題相容,但本文進一步把問題從「私有感知 vs 共享符號」推廣至「感知/表徵/語義/操作」四層異質世界,並將其與任務充分判定耦合相連。

本文最後提出七項可證偽命題與一組最低實驗設計,並指出本系列後續問題:若不存在單一固定符號載體能跨越所有異質世界,是否存在一種足夠一般的協議生成機制,能對每一組可耦合智慧體與給定任務,逐步生成任務充分的共享符號介面?該問題將於下一篇以全域量詞換序形式處理。

關鍵詞: 異質智慧、共享符號、共享世界、符號奠基、任務充分耦合、任務充分對齊、跨世界映射、emergent communication、common ground、representational alignment、AI-native interface


0. 研究位置與命題邊界

0.1 本系列母問題

本系列的母問題不是:

「AI 最適合用哪一種語言?」

也不是:

「人類與 AI 是否真正具有相同理解?」

而是:

是否存在一種足夠一般的協議生成機制,使任意「可互相建立某種耦合」的異質智慧,在給定任務下,都能逐步建立任務充分的共享符號介面?

本文不直接回答這個帶有強全域量詞的問題,而先建立它的第一個必要前提:

符號介面可共享,不代表內部世界必須同一。\boxed{ \text{符號介面可共享,不代表內部世界必須同一。} }

如果這一點不先分開,後續所有「通用協議」討論都容易把「共同使用一種格式」誤寫成「共同擁有一種認知」。


0.2 內部理論承接

本文直接承接兩項既有內部研究。

第一,《符號瞬時判定域:從語義同一到任務下判定等價》已提出:

BABB\mathcal B_A\neq\mathcal B_B

並不妨礙兩個主體在任務 TT 上達到:

ATδB.A\approx_T^\delta B.

其核心思想是:完整內部語義同一不是所有協作任務的必要條件;在特定任務、尺度、時間與風險條件下,足夠的判定等價可能已足以支撐共同工作。

第二,《共享參照場與任務充分對齊:為何共同文件不等於共同認知》已區分:

Shared ReferenceShared RepresentationShared JudgmentShared Memory\boxed{ \text{Shared Reference} \neq \text{Shared Representation} \neq \text{Shared Judgment} \neq \text{Shared Memory} }

本文把這一分離再向下推至「主體世界」層:即使雙方不只共享文件,而是共享同一符號、同一畫面、同一物件甚至同一任務,也不能直接推出其內部表徵、語義與操作狀態相同。


0.3 「世界」不是意識宣告

本文使用:

Wi\mathcal W_i

描述智慧體 AiA_i 可存取、表示、判定與操作的狀態域。

這裡的「世界」是功能性/計算性分析詞,不預設:

  1. AI 具有與人類同型的主觀經驗;
  2. AI 具有現象學意識;
  3. 模型內部表徵可直接等同人類概念;
  4. 人類的內部世界可以被完整形式化;
  5. 任一當前模型真的使用本文所寫的四層資料結構。

因此:

WAWH\mathcal W_A\neq\mathcal W_H

在本文中只代表:

兩個系統的可觀測輸入、內部表徵、判定映射或可執行操作可以不同。

不是形上學的意識判決。


1. 外部研究:共享符號問題已經出現,但尚未等於本文問題

1.1 符號奠基:符號不只需要符號對符號

Harnad 的符號奠基問題指出,純形式符號系統中的符號意義不能只靠另一組符號無限循環地解釋;至少必須面對符號如何與非符號層的辨識、分類或世界關聯建立聯繫的問題。[1]

本文與此相連,但問題方向不同。

符號奠基主要問:

symbolgrounded meaning\text{symbol} \rightarrow \text{grounded meaning}

本文進一步問:

同一 symbol{worldAworldB\text{同一 symbol} \rightarrow \begin{cases} \text{world}_A\\ \text{world}_B \end{cases}

當不同智慧體都能「使用」同一符號時,它們是否必須具有相同奠基、相同表徵或相同操作效果?

本文回答:不必。


1.2 成功溝通不等於人類式概念表徵

Bouchacourt 與 Baroni 在 emergent communication 的視覺指稱遊戲中發現,代理在互動後可以形成高度對齊的視覺表徵並成功溝通,但這些表徵未必捕捉輸入影像的人類概念性屬性。[2]

這個結果很重要,因為它直接拆開:

communication success\text{communication success}

與:

human-conceptual representation.\text{human-conceptual representation}.

本文不把該實驗泛化成「所有成功溝通都不需要共同表徵」;相反地,它顯示至少存在一類任務,其中成功溝通與我們直覺期待的概念對齊並不同步


1.3 不同視角仍可形成共同指稱

Tang、Mao 與 Suhr 的多視角指稱研究讓兩個代理位於同一場景但具有不同視覺位置,並要求它們生成與理解物件及空間關係的指稱語句。[3]

這顯示「共同場景」並不等於:

PA=PB.P_A=P_B.

即使兩個主體處於同一外部環境,它們可取得的觀察也可能不同;要成功溝通,必須把他者視角納入指稱過程。


1.4 2026:共享符號、私有表徵已成直接研究問題

Ochiai、Nagano 與 Taniguchi 在 2026 年預印本中直接研究「異質視覺代理」:代理具有不同 frozen visual encoders,不共享外部 communicative objective,只交換離散 token sequences,並依各自私有視覺證據更新。[4]

其實驗顯示,共享符號仍可以形成;然而,隨視覺 encoder mismatch 增加,跨代理指標下降,共享序列變少、變粗且更不對稱。[4]

這是與本文最接近的外部工作之一。

但本文的研究域更廣:

private perceptionheterogeneous world.\text{private perception} \subset \text{heterogeneous world}.

即使感知層高度相似,智慧體仍可能在:

  • 表徵;
  • 語義;
  • 判定;
  • 操作;

等層面異質。


1.5 人類與 LVLM 可能用不同方式建立 grounding

Zeng 等人在 ACL 2026 的人類—LVLM 指稱實驗中比較 human-human、human-AI、AI-human、AI-AI 四種配對,結果顯示現有 LVLM 在互動式生成與解析指稱語句、逐輪建立共同 grounding 的能力仍與人類不同。[5]

因此,若人與 AI 最後輸出相同詞彙或選中相同物件,也不能只憑輸出同一,推定雙方使用了相同 grounding process。


1.6 「看見同樣資訊」仍不等於「已共享理解」

Li、Gatt 與 Poesio 在 SIGDIAL 2026 的研究進一步指出,共享感知資訊本身不能保證共享詮釋;部分 VLM 甚至會把「可能共享的地圖內容」過度當成「已建立的共同基礎」。[6]

這與本文的核心分離非常接近:

Potentially ShareableActually Shared\boxed{ \text{Potentially Shareable} \neq \text{Actually Shared} }

也就是:

同一外部資訊⇏同一內部狀態.\text{同一外部資訊} \not\Rightarrow \text{同一內部狀態}.

2. 四層異質世界模型

2.1 智慧體世界四元組

對任一智慧體/代理/主體 AiA_i,定義:

Wi=(WiP,WiR,WiS,WiO)\boxed{ \mathfrak W_i = \left( \mathcal W_i^{P}, \mathcal W_i^{R}, \mathcal W_i^{S}, \mathcal W_i^{O} \right) }

其中:

第一層:可觀測/可接取世界

WiP\mathcal W_i^{P}

表示 AiA_i 能夠取得的輸入、訊號與狀態。

對人類可以包括:

  • 視覺;
  • 聽覺;
  • 身體感覺;
  • 語言;
  • 記憶回取。

對 AI/Agent 可以包括:

  • token context;
  • image embeddings;
  • tool outputs;
  • files;
  • API responses;
  • retrieved chunks;
  • runtime state。

「可接取」比「感知」更一般,以避免把所有計算輸入人化。


第二層:表徵世界

WiR\mathcal W_i^{R}

表示主體對可接取內容形成的內部表示。

本文不要求其具有人類可讀形式。

可以是:

  • 概念;
  • 空間模型;
  • 關聯圖;
  • latent representation;
  • hidden state;
  • memory structure;
  • rule state;
  • 其他未知內部表示。

第三層:語義—判定世界

WiS\mathcal W_i^{S}

表示哪些內部差異會影響:

  • 「這是什麼」;
  • 「此符號指向何物」;
  • 「哪一個解釋成立」;
  • 「哪一個答案可接受」;
  • 「何時需要澄清」;
  • 「是否已足夠確定」。

這一層不等同自然語言詞義,而是包含任務條件下的判定結構


第四層:操作—狀態轉移世界

WiO\mathcal W_i^{O}

表示哪些符號、判定或內部狀態可以導致什麼行動與狀態變化。

對人類:

「打開門」

可能先進入意圖、肌肉控制與物理行動。

對 Agent:

{"action":"open_file","path":"..."}

可能進入 schema validation、tool routing、permission checking 與 runtime execution。

兩者可以理解「打開」這個公共詞,但:

OH(open)OA(open)O_H(\text{open}) \neq O_A(\text{open})

3. 公共符號空間

3.1 可共享符號載體

令:

L\mathcal L

表示至少兩個智慧體可以交換、觀察或解析的一個公共符號空間。

L\mathcal L 可以是:

  • 自然語言;
  • 數學;
  • 程式碼;
  • JSON;
  • YAML;
  • 圖;
  • 音訊符號;
  • 視覺符號;
  • operator DSL;
  • AI-oriented format;
  • 多模態混合協議。

本文不給任何現有格式本體上的優先地位。


3.2 編碼與解碼

對智慧體 AiA_i,定義:

Ei:WiLE_i: \mathfrak W_i \rightarrow \mathcal L

為外部化/編碼映射。

再定義:

Di:LW^iD_i: \mathcal L \rightarrow \widehat{\mathfrak W}_i

為接收/解碼映射。

因此,一個共享符號:

sLs\in\mathcal L

AABB 同時接收時:

DA(s)D_A(s)

與:

DB(s)D_B(s)

不必相同。

即:

sA=sB⇏DA(s)=DB(s)\boxed{ s_A=s_B \not\Rightarrow D_A(s)=D_B(s) }

這就是本文第一個基本命題。


4. 共享符號非共享世界原理

4.1 弱式原理

原理 1:符號同一不推出表徵同一

存在:

sLs\in\mathcal L

使:

sA=sB=ss_A=s_B=s

但:

DAR(s)DBR(s).D_A^{R}(s) \neq D_B^{R}(s).

4.2 語義版本

原理 2:符號同一不推出判定函數同一

即使:

sA=sB,s_A=s_B,

仍可能:

JA(s,c)JB(s,c)J_A(s,c) \neq J_B(s,c)

其中 cc 為上下文。

因此「使用同一詞」不能單獨作為共享語義的充分證據。


4.3 操作版本

原理 3:符號同一不推出狀態轉移同一

令:

Γi:WiS×WiOWiO\Gamma_i: \mathcal W_i^{S}\times\mathcal W_i^{O} \rightarrow \mathcal W_i^{O}

為操作轉移函數。

則:

DA(s)=DB(s)D_A(s)=D_B(s)

即使在某種語義度量下成立,也不必推出:

ΓA(s)=ΓB(s).\Gamma_A(s)=\Gamma_B(s).

例如同一段程式碼:

  • 對人類可以是可閱讀的形式物;
  • 對某執行環境可以直接成為機器狀態轉移的來源;
  • 對另一個沒有相應 runtime 的系統則只是純文字。

因此:

Shared Meaning⇏Shared Operability\boxed{ \text{Shared Meaning} \not\Rightarrow \text{Shared Operability} }

5. 表面模仿與操作本體的分離

5.1 人類可以模仿 AI 文風

一個人可以刻意寫:

Constraints:
1. Preserve X.
2. Output JSON.
3. Return only valid schema.

或者模仿某一時期 LLM 的:

  • 條列格式;
  • 對稱小標;
  • 「核心洞見」;
  • 總結句;
  • Markdown;
  • 典型 transition phrase。

因此:

AI-like surface⇏AI source.\text{AI-like surface} \not\Rightarrow \text{AI source}.

5.2 AI 也可以模仿人類文風

同理,AI 可以生成:

  • 散文;
  • 文言;
  • 小說;
  • 學術論證;
  • 個人風格;
  • 歷史文體。

因此:

human-like surface⇏human source.\text{human-like surface} \not\Rightarrow \text{human source}.

5.3 但符號模仿不等於世界模仿

定義:

ImitateL(A,B)\operatorname{Imitate}_{\mathcal L}(A,B)

表示 AA 可以在公共符號層模仿 BB 的輸出分布。

即使:

ImitateL(A,B)1,\operatorname{Imitate}_{\mathcal L}(A,B)\approx1,

也不能推出:

WAWB.\mathfrak W_A \approx \mathfrak W_B.

因此提出:

Symbolic ImitationOperational-World Identity\boxed{ \text{Symbolic Imitation} \neq \text{Operational-World Identity} }

這是 AI attribution 問題與異質智慧通訊問題必須分開的原因。


6. 任務充分跨世界耦合

6.1 不要求世界同一

若要求:

WA=WB\mathfrak W_A=\mathfrak W_B

才能合作,則人—人之間很多交流也難以滿足。

因此,本文改採任務條件。

令:

TT

為任務,

QT={q1,,qm}\mathcal Q_T = \{q_1,\ldots,q_m\}

為任務相關 probe 集。

每個 probe 有風險/重要性權重:

wk0.w_k\ge0.

6.2 判定對齊函數

令:

Ji(qk)J_i(q_k)

表示主體 AiA_i 對 probe qkq_k 的任務判定。

定義:

TSAT(A,B)=1k=1mwkdT(JA(qk),JB(qk))k=1mwk,\operatorname{TSA}_T(A,B) = 1- \frac{ \sum_{k=1}^{m} w_k d_T \left( J_A(q_k), J_B(q_k) \right) }{ \sum_{k=1}^{m}w_k },

其中:

0dT1.0\le d_T\le1.

若:

TSAT(A,B)1δ,\operatorname{TSA}_T(A,B) \ge 1-\delta,

則稱:

ATδB.A \approx_T^\delta B.

這只是任務充分對齊。


6.3 加入操作結果

然而跨智慧介面還需要操作層。

令:

ai(qk)a_i(q_k)

為主體在 probe 下採取的行動,

RT(ai)R_T(a_i)

為任務結果。

定義操作差:

dO(RT(aA),RT(aB)).d_O \left( R_T(a_A), R_T(a_B) \right).

若同時:

TSAT(A,B)1δS\operatorname{TSA}_T(A,B) \ge1-\delta_S

且:

kwkdO(RT(aAk),RT(aBk))kwkδO,\frac{ \sum_k w_k d_O(R_T(a_A^k),R_T(a_B^k)) }{ \sum_k w_k } \le\delta_O,

則稱 AABB 達到:

δ-任務充分跨世界耦合\boxed{ \delta\text{-任務充分跨世界耦合} }

記為:

ATδS,δOB.A \bowtie_T^{\delta_S,\delta_O} B.

7. 跨世界符號橋

7.1 橋不是同構

定義任務 TT 下的跨世界符號橋:

BABT=DBEA.\mathcal B_{A\rightarrow B}^{T} = D_B \circ E_A.

它把:

WA\mathfrak W_A

中的某些任務相關狀態,經公共符號空間映射至:

W^B.\widehat{\mathfrak W}_B.

但不要求:

BABT\mathcal B_{A\rightarrow B}^{T}

是雙射。

甚至不要求它在所有狀態上有定義。

只要求對:

ΩTWA\Omega_T\subseteq\mathfrak W_A

的任務相關子域足夠有效。


7.2 局部同態而非全域同構

本文因此主張:

Cross-world communication needs local task homomorphism, not global world isomorphism.\boxed{ \text{Cross-world communication} \text{ needs local task homomorphism, not global world isomorphism.} }

形式上,希望在任務子域:

x,yΩTx,y\in\Omega_T

中,某些任務相關關係:

RA(x,y)R_A(x,y)

能被橋接後保持:

RB(B(x),B(y)).R_B \left( \mathcal B(x), \mathcal B(y) \right).

但對任務外結構:

Ω¬T\Omega_{\neg T}

可以完全不保證。


8. 為什麼「同一世界」反而可能是不必要要求

8.1 人—人已經不是完全同一

兩個人使用「紅色」,不代表:

  • 視網膜反應相同;
  • 主觀感受相同;
  • 色彩記憶相同;
  • 美學聯想相同;
  • 行動傾向相同。

但在交通號誌任務:

TtrafficT_{\text{traffic}}

中,只要雙方都能穩定判定:

redstop,\text{red} \rightarrow \text{stop},

即可達到任務充分耦合。


8.2 人—AI 的異質性只是更顯著

人類說:

「把這個檔案打開。」

對人類而言,「打開」可能是一個意圖與物理介面行為。

對 Agent 而言,同一句話可能需要:

intent parsepath resolutionpermissiontool invocationresult state.\text{intent parse} \rightarrow \text{path resolution} \rightarrow \text{permission} \rightarrow \text{tool invocation} \rightarrow \text{result state}.

所以雙方共享的是:

s=「打開」,s=\text{「打開」},

不是:

OH=OA.O_H=O_A.

8.3 AI—AI 也可能異質

不同 AI 系統可以具有:

  • 不同 encoder;
  • 不同 memory;
  • 不同 tools;
  • 不同 schema;
  • 不同 latent geometry;
  • 不同 state machine;
  • 不同 action space。

因此「AI 與 AI」也不能被假設為同一世界。

2026 年異質視覺代理的結果已直接顯示,encoder mismatch 的增加會改變可形成共享符號的內容、數量與對稱性。[4]


9. 七項可證偽命題

命題一:共享符號非共享表徵命題

存在任務 TT 與主體 A,BA,B,使:

sA=sBs_A=s_B

但:

DAR(s)DBR(s),D_A^{R}(s)\neq D_B^{R}(s),

同時仍:

ATB.A\bowtie_T B.

否證條件

若所有成功使用共享符號的系統,都必然收斂到可證明同構的內部表徵,則此命題失敗。


命題二:共享感知非共享語義命題

即使:

WAPWBP,\mathcal W_A^P \approx \mathcal W_B^P,

仍可能:

WAS≉WBS.\mathcal W_A^S \not\approx \mathcal W_B^S.

近期 VLM common-ground 研究已提供與此相容的實例:可取得相同地圖資訊的模型仍可能把「可能共享」誤判為「已共同理解」。[6]


命題三:任務充分弱於世界同一

存在:

ATδBA\bowtie_T^\delta B

但:

WA≇WB.\mathfrak W_A\not\cong\mathfrak W_B.

這是整個系列的重要可行性條件。


命題四:異質度—橋接成本命題

定義異質度:

H(A,B)H(A,B)

若其他條件固定,則存在某些任務族使:

H(A,B)Cbridge(A,B,T).H(A,B)\uparrow \Rightarrow C_{\text{bridge}}(A,B,T)\uparrow.

2026 年異質視覺代理實驗中,encoder mismatch 增大時跨代理溝通指標下降,與此方向一致。[4]

但本文不主張單調律對所有智慧與任務成立。


命題五:格式非本體命題

沒有理由由:

L=JSONL=\text{JSON}

推出:

LL

是 AI 的「內在語言」。

同樣,由:

L=自然語言L=\text{自然語言}

也不能推出它就是人類全部內部認知的原生資料格式。

本文只把格式視為:

interface carrier\boxed{ \text{interface carrier} }

而非內在世界本體。


命題六:操作不對稱命題

同一符號:

ss

對兩個智慧體可能具有不同 operation distance:

CAO(s)CBO(s).C_A^{O}(s)\neq C_B^{O}(s).

因此,未來跨智慧介面的最佳化不能只看:

  • token 長度;
  • 語法;
  • 可讀性;

還必須看符號到可執行狀態的轉換成本。


命題七:共享符號可先於共享世界收斂

在互動學習中可能出現:

LAB 已足以支援 T\mathcal L_{AB} \text{ 已足以支援 }T

但:

WA,WB\mathfrak W_A,\mathfrak W_B

仍保持顯著異質。

若此現象可穩定重現,將支持:

protocol convergenceworld convergence.\boxed{ \text{protocol convergence} \neq \text{world convergence}. }

10. 最低實驗框架

10.1 三類主體

至少建立:

  1. 同質 AI pair;
  2. 異質 AI pair;
  3. human–AI pair。

之後再加入:

  1. human–human;
  2. multi-agent population。

10.2 控制異質度

可控制:

  • 不同視覺 encoder;
  • 不同語言模型;
  • 不同 memory access;
  • 不同 tools;
  • 不同 action space;
  • 不同資料來源;
  • 不同觀測解析度。

建立:

H(A,B)[0,1]H(A,B)\in[0,1]

的代理指標。


10.3 共享符號條件

比較:

Condition A:自然語言

LA=NLL_A=\text{NL}

Condition B:固定形式格式

LB=schemaL_B=\text{schema}

Condition C:自適應符號介面

Lt+1=F(Lt,feedback).L_{t+1}=F(L_t,\text{feedback}).

本篇不要求 Condition C 已有一般解;它將成為後續系列核心。


10.4 測量

至少測:

任務成功率

STS_T

符號成本

CLC_L

解碼錯誤

ESE_S

執行錯誤

EOE_O

修復輪數

NrepairN_{\text{repair}}

表徵相似度

RsimR_{\text{sim}}

最後檢查:

STS_T

是否能在:

Rsim<1R_{\text{sim}}<1

甚至較低情況下仍維持高值。


11. 與 emergent communication 的差別

本文與 emergent communication 高度相關,但研究問題不完全相同。

傳統 emergent communication 常問:

代理能否透過互動發明一種有助任務的溝通協議?

本文問:

當代理本身的可觀測、表徵、語義與操作世界都可能異質時,什麼程度的共享才足以稱為可工作的跨世界介面?

因此本文將研究單位從:

message protocol\text{message protocol}

擴展為:

worldinterfaceworld.\boxed{ \text{world} \leftrightarrow \text{interface} \leftrightarrow \text{world}. }

這一擴展使人類—AI、AI—AI 與未來未知智慧體可以進入同一分析框架。


12. 與 common ground 的差別

common ground 研究通常關注參與者如何建立、更新與追蹤彼此認為已共同接受的資訊。

本文不否定 common ground。

但本文指出,在 common ground 之前還存在一個更底層問題:

雙方用來建立 ground 的世界結構本身可能不同。\boxed{ \text{雙方用來建立 ground 的世界結構本身可能不同。} }

因此:

Grounding\text{Grounding}

不是把兩個世界變成同一世界,

而可能只是建立:

BABT\mathcal B_{A\leftrightarrow B}^{T}

使任務相關部分足以互譯。

Zeng 等人的 human/LVLM 實驗與 Li 等人的 asymmetric dialogue 實驗都顯示:模型可能完成部分 referential matching,卻仍沒有以人類方式逐步建立或追蹤 common ground。[5][6]


13. 一個更強但尚不採用的命題

很容易把本文誤讀成:

A,B,T,L:ATB.\forall A,B,T, \exists L: A\bowtie_T B.

本文不主張這件事。

因為可能存在:

  • 完全無共同通道;
  • 不可觀測狀態;
  • 不可表達的任務差異;
  • 計算不可行;
  • 行動空間不相容;
  • 無法建立回饋;
  • 惡意或非合作;
  • 符號頻寬不足。

因此本篇只建立:

世界可以異質,而共享符號仍可能形成局部任務耦合。\boxed{ \text{世界可以異質,而共享符號仍可能形成局部任務耦合。} }

至於:

對「所有可耦合智慧體」,是否總能生成某種任務充分介面?

那是一個更強的量詞問題,留待下一篇。


14. 下一篇:量詞換序

下一篇將比較:

L(A,B,T)\boxed{ \exists L^\ast \forall(A,B,T) }

與:

(A,B,T)LA,B,T\boxed{ \forall(A,B,T) \exists L_{A,B,T} }

以及更重要的:

M(A,B,T)C  LA,B,T\boxed{ \exists\mathcal M \forall(A,B,T)\in\mathcal C \; \exists L_{A,B,T} }

其中:

M\mathcal M

不是一個固定語言,而是:

動態共享協議生成器。

因此本系列真正尋找的可能從來不是:

Universal Language,\text{Universal Language},

而是:

Universal-enough Protocol Constructor.\boxed{ \text{Universal-enough Protocol Constructor}. }

15. 結論

本文建立了異質智慧動態協議生成系列的最低本體分離:

Shared Symbols⇏Shared Worlds.\boxed{ \text{Shared Symbols} \not\Rightarrow \text{Shared Worlds}. }

不同智慧體可以:

  • 看見不同資訊;
  • 使用不同內部表徵;
  • 形成不同語義結構;
  • 具有不同操作世界;

卻仍在公共符號層:

L\mathcal L

相遇。

真正的跨智慧溝通不必要求:

WA=WB,\mathfrak W_A=\mathfrak W_B,

而可以只要求:

ATδB.\boxed{ A \bowtie_T^\delta B. }

即:在任務相關子域內,符號橋已足以支援需要的判定與行動。

因此,未來人類與 AI 的共同科學、共同數學、共同程式設計與共同知識系統,也不應被迫二選一:

要嘛 AI 永遠只能使用人類原生表示;
要嘛 AI 進入人類完全不可理解的黑箱世界。

第三條路是:

異質世界保留+共享介面生成+任務充分互譯.\boxed{ \text{異質世界保留} + \text{共享介面生成} + \text{任務充分互譯}. }

本篇證明不了這條路對所有可耦合智慧都存在。

但它先把問題改寫成一個可以研究、可以否證、也可以工程化的形式。


參考文獻

[1] Harnad, S. (1990). The Symbol Grounding Problem. Physica D: Nonlinear Phenomena, 42(1–3), 335–346.

[2] Bouchacourt, D., & Baroni, M. (2018). How agents see things: On visual representations in an emergent language game. Proceedings of EMNLP 2018, 981–985.

[3] Tang, Z., Mao, L., & Suhr, A. (2024). Grounding Language in Multi-Perspective Referential Communication. Proceedings of EMNLP 2024, 19727–19741. DOI: 10.18653/v1/2024.emnlp-main.1100.

[4] Ochiai, M., Nagano, M., & Taniguchi, T. (2026). Emergent Communication between Heterogeneous Visual Agents through Decentralized Learning. arXiv:2605.11695. Preprint.

[5] Zeng, P., Li, W., Paige, A. J., Wang, Z., Kaliosis, P., Samaras, D., Zelinsky, G. J., Brennan, S., & Rambow, O. (2026). LVLMs and Humans Ground Differently in Referential Communication. Proceedings of ACL 2026, 9061–9087. DOI: 10.18653/v1/2026.acl-long.410.

[6] Li, N., Gatt, A., & Poesio, M. (2026). Seeing Is Not Sharing: Some Vision-Language Models Overestimate Common Ground in Asymmetric Dialogue. Proceedings of SIGDIAL 2026.

[7] Evtimova, K., Drozdov, A., Kiela, D., & Cho, K. (2017). Emergent Communication in a Multi-Modal, Multi-Step Referential Game. arXiv:1705.10369.

[8] Harding Graesser, L., Cho, K., & Kiela, D. (2019). Emergent Linguistic Phenomena in Multi-Agent Communication Games. Proceedings of EMNLP-IJCNLP 2019, 3700–3710. DOI: 10.18653/v1/D19-1384.

[9] Feng, Y., & Lu, Z. (2023). Multi-Agent Language Learning: Symbolic Mapping. Findings of ACL 2023, 7756–7770. DOI: 10.18653/v1/2023.findings-acl.491.


內部理論依賴

  • Neo.K(2026-08-12),《符號瞬時判定域:從語義同一到任務下判定等價》,符號—記憶—判定耦合系列 Paper 01。
  • Neo.K(2026-08-12),《共享參照場與任務充分對齊:為何共同文件不等於共同認知》,符號—記憶—判定耦合系列 Paper 04。
  • 本系列前置對話命題:共享符號—異質世界、跨世界映射、任務充分共享介面、動態協議生成與全域量詞換序。