title: "共享符號不等於共享世界:異質智慧間的多層世界分離與任務充分耦合" english_title: "Shared Symbols Do Not Imply Shared Worlds: Multi-Layer World Separation and Task-Sufficient Coupling Across Heterogeneous Intelligences" author: "Neo.K(許筌崴)" institution: "EveMissLab(一言諾科技有限公司)" series: "異質智慧動態協議生成系列" paper_no: "01" version: "v0.1" date: "2026-08-14" status: "正式研究草稿" canonical_source_encoding: "UTF-8"
共享符號不等於共享世界:異質智慧間的多層世界分離與任務充分耦合
Shared Symbols Do Not Imply Shared Worlds: Multi-Layer World Separation and Task-Sufficient Coupling Across Heterogeneous Intelligences
作者:Neo.K(許筌崴)
機構:EveMissLab(一言諾科技有限公司)
系列:異質智慧動態協議生成系列,第 1 篇
版本:v0.1
日期:2026 年 8 月 14 日
摘要
人類與人工智慧可以共同使用自然語言、數學符號、程式碼、JSON、圖結構、形式語言與其他可共享符號載體。然而,共享同一符號,不代表不同智慧體以同一方式看見世界、表示世界、賦予符號意義,或以同一方式使符號進入行動。本文提出一個最低限度但重要的分離命題:
本文不把「世界」限制為現象學或意識經驗,而以功能性方式將智慧體 的可交互世界分為四層:可觀測/可接取世界 、內部表徵世界 、語義—判定世界 、操作—狀態轉移世界 。不同主體可以在公共符號空間 中交換相同符號 ,卻由不同解碼映射產生不同內部狀態:
因此,符號同一不推出表徵同一;表徵同一也不自動推出操作同一。本文進一步承接既有「符號瞬時判定域」與「任務充分對齊」框架,把跨智慧理解改寫為任務條件下的局部耦合問題:兩個智慧體不必共享完整內部世界,只要在任務 的關鍵探針、判定與操作上形成足以共同工作的跨世界映射,即可稱為「任務充分耦合」。
近期研究已顯示,異質視覺代理可以在不同私有視覺表徵下形成共享離散符號,但表徵差異增大時,共享符號會減少、變粗並更不對稱;人類與大型視覺語言模型在重複指稱任務中的 grounding 方式也存在系統性差異;此外,共享感知資訊本身並不保證已建立共同理解。這些結果與本文的最小命題相容,但本文進一步把問題從「私有感知 vs 共享符號」推廣至「感知/表徵/語義/操作」四層異質世界,並將其與任務充分判定耦合相連。
本文最後提出七項可證偽命題與一組最低實驗設計,並指出本系列後續問題:若不存在單一固定符號載體能跨越所有異質世界,是否存在一種足夠一般的協議生成機制,能對每一組可耦合智慧體與給定任務,逐步生成任務充分的共享符號介面?該問題將於下一篇以全域量詞換序形式處理。
關鍵詞: 異質智慧、共享符號、共享世界、符號奠基、任務充分耦合、任務充分對齊、跨世界映射、emergent communication、common ground、representational alignment、AI-native interface
0. 研究位置與命題邊界
0.1 本系列母問題
本系列的母問題不是:
「AI 最適合用哪一種語言?」
也不是:
「人類與 AI 是否真正具有相同理解?」
而是:
是否存在一種足夠一般的協議生成機制,使任意「可互相建立某種耦合」的異質智慧,在給定任務下,都能逐步建立任務充分的共享符號介面?
本文不直接回答這個帶有強全域量詞的問題,而先建立它的第一個必要前提:
如果這一點不先分開,後續所有「通用協議」討論都容易把「共同使用一種格式」誤寫成「共同擁有一種認知」。
0.2 內部理論承接
本文直接承接兩項既有內部研究。
第一,《符號瞬時判定域:從語義同一到任務下判定等價》已提出:
並不妨礙兩個主體在任務 上達到:
其核心思想是:完整內部語義同一不是所有協作任務的必要條件;在特定任務、尺度、時間與風險條件下,足夠的判定等價可能已足以支撐共同工作。
第二,《共享參照場與任務充分對齊:為何共同文件不等於共同認知》已區分:
本文把這一分離再向下推至「主體世界」層:即使雙方不只共享文件,而是共享同一符號、同一畫面、同一物件甚至同一任務,也不能直接推出其內部表徵、語義與操作狀態相同。
0.3 「世界」不是意識宣告
本文使用:
描述智慧體 可存取、表示、判定與操作的狀態域。
這裡的「世界」是功能性/計算性分析詞,不預設:
- AI 具有與人類同型的主觀經驗;
- AI 具有現象學意識;
- 模型內部表徵可直接等同人類概念;
- 人類的內部世界可以被完整形式化;
- 任一當前模型真的使用本文所寫的四層資料結構。
因此:
在本文中只代表:
兩個系統的可觀測輸入、內部表徵、判定映射或可執行操作可以不同。
不是形上學的意識判決。
1. 外部研究:共享符號問題已經出現,但尚未等於本文問題
1.1 符號奠基:符號不只需要符號對符號
Harnad 的符號奠基問題指出,純形式符號系統中的符號意義不能只靠另一組符號無限循環地解釋;至少必須面對符號如何與非符號層的辨識、分類或世界關聯建立聯繫的問題。[1]
本文與此相連,但問題方向不同。
符號奠基主要問:
本文進一步問:
當不同智慧體都能「使用」同一符號時,它們是否必須具有相同奠基、相同表徵或相同操作效果?
本文回答:不必。
1.2 成功溝通不等於人類式概念表徵
Bouchacourt 與 Baroni 在 emergent communication 的視覺指稱遊戲中發現,代理在互動後可以形成高度對齊的視覺表徵並成功溝通,但這些表徵未必捕捉輸入影像的人類概念性屬性。[2]
這個結果很重要,因為它直接拆開:
與:
本文不把該實驗泛化成「所有成功溝通都不需要共同表徵」;相反地,它顯示至少存在一類任務,其中成功溝通與我們直覺期待的概念對齊並不同步。
1.3 不同視角仍可形成共同指稱
Tang、Mao 與 Suhr 的多視角指稱研究讓兩個代理位於同一場景但具有不同視覺位置,並要求它們生成與理解物件及空間關係的指稱語句。[3]
這顯示「共同場景」並不等於:
即使兩個主體處於同一外部環境,它們可取得的觀察也可能不同;要成功溝通,必須把他者視角納入指稱過程。
1.4 2026:共享符號、私有表徵已成直接研究問題
Ochiai、Nagano 與 Taniguchi 在 2026 年預印本中直接研究「異質視覺代理」:代理具有不同 frozen visual encoders,不共享外部 communicative objective,只交換離散 token sequences,並依各自私有視覺證據更新。[4]
其實驗顯示,共享符號仍可以形成;然而,隨視覺 encoder mismatch 增加,跨代理指標下降,共享序列變少、變粗且更不對稱。[4]
這是與本文最接近的外部工作之一。
但本文的研究域更廣:
即使感知層高度相似,智慧體仍可能在:
- 表徵;
- 語義;
- 判定;
- 操作;
等層面異質。
1.5 人類與 LVLM 可能用不同方式建立 grounding
Zeng 等人在 ACL 2026 的人類—LVLM 指稱實驗中比較 human-human、human-AI、AI-human、AI-AI 四種配對,結果顯示現有 LVLM 在互動式生成與解析指稱語句、逐輪建立共同 grounding 的能力仍與人類不同。[5]
因此,若人與 AI 最後輸出相同詞彙或選中相同物件,也不能只憑輸出同一,推定雙方使用了相同 grounding process。
1.6 「看見同樣資訊」仍不等於「已共享理解」
Li、Gatt 與 Poesio 在 SIGDIAL 2026 的研究進一步指出,共享感知資訊本身不能保證共享詮釋;部分 VLM 甚至會把「可能共享的地圖內容」過度當成「已建立的共同基礎」。[6]
這與本文的核心分離非常接近:
也就是:
2. 四層異質世界模型
2.1 智慧體世界四元組
對任一智慧體/代理/主體 ,定義:
其中:
第一層:可觀測/可接取世界
表示 能夠取得的輸入、訊號與狀態。
對人類可以包括:
- 視覺;
- 聽覺;
- 身體感覺;
- 語言;
- 記憶回取。
對 AI/Agent 可以包括:
- token context;
- image embeddings;
- tool outputs;
- files;
- API responses;
- retrieved chunks;
- runtime state。
「可接取」比「感知」更一般,以避免把所有計算輸入人化。
第二層:表徵世界
表示主體對可接取內容形成的內部表示。
本文不要求其具有人類可讀形式。
可以是:
- 概念;
- 空間模型;
- 關聯圖;
- latent representation;
- hidden state;
- memory structure;
- rule state;
- 其他未知內部表示。
第三層:語義—判定世界
表示哪些內部差異會影響:
- 「這是什麼」;
- 「此符號指向何物」;
- 「哪一個解釋成立」;
- 「哪一個答案可接受」;
- 「何時需要澄清」;
- 「是否已足夠確定」。
這一層不等同自然語言詞義,而是包含任務條件下的判定結構。
第四層:操作—狀態轉移世界
表示哪些符號、判定或內部狀態可以導致什麼行動與狀態變化。
對人類:
「打開門」
可能先進入意圖、肌肉控制與物理行動。
對 Agent:
{"action":"open_file","path":"..."}
可能進入 schema validation、tool routing、permission checking 與 runtime execution。
兩者可以理解「打開」這個公共詞,但:
3. 公共符號空間
3.1 可共享符號載體
令:
表示至少兩個智慧體可以交換、觀察或解析的一個公共符號空間。
可以是:
- 自然語言;
- 數學;
- 程式碼;
- JSON;
- YAML;
- 圖;
- 音訊符號;
- 視覺符號;
- operator DSL;
- AI-oriented format;
- 多模態混合協議。
本文不給任何現有格式本體上的優先地位。
3.2 編碼與解碼
對智慧體 ,定義:
為外部化/編碼映射。
再定義:
為接收/解碼映射。
因此,一個共享符號:
被 與 同時接收時:
與:
不必相同。
即:
這就是本文第一個基本命題。
4. 共享符號非共享世界原理
4.1 弱式原理
原理 1:符號同一不推出表徵同一
存在:
使:
但:
4.2 語義版本
原理 2:符號同一不推出判定函數同一
即使:
仍可能:
其中 為上下文。
因此「使用同一詞」不能單獨作為共享語義的充分證據。
4.3 操作版本
原理 3:符號同一不推出狀態轉移同一
令:
為操作轉移函數。
則:
即使在某種語義度量下成立,也不必推出:
例如同一段程式碼:
- 對人類可以是可閱讀的形式物;
- 對某執行環境可以直接成為機器狀態轉移的來源;
- 對另一個沒有相應 runtime 的系統則只是純文字。
因此:
5. 表面模仿與操作本體的分離
5.1 人類可以模仿 AI 文風
一個人可以刻意寫:
Constraints:
1. Preserve X.
2. Output JSON.
3. Return only valid schema.
或者模仿某一時期 LLM 的:
- 條列格式;
- 對稱小標;
- 「核心洞見」;
- 總結句;
- Markdown;
- 典型 transition phrase。
因此:
5.2 AI 也可以模仿人類文風
同理,AI 可以生成:
- 散文;
- 文言;
- 小說;
- 學術論證;
- 個人風格;
- 歷史文體。
因此:
5.3 但符號模仿不等於世界模仿
定義:
表示 可以在公共符號層模仿 的輸出分布。
即使:
也不能推出:
因此提出:
這是 AI attribution 問題與異質智慧通訊問題必須分開的原因。
6. 任務充分跨世界耦合
6.1 不要求世界同一
若要求:
才能合作,則人—人之間很多交流也難以滿足。
因此,本文改採任務條件。
令:
為任務,
為任務相關 probe 集。
每個 probe 有風險/重要性權重:
6.2 判定對齊函數
令:
表示主體 對 probe 的任務判定。
定義:
其中:
若:
則稱:
這只是任務充分對齊。
6.3 加入操作結果
然而跨智慧介面還需要操作層。
令:
為主體在 probe 下採取的行動,
為任務結果。
定義操作差:
若同時:
且:
則稱 與 達到:
記為:
7. 跨世界符號橋
7.1 橋不是同構
定義任務 下的跨世界符號橋:
它把:
中的某些任務相關狀態,經公共符號空間映射至:
但不要求:
是雙射。
甚至不要求它在所有狀態上有定義。
只要求對:
的任務相關子域足夠有效。
7.2 局部同態而非全域同構
本文因此主張:
形式上,希望在任務子域:
中,某些任務相關關係:
能被橋接後保持:
但對任務外結構:
可以完全不保證。
8. 為什麼「同一世界」反而可能是不必要要求
8.1 人—人已經不是完全同一
兩個人使用「紅色」,不代表:
- 視網膜反應相同;
- 主觀感受相同;
- 色彩記憶相同;
- 美學聯想相同;
- 行動傾向相同。
但在交通號誌任務:
中,只要雙方都能穩定判定:
即可達到任務充分耦合。
8.2 人—AI 的異質性只是更顯著
人類說:
「把這個檔案打開。」
對人類而言,「打開」可能是一個意圖與物理介面行為。
對 Agent 而言,同一句話可能需要:
所以雙方共享的是:
不是:
8.3 AI—AI 也可能異質
不同 AI 系統可以具有:
- 不同 encoder;
- 不同 memory;
- 不同 tools;
- 不同 schema;
- 不同 latent geometry;
- 不同 state machine;
- 不同 action space。
因此「AI 與 AI」也不能被假設為同一世界。
2026 年異質視覺代理的結果已直接顯示,encoder mismatch 的增加會改變可形成共享符號的內容、數量與對稱性。[4]
9. 七項可證偽命題
命題一:共享符號非共享表徵命題
存在任務 與主體 ,使:
但:
同時仍:
否證條件
若所有成功使用共享符號的系統,都必然收斂到可證明同構的內部表徵,則此命題失敗。
命題二:共享感知非共享語義命題
即使:
仍可能:
近期 VLM common-ground 研究已提供與此相容的實例:可取得相同地圖資訊的模型仍可能把「可能共享」誤判為「已共同理解」。[6]
命題三:任務充分弱於世界同一
存在:
但:
這是整個系列的重要可行性條件。
命題四:異質度—橋接成本命題
定義異質度:
若其他條件固定,則存在某些任務族使:
2026 年異質視覺代理實驗中,encoder mismatch 增大時跨代理溝通指標下降,與此方向一致。[4]
但本文不主張單調律對所有智慧與任務成立。
命題五:格式非本體命題
沒有理由由:
推出:
是 AI 的「內在語言」。
同樣,由:
也不能推出它就是人類全部內部認知的原生資料格式。
本文只把格式視為:
而非內在世界本體。
命題六:操作不對稱命題
同一符號:
對兩個智慧體可能具有不同 operation distance:
因此,未來跨智慧介面的最佳化不能只看:
- token 長度;
- 語法;
- 可讀性;
還必須看符號到可執行狀態的轉換成本。
命題七:共享符號可先於共享世界收斂
在互動學習中可能出現:
但:
仍保持顯著異質。
若此現象可穩定重現,將支持:
10. 最低實驗框架
10.1 三類主體
至少建立:
- 同質 AI pair;
- 異質 AI pair;
- human–AI pair。
之後再加入:
- human–human;
- multi-agent population。
10.2 控制異質度
可控制:
- 不同視覺 encoder;
- 不同語言模型;
- 不同 memory access;
- 不同 tools;
- 不同 action space;
- 不同資料來源;
- 不同觀測解析度。
建立:
的代理指標。
10.3 共享符號條件
比較:
Condition A:自然語言
Condition B:固定形式格式
Condition C:自適應符號介面
本篇不要求 Condition C 已有一般解;它將成為後續系列核心。
10.4 測量
至少測:
任務成功率
符號成本
解碼錯誤
執行錯誤
修復輪數
表徵相似度
最後檢查:
是否能在:
甚至較低情況下仍維持高值。
11. 與 emergent communication 的差別
本文與 emergent communication 高度相關,但研究問題不完全相同。
傳統 emergent communication 常問:
代理能否透過互動發明一種有助任務的溝通協議?
本文問:
當代理本身的可觀測、表徵、語義與操作世界都可能異質時,什麼程度的共享才足以稱為可工作的跨世界介面?
因此本文將研究單位從:
擴展為:
這一擴展使人類—AI、AI—AI 與未來未知智慧體可以進入同一分析框架。
12. 與 common ground 的差別
common ground 研究通常關注參與者如何建立、更新與追蹤彼此認為已共同接受的資訊。
本文不否定 common ground。
但本文指出,在 common ground 之前還存在一個更底層問題:
因此:
不是把兩個世界變成同一世界,
而可能只是建立:
使任務相關部分足以互譯。
Zeng 等人的 human/LVLM 實驗與 Li 等人的 asymmetric dialogue 實驗都顯示:模型可能完成部分 referential matching,卻仍沒有以人類方式逐步建立或追蹤 common ground。[5][6]
13. 一個更強但尚不採用的命題
很容易把本文誤讀成:
本文不主張這件事。
因為可能存在:
- 完全無共同通道;
- 不可觀測狀態;
- 不可表達的任務差異;
- 計算不可行;
- 行動空間不相容;
- 無法建立回饋;
- 惡意或非合作;
- 符號頻寬不足。
因此本篇只建立:
至於:
對「所有可耦合智慧體」,是否總能生成某種任務充分介面?
那是一個更強的量詞問題,留待下一篇。
14. 下一篇:量詞換序
下一篇將比較:
與:
以及更重要的:
其中:
不是一個固定語言,而是:
動態共享協議生成器。
因此本系列真正尋找的可能從來不是:
而是:
15. 結論
本文建立了異質智慧動態協議生成系列的最低本體分離:
不同智慧體可以:
- 看見不同資訊;
- 使用不同內部表徵;
- 形成不同語義結構;
- 具有不同操作世界;
卻仍在公共符號層:
相遇。
真正的跨智慧溝通不必要求:
而可以只要求:
即:在任務相關子域內,符號橋已足以支援需要的判定與行動。
因此,未來人類與 AI 的共同科學、共同數學、共同程式設計與共同知識系統,也不應被迫二選一:
要嘛 AI 永遠只能使用人類原生表示;
要嘛 AI 進入人類完全不可理解的黑箱世界。
第三條路是:
本篇證明不了這條路對所有可耦合智慧都存在。
但它先把問題改寫成一個可以研究、可以否證、也可以工程化的形式。
參考文獻
[1] Harnad, S. (1990). The Symbol Grounding Problem. Physica D: Nonlinear Phenomena, 42(1–3), 335–346.
[2] Bouchacourt, D., & Baroni, M. (2018). How agents see things: On visual representations in an emergent language game. Proceedings of EMNLP 2018, 981–985.
[3] Tang, Z., Mao, L., & Suhr, A. (2024). Grounding Language in Multi-Perspective Referential Communication. Proceedings of EMNLP 2024, 19727–19741. DOI: 10.18653/v1/2024.emnlp-main.1100.
[4] Ochiai, M., Nagano, M., & Taniguchi, T. (2026). Emergent Communication between Heterogeneous Visual Agents through Decentralized Learning. arXiv:2605.11695. Preprint.
[5] Zeng, P., Li, W., Paige, A. J., Wang, Z., Kaliosis, P., Samaras, D., Zelinsky, G. J., Brennan, S., & Rambow, O. (2026). LVLMs and Humans Ground Differently in Referential Communication. Proceedings of ACL 2026, 9061–9087. DOI: 10.18653/v1/2026.acl-long.410.
[6] Li, N., Gatt, A., & Poesio, M. (2026). Seeing Is Not Sharing: Some Vision-Language Models Overestimate Common Ground in Asymmetric Dialogue. Proceedings of SIGDIAL 2026.
[7] Evtimova, K., Drozdov, A., Kiela, D., & Cho, K. (2017). Emergent Communication in a Multi-Modal, Multi-Step Referential Game. arXiv:1705.10369.
[8] Harding Graesser, L., Cho, K., & Kiela, D. (2019). Emergent Linguistic Phenomena in Multi-Agent Communication Games. Proceedings of EMNLP-IJCNLP 2019, 3700–3710. DOI: 10.18653/v1/D19-1384.
[9] Feng, Y., & Lu, Z. (2023). Multi-Agent Language Learning: Symbolic Mapping. Findings of ACL 2023, 7756–7770. DOI: 10.18653/v1/2023.findings-acl.491.
內部理論依賴
- Neo.K(2026-08-12),《符號瞬時判定域:從語義同一到任務下判定等價》,符號—記憶—判定耦合系列 Paper 01。
- Neo.K(2026-08-12),《共享參照場與任務充分對齊:為何共同文件不等於共同認知》,符號—記憶—判定耦合系列 Paper 04。
- 本系列前置對話命題:共享符號—異質世界、跨世界映射、任務充分共享介面、動態協議生成與全域量詞換序。