語義對齊作為知識互操作的底層條件
Semantic Alignment as a Foundational Condition for Knowledge Interoperability
作者: Neo.K
協作: Aletheia
版本: v0.1
日期: 2026-08-02
定位: 系列地基論文/初步總論
摘要
人類知識傳遞通常被描述為「知識經由語言、符號、公式、圖表或程式,被另一個認知主體接收」。然而,此種描述隱含了一個常被忽略的前提:發送者與接收者對訊息中的實體、概念、符號、關係、定義域、背景假設與推論角色已經充分對齊。實際上,知識傳遞中的主要損耗不只來自資訊缺失,也來自語義未對齊(semantic misalignment);而更危險的情形,是多方在未充分對齊時仍相信彼此已經對齊。
本文提出一個廣義的「語義對齊—知識互操作」研究框架。其核心主張是:哲學論爭、數學定義與證明、物理理論映射、自然科學模型、社會科學構念、跨學科溝通、人機協作,以及顯式知識與隱式知識的傳遞,都可被部分重述為不同知識狀態之間的多維對齊問題。本文區分詞彙對齊、定義對齊、本體對齊、關係對齊、推論角色對齊、背景假設對齊、例證對齊、語用對齊與隱式知識對齊,並指出「對齊」與「真實」是彼此獨立的維度:兩個系統可以完全對齊但共同錯誤,也可以接近同一現象卻因語義座標不同而表面矛盾。
本文進一步提出:在機器可讀知識系統中,語義身份檢查應先於矛盾判定與證據評估。若兩個命題 與 尚未確認指向同一語義對象,則不應僅因表面形式為 與 就直接判定為矛盾。人工智慧與大型語言模型使大規模語義對齊審計首次具備工程可行性:系統可以跨文件抽取定義、例證、排除條件、關係、本體假設與推論角色,建立語義框架,估計對齊程度,區分真實分歧、表面分歧與錯誤重建。
本文不主張單一數值即可完整度量理解,也不主張語義對齊可以消除所有知識爭議。本文的目標較窄:建立一個可形式化、可計算、可實驗化的共同地基,使「我們是否真的在談同一件事」從模糊的溝通直覺,逐步轉化為可審計的知識互操作問題。
關鍵詞: 語義對齊、知識互操作、知識表示、本體對齊、概念對齊、隱式知識、跨學科、AI、形式化、知識圖譜
1. 問題:知識傳遞不是訊息複製
傳統的知識傳遞直覺可簡化為:
其中 是發送者的知識狀態,(M) 是語言、公式、符號或其他外顯媒介, 是接收者形成的知識狀態。
然而,更接近實際情況的表示應是:
其中 與 分別表示發送端與接收端的語境、本體、背景知識、符號慣例與推論規則。
一般而言:
這種不等同並不一定代表某一方「理解錯誤」。它可能來自:
- 不同定義;
- 不同概念邊界;
- 不同本體分類;
- 不同符號慣例;
- 不同定義域;
- 不同背景假設;
- 不同例證與反例集合;
- 不同推論角色;
- 不同語用目的;
- 無法完全顯式化的隱式知識。
因此,知識傳遞中的基本問題不只是:
訊息是否完整?
還包括:
接收者重建出的語義狀態與發送者原本的語義狀態,究竟在哪些維度上對齊?
2. 核心命題:語義未對齊是知識損耗的一種主要形式
本文提出:
資訊缺失與語義未對齊不是同一問題。
資訊缺失可能是:
- 某段證明沒有被傳遞;
- 某個資料欄位遺失;
- 某個實驗條件未記錄。
語義未對齊則可能是:
- 雙方都看見相同文字,但對核心概念的邊界不同;
- 雙方使用相同符號,但其定義域或公理背景不同;
- 雙方使用不同名詞,但其實指向近似相同的概念;
- 一方認為某詞是描述性概念,另一方把它當規範性概念;
- 一方的「反駁」實際上只反駁了自己重建出的對手版本。
更值得注意的是:
最困難的情況並不是雙方知道自己沒有理解彼此,而是:
本文稱此類狀態為假對齊(pseudo-alignment)。
3. Name Similarity 不等於 Semantic Identity
最基本的錯誤可以表示為:
反之亦然:
在不同學科中,這兩種情況都大量存在。
3.1 同名異義
兩篇文章都使用:
但其含義可能分別是:
- Shannon information;
- semantic information;
- biological information;
- epistemic information;
- everyday informational content。
字符串一致不能證明概念一致。
3.2 異名近義
兩個研究傳統可能使用不同術語,但在操作定義、關係結構與推論角色上高度接近。
此時若只用 lexical matching,會錯過真正的知識重疊。
因此語義對齊問題天然高於單純的文本相似度。
4. 多維語義對齊
本文暫以一個多維向量表示兩個知識對象 的對齊狀態:
各維度暫定如下:
| 維度 | 名稱 | 問題 |
|---|---|---|
| Lexical Alignment | 是否使用相同或可映射詞彙? | |
| Definitional Alignment | 核心定義與邊界是否重合? | |
| Ontological Alignment | 雙方認為此對象「是什麼類型的存在」是否一致? | |
| Relational Alignment | 與其他概念、實體、關係的結構是否一致? | |
| Inferential-role Alignment | 此概念可由什麼推出,又可推出什麼? | |
| Background-assumption Alignment | 隱含公理、理論背景、慣例是否一致? | |
| Example/Counterexample Alignment | 典型案例與反例是否被共同接受? | |
| Pragmatic Alignment | 雙方使用概念的目的、任務、決策角色是否一致? | |
| Tacit/Contextual Alignment | 難以顯式化的操作習慣、專家判斷與局部語境是否一致? |
這不是最終分類,也不意味所有維度都必須壓縮成單一分數。
較合理的做法可能是保留:
或甚至使用離散、多值、圖結構與不確定分布共同表示。
重要的不是「alignment score 到底是 0.73 還是 0.74」,而是能夠指出:
對齊發生在哪些維度?失配發生在哪些維度?
5. 對齊與真實必須分離
語義對齊不等於真理。
兩個人可以:
但共同持有錯誤模型。
因此:
至少概念上,應區分:
例如:
狀態一:高對齊、高支持
雙方談的是同一命題,而且有相似證據。
狀態二:高對齊、共同錯誤
雙方充分理解彼此,但都依賴錯誤資料。
狀態三:低對齊、表面矛盾
兩篇文章看起來一正一反,但實際命題沒有完全重合。
狀態四:低對齊、接近同一現象
不同學科用完全不同語言描述相似結構,尚未找到翻譯層。
因此,任何知識驗證系統若先做真假、支持/反駁判斷,再處理 semantic identity,都可能把語義失配誤判為邏輯衝突。
6. 語義身份檢查應先於矛盾判定
假設:
如果只看表面文字:
很容易直接標記 contradiction。
但若:
則:
未必構成同一命題空間內的矛盾。
因此本文提出一個基本順序:
而不是:
這個原則可以直接應用於哲學、數學、科學論文、法律條文、政策比較與大型知識庫。
7. 哲學只是最容易看見的案例
哲學論爭中,雙方常使用同一詞彙:
- knowledge;
- justification;
- freedom;
- causation;
- identity;
- rationality;
- responsibility。
然而,真正的概念可能具有不同:
- 定義;
- 本體承諾;
- 必要/充分條件;
- 反例集合;
- 推論用途;
- 歷史傳統。
因此可定義:
其中 表示 A 對 B 立場的重建。
若:
則 A 所謂的「反駁 B」可能首先是一個 opponent reconstruction failure。
這使哲學論爭可以被重新拆成:
8. 數學不是語義對齊的例外
數學擁有更嚴格的符號與證明系統,但仍然依賴大量語境。
一個數學符號的可操作語義更接近:
常見失配包括:
- 是否包含 (0);
- ring 是否預設有乘法單位元;
- graph 是否允許 loop 或 multiple edge;
- manifold 是否預設 Hausdorff、second-countable;
- Fourier transform normalization;
- curvature sign convention;
- probability 中條件獨立性的實際假設;
- measure 是否完備;
- theorem statement 依賴哪些未明示的 library conventions。
因此,形式化數學的一個重要價值,不只是「電腦檢查證明」,也是迫使:
近期數學 autoformalization 研究也顯示,自然語言中的真實數學定義比簡化 benchmark 更難形式化,且 LLM 常遭遇「如何對齊既有形式函式庫與上下文」的困難。這說明數學中的 semantic grounding 並不因符號化程度高而自然消失。
9. 物理學與自然科學:理論之間需要 Translation Layer
物理學中的:
- state;
- field;
- particle;
- observer;
- measurement;
- information;
- entropy;
- locality;
- causality;
在不同理論中可能具有不同數學角色與本體地位。
因此跨理論映射不只需要:
還需要:
與:
未來 AI 做 theory integration 時,一個可能比「直接解方程」更前置的模組是:
用來辨認兩個模型的變量、實體、條件與近似是否真的處於可比較座標中。
10. 社會科學與構念對齊
社會科學中的大量核心詞彙,例如:
- power;
- institution;
- class;
- capital;
- democracy;
- development;
- trust;
- identity;
- inequality;
通常不是單一自然種類,而是理論構念。
即使兩篇研究都聲稱研究「inequality」,其操作語義仍可能依賴:
- income / wealth;
- individual / household;
- pretax / post-tax;
- absolute / relative;
- Gini / percentile ratio;
- nominal / real;
- population scope;
- time window。
因此,資料能否直接合併或結論能否直接比較,本身就是 alignment question。
11. 顯式知識與隱式知識
顯式知識至少可以透過:
進行外部表示。
隱式知識(tacit knowledge)則可能表現為:
- 熟練操作;
- 專家直覺;
- 局部脈絡;
- 「看起來不對」的模式辨認;
- 難以完全 verbalize 的判斷規則。
假設專家內部狀態為:
外顯化:
學習者再解讀:
通常:
因此隱式知識傳遞可以被視為一個高度 lossy 的 semantic projection problem。
這也是為什麼「把專家說過的全部句子存進資料庫」不等於完整保存專家知識。
12. 與現有 Semantic Interoperability / Ontology Alignment 的關係
本文並不主張「語義對齊」作為研究問題是全新概念。
現有 Semantic Web、knowledge graph、ontology matching、entity alignment 等研究已長期處理:
- 不同 ontology 之間的 mapping;
- 跨 knowledge graph 的 entity identity;
- lexical、structural、attribute-based alignment;
- cross-domain / cross-lingual knowledge fusion;
- semantic interoperability。
近期研究仍持續指出,單純依賴文本相似度可能忽略語義細節,而 ontology 結構、relation、context 與多來源訊號對 alignment 具有重要作用。
本文希望擴張的部分是研究尺度:
也就是把 alignment 對象從「知識圖譜中的實體或本體類別」擴大到:
- 命題;
- 定義;
- 推論角色;
- 公理背景;
- 理論模型;
- 跨學科概念;
- 專家隱式狀態;
- 人與 AI;
- AI 與 AI。
13. AI 使大規模語義對齊審計首次變得可行
傳統人工研究很難對數千、數萬、甚至數百萬文件做完整語義比較。
大型語言模型與知識圖譜工具使以下流程開始具備工程可行性:
AI 可嘗試抽取:
- 核心 claim;
- definition;
- domain;
- entities;
- relations;
- necessary / sufficient conditions;
- examples;
- counterexamples;
- background assumptions;
- inferred commitments;
- opponent reconstruction;
- concept drift。
因此未來的論文比較系統不必只回答:
兩篇文章是否立場相反?
而可以回答:
它們有多少語義重疊?
哪些分歧是 definition mismatch?
哪些是 ontology mismatch?
哪些是真正共享定義後仍存在的 substantive disagreement?
14. Philosophical / Scientific Alignment Auditor
本文提出一個初步系統概念:
輸入:
輸出可包含:
Core Claim Alignment
Term Alignment
Definition Divergence
Ontology Divergence
Inferential-Role Divergence
Background-Assumption Divergence
Opponent-Reconstruction Accuracy
Apparent Contradictions
Normalized Genuine Contradictions
Shared Semantic Core
Residual Disagreement
Alignment Uncertainty
對兩篇互相批評的論文,可另外建立方向性指標:
避免假設「理解必然是對稱的」。
15. 動態對齊:理解不是 0/1
理解更合理的表示不是:
而是:
隨著新資訊與澄清而更新:
因此 semantic alignment 本身可以是:
- 動態的;
- 不完全的;
- 局部的;
- 非對稱的;
- 可撤回的;
- 具有不確定性的。
一個智能體可以先誤解,再逐步修正;也可能原本高度對齊,之後因概念漂移而逐漸失配。
16. 一個初步的知識處理架構
本文提出以下前置順序:
Raw Input
↓
Entity / Symbol Resolution
↓
Semantic Frame Extraction
↓
Semantic Alignment
↓
Context / Ontology Alignment
↓
Claim Normalization
↓
Evidence Evaluation
↓
Contradiction / Support / Refutation Analysis
↓
Inference
可形式化為:
其中:
- (R):resolution;
- (S):semantic frame;
- (A):alignment;
- (N):normalization;
- (P):normalized proposition;
- (E):evidence evaluation;
- (K):可進一步推理的知識狀態。
核心原則是:
17. 與 Q4 / DBQ4 類框架的接口
若知識系統使用支持/反駁雙軸,例如:
那麼語義對齊應位於其前面。
因為 Q4 回答的是:
對某個 proposition,現在有多少支持與反證?
但 Semantic Alignment 回答的是:
我們所比較的 evidence、claim 與 counterclaim,究竟是不是在指同一 proposition?
因此:
比:
更合理。
語義身份未確認時,應允許系統產生:
- alignment uncertainty;
- unresolved mapping;
- possible pseudo-contradiction;
而不是直接進入 contradiction aggregation。
18. 可驗證研究命題
本文先提出以下可供未來系列逐一檢驗的命題:
H1:詞彙高度相似不能穩定預測完整語義對齊
H2:論爭中的一部分表面矛盾可被 semantic normalization 消除
即:
在至少部分知識領域成立。
H3:Opponent reconstruction 是方向性的
一般而言:
H4:形式化可降低部分隱式假設失配,但不能消除所有 semantic mismatch
proof assistant 可以迫使某些依賴顯式化,但 formal vocabulary 的選擇本身仍需要 alignment。
H5:跨學科整合失敗的一部分可以被重述為 semantic-interface incompatibility
而非單純資訊不足。
H6:AI 可以在大規模文件上估計多維 alignment,但 alignment score 本身也需要 calibration 與人工審計
H7:隱式知識對齊比顯式知識對齊具有更高的信息損耗與不可識別性
H8:先對齊再做 contradiction detection,應降低 false contradiction rate
H9:Alignment 與 Truth 應作為不同狀態維度保存
H10:知識系統若保存 semantic provenance,可比只保存 normalized claim 更好地支援後續重解讀
19. 研究限制
本文目前仍是一篇地基論文,而不是完成的度量理論。
主要限制包括:
- 尚未提出唯一或公認的 alignment metric;
- 多維度是否正交尚未驗證;
- AI 產生的 semantic frame 本身可能誤讀原文;
- 隱式知識無法保證可完全外顯;
- 不同領域的「足夠對齊」標準可能不同;
- 法律、醫學、數學、哲學等領域對 alignment error 的成本不同;
- 對齊不代表共識;
- 對齊不代表真實;
- 過度 normalization 反而可能抹平有價值的理論差異。
因此未來系統必須同時避免:
與:
後者尤其重要:不能因為兩個概念很像,就強行視為同一概念。
20. 未來系列方向
這篇總論之後,可以拆成至少以下研究線:
- 語義對齊的一般形式理論
- Name / Entity / Concept Identity
- 定義域與推論角色對齊
- 哲學論爭的 Semantic Alignment Audit
- 數學定義、定理與隱式公理對齊
- 物理理論之間的 Ontology / Variable Translation
- 社會科學構念與操作定義對齊
- 顯式知識—隱式知識投影
- 人—AI 語義對齊
- AI—AI Knowledge Interoperability
- 跨語言/跨文化語義對齊
- 動態概念漂移與時間對齊
- Semantic Alignment Benchmark
- Semantic Alignment Auditor 工程系統
- 與 Q4 / DBQ4 / 知識圖譜/TMS 的整合
這些方向不必一次完成;本文只建立共同母題。
21. 結論
本文的核心主張可以濃縮成三句話。
第一:
第二:
第三:
從哲學論爭到數學形式化,從物理理論到社會科學構念,從知識圖譜到專家隱式知識,語義對齊都不是附屬的語言問題,而可能是一層普遍的知識互操作條件。
若未來 AI 系統要整合數百萬篇論文、跨學科理論、人類專家經驗與其他 AI 的知識狀態,那麼它需要的不只是更大的記憶體、更強的推理器或更多資料,而還需要一個能回答下列問題的中介層:
「這些知識真的在談同一個東西嗎?」
因此,本文將 Semantic Alignment 暫定位為:
它位於符號解析之上、證據與推理之下,負責使異質知識狀態在進入共同推理空間之前,先建立可審計、可撤回、帶不確定性的語義映射。
這不是要消除人類知識中的多義性,而是讓多義性本身變得可見。
參考研究與背景文獻(初步)
本節只列本輪重新查核、與本文地基直接相關的文獻。後續系列每篇仍應重新進行領域搜尋。
Vogt, L., Kuhn, T., & Hoehndorf, R. (2024). Semantic units: organizing knowledge graphs into semantically meaningful units of representation. Journal of Biomedical Semantics, 15, Article 7.
— 討論 knowledge graph / ontology 在 FAIR interoperability 中的語義表示問題。Zhu, B., Wang, R., Wang, J., Shao, F., et al. (2024). A survey: knowledge graph entity alignment research based on graph embedding. Artificial Intelligence Review, 57, Article 229.
— 系統整理跨 knowledge graph entity alignment。Zhang, X., Liu, Y., Wei, H., Shan, S., et al. (2024). A self-supervised entity alignment framework via attribute correction. Journal of King Saud University Computer and Information Sciences, 36, 102167.
— 將 entity alignment 定義為不同 KG 中同一實體的識別與知識融合問題。Zhang, L., Valentino, M., & Freitas, A. (2025). Formalizing Complex Mathematical Statements with LLMs: A Study on Mathematical Definitions. arXiv:2502.12065.
— 顯示自然語言中的真實數學定義對 autoformalization 特別困難;formal library grounding 與外部 proof-assistant feedback 能改善結果。Paulson, L. C. (2025). Formalising New Mathematics in Isabelle: Diagonal Ramsey. arXiv:2501.10852.
— 展示 proof assistant 開始用於新近數學結果的形式化,並指出形式化在實際新數學中仍需要大量額外技術工作。Zhang, Z., Tan, C., Yang, M., et al. (2025). OTIEA: Ontology-Enhanced Triple Intrinsic-Correlation for Cross-lingual Entity Alignment. Neural Processing Letters, 57, Article 24.
— 強調跨語言、跨 domain alignment 與 ontology information 的作用。Ding, Q., Yin, J., Zhang, D., et al. (2025). Combating confirmation bias: a unified pseudo-labeling framework for entity alignment. Data Mining and Knowledge Discovery, 39, Article 51.
— 顯示 alignment 系統本身也存在錯誤擴增與 confirmation bias 問題。Lean Language FAQ / Mathlib ecosystem documentation.
— Lean 同時是 theorem prover 與 programming language;其形式化基礎與 Isabelle/HOL 等系統並不相同,說明「形式化」本身也包含 foundational context。近年的 knowledge-management 研究仍區分 tacit 與 explicit knowledge,並指出 tacit knowledge 具有 experience-driven、context-dependent、較難 formalize / transfer 的特徵。這為本文「隱式知識傳遞也是 alignment problem」提供既有研究背景,但本文對其形式化仍屬待驗證延伸。