# Series I / Paper 02
# 多符號非均勻權重與高階語義耦合：從身份解析到語義超圖閉合
## Non-Uniform Multi-Symbol Weights and Higher-Order Semantic Coupling: From Identity Resolution to Semantic Hypergraph Closure

**作者：Neo.K（許筌崴）**  
**機構：EveMissLab**  
**系列：公共顯著性場與實體可辨識理論（Series I）**  
**版本：v0.1**  
**日期：2026-08-14**

---

## 摘要

同一公共實體往往同時由真名、筆名、公司名、品牌名、作品名、網域、帳號、縮寫與跨語言名稱等多個符號所指涉。傳統直覺常以「這些符號都指向同一個實體」為由，默認它們在搜尋、識別與公共認知中近似等價；但實際資訊系統中，不同符號具有不同的頻率、歧義度、來源分布、檢索強度與身份指向能力。因此，即使在同一實體內部，也通常存在

$$
W(s_i)\neq W(s_j).
$$

本文提出「多符號非均勻語義耦合框架」（Non-Uniform Multi-Symbol Semantic Coupling Framework, NUMSC），作為公共顯著性狀態空間（PPSS）的第二層形式化。本文區分符號內在辨識力、查詢條件權重、來源獨立性與高階聯合證據，並定義一族 $k$ 階語義耦合張量

$$
\mathcal{T}^{(k)}.
$$

本文特別證明：高階身份閉合一般不能由所有 pairwise 相似度或關係分數的簡單總和唯一決定。透過 parity 型構造，可建立兩個具有完全相同一階與二階邊際關係、但三階聯合結構不同的系統。因此，普通圖上的兩兩邊不足以普遍表示不可約的高階語義依賴；超圖或高階張量是自然的擴展表示。

本文進一步提出符號有效數、身份閉合分數、高階增益、來源獨立性修正與觀察者依賴權重，並將 alias alignment、entity linking、collective entity linking、multi-view entity alignment、multi-relational tensor learning 與 hypergraph alignment 放入同一理論邊界。核心結論是：公共身份不是名稱字典，而是一個由非均勻符號、來源與高階關係共同形成的查詢依賴語義場。

**關鍵詞：** 多符號身份、別名解析、實體對齊、語義耦合、張量、超圖、身份閉合、搜尋權重、entity linking、entity alignment

---

## 1. 問題設定

Series I / Paper 01 將公共實體 $E$ 的狀態表示為

$$
\mathbf{x}_E^{\Omega}
=
(I,S,V,D,R,M,H,A,\rho),
$$

其中 $R$ 表示身份可辨識度， $M$ 表示機器可辨識度。

然而，若要真正計算 $R$ 與 $M$，必須先回答更底層的問題：

> 一個實體具有多個名稱、品牌、網域與作品符號時，資訊系統如何判斷這些符號彼此相關，並進一步閉合成同一身份或穩定關係網？

令實體 $E$ 的公開符號族為

$$
\Sigma_E
=
\{s_1,s_2,\ldots,s_n\}.
$$

例如 $s_i$ 可以是：

- 法定姓名；
- 筆名或網名；
- 公司名稱；
- 研究品牌；
- 網域；
- 作品名稱；
- 社群帳號；
- 跨語言轉寫；
- 縮寫；
- 固定 metadata identifier。

最簡化的模型會寫成

$$
s_1\sim s_2\sim\cdots\sim s_n\sim E.
$$

但此式只描述指涉關係，不描述資訊空間中的實際辨識難度。

本文主張：

$$
\boxed{
\text{referential equivalence}
\neq
\text{retrieval equivalence}
\neq
\text{recognition equivalence}.
}
$$

---

## 2. 多符號權重不是均勻的

### 定義 1：觀察條件

沿用 Paper 01，令

$$
\Omega=(o,p,q,t),
$$

其中 $o$ 為觀察者， $p$ 為平台或資訊系統， $q$ 為查詢／任務， $t$ 為時間。

### 定義 2：條件符號權重

對符號 $s_i$，定義

$$
w_i^{\Omega}
=
W(s_i\mid o,p,q,t),
$$

且

$$
w_i^{\Omega}\ge 0.
$$

它表示在觀察條件 $\Omega$ 下，符號 $s_i$ 對實體辨識與公共顯著性的有效貢獻。

一般情況下：

$$
\boxed{
w_i^{\Omega}\neq w_j^{\Omega}.
}
$$

即使 $s_i$ 與 $s_j$ 都正確指向同一實體。

---

## 3. 符號權重的分解

一個可操作的近似是：

$$
w_i^{\Omega}
=
f
\left(
r_i,
u_i,
c_i,
a_i,
d_i,
x_i,
\Omega
\right),
$$

其中：

- $r_i$：retrievability，可召回性；
- $u_i$：uniqueness，唯一性；
- $c_i$：contextual coherence，語境一致性；
- $a_i$：attribution strength，歸因強度；
- $d_i$：source diversity，來源多樣性；
- $x_i$：ambiguity penalty，歧義懲罰。

可使用乘法型近似：

$$
w_i^{\Omega}
=
r_i^{\alpha}
u_i^{\beta}
c_i^{\gamma}
a_i^{\delta}
d_i^{\eta}
(1-x_i)^{\zeta},
$$

其中所有指標先規範化到 $[0,1]$，指數控制不同觀察環境下的權重敏感度。

此式不是本文唯一允許的估計器。其目的只是指出：

$$
\text{符號出現次數}
$$

並不等於

$$
\text{符號身份權重}.
$$

高頻但高度歧義的短名稱，可能低於低頻但高度唯一的公司統編、固定網域或完整法定名稱。

---

## 4. 正規化權重與有效符號數

令

$$
\alpha_i^{\Omega}
=
\frac{w_i^{\Omega}}
{\sum_{j=1}^{n}w_j^{\Omega}},
$$

則：

$$
\sum_{i=1}^{n}\alpha_i^{\Omega}=1.
$$

若所有符號完全均勻：

$$
\alpha_i=\frac{1}{n}.
$$

但實際系統通常呈現長尾分布。

為描述「真正有效的符號數」，定義符號熵：

$$
H_{\Sigma}^{\Omega}
=
-\sum_{i=1}^{n}
\alpha_i^{\Omega}
\log\alpha_i^{\Omega}.
$$

再定義有效符號數：

$$
N_{\mathrm{eff}}^{\Omega}
=
\exp
\left(
H_{\Sigma}^{\Omega}
\right).
$$

因此：

$$
1\le N_{\mathrm{eff}}^{\Omega}\le n.
$$

如果一個實體形式上有十個名稱，但其中九個幾乎不具有檢索或辨識能力，則：

$$
N_{\mathrm{eff}}\ll 10.
$$

這使「符號數量」與「有效身份入口數量」得到形式分離。

---

## 5. 二階語義耦合矩陣

對任意兩個符號 $s_i,s_j$，定義：

$$
C_{ij}^{\Omega}
=
\operatorname{Couple}
(s_i,s_j\mid\Omega),
$$

其中：

$$
C_{ij}^{\Omega}\in[0,1].
$$

矩陣

$$
\mathbf{C}^{\Omega}
=
[C_{ij}^{\Omega}]
$$

可以表示 pairwise 關係，例如：

- 同一文件共同出現；
- 網頁互相連結；
- metadata 明示作者／機構；
- 語義上下文相似；
- 同一知識圖譜中的關係；
- 搜尋結果中共同召回；
- AI 對兩符號 identity match 的信心。

若只使用二階模型，一個自然的身份分數可能寫為

$$
R_{\mathrm{pair}}
=
\sum_{i<j}
\alpha_i\alpha_j C_{ij}.
$$

此形式很直觀，但不普遍充分。

---

## 6. 為什麼 pairwise graph 不夠？

真正重要的現象是：

> 某些符號兩兩看都不夠強，但三個、四個或更多符號聯合出現時，身份可能突然變得高度唯一。

令：

$$
s_1=\text{姓名},
$$

$$
s_2=\text{品牌},
$$

$$
s_3=\text{公司},
$$

$$
s_4=\text{固定網域}.
$$

可能存在：

$$
C_{12}\approx 0.4,
\qquad
C_{13}\approx 0.3,
\qquad
C_{24}\approx 0.5,
$$

但聯合查詢：

$$
(s_1,s_2,s_3,s_4)
$$

幾乎只有一個實體可以同時滿足。

因此：

$$
\operatorname{Couple}
(s_1,s_2,s_3,s_4)
$$

不能預設等於六個 pairwise coupling 的平均或總和。

---

## 7. 高階語義耦合張量

### 定義 3： $k$ 階語義耦合

對 $k\ge2$，定義

$$
\mathcal{T}^{(k),\Omega}_{i_1i_2\cdots i_k}
=
\operatorname{Couple}_k
\left(
s_{i_1},
s_{i_2},
\ldots,
s_{i_k}
\mid
\Omega
\right).
$$

其中：

$$
\mathcal{T}^{(k),\Omega}_{i_1i_2\cdots i_k}
\in[0,1].
$$

二階情況退化為：

$$
\mathcal{T}^{(2),\Omega}
=
\mathbf{C}^{\Omega}.
$$

但：

$$
\mathcal{T}^{(3)}
$$

與

$$
\mathcal{T}^{(4)}
$$

可以攜帶 pairwise matrix 無法唯一恢復的資訊。

---

## 8. Pairwise 不充分命題

### 命題 1：二階邊際不足以唯一決定高階聯合結構

存在兩個三變量系統 $P$ 與 $Q$，使所有一階與二階邊際分布完全相同，但三階聯合分布不同。

### 證明

令：

$$
X,Y
$$

為獨立均勻 Bernoulli 變量。

在系統 $P$ 中定義：

$$
Z=X\oplus Y,
$$

其中 $\oplus$ 為 XOR。

則 $X,Y,Z$ 各自均勻，且任意兩者 pairwise independent。因此：

$$
P(X,Y)=P(X)P(Y),
$$

$$
P(X,Z)=P(X)P(Z),
$$

$$
P(Y,Z)=P(Y)P(Z).
$$

再構造系統 $Q$，令：

$$
X,Y,Z
$$

三者完全獨立且均勻。

則 $P$ 與 $Q$ 具有相同的一階邊際與全部二階邊際。

然而在 $P$ 中：

$$
X\oplus Y\oplus Z=0
$$

以機率 $1$ 成立；在 $Q$ 中：

$$
P(X\oplus Y\oplus Z=0)=\frac{1}{2}.
$$

所以兩系統的三階聯合結構不同。

因此，由所有 pairwise 關係不能一般性地唯一恢復高階聯合結構。

$$
\boxed{\square}
$$

---

## 9. 語義意義

上述證明不是說公共身份真的服從 XOR。

它證明一個更一般的結構性限制：

$$
\boxed{
\text{all pairwise information}
\not\Rightarrow
\text{all higher-order information}.
}
$$

因此，如果多符號身份閉合依賴群組條件、共同上下文、來源組合或「只有這組符號一起出現才唯一」的條件，普通 adjacency matrix 可能不夠。

這正是超圖表示的自然動機。

---

## 10. 語義超圖

定義語義超圖：

$$
\mathcal{H}_E
=
(V,\mathcal{E},\omega),
$$

其中：

$$
V
=
\Sigma_E
\cup
\mathcal{D}
\cup
\mathcal{R},
$$

 $\Sigma_E$ 為符號節點， $\mathcal{D}$ 為文件／來源節點， $\mathcal{R}$ 為候選實體或關係節點。

每一條超邊：

$$
e\in\mathcal{E}
$$

可同時連接兩個以上節點：

$$
e
=
\{
s_{i_1},
s_{i_2},
\ldots,
s_{i_k},
d_j,
E
\}.
$$

例如，一個作者頁可能同時明示：

$$
\{
\text{真名},
\text{筆名},
\text{機構},
\text{作品},
\text{網域}
\}.
$$

此聯合陳述可以作為單一高階證據，而不必先拆成多條相互獨立的 pairwise 邊。

---

## 11. 高階增益

令 $S\subseteq\Sigma_E$，且 $|S|=k$。

定義高階耦合值：

$$
T(S)
=
\operatorname{Couple}_k(S).
$$

再令 pairwise 基準為：

$$
B_2(S)
=
\frac{2}{k(k-1)}
\sum_{\{i,j\}\subseteq S}
C_{ij}.
$$

定義高階增益：

$$
G_k(S)
=
T(S)-B_2(S).
$$

若：

$$
G_k(S)>0,
$$

表示聯合符號組的辨識能力高於 pairwise 平均所暗示的程度。

若：

$$
G_k(S)\gg0,
$$

則此符號組具有強烈的「閉合增益」。

這類現象可以稱為：

$$
\boxed{
\text{semantic closure gain}.
}
$$

---

## 12. 身份閉合分數

令候選實體集合為：

$$
\mathcal{E}^{*}
=
\{E_1,E_2,\ldots,E_m\}.
$$

觀察到證據集合：

$$
\mathcal{O}
=
\{
s_{i_1},
\ldots,
s_{i_k},
d_{j_1},
\ldots
\}.
$$

定義身份閉合分數：

$$
R(E\mid\mathcal{O},\Omega)
=
P
\left(
E
\mid
\mathcal{O},
\Omega
\right).
$$

若：

$$
R(E^{*}\mid\mathcal{O},\Omega)
\ge\tau
$$

且：

$$
R(E^{*}\mid\mathcal{O},\Omega)
-
\max_{E\neq E^{*}}
R(E\mid\mathcal{O},\Omega)
\ge\Delta,
$$

則稱觀察條件 $\Omega$ 下發生身份閉合。

其中：

- $\tau$ 為最低可信閾值；
- $\Delta$ 為候選間隔閾值。

這比「第一名候選就是答案」更嚴格，因為它要求絕對信心與相對優勢同時成立。

---

## 13. 非均勻權重的必要性命題

### 命題 2

若兩符號具有不同歧義度或不同條件召回率，則任何強制令其權重相等的估計器，一般不能保持最佳身份判別能力。

### 證明概念

設：

$$
s_a
$$

為高度唯一符號，在候選實體 $E_1$ 上有：

$$
P(s_a\mid E_1)=1,
$$

對其他候選：

$$
P(s_a\mid E_j)=\epsilon,
\qquad
j\neq1.
$$

另有高歧義符號 $s_b$，對所有候選皆近似：

$$
P(s_b\mid E_j)\approx c.
$$

則 $s_a$ 的 likelihood ratio 遠高於 $s_b$。

若估計器強迫：

$$
w_a=w_b,
$$

便無法反映兩者對 posterior identity discrimination 的不同資訊量。

因此合理權重必須允許：

$$
w_a>w_b.
$$

$$
\boxed{\square}
$$

---

## 14. 來源不是獨立票數

多個頁面支持同一身份，不代表有同樣多個獨立證據。

若十個網站全部複製自同一份資料：

$$
d_1,d_2,\ldots,d_{10},
$$

直接計數會產生虛假的證據膨脹。

令來源圖中的相關性為：

$$
\kappa_{ab}
\in[0,1].
$$

 $\kappa_{ab}=1$ 表示兩來源近乎完全依賴， $\kappa_{ab}=0$ 表示在指定模型中近似獨立。

可定義來源有效數：

$$
N_{\mathrm{src,eff}}
=
\frac{
\left(\sum_j v_j\right)^2
}{
\sum_j v_j^2
+
2\sum_{a<b}\kappa_{ab}v_av_b
}.
$$

此形式表達：

$$
\text{十份鏡像}
\neq
\text{十份獨立證據}.
$$

因此多符號身份模型必須同時處理：

$$
\text{symbol diversity}
$$

與：

$$
\text{source independence}.
$$

---

## 15. 條件權重與查詢重綁定

同一符號的權重會隨查詢改變。

對同一 $s_i$：

$$
w_i^{\Omega_1}
\neq
w_i^{\Omega_2}.
$$

例如：

- 精確人名查詢可能提高法定姓名權重；
- 技術產品查詢可能提高品牌／產品符號權重；
- 公司查詢可能提高法人名稱與註冊資訊權重；
- AI 問答可能同時整合跨站 metadata、摘要與語義上下文。

因此：

$$
\boxed{
W(s_i)
}
$$

不應理解為永久固定的「符號能量」。

更準確的是：

$$
\boxed{
W(s_i\mid\Omega).
}
$$

這使 NUMSC 成為觀察者依賴與查詢依賴模型。

---

## 16. 與 Entity Linking 的區別

Entity Linking 通常處理：

$$
\text{mention}
\rightarrow
\text{knowledge-base entity}.
$$

現代系統會進行候選生成與消歧，並利用名稱、語境、描述或全局一致性。

NUMSC 的問題更廣：

$$
\{
\text{names},
\text{aliases},
\text{brands},
\text{domains},
\text{organizations},
\text{works},
\text{sources}
\}
\rightarrow
\text{latent public entity field}.
$$

也就是說，NUMSC 不預設：

1. 已存在完整知識庫；
2. 所有符號都是文本 mention；
3. 只有一個文件；
4. 只有 pairwise mention–entity 關係；
5. 所有來源具有相同可信度；
6. 身份閉合與公共顯著性可以分開處理。

因此 NUMSC 與 entity linking 相交，但不等同。

---

## 17. 與 Alias Alignment 的關係

McKelvey 等人的 alias alignment 研究指出，即使缺乏完整背景知識，也可以結合名稱字面特徵與 alias 周圍的語義上下文進行身份對齊。

這支持：

$$
\text{name form}
+
\text{semantic context}
>
\text{name form alone}
$$

作為身份判別的一般方向。

NUMSC 再加入兩個層次：

第一，不只處理一個名稱與一個 alias，而處理：

$$
|\Sigma_E|\ge2.
$$

第二，不只考慮 pairwise alias alignment，而允許：

$$
\mathcal{T}^{(k)},
\qquad
k>2.
$$

---

## 18. 與 Collective Entity Linking 的關係

Collective Entity Linking 已指出，逐一獨立處理 mention 可能因局部資訊稀疏而失敗，因此需要全局 coherence。

這與本文具有直接同構：

$$
\text{local evidence}
\neq
\text{global closure}.
$$

但 collective EL 常在同一文件或候選實體圖上求整體一致性。

NUMSC 則把 globality 擴展至：

$$
\text{跨文件}
+
\text{跨網站}
+
\text{跨符號類型}
+
\text{跨來源}
+
\text{跨觀察者}.
$$

---

## 19. 與 Multi-View Entity Alignment 的關係

Multi-view entity alignment 已將名稱、關係與屬性等不同 view 統一用於跨 knowledge graph 實體對齊。

此結果直接支持本文的非均勻多來源觀點：

$$
\text{identity evidence}
\neq
\text{single-view evidence}.
$$

然而，NUMSC 更關心的是：

$$
\text{不同 view 的公共權重}
$$

以及：

$$
\text{不同 view 組合是否產生不可約高階增益}.
$$

因此，其目標不只是提高 Hits@1，而是描述一個公共實體如何在資訊空間中被逐步閉合。

---

## 20. 與 Multi-Relational Tensor Learning 的區別

既有 multi-relational learning 早已使用三維張量或其他 latent factor models 表示：

$$
(\text{entity}_i,\text{relation}_r,\text{entity}_j).
$$

因此本文不能宣稱「第一次使用張量表示實體關係」。

NUMSC 的不同點在於：

$$
\mathcal{T}^{(k)}_{i_1\cdots i_k}
$$

的索引首先對應的是多個符號／證據項的聯合耦合，而不是固定三元知識圖譜中的 relation type。

換言之：

$$
\text{multi-relational tensor}
$$

與：

$$
\text{higher-order multi-symbol coupling tensor}
$$

是相鄰但不同的建模對象。

---

## 21. 與 Hypergraph Alignment 的關係

近期 hypergraph alignment 研究明確指出，普通 graph 天然以 pairwise relation 為基本單位，而 higher-order dependencies 需要 hypergraph 才能直接表達。

本文採用相同的結構動機，但應用於公共身份閉合：

$$
\boxed{
\text{multiple symbols}
+
\text{multiple documents}
+
\text{multiple relations}
\rightarrow
\text{one higher-order identity evidence structure}.
}
$$

因此，本文的超圖不是為了取代所有 graph 方法，而是用來表示 graph projection 可能遺失的不可約高階關係。

---

## 22. Graph projection 與資訊損失

給定超圖：

$$
\mathcal{H}=(V,\mathcal{E}),
$$

常見作法可把每條 hyperedge 投影成 clique：

$$
e=\{v_1,v_2,v_3\}
$$

轉成：

$$
(v_1,v_2),
(v_1,v_3),
(v_2,v_3).
$$

但投影後，系統無法僅由三條 pairwise edge 判斷：

> 原本是一個三元共同關係？

還是：

> 三個互不相干的二元關係恰好同時存在？

因此 graph projection 可以保留部分鄰接資訊，卻不必保留原始高階事件的完整語義。

此差異對身份解析尤其重要，因為：

$$
\text{共同署名}
$$

與：

$$
\text{三組獨立共現}
$$

可能產生相同 pairwise clique，卻具有不同的證據意義。

---

## 23. 語義耦合場

當符號集合持續增長時，使用固定階數 $k$ 並不總是方便。

因此定義完整語義耦合場：

$$
\mathfrak{T}_E^{\Omega}
=
\left\{
\mathcal{T}^{(2),\Omega},
\mathcal{T}^{(3),\Omega},
\ldots,
\mathcal{T}^{(n),\Omega}
\right\}.
$$

它不是單一有限階 tensor，而是一族由不同階聯合證據形成的結構。

實體身份狀態可進一步寫成：

$$
\mathcal{I}_E^{\Omega}
=
\left(
\Sigma_E,
\mathbf{w}^{\Omega},
\mathfrak{T}_E^{\Omega},
\mathcal{D},
\mathbf{K}
\right),
$$

其中：

- $\Sigma_E$：符號族；
- $\mathbf{w}^{\Omega}$：非均勻符號權重；
- $\mathfrak{T}_E^{\Omega}$：高階耦合場；
- $\mathcal{D}$：來源集合；
- $\mathbf{K}$：來源依賴／相關矩陣。

這構成本文所稱的：

$$
\boxed{
\text{multi-symbol identity field}.
}
$$

---

## 24. 從身份閉合回到 PPSS

Paper 01 中的身份可辨識度：

$$
R(E,\Omega)
$$

現在可以重新寫成：

$$
R(E,\Omega)
=
\Phi
\left(
\mathcal{I}_E^{\Omega}
\right),
$$

即：

$$
R(E,\Omega)
=
\Phi
\left(
\Sigma_E,
\mathbf{w}^{\Omega},
\mathfrak{T}_E^{\Omega},
\mathcal{D},
\mathbf{K}
\right).
$$

機器可辨識度：

$$
M(E,\Omega)
$$

則可以理解成特定機器系統 $\mathcal{A}$ 對同一身份場的推斷性能：

$$
M(E,\Omega;\mathcal{A})
=
\Psi_{\mathcal{A}}
\left(
\mathcal{I}_E^{\Omega}
\right).
$$

因此：

$$
R
$$

是問題結構的一部分，而：

$$
M
$$

同時依賴求解器能力。

這個區分對下一篇 Paper 03 將非常重要。

---

## 25. 可檢驗假說

本文提出以下經驗假說。

### H1：非均勻權重假說

在真實多符號實體中：

$$
\operatorname{Var}
\left(
\alpha_1,\ldots,\alpha_n
\right)
>0
$$

通常成立。

### H2：高階增益假說

存在相當比例的身份解析案例，使：

$$
G_k(S)>0
$$

對某些 $k\ge3$ 成立。

### H3：來源修正假說

加入來源依賴修正後，身份 confidence calibration 優於將所有頁面視為獨立證據的模型。

### H4：觀察者重綁定假說

不同平台／查詢下：

$$
\operatorname{rank}
\left(
w_i^{\Omega_1}
\right)
\neq
\operatorname{rank}
\left(
w_i^{\Omega_2}
\right)
$$

會頻繁發生。

### H5：LLM 高階閉合假說

在包含多類符號與跨文件證據的 benchmark 中，允許聯合上下文推理的 LLM／graph-hypergraph hybrid 系統，應在部分案例上優於純 pairwise alias similarity 模型。

此假說不預設 LLM 必然正確；其驗證必須同時測量 hallucinated coupling。

---

## 26. Benchmark 設計

可以建立一個 Multi-Symbol Public Entity Benchmark。

每個實體至少包含：

$$
E
\rightarrow
\{
s_1,\ldots,s_n
\}.
$$

資料應包括：

1. 真實 alias；
2. 高歧義 alias；
3. 品牌與法人關係；
4. 網域與作者頁；
5. 跨語言名稱；
6. 鏡像來源；
7. 真正獨立第三方來源；
8. hard negative entities；
9. 僅在三階以上證據才容易閉合的案例。

評估至少包含：

$$
\text{Precision},
$$

$$
\text{Recall},
$$

$$
\text{F1},
$$

$$
\text{Brier Score},
$$

$$
\text{ECE},
$$

以及：

$$
\Delta_{\mathrm{HO}}
=
\text{Score}_{\mathrm{higher-order}}
-
\text{Score}_{\mathrm{pairwise}}.
$$

其中：

$$
\Delta_{\mathrm{HO}}>0
$$

可作為高階模型是否真正帶來辨識收益的直接證據。

---

## 27. 失敗模式

### 27.1 假閉合

大量語義相似不等於同一身份：

$$
\text{semantic similarity}
\not\Rightarrow
\text{identity}.
$$

### 27.2 熱門實體吸引

搜尋與知識庫系統可能把模糊符號錯誤吸附到高知名度候選。

### 27.3 自有內容迴圈

大量自有網站互相引用可能造成：

$$
\text{apparent source diversity}
>
\text{true source independence}.
$$

### 27.4 LLM 關係幻覺

LLM 可能因敘事一致性而創造不存在的：

$$
s_i\leftrightarrow s_j.
$$

因此高階推理必須保留 evidence provenance。

### 27.5 時間漂移

公司、品牌、筆名、職位與網域關係都可能隨時間變動：

$$
\mathfrak{T}_E
=
\mathfrak{T}_E(t).
$$

所以身份閉合不能永遠視為靜態。

---

## 28. 理論邊界

本文不主張：

1. 所有身份問題都需要高階 tensor；
2. pairwise graph 沒有用；
3. LLM 一定優於傳統 entity linker；
4. 多來源自動等於高可信；
5. 高階耦合等於因果關係；
6. 身份閉合等於權威或知名度。

本文只主張：

$$
\boxed{
\text{pairwise models are not universally sufficient for multi-symbol public identity closure}.
}
$$

以及：

$$
\boxed{
\text{symbol weights are generally non-uniform and observation-dependent}.
}
$$

---

## 29. 與 Paper 01 的統一

Paper 01 的核心式為：

$$
\mathbf{x}_E^{\Omega}
=
(I,S,V,D,R,M,H,A,\rho).
$$

Paper 02 現在把其中的：

$$
R
$$

展開成：

$$
R
=
\Phi
\left(
\Sigma_E,
\mathbf{w}^{\Omega},
\mathfrak{T}_E^{\Omega},
\mathcal{D},
\mathbf{K}
\right).
$$

因此公共顯著性理論第一次具有兩層結構：

$$
\boxed{
\text{symbol/evidence layer}
\rightarrow
\text{entity state layer}.
}
$$

下一步則需要研究：

$$
R,M,H,S,V
$$

彼此如何解耦。

亦即：

> 一個實體為什麼可以被搜尋引擎與 AI 高度閉合，卻仍然在人類社會中低知名？

這將構成 Series I / Paper 03。

---

## 30. 結論

本文提出 NUMSC，將公共實體的多符號結構表示為：

$$
\mathcal{I}_E^{\Omega}
=
\left(
\Sigma_E,
\mathbf{w}^{\Omega},
\mathfrak{T}_E^{\Omega},
\mathcal{D},
\mathbf{K}
\right).
$$

其中：

$$
\mathbf{w}^{\Omega}
$$

描述符號的非均勻、觀察者依賴權重；

$$
\mathfrak{T}_E^{\Omega}
$$

描述二階以上的高階語義耦合；

$$
\mathbf{K}
$$

修正來源間的依賴性。

本文以 parity 構造證明，所有 pairwise 邊際資訊不足以一般性地唯一恢復高階聯合結構。因此：

$$
\boxed{
\mathcal{T}^{(k)}
\not\equiv
\sum
\mathcal{T}^{(2)}.
}
$$

這不是說每個搜尋問題都必須使用高階張量，而是說：當身份唯一性真正來自多個符號、來源與上下文的聯合閉合時，二元關係的簡單加總沒有普遍充分性。

因此，公共身份不應被理解為：

$$
\text{name}
\rightarrow
\text{entity}.
$$

更一般地，它是一個：

$$
\boxed{
\text{query-dependent weighted semantic field of symbols, sources, and higher-order relations}.
}
$$

---

## 參考文獻

[1] McKelvey, K., Goutzounis, P., da Cruz, S., & Chambers, N. (2017). Aligning Entity Names with Online Aliases on Twitter. *Proceedings of the Fifth International Workshop on Natural Language Processing for Social Media*, 25–35. DOI: 10.18653/v1/W17-1104.

[2] Moro, A., Raganato, A., & Navigli, R. (2014). Entity Linking meets Word Sense Disambiguation: a Unified Approach. *Transactions of the Association for Computational Linguistics*, 2, 231–244. DOI: 10.1162/tacl_a_00179.

[3] Cao, Y., Hou, L., Li, J., & Liu, Z. (2018). Neural Collective Entity Linking. *Proceedings of COLING 2018*, 675–686.

[4] Yang, X., Gu, X., Lin, S., Tang, S., Zhuang, Y., Wu, F., Chen, Z., Hu, G., & Ren, X. (2019). Learning Dynamic Context Augmentation for Global Entity Linking. *Proceedings of EMNLP-IJCNLP 2019*, 271–281. DOI: 10.18653/v1/D19-1026.

[5] Zhang, Q., Sun, Z., Hu, W., Chen, M., Guo, L., & Qu, Y. (2019). Multi-view Knowledge Graph Embedding for Entity Alignment. arXiv:1906.02390.

[6] Trisedya, B. D., Qi, J., & Zhang, R. (2019). Entity Alignment between Knowledge Graphs Using Attribute Embeddings. *Proceedings of AAAI*, 33(01), 297–304. DOI: 10.1609/aaai.v33i01.3301297.

[7] Tan, S., Guan, Z., Cai, D., Qin, X., Bu, J., & Chen, C. (2014). Mapping Users across Networks by Manifold Alignment on Hypergraph. *Proceedings of AAAI*, 28(1). DOI: 10.1609/aaai.v28i1.8720.

[8] Yan, Y., Yang, C., Chen, Y., Cai, R., & Ng, M. (2025). Hypergraph Learning for Unsupervised Graph Alignment via Optimal Transport. *Proceedings of AAAI*, 39(20), 21913–21921. DOI: 10.1609/aaai.v39i20.35498.

[9] Hu, H., Feng, Y., Li, R., Xue, R., Hou, X., Tian, Z., et al. (2026). Cog-RAG: Cognitive-Inspired Dual-Hypergraph with Theme Alignment Retrieval-Augmented Generation. *Proceedings of AAAI*, 40(37), 31032–31040. DOI: 10.1609/aaai.v40i37.40363.

[10] Sutskever, I., Tenenbaum, J. B., & Salakhutdinov, R. (2009). Modelling Relational Data using Bayesian Clustered Tensor Factorization. *Advances in Neural Information Processing Systems 22*.

[11] Jenatton, R., Roux, N. L., Bordes, A., & Obozinski, G. R. (2012). A Latent Factor Model for Highly Multi-relational Data. *Advances in Neural Information Processing Systems 25*.

[12] Socher, R., Chen, D., Manning, C. D., & Ng, A. Y. (2013). Reasoning With Neural Tensor Networks for Knowledge Base Completion. *Advances in Neural Information Processing Systems 26*.

[13] Sawada, Y., Fujita, T., Sakai, Y., & Watanabe, T. (2026). entity-linkings: A Unified Library for Entity Linking. *Proceedings of EACL 2026, Volume 3*, 591–601. DOI: 10.18653/v1/2026.eacl-demo.42.

[14] Chourasia, S., Kapoor, H., & Patil, N. (2026). Structure-Guided Entity Resolution: Fine-Tuning LLMs for Robust Name Matching in Complex Linguistic Contexts. *Proceedings of ACL 2026, Industry Track*, 1461–1468. DOI: 10.18653/v1/2026.acl-industry.101.

---

## 系列位置

**Series I：公共顯著性場與實體可辨識理論**

1. Paper 01：有名—無名的多維狀態空間
2. **Paper 02：多符號非均勻權重與高階語義耦合**
3. Paper 03：搜尋顯著度、人類知名度與機器可辨識度的解耦
4. Paper 04：觀察者依賴的感知顯著度理論
5. Paper 05：資訊質量累積與顯著性壓力猜想
6. Paper 06：第三方生成相變與自我繁殖公共圖
