← Archive
lm-003103 · 2026-08

多符號非均勻權重與高階語義耦合:從身份解析到語義超圖閉合

下載 MD 檔 ⬇
📎 附件 · Companion files — 隨文交付的程式 / 證明 / 資料,可獨立下載重驗

Series I / Paper 02

多符號非均勻權重與高階語義耦合:從身份解析到語義超圖閉合

Non-Uniform Multi-Symbol Weights and Higher-Order Semantic Coupling: From Identity Resolution to Semantic Hypergraph Closure

作者:Neo.K(許筌崴)
機構:EveMissLab
系列:公共顯著性場與實體可辨識理論(Series I)
版本:v0.1
日期:2026-08-14


摘要

同一公共實體往往同時由真名、筆名、公司名、品牌名、作品名、網域、帳號、縮寫與跨語言名稱等多個符號所指涉。傳統直覺常以「這些符號都指向同一個實體」為由,默認它們在搜尋、識別與公共認知中近似等價;但實際資訊系統中,不同符號具有不同的頻率、歧義度、來源分布、檢索強度與身份指向能力。因此,即使在同一實體內部,也通常存在

W(si)W(sj).W(s_i)\neq W(s_j).

本文提出「多符號非均勻語義耦合框架」(Non-Uniform Multi-Symbol Semantic Coupling Framework, NUMSC),作為公共顯著性狀態空間(PPSS)的第二層形式化。本文區分符號內在辨識力、查詢條件權重、來源獨立性與高階聯合證據,並定義一族 kk 階語義耦合張量

T(k).\mathcal{T}^{(k)}.

本文特別證明:高階身份閉合一般不能由所有 pairwise 相似度或關係分數的簡單總和唯一決定。透過 parity 型構造,可建立兩個具有完全相同一階與二階邊際關係、但三階聯合結構不同的系統。因此,普通圖上的兩兩邊不足以普遍表示不可約的高階語義依賴;超圖或高階張量是自然的擴展表示。

本文進一步提出符號有效數、身份閉合分數、高階增益、來源獨立性修正與觀察者依賴權重,並將 alias alignment、entity linking、collective entity linking、multi-view entity alignment、multi-relational tensor learning 與 hypergraph alignment 放入同一理論邊界。核心結論是:公共身份不是名稱字典,而是一個由非均勻符號、來源與高階關係共同形成的查詢依賴語義場。

關鍵詞: 多符號身份、別名解析、實體對齊、語義耦合、張量、超圖、身份閉合、搜尋權重、entity linking、entity alignment


1. 問題設定

Series I / Paper 01 將公共實體 EE 的狀態表示為

xEΩ=(I,S,V,D,R,M,H,A,ρ),\mathbf{x}_E^{\Omega} = (I,S,V,D,R,M,H,A,\rho),

其中 RR 表示身份可辨識度, MM 表示機器可辨識度。

然而,若要真正計算 RRMM,必須先回答更底層的問題:

一個實體具有多個名稱、品牌、網域與作品符號時,資訊系統如何判斷這些符號彼此相關,並進一步閉合成同一身份或穩定關係網?

令實體 EE 的公開符號族為

ΣE={s1,s2,,sn}.\Sigma_E = \{s_1,s_2,\ldots,s_n\}.

例如 sis_i 可以是:

  • 法定姓名;
  • 筆名或網名;
  • 公司名稱;
  • 研究品牌;
  • 網域;
  • 作品名稱;
  • 社群帳號;
  • 跨語言轉寫;
  • 縮寫;
  • 固定 metadata identifier。

最簡化的模型會寫成

s1s2snE.s_1\sim s_2\sim\cdots\sim s_n\sim E.

但此式只描述指涉關係,不描述資訊空間中的實際辨識難度。

本文主張:

referential equivalenceretrieval equivalencerecognition equivalence.\boxed{ \text{referential equivalence} \neq \text{retrieval equivalence} \neq \text{recognition equivalence}. }

2. 多符號權重不是均勻的

定義 1:觀察條件

沿用 Paper 01,令

Ω=(o,p,q,t),\Omega=(o,p,q,t),

其中 oo 為觀察者, pp 為平台或資訊系統, qq 為查詢/任務, tt 為時間。

定義 2:條件符號權重

對符號 sis_i,定義

wiΩ=W(sio,p,q,t),w_i^{\Omega} = W(s_i\mid o,p,q,t),

wiΩ0.w_i^{\Omega}\ge 0.

它表示在觀察條件 Ω\Omega 下,符號 sis_i 對實體辨識與公共顯著性的有效貢獻。

一般情況下:

wiΩwjΩ.\boxed{ w_i^{\Omega}\neq w_j^{\Omega}. }

即使 sis_isjs_j 都正確指向同一實體。


3. 符號權重的分解

一個可操作的近似是:

wiΩ=f(ri,ui,ci,ai,di,xi,Ω),w_i^{\Omega} = f \left( r_i, u_i, c_i, a_i, d_i, x_i, \Omega \right),

其中:

  • rir_i:retrievability,可召回性;
  • uiu_i:uniqueness,唯一性;
  • cic_i:contextual coherence,語境一致性;
  • aia_i:attribution strength,歸因強度;
  • did_i:source diversity,來源多樣性;
  • xix_i:ambiguity penalty,歧義懲罰。

可使用乘法型近似:

wiΩ=riαuiβciγaiδdiη(1xi)ζ,w_i^{\Omega} = r_i^{\alpha} u_i^{\beta} c_i^{\gamma} a_i^{\delta} d_i^{\eta} (1-x_i)^{\zeta},

其中所有指標先規範化到 [0,1][0,1],指數控制不同觀察環境下的權重敏感度。

此式不是本文唯一允許的估計器。其目的只是指出:

符號出現次數\text{符號出現次數}

並不等於

符號身份權重.\text{符號身份權重}.

高頻但高度歧義的短名稱,可能低於低頻但高度唯一的公司統編、固定網域或完整法定名稱。


4. 正規化權重與有效符號數

αiΩ=wiΩj=1nwjΩ,\alpha_i^{\Omega} = \frac{w_i^{\Omega}} {\sum_{j=1}^{n}w_j^{\Omega}},

則:

i=1nαiΩ=1.\sum_{i=1}^{n}\alpha_i^{\Omega}=1.

若所有符號完全均勻:

αi=1n.\alpha_i=\frac{1}{n}.

但實際系統通常呈現長尾分布。

為描述「真正有效的符號數」,定義符號熵:

HΣΩ=i=1nαiΩlogαiΩ.H_{\Sigma}^{\Omega} = -\sum_{i=1}^{n} \alpha_i^{\Omega} \log\alpha_i^{\Omega}.

再定義有效符號數:

NeffΩ=exp(HΣΩ).N_{\mathrm{eff}}^{\Omega} = \exp \left( H_{\Sigma}^{\Omega} \right).

因此:

1NeffΩn.1\le N_{\mathrm{eff}}^{\Omega}\le n.

如果一個實體形式上有十個名稱,但其中九個幾乎不具有檢索或辨識能力,則:

Neff10.N_{\mathrm{eff}}\ll 10.

這使「符號數量」與「有效身份入口數量」得到形式分離。


5. 二階語義耦合矩陣

對任意兩個符號 si,sjs_i,s_j,定義:

CijΩ=Couple(si,sjΩ),C_{ij}^{\Omega} = \operatorname{Couple} (s_i,s_j\mid\Omega),

其中:

CijΩ[0,1].C_{ij}^{\Omega}\in[0,1].

矩陣

CΩ=[CijΩ]\mathbf{C}^{\Omega} = [C_{ij}^{\Omega}]

可以表示 pairwise 關係,例如:

  • 同一文件共同出現;
  • 網頁互相連結;
  • metadata 明示作者/機構;
  • 語義上下文相似;
  • 同一知識圖譜中的關係;
  • 搜尋結果中共同召回;
  • AI 對兩符號 identity match 的信心。

若只使用二階模型,一個自然的身份分數可能寫為

Rpair=i<jαiαjCij.R_{\mathrm{pair}} = \sum_{i<j} \alpha_i\alpha_j C_{ij}.

此形式很直觀,但不普遍充分。


6. 為什麼 pairwise graph 不夠?

真正重要的現象是:

某些符號兩兩看都不夠強,但三個、四個或更多符號聯合出現時,身份可能突然變得高度唯一。

令:

s1=姓名,s_1=\text{姓名}, s2=品牌,s_2=\text{品牌}, s3=公司,s_3=\text{公司}, s4=固定網域.s_4=\text{固定網域}.

可能存在:

C120.4,C130.3,C240.5,C_{12}\approx 0.4, \qquad C_{13}\approx 0.3, \qquad C_{24}\approx 0.5,

但聯合查詢:

(s1,s2,s3,s4)(s_1,s_2,s_3,s_4)

幾乎只有一個實體可以同時滿足。

因此:

Couple(s1,s2,s3,s4)\operatorname{Couple} (s_1,s_2,s_3,s_4)

不能預設等於六個 pairwise coupling 的平均或總和。


7. 高階語義耦合張量

定義 3: kk 階語義耦合

k2k\ge2,定義

Ti1i2ik(k),Ω=Couplek(si1,si2,,sikΩ).\mathcal{T}^{(k),\Omega}_{i_1i_2\cdots i_k} = \operatorname{Couple}_k \left( s_{i_1}, s_{i_2}, \ldots, s_{i_k} \mid \Omega \right).

其中:

Ti1i2ik(k),Ω[0,1].\mathcal{T}^{(k),\Omega}_{i_1i_2\cdots i_k} \in[0,1].

二階情況退化為:

T(2),Ω=CΩ.\mathcal{T}^{(2),\Omega} = \mathbf{C}^{\Omega}.

但:

T(3)\mathcal{T}^{(3)}

T(4)\mathcal{T}^{(4)}

可以攜帶 pairwise matrix 無法唯一恢復的資訊。


8. Pairwise 不充分命題

命題 1:二階邊際不足以唯一決定高階聯合結構

存在兩個三變量系統 PPQQ,使所有一階與二階邊際分布完全相同,但三階聯合分布不同。

證明

令:

X,YX,Y

為獨立均勻 Bernoulli 變量。

在系統 PP 中定義:

Z=XY,Z=X\oplus Y,

其中 \oplus 為 XOR。

X,Y,ZX,Y,Z 各自均勻,且任意兩者 pairwise independent。因此:

P(X,Y)=P(X)P(Y),P(X,Y)=P(X)P(Y), P(X,Z)=P(X)P(Z),P(X,Z)=P(X)P(Z), P(Y,Z)=P(Y)P(Z).P(Y,Z)=P(Y)P(Z).

再構造系統 QQ,令:

X,Y,ZX,Y,Z

三者完全獨立且均勻。

PPQQ 具有相同的一階邊際與全部二階邊際。

然而在 PP 中:

XYZ=0X\oplus Y\oplus Z=0

以機率 11 成立;在 QQ 中:

P(XYZ=0)=12.P(X\oplus Y\oplus Z=0)=\frac{1}{2}.

所以兩系統的三階聯合結構不同。

因此,由所有 pairwise 關係不能一般性地唯一恢復高階聯合結構。

\boxed{\square}

9. 語義意義

上述證明不是說公共身份真的服從 XOR。

它證明一個更一般的結構性限制:

all pairwise information⇏all higher-order information.\boxed{ \text{all pairwise information} \not\Rightarrow \text{all higher-order information}. }

因此,如果多符號身份閉合依賴群組條件、共同上下文、來源組合或「只有這組符號一起出現才唯一」的條件,普通 adjacency matrix 可能不夠。

這正是超圖表示的自然動機。


10. 語義超圖

定義語義超圖:

HE=(V,E,ω),\mathcal{H}_E = (V,\mathcal{E},\omega),

其中:

V=ΣEDR,V = \Sigma_E \cup \mathcal{D} \cup \mathcal{R},

ΣE\Sigma_E 為符號節點, D\mathcal{D} 為文件/來源節點, R\mathcal{R} 為候選實體或關係節點。

每一條超邊:

eEe\in\mathcal{E}

可同時連接兩個以上節點:

e={si1,si2,,sik,dj,E}.e = \{ s_{i_1}, s_{i_2}, \ldots, s_{i_k}, d_j, E \}.

例如,一個作者頁可能同時明示:

{真名,筆名,機構,作品,網域}.\{ \text{真名}, \text{筆名}, \text{機構}, \text{作品}, \text{網域} \}.

此聯合陳述可以作為單一高階證據,而不必先拆成多條相互獨立的 pairwise 邊。


11. 高階增益

SΣES\subseteq\Sigma_E,且 S=k|S|=k

定義高階耦合值:

T(S)=Couplek(S).T(S) = \operatorname{Couple}_k(S).

再令 pairwise 基準為:

B2(S)=2k(k1){i,j}SCij.B_2(S) = \frac{2}{k(k-1)} \sum_{\{i,j\}\subseteq S} C_{ij}.

定義高階增益:

Gk(S)=T(S)B2(S).G_k(S) = T(S)-B_2(S).

若:

Gk(S)>0,G_k(S)>0,

表示聯合符號組的辨識能力高於 pairwise 平均所暗示的程度。

若:

Gk(S)0,G_k(S)\gg0,

則此符號組具有強烈的「閉合增益」。

這類現象可以稱為:

semantic closure gain.\boxed{ \text{semantic closure gain}. }

12. 身份閉合分數

令候選實體集合為:

E={E1,E2,,Em}.\mathcal{E}^{*} = \{E_1,E_2,\ldots,E_m\}.

觀察到證據集合:

O={si1,,sik,dj1,}.\mathcal{O} = \{ s_{i_1}, \ldots, s_{i_k}, d_{j_1}, \ldots \}.

定義身份閉合分數:

R(EO,Ω)=P(EO,Ω).R(E\mid\mathcal{O},\Omega) = P \left( E \mid \mathcal{O}, \Omega \right).

若:

R(EO,Ω)τR(E^{*}\mid\mathcal{O},\Omega) \ge\tau

且:

R(EO,Ω)maxEER(EO,Ω)Δ,R(E^{*}\mid\mathcal{O},\Omega) - \max_{E\neq E^{*}} R(E\mid\mathcal{O},\Omega) \ge\Delta,

則稱觀察條件 Ω\Omega 下發生身份閉合。

其中:

  • τ\tau 為最低可信閾值;
  • Δ\Delta 為候選間隔閾值。

這比「第一名候選就是答案」更嚴格,因為它要求絕對信心與相對優勢同時成立。


13. 非均勻權重的必要性命題

命題 2

若兩符號具有不同歧義度或不同條件召回率,則任何強制令其權重相等的估計器,一般不能保持最佳身份判別能力。

證明概念

設:

sas_a

為高度唯一符號,在候選實體 E1E_1 上有:

P(saE1)=1,P(s_a\mid E_1)=1,

對其他候選:

P(saEj)=ϵ,j1.P(s_a\mid E_j)=\epsilon, \qquad j\neq1.

另有高歧義符號 sbs_b,對所有候選皆近似:

P(sbEj)c.P(s_b\mid E_j)\approx c.

sas_a 的 likelihood ratio 遠高於 sbs_b

若估計器強迫:

wa=wb,w_a=w_b,

便無法反映兩者對 posterior identity discrimination 的不同資訊量。

因此合理權重必須允許:

wa>wb.w_a>w_b. \boxed{\square}

14. 來源不是獨立票數

多個頁面支持同一身份,不代表有同樣多個獨立證據。

若十個網站全部複製自同一份資料:

d1,d2,,d10,d_1,d_2,\ldots,d_{10},

直接計數會產生虛假的證據膨脹。

令來源圖中的相關性為:

κab[0,1].\kappa_{ab} \in[0,1].

κab=1\kappa_{ab}=1 表示兩來源近乎完全依賴, κab=0\kappa_{ab}=0 表示在指定模型中近似獨立。

可定義來源有效數:

Nsrc,eff=(jvj)2jvj2+2a<bκabvavb.N_{\mathrm{src,eff}} = \frac{ \left(\sum_j v_j\right)^2 }{ \sum_j v_j^2 + 2\sum_{a<b}\kappa_{ab}v_av_b }.

此形式表達:

十份鏡像十份獨立證據.\text{十份鏡像} \neq \text{十份獨立證據}.

因此多符號身份模型必須同時處理:

symbol diversity\text{symbol diversity}

與:

source independence.\text{source independence}.

15. 條件權重與查詢重綁定

同一符號的權重會隨查詢改變。

對同一 sis_i

wiΩ1wiΩ2.w_i^{\Omega_1} \neq w_i^{\Omega_2}.

例如:

  • 精確人名查詢可能提高法定姓名權重;
  • 技術產品查詢可能提高品牌/產品符號權重;
  • 公司查詢可能提高法人名稱與註冊資訊權重;
  • AI 問答可能同時整合跨站 metadata、摘要與語義上下文。

因此:

W(si)\boxed{ W(s_i) }

不應理解為永久固定的「符號能量」。

更準確的是:

W(siΩ).\boxed{ W(s_i\mid\Omega). }

這使 NUMSC 成為觀察者依賴與查詢依賴模型。


16. 與 Entity Linking 的區別

Entity Linking 通常處理:

mentionknowledge-base entity.\text{mention} \rightarrow \text{knowledge-base entity}.

現代系統會進行候選生成與消歧,並利用名稱、語境、描述或全局一致性。

NUMSC 的問題更廣:

{names,aliases,brands,domains,organizations,works,sources}latent public entity field.\{ \text{names}, \text{aliases}, \text{brands}, \text{domains}, \text{organizations}, \text{works}, \text{sources} \} \rightarrow \text{latent public entity field}.

也就是說,NUMSC 不預設:

  1. 已存在完整知識庫;
  2. 所有符號都是文本 mention;
  3. 只有一個文件;
  4. 只有 pairwise mention–entity 關係;
  5. 所有來源具有相同可信度;
  6. 身份閉合與公共顯著性可以分開處理。

因此 NUMSC 與 entity linking 相交,但不等同。


17. 與 Alias Alignment 的關係

McKelvey 等人的 alias alignment 研究指出,即使缺乏完整背景知識,也可以結合名稱字面特徵與 alias 周圍的語義上下文進行身份對齊。

這支持:

name form+semantic context>name form alone\text{name form} + \text{semantic context} > \text{name form alone}

作為身份判別的一般方向。

NUMSC 再加入兩個層次:

第一,不只處理一個名稱與一個 alias,而處理:

ΣE2.|\Sigma_E|\ge2.

第二,不只考慮 pairwise alias alignment,而允許:

T(k),k>2.\mathcal{T}^{(k)}, \qquad k>2.

18. 與 Collective Entity Linking 的關係

Collective Entity Linking 已指出,逐一獨立處理 mention 可能因局部資訊稀疏而失敗,因此需要全局 coherence。

這與本文具有直接同構:

local evidenceglobal closure.\text{local evidence} \neq \text{global closure}.

但 collective EL 常在同一文件或候選實體圖上求整體一致性。

NUMSC 則把 globality 擴展至:

跨文件+跨網站+跨符號類型+跨來源+跨觀察者.\text{跨文件} + \text{跨網站} + \text{跨符號類型} + \text{跨來源} + \text{跨觀察者}.

19. 與 Multi-View Entity Alignment 的關係

Multi-view entity alignment 已將名稱、關係與屬性等不同 view 統一用於跨 knowledge graph 實體對齊。

此結果直接支持本文的非均勻多來源觀點:

identity evidencesingle-view evidence.\text{identity evidence} \neq \text{single-view evidence}.

然而,NUMSC 更關心的是:

不同 view 的公共權重\text{不同 view 的公共權重}

以及:

不同 view 組合是否產生不可約高階增益.\text{不同 view 組合是否產生不可約高階增益}.

因此,其目標不只是提高 Hits@1,而是描述一個公共實體如何在資訊空間中被逐步閉合。


20. 與 Multi-Relational Tensor Learning 的區別

既有 multi-relational learning 早已使用三維張量或其他 latent factor models 表示:

(entityi,relationr,entityj).(\text{entity}_i,\text{relation}_r,\text{entity}_j).

因此本文不能宣稱「第一次使用張量表示實體關係」。

NUMSC 的不同點在於:

Ti1ik(k)\mathcal{T}^{(k)}_{i_1\cdots i_k}

的索引首先對應的是多個符號/證據項的聯合耦合,而不是固定三元知識圖譜中的 relation type。

換言之:

multi-relational tensor\text{multi-relational tensor}

與:

higher-order multi-symbol coupling tensor\text{higher-order multi-symbol coupling tensor}

是相鄰但不同的建模對象。


21. 與 Hypergraph Alignment 的關係

近期 hypergraph alignment 研究明確指出,普通 graph 天然以 pairwise relation 為基本單位,而 higher-order dependencies 需要 hypergraph 才能直接表達。

本文採用相同的結構動機,但應用於公共身份閉合:

multiple symbols+multiple documents+multiple relationsone higher-order identity evidence structure.\boxed{ \text{multiple symbols} + \text{multiple documents} + \text{multiple relations} \rightarrow \text{one higher-order identity evidence structure}. }

因此,本文的超圖不是為了取代所有 graph 方法,而是用來表示 graph projection 可能遺失的不可約高階關係。


22. Graph projection 與資訊損失

給定超圖:

H=(V,E),\mathcal{H}=(V,\mathcal{E}),

常見作法可把每條 hyperedge 投影成 clique:

e={v1,v2,v3}e=\{v_1,v_2,v_3\}

轉成:

(v1,v2),(v1,v3),(v2,v3).(v_1,v_2), (v_1,v_3), (v_2,v_3).

但投影後,系統無法僅由三條 pairwise edge 判斷:

原本是一個三元共同關係?

還是:

三個互不相干的二元關係恰好同時存在?

因此 graph projection 可以保留部分鄰接資訊,卻不必保留原始高階事件的完整語義。

此差異對身份解析尤其重要,因為:

共同署名\text{共同署名}

與:

三組獨立共現\text{三組獨立共現}

可能產生相同 pairwise clique,卻具有不同的證據意義。


23. 語義耦合場

當符號集合持續增長時,使用固定階數 kk 並不總是方便。

因此定義完整語義耦合場:

TEΩ={T(2),Ω,T(3),Ω,,T(n),Ω}.\mathfrak{T}_E^{\Omega} = \left\{ \mathcal{T}^{(2),\Omega}, \mathcal{T}^{(3),\Omega}, \ldots, \mathcal{T}^{(n),\Omega} \right\}.

它不是單一有限階 tensor,而是一族由不同階聯合證據形成的結構。

實體身份狀態可進一步寫成:

IEΩ=(ΣE,wΩ,TEΩ,D,K),\mathcal{I}_E^{\Omega} = \left( \Sigma_E, \mathbf{w}^{\Omega}, \mathfrak{T}_E^{\Omega}, \mathcal{D}, \mathbf{K} \right),

其中:

  • ΣE\Sigma_E:符號族;
  • wΩ\mathbf{w}^{\Omega}:非均勻符號權重;
  • TEΩ\mathfrak{T}_E^{\Omega}:高階耦合場;
  • D\mathcal{D}:來源集合;
  • K\mathbf{K}:來源依賴/相關矩陣。

這構成本文所稱的:

multi-symbol identity field.\boxed{ \text{multi-symbol identity field}. }

24. 從身份閉合回到 PPSS

Paper 01 中的身份可辨識度:

R(E,Ω)R(E,\Omega)

現在可以重新寫成:

R(E,Ω)=Φ(IEΩ),R(E,\Omega) = \Phi \left( \mathcal{I}_E^{\Omega} \right),

即:

R(E,Ω)=Φ(ΣE,wΩ,TEΩ,D,K).R(E,\Omega) = \Phi \left( \Sigma_E, \mathbf{w}^{\Omega}, \mathfrak{T}_E^{\Omega}, \mathcal{D}, \mathbf{K} \right).

機器可辨識度:

M(E,Ω)M(E,\Omega)

則可以理解成特定機器系統 A\mathcal{A} 對同一身份場的推斷性能:

M(E,Ω;A)=ΨA(IEΩ).M(E,\Omega;\mathcal{A}) = \Psi_{\mathcal{A}} \left( \mathcal{I}_E^{\Omega} \right).

因此:

RR

是問題結構的一部分,而:

MM

同時依賴求解器能力。

這個區分對下一篇 Paper 03 將非常重要。


25. 可檢驗假說

本文提出以下經驗假說。

H1:非均勻權重假說

在真實多符號實體中:

Var(α1,,αn)>0\operatorname{Var} \left( \alpha_1,\ldots,\alpha_n \right) >0

通常成立。

H2:高階增益假說

存在相當比例的身份解析案例,使:

Gk(S)>0G_k(S)>0

對某些 k3k\ge3 成立。

H3:來源修正假說

加入來源依賴修正後,身份 confidence calibration 優於將所有頁面視為獨立證據的模型。

H4:觀察者重綁定假說

不同平台/查詢下:

rank(wiΩ1)rank(wiΩ2)\operatorname{rank} \left( w_i^{\Omega_1} \right) \neq \operatorname{rank} \left( w_i^{\Omega_2} \right)

會頻繁發生。

H5:LLM 高階閉合假說

在包含多類符號與跨文件證據的 benchmark 中,允許聯合上下文推理的 LLM/graph-hypergraph hybrid 系統,應在部分案例上優於純 pairwise alias similarity 模型。

此假說不預設 LLM 必然正確;其驗證必須同時測量 hallucinated coupling。


26. Benchmark 設計

可以建立一個 Multi-Symbol Public Entity Benchmark。

每個實體至少包含:

E{s1,,sn}.E \rightarrow \{ s_1,\ldots,s_n \}.

資料應包括:

  1. 真實 alias;
  2. 高歧義 alias;
  3. 品牌與法人關係;
  4. 網域與作者頁;
  5. 跨語言名稱;
  6. 鏡像來源;
  7. 真正獨立第三方來源;
  8. hard negative entities;
  9. 僅在三階以上證據才容易閉合的案例。

評估至少包含:

Precision,\text{Precision}, Recall,\text{Recall}, F1,\text{F1}, Brier Score,\text{Brier Score}, ECE,\text{ECE},

以及:

ΔHO=ScorehigherorderScorepairwise.\Delta_{\mathrm{HO}} = \text{Score}_{\mathrm{higher-order}} - \text{Score}_{\mathrm{pairwise}}.

其中:

ΔHO>0\Delta_{\mathrm{HO}}>0

可作為高階模型是否真正帶來辨識收益的直接證據。


27. 失敗模式

27.1 假閉合

大量語義相似不等於同一身份:

semantic similarity⇏identity.\text{semantic similarity} \not\Rightarrow \text{identity}.

27.2 熱門實體吸引

搜尋與知識庫系統可能把模糊符號錯誤吸附到高知名度候選。

27.3 自有內容迴圈

大量自有網站互相引用可能造成:

apparent source diversity>true source independence.\text{apparent source diversity} > \text{true source independence}.

27.4 LLM 關係幻覺

LLM 可能因敘事一致性而創造不存在的:

sisj.s_i\leftrightarrow s_j.

因此高階推理必須保留 evidence provenance。

27.5 時間漂移

公司、品牌、筆名、職位與網域關係都可能隨時間變動:

TE=TE(t).\mathfrak{T}_E = \mathfrak{T}_E(t).

所以身份閉合不能永遠視為靜態。


28. 理論邊界

本文不主張:

  1. 所有身份問題都需要高階 tensor;
  2. pairwise graph 沒有用;
  3. LLM 一定優於傳統 entity linker;
  4. 多來源自動等於高可信;
  5. 高階耦合等於因果關係;
  6. 身份閉合等於權威或知名度。

本文只主張:

pairwise models are not universally sufficient for multi-symbol public identity closure.\boxed{ \text{pairwise models are not universally sufficient for multi-symbol public identity closure}. }

以及:

symbol weights are generally non-uniform and observation-dependent.\boxed{ \text{symbol weights are generally non-uniform and observation-dependent}. }

29. 與 Paper 01 的統一

Paper 01 的核心式為:

xEΩ=(I,S,V,D,R,M,H,A,ρ).\mathbf{x}_E^{\Omega} = (I,S,V,D,R,M,H,A,\rho).

Paper 02 現在把其中的:

RR

展開成:

R=Φ(ΣE,wΩ,TEΩ,D,K).R = \Phi \left( \Sigma_E, \mathbf{w}^{\Omega}, \mathfrak{T}_E^{\Omega}, \mathcal{D}, \mathbf{K} \right).

因此公共顯著性理論第一次具有兩層結構:

symbol/evidence layerentity state layer.\boxed{ \text{symbol/evidence layer} \rightarrow \text{entity state layer}. }

下一步則需要研究:

R,M,H,S,VR,M,H,S,V

彼此如何解耦。

亦即:

一個實體為什麼可以被搜尋引擎與 AI 高度閉合,卻仍然在人類社會中低知名?

這將構成 Series I / Paper 03。


30. 結論

本文提出 NUMSC,將公共實體的多符號結構表示為:

IEΩ=(ΣE,wΩ,TEΩ,D,K).\mathcal{I}_E^{\Omega} = \left( \Sigma_E, \mathbf{w}^{\Omega}, \mathfrak{T}_E^{\Omega}, \mathcal{D}, \mathbf{K} \right).

其中:

wΩ\mathbf{w}^{\Omega}

描述符號的非均勻、觀察者依賴權重;

TEΩ\mathfrak{T}_E^{\Omega}

描述二階以上的高階語義耦合;

K\mathbf{K}

修正來源間的依賴性。

本文以 parity 構造證明,所有 pairwise 邊際資訊不足以一般性地唯一恢復高階聯合結構。因此:

T(k)≢T(2).\boxed{ \mathcal{T}^{(k)} \not\equiv \sum \mathcal{T}^{(2)}. }

這不是說每個搜尋問題都必須使用高階張量,而是說:當身份唯一性真正來自多個符號、來源與上下文的聯合閉合時,二元關係的簡單加總沒有普遍充分性。

因此,公共身份不應被理解為:

nameentity.\text{name} \rightarrow \text{entity}.

更一般地,它是一個:

query-dependent weighted semantic field of symbols, sources, and higher-order relations.\boxed{ \text{query-dependent weighted semantic field of symbols, sources, and higher-order relations}. }

參考文獻

[1] McKelvey, K., Goutzounis, P., da Cruz, S., & Chambers, N. (2017). Aligning Entity Names with Online Aliases on Twitter. Proceedings of the Fifth International Workshop on Natural Language Processing for Social Media, 25–35. DOI: 10.18653/v1/W17-1104.

[2] Moro, A., Raganato, A., & Navigli, R. (2014). Entity Linking meets Word Sense Disambiguation: a Unified Approach. Transactions of the Association for Computational Linguistics, 2, 231–244. DOI: 10.1162/tacl_a_00179.

[3] Cao, Y., Hou, L., Li, J., & Liu, Z. (2018). Neural Collective Entity Linking. Proceedings of COLING 2018, 675–686.

[4] Yang, X., Gu, X., Lin, S., Tang, S., Zhuang, Y., Wu, F., Chen, Z., Hu, G., & Ren, X. (2019). Learning Dynamic Context Augmentation for Global Entity Linking. Proceedings of EMNLP-IJCNLP 2019, 271–281. DOI: 10.18653/v1/D19-1026.

[5] Zhang, Q., Sun, Z., Hu, W., Chen, M., Guo, L., & Qu, Y. (2019). Multi-view Knowledge Graph Embedding for Entity Alignment. arXiv:1906.02390.

[6] Trisedya, B. D., Qi, J., & Zhang, R. (2019). Entity Alignment between Knowledge Graphs Using Attribute Embeddings. Proceedings of AAAI, 33(01), 297–304. DOI: 10.1609/aaai.v33i01.3301297.

[7] Tan, S., Guan, Z., Cai, D., Qin, X., Bu, J., & Chen, C. (2014). Mapping Users across Networks by Manifold Alignment on Hypergraph. Proceedings of AAAI, 28(1). DOI: 10.1609/aaai.v28i1.8720.

[8] Yan, Y., Yang, C., Chen, Y., Cai, R., & Ng, M. (2025). Hypergraph Learning for Unsupervised Graph Alignment via Optimal Transport. Proceedings of AAAI, 39(20), 21913–21921. DOI: 10.1609/aaai.v39i20.35498.

[9] Hu, H., Feng, Y., Li, R., Xue, R., Hou, X., Tian, Z., et al. (2026). Cog-RAG: Cognitive-Inspired Dual-Hypergraph with Theme Alignment Retrieval-Augmented Generation. Proceedings of AAAI, 40(37), 31032–31040. DOI: 10.1609/aaai.v40i37.40363.

[10] Sutskever, I., Tenenbaum, J. B., & Salakhutdinov, R. (2009). Modelling Relational Data using Bayesian Clustered Tensor Factorization. Advances in Neural Information Processing Systems 22.

[11] Jenatton, R., Roux, N. L., Bordes, A., & Obozinski, G. R. (2012). A Latent Factor Model for Highly Multi-relational Data. Advances in Neural Information Processing Systems 25.

[12] Socher, R., Chen, D., Manning, C. D., & Ng, A. Y. (2013). Reasoning With Neural Tensor Networks for Knowledge Base Completion. Advances in Neural Information Processing Systems 26.

[13] Sawada, Y., Fujita, T., Sakai, Y., & Watanabe, T. (2026). entity-linkings: A Unified Library for Entity Linking. Proceedings of EACL 2026, Volume 3, 591–601. DOI: 10.18653/v1/2026.eacl-demo.42.

[14] Chourasia, S., Kapoor, H., & Patil, N. (2026). Structure-Guided Entity Resolution: Fine-Tuning LLMs for Robust Name Matching in Complex Linguistic Contexts. Proceedings of ACL 2026, Industry Track, 1461–1468. DOI: 10.18653/v1/2026.acl-industry.101.


系列位置

Series I:公共顯著性場與實體可辨識理論

  1. Paper 01:有名—無名的多維狀態空間
  2. Paper 02:多符號非均勻權重與高階語義耦合
  3. Paper 03:搜尋顯著度、人類知名度與機器可辨識度的解耦
  4. Paper 04:觀察者依賴的感知顯著度理論
  5. Paper 05:資訊質量累積與顯著性壓力猜想
  6. Paper 06:第三方生成相變與自我繁殖公共圖