Series I / Paper 02
多符號非均勻權重與高階語義耦合:從身份解析到語義超圖閉合
Non-Uniform Multi-Symbol Weights and Higher-Order Semantic Coupling: From Identity Resolution to Semantic Hypergraph Closure
作者:Neo.K(許筌崴)
機構:EveMissLab
系列:公共顯著性場與實體可辨識理論(Series I)
版本:v0.1
日期:2026-08-14
摘要
同一公共實體往往同時由真名、筆名、公司名、品牌名、作品名、網域、帳號、縮寫與跨語言名稱等多個符號所指涉。傳統直覺常以「這些符號都指向同一個實體」為由,默認它們在搜尋、識別與公共認知中近似等價;但實際資訊系統中,不同符號具有不同的頻率、歧義度、來源分布、檢索強度與身份指向能力。因此,即使在同一實體內部,也通常存在
W(si)=W(sj).
本文提出「多符號非均勻語義耦合框架」(Non-Uniform Multi-Symbol Semantic Coupling Framework, NUMSC),作為公共顯著性狀態空間(PPSS)的第二層形式化。本文區分符號內在辨識力、查詢條件權重、來源獨立性與高階聯合證據,並定義一族 k 階語義耦合張量
T(k).
本文特別證明:高階身份閉合一般不能由所有 pairwise 相似度或關係分數的簡單總和唯一決定。透過 parity 型構造,可建立兩個具有完全相同一階與二階邊際關係、但三階聯合結構不同的系統。因此,普通圖上的兩兩邊不足以普遍表示不可約的高階語義依賴;超圖或高階張量是自然的擴展表示。
本文進一步提出符號有效數、身份閉合分數、高階增益、來源獨立性修正與觀察者依賴權重,並將 alias alignment、entity linking、collective entity linking、multi-view entity alignment、multi-relational tensor learning 與 hypergraph alignment 放入同一理論邊界。核心結論是:公共身份不是名稱字典,而是一個由非均勻符號、來源與高階關係共同形成的查詢依賴語義場。
關鍵詞: 多符號身份、別名解析、實體對齊、語義耦合、張量、超圖、身份閉合、搜尋權重、entity linking、entity alignment
1. 問題設定
Series I / Paper 01 將公共實體 E 的狀態表示為
xEΩ=(I,S,V,D,R,M,H,A,ρ),
其中 R 表示身份可辨識度, M 表示機器可辨識度。
然而,若要真正計算 R 與 M,必須先回答更底層的問題:
一個實體具有多個名稱、品牌、網域與作品符號時,資訊系統如何判斷這些符號彼此相關,並進一步閉合成同一身份或穩定關係網?
令實體 E 的公開符號族為
ΣE={s1,s2,…,sn}.
例如 si 可以是:
- 法定姓名;
- 筆名或網名;
- 公司名稱;
- 研究品牌;
- 網域;
- 作品名稱;
- 社群帳號;
- 跨語言轉寫;
- 縮寫;
- 固定 metadata identifier。
最簡化的模型會寫成
s1∼s2∼⋯∼sn∼E.
但此式只描述指涉關係,不描述資訊空間中的實際辨識難度。
本文主張:
referential equivalence=retrieval equivalence=recognition equivalence.
2. 多符號權重不是均勻的
定義 1:觀察條件
沿用 Paper 01,令
Ω=(o,p,q,t),
其中 o 為觀察者, p 為平台或資訊系統, q 為查詢/任務, t 為時間。
定義 2:條件符號權重
對符號 si,定義
wiΩ=W(si∣o,p,q,t),
且
wiΩ≥0.
它表示在觀察條件 Ω 下,符號 si 對實體辨識與公共顯著性的有效貢獻。
一般情況下:
wiΩ=wjΩ.
即使 si 與 sj 都正確指向同一實體。
3. 符號權重的分解
一個可操作的近似是:
wiΩ=f(ri,ui,ci,ai,di,xi,Ω),
其中:
- ri:retrievability,可召回性;
- ui:uniqueness,唯一性;
- ci:contextual coherence,語境一致性;
- ai:attribution strength,歸因強度;
- di:source diversity,來源多樣性;
- xi:ambiguity penalty,歧義懲罰。
可使用乘法型近似:
wiΩ=riαuiβciγaiδdiη(1−xi)ζ,
其中所有指標先規範化到 [0,1],指數控制不同觀察環境下的權重敏感度。
此式不是本文唯一允許的估計器。其目的只是指出:
符號出現次數
並不等於
符號身份權重.
高頻但高度歧義的短名稱,可能低於低頻但高度唯一的公司統編、固定網域或完整法定名稱。
4. 正規化權重與有效符號數
令
αiΩ=∑j=1nwjΩwiΩ,
則:
i=1∑nαiΩ=1.
若所有符號完全均勻:
αi=n1.
但實際系統通常呈現長尾分布。
為描述「真正有效的符號數」,定義符號熵:
HΣΩ=−i=1∑nαiΩlogαiΩ.
再定義有效符號數:
NeffΩ=exp(HΣΩ).
因此:
1≤NeffΩ≤n.
如果一個實體形式上有十個名稱,但其中九個幾乎不具有檢索或辨識能力,則:
Neff≪10.
這使「符號數量」與「有效身份入口數量」得到形式分離。
5. 二階語義耦合矩陣
對任意兩個符號 si,sj,定義:
CijΩ=Couple(si,sj∣Ω),
其中:
CijΩ∈[0,1].
矩陣
CΩ=[CijΩ]
可以表示 pairwise 關係,例如:
- 同一文件共同出現;
- 網頁互相連結;
- metadata 明示作者/機構;
- 語義上下文相似;
- 同一知識圖譜中的關係;
- 搜尋結果中共同召回;
- AI 對兩符號 identity match 的信心。
若只使用二階模型,一個自然的身份分數可能寫為
Rpair=i<j∑αiαjCij.
此形式很直觀,但不普遍充分。
6. 為什麼 pairwise graph 不夠?
真正重要的現象是:
某些符號兩兩看都不夠強,但三個、四個或更多符號聯合出現時,身份可能突然變得高度唯一。
令:
s1=姓名,
s2=品牌,
s3=公司,
s4=固定網域.
可能存在:
C12≈0.4,C13≈0.3,C24≈0.5,
但聯合查詢:
(s1,s2,s3,s4)
幾乎只有一個實體可以同時滿足。
因此:
Couple(s1,s2,s3,s4)
不能預設等於六個 pairwise coupling 的平均或總和。
7. 高階語義耦合張量
定義 3: k 階語義耦合
對 k≥2,定義
Ti1i2⋯ik(k),Ω=Couplek(si1,si2,…,sik∣Ω).
其中:
Ti1i2⋯ik(k),Ω∈[0,1].
二階情況退化為:
T(2),Ω=CΩ.
但:
T(3)
與
T(4)
可以攜帶 pairwise matrix 無法唯一恢復的資訊。
8. Pairwise 不充分命題
命題 1:二階邊際不足以唯一決定高階聯合結構
存在兩個三變量系統 P 與 Q,使所有一階與二階邊際分布完全相同,但三階聯合分布不同。
證明
令:
X,Y
為獨立均勻 Bernoulli 變量。
在系統 P 中定義:
Z=X⊕Y,
其中 ⊕ 為 XOR。
則 X,Y,Z 各自均勻,且任意兩者 pairwise independent。因此:
P(X,Y)=P(X)P(Y),
P(X,Z)=P(X)P(Z),
P(Y,Z)=P(Y)P(Z).
再構造系統 Q,令:
X,Y,Z
三者完全獨立且均勻。
則 P 與 Q 具有相同的一階邊際與全部二階邊際。
然而在 P 中:
X⊕Y⊕Z=0
以機率 1 成立;在 Q 中:
P(X⊕Y⊕Z=0)=21.
所以兩系統的三階聯合結構不同。
因此,由所有 pairwise 關係不能一般性地唯一恢復高階聯合結構。
□
9. 語義意義
上述證明不是說公共身份真的服從 XOR。
它證明一個更一般的結構性限制:
all pairwise information⇒all higher-order information.
因此,如果多符號身份閉合依賴群組條件、共同上下文、來源組合或「只有這組符號一起出現才唯一」的條件,普通 adjacency matrix 可能不夠。
這正是超圖表示的自然動機。
10. 語義超圖
定義語義超圖:
HE=(V,E,ω),
其中:
V=ΣE∪D∪R,
ΣE 為符號節點, D 為文件/來源節點, R 為候選實體或關係節點。
每一條超邊:
e∈E
可同時連接兩個以上節點:
e={si1,si2,…,sik,dj,E}.
例如,一個作者頁可能同時明示:
{真名,筆名,機構,作品,網域}.
此聯合陳述可以作為單一高階證據,而不必先拆成多條相互獨立的 pairwise 邊。
11. 高階增益
令 S⊆ΣE,且 ∣S∣=k。
定義高階耦合值:
T(S)=Couplek(S).
再令 pairwise 基準為:
B2(S)=k(k−1)2{i,j}⊆S∑Cij.
定義高階增益:
Gk(S)=T(S)−B2(S).
若:
Gk(S)>0,
表示聯合符號組的辨識能力高於 pairwise 平均所暗示的程度。
若:
Gk(S)≫0,
則此符號組具有強烈的「閉合增益」。
這類現象可以稱為:
semantic closure gain.
12. 身份閉合分數
令候選實體集合為:
E∗={E1,E2,…,Em}.
觀察到證據集合:
O={si1,…,sik,dj1,…}.
定義身份閉合分數:
R(E∣O,Ω)=P(E∣O,Ω).
若:
R(E∗∣O,Ω)≥τ
且:
R(E∗∣O,Ω)−E=E∗maxR(E∣O,Ω)≥Δ,
則稱觀察條件 Ω 下發生身份閉合。
其中:
- τ 為最低可信閾值;
- Δ 為候選間隔閾值。
這比「第一名候選就是答案」更嚴格,因為它要求絕對信心與相對優勢同時成立。
13. 非均勻權重的必要性命題
命題 2
若兩符號具有不同歧義度或不同條件召回率,則任何強制令其權重相等的估計器,一般不能保持最佳身份判別能力。
證明概念
設:
sa
為高度唯一符號,在候選實體 E1 上有:
P(sa∣E1)=1,
對其他候選:
P(sa∣Ej)=ϵ,j=1.
另有高歧義符號 sb,對所有候選皆近似:
P(sb∣Ej)≈c.
則 sa 的 likelihood ratio 遠高於 sb。
若估計器強迫:
wa=wb,
便無法反映兩者對 posterior identity discrimination 的不同資訊量。
因此合理權重必須允許:
wa>wb.
□
14. 來源不是獨立票數
多個頁面支持同一身份,不代表有同樣多個獨立證據。
若十個網站全部複製自同一份資料:
d1,d2,…,d10,
直接計數會產生虛假的證據膨脹。
令來源圖中的相關性為:
κab∈[0,1].
κab=1 表示兩來源近乎完全依賴, κab=0 表示在指定模型中近似獨立。
可定義來源有效數:
Nsrc,eff=∑jvj2+2∑a<bκabvavb(∑jvj)2.
此形式表達:
十份鏡像=十份獨立證據.
因此多符號身份模型必須同時處理:
symbol diversity
與:
source independence.
15. 條件權重與查詢重綁定
同一符號的權重會隨查詢改變。
對同一 si:
wiΩ1=wiΩ2.
例如:
- 精確人名查詢可能提高法定姓名權重;
- 技術產品查詢可能提高品牌/產品符號權重;
- 公司查詢可能提高法人名稱與註冊資訊權重;
- AI 問答可能同時整合跨站 metadata、摘要與語義上下文。
因此:
W(si)
不應理解為永久固定的「符號能量」。
更準確的是:
W(si∣Ω).
這使 NUMSC 成為觀察者依賴與查詢依賴模型。
16. 與 Entity Linking 的區別
Entity Linking 通常處理:
mention→knowledge-base entity.
現代系統會進行候選生成與消歧,並利用名稱、語境、描述或全局一致性。
NUMSC 的問題更廣:
{names,aliases,brands,domains,organizations,works,sources}→latent public entity field.
也就是說,NUMSC 不預設:
- 已存在完整知識庫;
- 所有符號都是文本 mention;
- 只有一個文件;
- 只有 pairwise mention–entity 關係;
- 所有來源具有相同可信度;
- 身份閉合與公共顯著性可以分開處理。
因此 NUMSC 與 entity linking 相交,但不等同。
17. 與 Alias Alignment 的關係
McKelvey 等人的 alias alignment 研究指出,即使缺乏完整背景知識,也可以結合名稱字面特徵與 alias 周圍的語義上下文進行身份對齊。
這支持:
name form+semantic context>name form alone
作為身份判別的一般方向。
NUMSC 再加入兩個層次:
第一,不只處理一個名稱與一個 alias,而處理:
∣ΣE∣≥2.
第二,不只考慮 pairwise alias alignment,而允許:
T(k),k>2.
18. 與 Collective Entity Linking 的關係
Collective Entity Linking 已指出,逐一獨立處理 mention 可能因局部資訊稀疏而失敗,因此需要全局 coherence。
這與本文具有直接同構:
local evidence=global closure.
但 collective EL 常在同一文件或候選實體圖上求整體一致性。
NUMSC 則把 globality 擴展至:
跨文件+跨網站+跨符號類型+跨來源+跨觀察者.
19. 與 Multi-View Entity Alignment 的關係
Multi-view entity alignment 已將名稱、關係與屬性等不同 view 統一用於跨 knowledge graph 實體對齊。
此結果直接支持本文的非均勻多來源觀點:
identity evidence=single-view evidence.
然而,NUMSC 更關心的是:
不同 view 的公共權重
以及:
不同 view 組合是否產生不可約高階增益.
因此,其目標不只是提高 Hits@1,而是描述一個公共實體如何在資訊空間中被逐步閉合。
20. 與 Multi-Relational Tensor Learning 的區別
既有 multi-relational learning 早已使用三維張量或其他 latent factor models 表示:
(entityi,relationr,entityj).
因此本文不能宣稱「第一次使用張量表示實體關係」。
NUMSC 的不同點在於:
Ti1⋯ik(k)
的索引首先對應的是多個符號/證據項的聯合耦合,而不是固定三元知識圖譜中的 relation type。
換言之:
multi-relational tensor
與:
higher-order multi-symbol coupling tensor
是相鄰但不同的建模對象。
21. 與 Hypergraph Alignment 的關係
近期 hypergraph alignment 研究明確指出,普通 graph 天然以 pairwise relation 為基本單位,而 higher-order dependencies 需要 hypergraph 才能直接表達。
本文採用相同的結構動機,但應用於公共身份閉合:
multiple symbols+multiple documents+multiple relations→one higher-order identity evidence structure.
因此,本文的超圖不是為了取代所有 graph 方法,而是用來表示 graph projection 可能遺失的不可約高階關係。
22. Graph projection 與資訊損失
給定超圖:
H=(V,E),
常見作法可把每條 hyperedge 投影成 clique:
e={v1,v2,v3}
轉成:
(v1,v2),(v1,v3),(v2,v3).
但投影後,系統無法僅由三條 pairwise edge 判斷:
原本是一個三元共同關係?
還是:
三個互不相干的二元關係恰好同時存在?
因此 graph projection 可以保留部分鄰接資訊,卻不必保留原始高階事件的完整語義。
此差異對身份解析尤其重要,因為:
共同署名
與:
三組獨立共現
可能產生相同 pairwise clique,卻具有不同的證據意義。
23. 語義耦合場
當符號集合持續增長時,使用固定階數 k 並不總是方便。
因此定義完整語義耦合場:
TEΩ={T(2),Ω,T(3),Ω,…,T(n),Ω}.
它不是單一有限階 tensor,而是一族由不同階聯合證據形成的結構。
實體身份狀態可進一步寫成:
IEΩ=(ΣE,wΩ,TEΩ,D,K),
其中:
- ΣE:符號族;
- wΩ:非均勻符號權重;
- TEΩ:高階耦合場;
- D:來源集合;
- K:來源依賴/相關矩陣。
這構成本文所稱的:
multi-symbol identity field.
24. 從身份閉合回到 PPSS
Paper 01 中的身份可辨識度:
R(E,Ω)
現在可以重新寫成:
R(E,Ω)=Φ(IEΩ),
即:
R(E,Ω)=Φ(ΣE,wΩ,TEΩ,D,K).
機器可辨識度:
M(E,Ω)
則可以理解成特定機器系統 A 對同一身份場的推斷性能:
M(E,Ω;A)=ΨA(IEΩ).
因此:
R
是問題結構的一部分,而:
M
同時依賴求解器能力。
這個區分對下一篇 Paper 03 將非常重要。
25. 可檢驗假說
本文提出以下經驗假說。
H1:非均勻權重假說
在真實多符號實體中:
Var(α1,…,αn)>0
通常成立。
H2:高階增益假說
存在相當比例的身份解析案例,使:
Gk(S)>0
對某些 k≥3 成立。
H3:來源修正假說
加入來源依賴修正後,身份 confidence calibration 優於將所有頁面視為獨立證據的模型。
H4:觀察者重綁定假說
不同平台/查詢下:
rank(wiΩ1)=rank(wiΩ2)
會頻繁發生。
H5:LLM 高階閉合假說
在包含多類符號與跨文件證據的 benchmark 中,允許聯合上下文推理的 LLM/graph-hypergraph hybrid 系統,應在部分案例上優於純 pairwise alias similarity 模型。
此假說不預設 LLM 必然正確;其驗證必須同時測量 hallucinated coupling。
26. Benchmark 設計
可以建立一個 Multi-Symbol Public Entity Benchmark。
每個實體至少包含:
E→{s1,…,sn}.
資料應包括:
- 真實 alias;
- 高歧義 alias;
- 品牌與法人關係;
- 網域與作者頁;
- 跨語言名稱;
- 鏡像來源;
- 真正獨立第三方來源;
- hard negative entities;
- 僅在三階以上證據才容易閉合的案例。
評估至少包含:
Precision,
Recall,
F1,
Brier Score,
ECE,
以及:
ΔHO=Scorehigher−order−Scorepairwise.
其中:
ΔHO>0
可作為高階模型是否真正帶來辨識收益的直接證據。
27. 失敗模式
27.1 假閉合
大量語義相似不等於同一身份:
semantic similarity⇒identity.
27.2 熱門實體吸引
搜尋與知識庫系統可能把模糊符號錯誤吸附到高知名度候選。
27.3 自有內容迴圈
大量自有網站互相引用可能造成:
apparent source diversity>true source independence.
27.4 LLM 關係幻覺
LLM 可能因敘事一致性而創造不存在的:
si↔sj.
因此高階推理必須保留 evidence provenance。
27.5 時間漂移
公司、品牌、筆名、職位與網域關係都可能隨時間變動:
TE=TE(t).
所以身份閉合不能永遠視為靜態。
28. 理論邊界
本文不主張:
- 所有身份問題都需要高階 tensor;
- pairwise graph 沒有用;
- LLM 一定優於傳統 entity linker;
- 多來源自動等於高可信;
- 高階耦合等於因果關係;
- 身份閉合等於權威或知名度。
本文只主張:
pairwise models are not universally sufficient for multi-symbol public identity closure.
以及:
symbol weights are generally non-uniform and observation-dependent.
29. 與 Paper 01 的統一
Paper 01 的核心式為:
xEΩ=(I,S,V,D,R,M,H,A,ρ).
Paper 02 現在把其中的:
R
展開成:
R=Φ(ΣE,wΩ,TEΩ,D,K).
因此公共顯著性理論第一次具有兩層結構:
symbol/evidence layer→entity state layer.
下一步則需要研究:
R,M,H,S,V
彼此如何解耦。
亦即:
一個實體為什麼可以被搜尋引擎與 AI 高度閉合,卻仍然在人類社會中低知名?
這將構成 Series I / Paper 03。
30. 結論
本文提出 NUMSC,將公共實體的多符號結構表示為:
IEΩ=(ΣE,wΩ,TEΩ,D,K).
其中:
wΩ
描述符號的非均勻、觀察者依賴權重;
TEΩ
描述二階以上的高階語義耦合;
K
修正來源間的依賴性。
本文以 parity 構造證明,所有 pairwise 邊際資訊不足以一般性地唯一恢復高階聯合結構。因此:
T(k)≡∑T(2).
這不是說每個搜尋問題都必須使用高階張量,而是說:當身份唯一性真正來自多個符號、來源與上下文的聯合閉合時,二元關係的簡單加總沒有普遍充分性。
因此,公共身份不應被理解為:
name→entity.
更一般地,它是一個:
query-dependent weighted semantic field of symbols, sources, and higher-order relations.
參考文獻
[1] McKelvey, K., Goutzounis, P., da Cruz, S., & Chambers, N. (2017). Aligning Entity Names with Online Aliases on Twitter. Proceedings of the Fifth International Workshop on Natural Language Processing for Social Media, 25–35. DOI: 10.18653/v1/W17-1104.
[2] Moro, A., Raganato, A., & Navigli, R. (2014). Entity Linking meets Word Sense Disambiguation: a Unified Approach. Transactions of the Association for Computational Linguistics, 2, 231–244. DOI: 10.1162/tacl_a_00179.
[3] Cao, Y., Hou, L., Li, J., & Liu, Z. (2018). Neural Collective Entity Linking. Proceedings of COLING 2018, 675–686.
[4] Yang, X., Gu, X., Lin, S., Tang, S., Zhuang, Y., Wu, F., Chen, Z., Hu, G., & Ren, X. (2019). Learning Dynamic Context Augmentation for Global Entity Linking. Proceedings of EMNLP-IJCNLP 2019, 271–281. DOI: 10.18653/v1/D19-1026.
[5] Zhang, Q., Sun, Z., Hu, W., Chen, M., Guo, L., & Qu, Y. (2019). Multi-view Knowledge Graph Embedding for Entity Alignment. arXiv:1906.02390.
[6] Trisedya, B. D., Qi, J., & Zhang, R. (2019). Entity Alignment between Knowledge Graphs Using Attribute Embeddings. Proceedings of AAAI, 33(01), 297–304. DOI: 10.1609/aaai.v33i01.3301297.
[7] Tan, S., Guan, Z., Cai, D., Qin, X., Bu, J., & Chen, C. (2014). Mapping Users across Networks by Manifold Alignment on Hypergraph. Proceedings of AAAI, 28(1). DOI: 10.1609/aaai.v28i1.8720.
[8] Yan, Y., Yang, C., Chen, Y., Cai, R., & Ng, M. (2025). Hypergraph Learning for Unsupervised Graph Alignment via Optimal Transport. Proceedings of AAAI, 39(20), 21913–21921. DOI: 10.1609/aaai.v39i20.35498.
[9] Hu, H., Feng, Y., Li, R., Xue, R., Hou, X., Tian, Z., et al. (2026). Cog-RAG: Cognitive-Inspired Dual-Hypergraph with Theme Alignment Retrieval-Augmented Generation. Proceedings of AAAI, 40(37), 31032–31040. DOI: 10.1609/aaai.v40i37.40363.
[10] Sutskever, I., Tenenbaum, J. B., & Salakhutdinov, R. (2009). Modelling Relational Data using Bayesian Clustered Tensor Factorization. Advances in Neural Information Processing Systems 22.
[11] Jenatton, R., Roux, N. L., Bordes, A., & Obozinski, G. R. (2012). A Latent Factor Model for Highly Multi-relational Data. Advances in Neural Information Processing Systems 25.
[12] Socher, R., Chen, D., Manning, C. D., & Ng, A. Y. (2013). Reasoning With Neural Tensor Networks for Knowledge Base Completion. Advances in Neural Information Processing Systems 26.
[13] Sawada, Y., Fujita, T., Sakai, Y., & Watanabe, T. (2026). entity-linkings: A Unified Library for Entity Linking. Proceedings of EACL 2026, Volume 3, 591–601. DOI: 10.18653/v1/2026.eacl-demo.42.
[14] Chourasia, S., Kapoor, H., & Patil, N. (2026). Structure-Guided Entity Resolution: Fine-Tuning LLMs for Robust Name Matching in Complex Linguistic Contexts. Proceedings of ACL 2026, Industry Track, 1461–1468. DOI: 10.18653/v1/2026.acl-industry.101.
系列位置
Series I:公共顯著性場與實體可辨識理論
- Paper 01:有名—無名的多維狀態空間
- Paper 02:多符號非均勻權重與高階語義耦合
- Paper 03:搜尋顯著度、人類知名度與機器可辨識度的解耦
- Paper 04:觀察者依賴的感知顯著度理論
- Paper 05:資訊質量累積與顯著性壓力猜想
- Paper 06:第三方生成相變與自我繁殖公共圖