← Archive
lm-003106 · 2026-08

搜尋顯著度、人類知名度與機器可辨識度的解耦:機器先辨識狀態與公共認知落差

下載 MD 檔 ⬇
📎 附件 · Companion files — 隨文交付的程式 / 證明 / 資料,可獨立下載重驗

Series I / Paper 03

搜尋顯著度、人類知名度與機器可辨識度的解耦:機器先辨識狀態與公共認知落差

Decoupling Search Prominence, Human Recognition, and Machine Recognizability: Machine-First Recognition Regimes and Public Awareness Gaps

作者:Neo.K(許筌崴)
機構:EveMissLab
系列:公共顯著性場與實體可辨識理論(Series I)
版本:v0.1
日期:2026-08-14


摘要

搜尋引擎、知識圖譜、檢索增強生成與具網頁遍歷能力的 AI 系統,使「一個實體是否被機器辨識」與「一個實體是否被人類社會廣泛認識」不再適合被視為同一問題。本文在公共顯著性狀態空間(PPSS)與多符號非均勻語義耦合框架(NUMSC)之上,提出搜尋顯著度、人類知名度與機器可辨識度的三通道解耦模型。

本文首先將搜尋顯著度定義為對查詢分布、排名位置、介面曝光與生成式回答引用的條件期望;將人類知名度定義為指定人群中對實體的正確辨識概率;再將機器可辨識度拆成參數式熟悉度、檢索式可辨識度與代理式重建能力。本文進一步定義「潛在機器可辨識度」(Latent Machine Recognizability),用以描述一個模型即使未在參數中穩定儲存某實體,也能在允許有限外部搜尋與關係推理時正確重建該實體的程度。

本文提出三種基本落差:

ΔMH=MLH,\Delta_{MH}=M_L-H, ΔSH=PSH,\Delta_{SH}=P_S-H, ΔSM=PSML,\Delta_{SM}=P_S-M_L,

分別描述機器—人類、搜尋—人類與搜尋—機器之間的結構差。透過乘積系統構造,本文證明在沒有額外耦合約束時,搜尋顯著度、機器可辨識度與人類知名度之間不存在普遍單調蘊含;因此:

PS⇏H,P_S\uparrow \not\Rightarrow H\uparrow, ML⇏H,M_L\uparrow \not\Rightarrow H\uparrow, PS⇏ML.P_S\uparrow \not\Rightarrow M_L\uparrow.

本文特別提出「機器先辨識狀態」(Machine-First Recognition Regime):一個實體可在公開資訊空間形成足以被搜尋與 AI 重建的身份閉合,而大多數人類仍未主動接觸、記憶或辨識該實體。此狀態不等於模型參數內已「知道」該實體,也不等於該實體已具社會名氣,而是一種由資訊可達性、身份結構與機器推理能力共同形成的新型公共存在狀態。

關鍵詞: 搜尋顯著度、機器可辨識度、人類知名度、長尾實體、RAG、entity linking、generative search、公共顯著性、AI 搜尋、資訊擴散


1. 問題:被搜尋到、被 AI 辨識與被人知道是三件事

Series I / Paper 01 定義公共實體狀態:

xEΩ=(I,S,V,D,R,M,H,A,ρ),\mathbf{x}_E^{\Omega} = (I,S,V,D,R,M,H,A,\rho),

其中:

  • SS:可搜尋度;
  • VV:介面可見度;
  • RR:身份可辨識度;
  • MM:機器可辨識度;
  • HH:人類認知度。

Paper 02 又將身份辨識問題展開為:

R=Φ(ΣE,wΩ,TEΩ,D,K),R = \Phi \left( \Sigma_E, \mathbf{w}^{\Omega}, \mathfrak{T}_E^{\Omega}, \mathcal{D}, \mathbf{K} \right),

其中多符號、來源與高階語義關係共同決定身份閉合。

本文處理下一個問題:

即使一個實體已經容易被搜尋引擎召回,也容易被 AI 由公開資料重建,為什麼它仍然可能對大多數人類近乎陌生?

核心答案是:

Search ExposureMachine ReconstructionHuman Recognition.\boxed{ \text{Search Exposure} \neq \text{Machine Reconstruction} \neq \text{Human Recognition}. }

三者使用不同的輸入、不同的觀察者與不同的轉換機制。


2. 搜尋顯著度不是單純的可搜尋度

Paper 01 中的 SS 只描述:

「找不找得到」.\text{「找不找得到」}.

但「搜尋結果中有沒有顯著出現」是一個更強的概念。

定義 1:查詢分布

令:

qQ,q\sim\mathcal{Q},

其中 Q\mathcal{Q} 是與實體相關的查詢分布。

這個分布可以包含:

  • 精確名稱查詢;
  • 模糊名稱查詢;
  • 主題查詢;
  • 品牌/作者/作品關係查詢;
  • 不包含實體名稱的探索性查詢。

3. 傳統搜尋顯著度

對搜尋平台 pp,令:

r(E,q,p,t)r(E,q,p,t)

為實體 EE 在查詢 qq 下最佳相關結果的位置。

定義排名曝光函數:

g(r),g(r),

使:

g(r)<0.g'(r)<0.

例如簡單形式可以是:

g(r)=1log2(1+r).g(r) = \frac{1}{\log_2(1+r)}.

再定義傳統搜尋顯著度:

PSERP(E;p,Q,t)=EqQ[χret(E,q)g(r)],P_{\mathrm{SERP}} (E;p,\mathcal{Q},t) = \mathbb{E}_{q\sim\mathcal{Q}} \left[ \chi_{\mathrm{ret}}(E,q) g(r) \right],

其中:

χret{0,1}\chi_{\mathrm{ret}}\in\{0,1\}

表示是否成功召回。

因此:

S>0S>0

只表示某些查詢可以召回,而:

PSERPP_{\mathrm{SERP}}

進一步考慮它被放在什麼位置、對多少種查詢出現。

早期搜尋研究已透過眼動與點擊資料證明,搜尋點擊受到展示位置與使用者檢視過程影響,因此「結果存在」不能直接等同「使用者實際注意」。這正是本文將 SS 與搜尋顯著度分離的經驗基礎。


4. 生成式搜尋顯著度

生成式搜尋不一定呈現十條藍色連結,而可能直接合成答案。

對生成式系統 GG,定義:

c(E,q,G,t)[0,1]c(E,q,G,t) \in[0,1]

為實體是否被引用、提及或作為證據使用的程度。

再定義答案內位置/權重函數:

a(E,q,G,t)[0,1].a(E,q,G,t) \in[0,1].

生成式搜尋顯著度可寫為:

PGEN=EqQ[c(E,q,G,t)a(E,q,G,t)].P_{\mathrm{GEN}} = \mathbb{E}_{q\sim\mathcal{Q}} \left[ c(E,q,G,t) a(E,q,G,t) \right].

因此整體搜尋顯著度可表示為向量:

PS=(PSERP,PGEN),\mathbf{P}_S = \left( P_{\mathrm{SERP}}, P_{\mathrm{GEN}} \right),

或由應用需求標量化為:

PS=λPSERP+(1λ)PGEN.P_S = \lambda P_{\mathrm{SERP}} + (1-\lambda) P_{\mathrm{GEN}}.

這種分離是必要的,因為傳統搜尋排名高,不保證生成式答案一定引用;反之亦然。


5. 人類知名度

定義 2:人類認知度

對指定人群:

uU,u\sim\mathcal{U},

定義:

H(E,U,t)=P(u 能正確辨認 EuU).H(E,\mathcal{U},t) = P \left( u\text{ 能正確辨認 }E \mid u\sim\mathcal{U} \right).

「正確辨認」至少需要能回答下列問題之一:

  • 這個名字是否聽過?
  • 它是一個人、公司、品牌還是作品?
  • 能否給出至少一項正確屬性?
  • 能否與相似名稱區分?

因此:

HH

不是搜尋流量,也不是頁面瀏覽量。

一個人可以打開某頁卻沒有形成可持續記憶;也可以從新聞、朋友或教育中知道某實體而從未搜尋。


6. 輔助與非輔助人類辨識

需要區分:

H0(E)H_0(E)

與:

H+(E).H_{+}(E).

其中:

H0H_0

表示不使用搜尋工具時的自發辨識;

H+H_{+}

表示允許搜尋或查證後的輔助辨識。

一般而言:

H+H0.H_{+}\ge H_0.

但日常語言中的「有名」更接近:

H0.H_0.

因為如果必須先輸入完整姓名、搜尋數分鐘後才知道某實體是誰,這並不等同於該實體已被社會廣泛認識。


7. 機器可辨識度必須再拆分

「AI 知不知道某人」是一個高度歧義的問題。

本文將它拆成三層。

7.1 參數式熟悉度

令:

MP(E;A,t)M_P(E;\mathcal{A},t)

表示模型 A\mathcal{A} 在不使用外部檢索時,由參數知識正確辨識實體的概率。

這比較接近:

parametric familiarity.\text{parametric familiarity}.

7.2 檢索式可辨識度

令:

MR(E;A,D,B,t)M_R(E;\mathcal{A},\mathcal{D},B,t)

表示系統在允許使用資料域 D\mathcal D 與檢索預算 BB 時,能否正確解析實體。

這種情況可以有:

MP0M_P\approx0

但:

MR0.M_R\gg0.

也就是模型原本未必穩定「知道」該實體,但搜尋後可以辨識。


7.3 代理式重建能力

現代 AI 可以不只取回單一頁面,而是:

SearchOpenTraverseCompareResolve.\text{Search} \rightarrow \text{Open} \rightarrow \text{Traverse} \rightarrow \text{Compare} \rightarrow \text{Resolve}.

定義:

MA(E;A,B,t)M_A(E;\mathcal{A},B,t)

為允許多步搜尋、網頁遍歷與關係推理後的實體重建能力。

因此:

MAM_A

可能高於單次檢索:

MA>MR.M_A>M_R.

但也可能因錯誤關係推理或 hallucination 下降,因此此不等式並非必然。


8. 潛在機器可辨識度

本文提出:

定義 3:潛在機器可辨識度

在允許的工具集合 T\mathcal{T} 、資料域 D\mathcal D 、搜尋預算 BB 與時間 tt 下:

ML(E;A,T,D,B,t)=P(E^=E),M_L (E;\mathcal{A},\mathcal{T},\mathcal{D},B,t) = P \left( \hat E=E \right),

其中 E^\hat E 是 AI 在完成合理搜尋與身份解析後輸出的實體模型。

此量稱為:

Latent Machine Recognizability.\boxed{ \text{Latent Machine Recognizability}. }

「latent」並不是指模型內部一定隱藏了該知識,而是:

在資訊空間中已存在足夠可取得的證據,使該機器系統在被要求時具有重建它的潛力。

因此:

ML0M_L\gg0

不能推出:

MP0.M_P\gg0.

9. 機器辨識鏈

對一個公開實體,可能存在:

CrawledIndexedRetrievedResolvedSynthesized.\text{Crawled} \rightarrow \text{Indexed} \rightarrow \text{Retrieved} \rightarrow \text{Resolved} \rightarrow \text{Synthesized}.

令各步驟成功概率分別為:

pC,pI,pR,pE,pG.p_C,p_I,p_R,p_E,p_G.

若用最簡化的條件獨立近似:

MLpCpIpRpEpG.M_L \approx p_Cp_Ip_Rp_Ep_G.

實際系統當然通常不獨立,但此式說明:

被爬取⇏被索引,\text{被爬取} \not\Rightarrow \text{被索引}, 被索引⇏被召回,\text{被索引} \not\Rightarrow \text{被召回}, 被召回⇏身份解析正確,\text{被召回} \not\Rightarrow \text{身份解析正確}, 身份解析正確⇏最終回答一定使用.\text{身份解析正確} \not\Rightarrow \text{最終回答一定使用}.

所以「AI 可能認識」必須指定究竟是鏈上的哪一層。


10. 三種落差變量

現在可以定義:

機器—人類落差

ΔMH=MLH0.\Delta_{MH} = M_L-H_0.

搜尋—人類落差

ΔSH=PSH0.\Delta_{SH} = P_S-H_0.

搜尋—機器落差

ΔSM=PSML.\Delta_{SM} = P_S-M_L.

這三個 gap 可以正、負或接近零。

因此一個公共實體不只是一個點,而可以位於:

(PS,ML,H0)[0,1]3.\left( P_S, M_L, H_0 \right) \in[0,1]^3.

11. 三通道結構解耦命題

命題 1:無額外耦合約束時,不存在普遍單調蘊含

考慮三個機制:

W\mathcal{W}

控制搜尋索引、排名與答案曝光;

A\mathcal{A}

控制機器身份解析能力;

U\mathcal{U}

控制人群中既有記憶與社會傳播。

若系統允許三者在構造上獨立調整,則可建立:

(PS,ML,H0)(P_S,M_L,H_0)

在可行立方體中的不同組合。

因此不存在普遍成立的:

PSH0,P_S\uparrow \Rightarrow H_0\uparrow, MLH0,M_L\uparrow \Rightarrow H_0\uparrow, PSML.P_S\uparrow \Rightarrow M_L\uparrow.

證明

固定一個公共實體 EE

第一,增加搜尋索引覆蓋與排名分數,但不向人群 U\mathcal U 進行任何社會擴散,可以提高 PSP_S 而保持 H0H_0 不變。

第二,給 AI 一個高品質、結構化、可檢索的身份資料庫,可以提高 MLM_L,但若人群仍未接觸該實體,則 H0H_0 可以保持不變。

第三,可以讓搜尋結果高排名地呈現大量歧義頁面,同時使身份關係不足,因此 PSP_S 高而 MLM_L 低。

第四,可以讓 AI 具有直接結構化資料源,而一般搜尋引擎對其低排名,因此 MLM_L 高而 PSP_S 低。

所以任一單通道增加都不足以在沒有額外機制假設時推出其他通道必然增加。

\boxed{\square}

此命題是一個模型結構命題,不是對所有現實平台的統計獨立性宣告。


12. 機器先辨識狀態

定義 4:Machine-First Recognition Regime

若存在閾值:

τM>τH,\tau_M>\tau_H,

使:

ML(E)τMM_L(E)\ge\tau_M

而:

H0(E)τH,H_0(E)\le\tau_H,

則稱 EE 位於機器先辨識狀態。

等價地,可要求:

ΔMHδ\Delta_{MH} \ge\delta

對某個:

δ>0.\delta>0.

典型結構為:

I,S,R0,I,S,R\gg0, ML0,M_L\gg0,

但:

D,H0ML.D,H_0\ll M_L.

其直觀意義是:

資訊已足以讓機器在需要時重建實體,但尚未產生足夠的人類被動發現、傳播與記憶。


13. 機器先辨識不等於「AI 已經知道」

這一點必須嚴格區分。

可能存在:

MP0,M_P\approx0, ML0.M_L\gg0.

此時更準確的描述是:

AI can reconstruct the entity when asked\boxed{ \text{AI can reconstruct the entity when asked} }

而不是:

the model already knows the entity parametrically.\boxed{ \text{the model already knows the entity parametrically}. }

這個區別尤其適用於:

  • 新成立公司;
  • 新作者;
  • 新論文;
  • 長尾人物;
  • 新品牌;
  • 快速變動事件;
  • 尚未進入靜態知識庫的 emerging entities。

14. 人類先辨識狀態

反方向也存在:

H0ML.H_0\gg M_L.

例如:

  • 小型地方社群中的知名人物;
  • 線下社群人物;
  • 新出現的口語代稱;
  • 私域社群符號;
  • 尚未進入公開網路的文化人物。

因此:

machine-first\boxed{ \text{machine-first} }

不是現代資訊社會唯一方向。

本文主張的是可行性與可測量性,而不是歷史必然性。


15. 搜尋高、機器低

可能存在:

PS0,P_S\gg0,

但:

MLPS.M_L\ll P_S.

常見原因包括:

  1. 名稱高度歧義;
  2. 搜尋結果被熱門同名實體占據;
  3. 文件量很大但 attribution 弱;
  4. 頁面彼此矛盾;
  5. 缺少高階身份閉合證據;
  6. AI 未能進行足夠的網頁遍歷。

這說明:

search prominenceentity reconstructability.\boxed{ \text{search prominence} \neq \text{entity reconstructability}. }

16. 機器高、搜尋低

也可能存在:

MLPS.M_L\gg P_S.

例如 AI 可以存取:

  • 結構化 knowledge graph;
  • 專業資料庫;
  • 私有索引;
  • 特定 repository;
  • 多步網站遍歷工具。

此時單一傳統搜尋結果頁並不能代表機器的資訊取得能力。


17. 長尾實體是自然實驗場

Entity Linking 文獻長期指出,熱門實體與長尾實體具有不同難度。真實 conversational EL 研究也發現,稀疏 knowledge base 與 domain-specific long-tail entities 會使 zero-shot 模型表現顯著下降。

2025 年對 ultra-fine entity typing 的研究進一步發現,僅依賴模型參數知識的方法在預訓練分布長尾實體上明顯較弱,而 knowledge-infused approaches 可以補足部分缺口。

因此:

MPM_P

天然受到訓練分布影響。

但:

MRM_R

與:

MAM_A

可以利用新的外部證據改變結果。

這正好支持本文將:

MM

拆成多層,而不是把它視為單一「AI 是否知道」判斷。


18. Emerging Entities 與時間動態

對新實體,靜態知識庫可能不存在對應條目。

DynamicER 顯示,新表達與持續變動的實體會妨礙 retrieval,並進一步影響 RAG。

RAED 則明確針對 emerging entities,透過外部 retrieval 建立更即時的 entity description,降低對固定 entity inventory 的依賴。

因此:

ML(E,t)M_L(E,t)

是時間函數:

ML=ML(t).M_L = M_L(t).

對快速成長的公開實體,可能出現:

ML(t1)ML(t2)M_L(t_1)\ll M_L(t_2)

即使:

H0(t1)H0(t2).H_0(t_1)\approx H_0(t_2).

這就是機器—人類落差可以隨時間暫時擴大的機制之一。


19. LLM 的語境增強作用

LLM-based entity linking 已顯示,增加實體 mention 的語境資訊可以改善 disambiguation。

因此從 NUMSC 角度:

TE\mathfrak T_E

中的高階關係若能被語言模型有效整合,可能提高:

ML.M_L.

但這不是保證,因為 LLM 同樣可能形成:

hallucinated coupling.\text{hallucinated coupling}.

所以機器可辨識度必須以:

correct reconstruction\text{correct reconstruction}

而不是:

confident narrative\text{confident narrative}

測量。


20. Web Traversal 與多步辨識

WebWalker 類工作指出,單層搜尋可能只能取回 shallow content,而多步網站遍歷可以改善複雜資訊取得。

這對公共身份問題非常重要。

某些身份不是一個頁面直接回答,而需要:

qd1d2d3E^.q \rightarrow d_1 \rightarrow d_2 \rightarrow d_3 \rightarrow \hat E.

因此:

MAM_A

應允許有限多步關係研究,而不能只用「搜尋首頁第一頁有沒有答案」測量。


21. 搜尋排名與人類注意

傳統搜尋研究顯示:

P(clickr)P(\text{click}\mid r)

受到 ranking position 影響。

Craswell 等人的 position-bias 實驗進一步以實際排序擾動研究不同 click models,顯示 presentation order 是理解搜尋行為的重要變數。

因此:

retrieved\text{retrieved}

與:

observed by a human\text{observed by a human}

之間還存在一個 attention channel。

可以寫成:

Ht+1=Ht+ηPSDCμHt,H_{t+1} = H_t + \eta P_S D C - \mu H_t,

其中:

  • η\eta:搜尋曝光轉成記憶/辨識的效率;
  • DD:實際發現概率;
  • CC:內容接觸後形成認知的轉換率;
  • μ\mu:遺忘或注意力流失。

因此:

PS0P_S\gg0

仍可能因:

D0D\approx0

或:

C0C\approx0

而不造成明顯:

H.H\uparrow.

22. 生成式搜尋增加了第四層可見性

GEO 研究已經把「在生成式答案中的 visibility」明確當成不同於傳統搜尋排名的新型優化問題。

因此一個實體可能具有:

PSERPPGEN,P_{\mathrm{SERP}}\ll P_{\mathrm{GEN}},

或:

PSERPPGEN.P_{\mathrm{SERP}}\gg P_{\mathrm{GEN}}.

從 PPSS 角度,這表示未來的「搜尋顯著度」本身也不能只保留一個數。

更一般地:

PS=(PSERP,PGEN,PREC,),\mathbf P_S = \left( P_{\mathrm{SERP}}, P_{\mathrm{GEN}}, P_{\mathrm{REC}}, \ldots \right),

其中:

PRECP_{\mathrm{REC}}

可以代表推薦系統曝光。


23. 動態耦合模型

定義:

z(t)=[PS(t)ML(t)H0(t)].\mathbf z(t) = \begin{bmatrix} P_S(t)\\ M_L(t)\\ H_0(t) \end{bmatrix}.

其動力學可以近似寫為:

dzdt=b(t)+A(t)z(t)d(t),\frac{d\mathbf z}{dt} = \mathbf b(t) + \mathbf A(t)\mathbf z(t) - \mathbf d(t),

其中:

b(t)\mathbf b(t)

表示外部注入,例如新增網站、媒體報導、模型更新;

A(t)\mathbf A(t)

為通道耦合矩陣;

d(t)\mathbf d(t)

表示衰減、去索引、遺忘與平台變動。

例如:

A=[aSSaSMaSHaMSaMMaMHaHSaHMaHH].\mathbf A = \begin{bmatrix} a_{SS} & a_{SM} & a_{SH}\\ a_{MS} & a_{MM} & a_{MH}\\ a_{HS} & a_{HM} & a_{HH} \end{bmatrix}.

其中:

aHSa_{HS}

表示搜尋顯著度對未來人類認知的轉換強度;

aMSa_{MS}

表示搜尋資訊對機器辨識的支援;

aHMa_{HM}

則可表示機器回答對人類認知的傳播效應。

如果:

aMSaHS,a_{MS}\gg a_{HS},

則:

MLM_L

可能比:

H0H_0

更快上升。

這提供 machine-first regime 的動態解釋。


24. 相位差與時間延遲

定義首次跨過辨識閾值的時間:

tM=inf{t:ML(t)τM},t_M = \inf \{ t:M_L(t)\ge\tau_M \}, tH=inf{t:H0(t)τH}.t_H = \inf \{ t:H_0(t)\ge\tau_H \}.

定義機器—人類相位差:

LMH=tHtM.L_{MH} = t_H-t_M.

若:

LMH>0,L_{MH}>0,

則機器先跨過辨識閾值;

若:

LMH<0,L_{MH}<0,

則人類社會先形成辨識。

因此 machine-first 不只是靜態:

ML>H0,M_L>H_0,

也可以是時間意義上的:

tM<tH.\boxed{ t_M<t_H. }

25. 潛在認識與實際觸發

一個重要區別是:

potential recognizability\text{potential recognizability}

與:

actual query activation.\text{actual query activation}.

假設:

ML(E)0,M_L(E)\gg0,

但從未有人向系統詢問 EE

則機器具有重建能力,但這個能力從未被觸發。

因此可以定義查詢觸發率:

QA(E,t)=P(system receives a query requiring E).Q_A(E,t) = P \left( \text{system receives a query requiring }E \right).

實際機器曝光可近似為:

XM=MLQA.X_M = M_LQ_A.

所以:

ML0M_L\gg0

並不自動造成任何現實社會後果。

這是「潛在認識」概念最重要的限制。


26. 機器可辨識度不等於機器權威判定

即使:

ML1,M_L\approx1,

AI 也可能只正確回答:

這個實體是誰、有哪些公開作品、與哪些組織相關。

這不能推出:

A1.A\approx1.

亦即:

recognizableauthoritative.\boxed{ \text{recognizable} \neq \text{authoritative}. }

Paper 01 中的權威度 AA 仍然是獨立維度。

同樣:

ML0M_L\gg0

也不能推出:

ρ>0.\rho>0.

機器能辨識一個實體,並不代表機器或人類對它持正面評價。


27. 可操作測量協議

27.1 搜尋顯著度

建立查詢集合:

Q=QexactQaliasQtopicQrel.\mathcal Q = \mathcal Q_{\mathrm{exact}} \cup \mathcal Q_{\mathrm{alias}} \cup \mathcal Q_{\mathrm{topic}} \cup \mathcal Q_{\mathrm{rel}}.

對每個平台重複測量:

  • 是否召回;
  • 最佳排名;
  • 首屏曝光;
  • snippet attribution;
  • 生成式回答是否提及;
  • 是否引用來源。

得到:

PS.P_S.

27.2 人類知名度

對分層人群:

U1,,Uk\mathcal U_1,\ldots,\mathcal U_k

進行:

  1. unaided recognition;
  2. aided recognition;
  3. identity discrimination;
  4. attribute recall。

核心值使用:

H0.H_0.

27.3 機器可辨識度

對多個模型/系統:

A1,,Am\mathcal A_1,\ldots,\mathcal A_m

分別測:

MP,M_P, MR,M_R, MA.M_A.

每次要求:

  • 身份判斷;
  • alias linking;
  • organization relation;
  • 至少兩項可驗證屬性;
  • evidence provenance。

並使用:

Accuracy,\text{Accuracy}, F1,\text{F1}, Brier Score,\text{Brier Score}, ECE.\text{ECE}.

28. PPSS-MHR Benchmark

本文建議建立:

PPSS Machine–Human Recognition Benchmark(PPSS-MHR)

每個實體包含:

Ei(Σi,Di,Ui,ti).E_i \rightarrow ( \Sigma_i, \mathcal D_i, \mathcal U_i, t_i ).

應特別抽樣:

  1. 高知名實體;
  2. 低知名但搜尋資料多的實體;
  3. 新公司;
  4. 新研究者;
  5. 地方型名人;
  6. 高歧義名稱;
  7. 長尾作品;
  8. 新興品牌;
  9. 跨語言實體;
  10. 網路資料薄但人類圈內知名的實體。

核心測量為:

(PS,MP,MR,MA,H0,H+).(P_S,M_P,M_R,M_A,H_0,H_+).

29. 可檢驗假說

H1:Machine-first existence hypothesis

在具有大量可索引結構資料但低社會傳播的實體中:

P(ML>H0)P(M_L>H_0)

應顯著高於隨機背景實體。

H2:Retrieval amplification hypothesis

對長尾與 emerging entities:

MRMP>0M_R-M_P>0

應顯著大於 head entities。

H3:Agentic reconstruction hypothesis

對需要跨頁關係閉合的實體:

MAMR>0M_A-M_R>0

應在部分 benchmark 類型中成立。

H4:Search–human lag hypothesis

搜尋顯著度上升後:

H0H_0

若上升,通常存在非零延遲:

LSH>0.L_{SH}>0.

H5:Ambiguity suppression hypothesis

在控制 corpus size 後,符號歧義越高:

MLM_L

越可能低於:

PS.P_S.

30. 可能反例與失敗模式

30.1 機器幻覺造成假高辨識

如果 AI 高信心輸出錯誤身份:

confidence0\text{confidence}\gg0

但:

accuracy=0,\text{accuracy}=0,

不能算:

ML0.M_L\gg0.

30.2 搜尋個人化

不同地區、語言、帳戶與時間會造成:

PS(1)PS(2).P_S^{(1)} \neq P_S^{(2)}.

因此搜尋顯著度必須記錄觀察條件。


30.3 人群抽樣偏差

若:

U\mathcal U

只取某專業社群,不能直接推論一般社會知名度。


30.4 AI 平台異質性

不同系統具有不同:

  • 索引;
  • knowledge base;
  • 模型參數;
  • 搜尋工具;
  • context window;
  • browsing policy。

因此不存在單一絕對:

ML(E).M_L(E).

只能寫:

ML(E;A,T,D,B,t).M_L(E;\mathcal A,\mathcal T,\mathcal D,B,t).

31. 與既有文獻的關係

本文不是重新發明 entity linking。

Entity Linking 文獻主要研究:

mentionentity.\text{mention} \rightarrow \text{entity}.

本文關心的則是:

machine entity resolutionsearch prominencehuman social recognition.\boxed{ \text{machine entity resolution} \neq \text{search prominence} \neq \text{human social recognition}. }

Long-tail EL、DynamicER、RAED 與 contextual augmentation 說明機器辨識對外部知識、時間與語境高度敏感;搜尋 click-bias 研究說明排名與曝光影響人類注意;GEO 則進一步把生成式答案內 visibility 變成新的資訊存取問題。

本文的貢獻是把這些分散結果放入同一公共顯著性狀態空間。


32. 與 Paper 01、Paper 02 的統一

Paper 01:

xEΩ=(I,S,V,D,R,M,H,A,ρ).\mathbf{x}_E^{\Omega} = (I,S,V,D,R,M,H,A,\rho).

Paper 02:

R=Φ(ΣE,wΩ,TEΩ,D,K).R = \Phi \left( \Sigma_E, \mathbf w^{\Omega}, \mathfrak T_E^{\Omega}, \mathcal D, \mathbf K \right).

Paper 03 現在把:

MM

展開成:

(MP,MR,MA,ML),\left( M_P, M_R, M_A, M_L \right),

並把 SSVV 聚合成查詢依賴搜尋顯著度:

PS=Γ(S,V,Q,p,t).P_S = \Gamma(S,V,\mathcal Q,p,t).

因此三篇形成:

symbol/evidence layerentity resolution layerpublic recognition channels.\boxed{ \text{symbol/evidence layer} \rightarrow \text{entity resolution layer} \rightarrow \text{public recognition channels}. }

33. 理論邊界

本文不主張:

  1. AI 一定會比人類先知道所有新實體;
  2. 搜尋資料多就必然高 MLM_L
  3. MLM_L 等於高社會重要性;
  4. 被 crawler 抓取等於模型訓練過;
  5. 被 AI 辨識等於被人類社會注意;
  6. 所有 generative engines 使用相同索引與排序;
  7. machine-first regime 必然轉化為 fame。

本文只主張三通道在概念與機制上不可等同,且存在合理可構造與可觀察的解耦狀態。


34. 結論

本文正式區分:

PS=Search Prominence,\boxed{ P_S = \text{Search Prominence}, } ML=Latent Machine Recognizability,\boxed{ M_L = \text{Latent Machine Recognizability}, } H0=Unaided Human Recognition.\boxed{ H_0 = \text{Unaided Human Recognition}. }

並提出三種差值:

ΔMH=MLH0,\Delta_{MH}=M_L-H_0, ΔSH=PSH0,\Delta_{SH}=P_S-H_0, ΔSM=PSML.\Delta_{SM}=P_S-M_L.

本文的核心結論為:

Searchable⇏socially known,\boxed{ \text{Searchable} \not\Rightarrow \text{socially known}, } machine reconstructable⇏socially known,\boxed{ \text{machine reconstructable} \not\Rightarrow \text{socially known}, }

以及:

search prominent⇏machine unambiguous.\boxed{ \text{search prominent} \not\Rightarrow \text{machine unambiguous}. }

數位公共存在因此出現一種具有時代特徵、但並非必然的新狀態:

MLH0.\boxed{ M_L\gg H_0. }

一個實體可能已在資訊空間中形成足夠完整的公開證據,使機器在受到詢問時可以重建其身份、品牌、作品與關係;但如果沒有足夠的人類發現、傳播與記憶,該實體仍然可以在社會認知上保持低顯著。

這不是「AI 已經偷偷認識所有人」的命題。

更精確的說法是:

machine-accessible public identity can precede broad human recognition.\boxed{ \text{machine-accessible public identity can precede broad human recognition}. }

下一篇將進一步處理這些量為什麼會因觀察者、領域、查詢與先驗不同,而形成完全不同的「看起來有多有名」判斷。


參考文獻

[1] Joachims, T., Granka, L., Pan, B., Hembrooke, H., & Gay, G. (2005). Accurately Interpreting Clickthrough Data as Implicit Feedback. Proceedings of SIGIR 2005, 154–161.

[2] Craswell, N., Zoeter, O., Taylor, M., & Ramsey, B. (2008). An Experimental Comparison of Click Position-Bias Models. Proceedings of WSDM 2008, 87–94. DOI: 10.1145/1341531.1341545.

[3] Ilievski, F., Vossen, P., & Schlobach, S. (2018). Systematic Study of Long Tail Phenomena in Entity Linking. Proceedings of COLING 2018, 664–674.

[4] Hoveyda, M., de Vries, A., Hasibi, F., & de Rijke, M. (2024). Real World Conversational Entity Linking Requires More Than Zero-Shots. Findings of ACL 2024, 13938–13946. DOI: 10.18653/v1/2024.findings-acl.829.

[5] Kim, J., Ko, D., & Kim, G. (2024). DynamicER: Resolving Emerging Mentions to Dynamic Entities for RAG. Proceedings of EMNLP 2024, 13752–13770. DOI: 10.18653/v1/2024.emnlp-main.762.

[6] Aggarwal, P., Murahari, V., Rajpurohit, T., Kalyan, A., Narasimhan, K., & Deshpande, A. (2024). GEO: Generative Engine Optimization. Proceedings of the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining, 5–16. DOI: 10.1145/3637528.3671900.

[7] Vollmers, D., Zahera, H., Moussallem, D., & Ngonga Ngomo, A.-C. (2025). Contextual Augmentation for Entity Linking using Large Language Models. Proceedings of COLING 2025, 8535–8545.

[8] Wu, J., Yin, W., Jiang, Y., Wang, Z., Xi, Z., Fang, R., Zhang, L., He, Y., Zhou, D., Xie, P., & Huang, F. (2025). WebWalker: Benchmarking LLMs in Web Traversal. Proceedings of ACL 2025, 10290–10305. DOI: 10.18653/v1/2025.acl-long.508.

[9] Deshmukh, A., Umadi, A., Srinivas, D., & Pacheco, M. L. (2025). All Entities are Not Created Equal: Examining the Long Tail for Ultra-Fine Entity Typing. Proceedings of *SEM 2025, 189–201. DOI: 10.18653/v1/2025.starsem-1.15.

[10] Ghonim, K., Huguet Cabot, P.-L., Orlando, R., & Navigli, R. (2025). RAED: Retrieval-Augmented Entity Description Generation for Emerging Entity Linking and Disambiguation. Proceedings of EMNLP 2025, 34439–34452. DOI: 10.18653/v1/2025.emnlp-main.1746.

[11] Li, Y., Galimov, A., Ganapaneni, M. D., Thejaswi, P., Meng, D., Kumar, P., & Potdar, S. (2025). Leveraging the Power of Large Language Models in Entity Linking via Adaptive Routing and Targeted Reasoning. EMNLP 2025 Industry Track, 871–882. DOI: 10.18653/v1/2025.emnlp-industry.59.

[12] Sawada, Y., Fujita, T., Sakai, Y., & Watanabe, T. (2026). entity-linkings: A Unified Library for Entity Linking. Proceedings of EACL 2026, 591–601. DOI: 10.18653/v1/2026.eacl-demo.42.


系列位置

Series I:公共顯著性場與實體可辨識理論

  1. Paper 01:有名—無名的多維狀態空間
  2. Paper 02:多符號非均勻權重與高階語義耦合
  3. Paper 03:搜尋顯著度、人類知名度與機器可辨識度的解耦
  4. Paper 04:觀察者依賴的感知顯著度理論
  5. Paper 05:資訊質量累積與顯著性壓力猜想
  6. Paper 06:第三方生成相變與自我繁殖公共圖