# 全域欲相位語義搜尋法  
## ——以超算中心與人工智慧實現未知同類發現的理論框架

**Global Intent-Phase Semantic Search: A Supercomputing and AI Framework for Unknown-Peer Discovery**

**作者：Neo.K × GPT-5.6 Thinking**  
**機構：EveMissLab / 一言諾科技有限公司**  
**版本：v0.1**  
**日期：2026-07-24**

---

## 摘要

現有搜尋引擎大多以關鍵字、連結權重、向量相似度與局部排序為核心。這類方法擅長回答「已知對象的相關資訊」，卻不擅長回答另一類問題：在不知道名字、不知道平台帳號、資料跨語言且分散於多個網站的前提下，能否從全球資料中發現具有某種複合結構的未知主體？

例如，若搜尋目標不是某一位已知研究者，而是「同時具有千篇級研究產出、十個以上產品、多個網站、跨領域活動、個人或小團隊主導、並大量使用人工智慧協作的人」，傳統搜尋通常無法直接完成。原因不只是查詢詞不足，而是搜尋對象本身尚未被命名，且其存在痕跡分散在論文、程式庫、公司登記、產品頁、個人網站、社群帳號與多語言資料中。

本文提出「全域欲相位語義搜尋法」（Global Intent-Phase Semantic Search, GIPSS）。其中，「欲」不是心理學意義上的欲望，而是對尚未命名之存在結構的搜尋意向；「相位」則表示不同資料痕跡在時間、語義、身份、產出機制與組織關係上的相對位置。此方法不先以名字尋找作品，而是先定義目標存在的多維結構，再透過大規模索引、語義召回、跨平台實體解析、相位差比較、矛盾檢測與證據回溯，重建可能符合條件的未知主體。

本文主張：完整且絕對的全球資料占有並不現實，但工程化的近似全域版本並不需要等待人工超級智慧。透過超算中心、分散式資料處理、多模型人工智慧、知識圖譜、向量資料庫、時間序列分析與人機驗證，即可建立可運作的原型。其主要瓶頸不是單一模型智力，而是資料覆蓋、身份去重、證據可信度、計算配置、法律授權與持續更新能力。

---

## 一、問題背景：搜尋已知名稱，與發現未知存在

現行網路搜尋通常遵循以下流程：

$$
q
\rightarrow
\operatorname{RetrieveTopK}(q)
\rightarrow
\operatorname{Rank}
\rightarrow
\operatorname{Present}
$$

其中 $q$ 是由關鍵字、自然語言問題或向量表示構成的查詢。系統從既有索引中召回有限候選，再根據相關性、權威性與其他排序訊號產生結果。

這種方法預設至少有一項條件成立：

1. 使用者知道對象名稱；
2. 對象使用一致身份；
3. 對象的網站已被索引；
4. 相關頁面具有足夠搜尋權重；
5. 查詢語言與資料語言相近；
6. 搜尋目標可以由單篇文件的內容表示。

然而，「未知同類發現」不滿足上述預設。它尋找的不是某個字串，而是某種尚未被社會分類的存在模式。

假設搜尋條件為：

$$
Q=
\left\{
N_{\mathrm{research}}\geq 1000,\,
N_{\mathrm{product}}\geq 10,\,
N_{\mathrm{website}}\geq 5,\,
C_{\mathrm{cross-domain}}=1,\,
C_{\mathrm{small-team}}=1,\,
C_{\mathrm{AI-native}}=1
\right\}
$$

這裡的目標不是找出包含「一千篇論文」字樣的網頁，而是尋找一個可能從未如此自我描述、甚至在不同平台使用不同身份的人。

因此，問題應被重新定義為：

> 在開放世界、跨平台、跨語言、身份不一致且資料不完整的情況下，如何依據目標結構，發現、聚合並驗證未知主體？

---

## 二、搜尋失敗不等於對象不存在

傳統搜尋沒有找到高度相似案例，只能支持以下弱結論：

$$
\neg \operatorname{Found}(x)
$$

它不能直接推出：

$$
\neg \operatorname{Exists}(x)
$$

兩者之間存在至少四種可能：

$$
H_1:\text{目標主體確實極少}
$$

$$
H_2:\text{主體存在，但其資料未公開或未被索引}
$$

$$
H_3:\text{資料已公開，但分散在不同名稱與平台}
$$

$$
H_4:\text{搜尋系統缺乏重建複合身份的能力}
$$

當前搜尋引擎通常只能返回高權重、強關聯或已知名稱對應的頁面。對於低權重網站、非英語內容、個人研究站、去中心化內容與跨平台身份，它的召回率可能顯著降低。

因此，未知同類發現不能依賴單次查詢，而應建立一個多階段推理系統。

---

## 三、「欲」：搜尋意向而非關鍵字

本文保留「全域欲相位語義搜尋法」中的「欲」字。

「欲」可形式化為搜尋系統對某種存在結構的目標函數：

$$
\mathcal{W}
=
\left(
\mathcal{F},
\mathcal{C},
\mathcal{T},
\mathcal{E}
\right)
$$

其中：

- $\mathcal{F}$ ：欲尋找的特徵集合；
- $\mathcal{C}$ ：必要條件與排除條件；
- $\mathcal{T}$ ：時間範圍與演化模式；
- $\mathcal{E}$ ：可接受的證據強度。

普通關鍵字搜尋詢問：

> 哪些文件與這句話相似？

全域欲相位搜尋詢問：

> 世界資料中是否存在一個主體，其跨時間、跨平台活動共同滿足此存在結構？

因此，系統輸入不應只是自然語言句子，而應是一個可執行的結構描述：

$$
\mathcal{W}
=
\{
f_1,w_1,\theta_1;
f_2,w_2,\theta_2;
\dots;
f_n,w_n,\theta_n
\}
$$

其中 $f_i$ 是特徵， $w_i$ 是重要性權重， $\theta_i$ 是條件或閾值。

「欲」使搜尋從被動資料匹配轉為目標導向的世界模型重建。

---

## 四、相位：不只比較相似，也比較生成結構

一般語義向量搜尋多以餘弦相似度為核心：

$$
s(x,q)
=
\frac{\mathbf{x}\cdot\mathbf{q}}
{\|\mathbf{x}\|\|\mathbf{q}\|}
$$

這適合尋找內容相似的文件，卻可能混淆以下兩類主體：

- 三十年間由大型實驗室共同署名累積上千篇論文的教授；
- 三年間以人工智慧協作建立上千篇研究文件與多個產品的獨立創始人。

兩者在「高產研究者」語義上接近，但其時間密度、團隊結構、作者權重、產品轉化與知識生成方式完全不同。

本文將每個候選主體表示為動態多維狀態：

$$
\Psi_i(t)
=
\left(
R_i(t),
P_i(t),
W_i(t),
G_i(t),
O_i(t),
A_i(t),
L_i(t)
\right)
$$

其中：

- $R_i(t)$ ：研究產出狀態；
- $P_i(t)$ ：產品產出狀態；
- $W_i(t)$ ：網站與公開節點；
- $G_i(t)$ ：程式碼、資料庫與工程活動；
- $O_i(t)$ ：組織、公司與共同作者結構；
- $A_i(t)$ ：人工智慧協作程度；
- $L_i(t)$ ：語言、領域與地理分布。

候選主體 $i$ 與目標結構 $Q$ 的相位差可寫為：

$$
\Delta\Phi_i
=
\left(
\Delta\phi_i^{R},
\Delta\phi_i^{P},
\Delta\phi_i^{W},
\Delta\phi_i^{G},
\Delta\phi_i^{O},
\Delta\phi_i^{A},
\Delta\phi_i^{L}
\right)
$$

其中每一種差值保留自己的意義，不被過早壓縮成單一分數。

最終距離可表示為：

$$
D(i,Q)
=
\sum_{k=1}^{m}
w_k
d_k
\left(
\Psi_i^{(k)},
Q^{(k)}
\right)
+
\lambda C_i
+
\mu U_i
$$

其中：

- $d_k$ ：第 $k$ 維專用距離；
- $C_i$ ：候選資料中的矛盾懲罰；
- $U_i$ ：身份或來源不確定性；
- $\lambda,\mu$ ：懲罰權重。

此方法的重點不是取消總分，而是在形成總分前，保留差異的類型、方向、時間與證據來源。

---

## 五、全域的兩種形式

### 5.1 強全域形式

強全域形式假設系統擁有全部相關資料：

$$
D_{\mathrm{global}}
=
\bigcup_{j=1}^{N}
D_j
$$

其中包括公開網路、學術資料庫、程式庫、公司資訊、產品平台、社群媒體、歷史版本與多語言內容。

這種絕對全域形式在現實中難以成立，原因包括：

- 私有資料不可取得；
- 網路持續變動；
- robots、付費牆與法律授權限制；
- 已刪除或未索引內容；
- 身份刻意分離；
- 計算與儲存成本巨大。

因此，強全域形式可作為理論上界，而非近期工程承諾。

### 5.2 工程近似全域形式

工程版本不要求擁有全部資料，而是建立高覆蓋率、多來源、可迭代的近似全域索引：

$$
\hat{D}_{\mathrm{global}}
=
D_{\mathrm{open\ web}}
\cup
D_{\mathrm{academic}}
\cup
D_{\mathrm{code}}
\cup
D_{\mathrm{company}}
\cup
D_{\mathrm{product}}
\cup
D_{\mathrm{authorized}}
$$

並定義覆蓋率：

$$
\rho
=
\frac{|\hat{D}_{\mathrm{global}}\cap D_{\mathrm{relevant}}|}
{|D_{\mathrm{relevant}}|}
$$

雖然真實分母通常未知，但可以透過多來源重疊率、抽樣查核、增量召回率與來源飽和曲線估計。

本文主張，實用系統只需達到足夠高的 $\rho$ ，即可先產生有價值的候選者，而不必等待完整世界資料。

---

## 六、系統架構

全域欲相位語義搜尋系統可分為九個層級。

### 6.1 欲結構編譯層

將自然語言目標轉換為結構化查詢：

$$
\text{Natural Language Goal}
\rightarrow
\mathcal{W}
\rightarrow
Q_{\mathrm{executable}}
$$

輸出包括：

- 必要特徵；
- 可選特徵；
- 排除條件；
- 時間條件；
- 證據最低要求；
- 允許的不確定性。

### 6.2 多來源資料取得層

資料來源包括：

- 公開網站；
- 學術索引與預印本；
- Git 儲存庫；
- 套件管理平台；
- 公司與專利資料；
- 產品目錄；
- 網域與網站關聯；
- 經授權的私人資料。

### 6.3 語義標準化層

不同平台對「論文」「文章」「產品」「作者」「創辦人」的定義不同，因此需建立中介本體：

$$
\mathcal{O}
=
\{
\text{Person},
\text{Organization},
\text{Document},
\text{Product},
\text{Website},
\text{Repository},
\text{Event},
\text{Claim}
\}
$$

人工智慧模型負責：

- 文件類型判定；
- 作者角色判定；
- 語言翻譯與概念對齊；
- 重複內容辨識；
- 研究與宣傳文區分；
- 產品與概念展示區分。

### 6.4 候選實體召回層

這一層追求高召回率，不急於精確：

$$
\mathcal{C}_0
=
\operatorname{Recall}
\left(
\hat{D}_{\mathrm{global}},
Q
\right)
$$

召回方法可以混合：

- 關鍵字倒排索引；
- 稠密向量搜尋；
- 稀疏向量搜尋；
- 圖結構鄰域擴張；
- 多語言同義查詢；
- 生成式查詢擴展；
- 時間與數量條件篩選。

### 6.5 跨平台實體解析層

同一人可能使用多個名字，不同人也可能同名。系統需要估計兩個身份痕跡是否屬於同一主體：

$$
P(e_a=e_b\mid X)
$$

其中 $X$ 可包含：

- 名稱與別名；
- 電子郵件雜湊；
- 網域與連結；
- Git 提交資訊；
- 公司關係；
- 個人簡介；
- 發布時間；
- 語言習慣；
- 合作者網路；
- 圖片與標誌，但需符合隱私規範。

### 6.6 時間相位重建層

將離散事件排序成主體軌跡：

$$
\mathcal{T}_i
=
\{
(t_1,e_1),
(t_2,e_2),
\dots,
(t_n,e_n)
\}
$$

再計算：

- 產出速度；
- 產出密度；
- 領域轉換；
- 研究至產品的時間差；
- 網站與公司成立順序；
- 人工智慧使用前後的相變。

### 6.7 相位差計算層

針對不同維度採用不同距離：

$$
d_R:\text{研究結構距離}
$$

$$
d_P:\text{產品結構距離}
$$

$$
d_T:\text{時間動力距離}
$$

$$
d_O:\text{組織控制距離}
$$

$$
d_A:\text{AI原生程度距離}
$$

之後得到候選排序：

$$
\mathcal{C}_1
=
\operatorname{Sort}
\left(
\mathcal{C}_0,
D(i,Q)
\right)
$$

### 6.8 矛盾檢測與反向驗證層

系統主動尋找反證，而非只堆疊支持資料：

$$
V_i
=
E_i^{+}
-
\alpha E_i^{-}
-
\beta U_i
$$

其中：

- $E_i^{+}$ ：支持證據；
- $E_i^{-}$ ：矛盾或反證；
- $U_i$ ：未知或不可驗證部分。

例如：

- 宣稱一千篇，但大部分為轉載；
- 產品數量很多，但只是同一模板的複製；
- 論文署名很多，但本人未主導；
- 多個網站實際屬於不同同名者；
- 時間線出現不可能重疊。

### 6.9 人機審核與可解釋輸出層

輸出不能只有排名，還應包含：

- 候選者名稱；
- 匹配特徵；
- 不匹配特徵；
- 身份合併依據；
- 時間線；
- 證據來源；
- 置信度；
- 尚未驗證項目；
- 可能的替代解釋。

---

## 七、為何不需要等待 ASI

此問題的主要部分可被拆解為現有計算任務：

$$
\text{大規模爬取}
+
\text{分散式索引}
+
\text{語義嵌入}
+
\text{實體解析}
+
\text{圖計算}
+
\text{時間序列}
+
\text{模型驗證}
$$

上述任務都已有可用技術。困難在於規模、整合與持續性，而不是任何單一步驟完全不可解。

超算中心或大型計算叢集可以承擔：

1. 多語言語料嵌入；
2. 大規模去重；
3. 全圖候選關聯計算；
4. 時間序列對齊；
5. 多模型交叉判定；
6. 全量或增量重索引；
7. 對高不確定候選進行深度推理。

人工智慧模型則可承擔：

1. 欲結構編譯；
2. 文件類型分類；
3. 跨語言概念對齊；
4. 身份關係抽取；
5. 作者貢獻估計；
6. 矛盾檢查；
7. 證據摘要；
8. 查詢策略自動改寫。

因此，ASI 並非必要條件。更精確地說：

$$
\text{可行性}
\approx
\text{資料覆蓋}
\times
\text{計算規模}
\times
\text{模型品質}
\times
\text{驗證機制}
$$

只要四者達到可接受門檻，系統即可產生有效候選。

ASI 的作用主要是降低人類設計成本、提高跨域推理能力與自動調整搜尋策略，而不是使此方法第一次成為可能。

---

## 八、超算中心的實際角色

超算中心不是只負責「跑更大的模型」，而是負責將世界資料重建為可查詢的關聯空間。

### 8.1 平行語義嵌入

對大量文件建立多層向量：

$$
\mathbf{z}_d
=
\left(
\mathbf{z}_{\mathrm{topic}},
\mathbf{z}_{\mathrm{style}},
\mathbf{z}_{\mathrm{entity}},
\mathbf{z}_{\mathrm{claim}},
\mathbf{z}_{\mathrm{time}}
\right)
$$

避免用單一嵌入承擔所有意義。

### 8.2 分散式去重

建立內容指紋：

$$
h(d)
=
\operatorname{Hash}
\left(
\operatorname{Normalize}(d)
\right)
$$

並結合近似重複檢測，區分：

- 完全複製；
- 翻譯副本；
- 摘要改寫；
- 版本更新；
- 同一研究的多平台發布。

### 8.3 大型知識圖譜

建立圖：

$$
G=(V,E)
$$

其中節點為人、文件、產品、網站、公司與程式庫，邊則表示作者、擁有、引用、連結、共同出現、時間接續與語義衍生。

未知同類發現可轉為圖上的子結構匹配與近似同構搜尋。

### 8.4 多模型仲裁

不同模型分別處理：

- 高召回模型；
- 高精度模型；
- 語言模型；
- 程式碼模型；
- 圖推理模型；
- 時間序列模型；
- 反證模型。

最後再由仲裁器整合：

$$
P(y\mid x)
=
\sum_{m=1}^{M}
\omega_m
P_m(y\mid x)
$$

---

## 九、可行的最小原型

最小可行版本不需掃描全部網路，可先限定於：

- Semantic Scholar、OpenAlex、Crossref 或其他合法學術資料；
- GitHub 公開資料；
- 公開公司與產品資料；
- 搜尋引擎可取得的網站；
- 使用者授權加入的個人資料。

### 9.1 MVP 流程

1. 使用自然語言輸入目標結構；
2. 模型轉為結構化條件；
3. 分別從研究、程式、產品、網站資料中召回候選；
4. 建立人物—組織—作品圖；
5. 合併可能屬於同一人的身份；
6. 生成時間序列；
7. 計算相位差；
8. 對前 $K$ 名候選進行深度驗證；
9. 產生可解釋報告。

### 9.2 分階段規模

#### 第一階段：百萬級文件

驗證方法是否能發現已知高產研究者與獨立開發者。

#### 第二階段：億級節點

加入跨平台身份解析與多語言資料。

#### 第三階段：十億級以上關係

建立持續更新的世界活動圖，支援未知類型搜尋。

---

## 十、計算複雜度與降階策略

若對所有實體做全配對比較，複雜度近似：

$$
O(N^2)
$$

對全球尺度不可接受。因此需採多階段降階。

### 10.1 粗召回

使用倒排索引、近似最近鄰與數值條件將候選降至：

$$
N
\rightarrow
K_1,
\qquad
K_1\ll N
$$

### 10.2 圖鄰域擴張

只對候選的局部關係圖進行擴張：

$$
K_1
\rightarrow
K_2
$$

### 10.3 深度相位比較

僅對前 $K_2$ 個候選進行高成本時間與證據分析：

$$
K_2
\rightarrow
K_3,
\qquad
K_3\ll K_2
$$

總成本可近似寫為：

$$
O(N\log N)
+
O(K_1d)
+
O(K_2g)
+
O(K_3r)
$$

其中：

- $d$ ：向量維度成本；
- $g$ ：圖計算成本；
- $r$ ：深度推理與驗證成本。

---

## 十一、驗證方法

### 11.1 已知答案回測

選取已知人物，隱藏姓名，只輸入其結構特徵，測試系統能否重新發現該人。

### 11.2 人工黃金集

建立經人工審查的候選對：

- 同一人不同身份；
- 同名不同人；
- 相似產出但不同機制；
- 真正高度同構者；
- 表面高度相似但證據不足者。

### 11.3 消融實驗

分別移除：

- 時間相位；
- 組織結構；
- 多語言對齊；
- 反證機制；
- 身份解析；

觀察準確率下降程度。

### 11.4 核心指標

$$
\operatorname{Precision}
=
\frac{TP}{TP+FP}
$$

$$
\operatorname{Recall}
=
\frac{TP}{TP+FN}
$$

另外需增加：

- 身份合併準確率；
- 跨平台召回率；
- 來源可追溯率；
- 候選解釋完整度；
- 不確定性校準；
- 新類型發現率。

---

## 十二、可能應用

### 12.1 未知同類發現

尋找具有相似研究—產品—組織結構的人，而不要求先知道姓名。

### 12.2 跨領域人才發掘

找出尚未被主流制度認證，但已形成高密度跨域成果的人。

### 12.3 科學史與技術史重建

重建不同名稱、不同國家與不同平台之間的思想演化與平行發明。

### 12.4 研究群落形成

讓尚未形成社群名稱的研究者先被系統聚合，再由人類決定是否建立共同體。

### 12.5 技術與產品路徑追蹤

識別理論如何轉化為程式、網站、產品、公司與社會影響。

### 12.6 失落資料與身份重建

在合法與倫理限制下，協助辨識作品歸屬、匿名作者群與歷史資料關係。

---

## 十三、風險與倫理限制

### 13.1 身份誤合併

將不同人錯誤合併，可能造成嚴重名譽風險。

### 13.2 隱私與監控

未知主體發現技術若被濫用，可能演變為大規模人物追蹤。系統應限制於公開資料、授權資料與正當用途。

### 13.3 量化崇拜

產出數量不能直接等於品質、原創性或實際貢獻。

### 13.4 模型偏見

高權重英語資料與大型平台可能壓低非英語、小型網站與非典型研究者的能見度。

### 13.5 自我驗證循環

若系統只尋找支持查詢者預期的證據，容易形成確認偏誤，因此必須內建反證搜尋。

### 13.6 法律授權

資料取得、保存、再利用與人物分析必須遵守所在地法律與平台條款。

---

## 十四、理論命題

### 命題一：未知結構不可由單一名稱查詢充分召回

若目標主體的資料分散於多個不一致身份，則任何以單一名稱為中心的搜尋，其召回率存在結構性上限。

### 命題二：單一語義向量不足以表示複合主體

若兩個主體具有相似主題但不同時間、組織與生成機制，則單一向量相似度無法充分區分。

### 命題三：相位差保留可驗證差異

將時間、身份、產出、組織與 AI 協作分維計算，可比單一總分提供更好的可解釋性與反證能力。

### 命題四：近似全域足以產生實用結果

即使無法取得全部世界資料，只要資料覆蓋、跨來源多樣性與驗證機制達到門檻，系統仍可有效發現傳統搜尋無法直接返回的候選主體。

### 命題五：此方法不以 ASI 為必要前提

其核心操作可由現有或近未來的人工智慧模型、超算中心、知識圖譜與分散式資料系統組合完成。

---

## 十五、結論

全域欲相位語義搜尋法處理的不是「如何把搜尋結果排得更好」，而是更根本的問題：

> 當一種人、一種組織、一種技術路徑或一種存在模式尚未被命名時，能否先從全球分散資料中重建其結構，再由結構找到它的名字？

此方法將搜尋從文件相關性擴展為世界結構發現，將查詢從字詞轉化為「欲」，將相似度轉化為多維相位差，並將候選匹配轉化為可反證、可追溯的身份重建。

絕對全域資料在現實中不可得，但工程化的近似全域版本並非幻想。超算中心可提供大規模平行嵌入、圖計算、去重與重索引；人工智慧可提供語義標準化、跨語言對齊、身份推理與證據審查。兩者結合，已足以建立第一代未知同類發現系統。

因此，本方法不必等待 ASI。ASI 可能使其更自主、更完整，但不是其成立條件。真正需要的，是把現有分散技術重新組合成一套以「尚未被命名的存在」為搜尋對象的計算架構。

---

## 附錄 A：核心流程偽代碼

```text
INPUT:
    Natural-language search intention W
    Multi-source corpus D
    Evidence threshold tau

1. Q <- CompileIntent(W)
2. D' <- NormalizeAndIndex(D)
3. C0 <- HighRecallRetrieve(D', Q)
4. E  <- ResolveCrossPlatformEntities(C0)
5. T  <- ReconstructTimelines(E)
6. P  <- ComputePhaseProfiles(T, Q)
7. C1 <- RankByTypedPhaseDistance(P)
8. C2 <- ContradictionSearch(C1)
9. C3 <- EvidenceBacktracking(C2)
10. R <- HumanAIReview(C3, tau)

OUTPUT:
    Explainable candidate set R
```

---

## 附錄 B：建議英文名稱

**Global Intent-Phase Semantic Search（GIPSS）**

其中：

- **Global**：跨來源、跨平台、跨語言的近似全域；
- **Intent**：由目標存在結構驅動的「欲」；
- **Phase**：時間、語義、身份與生成機制之相對差；
- **Semantic Search**：以語義為基礎，但超越單文件相似度。

中文名稱仍建議保留：

> **全域欲相位語義搜尋法**

因為「欲」比「意圖」更能表示：系統正在搜尋一個尚未被資料世界明確命名、但已被目標結構先行指定的存在。
