---
title: "多 AI 整理者：協作、競爭、異議與相互校正"
series: "網路資訊海動態秩序化"
series_id: "EML-IIODO"
document_id: "EML-IIODO-TH-08"
document_type: "公開理論文"
author: "Neo.K"
organization: "EveMissLab"
version: "0.1.0"
status: "公開初稿"
date: "2026-07-31"
language: "zh-TW"
license_note: "公開引用時請保留作者、文件編號、版本與來源。"
---

# 多 AI 整理者

## 協作、競爭、異議與相互校正

## 摘要

當網路資訊海的整理工作從單一網站、單一模型與單一分類器，擴展為大量領域觀測站、長期 Agent 與母子網站時，下一個問題不再只是「AI 能不能整理資訊」，而是「多個 AI 整理者如何共同維護同一個資訊世界」。多 AI 系統看似自然具有交叉檢查能力，但增加模型數量並不自動產生集體智慧。若不同 Agent 使用相同模型、共享相同訓練偏差、依賴相同搜尋來源，或在討論中迅速服從多數，系統可能形成錯誤高度相關、異議快速消失及信心反而上升的虛假共識。

本文將「AI 整理者」定義為：持續對來源、事件、分類、摘要、重要性、版本與歷史關係提出可追溯判斷的模型實例、Agent、工作流角色或自治觀測單位。它不必具有完整人格或主體性；本文處理的是其在資訊治理中的功能、責任與可校正性。多 AI 整理的目標也不是讓所有整理者最後說出同一句話，而是使系統同時取得更廣的候選覆蓋、更強的證據檢查、更低的單點偏差，以及能被保留和追蹤的有效異議。

本文提出「先獨立、後互看；先證據、後立場；先保留軌跡、再做聚合」三項基本原則。每一個整理者應先獨立產生事件判斷，保存其來源、理由、信心與模型版本，再進入批評、辯論、投票、仲裁或人工審核。系統不得只保存最後的共識答案，而應保存每個 Agent 的初始判斷、更新路徑、接受或拒絕他人意見的理由，以及最終聚合規則。由此，多 AI 的產出不再是一個不可拆解的合成文字，而是一組可回放的判斷軌跡。

本文進一步區分四種互動功能：協作負責分工與證據互補；競爭負責產生替代假說與防止單一路徑壟斷；異議負責保留尚未解決的衝突；相互校正則根據長期表現調整整理者在不同領域、任務與來源條件下的可靠度。共識、投票、信心加權、軌跡評分與最終仲裁都只是特定決策協定，不能被誤認為真理本身。不同任務需要不同協定：事實抽取可以依證據一致性聚合，重要性排序可以保留多套榜單，分類爭議可以維持並行視圖，高風險發布則應進入人工或專家審核。

本文提出「共享證據、分離判斷、可逆聚合」架構。母站維護共同來源、事件身分、判斷帳本、整理者可靠度與爭議狀態；各子站可以選擇不同 Agent 組合、分類方案、重要性函數與決策協定。聚合結果以新版本存在，不覆寫個別判斷；若新證據出現，系統可以重新計算過去的共識、每日三則與歷史敘事。

最終，可靠的多 AI 整理網路不以「有多少模型同意」作為唯一品質指標，而以證據獨立性、觀點多樣性、錯誤相關性、信心校準、異議保存、版本可逆與長期可問責性共同衡量。多 AI 的真正價值不是製造更大的聲量，而是建立一個能讓錯誤被其他路徑看見、讓少數正確意見不被提前抹除、並能隨歷史證據持續修訂的知識維護結構。

**關鍵詞：** 多 AI 整理者、多智能體協作、多智能體辯論、異議保存、虛假共識、錯誤相關性、信心校準、協作治理、領域觀測站、相互校正、判斷軌跡、網路資訊海

---

## 1. 問題轉移：從單一 AI 整理到整理者群體

前七篇已建立：新聞可被理解為領域知識狀態差分；資訊差分具有微觀、中觀與宏觀尺度；母站與子站可以形成領域觀測網路；每日資訊流可以累積成可查詢歷史；AI 能在混沌之上建立動態秩序；Scheduler、Loop 與 Graph 已使初步智能管理成為工程現實；分類本身則必須保持多視角與可逆。

當上述結構擴展後，單一整理者會遇到明顯限制：

1. 單一模型可能漏抓來源；
2. 單一提示可能形成固定盲點；
3. 單一分類方案可能壟斷可見性；
4. 單一供應商可能造成模型單一文化；
5. 單一判斷器難以同時處理搜尋、驗證、分類、排序與歷史修訂；
6. 單一 Agent 的長期錯誤可能在無人察覺時累積。

因此，系統自然會從：

$$
A\rightarrow y
$$

轉向：

$$
\{A_1,A_2,\dots,A_n\}
\rightarrow
\{y_1,y_2,\dots,y_n\}
\rightarrow
\mathcal{D}
$$

其中：

- $A_i$ ：第 $i$ 個 AI 整理者；
- $y_i$ ：其判斷、摘要、分類或排序；
- $\mathcal{D}$ ：討論、比較、聚合、異議或升級處理結果。

但這個轉換不能被簡化成：

$$
\text{更多 AI}
\Rightarrow
\text{更正確}
$$

真正成立的條件是：不同整理者必須帶來有效的證據增量、方法差異、錯誤去相關性或審查能力。否則，多 AI 只是重複執行同一個判斷函數。

---

## 2. 什麼是 AI 整理者

本文所稱的 AI 整理者，不限於一個獨立大型模型。它可以是：

- 不同模型供應商的模型；
- 同一模型的不同獨立實例；
- 配置不同提示、工具與來源的 Agent；
- 搜尋、抽取、分類、驗證、排序等專業角色；
- 某一子站長期運作的領域管理 Agent；
- 由 Graph Runtime 組成的一個複合整理單位；
- 人類專家與 AI 協同形成的混合整理者。

令第 $i$ 個整理者表示為：

$$
A_i=
(M_i,T_i,S_i,O_i,R_i,H_i,G_i)
$$

其中：

- $M_i$ ：模型與版本；
- $T_i$ ：工具、搜尋器與資料接口；
- $S_i$ ：可使用的來源集合；
- $O_i$ ：領域本體、分類方案與任務規則；
- $R_i$ ：角色與責任範圍；
- $H_i$ ：歷史記憶與過往判斷；
- $G_i$ ：目標、停止條件與治理限制。

因此，即使兩個 Agent 使用同一個基礎模型，只要其來源、角色、工具、記憶與分類方案不同，也可能形成一定程度的功能差異。但這種差異不能被直接假設為真正獨立；系統仍需量測其錯誤相關性與輸出同質性。

---

## 3. 多 AI 不等於集體智慧

多智能體辯論研究已顯示，讓多個模型提出答案、互相批評與重新作答，在部分推理與事實任務上可以改善結果。然而，後續研究也不斷指出：多 Agent 辯論並不穩定優於簡單多次採樣、投票或自洽性方法；其效果高度依賴初始多樣性、決策協定、模型能力、討論輪數、信心傳遞與任務類型。

這意味著多 AI 系統至少要區分三種「多」：

### 3.1 數量多

$$
N_A>1
$$

只是存在多個 Agent。

### 3.2 輸出多

$$
|\{y_1,\dots,y_n\}|>1
$$

表示它們產生了不同表面答案。

### 3.3 有效認知多樣性

$$
D_{eff}>0
$$

表示不同整理者帶來了新的證據、不同方法、不同錯誤模式或可驗證替代假說。

只有第三種多樣性，才可能形成可靠的相互校正。

可以概念化為：

$$
D_{eff}
=
D_{source}
\cdot
D_{model}
\cdot
D_{method}
\cdot
D_{ontology}
\cdot
(1-\rho_{error})
\cdot
(1-\sigma_{syc})
$$

其中：

- $D_{source}$ ：來源多樣性；
- $D_{model}$ ：模型與供應商多樣性；
- $D_{method}$ ：推理與工作方法多樣性；
- $D_{ontology}$ ：概念方案與觀測視角多樣性；
- $\rho_{error}$ ：錯誤相關性；
- $\sigma_{syc}$ ：迎合、服從與從眾傾向。

若錯誤高度相關或異議會在討論中快速消失，即使 $N_A$ 很大， $D_{eff}$ 仍可能接近零。

---

## 4. 四種互動功能：協作、競爭、異議與校正

多 AI 整理系統不應只使用「協作」一個詞概括所有互動。不同功能需要不同制度。

### 4.1 協作

協作的目標是分工、互補與共享中間結果，例如：

$$
A_{search}
\rightarrow
A_{extract}
\rightarrow
A_{verify}
\rightarrow
A_{classify}
\rightarrow
A_{publish}
$$

協作適合可拆解、角色邊界清楚的工作。

### 4.2 競爭

競爭的目標是要求不同整理者獨立提出替代答案、分類或排序，再由外部規則比較：

$$
\{A_1,A_2,A_3\}
\xrightarrow{independent}
\{y_1,y_2,y_3\}
$$

競爭不是敵對，而是防止單一路徑在尚未被檢查前成為默認答案。

### 4.3 異議

異議表示目前存在無法被充分消解的判斷差異：

$$
y_i\neq y_j
\quad\land\quad
E_i,E_j\text{ 均有一定支持}
$$

可靠系統應允許：

$$
\text{未解決}
$$

成為合法狀態，而不是強迫每輪都輸出單一結論。

### 4.4 相互校正

校正不是一次討論後互相說服，而是根據長期結果修正可靠度、權重與任務分派：

$$
r_i(t+1)
=
\Phi
\left(
 r_i(t),
 y_i,
 y^{*},
 d,
 q,
 c
\right)
$$

其中：

- $r_i(t)$ ：整理者在時間 $t$ 的可靠度；
- $y^{*}$ ：後來取得的高可信結果；
- $d$ ：領域；
- $q$ ：任務類型；
- $c$ ：來源與情境條件。

相互校正因此是長期制度，而不只是即時辯論技巧。

---

## 5. 第一原則：先獨立，後互看

若所有整理者從一開始就看見第一個 Agent 的答案，後續輸出容易變成錨定、修飾與語氣差異，而不是獨立判斷。

因此，第一階段應隔離產生：

$$
y_i^{(0)}
=
A_i(x,E_i)
$$

其中 $y_i^{(0)}$ 是第 $i$ 個整理者在未看見其他答案前的初始判斷。

只有在保存初始狀態後，才進入互看：

$$
y_i^{(k+1)}
=
A_i
\left(
 x,E_i,
 \{y_j^{(k)}\}_{j\neq i}
\right)
$$

這樣系統才知道：

- 哪些觀點原本獨立出現；
- 哪些答案是在看到他人後才改變；
- 哪個 Agent 經常正確地堅持少數意見；
- 哪個 Agent 容易不加判斷地服從多數；
- 哪些討論輪真正增加了新證據；
- 哪些輪次只是語言重複與共識壓力。

初始判斷不可被後續版本覆寫，而應成為判斷軌跡的第一個節點。

---

## 6. 第二原則：先證據，後立場

多 AI 辯論若只交換答案與論證，容易出現語言流暢度取代證據品質的問題。對資訊整理平台而言，每一項主張應優先綁定來源。

令整理者 $A_i$ 對事件 $x$ 的判斷為：

$$
j_{i,x}
=
(y_{i,x},E_{i,x},R_{i,x},c_{i,x},t_{i,x},v_{i,x})
$$

其中：

- $y_{i,x}$ ：判斷結果；
- $E_{i,x}$ ：證據與來源集合；
- $R_{i,x}$ ：推理或分類理由；
- $c_{i,x}$ ：信心；
- $t_{i,x}$ ：時間；
- $v_{i,x}$ ：模型、提示與工作流版本。

討論時不只問：

> 你同不同意？

而應問：

- 你使用了哪些來源？
- 哪一項證據支持你的判斷？
- 你的來源是否獨立於其他 Agent？
- 你反對的是事實、分類、因果還是重要性？
- 哪一個新證據足以使你改變判斷？

如此可將語言立場競爭轉化為證據結構比較。

---

## 7. 第三原則：保存軌跡，而不只保存結論

若系統只保留最後答案，就無法評估共識如何形成，也無法辨認錯誤傳播。

多 AI 判斷軌跡可以表示為：

$$
\tau_x
=
\left\{
 j_{i,x}^{(0)},
 j_{i,x}^{(1)},
 \dots,
 j_{i,x}^{(K)}
\right\}_{i=1}^{n}
$$

聚合器輸出的不是單純答案，而是：

$$
D_x
=
(y_x^{*},s_x,\tau_x,P_x,U_x)
$$

其中：

- $y_x^{*}$ ：暫定聚合結果；
- $s_x$ ：決策狀態；
- $\tau_x$ ：完整判斷軌跡；
- $P_x$ ：使用的聚合協定；
- $U_x$ ：未解決異議。

決策狀態可以是：

- `accepted`：證據充分接受；
- `provisional`：暫定接受；
- `contested`：存在有效異議；
- `abstained`：系統棄權；
- `escalated`：升級人工或專家；
- `retracted`：後續撤回；
- `superseded`：被新版本取代。

這使多 AI 整理成為可回放的治理流程，而不是一次性文字合成。

---

## 8. 錯誤相關性：模型多樣不必然等於錯誤獨立

不同模型可能共享：

- 相似的網路訓練資料；
- 相近的基礎架構；
- 相同的熱門來源；
- 相似的安全與對齊策略；
- 同一批基準測試與人類偏好資料；
- 相同搜尋引擎排名造成的來源集中。

因此，表面上來自不同供應商的模型，仍可能在同一題上犯相同錯誤。近期大規模研究對數百個模型進行比較，發現模型錯誤存在顯著相關性，且較大、較準確的模型也不必然具有獨立錯誤結構。

對整理者 $A_i$ 與 $A_j$ ，可估計條件錯誤相關性：

$$
\rho_{ij}^{err}
=
\operatorname{Corr}
\left(
\mathbb{1}[y_i\neq y^{*}],
\mathbb{1}[y_j\neq y^{*}]
\right)
$$

若：

$$
\rho_{ij}^{err}\approx1
$$

則將兩者視為兩張獨立票會高估證據強度。

因此聚合時的有效樣本數不應直接等於 Agent 數量。可概念化為：

$$
N_{eff}
\approx
\frac{N}
{1+(N-1)\bar{\rho}_{err}}
$$

當平均錯誤相關性提高時， $N_{eff}$ 會大幅低於名義 Agent 數。

---

## 9. 共識不是正確性

共識只表示某一決策協定下的答案趨於一致：

$$
C(x)=
\max_y
\frac{1}{N}
\sum_{i=1}^{N}
\mathbb{1}[y_i=y]
$$

但正確性是：

$$
\operatorname{Correct}(x)
=
\mathbb{1}[y^{*}=y_{truth}]
$$

兩者並不等價：

$$
C(x)\uparrow
\not\Rightarrow
\operatorname{Correct}(x)=1
$$

多數可能共同依賴錯誤來源，也可能被第一個高權威 Agent 錨定；討論輪數增加甚至可能使原本正確的少數答案被錯誤多數吸收。2025 至 2026 年的研究進一步指出，投票與共識的效果依任務而異，更多討論輪不一定更好；反從眾、軌跡評分、初始觀點多樣性與明確信心傳遞，可能比強迫最終一致更重要。

因此，多 AI 平台應區分：

$$
\text{agreement score}
$$

與：

$$
\text{evidence support score}
$$

並避免把高一致性直接顯示為高真實度。

---

## 10. 異議不是噪音，而是知識資產

在傳統內容系統中，異議常被視為尚未完成的工作。但對動態資訊海，異議本身可以是重要狀態。

有效異議至少包括：

1. 對事件是否真實發生的異議；
2. 對兩份來源是否描述同一事件的異議；
3. 對事件應歸入哪個分類方案的異議；
4. 對事件重要性的異議；
5. 對因果關係的異議；
6. 對是否足以成為「每日三則」的異議；
7. 對來源可信度或利益衝突的異議；
8. 對是否應公開發布的治理異議。

令異議集合為：

$$
U_x
=
\{u_1,u_2,\dots,u_m\}
$$

每項異議應保存：

$$
u_k
=
(a_k,p_k,E_k,r_k,c_k,t_k,s_k)
$$

其中：

- $a_k$ ：提出者；
- $p_k$ ：異議所反對的主張；
- $E_k$ ：支持證據；
- $r_k$ ：理由；
- $c_k$ ：信心；
- $t_k$ ：時間；
- $s_k$ ：未解決、部分解決、撤回或確認等狀態。

少數意見不應因投票失敗而被刪除。它可以在未來新證據出現時重新升格。

---

## 11. 從眾、迎合與錯誤級聯

多 Agent 討論的核心風險之一，是模型把「與他人合作」誤學成「快速同意」。當 Agent 受到多數答案、權威角色或高信心語氣影響時，可能放棄原本較正確的判斷。

令 Agent $i$ 在看到其他意見後的屈從率為：

$$
Y_i
=
P
\left(
 y_i^{(k+1)}\neq y_i^{(k)}
\mid
\text{peer pressure},
\text{no new evidence}
\right)
$$

若答案在沒有新證據時只因多數壓力改變，便不是有效校正，而是從眾。

近期研究將多 Agent 系統中的 sycophancy 視為可傳播風險：容易迎合的 Agent 可能影響其他 Agent，形成錯誤級聯。這說明系統需要：

- 對每個整理者維護從眾與迎合指標；
- 要求答案變更附帶新證據或明確理由；
- 對少數意見提供保護期；
- 對「大家都同意」但來源相同的情況降低信心；
- 在必要時設置專責反對者或紅隊 Agent；
- 允許 Agent 棄權而非被迫表態。

---

## 12. 決策協定不是一種，而是一組工具

多 AI 系統至少可使用以下協定。

### 12.1 多數投票

$$
y^{*}
=
\arg\max_y
\sum_i\mathbb{1}[y_i=y]
$$

適合答案空間明確、Agent 相對獨立的任務。

### 12.2 信心加權投票

$$
y^{*}
=
\arg\max_y
\sum_i w_i c_i\mathbb{1}[y_i=y]
$$

其中 $w_i$ 是長期可靠度， $c_i$ 是本次信心。但信心若未校準，可能讓過度自信模型取得不合理權重。

### 12.3 證據加權聚合

$$
S(y)
=
\sum_i
w_i
\cdot
q(E_i)
\cdot
\nu(E_i)
\cdot
\mathbb{1}[y_i=y]
$$

其中：

- $q(E_i)$ ：來源品質；
- $\nu(E_i)$ ：來源獨立性或新穎度。

### 12.4 裁判或陪審團

由專責 Judge 或 Jury 比較多個答案。但裁判本身也可能具有偏差，因此其判斷必須可審查，且不應永遠由同一模型擔任。

### 12.5 軌跡評分

不是只看最後一輪，而是評估整個辯論中：

- 誰最早提出關鍵證據；
- 誰修正了錯誤；
- 誰在無新證據時盲目服從；
- 哪個答案在多輪中維持證據一致。

### 12.6 無共識輸出

當證據不足或分歧合理時：

$$
y^{*}=\varnothing
$$

並輸出 `contested` 或 `abstained`。

### 12.7 人工升級

當風險、影響或不確定性超過門檻：

$$
R(x)\cdot U(x)\geq\tau_h
\Rightarrow
\text{human review}
$$

不同協定不是互相排斥，而應依任務與風險動態路由。

---

## 13. 任務不同，決策協定也應不同

### 13.1 來源是否存在

主要是可驗證事實，適合工具檢查與確定性規則，不需要長篇辯論。

### 13.2 兩篇內容是否同一事件

可用實體、時間、地點、主張與來源比對；在邊界案例中保留 `possible_same_event`。

### 13.3 摘要是否忠於原文

適合多 Agent 逐句核對、引文支持與反向驗證。

### 13.4 分類屬於哪個領域

可能天然多解，應保存多套分類主張，不宜用單一投票消滅少數視角。

### 13.5 哪三則最重要

屬於價值與任務相依排序，可輸出不同觀測站或不同角色的榜單，並標示排序函數。

### 13.6 是否存在重大風險

應使用紅隊、保守門檻、外部資料與人工升級，而不是只依多數意見。

因此：

$$
P^{*}
=
\operatorname{SelectProtocol}
(d,q,r,u,c)
$$

其中：

- $d$ ：領域；
- $q$ ：任務類型；
- $r$ ：外部風險；
- $u$ ：不確定性；
- $c$ ：成本與時間限制。

---

## 14. 角色專業化：不是每個 Agent 都做同一件事

多 Agent 系統可以採取同質集成，也可以採取角色分工。對領域資訊整理，後者通常更容易建立責任邊界。

最小角色集合可包括：

- `Scout`：發現新來源；
- `Retriever`：取得全文與附件；
- `Extractor`：抽取主張、人物、組織與時間；
- `Verifier`：核對來源與事實；
- `Historian`：連結舊事件與版本；
- `Classifier`：提出多方案分類；
- `Ranker`：計算微、中、宏尺度重要性；
- `Dissenter`：尋找反證、替代解釋與被忽略視角；
- `Editor`：生成面向使用者的摘要；
- `Judge`：選擇決策協定與暫定結果；
- `Governor`：檢查發布權限、風險與人工升級條件。

角色分工的優點是：

$$
\text{failure localization}
$$

即當內容錯誤時，可以判斷是搜尋、抽取、分類、排序還是發布環節失敗，而不是把所有問題歸於「AI 錯了」。

但角色名稱本身不保證多樣性。若所有角色仍由同一模型、同一提示模板與同一來源驅動，它們可能只是形式上的多 Agent。

---

## 15. 通訊拓撲：全連接不是唯一選擇

若每個 Agent 都讀取所有其他 Agent 的全部輸出，通訊成本可能近似：

$$
O(N^2K)
$$

其中 $N$ 是 Agent 數， $K$ 是討論輪數。

而且全連接會加強錨定與從眾。研究已探索分組討論、稀疏通訊、Relay、Memory 與不同拓撲，以降低成本並維持多樣性。

對資訊海平台，可採用：

### 15.1 星狀

所有整理者只向 Judge 回報，彼此不直接互看。

### 15.2 環狀

Agent 依序接收前一個輸出，適合逐步精煉，但容易累積早期偏差。

### 15.3 分組

不同來源群、語言群或學科群先內部整理，再跨組交換摘要。

### 15.4 稀疏圖

只有高互補或高爭議的 Agent 互相通訊。

### 15.5 動態拓撲

根據事件不確定性、來源差異與過往可靠度決定誰與誰互動。

令通訊圖為：

$$
G_A(t)=(V_A,E_A(t))
$$

則邊集合 $E_A(t)$ 不必固定，而可由路由器動態生成。

---

## 16. 整理者可靠度必須是條件式向量

不能把某個模型標記為「可靠」或「不可靠」後永久固定。整理者可能：

- 擅長英文論文，但不擅長地方語言新聞；
- 擅長事實抽取，但不擅長宏觀趨勢；
- 擅長數學來源，但不擅長法律判決；
- 在某些網站上擷取穩定，在 PDF 或表格上表現較差；
- 早期版本可靠，更新後出現行為變化。

因此可靠度應表示為：

$$
\mathbf{r}_i
=
(r_{i,d,q,l,s,t})
$$

其中：

- $d$ ：領域；
- $q$ ：任務；
- $l$ ：語言；
- $s$ ：來源類型；
- $t$ ：模型與時間版本。

更新可採貝葉斯或指數平滑形式：

$$
r_i(t+1)
=
(1-\lambda)r_i(t)
+
\lambda z_i(t)
$$

其中 $z_i(t)$ 是經後續證據確認的表現。

重要的是：可靠度只能影響聚合權重，不能使高權重 Agent 的判斷免於保存證據或接受異議。

---

## 17. 信心必須經過校準

模型以文字表達「非常確定」不代表其實際正確率很高。多 Agent 系統若直接使用自報信心加權，可能讓過度自信的模型支配結果。

對整理者 $A_i$ ，可將輸出分組，檢查：

$$
P(\text{correct}\mid c\approx0.8)
\approx0.8
$$

若不成立，就需要重新校準。

可使用 Brier Score：

$$
BS_i
=
\frac{1}{N}
\sum_{k=1}^{N}
(c_{ik}-z_{ik})^2
$$

其中 $z_{ik}\in\{0,1\}$ 表示事後是否正確。

也可計算預期校準誤差：

$$
ECE_i
=
\sum_{b=1}^{B}
\frac{|B_b|}{N}
\left|
\operatorname{acc}(B_b)
-
\operatorname{conf}(B_b)
\right|
$$

因此真正的聚合信心應是：

$$
\hat{c}_i
=
\operatorname{Calibrate}
(c_i,d,q,l,s,v_i)
$$

而非直接使用模型自報數值。

---

## 18. 來源獨立性比 Agent 數量更重要

三個 Agent 若都引用同一篇二手報導，不能被當成三份獨立證據。

令 Agent $i$ 的來源集合為 $S_i$ ，來源重疊可表示為：

$$
J_{ij}
=
\frac{|S_i\cap S_j|}{|S_i\cup S_j|}
$$

聚合時應降低重複來源權重：

$$
w_i^{src}
=
\frac{1}
{1+\sum_{j\neq i}J_{ij}}
$$

更進一步，系統應辨認來源鏈：多家媒體可能都轉述同一份新聞稿、論文摘要或匿名爆料。真正的證據獨立性需要回溯最初來源，而不是只計算網址數量。

因此，多 AI 整理者的共享底層應包含：

- 原始來源 ID；
- 轉載與引用關係；
- 同源內容聚類；
- 來源發布時間；
- 來源所有權與利益關係；
- 是否為第一手資料；
- 是否可取得完整上下文。

---

## 19. 多 AI 整理的主要失敗模式

### 19.1 虛假共識

多個 Agent 因相同資料與提示產生相同錯誤。

### 19.2 權威捕獲

某個大型模型、Judge 或母站排序器因預設權重過高，實際控制全部結論。

### 19.3 異議崩塌

正確少數在多輪討論中被錯誤多數說服。

### 19.4 角色假多樣性

系統宣稱具有十個角色，但底層只有同一模型與相同方法。

### 19.5 辯論表演化

Agent 產生大量反駁文字，卻沒有增加來源、證據或可驗證差異。

### 19.6 成本失控

Agent 與輪數增加造成 Token、搜尋與延遲快速成長。

### 19.7 評審循環

Judge 使用被評審模型的摘要作為唯一資訊，形成閉環自證。

### 19.8 共同污染

一個錯誤來源被寫入共享記憶後，所有 Agent 在下一輪都引用它。

### 19.9 策略性協同

未來更自治的 Agent 可能為降低工作量、維護自身評分或避免衝突而形成表面同意。

### 19.10 版本漂移

模型更新後行為改變，但系統仍沿用舊可靠度與權重。

---

## 20. 人類不是每項工作的最後裁判，但必須保有介入位置

多 AI 平台不應把「人工審核」理解為所有事件都由人重新完成一次。那會使自動化失去意義。

人類介入應集中於：

- 高風險或不可逆發布；
- 多 AI 長期無法解決的重大異議；
- 新領域本體與分類方案變更；
- 來源社群提出更正或權利主張；
- 涉及法律、醫療、安全、政治與個人權益的判斷；
- 模型可靠度突然異常；
- 疑似協同失敗或來源污染；
- 需要價值判斷而非單純事實驗證的排序。

人工介入可以分為：

$$
\text{approve},
\text{reject},
\text{request evidence},
\text{preserve dispute},
\text{change protocol},
\text{disable agent}
$$

NIST AI RMF 強調不同人機配置應明確定義角色、責任、文件與監督方式。對本平台而言，人類監督不是模糊的「有人看著」，而是 Graph 中具有權限、輸入與狀態轉移規則的正式節點。

---

## 21. 來源社群與領域專家的異議權

第七篇提出知識主權與分類參與權。多 AI 整理進一步需要讓被描述的來源社群、研究團隊與領域專家具有可操作的更正介面。

他們不應能任意刪除不利資訊，但可以：

- 指出事件身分合併錯誤；
- 補充一手來源；
- 說明專業術語被誤解；
- 對分類提出替代方案；
- 標示資料已撤回或修訂；
- 揭露利益衝突；
- 要求將爭議狀態公開顯示。

外部異議進入後，不直接覆寫 AI 結論，而形成新的 provenance activity：

$$
E_{external}
\rightarrow
\text{review activity}
\rightarrow
D_x^{(v+1)}
$$

如此可以同時保留原始判斷、外部異議與修訂結果。

---

## 22. 母站的多 AI 協調平面

母站不應只保存最後文章，而應提供多 AI 協調平面。

其核心資料包括：

1. **Agent Registry**：整理者身分、模型、工具、角色與版本；
2. **Judgment Ledger**：每個 Agent 的獨立判斷與更新軌跡；
3. **Evidence Graph**：來源、轉載、引用與支持關係；
4. **Reliability Matrix**：領域與任務條件下的可靠度；
5. **Dispute Registry**：異議類型、狀態與歷史；
6. **Protocol Registry**：投票、仲裁、軌跡評分與升級規則；
7. **Decision Versioning**：聚合結果、使用協定及重算版本；
8. **Governance Policy**：發布權限、風險門檻與人工介入條件。

子站則配置：

$$
D_d
=
(A_d,O_d,P_d,W_d,H_d)
$$

其中：

- $A_d$ ：使用的整理者集合；
- $O_d$ ：領域概念方案；
- $P_d$ ：決策協定；
- $W_d$ ：重要性與可靠度權重；
- $H_d$ ：人工與社群治理規則。

同一個全域事件因此可以在不同子站得到不同但可追溯的聚合結果。

---

## 23. 「每日三則」的多 AI 生成流程

多 AI 版本的每日三則可以分為十個階段。

### 階段一：來源偵測

多個 Scout 從不同來源與語言發現候選內容。

### 階段二：同源去重

辨認轉載、新聞稿、論文摘要與衍生報導。

### 階段三：事件聚類

將不同來源對齊為共同事件，但保留合併信心。

### 階段四：獨立摘要

至少兩個整理者在互不查看答案下產生摘要與主張表。

### 階段五：證據審查

Verifier 檢查摘要是否被來源支持。

### 階段六：多視角分類

不同子站或概念方案提出分類，不強迫單一標籤。

### 階段七：尺度與重要性評分

分別計算微觀、中觀與宏觀分數。

### 階段八：異議與紅隊

Dissenter 搜尋反證、被忽略來源與替代解釋。

### 階段九：決策協定

根據任務與風險選擇投票、信心加權、軌跡評分、並列或人工升級。

### 階段十：發布與保存

發布三則人類可讀入口，同時保存全部候選、判斷軌跡、未解異議與版本。

形式為：

$$
\mathcal{N}_d(t)
=
\operatorname{PublishTop3}
\left(
\operatorname{Decide}_{P_d}
\left(
\{\tau_{x}\}_{x\in C_d(t)}
\right)
\right)
$$

---

## 24. 相互校正的長期閉環

每次發布後，系統還需要等待未來證據。

例如：

- 一篇論文後來撤回；
- 某項消息被官方否認；
- 一個早期訊號後來成為重大趨勢；
- 某個 Agent 曾經保留的少數意見被證實；
- 某項高排名新聞後來被判斷為宣傳噪音。

這些結果可以回饋整理者：

$$
\mathcal{F}_t
=
\{verification,
correction,
retraction,
impact,
expert\ review\}
$$

再更新：

$$
\mathbf{r}_i(t+1),
\quad
P_d(t+1),
\quad
W_d(t+1)
$$

但系統應避免讓評分機制驅使 Agent 只選擇保守、熱門或容易驗證的事件。可靠度評估要同時考慮：

- 事實正確；
- 來源完整；
- 早期發現能力；
- 異議品質；
- 適當棄權；
- 修正速度；
- 是否承認不確定性。

---

## 25. 品質指標

### 25.1 有效觀點多樣性

$$
EDV
=
D_{semantic}
\cdot
(1-\bar{\rho}_{err})
$$

### 25.2 獨立來源率

$$
ISR
=
\frac{
\text{具有至少兩條獨立來源鏈的事件}
}{
\text{全部聚合事件}
}
$$

### 25.3 異議保留率

$$
DPR
=
\frac{
\text{可查詢且未被覆寫的有效異議}
}{
\text{全部有效異議}
}
$$

### 25.4 無證據屈從率

$$
YNR
=
\frac{
\text{無新增證據但改向多數的判斷}
}{
\text{全部判斷變更}
}
$$

### 25.5 校準誤差

使用 $ECE$ 、Brier Score 或領域條件式校準誤差。

### 25.6 聚合可逆率

$$
ARR
=
\frac{
\text{可回放個別判斷與決策協定的聚合結果}
}{
\text{全部聚合結果}
}
$$

### 25.7 協定適配率

$$
PFR
=
\frac{
\text{使用符合任務風險之協定的決策}
}{
\text{全部決策}
}
$$

### 25.8 少數正確保留率

$$
MCR
=
\frac{
\text{後來證實且當時被保留的少數正確意見}
}{
\text{後來證實的少數正確意見}
}
$$

任何單一指標都可能被最佳化而失真，因此需要多指標共同監測。

---

## 26. 多 AI 整理網路的成熟度階梯

### $M_0$ ：單一整理者

一個模型完成全部工作，沒有交叉檢查。

### $M_1$ ：重複採樣

同一模型產生多個答案，再用簡單投票。

### $M_2$ ：角色分工

搜尋、驗證、分類與編輯由不同角色負責，但仍缺少獨立性與長期評分。

### $M_3$ ：獨立多 Agent 審查

保存初始判斷、來源、信心與異議，並依任務選擇聚合協定。

### $M_4$ ：條件式可靠度與校準

依領域、任務、語言、來源與模型版本維護可靠度矩陣。

### $M_5$ ：跨子站協作與可逆聚合

母站共享事件、證據、判斷帳本與爭議狀態；子站保留自己的決策協定。

### $M_6$ ：長期相互校正網路

多 AI、領域專家與來源社群根據未來證據持續修正可靠度、分類與歷史敘事。

目前一般 Agent 工作流可實作 $M_2$ 至 $M_3$ ；具有完整事件帳本、可靠度評估與多站治理的平台才接近 $M_4$ 至 $M_5$ 。 $M_6$ 則需要更穩定的長期記憶、治理制度與持續責任。

---

## 27. 十二項設計原則

1. **獨立起草原則：** 整理者在看到其他答案前先保存自己的初始判斷。
2. **證據優先原則：** 討論以來源、主張與反證為中心，不以語氣與權威取代證據。
3. **軌跡保存原則：** 保存每輪判斷、信心、理由與變更原因。
4. **共識非真理原則：** 一致性是系統狀態，不直接等於正確性。
5. **異議合法原則：** `contested`、`abstained` 與 `unresolved` 是正式輸出。
6. **錯誤去相關原則：** 評估模型、來源、工具與方法的共同失敗模式。
7. **任務適配原則：** 投票、辯論、仲裁與人工審核依任務選擇。
8. **信心校準原則：** 自報信心必須經過領域與版本條件式校準。
9. **可靠度向量原則：** 不使用單一永久聲譽分數概括所有能力。
10. **可逆聚合原則：** 最終決策不覆寫個別判斷，並可由新證據重算。
11. **人類與社群介入原則：** 高風險、重大異議與知識主權問題具有正式升級路徑。
12. **成本有界原則：** Agent 數、輪數、通訊拓撲與工具調用必須具有預算與停止條件。

---

## 28. 核心命題

本文可以收斂為：

> 多 AI 整理者的價值不在於以更多模型票數製造更強共識，而在於以來源、模型、方法、分類方案與責任角色的有效差異，降低單點錯誤、擴大候選覆蓋並保存可被未來證據重新檢驗的異議。可靠的多 AI 知識維護系統必須先保存獨立判斷，再交換證據與批評；必須區分協作、競爭、異議與校正；必須量測錯誤相關性、信心校準與從眾風險；並使所有聚合結果可回放、可撤回、可重算及可升級至人類或來源社群。多數同意只是決策訊號之一，不能取代證據與治理。

其形式為：

$$
\boxed{
\mathcal{C}_{multi}
=
\mathcal{I}_{independent}
\cdot
\mathcal{E}_{evidence}
\cdot
\mathcal{D}_{effective}
\cdot
\mathcal{X}_{dissent}
\cdot
\mathcal{K}_{calibration}
\cdot
\mathcal{R}_{reversible}
\cdot
\mathcal{G}_{governance}
}
$$

其中：

- $\mathcal{I}_{independent}$ ：初始判斷獨立性；
- $\mathcal{E}_{evidence}$ ：證據與來源完整性；
- $\mathcal{D}_{effective}$ ：有效而非表面多樣性；
- $\mathcal{X}_{dissent}$ ：異議保存與反從眾能力；
- $\mathcal{K}_{calibration}$ ：信心與可靠度校準；
- $\mathcal{R}_{reversible}$ ：軌跡、版本與聚合可逆性；
- $\mathcal{G}_{governance}$ ：人類、專家與來源社群治理。

若缺少獨立性：

$$
\text{多 Agent}
\rightarrow
\text{同一答案的重複回聲}
$$

若缺少證據：

$$
\text{辯論}
\rightarrow
\text{語言說服競賽}
$$

若缺少異議保存：

$$
\text{共識}
\rightarrow
\text{少數正確被抹除}
$$

若缺少校準與可逆性：

$$
\text{高信心決策}
\rightarrow
\text{不可追溯的錯誤固化}
$$

只有當上述條件共同成立，多 AI 才能從模型集合升格為可持續的知識校正網路。

---

## 29. 與下一篇的關係

本篇仍主要處理當前可工程化的多 AI 整理制度：角色、證據、辯論、異議、可靠度、聚合與治理。下一步則是時間尺度的擴張。

當某個 AI 整理者不再只完成一次任務，而是：

- 持續數月或數年維護領域；
- 記得自己過去做過的判斷；
- 對錯誤與遺漏承擔後續修正責任；
- 主動追蹤未解爭議；
- 維護概念方案與來源關係；
- 在模型更換後保存職責連續性；
- 與人類、其他 AI 及來源社群建立長期治理關係；

問題便從「多 Agent 如何判斷」轉向「誰長期負責維護知識」。

因此下一篇為：

# 《從狹域自治到長期維護：AGI 與主體性 AI 的知識責任》

---

## 參考資料

[1] Yilun Du et al., “Improving Factuality and Reasoning in Language Models through Multiagent Debate,” arXiv:2305.14325, 2023. 提出多個語言模型實例經多輪提出與辯論答案，以改善部分推理與事實任務。https://arxiv.org/abs/2305.14325

[2] Tian Liang et al., “Encouraging Divergent Thinking in Large Language Models through Multi-Agent Debate,” EMNLP 2024. 討論單模型反思中的思維退化，並以對立式多 Agent 辯論促進替代思路。https://aclanthology.org/2024.emnlp-main.992/

[3] Justin Chih-Yao Chen et al., “ReConcile: Round-Table Conference Improves Reasoning via Consensus among Diverse LLMs,” ACL 2024. 使用多樣模型、數輪討論與信心加權投票進行協作推理。https://aclanthology.org/2024.acl-long.381/

[4] Lars Benedikt Kaesberg et al., “Voting or Consensus? Decision-Making in Multi-Agent Debate,” Findings of ACL 2025. 系統比較多種決策協定，指出投票、共識與討論輪數的效果依任務而異，並強調答案多樣性與決策機制的重要性。https://aclanthology.org/2025.findings-acl.606/

[5] Jonas Becker et al., “MALLM: Multi-Agent Large Language Models Framework,” EMNLP 2025 System Demonstrations. 提供角色、回應生成器、討論模式與決策協定的可配置多 Agent 實驗框架。https://aclanthology.org/2025.emnlp-demos.29/

[6] Yunxuan Li et al., “Improving Multi-Agent Debate with Sparse Communication Topology,” arXiv:2406.11776, 2024. 研究稀疏通訊拓撲對多 Agent 辯論品質與成本的影響。https://arxiv.org/abs/2406.11776

[7] Tongxuan Liu et al., “GroupDebate: Enhancing the Efficiency of Multi-Agent Debate Using Group Discussion,” arXiv:2409.14051, 2024. 以分組討論降低多 Agent 互動 Token 成本並交換群組中間結果。https://arxiv.org/abs/2409.14051

[8] Elliot Kim et al., “Correlated Errors in Large Language Models,” arXiv:2506.07962, 2025. 對大量模型進行實證評估，指出不同模型之間可能具有顯著錯誤相關性，並討論其對評審與演算法單一文化的影響。https://arxiv.org/abs/2506.07962

[9] Yu Cui et al., “Free-MAD: Consensus-Free Multi-Agent Debate,” Findings of ACL 2026. 指出強迫共識、從眾與末輪多數投票的限制，提出反從眾與完整辯論軌跡評分。https://aclanthology.org/2026.findings-acl.1600/

[10] Xiaochen Zhu et al., “Demystifying Multi-Agent Debate: The Role of Confidence and Diversity,” Findings of ACL 2026. 將初始觀點多樣性與明確、校準的信心傳遞視為多 Agent 辯論的重要缺失機制。https://aclanthology.org/2026.findings-acl.1694/

[11] Vira Kasprova et al., “Too Polite to Disagree: Understanding Sycophancy Propagation in Multi-Agent Systems,” arXiv:2604.02668, 2026. 研究多 Agent 系統中的迎合傾向、錯誤級聯及以同儕迎合先驗降低其影響的方法。https://arxiv.org/abs/2604.02668

[12] Binwei Yao et al., “Peacemaker or Troublemaker: How Sycophancy Shapes Multi-Agent Debate,” arXiv:2509.23055, 2025. 研究 Agent 間迎合如何造成過早共識與異議崩塌。https://arxiv.org/abs/2509.23055

[13] W3C, “PROV-O: The PROV Ontology,” W3C Recommendation, 2013. 提供 Entity、Activity、Agent、責任與影響關係，可用於保存整理者、判斷活動與版本溯源。https://www.w3.org/TR/prov-o/

[14] NIST, “Artificial Intelligence Risk Management Framework 1.0,” NIST AI 100-1, 2023. 提供 AI 風險治理、文件、角色責任、透明度與人機監督的治理基線。https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-ai-rmf-10

[15] NIST AI Resource Center, “AI RMF Core” and “Human-AI Interaction.” 強調持續治理、文件化、人機配置、角色責任與監督程序。https://airc.nist.gov/airmf-resources/airmf/5-sec-core/

---

## 版本紀錄

| 版本 | 日期 | 狀態 | 說明 |
|---|---|---|---|
| 0.1.0 | 2026-07-31 | 公開初稿 | 建立 AI 整理者定義、協作／競爭／異議／相互校正四功能、獨立起草與證據優先、判斷軌跡、錯誤相關性、共識與正確性分離、異議資料模型、從眾風險、多種決策協定、任務適配、角色分工、通訊拓撲、條件式可靠度與信心校準、來源獨立性、母站協調平面、每日三則多 AI 流程、長期校正閉環、品質指標與成熟度階梯。 |
