← Archive
lm-002122 · 2026-08

07_分類不唯一_多視角秩序知識主權與可逆分類_v0.1.0

下載 MD 檔 ⬇

title: "分類不唯一:多視角秩序、知識主權與可逆分類" series: "網路資訊海動態秩序化" series_id: "EML-IIODO" document_id: "EML-IIODO-TH-07" document_type: "公開理論文" author: "Neo.K" organization: "EveMissLab" version: "0.1.0" status: "公開初稿" date: "2026-07-31" language: "zh-TW" license_note: "公開引用時請保留作者、文件編號、版本與來源。"

分類不唯一

多視角秩序、知識主權與可逆分類

摘要

當 AI 開始大規模整理網路資訊海時,最容易被低估的問題不是模型能否產生標籤,而是分類本身從來就不是中性的資料搬運。分類決定一項資訊被看見於何處、與哪些事件相連、被何種群體訂閱、以何種尺度聚合,以及是否有機會進入「每日三則」或宏觀歷史敘事。若某一套分類被誤認為事物的唯一真實結構,則自動化程度越高,早期分類偏差越可能被高速複製並固化為整個資訊基礎設施的默認秩序。

本文主張,網路資訊海的秩序化不能建立在「每個事件只有一個正確類別」的假設上。分類應被理解為觀測者、目的、概念方案、尺度與時間共同決定的投影。對同一事件 xx ,不同領域觀測站可以產生不同但同時合理的分類:一項 AI 訓練資料判決,可以是著作權新聞、資料治理新聞、模型產業新聞、司法制度新聞,也可能成為 AI 權利與內容授權長期歷史中的節點。這些分類不必互相排斥;真正需要保存的是它們各自的方案、理由、來源、信心與適用範圍。

本文提出「共享身分、分離投影」原則。母站保存事件、來源、人物、組織與文件的共同身分;子站則保存自己對該事件的分類、重要性、尺度與解釋。分類不直接寫死於事件本體,而以可版本化的分類主張存在:

q=(x,c,s,a,tv,ts,p,r,ρ,ν)q= (x,c,s,a,t_v,t_s,p,r,\rho,\nu)

其中 xx 是被分類對象, cc 是概念, ss 是概念方案, aa 是提出者, tvt_vtst_s 分別表示有效時間與系統紀錄時間, pp 是來源溯源, rr 是理由, ρ\rho 是信心, ν\nu 是版本與狀態。如此,分類便可以被新增、修訂、分叉、撤回、失效、重新映射與重新計算,而不需要覆寫原始事件或抹除舊判斷。

本文進一步將「知識主權」限定為一組對知識表示與治理流程的權利,而不是宣稱任何群體可以壟斷事實或免於證據檢驗。它至少包括命名權、語境權、分類參與權、異議保留權、存取與使用治理權、算法可見性權,以及要求更正與撤回的程序權。對原住民族、地方社群、專業學科、語言共同體與特定領域觀測站而言,知識主權意味著其概念與語境不應只被外部平台單方面吸收、重新命名並失去來源;但共同事件身分、跨方案映射與公開證據仍然可以支持互操作與跨領域比較。

本文將「可逆分類」定義為:任何分類結果均可追溯至特定版本、方案、執行者與證據;修改不破壞先前狀態;系統可以回放某一時間點的分類視圖,也可以在新方案下重算歷史。可逆不代表所有錯誤都能毫無成本地消除,而是要求系統避免不可見的語義覆寫,使分類權力本身成為可檢查、可爭議與可修正的對象。

最終,本文提出多視角秩序並不是放棄真假判斷,也不是將所有分類視為同等有效。它要求把「事實證據是否成立」、「概念如何劃分」與「某一視圖為何選擇此分類」分開處理。可靠的資訊海秩序應同時允許證據收斂、概念多元、映射不確定與治理可逆。只有如此,大量 AI 整理者才能在不製造單一語義霸權的前提下,共同維護可導航、可比較與可長期演化的網路知識結構。

關鍵詞: 分類不唯一、多視角秩序、知識主權、可逆分類、概念方案、SKOS、分類溯源、語義治理、母子網站、領域觀測站、AI 偏誤、網路資訊海


1. 問題起點:分類看似只是整理,實際上決定資訊如何存在

在一般資訊系統中,分類經常被視為後處理步驟。資料先存在,系統再替它加上標籤、資料夾或主題名稱。這種直覺容易導出以下假設:

事物先有固定本質分類只是找出正確位置\text{事物先有固定本質} \rightarrow \text{分類只是找出正確位置}

但對網路資訊海而言,分類並不只是描述已經存在的結構。它同時參與創造使用者可以看見的結構。

一項事件被歸入「AI 著作權」,就會被著作權觀測站、法律研究者與內容創作者看見;被歸入「訓練資料權利」,就會進入模型資料治理與授權協議的歷史;被歸入「產業競爭」,又會被投資、商業與政策系統以不同方式排序。若它只被允許選擇一個類別,其餘視角便可能從介面、訂閱與統計中消失。

因此,分類至少影響:

  1. 資訊出現在哪一個子站;
  2. 哪些搜尋與訂閱可以找到它;
  3. 它與哪些舊事件形成關聯;
  4. 它在微觀、中觀與宏觀層的權重;
  5. 它是否進入每日精選;
  6. 它如何被納入歷史敘事;
  7. 哪些模型把它當成同類訓練範例;
  8. 哪些使用者以為它不存在。

所以分類不是附加於資訊的裝飾,而是一種資訊可見性的配置機制。

令事件 xx 在概念方案 ss 下被賦予分類集合:

As(x)={c1,c2,,cn}A_s(x)=\{c_1,c_2,\dots,c_n\}

若平台的檢索、排序與發布均依賴 As(x)A_s(x) ,那麼分類實際上參與決定事件的傳播路徑:

P(visiblex,u)=F(As(x),Ru,Ws,Ix)P(\text{visible}\mid x,u) = F(A_s(x),R_u,W_s,I_x)

其中:

  • uu :使用者或觀測者;
  • RuR_u :使用者訂閱與關注規則;
  • WsW_s :概念方案的排序權重;
  • IxI_x :事件自身的重要性與可信度。

這表示分類錯誤的後果不只是標籤不好看,而是事件可能被錯誤聚合、錯誤隱藏或錯誤放大。


2. 分類不是本體本身,而是目的導向的投影

本文不主張世界完全沒有結構,也不主張任何分類都只是任意偏好。事件具有時間、來源、參與者、行為、結果與因果關係;這些證據對分類形成約束。然而,即使基礎事實相同,分類仍然會依觀測目的而不同。

令網路資訊海在時間 tt 的狀態為:

W(t)={Vt,Et,Dt,Pt}\mathcal{W}(t)=\{V_t,E_t,D_t,P_t\}

其中:

  • VtV_t :人物、組織、概念、文件、事件與其他實體;
  • EtE_t :實體間的關係;
  • DtD_t :來源內容與資料;
  • PtP_t :溯源、時間與版本資訊。

分類方案 SjS_j 可以寫成:

Sj=(Cj,Rj,Lj,Gj)S_j=(C_j,R_j,L_j,G_j)

其中:

  • CjC_j :概念集合;
  • RjR_j :廣義、狹義、相關、對應等語義關係;
  • LjL_j :不同語言的標籤與定義;
  • GjG_j :適用目的、社群、範圍與治理規則。

分類不是直接發現唯一函數:

WC\mathcal{W}\rightarrow C^{*}

而是由方案與目的決定的投影:

ΠSj,g,u,,t:WtVj,g,u,(t)\Pi_{S_j,g,u,\ell,t} : \mathcal{W}_{\leq t}\rightarrow\mathcal{V}_{j,g,u,\ell}(t)

其中:

  • gg :任務目的;
  • uu :觀測者或使用者;
  • \ell :觀測尺度;
  • tt :時間。

同一事件在不同投影中得到不同分類,不必然代表其中一個錯誤。真正要判斷的是:

  • 分類是否符合該方案的定義;
  • 是否有足夠證據;
  • 是否超出方案適用範圍;
  • 是否隱瞞其他重要視角;
  • 是否可被質疑與修正。

3. 為何分類必然不唯一

分類不唯一不是 AI 時代才出現,而是知識組織本身的基本條件。AI 只是把分類的規模、速度與影響放大。

3.1 目的不唯一

一份模型安全報告可以被分類為:

  • 技術評測;
  • 風險治理;
  • 產業競爭;
  • 國家安全;
  • 公共政策;
  • AI 權利或主體性爭議的背景資料。

不同目的選擇不同特徵:

A(xg1)A(xg2)A(x\mid g_1)\neq A(x\mid g_2)

3.2 尺度不唯一

一篇單一論文在微觀層是研究更新;數十篇同方向論文在中觀層可能形成研究潮流;若該潮流改變整個學科資金與方法,宏觀層才會出現結構轉折。

Aμ(x)Am(x)AM(x)A_{\mu}(x)\neq A_m(x)\neq A_M(x)

3.3 學科不唯一

同一事件可能同時位於法律、計算機科學、倫理、社會學與經濟學的交界。學科分類通常依自己的問題意識切割世界,而非共享完全相同的邊界。

3.4 語言與文化不唯一

不同語言對概念的切割粒度、歷史脈絡與隱含價值並不一致。翻譯標籤不必然等於概念完全相同:

label translation⇏concept identity\text{label translation} \not\Rightarrow \text{concept identity}

因此跨語言系統需要區分:

  • 同一概念的不同語言標籤;
  • 高度相近但不完全相同的概念;
  • 只有部分範圍重疊的概念;
  • 無法直接翻譯的地方性概念。

3.5 時間不唯一

分類會隨知識與社會變化而修訂。一項技術可能先被視為玩具,後來成為產業基礎設施;某個疾病名稱、族群稱呼或學科邊界,也可能因新證據與治理改革而改變。

As(x,t1)As(x,t2)A_s(x,t_1)\neq A_s(x,t_2)

美國國會圖書館持續發布新增與修改的主題詞清單,本身就說明大型權威詞彙並非一次完成的永恆結構,而是持續接受提案與修訂的治理系統。

3.6 多重成員資格

許多事件天然跨越多個類別,強迫單選反而會失真:

As(x)>1|A_s(x)|>1

真正需要控制的是多標籤氾濫與無意義貼標,而不是把多重身分本身視為錯誤。


4. 事實、概念與視圖必須分層

多視角秩序最常被誤解為相對主義:既然分類不唯一,是否代表事實也不重要?本文的答案是否定的。

系統應至少區分三層。

4.1 證據層

保存來源、內容快照、時間、作者、機構與可驗證主張。

Ex={e1,e2,,en}\mathcal{E}_x = \{e_1,e_2,\dots,e_n\}

4.2 事件與實體層

根據證據識別某一事件或實體,並保留同名消歧、事件合併與分裂歷史。

I(x)=Resolve(Ex)I(x)=\operatorname{Resolve}(\mathcal{E}_x)

4.3 分類視圖層

不同方案對共同事件身分提出分類與解釋:

Q(x)={q1,q2,,qm}Q(x)=\{q_1,q_2,\dots,q_m\}

因此:

共同證據⇏唯一分類\text{共同證據} \not\Rightarrow \text{唯一分類}

但也不代表:

任意分類同等有效\text{任意分類} \Rightarrow \text{同等有效}

分類仍可依證據充分性、方案一致性、語境適切性與推理品質評估。


5. 共享身分、分離投影

母子網站架構若要容納多視角,最重要的原則是:

Shared Identity+Separated Projections\boxed{ \text{Shared Identity} + \text{Separated Projections} }

母站應保存:

  • 全域事件識別碼;
  • 原始來源與快照;
  • 人物、組織與文件身分;
  • 時間與版本關係;
  • 跨站可重用的證據;
  • 分類方案之間的映射。

子站則可以獨立保存:

  • 自己的概念方案;
  • 自己的主題標籤;
  • 自己的重要性函數;
  • 自己的微、中、宏尺度;
  • 自己的發布與訂閱介面;
  • 自己的異議與分類歷史。

若事件 xx 同時進入子站 d1,d2,d3d_1,d_2,d_3 ,可表示為:

Pdi(x)=(Adi(x),Wdi(x),Ldi(x),Ndi(x))P_{d_i}(x) = (A_{d_i}(x),W_{d_i}(x),L_{d_i}(x),N_{d_i}(x))

其中:

  • Adi(x)A_{d_i}(x) :分類;
  • Wdi(x)W_{d_i}(x) :重要性權重;
  • Ldi(x)L_{d_i}(x) :尺度;
  • Ndi(x)N_{d_i}(x) :該子站的敘述與解釋。

這些投影共享同一事件身分,但不互相覆寫。


6. 分類主張模型

傳統資料庫常直接在事件資料列加入:

category = "AI Governance"

這種設計把分類偽裝成事件的固定屬性,也無法回答是誰、何時、依哪套方案與何種證據完成分類。

本文建議將分類表示為獨立主張:

q=(x,c,s,a,tv,ts,p,r,ρ,ν)q= (x,c,s,a,t_v,t_s,p,r,\rho,\nu)

其中:

  • xx :被分類的事件、文件或實體;
  • cc :概念節點;
  • ss :概念方案;
  • aa :人類、AI、機構或工作流執行者;
  • tvt_v :分類在領域世界中被視為有效的時間;
  • tst_s :系統寫入或修訂該主張的時間;
  • pp :來源與運算溯源;
  • rr :分類理由;
  • ρ[0,1]\rho\in[0,1] :信心;
  • ν\nu :版本、狀態與分支資訊。

分類主張可具有下列狀態:

νstatus{proposed,active,disputed,superseded,withdrawn,invalidated}\nu_{status} \in \{ proposed, active, disputed, superseded, withdrawn, invalidated \}

因此,當分類被修改時,系統不是直接把舊值改掉,而是建立新的主張與版本關係。


7. 概念方案不是一棵全球唯一分類樹

W3C SKOS 將概念方案視為一組概念及其語義關係的集合,並允許概念在不同方案之間建立 exactMatchcloseMatchbroadMatchnarrowMatchrelatedMatch 等映射。這提供了一個重要工程啟示:互操作不必以消滅差異為代價。

令兩套方案為:

SA=(CA,RA)S_A=(C_A,R_A) SB=(CB,RB)S_B=(C_B,R_B)

跨方案映射為:

MA,BCA×Rmap×CBM_{A,B} \subseteq C_A\times\mathcal{R}_{map}\times C_B

其中:

Rmap={exact,close,broad,narrow,related,conflict,unmapped}\mathcal{R}_{map} = \{ exact, close, broad, narrow, related, conflict, unmapped \}

前五種可以直接借鑑 SKOS;conflictunmapped 則是本文為治理系統額外提出的狀態,用來避免平台為了追求全域一致而製造虛假的精確對應。

這意味著母站不必建立一棵囊括所有知識的終極分類樹,而可以維護:

S={S1,S2,,Sn}\mathfrak{S} = \{S_1,S_2,\dots,S_n\}

以及它們之間的映射網路:

M={Mi,jij}\mathfrak{M} = \{M_{i,j}\mid i\neq j\}

整體秩序因而是一個概念方案聯邦,而不是單一分類帝國。


8. 多視角秩序不等於所有視角同樣可靠

若承認分類多元,系統仍需要品質判斷。可以為分類主張定義可信度:

T(q)=αE(q)+βC(q)+γD(q)+δP(q)+ϵR(q)ζB(q)T(q) = \alpha E(q) + \beta C(q) + \gamma D(q) + \delta P(q) + \epsilon R(q) - \zeta B(q)

其中:

  • E(q)E(q) :證據支持度;
  • C(q)C(q) :與概念方案定義的一致度;
  • D(q)D(q) :領域專業度;
  • P(q)P(q) :溯源完整度;
  • R(q)R(q) :理由可解釋性;
  • B(q)B(q) :已知偏誤與利益衝突風險。

不同分類可能同時合理,但其證據品質、適用範圍與治理正當性不必相同。

例如,某公司將一項產品事故分類為「使用者誤用」,監管者分類為「安全缺陷」,研究者分類為「人機介面失敗」。系統應保存三種主張,但不能省略提出者與利益位置,也不能在沒有證據的情況下把三者當成等權事實。

多視角的真正要求是:

保留差異+顯示依據+允許評估\text{保留差異} + \text{顯示依據} + \text{允許評估}

而不是:

取消真假與品質判斷\text{取消真假與品質判斷}

9. 分類權力:可見性、排序與歷史敘事

分類具有權力,因為它會進入後續運算。

令事件 xx 被使用者 uu 看見的機率為:

V(x,u)=σ(s,cA(x,c,s)W(c,u,s)+H(x)+R(x))V(x,u) = \sigma \left( \sum_{s,c} A(x,c,s) W(c,u,s) + H(x) + R(x) \right)

其中:

  • A(x,c,s)A(x,c,s) :事件是否在方案 ss 下被歸入概念 cc
  • W(c,u,s)W(c,u,s) :使用者對該概念的興趣與平台權重;
  • H(x)H(x) :熱度;
  • R(x)R(x) :可靠度;
  • σ\sigma :正規化函數。

若一個概念不存在於主流方案,相關事件的可見性可能系統性降低。若一個社群的概念被錯誤映射為更大的外部分類,其差異也可能在統計中消失。

因此,分類權至少包括:

  1. 命名權: 誰決定概念名稱;
  2. 邊界權: 誰決定什麼算在概念內;
  3. 層級權: 誰決定哪個概念是上位或下位;
  4. 映射權: 誰宣稱兩套概念等同;
  5. 排序權: 哪些分類獲得較高曝光;
  6. 歷史權: 哪些事件被視為某一領域的關鍵歷史;
  7. 撤回權: 誰能修改或否定既有分類。

當 AI 可以每天自動分類大量內容時,這些權力不再只由圖書館、編輯與研究共同體行使,也會被模型、提示詞、訓練資料與工作流配置共同塑造。


10. 知識主權的限定定義

「知識主權」容易被誤解為國家或群體可以自行決定真理,甚至拒絕任何外部證據。本文不採用這種定義。

本文將知識主權定義為:

知識持有者、來源社群、專業共同體與受影響群體,對其知識如何被命名、分類、脫離或保留語境、被存取、被重新使用、被算法排序及被修訂,具有可制度化的參與、控制與異議權。

它至少包含七個面向。

10.1 語義主權

社群可以提供自己的概念、名稱、定義與關係,不必完全依附外部分類。

10.2 語境主權

資料與知識不應在去除必要歷史、文化與使用限制後,被重新包裝成表面中性的內容。

10.3 參與主權

被分類與被描述的群體,應能參與分類方案制定與修改。

10.4 存取與使用治理

開放不必等於無條件抽取。某些知識可以要求同意、用途限制、利益回饋或適當的責任關係。

10.5 算法可見性

社群應能理解哪些分類與排序規則影響其內容是否被看見。

10.6 異議與分叉權

當共同方案無法代表某一社群時,該社群可以保留替代方案與映射,而非只能接受或退出。

10.7 更正與撤回程序

分類錯誤、傷害性稱呼或過時映射應有可追蹤的修訂程序。

Global Indigenous Data Alliance 的 CARE 原則強調集體利益、控制權、責任與倫理,並將資料治理連結到原住民族世界觀、自決與知識經濟中的價值創造。UNESCO 的開放科學建議亦明確納入知識多樣性、原住民族與地方社群治理知識的權利。這些框架顯示,資料可互操作與知識開放不應只考慮技術可取得性,也必須處理人、目的、權利與語境。


11. 知識主權與共同事實基礎並不衝突

多套概念方案可以共存,但跨站平台仍需要最低限度的共同基礎。

可將其分成三層:

11.1 共同證據層

保存來源、時間、文本、版本、雜湊與取得方式。

11.2 共同事件身分層

在可行範圍內判斷不同來源是否指向同一事件或實體。

11.3 自治解釋層

不同社群與子站可以使用自己的概念、重要性與敘事。

Shared Evidence+Shared Identity+Plural Interpretation\text{Shared Evidence} + \text{Shared Identity} + \text{Plural Interpretation}

這個結構避免兩種極端:

  • 以全域統一為名,抹除地方與專業差異;
  • 以主權為名,拒絕任何互操作、比較與事實查核。

真正穩健的知識主權應該增加可見的責任與協商,而不是建立無法檢查的封閉真理區。


12. 可逆分類的定義

本文將可逆分類定義為:

一項分類決策在被採用後,仍能被追溯、重現、比較、修訂、撤回、分叉與重算;任何修改都不應秘密覆寫先前狀態,且系統可恢復某個時間點或某套概念方案下的歷史分類視圖。

令分類狀態為:

Ct={q1,q2,,qn}\mathcal{C}_t = \{q_1,q_2,\dots,q_n\}

分類操作事件為:

ωt{attach,detach,relabel,merge,split,map,deprecate,withdraw,branch,recompute}\omega_t \in \{ attach, detach, relabel, merge, split, map, deprecate, withdraw, branch, recompute \}

則:

Ct+1=F(Ct,ωt)\mathcal{C}_{t+1} = F(\mathcal{C}_t,\omega_t)

但舊狀態不被刪除,而是保存在事件帳本中:

LC(T)={ω1,ω2,,ωT}\mathcal{L}_C(T) = \{\omega_1,\omega_2,\dots,\omega_T\}

因此任意時間點的分類可由回放重建:

Ck=Replay(LC,k)\mathcal{C}_k = \operatorname{Replay}(\mathcal{L}_C,k)

可逆分類不是保證每個社會後果都能逆轉。錯誤分類造成的名譽、政策或資源影響可能無法完全恢復。它保證的是資訊系統不再把修改偽裝成從未發生過,並為更正、審計與歷史研究保留技術條件。


13. 可逆分類的七項必要條件

13.1 分類主張獨立化

分類不是事件表的一個不可追溯欄位,而是獨立實體。

13.2 版本不可覆寫

新分類以新版本或新主張存在,舊版本標記為被取代或失效。

13.3 溯源完整

保存提出者、模型版本、提示、規則、來源與執行時間。

13.4 有效時間與系統時間分離

系統必須知道分類何時被認為適用,以及何時被資料庫記錄。

13.5 映射可版本化

兩概念之間的 exactMatchcloseMatch 也不是永恆真理,應能修訂與撤回。

13.6 歷史可回放

使用者可以查看「當時系統怎麼分類」,而非只看到今天修訂後的結果。

13.7 批次重算

當概念方案大幅修改時,可以依新規則重新計算過去事件,同時保留舊結果。

W3C PROV-O 提供 wasRevisionOfinvalidatedAtTimespecializationOf 與相關溯源關係;SKOS 提供 changeNotehistoryNote 與映射關係;DataCite 則提供 IsNewVersionOfIsPreviousVersionOf 等資源版本關係。這些既有規格說明,可逆分類並不需要從零發明所有基礎語彙,而可以建立在成熟的溯源與版本模型上。


14. 分類分叉:異議不必被迫收斂

某些分類爭議可以透過更多證據解決;另一些則源自目的、價值或概念邊界不同,未必存在單一終局答案。

令共同方案版本為:

S(0)S^{(0)}

當社群 AABB 對某概念邊界無法收斂時,可以形成:

SA(1)=Branch(S(0),ΔA)S_A^{(1)} = \operatorname{Branch}(S^{(0)},\Delta_A) SB(1)=Branch(S(0),ΔB)S_B^{(1)} = \operatorname{Branch}(S^{(0)},\Delta_B)

母站保存分叉關係與映射,而不是強迫其中一方消失。

分類分叉應具備:

  • 清楚的分叉原因;
  • 對應社群與治理者;
  • 與共同方案的差異;
  • 跨方案映射;
  • 適用範圍;
  • 重新合併的可能條件。

這與軟體版本分支不同之處在於,概念方案分叉可能長期共存,因為它們服務不同知識目的。


15. 共識不是投票總和,而是帶條件的收斂

多 AI、多子站與多人類社群可能對同一事件產生不同分類。可以定義分類支持矩陣:

Mij=ρijM_{ij} = \rho_{ij}

其中 ii 是整理者, jj 是候選分類, ρij\rho_{ij} 是其信心。

簡單多數決:

argmaxjiMij\arg\max_j\sum_i M_{ij}

並不足以形成可靠共識,因為:

  • 整理者可能使用相同模型與訓練資料;
  • 多數可能缺乏領域專業;
  • 少數社群可能正是知識來源;
  • 不同分類可能服務不同目的;
  • 模型相關錯誤會造成虛假一致。

因此共識函數應包含多樣性、專業、來源位置與利益衝突:

Consensus(c)=iwiexpertwiindependentwistakeρicConsensus(c) = \sum_i w_i^{expert} \cdot w_i^{independent} \cdot w_i^{stake} \cdot \rho_{ic}

即使形成主要分類,也應保留:

  • 主要視圖;
  • 少數視圖;
  • 爭議狀態;
  • 未決理由;
  • 適用目的。

16. AI 分類者不是隱形權威

在大量資訊海整理中,AI 會承擔初步分類。若系統只保存最後標籤,模型就成為無法追溯的隱形編輯者。

AI 分類主張至少應記錄:

qAI=(x,c,s,m,prompt,tools,data,t,r,ρ)q_{AI} = (x,c,s,m,prompt,tools,data,t,r,\rho)

其中:

  • mm :模型與版本;
  • promptprompt :分類指令或政策版本;
  • toolstools :使用的搜尋、檢索與規則工具;
  • datadata :依據的來源;
  • rr :理由;
  • ρ\rho :信心。

AI 應具備棄權能力:

ρ<τA(x)=unknown\rho<\tau \Rightarrow A(x)=unknown

而不是為了資料完整率強迫每個事件進入某類。

AI 分類的治理還需要:

  • 多標籤上限與理由;
  • 高風險概念人工審查;
  • 定期抽樣;
  • 方案漂移檢測;
  • 模型更新前後差異測試;
  • 既有歷史批次重算;
  • 異常分類告警;
  • 偏誤與利益衝突記錄。

NIST AI RMF 將公平、有害偏誤管理、透明、可解釋與問責列入可信 AI 特徵,這些要求在分類系統中尤其重要,因為分類會直接進入可見性與資源分配。


17. 自動化容易把早期分類偏差變成長期結構

若系統每天執行:

分類發布歷史聚合模型再學習\text{分類} \rightarrow \text{發布} \rightarrow \text{歷史聚合} \rightarrow \text{模型再學習}

分類偏差可能形成回饋迴圈。

令某概念 cc 在時間 tt 的資料量為 nc(t)n_c(t) ,模型根據歷史資料判斷新事件屬於 cc 的傾向為:

Pt(cx)nc(t)P_t(c\mid x) \propto n_c(t)

若早期分類過度集中於某些主流概念,後續模型便更容易重複同樣分類:

nc(t+1)=nc(t)+Δnc(t)n_c(t+1) = n_c(t)+\Delta n_c(t)

形成:

早期偏差資料不平衡模型偏好更強偏差\text{早期偏差} \rightarrow \text{資料不平衡} \rightarrow \text{模型偏好} \rightarrow \text{更強偏差}

因此,動態秩序化平台不能只監控模型準確率,也必須監控:

  • 類別集中度;
  • 新概念進入率;
  • 未分類比例;
  • 少數方案可見性;
  • 映射爭議;
  • 人工更正頻率;
  • 模型更新造成的歷史重分類比例。

18. 每日三則在多視角分類下如何運作

每日三則不應先把所有事件壓進單一分類,再選三項。更合理的流程是:

共同事件池多方案分類投影子站內排序多樣性約束每日三則\text{共同事件池} \rightarrow \text{多方案分類投影} \rightarrow \text{子站內排序} \rightarrow \text{多樣性約束} \rightarrow \text{每日三則}

對子站 dd ,候選事件分數可寫成:

Scored(x)=Id(x)R(x)Nd(x)Cd(x)Dd(x)Score_d(x) = I_d(x) \cdot R(x) \cdot N_d(x) \cdot C_d(x) \cdot D_d(x)

其中:

  • Id(x)I_d(x) :領域重要性;
  • R(x)R(x) :來源可靠度;
  • Nd(x)N_d(x) :新穎性;
  • Cd(x)C_d(x) :分類信心;
  • Dd(x)D_d(x) :與當日其他事件的多樣性增益。

同一事件可以在多個子站入選,但每個站的標題、背景與理由可以不同。母站則可以標示:

  • 此事件在哪些子站出現;
  • 各站採用哪些分類;
  • 是否存在爭議;
  • 哪些概念為近似映射而非完全相同。

這能把多站重複從「內容重複」轉化為「多視角比較」。


19. AGIRight 的可逆分類起點

AGIRight Topics 目前已使用多個主題標籤,例如 AI Governance、Content Licensing、Training Data Rights、AI Consciousness、Agent Autonomy 與 Human-AI Relations。這已經是一個早期多標籤領域觀測介面。

下一步不必立刻建立複雜本體,可以從下列最小結構開始。

19.1 標籤升格為概念節點

每個標籤擁有:

  • 穩定 ID;
  • 顯示名稱;
  • 定義;
  • 範圍說明;
  • 上位與相關概念;
  • 建立與修改時間;
  • 多語標籤。

19.2 事件與分類分離

事件本身保存來源與摘要;標籤則以分類主張關聯。

19.3 保存分類理由

至少保存一段簡短理由,說明事件為何屬於該概念。

19.4 記錄方案版本

例如:

agiright-topic-scheme@0.1.0

19.5 允許標籤撤回與取代

舊標籤不直接刪除,而標示為 deprecated、merged 或 split。

19.6 建立跨站映射預留欄位

未來其他子站出現後,可以建立:

AGIRight:TrainingDataRights
closeMatch
CopyrightObservatory:AITrainingUse

19.7 提供視圖切換

同一事件可以依法律、權利、技術、治理或主體性視圖重排。

如此,AGIRight 不只是有多個標籤,而是開始具備可演化的領域概念方案。


20. 母站需要的分類協調平面

當子站數量增加,母站需要提供分類協調服務,但不應接管所有概念定義。

協調平面可以包含:

  1. 概念方案註冊表;
  2. 概念與版本識別碼;
  3. 跨方案映射;
  4. 分類主張資料格式;
  5. 溯源與執行者身分;
  6. 變更事件與版本鏈;
  7. 爭議與異議狀態;
  8. 查詢與批次重算介面;
  9. 使用者視圖偏好;
  10. 分類品質與偏誤監控。

母站可以要求最小互操作規格:

Common ProtocolCommon Ontology\text{Common Protocol} \neq \text{Common Ontology}

也就是共同使用事件 ID、時間、來源、分類主張與映射格式,但不強迫所有子站使用相同概念樹。


21. 分類治理流程

分類系統應像軟體與政策一樣具有變更治理,而不是由單一管理員靜默修改。

一項概念變更可以經過:

proposalreviewimpact analysisapprovalversionmigrationmonitoringproposal \rightarrow review \rightarrow impact\ analysis \rightarrow approval \rightarrow version \rightarrow migration \rightarrow monitoring

變更提案至少應說明:

  • 要新增、合併、拆分、改名或棄用什麼;
  • 變更原因;
  • 受影響事件數量;
  • 跨語言與跨站影響;
  • 來源社群是否參與;
  • 是否需要歷史重算;
  • 是否保留舊視圖;
  • 回滾條件。

對敏感分類,還應加入:

  • 受影響群體諮詢;
  • 利益衝突揭露;
  • 更高審核門檻;
  • 公開異議期;
  • 定期重新評估。

22. 主要失敗模式

22.1 語義單一化

母站為了簡化搜尋,強迫所有子站使用同一套分類,造成地方與專業概念消失。

22.2 分類碎片化

每個子站建立完全不相容的標籤,缺乏映射與共同身分,最後無法跨站搜尋。

22.3 虛假等價

為了提高互操作率,把僅部分相近的概念標成 exactMatch

22.4 映射洗白

平台透過跨方案映射,表面保留地方概念,實際仍把所有查詢導向主流概念。

22.5 自動化固化

模型持續重複舊分類,讓早期偏差成為歷史統計與後續模型的基礎。

22.6 分類即審判

把爭議性、暫時性或推測性分類當成對人物與機構的固定定性。

22.7 主權濫用

以知識主權為由拒絕來源查核、更正與合理公共監督。

22.8 過度可逆

所有修訂都允許任意回滾,導致已確認的傷害性或錯誤分類被持續復活。可逆應保留歷史,不代表所有版本都必須成為默認有效版本。


23. 多視角秩序的品質指標

可以定義多視角秩序品質向量:

Qplural=(Pl,Tr,Rv,Ct,Al,St)\mathbf{Q}_{plural} = (P_l,T_r,R_v,C_t,A_l,S_t)

其中:

  • PlP_l :多元性,是否容納必要的不同方案;
  • TrT_r :可追溯性;
  • RvR_v :可逆性;
  • CtC_t :可爭議性與更正能力;
  • AlA_l :跨方案可對齊性;
  • StS_t :分類穩定性。

可進一步定義:

23.1 多元覆蓋率

PCR=具有兩種以上有效視圖的跨領域事件數跨領域事件總數PCR = \frac{\text{具有兩種以上有效視圖的跨領域事件數}} {\text{跨領域事件總數}}

23.2 溯源完整率

PCRov=具有提出者、方案、理由與來源的分類主張全部分類主張PCRov = \frac{\text{具有提出者、方案、理由與來源的分類主張}} {\text{全部分類主張}}

23.3 可逆率

RR=可回放先前狀態的分類變更全部分類變更RR = \frac{\text{可回放先前狀態的分類變更}} {\text{全部分類變更}}

23.4 映射不確定性揭露率

MDR=明確標示 close/conflict/unmapped 的映射非精確跨方案映射總數MDR = \frac{\text{明確標示 close/conflict/unmapped 的映射}} {\text{非精確跨方案映射總數}}

23.5 異議保留率

DR=未被覆寫且可查詢的有效異議已提出異議總數DR = \frac{\text{未被覆寫且可查詢的有效異議}} {\text{已提出異議總數}}

這些指標不是越高越好。例如多元性過高可能代表分類失控,穩定性過高則可能代表系統拒絕修正。真正目標是多元、互操作與治理成本之間的平衡。


24. 多視角秩序的成熟度階梯

M0M_0 :固定單標籤

每項內容只有一個不可追溯類別。

M1M_1 :多標籤

允許一項事件進入多個類別,但沒有方案、版本與理由。

M2M_2 :概念方案化

標籤具有穩定 ID、定義、層級與多語名稱。

M3M_3 :分類主張化

每項分類保存提出者、時間、信心、理由與來源。

M4M_4 :可逆版本化

分類與概念方案可以回放、撤回、分叉與重算。

M5M_5 :跨方案聯邦

多個子站保有自治方案,母站維護共同事件身分與映射。

M6M_6 :多 AI 與多社群治理

不同整理者持續提出、審查、異議與修訂分類,並由透明程序維護長期品質。

目前 AGIRight 的 Topics 介面大致位於 M1M_1 ,若將標籤升格為可版本化概念方案,可進入 M2M_2M3M_3 。本系列的母子網站平台目標則至少需要達到 M5M_5


25. 十項設計原則

  1. 分類主張原則: 分類是可追溯判斷,不是事件不可分離的本質欄位。
  2. 共享身分原則: 跨站優先共享事件與來源身分,而非強迫共享所有概念。
  3. 多方案原則: 允許不同領域、語言與社群維護自己的概念方案。
  4. 映射誠實原則: 區分精確、近似、上下位、相關、衝突與無法映射。
  5. 證據約束原則: 多視角不取消證據與品質判斷。
  6. 知識主權原則: 來源社群與受影響群體具有命名、語境、參與、異議與更正權。
  7. 版本不可覆寫原則: 概念與分類修改以新版本存在,舊狀態可查詢。
  8. 可回放原則: 系統能重建任意時間點與任意方案下的分類視圖。
  9. AI 可問責原則: 模型、提示、規則與信心必須進入分類溯源。
  10. 聯邦秩序原則: 母站協調協定與映射,子站保留領域自治。

26. 核心命題

本文可以收斂為:

網路資訊海的分類不是對唯一真實結構的被動抄寫,而是由目的、領域、尺度、語言、文化與時間共同決定的知識投影。AI 可以提高分類速度與覆蓋率,但若分類結果被寫死為單一權威,便會將早期偏差高速固化為可見性、排序與歷史敘事。可靠的動態秩序化平台應保存共同事件身分與證據,同時允許多套概念方案、跨方案映射、知識持有者參與及可版本化的分類主張。分類必須能被追溯、爭議、分叉、撤回與重算,才能在秩序化與知識主權之間建立可持續平衡。

其形式為:

Oplural=IsharedSmultipleMmappingPprovenanceRreversibleGgovernance\boxed{ \mathcal{O}_{plural} = \mathcal{I}_{shared} \cdot \mathcal{S}_{multiple} \cdot \mathcal{M}_{mapping} \cdot \mathcal{P}_{provenance} \cdot \mathcal{R}_{reversible} \cdot \mathcal{G}_{governance} }

其中:

  • Ishared\mathcal{I}_{shared} :共同事件與證據身分;
  • Smultiple\mathcal{S}_{multiple} :多套概念方案;
  • Mmapping\mathcal{M}_{mapping} :跨方案映射;
  • Pprovenance\mathcal{P}_{provenance} :分類溯源;
  • Rreversible\mathcal{R}_{reversible} :版本、回放與重算;
  • Ggovernance\mathcal{G}_{governance} :參與、異議與更正程序。

若缺少其中任一項:

只有共享身分資料庫而非多視角秩序\text{只有共享身分} \rightarrow \text{資料庫而非多視角秩序} 只有多套方案碎片化而非互操作\text{只有多套方案} \rightarrow \text{碎片化而非互操作} 只有映射可能製造虛假等價\text{只有映射} \rightarrow \text{可能製造虛假等價} 只有版本可回復但未必正當\text{只有版本} \rightarrow \text{可回復但未必正當} 加入溯源、知識主權與治理可持續的多視角知識秩序\text{加入溯源、知識主權與治理} \rightarrow \text{可持續的多視角知識秩序}

27. 與下一篇的關係

本篇建立了多套分類方案共存、分類主張化、知識主權與可逆分類。然而,當整理規模繼續上升,實際執行分類、映射與更正的將不再只是單一人類編輯或單一模型,而是大量 AI 整理者、專業 Agent、子站管理 AI 與人類社群。

下一篇將處理:

  • 多個 AI 如何對同一事件提出不同分類與摘要;
  • 模型同質性如何製造虛假共識;
  • AI 整理者之間如何交叉審查;
  • 何時應協作、競爭、辯論或保留異議;
  • 如何評估整理者的長期可靠度;
  • 如何避免單一模型供應商控制所有領域視圖;
  • 多 Agent 校正如何接入母站協調平面;
  • 人類專家與來源社群如何保有有效介入權。

因此下一篇為:

《多 AI 整理者:協作、競爭、異議與相互校正》


參考資料

[1] W3C, “SKOS Simple Knowledge Organization System Reference,” W3C Recommendation, 18 August 2009. 定義 Concept、Concept Scheme、語義關係、映射關係,以及 changeNotehistoryNote 等知識組織與變更文件語彙。https://www.w3.org/TR/skos-reference/

[2] W3C, “SKOS Simple Knowledge Organization System Primer,” W3C Working Group Note, 18 August 2009. 說明概念方案、跨方案映射、多語標籤、概念集合與社群擴充。https://www.w3.org/TR/skos-primer/

[3] W3C, “PROV-O: The PROV Ontology,” W3C Recommendation, 30 April 2013. 提供 Entity、Activity、Agent、wasRevisionOfinvalidatedAtTimespecializationOf 等可用於分類溯源與版本治理的語彙。https://www.w3.org/TR/prov-o/

[4] DataCite, “relationType — DataCite Metadata Schema,” Schema 4.5/4.7. 定義 IsVersionOfIsNewVersionOfIsPreviousVersionOfObsoletesIsObsoletedBy 等版本與取代關係。https://datacite-metadata-schema.readthedocs.io/en/4.7/appendices/appendix-1/relationType/

[5] Global Indigenous Data Alliance, “The CARE Principles for Indigenous Data Governance.” 提出 Collective Benefit、Authority to Control、Responsibility、Ethics,並強調原住民族世界觀、自決及對資料治理的權利。https://www.gida-global.org/careprinciples

[6] UNESCO, “UNESCO Recommendation on Open Science,” adopted 2021. 將知識多樣性、包容、原住民族與地方社群的知識治理及權利納入開放科學框架。https://unesdoc.unesco.org/ark:/48223/pf0000379949

[7] UNESCO, “Consultation with Indigenous Peoples on the UNESCO Recommendation on Open Science,” 2021. 強調文化與知識多樣性、原住民族及地方知識持有者參與。https://www.unesco.org/en/articles/consultation-indigenous-peoples-unesco-recommendation-open-science

[8] Library of Congress, “Subject Headings and Genre/Form Terms.” 說明 LCSH 作為廣泛使用的主題索引語言,並提供新增與修訂提案流程。https://www.loc.gov/aba/cataloging/subject/index.html

[9] Library of Congress, “About the Subject Vocabularies Approved Lists.” 保存各類主題詞彙每月新增與修改清單,提供權威分類系統持續演化的實例。https://www.loc.gov/catdir/cpso/wlsabt.html

[10] NIST, “Artificial Intelligence Risk Management Framework 1.0,” NIST AI 100-1, 2023. 將有效可靠、安全、問責透明、可解釋、隱私與公平及有害偏誤管理列為可信 AI 特徵。https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-ai-rmf-10

[11] NIST, “AI Risk Management Framework FAQs.” 說明 AI RMF 對個人、組織、社會與環境風險,以及公平、有害偏誤、透明與問責的治理目標。https://www.nist.gov/itl/ai-risk-management-framework/ai-risk-management-framework-faqs

[12] AGIRight.org, “Topics,” accessed 2026-07-31. 現行介面包含多主題標籤、來源、日期、摘要、篩選、原文連結與 JSON 匯出,可作為領域多標籤觀測站的早期案例。https://agiright.org/topics


版本紀錄

版本 日期 狀態 說明
0.1.0 2026-07-31 公開初稿 建立分類投影模型、共享身分與分離投影、分類主張資料結構、多概念方案與跨方案映射、知識主權限定定義、可逆分類、分類分叉、AI 分類溯源、偏差回饋、每日三則多視角選擇、AGIRight 最小實作起點、分類協調平面、治理流程、品質指標與成熟度階梯。