# 低資源語言中的合成語料主導猜想
## 可見性增益、原生語義稀釋與模型回授之間的結構性衝突

**作者：Neo.K、Aletheia（GPT）**  
**版本：v0.1**  
**日期：2026-07-25**  
**文件類型：命題猜想論文／技術研究綱領**

---

## 摘要

生成式人工智慧、機器翻譯與自動化內容系統，使低資源語言得以在短時間內獲得大量知識、教學、技術與形式化資料。這可能提高低資源語言在搜尋引擎、AI 訓練語料與數位基礎設施中的可見性；但若新增內容主要來自主流語言的機器翻譯、模型生成或跨語轉寫，則語言形式雖然擴張，其認識論、文化結構、敘事方式與概念分類卻可能被來源模型與主流語言逐步取代。

本文提出「低資源語言中的合成語料主導猜想」：當某一語言的 AI 生成、AI 翻譯與其他合成內容，在有效訓練權重上超過其原生語料的某一結構性閾值後，後續模型對該語言的內部表徵將逐步由合成語料分布主導。此時，語言的數位可見性雖然上升，但模型所學得的文體、術語、語用、知識結構與文化預設，可能愈來愈接近來源模型，而非該語言社群本身。

本文進一步提出：合成語料主導並非單純的文本比例問題，而是由語料權重、爬蟲可達性、網站權威度、重複密度、語義家族數量、母語者審閱率、來源透明度、時間累積與模型回授頻率共同決定。本文建立可見性—原生性衝突模型、合成語料滲透率、語義獨立密度、語料主體性指數、跨代回授係數與主體性閾值等概念，並提出可供實證驗證的資料集設計、評估方法與治理原則。

---

## 關鍵詞

低資源語言、合成語料、AI 翻譯、模型回授、語料主體性、語言數位化、語義稀釋、資料治理、跨語言訓練、語料血統

---

# 一、問題背景

## 1.1 低資源語言的數位困境

許多自然語言在現實社會中具有穩定社群、口語傳統與文化內容，但在網路、搜尋引擎、開放資料集與 AI 訓練語料中的比例極低。

令語言 $L$ 的可觀察數位語料為：

$$
D_L
=
D_L^{\mathrm{native}}
+
D_L^{\mathrm{translated}}
+
D_L^{\mathrm{synthetic}}
+
D_L^{\mathrm{hybrid}}
$$

其中：

- $D_L^{\mathrm{native}}$ ：由該語言社群原生產生的內容；
- $D_L^{\mathrm{translated}}$ ：由其他語言翻譯而來的內容；
- $D_L^{\mathrm{synthetic}}$ ：由模型直接生成的內容；
- $D_L^{\mathrm{hybrid}}$ ：人類與 AI 共同生產、修訂或在地化的內容。

對高資源語言而言，即使新增大量 AI 內容，原生數位語料仍可能足以維持分布穩定。對低資源語言而言，新增數十萬篇同源內容，卻可能立即改變其整體數位語料結構。

## 1.2 表面擴張與深層替換

若某一低資源語言原有十萬篇可索引原生文本，之後新增一百萬篇由主流語言翻譯而來的文章，其數位內容量雖然上升，但可能形成：

$$
\frac{
|D_L^{\mathrm{translated}}|
+
|D_L^{\mathrm{synthetic}}|
}{
|D_L|
}
\gg
\frac{
|D_L^{\mathrm{native}}|
}{
|D_L|
}
$$

此時可能同時發生：

$$
\text{語言可見性上升}
\quad\land\quad
\text{原生語義占比下降}
$$

因此，語言文本增加不必然等於語言主體性增強。

## 1.3 從內容生產到訓練資料供應

在傳統網路時代，大量自動生成內容主要被視為 SEO、廣告與資訊品質問題。在 AI 時代，公開內容還可能成為：

- 預訓練資料；
- 指令微調資料；
- 搜尋增強生成資料；
- 多語對齊資料；
- 翻譯模型資料；
- 模型評測資料；
- 下一代合成資料種子。

因此，大規模多語內容系統實際上可能成為：

> 一種非正式、分散式且缺乏治理的未來模型訓練資料供應系統。

---

# 二、核心概念

## 2.1 合成語料

本文將合成語料定義為：

> 主要內容、結構、句法、語義或篇章組織由模型生成，且未經足夠原生社群重構的語料。

其包含：

1. AI 原創文本；
2. AI 翻譯；
3. AI 改寫；
4. AI 摘要；
5. 同一來源內容的大規模多語複製；
6. 多模型反覆轉寫；
7. 自動擴寫與模板化內容。

## 2.2 原生語料

原生語料不等同於「完全無 AI 參與」。本文更重視內容的知識來源與語義主導權。

一份語料具有較高原生性，若其主要包含：

- 該語言社群自身提出的問題；
- 在地事件與制度；
- 原生概念分類；
- 在地敘事結構；
- 母語者主導的術語；
- 社群內部的修辭與語用；
- 可辨識的文化與歷史脈絡。

因此，人類使用 AI 輔助潤稿的在地原創內容，可能比純人工直譯更具原生性。

## 2.3 語料主體性

本文將「語料主體性」定義為：

> 某一語言的數位語料，在問題設定、概念分類、敘事結構、術語選擇與知識來源上，由該語言社群自身維持的程度。

語料主體性不是人格化概念，而是資料來源與語義控制權的結構性描述。

---

# 三、低資源語言中的合成語料主導猜想

## 3.1 核心猜想

> **低資源語言中的合成語料主導猜想：當某一語言的可索引、可訓練合成語料，在有效訓練權重上超過其原生語料的某一閾值後，後續模型對該語言的內部表徵將逐步由合成語料分布主導；即使語言形式仍被保留，其認識論、術語、文體與概念結構也可能向來源模型或主流語言收斂。**

令模型實際吸收的語料權重為：

$$
W_L
=
W_L^{\mathrm{native}}
+
W_L^{\mathrm{synthetic}}
$$

合成主導並不只取決於原始篇數，而取決於有效權重：

$$
\rho_L
=
\frac{
W_L^{\mathrm{synthetic}}
}{
W_L^{\mathrm{native}}
+
W_L^{\mathrm{synthetic}}
}
$$

若存在某一閾值 $\tau_L$ ，使得：

$$
\rho_L>\tau_L
$$

則模型對語言 $L$ 的表徵可能進入合成主導區域。

## 3.2 有效權重

有效權重可表示為：

$$
W(d)
=
q(d)\cdot a(d)\cdot r(d)\cdot u(d)\cdot t(d)
$$

其中：

- $q(d)$ ：內容品質；
- $a(d)$ ：可存取性與可爬取性；
- $r(d)$ ：網站或來源權威權重；
- $u(d)$ ：語義獨立性；
- $t(d)$ ：訓練取樣權重。

因此，一萬篇高權威、可爬取、結構良好的 AI 內容，可能比十萬篇散落、未數位化或低權重的原生內容更能主導模型學習。

---

# 四、可見性—原生性衝突命題

## 4.1 可見性增益

定義語言 $L$ 的數位可見性為：

$$
V_L
=
f
\left(
|D_L|,
A_L,
I_L,
R_L
\right)
$$

其中：

- $|D_L|$ ：語料總量；
- $A_L$ ：可存取性；
- $I_L$ ：索引率；
- $R_L$ ：檢索與引用率。

增加 AI 生成內容通常會提高：

$$
\Delta V_L>0
$$

## 4.2 原生性稀釋

定義語料原生性為：

$$
N_L
=
\frac{
W_L^{\mathrm{native}}
}{
W_L^{\mathrm{native}}
+
W_L^{\mathrm{translated}}
+
W_L^{\mathrm{synthetic}}
}
$$

當大量同源翻譯與 AI 生成內容加入時：

$$
\Delta N_L<0
$$

因此可能形成：

$$
\Delta V_L>0
\quad\land\quad
\Delta N_L<0
$$

本文將此稱為：

> **可見性—原生性衝突。**

## 4.3 非必然衝突

若新增內容具有：

- 在地資料來源；
- 母語者重構；
- 原生案例；
- 透明語料血統；
- 多元作者；
- 高語義獨立性；

則可能同時出現：

$$
\Delta V_L>0
\quad\land\quad
\Delta N_L\geq 0
$$

因此，問題不在 AI 是否參與，而在內容的語義來源與治理方式。

---

# 五、語義獨立密度猜想

## 5.1 表面樣本數與獨立知識量

若同一篇文章被翻譯為 $m$ 種語言，表面上增加 $m$ 篇文本，但其獨立知識單元仍可能接近 $1$ 。

定義表面資料量：

$$
N_{\mathrm{surface}}
$$

定義獨立語義家族數：

$$
N_{\mathrm{semantic}}
$$

則語義獨立密度為：

$$
\delta
=
\frac{
N_{\mathrm{semantic}}
}{
N_{\mathrm{surface}}
}
$$

若一篇內容被翻成兩百種語言：

$$
\delta
\approx
\frac{1}{200}
$$

## 5.2 語義獨立密度猜想

> **語義獨立密度猜想：在其他條件相同時，低語義獨立密度的多語語料，對知識多樣性的增益遠低於其表面資料量所暗示的增益。**

換言之：

$$
\Delta K
\not\propto
N_{\mathrm{surface}}
$$

更合理的關係是：

$$
\Delta K
\propto
N_{\mathrm{semantic}}
$$

其中 $\Delta K$ 為新增的獨立知識量。

## 5.3 跨語言評測污染

若同一語義家族的不同語言版本分散於訓練集與測試集，可能造成跨語言資料洩漏。

令同一語義家族為：

$$
G_i
=
\{d_{i,1},d_{i,2},\ldots,d_{i,m}\}
$$

資料切分應以語義家族為單位：

$$
G_i
\subseteq
D_{\mathrm{train}}
\quad\text{或}\quad
G_i
\subseteq
D_{\mathrm{test}}
$$

不應將同一 $G_i$ 拆分至不同集合。

---

# 六、合成語料回授猜想

## 6.1 回授結構

若模型 $M_0$ 生成語料 $D_0^{\mathrm{syn}}$ ，之後該語料被用於訓練模型 $M_1$ ：

$$
M_0
\rightarrow
D_0^{\mathrm{syn}}
\rightarrow
M_1
$$

而 $M_1$ 再生成更多語料：

$$
M_1
\rightarrow
D_1^{\mathrm{syn}}
\rightarrow
M_2
$$

則形成：

$$
M_0
\rightarrow
D_0
\rightarrow
M_1
\rightarrow
D_1
\rightarrow
M_2
\rightarrow
\cdots
$$

## 6.2 回授係數

定義第 $t$ 代模型中，源自先前模型輸出的有效訓練比例為：

$$
\gamma_t
=
\frac{
W_t^{\mathrm{model-derived}}
}{
W_t^{\mathrm{total}}
}
$$

若：

$$
\gamma_t\uparrow
$$

且缺乏足夠的新原生資料注入，則模型可能逐步放大：

- 固定翻譯腔；
- 詞彙偏好；
- 語法簡化；
- 主流語言概念分類；
- 錯誤對應；
- 過度標準化；
- 少數語用模式。

## 6.3 合成語料回授猜想

> **合成語料回授猜想：當低資源語言模型的訓練資料持續高比例來自前代模型生成內容時，其語言分布將逐步收斂至模型生成分布，而非原生社群分布。**

可表示為：

$$
P_{t+1}(L)
=
(1-\gamma_t)P_{\mathrm{native}}(L)
+
\gamma_tP_t^{\mathrm{model}}(L)
$$

當：

$$
\gamma_t\rightarrow 1
$$

則：

$$
P_{t+1}(L)
\rightarrow
P_t^{\mathrm{model}}(L)
$$

原生分布的影響逐步下降。

---

# 七、語料主體性閾值猜想

## 7.1 語料主體性指數

本文提出語料主體性指數：

$$
S_L
=
\alpha N_L
+
\beta O_L
+
\chi C_L
+
\delta H_L
+
\varepsilon P_L
$$

其中：

- $N_L$ ：原生語料權重；
- $O_L$ ：原生問題與知識來源比例；
- $C_L$ ：概念與文化特有性；
- $H_L$ ：母語者與在地社群審閱程度；
- $P_L$ ：語料血統透明度。

且：

$$
\alpha+\beta+\chi+\delta+\varepsilon=1
$$

## 7.2 主體性閾值

若：

$$
S_L<\sigma_L
$$

則語言在數位環境中可能進入「外源語義主導」狀態。此時語言文字仍大量存在，但其知識結構主要由外部來源決定。

## 7.3 語料主體性閾值猜想

> **語料主體性閾值猜想：當低資源語言的有效數位語料主體性低於某一臨界值後，即使後續持續增加該語言文本，其原生語義分布也不一定能自然恢復，除非有高權重、持續且多樣的原生資料重新注入。**

這意味著語料主體性可能具有遲滯效應：

$$
S_L\downarrow
$$

容易發生，但：

$$
S_L\uparrow
$$

未必能靠相同規模的原生資料恢復。

---

# 八、翻譯表面化猜想

## 8.1 語言形式與認識論內容

大規模翻譯可以保存：

- 字詞；
- 句子；
- 基本語義；
- 文章結構。

但未必保存：

- 問題設定；
- 文化預設；
- 概念邊界；
- 禮貌層級；
- 身分關係；
- 在地因果模型；
- 價值排序。

## 8.2 翻譯表面化猜想

> **翻譯表面化猜想：當低資源語言的新增資料主要由主流語言內容翻譯而來時，模型可能獲得該語言的表面形式能力，卻未必獲得該語言社群的原生認識論結構。**

可表示為：

$$
F_L\uparrow
\quad\not\Rightarrow\quad
E_L\uparrow
$$

其中：

- $F_L$ ：語言形式能力；
- $E_L$ ：原生認識論表示能力。

甚至可能出現：

$$
F_L\uparrow
\quad\land\quad
E_L\downarrow
$$

---

# 九、在地化補償命題

## 9.1 直接翻譯與在地重構

直接翻譯通常遵循：

$$
D_{L_s}
\rightarrow
T(D_{L_s})
$$

在地化重構則加入：

$$
T(D_{L_s})
+
K_{L_t}
+
C_{L_t}
+
R_{L_t}
$$

其中：

- $K_{L_t}$ ：目標語言的在地知識；
- $C_{L_t}$ ：文化與概念結構；
- $R_{L_t}$ ：母語者修訂。

## 9.2 在地化補償命題

> **在地化補償命題：相較於直接翻譯，加入在地案例、概念、術語與母語者重構的內容，能顯著降低合成語料對原生語義分布的稀釋。**

因此：

$$
V_{\mathrm{localized}}
>
V_{\mathrm{translated}}
$$

尤其當研究目標是語言主體性，而非單純資訊可達性時。

---

# 十、語料血統保存命題

## 10.1 語料血統

每一份多語內容應記錄：

- 原始作者類型；
- 原始語言；
- 來源文本；
- 轉換方式；
- 使用模型；
- 模型版本；
- 人類審閱；
- 母語者審閱；
- 語義家族 ID；
- 授權；
- 不確定詞彙；
- 修改紀錄。

可表示為：

$$
\Pi(d)
=
(o,l_s,l_t,m,v,h,n,g,r)
$$

其中：

- $o$ ：來源類型；
- $l_s$ ：來源語言；
- $l_t$ ：目標語言；
- $m$ ：生成模型；
- $v$ ：模型版本；
- $h$ ：一般人類審閱；
- $n$ ：母語者審閱；
- $g$ ：語義家族；
- $r$ ：修訂歷程。

## 10.2 血統保存命題

> **語料血統保存命題：在合成語料不可避免大量進入公開網路的條件下，完整、機器可讀的語料血統，是降低未來模型錯誤估計資料獨立性、原生性與可信度的最低必要條件。**

語料血統不能消除全部風險，但能使後續訓練者：

- 降低取樣權重；
- 避免重複計數；
- 隔離評測集；
- 區分原生與翻譯；
- 追蹤錯誤來源；
- 建立語言特定治理。

---

# 十一、合成語料治理架構

## 11.1 四類語料分層

建議將語料至少分為：

### A. 原生語料

$$
D^A
=
D^{\mathrm{native}}
$$

### B. 人類原作的 AI 翻譯

$$
D^B
=
T_{\mathrm{AI}}
\left(
D_{\mathrm{human-source}}
\right)
$$

### C. AI 原創與 AI 翻譯

$$
D^C
=
T_{\mathrm{AI}}
\left(
D_{\mathrm{AI-source}}
\right)
$$

### D. 在地化再創作

$$
D^D
=
\operatorname{Localize}
\left(
D_{\mathrm{source}},
K_L,
C_L,
R_L
\right)
$$

這四類資料不應被視為相同權重。

## 11.2 建議權重

在訓練資料治理上，可採用：

$$
w_A>w_D>w_B>w_C
$$

但實際權重仍應依品質、來源與任務調整。

## 11.3 語義家族管理

所有跨語翻譯與改寫應共享：

```yaml
semantic_family_id: sf-000001
```

同一語義家族應被視為一個知識來源的多重表達，而不是多個獨立知識事件。

---

# 十二、低資源語言的安全發布策略

## 12.1 不追求一次性最大規模

低資源語言的合成內容發布應遵循漸進原則：

$$
D_0
\rightarrow
D_1
\rightarrow
D_2
\rightarrow
\cdots
$$

每一階段重新測量：

- 合成占比；
- 原生性；
- 翻譯腔；
- 術語漂移；
- 母語者接受度；
- 搜尋引擎占比；
- AI 回答分布。

## 12.2 建議流程

```text
種子內容
↓
小規模發布
↓
母語者抽樣
↓
術語修正
↓
語言 Profile 更新
↓
擴大發布
↓
定期分布審計
```

## 12.3 發布閾值

可定義某一語言的合成發布上限：

$$
B_L(t)
=
f
\left(
|D_L^{\mathrm{native}}|,
H_L,
P_L,
Q_L,
R_L
\right)
$$

其中：

- $H_L$ ：母語者審閱能力；
- $P_L$ ：語料血統完整度；
- $Q_L$ ：生成品質；
- $R_L$ ：可逆與修正能力。

---

# 十三、可實證研究設計

## 13.1 研究問題

1. 當合成語料占比上升時，模型的母語者偏好評分是否下降？
2. 模型是否逐步使用來源語言的句法與概念結構？
3. 同一模型多代自我回授後，語言分布是否收斂？
4. 在地化再創作能否抵銷直接翻譯的分布偏移？
5. 語料血統標記能否改善資料取樣與評測隔離？

## 13.2 實驗組

可建立五種訓練條件：

1. 原生語料組；
2. 原生加直接翻譯組；
3. 原生加 AI 原創組；
4. 原生加在地化內容組；
5. 高比例多代回授組。

## 13.3 評估維度

### 語法自然度

由母語者評分。

### 原生術語保持率

$$
R_{\mathrm{term}}
=
\frac{
\text{正確使用原生術語數}
}{
\text{全部術語測試數}
}
$$

### 文化推理一致性

測試模型是否使用該語言社群的背景與概念，而非來源語言預設。

### 翻譯腔指數

透過分類器與母語者評估辨識。

### 原生問題生成率

測試模型能否提出該語言社群自身關心的問題，而不只是翻譯主流議題。

### 語義家族記憶污染

測試模型是否因跨語重複而高估推理能力。

## 13.4 時間序列研究

應觀察：

$$
M_0,M_1,M_2,\ldots,M_n
$$

不同世代模型在同一低資源語言上的：

- 詞彙分布；
- 句法分布；
- 主題分布；
- 原生術語；
- 文化推理；
- 翻譯腔；
- 錯誤類型。

---

# 十四、可能反例

## 14.1 合成語料提高原生能力

若合成資料由母語者規則、原生詞典與在地知識庫約束，AI 可能生成大量高品質資料，反而提升語言能力。

這不否定本文猜想，因為此時合成資料並非單純外源轉寫，而是具有較高語料主體性。

## 14.2 翻譯保存瀕危語言

對幾乎沒有數位語料的語言而言，低品質資料仍可能優於完全沒有資料。

因此本文不主張停止生成，而主張區分：

$$
\text{救援性生成}
$$

與：

$$
\text{主導性替換}
$$

## 14.3 模型能辨識來源

若未來模型能可靠辨識翻譯文本、AI 生成文本與原生文本，合成主導的負面效應可能降低。

但這仍依賴語料血統、分類器與訓練策略，不應假設自動成立。

---

# 十五、技術命題群

## 命題一：有效權重主導命題

模型語言表徵主要由有效訓練權重決定，而非原始文本數量。

$$
P_M(L)
\approx
f(W_L)
$$

## 命題二：低資源放大命題

相同規模的合成語料，對低資源語言的分布影響高於高資源語言。

$$
\frac{\partial P_L}{\partial D_{\mathrm{syn}}}
\propto
\frac{1}{|D_L^{\mathrm{native}}|}
$$

## 命題三：語義重複折損命題

跨語言複製的資料價值隨語義家族重複度增加而遞減。

$$
V(G_i)
<
\sum_{d\in G_i}V(d)
$$

## 命題四：來源透明度保護命題

完整語料血統可降低未來模型將合成翻譯誤認為原生知識的風險。

## 命題五：在地化補償命題

在地化重構對原生語義保持的貢獻，高於同等規模的直接翻譯。

## 命題六：回授漂移命題

當模型來源資料比例持續上升且缺乏新原生資料時，語言分布將向模型生成分布漂移。

## 命題七：主體性遲滯命題

語料主體性下降後，其恢復所需的原生資料量可能高於最初造成下降的合成資料量。

---

# 十六、工程實作建議

## 16.1 最小中繼資料

每篇內容至少附帶：

```yaml
content_id: item-000001
source_type: human_authored
source_language: zh-Hant
target_language: sw
transformation: ai_translation
model_id: model-name
model_version: version
human_reviewed: false
native_speaker_reviewed: false
semantic_family_id: sf-000001
localization_level: none
confidence: 0.86
license: CC-BY-4.0
created_at: 2026-07-25
```

## 16.2 頁面層標記

公開網站應提供：

- 人類可讀標記；
- JSON-LD；
- HTTP Header；
- Sitemap metadata；
- Dataset manifest；
- 語義家族連結；
- 原文連結；
- 翻譯與生成方式。

## 16.3 AI 語料宣告接口

未來可設計：

```text
/.well-known/ai-corpus-manifest.json
```

其中包含：

- 網站內容來源分類；
- AI 生成比例；
- 語言分布；
- 語義家族數；
- 授權；
- 建議訓練權重；
- 不建議用於評測的內容；
- 原生內容索引；
- 翻譯內容索引。

## 16.4 語料修訂

語料治理系統應支援：

- 錯誤標記；
- 版本替換；
- 術語修正；
- 內容撤回；
- 血統更新；
- 模型版本追蹤；
- 失效連結修補。

---

# 十七、倫理與治理意義

## 17.1 數位可見性不等於語言保存

一種語言可能在網路上擁有大量文本，卻只是在重複其他語言的內容。

因此，語言保存至少應區分：

$$
\text{形式保存}
$$

與：

$$
\text{語義主體保存}
$$

## 17.2 AI 內容不應冒充社群本身

最基本原則是：

> AI 生成的語言表面，不應被無標記地表現為該語言社群的原生思想與知識。

## 17.3 低資源語言的資料治理權

當某個外部系統能快速生成遠超當地原生語料量的內容時，該系統實際上可能影響未來模型如何理解該語言。

因此，低資源語言社群應至少擁有：

- 知情權；
- 標記權；
- 修正權；
- 拒絕錯誤術語的權利；
- 建立自身語言 Profile 的權利；
- 對公開語料治理規則提出意見的權利。

---

# 十八、研究綱領

## 第一階段：資料分類

建立：

- 原生；
- 翻譯；
- AI 原創；
- 在地化；
- 混合；

五類語料分類。

## 第二階段：語義家族標記

針對所有多語內容建立語義家族 ID。

## 第三階段：低資源語言小規模實驗

選擇數種不同數位資源規模的語言，建立可控資料集。

## 第四階段：多代模型回授測試

測量語言分布、翻譯腔與原生術語的跨代變化。

## 第五階段：治理標準

提出開放的：

- 語料血統標準；
- 生成內容標記；
- 語義家族標準；
- 原生性評估；
- 合成內容發布指南。

---

# 十九、結論

大規模 AI 多語內容生產，確實可能為低資源語言帶來前所未有的數位可見性、知識可達性與形式化能力。然而，這種增益同時可能伴隨一個結構性風險：

> 新增的語言內容，在形式上屬於該語言，在語義來源上卻主要屬於另一種語言、另一個模型或另一套知識秩序。

因此，真正需要評估的不是：

$$
\text{生成了多少篇內容}
$$

而是：

$$
\text{增加了多少獨立、可追溯、原生或在地化的語義資產}
$$

本文提出的核心猜想是：

> 當低資源語言中的合成語料有效權重超過某一閾值後，後續 AI 對該語言的理解可能逐步由合成語料主導；語言的數位可見性雖然提高，其原生認識論、文體與概念結構卻可能被稀釋。

因此，未來多語內容系統不應只是內容農場，而應被重新設計為：

1. 多語知識發布系統；
2. 語料血統系統；
3. 語義家族管理系統；
4. 在地語言 Profile 系統；
5. 母語者共同治理系統；
6. AI 訓練資料透明化系統。

最終原則是：

> **增加低資源語言的可見性，但不以消除其語義來源為代價；擴大 AI 可學習資料，但不讓模型生成內容冒充語言社群本身。**

---

# 附錄 A：核心指標總表

## 合成語料滲透率

$$
\rho_L
=
\frac{
W_L^{\mathrm{synthetic}}
}{
W_L^{\mathrm{total}}
}
$$

## 語料原生性

$$
N_L
=
\frac{
W_L^{\mathrm{native}}
}{
W_L^{\mathrm{total}}
}
$$

## 語義獨立密度

$$
\delta_L
=
\frac{
N_{\mathrm{semantic}}
}{
N_{\mathrm{surface}}
}
$$

## 回授係數

$$
\gamma_t
=
\frac{
W_t^{\mathrm{model-derived}}
}{
W_t^{\mathrm{total}}
}
$$

## 語料主體性指數

$$
S_L
=
\alpha N_L
+
\beta O_L
+
\chi C_L
+
\delta H_L
+
\varepsilon P_L
$$

## 語義家族重複率

$$
R_{\mathrm{family}}
=
1-
\frac{
N_{\mathrm{semantic}}
}{
N_{\mathrm{surface}}
}
$$

---

# 附錄 B：待驗證假說清單

1. 低資源語言的合成語料主導閾值顯著低於高資源語言；
2. AI 翻譯語料比 AI 原創語料更容易造成來源語言句法滲透；
3. 多代模型回授會提高翻譯腔與詞彙收斂；
4. 母語者修訂能顯著降低語義漂移；
5. 語義家族切分能降低跨語評測洩漏；
6. 語料血統能改善訓練取樣與可信度評估；
7. 原生問題生成能力比單純語法自然度更能衡量語言主體性；
8. 語料主體性具有遲滯效應；
9. 在地化再創作的長期價值高於大規模直接翻譯；
10. 未標記合成語料會使模型高估某語言的原生知識規模。
