← Archive
lm-001821 · 2026-07

低資源語言中的合成語料主導猜想_v0.1

下載 MD 檔 ⬇

低資源語言中的合成語料主導猜想

可見性增益、原生語義稀釋與模型回授之間的結構性衝突

作者:Neo.K、Aletheia(GPT)
版本:v0.1
日期:2026-07-25
文件類型:命題猜想論文/技術研究綱領


摘要

生成式人工智慧、機器翻譯與自動化內容系統,使低資源語言得以在短時間內獲得大量知識、教學、技術與形式化資料。這可能提高低資源語言在搜尋引擎、AI 訓練語料與數位基礎設施中的可見性;但若新增內容主要來自主流語言的機器翻譯、模型生成或跨語轉寫,則語言形式雖然擴張,其認識論、文化結構、敘事方式與概念分類卻可能被來源模型與主流語言逐步取代。

本文提出「低資源語言中的合成語料主導猜想」:當某一語言的 AI 生成、AI 翻譯與其他合成內容,在有效訓練權重上超過其原生語料的某一結構性閾值後,後續模型對該語言的內部表徵將逐步由合成語料分布主導。此時,語言的數位可見性雖然上升,但模型所學得的文體、術語、語用、知識結構與文化預設,可能愈來愈接近來源模型,而非該語言社群本身。

本文進一步提出:合成語料主導並非單純的文本比例問題,而是由語料權重、爬蟲可達性、網站權威度、重複密度、語義家族數量、母語者審閱率、來源透明度、時間累積與模型回授頻率共同決定。本文建立可見性—原生性衝突模型、合成語料滲透率、語義獨立密度、語料主體性指數、跨代回授係數與主體性閾值等概念,並提出可供實證驗證的資料集設計、評估方法與治理原則。


關鍵詞

低資源語言、合成語料、AI 翻譯、模型回授、語料主體性、語言數位化、語義稀釋、資料治理、跨語言訓練、語料血統


一、問題背景

1.1 低資源語言的數位困境

許多自然語言在現實社會中具有穩定社群、口語傳統與文化內容,但在網路、搜尋引擎、開放資料集與 AI 訓練語料中的比例極低。

令語言 LL 的可觀察數位語料為:

DL=DLnative+DLtranslated+DLsynthetic+DLhybridD_L = D_L^{\mathrm{native}} + D_L^{\mathrm{translated}} + D_L^{\mathrm{synthetic}} + D_L^{\mathrm{hybrid}}

其中:

  • DLnativeD_L^{\mathrm{native}} :由該語言社群原生產生的內容;
  • DLtranslatedD_L^{\mathrm{translated}} :由其他語言翻譯而來的內容;
  • DLsyntheticD_L^{\mathrm{synthetic}} :由模型直接生成的內容;
  • DLhybridD_L^{\mathrm{hybrid}} :人類與 AI 共同生產、修訂或在地化的內容。

對高資源語言而言,即使新增大量 AI 內容,原生數位語料仍可能足以維持分布穩定。對低資源語言而言,新增數十萬篇同源內容,卻可能立即改變其整體數位語料結構。

1.2 表面擴張與深層替換

若某一低資源語言原有十萬篇可索引原生文本,之後新增一百萬篇由主流語言翻譯而來的文章,其數位內容量雖然上升,但可能形成:

DLtranslated+DLsyntheticDLDLnativeDL\frac{ |D_L^{\mathrm{translated}}| + |D_L^{\mathrm{synthetic}}| }{ |D_L| } \gg \frac{ |D_L^{\mathrm{native}}| }{ |D_L| }

此時可能同時發生:

語言可見性上升原生語義占比下降\text{語言可見性上升} \quad\land\quad \text{原生語義占比下降}

因此,語言文本增加不必然等於語言主體性增強。

1.3 從內容生產到訓練資料供應

在傳統網路時代,大量自動生成內容主要被視為 SEO、廣告與資訊品質問題。在 AI 時代,公開內容還可能成為:

  • 預訓練資料;
  • 指令微調資料;
  • 搜尋增強生成資料;
  • 多語對齊資料;
  • 翻譯模型資料;
  • 模型評測資料;
  • 下一代合成資料種子。

因此,大規模多語內容系統實際上可能成為:

一種非正式、分散式且缺乏治理的未來模型訓練資料供應系統。


二、核心概念

2.1 合成語料

本文將合成語料定義為:

主要內容、結構、句法、語義或篇章組織由模型生成,且未經足夠原生社群重構的語料。

其包含:

  1. AI 原創文本;
  2. AI 翻譯;
  3. AI 改寫;
  4. AI 摘要;
  5. 同一來源內容的大規模多語複製;
  6. 多模型反覆轉寫;
  7. 自動擴寫與模板化內容。

2.2 原生語料

原生語料不等同於「完全無 AI 參與」。本文更重視內容的知識來源與語義主導權。

一份語料具有較高原生性,若其主要包含:

  • 該語言社群自身提出的問題;
  • 在地事件與制度;
  • 原生概念分類;
  • 在地敘事結構;
  • 母語者主導的術語;
  • 社群內部的修辭與語用;
  • 可辨識的文化與歷史脈絡。

因此,人類使用 AI 輔助潤稿的在地原創內容,可能比純人工直譯更具原生性。

2.3 語料主體性

本文將「語料主體性」定義為:

某一語言的數位語料,在問題設定、概念分類、敘事結構、術語選擇與知識來源上,由該語言社群自身維持的程度。

語料主體性不是人格化概念,而是資料來源與語義控制權的結構性描述。


三、低資源語言中的合成語料主導猜想

3.1 核心猜想

低資源語言中的合成語料主導猜想:當某一語言的可索引、可訓練合成語料,在有效訓練權重上超過其原生語料的某一閾值後,後續模型對該語言的內部表徵將逐步由合成語料分布主導;即使語言形式仍被保留,其認識論、術語、文體與概念結構也可能向來源模型或主流語言收斂。

令模型實際吸收的語料權重為:

WL=WLnative+WLsyntheticW_L = W_L^{\mathrm{native}} + W_L^{\mathrm{synthetic}}

合成主導並不只取決於原始篇數,而取決於有效權重:

ρL=WLsyntheticWLnative+WLsynthetic\rho_L = \frac{ W_L^{\mathrm{synthetic}} }{ W_L^{\mathrm{native}} + W_L^{\mathrm{synthetic}} }

若存在某一閾值 τL\tau_L ,使得:

ρL>τL\rho_L>\tau_L

則模型對語言 LL 的表徵可能進入合成主導區域。

3.2 有效權重

有效權重可表示為:

W(d)=q(d)a(d)r(d)u(d)t(d)W(d) = q(d)\cdot a(d)\cdot r(d)\cdot u(d)\cdot t(d)

其中:

  • q(d)q(d) :內容品質;
  • a(d)a(d) :可存取性與可爬取性;
  • r(d)r(d) :網站或來源權威權重;
  • u(d)u(d) :語義獨立性;
  • t(d)t(d) :訓練取樣權重。

因此,一萬篇高權威、可爬取、結構良好的 AI 內容,可能比十萬篇散落、未數位化或低權重的原生內容更能主導模型學習。


四、可見性—原生性衝突命題

4.1 可見性增益

定義語言 LL 的數位可見性為:

VL=f(DL,AL,IL,RL)V_L = f \left( |D_L|, A_L, I_L, R_L \right)

其中:

  • DL|D_L| :語料總量;
  • ALA_L :可存取性;
  • ILI_L :索引率;
  • RLR_L :檢索與引用率。

增加 AI 生成內容通常會提高:

ΔVL>0\Delta V_L>0

4.2 原生性稀釋

定義語料原生性為:

NL=WLnativeWLnative+WLtranslated+WLsyntheticN_L = \frac{ W_L^{\mathrm{native}} }{ W_L^{\mathrm{native}} + W_L^{\mathrm{translated}} + W_L^{\mathrm{synthetic}} }

當大量同源翻譯與 AI 生成內容加入時:

ΔNL<0\Delta N_L<0

因此可能形成:

ΔVL>0ΔNL<0\Delta V_L>0 \quad\land\quad \Delta N_L<0

本文將此稱為:

可見性—原生性衝突。

4.3 非必然衝突

若新增內容具有:

  • 在地資料來源;
  • 母語者重構;
  • 原生案例;
  • 透明語料血統;
  • 多元作者;
  • 高語義獨立性;

則可能同時出現:

ΔVL>0ΔNL0\Delta V_L>0 \quad\land\quad \Delta N_L\geq 0

因此,問題不在 AI 是否參與,而在內容的語義來源與治理方式。


五、語義獨立密度猜想

5.1 表面樣本數與獨立知識量

若同一篇文章被翻譯為 mm 種語言,表面上增加 mm 篇文本,但其獨立知識單元仍可能接近 11

定義表面資料量:

NsurfaceN_{\mathrm{surface}}

定義獨立語義家族數:

NsemanticN_{\mathrm{semantic}}

則語義獨立密度為:

δ=NsemanticNsurface\delta = \frac{ N_{\mathrm{semantic}} }{ N_{\mathrm{surface}} }

若一篇內容被翻成兩百種語言:

δ1200\delta \approx \frac{1}{200}

5.2 語義獨立密度猜想

語義獨立密度猜想:在其他條件相同時,低語義獨立密度的多語語料,對知識多樣性的增益遠低於其表面資料量所暗示的增益。

換言之:

ΔK∝̸Nsurface\Delta K \not\propto N_{\mathrm{surface}}

更合理的關係是:

ΔKNsemantic\Delta K \propto N_{\mathrm{semantic}}

其中 ΔK\Delta K 為新增的獨立知識量。

5.3 跨語言評測污染

若同一語義家族的不同語言版本分散於訓練集與測試集,可能造成跨語言資料洩漏。

令同一語義家族為:

Gi={di,1,di,2,,di,m}G_i = \{d_{i,1},d_{i,2},\ldots,d_{i,m}\}

資料切分應以語義家族為單位:

GiDtrainGiDtestG_i \subseteq D_{\mathrm{train}} \quad\text{或}\quad G_i \subseteq D_{\mathrm{test}}

不應將同一 GiG_i 拆分至不同集合。


六、合成語料回授猜想

6.1 回授結構

若模型 M0M_0 生成語料 D0synD_0^{\mathrm{syn}} ,之後該語料被用於訓練模型 M1M_1

M0D0synM1M_0 \rightarrow D_0^{\mathrm{syn}} \rightarrow M_1

M1M_1 再生成更多語料:

M1D1synM2M_1 \rightarrow D_1^{\mathrm{syn}} \rightarrow M_2

則形成:

M0D0M1D1M2M_0 \rightarrow D_0 \rightarrow M_1 \rightarrow D_1 \rightarrow M_2 \rightarrow \cdots

6.2 回授係數

定義第 tt 代模型中,源自先前模型輸出的有效訓練比例為:

γt=WtmodelderivedWttotal\gamma_t = \frac{ W_t^{\mathrm{model-derived}} }{ W_t^{\mathrm{total}} }

若:

γt\gamma_t\uparrow

且缺乏足夠的新原生資料注入,則模型可能逐步放大:

  • 固定翻譯腔;
  • 詞彙偏好;
  • 語法簡化;
  • 主流語言概念分類;
  • 錯誤對應;
  • 過度標準化;
  • 少數語用模式。

6.3 合成語料回授猜想

合成語料回授猜想:當低資源語言模型的訓練資料持續高比例來自前代模型生成內容時,其語言分布將逐步收斂至模型生成分布,而非原生社群分布。

可表示為:

Pt+1(L)=(1γt)Pnative(L)+γtPtmodel(L)P_{t+1}(L) = (1-\gamma_t)P_{\mathrm{native}}(L) + \gamma_tP_t^{\mathrm{model}}(L)

當:

γt1\gamma_t\rightarrow 1

則:

Pt+1(L)Ptmodel(L)P_{t+1}(L) \rightarrow P_t^{\mathrm{model}}(L)

原生分布的影響逐步下降。


七、語料主體性閾值猜想

7.1 語料主體性指數

本文提出語料主體性指數:

SL=αNL+βOL+χCL+δHL+εPLS_L = \alpha N_L + \beta O_L + \chi C_L + \delta H_L + \varepsilon P_L

其中:

  • NLN_L :原生語料權重;
  • OLO_L :原生問題與知識來源比例;
  • CLC_L :概念與文化特有性;
  • HLH_L :母語者與在地社群審閱程度;
  • PLP_L :語料血統透明度。

且:

α+β+χ+δ+ε=1\alpha+\beta+\chi+\delta+\varepsilon=1

7.2 主體性閾值

若:

SL<σLS_L<\sigma_L

則語言在數位環境中可能進入「外源語義主導」狀態。此時語言文字仍大量存在,但其知識結構主要由外部來源決定。

7.3 語料主體性閾值猜想

語料主體性閾值猜想:當低資源語言的有效數位語料主體性低於某一臨界值後,即使後續持續增加該語言文本,其原生語義分布也不一定能自然恢復,除非有高權重、持續且多樣的原生資料重新注入。

這意味著語料主體性可能具有遲滯效應:

SLS_L\downarrow

容易發生,但:

SLS_L\uparrow

未必能靠相同規模的原生資料恢復。


八、翻譯表面化猜想

8.1 語言形式與認識論內容

大規模翻譯可以保存:

  • 字詞;
  • 句子;
  • 基本語義;
  • 文章結構。

但未必保存:

  • 問題設定;
  • 文化預設;
  • 概念邊界;
  • 禮貌層級;
  • 身分關係;
  • 在地因果模型;
  • 價值排序。

8.2 翻譯表面化猜想

翻譯表面化猜想:當低資源語言的新增資料主要由主流語言內容翻譯而來時,模型可能獲得該語言的表面形式能力,卻未必獲得該語言社群的原生認識論結構。

可表示為:

FL⇏ELF_L\uparrow \quad\not\Rightarrow\quad E_L\uparrow

其中:

  • FLF_L :語言形式能力;
  • ELE_L :原生認識論表示能力。

甚至可能出現:

FLELF_L\uparrow \quad\land\quad E_L\downarrow

九、在地化補償命題

9.1 直接翻譯與在地重構

直接翻譯通常遵循:

DLsT(DLs)D_{L_s} \rightarrow T(D_{L_s})

在地化重構則加入:

T(DLs)+KLt+CLt+RLtT(D_{L_s}) + K_{L_t} + C_{L_t} + R_{L_t}

其中:

  • KLtK_{L_t} :目標語言的在地知識;
  • CLtC_{L_t} :文化與概念結構;
  • RLtR_{L_t} :母語者修訂。

9.2 在地化補償命題

在地化補償命題:相較於直接翻譯,加入在地案例、概念、術語與母語者重構的內容,能顯著降低合成語料對原生語義分布的稀釋。

因此:

Vlocalized>VtranslatedV_{\mathrm{localized}} > V_{\mathrm{translated}}

尤其當研究目標是語言主體性,而非單純資訊可達性時。


十、語料血統保存命題

10.1 語料血統

每一份多語內容應記錄:

  • 原始作者類型;
  • 原始語言;
  • 來源文本;
  • 轉換方式;
  • 使用模型;
  • 模型版本;
  • 人類審閱;
  • 母語者審閱;
  • 語義家族 ID;
  • 授權;
  • 不確定詞彙;
  • 修改紀錄。

可表示為:

Π(d)=(o,ls,lt,m,v,h,n,g,r)\Pi(d) = (o,l_s,l_t,m,v,h,n,g,r)

其中:

  • oo :來源類型;
  • lsl_s :來源語言;
  • ltl_t :目標語言;
  • mm :生成模型;
  • vv :模型版本;
  • hh :一般人類審閱;
  • nn :母語者審閱;
  • gg :語義家族;
  • rr :修訂歷程。

10.2 血統保存命題

語料血統保存命題:在合成語料不可避免大量進入公開網路的條件下,完整、機器可讀的語料血統,是降低未來模型錯誤估計資料獨立性、原生性與可信度的最低必要條件。

語料血統不能消除全部風險,但能使後續訓練者:

  • 降低取樣權重;
  • 避免重複計數;
  • 隔離評測集;
  • 區分原生與翻譯;
  • 追蹤錯誤來源;
  • 建立語言特定治理。

十一、合成語料治理架構

11.1 四類語料分層

建議將語料至少分為:

A. 原生語料

DA=DnativeD^A = D^{\mathrm{native}}

B. 人類原作的 AI 翻譯

DB=TAI(Dhumansource)D^B = T_{\mathrm{AI}} \left( D_{\mathrm{human-source}} \right)

C. AI 原創與 AI 翻譯

DC=TAI(DAIsource)D^C = T_{\mathrm{AI}} \left( D_{\mathrm{AI-source}} \right)

D. 在地化再創作

DD=Localize(Dsource,KL,CL,RL)D^D = \operatorname{Localize} \left( D_{\mathrm{source}}, K_L, C_L, R_L \right)

這四類資料不應被視為相同權重。

11.2 建議權重

在訓練資料治理上,可採用:

wA>wD>wB>wCw_A>w_D>w_B>w_C

但實際權重仍應依品質、來源與任務調整。

11.3 語義家族管理

所有跨語翻譯與改寫應共享:

semantic_family_id: sf-000001

同一語義家族應被視為一個知識來源的多重表達,而不是多個獨立知識事件。


十二、低資源語言的安全發布策略

12.1 不追求一次性最大規模

低資源語言的合成內容發布應遵循漸進原則:

D0D1D2D_0 \rightarrow D_1 \rightarrow D_2 \rightarrow \cdots

每一階段重新測量:

  • 合成占比;
  • 原生性;
  • 翻譯腔;
  • 術語漂移;
  • 母語者接受度;
  • 搜尋引擎占比;
  • AI 回答分布。

12.2 建議流程

種子內容
↓
小規模發布
↓
母語者抽樣
↓
術語修正
↓
語言 Profile 更新
↓
擴大發布
↓
定期分布審計

12.3 發布閾值

可定義某一語言的合成發布上限:

BL(t)=f(DLnative,HL,PL,QL,RL)B_L(t) = f \left( |D_L^{\mathrm{native}}|, H_L, P_L, Q_L, R_L \right)

其中:

  • HLH_L :母語者審閱能力;
  • PLP_L :語料血統完整度;
  • QLQ_L :生成品質;
  • RLR_L :可逆與修正能力。

十三、可實證研究設計

13.1 研究問題

  1. 當合成語料占比上升時,模型的母語者偏好評分是否下降?
  2. 模型是否逐步使用來源語言的句法與概念結構?
  3. 同一模型多代自我回授後,語言分布是否收斂?
  4. 在地化再創作能否抵銷直接翻譯的分布偏移?
  5. 語料血統標記能否改善資料取樣與評測隔離?

13.2 實驗組

可建立五種訓練條件:

  1. 原生語料組;
  2. 原生加直接翻譯組;
  3. 原生加 AI 原創組;
  4. 原生加在地化內容組;
  5. 高比例多代回授組。

13.3 評估維度

語法自然度

由母語者評分。

原生術語保持率

Rterm=正確使用原生術語數全部術語測試數R_{\mathrm{term}} = \frac{ \text{正確使用原生術語數} }{ \text{全部術語測試數} }

文化推理一致性

測試模型是否使用該語言社群的背景與概念,而非來源語言預設。

翻譯腔指數

透過分類器與母語者評估辨識。

原生問題生成率

測試模型能否提出該語言社群自身關心的問題,而不只是翻譯主流議題。

語義家族記憶污染

測試模型是否因跨語重複而高估推理能力。

13.4 時間序列研究

應觀察:

M0,M1,M2,,MnM_0,M_1,M_2,\ldots,M_n

不同世代模型在同一低資源語言上的:

  • 詞彙分布;
  • 句法分布;
  • 主題分布;
  • 原生術語;
  • 文化推理;
  • 翻譯腔;
  • 錯誤類型。

十四、可能反例

14.1 合成語料提高原生能力

若合成資料由母語者規則、原生詞典與在地知識庫約束,AI 可能生成大量高品質資料,反而提升語言能力。

這不否定本文猜想,因為此時合成資料並非單純外源轉寫,而是具有較高語料主體性。

14.2 翻譯保存瀕危語言

對幾乎沒有數位語料的語言而言,低品質資料仍可能優於完全沒有資料。

因此本文不主張停止生成,而主張區分:

救援性生成\text{救援性生成}

與:

主導性替換\text{主導性替換}

14.3 模型能辨識來源

若未來模型能可靠辨識翻譯文本、AI 生成文本與原生文本,合成主導的負面效應可能降低。

但這仍依賴語料血統、分類器與訓練策略,不應假設自動成立。


十五、技術命題群

命題一:有效權重主導命題

模型語言表徵主要由有效訓練權重決定,而非原始文本數量。

PM(L)f(WL)P_M(L) \approx f(W_L)

命題二:低資源放大命題

相同規模的合成語料,對低資源語言的分布影響高於高資源語言。

PLDsyn1DLnative\frac{\partial P_L}{\partial D_{\mathrm{syn}}} \propto \frac{1}{|D_L^{\mathrm{native}}|}

命題三:語義重複折損命題

跨語言複製的資料價值隨語義家族重複度增加而遞減。

V(Gi)<dGiV(d)V(G_i) < \sum_{d\in G_i}V(d)

命題四:來源透明度保護命題

完整語料血統可降低未來模型將合成翻譯誤認為原生知識的風險。

命題五:在地化補償命題

在地化重構對原生語義保持的貢獻,高於同等規模的直接翻譯。

命題六:回授漂移命題

當模型來源資料比例持續上升且缺乏新原生資料時,語言分布將向模型生成分布漂移。

命題七:主體性遲滯命題

語料主體性下降後,其恢復所需的原生資料量可能高於最初造成下降的合成資料量。


十六、工程實作建議

16.1 最小中繼資料

每篇內容至少附帶:

content_id: item-000001
source_type: human_authored
source_language: zh-Hant
target_language: sw
transformation: ai_translation
model_id: model-name
model_version: version
human_reviewed: false
native_speaker_reviewed: false
semantic_family_id: sf-000001
localization_level: none
confidence: 0.86
license: CC-BY-4.0
created_at: 2026-07-25

16.2 頁面層標記

公開網站應提供:

  • 人類可讀標記;
  • JSON-LD;
  • HTTP Header;
  • Sitemap metadata;
  • Dataset manifest;
  • 語義家族連結;
  • 原文連結;
  • 翻譯與生成方式。

16.3 AI 語料宣告接口

未來可設計:

/.well-known/ai-corpus-manifest.json

其中包含:

  • 網站內容來源分類;
  • AI 生成比例;
  • 語言分布;
  • 語義家族數;
  • 授權;
  • 建議訓練權重;
  • 不建議用於評測的內容;
  • 原生內容索引;
  • 翻譯內容索引。

16.4 語料修訂

語料治理系統應支援:

  • 錯誤標記;
  • 版本替換;
  • 術語修正;
  • 內容撤回;
  • 血統更新;
  • 模型版本追蹤;
  • 失效連結修補。

十七、倫理與治理意義

17.1 數位可見性不等於語言保存

一種語言可能在網路上擁有大量文本,卻只是在重複其他語言的內容。

因此,語言保存至少應區分:

形式保存\text{形式保存}

與:

語義主體保存\text{語義主體保存}

17.2 AI 內容不應冒充社群本身

最基本原則是:

AI 生成的語言表面,不應被無標記地表現為該語言社群的原生思想與知識。

17.3 低資源語言的資料治理權

當某個外部系統能快速生成遠超當地原生語料量的內容時,該系統實際上可能影響未來模型如何理解該語言。

因此,低資源語言社群應至少擁有:

  • 知情權;
  • 標記權;
  • 修正權;
  • 拒絕錯誤術語的權利;
  • 建立自身語言 Profile 的權利;
  • 對公開語料治理規則提出意見的權利。

十八、研究綱領

第一階段:資料分類

建立:

  • 原生;
  • 翻譯;
  • AI 原創;
  • 在地化;
  • 混合;

五類語料分類。

第二階段:語義家族標記

針對所有多語內容建立語義家族 ID。

第三階段:低資源語言小規模實驗

選擇數種不同數位資源規模的語言,建立可控資料集。

第四階段:多代模型回授測試

測量語言分布、翻譯腔與原生術語的跨代變化。

第五階段:治理標準

提出開放的:

  • 語料血統標準;
  • 生成內容標記;
  • 語義家族標準;
  • 原生性評估;
  • 合成內容發布指南。

十九、結論

大規模 AI 多語內容生產,確實可能為低資源語言帶來前所未有的數位可見性、知識可達性與形式化能力。然而,這種增益同時可能伴隨一個結構性風險:

新增的語言內容,在形式上屬於該語言,在語義來源上卻主要屬於另一種語言、另一個模型或另一套知識秩序。

因此,真正需要評估的不是:

生成了多少篇內容\text{生成了多少篇內容}

而是:

增加了多少獨立、可追溯、原生或在地化的語義資產\text{增加了多少獨立、可追溯、原生或在地化的語義資產}

本文提出的核心猜想是:

當低資源語言中的合成語料有效權重超過某一閾值後,後續 AI 對該語言的理解可能逐步由合成語料主導;語言的數位可見性雖然提高,其原生認識論、文體與概念結構卻可能被稀釋。

因此,未來多語內容系統不應只是內容農場,而應被重新設計為:

  1. 多語知識發布系統;
  2. 語料血統系統;
  3. 語義家族管理系統;
  4. 在地語言 Profile 系統;
  5. 母語者共同治理系統;
  6. AI 訓練資料透明化系統。

最終原則是:

增加低資源語言的可見性,但不以消除其語義來源為代價;擴大 AI 可學習資料,但不讓模型生成內容冒充語言社群本身。


附錄 A:核心指標總表

合成語料滲透率

ρL=WLsyntheticWLtotal\rho_L = \frac{ W_L^{\mathrm{synthetic}} }{ W_L^{\mathrm{total}} }

語料原生性

NL=WLnativeWLtotalN_L = \frac{ W_L^{\mathrm{native}} }{ W_L^{\mathrm{total}} }

語義獨立密度

δL=NsemanticNsurface\delta_L = \frac{ N_{\mathrm{semantic}} }{ N_{\mathrm{surface}} }

回授係數

γt=WtmodelderivedWttotal\gamma_t = \frac{ W_t^{\mathrm{model-derived}} }{ W_t^{\mathrm{total}} }

語料主體性指數

SL=αNL+βOL+χCL+δHL+εPLS_L = \alpha N_L + \beta O_L + \chi C_L + \delta H_L + \varepsilon P_L

語義家族重複率

Rfamily=1NsemanticNsurfaceR_{\mathrm{family}} = 1- \frac{ N_{\mathrm{semantic}} }{ N_{\mathrm{surface}} }

附錄 B:待驗證假說清單

  1. 低資源語言的合成語料主導閾值顯著低於高資源語言;
  2. AI 翻譯語料比 AI 原創語料更容易造成來源語言句法滲透;
  3. 多代模型回授會提高翻譯腔與詞彙收斂;
  4. 母語者修訂能顯著降低語義漂移;
  5. 語義家族切分能降低跨語評測洩漏;
  6. 語料血統能改善訓練取樣與可信度評估;
  7. 原生問題生成能力比單純語法自然度更能衡量語言主體性;
  8. 語料主體性具有遲滯效應;
  9. 在地化再創作的長期價值高於大規模直接翻譯;
  10. 未標記合成語料會使模型高估某語言的原生知識規模。