02|高品質資料之後:從 Quality Paradigm 到 Novelty Paradigm
Beyond High-Quality Data: From the Quality Paradigm to the Novelty Paradigm
系列:《可執行資料與深層解構學習》
篇次: 02 / 10
作者: Neo.K with Aletheia
機構: EveMissLab/一言諾科技有限公司
版本: v0.1 Research Draft
日期: 2026-08-16
文件性質: AI 資料理論/合成資料/新穎性搜尋/Quality-Diversity/可執行驗證
範圍聲明: 本文討論一般 AI 資料、合成資料與可驗證生成,不涉及特定私人學術資料庫或特定資料格式商業化。
摘要
AI 時代的資料研究長期以「高品質資料」為核心語言:乾淨、正確、去重、來源可靠、格式一致、標註準確的資料,被視為優質訓練資產。此一觀點在資料稀缺、人工標註昂貴、錯誤難以自動驗證的時代具有高度合理性。然而,當生成式模型開始大量產生候選資料,而程式執行、模擬器、形式驗證器、單元測試、狀態不變量與自動評測器可以快速排除大量錯誤候選時,「高品質」可能逐步由主要優化目標轉化為進場門檻。
本文提出「品質—新穎性相變命題」(Quality-to-Novelty Transition Hypothesis):
當大量資料都已通過最低有效性、可重現性與來源要求時,真正開始稀缺的可能不再是「資料是否足夠好」,而是:
即候選資料 相對於當前知識庫 所增加的結構新穎性、行為新穎性、組合新穎性與可遷移新穎性。
本文區分「表面差異」與「結構新穎性」,指出重新命名、參數微調、文風變化與語句重寫並不足以構成高價值新穎資料。真正的新穎性必須與既有知識空間的結構距離、功能差異與可重用機制相關。
本文進一步吸收 Novelty Search、MAP-Elites 與 Quality-Diversity(QD)研究的思想,將資料選擇由單一品質排序改寫為「有效性門檻 + 新穎性/多樣性 + 局部品質」的多維搜索問題。本文同時加入 synthetic data 的限制:遞迴以模型生成資料取代真實資料可能造成分布尾部消失與 model collapse,因此「新穎資料範式」不是鼓勵無限制自我生成,而是要求保留真實基線、歷史樣本、分布覆蓋與可驗證增益。
本文最終提出「Verified Novelty Corpus」與「Executable Novelty Space」概念。其核心不是蒐集最多資料,而是建立一個由可驗證候選所構成、能度量彼此結構距離並持續向未知區域擴展的資料空間:
這為後續遊戲解構、可執行因果資料、AI 生成新遊戲智能架構與意圖重建建立資料理論基礎。
關鍵詞: 高品質資料、新穎資料、Synthetic Data、Novelty Search、Quality-Diversity、MAP-Elites、Model Collapse、Executable Validation、資料選擇、AI 自我生成
1. 問題:如果所有候選都「品質很好」,還剩下什麼?
傳統資料工程常以:
表示某筆資料 的品質。
可以綜合:
- 正確性;
- 完整性;
- 一致性;
- 格式;
- 標註;
- 來源;
- 去重;
- 可讀性;
- 任務相關性。
因此典型的資料選擇問題可以表示為:
這個思路在歷史上十分合理。
當人工標註昂貴、資料雜訊高、模型難以辨識錯誤時,優先提升 能有效改善模型。
DataComp-LM 的大規模受控實驗也顯示,資料集設計本身會顯著影響模型表現;其研究比較去重、filtering、mixing 等策略,並指出 model-based filtering 可以形成更有效的預訓練資料。
因此本文不是否定:
本文提出的是另一個問題:
當生成與驗證成本都下降,且大量候選已經通過品質門檻時,單純繼續最大化品質是否仍是正確的資料選擇目標?
2. 生成成本下降造成的資料條件改變
令資料生成成本為:
在生成式 AI 時代,可預期大量領域中:
特別是在:
- 程式碼;
- 數學題;
- 模擬情境;
- 遊戲規則;
- 任務軌跡;
- synthetic QA;
- 軟體操作案例;
- scenario generation;
等領域,AI 可以快速產生候選。
因此資料瓶頸由:
逐步轉成:
也就是:
我們不再缺候選,而是缺少判斷哪些候選值得保留的方法。
3. 驗證能力上升造成第二個條件改變
並非所有 AI 生成資料都可自動驗證。
但有一類領域具有高度有利的性質:
例如:
3.1 程式碼
可以使用:
- compiler;
- unit test;
- integration test;
- benchmark;
- fuzzing;
- static analysis。
3.2 數學與形式系統
部分問題可以使用:
- proof checker;
- CAS;
- theorem prover;
- symbolic verification。
3.3 遊戲與模擬
可以使用:
- game runtime;
- state invariant;
- replay;
- simulation;
- performance profiling;
- behavioral tests。
3.4 Agent 工作流
可以檢查:
- final state;
- tool output;
- database state;
- file state;
- task completion;
- transaction correctness。
當:
表示驗證成本時,在上述領域亦可能出現:
因此:
形成新的資料生產條件。
4. 品質從 Optimization Target 轉為 Admission Threshold
令 admissible set 為:
其中:
- :品質/有效性;
- :可重現性;
- :來源、血緣或生成 provenance 完整度。
只有:
的候選才有資格進入下一階段。
在這個框架裡,品質依然重要。
但其角色改變了。
原本:
逐漸變成:
也就是:
品質不夠,直接淘汰;品質夠了,再比較其他維度。
5. 為什麼「高品質」會出現範疇不足?
假設存在:
且全部滿足:
此時「品質高」已無法有效排序它們。
例如:
候選 A
已知演算法的變數重新命名。
候選 B
已知場景的文字改寫。
候選 C
已知行為樹只改一個 threshold。
候選 D
產生新的 scheduler + memory + interrupt 組合。
如果 A、B、C、D 都能通過格式與功能測試,則:
但顯然:
因此「品質」沒有錯。
錯的是把:
與:
壓成同一個標量。
6. 新穎性不是「以前沒出現過這個字串」
最簡單的新穎性可以理解為:
但這太弱。
假設:
attack_power = 10
改成:
attack_power = 11
雖然位元內容不同,但:
同樣:
Fireball
改成:
Iceball
如果機制完全一致,亦不應視為高結構新穎性。
因此本文區分四種 novelty。
7. 四類新穎性
7.1 表面新穎性
包括:
- 文字不同;
- 名稱不同;
- 圖像不同;
- 語法不同;
- 參數微調。
這是最容易大量生成的一類。
7.2 結構新穎性
表示:
- graph topology 改變;
- subsystem 組成不同;
- dependency 不同;
- information flow 不同;
- state decomposition 不同;
- control structure 不同。
這比文字差異更重要。
7.3 行為新穎性
即在相同或相似環境下,系統產生新的行為軌跡。
令:
為系統 的 trajectory distribution。
則可比較:
7.4 功能/遷移新穎性
指某候選不只在單一 benchmark 有差異,而能提供新的:
- reusable primitive;
- composition;
- general rule;
- cross-domain mapping;
- failure recovery;
- adaptation strategy。
這通常是最有研究價值的一類。
8. 一個最小新穎性函數
令當前知識庫為:
對候選:
可定義最簡距離式 novelty:
其中:
不應只使用文字 embedding 距離。
更合理的 可以綜合:
其中:
- :結構差異;
- :行為差異;
- :功能差異;
- :因果機制差異。
9. Novelty Search:為什麼「不要只追最佳解」?
Lehman 與 Stanley 的 Novelty Search 提出一個反直覺思想:
在某些問題中,直接追逐單一 objective 可能造成 deceptive search;改為獎勵行為新穎性,反而能找到更有價值的解。
其核心不是:
而是增加:
這與本文的資料問題具有高度類比性。
若所有候選都只依:
排序,生成系統可能快速收斂到:
也就是:
每筆資料都很好,但它們彼此幾乎一樣。
10. Quality-Diversity:品質與多樣性不是二選一
Novelty Search 並不意味應永久放棄品質。
後續 Quality-Diversity(QD)研究更直接處理:
MAP-Elites 的重要思想之一,是不只尋找一個 global optimum,而是在不同 behavioral niches 中保存各自高表現的解。
因此,可將資料庫想像成:
每個 bin / niche:
保存該行為區域中最有價值的候選。
這意味著資料選擇問題可以從:
轉變成:
11. 從 High Quality Corpus 到 Quality-Diversity Corpus
傳統 corpus:
本文提出另一種構造:
也就是:
不把所有容量浪費在同一種「好資料」上,而是在不同結構區域保留局部最優樣本。
對 AI 訓練而言,這可能意味:
- 不同策略;
- 不同錯誤模式;
- 不同架構;
- 不同時間尺度;
- 不同風格;
- 不同資源約束;
- 不同解題路徑;
- 不同失敗恢復方式。
12. 資料的新目標:Coverage
因此除了:
與:
還需要:
令設計/行為空間為:
資料庫 的覆蓋可以粗略表示為:
其中:
為候選周圍的局部區域。
實務上不需要真的知道完整 。
我們可以持續估計:
還有哪些已知類型、狀態、行為與架構區域沒有樣本?
13. 合成資料最大的誘惑
生成式 AI 使以下循環非常誘人:
也就是:
若生成成本極低,似乎可以無限擴張資料。
但這裡存在重大限制。
14. Model Collapse:生成不等於創新
Shumailov 等人的研究指出,若生成模型持續以先前模型生成的資料進行遞迴訓練,可能出現 model collapse;資料分布尾部與低機率事件會逐步消失。
其他後續研究亦指出,synthetic data 的影響與 training workflow 有關;保留或累積 real data 與 synthetic data,可能比每輪完全以生成資料替換原資料穩定。
因此本文拒絕:
甚至可能存在:
這是非常重要的反直覺情形。
15. Novelty Paradigm 不是「讓模型自己亂想」
本文所稱:
Novelty Paradigm
不是:
不管對錯,只要以前沒看過就收。
真正條件是:
更完整可以表示為:
只有:
才計算 novelty。
16. Verified Novelty Corpus
本文提出:
Verified Novelty Corpus, VNC
令:
為時間 的已驗證新穎資料庫。
更新規則可寫為:
這裡:
- validity 決定能否進門;
- novelty 決定是否值得增加;
- quality 可在局部 niche 內決定是否替換既有樣本。
17. 局部 Elite 替換
如果:
與:
屬於同一 niche:
而:
則可以:
保留 作為該區域的新 elite。
因此資料庫不必永遠增長。
它可以:
這使資料庫同時具有:
- 增長;
- 壓縮;
- 更新;
- 去重;
- 競爭。
18. Executable Novelty Space
對於可執行系統,本文進一步提出:
Executable Novelty Space
令候選系統:
經過:
其中:
- :runtime;
- :行為軌跡;
- :評測結果。
此時 novelty 不再只是語義距離。
可以直接比較:
19. 為什麼遊戲特別適合?
遊戲可以提供:
其中:
- :狀態;
- :行動;
- :轉移;
- :規則;
- :目標;
- :評估。
因此 AI 可以生成一個新的遊戲 AI controller:
然後直接跑。
如果它:
- 能編譯;
- 不 crash;
- 不違反 invariant;
- 達成任務;
- 行為穩定;
- 與既有 controller 有結構或行為差異;
則:
可以成為 VNC 候選。
20. 風格開始成為有效資料的另一個座標
當:
且:
仍然可能存在大量候選。
例如兩個 NPC 系統:
與:
都能完成任務。
但:
- 保守;
- 冒險;
- 高效率;
- 高戲劇性;
- 可預測;
- 產生 emergent surprise。
因此還需要:
這表示資料選擇最後可能不是一維 ranking。
而是:
的多目標空間。
21. Pareto Frontier 取代單一總分
若:
在新穎性高、效率低;
而:
在效率高、新穎性低;
不一定存在:
因此應保留:
也就是一批不同方向上具有價值的候選。
這與 Quality-Diversity 的精神高度相容。
22. 「新穎」也可能是垃圾
必須特別排除一個誤解。
如果 AI 生成:
- 無法執行;
- 隨機噪聲;
- 奇怪 graph;
- 無法完成任何任務;
- 沒有可解釋作用;
它可能離已知資料很遠:
但這不代表它有價值。
因此:
真正需要的是:
即:
23. Novelty 與 Utility 也不可混淆
某個候選可能:
但:
例如一個非常新的控制架構,但沒有任何實際優勢。
另一候選可能:
但:
它只是已知架構的小改進,卻把成本降低 80%。
因此資料價值不應化約為 novelty。
本文提出:
其中:
- :valid quality;
- :novelty;
- :utility;
- :coverage contribution;
- :style/value coordinate;
- :transferability。
24. 從 Dataset 到 Explored Space
傳統 Dataset 是:
但 VNC 更像:
資料庫不只回答:
我們有多少筆資料?
而回答:
我們探索過哪些區域?
以及:
還有哪些區域是空白?
這會使資料工程開始接近:
25. 邊界推進
令:
表示當前已探索空間的邊界。
真正有研究價值的生成,可以理解為:
且:
也就是:
不只是重複內部已知區域,而是在仍可驗證的前提下向外推進。
26. 人類資料與歷史資料仍然重要
Novelty Paradigm 絕不能被理解成:
以後全部使用 AI 自己生成的資料。
真實資料、歷史資料與人類產物具有至少三種重要作用:
26.1 Anchor
提供:
避免生成系統逐代偏離現實與歷史基線。
26.2 Tail Preservation
保留低頻但重要事件。
26.3 External Surprise
人類世界與自然世界可以持續提供模型本身未預期的新結構。
因此:
比:
更符合本文框架。
27. 生成資料應保留 genealogy
每個 synthetic candidate 應至少保存:
candidate_id
parent_ids
generator_model
generation_prompt
source_context
mutation_operator
validation_tests
novelty_score
niche_id
utility_score
accepted_or_rejected
rejection_reason
因此:
不是無來源資料。
它應具有:
28. Rejected Data 也可能有研究價值
一般資料清理會丟棄:
但在生成—驗證研究中,失敗資料可記錄:
- deadlock;
- crash;
- unstable policy;
- reward hacking;
- bad composition;
- excessive resource use;
- pathological strategy。
因此可以建立:
這對 AI 學習:
哪些方向不要走。
非常重要。
29. 新穎性不是一次計算,而是動態量
如果今天:
是全新架構:
當未來有一萬個類似架構:
因此:
Novelty 必須相對時間與 corpus 狀態定義。
這也是它與固定品質標籤的重要差異。
30. 資料庫會產生「邊際資訊收益遞減」
對第 筆同類資料:
通常可能滿足:
例如已經有:
個近似 FSM combat example,
第:
個若沒有新的機制,資訊增益可能接近零。
這表示:
31. AI 資料選擇器的未來任務
因此未來資料 curator 不應只問:
這筆資料好不好?
而應問:
- 它是否合法進入有效域?
- 它與現有資料有多重複?
- 它補上哪一個 niche?
- 它帶來什麼新 mechanism?
- 它能否跨域遷移?
- 它是否擴大 tail coverage?
- 它是否只增加表面多樣性?
- 它是否值得保留而非被更好的 local elite 取代?
32. 從 Data Cleaning 到 Knowledge Frontier Management
傳統資料工程:
本文提出未來可能逐漸變成:
這不再只是 Data Cleaning。
而是:
Knowledge Frontier Management
33. 命題一:品質門檻化命題
當候選生成與驗證能力足夠高,使大量資料滿足:
則品質逐漸由主要排序變數轉為 admission constraint。
34. 命題二:結構新穎性優先命題
在滿足最低有效性條件後,資料的邊際價值與:
的關係,可能高於與表面差異的關係。
35. 命題三:Quality-Diversity Corpus 命題
在固定資料預算下:
若任務需要廣泛泛化,則覆蓋多個有效 niche 的資料集可能優於大量集中於單一高品質模式的資料集。
此命題需要後續實驗驗證,不能直接視為普遍定理。
36. 命題四:Synthetic Recursion 約束命題
若 synthetic data 由模型遞迴生成,資料治理必須保留:
- real anchors;
- historical corpus;
- distribution tails;
- novelty tracking;
- provenance;
- independent validation。
否則生成規模增加不必然帶來知識增長。
37. 命題五:可執行新穎性命題
在具有 runtime verifier 的領域,新穎資料可以被更強地定義為:
這類資料比單純文字層新穎性更容易建立客觀驗證閉環。
38. 與下一篇的連接
到此,系列已完成兩步:
第一篇建立:
第二篇建立:
下一個問題是:
哪一種現成人類產物最適合產生大量「狀態—行動—規則—結果」可驗證資料?
遊戲是一個極為特殊的答案。
因為遊戲不是只有:
它還具有:
因此下一篇將正式轉入:
03|遊戲不是內容資料:遊戲作為可執行因果世界
39. 結論
「高品質資料」不是錯誤概念。
但在生成與驗證能力高速提升後,它可能不足以描述新的資料選擇問題。
當:
已變成大量候選的共同條件,新的稀缺量開始轉向:
真正成熟的生成式資料系統不應追求:
產生更多看起來正確的資料。
而應追求:
在保留真實基線、分布尾部與可驗證性的前提下,持續找到尚未被充分探索的新結構。
因此:
而對可執行系統而言,最終甚至可以形成:
其資料不是靜態文本堆積,而是一個持續被生成、驗證、淘汰、分類、替換與向外推進的可計算設計空間。
參考資料
Li, J. et al. (2024). DataComp-LM: In search of the next generation of training sets for language models. NeurIPS 2024 Datasets and Benchmarks Track.
https://arxiv.org/abs/2406.11794
https://proceedings.neurips.cc/paper_files/paper/2024/hash/19e4ea30dded58259665db375885e412-Abstract-Datasets_and_Benchmarks_Track.htmlLehman, J., & Stanley, K. O. (2011). Abandoning Objectives: Evolution Through the Search for Novelty Alone. Evolutionary Computation, 19(2), 189–223.
https://pubmed.ncbi.nlm.nih.gov/20868264/Mouret, J.-B., & Clune, J. (2015). Illuminating search spaces by mapping elites. arXiv:1504.04909.
https://arxiv.org/abs/1504.04909Cully, A., & Demiris, Y. (2018). Quality and Diversity Optimization: A Unifying Modular Framework. IEEE Transactions on Evolutionary Computation, 22(2), 245–259.
Shumailov, I. et al. (2024). AI models collapse when trained on recursively generated data. Nature, 631, 755–759.
https://doi.org/10.1038/s41586-024-07566-yGerstgrasser, M. et al. (2024). Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data. arXiv:2404.01413.
https://arxiv.org/abs/2404.01413Kazdan, J. et al. (2024). Collapse or Thrive? Perils and Promises of Synthetic Data in a Self-Generating World. arXiv:2410.16713.
https://arxiv.org/abs/2410.16713Yang, X. et al. (2025). Diversity-driven Data Selection for Language Model Tuning through Sparse Autoencoder. arXiv:2502.14050.
https://arxiv.org/abs/2502.14050
系列導航
- 01|AI 時代的資料資產:從「賣資料」到授權可計算知識
- 02|高品質資料之後:從 Quality Paradigm 到 Novelty Paradigm
- 03|遊戲不是內容資料:遊戲作為可執行因果世界
- 04|商業遊戲智能考古:從 AI 名作到普通遊戲群
- 05|遊戲解構經濟學:成本、難度、資訊增益與研究深度
- 06|商業遊戲 AI 的隱藏層:真正稀缺的是組合,而非基礎演算法
- 07|餵資料不等於學習:從 Raw Exposure 到深層解構學習
- 08|理解的工程驗收:如果真的懂,就重建給我看
- 09|合成資料之後:從模仿既有設計到探索新穎可執行設計空間
- 10|慣老闆測試:意圖重建、設計生成與可執行世界考古