01|AI 時代的資料資產:從「賣資料」到授權可計算知識
Data Assets in the AI Era: From Selling Files to Licensing Computable Knowledge
系列:《可執行資料與深層解構學習》
篇次: 01 / 10
作者: Neo.K with Aletheia
機構: EveMissLab/一言諾科技有限公司
版本: v0.1 Research Draft
日期: 2026-08-16
文件性質: 資料經濟/AI 訓練資料/可計算知識/資料授權方法論
範圍聲明: 本文討論一般資料資產與後續可執行系統解構,不討論特定個人學術站、特定私人論文庫或 TCF 商業化。
法律聲明: 本文為研究方法論與商業架構分析,不構成法律意見。
摘要
生成式 AI 與 Agent 系統使「資料」重新成為核心生產要素,但「資料很重要」並不等於「任何資料都具有可交易價值」。在 AI 時代,真正可形成資產的並不是檔案本身,而是具有明確權利邊界、可追溯來源、穩定結構、可驗證品質、可持續更新、可被機器有效使用,且能對模型或任務產生可量化效益的資料產品。
本文提出:
並將 AI 時代資料資產初步表示為:
其中:
- :Data,資料內容;
- :Rights,權利與授權邊界;
- :Structure,資料結構;
- :Provenance,來源與資料血緣;
- :Verification,可驗證性;
- :Utility,對模型或任務的實際效益;
- :Maintenance,版本、更新與持續維護能力。
本文進一步區分「資料所有權」與「資料使用權」,指出實際資料市場更常見的交易單位是期間、用途、範圍與權限受約束的授權,而不是將資料本體一次性賣斷。本文亦提出資料商品的多權限模型,包括 Research、RAG、Evaluation、Fine-tuning、Training 與 Commercial Deployment 等不同授權面。
更重要的是,本文指出:當生成式 AI 使內容產出成本快速下降,資料價值將逐漸由「是否存在」轉向「是否具有結構、權利、驗證、差異化與可執行效益」。因此,未來高價值資料的核心不只是規模,而是:
本文最後將此框架連接至後續「遊戲解構」研究:遊戲不只是內容,而是包含狀態、行動、規則、回饋與因果轉移的可執行資料源。因而本系列下一階段將由一般資料資產,進一步轉向可執行因果資料、遊戲智能考古與深層解構學習。
關鍵詞: 資料資產、AI 訓練資料、資料授權、Data Product、RAG、Fine-tuning、Training Data、Provenance、Benchmark、可計算知識
1. 問題:為什麼「有資料」不等於「有資產」?
數位時代早已累積海量資料。
企業有:
- log;
- 文件;
- 郵件;
- 交易;
- 客服;
- 程式碼;
- 圖片;
- 影片;
- 使用紀錄。
網路亦存在大量:
- 網頁;
- 開源專案;
- 論文;
- Wiki;
- 論壇;
- 社群內容;
- 公開資料集。
然而,資料量巨大並不意味所有資料都可直接形成經濟資產。
最簡單的錯誤是:
這並不成立。
一個資料集可能:
- 來源不明;
- 權利不清;
- 重複率極高;
- 欄位混亂;
- 缺乏版本;
- 無法驗證;
- 無法與模型任務對接;
- 使用後沒有任何性能提升。
即使資料量非常大,它仍可能只是:
而不是:
因此需要重新區分:
2. 四層資料存在形態
2.1 Raw Data
最底層為:
例如:
- 未整理文本;
- 原始遊戲錄影;
- server logs;
- Git repository;
- JSON dump;
- sensor stream;
- screenshot;
- transaction records。
這些資料可能具有資訊,但不一定已經具備可交付性。
2.2 Dataset
當資料完成:
- 篩選;
- 格式統一;
- 基本 metadata;
- 去重;
- 欄位定義;
- 基本品質控制;
可形成:
Dataset 已經可以被使用,但仍不必然適合商業授權。
2.3 Data Product
當 Dataset 再加入:
- 明確用途;
- 版本;
- schema;
- delivery mechanism;
- documentation;
- license;
- support;
- 更新政策;
則形成:
現有資料市場的實務即反映此模式。AWS Data Exchange 的資料產品以 subscription 為主要取得方式,offer 會明確包含價格、期間、付款條件與 Data Subscription Agreement;provider 亦可建立 custom / private offers。Snowflake Marketplace 同樣支援 paid listings 與 pricing plans;Databricks Marketplace 則將 dataset、model 等作為可被 listing 與交換的 data products。
因此,市場實際交易的已不是單純:
一包 CSV。
而是:
一個具有條款、期間、交付與服務邊界的資料產品。
2.4 Data Asset
本文進一步定義:
當且僅當 Data Product 不只是能交付,而且能持續產生可衡量效益。
可形式化為:
其中任何一項長期接近零,都可能使資產價值快速下降。
3. 資料交易的核心不是「賣掉資料」
一般人第一次思考資料商業化時,常使用實體商品直覺:
我有一份資料,賣給某公司後,資料就是他的。
但資料具有:
也就是同一份資料在技術上可以被複製並授權給多個使用者。
因此更自然的商業單位是:
而不是:
4. 權利向量:同一份資料可以有不同商品
令某資料集為:
它的授權權限可以形成:
其中:
- :Research;
- :RAG / Retrieval;
- :Evaluation / Benchmark;
- :Fine-tuning;
- :Model Training;
- :Commercial Deployment;
- :Derivative / Redistribution。
因此:
即使兩個客戶拿到的是同一份內容,其商業權利也可能完全不同。
例如:
License A
Research only
No model training
No redistribution
12 months
License B
Internal RAG
Commercial application allowed
No foundation-model training
No raw-data redistribution
License C
Fine-tuning and evaluation allowed
Commercial model deployment allowed
No raw-data resale
Perpetual internal use
License D
Foundation-model training allowed
Derivative model commercialization allowed
Raw corpus redistribution prohibited
此時真正出售的是:
5. AI 訓練使「用途」變成授權核心
傳統資料授權可能主要關注:
- 閱讀;
- 顯示;
- 分析;
- 再出版。
AI 時代則新增:
- embedding;
- retrieval;
- fine-tuning;
- pretraining;
- RL / preference learning;
- evaluation;
- synthetic derivative generation。
因此:
本身成為重要契約維度。
臺灣數位發展部於 2026 年推出「臺灣主權 AI 訓練語料授權條款」第 1 版,正反映 AI training 已需要專門處理資料使用、期間、識別與授權資訊等問題。
這意味著:
已逐漸成為可被單獨描述與治理的權利層。
6. 資料價值不是檔案大小
假設兩個資料集:
與:
其中:
而:
不能因此推出:
如果 :
- 充滿重複;
- 權利不清;
- 無標註;
- 無任務對應;
- 對模型沒有增益;
而 :
- 高度稀缺;
- 來源清楚;
- 結構穩定;
- 對某專業任務具有巨大提升;
則可能:
因此,AI 資料的基本估值思路應從容量轉向有效資訊增益。
7. 一個初步的資料資產價值模型
本文提出一個內部評估形式:
其中:
- :Rights clarity;
- :Quality;
- :Provenance;
- :Structure;
- :Utility;
- :Novelty / Scarcity;
- :Maintainability。
這不是市場定價公式,而是一個研究判斷模型。
它的重要意義在於:
高價值資料不是只有「高品質」。
8. Provenance 為什麼會變成資產的一部分?
AI 系統需要知道:
- 資料從哪裡來;
- 誰有權授權;
- 何時取得;
- 是否修改;
- 哪一版;
- 是否含第三方內容;
- 是否存在限制;
- 哪些資料是推論;
- 哪些資料是原始觀察。
因此資料來源不應只是附註。
應把:
視為資料本體的一部分。
Defined.ai 的資料合作與 marketplace 模式即明確要求供應者具有資料商業化與 AI training 的合法權利,並進行資料來源與權利審查。
沒有 provenance 的資料可能仍然有資訊價值,但其企業可採購性會顯著下降。
9. 結構化的價值:AI 能不能真正使用?
假設有一百萬份文字。
最簡單作法:
這當然有用。
但某些領域需要的不只是文字相似性。
例如真正的專業資料可能還需要:
- entity;
- state;
- action;
- relation;
- outcome;
- version;
- evidence;
- confidence;
- dependency;
- failure mode。
因此:
JSON 並不自動等於高階結構。
真正的問題是:
這個結構是否對任務形成有效歸納偏置?
10. 最好的銷售證明不是「我的資料很好」
如果要證明資料價值,最有效的方法不是描述資料多珍貴。
而是測:
其中:
- :基準模型;
- :資料產品。
定義:
可測:
- accuracy;
- hallucination rate;
- task completion;
- code correctness;
- retrieval precision;
- reconstruction success;
- agent success rate;
- planning quality。
如果:
而:
則:
這就是資料最直接的效益證據。
11. Corpus + Benchmark 比 Corpus 更接近資產
因此未來真正成熟的資料商品應該不是只有:
dataset.zip
而是:
dataset/
schema/
documentation/
provenance/
license/
train/
dev/
test/
benchmark/
baseline/
evaluation/
version/
changelog/
可寫成:
Benchmark 的存在使資料從:
也許有用。
變成:
可以被測量是否有用。
12. 資料市場正在從 Data 走向 Data Product
目前 AWS Data Exchange、Snowflake Marketplace、Databricks Marketplace 等平台均已將資料供應者、listing、subscription、paid listing、private offer 或 data product 等概念產品化。
這表示資料市場已逐漸建立:
的基礎設施。
因此個人或小型研究團隊真正缺乏的通常不是:
能不能把資料放上網?
而是:
能不能把資料變成買方知道如何評估、如何合法使用、如何整合、如何持續取得的產品?
13. AI 時代的資料生產成本正在改變
生成式 AI 使大量內容可以低成本產生。
因此:
如果生成速度持續提升,僅有:
大量文字。
將逐漸降低稀缺性。
資料資產的競爭因而轉向:
也就是:
問題將從「誰有最多資料」逐漸轉成「誰知道哪些資料值得留下」。
14. 高品質資料不是終點
傳統資料工程常將:
作為核心目標。
在資料稀缺、標註昂貴的年代,這是合理的。
但若未來:
- AI 大量生成;
- 計算機自動測試;
- verifier 自動篩選;
- simulation 自動驗證;
- schema 自動檢查;
則可能出現大量:
的候選。
此時 Quality 逐漸由:
變成:
這將引出本系列下一篇的重要問題:
答案可能是:
15. 從 Content Data 到 Executable Data
一般文本資料主要記錄:
但存在另一種更高密度資料:
也就是:
- 當下狀態;
- 執行動作;
- 世界如何改變。
若再加入:
其中:
- :goal;
- :constraint;
- :outcome;
則形成:
這已經不只是內容。
它開始描述:
16. 為什麼下一步會進入遊戲?
遊戲是極具代表性的可執行資料源。
因為遊戲天然包含:
- state;
- action;
- rules;
- goal;
- feedback;
- resource;
- history;
- world transition。
因此:
小說主要留下:
發生了什麼。
影片可以留下:
看起來發生了什麼。
而遊戲還可以讓研究者問:
如果我改變行動,系統會怎麼回應?
因此它天然提供反事實操作空間:
這使遊戲非常適合作為:
的研究母體。
17. 資料資產與遊戲解構的連接
若只錄製遊戲影片:
我們得到的是表面 observation。
若進一步記錄:
則資料開始具有結構。
若再進一步抽取:
- FSM;
- Behavior Tree;
- Utility;
- Scheduler;
- Memory;
- Priority;
- Interrupt;
- World State;
- Composition;
則:
這正是本系列第二部將研究的核心。
18. 本文命題
命題一:資料—資產非同一命題
資料需經權利、結構、來源、驗證、效益與維護才能形成可持續資產。
命題二:使用權優先命題
AI 時代資料商業化的主要單位可以是:
而不需要是資料所有權永久移轉。
命題三:模型增益證明命題
資料價值若能用:
穩定證明,其商業可評估性將顯著高於只依賴主觀品質描述的資料。
命題四:結構增值命題
在內容相同時,能夠提供:
- 可尋址結構;
- 穩定 schema;
- provenance;
- task mapping;
- validation;
的資料,對 AI 系統的可操作價值通常高於純 raw dump。
命題五:可執行資料升階命題
若資料不只描述結果,而能保存:
則它可進一步支援:
- Agent learning;
- planning;
- reconstruction;
- simulation;
- causal analysis;
- executable validation。
19. 研究與商業的分離
本文並不主張:
所有資料都應被出售。
一個資料集可以具有:
但其持有人仍選擇:
資料資產化的意義首先是:
知道自己擁有什麼。
而不是:
必須把所有東西標價。
因此:
這個區分對知識公共性、開源文化與研究倫理尤其重要。
20. 結論:AI 時代真正賣的是「可用性」
資料市場表面上看起來是在交易資料。
但更深層地說,真正被交易的是:
沒有授權,資料可能不能安全使用。
沒有結構,AI 可能只能低效讀取。
沒有 provenance,企業無法有效治理。
沒有 benchmark,買方無法知道它是否真的有價值。
因此:
但生成式 AI 又將進一步改變這條鏈。
當:
而:
下一個真正稀缺的東西將不再只是:
而會開始轉向:
因此下一篇將進一步研究:
02|高品質資料之後:從 Quality Paradigm 到 Novelty Paradigm
參考資料
Amazon Web Services, AWS Data Exchange User Guide — Product subscriptions / Creating offers / Data products, accessed 2026-08-16.
https://docs.aws.amazon.com/data-exchange/latest/userguide/product-subscriptions.html
https://docs.aws.amazon.com/data-exchange/latest/userguide/prepare-offers.html
https://docs.aws.amazon.com/marketplace/latest/userguide/data-products.htmlSnowflake Documentation, Snowflake Marketplace — Paid listings / Pricing models / Provider listings, accessed 2026-08-16.
https://docs.snowflake.com/en/collaboration/collaboration-marketplace-about
https://docs.snowflake.com/en/en/collaboration/provider-listings-pricing-modelDatabricks Documentation, Databricks Marketplace — Provider and listing documentation, accessed 2026-08-16.
https://docs.databricks.com/aws/en/marketplace
https://docs.databricks.com/aws/en/marketplace/create-listingDefined.ai, Partnership Programs / Data License Agreement / AI Training Data Platform, accessed 2026-08-16.
https://defined.ai/partnership-programs
https://defined.ai/data-license-agreement
https://defined.ai/數位發展部,臺灣主權 AI 訓練語料庫與臺灣主權 AI 訓練語料授權條款第 1 版,2026。
https://moda.gov.tw/en/digital-affairs/plural-innovation/operations/18874
https://taic.moda.gov.tw/content/license
系列導航
- 01|AI 時代的資料資產:從「賣資料」到授權可計算知識
- 02|高品質資料之後:從 Quality Paradigm 到 Novelty Paradigm
- 03|遊戲不是內容資料:遊戲作為可執行因果世界
- 04|商業遊戲智能考古:從 AI 名作到普通遊戲群
- 05|遊戲解構經濟學:成本、難度、資訊增益與研究深度
- 06|商業遊戲 AI 的隱藏層:真正稀缺的是組合,而非基礎演算法
- 07|餵資料不等於學習:從 Raw Exposure 到深層解構學習
- 08|理解的工程驗收:如果真的懂,就重建給我看
- 09|合成資料之後:從模仿既有設計到探索新穎可執行設計空間
- 10|慣老闆測試:意圖重建、設計生成與可執行世界考古