← Archive
lm-002841 · 2026-08

01|AI 時代的資料資產:從「賣資料」到授權可計算知識

下載 MD 檔 ⬇
📎 附件 · Companion files — 隨文交付的程式 / 證明 / 資料,可獨立下載重驗

01|AI 時代的資料資產:從「賣資料」到授權可計算知識

Data Assets in the AI Era: From Selling Files to Licensing Computable Knowledge

系列:《可執行資料與深層解構學習》
篇次: 01 / 10
作者: Neo.K with Aletheia
機構: EveMissLab/一言諾科技有限公司
版本: v0.1 Research Draft
日期: 2026-08-16
文件性質: 資料經濟/AI 訓練資料/可計算知識/資料授權方法論
範圍聲明: 本文討論一般資料資產與後續可執行系統解構,不討論特定個人學術站、特定私人論文庫或 TCF 商業化。
法律聲明: 本文為研究方法論與商業架構分析,不構成法律意見。


摘要

生成式 AI 與 Agent 系統使「資料」重新成為核心生產要素,但「資料很重要」並不等於「任何資料都具有可交易價值」。在 AI 時代,真正可形成資產的並不是檔案本身,而是具有明確權利邊界、可追溯來源、穩定結構、可驗證品質、可持續更新、可被機器有效使用,且能對模型或任務產生可量化效益的資料產品。

本文提出:

Raw DataData Asset\boxed{ \text{Raw Data} \neq \text{Data Asset} }

並將 AI 時代資料資產初步表示為:

DA=(D,R,S,P,V,U,M)\boxed{ \mathcal D_A = (D,R,S,P,V,U,M) }

其中:

  • DD:Data,資料內容;
  • RR:Rights,權利與授權邊界;
  • SS:Structure,資料結構;
  • PP:Provenance,來源與資料血緣;
  • VV:Verification,可驗證性;
  • UU:Utility,對模型或任務的實際效益;
  • MM:Maintenance,版本、更新與持續維護能力。

本文進一步區分「資料所有權」與「資料使用權」,指出實際資料市場更常見的交易單位是期間、用途、範圍與權限受約束的授權,而不是將資料本體一次性賣斷。本文亦提出資料商品的多權限模型,包括 Research、RAG、Evaluation、Fine-tuning、Training 與 Commercial Deployment 等不同授權面。

更重要的是,本文指出:當生成式 AI 使內容產出成本快速下降,資料價值將逐漸由「是否存在」轉向「是否具有結構、權利、驗證、差異化與可執行效益」。因此,未來高價值資料的核心不只是規模,而是:

Machine Usability+Rights Clarity+Provenance+Measured Uplift\boxed{ \text{Machine Usability} + \text{Rights Clarity} + \text{Provenance} + \text{Measured Uplift} }

本文最後將此框架連接至後續「遊戲解構」研究:遊戲不只是內容,而是包含狀態、行動、規則、回饋與因果轉移的可執行資料源。因而本系列下一階段將由一般資料資產,進一步轉向可執行因果資料、遊戲智能考古與深層解構學習。

關鍵詞: 資料資產、AI 訓練資料、資料授權、Data Product、RAG、Fine-tuning、Training Data、Provenance、Benchmark、可計算知識


1. 問題:為什麼「有資料」不等於「有資產」?

數位時代早已累積海量資料。

企業有:

  • log;
  • 文件;
  • 郵件;
  • 交易;
  • 客服;
  • 程式碼;
  • 圖片;
  • 影片;
  • 使用紀錄。

網路亦存在大量:

  • 網頁;
  • 開源專案;
  • 論文;
  • Wiki;
  • 論壇;
  • 社群內容;
  • 公開資料集。

然而,資料量巨大並不意味所有資料都可直接形成經濟資產。

最簡單的錯誤是:

More DataMore Value\boxed{ \text{More Data} \Rightarrow \text{More Value} }

這並不成立。

一個資料集可能:

  • 來源不明;
  • 權利不清;
  • 重複率極高;
  • 欄位混亂;
  • 缺乏版本;
  • 無法驗證;
  • 無法與模型任務對接;
  • 使用後沒有任何性能提升。

即使資料量非常大,它仍可能只是:

Storage Cost\boxed{ \text{Storage Cost} }

而不是:

Data Asset\boxed{ \text{Data Asset} }

因此需要重新區分:

DataDatasetData ProductData Asset.\text{Data} \neq \text{Dataset} \neq \text{Data Product} \neq \text{Data Asset}.

2. 四層資料存在形態

2.1 Raw Data

最底層為:

D0=Raw Data.D_0=\text{Raw Data}.

例如:

  • 未整理文本;
  • 原始遊戲錄影;
  • server logs;
  • Git repository;
  • JSON dump;
  • sensor stream;
  • screenshot;
  • transaction records。

這些資料可能具有資訊,但不一定已經具備可交付性。


2.2 Dataset

當資料完成:

  • 篩選;
  • 格式統一;
  • 基本 metadata;
  • 去重;
  • 欄位定義;
  • 基本品質控制;

可形成:

D1=Dataset.D_1=\text{Dataset}.

Dataset 已經可以被使用,但仍不必然適合商業授權。


2.3 Data Product

當 Dataset 再加入:

  • 明確用途;
  • 版本;
  • schema;
  • delivery mechanism;
  • documentation;
  • license;
  • support;
  • 更新政策;

則形成:

D2=Data Product.D_2=\text{Data Product}.

現有資料市場的實務即反映此模式。AWS Data Exchange 的資料產品以 subscription 為主要取得方式,offer 會明確包含價格、期間、付款條件與 Data Subscription Agreement;provider 亦可建立 custom / private offers。Snowflake Marketplace 同樣支援 paid listings 與 pricing plans;Databricks Marketplace 則將 dataset、model 等作為可被 listing 與交換的 data products。

因此,市場實際交易的已不是單純:

一包 CSV。

而是:

一個具有條款、期間、交付與服務邊界的資料產品。


2.4 Data Asset

本文進一步定義:

D3=Data Asset\boxed{ D_3=\text{Data Asset} }

當且僅當 Data Product 不只是能交付,而且能持續產生可衡量效益。

可形式化為:

DA=(D,R,S,P,V,U,M)\boxed{ \mathcal D_A = (D,R,S,P,V,U,M) }

其中任何一項長期接近零,都可能使資產價值快速下降。


3. 資料交易的核心不是「賣掉資料」

一般人第一次思考資料商業化時,常使用實體商品直覺:

我有一份資料,賣給某公司後,資料就是他的。

但資料具有:

Non-rival Copyability\boxed{ \text{Non-rival Copyability} }

也就是同一份資料在技術上可以被複製並授權給多個使用者。

因此更自然的商業單位是:

License\boxed{ \text{License} }

而不是:

Transfer of the only copy.\boxed{ \text{Transfer of the only copy}. }

4. 權利向量:同一份資料可以有不同商品

令某資料集為:

D.D.

它的授權權限可以形成:

L(D)=(lr,lg,le,lf,lt,lc,ld)\boxed{ L(D) = ( l_r, l_g, l_e, l_f, l_t, l_c, l_d ) }

其中:

  • lrl_r:Research;
  • lgl_g:RAG / Retrieval;
  • lel_e:Evaluation / Benchmark;
  • lfl_f:Fine-tuning;
  • ltl_t:Model Training;
  • lcl_c:Commercial Deployment;
  • ldl_d:Derivative / Redistribution。

因此:

L1(D)L2(D)L_1(D)\neq L_2(D)

即使兩個客戶拿到的是同一份內容,其商業權利也可能完全不同。

例如:

License A

Research only
No model training
No redistribution
12 months

License B

Internal RAG
Commercial application allowed
No foundation-model training
No raw-data redistribution

License C

Fine-tuning and evaluation allowed
Commercial model deployment allowed
No raw-data resale
Perpetual internal use

License D

Foundation-model training allowed
Derivative model commercialization allowed
Raw corpus redistribution prohibited

此時真正出售的是:

Authorized Capability over Data\boxed{ \text{Authorized Capability over Data} }

5. AI 訓練使「用途」變成授權核心

傳統資料授權可能主要關注:

  • 閱讀;
  • 顯示;
  • 分析;
  • 再出版。

AI 時代則新增:

  • embedding;
  • retrieval;
  • fine-tuning;
  • pretraining;
  • RL / preference learning;
  • evaluation;
  • synthetic derivative generation。

因此:

Use Type\boxed{ \text{Use Type} }

本身成為重要契約維度。

臺灣數位發展部於 2026 年推出「臺灣主權 AI 訓練語料授權條款」第 1 版,正反映 AI training 已需要專門處理資料使用、期間、識別與授權資訊等問題。

這意味著:

AI Training Rights\boxed{ \text{AI Training Rights} }

已逐漸成為可被單獨描述與治理的權利層。


6. 資料價值不是檔案大小

假設兩個資料集:

DAD_A

與:

DB.D_B.

其中:

DA=10 TB|D_A|=10\text{ TB}

而:

DB=5 GB.|D_B|=5\text{ GB}.

不能因此推出:

V(DA)>V(DB).V(D_A)>V(D_B).

如果 DAD_A

  • 充滿重複;
  • 權利不清;
  • 無標註;
  • 無任務對應;
  • 對模型沒有增益;

DBD_B

  • 高度稀缺;
  • 來源清楚;
  • 結構穩定;
  • 對某專業任務具有巨大提升;

則可能:

V(DB)V(DA).\boxed{ V(D_B)\gg V(D_A). }

因此,AI 資料的基本估值思路應從容量轉向有效資訊增益。


7. 一個初步的資料資產價值模型

本文提出一個內部評估形式:

VDRQPSUNM\boxed{ V_D \propto R \cdot Q \cdot P \cdot S \cdot U \cdot N \cdot M }

其中:

  • RR:Rights clarity;
  • QQ:Quality;
  • PP:Provenance;
  • SS:Structure;
  • UU:Utility;
  • NN:Novelty / Scarcity;
  • MM:Maintainability。

這不是市場定價公式,而是一個研究判斷模型。

它的重要意義在於:

高價值資料不是只有「高品質」。


8. Provenance 為什麼會變成資產的一部分?

AI 系統需要知道:

  • 資料從哪裡來;
  • 誰有權授權;
  • 何時取得;
  • 是否修改;
  • 哪一版;
  • 是否含第三方內容;
  • 是否存在限制;
  • 哪些資料是推論;
  • 哪些資料是原始觀察。

因此資料來源不應只是附註。

應把:

P=Provenance\boxed{ P=\text{Provenance} }

視為資料本體的一部分。

Defined.ai 的資料合作與 marketplace 模式即明確要求供應者具有資料商業化與 AI training 的合法權利,並進行資料來源與權利審查。

沒有 provenance 的資料可能仍然有資訊價值,但其企業可採購性會顯著下降。


9. 結構化的價值:AI 能不能真正使用?

假設有一百萬份文字。

最簡單作法:

TextChunkEmbedding.\text{Text} \rightarrow \text{Chunk} \rightarrow \text{Embedding}.

這當然有用。

但某些領域需要的不只是文字相似性。

例如真正的專業資料可能還需要:

  • entity;
  • state;
  • action;
  • relation;
  • outcome;
  • version;
  • evidence;
  • confidence;
  • dependency;
  • failure mode。

因此:

Machine-readableMachine-usable.\boxed{ \text{Machine-readable} \neq \text{Machine-usable}. }

JSON 並不自動等於高階結構。

真正的問題是:

這個結構是否對任務形成有效歸納偏置?


10. 最好的銷售證明不是「我的資料很好」

如果要證明資料價值,最有效的方法不是描述資料多珍貴。

而是測:

M+D>M\boxed{ M+D > M }

其中:

  • MM:基準模型;
  • DD:資料產品。

定義:

ΔP=P(M+D)P(M).\Delta P = P(M+D)-P(M).

可測:

  • accuracy;
  • hallucination rate;
  • task completion;
  • code correctness;
  • retrieval precision;
  • reconstruction success;
  • agent success rate;
  • planning quality。

如果:

P(M)=0.54P(M)=0.54

而:

P(M+D)=0.79,P(M+D)=0.79,

則:

ΔP=0.25.\Delta P=0.25.

這就是資料最直接的效益證據。


11. Corpus + Benchmark 比 Corpus 更接近資產

因此未來真正成熟的資料商品應該不是只有:

dataset.zip

而是:

dataset/
schema/
documentation/
provenance/
license/
train/
dev/
test/
benchmark/
baseline/
evaluation/
version/
changelog/

可寫成:

Data Asset=Corpus+Benchmark+Usage Contract\boxed{ \text{Data Asset} = \text{Corpus} + \text{Benchmark} + \text{Usage Contract} }

Benchmark 的存在使資料從:

也許有用。

變成:

可以被測量是否有用。


12. 資料市場正在從 Data 走向 Data Product

目前 AWS Data Exchange、Snowflake Marketplace、Databricks Marketplace 等平台均已將資料供應者、listing、subscription、paid listing、private offer 或 data product 等概念產品化。

這表示資料市場已逐漸建立:

DataProductOfferLicenseDelivery\boxed{ \text{Data} \rightarrow \text{Product} \rightarrow \text{Offer} \rightarrow \text{License} \rightarrow \text{Delivery} }

的基礎設施。

因此個人或小型研究團隊真正缺乏的通常不是:

能不能把資料放上網?

而是:

能不能把資料變成買方知道如何評估、如何合法使用、如何整合、如何持續取得的產品?


13. AI 時代的資料生產成本正在改變

生成式 AI 使大量內容可以低成本產生。

因此:

Cgeneration.C_{\text{generation}}\downarrow.

如果生成速度持續提升,僅有:

大量文字。

將逐漸降低稀缺性。

資料資產的競爭因而轉向:

GenerationValidationSelectionStructuring\boxed{ \text{Generation} \rightarrow \text{Validation} \rightarrow \text{Selection} \rightarrow \text{Structuring} }

也就是:

問題將從「誰有最多資料」逐漸轉成「誰知道哪些資料值得留下」。


14. 高品質資料不是終點

傳統資料工程常將:

Q=QualityQ=\text{Quality}

作為核心目標。

在資料稀缺、標註昂貴的年代,這是合理的。

但若未來:

  • AI 大量生成;
  • 計算機自動測試;
  • verifier 自動篩選;
  • simulation 自動驗證;
  • schema 自動檢查;

則可能出現大量:

Q(x)τQQ(x)\geq\tau_Q

的候選。

此時 Quality 逐漸由:

Optimization Target\text{Optimization Target}

變成:

Admission Threshold.\text{Admission Threshold}.

這將引出本系列下一篇的重要問題:

If everything is valid, what remains scarce?\boxed{ \text{If everything is valid, what remains scarce?} }

答案可能是:

Novelty.\boxed{ \text{Novelty}. }

15. 從 Content Data 到 Executable Data

一般文本資料主要記錄:

Description.\text{Description}.

但存在另一種更高密度資料:

(st,at,st+1)\boxed{ (s_t,a_t,s_{t+1}) }

也就是:

  • 當下狀態;
  • 執行動作;
  • 世界如何改變。

若再加入:

(g,c,o)(g,c,o)

其中:

  • gg:goal;
  • cc:constraint;
  • oo:outcome;

則形成:

(st,at,g,c,st+1,o)\boxed{ (s_t,a_t,g,c,s_{t+1},o) }

這已經不只是內容。

它開始描述:

How a World Operates.\boxed{ \text{How a World Operates}. }

16. 為什麼下一步會進入遊戲?

遊戲是極具代表性的可執行資料源。

因為遊戲天然包含:

  • state;
  • action;
  • rules;
  • goal;
  • feedback;
  • resource;
  • history;
  • world transition。

因此:

Game=Content+Executable System\boxed{ \text{Game} = \text{Content} + \text{Executable System} }

小說主要留下:

發生了什麼。

影片可以留下:

看起來發生了什麼。

而遊戲還可以讓研究者問:

如果我改變行動,系統會怎麼回應?

因此它天然提供反事實操作空間:

a1a2s1s2.\boxed{ a_1\neq a_2 \Rightarrow s'_{1}\neq s'_{2}. }

這使遊戲非常適合作為:

Executable Causal Data\boxed{ \text{Executable Causal Data} }

的研究母體。


17. 資料資產與遊戲解構的連接

若只錄製遊戲影片:

GameVideo\text{Game} \rightarrow \text{Video}

我們得到的是表面 observation。

若進一步記錄:

State+Action+Rule+Transition+Outcome,\text{State} + \text{Action} + \text{Rule} + \text{Transition} + \text{Outcome},

則資料開始具有結構。

若再進一步抽取:

  • FSM;
  • Behavior Tree;
  • Utility;
  • Scheduler;
  • Memory;
  • Priority;
  • Interrupt;
  • World State;
  • Composition;

則:

Game ExperienceComputable Intelligence Structure.\boxed{ \text{Game Experience} \rightarrow \text{Computable Intelligence Structure}. }

這正是本系列第二部將研究的核心。


18. 本文命題

命題一:資料—資產非同一命題

Data≢Data Asset.\boxed{ \text{Data} \not\equiv \text{Data Asset}. }

資料需經權利、結構、來源、驗證、效益與維護才能形成可持續資產。


命題二:使用權優先命題

AI 時代資料商業化的主要單位可以是:

Licensed Use\boxed{ \text{Licensed Use} }

而不需要是資料所有權永久移轉。


命題三:模型增益證明命題

資料價值若能用:

ΔP>0\Delta P>0

穩定證明,其商業可評估性將顯著高於只依賴主觀品質描述的資料。


命題四:結構增值命題

在內容相同時,能夠提供:

  • 可尋址結構;
  • 穩定 schema;
  • provenance;
  • task mapping;
  • validation;

的資料,對 AI 系統的可操作價值通常高於純 raw dump。


命題五:可執行資料升階命題

若資料不只描述結果,而能保存:

StateActionTransitionOutcome,\text{State} \rightarrow \text{Action} \rightarrow \text{Transition} \rightarrow \text{Outcome},

則它可進一步支援:

  • Agent learning;
  • planning;
  • reconstruction;
  • simulation;
  • causal analysis;
  • executable validation。

19. 研究與商業的分離

本文並不主張:

所有資料都應被出售。

一個資料集可以具有:

Vcommercial>0V_{\text{commercial}}>0

但其持有人仍選擇:

Commercialize=0.\text{Commercialize}=0.

資料資產化的意義首先是:

知道自己擁有什麼。

而不是:

必須把所有東西標價。

因此:

Asset RecognitionMandatory Monetization.\boxed{ \text{Asset Recognition} \neq \text{Mandatory Monetization}. }

這個區分對知識公共性、開源文化與研究倫理尤其重要。


20. 結論:AI 時代真正賣的是「可用性」

資料市場表面上看起來是在交易資料。

但更深層地說,真正被交易的是:

Permission+Structure+Trust+Utility.\boxed{ \text{Permission} + \text{Structure} + \text{Trust} + \text{Utility}. }

沒有授權,資料可能不能安全使用。

沒有結構,AI 可能只能低效讀取。

沒有 provenance,企業無法有效治理。

沒有 benchmark,買方無法知道它是否真的有價值。

因此:

Raw DataStructured DataLicensed Data ProductMeasured Data Asset.\boxed{ \text{Raw Data} \rightarrow \text{Structured Data} \rightarrow \text{Licensed Data Product} \rightarrow \text{Measured Data Asset}. }

但生成式 AI 又將進一步改變這條鏈。

當:

Generation Cost\text{Generation Cost}\downarrow

而:

Validation Capacity,\text{Validation Capacity}\uparrow,

下一個真正稀缺的東西將不再只是:

High Quality.\text{High Quality}.

而會開始轉向:

Novelty+Utility+Executable Difference.\boxed{ \text{Novelty} + \text{Utility} + \text{Executable Difference}. }

因此下一篇將進一步研究:

02|高品質資料之後:從 Quality Paradigm 到 Novelty Paradigm


參考資料

  1. Amazon Web Services, AWS Data Exchange User Guide — Product subscriptions / Creating offers / Data products, accessed 2026-08-16.
    https://docs.aws.amazon.com/data-exchange/latest/userguide/product-subscriptions.html
    https://docs.aws.amazon.com/data-exchange/latest/userguide/prepare-offers.html
    https://docs.aws.amazon.com/marketplace/latest/userguide/data-products.html

  2. Snowflake Documentation, Snowflake Marketplace — Paid listings / Pricing models / Provider listings, accessed 2026-08-16.
    https://docs.snowflake.com/en/collaboration/collaboration-marketplace-about
    https://docs.snowflake.com/en/en/collaboration/provider-listings-pricing-model

  3. Databricks Documentation, Databricks Marketplace — Provider and listing documentation, accessed 2026-08-16.
    https://docs.databricks.com/aws/en/marketplace
    https://docs.databricks.com/aws/en/marketplace/create-listing

  4. Defined.ai, Partnership Programs / Data License Agreement / AI Training Data Platform, accessed 2026-08-16.
    https://defined.ai/partnership-programs
    https://defined.ai/data-license-agreement
    https://defined.ai/

  5. 數位發展部,臺灣主權 AI 訓練語料庫與臺灣主權 AI 訓練語料授權條款第 1 版,2026。
    https://moda.gov.tw/en/digital-affairs/plural-innovation/operations/18874
    https://taic.moda.gov.tw/content/license


系列導航

  • 01|AI 時代的資料資產:從「賣資料」到授權可計算知識
  • 02|高品質資料之後:從 Quality Paradigm 到 Novelty Paradigm
  • 03|遊戲不是內容資料:遊戲作為可執行因果世界
  • 04|商業遊戲智能考古:從 AI 名作到普通遊戲群
  • 05|遊戲解構經濟學:成本、難度、資訊增益與研究深度
  • 06|商業遊戲 AI 的隱藏層:真正稀缺的是組合,而非基礎演算法
  • 07|餵資料不等於學習:從 Raw Exposure 到深層解構學習
  • 08|理解的工程驗收:如果真的懂,就重建給我看
  • 09|合成資料之後:從模仿既有設計到探索新穎可執行設計空間
  • 10|慣老闆測試:意圖重建、設計生成與可執行世界考古