# 01｜AI 時代的資料資產：從「賣資料」到授權可計算知識
## Data Assets in the AI Era: From Selling Files to Licensing Computable Knowledge

**系列：**《可執行資料與深層解構學習》  
**篇次：** 01 / 10  
**作者：** Neo.K with Aletheia  
**機構：** EveMissLab／一言諾科技有限公司  
**版本：** v0.1 Research Draft  
**日期：** 2026-08-16  
**文件性質：** 資料經濟／AI 訓練資料／可計算知識／資料授權方法論  
**範圍聲明：** 本文討論一般資料資產與後續可執行系統解構，不討論特定個人學術站、特定私人論文庫或 TCF 商業化。  
**法律聲明：** 本文為研究方法論與商業架構分析，不構成法律意見。

---

## 摘要

生成式 AI 與 Agent 系統使「資料」重新成為核心生產要素，但「資料很重要」並不等於「任何資料都具有可交易價值」。在 AI 時代，真正可形成資產的並不是檔案本身，而是具有明確權利邊界、可追溯來源、穩定結構、可驗證品質、可持續更新、可被機器有效使用，且能對模型或任務產生可量化效益的資料產品。

本文提出：

$$
\boxed{
\text{Raw Data}
\neq
\text{Data Asset}
}
$$

並將 AI 時代資料資產初步表示為：

$$
\boxed{
\mathcal D_A
=
(D,R,S,P,V,U,M)
}
$$

其中：

- $D$：Data，資料內容；
- $R$：Rights，權利與授權邊界；
- $S$：Structure，資料結構；
- $P$：Provenance，來源與資料血緣；
- $V$：Verification，可驗證性；
- $U$：Utility，對模型或任務的實際效益；
- $M$：Maintenance，版本、更新與持續維護能力。

本文進一步區分「資料所有權」與「資料使用權」，指出實際資料市場更常見的交易單位是期間、用途、範圍與權限受約束的授權，而不是將資料本體一次性賣斷。本文亦提出資料商品的多權限模型，包括 Research、RAG、Evaluation、Fine-tuning、Training 與 Commercial Deployment 等不同授權面。

更重要的是，本文指出：當生成式 AI 使內容產出成本快速下降，資料價值將逐漸由「是否存在」轉向「是否具有結構、權利、驗證、差異化與可執行效益」。因此，未來高價值資料的核心不只是規模，而是：

$$
\boxed{
\text{Machine Usability}
+
\text{Rights Clarity}
+
\text{Provenance}
+
\text{Measured Uplift}
}
$$

本文最後將此框架連接至後續「遊戲解構」研究：遊戲不只是內容，而是包含狀態、行動、規則、回饋與因果轉移的可執行資料源。因而本系列下一階段將由一般資料資產，進一步轉向可執行因果資料、遊戲智能考古與深層解構學習。

**關鍵詞：** 資料資產、AI 訓練資料、資料授權、Data Product、RAG、Fine-tuning、Training Data、Provenance、Benchmark、可計算知識

---

# 1. 問題：為什麼「有資料」不等於「有資產」？

數位時代早已累積海量資料。

企業有：

- log；
- 文件；
- 郵件；
- 交易；
- 客服；
- 程式碼；
- 圖片；
- 影片；
- 使用紀錄。

網路亦存在大量：

- 網頁；
- 開源專案；
- 論文；
- Wiki；
- 論壇；
- 社群內容；
- 公開資料集。

然而，資料量巨大並不意味所有資料都可直接形成經濟資產。

最簡單的錯誤是：

$$
\boxed{
\text{More Data}
\Rightarrow
\text{More Value}
}
$$

這並不成立。

一個資料集可能：

- 來源不明；
- 權利不清；
- 重複率極高；
- 欄位混亂；
- 缺乏版本；
- 無法驗證；
- 無法與模型任務對接；
- 使用後沒有任何性能提升。

即使資料量非常大，它仍可能只是：

$$
\boxed{
\text{Storage Cost}
}
$$

而不是：

$$
\boxed{
\text{Data Asset}
}
$$

因此需要重新區分：

$$
\text{Data}
\neq
\text{Dataset}
\neq
\text{Data Product}
\neq
\text{Data Asset}.
$$

---

# 2. 四層資料存在形態

## 2.1 Raw Data

最底層為：

$$
D_0=\text{Raw Data}.
$$

例如：

- 未整理文本；
- 原始遊戲錄影；
- server logs；
- Git repository；
- JSON dump；
- sensor stream；
- screenshot；
- transaction records。

這些資料可能具有資訊，但不一定已經具備可交付性。

---

## 2.2 Dataset

當資料完成：

- 篩選；
- 格式統一；
- 基本 metadata；
- 去重；
- 欄位定義；
- 基本品質控制；

可形成：

$$
D_1=\text{Dataset}.
$$

Dataset 已經可以被使用，但仍不必然適合商業授權。

---

## 2.3 Data Product

當 Dataset 再加入：

- 明確用途；
- 版本；
- schema；
- delivery mechanism；
- documentation；
- license；
- support；
- 更新政策；

則形成：

$$
D_2=\text{Data Product}.
$$

現有資料市場的實務即反映此模式。AWS Data Exchange 的資料產品以 subscription 為主要取得方式，offer 會明確包含價格、期間、付款條件與 Data Subscription Agreement；provider 亦可建立 custom / private offers。Snowflake Marketplace 同樣支援 paid listings 與 pricing plans；Databricks Marketplace 則將 dataset、model 等作為可被 listing 與交換的 data products。

因此，市場實際交易的已不是單純：

> 一包 CSV。

而是：

> 一個具有條款、期間、交付與服務邊界的資料產品。

---

## 2.4 Data Asset

本文進一步定義：

$$
\boxed{
D_3=\text{Data Asset}
}
$$

當且僅當 Data Product 不只是能交付，而且能持續產生可衡量效益。

可形式化為：

$$
\boxed{
\mathcal D_A
=
(D,R,S,P,V,U,M)
}
$$

其中任何一項長期接近零，都可能使資產價值快速下降。

---

# 3. 資料交易的核心不是「賣掉資料」

一般人第一次思考資料商業化時，常使用實體商品直覺：

> 我有一份資料，賣給某公司後，資料就是他的。

但資料具有：

$$
\boxed{
\text{Non-rival Copyability}
}
$$

也就是同一份資料在技術上可以被複製並授權給多個使用者。

因此更自然的商業單位是：

$$
\boxed{
\text{License}
}
$$

而不是：

$$
\boxed{
\text{Transfer of the only copy}.
}
$$

---

# 4. 權利向量：同一份資料可以有不同商品

令某資料集為：

$$
D.
$$

它的授權權限可以形成：

$$
\boxed{
L(D)
=
(
l_r,
l_g,
l_e,
l_f,
l_t,
l_c,
l_d
)
}
$$

其中：

- $l_r$：Research；
- $l_g$：RAG / Retrieval；
- $l_e$：Evaluation / Benchmark；
- $l_f$：Fine-tuning；
- $l_t$：Model Training；
- $l_c$：Commercial Deployment；
- $l_d$：Derivative / Redistribution。

因此：

$$
L_1(D)\neq L_2(D)
$$

即使兩個客戶拿到的是同一份內容，其商業權利也可能完全不同。

例如：

### License A

```text
Research only
No model training
No redistribution
12 months
```

### License B

```text
Internal RAG
Commercial application allowed
No foundation-model training
No raw-data redistribution
```

### License C

```text
Fine-tuning and evaluation allowed
Commercial model deployment allowed
No raw-data resale
Perpetual internal use
```

### License D

```text
Foundation-model training allowed
Derivative model commercialization allowed
Raw corpus redistribution prohibited
```

此時真正出售的是：

$$
\boxed{
\text{Authorized Capability over Data}
}
$$

---

# 5. AI 訓練使「用途」變成授權核心

傳統資料授權可能主要關注：

- 閱讀；
- 顯示；
- 分析；
- 再出版。

AI 時代則新增：

- embedding；
- retrieval；
- fine-tuning；
- pretraining；
- RL / preference learning；
- evaluation；
- synthetic derivative generation。

因此：

$$
\boxed{
\text{Use Type}
}
$$

本身成為重要契約維度。

臺灣數位發展部於 2026 年推出「臺灣主權 AI 訓練語料授權條款」第 1 版，正反映 AI training 已需要專門處理資料使用、期間、識別與授權資訊等問題。

這意味著：

$$
\boxed{
\text{AI Training Rights}
}
$$

已逐漸成為可被單獨描述與治理的權利層。

---

# 6. 資料價值不是檔案大小

假設兩個資料集：

$$
D_A
$$

與：

$$
D_B.
$$

其中：

$$
|D_A|=10\text{ TB}
$$

而：

$$
|D_B|=5\text{ GB}.
$$

不能因此推出：

$$
V(D_A)>V(D_B).
$$

如果 $D_A$：

- 充滿重複；
- 權利不清；
- 無標註；
- 無任務對應；
- 對模型沒有增益；

而 $D_B$：

- 高度稀缺；
- 來源清楚；
- 結構穩定；
- 對某專業任務具有巨大提升；

則可能：

$$
\boxed{
V(D_B)\gg V(D_A).
}
$$

因此，AI 資料的基本估值思路應從容量轉向有效資訊增益。

---

# 7. 一個初步的資料資產價值模型

本文提出一個內部評估形式：

$$
\boxed{
V_D
\propto
R
\cdot
Q
\cdot
P
\cdot
S
\cdot
U
\cdot
N
\cdot
M
}
$$

其中：

- $R$：Rights clarity；
- $Q$：Quality；
- $P$：Provenance；
- $S$：Structure；
- $U$：Utility；
- $N$：Novelty / Scarcity；
- $M$：Maintainability。

這不是市場定價公式，而是一個研究判斷模型。

它的重要意義在於：

> 高價值資料不是只有「高品質」。

---

# 8. Provenance 為什麼會變成資產的一部分？

AI 系統需要知道：

- 資料從哪裡來；
- 誰有權授權；
- 何時取得；
- 是否修改；
- 哪一版；
- 是否含第三方內容；
- 是否存在限制；
- 哪些資料是推論；
- 哪些資料是原始觀察。

因此資料來源不應只是附註。

應把：

$$
\boxed{
P=\text{Provenance}
}
$$

視為資料本體的一部分。

Defined.ai 的資料合作與 marketplace 模式即明確要求供應者具有資料商業化與 AI training 的合法權利，並進行資料來源與權利審查。

沒有 provenance 的資料可能仍然有資訊價值，但其企業可採購性會顯著下降。

---

# 9. 結構化的價值：AI 能不能真正使用？

假設有一百萬份文字。

最簡單作法：

$$
\text{Text}
\rightarrow
\text{Chunk}
\rightarrow
\text{Embedding}.
$$

這當然有用。

但某些領域需要的不只是文字相似性。

例如真正的專業資料可能還需要：

- entity；
- state；
- action；
- relation；
- outcome；
- version；
- evidence；
- confidence；
- dependency；
- failure mode。

因此：

$$
\boxed{
\text{Machine-readable}
\neq
\text{Machine-usable}.
}
$$

JSON 並不自動等於高階結構。

真正的問題是：

> 這個結構是否對任務形成有效歸納偏置？

---

# 10. 最好的銷售證明不是「我的資料很好」

如果要證明資料價值，最有效的方法不是描述資料多珍貴。

而是測：

$$
\boxed{
M+D
>
M
}
$$

其中：

- $M$：基準模型；
- $D$：資料產品。

定義：

$$
\Delta P
=
P(M+D)-P(M).
$$

可測：

- accuracy；
- hallucination rate；
- task completion；
- code correctness；
- retrieval precision；
- reconstruction success；
- agent success rate；
- planning quality。

如果：

$$
P(M)=0.54
$$

而：

$$
P(M+D)=0.79,
$$

則：

$$
\Delta P=0.25.
$$

這就是資料最直接的效益證據。

---

# 11. Corpus + Benchmark 比 Corpus 更接近資產

因此未來真正成熟的資料商品應該不是只有：

```text
dataset.zip
```

而是：

```text
dataset/
schema/
documentation/
provenance/
license/
train/
dev/
test/
benchmark/
baseline/
evaluation/
version/
changelog/
```

可寫成：

$$
\boxed{
\text{Data Asset}
=
\text{Corpus}
+
\text{Benchmark}
+
\text{Usage Contract}
}
$$

Benchmark 的存在使資料從：

> 也許有用。

變成：

> 可以被測量是否有用。

---

# 12. 資料市場正在從 Data 走向 Data Product

目前 AWS Data Exchange、Snowflake Marketplace、Databricks Marketplace 等平台均已將資料供應者、listing、subscription、paid listing、private offer 或 data product 等概念產品化。

這表示資料市場已逐漸建立：

$$
\boxed{
\text{Data}
\rightarrow
\text{Product}
\rightarrow
\text{Offer}
\rightarrow
\text{License}
\rightarrow
\text{Delivery}
}
$$

的基礎設施。

因此個人或小型研究團隊真正缺乏的通常不是：

> 能不能把資料放上網？

而是：

> 能不能把資料變成買方知道如何評估、如何合法使用、如何整合、如何持續取得的產品？

---

# 13. AI 時代的資料生產成本正在改變

生成式 AI 使大量內容可以低成本產生。

因此：

$$
C_{\text{generation}}\downarrow.
$$

如果生成速度持續提升，僅有：

> 大量文字。

將逐漸降低稀缺性。

資料資產的競爭因而轉向：

$$
\boxed{
\text{Generation}
\rightarrow
\text{Validation}
\rightarrow
\text{Selection}
\rightarrow
\text{Structuring}
}
$$

也就是：

> 問題將從「誰有最多資料」逐漸轉成「誰知道哪些資料值得留下」。

---

# 14. 高品質資料不是終點

傳統資料工程常將：

$$
Q=\text{Quality}
$$

作為核心目標。

在資料稀缺、標註昂貴的年代，這是合理的。

但若未來：

- AI 大量生成；
- 計算機自動測試；
- verifier 自動篩選；
- simulation 自動驗證；
- schema 自動檢查；

則可能出現大量：

$$
Q(x)\geq\tau_Q
$$

的候選。

此時 Quality 逐漸由：

$$
\text{Optimization Target}
$$

變成：

$$
\text{Admission Threshold}.
$$

這將引出本系列下一篇的重要問題：

$$
\boxed{
\text{If everything is valid, what remains scarce?}
}
$$

答案可能是：

$$
\boxed{
\text{Novelty}.
}
$$

---

# 15. 從 Content Data 到 Executable Data

一般文本資料主要記錄：

$$
\text{Description}.
$$

但存在另一種更高密度資料：

$$
\boxed{
(s_t,a_t,s_{t+1})
}
$$

也就是：

- 當下狀態；
- 執行動作；
- 世界如何改變。

若再加入：

$$
(g,c,o)
$$

其中：

- $g$：goal；
- $c$：constraint；
- $o$：outcome；

則形成：

$$
\boxed{
(s_t,a_t,g,c,s_{t+1},o)
}
$$

這已經不只是內容。

它開始描述：

$$
\boxed{
\text{How a World Operates}.
}
$$

---

# 16. 為什麼下一步會進入遊戲？

遊戲是極具代表性的可執行資料源。

因為遊戲天然包含：

- state；
- action；
- rules；
- goal；
- feedback；
- resource；
- history；
- world transition。

因此：

$$
\boxed{
\text{Game}
=
\text{Content}
+
\text{Executable System}
}
$$

小說主要留下：

> 發生了什麼。

影片可以留下：

> 看起來發生了什麼。

而遊戲還可以讓研究者問：

> 如果我改變行動，系統會怎麼回應？

因此它天然提供反事實操作空間：

$$
\boxed{
a_1\neq a_2
\Rightarrow
s'_{1}\neq s'_{2}.
}
$$

這使遊戲非常適合作為：

$$
\boxed{
\text{Executable Causal Data}
}
$$

的研究母體。

---

# 17. 資料資產與遊戲解構的連接

若只錄製遊戲影片：

$$
\text{Game}
\rightarrow
\text{Video}
$$

我們得到的是表面 observation。

若進一步記錄：

$$
\text{State}
+
\text{Action}
+
\text{Rule}
+
\text{Transition}
+
\text{Outcome},
$$

則資料開始具有結構。

若再進一步抽取：

- FSM；
- Behavior Tree；
- Utility；
- Scheduler；
- Memory；
- Priority；
- Interrupt；
- World State；
- Composition；

則：

$$
\boxed{
\text{Game Experience}
\rightarrow
\text{Computable Intelligence Structure}.
}
$$

這正是本系列第二部將研究的核心。

---

# 18. 本文命題

## 命題一：資料—資產非同一命題

$$
\boxed{
\text{Data}
\not\equiv
\text{Data Asset}.
}
$$

資料需經權利、結構、來源、驗證、效益與維護才能形成可持續資產。

---

## 命題二：使用權優先命題

AI 時代資料商業化的主要單位可以是：

$$
\boxed{
\text{Licensed Use}
}
$$

而不需要是資料所有權永久移轉。

---

## 命題三：模型增益證明命題

資料價值若能用：

$$
\Delta P>0
$$

穩定證明，其商業可評估性將顯著高於只依賴主觀品質描述的資料。

---

## 命題四：結構增值命題

在內容相同時，能夠提供：

- 可尋址結構；
- 穩定 schema；
- provenance；
- task mapping；
- validation；

的資料，對 AI 系統的可操作價值通常高於純 raw dump。

---

## 命題五：可執行資料升階命題

若資料不只描述結果，而能保存：

$$
\text{State}
\rightarrow
\text{Action}
\rightarrow
\text{Transition}
\rightarrow
\text{Outcome},
$$

則它可進一步支援：

- Agent learning；
- planning；
- reconstruction；
- simulation；
- causal analysis；
- executable validation。

---

# 19. 研究與商業的分離

本文並不主張：

> 所有資料都應被出售。

一個資料集可以具有：

$$
V_{\text{commercial}}>0
$$

但其持有人仍選擇：

$$
\text{Commercialize}=0.
$$

資料資產化的意義首先是：

> 知道自己擁有什麼。

而不是：

> 必須把所有東西標價。

因此：

$$
\boxed{
\text{Asset Recognition}
\neq
\text{Mandatory Monetization}.
}
$$

這個區分對知識公共性、開源文化與研究倫理尤其重要。

---

# 20. 結論：AI 時代真正賣的是「可用性」

資料市場表面上看起來是在交易資料。

但更深層地說，真正被交易的是：

$$
\boxed{
\text{Permission}
+
\text{Structure}
+
\text{Trust}
+
\text{Utility}.
}
$$

沒有授權，資料可能不能安全使用。

沒有結構，AI 可能只能低效讀取。

沒有 provenance，企業無法有效治理。

沒有 benchmark，買方無法知道它是否真的有價值。

因此：

$$
\boxed{
\text{Raw Data}
\rightarrow
\text{Structured Data}
\rightarrow
\text{Licensed Data Product}
\rightarrow
\text{Measured Data Asset}.
}
$$

但生成式 AI 又將進一步改變這條鏈。

當：

$$
\text{Generation Cost}\downarrow
$$

而：

$$
\text{Validation Capacity}\uparrow,
$$

下一個真正稀缺的東西將不再只是：

$$
\text{High Quality}.
$$

而會開始轉向：

$$
\boxed{
\text{Novelty}
+
\text{Utility}
+
\text{Executable Difference}.
}
$$

因此下一篇將進一步研究：

# **02｜高品質資料之後：從 Quality Paradigm 到 Novelty Paradigm**

---

# 參考資料

1. Amazon Web Services, **AWS Data Exchange User Guide — Product subscriptions / Creating offers / Data products**, accessed 2026-08-16.  
   <https://docs.aws.amazon.com/data-exchange/latest/userguide/product-subscriptions.html>  
   <https://docs.aws.amazon.com/data-exchange/latest/userguide/prepare-offers.html>  
   <https://docs.aws.amazon.com/marketplace/latest/userguide/data-products.html>

2. Snowflake Documentation, **Snowflake Marketplace — Paid listings / Pricing models / Provider listings**, accessed 2026-08-16.  
   <https://docs.snowflake.com/en/collaboration/collaboration-marketplace-about>  
   <https://docs.snowflake.com/en/en/collaboration/provider-listings-pricing-model>

3. Databricks Documentation, **Databricks Marketplace — Provider and listing documentation**, accessed 2026-08-16.  
   <https://docs.databricks.com/aws/en/marketplace>  
   <https://docs.databricks.com/aws/en/marketplace/create-listing>

4. Defined.ai, **Partnership Programs / Data License Agreement / AI Training Data Platform**, accessed 2026-08-16.  
   <https://defined.ai/partnership-programs>  
   <https://defined.ai/data-license-agreement>  
   <https://defined.ai/>

5. 數位發展部，**臺灣主權 AI 訓練語料庫與臺灣主權 AI 訓練語料授權條款第 1 版**，2026。  
   <https://moda.gov.tw/en/digital-affairs/plural-innovation/operations/18874>  
   <https://taic.moda.gov.tw/content/license>

---

## 系列導航

- 01｜AI 時代的資料資產：從「賣資料」到授權可計算知識
- 02｜高品質資料之後：從 Quality Paradigm 到 Novelty Paradigm
- 03｜遊戲不是內容資料：遊戲作為可執行因果世界
- 04｜商業遊戲智能考古：從 AI 名作到普通遊戲群
- 05｜遊戲解構經濟學：成本、難度、資訊增益與研究深度
- 06｜商業遊戲 AI 的隱藏層：真正稀缺的是組合，而非基礎演算法
- 07｜餵資料不等於學習：從 Raw Exposure 到深層解構學習
- 08｜理解的工程驗收：如果真的懂，就重建給我看
- 09｜合成資料之後：從模仿既有設計到探索新穎可執行設計空間
- 10｜慣老闆測試：意圖重建、設計生成與可執行世界考古
