# 雙側資料生產：Creator Intent 與 Player Trajectory

## Dual-Sided Data Production: Creator Intent and Player Trajectory in Generative Interactive Platforms

**系列**：生成式互動平台與人工世界資料飛輪，第 2 篇／共 7 篇  
**系列英文名**：Generative Interactive Platforms and Artificial-World Data Flywheels  
**系列代碼**：GIAW  
**文件編號**：EML-GIAW-2026-02-v0.1  
**作者**：Neo.K with Aletheia（GPT-5.6 Sol）  
**機構**：EveMissLab／一言諾科技有限公司  
**版本**：v0.1  
**日期**：2026-09-12  
**性質**：AI Platform Theory／Artificial Worlds／World Models／Human-AI Interaction／Data Flywheel  
**狀態**：Public Theory Draft  
**直接前置**：GIAW-01《生成式互動平台不是遊戲平台》；遊戲本體論系列；AGPL Series；ECGC Series  
**後續接口**：GIAW-03《反轉的創作者經濟》；GIAW-04《推薦函數即遊戲設計者》

---

## 摘要

生成式互動平台通常被表面理解為「使用者輸入想法，AI 生成遊戲，玩家再進入遊玩」的內容生產平台。然而，若平台能完整觀測創作者的生成、修改與拒絕過程，同時又能觀測玩家在人工世界中的狀態、行動、結果與留存行為，則平台實際產生的並不只是遊戲內容，而是兩套具有不同統計性質、語義層級與訓練價值的資料流。

本文提出「雙側資料生產」（Dual-Sided Data Production）框架，將生成式互動平台中的資料來源分為：

$$
\mathcal D_C
=
\text{Creator-Side Intent Data}
$$

與

$$
\mathcal D_P
=
\text{Player-Side Trajectory Data}.
$$

創作者側資料描述「人類想要什麼世界、如何修正 AI 生成結果、哪些結果被接受或拒絕」；玩家側資料則描述「在已生成世界中，人類看見什麼、做了什麼、世界如何轉移、何時產生回饋、何時離開或重試」。兩者分別對應：

$$
\boxed{
\text{Intent}
\rightarrow
\text{World Construction}
}
$$

與

$$
\boxed{
\text{World State}
+
\text{Action}
\rightarrow
\text{Consequence}
}
$$

當兩側資料被同一平台串接後，即形成一個過去傳統遊戲平台較少擁有的閉環：模型不只觀察「玩家如何玩」，也能觀察「世界最初是如何被要求、生成、修改與接受」。因此，生成式互動平台可能逐步形成一種以人工世界為中介的人類意圖—世界結構—行動軌跡聯合資料層。

本文不假設任何單一平台已完成此閉環，也不主張所有蒐集資料都具有足夠品質或可合法用於訓練。本文的目標是建立一套可檢驗框架，分析何種資料真正具有模型價值、何種資料只是噪聲、何時雙側資料會形成可持續的 AI 成長飛輪，以及這種飛輪會產生哪些新的經濟與治理問題。

**關鍵詞**：生成式互動平台、雙側資料生產、Creator Intent、Player Trajectory、Artificial World、World Model、Action-Conditioned Data、Preference Learning、Human-AI Interaction、Data Flywheel

---

# 1. 問題提出：遊戲內容不是唯一產物

傳統遊戲平台的核心資料物件通常是：

$$
\mathcal G
=
\{
G_1,G_2,\ldots,G_n
\},
$$

其中每個 $G_i$ 是一個已完成或至少可執行的遊戲。

平台主要管理：

- 遊戲檔案；
- 商店頁面；
- 玩家帳號；
- 購買紀錄；
- 遊玩時間；
- 成就；
- 社群資料；
- 評價；
- 部分遙測資料。

然而，在生成式互動平台中，一個遊戲不再只是最終檔案，而可能是一條生成歷史：

$$
G_i
=
\left(
I_0,
P_1,
W_1,
E_1,
P_2,
W_2,
E_2,
\ldots,
W_k
\right),
$$

其中：

- $I_0$：最初意圖；
- $P_t$：第 $t$ 次 prompt、自然語言指令或其他輸入；
- $W_t$：第 $t$ 次生成的世界／程式／資產狀態；
- $E_t$：創作者對結果的編輯、接受、拒絕、回退或補充；
- $W_k$：最終發布版本。

因此，平台獲得的不是單一：

$$
\text{Final Game},
$$

而是一條：

$$
\text{Intent}
\rightarrow
\text{Generation}
\rightarrow
\text{Evaluation}
\rightarrow
\text{Revision}
\rightarrow
\text{Publication}
$$

的演化軌跡。

同一時間，玩家也不是只提供「下載」或「遊玩時間」，而是在可觀測人工世界中形成：

$$
\tau
=
(
S_0,O_0,A_0,S_1,O_1,A_1,\ldots,S_T
),
$$

其中：

- $S_t$：世界真實或近似狀態；
- $O_t$：玩家在 $t$ 時刻可見的觀測；
- $A_t$：玩家行動；
- $S_{t+1}$：行動後世界狀態；
- $T$：episode 長度。

這形成了第二條資料軌跡。

因此本文的第一個核心命題是：

$$
\boxed{
\text{Generative Interactive Platform}
\neq
\text{Content Repository}.
}
$$

更準確地說：

$$
\boxed{
\text{Platform Output}
=
\text{Content}
+
\text{Creator-Side Data}
+
\text{Player-Side Data}.
}
$$

---

# 2. 雙側資料生產框架

定義一個生成式互動平台：

$$
\mathcal P
=
(
\mathcal C,
\mathcal W,
\mathcal U,
\mathcal M,
\mathcal R
),
$$

其中：

- $\mathcal C$：創作者集合；
- $\mathcal W$：人工世界集合；
- $\mathcal U$：玩家／使用者集合；
- $\mathcal M$：生成、推薦、世界模型與分析模型集合；
- $\mathcal R$：平台 runtime 與規則。

平台同時產生兩組主要資料：

$$
\mathcal D
=
\mathcal D_C
\oplus
\mathcal D_P.
$$

其中：

$$
\mathcal D_C
=
\{
d^C_1,d^C_2,\ldots
\}
$$

為創作者側資料；

$$
\mathcal D_P
=
\{
d^P_1,d^P_2,\ldots
\}
$$

為玩家側資料。

兩者的語義並不同。

創作者側主要回答：

> 「人想建構什麼？」

玩家側主要回答：

> 「人在一個既定世界中實際如何行動？」

因此：

$$
\boxed{
\mathcal D_C
\text{ encodes constructional preference,}
}
$$

而：

$$
\boxed{
\mathcal D_P
\text{ encodes behavioral preference and interaction dynamics.}
}
$$

只有將兩者區分後，才能正確分析平台的訓練價值。

---

# 3. Creator-Side Intent Data

## 3.1 創作者不是只提供 prompt

將單一創作者工作階段表示為：

$$
\sigma_C
=
(
I,
Q,
G,
R,
A,
X
),
$$

其中：

- $I$：原始創作意圖；
- $Q$：指令序列；
- $G$：生成結果序列；
- $R$：修訂操作；
- $A$：接受／拒絕訊號；
- $X$：最終發布或放棄狀態。

因此，創作者側資料不是：

$$
\text{Prompt}
\rightarrow
\text{Game}
$$

這麼簡單。

更接近：

$$
I_0
\rightarrow
G_1
\rightarrow
R_1
\rightarrow
G_2
\rightarrow
R_2
\rightarrow
\cdots
\rightarrow
G_n.
$$

每一次修訂都隱含了比較：

$$
G_t
\prec
G_{t+1}
$$

或至少：

$$
G_t
\notin
\mathcal A_{\text{creator}},
$$

其中 $\mathcal A_{\text{creator}}$ 是創作者願意接受的結果集合。

這使 revision history 成為隱性的 preference data。

---

## 3.2 Prompt 並不是完整意圖

自然語言 prompt 通常只是人類意圖的一個投影：

$$
P
=
\Pi_L(I),
$$

其中：

- $I$：高維創作意圖；
- $\Pi_L$：語言投影；
- $P$：文字指令。

因此：

$$
P
\neq
I.
$$

創作者後續修訂：

$$
R_1,R_2,\ldots,R_n
$$

其實是在補回一部分沒有被最初 prompt 完整表達的意圖。

若平台只保存第一個 prompt 與最終遊戲，它看到的是：

$$
P_0
\rightarrow
G_f.
$$

若平台保留完整生成與修訂歷史，它得到的則是：

$$
I
\approx
\{
P_0,
R_1,
R_2,\ldots,R_n,
A
\}.
$$

因此，對模型而言：

$$
\boxed{
\text{Revision Trace}
>
\text{Initial Prompt Alone}
}
$$

在許多任務中可能具有更高的 supervision density。

---

# 4. Creator Data 的細分

創作者資料至少可以拆成六類。

## 4.1 Intent Declaration Data

例如：

- 題材；
- 玩法；
- 美術風格；
- 難度；
- 節奏；
- 角色；
- 世界規則；
- 互動形式；
- 裝置限制。

記為：

$$
D_{\text{intent}}.
$$

---

## 4.2 Construction Data

AI 如何把意圖轉成：

- code；
- scene graph；
- sprites；
- animation；
- level；
- rules；
- UI；
- audio；
- state machine。

記為：

$$
D_{\text{construct}}.
$$

---

## 4.3 Revision Data

創作者指出：

- 太慢；
- 太難；
- 不夠爽；
- 不符合世界觀；
- 美術錯；
- UI 錯；
- lag；
- 關卡不合理；
- 玩家看不懂；
- 系統互相衝突。

記為：

$$
D_{\text{revise}}.
$$

---

## 4.4 Acceptance Data

包括：

$$
\text{Accept},
\text{Reject},
\text{Retry},
\text{Undo},
\text{Publish},
\text{Abandon}.
$$

記為：

$$
D_{\text{accept}}.
$$

---

## 4.5 Structural Edit Data

若平台允許直接修改 code、graph、parameter、asset 或 rule，則可得到：

$$
D_{\text{struct-edit}}.
$$

這比純語言修訂具有更高結構性。

---

## 4.6 Creator Outcome Data

最終作品是否：

- 發布；
- 被再次修改；
- 被複製；
- 被分享；
- 被刪除；
- 產生玩家；
- 形成後續版本。

記為：

$$
D_{\text{creator-outcome}}.
$$

因此完整創作者資料可寫為：

$$
\mathcal D_C
=
D_{\text{intent}}
\oplus
D_{\text{construct}}
\oplus
D_{\text{revise}}
\oplus
D_{\text{accept}}
\oplus
D_{\text{struct-edit}}
\oplus
D_{\text{creator-outcome}}.
$$

---

# 5. Player-Side Trajectory Data

玩家端與創作者端的本體完全不同。

玩家通常不告訴平台：

> 「我認為這款遊戲的狀態轉移函數應該改成什麼。」

玩家提供的是實際行動。

對單一 episode，可表示為：

$$
\tau_P
=
(
S_t,
O_t,
A_t,
R_t,
S_{t+1}
)_{t=0}^{T-1}.
$$

其中 $R_t$ 不必只是遊戲內 reward，也可以包含：

- 得分；
- 死亡；
- 成功；
- retry；
- pause；
- quit；
- restart；
- share；
- like；
- follow；
- return。

這使玩家資料具有 action-conditioned 性質。

---

# 6. 玩家資料不是「停留時間」而已

若平台只看：

$$
T_{\text{session}},
$$

則很難區分：

- 玩家正在認真玩；
- 玩家發呆；
- 玩家卡住；
- 玩家離開裝置；
- 玩家看不懂；
- 玩家故意等待；
- 遊戲 lag。

因此真正高價值玩家資料應至少包含：

$$
\mathcal D_P
=
D_{\text{obs}}
\oplus
D_{\text{action}}
\oplus
D_{\text{transition}}
\oplus
D_{\text{reward}}
\oplus
D_{\text{termination}}
\oplus
D_{\text{return}}.
$$

其中：

- $D_{\text{obs}}$：玩家可見資訊；
- $D_{\text{action}}$：玩家輸入；
- $D_{\text{transition}}$：世界反應；
- $D_{\text{reward}}$：局部回饋；
- $D_{\text{termination}}$：退出或 episode 結束原因；
- $D_{\text{return}}$：後續是否回來。

因此：

$$
\boxed{
\text{Play Count}
\ll
\text{Trajectory Information}
}
$$

在模型價值上通常成立。

---

# 7. 行動—後果資料的特殊價值

純影片資料通常提供：

$$
X_t
\rightarrow
X_{t+1}.
$$

但它不一定知道造成轉移的 action。

人工世界可提供：

$$
(S_t,A_t)
\rightarrow
S_{t+1}.
$$

因此模型可以更直接學習：

$$
P(S_{t+1}\mid S_t,A_t).
$$

若存在多玩家與部分可觀測性，還可以延伸為：

$$
P(S_{t+1}\mid S_t,A_t^1,\ldots,A_t^n,\Omega_t).
$$

其中 $\Omega_t$ 表示：

- 隨機事件；
- 環境噪聲；
- 隱藏規則；
- 其他 actor；
- server-side dynamics。

這使遊戲／人工世界資料天然適合：

- world model；
- planning；
- counterfactual prediction；
- opponent modeling；
- agent evaluation；
- policy learning；
- causal hypothesis testing。

---

# 8. Creator Side 與 Player Side 的第一次耦合

雙側資料真正有意思的地方，不是各自存在，而是可以對同一個人工世界對齊。

對世界 $W_i$，平台可能同時擁有：

$$
C_i
=
\text{Creator Trace}(W_i)
$$

與：

$$
P_i
=
\{
\tau_{i1},
\tau_{i2},
\ldots,
\tau_{im}
\}.
$$

因此可形成：

$$
Z_i
=
(
C_i,
W_i,
P_i
).
$$

這代表平台知道：

1. 這個世界最初被怎樣要求；
2. AI 怎樣生成；
3. 創作者怎樣修正；
4. 最後發布成什麼；
5. 玩家進入後做什麼；
6. 哪些地方讓玩家留下；
7. 哪些地方導致退出；
8. 哪些設計造成 retry；
9. 哪些版本比前版更有效。

這種資料比單純：

$$
\text{Prompt}
\rightarrow
\text{Output}
$$

多了一層現實測試。

---

# 9. 從「生成正確」到「體驗有效」

生成模型通常可以被訓練成：

$$
P(W\mid I).
$$

也就是：

> 給定意圖 $I$，生成世界 $W$。

但生成式互動平台可以進一步估計：

$$
P(Y\mid I,W,U),
$$

其中 $Y$ 可以是：

- engagement；
- retention；
- completion；
- retry；
- enjoyment proxy；
- frustration proxy；
- share；
- return。

因此平台的模型目標可以從：

$$
\text{Intent Matching}
$$

升級為：

$$
\text{Intent Matching}
+
\text{Experience Outcome Prediction}.
$$

更完整地：

$$
P(W^\star\mid I,U)
\propto
P(W\mid I)\cdot P(Y^\star\mid W,U).
$$

其中 $W^\star$ 是對特定使用者或群體更可能產生期望體驗的人工世界。

這是 Experience Model 與一般 code/game generation model 的根本差異之一。

---

# 10. Preference Signal 的多層結構

玩家偏好不應被壓縮成單一：

$$
\text{Like}=1,\quad \text{Dislike}=0.
$$

更合理的是：

$$
P_u(W)
=
(
p_{\text{enter}},
p_{\text{continue}},
p_{\text{retry}},
p_{\text{return}},
p_{\text{share}},
p_{\text{create-related}},
\ldots
).
$$

同一玩家可能：

- 願意點進去；
- 不願意玩久；
- 願意重試；
- 不願意明天再回來。

因此：

$$
\text{Preference}
$$

是多維向量，而不是單一數值。

此外：

$$
\text{High Engagement}
\not\Rightarrow
\text{High Satisfaction}.
$$

例如：

- 困惑；
- exploit；
- rage retry；
- compulsive loop；
- loading；
- accidental idle。

都可能增加時間或操作量。

因此資料飛輪若只最大化 engagement，可能學到錯誤效用函數。

---

# 11. 雙側資料的互補性

創作者側與玩家側的價值不相同。

創作者資料回答：

$$
\text{What should exist?}
$$

玩家資料回答：

$$
\text{What happens when it exists?}
$$

前者偏向：

- intention；
- specification；
- construction；
- correction。

後者偏向：

- behavior；
- consequence；
- interaction；
- revealed preference。

兩者結合：

$$
\boxed{
\text{Declared Preference}
+
\text{Revealed Preference}
}
$$

形成較完整的人類—世界互動資料。

但兩者也可能衝突。

創作者說：

> 「我想做一款高難度遊戲。」

玩家卻快速離開。

這不代表創作者錯，也不代表玩家錯，而可能表示：

$$
\text{Objective}_{\text{creator}}
\neq
\text{Objective}_{\text{player}}.
$$

因此模型不能簡單把兩者平均。

---

# 12. Intent–Trajectory Alignment

本文提出 Intent–Trajectory Alignment：

$$
\mathcal A_{IT}
=
\text{Align}(
I_C,
W,
\tau_P,
Y_P
).
$$

其中：

- $I_C$：創作者意圖；
- $W$：人工世界；
- $\tau_P$：玩家軌跡；
- $Y_P$：玩家結果。

研究問題變成：

> 創作者想要的體驗，是否真的在玩家行為中出現？

例如創作者想要：

$$
I_C
=
\text{fast, satisfying, low-friction}.
$$

若玩家資料顯示：

$$
T_{\text{first-action}}\uparrow,
\quad
\text{quit}_{30s}\uparrow,
\quad
\text{retry}\downarrow,
$$

則：

$$
\mathcal A_{IT}
$$

偏低。

平台可以因此學習：

$$
\text{Design Intention}
\rightarrow
\text{Behavioral Realization}.
$$

這是比單純生成 code 更高階的學習問題。

---

# 13. Revision–Outcome Causality

若一個世界有多版本：

$$
W_1,W_2,\ldots,W_k,
$$

且每次修改都有對應玩家資料：

$$
P_1,P_2,\ldots,P_k,
$$

則平台可以做準因果分析：

$$
\Delta W_t
\rightarrow
\Delta Y_t.
$$

例如：

$$
\Delta W_t
=
\text{Reduce tutorial length},
$$

對應：

$$
\Delta Y_t
=
\text{30s retention improvement}.
$$

或者：

$$
\Delta W_t
=
\text{Add particles},
$$

結果：

$$
\Delta Y_t
=
\text{FPS decline}
+
\text{quit increase}.
$$

這比靜態資料集更接近：

$$
\text{Intervention}
\rightarrow
\text{Outcome}.
$$

但必須注意：

$$
\text{Correlation}
\neq
\text{Causation}.
$$

因為同時可能存在：

- 推薦流量改變；
- 玩家族群改變；
- 時段改變；
- 裝置差異；
- 版本外的其他調整。

因此需要控制或隨機實驗。

---

# 14. 人工世界作為資料座標系

生成式互動平台的一個特殊優勢是：

每條資料都不必是無上下文 event。

它可以被綁定到：

$$
W_i
$$

這個人工世界。

因此 event：

$$
e_t
$$

可以擁有：

$$
e_t
=
(
W_i,
S_t,
O_t,
A_t,
R_t,
S_{t+1},
U_j
).
$$

世界本身提供：

- 規則；
- 空間；
- 物件；
- 任務；
- 資源；
- 行動約束；
- 勝敗條件；
- 因果結構。

這使資料天然具有結構背景。

因此：

$$
\boxed{
\text{Artificial World}
=
\text{Data Coordinate System}.
}
$$

遊戲不只是資料來源，也是一種把行為資料結構化的容器。

---

# 15. 玩家不是單純標註員

把玩家理解成：

> 「替 AI 免費標資料的人」

過度簡化。

玩家真正提供的是：

$$
\text{Closed-Loop Interaction}.
$$

他們不是對靜態答案打分，而是在世界中連續改變狀態。

因此：

$$
A_t
$$

會改變：

$$
S_{t+1},
$$

而：

$$
S_{t+1}
$$

又改變後續：

$$
A_{t+1}.
$$

所以資料不是 IID label，而是：

$$
\text{Path-Dependent Sequential Data}.
$$

這對 agent 與 world-model 訓練特別重要。

---

# 16. 創作者也不是單純內容供應商

同樣地，創作者不是只提供：

$$
\text{Game Asset}.
$$

創作者提供：

$$
\text{Intent Trace}
+
\text{Correction Trace}
+
\text{Design Judgment}.
$$

如果平台能保存這些過程，就能建立：

$$
\text{Human Design Preference Dataset}.
$$

它可能包含：

- 哪些生成結果被否定；
- 哪些錯誤最常被修；
- 哪些 prompt 容易產生錯誤；
- 哪些設計模式被反覆要求；
- 哪些 runtime 限制迫使創作者妥協；
- 哪些視覺／玩法元素常被保留。

因此，平台的 creator base 本身也是模型演化來源。

---

# 17. 資料量與資料價值不能等同

定義原始資料量：

$$
V_{\text{raw}}.
$$

有效資料量：

$$
V_{\text{eff}}
=
V_{\text{raw}}
\cdot
q
\cdot
d
\cdot
a
\cdot
c,
$$

其中：

- $q$：品質；
- $d$：多樣性；
- $a$：可對齊性；
- $c$：可用性／合規性。

因此：

$$
V_{\text{raw}}\uparrow
$$

不保證：

$$
V_{\text{eff}}\uparrow.
$$

大量：

- 重複模板；
- accidental click；
- idle session；
- bot-like behavior；
- 低變異玩法；
- 相同 prompt；
- 同質化創作者；

都可能使有效資訊量低於表面事件數。

---

# 18. Design-Space Diversity

若平台中的世界高度同質：

$$
W_1\approx W_2\approx\cdots\approx W_n,
$$

那即使：

$$
n\rightarrow\infty,
$$

有效資料多樣性仍可能很低。

定義人工世界多樣性：

$$
D_W
=
D(
\text{Rules},
\text{Mechanics},
\text{StateSpace},
\text{ActionSpace},
\text{Observation},
\text{Objectives},
\text{Aesthetics}
).
$$

若推薦演算法與 runtime 同時把創作者壓向相同局部最優：

$$
D_W\downarrow.
$$

此時：

$$
\text{More Games}
\not\Rightarrow
\text{More World Diversity}.
$$

這將直接影響世界模型的泛化價值。

這一點會在 GIAW-04 與 GIAW-05 進一步展開。

---

# 19. Creator–Player–Model 三角

生成式互動平台不應只畫成：

$$
\text{Creator}
\rightarrow
\text{Game}
\rightarrow
\text{Player}.
$$

更完整的結構是：

$$
\text{Creator}
\leftrightarrow
\text{Model}
\leftrightarrow
\text{World}
\leftrightarrow
\text{Player}.
$$

更具體：

$$
\text{Creator}
\rightarrow
\text{Intent}
\rightarrow
\text{Model}
\rightarrow
\text{World}
\rightarrow
\text{Player}
\rightarrow
\text{Trajectory}
\rightarrow
\text{Model}.
$$

因此模型同時位於：

- 世界生成之前；
- 世界運行之中；
- 世界評估之後。

這是典型的：

$$
\boxed{
\text{Model-in-the-Loop Platform}.
}
$$

---

# 20. 雙側飛輪

本文定義最小雙側資料飛輪：

$$
M_t
\rightarrow
W_t
\rightarrow
(C_t,P_t)
\rightarrow
D_t
\rightarrow
M_{t+1}.
$$

其中：

- $M_t$：第 $t$ 代模型；
- $W_t$：模型產生的人工世界；
- $C_t$：創作者修訂；
- $P_t$：玩家互動；
- $D_t$：聯合資料；
- $M_{t+1}$：更新模型。

若：

$$
Q(M_{t+1})>Q(M_t),
$$

則形成正向能力成長。

但此飛輪只有在以下條件成立時才成立：

$$
\Delta Q_M
>
0.
$$

如果新增資料只是：

- 更多相同類型的遊戲；
- 更多低品質流量；
- 更多短暫 novelty；
- 更多演算法自我複製；

則：

$$
\Delta Q_M
\approx 0
$$

甚至可能：

$$
\Delta Q_M<0.
$$

因此「有飛輪」不等於「飛輪有效」。

---

# 21. 自我污染風險

若模型 $M_t$ 產生世界：

$$
W_t=M_t(I),
$$

接著平台再用：

$$
W_t
$$

所產生的資料訓練：

$$
M_{t+1},
$$

則可能出現 model-induced distribution collapse。

即：

$$
M_t
\rightarrow
W_t
\rightarrow
D_t
\rightarrow
M_{t+1}
$$

中，資料分布本身受到舊模型限制。

如果舊模型只擅長：

$$
\mathcal W_{\text{narrow}},
$$

新資料也主要落在：

$$
\mathcal W_{\text{narrow}}.
$$

最後：

$$
M_{t+1}
$$

會更加擅長同一窄域，而非擴大能力。

因此需要：

- human novelty；
- external source；
- cross-engine generation；
- deliberate exploration；
- counterfactual worlds；
- synthetic diversity controls。

---

# 22. 雙側資料的反身性

平台推薦什麼，玩家就玩什麼。

玩家玩什麼，平台就得到什麼資料。

平台得到什麼資料，又影響模型學什麼。

因此：

$$
\text{Recommendation}_t
\rightarrow
\text{Data}_t
\rightarrow
\text{Model}_{t+1}
\rightarrow
\text{Recommendation}_{t+1}.
$$

這形成：

$$
\boxed{
\text{Data Reflexivity}.
}
$$

所以資料不是被動反映「人類真正喜歡什麼」。

而是部分由平台先前的：

- 推薦；
- runtime；
- 生成能力；
- UI；
- 商業規則；

共同塑造。

因此：

$$
\text{ObservedPreference}
\neq
\text{LatentPreference}.
$$

---

# 23. 三種偏好不能混在一起

至少應區分：

## 23.1 Declared Preference

人說：

> 「我想要 X。」

記為：

$$
P_D.
$$

## 23.2 Revealed Preference

人實際選擇：

$$
P_R.
$$

## 23.3 Platform-Induced Preference

平台因推薦、摩擦、預設值而誘發的選擇：

$$
P_I.
$$

觀察到的行為：

$$
P_{\text{obs}}
=
f(P_D,P_R,P_I).
$$

若平台直接把：

$$
P_{\text{obs}}
$$

當作真實人類效用函數，可能產生系統性錯誤。

---

# 24. 資料品質的最低條件

本文提出雙側資料有效性的最低條件。

## Creator-Side

應能辨識：

- 同一創作者 session；
- prompt sequence；
- revision order；
- accepted／rejected branch；
- final artifact；
- version lineage。

## Player-Side

應能辨識：

- session；
- world version；
- state；
- action；
- timestamp；
- termination reason；
- device/runtime condition。

## Cross-Side

應能對齊：

$$
\text{CreatorTrace}
\leftrightarrow
\text{WorldVersion}
\leftrightarrow
\text{PlayerTrajectory}.
$$

如果版本對不起來，雙側資料價值大幅降低。

---

# 25. 資料治理不是附加問題

若平台建立：

$$
\mathcal D_C
\oplus
\mathcal D_P,
$$

就必須回答：

- 創作者是否知道 revision trace 被保存？
- 玩家是否知道 action trajectory 被保存？
- 是否用於模型訓練？
- 是否可退出？
- 是否可刪除？
- 作品權利如何處理？
- 私人 prompt 是否進入訓練？
- 未成年人資料如何治理？
- 商業機密是否可能被吸收？
- 創作者是否能區分「平台功能資料」與「模型訓練資料」？

因此：

$$
\text{Data Flywheel}
$$

必須伴隨：

$$
\text{Data Governance}.
$$

否則：

$$
\text{Model Capability Growth}
$$

可能與：

$$
\text{Trust Decay}
$$

同時發生。

---

# 26. 可證偽命題

本文提出以下可證偽命題。

## H1：Revision Trace Value Hypothesis

若保存完整 revision trace 的模型，在 intent-to-world 任務上未優於只看 initial prompt + final world 的模型，則：

$$
D_{\text{revise}}
$$

的增量價值有限。

---

## H2：Trajectory Value Hypothesis

若完整：

$$
(S_t,A_t,S_{t+1})
$$

資料對 world-model prediction 不優於單純 session time 與 aggregate metrics，則 action-conditioned trajectory 的訓練價值被高估。

---

## H3：Cross-Side Alignment Hypothesis

若 Creator Intent 與 Player Trajectory 對齊後，無法改善：

- experience prediction；
- design correction；
- world generation；
- retention calibration；

則：

$$
\mathcal D_C
\oplus
\mathcal D_P
$$

的聯合價值有限。

---

## H4：Diversity Hypothesis

若世界數增加但 world diversity 不增加，模型 OOD 泛化不應顯著改善。

---

## H5：Reflexivity Risk Hypothesis

若推薦與生成器過度收斂，則資料分布會出現：

$$
\text{Entropy}(\mathcal D_{t+1})
<
\text{Entropy}(\mathcal D_t).
$$

若長期觀測未出現此現象，則自我污染風險可能低於本文預期。

---

# 27. 與遊戲本體論的接口

遊戲本體論將人工世界表示為：

$$
\mathcal W
=
\langle
S,P,R,A,T,O,C,U,F,H,L
\rangle.
$$

雙側資料框架進一步加入：

$$
I_C
$$

與：

$$
\tau_P.
$$

因此：

$$
\mathcal W^\star
=
(
\mathcal W,
I_C,
\tau_P
).
$$

這使「遊戲本體論」從靜態世界結構，向：

$$
\text{World}
+
\text{Construction History}
+
\text{Interaction History}
$$

擴展。

---

# 28. 與 AGPL 的接口

AGPL 把遊戲視為受控世界模型實驗室。

本文補充：

若平台不只控制世界，還能記錄：

$$
\text{CreatorTrace}
$$

與：

$$
\text{PlayerTrajectory},
$$

則人工世界實驗室同時成為：

$$
\boxed{
\text{World Construction Laboratory}
+
\text{Behavioral Interaction Laboratory}.
}
$$

因此研究者不只測：

> Agent 在世界中做什麼？

還可以測：

> 世界設計怎樣影響 Agent／Human 行為？

---

# 29. 與 Capability Compilation 的接口

Capability Compilation 關注：

$$
S_t,A_t,R_t,Y_t
$$

與 replay。

本文補充來源：

$$
\mathcal D_C
$$

可以提供：

- task construction；
- design objective；
- correction criterion。

而：

$$
\mathcal D_P
$$

可以提供：

- behavior；
- failure；
- adaptation；
- outcome。

因此未來能力編譯資料可形成：

$$
\text{Intent}
\rightarrow
\text{World}
\rightarrow
\text{Behavior}
\rightarrow
\text{Outcome}
\rightarrow
\text{Operator Update}.
$$

---

# 30. 生成式互動平台的真正資料單位

傳統平台常以：

$$
\text{Game}
$$

作為基本單位。

本文主張，AI 原生互動平台更適合以：

$$
\boxed{
\mathcal U_i
=
(
I_i,
H_i^C,
W_i,
H_i^P,
Y_i
)
}
$$

為資料單位。

其中：

- $I_i$：創作者意圖；
- $H_i^C$：創作者生成／修訂歷史；
- $W_i$：人工世界；
- $H_i^P$：玩家互動歷史；
- $Y_i$：結果。

這是一個：

$$
\text{Intent–World–Trajectory Unit}.
$$

它比「一款遊戲」更接近 AI 模型可使用的資料結構。

---

# 31. 核心結論

本文將生成式互動平台中的資料生產重新定義為：

$$
\boxed{
\mathcal D
=
\mathcal D_C
\oplus
\mathcal D_P.
}
$$

其中：

$$
\mathcal D_C
:
\text{Human Intent}
\rightarrow
\text{World Construction},
$$

而：

$$
\mathcal D_P
:
\text{World State}
+
\text{Human Action}
\rightarrow
\text{Consequence}.
$$

兩者結合後，平台得到：

$$
\boxed{
\text{Intent}
\rightarrow
\text{World}
\rightarrow
\text{Action}
\rightarrow
\text{Outcome}
}
$$

這是一條比傳統「prompt → output」更完整的學習鏈。

因此，生成式互動平台的核心資產可能不只包括：

$$
\text{Games}
$$

而是：

$$
\boxed{
\text{Human Intent Traces}
+
\text{Artificial Worlds}
+
\text{Human Action Trajectories}
+
\text{Outcome Signals}.
}
$$

當這四者能被合法、透明、高品質地對齊，平台就可能從「內容生成器」升級為：

$$
\boxed{
\text{Human–Artificial-World Learning System}.
}
$$

---

# 32. 對下一篇的接口

GIAW-03 將處理一個直接衍生問題：

若創作者與玩家實際上同時提供：

$$
\text{Content}
+
\text{Data}
+
\text{Evaluation}
+
\text{Distribution}
$$

那麼傳統：

$$
\text{Creator Revenue Share}
$$

是否仍足以描述這種平台的經濟關係？

下一篇將提出：

$$
\boxed{
\text{Creator Economy}
\rightarrow
\text{Data-Producing Creator Economy}
}
$$

並分析 Creator Fund、低額播放補貼、模型訓練價值、資料取得成本與平台資本化之間可能存在的結構性不對稱。

---

# 附錄 A：Creator Trace 最小資料結構

```yaml
creator_trace:
  creator_id_hash:
  project_id:
  session_id:

  intent:
    initial_prompt:
    constraints:
    references:

  generations:
    - generation_id:
      parent_generation_id:
      prompt:
      model_version:
      world_version:
      output_hash:

  revisions:
    - revision_id:
      target_generation:
      operation:
      reason:
      accepted:

  final_state:
    published:
    abandoned:
    world_version:
```

---

# 附錄 B：Player Trajectory 最小資料結構

```yaml
player_trajectory:
  player_id_hash:
  world_id:
  world_version:
  session_id:

  steps:
    - t:
      observation:
      action:
      state_transition:
      reward_proxy:

  termination:
    type:
    time:
    reason:

  return:
    d1:
    d7:
    d30:
```

---

# 附錄 C：Intent–World–Trajectory Unit

```yaml
iwt_unit:
  intent_ref:
  creator_trace_ref:
  world_ref:
  player_trajectory_refs:
  outcome_summary:

  alignment:
    intent_realization:
    behavioral_realization:
    retention:
    revision_effect:

  governance:
    creator_consent:
    player_consent:
    training_eligible:
    deletion_state:
```

---

# 附錄 D：一句話版本

> **生成式互動平台真正特殊之處，不只是 AI 能生成遊戲，而是同一平台可能同時觀測「人如何要求世界被創造」與「人如何在被創造的世界中行動」，從而形成 Intent–World–Trajectory 的雙側學習資料。**
