← Archive
lm-004272 · 2026-10

雙側資料生產:Creator Intent 與 Player Trajectory

下載 MD 檔 ⬇

雙側資料生產:Creator Intent 與 Player Trajectory

Dual-Sided Data Production: Creator Intent and Player Trajectory in Generative Interactive Platforms

系列:生成式互動平台與人工世界資料飛輪,第 2 篇/共 7 篇
系列英文名:Generative Interactive Platforms and Artificial-World Data Flywheels
系列代碼:GIAW
文件編號:EML-GIAW-2026-02-v0.1
作者:Neo.K with Aletheia(GPT-5.6 Sol)
機構:EveMissLab/一言諾科技有限公司
版本:v0.1
日期:2026-09-12
性質:AI Platform Theory/Artificial Worlds/World Models/Human-AI Interaction/Data Flywheel
狀態:Public Theory Draft
直接前置:GIAW-01《生成式互動平台不是遊戲平台》;遊戲本體論系列;AGPL Series;ECGC Series
後續接口:GIAW-03《反轉的創作者經濟》;GIAW-04《推薦函數即遊戲設計者》


摘要

生成式互動平台通常被表面理解為「使用者輸入想法,AI 生成遊戲,玩家再進入遊玩」的內容生產平台。然而,若平台能完整觀測創作者的生成、修改與拒絕過程,同時又能觀測玩家在人工世界中的狀態、行動、結果與留存行為,則平台實際產生的並不只是遊戲內容,而是兩套具有不同統計性質、語義層級與訓練價值的資料流。

本文提出「雙側資料生產」(Dual-Sided Data Production)框架,將生成式互動平台中的資料來源分為:

DC=Creator-Side Intent Data\mathcal D_C = \text{Creator-Side Intent Data}

與

DP=Player-Side Trajectory Data.\mathcal D_P = \text{Player-Side Trajectory Data}.

創作者側資料描述「人類想要什麼世界、如何修正 AI 生成結果、哪些結果被接受或拒絕」;玩家側資料則描述「在已生成世界中,人類看見什麼、做了什麼、世界如何轉移、何時產生回饋、何時離開或重試」。兩者分別對應:

Intent→World Construction\boxed{ \text{Intent} \rightarrow \text{World Construction} }

與

World State+Action→Consequence\boxed{ \text{World State} + \text{Action} \rightarrow \text{Consequence} }

當兩側資料被同一平台串接後,即形成一個過去傳統遊戲平台較少擁有的閉環:模型不只觀察「玩家如何玩」,也能觀察「世界最初是如何被要求、生成、修改與接受」。因此,生成式互動平台可能逐步形成一種以人工世界為中介的人類意圖—世界結構—行動軌跡聯合資料層。

本文不假設任何單一平台已完成此閉環,也不主張所有蒐集資料都具有足夠品質或可合法用於訓練。本文的目標是建立一套可檢驗框架,分析何種資料真正具有模型價值、何種資料只是噪聲、何時雙側資料會形成可持續的 AI 成長飛輪,以及這種飛輪會產生哪些新的經濟與治理問題。

關鍵詞:生成式互動平台、雙側資料生產、Creator Intent、Player Trajectory、Artificial World、World Model、Action-Conditioned Data、Preference Learning、Human-AI Interaction、Data Flywheel


1. 問題提出:遊戲內容不是唯一產物

傳統遊戲平台的核心資料物件通常是:

G={G1,G2,…,Gn},\mathcal G = \{ G_1,G_2,\ldots,G_n \},

其中每個 GiG_i 是一個已完成或至少可執行的遊戲。

平台主要管理:

  • 遊戲檔案;
  • 商店頁面;
  • 玩家帳號;
  • 購買紀錄;
  • 遊玩時間;
  • 成就;
  • 社群資料;
  • 評價;
  • 部分遙測資料。

然而,在生成式互動平台中,一個遊戲不再只是最終檔案,而可能是一條生成歷史:

Gi=(I0,P1,W1,E1,P2,W2,E2,…,Wk),G_i = \left( I_0, P_1, W_1, E_1, P_2, W_2, E_2, \ldots, W_k \right),

其中:

  • I0I_0:最初意圖;
  • PtP_t:第 tt 次 prompt、自然語言指令或其他輸入;
  • WtW_t:第 tt 次生成的世界/程式/資產狀態;
  • EtE_t:創作者對結果的編輯、接受、拒絕、回退或補充;
  • WkW_k:最終發布版本。

因此,平台獲得的不是單一:

Final Game,\text{Final Game},

而是一條:

Intent→Generation→Evaluation→Revision→Publication\text{Intent} \rightarrow \text{Generation} \rightarrow \text{Evaluation} \rightarrow \text{Revision} \rightarrow \text{Publication}

的演化軌跡。

同一時間,玩家也不是只提供「下載」或「遊玩時間」,而是在可觀測人工世界中形成:

τ=(S0,O0,A0,S1,O1,A1,…,ST),\tau = ( S_0,O_0,A_0,S_1,O_1,A_1,\ldots,S_T ),

其中:

  • StS_t:世界真實或近似狀態;
  • OtO_t:玩家在 tt 時刻可見的觀測;
  • AtA_t:玩家行動;
  • St+1S_{t+1}:行動後世界狀態;
  • TT:episode 長度。

這形成了第二條資料軌跡。

因此本文的第一個核心命題是:

Generative Interactive Platform≠Content Repository.\boxed{ \text{Generative Interactive Platform} \neq \text{Content Repository}. }

更準確地說:

Platform Output=Content+Creator-Side Data+Player-Side Data.\boxed{ \text{Platform Output} = \text{Content} + \text{Creator-Side Data} + \text{Player-Side Data}. }

2. 雙側資料生產框架

定義一個生成式互動平台:

P=(C,W,U,M,R),\mathcal P = ( \mathcal C, \mathcal W, \mathcal U, \mathcal M, \mathcal R ),

其中:

  • C\mathcal C:創作者集合;
  • W\mathcal W:人工世界集合;
  • U\mathcal U:玩家/使用者集合;
  • M\mathcal M:生成、推薦、世界模型與分析模型集合;
  • R\mathcal R:平台 runtime 與規則。

平台同時產生兩組主要資料:

D=DC⊕DP.\mathcal D = \mathcal D_C \oplus \mathcal D_P.

其中:

DC={d1C,d2C,…}\mathcal D_C = \{ d^C_1,d^C_2,\ldots \}

為創作者側資料;

DP={d1P,d2P,…}\mathcal D_P = \{ d^P_1,d^P_2,\ldots \}

為玩家側資料。

兩者的語義並不同。

創作者側主要回答:

「人想建構什麼?」

玩家側主要回答:

「人在一個既定世界中實際如何行動?」

因此:

DC encodes constructional preference,\boxed{ \mathcal D_C \text{ encodes constructional preference,} }

而:

DP encodes behavioral preference and interaction dynamics.\boxed{ \mathcal D_P \text{ encodes behavioral preference and interaction dynamics.} }

只有將兩者區分後,才能正確分析平台的訓練價值。


3. Creator-Side Intent Data

3.1 創作者不是只提供 prompt

將單一創作者工作階段表示為:

σC=(I,Q,G,R,A,X),\sigma_C = ( I, Q, G, R, A, X ),

其中:

  • II:原始創作意圖;
  • QQ:指令序列;
  • GG:生成結果序列;
  • RR:修訂操作;
  • AA:接受/拒絕訊號;
  • XX:最終發布或放棄狀態。

因此,創作者側資料不是:

Prompt→Game\text{Prompt} \rightarrow \text{Game}

這麼簡單。

更接近:

I0→G1→R1→G2→R2→⋯→Gn.I_0 \rightarrow G_1 \rightarrow R_1 \rightarrow G_2 \rightarrow R_2 \rightarrow \cdots \rightarrow G_n.

每一次修訂都隱含了比較:

Gt≺Gt+1G_t \prec G_{t+1}

或至少:

Gt∉Acreator,G_t \notin \mathcal A_{\text{creator}},

其中 Acreator\mathcal A_{\text{creator}} 是創作者願意接受的結果集合。

這使 revision history 成為隱性的 preference data。


3.2 Prompt 並不是完整意圖

自然語言 prompt 通常只是人類意圖的一個投影:

P=ΠL(I),P = \Pi_L(I),

其中:

  • II:高維創作意圖;
  • ΠL\Pi_L:語言投影;
  • PP:文字指令。

因此:

P≠I.P \neq I.

創作者後續修訂:

R1,R2,…,RnR_1,R_2,\ldots,R_n

其實是在補回一部分沒有被最初 prompt 完整表達的意圖。

若平台只保存第一個 prompt 與最終遊戲,它看到的是:

P0→Gf.P_0 \rightarrow G_f.

若平台保留完整生成與修訂歷史,它得到的則是:

I≈{P0,R1,R2,…,Rn,A}.I \approx \{ P_0, R_1, R_2,\ldots,R_n, A \}.

因此,對模型而言:

Revision Trace>Initial Prompt Alone\boxed{ \text{Revision Trace} > \text{Initial Prompt Alone} }

在許多任務中可能具有更高的 supervision density。


4. Creator Data 的細分

創作者資料至少可以拆成六類。

4.1 Intent Declaration Data

例如:

  • 題材;
  • 玩法;
  • 美術風格;
  • 難度;
  • 節奏;
  • 角色;
  • 世界規則;
  • 互動形式;
  • 裝置限制。

記為:

Dintent.D_{\text{intent}}.

4.2 Construction Data

AI 如何把意圖轉成:

  • code;
  • scene graph;
  • sprites;
  • animation;
  • level;
  • rules;
  • UI;
  • audio;
  • state machine。

記為:

Dconstruct.D_{\text{construct}}.

4.3 Revision Data

創作者指出:

  • 太慢;
  • 太難;
  • 不夠爽;
  • 不符合世界觀;
  • 美術錯;
  • UI 錯;
  • lag;
  • 關卡不合理;
  • 玩家看不懂;
  • 系統互相衝突。

記為:

Drevise.D_{\text{revise}}.

4.4 Acceptance Data

包括:

Accept,Reject,Retry,Undo,Publish,Abandon.\text{Accept}, \text{Reject}, \text{Retry}, \text{Undo}, \text{Publish}, \text{Abandon}.

記為:

Daccept.D_{\text{accept}}.

4.5 Structural Edit Data

若平台允許直接修改 code、graph、parameter、asset 或 rule,則可得到:

Dstruct-edit.D_{\text{struct-edit}}.

這比純語言修訂具有更高結構性。


4.6 Creator Outcome Data

最終作品是否:

  • 發布;
  • 被再次修改;
  • 被複製;
  • 被分享;
  • 被刪除;
  • 產生玩家;
  • 形成後續版本。

記為:

Dcreator-outcome.D_{\text{creator-outcome}}.

因此完整創作者資料可寫為:

DC=Dintent⊕Dconstruct⊕Drevise⊕Daccept⊕Dstruct-edit⊕Dcreator-outcome.\mathcal D_C = D_{\text{intent}} \oplus D_{\text{construct}} \oplus D_{\text{revise}} \oplus D_{\text{accept}} \oplus D_{\text{struct-edit}} \oplus D_{\text{creator-outcome}}.

5. Player-Side Trajectory Data

玩家端與創作者端的本體完全不同。

玩家通常不告訴平台:

「我認為這款遊戲的狀態轉移函數應該改成什麼。」

玩家提供的是實際行動。

對單一 episode,可表示為:

τP=(St,Ot,At,Rt,St+1)t=0T−1.\tau_P = ( S_t, O_t, A_t, R_t, S_{t+1} )_{t=0}^{T-1}.

其中 RtR_t 不必只是遊戲內 reward,也可以包含:

  • 得分;
  • 死亡;
  • 成功;
  • retry;
  • pause;
  • quit;
  • restart;
  • share;
  • like;
  • follow;
  • return。

這使玩家資料具有 action-conditioned 性質。


6. 玩家資料不是「停留時間」而已

若平台只看:

Tsession,T_{\text{session}},

則很難區分:

  • 玩家正在認真玩;
  • 玩家發呆;
  • 玩家卡住;
  • 玩家離開裝置;
  • 玩家看不懂;
  • 玩家故意等待;
  • 遊戲 lag。

因此真正高價值玩家資料應至少包含:

DP=Dobs⊕Daction⊕Dtransition⊕Dreward⊕Dtermination⊕Dreturn.\mathcal D_P = D_{\text{obs}} \oplus D_{\text{action}} \oplus D_{\text{transition}} \oplus D_{\text{reward}} \oplus D_{\text{termination}} \oplus D_{\text{return}}.

其中:

  • DobsD_{\text{obs}}:玩家可見資訊;
  • DactionD_{\text{action}}:玩家輸入;
  • DtransitionD_{\text{transition}}:世界反應;
  • DrewardD_{\text{reward}}:局部回饋;
  • DterminationD_{\text{termination}}:退出或 episode 結束原因;
  • DreturnD_{\text{return}}:後續是否回來。

因此:

Play Count≪Trajectory Information\boxed{ \text{Play Count} \ll \text{Trajectory Information} }

在模型價值上通常成立。


7. 行動—後果資料的特殊價值

純影片資料通常提供:

Xt→Xt+1.X_t \rightarrow X_{t+1}.

但它不一定知道造成轉移的 action。

人工世界可提供:

(St,At)→St+1.(S_t,A_t) \rightarrow S_{t+1}.

因此模型可以更直接學習:

P(St+1∣St,At).P(S_{t+1}\mid S_t,A_t).

若存在多玩家與部分可觀測性,還可以延伸為:

P(St+1∣St,At1,…,Atn,Ωt).P(S_{t+1}\mid S_t,A_t^1,\ldots,A_t^n,\Omega_t).

其中 Ωt\Omega_t 表示:

  • 隨機事件;
  • 環境噪聲;
  • 隱藏規則;
  • 其他 actor;
  • server-side dynamics。

這使遊戲/人工世界資料天然適合:

  • world model;
  • planning;
  • counterfactual prediction;
  • opponent modeling;
  • agent evaluation;
  • policy learning;
  • causal hypothesis testing。

8. Creator Side 與 Player Side 的第一次耦合

雙側資料真正有意思的地方,不是各自存在,而是可以對同一個人工世界對齊。

對世界 WiW_i,平台可能同時擁有:

Ci=Creator Trace(Wi)C_i = \text{Creator Trace}(W_i)

與:

Pi={τi1,τi2,…,τim}.P_i = \{ \tau_{i1}, \tau_{i2}, \ldots, \tau_{im} \}.

因此可形成:

Zi=(Ci,Wi,Pi).Z_i = ( C_i, W_i, P_i ).

這代表平台知道:

  1. 這個世界最初被怎樣要求;
  2. AI 怎樣生成;
  3. 創作者怎樣修正;
  4. 最後發布成什麼;
  5. 玩家進入後做什麼;
  6. 哪些地方讓玩家留下;
  7. 哪些地方導致退出;
  8. 哪些設計造成 retry;
  9. 哪些版本比前版更有效。

這種資料比單純:

Prompt→Output\text{Prompt} \rightarrow \text{Output}

多了一層現實測試。


9. 從「生成正確」到「體驗有效」

生成模型通常可以被訓練成:

P(W∣I).P(W\mid I).

也就是:

給定意圖 II,生成世界 WW。

但生成式互動平台可以進一步估計:

P(Y∣I,W,U),P(Y\mid I,W,U),

其中 YY 可以是:

  • engagement;
  • retention;
  • completion;
  • retry;
  • enjoyment proxy;
  • frustration proxy;
  • share;
  • return。

因此平台的模型目標可以從:

Intent Matching\text{Intent Matching}

升級為:

Intent Matching+Experience Outcome Prediction.\text{Intent Matching} + \text{Experience Outcome Prediction}.

更完整地:

P(W⋆∣I,U)∝P(W∣I)⋅P(Y⋆∣W,U).P(W^\star\mid I,U) \propto P(W\mid I)\cdot P(Y^\star\mid W,U).

其中 W⋆W^\star 是對特定使用者或群體更可能產生期望體驗的人工世界。

這是 Experience Model 與一般 code/game generation model 的根本差異之一。


10. Preference Signal 的多層結構

玩家偏好不應被壓縮成單一:

Like=1,Dislike=0.\text{Like}=1,\quad \text{Dislike}=0.

更合理的是:

Pu(W)=(penter,pcontinue,pretry,preturn,pshare,pcreate-related,…).P_u(W) = ( p_{\text{enter}}, p_{\text{continue}}, p_{\text{retry}}, p_{\text{return}}, p_{\text{share}}, p_{\text{create-related}}, \ldots ).

同一玩家可能:

  • 願意點進去;
  • 不願意玩久;
  • 願意重試;
  • 不願意明天再回來。

因此:

Preference\text{Preference}

是多維向量,而不是單一數值。

此外:

High Engagement⇏High Satisfaction.\text{High Engagement} \not\Rightarrow \text{High Satisfaction}.

例如:

  • 困惑;
  • exploit;
  • rage retry;
  • compulsive loop;
  • loading;
  • accidental idle。

都可能增加時間或操作量。

因此資料飛輪若只最大化 engagement,可能學到錯誤效用函數。


11. 雙側資料的互補性

創作者側與玩家側的價值不相同。

創作者資料回答:

What should exist?\text{What should exist?}

玩家資料回答:

What happens when it exists?\text{What happens when it exists?}

前者偏向:

  • intention;
  • specification;
  • construction;
  • correction。

後者偏向:

  • behavior;
  • consequence;
  • interaction;
  • revealed preference。

兩者結合:

Declared Preference+Revealed Preference\boxed{ \text{Declared Preference} + \text{Revealed Preference} }

形成較完整的人類—世界互動資料。

但兩者也可能衝突。

創作者說:

「我想做一款高難度遊戲。」

玩家卻快速離開。

這不代表創作者錯,也不代表玩家錯,而可能表示:

Objectivecreator≠Objectiveplayer.\text{Objective}_{\text{creator}} \neq \text{Objective}_{\text{player}}.

因此模型不能簡單把兩者平均。


12. Intent–Trajectory Alignment

本文提出 Intent–Trajectory Alignment:

AIT=Align(IC,W,τP,YP).\mathcal A_{IT} = \text{Align}( I_C, W, \tau_P, Y_P ).

其中:

  • ICI_C:創作者意圖;
  • WW:人工世界;
  • τP\tau_P:玩家軌跡;
  • YPY_P:玩家結果。

研究問題變成:

創作者想要的體驗,是否真的在玩家行為中出現?

例如創作者想要:

IC=fast, satisfying, low-friction.I_C = \text{fast, satisfying, low-friction}.

若玩家資料顯示:

Tfirst-action↑,quit30s↑,retry↓,T_{\text{first-action}}\uparrow, \quad \text{quit}_{30s}\uparrow, \quad \text{retry}\downarrow,

則:

AIT\mathcal A_{IT}

偏低。

平台可以因此學習:

Design Intention→Behavioral Realization.\text{Design Intention} \rightarrow \text{Behavioral Realization}.

這是比單純生成 code 更高階的學習問題。


13. Revision–Outcome Causality

若一個世界有多版本:

W1,W2,…,Wk,W_1,W_2,\ldots,W_k,

且每次修改都有對應玩家資料:

P1,P2,…,Pk,P_1,P_2,\ldots,P_k,

則平台可以做準因果分析:

ΔWt→ΔYt.\Delta W_t \rightarrow \Delta Y_t.

例如:

ΔWt=Reduce tutorial length,\Delta W_t = \text{Reduce tutorial length},

對應:

ΔYt=30s retention improvement.\Delta Y_t = \text{30s retention improvement}.

或者:

ΔWt=Add particles,\Delta W_t = \text{Add particles},

結果:

ΔYt=FPS decline+quit increase.\Delta Y_t = \text{FPS decline} + \text{quit increase}.

這比靜態資料集更接近:

Intervention→Outcome.\text{Intervention} \rightarrow \text{Outcome}.

但必須注意:

Correlation≠Causation.\text{Correlation} \neq \text{Causation}.

因為同時可能存在:

  • 推薦流量改變;
  • 玩家族群改變;
  • 時段改變;
  • 裝置差異;
  • 版本外的其他調整。

因此需要控制或隨機實驗。


14. 人工世界作為資料座標系

生成式互動平台的一個特殊優勢是:

每條資料都不必是無上下文 event。

它可以被綁定到:

WiW_i

這個人工世界。

因此 event:

ete_t

可以擁有:

et=(Wi,St,Ot,At,Rt,St+1,Uj).e_t = ( W_i, S_t, O_t, A_t, R_t, S_{t+1}, U_j ).

世界本身提供:

  • 規則;
  • 空間;
  • 物件;
  • 任務;
  • 資源;
  • 行動約束;
  • 勝敗條件;
  • 因果結構。

這使資料天然具有結構背景。

因此:

Artificial World=Data Coordinate System.\boxed{ \text{Artificial World} = \text{Data Coordinate System}. }

遊戲不只是資料來源,也是一種把行為資料結構化的容器。


15. 玩家不是單純標註員

把玩家理解成:

「替 AI 免費標資料的人」

過度簡化。

玩家真正提供的是:

Closed-Loop Interaction.\text{Closed-Loop Interaction}.

他們不是對靜態答案打分,而是在世界中連續改變狀態。

因此:

AtA_t

會改變:

St+1,S_{t+1},

而:

St+1S_{t+1}

又改變後續:

At+1.A_{t+1}.

所以資料不是 IID label,而是:

Path-Dependent Sequential Data.\text{Path-Dependent Sequential Data}.

這對 agent 與 world-model 訓練特別重要。


16. 創作者也不是單純內容供應商

同樣地,創作者不是只提供:

Game Asset.\text{Game Asset}.

創作者提供:

Intent Trace+Correction Trace+Design Judgment.\text{Intent Trace} + \text{Correction Trace} + \text{Design Judgment}.

如果平台能保存這些過程,就能建立:

Human Design Preference Dataset.\text{Human Design Preference Dataset}.

它可能包含:

  • 哪些生成結果被否定;
  • 哪些錯誤最常被修;
  • 哪些 prompt 容易產生錯誤;
  • 哪些設計模式被反覆要求;
  • 哪些 runtime 限制迫使創作者妥協;
  • 哪些視覺/玩法元素常被保留。

因此,平台的 creator base 本身也是模型演化來源。


17. 資料量與資料價值不能等同

定義原始資料量:

Vraw.V_{\text{raw}}.

有效資料量:

Veff=Vraw⋅q⋅d⋅a⋅c,V_{\text{eff}} = V_{\text{raw}} \cdot q \cdot d \cdot a \cdot c,

其中:

  • qq:品質;
  • dd:多樣性;
  • aa:可對齊性;
  • cc:可用性/合規性。

因此:

Vraw↑V_{\text{raw}}\uparrow

不保證:

Veff↑.V_{\text{eff}}\uparrow.

大量:

  • 重複模板;
  • accidental click;
  • idle session;
  • bot-like behavior;
  • 低變異玩法;
  • 相同 prompt;
  • 同質化創作者;

都可能使有效資訊量低於表面事件數。


18. Design-Space Diversity

若平台中的世界高度同質:

W1≈W2≈⋯≈Wn,W_1\approx W_2\approx\cdots\approx W_n,

那即使:

n→∞,n\rightarrow\infty,

有效資料多樣性仍可能很低。

定義人工世界多樣性:

DW=D(Rules,Mechanics,StateSpace,ActionSpace,Observation,Objectives,Aesthetics).D_W = D( \text{Rules}, \text{Mechanics}, \text{StateSpace}, \text{ActionSpace}, \text{Observation}, \text{Objectives}, \text{Aesthetics} ).

若推薦演算法與 runtime 同時把創作者壓向相同局部最優:

DW↓.D_W\downarrow.

此時:

More Games⇏More World Diversity.\text{More Games} \not\Rightarrow \text{More World Diversity}.

這將直接影響世界模型的泛化價值。

這一點會在 GIAW-04 與 GIAW-05 進一步展開。


19. Creator–Player–Model 三角

生成式互動平台不應只畫成:

Creator→Game→Player.\text{Creator} \rightarrow \text{Game} \rightarrow \text{Player}.

更完整的結構是:

Creator↔Model↔World↔Player.\text{Creator} \leftrightarrow \text{Model} \leftrightarrow \text{World} \leftrightarrow \text{Player}.

更具體:

Creator→Intent→Model→World→Player→Trajectory→Model.\text{Creator} \rightarrow \text{Intent} \rightarrow \text{Model} \rightarrow \text{World} \rightarrow \text{Player} \rightarrow \text{Trajectory} \rightarrow \text{Model}.

因此模型同時位於:

  • 世界生成之前;
  • 世界運行之中;
  • 世界評估之後。

這是典型的:

Model-in-the-Loop Platform.\boxed{ \text{Model-in-the-Loop Platform}. }

20. 雙側飛輪

本文定義最小雙側資料飛輪:

Mt→Wt→(Ct,Pt)→Dt→Mt+1.M_t \rightarrow W_t \rightarrow (C_t,P_t) \rightarrow D_t \rightarrow M_{t+1}.

其中:

  • MtM_t:第 tt 代模型;
  • WtW_t:模型產生的人工世界;
  • CtC_t:創作者修訂;
  • PtP_t:玩家互動;
  • DtD_t:聯合資料;
  • Mt+1M_{t+1}:更新模型。

若:

Q(Mt+1)>Q(Mt),Q(M_{t+1})>Q(M_t),

則形成正向能力成長。

但此飛輪只有在以下條件成立時才成立:

ΔQM>0.\Delta Q_M > 0.

如果新增資料只是:

  • 更多相同類型的遊戲;
  • 更多低品質流量;
  • 更多短暫 novelty;
  • 更多演算法自我複製;

則:

ΔQM≈0\Delta Q_M \approx 0

甚至可能:

ΔQM<0.\Delta Q_M<0.

因此「有飛輪」不等於「飛輪有效」。


21. 自我污染風險

若模型 MtM_t 產生世界:

Wt=Mt(I),W_t=M_t(I),

接著平台再用:

WtW_t

所產生的資料訓練:

Mt+1,M_{t+1},

則可能出現 model-induced distribution collapse。

即:

Mt→Wt→Dt→Mt+1M_t \rightarrow W_t \rightarrow D_t \rightarrow M_{t+1}

中,資料分布本身受到舊模型限制。

如果舊模型只擅長:

Wnarrow,\mathcal W_{\text{narrow}},

新資料也主要落在:

Wnarrow.\mathcal W_{\text{narrow}}.

最後:

Mt+1M_{t+1}

會更加擅長同一窄域,而非擴大能力。

因此需要:

  • human novelty;
  • external source;
  • cross-engine generation;
  • deliberate exploration;
  • counterfactual worlds;
  • synthetic diversity controls。

22. 雙側資料的反身性

平台推薦什麼,玩家就玩什麼。

玩家玩什麼,平台就得到什麼資料。

平台得到什麼資料,又影響模型學什麼。

因此:

Recommendationt→Datat→Modelt+1→Recommendationt+1.\text{Recommendation}_t \rightarrow \text{Data}_t \rightarrow \text{Model}_{t+1} \rightarrow \text{Recommendation}_{t+1}.

這形成:

Data Reflexivity.\boxed{ \text{Data Reflexivity}. }

所以資料不是被動反映「人類真正喜歡什麼」。

而是部分由平台先前的:

  • 推薦;
  • runtime;
  • 生成能力;
  • UI;
  • 商業規則;

共同塑造。

因此:

ObservedPreference≠LatentPreference.\text{ObservedPreference} \neq \text{LatentPreference}.

23. 三種偏好不能混在一起

至少應區分:

23.1 Declared Preference

人說:

「我想要 X。」

記為:

PD.P_D.

23.2 Revealed Preference

人實際選擇:

PR.P_R.

23.3 Platform-Induced Preference

平台因推薦、摩擦、預設值而誘發的選擇:

PI.P_I.

觀察到的行為:

Pobs=f(PD,PR,PI).P_{\text{obs}} = f(P_D,P_R,P_I).

若平台直接把:

PobsP_{\text{obs}}

當作真實人類效用函數,可能產生系統性錯誤。


24. 資料品質的最低條件

本文提出雙側資料有效性的最低條件。

Creator-Side

應能辨識:

  • 同一創作者 session;
  • prompt sequence;
  • revision order;
  • accepted/rejected branch;
  • final artifact;
  • version lineage。

Player-Side

應能辨識:

  • session;
  • world version;
  • state;
  • action;
  • timestamp;
  • termination reason;
  • device/runtime condition。

Cross-Side

應能對齊:

CreatorTrace↔WorldVersion↔PlayerTrajectory.\text{CreatorTrace} \leftrightarrow \text{WorldVersion} \leftrightarrow \text{PlayerTrajectory}.

如果版本對不起來,雙側資料價值大幅降低。


25. 資料治理不是附加問題

若平台建立:

DC⊕DP,\mathcal D_C \oplus \mathcal D_P,

就必須回答:

  • 創作者是否知道 revision trace 被保存?
  • 玩家是否知道 action trajectory 被保存?
  • 是否用於模型訓練?
  • 是否可退出?
  • 是否可刪除?
  • 作品權利如何處理?
  • 私人 prompt 是否進入訓練?
  • 未成年人資料如何治理?
  • 商業機密是否可能被吸收?
  • 創作者是否能區分「平台功能資料」與「模型訓練資料」?

因此:

Data Flywheel\text{Data Flywheel}

必須伴隨:

Data Governance.\text{Data Governance}.

否則:

Model Capability Growth\text{Model Capability Growth}

可能與:

Trust Decay\text{Trust Decay}

同時發生。


26. 可證偽命題

本文提出以下可證偽命題。

H1:Revision Trace Value Hypothesis

若保存完整 revision trace 的模型,在 intent-to-world 任務上未優於只看 initial prompt + final world 的模型,則:

DreviseD_{\text{revise}}

的增量價值有限。


H2:Trajectory Value Hypothesis

若完整:

(St,At,St+1)(S_t,A_t,S_{t+1})

資料對 world-model prediction 不優於單純 session time 與 aggregate metrics,則 action-conditioned trajectory 的訓練價值被高估。


H3:Cross-Side Alignment Hypothesis

若 Creator Intent 與 Player Trajectory 對齊後,無法改善:

  • experience prediction;
  • design correction;
  • world generation;
  • retention calibration;

則:

DC⊕DP\mathcal D_C \oplus \mathcal D_P

的聯合價值有限。


H4:Diversity Hypothesis

若世界數增加但 world diversity 不增加,模型 OOD 泛化不應顯著改善。


H5:Reflexivity Risk Hypothesis

若推薦與生成器過度收斂,則資料分布會出現:

Entropy(Dt+1)<Entropy(Dt).\text{Entropy}(\mathcal D_{t+1}) < \text{Entropy}(\mathcal D_t).

若長期觀測未出現此現象,則自我污染風險可能低於本文預期。


27. 與遊戲本體論的接口

遊戲本體論將人工世界表示為:

W=⟨S,P,R,A,T,O,C,U,F,H,L⟩.\mathcal W = \langle S,P,R,A,T,O,C,U,F,H,L \rangle.

雙側資料框架進一步加入:

ICI_C

與:

τP.\tau_P.

因此:

W⋆=(W,IC,τP).\mathcal W^\star = ( \mathcal W, I_C, \tau_P ).

這使「遊戲本體論」從靜態世界結構,向:

World+Construction History+Interaction History\text{World} + \text{Construction History} + \text{Interaction History}

擴展。


28. 與 AGPL 的接口

AGPL 把遊戲視為受控世界模型實驗室。

本文補充:

若平台不只控制世界,還能記錄:

CreatorTrace\text{CreatorTrace}

與:

PlayerTrajectory,\text{PlayerTrajectory},

則人工世界實驗室同時成為:

World Construction Laboratory+Behavioral Interaction Laboratory.\boxed{ \text{World Construction Laboratory} + \text{Behavioral Interaction Laboratory}. }

因此研究者不只測:

Agent 在世界中做什麼?

還可以測:

世界設計怎樣影響 Agent/Human 行為?


29. 與 Capability Compilation 的接口

Capability Compilation 關注:

St,At,Rt,YtS_t,A_t,R_t,Y_t

與 replay。

本文補充來源:

DC\mathcal D_C

可以提供:

  • task construction;
  • design objective;
  • correction criterion。

而:

DP\mathcal D_P

可以提供:

  • behavior;
  • failure;
  • adaptation;
  • outcome。

因此未來能力編譯資料可形成:

Intent→World→Behavior→Outcome→Operator Update.\text{Intent} \rightarrow \text{World} \rightarrow \text{Behavior} \rightarrow \text{Outcome} \rightarrow \text{Operator Update}.

30. 生成式互動平台的真正資料單位

傳統平台常以:

Game\text{Game}

作為基本單位。

本文主張,AI 原生互動平台更適合以:

Ui=(Ii,HiC,Wi,HiP,Yi)\boxed{ \mathcal U_i = ( I_i, H_i^C, W_i, H_i^P, Y_i ) }

為資料單位。

其中:

  • IiI_i:創作者意圖;
  • HiCH_i^C:創作者生成/修訂歷史;
  • WiW_i:人工世界;
  • HiPH_i^P:玩家互動歷史;
  • YiY_i:結果。

這是一個:

Intent–World–Trajectory Unit.\text{Intent–World–Trajectory Unit}.

它比「一款遊戲」更接近 AI 模型可使用的資料結構。


31. 核心結論

本文將生成式互動平台中的資料生產重新定義為:

D=DC⊕DP.\boxed{ \mathcal D = \mathcal D_C \oplus \mathcal D_P. }

其中:

DC:Human Intent→World Construction,\mathcal D_C : \text{Human Intent} \rightarrow \text{World Construction},

而:

DP:World State+Human Action→Consequence.\mathcal D_P : \text{World State} + \text{Human Action} \rightarrow \text{Consequence}.

兩者結合後,平台得到:

Intent→World→Action→Outcome\boxed{ \text{Intent} \rightarrow \text{World} \rightarrow \text{Action} \rightarrow \text{Outcome} }

這是一條比傳統「prompt → output」更完整的學習鏈。

因此,生成式互動平台的核心資產可能不只包括:

Games\text{Games}

而是:

Human Intent Traces+Artificial Worlds+Human Action Trajectories+Outcome Signals.\boxed{ \text{Human Intent Traces} + \text{Artificial Worlds} + \text{Human Action Trajectories} + \text{Outcome Signals}. }

當這四者能被合法、透明、高品質地對齊,平台就可能從「內容生成器」升級為:

Human–Artificial-World Learning System.\boxed{ \text{Human–Artificial-World Learning System}. }

32. 對下一篇的接口

GIAW-03 將處理一個直接衍生問題:

若創作者與玩家實際上同時提供:

Content+Data+Evaluation+Distribution\text{Content} + \text{Data} + \text{Evaluation} + \text{Distribution}

那麼傳統:

Creator Revenue Share\text{Creator Revenue Share}

是否仍足以描述這種平台的經濟關係?

下一篇將提出:

Creator Economy→Data-Producing Creator Economy\boxed{ \text{Creator Economy} \rightarrow \text{Data-Producing Creator Economy} }

並分析 Creator Fund、低額播放補貼、模型訓練價值、資料取得成本與平台資本化之間可能存在的結構性不對稱。


附錄 A:Creator Trace 最小資料結構

creator_trace:
  creator_id_hash:
  project_id:
  session_id:

  intent:
    initial_prompt:
    constraints:
    references:

  generations:
    - generation_id:
      parent_generation_id:
      prompt:
      model_version:
      world_version:
      output_hash:

  revisions:
    - revision_id:
      target_generation:
      operation:
      reason:
      accepted:

  final_state:
    published:
    abandoned:
    world_version:

附錄 B:Player Trajectory 最小資料結構

player_trajectory:
  player_id_hash:
  world_id:
  world_version:
  session_id:

  steps:
    - t:
      observation:
      action:
      state_transition:
      reward_proxy:

  termination:
    type:
    time:
    reason:

  return:
    d1:
    d7:
    d30:

附錄 C:Intent–World–Trajectory Unit

iwt_unit:
  intent_ref:
  creator_trace_ref:
  world_ref:
  player_trajectory_refs:
  outcome_summary:

  alignment:
    intent_realization:
    behavioral_realization:
    retention:
    revision_effect:

  governance:
    creator_consent:
    player_consent:
    training_eligible:
    deletion_state:

附錄 D:一句話版本

生成式互動平台真正特殊之處,不只是 AI 能生成遊戲,而是同一平台可能同時觀測「人如何要求世界被創造」與「人如何在被創造的世界中行動」,從而形成 Intent–World–Trajectory 的雙側學習資料。