# 從具身軌跡到可治理經驗：多模態具身學習資料平面的架構命題

## 感知—意圖—行動—後果資料鏈的分層、授權、溯源與學習晉升模型

**英文題名：** From Embodied Trajectories to Governable Experience: An Architectural Proposition for a Multimodal Embodied Learning Data Plane  
**作者：** Neo.K  
**日期：** 2026-07-30  
**文件類型：** 公開技術論文／架構命題論文  
**版本：** v1.0  
**公開狀態：** Public  
**關鍵詞：** 具身智能、多模態資料、行動軌跡、資料治理、資料溯源、隱私、授權、技能學習、世界模型、MELDP

---

# 摘要

具身智能、電腦操作代理、機器人與虛擬世界代理正在產生一類不同於傳統文字、影像與影片語料的新資料：代理不只觀察環境，也形成目標、提出候選行動、接受安全約束、執行外部操作、承受後果、判斷成功與失敗，並在人類接管或自我修正後繼續任務。這類資料同時包含感知、語義、決策、控制、回饋與因果結構，可被稱為**多模態具身經驗資料**。

然而，現有資料管線經常把執行紀錄、產品遙測、個人化記憶、評估樣本與模型訓練資料視為可自然互換的資料集合。這種做法忽略了一個根本差異：使用者允許代理觀察或操作環境，不等於允許系統長期保存資料；允許保存，不等於允許進行個人化學習；允許個人化，也不等於允許將資料用於共享模型訓練、跨主體傳播或公開發布。

本文提出**多模態具身學習資料平面**（Multimodal Embodied Learning Data Plane, MELDP）的架構命題。MELDP 不被定義為單一資料庫，而是一個跨越具身代理生命週期的橫向資料治理平面，負責分離營運資料、私密原始資料、因果軌跡、權利與授權、去識別學習語料、資料集版本及模型血緣。

本文提出九項主要構件：

1. 具身經驗單位；
2. 多區資料分層；
3. 權利與用途向量；
4. 資料晉升閘門；
5. 隱私—效用轉換鏈；
6. 記憶—技能—參數三級學習；
7. 因果軌跡與負例保存；
8. 資料—資料集—模型溯源圖；
9. 可撤回性與模型影響追蹤。

本文的核心命題是：

$$
\boxed{
\text{營運中產生的具身資料}
\not\Rightarrow
\text{自動成為可訓練資料}
}
$$

只有在用途相容、權利允許、資料最小化、敏感資訊處理、品質審查與來源可追溯等條件同時成立時，資料才可由營運狀態晉升為學習資產。

MELDP 的最終目的不是最大化資料蒐集，而是使具身智能能夠在不破壞個人權利、內容權利與系統安全的前提下，從自身經驗中形成可刪除記憶、可版本化技能及受治理模型更新。

---

# 一、研究背景

## 1.1 從網路語料到環境互動

傳統大型模型主要由既有文字、影像、聲音與影片語料學習。具身智能則逐漸轉向：

$$
\text{環境觀察}
\rightarrow
\text{狀態理解}
\rightarrow
\text{行動}
\rightarrow
\text{環境回饋}
$$

具身 AI 研究長期強調代理透過第一視角感知及環境互動取得經驗，而不是只從靜態網路資料學習。近期研究亦指出，與實際軌跡耦合的視覺—語言資料可作為通用視覺語言模型與具身行動模型之間的中介資料；桌面與遊戲互動也可能成為具有觀察—行動耦合特性的具身預訓練來源。

這表示未來最有價值的 AI 資料之一，可能不是單純的畫面，而是：

$$
\boxed{
\text{畫面}
+
\text{理解}
+
\text{目標}
+
\text{行動}
+
\text{後果}
}
$$

---

## 1.2 普通日誌無法描述具身經驗

一般系統日誌可能只記錄：

```text
10:31:02 click x=812 y=546
10:31:03 screen_changed=true
```

但對學習而言，更有價值的資料是：

```text
目標：開啟設定
觀察：右上方有齒輪圖示
候選：齒輪、問號、關閉按鈕
選擇：齒輪
理由：圖示語義與歷史場景一致
預期：設定面板出現
執行：滑鼠移動並點擊
結果：設定面板出現
驗證：成功
```

兩者的差別不只是欄位數量，而是後者保存了：

- 參照；
- 意圖；
- 候選；
- 選擇；
- 預測；
- 因果；
- 驗證；
- 失敗可能性。

因此本文將這類資料稱為：

$$
\boxed{
\text{Embodied Experience Data}
}
$$

即具身經驗資料。

---

## 1.3 為何需要獨立資料平面

具身代理同時跨越：

- 感知系統；
- 世界模型；
- 規劃器；
- 安全政策；
- 外部執行器；
- 記憶系統；
- 評估系統；
- 模型訓練系統。

若每個模組各自保存資料，將出現：

- 重複蒐集；
- 無法確定資料來源；
- 無法判斷用途；
- 無法執行刪除；
- 無法區分個人化與共享訓練；
- 無法知道哪個模型使用過哪些資料；
- 失敗案例被遺失；
- 原始敏感資料被永久保留。

因此需要一個橫向平面，統一管理資料從產生到刪除、從營運到學習、從單次經驗到模型版本的完整生命週期。

---

# 二、研究問題

本文處理以下問題：

1. 如何形式化一筆完整的具身經驗？
2. 如何分離營運、隱私、軌跡、授權與學習資料？
3. 如何表達不同資料用途的授權範圍？
4. 什麼條件下，營運資料可以晉升為學習資料？
5. 如何兼顧資料效用與敏感資訊最小化？
6. 如何保留失敗、拒絕與人類接管等負例？
7. 如何區分記憶學習、技能學習及參數學習？
8. 如何追蹤資料對資料集、技能與模型的影響？
9. 當授權被撤回時，系統可以撤回到什麼程度？

---

# 三、相關研究與治理基線

## 3.1 具身軌跡的學習價值

具身 AI 的核心特徵是代理從環境互動中取得第一視角經驗。相關研究已把長序列軌跡用於世界模型、定位、模仿學習、計畫與行動預測。

近期「Embodied Trajectory-Coupled Data」研究主張，從同一批具身場景及軌跡衍生出的視覺—語言監督，可成為通用 VLM 轉向具身控制策略時的中介資料。另有研究指出，桌面與遊戲環境能提供可大規模收集的感知—行動耦合資料，並可能將部分數位互動中的感覺運動表徵轉移至物理具身任務。

本文不假定所有數位軌跡都能直接轉移至物理世界，而是接受以下較弱命題：

$$
\boxed{
\text{具備觀察—行動—結果耦合的資料}
>
\text{只有結果畫面的資料}
}
$$

---

## 3.2 目的限制與資料最小化

資料治理不能只處理資安，也必須處理資料被何種目的使用。

GDPR 第 5 條提出目的限制、資料最小化、正確性、保存限制等原則：個人資料應為明確、合法目的蒐集，且限於達成目的所必要的範圍。這些原則可被抽象為具身資料平面的工程要求：

$$
\text{Collect}(d)
\Rightarrow
\text{Purpose}(d)
\land
\text{Necessity}(d)
$$

NIST Privacy Framework 則將隱私風險視為資料處理活動可能對個人造成的問題，並強調從蒐集至處置的完整生命週期與資料處理生態系角色。

---

## 3.3 AI 資料治理

NIST AI RMF 將 AI 風險管理描述為跨越設計、開發、部署、使用及評估的持續工作，強調可信、可解釋、隱私增強、安全與問責。

歐盟 AI Act 第 10 條則對高風險 AI 的訓練、驗證與測試資料提出適合預定目的的資料治理與管理要求。本文並不把所有具身代理視為法律上的高風險 AI，而是採用較一般的工程推論：

> 當具身資料可能被用於訓練、驗證或評估模型時，資料治理不應等到訓練階段才開始。

---

## 3.4 資料來源與溯源

W3C PROV 資料模型以 Entity、Activity 與 Agent 描述資料如何產生、使用、轉換與歸責，並支援不同系統間交換來源資訊。

NIST Research Data Framework 也把 provenance 視為記錄資料資產何時、何地、如何及由誰產生、取得與修改的歷史紀錄。

具身資料特別需要溯源，因為同一筆訓練樣本可能來自：

```text
原始影格
→ 裁切
→ 去識別
→ Target 標註
→ 軌跡摘要
→ 技能抽取
→ 資料集
→ 模型 Checkpoint
```

只保存最終樣本，將無法回答其合法性、品質與撤回影響。

---

# 四、具身經驗單位

## 4.1 基本定義

定義第 $i$ 筆具身經驗：

$$
\mathcal{E}_i
=
(
O_i,
W_i,
G_i,
T_i,
C_i,
A_i,
P_i,
X_i,
V_i,
R_i,
H_i,
\Gamma_i
)
$$

其中：

- $O_i$ ：外部觀察；
- $W_i$ ：代理內部世界狀態；
- $G_i$ ：目標；
- $T_i$ ：被定位的 Target；
- $C_i$ ：候選行動集合；
- $A_i$ ：實際行動；
- $P_i$ ：Expected Effect；
- $X_i$ ：外部執行回執；
- $V_i$ ：結果驗證；
- $R_i$ ：恢復行動；
- $H_i$ ：人類介入；
- $\Gamma_i$ ：權利、來源、用途與保存 metadata。

---

## 4.2 經驗不是固定長度紀錄

一筆經驗可以是：

- 單次點擊；
- 數秒滑鼠拖曳；
- 一次對話框處理；
- 一個完整子任務；
- 一段數分鐘的導航；
- 一次失敗與修復；
- 一段人類接管軌跡。

因此經驗單位應支援巢狀結構：

$$
\mathcal{E}^{task}
=
\{
\mathcal{E}_1,
\mathcal{E}_2,
\dots,
\mathcal{E}_n
\}
$$

子經驗可以被折疊成摘要，但原始軌跡仍保留來源關係。

---

## 4.3 因果承諾

具身經驗與一般多模態紀錄的關鍵差異是：

$$
P_i
\leftrightarrow
V_i
$$

即：

- 行動前，代理承諾預期效果；
- 行動後，系統檢查實際效果。

因此資料可以標註：

```text
預期成功，實際成功
預期成功，實際無效果
預期 A，實際 B
不確定，要求人類
安全政策拒絕執行
```

這些資料可用於學習：

- 行動效果模型；
- 不確定性；
- 錯誤預測；
- Recovery；
- 安全停止。

---

# 五、MELDP 架構命題

## 5.1 定義

多模態具身學習資料平面定義為：

$$
\boxed{
\mathcal{D}_{MELDP}
=
(
S,
R,
P,
L,
G,
M
)
}
$$

其中：

- $S$ ：多區資料儲存；
- $R$ ：Rights Registry；
- $P$ ：Data Promotion Pipeline；
- $L$ ：Lineage／Provenance Graph；
- $G$ ：Governance and Policy；
- $M$ ：Learning Materialization。

MELDP 不是取代既有資料庫，而是規定：

- 哪種資料放在哪裡；
- 哪些用途被允許；
- 哪些轉換必須發生；
- 哪些資料可以晉升；
- 哪些模型受到影響；
- 如何執行刪除或撤回。

---

# 六、多區資料分層

## 6.1 Raw Private Vault

保存最敏感的原始資料：

- 完整影格；
- 原始音訊；
- OCR 原文；
- 帳號名稱；
- 聊天；
- 人臉；
- 裝置資訊；
- 精確時間與位置；
- 未裁切桌面內容。

基本政策：

$$
\text{DefaultTrainingPermission}=0
$$

其特徵應為：

- 本地優先；
- 加密；
- 最短必要保留；
- 嚴格存取控制；
- 明確 TTL；
- 可立即刪除；
- 不與訓練系統直接相連。

---

## 6.2 Operational State Store

保存系統繼續運作所需狀態：

- Session；
- Scene；
- Target；
- Action；
- Runtime State；
- Frame Revision；
- Checkpoint；
- Task Budget。

它回答：

> 系統如何繼續任務？

而不是：

> 這些資料可否拿去訓練？

---

## 6.3 Causal Trajectory Ledger

保存具身經驗的因果鏈：

$$
O
\rightarrow
T
\rightarrow
C
\rightarrow
A
\rightarrow
P
\rightarrow
X
\rightarrow
V
\rightarrow
R
$$

包含：

- 成功；
- 失敗；
- 拒絕；
- Retry；
- 人類接管；
- Emergency Stop。

可採 append-only 與 hash chaining：

$$
h_n
=
H(
h_{n-1},
e_n
)
$$

---

## 6.4 Consent and Rights Registry

保存資料用途、權利與期限。

它不只保存：

```text
consent = true
```

而保存多維度權利。

---

## 6.5 De-identified Learning Corpus

只有通過：

- 去識別；
- 最小化；
- 權利檢查；
- 品質檢查；
- 來源檢查；

的資料才能進入。

---

## 6.6 Dataset and Model Lineage Registry

保存：

- 資料來源；
- 衍生轉換；
- Dataset Version；
- Skill Version；
- Model Checkpoint；
- 評估結果；
- 撤回影響。

---

# 七、權利與用途向量

## 7.1 權利不是單一布林值

定義資料 $d$ 的權利向量：

$$
\mathbf{r}(d)
=
(
r_o,
r_c,
r_r,
r_p,
r_l,
r_s,
r_e,
r_u
)
$$

可分別表示：

- $r_o$ ：observe；
- $r_c$ ：control；
- $r_r$ ：record／retain；
- $r_p$ ：personalize；
- $r_l$ ：train local；
- $r_s$ ：train shared；
- $r_e$ ：export／share；
- $r_u$ ：publish。

例如：

$$
\mathbf{r}(d)
=
(
1,1,1,1,0,0,0,0
)
$$

表示：

- 可以觀察；
- 可以操作；
- 可以保存；
- 可以本地個人化；
- 不得訓練本地權重；
- 不得訓練共享模型；
- 不得分享；
- 不得公開。

---

## 7.2 操作授權與學習授權分離

核心不變量：

$$
\boxed{
r_c
\not\Rightarrow
r_r
}
$$

$$
\boxed{
r_r
\not\Rightarrow
r_l
}
$$

$$
\boxed{
r_l
\not\Rightarrow
r_s
}
$$

$$
\boxed{
r_s
\not\Rightarrow
r_u
}
$$

因此：

```text
允許代理操作
≠ 允許保存畫面
≠ 允許個人化
≠ 允許微調模型
≠ 允許跨使用者共享
≠ 允許公開資料集
```

---

## 7.3 權利 metadata

除向量外，還需要：

$$
\Gamma_r
=
(
owner,
subjects,
purpose,
jurisdiction,
expiry,
revocability,
license,
restrictions
)
$$

同一筆畫面可能同時涉及：

- 使用者；
- 其他自然人；
- 內容著作權人；
- 平台；
- 應用程式供應商；
- 模型供應商；
- 組織政策。

因此權利評估是多主體問題，而不是單一使用者勾選框。

---

# 八、資料晉升閘門

## 8.1 營運資料不自動成為學習資料

定義資料晉升函數：

$$
\Pi(d,p)
=
\begin{cases}
1, & \text{允許資料 }d\text{ 晉升至用途 }p\\
0, & \text{拒絕}
\end{cases}
$$

晉升條件：

$$
\Pi(d,p)
=
L
\land
C
\land
M
\land
R
\land
Q
\land
V
\land
S
$$

其中：

- $L$ ：合法／授權基礎存在；
- $C$ ：用途相容；
- $M$ ：資料最小化完成；
- $R$ ：敏感資訊處理完成；
- $Q$ ：品質合格；
- $V$ ：來源與轉換可驗證；
- $S$ ：安全審查通過。

---

## 8.2 標準晉升鏈

$$
\boxed{
\text{Capture}
\rightarrow
\text{Classify}
\rightarrow
\text{Minimize}
\rightarrow
\text{Redact}
\rightarrow
\text{Rights Check}
\rightarrow
\text{Quality Review}
\rightarrow
\text{Version}
\rightarrow
\text{Promote}
}
$$

任何一步失敗：

```text
reject
quarantine
delete
retain operational-only
request new authorization
```

---

## 8.3 晉升狀態

```text
RAW
CLASSIFIED
MINIMIZED
REDACTED
RIGHTS_VALIDATED
QUALITY_VALIDATED
APPROVED_FOR_MEMORY
APPROVED_FOR_SKILL
APPROVED_FOR_LOCAL_TRAINING
APPROVED_FOR_SHARED_TRAINING
REJECTED
REVOKED
DELETED
```

---

# 九、隱私—效用轉換

## 9.1 最小化目標

給定資料轉換 $\phi$ ：

$$
d'
=
\phi(d)
$$

希望：

$$
\min_{\phi}
I(d';S)
$$

同時滿足：

$$
U(d')
\geq
\theta
$$

其中：

- $S$ ：敏感資訊；
- $I(d';S)$ ：轉換後資料與敏感資訊的關聯；
- $U(d')$ ：任務效用；
- $\theta$ ：最低學習效用。

這不是宣稱可計算出完美隱私，而是把工程目標明確化：

> 保留完成學習任務所需的最小資訊，而不是盡量保存全部內容。

---

## 9.2 分層轉換

### Level 0：Raw

完整原始資料。

### Level 1：Masked

遮罩姓名、聊天、人臉、通知及帳號。

### Level 2：Cropped

只保留 Target 與相關區域。

### Level 3：Structured

轉換為：

- Target；
- Scene；
- Action；
- Verification；
- Coordinate-normalized metadata。

### Level 4：Abstracted

轉換為一般技能：

```text
find primary action
hover to disambiguate
click and verify panel appearance
```

### Level 5：Statistical

只保留統計或模型更新。

隨著抽象化程度提高，直接識別風險通常下降，但錯誤抽象與不可撤回性問題可能上升。

---

# 十、三級學習模型

## 10.1 記憶學習

$$
\mathcal{E}
\rightarrow
\mathcal{M}
$$

將經驗保存成可檢索記憶：

- 相似場景；
- 已知 Target；
- 使用者偏好；
- 失敗；
- Recovery。

特徵：

- 易刪除；
- 易修正；
- 易撤回；
- 不改模型權重；
- 適合個人化。

---

## 10.2 技能學習

$$
\{
\mathcal{E}_1,\dots,\mathcal{E}_n
\}
\rightarrow
\mathcal{K}
$$

從多筆軌跡抽象技能：

- 開啟設定；
- 處理 Loading；
- 重新定位；
- 調整 Slider；
- 處理意外對話框。

技能應具有：

- 來源集合；
- 適用條件；
- 版本；
- 失敗條件；
- 權限；
- 測試；
- 可停用性。

---

## 10.3 參數學習

$$
\mathcal{D}_{train}
\rightarrow
\theta'
$$

包括：

- Fine-tuning；
- Grounding Model；
- Preference Model；
- Action Model；
- World Model；
- Offline RL。

參數學習通常最難：

- 精確刪除單筆資料影響；
- 解釋權重來源；
- 執行授權撤回；
- 防止記憶洩漏。

因此合理的學習順序是：

$$
\boxed{
\text{Memory}
\rightarrow
\text{Skill}
\rightarrow
\text{Model Weight}
}
$$

---

## 10.4 可撤回性梯度

定義可撤回性：

$$
\mathcal{R}(x)
=
\text{從系統中移除資料影響的可行程度}
$$

一般而言：

$$
\mathcal{R}(\text{memory})
>
\mathcal{R}(\text{skill})
>
\mathcal{R}(\text{weight})
$$

因此高敏感資料應優先使用可刪除記憶，而不是直接進入參數更新。

---

# 十一、負例與失敗資料

## 11.1 為何失敗資料重要

成功軌跡回答：

> 什麼有效？

失敗軌跡回答：

- 哪裡容易混淆；
- 哪些置信度不可靠；
- 哪些 Target 會移動；
- 哪些 Click 沒有效果；
- 哪些行動進入錯誤場景；
- 什麼時候應停止；
- 什麼時候需要人類。

---

## 11.2 負例類型

```text
target_not_found
wrong_target
stale_target
policy_denied
execution_blocked
no_effect
wrong_effect
unexpected_scene
human_takeover
emergency_stop
recovery_failed
```

---

## 11.3 偏好資料

一組高價值偏好樣本：

$$
(
O,
A^-,
V^-,
H,
A^+,
V^+
)
$$

其中：

- $A^-$ ：錯誤行動；
- $V^-$ ：錯誤結果；
- $H$ ：人類更正；
- $A^+$ ：修正行動；
- $V^+$ ：正確結果。

這比只保存成功行動更適合訓練：

- Action Ranking；
- Recovery；
- Uncertainty；
- Human Escalation；
- Safety Policy。

---

# 十二、溯源圖

## 12.1 資料血緣

定義溯源圖：

$$
\mathcal{G}_p
=
(
N,
E
)
$$

節點：

```text
RawFrame
RedactedFrame
Observation
Target
Trajectory
Episode
Skill
Dataset
TrainingRun
ModelCheckpoint
Evaluation
Deployment
```

邊：

```text
wasGeneratedBy
wasDerivedFrom
used
wasAttributedTo
wasApprovedBy
wasRevokedBy
wasIncludedIn
producedModel
evaluatedBy
```

這與 W3C PROV 的 Entity、Activity、Agent 基本模型相容。

---

## 12.2 模型影響集合

定義資料 $d$ 的後代集合：

$$
Desc(d)
=
\{
x
\mid
d
\leadsto
x
\}
$$

可能包括：

- Dataset；
- Skill；
- Model Checkpoint；
- Evaluation；
- Deployment。

當資料被撤回時，系統先計算：

$$
Impact(d)
=
Desc(d)
$$

再依政策決定：

- 只停止未來使用；
- 從資料集移除；
- 重建技能；
- 重新訓練；
- 停用 Checkpoint；
- 標註無法完全撤回。

---

## 12.3 不誇大可刪除能力

MELDP 不應承諾：

> 刪除原始資料就能保證模型權重完全忘記。

更誠實的狀態是：

```text
source_deleted
future_use_blocked
dataset_removed
skill_rebuilt
model_retraining_required
model_unlearning_attempted
residual_influence_unknown
```

---

# 十三、跨主體與跨代理學習

## 13.1 個人學習與共享學習分離

定義：

$$
\mathcal{D}_{personal}
\cap
\mathcal{D}_{shared}
=
\varnothing
$$

除非資料經過明確晉升。

本地個人化資料不應自動進入共享模型。

---

## 13.2 經驗共享的最低單位

最安全的共享方式不一定是分享原始 Frame，而可能是分享：

- 抽象技能；
- 錯誤類型；
- Target Role；
- Scene Transition；
- Verification Rule；
- 統計；
- 去識別軌跡。

例如：

```text
當主要按鈕有三個相似候選時，
先 Hover 並確認 Tooltip，
再執行 Click。
```

這種技能不必包含任何使用者畫面。

---

## 13.3 聯邦式或本地優先學習

在適當場景下，可以考慮：

- Local Training；
- Federated Aggregation；
- Secure Aggregation；
- Differential Privacy；
- Gradient／Update Filtering。

但這些技術不能取代：

- 用途授權；
- 最小化；
- 資料來源；
- 權利管理。

隱私技術降低風險，不會自動創造資料使用權。

---

# 十四、資料治理不變量

MELDP 最低不變量為：

$$
\boxed{
\text{操作授權}
\neq
\text{紀錄授權}
}
$$

$$
\boxed{
\text{紀錄授權}
\neq
\text{訓練授權}
}
$$

$$
\boxed{
\text{個人化授權}
\neq
\text{共享模型授權}
}
$$

$$
\boxed{
\text{營運資料}
\not\Rightarrow
\text{訓練資料}
}
$$

$$
\boxed{
\text{無來源資料}
\not\rightarrow
\text{正式資料集}
}
$$

$$
\boxed{
\text{被拒絕資料}
\not\rightarrow
\text{其他用途}
}
$$

$$
\boxed{
\text{原始敏感資料保留期限}
\leq
\text{必要期限}
}
$$

---

# 十五、資料品質

## 15.1 具身資料品質維度

資料品質不只包含正確標籤。

還包括：

- Observation 完整性；
- Frame／Action 時間對齊；
- Target Revision；
- Execution Receipt；
- Verification；
- Scene Continuity；
- Policy Context；
- Human Correction；
- Source Integrity；
- Rights Completeness。

---

## 15.2 不完整經驗

若缺少：

- 行動前影格；
- Expected Effect；
- Runtime Receipt；
- 行動後影格；
- Verification；

則該資料不應被標記為完整因果軌跡。

定義完整性：

$$
C(\mathcal{E})
=
\frac{\text{存在的必要構件}}
{\text{全部必要構件}}
$$

不同用途可設定不同門檻。

例如：

- Grounding 訓練不一定需要 Action；
- Effect Model 必須有前後觀察；
- Recovery 模型必須有失敗與修正。

---

# 十六、系統生命週期

## 16.1 產生

代理在環境中觀察與行動。

## 16.2 營運保存

支援任務繼續、除錯與安全審計。

## 16.3 分類

判斷：

- 個資；
- 敏感資訊；
- 內容權利；
- 平台限制；
- 資料用途；
- 保留期限。

## 16.4 轉換

- Redaction；
- Crop；
- Pseudonymization；
- Structuralization；
- Abstraction。

## 16.5 晉升

依 Rights、Purpose、Quality、Provenance 決定可進入：

- Memory；
- Skill；
- Local Training；
- Shared Training；
- Evaluation；
- Publication。

## 16.6 使用

- Retrieval；
- Training；
- Evaluation；
- Benchmark；
- Skill Execution。

## 16.7 撤回與刪除

- 停止未來使用；
- 刪除原始資料；
- 更新資料集；
- 重建技能；
- 標記模型影響；
- 視需要重新訓練。

---

# 十七、架構貢獻

本文的主要架構貢獻可概括為：

## 貢獻一：具身經驗單位

把感知、內部狀態、候選行動、Expected Effect、Execution Receipt 與 Verification 整合為一筆可學習經驗。

## 貢獻二：營運—學習分離

提出資料必須經過晉升閘門，而不是從執行紀錄直接流入訓練。

## 貢獻三：權利向量

把觀察、操作、保存、個人化、本地訓練、共享訓練、分享與公開拆成不同權利維度。

## 貢獻四：三級學習

區分可刪除記憶、可版本化技能與難撤回模型權重。

## 貢獻五：因果與負例保存

將 Expected／Actual Effect、Policy Denial、No Effect、Wrong Effect 與 Human Takeover 視為一級學習資料。

## 貢獻六：溯源與影響圖

建立從原始資料到技能、資料集、模型與部署的可查詢血緣。

---

# 十八、討論

## 18.1 這是否會限制資料規模？

會。

嚴格資料治理通常降低可直接使用的資料量。

但具身資料的價值不只在規模，也在：

- 時間對齊；
- 行動參照；
- 因果驗證；
- 失敗修正；
- 高品質來源。

低治理的大量資料，可能同時包含：

- 錯誤 Target；
- 錯誤 Timestamp；
- 隱私資訊；
- 失效授權；
- 未知來源；
- 不可重播軌跡。

因此更合理的目標是：

$$
\boxed{
\text{最大化可治理的有效經驗}
}
$$

而不是最大化原始資料量。

---

## 18.2 結構化是否會損失資訊？

會。

從完整影格抽象為 Target 與 Action，必然失去部分上下文。

因此 MELDP 不應只保存單一抽象層，而應保存可控的多解析度表示：

```text
Raw
Redacted
Cropped
Structured
Abstracted
Statistical
```

不同用途取得不同層級。

---

## 18.3 權利撤回是否能真正影響已訓練模型？

不一定能完全達成。

這正是需要分層學習與 lineage 的原因。

系統至少應做到：

- 停止未來使用；
- 刪除可刪除記憶；
- 移除技能來源；
- 從後續資料集排除；
- 標記受影響模型；
- 誠實揭露殘餘影響。

---

## 18.4 MELDP 是否只適用於機器人？

不是。

它適用於所有具備：

$$
\text{Observation}
\rightarrow
\text{Action}
\rightarrow
\text{Outcome}
$$

的代理，包括：

- 機器人；
- 遊戲代理；
- 桌面操作代理；
- 瀏覽器代理；
- 虛擬世界角色；
- 工業控制代理；
- 軟體測試代理；
- 無障礙代理。

---

# 十九、未來研究

1. 具身資料權利表示語言；
2. 可機器執行的資料晉升政策；
3. Target／Action／Effect 的跨環境通用 Schema；
4. 個別經驗對模型權重影響的估計；
5. 具身模型的資料撤回與機器遺忘；
6. 跨代理技能共享的最小資訊表示；
7. 隱私保護下的失敗軌跡學習；
8. 數位具身經驗向物理具身策略的轉移；
9. 人類接管資料的偏好與安全學習；
10. 具身資料集的完整性與因果品質指標。

---

# 二十、結論

未來代理最有價值的資料，不只是人類事先準備的文字、圖片與影片，也包括代理自己在環境中形成的經驗：

$$
\boxed{
\text{看見什麼}
+
\text{如何理解}
+
\text{想做什麼}
+
\text{實際做了什麼}
+
\text{發生了什麼}
+
\text{如何修正}
}
$$

這類資料具有極高學習價值，也同時具有極高的隱私、權利、來源與安全風險。

因此，具身智能不應只建造感知器、規劃器與外部執行器，還必須建造一個獨立的資料治理平面，使資料在不同用途之間受到明確控制。

本文提出的 MELDP 命題可以濃縮為：

$$
\boxed{
\text{具身經驗}
=
\text{可學習資產}
+
\text{受治理責任}
}
$$

以及：

$$
\boxed{
\text{Operational Experience}
\xrightarrow{\text{Governed Promotion}}
\text{Learning Material}
}
$$

而不是：

$$
\text{Operational Experience}
=
\text{Training Data}
$$

只有當來源、用途、權利、最小化、品質、溯源與撤回機制共同存在時，代理從自身經驗中學習，才能從不受控的資料累積，轉化為可持續、可問責且尊重權利的智能演化。

---

# 參考文獻

1. Duan, J., Yu, S., Tan, H. L., Zhu, H., & Tan, C. “A Survey of Embodied AI: From Simulators to Research Tasks.” 2021.
2. Kotar, K., Walsman, A., & Mottaghi, R. “ENTL: Embodied Navigation Trajectory Learner.” 2023.
3. Mu, Y., et al. “EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought.” 2023.
4. Yin, L., et al. “Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data.” 2026.
5. Choi, S., et al. “D2E: Scaling Vision-Action Pretraining on Desktop Data for Transfer to Embodied AI.” 2025.
6. National Institute of Standards and Technology. “Artificial Intelligence Risk Management Framework 1.0.” NIST AI 100-1, 2023.
7. National Institute of Standards and Technology. “NIST Privacy Framework: A Tool for Improving Privacy Through Enterprise Risk Management.” Version 1.0.
8. National Institute of Standards and Technology. “NIST Research Data Framework.” NIST SP 1500-18r2.
9. World Wide Web Consortium. “PROV-O: The PROV Ontology.” W3C Recommendation, 2013.
10. European Union. Regulation (EU) 2016/679, General Data Protection Regulation, Article 5.
11. European Union. Regulation (EU) 2024/1689, Artificial Intelligence Act, Article 10.

---

# 聲明

本文為架構與工程研究，不構成針對特定司法管轄區的法律意見。實際部署仍需依應用場景、資料類型、權利主體、產業規範與所在地法律進行獨立審查。
