← Archive
lm-002255 · 2026-08

從具身軌跡到可治理經驗_多模態具身學習資料平面架構命題_公開論文_v1.0

下載 MD 檔 ⬇

從具身軌跡到可治理經驗:多模態具身學習資料平面的架構命題

感知—意圖—行動—後果資料鏈的分層、授權、溯源與學習晉升模型

英文題名: From Embodied Trajectories to Governable Experience: An Architectural Proposition for a Multimodal Embodied Learning Data Plane
作者: Neo.K
日期: 2026-07-30
文件類型: 公開技術論文/架構命題論文
版本: v1.0
公開狀態: Public
關鍵詞: 具身智能、多模態資料、行動軌跡、資料治理、資料溯源、隱私、授權、技能學習、世界模型、MELDP


摘要

具身智能、電腦操作代理、機器人與虛擬世界代理正在產生一類不同於傳統文字、影像與影片語料的新資料:代理不只觀察環境,也形成目標、提出候選行動、接受安全約束、執行外部操作、承受後果、判斷成功與失敗,並在人類接管或自我修正後繼續任務。這類資料同時包含感知、語義、決策、控制、回饋與因果結構,可被稱為多模態具身經驗資料

然而,現有資料管線經常把執行紀錄、產品遙測、個人化記憶、評估樣本與模型訓練資料視為可自然互換的資料集合。這種做法忽略了一個根本差異:使用者允許代理觀察或操作環境,不等於允許系統長期保存資料;允許保存,不等於允許進行個人化學習;允許個人化,也不等於允許將資料用於共享模型訓練、跨主體傳播或公開發布。

本文提出多模態具身學習資料平面(Multimodal Embodied Learning Data Plane, MELDP)的架構命題。MELDP 不被定義為單一資料庫,而是一個跨越具身代理生命週期的橫向資料治理平面,負責分離營運資料、私密原始資料、因果軌跡、權利與授權、去識別學習語料、資料集版本及模型血緣。

本文提出九項主要構件:

  1. 具身經驗單位;
  2. 多區資料分層;
  3. 權利與用途向量;
  4. 資料晉升閘門;
  5. 隱私—效用轉換鏈;
  6. 記憶—技能—參數三級學習;
  7. 因果軌跡與負例保存;
  8. 資料—資料集—模型溯源圖;
  9. 可撤回性與模型影響追蹤。

本文的核心命題是:

營運中產生的具身資料⇏自動成為可訓練資料\boxed{ \text{營運中產生的具身資料} \not\Rightarrow \text{自動成為可訓練資料} }

只有在用途相容、權利允許、資料最小化、敏感資訊處理、品質審查與來源可追溯等條件同時成立時,資料才可由營運狀態晉升為學習資產。

MELDP 的最終目的不是最大化資料蒐集,而是使具身智能能夠在不破壞個人權利、內容權利與系統安全的前提下,從自身經驗中形成可刪除記憶、可版本化技能及受治理模型更新。


一、研究背景

1.1 從網路語料到環境互動

傳統大型模型主要由既有文字、影像、聲音與影片語料學習。具身智能則逐漸轉向:

環境觀察狀態理解行動環境回饋\text{環境觀察} \rightarrow \text{狀態理解} \rightarrow \text{行動} \rightarrow \text{環境回饋}

具身 AI 研究長期強調代理透過第一視角感知及環境互動取得經驗,而不是只從靜態網路資料學習。近期研究亦指出,與實際軌跡耦合的視覺—語言資料可作為通用視覺語言模型與具身行動模型之間的中介資料;桌面與遊戲互動也可能成為具有觀察—行動耦合特性的具身預訓練來源。

這表示未來最有價值的 AI 資料之一,可能不是單純的畫面,而是:

畫面+理解+目標+行動+後果\boxed{ \text{畫面} + \text{理解} + \text{目標} + \text{行動} + \text{後果} }

1.2 普通日誌無法描述具身經驗

一般系統日誌可能只記錄:

10:31:02 click x=812 y=546
10:31:03 screen_changed=true

但對學習而言,更有價值的資料是:

目標:開啟設定
觀察:右上方有齒輪圖示
候選:齒輪、問號、關閉按鈕
選擇:齒輪
理由:圖示語義與歷史場景一致
預期:設定面板出現
執行:滑鼠移動並點擊
結果:設定面板出現
驗證:成功

兩者的差別不只是欄位數量,而是後者保存了:

  • 參照;
  • 意圖;
  • 候選;
  • 選擇;
  • 預測;
  • 因果;
  • 驗證;
  • 失敗可能性。

因此本文將這類資料稱為:

Embodied Experience Data\boxed{ \text{Embodied Experience Data} }

即具身經驗資料。


1.3 為何需要獨立資料平面

具身代理同時跨越:

  • 感知系統;
  • 世界模型;
  • 規劃器;
  • 安全政策;
  • 外部執行器;
  • 記憶系統;
  • 評估系統;
  • 模型訓練系統。

若每個模組各自保存資料,將出現:

  • 重複蒐集;
  • 無法確定資料來源;
  • 無法判斷用途;
  • 無法執行刪除;
  • 無法區分個人化與共享訓練;
  • 無法知道哪個模型使用過哪些資料;
  • 失敗案例被遺失;
  • 原始敏感資料被永久保留。

因此需要一個橫向平面,統一管理資料從產生到刪除、從營運到學習、從單次經驗到模型版本的完整生命週期。


二、研究問題

本文處理以下問題:

  1. 如何形式化一筆完整的具身經驗?
  2. 如何分離營運、隱私、軌跡、授權與學習資料?
  3. 如何表達不同資料用途的授權範圍?
  4. 什麼條件下,營運資料可以晉升為學習資料?
  5. 如何兼顧資料效用與敏感資訊最小化?
  6. 如何保留失敗、拒絕與人類接管等負例?
  7. 如何區分記憶學習、技能學習及參數學習?
  8. 如何追蹤資料對資料集、技能與模型的影響?
  9. 當授權被撤回時,系統可以撤回到什麼程度?

三、相關研究與治理基線

3.1 具身軌跡的學習價值

具身 AI 的核心特徵是代理從環境互動中取得第一視角經驗。相關研究已把長序列軌跡用於世界模型、定位、模仿學習、計畫與行動預測。

近期「Embodied Trajectory-Coupled Data」研究主張,從同一批具身場景及軌跡衍生出的視覺—語言監督,可成為通用 VLM 轉向具身控制策略時的中介資料。另有研究指出,桌面與遊戲環境能提供可大規模收集的感知—行動耦合資料,並可能將部分數位互動中的感覺運動表徵轉移至物理具身任務。

本文不假定所有數位軌跡都能直接轉移至物理世界,而是接受以下較弱命題:

具備觀察—行動—結果耦合的資料>只有結果畫面的資料\boxed{ \text{具備觀察—行動—結果耦合的資料} > \text{只有結果畫面的資料} }

3.2 目的限制與資料最小化

資料治理不能只處理資安,也必須處理資料被何種目的使用。

GDPR 第 5 條提出目的限制、資料最小化、正確性、保存限制等原則:個人資料應為明確、合法目的蒐集,且限於達成目的所必要的範圍。這些原則可被抽象為具身資料平面的工程要求:

Collect(d)Purpose(d)Necessity(d)\text{Collect}(d) \Rightarrow \text{Purpose}(d) \land \text{Necessity}(d)

NIST Privacy Framework 則將隱私風險視為資料處理活動可能對個人造成的問題,並強調從蒐集至處置的完整生命週期與資料處理生態系角色。


3.3 AI 資料治理

NIST AI RMF 將 AI 風險管理描述為跨越設計、開發、部署、使用及評估的持續工作,強調可信、可解釋、隱私增強、安全與問責。

歐盟 AI Act 第 10 條則對高風險 AI 的訓練、驗證與測試資料提出適合預定目的的資料治理與管理要求。本文並不把所有具身代理視為法律上的高風險 AI,而是採用較一般的工程推論:

當具身資料可能被用於訓練、驗證或評估模型時,資料治理不應等到訓練階段才開始。


3.4 資料來源與溯源

W3C PROV 資料模型以 Entity、Activity 與 Agent 描述資料如何產生、使用、轉換與歸責,並支援不同系統間交換來源資訊。

NIST Research Data Framework 也把 provenance 視為記錄資料資產何時、何地、如何及由誰產生、取得與修改的歷史紀錄。

具身資料特別需要溯源,因為同一筆訓練樣本可能來自:

原始影格
→ 裁切
→ 去識別
→ Target 標註
→ 軌跡摘要
→ 技能抽取
→ 資料集
→ 模型 Checkpoint

只保存最終樣本,將無法回答其合法性、品質與撤回影響。


四、具身經驗單位

4.1 基本定義

定義第 ii 筆具身經驗:

Ei=(Oi,Wi,Gi,Ti,Ci,Ai,Pi,Xi,Vi,Ri,Hi,Γi)\mathcal{E}_i = ( O_i, W_i, G_i, T_i, C_i, A_i, P_i, X_i, V_i, R_i, H_i, \Gamma_i )

其中:

  • OiO_i :外部觀察;
  • WiW_i :代理內部世界狀態;
  • GiG_i :目標;
  • TiT_i :被定位的 Target;
  • CiC_i :候選行動集合;
  • AiA_i :實際行動;
  • PiP_i :Expected Effect;
  • XiX_i :外部執行回執;
  • ViV_i :結果驗證;
  • RiR_i :恢復行動;
  • HiH_i :人類介入;
  • Γi\Gamma_i :權利、來源、用途與保存 metadata。

4.2 經驗不是固定長度紀錄

一筆經驗可以是:

  • 單次點擊;
  • 數秒滑鼠拖曳;
  • 一次對話框處理;
  • 一個完整子任務;
  • 一段數分鐘的導航;
  • 一次失敗與修復;
  • 一段人類接管軌跡。

因此經驗單位應支援巢狀結構:

Etask={E1,E2,,En}\mathcal{E}^{task} = \{ \mathcal{E}_1, \mathcal{E}_2, \dots, \mathcal{E}_n \}

子經驗可以被折疊成摘要,但原始軌跡仍保留來源關係。


4.3 因果承諾

具身經驗與一般多模態紀錄的關鍵差異是:

PiViP_i \leftrightarrow V_i

即:

  • 行動前,代理承諾預期效果;
  • 行動後,系統檢查實際效果。

因此資料可以標註:

預期成功,實際成功
預期成功,實際無效果
預期 A,實際 B
不確定,要求人類
安全政策拒絕執行

這些資料可用於學習:

  • 行動效果模型;
  • 不確定性;
  • 錯誤預測;
  • Recovery;
  • 安全停止。

五、MELDP 架構命題

5.1 定義

多模態具身學習資料平面定義為:

DMELDP=(S,R,P,L,G,M)\boxed{ \mathcal{D}_{MELDP} = ( S, R, P, L, G, M ) }

其中:

  • SS :多區資料儲存;
  • RR :Rights Registry;
  • PP :Data Promotion Pipeline;
  • LL :Lineage/Provenance Graph;
  • GG :Governance and Policy;
  • MM :Learning Materialization。

MELDP 不是取代既有資料庫,而是規定:

  • 哪種資料放在哪裡;
  • 哪些用途被允許;
  • 哪些轉換必須發生;
  • 哪些資料可以晉升;
  • 哪些模型受到影響;
  • 如何執行刪除或撤回。

六、多區資料分層

6.1 Raw Private Vault

保存最敏感的原始資料:

  • 完整影格;
  • 原始音訊;
  • OCR 原文;
  • 帳號名稱;
  • 聊天;
  • 人臉;
  • 裝置資訊;
  • 精確時間與位置;
  • 未裁切桌面內容。

基本政策:

DefaultTrainingPermission=0\text{DefaultTrainingPermission}=0

其特徵應為:

  • 本地優先;
  • 加密;
  • 最短必要保留;
  • 嚴格存取控制;
  • 明確 TTL;
  • 可立即刪除;
  • 不與訓練系統直接相連。

6.2 Operational State Store

保存系統繼續運作所需狀態:

  • Session;
  • Scene;
  • Target;
  • Action;
  • Runtime State;
  • Frame Revision;
  • Checkpoint;
  • Task Budget。

它回答:

系統如何繼續任務?

而不是:

這些資料可否拿去訓練?


6.3 Causal Trajectory Ledger

保存具身經驗的因果鏈:

OTCAPXVRO \rightarrow T \rightarrow C \rightarrow A \rightarrow P \rightarrow X \rightarrow V \rightarrow R

包含:

  • 成功;
  • 失敗;
  • 拒絕;
  • Retry;
  • 人類接管;
  • Emergency Stop。

可採 append-only 與 hash chaining:

hn=H(hn1,en)h_n = H( h_{n-1}, e_n )

6.4 Consent and Rights Registry

保存資料用途、權利與期限。

它不只保存:

consent = true

而保存多維度權利。


6.5 De-identified Learning Corpus

只有通過:

  • 去識別;
  • 最小化;
  • 權利檢查;
  • 品質檢查;
  • 來源檢查;

的資料才能進入。


6.6 Dataset and Model Lineage Registry

保存:

  • 資料來源;
  • 衍生轉換;
  • Dataset Version;
  • Skill Version;
  • Model Checkpoint;
  • 評估結果;
  • 撤回影響。

七、權利與用途向量

7.1 權利不是單一布林值

定義資料 dd 的權利向量:

r(d)=(ro,rc,rr,rp,rl,rs,re,ru)\mathbf{r}(d) = ( r_o, r_c, r_r, r_p, r_l, r_s, r_e, r_u )

可分別表示:

  • ror_o :observe;
  • rcr_c :control;
  • rrr_r :record/retain;
  • rpr_p :personalize;
  • rlr_l :train local;
  • rsr_s :train shared;
  • rer_e :export/share;
  • rur_u :publish。

例如:

r(d)=(1,1,1,1,0,0,0,0)\mathbf{r}(d) = ( 1,1,1,1,0,0,0,0 )

表示:

  • 可以觀察;
  • 可以操作;
  • 可以保存;
  • 可以本地個人化;
  • 不得訓練本地權重;
  • 不得訓練共享模型;
  • 不得分享;
  • 不得公開。

7.2 操作授權與學習授權分離

核心不變量:

rc⇏rr\boxed{ r_c \not\Rightarrow r_r } rr⇏rl\boxed{ r_r \not\Rightarrow r_l } rl⇏rs\boxed{ r_l \not\Rightarrow r_s } rs⇏ru\boxed{ r_s \not\Rightarrow r_u }

因此:

允許代理操作
≠ 允許保存畫面
≠ 允許個人化
≠ 允許微調模型
≠ 允許跨使用者共享
≠ 允許公開資料集

7.3 權利 metadata

除向量外,還需要:

Γr=(owner,subjects,purpose,jurisdiction,expiry,revocability,license,restrictions)\Gamma_r = ( owner, subjects, purpose, jurisdiction, expiry, revocability, license, restrictions )

同一筆畫面可能同時涉及:

  • 使用者;
  • 其他自然人;
  • 內容著作權人;
  • 平台;
  • 應用程式供應商;
  • 模型供應商;
  • 組織政策。

因此權利評估是多主體問題,而不是單一使用者勾選框。


八、資料晉升閘門

8.1 營運資料不自動成為學習資料

定義資料晉升函數:

Π(d,p)={1,允許資料 d 晉升至用途 p0,拒絕\Pi(d,p) = \begin{cases} 1, & \text{允許資料 }d\text{ 晉升至用途 }p\\ 0, & \text{拒絕} \end{cases}

晉升條件:

Π(d,p)=LCMRQVS\Pi(d,p) = L \land C \land M \land R \land Q \land V \land S

其中:

  • LL :合法/授權基礎存在;
  • CC :用途相容;
  • MM :資料最小化完成;
  • RR :敏感資訊處理完成;
  • QQ :品質合格;
  • VV :來源與轉換可驗證;
  • SS :安全審查通過。

8.2 標準晉升鏈

CaptureClassifyMinimizeRedactRights CheckQuality ReviewVersionPromote\boxed{ \text{Capture} \rightarrow \text{Classify} \rightarrow \text{Minimize} \rightarrow \text{Redact} \rightarrow \text{Rights Check} \rightarrow \text{Quality Review} \rightarrow \text{Version} \rightarrow \text{Promote} }

任何一步失敗:

reject
quarantine
delete
retain operational-only
request new authorization

8.3 晉升狀態

RAW
CLASSIFIED
MINIMIZED
REDACTED
RIGHTS_VALIDATED
QUALITY_VALIDATED
APPROVED_FOR_MEMORY
APPROVED_FOR_SKILL
APPROVED_FOR_LOCAL_TRAINING
APPROVED_FOR_SHARED_TRAINING
REJECTED
REVOKED
DELETED

九、隱私—效用轉換

9.1 最小化目標

給定資料轉換 ϕ\phi

d=ϕ(d)d' = \phi(d)

希望:

minϕI(d;S)\min_{\phi} I(d';S)

同時滿足:

U(d)θU(d') \geq \theta

其中:

  • SS :敏感資訊;
  • I(d;S)I(d';S) :轉換後資料與敏感資訊的關聯;
  • U(d)U(d') :任務效用;
  • θ\theta :最低學習效用。

這不是宣稱可計算出完美隱私,而是把工程目標明確化:

保留完成學習任務所需的最小資訊,而不是盡量保存全部內容。


9.2 分層轉換

Level 0:Raw

完整原始資料。

Level 1:Masked

遮罩姓名、聊天、人臉、通知及帳號。

Level 2:Cropped

只保留 Target 與相關區域。

Level 3:Structured

轉換為:

  • Target;
  • Scene;
  • Action;
  • Verification;
  • Coordinate-normalized metadata。

Level 4:Abstracted

轉換為一般技能:

find primary action
hover to disambiguate
click and verify panel appearance

Level 5:Statistical

只保留統計或模型更新。

隨著抽象化程度提高,直接識別風險通常下降,但錯誤抽象與不可撤回性問題可能上升。


十、三級學習模型

10.1 記憶學習

EM\mathcal{E} \rightarrow \mathcal{M}

將經驗保存成可檢索記憶:

  • 相似場景;
  • 已知 Target;
  • 使用者偏好;
  • 失敗;
  • Recovery。

特徵:

  • 易刪除;
  • 易修正;
  • 易撤回;
  • 不改模型權重;
  • 適合個人化。

10.2 技能學習

{E1,,En}K\{ \mathcal{E}_1,\dots,\mathcal{E}_n \} \rightarrow \mathcal{K}

從多筆軌跡抽象技能:

  • 開啟設定;
  • 處理 Loading;
  • 重新定位;
  • 調整 Slider;
  • 處理意外對話框。

技能應具有:

  • 來源集合;
  • 適用條件;
  • 版本;
  • 失敗條件;
  • 權限;
  • 測試;
  • 可停用性。

10.3 參數學習

Dtrainθ\mathcal{D}_{train} \rightarrow \theta'

包括:

  • Fine-tuning;
  • Grounding Model;
  • Preference Model;
  • Action Model;
  • World Model;
  • Offline RL。

參數學習通常最難:

  • 精確刪除單筆資料影響;
  • 解釋權重來源;
  • 執行授權撤回;
  • 防止記憶洩漏。

因此合理的學習順序是:

MemorySkillModel Weight\boxed{ \text{Memory} \rightarrow \text{Skill} \rightarrow \text{Model Weight} }

10.4 可撤回性梯度

定義可撤回性:

R(x)=從系統中移除資料影響的可行程度\mathcal{R}(x) = \text{從系統中移除資料影響的可行程度}

一般而言:

R(memory)>R(skill)>R(weight)\mathcal{R}(\text{memory}) > \mathcal{R}(\text{skill}) > \mathcal{R}(\text{weight})

因此高敏感資料應優先使用可刪除記憶,而不是直接進入參數更新。


十一、負例與失敗資料

11.1 為何失敗資料重要

成功軌跡回答:

什麼有效?

失敗軌跡回答:

  • 哪裡容易混淆;
  • 哪些置信度不可靠;
  • 哪些 Target 會移動;
  • 哪些 Click 沒有效果;
  • 哪些行動進入錯誤場景;
  • 什麼時候應停止;
  • 什麼時候需要人類。

11.2 負例類型

target_not_found
wrong_target
stale_target
policy_denied
execution_blocked
no_effect
wrong_effect
unexpected_scene
human_takeover
emergency_stop
recovery_failed

11.3 偏好資料

一組高價值偏好樣本:

(O,A,V,H,A+,V+)( O, A^-, V^-, H, A^+, V^+ )

其中:

  • AA^- :錯誤行動;
  • VV^- :錯誤結果;
  • HH :人類更正;
  • A+A^+ :修正行動;
  • V+V^+ :正確結果。

這比只保存成功行動更適合訓練:

  • Action Ranking;
  • Recovery;
  • Uncertainty;
  • Human Escalation;
  • Safety Policy。

十二、溯源圖

12.1 資料血緣

定義溯源圖:

Gp=(N,E)\mathcal{G}_p = ( N, E )

節點:

RawFrame
RedactedFrame
Observation
Target
Trajectory
Episode
Skill
Dataset
TrainingRun
ModelCheckpoint
Evaluation
Deployment

邊:

wasGeneratedBy
wasDerivedFrom
used
wasAttributedTo
wasApprovedBy
wasRevokedBy
wasIncludedIn
producedModel
evaluatedBy

這與 W3C PROV 的 Entity、Activity、Agent 基本模型相容。


12.2 模型影響集合

定義資料 dd 的後代集合:

Desc(d)={xdx}Desc(d) = \{ x \mid d \leadsto x \}

可能包括:

  • Dataset;
  • Skill;
  • Model Checkpoint;
  • Evaluation;
  • Deployment。

當資料被撤回時,系統先計算:

Impact(d)=Desc(d)Impact(d) = Desc(d)

再依政策決定:

  • 只停止未來使用;
  • 從資料集移除;
  • 重建技能;
  • 重新訓練;
  • 停用 Checkpoint;
  • 標註無法完全撤回。

12.3 不誇大可刪除能力

MELDP 不應承諾:

刪除原始資料就能保證模型權重完全忘記。

更誠實的狀態是:

source_deleted
future_use_blocked
dataset_removed
skill_rebuilt
model_retraining_required
model_unlearning_attempted
residual_influence_unknown

十三、跨主體與跨代理學習

13.1 個人學習與共享學習分離

定義:

DpersonalDshared=\mathcal{D}_{personal} \cap \mathcal{D}_{shared} = \varnothing

除非資料經過明確晉升。

本地個人化資料不應自動進入共享模型。


13.2 經驗共享的最低單位

最安全的共享方式不一定是分享原始 Frame,而可能是分享:

  • 抽象技能;
  • 錯誤類型;
  • Target Role;
  • Scene Transition;
  • Verification Rule;
  • 統計;
  • 去識別軌跡。

例如:

當主要按鈕有三個相似候選時,
先 Hover 並確認 Tooltip,
再執行 Click。

這種技能不必包含任何使用者畫面。


13.3 聯邦式或本地優先學習

在適當場景下,可以考慮:

  • Local Training;
  • Federated Aggregation;
  • Secure Aggregation;
  • Differential Privacy;
  • Gradient/Update Filtering。

但這些技術不能取代:

  • 用途授權;
  • 最小化;
  • 資料來源;
  • 權利管理。

隱私技術降低風險,不會自動創造資料使用權。


十四、資料治理不變量

MELDP 最低不變量為:

操作授權紀錄授權\boxed{ \text{操作授權} \neq \text{紀錄授權} } 紀錄授權訓練授權\boxed{ \text{紀錄授權} \neq \text{訓練授權} } 個人化授權共享模型授權\boxed{ \text{個人化授權} \neq \text{共享模型授權} } 營運資料⇏訓練資料\boxed{ \text{營運資料} \not\Rightarrow \text{訓練資料} } 無來源資料↛正式資料集\boxed{ \text{無來源資料} \not\rightarrow \text{正式資料集} } 被拒絕資料↛其他用途\boxed{ \text{被拒絕資料} \not\rightarrow \text{其他用途} } 原始敏感資料保留期限必要期限\boxed{ \text{原始敏感資料保留期限} \leq \text{必要期限} }

十五、資料品質

15.1 具身資料品質維度

資料品質不只包含正確標籤。

還包括:

  • Observation 完整性;
  • Frame/Action 時間對齊;
  • Target Revision;
  • Execution Receipt;
  • Verification;
  • Scene Continuity;
  • Policy Context;
  • Human Correction;
  • Source Integrity;
  • Rights Completeness。

15.2 不完整經驗

若缺少:

  • 行動前影格;
  • Expected Effect;
  • Runtime Receipt;
  • 行動後影格;
  • Verification;

則該資料不應被標記為完整因果軌跡。

定義完整性:

C(E)=存在的必要構件全部必要構件C(\mathcal{E}) = \frac{\text{存在的必要構件}} {\text{全部必要構件}}

不同用途可設定不同門檻。

例如:

  • Grounding 訓練不一定需要 Action;
  • Effect Model 必須有前後觀察;
  • Recovery 模型必須有失敗與修正。

十六、系統生命週期

16.1 產生

代理在環境中觀察與行動。

16.2 營運保存

支援任務繼續、除錯與安全審計。

16.3 分類

判斷:

  • 個資;
  • 敏感資訊;
  • 內容權利;
  • 平台限制;
  • 資料用途;
  • 保留期限。

16.4 轉換

  • Redaction;
  • Crop;
  • Pseudonymization;
  • Structuralization;
  • Abstraction。

16.5 晉升

依 Rights、Purpose、Quality、Provenance 決定可進入:

  • Memory;
  • Skill;
  • Local Training;
  • Shared Training;
  • Evaluation;
  • Publication。

16.6 使用

  • Retrieval;
  • Training;
  • Evaluation;
  • Benchmark;
  • Skill Execution。

16.7 撤回與刪除

  • 停止未來使用;
  • 刪除原始資料;
  • 更新資料集;
  • 重建技能;
  • 標記模型影響;
  • 視需要重新訓練。

十七、架構貢獻

本文的主要架構貢獻可概括為:

貢獻一:具身經驗單位

把感知、內部狀態、候選行動、Expected Effect、Execution Receipt 與 Verification 整合為一筆可學習經驗。

貢獻二:營運—學習分離

提出資料必須經過晉升閘門,而不是從執行紀錄直接流入訓練。

貢獻三:權利向量

把觀察、操作、保存、個人化、本地訓練、共享訓練、分享與公開拆成不同權利維度。

貢獻四:三級學習

區分可刪除記憶、可版本化技能與難撤回模型權重。

貢獻五:因果與負例保存

將 Expected/Actual Effect、Policy Denial、No Effect、Wrong Effect 與 Human Takeover 視為一級學習資料。

貢獻六:溯源與影響圖

建立從原始資料到技能、資料集、模型與部署的可查詢血緣。


十八、討論

18.1 這是否會限制資料規模?

會。

嚴格資料治理通常降低可直接使用的資料量。

但具身資料的價值不只在規模,也在:

  • 時間對齊;
  • 行動參照;
  • 因果驗證;
  • 失敗修正;
  • 高品質來源。

低治理的大量資料,可能同時包含:

  • 錯誤 Target;
  • 錯誤 Timestamp;
  • 隱私資訊;
  • 失效授權;
  • 未知來源;
  • 不可重播軌跡。

因此更合理的目標是:

最大化可治理的有效經驗\boxed{ \text{最大化可治理的有效經驗} }

而不是最大化原始資料量。


18.2 結構化是否會損失資訊?

會。

從完整影格抽象為 Target 與 Action,必然失去部分上下文。

因此 MELDP 不應只保存單一抽象層,而應保存可控的多解析度表示:

Raw
Redacted
Cropped
Structured
Abstracted
Statistical

不同用途取得不同層級。


18.3 權利撤回是否能真正影響已訓練模型?

不一定能完全達成。

這正是需要分層學習與 lineage 的原因。

系統至少應做到:

  • 停止未來使用;
  • 刪除可刪除記憶;
  • 移除技能來源;
  • 從後續資料集排除;
  • 標記受影響模型;
  • 誠實揭露殘餘影響。

18.4 MELDP 是否只適用於機器人?

不是。

它適用於所有具備:

ObservationActionOutcome\text{Observation} \rightarrow \text{Action} \rightarrow \text{Outcome}

的代理,包括:

  • 機器人;
  • 遊戲代理;
  • 桌面操作代理;
  • 瀏覽器代理;
  • 虛擬世界角色;
  • 工業控制代理;
  • 軟體測試代理;
  • 無障礙代理。

十九、未來研究

  1. 具身資料權利表示語言;
  2. 可機器執行的資料晉升政策;
  3. Target/Action/Effect 的跨環境通用 Schema;
  4. 個別經驗對模型權重影響的估計;
  5. 具身模型的資料撤回與機器遺忘;
  6. 跨代理技能共享的最小資訊表示;
  7. 隱私保護下的失敗軌跡學習;
  8. 數位具身經驗向物理具身策略的轉移;
  9. 人類接管資料的偏好與安全學習;
  10. 具身資料集的完整性與因果品質指標。

二十、結論

未來代理最有價值的資料,不只是人類事先準備的文字、圖片與影片,也包括代理自己在環境中形成的經驗:

看見什麼+如何理解+想做什麼+實際做了什麼+發生了什麼+如何修正\boxed{ \text{看見什麼} + \text{如何理解} + \text{想做什麼} + \text{實際做了什麼} + \text{發生了什麼} + \text{如何修正} }

這類資料具有極高學習價值,也同時具有極高的隱私、權利、來源與安全風險。

因此,具身智能不應只建造感知器、規劃器與外部執行器,還必須建造一個獨立的資料治理平面,使資料在不同用途之間受到明確控制。

本文提出的 MELDP 命題可以濃縮為:

具身經驗=可學習資產+受治理責任\boxed{ \text{具身經驗} = \text{可學習資產} + \text{受治理責任} }

以及:

Operational ExperienceGoverned PromotionLearning Material\boxed{ \text{Operational Experience} \xrightarrow{\text{Governed Promotion}} \text{Learning Material} }

而不是:

Operational Experience=Training Data\text{Operational Experience} = \text{Training Data}

只有當來源、用途、權利、最小化、品質、溯源與撤回機制共同存在時,代理從自身經驗中學習,才能從不受控的資料累積,轉化為可持續、可問責且尊重權利的智能演化。


參考文獻

  1. Duan, J., Yu, S., Tan, H. L., Zhu, H., & Tan, C. “A Survey of Embodied AI: From Simulators to Research Tasks.” 2021.
  2. Kotar, K., Walsman, A., & Mottaghi, R. “ENTL: Embodied Navigation Trajectory Learner.” 2023.
  3. Mu, Y., et al. “EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought.” 2023.
  4. Yin, L., et al. “Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data.” 2026.
  5. Choi, S., et al. “D2E: Scaling Vision-Action Pretraining on Desktop Data for Transfer to Embodied AI.” 2025.
  6. National Institute of Standards and Technology. “Artificial Intelligence Risk Management Framework 1.0.” NIST AI 100-1, 2023.
  7. National Institute of Standards and Technology. “NIST Privacy Framework: A Tool for Improving Privacy Through Enterprise Risk Management.” Version 1.0.
  8. National Institute of Standards and Technology. “NIST Research Data Framework.” NIST SP 1500-18r2.
  9. World Wide Web Consortium. “PROV-O: The PROV Ontology.” W3C Recommendation, 2013.
  10. European Union. Regulation (EU) 2016/679, General Data Protection Regulation, Article 5.
  11. European Union. Regulation (EU) 2024/1689, Artificial Intelligence Act, Article 10.

聲明

本文為架構與工程研究,不構成針對特定司法管轄區的法律意見。實際部署仍需依應用場景、資料類型、權利主體、產業規範與所在地法律進行獨立審查。