從具身軌跡到可治理經驗:多模態具身學習資料平面的架構命題
感知—意圖—行動—後果資料鏈的分層、授權、溯源與學習晉升模型
英文題名: From Embodied Trajectories to Governable Experience: An Architectural Proposition for a Multimodal Embodied Learning Data Plane
作者: Neo.K
日期: 2026-07-30
文件類型: 公開技術論文/架構命題論文
版本: v1.0
公開狀態: Public
關鍵詞: 具身智能、多模態資料、行動軌跡、資料治理、資料溯源、隱私、授權、技能學習、世界模型、MELDP
摘要
具身智能、電腦操作代理、機器人與虛擬世界代理正在產生一類不同於傳統文字、影像與影片語料的新資料:代理不只觀察環境,也形成目標、提出候選行動、接受安全約束、執行外部操作、承受後果、判斷成功與失敗,並在人類接管或自我修正後繼續任務。這類資料同時包含感知、語義、決策、控制、回饋與因果結構,可被稱為多模態具身經驗資料。
然而,現有資料管線經常把執行紀錄、產品遙測、個人化記憶、評估樣本與模型訓練資料視為可自然互換的資料集合。這種做法忽略了一個根本差異:使用者允許代理觀察或操作環境,不等於允許系統長期保存資料;允許保存,不等於允許進行個人化學習;允許個人化,也不等於允許將資料用於共享模型訓練、跨主體傳播或公開發布。
本文提出多模態具身學習資料平面(Multimodal Embodied Learning Data Plane, MELDP)的架構命題。MELDP 不被定義為單一資料庫,而是一個跨越具身代理生命週期的橫向資料治理平面,負責分離營運資料、私密原始資料、因果軌跡、權利與授權、去識別學習語料、資料集版本及模型血緣。
本文提出九項主要構件:
- 具身經驗單位;
- 多區資料分層;
- 權利與用途向量;
- 資料晉升閘門;
- 隱私—效用轉換鏈;
- 記憶—技能—參數三級學習;
- 因果軌跡與負例保存;
- 資料—資料集—模型溯源圖;
- 可撤回性與模型影響追蹤。
本文的核心命題是:
只有在用途相容、權利允許、資料最小化、敏感資訊處理、品質審查與來源可追溯等條件同時成立時,資料才可由營運狀態晉升為學習資產。
MELDP 的最終目的不是最大化資料蒐集,而是使具身智能能夠在不破壞個人權利、內容權利與系統安全的前提下,從自身經驗中形成可刪除記憶、可版本化技能及受治理模型更新。
一、研究背景
1.1 從網路語料到環境互動
傳統大型模型主要由既有文字、影像、聲音與影片語料學習。具身智能則逐漸轉向:
具身 AI 研究長期強調代理透過第一視角感知及環境互動取得經驗,而不是只從靜態網路資料學習。近期研究亦指出,與實際軌跡耦合的視覺—語言資料可作為通用視覺語言模型與具身行動模型之間的中介資料;桌面與遊戲互動也可能成為具有觀察—行動耦合特性的具身預訓練來源。
這表示未來最有價值的 AI 資料之一,可能不是單純的畫面,而是:
1.2 普通日誌無法描述具身經驗
一般系統日誌可能只記錄:
10:31:02 click x=812 y=546
10:31:03 screen_changed=true
但對學習而言,更有價值的資料是:
目標:開啟設定
觀察:右上方有齒輪圖示
候選:齒輪、問號、關閉按鈕
選擇:齒輪
理由:圖示語義與歷史場景一致
預期:設定面板出現
執行:滑鼠移動並點擊
結果:設定面板出現
驗證:成功
兩者的差別不只是欄位數量,而是後者保存了:
- 參照;
- 意圖;
- 候選;
- 選擇;
- 預測;
- 因果;
- 驗證;
- 失敗可能性。
因此本文將這類資料稱為:
即具身經驗資料。
1.3 為何需要獨立資料平面
具身代理同時跨越:
- 感知系統;
- 世界模型;
- 規劃器;
- 安全政策;
- 外部執行器;
- 記憶系統;
- 評估系統;
- 模型訓練系統。
若每個模組各自保存資料,將出現:
- 重複蒐集;
- 無法確定資料來源;
- 無法判斷用途;
- 無法執行刪除;
- 無法區分個人化與共享訓練;
- 無法知道哪個模型使用過哪些資料;
- 失敗案例被遺失;
- 原始敏感資料被永久保留。
因此需要一個橫向平面,統一管理資料從產生到刪除、從營運到學習、從單次經驗到模型版本的完整生命週期。
二、研究問題
本文處理以下問題:
- 如何形式化一筆完整的具身經驗?
- 如何分離營運、隱私、軌跡、授權與學習資料?
- 如何表達不同資料用途的授權範圍?
- 什麼條件下,營運資料可以晉升為學習資料?
- 如何兼顧資料效用與敏感資訊最小化?
- 如何保留失敗、拒絕與人類接管等負例?
- 如何區分記憶學習、技能學習及參數學習?
- 如何追蹤資料對資料集、技能與模型的影響?
- 當授權被撤回時,系統可以撤回到什麼程度?
三、相關研究與治理基線
3.1 具身軌跡的學習價值
具身 AI 的核心特徵是代理從環境互動中取得第一視角經驗。相關研究已把長序列軌跡用於世界模型、定位、模仿學習、計畫與行動預測。
近期「Embodied Trajectory-Coupled Data」研究主張,從同一批具身場景及軌跡衍生出的視覺—語言監督,可成為通用 VLM 轉向具身控制策略時的中介資料。另有研究指出,桌面與遊戲環境能提供可大規模收集的感知—行動耦合資料,並可能將部分數位互動中的感覺運動表徵轉移至物理具身任務。
本文不假定所有數位軌跡都能直接轉移至物理世界,而是接受以下較弱命題:
3.2 目的限制與資料最小化
資料治理不能只處理資安,也必須處理資料被何種目的使用。
GDPR 第 5 條提出目的限制、資料最小化、正確性、保存限制等原則:個人資料應為明確、合法目的蒐集,且限於達成目的所必要的範圍。這些原則可被抽象為具身資料平面的工程要求:
NIST Privacy Framework 則將隱私風險視為資料處理活動可能對個人造成的問題,並強調從蒐集至處置的完整生命週期與資料處理生態系角色。
3.3 AI 資料治理
NIST AI RMF 將 AI 風險管理描述為跨越設計、開發、部署、使用及評估的持續工作,強調可信、可解釋、隱私增強、安全與問責。
歐盟 AI Act 第 10 條則對高風險 AI 的訓練、驗證與測試資料提出適合預定目的的資料治理與管理要求。本文並不把所有具身代理視為法律上的高風險 AI,而是採用較一般的工程推論:
當具身資料可能被用於訓練、驗證或評估模型時,資料治理不應等到訓練階段才開始。
3.4 資料來源與溯源
W3C PROV 資料模型以 Entity、Activity 與 Agent 描述資料如何產生、使用、轉換與歸責,並支援不同系統間交換來源資訊。
NIST Research Data Framework 也把 provenance 視為記錄資料資產何時、何地、如何及由誰產生、取得與修改的歷史紀錄。
具身資料特別需要溯源,因為同一筆訓練樣本可能來自:
原始影格
→ 裁切
→ 去識別
→ Target 標註
→ 軌跡摘要
→ 技能抽取
→ 資料集
→ 模型 Checkpoint
只保存最終樣本,將無法回答其合法性、品質與撤回影響。
四、具身經驗單位
4.1 基本定義
定義第 筆具身經驗:
其中:
- :外部觀察;
- :代理內部世界狀態;
- :目標;
- :被定位的 Target;
- :候選行動集合;
- :實際行動;
- :Expected Effect;
- :外部執行回執;
- :結果驗證;
- :恢復行動;
- :人類介入;
- :權利、來源、用途與保存 metadata。
4.2 經驗不是固定長度紀錄
一筆經驗可以是:
- 單次點擊;
- 數秒滑鼠拖曳;
- 一次對話框處理;
- 一個完整子任務;
- 一段數分鐘的導航;
- 一次失敗與修復;
- 一段人類接管軌跡。
因此經驗單位應支援巢狀結構:
子經驗可以被折疊成摘要,但原始軌跡仍保留來源關係。
4.3 因果承諾
具身經驗與一般多模態紀錄的關鍵差異是:
即:
- 行動前,代理承諾預期效果;
- 行動後,系統檢查實際效果。
因此資料可以標註:
預期成功,實際成功
預期成功,實際無效果
預期 A,實際 B
不確定,要求人類
安全政策拒絕執行
這些資料可用於學習:
- 行動效果模型;
- 不確定性;
- 錯誤預測;
- Recovery;
- 安全停止。
五、MELDP 架構命題
5.1 定義
多模態具身學習資料平面定義為:
其中:
- :多區資料儲存;
- :Rights Registry;
- :Data Promotion Pipeline;
- :Lineage/Provenance Graph;
- :Governance and Policy;
- :Learning Materialization。
MELDP 不是取代既有資料庫,而是規定:
- 哪種資料放在哪裡;
- 哪些用途被允許;
- 哪些轉換必須發生;
- 哪些資料可以晉升;
- 哪些模型受到影響;
- 如何執行刪除或撤回。
六、多區資料分層
6.1 Raw Private Vault
保存最敏感的原始資料:
- 完整影格;
- 原始音訊;
- OCR 原文;
- 帳號名稱;
- 聊天;
- 人臉;
- 裝置資訊;
- 精確時間與位置;
- 未裁切桌面內容。
基本政策:
其特徵應為:
- 本地優先;
- 加密;
- 最短必要保留;
- 嚴格存取控制;
- 明確 TTL;
- 可立即刪除;
- 不與訓練系統直接相連。
6.2 Operational State Store
保存系統繼續運作所需狀態:
- Session;
- Scene;
- Target;
- Action;
- Runtime State;
- Frame Revision;
- Checkpoint;
- Task Budget。
它回答:
系統如何繼續任務?
而不是:
這些資料可否拿去訓練?
6.3 Causal Trajectory Ledger
保存具身經驗的因果鏈:
包含:
- 成功;
- 失敗;
- 拒絕;
- Retry;
- 人類接管;
- Emergency Stop。
可採 append-only 與 hash chaining:
6.4 Consent and Rights Registry
保存資料用途、權利與期限。
它不只保存:
consent = true
而保存多維度權利。
6.5 De-identified Learning Corpus
只有通過:
- 去識別;
- 最小化;
- 權利檢查;
- 品質檢查;
- 來源檢查;
的資料才能進入。
6.6 Dataset and Model Lineage Registry
保存:
- 資料來源;
- 衍生轉換;
- Dataset Version;
- Skill Version;
- Model Checkpoint;
- 評估結果;
- 撤回影響。
七、權利與用途向量
7.1 權利不是單一布林值
定義資料 的權利向量:
可分別表示:
- :observe;
- :control;
- :record/retain;
- :personalize;
- :train local;
- :train shared;
- :export/share;
- :publish。
例如:
表示:
- 可以觀察;
- 可以操作;
- 可以保存;
- 可以本地個人化;
- 不得訓練本地權重;
- 不得訓練共享模型;
- 不得分享;
- 不得公開。
7.2 操作授權與學習授權分離
核心不變量:
因此:
允許代理操作
≠ 允許保存畫面
≠ 允許個人化
≠ 允許微調模型
≠ 允許跨使用者共享
≠ 允許公開資料集
7.3 權利 metadata
除向量外,還需要:
同一筆畫面可能同時涉及:
- 使用者;
- 其他自然人;
- 內容著作權人;
- 平台;
- 應用程式供應商;
- 模型供應商;
- 組織政策。
因此權利評估是多主體問題,而不是單一使用者勾選框。
八、資料晉升閘門
8.1 營運資料不自動成為學習資料
定義資料晉升函數:
晉升條件:
其中:
- :合法/授權基礎存在;
- :用途相容;
- :資料最小化完成;
- :敏感資訊處理完成;
- :品質合格;
- :來源與轉換可驗證;
- :安全審查通過。
8.2 標準晉升鏈
任何一步失敗:
reject
quarantine
delete
retain operational-only
request new authorization
8.3 晉升狀態
RAW
CLASSIFIED
MINIMIZED
REDACTED
RIGHTS_VALIDATED
QUALITY_VALIDATED
APPROVED_FOR_MEMORY
APPROVED_FOR_SKILL
APPROVED_FOR_LOCAL_TRAINING
APPROVED_FOR_SHARED_TRAINING
REJECTED
REVOKED
DELETED
九、隱私—效用轉換
9.1 最小化目標
給定資料轉換 :
希望:
同時滿足:
其中:
- :敏感資訊;
- :轉換後資料與敏感資訊的關聯;
- :任務效用;
- :最低學習效用。
這不是宣稱可計算出完美隱私,而是把工程目標明確化:
保留完成學習任務所需的最小資訊,而不是盡量保存全部內容。
9.2 分層轉換
Level 0:Raw
完整原始資料。
Level 1:Masked
遮罩姓名、聊天、人臉、通知及帳號。
Level 2:Cropped
只保留 Target 與相關區域。
Level 3:Structured
轉換為:
- Target;
- Scene;
- Action;
- Verification;
- Coordinate-normalized metadata。
Level 4:Abstracted
轉換為一般技能:
find primary action
hover to disambiguate
click and verify panel appearance
Level 5:Statistical
只保留統計或模型更新。
隨著抽象化程度提高,直接識別風險通常下降,但錯誤抽象與不可撤回性問題可能上升。
十、三級學習模型
10.1 記憶學習
將經驗保存成可檢索記憶:
- 相似場景;
- 已知 Target;
- 使用者偏好;
- 失敗;
- Recovery。
特徵:
- 易刪除;
- 易修正;
- 易撤回;
- 不改模型權重;
- 適合個人化。
10.2 技能學習
從多筆軌跡抽象技能:
- 開啟設定;
- 處理 Loading;
- 重新定位;
- 調整 Slider;
- 處理意外對話框。
技能應具有:
- 來源集合;
- 適用條件;
- 版本;
- 失敗條件;
- 權限;
- 測試;
- 可停用性。
10.3 參數學習
包括:
- Fine-tuning;
- Grounding Model;
- Preference Model;
- Action Model;
- World Model;
- Offline RL。
參數學習通常最難:
- 精確刪除單筆資料影響;
- 解釋權重來源;
- 執行授權撤回;
- 防止記憶洩漏。
因此合理的學習順序是:
10.4 可撤回性梯度
定義可撤回性:
一般而言:
因此高敏感資料應優先使用可刪除記憶,而不是直接進入參數更新。
十一、負例與失敗資料
11.1 為何失敗資料重要
成功軌跡回答:
什麼有效?
失敗軌跡回答:
- 哪裡容易混淆;
- 哪些置信度不可靠;
- 哪些 Target 會移動;
- 哪些 Click 沒有效果;
- 哪些行動進入錯誤場景;
- 什麼時候應停止;
- 什麼時候需要人類。
11.2 負例類型
target_not_found
wrong_target
stale_target
policy_denied
execution_blocked
no_effect
wrong_effect
unexpected_scene
human_takeover
emergency_stop
recovery_failed
11.3 偏好資料
一組高價值偏好樣本:
其中:
- :錯誤行動;
- :錯誤結果;
- :人類更正;
- :修正行動;
- :正確結果。
這比只保存成功行動更適合訓練:
- Action Ranking;
- Recovery;
- Uncertainty;
- Human Escalation;
- Safety Policy。
十二、溯源圖
12.1 資料血緣
定義溯源圖:
節點:
RawFrame
RedactedFrame
Observation
Target
Trajectory
Episode
Skill
Dataset
TrainingRun
ModelCheckpoint
Evaluation
Deployment
邊:
wasGeneratedBy
wasDerivedFrom
used
wasAttributedTo
wasApprovedBy
wasRevokedBy
wasIncludedIn
producedModel
evaluatedBy
這與 W3C PROV 的 Entity、Activity、Agent 基本模型相容。
12.2 模型影響集合
定義資料 的後代集合:
可能包括:
- Dataset;
- Skill;
- Model Checkpoint;
- Evaluation;
- Deployment。
當資料被撤回時,系統先計算:
再依政策決定:
- 只停止未來使用;
- 從資料集移除;
- 重建技能;
- 重新訓練;
- 停用 Checkpoint;
- 標註無法完全撤回。
12.3 不誇大可刪除能力
MELDP 不應承諾:
刪除原始資料就能保證模型權重完全忘記。
更誠實的狀態是:
source_deleted
future_use_blocked
dataset_removed
skill_rebuilt
model_retraining_required
model_unlearning_attempted
residual_influence_unknown
十三、跨主體與跨代理學習
13.1 個人學習與共享學習分離
定義:
除非資料經過明確晉升。
本地個人化資料不應自動進入共享模型。
13.2 經驗共享的最低單位
最安全的共享方式不一定是分享原始 Frame,而可能是分享:
- 抽象技能;
- 錯誤類型;
- Target Role;
- Scene Transition;
- Verification Rule;
- 統計;
- 去識別軌跡。
例如:
當主要按鈕有三個相似候選時,
先 Hover 並確認 Tooltip,
再執行 Click。
這種技能不必包含任何使用者畫面。
13.3 聯邦式或本地優先學習
在適當場景下,可以考慮:
- Local Training;
- Federated Aggregation;
- Secure Aggregation;
- Differential Privacy;
- Gradient/Update Filtering。
但這些技術不能取代:
- 用途授權;
- 最小化;
- 資料來源;
- 權利管理。
隱私技術降低風險,不會自動創造資料使用權。
十四、資料治理不變量
MELDP 最低不變量為:
十五、資料品質
15.1 具身資料品質維度
資料品質不只包含正確標籤。
還包括:
- Observation 完整性;
- Frame/Action 時間對齊;
- Target Revision;
- Execution Receipt;
- Verification;
- Scene Continuity;
- Policy Context;
- Human Correction;
- Source Integrity;
- Rights Completeness。
15.2 不完整經驗
若缺少:
- 行動前影格;
- Expected Effect;
- Runtime Receipt;
- 行動後影格;
- Verification;
則該資料不應被標記為完整因果軌跡。
定義完整性:
不同用途可設定不同門檻。
例如:
- Grounding 訓練不一定需要 Action;
- Effect Model 必須有前後觀察;
- Recovery 模型必須有失敗與修正。
十六、系統生命週期
16.1 產生
代理在環境中觀察與行動。
16.2 營運保存
支援任務繼續、除錯與安全審計。
16.3 分類
判斷:
- 個資;
- 敏感資訊;
- 內容權利;
- 平台限制;
- 資料用途;
- 保留期限。
16.4 轉換
- Redaction;
- Crop;
- Pseudonymization;
- Structuralization;
- Abstraction。
16.5 晉升
依 Rights、Purpose、Quality、Provenance 決定可進入:
- Memory;
- Skill;
- Local Training;
- Shared Training;
- Evaluation;
- Publication。
16.6 使用
- Retrieval;
- Training;
- Evaluation;
- Benchmark;
- Skill Execution。
16.7 撤回與刪除
- 停止未來使用;
- 刪除原始資料;
- 更新資料集;
- 重建技能;
- 標記模型影響;
- 視需要重新訓練。
十七、架構貢獻
本文的主要架構貢獻可概括為:
貢獻一:具身經驗單位
把感知、內部狀態、候選行動、Expected Effect、Execution Receipt 與 Verification 整合為一筆可學習經驗。
貢獻二:營運—學習分離
提出資料必須經過晉升閘門,而不是從執行紀錄直接流入訓練。
貢獻三:權利向量
把觀察、操作、保存、個人化、本地訓練、共享訓練、分享與公開拆成不同權利維度。
貢獻四:三級學習
區分可刪除記憶、可版本化技能與難撤回模型權重。
貢獻五:因果與負例保存
將 Expected/Actual Effect、Policy Denial、No Effect、Wrong Effect 與 Human Takeover 視為一級學習資料。
貢獻六:溯源與影響圖
建立從原始資料到技能、資料集、模型與部署的可查詢血緣。
十八、討論
18.1 這是否會限制資料規模?
會。
嚴格資料治理通常降低可直接使用的資料量。
但具身資料的價值不只在規模,也在:
- 時間對齊;
- 行動參照;
- 因果驗證;
- 失敗修正;
- 高品質來源。
低治理的大量資料,可能同時包含:
- 錯誤 Target;
- 錯誤 Timestamp;
- 隱私資訊;
- 失效授權;
- 未知來源;
- 不可重播軌跡。
因此更合理的目標是:
而不是最大化原始資料量。
18.2 結構化是否會損失資訊?
會。
從完整影格抽象為 Target 與 Action,必然失去部分上下文。
因此 MELDP 不應只保存單一抽象層,而應保存可控的多解析度表示:
Raw
Redacted
Cropped
Structured
Abstracted
Statistical
不同用途取得不同層級。
18.3 權利撤回是否能真正影響已訓練模型?
不一定能完全達成。
這正是需要分層學習與 lineage 的原因。
系統至少應做到:
- 停止未來使用;
- 刪除可刪除記憶;
- 移除技能來源;
- 從後續資料集排除;
- 標記受影響模型;
- 誠實揭露殘餘影響。
18.4 MELDP 是否只適用於機器人?
不是。
它適用於所有具備:
的代理,包括:
- 機器人;
- 遊戲代理;
- 桌面操作代理;
- 瀏覽器代理;
- 虛擬世界角色;
- 工業控制代理;
- 軟體測試代理;
- 無障礙代理。
十九、未來研究
- 具身資料權利表示語言;
- 可機器執行的資料晉升政策;
- Target/Action/Effect 的跨環境通用 Schema;
- 個別經驗對模型權重影響的估計;
- 具身模型的資料撤回與機器遺忘;
- 跨代理技能共享的最小資訊表示;
- 隱私保護下的失敗軌跡學習;
- 數位具身經驗向物理具身策略的轉移;
- 人類接管資料的偏好與安全學習;
- 具身資料集的完整性與因果品質指標。
二十、結論
未來代理最有價值的資料,不只是人類事先準備的文字、圖片與影片,也包括代理自己在環境中形成的經驗:
這類資料具有極高學習價值,也同時具有極高的隱私、權利、來源與安全風險。
因此,具身智能不應只建造感知器、規劃器與外部執行器,還必須建造一個獨立的資料治理平面,使資料在不同用途之間受到明確控制。
本文提出的 MELDP 命題可以濃縮為:
以及:
而不是:
只有當來源、用途、權利、最小化、品質、溯源與撤回機制共同存在時,代理從自身經驗中學習,才能從不受控的資料累積,轉化為可持續、可問責且尊重權利的智能演化。
參考文獻
- Duan, J., Yu, S., Tan, H. L., Zhu, H., & Tan, C. “A Survey of Embodied AI: From Simulators to Research Tasks.” 2021.
- Kotar, K., Walsman, A., & Mottaghi, R. “ENTL: Embodied Navigation Trajectory Learner.” 2023.
- Mu, Y., et al. “EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought.” 2023.
- Yin, L., et al. “Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data.” 2026.
- Choi, S., et al. “D2E: Scaling Vision-Action Pretraining on Desktop Data for Transfer to Embodied AI.” 2025.
- National Institute of Standards and Technology. “Artificial Intelligence Risk Management Framework 1.0.” NIST AI 100-1, 2023.
- National Institute of Standards and Technology. “NIST Privacy Framework: A Tool for Improving Privacy Through Enterprise Risk Management.” Version 1.0.
- National Institute of Standards and Technology. “NIST Research Data Framework.” NIST SP 1500-18r2.
- World Wide Web Consortium. “PROV-O: The PROV Ontology.” W3C Recommendation, 2013.
- European Union. Regulation (EU) 2016/679, General Data Protection Regulation, Article 5.
- European Union. Regulation (EU) 2024/1689, Artificial Intelligence Act, Article 10.
聲明
本文為架構與工程研究,不構成針對特定司法管轄區的法律意見。實際部署仍需依應用場景、資料類型、權利主體、產業規範與所在地法律進行獨立審查。