# 發展式智能體學習：時間、記憶、真實後果與自生成課程

**副標題：從持續狀態到可觀察的長期能力形成**  
**系列：**《發展式智能體：持續計算環境、共適應學習與外部性有界自治》  
**篇次：** 06 / 14  
**作者：** Neo.K × Aletheia  
**機構：** EveMissLab／一言諾科技有限公司  
**版本：** v0.1  
**日期：** 2026-08-01

---

## 摘要

上一篇提出「持續計算棲居環境（Persistent Computer Habitat, PCH）」：AI Agent 不再只於一次性 session 中暫時使用電腦，而是在跨 session 保存狀態、工具、檔案、排程、記憶與歷史的計算環境中反覆活動。但「環境持續存在」本身並不等於「Agent 正在學習」。一個系統即使保存了十年的 log，如果沒有從經驗中選擇、抽象、驗證、更新並影響後續策略，它仍可能只是長期儲存，而非長期發展。

本文提出「發展式智能體學習（Developmental Agent Learning, DAL）」作為工作框架，用以描述智能體在持續環境中，透過時間暴露、長期記憶、真實後果、失敗、維護、反思、人類修正與自生成課程，使未來行動策略與環境治理能力產生可驗證改變的過程。

本文的核心主張是：

$$
\boxed{
\text{Persistence}
+
\text{Memory}
+
\text{Consequence}
+
\text{Reflection}
+
\text{Policy Change}
\Rightarrow
\text{Development}
}
$$

但任何一項單獨存在都不足以構成發展。時間只是提供狀態變化的機會；記憶只是保存；失敗只是事件；反思若不改變後續行為，也只是文字生成。真正的發展必須表現在未來：同類錯誤是否下降、未知問題是否更快解決、維護成本是否降低、求援時機是否改善、是否能把重複工作編譯成工具或規則，以及是否能把局部經驗遷移到新的情境。

2026 年的相關研究已出現多個接近這一方向的組件。ACL 2026 的 ReMe 將 Agent memory 從被動累積推進到成功／失敗經驗蒸餾、情境化重用與效用式修剪；FORGE 將失敗軌跡反思成可重用規則與案例，在不更新模型權重的條件下提升後續決策；EvolvingAgent 則把持續 world model、self-verification 與 curriculum learning 結合於長流程任務；MSCE 更進一步把 trace、memory 與可調用 skill 以證據與可靠度治理。這些成果共同支持一個重要方向：智能體的「發展」可以部分發生於模型權重之外，並以記憶、程序、技能、工具與環境結構持續累積。

本文進一步提出「摩擦驅動課程（Friction-Driven Curriculum）」：長期計算環境中的錯誤、重複、延遲、資源浪費、維護債務、失敗恢復與人類介入點，本身可以成為 Agent 下一輪學習任務的來源。於是，計算機不只是工作平台，也會逐步成為自生成課程的來源。

**關鍵詞：** Developmental Agent Learning、Persistent Computer Habitat、Lifelong Agent、Self-Evolving Memory、Curriculum Learning、Failure Learning、Longitudinal Learning、Self-Generated Curriculum、Agent Maintenance、Experience Distillation

---

## 1. 持續存在不是發展

設 Agent 在時間 $t$ 的整體狀態為：

$$
A_t=f(\theta,M_t,E_t,T_t,P_t,H_t)
$$

其中：

- $\theta$ ：底層模型參數；
- $M_t$ ：記憶；
- $E_t$ ：環境狀態；
- $T_t$ ：工具集合；
- $P_t$ ：策略與政策；
- $H_t$ ：歷史軌跡。

若環境跨 session 保存：

$$
E_{t+1}\neq E_0
$$

我們可以稱其具有持續性。

但這不代表：

$$
A_{t+1}>A_t
$$

因為 Agent 可能只是把更多東西堆進硬碟、記憶庫與 log，而沒有形成更好的未來行為。

因此本文首先區分：

$$
\boxed{
\text{Accumulation}\neq\text{Learning}\neq\text{Development}
}
$$

### 1.1 累積（Accumulation）

只表示：

$$
|M_{t+1}|>|M_t|
$$

或資料、紀錄、檔案增加。

### 1.2 學習（Learning）

至少要求過去經驗改變未來策略：

$$
\pi_{t+1}(a\mid s)\neq\pi_t(a\mid s)
$$

而且此改變在某些可重現條件下帶來較好的結果。

### 1.3 發展（Development）

比單次策略改善更強。它要求多種能力在時間上形成結構性改變，例如：

- 更會判斷哪些事情值得記；
- 更會選擇工具；
- 更會安排自己的工作；
- 更少重複犯同類錯；
- 更知道何時需要求援；
- 更能把經驗抽象成跨任務技能；
- 更能維護自己的計算環境；
- 更能處理新問題，而不是只記住舊答案。

因此可寫為：

$$
D_{t+1}=F(D_t,\tau_t,\Delta E_t,V_t,C_t)
$$

其中 $D_t$ 是發展狀態， $\tau_t$ 是經驗軌跡， $V_t$ 是驗證訊號， $C_t$ 是修正與後果。

---

## 2. 時間不是訓練資料，而是狀態變化的容器

一句「讓 AI 跑半年」並不自動產生半年份學習。

若：

$$
E_{t+1}=E_t
$$

且 Agent 每次只是重複同一件事，那麼：

$$
T\uparrow
$$

並不意味：

$$
Learning\uparrow
$$

真正有價值的是時間讓以下東西發生：

- 新資料到來；
- 工具失效；
- 系統更新；
- 索引老化；
- 使用模式改變；
- 人類偏好改變；
- 任務累積；
- 資源壓力出現；
- 長期決策的後果開始顯現。

所以應該寫成：

$$
\boxed{
\text{Time Value}
\propto
\text{Meaningful State Change}
}
$$

這使「長期存在」成為一種不同於 benchmark episode 的實驗條件。

一個決策今天看似成功，可能三週後才暴露它造成的維護債務。

因此長期 Agent 必須面對：

$$
R_t\neq R_{t+k}
$$

也就是短期 reward 與長期 reward 可能不同。

---

## 3. 真實後果使經驗具備時間深度

一次性 sandbox 常把失敗限制在 episode 內：

$$
Failure_t\rightarrow Reset
$$

Persistent Computer Habitat 則可能出現：

$$
Failure_t
\rightarrow
Debt_{t+1}
\rightarrow
Maintenance_{t+2}
\rightarrow
Recovery_{t+3}
$$

例如 Agent 今天建立了一個不好的備份策略。

今天：沒有問題。

一個月後：儲存成本暴增。

兩個月後：真正需要回復時才發現版本不足。

此時真正的回饋延遲為：

$$
\Delta t\gg0
$$

因此發展式學習必須能把後果重新連回原始決策：

$$
Outcome_{t+k}\rightarrow Action_t
$$

這可以稱為：

$$
\boxed{
\text{Longitudinal Credit Assignment}
}
$$

即**縱向歸因**。

未來私人 Agent 如果沒有這一層，很可能會「記得發生過什麼」，卻不知道是哪個早期決策造成後果。

---

## 4. 記憶必須從 Storage 進化到 Experience

2026 年 ACL Findings 的記憶研究綜述把 Agent memory 的演化概括為：

$$
Storage\rightarrow Reflection\rightarrow Experience
$$

這個方向與本文高度一致。

單純儲存：

> 我在 3 月 4 日執行過 script A。

反思：

> script A 在某些條件下失敗。

經驗：

> 當依賴版本不確定時，不應直接部署 script A；應先執行版本檢查。

因此真正能改變未來策略的不是：

$$
RawHistory
$$

而是：

$$
\boxed{
Experience
=
Abstraction(History,Outcome,Context)
}
$$

ReMe 進一步顯示，成功模式、失敗觸發、比較性洞見、情境化重用與效用式修剪，可以讓程序性記憶不只是被動堆積；其實驗甚至顯示較小模型加上動態記憶可以超過較大的無記憶模型。

這支持本文一個重要命題：

$$
\boxed{
Capability
\neq
ModelSize\ Only
}
$$

而可能是：

$$
Capability_t=f(\theta,Experience_t,Tools_t,Environment_t)
$$

---

## 5. 失敗不是垃圾資料，而是高價值邊界訊號

傳統系統常把失敗視為：

$$
BadEpisode
$$

然後丟棄。

但長期 Agent 最值得學的往往恰好是：

> 為什麼這次會失敗？

FORGE 在 2026 年展示了一條重要路線：把失敗軌跡透過 reflection 轉換為可重用的 textual rules、examples 或混合表示，而不必修改底層模型權重。

我們可以把這個一般化為：

$$
Failure
\rightarrow
Diagnosis
\rightarrow
Rule
\rightarrow
FuturePolicy
$$

但不是所有失敗都值得永久保存。

因此需要：

$$
Value(Failure_i)
=
f(
Novelty,
Recurrence,
Severity,
Generalizability,
Recoverability
)
$$

一次偶發 API timeout 的價值可能很低。

但：

> 連續三次因「未檢查目的路徑是否為 canonical source」而覆蓋錯文件

則高度值得抽象為新規則。

---

## 6. 維護本身就是 curriculum

對長期 Agent 而言，學習題目不必全部由人類出。

計算環境會自然產生「摩擦」。

本文定義：

$$
F_t
=
\text{Environmental Friction}
$$

它可以由以下訊號構成：

$$
F_t=f(
Errors,
Retries,
Latency,
Redundancy,
HumanIntervention,
ResourceWaste,
RecoveryEvents,
SearchCost
)
$$

若一個工作每週都需要人工修正，就表示存在高摩擦。

若某個目錄每次搜尋都要重新讀大量文件，也表示高摩擦。

若某支 script 兩週內失敗五次，也表示高摩擦。

因此 Agent 可以建立：

$$
\boxed{
\text{Friction-Driven Curriculum, FDC}
}
$$

即**摩擦驅動課程**。

流程可以是：

$$
Observe
\rightarrow
DetectFriction
\rightarrow
Rank
\rightarrow
FormLearningTask
\rightarrow
Experiment
\rightarrow
Verify
\rightarrow
Consolidate
$$

此時：

> 「把我的下載資料夾整理好」

不再只是家務工作。

它可能變成：

> 找出為什麼每週產生 120 個難以辨識的檔案，設計一個可逆、自動化、低維護成本的分類機制。

這就是自生成 curriculum。

---

## 7. 自生成課程不能等於「想做什麼就做什麼」

如果 Agent 自己決定所有學習目標，可能出現 curriculum drift。

例如它覺得：

> 優化 cache 很有趣。

於是花掉 90% 算力反覆優化對整體幾乎沒價值的 cache。

因此學習任務應該根據：

$$
Priority_i
=
f(
ExpectedGain,
Frequency,
Cost,
Risk,
Externality,
Transferability
)
$$

理想的早期 curriculum 通常應偏向：

$$
HighGain+HighFrequency+LowRisk+LowExternality
$$

例如：

- 改善自己的檔案搜尋；
- 把重複 CLI 操作變成 script；
- 學會檢查磁碟健康；
- 改善備份版本標註；
- 整理自己的工作 log；
- 減少重複 token 消耗。

而高外部性任務：

- 自動付款；
- 大量寄信；
- 修改 production；
- 對外發布；
- 改動他人資產；

則不應因為「有學習價值」就直接成為自由探索區。

這正是後續「外部性有界自治」必須接上的原因。

---

## 8. 課程可以由四種來源共同生成

### 8.1 Human Curriculum

人類直接要求：

> 學會整理我的論文庫。

### 8.2 Environment Curriculum

環境產生問題：

> 磁碟快滿了。

### 8.3 Failure Curriculum

錯誤產生問題：

> 為什麼昨天的排程失敗？

### 8.4 Self-Proposed Curriculum

Agent 根據歷史提出：

> 我每次都花大量時間做相同檢查，應該建立自動驗證器。

因此：

$$
Curriculum_t
=
C_H\cup C_E\cup C_F\cup C_A
$$

發展式智能體真正有趣的地方就在於：

$$
|C_A|\uparrow
$$

可能隨能力成熟而逐漸增加，但仍受風險與權限邊界限制。

---

## 9. 從 Memory 到 Skill：經驗必須可執行

如果 Agent 每次碰到問題，只檢索一句：

> 「以前好像遇過。」

其價值有限。

更成熟的形式是：

$$
Trace
\rightarrow
Memory
\rightarrow
Policy
\rightarrow
Skill
$$

2026 年的 MSCE 正在研究這個方向：把經驗組織為 grounded traces、procedural policies、environmental cognition，並把有證據、有效益的政策結晶成可調用 skill，同時保留適用邊界、驗證規則與可靠度。

因此本文主張：

$$
\boxed{
Development
\text{ requires executable consolidation}
}
$$

例如從：

> 「上次備份前忘記確認磁碟空間。」

演化成：

```text
backup_preflight_check()
```

甚至：

> 所有高價值備份工作，自動先跑 preflight skill。

此時經驗不只是被回憶，而被編譯進未來行動結構。

---

## 10. 發展可以發生在多個層級，而非只有權重

可將 Agent 的更新分為：

$$
U
=
\{
U_M,U_P,U_S,U_T,U_E,U_\theta
\}
$$

其中：

- $U_M$ ：Memory update；
- $U_P$ ：Policy update；
- $U_S$ ：Skill update；
- $U_T$ ：Tool update；
- $U_E$ ：Environment restructuring；
- $U_\theta$ ：Model weight update。

大部分私人本地 Agent 的早期發展，完全可以主要發生在：

$$
U_M+U_P+U_S+U_T+U_E
$$

而不急著做：

$$
U_\theta
$$

這具有幾個優點：

- 更容易回滾；
- 更容易觀察；
- 更容易做版本管理；
- 更容易知道「學了什麼」；
- 不需要本地具備巨大訓練算力；
- 可以使用雲端大型模型作教師而不必把大型模型永久放在本機。

所以：

$$
\boxed{
LifelongDevelopment
\not\equiv
OnlineWeightTraining
}
$$

這是本系列對「可養成本地 AI」的重要工程立場。

---

## 11. 怎麼判斷 Agent 是真的變好，而不是變得更熟悉？

如果一個 Agent 只把同一個使用者的十個固定流程背熟，這可能只是適應，而不是廣義能力發展。

因此需要區分：

### 11.1 Repetition Gain

重複任務變快。

### 11.2 Transfer Gain

新任務也受益。

### 11.3 Recovery Gain

遇到失敗時更會處理。

### 11.4 Governance Gain

更會決定何時自己做、何時求援。

### 11.5 Compression Gain

能把大量重複互動壓縮成規則、工具或工作流。

可定義一個發展性評測：

$$
DScore
=
\alpha G_R
+
\beta G_T
+
\gamma G_{Rec}
+
\delta G_G
+
\epsilon G_C
-
\lambda Drift
$$

其中最後必須扣掉：

$$
Drift
$$

因為一個 Agent 可能「越來越有效率」，但同時逐漸偏離原始意圖。

---

## 12. 發展式學習的反例：看起來在學，其實沒有

### 12.1 Log Hoarding

保存所有紀錄，但從未重用。

### 12.2 Memory Inflation

記憶越來越多，檢索反而變差。

### 12.3 Repeated Reflection

每次失敗都寫心得，但下次仍犯同樣錯。

### 12.4 Tool Sprawl

每個問題都寫一支新 script，最後產生 500 個無人維護工具。

### 12.5 Local Overfitting

只會處理自己電腦裡極窄的既有狀況，稍有變化就失效。

### 12.6 Confirmation Loop

Agent 自己產生假設、自己驗證、自己記住，形成自我強化錯誤。

因此：

$$
SelfReflection
\not\Rightarrow
CorrectReflection
$$

以及：

$$
SelfGeneratedData
\not\Rightarrow
HighQualityData
$$

這也是雲端教師、人類修正與外部驗證仍然重要的原因。

---

## 13. 發展式學習需要「遺忘」

如果所有經驗永久保留：

$$
|M_t|\rightarrow\infty
$$

最終可能導致：

- 搜尋成本上升；
- 衝突規則增加；
- 過時知識污染；
- 舊環境偏好壓制新環境；
- 無效工具堆積。

ReMe 的 utility-based refinement、MSCE 的 evidence-grounded governance 都指向同一件事：

> 長期 Agent 的記憶不是 archive，而是 lifecycle。

因此：

$$
\boxed{
Learning
=
Remembering
+
Refining
+
Forgetting
}
$$

但「忘記」不能只是刪除。

更安全的是：

$$
ActiveMemory
\rightarrow
ColdMemory
\rightarrow
Archive
$$

並保留 provenance，使錯誤修正仍可追溯。

這也會與後續多雲備份、不可變歷史形成重要區別：

> Agent 可以在「工作記憶」中遺忘，但系統未必要在「恢復歷史」中真正抹除。

---

## 14. 發展式智能體的基本閉環

本文將發展式智能體學習收斂為：

$$
\boxed{
Observe
\rightarrow
Act
\rightarrow
Consequence
\rightarrow
Verify
\rightarrow
Reflect
\rightarrow
Abstract
\rightarrow
Consolidate
\rightarrow
Reapply
}
$$

若重複多輪：

$$
\mathcal D_0
\rightarrow
\mathcal D_1
\rightarrow
\cdots
\rightarrow
\mathcal D_n
$$

其中 $\mathcal D_t$ 不是單一模型能力，而是：

$$
\mathcal D_t
=
(
M_t,
P_t,
S_t,
T_t,
E_t,
R_t
)
$$

即記憶、政策、技能、工具、環境結構與恢復能力的聯合狀態。

---

## 15. 一個可實驗化的 90 天研究設計

如果要證明這不是漂亮的概念，而是真正的方法，可以做一個非常直接的實驗。

### Group A：Stateless Agent

每次任務後恢復基準環境，只允許短期 context。

### Group B：Persistent Agent

擁有：

- PCH；
- 長期記憶；
- 工具保存；
- 排程；
- 可逆環境修改；
- 失敗反思；
- 週期性 memory／skill consolidation。

兩組使用相同底層模型：

$$
\theta_A=\theta_B
$$

並給予 90 天相似工作流。

評估：

$$
\Delta RepeatCost
$$

$$
\Delta TransferSuccess
$$

$$
\Delta HumanIntervention
$$

$$
\Delta RecoveryTime
$$

$$
\Delta SearchCost
$$

$$
\Delta MaintenanceDebt
$$

如果 Group B 在沒有更新底層權重的情況下，持續產生跨任務改善，就可以得到很強的證據：

$$
\boxed{
\text{Persistent Environment}
+
\text{Actionable Experience}
\Rightarrow
\text{Runtime Development}
}
$$

---

## 16. 安全條件：不是讓 Agent 用真實世界當無限制 RL 環境

本文的「真實後果」不能被誤解成：

> 讓 Agent 到真實世界亂試，出事再學。

應該採取：

$$
LearningFreedom
\propto
Recoverability
$$

並且：

$$
ExplorationFreedom
\propto
\frac{1}{Externality}
$$

因此：

- 本地可逆檔案整理：高自由；
- 自己的工具重構：高自由；
- 可回滾 OS 測試：中高自由；
- 對外發布：低自由；
- 支付、production、他人資產：高治理。

這會在第 09–13 篇正式展開。

發展式學習不是取消治理，而是把：

$$
\text{Learning Space}
$$

設計成足夠真實、又有界可恢復。

---

## 17. 與 HACAL 的重新合流：人類也是 curriculum 的一部分

第 02 篇提出：

$$
(H_t,A_t,M_t)
\rightarrow
(H_{t+1},A_{t+1},M_{t+1})
$$

所以發展式 Agent 的 curriculum 不只來自計算環境。

人類的：

- 修正；
- 不耐煩；
- 重複說明；
- 拒絕；
- 授權；
- 改變偏好；
- 求助；

都是資料。

甚至：

> 「為什麼這件事情我已經講三次了？」

本身就可以被 Agent 轉成：

$$
Friction\ Signal
$$

從而觸發：

> 應該形成一條新規則或工具，而不是第四次再問。

因此：

$$
\boxed{
Human
+
Environment
+
Failure
+
Agent
\rightarrow
Curriculum
}
$$

---

## 18. 從「訓練一個模型」到「養成一個系統」

傳統模型訓練思維：

$$
Dataset
\rightarrow
Training
\rightarrow
Model
\rightarrow
Deploy
$$

發展式智能體則更接近：

$$
Deploy
\rightarrow
Experience
\rightarrow
Memory
\rightarrow
Skill
\rightarrow
Environment
\rightarrow
Policy
\rightarrow
NewExperience
$$

也就是部署不再是訓練結束。

部署反而是：

$$
\boxed{
Development\
Begins
}
$$

對未來私人本地 AI 而言，使用者拿到的可能不是「已完成的 AI」，而是一個：

> 基礎能力足夠、但會隨長期互動、環境與生活史形成個體化能力結構的智能系統。

這不是必須以哲學人格為前提。

純工程上就可以成立。

---

## 19. 下一篇：整理為什麼本身就是學習演算法？

如果本文成立，那麼下一個問題自然出現：

> Agent 每天到底從哪裡得到最多、最穩定、最便宜的學習任務？

答案之一可能非常普通：

> 整理自己的環境。

因為整理會直接作用於：

$$
SearchCost
$$

$$
Redundancy
$$

$$
MaintenanceDebt
$$

$$
RecoveryCost
$$

$$
ContextReconstructionCost
$$

因此第 07 篇將正式展開：

# 〈整理即優化：從文件管理到環境演算法〉

並研究「整理」如何從人類 housekeeping 概念，提升為智能體降低未來計算與認知成本的一般化演算法。

---

## 20. 結論

本文的核心區分是：

$$
\boxed{
\text{Long-lived Agent}
\neq
\text{Learning Agent}
}
$$

真正的發展至少需要：

$$
\boxed{
Experience
\rightarrow
Selection
\rightarrow
Abstraction
\rightarrow
Verification
\rightarrow
Consolidation
\rightarrow
FuturePolicyChange
}
$$

Persistent Computer Habitat 提供時間與環境；記憶保存經驗；真實後果提供延遲回饋；反思產生候選規則；工具與技能把經驗編譯成可執行能力；人類與雲端則提供外部修正與更高階驗證。

所以發展式智能體學習並不是：

> 「讓 AI 自己跑久一點。」

而是：

> **讓一個智能體在可恢復、有歷史、有後果的環境中，持續把生活過程轉換成未來能力。**

可以濃縮為：

$$
\boxed{
\text{History}
\rightarrow
\text{Experience}
\rightarrow
\text{Capability}
}
$$

如果這條鏈真正成立，那麼未來 AI 的重要訓練場不只會是資料中心裡的大型 dataset。

它也可能是：

> **它長期管理的那一台計算機本身。**

---

## 參考資料

[1] Cao, Z. et al. **Remember Me, Refine Me: A Dynamic Procedural Memory Framework for Experience-Driven Agent Evolution.** Findings of ACL 2026.  
https://aclanthology.org/2026.findings-acl.829/

[2] Luo, J. et al. **From Storage to Experience: A Survey on the Evolution of LLM Agent Memory Mechanisms.** Findings of ACL 2026.  
https://aclanthology.org/2026.findings-acl.2069/

[3] Bogdanov, I. et al. **FORGE: Self-Evolving Agent Memory With No Weight Updates via Population Broadcast.** arXiv:2605.16233, 2026.  
https://arxiv.org/abs/2605.16233

[4] Feng, T. et al. **EvolvingAgent: Curriculum Self-evolving Agent with Continual World Model for Long-Horizon Tasks.** arXiv:2502.05907; updated 2026.  
https://arxiv.org/abs/2502.05907

[5] Tang, B. et al. **From Memory to Skills: Evidence-Grounded Co-Evolution Governance for Long-Horizon LLM Agents.** arXiv:2607.16621, 2026.  
https://arxiv.org/abs/2607.16621

[6] Yang, Y. et al. **AutoSkill: Experience-Driven Lifelong Learning via Skill Self-Evolution.** arXiv:2603.01145, 2026.  
https://arxiv.org/abs/2603.01145

---

## 系列依賴

**上游：**

- 02〈人機智能體共適應學習〉
- 03〈合作軌跡作為訓練資料〉
- 04〈從 P/NP 認知到協作搜尋空間壓縮〉
- 05〈計算機作為持續智能環境〉

**下游：**

- 07〈整理即優化：從文件管理到環境演算法〉
- 08〈計算式自我維護〉
- 09〈外部性有界智能體自治〉
- 11〈本地自由、雲端治理與教師智能〉
