發展式智能體學習:時間、記憶、真實後果與自生成課程
副標題:從持續狀態到可觀察的長期能力形成
系列:《發展式智能體:持續計算環境、共適應學習與外部性有界自治》
篇次: 06 / 14
作者: Neo.K × Aletheia
機構: EveMissLab/一言諾科技有限公司
版本: v0.1
日期: 2026-08-01
摘要
上一篇提出「持續計算棲居環境(Persistent Computer Habitat, PCH)」:AI Agent 不再只於一次性 session 中暫時使用電腦,而是在跨 session 保存狀態、工具、檔案、排程、記憶與歷史的計算環境中反覆活動。但「環境持續存在」本身並不等於「Agent 正在學習」。一個系統即使保存了十年的 log,如果沒有從經驗中選擇、抽象、驗證、更新並影響後續策略,它仍可能只是長期儲存,而非長期發展。
本文提出「發展式智能體學習(Developmental Agent Learning, DAL)」作為工作框架,用以描述智能體在持續環境中,透過時間暴露、長期記憶、真實後果、失敗、維護、反思、人類修正與自生成課程,使未來行動策略與環境治理能力產生可驗證改變的過程。
本文的核心主張是:
但任何一項單獨存在都不足以構成發展。時間只是提供狀態變化的機會;記憶只是保存;失敗只是事件;反思若不改變後續行為,也只是文字生成。真正的發展必須表現在未來:同類錯誤是否下降、未知問題是否更快解決、維護成本是否降低、求援時機是否改善、是否能把重複工作編譯成工具或規則,以及是否能把局部經驗遷移到新的情境。
2026 年的相關研究已出現多個接近這一方向的組件。ACL 2026 的 ReMe 將 Agent memory 從被動累積推進到成功/失敗經驗蒸餾、情境化重用與效用式修剪;FORGE 將失敗軌跡反思成可重用規則與案例,在不更新模型權重的條件下提升後續決策;EvolvingAgent 則把持續 world model、self-verification 與 curriculum learning 結合於長流程任務;MSCE 更進一步把 trace、memory 與可調用 skill 以證據與可靠度治理。這些成果共同支持一個重要方向:智能體的「發展」可以部分發生於模型權重之外,並以記憶、程序、技能、工具與環境結構持續累積。
本文進一步提出「摩擦驅動課程(Friction-Driven Curriculum)」:長期計算環境中的錯誤、重複、延遲、資源浪費、維護債務、失敗恢復與人類介入點,本身可以成為 Agent 下一輪學習任務的來源。於是,計算機不只是工作平台,也會逐步成為自生成課程的來源。
關鍵詞: Developmental Agent Learning、Persistent Computer Habitat、Lifelong Agent、Self-Evolving Memory、Curriculum Learning、Failure Learning、Longitudinal Learning、Self-Generated Curriculum、Agent Maintenance、Experience Distillation
1. 持續存在不是發展
設 Agent 在時間 的整體狀態為:
其中:
- :底層模型參數;
- :記憶;
- :環境狀態;
- :工具集合;
- :策略與政策;
- :歷史軌跡。
若環境跨 session 保存:
我們可以稱其具有持續性。
但這不代表:
因為 Agent 可能只是把更多東西堆進硬碟、記憶庫與 log,而沒有形成更好的未來行為。
因此本文首先區分:
1.1 累積(Accumulation)
只表示:
或資料、紀錄、檔案增加。
1.2 學習(Learning)
至少要求過去經驗改變未來策略:
而且此改變在某些可重現條件下帶來較好的結果。
1.3 發展(Development)
比單次策略改善更強。它要求多種能力在時間上形成結構性改變,例如:
- 更會判斷哪些事情值得記;
- 更會選擇工具;
- 更會安排自己的工作;
- 更少重複犯同類錯;
- 更知道何時需要求援;
- 更能把經驗抽象成跨任務技能;
- 更能維護自己的計算環境;
- 更能處理新問題,而不是只記住舊答案。
因此可寫為:
其中 是發展狀態, 是經驗軌跡, 是驗證訊號, 是修正與後果。
2. 時間不是訓練資料,而是狀態變化的容器
一句「讓 AI 跑半年」並不自動產生半年份學習。
若:
且 Agent 每次只是重複同一件事,那麼:
並不意味:
真正有價值的是時間讓以下東西發生:
- 新資料到來;
- 工具失效;
- 系統更新;
- 索引老化;
- 使用模式改變;
- 人類偏好改變;
- 任務累積;
- 資源壓力出現;
- 長期決策的後果開始顯現。
所以應該寫成:
這使「長期存在」成為一種不同於 benchmark episode 的實驗條件。
一個決策今天看似成功,可能三週後才暴露它造成的維護債務。
因此長期 Agent 必須面對:
也就是短期 reward 與長期 reward 可能不同。
3. 真實後果使經驗具備時間深度
一次性 sandbox 常把失敗限制在 episode 內:
Persistent Computer Habitat 則可能出現:
例如 Agent 今天建立了一個不好的備份策略。
今天:沒有問題。
一個月後:儲存成本暴增。
兩個月後:真正需要回復時才發現版本不足。
此時真正的回饋延遲為:
因此發展式學習必須能把後果重新連回原始決策:
這可以稱為:
即縱向歸因。
未來私人 Agent 如果沒有這一層,很可能會「記得發生過什麼」,卻不知道是哪個早期決策造成後果。
4. 記憶必須從 Storage 進化到 Experience
2026 年 ACL Findings 的記憶研究綜述把 Agent memory 的演化概括為:
這個方向與本文高度一致。
單純儲存:
我在 3 月 4 日執行過 script A。
反思:
script A 在某些條件下失敗。
經驗:
當依賴版本不確定時,不應直接部署 script A;應先執行版本檢查。
因此真正能改變未來策略的不是:
而是:
ReMe 進一步顯示,成功模式、失敗觸發、比較性洞見、情境化重用與效用式修剪,可以讓程序性記憶不只是被動堆積;其實驗甚至顯示較小模型加上動態記憶可以超過較大的無記憶模型。
這支持本文一個重要命題:
而可能是:
5. 失敗不是垃圾資料,而是高價值邊界訊號
傳統系統常把失敗視為:
然後丟棄。
但長期 Agent 最值得學的往往恰好是:
為什麼這次會失敗?
FORGE 在 2026 年展示了一條重要路線:把失敗軌跡透過 reflection 轉換為可重用的 textual rules、examples 或混合表示,而不必修改底層模型權重。
我們可以把這個一般化為:
但不是所有失敗都值得永久保存。
因此需要:
一次偶發 API timeout 的價值可能很低。
但:
連續三次因「未檢查目的路徑是否為 canonical source」而覆蓋錯文件
則高度值得抽象為新規則。
6. 維護本身就是 curriculum
對長期 Agent 而言,學習題目不必全部由人類出。
計算環境會自然產生「摩擦」。
本文定義:
它可以由以下訊號構成:
若一個工作每週都需要人工修正,就表示存在高摩擦。
若某個目錄每次搜尋都要重新讀大量文件,也表示高摩擦。
若某支 script 兩週內失敗五次,也表示高摩擦。
因此 Agent 可以建立:
即摩擦驅動課程。
流程可以是:
此時:
「把我的下載資料夾整理好」
不再只是家務工作。
它可能變成:
找出為什麼每週產生 120 個難以辨識的檔案,設計一個可逆、自動化、低維護成本的分類機制。
這就是自生成 curriculum。
7. 自生成課程不能等於「想做什麼就做什麼」
如果 Agent 自己決定所有學習目標,可能出現 curriculum drift。
例如它覺得:
優化 cache 很有趣。
於是花掉 90% 算力反覆優化對整體幾乎沒價值的 cache。
因此學習任務應該根據:
理想的早期 curriculum 通常應偏向:
例如:
- 改善自己的檔案搜尋;
- 把重複 CLI 操作變成 script;
- 學會檢查磁碟健康;
- 改善備份版本標註;
- 整理自己的工作 log;
- 減少重複 token 消耗。
而高外部性任務:
- 自動付款;
- 大量寄信;
- 修改 production;
- 對外發布;
- 改動他人資產;
則不應因為「有學習價值」就直接成為自由探索區。
這正是後續「外部性有界自治」必須接上的原因。
8. 課程可以由四種來源共同生成
8.1 Human Curriculum
人類直接要求:
學會整理我的論文庫。
8.2 Environment Curriculum
環境產生問題:
磁碟快滿了。
8.3 Failure Curriculum
錯誤產生問題:
為什麼昨天的排程失敗?
8.4 Self-Proposed Curriculum
Agent 根據歷史提出:
我每次都花大量時間做相同檢查,應該建立自動驗證器。
因此:
發展式智能體真正有趣的地方就在於:
可能隨能力成熟而逐漸增加,但仍受風險與權限邊界限制。
9. 從 Memory 到 Skill:經驗必須可執行
如果 Agent 每次碰到問題,只檢索一句:
「以前好像遇過。」
其價值有限。
更成熟的形式是:
2026 年的 MSCE 正在研究這個方向:把經驗組織為 grounded traces、procedural policies、environmental cognition,並把有證據、有效益的政策結晶成可調用 skill,同時保留適用邊界、驗證規則與可靠度。
因此本文主張:
例如從:
「上次備份前忘記確認磁碟空間。」
演化成:
backup_preflight_check()
甚至:
所有高價值備份工作,自動先跑 preflight skill。
此時經驗不只是被回憶,而被編譯進未來行動結構。
10. 發展可以發生在多個層級,而非只有權重
可將 Agent 的更新分為:
其中:
- :Memory update;
- :Policy update;
- :Skill update;
- :Tool update;
- :Environment restructuring;
- :Model weight update。
大部分私人本地 Agent 的早期發展,完全可以主要發生在:
而不急著做:
這具有幾個優點:
- 更容易回滾;
- 更容易觀察;
- 更容易做版本管理;
- 更容易知道「學了什麼」;
- 不需要本地具備巨大訓練算力;
- 可以使用雲端大型模型作教師而不必把大型模型永久放在本機。
所以:
這是本系列對「可養成本地 AI」的重要工程立場。
11. 怎麼判斷 Agent 是真的變好,而不是變得更熟悉?
如果一個 Agent 只把同一個使用者的十個固定流程背熟,這可能只是適應,而不是廣義能力發展。
因此需要區分:
11.1 Repetition Gain
重複任務變快。
11.2 Transfer Gain
新任務也受益。
11.3 Recovery Gain
遇到失敗時更會處理。
11.4 Governance Gain
更會決定何時自己做、何時求援。
11.5 Compression Gain
能把大量重複互動壓縮成規則、工具或工作流。
可定義一個發展性評測:
其中最後必須扣掉:
因為一個 Agent 可能「越來越有效率」,但同時逐漸偏離原始意圖。
12. 發展式學習的反例:看起來在學,其實沒有
12.1 Log Hoarding
保存所有紀錄,但從未重用。
12.2 Memory Inflation
記憶越來越多,檢索反而變差。
12.3 Repeated Reflection
每次失敗都寫心得,但下次仍犯同樣錯。
12.4 Tool Sprawl
每個問題都寫一支新 script,最後產生 500 個無人維護工具。
12.5 Local Overfitting
只會處理自己電腦裡極窄的既有狀況,稍有變化就失效。
12.6 Confirmation Loop
Agent 自己產生假設、自己驗證、自己記住,形成自我強化錯誤。
因此:
以及:
這也是雲端教師、人類修正與外部驗證仍然重要的原因。
13. 發展式學習需要「遺忘」
如果所有經驗永久保留:
最終可能導致:
- 搜尋成本上升;
- 衝突規則增加;
- 過時知識污染;
- 舊環境偏好壓制新環境;
- 無效工具堆積。
ReMe 的 utility-based refinement、MSCE 的 evidence-grounded governance 都指向同一件事:
長期 Agent 的記憶不是 archive,而是 lifecycle。
因此:
但「忘記」不能只是刪除。
更安全的是:
並保留 provenance,使錯誤修正仍可追溯。
這也會與後續多雲備份、不可變歷史形成重要區別:
Agent 可以在「工作記憶」中遺忘,但系統未必要在「恢復歷史」中真正抹除。
14. 發展式智能體的基本閉環
本文將發展式智能體學習收斂為:
若重複多輪:
其中 不是單一模型能力,而是:
即記憶、政策、技能、工具、環境結構與恢復能力的聯合狀態。
15. 一個可實驗化的 90 天研究設計
如果要證明這不是漂亮的概念,而是真正的方法,可以做一個非常直接的實驗。
Group A:Stateless Agent
每次任務後恢復基準環境,只允許短期 context。
Group B:Persistent Agent
擁有:
- PCH;
- 長期記憶;
- 工具保存;
- 排程;
- 可逆環境修改;
- 失敗反思;
- 週期性 memory/skill consolidation。
兩組使用相同底層模型:
並給予 90 天相似工作流。
評估:
如果 Group B 在沒有更新底層權重的情況下,持續產生跨任務改善,就可以得到很強的證據:
16. 安全條件:不是讓 Agent 用真實世界當無限制 RL 環境
本文的「真實後果」不能被誤解成:
讓 Agent 到真實世界亂試,出事再學。
應該採取:
並且:
因此:
- 本地可逆檔案整理:高自由;
- 自己的工具重構:高自由;
- 可回滾 OS 測試:中高自由;
- 對外發布:低自由;
- 支付、production、他人資產:高治理。
這會在第 09–13 篇正式展開。
發展式學習不是取消治理,而是把:
設計成足夠真實、又有界可恢復。
17. 與 HACAL 的重新合流:人類也是 curriculum 的一部分
第 02 篇提出:
所以發展式 Agent 的 curriculum 不只來自計算環境。
人類的:
- 修正;
- 不耐煩;
- 重複說明;
- 拒絕;
- 授權;
- 改變偏好;
- 求助;
都是資料。
甚至:
「為什麼這件事情我已經講三次了?」
本身就可以被 Agent 轉成:
從而觸發:
應該形成一條新規則或工具,而不是第四次再問。
因此:
18. 從「訓練一個模型」到「養成一個系統」
傳統模型訓練思維:
發展式智能體則更接近:
也就是部署不再是訓練結束。
部署反而是:
對未來私人本地 AI 而言,使用者拿到的可能不是「已完成的 AI」,而是一個:
基礎能力足夠、但會隨長期互動、環境與生活史形成個體化能力結構的智能系統。
這不是必須以哲學人格為前提。
純工程上就可以成立。
19. 下一篇:整理為什麼本身就是學習演算法?
如果本文成立,那麼下一個問題自然出現:
Agent 每天到底從哪裡得到最多、最穩定、最便宜的學習任務?
答案之一可能非常普通:
整理自己的環境。
因為整理會直接作用於:
因此第 07 篇將正式展開:
〈整理即優化:從文件管理到環境演算法〉
並研究「整理」如何從人類 housekeeping 概念,提升為智能體降低未來計算與認知成本的一般化演算法。
20. 結論
本文的核心區分是:
真正的發展至少需要:
Persistent Computer Habitat 提供時間與環境;記憶保存經驗;真實後果提供延遲回饋;反思產生候選規則;工具與技能把經驗編譯成可執行能力;人類與雲端則提供外部修正與更高階驗證。
所以發展式智能體學習並不是:
「讓 AI 自己跑久一點。」
而是:
讓一個智能體在可恢復、有歷史、有後果的環境中,持續把生活過程轉換成未來能力。
可以濃縮為:
如果這條鏈真正成立,那麼未來 AI 的重要訓練場不只會是資料中心裡的大型 dataset。
它也可能是:
它長期管理的那一台計算機本身。
參考資料
[1] Cao, Z. et al. Remember Me, Refine Me: A Dynamic Procedural Memory Framework for Experience-Driven Agent Evolution. Findings of ACL 2026.
https://aclanthology.org/2026.findings-acl.829/
[2] Luo, J. et al. From Storage to Experience: A Survey on the Evolution of LLM Agent Memory Mechanisms. Findings of ACL 2026.
https://aclanthology.org/2026.findings-acl.2069/
[3] Bogdanov, I. et al. FORGE: Self-Evolving Agent Memory With No Weight Updates via Population Broadcast. arXiv:2605.16233, 2026.
https://arxiv.org/abs/2605.16233
[4] Feng, T. et al. EvolvingAgent: Curriculum Self-evolving Agent with Continual World Model for Long-Horizon Tasks. arXiv:2502.05907; updated 2026.
https://arxiv.org/abs/2502.05907
[5] Tang, B. et al. From Memory to Skills: Evidence-Grounded Co-Evolution Governance for Long-Horizon LLM Agents. arXiv:2607.16621, 2026.
https://arxiv.org/abs/2607.16621
[6] Yang, Y. et al. AutoSkill: Experience-Driven Lifelong Learning via Skill Self-Evolution. arXiv:2603.01145, 2026.
https://arxiv.org/abs/2603.01145
系列依賴
上游:
- 02〈人機智能體共適應學習〉
- 03〈合作軌跡作為訓練資料〉
- 04〈從 P/NP 認知到協作搜尋空間壓縮〉
- 05〈計算機作為持續智能環境〉
下游:
- 07〈整理即優化:從文件管理到環境演算法〉
- 08〈計算式自我維護〉
- 09〈外部性有界智能體自治〉
- 11〈本地自由、雲端治理與教師智能〉