05|遊戲解構經濟學:成本、難度、資訊增益與研究深度
The Economics of Game Deconstruction: Cost, Difficulty, Information Gain, and Research Depth
系列:《可執行資料與深層解構學習》
篇次: 05 / 10
作者: Neo.K with Aletheia
機構: EveMissLab/一言諾科技有限公司
版本: v0.1 Research Draft
日期: 2026-08-16
文件性質: 遊戲智能考古/研究投資/Cost-aware Acquisition/資訊增益/多保真研究
範圍聲明: 本文處理合法取得與正常研究條件下的遊戲解構資源配置問題。遊戲價格只是研究成本的一部分,不以短期退款、暫時存取或破壞性取得方式作為研究經濟模型基礎。
摘要
當遊戲解構由少數興趣案例擴展為數百、數千款遊戲與版本的系統性研究後,真正的瓶頸不再是「有哪些遊戲值得看」,而是如何在有限預算、時間、算力、人力與驗證能力下,選擇最值得研究的遊戲、子系統與研究深度。
本文提出「遊戲解構經濟學」(Economics of Game Deconstruction, EGD)框架。其核心主張是:
在大量案例中,一款遊戲的售價只是最容易觀察的成本,而真正支配研究資源的是:安裝與版本治理、關鍵行為觸發時間、黑箱程度、資料可觀測性、可重現性、工具建置、AI 研究算力、人類覆核、獨立重建與驗證成本。
本文將單一遊戲 在時間 的總研究成本表示為:
其中依序表示 acquisition、setup、observation、extraction、compute、human review、verification 與 maintenance。
本文進一步提出「解構難度」不是遊戲系統複雜度的單一函數,而至少由複雜度、不可見性、狀態可取得性、重現性、版本熵、關鍵行為等待時間與工具摩擦共同構成:
更重要的是,遊戲的研究價值不是固定常數,而是相對於當前知識庫 的動態邊際資訊增益:
當研究庫尚無 RTS 樣本時,一款代表性 RTS 的價值可能極高;當已有數十款高度相似的 RTS 被深度解構後,下一款同質作品的邊際資訊增益可能接近零。故研究優先級應取決於「相對現有知識空間,這款遊戲還能補什麼」。
本文將遊戲研究分為五級深度:
從 inventory、behavioral survey、mechanism study、independent reconstruction 到 validated cross-case integration。並提出多保真研究思想:不需要對每款遊戲都投入最高研究成本;大量遊戲可停留於低成本層,只有高資訊增益候選才逐步升級。
最終,本研究提出一個動態研究優先函數:
其中 為研究深度, 為與當前專案的協同價值, 為泛化與重建收益, 為該深度的總成本, 為當前研究預算。
本文最後將遊戲解構從「遊戲收藏」改寫為:
這為後續大規模遊戲智能資料庫、AI 研究艦隊與自動研究排程奠定資源配置基礎。
關鍵詞: 遊戲解構、研究成本、資訊增益、Active Learning、Multi-Fidelity、Research Portfolio、Game AI Archaeology、Budget Allocation、研究深度
1. 問題:當遊戲從 5 款變成 500 款
少量研究時,我們可以使用直覺:
這款有趣,研究。
那款 AI 很有名,研究。
這款正好對自己的遊戲開發有用,先研究。
這在:
時完全足夠。
但當目標變成:
甚至:
其中研究單位還包含:
- version;
- platform;
- subsystem;
- AI feature;
- behavior family;
則直覺式選擇開始失效。
此時真正問題變成:
2. 第一個錯覺:遊戲售價就是研究成本
最容易觀察的成本是:
例如:
- 購買遊戲;
- DLC;
- expansion;
- subscription;
- platform hardware;
- legacy copy。
因此人容易以為:
但對系統性解構而言通常不是如此。
3. 一款便宜遊戲可能非常昂貴
假設:
但它:
- 沒有 Wiki;
- 沒有 MOD;
- 沒有 debug console;
- 沒有 replay;
- 關鍵 AI 行為要玩 30 小時才出現;
- 存檔不可讀;
- 不同版本行為不同;
- 沒有公開開發者資訊;
- 需要大量黑箱測試。
則:
相反,一款:
的遊戲,如果:
- 有完整公開 API;
- 有 debug tools;
- 有 replay;
- 有 modding docs;
- 有公開開發演講;
- 有可控 sandbox;
- 關鍵 AI 可快速重現;
則:
完全可能成立。
4. 總研究成本模型
本文將:
定義為遊戲 在研究深度 下的總成本。
初步拆為:
5. Acquisition Cost
包含:
- 遊戲;
- expansion;
- 必要 DLC;
- 平台版本;
- hardware;
- subscription;
- archival copy。
但並非所有 DLC 都值得購買。
研究應問:
DLC 是否改變目標 AI subsystem?
若:
則:
可能沒有研究必要。
6. Setup Cost
包括:
- 安裝;
- compatibility;
- 控制器;
- emulator;
- resolution;
- save preparation;
- debug environment;
- instrumentation;
- capture setup;
- mod manager;
- 版本鎖定。
舊遊戲的:
有時甚至高於購買成本數十倍。
7. Observation Cost
是取得行為證據所需成本。
例如:
- 實際遊玩;
- 等待 NPC 行為;
- 刷 boss phase;
- 建立 colony;
- 發展到 late game;
- 觸發外交;
- 讓 AI 進入特殊狀態;
- 執行多場戰鬥。
若關鍵現象需要:
則這本身就是重大成本。
8. Extraction Cost
表示把觀察轉成結構化研究資料的成本。
包括:
- transcript;
- state logging;
- save diff;
- video segmentation;
- event annotation;
- API extraction;
- code indexing;
- relation graph;
- feature table;
- evidence classification。
「看到」不等於「已經解構」。
9. Compute Cost
在多 AI 時代開始重要。
可能包括:
- frontier-model token;
- local inference;
- VLM analysis;
- code agent;
- simulation;
- automated gameplay;
- repeated experiments;
- embedding;
- graph construction。
當:
此項會成為可累積成本。
10. Human Review Cost
即使 AI 能大量解構,仍存在:
- ambiguous behavior;
- false causal inference;
- wrong version mapping;
- hallucinated mechanic;
- mistaken terminology;
- legal/source classification;
- design interpretation。
因此需要:
11. Verification Cost
通常是最容易被低估的部分之一。
它包括:
- 重跑;
- 反例;
- A/B test;
- state reset;
- seed control;
- replay;
- independent reconstruction;
- benchmark;
- second-model audit;
- cross-version check。
一個漂亮解釋的成本很低。
一個可驗證結論的成本可能高很多。
12. Maintenance Cost
遊戲不是靜態研究物。
存在:
- patch;
- remaster;
- remake;
- server update;
- mod update;
- engine update;
- DLC;
- AI balance patch。
因此:
可能隨時間失效。
真正研究庫必須支付:
13. 解構成本不等於遊戲複雜度
一個非常複雜的遊戲:
如果有極佳 instrumentation,仍可能容易研究。
一個非常簡單的遊戲:
如果完全黑箱,仍可能難以驗證。
因此:
14. 解構難度七維模型
本文提出:
其中:
- :system complexity;
- :opacity;
- :state accessibility;
- :reproducibility difficulty;
- :version entropy;
- :time-to-trigger;
- :tooling friction。
15. Complexity
包含:
- subsystem 數;
- 狀態量;
- interaction density;
- hierarchy;
- concurrency;
- rule count;
- hidden coupling。
但:
不是唯一難度。
16. Opacity
表示:
我們看不到多少東西?
例如:
- hidden state;
- server-side logic;
- undocumented rule;
- proprietary data;
- inaccessible logs。
若:
需要更多黑箱推論。
17. State Accessibility
表示能否取得:
- save;
- debug;
- console;
- log;
- API;
- telemetry;
- mod hooks;
- replay state。
注意:
通常意味:
因此在實作時可以使用:
18. Reproducibility
同樣輸入是否能重現近似結果?
若:
- RNG 強;
- background simulation 複雜;
- server population 改變;
- procedural generation 未鎖 seed;
則:
沒有重現能力,因果判定成本急升。
19. Version Entropy
定義:
為遊戲版本造成的研究不確定性。
例如:
Original
Patch 1.1
Expansion
Console Port
Remaster
Definitive Edition
若各版 AI 不同:
則「這款遊戲使用什麼 AI」本身就是錯誤問題。
應問:
其中:
- :version;
- :platform。
20. Time-to-Trigger
某 AI 行為可能:
- 30 秒出現;
- 3 小時出現;
- 30 小時出現;
- 只在 late game 出現。
定義:
為觀察機制 的預期等待成本。
這是遊戲研究非常特殊的一個成本維度。
21. Tooling Friction
包括:
- file format;
- scripting language;
- obfuscated data;
- no export;
- platform isolation;
- capture difficulty;
- inaccessible version;
- automation instability。
高 tooling friction 會使大量 AI 時間浪費在:
取得資料。
而不是:
理解資料。
22. 解構難度與研究深度耦合
同一款遊戲:
因此不能只給每款遊戲一個固定 difficulty。
更完整應寫:
23. 研究效益也不是單一值
假設研究收益:
本文至少拆成:
其中:
- :Direct development benefit;
- :information gain;
- :generalization benefit;
- :novelty;
- :reconstruction value;
- :coverage contribution;
- :historical / comparative value。
24. Direct Development Benefit
回答:
這個研究能否直接改善我們現在要做的遊戲?
例如正在建立:
- NPC autonomy;
- persistent world;
- colony simulation;
- macro politics;
- auto battle;
則相對應遊戲:
這是當前階段最應被提高權重的收益。
25. Information Gain
令當前遊戲智能知識庫為:
研究遊戲 後得到:
則:
這裡 不必一開始就是嚴格 Shannon information。
可以是結構化研究指標:
- 新 mechanism;
- 新 relation;
- 新 failure mode;
- 新 composition;
- 新 architecture family;
- 新 version transition;
- 新 counterexample。
26. 邊際資訊價值是動態的
假設:
沒有 RTS AI。
第一款代表 RTS:
可能有:
研究:
之後,若:
與已有樣本高度重複:
因此:
27. 這與 Active Learning 的思想一致
Active Learning 的基本問題是:
在資料取得有成本時,下一筆應該取得哪個樣本?
Cost-aware active learning 更進一步加入:
遊戲解構可以視為類似問題。
不同的是 query 不再只是:
要不要標這個 sample?
而是:
要不要買、安裝、研究、驗證這個遊戲的某個 subsystem 到某個深度?
28. Cost-aware Research Acquisition
定義候選研究單元:
其中:
- :game;
- :version;
- :platform;
- :mechanism / subsystem;
- :depth。
每個單元具有:
與:
最簡研究策略是:
29. 但只看資訊增益仍然不夠
如果我們現在正在做遊戲產品:
則一個資訊上很新、但與目前產品無關的遊戲,未必最優先。
因此加入:
得到:
30. 泛化收益
有些機制只對一款遊戲有用。
另一些可以跨:
- genre;
- engine;
- platform;
- 年代。
定義:
若研究結果可以轉為:
- 通用 scheduler;
- 通用 priority arbitration;
- 通用 world-state pattern;
- 通用 companion AI;
則:
31. 初步研究優先函數
因此本文提出:
其中:
為 validation / reconstruction potential。
如果某機制根本無法驗證,研究價值需要折扣。
32. 不要迷信這個公式
此公式不是自然定律。
其用途是:
權重可以隨階段改變。
例如產品開發期:
歷史資料庫建設期:
前沿創新期:
33. 研究深度必須分層
最大節省成本的方法不是:
少研究幾款。
而是:
不要每款都研究到最深。
本文定義:
34. — Inventory
目標:
先知道它可能有什麼。
記錄:
- title;
- version;
- genre;
- platform;
- AI reputation;
- known subsystem;
- public docs;
- mod availability;
- rough research cost。
成本最低。
35. — Behavioral Survey
研究:
- gameplay;
- video;
- manual;
- Wiki;
- obvious behavior;
- basic experiments。
輸出:
不急著判斷內部機制。
36. — Mechanism Study
開始使用:
- controlled experiments;
- save diff;
- debug;
- mod API;
- version comparison;
- public code;
- telemetry;
- repeat trials。
輸出:
- mechanism candidates;
- state schema;
- functional typing;
- evidence confidence。
37. — Independent Reconstruction
根據:
建立:
要求:
- 自己寫;
- 不依賴原始專有程式;
- 能重現核心 behavior;
- 有 tests。
此時成本大幅提升。
38. — Validated Cross-Case Integration
最深層研究。
除了:
能工作,
還要求:
- 反例;
- cross-game comparison;
- benchmark;
- alternative hypothesis;
- architecture family placement;
- failure region;
- generalization test。
最後才能進:
39. Multi-Fidelity Research
這與 multi-fidelity experimental design 很相似。
不同 fidelity:
具有不同:
- 成本;
- 精度;
- 可觀測性;
- 誤差。
低 fidelity:
可以大規模掃描。
高 fidelity:
只分配給高價值候選。
40. 研究漏斗
例如:
款遊戲進:
其中:
進:
再:
進:
再:
進:
最後:
進:
這不是固定比例。
而是:
41. 升級條件
遊戲 從:
升至:
應滿足:
即下一層的預期資訊收益大於成本門檻。
42. Stop Rule
同樣重要的是:
什麼時候停止?
若:
則:
「沒研究到底」不是失敗。
可能是理性資源配置。
43. 低價遊戲不應自動優先
最簡單策略:
會造成:
- 大量低價;
- 大量重複;
- 大量低資訊樣本。
所以:
44. 名作也不應自動優先
另一個偏差:
但名作可能:
- 已被研究非常多;
- 公開資訊已飽和;
- 與當前缺口無關。
因此:
45. 冷門遊戲的探索價值
反過來,冷門遊戲可能包含:
- 未整理 mechanic;
- 特殊 AI;
- 被遺忘的 design pattern;
- 歷史分支;
- 失敗但有價值的實驗。
因此可保留:
的 exploration budget。
避免研究策略完全 exploit 已知名作。
46. Exploration–Exploitation
研究 portfolio 可以分:
其中:
Exploit
研究:
- 直接有用;
- 高成功率;
- 高泛化;
- 高已有證據。
Explore
研究:
- 冷門;
- 未知;
- 高不確定性;
- 潛在新機制。
這與 bandit / active learning 思想一致。
47. 遊戲群覆蓋
若資料庫目前:
- RTS:90 款;
- JRPG:3 款;
- life sim:1 款;
則下一個 RTS 的:
可能低。
JRPG/life sim:
可能高。
因此需要:
48. Coverage Deficit
令目標域為:
對類別:
定義:
則研究效益可以加入:
49. 版本研究也是投資問題
是否研究:
取決於:
如果 remaster 只改畫面:
則 AI 研究不一定需要深入。
如果 patch 明確改:
- pathfinding;
- target selection;
- autonomy;
- diplomacy;
- balance logic;
則:
50. DLC 也應作為 conditional acquisition
只有當:
夠高時才購買。
可先使用:
- patch notes;
- public docs;
- developer notes;
- community evidence;
做低成本 pre-screening。
51. Pre-Screening
在購買/安裝前,可建立:
估計研究價值。
輸入:
- 公開文件;
- 影片;
- Wiki;
- 論壇;
- 開發者演講;
- 已有論文;
- mod ecosystem。
輸出:
只有高分者才進 acquisition。
52. AI 使 Pre-Screening 非常便宜
過去人類要:
- 搜;
- 看;
- 摘要;
- 比較。
現在可以由廉價模型做:
因此:
這是大規模遊戲考古現在才真正可行的重要原因之一。
53. 但 AI 也會造成虛假低成本
若 AI 很快給出:
這遊戲使用 utility AI。
人可能誤以為研究已完成。
但:
因此:
54. 每個結論需要成本級別
建議資料庫對 evidence 記錄:
E0 = public mention
E1 = repeated observation
E2 = controlled experiment
E3 = structural evidence
E4 = independent reconstruction
E5 = cross-case validation
這不是 truth probability。
而是:
55. Knowledge Unit Cost
對機制:
定義:
這可以比較不同遊戲的研究效率。
56. Knowledge Yield
反過來定義:
即每單位成本帶來多少知識增量。
57. 不是所有知識單位同價
如果一筆只是:
敵人會在 HP 低時補血。
與:
發現一個可跨 genre 的 hierarchical interrupt architecture。
不能等價。
因此每個 knowledge unit 可帶:
則:
58. 重建收益
如果某機制可以直接進自己的遊戲:
它的價值不只是一筆知識。
還可能節省:
- design time;
- prototyping;
- debugging;
- failed architecture;
- engineering iteration。
因此:
59. 失敗案例也有價值
某遊戲 AI 很差,不代表:
若可以辨認:
- failure mode;
- why it fails;
- player exploit;
- bad scheduler;
- pathfinding pathology;
- overoptimization;
則得到:
它可以避免未來重犯。
60. 研究 portfolio 不應只有冠軍
若只選:
可能造成研究集中於同一類型。
因此更適合:
在總預算:
下選:
使:
並最大化:
61. Redundancy Penalty
如果兩個遊戲:
高度相似,
則同時深度研究可能浪費。
定義:
portfolio objective 加入:
這會鼓勵多樣化研究。
62. 研究深度也要 portfolio 化
可能選:
- Game A: ;
- Game B: ;
- Game C: ;
- Game D: 。
所以真正配置單位不是 game。
而是:
63. 與 Multi-Fidelity Active Learning 的對應
多保真主動學習處理:
高精度評估很貴,低精度評估很便宜,如何混合?
遊戲解構完全有類似結構:
研究目標不是:
全部高保真。
而是:
64. 部分可觀測與成本
Cost-aware active learning 尤其強調:
- feature acquisition 有成本;
- label acquisition 有成本;
- 部分資訊一開始不可見。
商業遊戲同樣具有:
例如:
要不要花 20 小時玩到 late game 取得外交 AI 證據?
本質就是一個昂貴 query。
65. Active Experiment Selection
2025 年多任務機器人評估工作已直接使用 cost-aware information gain 來選擇最有資訊價值的實驗,降低完整評估成本。
遊戲解構未來也可以類似:
例如不是問:
下一款玩什麼?
而問:
哪個測試最能區分 Utility AI 與 Priority Rule 兩個候選機制?
66. 研究可以由 Game Selection 進化成 Experiment Selection
初期:
成熟後:
因為一款遊戲內部可能有:
個值得測的 hypothesis。
此時遊戲只是一個環境。
真正的研究單位變成:
67. Hypothesis Discrimination
若候選:
應選一個輸入:
使:
與:
差異最大。
這比隨機玩 10 小時更有效率。
68. AI 可以自動設計解構實驗
當 AI 已讀:
- rules;
- replay;
- public docs;
- observations;
它可以提出:
把 Hunger 設到 90%,同時建立兩個距離不同但 utility 相近的 job,觀察 NPC 中斷規則。
這就開始形成:
69. 研究成本的真正未來
當公司資源增加時,最容易想到:
可以買更多遊戲。
但:
可能只是小部分。
真正可以擴張的是:
- parallel agents;
- automated gameplay;
- storage;
- GPU;
- version archive;
- test harness;
- human reviewers;
- reconstruction lab。
所以:
70. 大規模公司的優勢
假設:
為平行 AI researcher 數量。
若 task 可分解:
則:
在治理足夠好時可以大幅提升。
因此未來資本主要購買:
71. 但平行化不是免費午餐
大量 Agent 會增加:
- duplicate work;
- inconsistent taxonomy;
- hallucinated conclusions;
- version confusion;
- merge cost。
因此:
也使:
成熟系統必須加入這一項。
72. 擴展總成本
因此公司級模型可寫:
73. 現階段與未來階段應使用不同策略
現階段
目標:
因此:
權重極高。
優先:
- The Sims;
- RimWorld;
- Dwarf Fortress;
- Paradox;
- StarCraft;
- Dragon Quest;
- Final Fantasy;
- Auto-Battle;
- 與目標架構直接相關的作品。
74. 第二階段
當自己的基礎能力建立後:
逐步下降,
而:
提高。
開始追求:
- 代表性;
- 歷史覆蓋;
- 冷門樣本;
- 負案例;
- genre breadth。
75. 第三階段
當 corpus 足夠大後,主要問題變成:
研究選擇由:
轉成:
先找到 knowledge gap,再找最適合的遊戲填它。
76. Research Frontier
令:
為當前知識空間。
其 frontier:
包含:
- 不確定機制;
- 缺少案例;
- 缺少反例;
- 缺少版本;
- 缺少重建;
- 缺少跨域驗證。
此時遊戲選擇應服務:
77. 解構效益的最終定義
因此「這款遊戲值不值得研究」不能只看:
- 好不好玩;
- 有沒有名;
- 售價;
- AI 是否知名。
而應看:
相對於:
78. 命題一:購買成本次級命題
對系統性遊戲解構:
因此遊戲價格不能單獨決定研究優先級。
79. 命題二:難度—複雜度非同一命題
解構難度還取決於 opacity、state accessibility、reproducibility、version entropy、time-to-trigger 與 tooling friction。
80. 命題三:邊際資訊收益命題
遊戲研究價值依賴當前知識庫:
因此同一款遊戲在不同研究階段具有不同優先級。
81. 命題四:多保真解構命題
大規模 corpus 不應要求:
而應使用:
大量低深度篩選、少量高深度驗證。
82. 命題五:停止是研究能力的一部分
真正成熟的研究系統必須知道:
若邊際增益低於成本:
停止或暫停是合理結果。
83. 命題六:Portfolio 優於單點排名
研究資源配置應優化:
而不是永遠選單一最高分遊戲。
多樣性、覆蓋與冗餘都必須納入。
84. 命題七:成熟解構將從 Game Selection 轉向 Experiment Selection
當遊戲庫足夠大後:
不再是最小決策單位。
而是:
85. 最小實作 Schema
未來研究矩陣可以為每款遊戲加入:
research_economics:
acquisition_cost:
setup_cost:
estimated_play_hours:
time_to_trigger:
observability:
state_accessibility:
reproducibility:
version_entropy:
tooling_friction:
current_depth:
next_depth_cost:
expected_information_gain:
direct_project_relevance:
generalization_value:
reconstruction_potential:
coverage_gain:
novelty_gain:
redundancy_score:
priority_score:
stop_reason:
revisit_trigger:
86. Revisit Trigger
被停止的遊戲不代表永久封存。
可設定:
new patch
new source release
new mod API
new research question
new reconstruction need
new AI capability
new cheaper tool
觸發:
87. AI 能讓 Research Economics 自己學習
一開始優先函數權重:
由人類設定。
做完:
個研究後,可以觀察:
- 預估成本 vs 實際成本;
- 預估資訊增益 vs 實際增益;
- 哪些遊戲最容易產生通用算法;
- 哪些類型常被高估。
然後更新:
所以研究排程器本身也可以學習。
88. Meta-Deconstruction
這會產生一個有趣結果:
我們不只解構遊戲。
還會解構:
也就是研究自己的:
- 成本;
- 失敗;
- 預測誤差;
- 工具效果;
- 模型分工。
因此:
本身成為可優化對象。
89. 與下一篇的連接
第 04 篇回答:
應該研究哪些遊戲群?
第 05 篇回答:
在有限資源下,哪些遊戲值得研究到多深?
下一個問題則更接近最早的直覺:
為什麼看完教科書、程式碼與 Wiki,仍然常常沒有真正得到商業遊戲 AI 的工程能力?
答案很可能不是缺少 FSM、BT、A* 或 Utility AI 的定義。
而是缺少:
因此下一篇正式進入:
06|商業遊戲 AI 的隱藏層:真正稀缺的是組合,而非基礎演算法
90. 結論
大規模遊戲智能考古不是:
有錢就把 Steam 買一遍。
真正的問題是:
遊戲只是研究載體。
真正要購買的是:
- 存取;
- 時間;
- 可觀測性;
- 實驗;
- 算力;
- 驗證;
- 重建;
- 人類判斷。
因此:
而不是:
成熟的解構系統必須能回答:
下一個最值得花一小時、一百萬 token、一次人工覆核或一次高保真重建的是什麼?
其核心可以濃縮成:
但隨研究成熟,這又會從遊戲級選擇進一步細化成:
所以「遊戲解構經濟學」最終不是遊戲購買指南。
它是一套讓 AI 與人類在有限資源下,持續決定:
的方法論。
參考資料
Astorga, N., Liu, T., Seedat, N., & van der Schaar, M. (2024). Active Learning with LLMs for Partially Observed and Cost-Aware Scenarios. NeurIPS 2024.
https://proceedings.neurips.cc/paper_files/paper/2024/hash/24f3041067ab24157912330344dc3bbd-Abstract-Conference.htmlKim, Y.-Y., Song, K., Jang, J. H., & Moon, I.-c. (2021). LADA: Look-Ahead Data Acquisition via Augmentation for Deep Active Learning. NeurIPS 2021.
https://proceedings.neurips.cc/paper/2021/hash/c1b70d965ca504aa751ddb62ad69c63f-Abstract.htmlYang, L., & Carbonell, J. (2013). Buy-in-Bulk Active Learning. NeurIPS 2013.
https://proceedings.neurips.cc/paper/2013/hash/43baa6762fa81bb43b39c62553b2970d-Abstract.htmlHernandez-Garcia, A., Saxena, N., Jain, M., Liu, C.-H., & Bengio, Y. (2023). Multi-Fidelity Active Learning with GFlowNets.
https://arxiv.org/abs/2306.11715Li, S., Phillips, J. M., Yu, X., Kirby, R. M., & Zhe, S. (2022). Batch Multi-Fidelity Active Learning with Budget Constraints.
https://arxiv.org/abs/2210.12704Anwar, A. et al. (2025). Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection. CoRL 2025.
https://openreview.net/forum?id=pJ5FONkM9NLin, H., Wang, Z., Ma, J., & Liang, Y. (2023). MCU: A Task-centric Framework for Open-ended Agent Evaluation in Minecraft.
https://openreview.net/forum?id=fDJydDFcDvZheng, X. et al. (2025). Towards Evaluating Generalist Agents: An Automated Benchmark in Open World. ICLR 2025 submission / OpenReview.
https://openreview.net/forum?id=IWC6zUEVcLCollins, K. M. et al. (2026). Evaluating Language Models' Evaluations of Games. ICLR 2026.
https://openreview.net/forum?id=kefUcn22mk
系列導航
- 01|AI 時代的資料資產:從「賣資料」到授權可計算知識
- 02|高品質資料之後:從 Quality Paradigm 到 Novelty Paradigm
- 03|遊戲不是內容資料:遊戲作為可執行因果世界
- 04|商業遊戲智能考古:從 AI 名作到普通遊戲群
- 05|遊戲解構經濟學:成本、難度、資訊增益與研究深度
- 06|商業遊戲 AI 的隱藏層:真正稀缺的是組合,而非基礎演算法
- 07|餵資料不等於學習:從 Raw Exposure 到深層解構學習
- 08|理解的工程驗收:如果真的懂,就重建給我看
- 09|合成資料之後:從模仿既有設計到探索新穎可執行設計空間
- 10|慣老闆測試:意圖重建、設計生成與可執行世界考古