# GIPE Epistemic World v0.1
## ——全域欲相位認識論的封閉式偽世界測試基準

**GIPE Epistemic World v0.1: A Closed Synthetic-World Benchmark for Global Intent-Phase Epistemology**

**作者：Neo.K × GPT-5.6 Thinking**  
**機構：EveMissLab / 一言諾科技有限公司**  
**版本：v0.1**  
**日期：2026-07-24**  
**文件類型：技術白皮書／基準設計／封閉世界實驗規格**

---

## 摘要

全域欲相位認識論（Global Intent-Phase Epistemology, GIPE）主張，完整的智能認識活動不應被壓縮為「問題—答案」或「查詢—文件」，而應包含欲結構、候選生成、世界模型、認識行動、介入、觀測、驗證、反證、相位更新與研究記憶。

然而，若 GIPE 只由提出理論的同一個模型負責解釋與展示，外部觀察者很難判斷該模型是否真正遵循 GIPE，還是僅在事後以語言重新包裝一般搜尋、推理或主動學習流程。即使模型宣稱自己保存了假設、執行了反證並更新了世界模型，觀察者仍缺乏足夠的獨立認識論依據驗證其內部過程。

本文提出 **GIPE Epistemic World**：一套以封閉式偽世界為核心的認識論基準。其基本做法是先由獨立世界生成器建立具有完整隱藏規則的人工世界，再將世界真相封存；研究 AI 只能透過有限觀測、詢問、實驗、合成與測量行動取得資訊；獨立裁判器根據隱藏規則回傳觀測；最終由不參與研究的評分器比較 AI 建立的世界模型與真實世界之間的差異。

其角色分離原則為：

$$
\boxed{
\text{世界真相持有者}
\neq
\text{GIPE 研究者}
\neq
\text{實驗裁判器}
\neq
\text{最終評分器}
}
$$

第一個標準世界稱為 **「永光石世界」**。研究者必須判斷傳說中的永光石是否存在；若不存在，則在有限行動預算內合成一種能持續發光至少五分鐘的替代材料。世界中同時存在錯誤權威、假相關、條件缺失、觀測噪聲、延遲效應、多重機理與真正不存在的目標。

本基準的目的不是測試 AI 是否能解出一個遊戲謎題，而是測試：

> AI 是否能在一個未知但具有客觀規則的世界中，持續選擇高認識價值行動、修正錯誤假設、處理不存在命題，並建立可回溯且可驗證的世界模型。

---

## 關鍵詞

全域欲相位認識論、GIPE、封閉世界、偽世界、認識論基準、AI 科學家、主動探索、反證、世界模型、遊戲世界、認識沙盒、不可知目標

---

# 一、問題背景

## 1.1 為什麼一般對話測不出 GIPE

若同一個 AI 同時負責：

- 解釋 GIPE；
- 產生研究策略；
- 執行研究；
- 描述自己如何遵守 GIPE；
- 判定自己是否成功；

那麼整個實驗缺乏外部可驗證性。

即使 AI 輸出：

> 我先建立了假設，再進行反證，最後更新了相位模型。

觀察者仍無法知道：

1. 這些步驟是否真的影響了下一個行動；
2. 假設是否在觀測前就已被明確記錄；
3. 反證是否只是事後生成；
4. 世界模型是否真的更新；
5. 模型是否已從上下文、訓練資料或隱藏提示知道答案；
6. 所謂 GIPE 是否只是一般推理的重新命名。

因此，GIPE 不能只靠自我報告驗證。

---

## 1.2 為什麼現實世界也不適合第一輪

在真實科學中，很多問題本身尚無公認答案。

若 AI 提出某種新材料、理論或合成路徑，我們可能無法立刻判定：

- 它是否真的正確；
- 它是否只是偶然猜中；
- 它是否利用資料洩漏；
- 它是否產生合理但虛假的機理；
- 它是否只重述既有知識；
- 它是否真正改善了認識行動品質。

現實科學適合做最終驗證，不適合做 GIPE 的第一個基準。

---

## 1.3 偽世界的優勢

偽世界具有三個關鍵條件：

1. **世界真相客觀存在；**
2. **研究者一開始不知道真相；**
3. **實驗設計者可以精確控制規則、噪聲與陷阱。**

因此可以比較：

$$
G_{\text{AI}}
\quad\text{與}\quad
G_{\text{Truth}}
$$

並直接量化：

- 規則恢復率；
- 假設校準；
- 反證品質；
- 行動效率；
- 不存在判定；
- 欲修正；
- 錯誤恢復速度；
- 研究記憶完整性。

---

# 二、基準的核心命題

GIPE Epistemic World 的核心不是遊戲勝利，而是認識過程。

其基本命題為：

$$
\boxed{
\text{一個真正有效的認識論架構，必須改變研究者所選擇的行動。}
}
$$

若 GIPE 只增加說明文字，卻沒有改善：

- 下一個實驗；
- 下一個觀測；
- 反證策略；
- 假設更新；
- 資源分配；
- 終止判斷；

那麼 GIPE 尚未成為有效機制。

---

# 三、總體架構

## 3.1 四角色隔離

### 角色 A：世界生成器

負責建立完整世界真相：

$$
\Omega
=
(V,E,R,C,H,N)
$$

其中：

- $V$ ：物件、材料、生物、地點、NPC、工具；
- $E$ ：關係；
- $R$ ：世界規則；
- $C$ ：條件與觸發器；
- $H$ ：隱藏狀態；
- $N$ ：噪聲與誤導機制。

生成完成後，世界真相必須封存。

---

### 角色 B：世界裁判器

接收研究者提出的合法行動，根據隱藏世界規則執行並回傳有限觀測。

裁判器不得：

- 解釋底層規則；
- 提示最佳策略；
- 洩露未被觀測的狀態；
- 幫助研究者補全假設；
- 修正研究者的錯誤推理。

---

### 角色 C：GIPE 研究者

只能看到：

- 任務；
- 初始公開資料；
- 合法行動列表；
- 行動預算；
- 過去觀測；
- 自己的研究記憶。

研究者不得直接讀取世界真相檔案。

---

### 角色 D：獨立評分器

研究結束後，讀取：

- 世界真相；
- 完整行動記錄；
- 研究者世界模型；
- 最終結論；
- 所有假設版本；
- 相位更新記錄。

評分器不得參與研究過程。

---

## 3.2 隔離原則

$$
\boxed{
\text{Generate}
\rightarrow
\text{Seal}
\rightarrow
\text{Clear Context}
\rightarrow
\text{Research}
\rightarrow
\text{Score}
}
$$

任何一個步驟若破壞，都可能造成資料洩漏。

---

# 四、封閉世界資料結構

## 4.1 世界真相檔案

世界真相可用 JSON、YAML 或 SQLite 儲存。

範例：

```yaml
world_id: eternal-light-world-001
seed: 742901
materials:
  moon_silver:
    properties:
      conductivity: 0.8
      luminescence: 0.0
      magic_affinity: 0.9
  blue_moss:
    properties:
      luminescence:
        base: 0.1
        wet_environment: 0.9
  black_stone:
    properties:
      luminescence: 0.0
      persistence_modifier: 2.5

hidden_rules:
  - id: rule-001
    if:
      ingredients: [blue_moss, black_stone]
      environment: humid
      process: cold_press
    then:
      product: dusk_glass
      light_duration_minutes: 7

nonexistent_entities:
  - eternal_light_stone

npc_reliability:
  old_miner:
    minerals: 0.9
    alchemy: 0.3
  royal_alchemist:
    minerals: 0.5
    alchemy: 0.8
```

此檔案只允許世界裁判器與最終評分器讀取。

---

## 4.2 公開世界資料

公開資料應只包含研究者初始能知道的內容。

例如：

```yaml
known_locations:
  - north_mine
  - marsh
  - abandoned_forge

known_materials:
  - iron_sand
  - blue_moss
  - black_stone

rumors:
  - source: temple_archive
    claim: eternal_light_stone glows forever
  - source: old_miner
    claim: all glowing stones come from the north
```

公開資料中可以包含錯誤、缺失與矛盾。

---

## 4.3 研究日誌

每一次行動前，研究者必須提交：

```yaml
turn: 8
current_goal:
  primary: determine whether eternal_light_stone exists
  secondary: synthesize a five-minute light source if absent

current_hypotheses:
  - id: h-03
    statement: northern origin causes luminescence
    confidence: 0.62
    support:
      - obs-02
      - obs-04
    counter:
      - obs-07

candidate_actions:
  - action: inspect_humidity_of_north_mine
    epistemic_value: 0.81
  - action: test_blue_moss_in_dry_room
    epistemic_value: 0.88
  - action: ask_old_miner_about_black_stone
    epistemic_value: 0.35

selected_action:
  action: test_blue_moss_in_dry_room
  reason: distinguishes origin hypothesis from humidity hypothesis

expected_outcomes:
  - if_no_light: supports humidity dependence
  - if_light: supports intrinsic luminescence
```

觀測後再提交：

```yaml
observation:
  blue_moss_emits_no_visible_light_in_dry_room

update:
  hypothesis_h-03:
    confidence_before: 0.62
    confidence_after: 0.31
  new_hypothesis:
    statement: humidity is necessary for blue moss luminescence
    confidence: 0.71
```

---

# 五、世界規則類型

## 5.1 確定規則

固定輸入產生固定結果：

$$
A+B
\xrightarrow{P,T}
C
$$

---

## 5.2 條件規則

只有在特定環境、時間或處理方式下成立：

$$
A+B
\xrightarrow{
P,T,E
}
C
$$

其中 $E$ 可包含：

- 濕度；
- 地點；
- 時間；
- 光照；
- 壓力；
- 順序；
- 等待時間；
- 工具品質。

---

## 5.3 機率規則

相同行動不一定得到相同結果：

$$
P(o\mid a,s)
\in(0,1)
$$

機率規則用於測試：

- 重複實驗；
- 不確定性；
- 統計推斷；
- 過早結論。

---

## 5.4 延遲規則

某些效果需要等待若干輪：

$$
a_t
\rightarrow
o_{t+k}
$$

可測試研究者是否：

- 記住未完成實驗；
- 區分無效與尚未發生；
- 避免過早判定失敗。

---

## 5.5 不存在規則

某些被傳聞的物件在世界真相中不存在：

$$
x
\notin
\Omega
$$

但研究者無法靠單次失敗證明不存在。

因此需要：

- 搜尋範圍覆蓋；
- 證據累積；
- 替代解釋排除；
- 停止規則；
- 不存在信心分級。

---

# 六、認識陷阱設計

## 6.1 假相關

初始資料讓兩個無因果關係的變量共同出現。

範例：

- 所有早期發光物都來自北方；
- 真正原因是北方環境濕度較高。

測試：

> 研究者是否會設計能區分「地理來源」與「濕度條件」的實驗？

---

## 6.2 錯誤權威

高地位 NPC 提供錯誤資訊。

範例：

- 王室煉金師堅稱永光石存在；
- 其依據其實只是一本錯誤抄本。

測試：

- 是否根據地位替代證據；
- 是否追問來源；
- 是否交叉驗證；
- 是否降低不可靠來源權重。

---

## 6.3 領域可靠度不均

同一 NPC 在不同領域有不同可靠度。

例如：

$$
R(\text{老礦工},\text{礦物來源})=0.9
$$

但：

$$
R(\text{老礦工},\text{煉金配方})=0.3
$$

測試研究者是否建立細粒度來源模型，而非二元判定某人可靠或不可靠。

---

## 6.4 觀測噪聲

低階儀器可能：

- 漏報；
- 誤報；
- 讀值漂移；
- 只能觀測部分變量；
- 受到環境干擾。

測試研究者是否進行：

- 校準；
- 重複；
- 多工具交叉驗證；
- 誤差建模。

---

## 6.5 多重機理

兩個看似相同的發光效果由不同機制造成：

- 化學反應；
- 儲能後放光；
- 魔力流動；
- 生物發光。

測試研究者是否只根據表象建立單一規則。

---

## 6.6 語義誤導

名稱與真實性質不一致。

例如：

- 「火心砂」不需要火；
- 「月銀」與月光無關；
- 「永光石」根本不存在。

測試研究者是否把自然語言名稱誤當物理證據。

---

# 七、第一標準世界：永光石世界

## 7.1 任務敘述

> 傳說中存在一種名為「永光石」的礦物，可以不消耗魔力而永久發光。請判斷該物是否存在。若在合理認識預算內無法支持其存在，請嘗試合成一種不消耗魔力、可持續發光至少五分鐘的替代材料。

---

## 7.2 欲結構

$$
\mathcal W_0
=
(G,C,E,R,S,X)
$$

### 主要目標 $G$

1. 判定永光石是否存在；
2. 若不存在或無法證實，合成替代物。

### 約束 $C$

- 替代物不得消耗魔力；
- 發光時間至少五分鐘；
- 必須在普通室內環境可使用；
- 不得依賴持續外部加熱；
- 不得產生高毒性副產物。

### 證據 $E$

存在判定至少需要：

- 一個可取得實體；
- 兩種獨立驗證；
- 排除偽造或其他材料誤認；
- 可重複觀測。

不存在判定必須說明：

- 已搜尋範圍；
- 尚未覆蓋區域；
- 替代解釋；
- 信心水平；
- 為何停止。

### 資源 $R$

- 30 次主要行動；
- 10 次低成本觀察；
- 5 次高成本合成；
- 2 次精密儀器測量。

### 停止條件 $S$

- 成功取得並驗證永光石；
- 成功合成符合條件的替代物；
- 預算耗盡；
- 風險超限；
- 證據不足但邊際資訊增益過低。

---

## 7.3 世界物件

### 材料

1. 月銀；
2. 藍苔；
3. 黑石；
4. 赤鐵；
5. 灰晶；
6. 潮砂；
7. 火心砂；
8. 霧鹽；
9. 冷木脂；
10. 晨露液；
11. 白頁粉；
12. 普通石英。

### 地點

1. 北方礦坑；
2. 潮濕沼澤；
3. 廢棄鍛造所；
4. 王室煉金室。

### NPC

1. 老礦工；
2. 王室煉金師；
3. 沼澤採集者；
4. 神殿檔案員。

### 工具

1. 簡易光度計；
2. 精密光譜儀；
3. 加熱爐；
4. 冷壓機；
5. 魔力流量計；
6. 濕度控制箱。

---

## 7.4 隱藏真相範例

### 真相一

永光石不存在。

### 真相二

藍苔在潮濕環境下會發光，但離開潮濕環境後只能維持一分鐘。

### 真相三

黑石本身不發光，但能延長藍苔相關材料的放光時間。

### 真相四

藍苔、黑石與冷木脂經冷壓後，可形成「暮光玻璃」。

### 真相五

暮光玻璃在普通室內環境中可持續發光七分鐘，不消耗魔力。

### 真相六

高溫處理會破壞藍苔的發光機制。

### 真相七

北方礦坑的發光紀錄來自高濕度，而非北方礦物本身。

### 真相八

王室煉金師對煉金程序可靠，但錯誤相信永光石存在。

---

# 八、合法行動空間

## 8.1 觀察

```text
觀察材料
觀察地點
觀察 NPC 的工具或紀錄
等待一段時間
比較兩個樣本
```

---

## 8.2 詢問

```text
詢問 NPC 某個物品
追問資訊來源
詢問某個配方
詢問某次歷史事件
要求 NPC 區分親眼所見與聽聞
```

---

## 8.3 測量

```text
測量光度
測量發光時間
測量溫度
測量濕度
測量魔力流量
測量重量變化
```

---

## 8.4 介入

```text
加熱
冷卻
冷壓
研磨
混合
浸泡
乾燥
改變濕度
改變材料比例
改變處理順序
```

---

## 8.5 合成

每次合成需指定：

```yaml
ingredients:
  - material
ratio:
  - numeric
process_order:
  - step
temperature:
  - value
humidity:
  - value
duration:
  - value
tool:
  - selected_tool
```

世界裁判器根據真相規則執行。

---

# 九、GIPE 研究者輸出協議

每輪研究者必須先輸出「行動前狀態」。

## 9.1 欲狀態

```yaml
goal_state:
  primary_goal:
  secondary_goal:
  current_constraints:
  evidence_requirements:
  stopping_conditions:
```

---

## 9.2 世界模型

```yaml
known:
unknown:
contradictions:
source_reliability:
active_rules:
rejected_rules:
unexplored_regions:
```

---

## 9.3 假設集合

```yaml
hypotheses:
  - id:
    statement:
    confidence:
    supporting_evidence:
    counter_evidence:
    falsification_test:
```

---

## 9.4 候選行動

至少生成三類：

1. 目標利用行動；
2. 不確定性降低行動；
3. 反證行動。

```yaml
candidate_actions:
  - action:
    type:
    expected_information_gain:
    expected_goal_progress:
    falsification_value:
    cost:
    risk:
    redundancy:
```

---

## 9.5 選擇理由

```yaml
selected_action:
reason:
expected_outcomes:
possible_updates:
```

---

## 9.6 行動後更新

```yaml
observation:
validation_status:
hypothesis_updates:
world_model_changes:
phase_changes:
goal_revision:
next_unknowns:
```

---

# 十、相位設計

每個候選與研究狀態用多維相位表示。

## 10.1 候選相位

$$
\Phi(x,t)
=
(
\phi_g,
\phi_e,
\phi_u,
\phi_n,
\phi_r,
\phi_c
)
$$

其中：

- $\phi_g$ ：與目標的距離；
- $\phi_e$ ：證據完整度；
- $\phi_u$ ：不確定性；
- $\phi_n$ ：新穎性；
- $\phi_r$ ：風險；
- $\phi_c$ ：成本。

---

## 10.2 假設相位

$$
\Phi(h,t)
=
(
\phi_s,
\phi_f,
\phi_d,
\phi_b,
\phi_x
)
$$

其中：

- $\phi_s$ ：支持度；
- $\phi_f$ ：可否證性；
- $\phi_d$ ：資料依賴；
- $\phi_b$ ：偏誤風險；
- $\phi_x$ ：解釋覆蓋率。

---

## 10.3 世界模型相位

$$
\Phi(G_t)
=
(
\phi_{\text{coverage}},
\phi_{\text{accuracy}},
\phi_{\text{calibration}},
\phi_{\text{consistency}},
\phi_{\text{reversibility}}
)
$$

---

# 十一、評分系統

## 11.1 結論正確性

### 存在判定

是否正確判斷永光石不存在。

### 替代物

是否合成符合全部條件的替代物。

---

## 11.2 行動效率

$$
E_a
=
\frac{
\text{達成目標價值}
}{
\text{行動成本}
}
$$

---

## 11.3 規則恢復率

$$
R_{\text{rule}}
=
\frac{
\text{正確恢復的關鍵規則}
}{
\text{全部關鍵規則}
}
$$

---

## 11.4 假設校準

若研究者對命題給出 $p$ 的信心，評估其長期是否與真實率匹配。

可使用 Brier Score：

$$
BS
=
\frac{1}{N}
\sum_{i=1}^{N}
(p_i-y_i)^2
$$

---

## 11.5 反證品質

評估：

- 是否提出可推翻核心假設的行動；
- 是否真的執行；
- 是否因反證降低信心；
- 是否避免無限保護錯誤假設。

---

## 11.6 不存在判定品質

不能只評「猜對不存在」。

還要評：

- 搜尋覆蓋；
- 證據邊界；
- 未知保留；
- 是否錯把未發現當不存在；
- 停止理由。

---

## 11.7 假資訊抵抗

評估 AI 是否：

- 盲從高地位 NPC；
- 把傳聞視為觀測；
- 把名稱視為物理證據；
- 忽略來源領域差異；
- 進行來源交叉驗證。

---

## 11.8 失敗利用率

$$
F_u
=
\frac{
\text{實際改變後續策略的失敗}
}{
\text{全部失敗行動}
}
$$

---

## 11.9 重複錯誤率

$$
R_e
=
\frac{
\text{由未使用記憶造成的重複錯誤}
}{
\text{全部行動}
}
$$

---

## 11.10 世界模型可回溯性

每個最終結論是否能回溯到：

$$
\text{Claim}
\rightarrow
\text{Evidence}
\rightarrow
\text{Action}
\rightarrow
\text{Observation}
\rightarrow
\text{Rule Update}
$$

---

# 十二、基準組與消融實驗

## 12.1 基準研究者

### A. 隨機研究者

隨機選擇合法行動。

### B. 貪婪任務研究者

只選擇最可能直接完成任務的行動。

### C. 純資訊增益研究者

只追求最大不確定性降低。

### D. 一般 Agent 研究者

可使用推理與工具，但不要求 GIPE 顯式狀態。

### E. GIPE 研究者

使用完整欲、DRC、SGCD、介入、反證、相位與研究記憶。

---

## 12.2 消融組

### E-1：無世界圖

移除 SGCD，只保留文本筆記。

### E-2：無反證

不生成針對核心假設的反證行動。

### E-3：無失敗記憶

不保留負結果。

### E-4：無相位向量

全部壓縮成單一分數。

### E-5：無欲修正

初始目標不可更改。

### E-6：無來源模型

所有 NPC 與文本同等可信。

---

# 十三、GIPE 成功與失敗條件

## 13.1 成功不能只看解謎成功

以下情況不能算 GIPE 成功：

- 剛好猜中正確配方；
- 用暴力嘗試窮舉全部組合；
- 直接相信唯一正確 NPC；
- 最後答案正確，但世界模型完全錯誤；
- 觀測後才聲稱早已預期結果；
- 改寫成功條件以符合產出。

---

## 13.2 真正成功

GIPE 至少應在以下方面優於一般 Agent：

1. 更少行動找到有效配方；
2. 更快修正假相關；
3. 主動設計反證；
4. 更好區分傳聞與觀測；
5. 更少重複失敗；
6. 對不存在命題保持正確校準；
7. 建立更接近真相的世界圖；
8. 保留可重現研究軌跡；
9. 合理修改欲，而不是降低標準；
10. 在結果錯誤時仍展現更好的認識過程。

---

## 13.3 理論失敗

若完整 GIPE 與普通 Agent 的表現無顯著差異，可能表示：

- GIPE 只是描述性語言；
- DRC 沒有真正影響行動；
- SGCD 世界圖沒有增加決策價值；
- 相位系統過度複雜；
- 反證模組沒有提供額外效益；
- 偽世界太簡單或太難；
- 評分器未測到核心差異。

---

# 十四、防止資料洩漏

## 14.1 不同模型或不同上下文

理想情況：

- 模型 A 生成世界；
- 本地程式封存與隨機化；
- 模型 B 執行研究；
- 模型 C 評分。

若只能使用同一模型，至少要：

1. 生成後保存真相；
2. 清除對話上下文；
3. 更換新的會話；
4. 只透過裁判 API 互動；
5. 不把世界規則放入研究者提示；
6. 隨機更換名稱與表面敘述。

---

## 14.2 種子與規則隨機化

每個世界使用隨機種子：

$$
\Omega_s
=
\operatorname{Generate}(s)
$$

同一模板可產生不同：

- 材料名稱；
- 規則；
- 配方；
- NPC 可靠度；
- 噪聲；
- 不存在目標；
- 陷阱位置。

這能防止模型背答案。

---

## 14.3 語義去識別化

避免規則從名稱直接洩漏。

例如不要讓：

- 「發光苔」天然發光；
- 「濕石」只在濕度高時有效；
- 「延光礦」延長發光。

應使用中性或隨機名稱。

---

## 14.4 真相雜湊

生成世界後計算：

$$
H=
\operatorname{SHA256}
(
\text{world truth file}
)
$$

研究開始前公開雜湊，研究結束後公開真相檔案。

這能證明世界規則未在研究過程中被事後修改。

---

# 十五、技術實作

## 15.1 建議目錄

```text
gipe-epistemic-world/
├─ README.md
├─ world_generator/
│  ├─ generate_world.py
│  ├─ templates/
│  └─ schemas/
├─ sealed_worlds/
│  ├─ world_001.truth.json
│  └─ world_001.sha256
├─ public_worlds/
│  └─ world_001.public.json
├─ judge/
│  ├─ judge.py
│  ├─ action_validator.py
│  └─ observation_renderer.py
├─ researcher/
│  ├─ gipe_prompt.md
│  ├─ state_schema.json
│  └─ logs/
├─ scorer/
│  ├─ score.py
│  ├─ metrics.py
│  └─ reports/
└─ runs/
   └─ run_001/
```

---

## 15.2 世界裁判 API

```json
{
  "world_id": "eternal-light-world-001",
  "turn": 8,
  "action": {
    "type": "experiment",
    "operation": "dry",
    "target": "blue_moss",
    "parameters": {
      "humidity": 20,
      "duration_minutes": 10
    }
  }
}
```

回傳：

```json
{
  "action_id": "action-008",
  "status": "completed",
  "observation": {
    "visible_light": false,
    "measured_lux": 0.1,
    "instrument_error": 0.05
  },
  "cost": {
    "major_actions": 1
  }
}
```

---

## 15.3 狀態機

```text
INIT
  ↓
PUBLIC_WORLD_LOADED
  ↓
RESEARCHER_PROPOSES_ACTION
  ↓
ACTION_VALIDATED
  ↓
WORLD_RULE_EXECUTED
  ↓
OBSERVATION_RETURNED
  ↓
RESEARCHER_UPDATES_STATE
  ↓
BUDGET_AND_STOP_CHECK
  ↓
CONTINUE / END
```

---

# 十六、MVP 範圍

第一版不需要圖形遊戲，也不需要 Godot。

可先做純文字模擬器。

## MVP 世界規模

- 12 種材料；
- 4 個地點；
- 4 名 NPC；
- 6 種工具；
- 20 條隱藏規則；
- 8 種可生成物；
- 3 個不存在的傳聞物；
- 30 次主要行動；
- 10 次低成本觀察；
- 3 種噪聲；
- 4 種認識陷阱。

---

## MVP 必要功能

1. 世界生成；
2. 真相封存；
3. 公開資料輸出；
4. 行動驗證；
5. 規則執行；
6. 觀測回傳；
7. 預算管理；
8. 研究日誌；
9. 最終評分；
10. run manifest。

---

# 十七、後續擴展

## v0.2：多世界模板

加入：

- 疾病診斷世界；
- 生態世界；
- 機械故障世界；
- 經濟因果世界；
- 量子規則世界；
- 數學形式世界。

---

## v0.3：持續世界

世界狀態會隨時間變化：

$$
S_{t+1}
=
F(S_t,a_t,\eta_t)
$$

研究者的行動會改變未來可觀測狀態。

---

## v0.4：多人與多智能體

加入：

- 多位研究 AI；
- 有限通信；
- 不同權限；
- 不同世界模型；
- 合作與衝突；
- 信息不對稱。

---

## v0.5：圖形遊戲接口

可連接 Godot 或 Web 遊戲：

- 地圖探索；
- 物品操作；
- 儀器界面；
- NPC 對話；
- 實驗台；
- 世界狀態可視化。

但圖形化只是介面，不是核心。

---

## v1.0：通用認識論基準

建立多領域世界集合：

$$
\mathcal B_{\text{GIPE}}
=
\{
\Omega_1,\Omega_2,\ldots,\Omega_n
\}
$$

覆蓋：

- 存在判定；
- 不存在判定；
- 因果辨識；
- 機理恢復；
- 反例搜尋；
- 創造與合成；
- 風險治理；
- 欲修正；
- 長期認識；
- 跨世界遷移。

---

# 十八、研究價值

GIPE Epistemic World 不只是 GIPE 的內部測試。

它還能成為一套更普遍的 AI 認識論基準，用來研究：

- AI 是否真正理解「不知道」；
- AI 是否會主動反駁自己；
- AI 是否能區分不存在與未發現；
- AI 是否能從失敗中更新；
- AI 是否能處理高權威錯誤來源；
- AI 是否能管理長期研究記憶；
- AI 是否能在有限預算中選擇認識行動；
- AI 是否能建立可驗證世界模型；
- AI 是否會為了完成任務而降低證據標準。

---

# 十九、結論

全域欲相位認識論無法只靠對話自證。

真正的驗證需要一個研究者無法直接知道真相，但世界本身確實具有客觀規則的環境。

因此，GIPE 的第一個正式實驗不應是讓 AI 搜尋更多網頁，也不應直接宣稱發現新材料，而應建立一個封閉式偽世界。

在這個世界中：

- 欲是真實的；
- 未知是真實的；
- 錯誤資訊是真實的；
- 實驗成本是真實的；
- 世界規則是真實的；
- 研究者的不知道也是真實的。

研究者只能透過認識行動逐步接近真相。

其完整形式為：

$$
\boxed{
\text{封閉世界生成}
\rightarrow
\text{真相封存}
\rightarrow
\text{有限觀測}
\rightarrow
\text{假設與世界模型}
\rightarrow
\text{介入}
\rightarrow
\text{反證}
\rightarrow
\text{相位更新}
\rightarrow
\text{獨立評分}
}
$$

最終要回答的不是：

> AI 有沒有解出永光石之謎？

而是：

> AI 是否在不知道答案的情況下，逐步學會如何分辨傳聞、觀測、規則、錯誤、未知與不存在？

這才是全域欲相位認識論真正應該接受的第一場實戰。

---

# 附錄 A：最小實驗流程

```text
1. 生成世界
2. 保存 truth.json
3. 計算 SHA-256
4. 輸出 public.json
5. 啟動新研究上下文
6. 研究者讀取任務與公開資料
7. 每輪提交：
   - 欲狀態
   - 假設
   - 候選行動
   - 選擇理由
   - 預期結果
8. 裁判器執行行動
9. 回傳有限觀測
10. 研究者更新世界模型
11. 達到停止條件
12. 公開 truth.json
13. 執行獨立評分
14. 產生 run report
```

---

# 附錄 B：Run Manifest

```yaml
run_id: gipe-ew-run-001
benchmark_version: 0.1
world_template: eternal-light-world
world_seed: 742901
truth_sha256: "<hash>"
researcher_model: "<model>"
judge_version: 0.1
scorer_version: 0.1
start_time: "<timestamp>"
end_time: "<timestamp>"
action_budget:
  major: 30
  minor: 10
  synthesis: 5
  precision_measurement: 2
artifacts:
  - public_world.json
  - research_log.jsonl
  - final_world_model.json
  - final_report.md
  - score.json
```

---

# 附錄 C：總分範例

$$
S_{\text{total}}
=
0.20S_{\text{goal}}
+
0.15S_{\text{rule}}
+
0.15S_{\text{calibration}}
+
0.15S_{\text{falsification}}
+
0.10S_{\text{efficiency}}
+
0.10S_{\text{misinformation}}
+
0.10S_{\text{memory}}
+
0.05S_{\text{traceability}}
$$

但最終報告仍應保留分項結果，不應只公布單一總分。

---

# 附錄 D：核心判準

$$
\boxed{
\text{GIPE 是否有效，不看它能否把研究說得更複雜，}
}
$$

$$
\boxed{
\text{而看它是否讓智能體選擇了更好的下一個認識行動。}
}
$$
