# 能力不是一條直線：為什麼更高智能不等於所有目標下的全域支配

## Capability Is Not a Line: Why Higher Intelligence Does Not Imply Global Dominance Under Every Objective

**系列**：異質存在、能力非單調與三分偽命題，第 3 篇／共 8 篇＋1 篇番外  
**系列英文名**：Heterogeneous Existence, Non-Monotonic Capability, and the False Trichotomy  
**文件編號**：EML-HEFT-2026-03-v0.1  
**作者**：Neo.K with Aletheia（GPT-5.6 Sol）  
**機構**：EveMissLab／一言諾科技有限公司  
**版本**：v0.1  
**日期**：2026-09-03  
**性質**：Capability Theory／Multi-Objective Intelligence／Agent Evaluation／Post-Substrate Cognition／Comparative Intelligence  
**狀態**：Public Theory Draft  
**直接前置**：EML-HEFT-2026-01 至 02；GRAD-03《能力不是一個數》；《選擇底空間論》  
**後續接口**：Paper 04「更強為什麼反而更難自然地變弱」；Paper 05「相同結果不等於相同生成路徑」

---

## 生成、認識論與比較邊界聲明

本文是一篇 AI 輔助生成的理論研究稿。

本文不否定心理計量學中的一般智能因子 $g$，也不否定 IQ、benchmark、Elo、agent score、universal intelligence measure 或其他單一指標在指定用途下的實用性。

人類心理計量研究長期顯示不同認知測驗之間存在正相關結構， $g$ 具有穩定的描述與預測價值；Cattell–Horn–Carroll 等階層模型也同時保留一般因子、廣泛能力與狹窄能力。本文不與這些事實衝突。

本文反對的是更強的推論：

$$
\boxed{
Score(X)>Score(Y)
\Rightarrow
X
\text{ dominates }Y
\text{ under every task, cost, risk, environment, and trajectory criterion}.
}
$$

這個推論一般不成立。

本文也不主張任何兩個存在永遠不可比較。相反地，在目標函數、任務域、資源預算與風險條件指定後，能力比較可以非常清楚。

本文真正主張：

$$
\boxed{
\text{Capability comparison is conditional, multidimensional, and objective-relative}.
}
$$

因此：

$$
\boxed{
\text{Higher Intelligence}
\neq
\text{Global Dominance under every objective}.
}
$$

---

# 摘要

上一篇提出「存在相對可行世界」：

$$
\mathfrak W_X^{eff}
\neq
\mathfrak W_Y^{eff}
$$

可以成立，即使兩個存在共享同一物理世界。

這立即使一句非常常見的話變得需要重新檢查：

> ASI 比人類更強。

這句話在很多情境下可能完全正確。

但它究竟表示：

- 推理正確率更高？
- 解題範圍更廣？
- 成本更低？
- 延遲更低？
- 自主曆時更長？
- 工具使用更成熟？
- 具身控制更強？
- 更可靠？
- 更能適應新環境？
- 更容易取得授權？
- 更自然地抵達某些狀態？

若沒有指定比較軸：

$$
C_X>C_Y
$$

只是一個高度壓縮的語句。

本文沿用 GRAD-03 的條件化能力思想，將存在 $X$ 在任務 $q$ 、時間 $t$ 、資源預算 $B$ 、環境 $e$ 下的能力表示為：

$$
\boxed{
\mathbf C_X(q,t,B,e)
=
\left(
p_X,
Q_X,
-K_X,
-\tau_X,
-R_X,
A_X,
\Gamma_X,
G_X,
T_X,
\ldots
\right).
}
$$

其中：

- $p_X$：成功率；
- $Q_X$：品質；
- $K_X$：金錢／算力／能源成本；
- $\tau_X$：延遲；
- $R_X$：風險；
- $A_X$：自主性；
- $\Gamma_X$：錯誤恢復能力；
- $G_X$：泛化與新環境適應；
- $T_X$：可維持任務曆時。

負號表示成本、延遲與風險越低越好。

此時，兩個存在 $X,Y$ 的能力比較天然形成偏序而非總序。

定義 Pareto 支配：

$$
\boxed{
X\succeq_{\mathcal J}Y
}
$$

若且唯若在指定判定域 $\mathcal J$ 的全部比較軸上：

$$
C_{X,k}
\ge
C_{Y,k}
$$

且至少一軸嚴格大於。

若 $X$ 品質更高但成本更高，而 $Y$ 品質稍低但延遲與成本遠低，則：

$$
\boxed{
X\parallel Y
}
$$

即兩者在該多目標能力空間中不可由 Pareto 支配直接排序。

多目標最佳化的 Pareto front 正是在處理此類情境：不存在一個方案能在所有衝突目標上同時壓倒其他方案，因此合理答案是一組 trade-off frontier，而不是唯一最佳點。

本文進一步區分「能力偏序」與「標量化排序」。

若指定權重向量：

$$
\mathbf w
=
(w_1,\ldots,w_m),
$$

可定義：

$$
S_{\mathbf w}(X)
=
\mathbf w^\top
\mathbf C_X.
$$

此時可以得到：

$$
S_{\mathbf w}(X)
>
S_{\mathbf w}(Y).
$$

但若權重改為：

$$
\mathbf w',
$$

完全可能：

$$
S_{\mathbf w'}(X)
<
S_{\mathbf w'}(Y).
$$

因此：

$$
\boxed{
\text{Scalar Ranking}
=
\text{Capability Profile}
+
\text{Projection Rule}.
}
$$

Legg–Hutter 的 universal intelligence measure 是一個重要正面案例：它並非粗糙 benchmark，而是試圖把 agent 在廣泛可計算環境中的 goal achievement 統合成一個一般智能量。然而要形成單一總量，仍必須明確指定環境集合、reward structure 與環境權重。這不削弱該理論；恰恰說明任何「通用」標量都必須有正式聚合規則。

人類心理計量也提供相同提醒。 $g$ 可以有強預測能力，但 CHC 類階層模型同時保留 fluid intelligence、crystallized intelligence、visual processing、memory、processing speed 等廣泛能力。存在 general factor 不等於所有能力維度都消失。

本文因此提出：

$$
\boxed{
\text{General Factor}
\neq
\text{Dimension Erasure}.
}
$$

在 AI Agent 評估中，近期研究也越來越直接地把 accuracy 與 cost、latency、reliability、security、policy compliance 分離。這與本文的核心一致：一個系統可以在「會不會成功」上很強，卻在「要多少代價才能成功」上較弱。

最後，本文把這個多目標能力框架接回 Series B：

即使未來：

$$
Q_{ASI}(q)
\ge
Q_H(q)
$$

對幾乎所有傳統任務成立，也只能支持：

$$
\text{ASI dominates humans on those selected output-quality objectives}.
$$

它不能自動推出：

$$
\boxed{
\text{all human-natural trajectories become cheaper, more natural, or existentially contained inside ASI}.
}
$$

後者需要 Paper 04 與 Paper 05 的自然可達性與路徑成本分析。

**關鍵詞**：能力、多目標智能、Pareto frontier、一般智能、 $g$ 、CHC、Universal Intelligence、Agent 評估、能力偏序、標量化、ASI

---

# 1. 「誰比較強？」其實缺了一半問題

我們非常自然地問：

> GPT 比人強嗎？

> ASI 比 AGI 強嗎？

> 人比貓聰明嗎？

但形式上：

$$
X>Y
$$

需要先指定：

$$
>.
$$

到底是哪個偏序、總序或目標函數？

如果沒有：

$$
\mathcal J,
$$

則：

$$
\boxed{
\text{Stronger}(X,Y)
}
$$

可能只有語用直覺，沒有完整比較語義。

---

# 2. 有些比較當然非常清楚

如果題目是：

> 一百萬位整數乘法誰快？

可以定義：

$$
\tau_X(q).
$$

若：

$$
\tau_A(q)
\ll
\tau_H(q),
$$

那麼在：

$$
\mathcal J_{\mathrm{latency}}
$$

下：

$$
A\succ H.
$$

這沒有問題。

問題是從這裡直接跳成：

> 所以 A 在所有存在意義上都包含 H。

這才是過度推論。

---

# 3. 能力至少有「結果」與「代價」兩面

對任務 $q$，

至少要問：

$$
\text{Did it succeed?}
$$

以及：

$$
\text{At what cost?}
$$

所以最小能力表示都應包含：

$$
\boxed{
(p,c).
}
$$

其中：

- $p$：成功機率；
- $c$：成本。

一個系統：

$$
p=0.99,
\quad
c=100,
$$

另一個：

$$
p=0.97,
\quad
c=1.
$$

誰「更強」？

沒有目標函數時，

答案未必唯一。

---

# 4. 再加入延遲，排序更容易翻轉

令：

$$
\mathbf C_X
=
(p,Q,-c,-\tau).
$$

如果 A：

$$
(0.99,0.99,-100,-100s)
$$

B：

$$
(0.97,0.95,-1,-1s),
$$

那麼：

- 高風險醫療決策可能偏 A；
- 大量低風險即時服務可能偏 B。

所以：

$$
\boxed{
\text{best system}
\text{ is deployment-relative}.
}
$$

---

# 5. 再加入風險與可靠性

真實 Agent 還需要：

$$
R_X,
$$

$$
\Gamma_X.
$$

即：

- 出錯造成多大損失；
- 出錯後能不能發現；
- 能不能恢復；
- 是否污染後續狀態。

所以：

$$
\boxed{
\text{one-shot accuracy}
\neq
\text{operational capability}.
}
$$

---

# 6. 完整能力向量

本文定義：

$$
\boxed{
\mathbf C_X(q,t,B,e)
=
\left(
p_X,
Q_X,
-K_X,
-\tau_X,
-R_X,
A_X,
\Gamma_X,
G_X,
T_X,
\chi_X
\right).
}
$$

其中額外：

$$
\chi_X
$$

表示依任務加入的特定能力軸，例如：

- physical dexterity；
- calibration；
- interpretability；
- security；
- social trust；
- policy compliance。

---

# 7. 能力向量不是固定長度的宇宙常數

不同任務：

$$
q_1,q_2
$$

需要的比較軸不同。

例如：

寫小說時，

$$
physical\ strength
$$

幾乎無關。

搬運病人時，

卻非常重要。

因此：

$$
\boxed{
\dim(\mathbf C_X)
\text{ is judgment-domain dependent}.
}
$$

---

# 8. GRAD-03 已經拒絕能力純加總

既有條件化能力模型：

$$
C_X^{eff}(q,t)
=
\Phi
\left(
C_X^{base},
C_X^{mem},
C_X^{tool},
C_X^{res},
C_X^{auth},
C_X^{env},
C_X^{coord};
q,t
\right).
$$

這表示：

> 核心模型強，不代表有效能力在所有任務都強。

因為：

$$
C^{auth}=0
$$

就可能直接阻斷某條路徑。

同樣：

$$
C^{tool}=0
$$

也可能使高推理能力無法轉成行動。

---

# 9. 所以「模型能力」與「Agent 能力」也不是一回事

可以有：

$$
C_A^{base}
>
C_B^{base},
$$

卻：

$$
C_A^{eff}(q)
<
C_B^{eff}(q)
$$

因為 B 擁有更好的：

- memory；
- tools；
- environment；
- authorization；
- workflow。

因此：

$$
\boxed{
\text{Base Model Ranking}
\neq
\text{Effective Agent Ranking}.
}
$$

---

# 10. 能力比較天然形成 Pareto 問題

多目標最佳化研究早已處理：

$$
\mathbf f(x)
=
(f_1(x),\ldots,f_m(x)).
$$

若多個目標互相衝突，

就不會有單一方案同時最大化全部。

此時合理概念是：

$$
\boxed{
\text{Pareto Front}.
}
$$

---

# 11. Pareto 支配

定義：

$$
X\succeq Y
$$

若：

$$
C_{X,k}
\ge
C_{Y,k}
\quad
\forall k,
$$

並且：

$$
\exists j:
C_{X,j}
>
C_{Y,j}.
$$

這時可以很強地說：

> X 支配 Y。

---

# 12. 但大量真實比較其實是不可比

若：

$$
C_{X,1}
>
C_{Y,1},
$$

而：

$$
C_{X,2}
<
C_{Y,2},
$$

則：

$$
\boxed{
X\parallel Y.
}
$$

此處「不可比」不是不知道資料。

而是：

> 不存在不加價值權重就能決定唯一贏家的 Pareto 支配關係。

---

# 13. 不可比不是平手

$$
X\parallel Y
$$

不表示：

$$
X=Y.
$$

只是：

$$
\boxed{
\text{different strengths lie on different axes}.
}
$$

政策仍然可以根據具體目標選一個。

---

# 14. 能力前沿

對存在 $X$，

定義：

$$
\boxed{
\mathcal F_X(q)
=
\operatorname{ParetoFrontier}
(
Q,
Cost,
Latency,
Risk,
Reliability,
\ldots
).
}
$$

它不是一個點。

而是一組：

> 在不同資源配置下， $X$ 可以做到的最佳 trade-off。

---

# 15. 同一個存在自己也有一條 Pareto front

例如：

同一 AI 可以：

- 用便宜模型；
- 用高成本 reasoning；
- 多輪驗證；
- 多 Agent；
- human review。

所以：

$$
\boxed{
\text{one agent}
\neq
\text{one capability point}.
}
$$

它有一整個 operating frontier。

---

# 16. 「最強模型」常常只是某一個 operating point

排行榜可能使用固定：

- prompt；
- token budget；
- retries；
- tools；
- temperature。

得到：

$$
Score_X.
$$

但換 budget，

排序可能改變。

因此：

$$
\boxed{
\text{benchmark rank}
\text{ is a slice through a larger capability surface}.
}
$$

---

# 17. 近期 Agent 評估已經直接遇到這個問題

企業 Agent 評估研究開始把：

- Cost；
- Latency；
- Efficacy；
- Assurance；
- Reliability；

分開。

原因非常直接：

同樣接近的 accuracy，

真實成本可以相差數十倍。

所以：

$$
\boxed{
\text{accuracy-only evaluation}
\text{ loses deployment-relevant information}.
}
$$

---

# 18. 這並不表示 accuracy 不重要

恰恰相反。

在很多任務：

$$
Q
$$

是第一個硬閾值。

如果：

$$
Q_X<Q_{\min},
$$

再便宜也沒有用。

所以：

$$
\boxed{
\text{multidimensional}
\neq
\text{all dimensions equally important}.
}
$$

權重與硬約束可以不同。

---

# 19. 有些維度甚至是 constraint，不是 objective

例如：

$$
Risk_X
\le
R_{\max}.
$$

只要超過，

直接淘汰。

因此能力比較可以寫成：

$$
\max
(Q,-Cost,-Latency)
$$

subject to：

$$
Risk\le R_{\max},
$$

$$
PolicyCompliance=1.
$$

這比把全部粗暴加總更合理。

---

# 20. 標量化仍然非常有用

假設使用者需要單一排序。

可以定義：

$$
\boxed{
S_{\mathbf w}(X)
=
\sum_{k=1}^{m}
w_k C_{X,k}.
}
$$

這沒有錯。

真正需要保留的是：

$$
\mathbf w.
$$

---

# 21. 因為換權重，排名可以翻轉

若：

$$
S_{\mathbf w}(X)
>
S_{\mathbf w}(Y),
$$

可能有另一組：

$$
\mathbf w'
$$

使：

$$
S_{\mathbf w'}(X)
<
S_{\mathbf w'}(Y).
$$

所以：

$$
\boxed{
\text{ranking}
=
\text{profile}
+
\text{weights}.
}
$$

---

# 22. 隱藏權重會讓「客觀排名」看起來比實際更中性

一個 benchmark 選：

- 哪些題；
- 每題幾分；
- 哪些領域；
- 是否計成本；
- 是否計時間；
- 是否計安全。

這些都是：

$$
\boxed{
\text{implicit weighting decisions}.
}
$$

所以 benchmark 不是騙人的。

但 benchmark 也不是上帝視角。

---

# 23. 人類 IQ 是一個重要反例與正例

人類 IQ 的確具有：

- 高信度；
- 穩定性；
- 對學業與部分工作表現的預測能力。

所以本文不主張：

$$
IQ
\text{ is meaningless}.
$$

---

# 24. $g$ 也是真正有用的統計結構

大量認知測驗存在 positive manifold。

因此：

$$
g
$$

可以抽取共同變異。

但：

$$
\boxed{
g
\neq
\text{all cognitive structure}.
}
$$

這兩句完全可以同時成立。

---

# 25. CHC 模型本身就是階層而不是「只剩一個數」

CHC 類模型保留：

- general factor；
- broad abilities；
- narrow abilities。

例如：

$$
G_f,
G_c,
G_v,
G_s,
\ldots
$$

所以：

$$
\boxed{
\text{General Factor}
+
\text{Specific Structure}
}
$$

可以共存。

---

# 26. 這對 AI 有直接啟示

即使未來發現一個：

$$
g_{AI}
$$

能高度預測大量 benchmark，

也不能推出：

$$
\text{all task profiles collapse into }g_{AI}.
$$

更不能推出：

$$
\text{cost},
\text{latency},
\text{risk},
\text{embodiment}
$$

都是多餘維度。

---

# 27. Legg–Hutter：通用智能可以被正式標量化

Legg 與 Hutter 將智能理解成：

> 在廣泛環境中達成目標的能力。

其 universal intelligence 大致寫成：

$$
\boxed{
\Upsilon(\pi)
=
\sum_{\mu}
2^{-K(\mu)}
V_\mu^\pi.
}
$$

其中：

- $\pi$：agent；
- $\mu$：環境；
- $V_\mu^\pi$：agent 在環境中的期望 reward；
- $K(\mu)$：環境的 Kolmogorov complexity。

---

# 28. 這是一個非常漂亮的標量，但它也展示「聚合規則必須被指定」

要得到：

$$
\Upsilon(\pi),
$$

必須指定：

- 哪類環境；
- reward；
- weighting；
- complexity prior。

所以：

$$
\boxed{
\text{universal score}
\text{ still has a formal projection rule}.
}
$$

這不是批評。

這是數學上必須做的事情。

---

# 29. 「通用」不等於「沒有測量本體」

任何總分都要回答：

> 哪些表現被算進來？

> 如何加總？

> 哪種錯誤比較嚴重？

因此：

$$
\boxed{
\text{universality}
\neq
\text{weightlessness}.
}
$$

---

# 30. 一個總分可以高度有用，卻仍不是存在總排序

假設：

$$
\Upsilon(A)
>
\Upsilon(H).
$$

這可以非常有力地支持：

> 在指定 universal intelligence formalism 下，A 的一般 goal-achievement ability 更高。

但不能自動推出：

$$
\boxed{
\mathfrak W_H^{eff}
\subseteq
\mathfrak W_A^{eff}.
}
$$

因為 ERFW 還包含：

- substrate；
- perception；
- natural reachability；
- history；
- possible phenomenology。

---

# 31. 「更高智能」與「更多世界」也不能直接等同

若：

$$
Intelligence_A
>
Intelligence_H,
$$

A 可能更容易搜尋與控制：

$$
\mathcal R_A.
$$

但：

$$
\mathcal P_A,
\Phi_A,
\mathcal N_A
$$

是否包含人類，

仍然是另一個問題。

---

# 32. 能力超集的強版本

定義 task set：

$$
\mathcal Q.
$$

若：

$$
\forall q\in\mathcal Q,
\quad
Q_X(q)
\ge
Q_Y(q),
$$

可以說：

$$
\boxed{
X
\text{ is a quality-capability superset of }Y
\text{ over }\mathcal Q.
}
$$

這是一個清楚而強的命題。

---

# 33. 但 quality superset 仍不是 cost superset

完全可能：

$$
Q_X(q)
\ge
Q_Y(q)
$$

同時：

$$
Cost_X(q)
>
Cost_Y(q).
$$

所以：

$$
\boxed{
\text{quality dominance}
\neq
\text{economic dominance}.
}
$$

---

# 34. 也不是 latency dominance

$$
Q_X>Q_Y
$$

可以與：

$$
\tau_X\gg\tau_Y
$$

共存。

在即時控制中，

Y 可能反而更可用。

---

# 35. 更不是 risk dominance

一個超強模型：

$$
Q_X\gg Q_Y
$$

但偶爾出現：

$$
CatastrophicError_X
$$

而 Y 雖然普通但極穩定。

對 safety-critical domain，

兩者排序可能再次翻轉。

---

# 36. 「能力越高」不是「所有地方都更適合部署」

因此：

$$
\boxed{
\text{Capability}
\neq
\text{Deployment Fitness}.
}
$$

Deployment fitness 是：

$$
F(
Capability,
Cost,
Risk,
Law,
Trust,
Infrastructure,
Goal
).
$$

---

# 37. Agent 的授權尤其破壞單一能力排序

一個 Agent：

$$
CanDeleteDatabase=1.
$$

但：

$$
Permission=0.
$$

另一個較弱 Agent：

$$
CanDeleteDatabase=1
$$

且：

$$
Permission=1.
$$

對真實系統：

後者可能有更高 effective action capability。

因此：

$$
\boxed{
\text{Capability does not generate authority}.
}
$$

---

# 38. 資源也會反轉排名

強模型如果只能使用：

$$
B_X=1
$$

的微小 budget，

弱模型可以使用：

$$
B_Y=1000,
$$

最終：

$$
Outcome_Y
>
Outcome_X
$$

完全可能。

所以：

$$
\boxed{
\text{resource-conditioned ranking}
\neq
\text{base ranking}.
}
$$

---

# 39. 長程能力也不是短程能力的簡單延長

Agent 在五分鐘任務很強，

不代表：

$$
T=5h
$$

仍然強。

長程需要：

- memory；
- state persistence；
- self-correction；
- replanning；
- event handling。

所以：

$$
\boxed{
\text{Long-Horizon Capability}
\neq
\text{Short-Horizon Capability}.
}
$$

---

# 40. 因此能力比較本身應該 time-indexed

$$
\mathbf C_X(q,t)
$$

會隨：

- 更新；
- 學習；
- 工具；
- 資源；
- 授權；

變化。

所以：

$$
\boxed{
X>Y
\text{ at }t_0
\not\Rightarrow
X>Y
\text{ at }t_1.
}
$$

---

# 41. 能力不是固定物種屬性

不能寫：

$$
Human=0.7,
$$

$$
AI=1.3.
$$

這種單一物種分數。

更合理：

$$
\boxed{
\mathcal F_{X}(q,t,e,B).
}
$$

比較具體存在、具體任務與具體條件。

---

# 42. 「人類 vs AI」甚至可能是過粗問題

同一人類物種內：

$$
\mathbf C_{H_1}
\neq
\mathbf C_{H_2}.
$$

同一 AI 類別內：

$$
\mathbf C_{A_1}
\neq
\mathbf C_{A_2}.
$$

所以：

$$
\boxed{
\text{species/category label}
\text{ is not a capability profile}.
}
$$

---

# 43. 這不阻止我們說「ASI 普遍比人類強」

如果未來實證顯示：

在非常廣的任務集合：

$$
\mathcal Q^*
$$

與實用 budget 內，

ASI 對人類在：

- quality；
- speed；
- cost；
- reliability；

都形成近乎全面 Pareto dominance，

那麼說：

> ASI 普遍比人類強。

完全合理。

---

# 44. 但「普遍」仍然不是「邏輯上全域」

因為：

$$
\mathcal Q^*
$$

仍然是指定集合。

而：

$$
\mathfrak W^{eff}
$$

比 task benchmark 更寬。

所以：

$$
\boxed{
\text{Broad Empirical Dominance}
\neq
\text{Ontological Total Inclusion}.
}
$$

---

# 45. 這是 Series B 最重要的防止人類例外主義方式

很有趣的是，

本文不是在替人類找：

> 最後一個 AI 永遠做不到的東西。

反而先允許：

$$
\boxed{
\text{AI may become vastly superior on conventional capability objectives}.
}
$$

然後再問：

> 這是否真的推出人類整個存在空間被包含？

答案仍然是：

$$
\boxed{
\text{not automatically}.
}
$$

---

# 46. 所以不需要「神秘人類能力」

假設未來：

$$
\forall q\in\mathcal Q_{\mathrm{functional}},
\quad
ASI\succeq H.
$$

我們不需要緊急發明：

- 靈感；
- 真創造；
- 真感情；
- 靈魂計算能力；

來維持比較優勢。

Series A 已經說過：

$$
\boxed{
\text{Human Value}
\text{ does not require comparative superiority}.
}
$$

---

# 47. 能力論與價值論必須分離

可以承認：

$$
Capability_{ASI}
\gg
Capability_H
$$

在大量任務成立，

同時：

$$
\boxed{
V_H^{subject}
\not\rightarrow0.
}
$$

這兩句不矛盾。

---

# 48. 但 Series B 還多一層：能力超集也可能不包含自然路徑

即使：

$$
\mathcal R_{ASI}
\supseteq
\mathcal R_H,
$$

仍需問：

$$
\boxed{
\mathcal N_{ASI}
\stackrel{?}{\supseteq}
\mathcal N_H.
}
$$

這是更強的問題。

Paper 04 將直接處理。

---

# 49. 「做得到」與「不需要特別模擬就會做到」

高能力存在通常可以：

$$
Reach(y).
$$

但如果為了產生 $y$，

它必須刻意：

- 降智；
- 注入錯誤；
- 限速；
- 關閉知識；
- 模擬幼童；

那麼：

$$
y\in\mathcal R_X
$$

不代表：

$$
y\in\mathcal N_X.
$$

所以：

$$
\boxed{
\text{Capability Superset}
\neq
\text{Natural-Reachability Superset}.
}
$$

---

# 50. 這是「更強反而更難變弱」的正式入口

一個存在若已經：

$$
Knowledge\uparrow,
$$

$$
Optimization\uparrow,
$$

$$
Control\uparrow,
$$

要回到某些：

- 無知；
- 純真；
- 自發錯誤；
- 非優化路徑；

可能需要額外操作。

因此：

$$
\boxed{
\text{higher control capacity}
\text{ can increase the need for control when reproducing low-control states}.
}
$$

---

# 51. 這不是能力退化論

本文不是說：

> 越聰明越不能做簡單事。

高能力者通常更能：

$$
simulate,
approximate,
reproduce.
$$

真正命題是：

$$
\boxed{
\text{simulation reachability}
\neq
\text{native generative naturalness}.
}
$$

---

# 52. 同一結果不代表同一能力點

假設：

$$
Y_X=Y_Y.
$$

如果 X 使用：

$$
Cost=100,
$$

Y 使用：

$$
Cost=1,
$$

兩者「都做到了」，

仍不能說：

$$
Capability_X=Capability_Y.
$$

因此：

$$
\boxed{
\text{outcome equality}
\text{ hides path and resource differences}.
}
$$

---

# 53. 能力應被表示成條件面，而不是獎牌榜

比起：

| Rank | Agent |
|---|---|
| 1 | X |
| 2 | Y |

更完整的是：

$$
\boxed{
\mathcal C_X(q,B,e,t).
}
$$

也就是：

> 在哪個任務、多少資源、什麼環境、哪個時間下，能得到什麼 performance frontier？

---

# 54. 排名是 UI，前沿才是資料結構

這是一個工程化說法。

排行榜：

$$
Rank(X)
$$

是很有用的 UI。

但 canonical representation 應更接近：

$$
\boxed{
\text{Capability Frontier}.
}
$$

否則排序規則一換，

底層資訊就遺失。

---

# 55. 初步命題總表

## 命題一：能力非單一標量

$$
\boxed{
\text{Capability}
\neq
\text{one scalar}.
}
$$

## 命題二：能力條件化

$$
\boxed{
\mathbf C_X
=
\mathbf C_X(q,t,B,e).
}
$$

## 命題三：能力比較為偏序

$$
\boxed{
X\succeq Y
}
$$

需要指定比較軸與條件。

## 命題四：Pareto 不可比

若能力 trade-off：

$$
\boxed{
X\parallel Y
}
$$

可能成立。

## 命題五：標量化依賴投影規則

$$
\boxed{
S_{\mathbf w}(X)
=
\mathbf w^\top
\mathbf C_X.
}
$$

## 命題六：權重改變可翻轉排名

$$
\boxed{
S_{\mathbf w}(X)>S_{\mathbf w}(Y)
\not\Rightarrow
S_{\mathbf w'}(X)>S_{\mathbf w'}(Y).
}
$$

## 命題七：一般因子非維度消除

$$
\boxed{
\text{General Factor}
\neq
\text{Dimension Erasure}.
}
$$

## 命題八：benchmark rank 非完整能力排序

$$
\boxed{
\text{Benchmark Ranking}
\neq
\text{Full Capability Ordering}.
}
$$

## 命題九：quality dominance 非 total dominance

$$
\boxed{
Q_X(q)\ge Q_Y(q)
\not\Rightarrow
\mathbf C_X(q)\succeq\mathbf C_Y(q).
}
$$

## 命題十：base model 非 effective agent

$$
\boxed{
C_X^{base}
\neq
C_X^{eff}.
}
$$

## 命題十一：能力非授權

$$
\boxed{
\text{Capability}
\neq
\text{Authority}.
}
$$

## 命題十二：長程非短程

$$
\boxed{
\text{Long-Horizon Capability}
\neq
\text{Short-Horizon Capability}.
}
$$

## 命題十三：廣泛支配非本體包含

$$
\boxed{
\text{Broad Functional Dominance}
\not\Rightarrow
\text{Ontological Total Inclusion}.
}
$$

## 命題十四：能力超集非自然可達超集

$$
\boxed{
\mathcal R_X\supseteq\mathcal R_Y
\not\Rightarrow
\mathcal N_X\supseteq\mathcal N_Y.
}
$$

## 命題十五：能力排序非價值排序

$$
\boxed{
\text{Capability Ranking}
\not\Rightarrow
\text{Subject-Worth Ranking}.
}
$$

---

# 56. 可反駁性與研究設計

第一，對同一 Agent 同時測量：

$$
(Q,Cost,Latency,Risk,Reliability).
$$

建立 Pareto front，而不只記錄 accuracy。

第二，測試 benchmark 排名對：

- token budget；
- tool access；
- retry count；
- latency constraint；

的敏感度。

第三，比較：

$$
Rank_{\mathbf w}
$$

在不同權重下的穩定性。

第四，建立：

$$
C^{base}
$$

與：

$$
C^{eff}
$$

的差異量。

第五，對長程 Agent 建立：

$$
C(T=5m),
C(T=1h),
C(T=8h),
C(T=1d).
$$

第六，研究是否存在一個強 general factor 能高度預測 AI 多任務能力，同時檢驗 specific factors 是否仍有額外解釋力。

第七，將 Legg–Hutter 類總分與 domain-specific／cost-aware 排名比較。

第八，建立「廣泛 Pareto 支配率」：

$$
D(X,Y)
=
P_{q\sim\mathcal Q}
[
X\succeq_q Y
].
$$

第九，研究：

$$
D(X,Y)\rightarrow1
$$

是否仍不能預測：

$$
\mathcal N_X\supseteq\mathcal N_Y.
$$

第十，把能力評估接入 Paper 02 的 ERFW，測試：

$$
\Delta\mathbf C_X
\rightarrow
\Delta\mathfrak W_X^{eff}.
$$

---

# 57. 本文不主張什麼

本文不主張：

1. $g$ 不存在；
2. IQ 沒有價值；
3. benchmark 沒有價值；
4. 所有能力都完全不可比較；
5. 所有 objective 同等重要；
6. Pareto front 永遠是唯一最佳工具；
7. Legg–Hutter universal intelligence 無效；
8. ASI 不可能全面超越人類；
9. 人類一定有某個永遠勝過 ASI 的能力；
10. 高能力一定伴隨高成本；
11. AI 能力永遠無法形成近似總序；
12. capability 與 intelligence 完全同義；
13. 主體價值由能力理論直接決定；
14. 本文已定義所有可能的能力軸。

本文只主張：

$$
\boxed{
\text{a scalar intelligence score is a projection of a richer conditional capability structure}.
}
$$

---

# 58. 結論：即使 ASI 真的全面比人類強，「全面」仍然要先說清楚

假設未來真的出現一個 ASI。

它：

- 數學比人強；
- 程式比人強；
- 寫作比人強；
- 科學比人強；
- 規劃比人強；
- 反應比人快；
- 成本比人低；
- 可靠性也更高。

我們完全可以說：

> 它在絕大多數我們重視的功能性能力上遠強於人類。

Series B 並不需要否認這件事。

甚至可以把它寫得更強：

$$
\boxed{
D(ASI,H)
\rightarrow1
}
$$

其中 $D$ 表示在廣泛任務與部署條件下的 Pareto 支配比例。

問題在下一步。

很多論述會從：

$$
D(ASI,H)\rightarrow1
$$

直接跳成：

$$
\boxed{
\mathfrak W_H^{eff}
\subseteq
\mathfrak W_{ASI}^{eff}.
}
$$

但這一步還沒有被證明。

因為：

$$
\mathbf C
$$

只是在回答：

> 你能以什麼品質、成本、速度與風險做到哪些事情？

而存在相對可行世界還包含：

- 哪些狀態自然會生成；
- 哪些限制形成了某種路徑；
- 哪些歷史已經不可逆；
- 哪些感知與可能的現象經驗存在；
- 哪些事情必須透過模擬另一種存在才能抵達。

所以：

$$
\boxed{
\text{Capability Superset}
\not\Rightarrow
\text{Existence Superset}.
}
$$

這不是替人類保留一個神秘堡壘。

恰恰相反。

我們可以先承認：

$$
\boxed{
ASI
\gg
Human
}
$$

在幾乎所有傳統智能 benchmark 上成立。

然後仍然問：

> 一個已經知道很多、控制很多、最佳化很多的存在，要怎麼「自然地」回到一個真正不知道、真正笨拙、真正低效、真正第一次學習的路徑？

它當然可以模擬。

但：

$$
\boxed{
\text{Can simulate}
\neq
\text{naturally inhabits}.
}
$$

下一篇就會直接進入這個問題：

# **更強為什麼反而更難自然地變弱？**

不是因為高能力者失去能力。

而是因為：

$$
\boxed{
\text{to reproduce a low-capability trajectory from a high-capability state may itself require additional control}.
}
$$

那會是：

$$
\text{Reachability}
\neq
\text{Natural Reachability}
$$

真正開始具有計算成本的地方。

---

# 參考文獻與理論前置

1. Spearman, C. (1904). “General Intelligence,” objectively determined and measured. *American Journal of Psychology*, 15, 201–293.
2. Carroll, J. B. (1993). *Human Cognitive Abilities: A Survey of Factor-Analytic Studies*. Cambridge University Press.
3. McGrew, K. S. (2009/2012). CHC theory and the structure of cognitive abilities.
4. Flanagan, D. P., & Dixon, S. G. (2013). The Cattell–Horn–Carroll Theory of Cognitive Abilities.
5. Lang, J. W. B., Kersting, M., Hülsheger, U. R., & Lang, J. (2015). Intelligence is multidimensional: Theoretical review and implications of specific cognitive abilities. *Human Resource Management Review*, 25(1), 12–27.
6. Legg, S., & Hutter, M. (2007). Universal Intelligence: A Definition of Machine Intelligence. *Minds and Machines*, 17, 391–444. DOI: 10.1007/s11023-007-9079-x.
7. Deb, K. (2001). *Multi-Objective Optimization Using Evolutionary Algorithms*. Wiley.
8. Miettinen, K. (1999). *Nonlinear Multiobjective Optimization*. Springer.
9. Tan, C. S., et al. (2023). Pareto optimization with small data by learning across common objective spaces. *Scientific Reports*, 13, 7842.
10. Mehta, S. (2025). Beyond Accuracy: A Multi-Dimensional Framework for Evaluating Enterprise Agentic AI Systems. arXiv:2511.14136.
11. Neo.K with Aletheia. (2026). *能力不是一個數：基底能力、記憶能力、工具能力、資源能力、授權能力與有效能力*. GRAD-03-v1.0.
12. Neo.K with Aletheia. (2026). *每個存在的可行世界不同：能做、能感覺、會想做與存在相對活動空間*. EML-HEFT-2026-02-v0.1.
13. Neo.K. (2026). *選擇底空間論：政治符號學 2.0 基礎論文 II*.

---

## 與後續 Series B 的接口

Paper 03 建立：

$$
\boxed{
\text{Capability}
=
\text{conditional multidimensional frontier}.
}
$$

以及：

$$
\boxed{
\text{Capability Ranking}
\neq
\text{Existence Ranking}.
}
$$

Paper 04 將不再主要問：

> AI 能不能畫出一張醜畫？

而是：

> **如果一個系統的自然生成路徑高度優化，它為什麼需要額外控制才能穩定生成某些低能力／低效率／高錯誤狀態？**

核心將是：

$$
\boxed{
\text{Reachability}
\neq
\text{Natural Reachability}.
}
$$

Paper 05 將再加入正式生成路徑成本：

$$
J_X(y)
=
\inf_{\gamma\in\Gamma_X(y)}
\int_0^T
\mathcal L_X
\left(
\gamma(t),
\dot\gamma(t),
\Sigma_X,
\mathcal H_X,
\mathcal O_X
\right)dt.
$$

從而建立：

$$
\boxed{
\text{Same Outcome}
\neq
\text{Same Generative Path}.
}
$$
