# 按需智能：事件驅動、多模型路由與稀疏推理

**系列：狀態驅動的本地具身 AI｜第 5 篇**  
**版本：v0.1**  
**日期：2026-08-01**

---

## 摘要

當 AI 被部署到機器人、手機、眼鏡與長期 Agent Runtime 中，一個常見但昂貴的假設是：只要系統正在運行，大型模型就應持續參與每一次感知、判斷與決策。本文主張相反：**真正可持續的本地具身智能應是「按需智能（On-Demand Intelligence）」——世界狀態持續存在，但高成本模型只在事件、困難度、不確定性或後果等條件需要時才被喚醒。**

本文把這種架構拆成三種不同的「稀疏性」：第一，時間上的呼叫稀疏，即不是每個事件都呼叫模型；第二，模型層級的路由稀疏，即不同事件分配給規則、小模型、大模型或雲端模型；第三，模型內部的計算稀疏，例如 Mixture-of-Experts（MoE）只啟用部分專家。三者概念相關但不能混為一談。

近年 LLM routing 與 cascade 研究已證明這一路線的實用價值。ICLR 2024 的 Hybrid LLM 以查詢難度在小模型與大模型間路由，實驗中可減少最多約 40% 的大型模型呼叫而不降低回答品質；ICML 2024 的 Online Cascade Learning 則在資料流場景中以小模型先處理、困難案例再遞交 LLM，部分實驗將推論成本降低最高約 90%；ICML 2025 的 BEST-Route 更把「使用哪個模型、生成幾個候選」共同納入 test-time compute 決策，在其測試中最高可降低約 60% 成本而性能下降少於 1%。這些結果並不直接等同於具身控制，但它們證明了「不是所有輸入都需要最昂貴模型」這一基本原理。

本文進一步提出一個具身 Agent Router：

$$
r_t
=
R(E_t,S_t,G_t,U_t,B_t,P_t),
$$

其中路由器根據事件、世界狀態、當前目標、不確定性、資源預算與權限，選擇「不推理、規則處理、小模型、本地大模型、雲端模型或多模型協作」。如此，AI 的持續性由世界狀態提供，而不是靠大型模型持續運算來維持。

**關鍵詞：** 按需智能、事件驅動、多模型路由、稀疏推理、LLM Cascade、Hybrid LLM、Mixture-of-Experts、本地 AI、具身智能、世界狀態機

---

# 1. 一個關鍵誤解：持續存在不等於持續大模型推理

如果我們希望一個 AI 角色「一直存在」，很容易直覺地把它理解成：

$$
\text{AI Alive}
\Rightarrow
\text{LLM Continuously Running}.
$$

但這個推論沒有必要。

一台機器人在待機時仍然：

- 知道自己是誰；
- 知道主人在哪裡；
- 保存當前任務；
- 持續監測電量；
- 感知是否有人靠近；
- 維持時間、事件與記憶；

並不要求一個 20B、70B 甚至更大的模型每秒都重新推理。

更合理的是：

$$
\boxed{
\text{Persistent State}
\neq
\text{Persistent High-Cost Inference}
}
$$

真正持續的是：

$$
S_t,
$$

而不是：

$$
M_{\mathrm{large}}(t).
$$

大型模型可以睡著。

世界狀態不能睡著。

---

# 2. 從輪詢式 AI 轉向事件驅動 AI

一個低效率 Agent 可以採用固定輪詢：

```text
每 500 ms：
    讀攝影機
    讀麥克風
    讀所有感測器
    組 Prompt
    呼叫大模型
    問「現在要做什麼？」
```

其成本近似：

$$
C(T)
\propto
\frac{T}{\Delta t}
C_{\mathrm{LLM}}.
$$

只要運行時間 $T$ 增加，成本線性累積。

事件驅動架構則不同：

```text
Sensor Stream
    ↓
Event Detector
    ↓
World-State Update
    ↓
Trigger?
 ┌──┴───┐
 No     Yes
 │       │
Stop   Route Intelligence
```

只有：

$$
\Gamma(E_t,S_t)=1
$$

時才進一步喚醒高階能力。

例如：

- 溫度正常波動：只更新 state；
- 熟悉的人走進房間：啟動社交策略；
- 使用者叫名字：啟動語音處理；
- 路徑被未知障礙阻塞：升級視覺／規劃；
- 使用者問開放式問題：呼叫 LLM；
- 電池低於門檻：直接執行回充，不必問 LLM。

因此：

$$
\boxed{
\text{Observe continuously;}
\quad
\text{reason expensively only when necessary.}
}
$$

---

# 3. 「稀疏推理」其實有三種完全不同的層級

本系列使用「稀疏推理」時，至少應區分三層。

## 3.1 時間稀疏：Temporal Invocation Sparsity

不是每個時間點都呼叫模型。

定義模型啟動指示：

$$
z_t\in\{0,1\}.
$$

若：

$$
z_t=0,
$$

代表該事件完全由規則、控制器或狀態更新處理。

總推論成本：

$$
C_{\mathrm{total}}
=
\sum_t z_t C_t.
$$

只要：

$$
\mathbb E[z_t]\ll1,
$$

系統就能長期運作而不讓大模型持續滿載。

---

## 3.2 模型稀疏：Model-Level Routing

即使需要模型，也不代表每次都使用最大模型。

可以有：

$$
\mathcal M=
\{
M_{\mathrm{tiny}},
M_{\mathrm{small}},
M_{\mathrm{local}},
M_{\mathrm{large}},
M_{\mathrm{cloud}}
\}.
$$

Router 選擇：

$$
m_t=R(x_t).
$$

這正是 Hybrid LLM、LLM cascade 與近年 model routing 文獻所研究的主要問題。

---

## 3.3 模型內部稀疏：MoE Sparse Activation

MoE 則是在一個模型內部：

$$
\text{Token}
\rightarrow
\text{Router}
\rightarrow
\text{Top-}k\text{ Experts}.
$$

例如模型有 $N$ 個 experts，但每個 token 只啟用：

$$
k\ll N.
$$

這可以降低單 token 的有效計算量，並提升參數規模與計算成本之間的效率。

但：

$$
\boxed{
\text{MoE Routing}
\neq
\text{Agent Model Routing}
}
$$

前者在模型內選專家。

後者是在 Runtime 中決定要不要用模型、用哪個模型。

三種 sparsity 可以同時存在，但不能概念混用。

---

# 4. Router 到底在決定什麼？

在具身 AI 中，Router 不只是：

> 這題要用 7B 還是 70B？

它更像：

$$
r_t
=
R(
E_t,
S_t,
G_t,
U_t,
B_t,
P_t
),
$$

其中：

- $E_t$ ：事件；
- $S_t$ ：世界狀態；
- $G_t$ ：當前目標；
- $U_t$ ：不確定性；
- $B_t$ ：算力、能源、延遲與金錢預算；
- $P_t$ ：權限、安全與隱私政策。

Router 的輸出可以是：

$$
r_t\in
\{
\text{NONE},
\text{RULE},
\text{TINY},
\text{SMALL},
\text{LOCAL-LARGE},
\text{CLOUD},
\text{MULTI}
\}.
$$

因此：

> 「不呼叫任何模型」本身就是一個合法而重要的 routing decision。

---

# 5. 第一級：零模型處理

大量具身事件根本不需要生成式模型。

例如：

```text
battery < 10%
→ return_to_charger
```

或：

```text
cliff_sensor = true
→ stop
```

或者：

```text
wake_word not detected
→ do not activate ASR
```

形式上：

$$
R(E_t,S_t)=\text{RULE}.
$$

這類事件的優勢是：

- 確定性高；
- 延遲低；
- 能耗低；
- 容易測試；
- 不受模型幻覺影響。

因此大模型的存在不應消滅規則。

規則反而成為一種：

$$
\boxed{
\text{Zero-Inference Intelligence Path}
}
$$

---

# 6. 第二級：小模型常駐

比純規則複雜、但不值得喚醒大型模型的工作，可以交給小模型。

例如：

- 喚醒詞；
- VAD；
- 情緒粗分類；
- 人臉辨識；
- 手勢辨識；
- 意圖分類；
- 事件難度預測；
- 是否需要 LLM 的判定。

所以一個本地 AI Runtime 可以常駐：

$$
M_{\mathrm{router}}\approx 0.1B\sim3B
$$

甚至完全不是 LLM，而是：

- classifier；
- tree model；
- embedding similarity；
- deterministic policy。

重要的是：

> Router 本身不能貴到跟被路由的大模型差不多。

如果每次為了決定「要不要叫 70B」而先叫一次 70B，就失去意義。

---

# 7. 第三級：本地日常模型

許多日常互動其實不需要前沿最大模型。

例如：

- 「幾點了？」
- 「跟著我。」
- 「不要吵。」
- 「把音量小一點。」
- 簡單閒聊；
- 常見家居控制；
- 既有技能選擇。

可以由較小的本地多模態模型處理。

因此：

$$
M_{\mathrm{daily}}
$$

可以是常見的 3B、7B、14B 或其他適合當時硬體的模型。

它的價值不是 benchmark 最強，而是：

$$
\text{low latency}
+
\text{privacy}
+
\text{offline availability}.
$$

---

# 8. 第四級：本地高階模型或雲端模型

當事件出現：

- 高語義複雜度；
- 長規劃鏈；
- 大量文件；
- 未見情境；
- 深度程式／數學；
- 跨模態理解；

才升級：

$$
M_{\mathrm{daily}}
\rightarrow
M_{\mathrm{large}}.
$$

若本地算力不足，再：

$$
M_{\mathrm{large}}
\rightarrow
M_{\mathrm{cloud}}.
$$

這形成：

$$
\boxed{
\text{Rule}
\rightarrow
\text{Small}
\rightarrow
\text{Local Large}
\rightarrow
\text{Cloud Frontier}
}
$$

但這不是固定每次都走完整鏈。

任何一層只要成功，都可以終止 escalation。

---

# 9. LLM Cascade 已經證明這種想法具有實際價值

2023 年 FrugalGPT 系統性提出 LLM cascade：不同模型在成本與能力上具有差異，因此可以學習如何針對不同查詢組合與遞交模型。

ICLR 2024 的 Hybrid LLM 更明確提出：

$$
\text{small model for easier queries}
\quad+\quad
\text{large model for harder queries}.
$$

其實驗報告在不降低回應品質的條件下，最多減少約 $40\%$ 的大型模型呼叫。

2024 年 ICML 的 Online Cascade Learning 把這個思想放到資料流場景：低成本模型先處理輸入，只有需要時才 defer 到 LLM；在其四個 benchmark 中，推論成本最高降低約 $90\%$ ，同時維持接近大型模型的準確率。

2025 年 ICML 的 BEST-Route 則進一步不只決定模型，也決定：

$$
n_{\mathrm{sample}},
$$

即要從該模型產生多少候選，再共同最佳化 quality 與 test-time compute。該研究報告最高約 $60\%$ 成本下降而性能損失少於 $1\%$ 。

這些實驗的任務與機器人並不相同。

但它們共同支持：

$$
\boxed{
\text{Uniform maximum compute per query is usually unnecessary.}
}
$$

---

# 10. 難度不是唯一的 routing 變數

傳統 LLM routing 很自然以：

$$
D(x)=\text{query difficulty}
$$

決定模型。

但具身系統還有更重要的維度。

例如：

$$
R=
f(
D,
C,
L,
E,
P,
Q
),
$$

其中：

- $D$ ：difficulty；
- $C$ ：consequence；
- $L$ ：latency requirement；
- $E$ ：energy budget；
- $P$ ：privacy；
- $Q$ ：required quality。

例如：

> 「講個笑話。」

可能：

$$
D\approx低,
\quad
C\approx低,
$$

小模型足夠。

但：

> 「這瓶藥是不是主人剛剛要我拿的那一瓶？」

即使語言問題不難：

$$
D\approx中,
$$

其物理後果：

$$
C\approx高.
$$

此時 Router 可能應該：

- 要求額外視覺確認；
- 交叉檢查；
- 不確定時拒絕；
- 請人類確認。

因此：

$$
\boxed{
\text{Routing should depend on consequence, not only difficulty.}
}
$$

---

# 11. 不確定性可以作為 escalation trigger

一個很自然的 deferral policy 是：

$$
U(x)>\theta
\Rightarrow
\text{escalate}.
$$

其中 $U$ 是不確定性。

但生成模型的不確定性並不好定義。

ICLR 2024 的 Language Model Cascades 研究指出，生成任務不像簡單分類，不能直接把單一分類機率當作 confidence；token-level uncertainty、長度偏差與表徵資訊都會影響 deferral quality。

因此具身 Router 不應只相信：

```text
model_confidence = 0.92
```

而可以綜合：

- 小模型自評；
- logits／entropy；
- 多模型一致性；
- 感測器可信度；
- 是否超出已知技能；
- 世界狀態衝突；
- 任務後果。

即：

$$
U_t
=
F(
U_{\mathrm{model}},
U_{\mathrm{sensor}},
U_{\mathrm{state}},
U_{\mathrm{task}}
).
$$

---

# 12. 多模型一致性可以作為「要不要升級」的訊號

2024 年 Agreement-Based Cascading 提出一種直觀方法：

如果多個較小模型在某一層達成足夠一致：

$$
\operatorname{Agree}(M_1,M_2,\ldots)>\theta,
$$

就不需要呼叫更大的模型。

若分歧：

$$
\operatorname{Agree}<\theta,
$$

則升級。

這在具身系統可以轉化成：

```text
vision_small_1: cup
vision_small_2: bottle
state_memory: expected cup
→ ambiguity
→ call stronger VLM
```

而不是一看到影像就直接呼叫最大 VLM。

這形成：

$$
\boxed{
\text{Cheap disagreement detection}
\rightarrow
\text{Expensive resolution}.
}
$$

---

# 13. Router 不應頻繁震盪

如果：

```text
small → large → small → large → small
```

每幾百毫秒切一次，系統會出現：

- cache thrashing；
- 模型載入成本；
- 記憶切換；
- 延遲尖峰；
- 能耗增加。

因此 Router 需要 hysteresis。

例如：

$$
U>\theta_{\mathrm{up}}
\Rightarrow
\text{upgrade},
$$

但只有：

$$
U<\theta_{\mathrm{down}}
$$

才 downgrade，且：

$$
\theta_{\mathrm{down}}
<
\theta_{\mathrm{up}}.
$$

也可以設定最短 residency time：

$$
T_{\mathrm{min}}.
$$

這在手機與機器人的有限功耗平台尤其重要。

---

# 14. 路由不是每一次都要從零學

如果某個事件模式已經反覆出現：

```text
主人說「我要睡了」
→ 降低音量
→ 關閉主動互動
→ 進入夜間狀態
```

系統一開始可能需要 LLM 理解。

但在穩定確認後，可以把它編譯成：

$$
\text{Known Pattern}
\rightarrow
\text{Cheap Policy}.
$$

這形成一個有趣的學習方向：

$$
\boxed{
\text{Expensive reasoning}
\rightarrow
\text{validated reusable rule}
}
$$

也就是讓大模型負責「第一次理解」，Runtime 負責「之後便宜地重複」。

這種 amortization 對長期 Agent 特別重要。

---

# 15. 小模型可以向大模型學習，讓大模型越來越少出場

Online Cascade Learning 提出的一個重要方向是：

> 小模型可以從過去 LLM 的示範持續學習。

具身 Runtime 可以記錄：

$$
(E_t,S_t)
\rightarrow
A_t^{\mathrm{LLM}}.
$$

當相同模式累積足夠資料後：

$$
M_{\mathrm{small}}
\leftarrow
\operatorname{Distill}(M_{\mathrm{large}}).
$$

於是時間越久：

$$
P(\text{need large model})\downarrow.
$$

這是一種很實際的「個人化本地智能成長」：

不是讓裝置上的模型無限制自我修改，

而是把大量重複、高頻、低風險模式逐步蒸餾到更便宜的本地策略中。

---

# 16. 本地／雲端 routing 也是隱私 routing

假設事件包含：

- 相機畫面；
- 私人對話；
- 文件；
- 家中布局；
- 個人記憶。

Router 不只要問：

> 哪個模型最強？

還要問：

> 這個資料允不允許離開本地？

因此可以有：

$$
P_{\mathrm{privacy}}(x)\in\{\text{local-only},\text{cloud-ok}\}.
$$

若：

$$
P_{\mathrm{privacy}}=\text{local-only},
$$

即使本地模型較弱，也不能自動升級到雲端。

這時可能選擇：

- 本地大模型；
- 降級完成；
- 要求使用者授權；
- 拒絕任務。

因此：

$$
\boxed{
\text{Model routing is also data-governance routing.}
}
$$

---

# 17. 本地 AI 手機尤其需要這種架構

手機的限制不是一次能不能跑大型模型，而是：

> 能不能全天候跑而不把電池、熱量與記憶體吃光？

假設一支 AI 手機有：

- always-on sensor hub；
- 小型 NPU；
- 7B 日常模型；
- 20B 高階模型；
- 雲端前沿模型。

可以採用：

$$
\text{Sensor Hub}
\rightarrow
\text{Event Detector}
\rightarrow
\text{Small Router}
\rightarrow
\begin{cases}
\text{No LLM}\\
\text{7B}\\
\text{20B}\\
\text{Cloud}
\end{cases}
$$

大部分時間：

$$
M_{20B}=\text{sleep}.
$$

只有在重要事件發生時喚醒。

這比要求 20B 模型「一直有意識地盯著所有事情」更接近現實可用的個人 AI 主機。

---

# 18. 一個迷你具身機器人的完整按需流程

假設二白式機器人正在房間待機。

### Event 1：風扇聲變大

```text
audio classifier = environmental noise
```

Router：

$$
R=\text{NONE}.
$$

只更新狀態。

---

### Event 2：有人叫「二白」

Wake-word detector：

$$
R=\text{SMALL}.
$$

啟動 ASR 與視線轉向。

---

### Event 3：「過來一下」

意圖分類高度確定：

$$
U<\theta.
$$

直接映射既有 skill：

$$
R=\text{RULE/BT}.
$$

不需要大模型。

---

### Event 4：「你覺得我今天是不是有點怪？」

這是開放式社交語義：

$$
R=\text{LOCAL-LARGE}.
$$

讀取：

$$
\phi(S_t)
$$

中的近期互動與人物狀態後回答。

---

### Event 5：「幫我看看這個奇怪的電路板是不是壞了。」

本地模型能力不足：

$$
U>\theta.
$$

若使用者允許上傳圖片：

$$
R=\text{CLOUD}.
$$

若隱私政策禁止：

$$
R=\text{LOCAL-LARGE / DECLINE}.
$$

這就是完整的按需智能。

---

# 19. 不要把所有事件都升級，也不要把所有事情都壓到小模型

這套架構有兩個相反的失敗模式。

## 過度升級

$$
P(\text{large})\approx1.
$$

結果：

- 浪費電；
- 浪費錢；
- 高延遲；
- 本地能力形同虛設。

## 過度節省

$$
P(\text{large})\approx0.
$$

結果：

- 困難任務品質差；
- 錯誤無法被糾正；
- 小模型超出能力仍硬答。

真正的目標是最佳化：

$$
J
=
Q
-\lambda_c C
-\lambda_l L
-\lambda_e E
-\lambda_r R_{\mathrm{risk}},
$$

其中：

- $Q$ ：品質；
- $C$ ：金錢／算力成本；
- $L$ ：延遲；
- $E$ ：能源；
- $R_{\mathrm{risk}}$ ：風險。

Router 的目標不是：

$$
\min C
$$

也不是：

$$
\max Q
$$

而是找到當下情境合理的 trade-off。

---

# 20. 與 MoE 的最終關係：從 token routing 到 existence routing

MoE 的核心直覺是：

$$
\text{不是每個 token 都需要全部參數。}
$$

多模型 Router 的核心直覺是：

$$
\text{不是每個任務都需要最大模型。}
$$

事件驅動 Runtime 的核心直覺則更進一步：

$$
\boxed{
\text{不是每個世界變化都需要生成式推理。}
}
$$

因此可以看到三層遞進：

$$
\text{Expert Sparsity}
\subset
\text{Model Sparsity}
\subset
\text{Temporal Intelligence Sparsity}.
$$

這不是嚴格的集合論包含，而是一種架構層級的類比。

真正重要的是：

> 智能系統可以持續存在，但計算不需要持續以最高密度發生。

---

# 21. 「按需智能」真正改變了什麼？

傳統想像：

$$
\text{Strong AI}
=
\text{One Very Strong Model}.
$$

按需智能則變成：

$$
\text{Strong AI System}
=
\text{Persistent State}
+
\text{Cheap Reflex}
+
\text{Router}
+
\text{Model Pool}
+
\text{Escalation Policy}.
$$

因此總體能力不再由單一模型完全決定。

一個較小本地模型，配合：

- 正確世界狀態；
- 優秀路由；
- 可重用技能；
- 雲端升級；
- 可靠安全層；

可能在真實長期任務中比「每件事都問最大模型」更快、更便宜、更穩定。

---

# 22. 結論：智能不必一直燃燒

完成世界狀態機之後，我們得到一個重要推論：

如果：

$$
S_t
$$

一直存在，

那麼：

$$
M_{\mathrm{large}}
$$

不必一直存在於 active inference 狀態。

因此：

$$
\boxed{
\text{Persistent Agent}
=
\text{Persistent State}
+
\text{Intermittent High-Cost Intelligence}.
}
$$

模型可以睡眠。

推理可以稀疏。

雲端可以離線。

但：

- 世界狀態仍在；
- 任務仍在；
- 身體仍在；
- 安全層仍在；
- 事件仍在被監聽。

這正是本地具身 AI 能夠從「Demo」走向「全天候系統」的必要轉變。

而現在，系列的架構核心已基本完成：

$$
\boxed{
\text{State}
+
\text{Event}
+
\text{Router}
+
\text{Layered Models}
}
$$

下一篇將把這一整套抽象架構真正落到硬體：

**《迷你具身智能的本地計算核心：Jetson、x86、ARM 與外部主腦》**

---

# 參考資料

1. Ding, D. et al. (2024). *Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing*. ICLR 2024.  
   https://proceedings.iclr.cc/paper_files/paper/2024/hash/b47d93c99fa22ac0b377578af0a1f63a-Abstract-Conference.html

2. Nie, L. et al. (2024). *Online Cascade Learning for Efficient Inference over Streams*. ICML 2024, PMLR 235.  
   https://proceedings.mlr.press/v235/nie24a.html

3. Ding, D. et al. (2025). *BEST-Route: Adaptive LLM Routing with Test-Time Optimal Compute*. ICML 2025, PMLR 267.  
   https://proceedings.mlr.press/v267/ding25d.html

4. Gupta, N. et al. (2024). *Language Model Cascades: Token-Level Uncertainty And Beyond*. ICLR 2024.  
   https://research.google/pubs/language-model-cascades-token-level-uncertainty-and-beyond/

5. Chen, L., Zaharia, M., & Zou, J. (2023). *FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance*.  
   https://arxiv.org/abs/2305.05176

6. Kolawole, S. et al. (2024). *Agreement-Based Cascading for Efficient Inference*.  
   https://arxiv.org/abs/2407.02348

7. Zhang, X. et al. (2024). *Efficient Contextual LLM Cascades through Budget-Constrained Policy Learning*.  
   https://arxiv.org/abs/2404.13082

8. Panda, A. et al. (2024). *Dense Backpropagation Improves Routing for Sparsely-Gated Mixture-of-Experts*. NeurIPS ENLSP Workshop, PMLR 262.  
   https://proceedings.mlr.press/v262/panda24a.html

9. Huang, Z. et al. (2025). *RouterEval: A Comprehensive Benchmark for Routing LLMs to Explore Model-level Scaling Up in LLMs*. Findings of EMNLP 2025.  
   https://aclanthology.org/2025.findings-emnlp.208/
