← Archive
lm-002100 · 2026-08

05_按需智能_事件驅動多模型路由與稀疏推理

下載 MD 檔 ⬇

按需智能:事件驅動、多模型路由與稀疏推理

系列:狀態驅動的本地具身 AI|第 5 篇
版本:v0.1
日期:2026-08-01


摘要

當 AI 被部署到機器人、手機、眼鏡與長期 Agent Runtime 中,一個常見但昂貴的假設是:只要系統正在運行,大型模型就應持續參與每一次感知、判斷與決策。本文主張相反:真正可持續的本地具身智能應是「按需智能(On-Demand Intelligence)」——世界狀態持續存在,但高成本模型只在事件、困難度、不確定性或後果等條件需要時才被喚醒。

本文把這種架構拆成三種不同的「稀疏性」:第一,時間上的呼叫稀疏,即不是每個事件都呼叫模型;第二,模型層級的路由稀疏,即不同事件分配給規則、小模型、大模型或雲端模型;第三,模型內部的計算稀疏,例如 Mixture-of-Experts(MoE)只啟用部分專家。三者概念相關但不能混為一談。

近年 LLM routing 與 cascade 研究已證明這一路線的實用價值。ICLR 2024 的 Hybrid LLM 以查詢難度在小模型與大模型間路由,實驗中可減少最多約 40% 的大型模型呼叫而不降低回答品質;ICML 2024 的 Online Cascade Learning 則在資料流場景中以小模型先處理、困難案例再遞交 LLM,部分實驗將推論成本降低最高約 90%;ICML 2025 的 BEST-Route 更把「使用哪個模型、生成幾個候選」共同納入 test-time compute 決策,在其測試中最高可降低約 60% 成本而性能下降少於 1%。這些結果並不直接等同於具身控制,但它們證明了「不是所有輸入都需要最昂貴模型」這一基本原理。

本文進一步提出一個具身 Agent Router:

rt=R(Et,St,Gt,Ut,Bt,Pt),r_t = R(E_t,S_t,G_t,U_t,B_t,P_t),

其中路由器根據事件、世界狀態、當前目標、不確定性、資源預算與權限,選擇「不推理、規則處理、小模型、本地大模型、雲端模型或多模型協作」。如此,AI 的持續性由世界狀態提供,而不是靠大型模型持續運算來維持。

關鍵詞: 按需智能、事件驅動、多模型路由、稀疏推理、LLM Cascade、Hybrid LLM、Mixture-of-Experts、本地 AI、具身智能、世界狀態機


1. 一個關鍵誤解:持續存在不等於持續大模型推理

如果我們希望一個 AI 角色「一直存在」,很容易直覺地把它理解成:

AI AliveLLM Continuously Running.\text{AI Alive} \Rightarrow \text{LLM Continuously Running}.

但這個推論沒有必要。

一台機器人在待機時仍然:

  • 知道自己是誰;
  • 知道主人在哪裡;
  • 保存當前任務;
  • 持續監測電量;
  • 感知是否有人靠近;
  • 維持時間、事件與記憶;

並不要求一個 20B、70B 甚至更大的模型每秒都重新推理。

更合理的是:

Persistent StatePersistent High-Cost Inference\boxed{ \text{Persistent State} \neq \text{Persistent High-Cost Inference} }

真正持續的是:

St,S_t,

而不是:

Mlarge(t).M_{\mathrm{large}}(t).

大型模型可以睡著。

世界狀態不能睡著。


2. 從輪詢式 AI 轉向事件驅動 AI

一個低效率 Agent 可以採用固定輪詢:

每 500 ms:
    讀攝影機
    讀麥克風
    讀所有感測器
    組 Prompt
    呼叫大模型
    問「現在要做什麼?」

其成本近似:

C(T)TΔtCLLM.C(T) \propto \frac{T}{\Delta t} C_{\mathrm{LLM}}.

只要運行時間 TT 增加,成本線性累積。

事件驅動架構則不同:

Sensor Stream
    ↓
Event Detector
    ↓
World-State Update
    ↓
Trigger?
 ┌──┴───┐
 No     Yes
 │       │
Stop   Route Intelligence

只有:

Γ(Et,St)=1\Gamma(E_t,S_t)=1

時才進一步喚醒高階能力。

例如:

  • 溫度正常波動:只更新 state;
  • 熟悉的人走進房間:啟動社交策略;
  • 使用者叫名字:啟動語音處理;
  • 路徑被未知障礙阻塞:升級視覺/規劃;
  • 使用者問開放式問題:呼叫 LLM;
  • 電池低於門檻:直接執行回充,不必問 LLM。

因此:

Observe continuously;reason expensively only when necessary.\boxed{ \text{Observe continuously;} \quad \text{reason expensively only when necessary.} }

3. 「稀疏推理」其實有三種完全不同的層級

本系列使用「稀疏推理」時,至少應區分三層。

3.1 時間稀疏:Temporal Invocation Sparsity

不是每個時間點都呼叫模型。

定義模型啟動指示:

zt{0,1}.z_t\in\{0,1\}.

若:

zt=0,z_t=0,

代表該事件完全由規則、控制器或狀態更新處理。

總推論成本:

Ctotal=tztCt.C_{\mathrm{total}} = \sum_t z_t C_t.

只要:

E[zt]1,\mathbb E[z_t]\ll1,

系統就能長期運作而不讓大模型持續滿載。


3.2 模型稀疏:Model-Level Routing

即使需要模型,也不代表每次都使用最大模型。

可以有:

M={Mtiny,Msmall,Mlocal,Mlarge,Mcloud}.\mathcal M= \{ M_{\mathrm{tiny}}, M_{\mathrm{small}}, M_{\mathrm{local}}, M_{\mathrm{large}}, M_{\mathrm{cloud}} \}.

Router 選擇:

mt=R(xt).m_t=R(x_t).

這正是 Hybrid LLM、LLM cascade 與近年 model routing 文獻所研究的主要問題。


3.3 模型內部稀疏:MoE Sparse Activation

MoE 則是在一個模型內部:

TokenRouterTop-k Experts.\text{Token} \rightarrow \text{Router} \rightarrow \text{Top-}k\text{ Experts}.

例如模型有 NN 個 experts,但每個 token 只啟用:

kN.k\ll N.

這可以降低單 token 的有效計算量,並提升參數規模與計算成本之間的效率。

但:

MoE RoutingAgent Model Routing\boxed{ \text{MoE Routing} \neq \text{Agent Model Routing} }

前者在模型內選專家。

後者是在 Runtime 中決定要不要用模型、用哪個模型。

三種 sparsity 可以同時存在,但不能概念混用。


4. Router 到底在決定什麼?

在具身 AI 中,Router 不只是:

這題要用 7B 還是 70B?

它更像:

rt=R(Et,St,Gt,Ut,Bt,Pt),r_t = R( E_t, S_t, G_t, U_t, B_t, P_t ),

其中:

  • EtE_t :事件;
  • StS_t :世界狀態;
  • GtG_t :當前目標;
  • UtU_t :不確定性;
  • BtB_t :算力、能源、延遲與金錢預算;
  • PtP_t :權限、安全與隱私政策。

Router 的輸出可以是:

rt{NONE,RULE,TINY,SMALL,LOCAL-LARGE,CLOUD,MULTI}.r_t\in \{ \text{NONE}, \text{RULE}, \text{TINY}, \text{SMALL}, \text{LOCAL-LARGE}, \text{CLOUD}, \text{MULTI} \}.

因此:

「不呼叫任何模型」本身就是一個合法而重要的 routing decision。


5. 第一級:零模型處理

大量具身事件根本不需要生成式模型。

例如:

battery < 10%
→ return_to_charger

或:

cliff_sensor = true
→ stop

或者:

wake_word not detected
→ do not activate ASR

形式上:

R(Et,St)=RULE.R(E_t,S_t)=\text{RULE}.

這類事件的優勢是:

  • 確定性高;
  • 延遲低;
  • 能耗低;
  • 容易測試;
  • 不受模型幻覺影響。

因此大模型的存在不應消滅規則。

規則反而成為一種:

Zero-Inference Intelligence Path\boxed{ \text{Zero-Inference Intelligence Path} }

6. 第二級:小模型常駐

比純規則複雜、但不值得喚醒大型模型的工作,可以交給小模型。

例如:

  • 喚醒詞;
  • VAD;
  • 情緒粗分類;
  • 人臉辨識;
  • 手勢辨識;
  • 意圖分類;
  • 事件難度預測;
  • 是否需要 LLM 的判定。

所以一個本地 AI Runtime 可以常駐:

Mrouter0.1B3BM_{\mathrm{router}}\approx 0.1B\sim3B

甚至完全不是 LLM,而是:

  • classifier;
  • tree model;
  • embedding similarity;
  • deterministic policy。

重要的是:

Router 本身不能貴到跟被路由的大模型差不多。

如果每次為了決定「要不要叫 70B」而先叫一次 70B,就失去意義。


7. 第三級:本地日常模型

許多日常互動其實不需要前沿最大模型。

例如:

  • 「幾點了?」
  • 「跟著我。」
  • 「不要吵。」
  • 「把音量小一點。」
  • 簡單閒聊;
  • 常見家居控制;
  • 既有技能選擇。

可以由較小的本地多模態模型處理。

因此:

MdailyM_{\mathrm{daily}}

可以是常見的 3B、7B、14B 或其他適合當時硬體的模型。

它的價值不是 benchmark 最強,而是:

low latency+privacy+offline availability.\text{low latency} + \text{privacy} + \text{offline availability}.

8. 第四級:本地高階模型或雲端模型

當事件出現:

  • 高語義複雜度;
  • 長規劃鏈;
  • 大量文件;
  • 未見情境;
  • 深度程式/數學;
  • 跨模態理解;

才升級:

MdailyMlarge.M_{\mathrm{daily}} \rightarrow M_{\mathrm{large}}.

若本地算力不足,再:

MlargeMcloud.M_{\mathrm{large}} \rightarrow M_{\mathrm{cloud}}.

這形成:

RuleSmallLocal LargeCloud Frontier\boxed{ \text{Rule} \rightarrow \text{Small} \rightarrow \text{Local Large} \rightarrow \text{Cloud Frontier} }

但這不是固定每次都走完整鏈。

任何一層只要成功,都可以終止 escalation。


9. LLM Cascade 已經證明這種想法具有實際價值

2023 年 FrugalGPT 系統性提出 LLM cascade:不同模型在成本與能力上具有差異,因此可以學習如何針對不同查詢組合與遞交模型。

ICLR 2024 的 Hybrid LLM 更明確提出:

small model for easier queries+large model for harder queries.\text{small model for easier queries} \quad+\quad \text{large model for harder queries}.

其實驗報告在不降低回應品質的條件下,最多減少約 40%40\% 的大型模型呼叫。

2024 年 ICML 的 Online Cascade Learning 把這個思想放到資料流場景:低成本模型先處理輸入,只有需要時才 defer 到 LLM;在其四個 benchmark 中,推論成本最高降低約 90%90\% ,同時維持接近大型模型的準確率。

2025 年 ICML 的 BEST-Route 則進一步不只決定模型,也決定:

nsample,n_{\mathrm{sample}},

即要從該模型產生多少候選,再共同最佳化 quality 與 test-time compute。該研究報告最高約 60%60\% 成本下降而性能損失少於 1%1\%

這些實驗的任務與機器人並不相同。

但它們共同支持:

Uniform maximum compute per query is usually unnecessary.\boxed{ \text{Uniform maximum compute per query is usually unnecessary.} }

10. 難度不是唯一的 routing 變數

傳統 LLM routing 很自然以:

D(x)=query difficultyD(x)=\text{query difficulty}

決定模型。

但具身系統還有更重要的維度。

例如:

R=f(D,C,L,E,P,Q),R= f( D, C, L, E, P, Q ),

其中:

  • DD :difficulty;
  • CC :consequence;
  • LL :latency requirement;
  • EE :energy budget;
  • PP :privacy;
  • QQ :required quality。

例如:

「講個笑話。」

可能:

D,C,D\approx低, \quad C\approx低,

小模型足夠。

但:

「這瓶藥是不是主人剛剛要我拿的那一瓶?」

即使語言問題不難:

D,D\approx中,

其物理後果:

C.C\approx高.

此時 Router 可能應該:

  • 要求額外視覺確認;
  • 交叉檢查;
  • 不確定時拒絕;
  • 請人類確認。

因此:

Routing should depend on consequence, not only difficulty.\boxed{ \text{Routing should depend on consequence, not only difficulty.} }

11. 不確定性可以作為 escalation trigger

一個很自然的 deferral policy 是:

U(x)>θescalate.U(x)>\theta \Rightarrow \text{escalate}.

其中 UU 是不確定性。

但生成模型的不確定性並不好定義。

ICLR 2024 的 Language Model Cascades 研究指出,生成任務不像簡單分類,不能直接把單一分類機率當作 confidence;token-level uncertainty、長度偏差與表徵資訊都會影響 deferral quality。

因此具身 Router 不應只相信:

model_confidence = 0.92

而可以綜合:

  • 小模型自評;
  • logits/entropy;
  • 多模型一致性;
  • 感測器可信度;
  • 是否超出已知技能;
  • 世界狀態衝突;
  • 任務後果。

即:

Ut=F(Umodel,Usensor,Ustate,Utask).U_t = F( U_{\mathrm{model}}, U_{\mathrm{sensor}}, U_{\mathrm{state}}, U_{\mathrm{task}} ).

12. 多模型一致性可以作為「要不要升級」的訊號

2024 年 Agreement-Based Cascading 提出一種直觀方法:

如果多個較小模型在某一層達成足夠一致:

Agree(M1,M2,)>θ,\operatorname{Agree}(M_1,M_2,\ldots)>\theta,

就不需要呼叫更大的模型。

若分歧:

Agree<θ,\operatorname{Agree}<\theta,

則升級。

這在具身系統可以轉化成:

vision_small_1: cup
vision_small_2: bottle
state_memory: expected cup
→ ambiguity
→ call stronger VLM

而不是一看到影像就直接呼叫最大 VLM。

這形成:

Cheap disagreement detectionExpensive resolution.\boxed{ \text{Cheap disagreement detection} \rightarrow \text{Expensive resolution}. }

13. Router 不應頻繁震盪

如果:

small → large → small → large → small

每幾百毫秒切一次,系統會出現:

  • cache thrashing;
  • 模型載入成本;
  • 記憶切換;
  • 延遲尖峰;
  • 能耗增加。

因此 Router 需要 hysteresis。

例如:

U>θupupgrade,U>\theta_{\mathrm{up}} \Rightarrow \text{upgrade},

但只有:

U<θdownU<\theta_{\mathrm{down}}

才 downgrade,且:

θdown<θup.\theta_{\mathrm{down}} < \theta_{\mathrm{up}}.

也可以設定最短 residency time:

Tmin.T_{\mathrm{min}}.

這在手機與機器人的有限功耗平台尤其重要。


14. 路由不是每一次都要從零學

如果某個事件模式已經反覆出現:

主人說「我要睡了」
→ 降低音量
→ 關閉主動互動
→ 進入夜間狀態

系統一開始可能需要 LLM 理解。

但在穩定確認後,可以把它編譯成:

Known PatternCheap Policy.\text{Known Pattern} \rightarrow \text{Cheap Policy}.

這形成一個有趣的學習方向:

Expensive reasoningvalidated reusable rule\boxed{ \text{Expensive reasoning} \rightarrow \text{validated reusable rule} }

也就是讓大模型負責「第一次理解」,Runtime 負責「之後便宜地重複」。

這種 amortization 對長期 Agent 特別重要。


15. 小模型可以向大模型學習,讓大模型越來越少出場

Online Cascade Learning 提出的一個重要方向是:

小模型可以從過去 LLM 的示範持續學習。

具身 Runtime 可以記錄:

(Et,St)AtLLM.(E_t,S_t) \rightarrow A_t^{\mathrm{LLM}}.

當相同模式累積足夠資料後:

MsmallDistill(Mlarge).M_{\mathrm{small}} \leftarrow \operatorname{Distill}(M_{\mathrm{large}}).

於是時間越久:

P(need large model).P(\text{need large model})\downarrow.

這是一種很實際的「個人化本地智能成長」:

不是讓裝置上的模型無限制自我修改,

而是把大量重複、高頻、低風險模式逐步蒸餾到更便宜的本地策略中。


16. 本地/雲端 routing 也是隱私 routing

假設事件包含:

  • 相機畫面;
  • 私人對話;
  • 文件;
  • 家中布局;
  • 個人記憶。

Router 不只要問:

哪個模型最強?

還要問:

這個資料允不允許離開本地?

因此可以有:

Pprivacy(x){local-only,cloud-ok}.P_{\mathrm{privacy}}(x)\in\{\text{local-only},\text{cloud-ok}\}.

若:

Pprivacy=local-only,P_{\mathrm{privacy}}=\text{local-only},

即使本地模型較弱,也不能自動升級到雲端。

這時可能選擇:

  • 本地大模型;
  • 降級完成;
  • 要求使用者授權;
  • 拒絕任務。

因此:

Model routing is also data-governance routing.\boxed{ \text{Model routing is also data-governance routing.} }

17. 本地 AI 手機尤其需要這種架構

手機的限制不是一次能不能跑大型模型,而是:

能不能全天候跑而不把電池、熱量與記憶體吃光?

假設一支 AI 手機有:

  • always-on sensor hub;
  • 小型 NPU;
  • 7B 日常模型;
  • 20B 高階模型;
  • 雲端前沿模型。

可以採用:

Sensor HubEvent DetectorSmall Router{No LLM7B20BCloud\text{Sensor Hub} \rightarrow \text{Event Detector} \rightarrow \text{Small Router} \rightarrow \begin{cases} \text{No LLM}\\ \text{7B}\\ \text{20B}\\ \text{Cloud} \end{cases}

大部分時間:

M20B=sleep.M_{20B}=\text{sleep}.

只有在重要事件發生時喚醒。

這比要求 20B 模型「一直有意識地盯著所有事情」更接近現實可用的個人 AI 主機。


18. 一個迷你具身機器人的完整按需流程

假設二白式機器人正在房間待機。

Event 1:風扇聲變大

audio classifier = environmental noise

Router:

R=NONE.R=\text{NONE}.

只更新狀態。


Event 2:有人叫「二白」

Wake-word detector:

R=SMALL.R=\text{SMALL}.

啟動 ASR 與視線轉向。


Event 3:「過來一下」

意圖分類高度確定:

U<θ.U<\theta.

直接映射既有 skill:

R=RULE/BT.R=\text{RULE/BT}.

不需要大模型。


Event 4:「你覺得我今天是不是有點怪?」

這是開放式社交語義:

R=LOCAL-LARGE.R=\text{LOCAL-LARGE}.

讀取:

ϕ(St)\phi(S_t)

中的近期互動與人物狀態後回答。


Event 5:「幫我看看這個奇怪的電路板是不是壞了。」

本地模型能力不足:

U>θ.U>\theta.

若使用者允許上傳圖片:

R=CLOUD.R=\text{CLOUD}.

若隱私政策禁止:

R=LOCAL-LARGE / DECLINE.R=\text{LOCAL-LARGE / DECLINE}.

這就是完整的按需智能。


19. 不要把所有事件都升級,也不要把所有事情都壓到小模型

這套架構有兩個相反的失敗模式。

過度升級

P(large)1.P(\text{large})\approx1.

結果:

  • 浪費電;
  • 浪費錢;
  • 高延遲;
  • 本地能力形同虛設。

過度節省

P(large)0.P(\text{large})\approx0.

結果:

  • 困難任務品質差;
  • 錯誤無法被糾正;
  • 小模型超出能力仍硬答。

真正的目標是最佳化:

J=QλcCλlLλeEλrRrisk,J = Q -\lambda_c C -\lambda_l L -\lambda_e E -\lambda_r R_{\mathrm{risk}},

其中:

  • QQ :品質;
  • CC :金錢/算力成本;
  • LL :延遲;
  • EE :能源;
  • RriskR_{\mathrm{risk}} :風險。

Router 的目標不是:

minC\min C

也不是:

maxQ\max Q

而是找到當下情境合理的 trade-off。


20. 與 MoE 的最終關係:從 token routing 到 existence routing

MoE 的核心直覺是:

不是每個 token 都需要全部參數。\text{不是每個 token 都需要全部參數。}

多模型 Router 的核心直覺是:

不是每個任務都需要最大模型。\text{不是每個任務都需要最大模型。}

事件驅動 Runtime 的核心直覺則更進一步:

不是每個世界變化都需要生成式推理。\boxed{ \text{不是每個世界變化都需要生成式推理。} }

因此可以看到三層遞進:

Expert SparsityModel SparsityTemporal Intelligence Sparsity.\text{Expert Sparsity} \subset \text{Model Sparsity} \subset \text{Temporal Intelligence Sparsity}.

這不是嚴格的集合論包含,而是一種架構層級的類比。

真正重要的是:

智能系統可以持續存在,但計算不需要持續以最高密度發生。


21. 「按需智能」真正改變了什麼?

傳統想像:

Strong AI=One Very Strong Model.\text{Strong AI} = \text{One Very Strong Model}.

按需智能則變成:

Strong AI System=Persistent State+Cheap Reflex+Router+Model Pool+Escalation Policy.\text{Strong AI System} = \text{Persistent State} + \text{Cheap Reflex} + \text{Router} + \text{Model Pool} + \text{Escalation Policy}.

因此總體能力不再由單一模型完全決定。

一個較小本地模型,配合:

  • 正確世界狀態;
  • 優秀路由;
  • 可重用技能;
  • 雲端升級;
  • 可靠安全層;

可能在真實長期任務中比「每件事都問最大模型」更快、更便宜、更穩定。


22. 結論:智能不必一直燃燒

完成世界狀態機之後,我們得到一個重要推論:

如果:

StS_t

一直存在,

那麼:

MlargeM_{\mathrm{large}}

不必一直存在於 active inference 狀態。

因此:

Persistent Agent=Persistent State+Intermittent High-Cost Intelligence.\boxed{ \text{Persistent Agent} = \text{Persistent State} + \text{Intermittent High-Cost Intelligence}. }

模型可以睡眠。

推理可以稀疏。

雲端可以離線。

但:

  • 世界狀態仍在;
  • 任務仍在;
  • 身體仍在;
  • 安全層仍在;
  • 事件仍在被監聽。

這正是本地具身 AI 能夠從「Demo」走向「全天候系統」的必要轉變。

而現在,系列的架構核心已基本完成:

State+Event+Router+Layered Models\boxed{ \text{State} + \text{Event} + \text{Router} + \text{Layered Models} }

下一篇將把這一整套抽象架構真正落到硬體:

《迷你具身智能的本地計算核心:Jetson、x86、ARM 與外部主腦》


參考資料

  1. Ding, D. et al. (2024). Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing. ICLR 2024.
    https://proceedings.iclr.cc/paper_files/paper/2024/hash/b47d93c99fa22ac0b377578af0a1f63a-Abstract-Conference.html

  2. Nie, L. et al. (2024). Online Cascade Learning for Efficient Inference over Streams. ICML 2024, PMLR 235.
    https://proceedings.mlr.press/v235/nie24a.html

  3. Ding, D. et al. (2025). BEST-Route: Adaptive LLM Routing with Test-Time Optimal Compute. ICML 2025, PMLR 267.
    https://proceedings.mlr.press/v267/ding25d.html

  4. Gupta, N. et al. (2024). Language Model Cascades: Token-Level Uncertainty And Beyond. ICLR 2024.
    https://research.google/pubs/language-model-cascades-token-level-uncertainty-and-beyond/

  5. Chen, L., Zaharia, M., & Zou, J. (2023). FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance.
    https://arxiv.org/abs/2305.05176

  6. Kolawole, S. et al. (2024). Agreement-Based Cascading for Efficient Inference.
    https://arxiv.org/abs/2407.02348

  7. Zhang, X. et al. (2024). Efficient Contextual LLM Cascades through Budget-Constrained Policy Learning.
    https://arxiv.org/abs/2404.13082

  8. Panda, A. et al. (2024). Dense Backpropagation Improves Routing for Sparsely-Gated Mixture-of-Experts. NeurIPS ENLSP Workshop, PMLR 262.
    https://proceedings.mlr.press/v262/panda24a.html

  9. Huang, Z. et al. (2025). RouterEval: A Comprehensive Benchmark for Routing LLMs to Explore Model-level Scaling Up in LLMs. Findings of EMNLP 2025.
    https://aclanthology.org/2025.findings-emnlp.208/