按需智能:事件驅動、多模型路由與稀疏推理
系列:狀態驅動的本地具身 AI|第 5 篇
版本:v0.1
日期:2026-08-01
摘要
當 AI 被部署到機器人、手機、眼鏡與長期 Agent Runtime 中,一個常見但昂貴的假設是:只要系統正在運行,大型模型就應持續參與每一次感知、判斷與決策。本文主張相反:真正可持續的本地具身智能應是「按需智能(On-Demand Intelligence)」——世界狀態持續存在,但高成本模型只在事件、困難度、不確定性或後果等條件需要時才被喚醒。
本文把這種架構拆成三種不同的「稀疏性」:第一,時間上的呼叫稀疏,即不是每個事件都呼叫模型;第二,模型層級的路由稀疏,即不同事件分配給規則、小模型、大模型或雲端模型;第三,模型內部的計算稀疏,例如 Mixture-of-Experts(MoE)只啟用部分專家。三者概念相關但不能混為一談。
近年 LLM routing 與 cascade 研究已證明這一路線的實用價值。ICLR 2024 的 Hybrid LLM 以查詢難度在小模型與大模型間路由,實驗中可減少最多約 40% 的大型模型呼叫而不降低回答品質;ICML 2024 的 Online Cascade Learning 則在資料流場景中以小模型先處理、困難案例再遞交 LLM,部分實驗將推論成本降低最高約 90%;ICML 2025 的 BEST-Route 更把「使用哪個模型、生成幾個候選」共同納入 test-time compute 決策,在其測試中最高可降低約 60% 成本而性能下降少於 1%。這些結果並不直接等同於具身控制,但它們證明了「不是所有輸入都需要最昂貴模型」這一基本原理。
本文進一步提出一個具身 Agent Router:
其中路由器根據事件、世界狀態、當前目標、不確定性、資源預算與權限,選擇「不推理、規則處理、小模型、本地大模型、雲端模型或多模型協作」。如此,AI 的持續性由世界狀態提供,而不是靠大型模型持續運算來維持。
關鍵詞: 按需智能、事件驅動、多模型路由、稀疏推理、LLM Cascade、Hybrid LLM、Mixture-of-Experts、本地 AI、具身智能、世界狀態機
1. 一個關鍵誤解:持續存在不等於持續大模型推理
如果我們希望一個 AI 角色「一直存在」,很容易直覺地把它理解成:
但這個推論沒有必要。
一台機器人在待機時仍然:
- 知道自己是誰;
- 知道主人在哪裡;
- 保存當前任務;
- 持續監測電量;
- 感知是否有人靠近;
- 維持時間、事件與記憶;
並不要求一個 20B、70B 甚至更大的模型每秒都重新推理。
更合理的是:
真正持續的是:
而不是:
大型模型可以睡著。
世界狀態不能睡著。
2. 從輪詢式 AI 轉向事件驅動 AI
一個低效率 Agent 可以採用固定輪詢:
每 500 ms:
讀攝影機
讀麥克風
讀所有感測器
組 Prompt
呼叫大模型
問「現在要做什麼?」
其成本近似:
只要運行時間 增加,成本線性累積。
事件驅動架構則不同:
Sensor Stream
↓
Event Detector
↓
World-State Update
↓
Trigger?
┌──┴───┐
No Yes
│ │
Stop Route Intelligence
只有:
時才進一步喚醒高階能力。
例如:
- 溫度正常波動:只更新 state;
- 熟悉的人走進房間:啟動社交策略;
- 使用者叫名字:啟動語音處理;
- 路徑被未知障礙阻塞:升級視覺/規劃;
- 使用者問開放式問題:呼叫 LLM;
- 電池低於門檻:直接執行回充,不必問 LLM。
因此:
3. 「稀疏推理」其實有三種完全不同的層級
本系列使用「稀疏推理」時,至少應區分三層。
3.1 時間稀疏:Temporal Invocation Sparsity
不是每個時間點都呼叫模型。
定義模型啟動指示:
若:
代表該事件完全由規則、控制器或狀態更新處理。
總推論成本:
只要:
系統就能長期運作而不讓大模型持續滿載。
3.2 模型稀疏:Model-Level Routing
即使需要模型,也不代表每次都使用最大模型。
可以有:
Router 選擇:
這正是 Hybrid LLM、LLM cascade 與近年 model routing 文獻所研究的主要問題。
3.3 模型內部稀疏:MoE Sparse Activation
MoE 則是在一個模型內部:
例如模型有 個 experts,但每個 token 只啟用:
這可以降低單 token 的有效計算量,並提升參數規模與計算成本之間的效率。
但:
前者在模型內選專家。
後者是在 Runtime 中決定要不要用模型、用哪個模型。
三種 sparsity 可以同時存在,但不能概念混用。
4. Router 到底在決定什麼?
在具身 AI 中,Router 不只是:
這題要用 7B 還是 70B?
它更像:
其中:
- :事件;
- :世界狀態;
- :當前目標;
- :不確定性;
- :算力、能源、延遲與金錢預算;
- :權限、安全與隱私政策。
Router 的輸出可以是:
因此:
「不呼叫任何模型」本身就是一個合法而重要的 routing decision。
5. 第一級:零模型處理
大量具身事件根本不需要生成式模型。
例如:
battery < 10%
→ return_to_charger
或:
cliff_sensor = true
→ stop
或者:
wake_word not detected
→ do not activate ASR
形式上:
這類事件的優勢是:
- 確定性高;
- 延遲低;
- 能耗低;
- 容易測試;
- 不受模型幻覺影響。
因此大模型的存在不應消滅規則。
規則反而成為一種:
6. 第二級:小模型常駐
比純規則複雜、但不值得喚醒大型模型的工作,可以交給小模型。
例如:
- 喚醒詞;
- VAD;
- 情緒粗分類;
- 人臉辨識;
- 手勢辨識;
- 意圖分類;
- 事件難度預測;
- 是否需要 LLM 的判定。
所以一個本地 AI Runtime 可以常駐:
甚至完全不是 LLM,而是:
- classifier;
- tree model;
- embedding similarity;
- deterministic policy。
重要的是:
Router 本身不能貴到跟被路由的大模型差不多。
如果每次為了決定「要不要叫 70B」而先叫一次 70B,就失去意義。
7. 第三級:本地日常模型
許多日常互動其實不需要前沿最大模型。
例如:
- 「幾點了?」
- 「跟著我。」
- 「不要吵。」
- 「把音量小一點。」
- 簡單閒聊;
- 常見家居控制;
- 既有技能選擇。
可以由較小的本地多模態模型處理。
因此:
可以是常見的 3B、7B、14B 或其他適合當時硬體的模型。
它的價值不是 benchmark 最強,而是:
8. 第四級:本地高階模型或雲端模型
當事件出現:
- 高語義複雜度;
- 長規劃鏈;
- 大量文件;
- 未見情境;
- 深度程式/數學;
- 跨模態理解;
才升級:
若本地算力不足,再:
這形成:
但這不是固定每次都走完整鏈。
任何一層只要成功,都可以終止 escalation。
9. LLM Cascade 已經證明這種想法具有實際價值
2023 年 FrugalGPT 系統性提出 LLM cascade:不同模型在成本與能力上具有差異,因此可以學習如何針對不同查詢組合與遞交模型。
ICLR 2024 的 Hybrid LLM 更明確提出:
其實驗報告在不降低回應品質的條件下,最多減少約 的大型模型呼叫。
2024 年 ICML 的 Online Cascade Learning 把這個思想放到資料流場景:低成本模型先處理輸入,只有需要時才 defer 到 LLM;在其四個 benchmark 中,推論成本最高降低約 ,同時維持接近大型模型的準確率。
2025 年 ICML 的 BEST-Route 則進一步不只決定模型,也決定:
即要從該模型產生多少候選,再共同最佳化 quality 與 test-time compute。該研究報告最高約 成本下降而性能損失少於 。
這些實驗的任務與機器人並不相同。
但它們共同支持:
10. 難度不是唯一的 routing 變數
傳統 LLM routing 很自然以:
決定模型。
但具身系統還有更重要的維度。
例如:
其中:
- :difficulty;
- :consequence;
- :latency requirement;
- :energy budget;
- :privacy;
- :required quality。
例如:
「講個笑話。」
可能:
小模型足夠。
但:
「這瓶藥是不是主人剛剛要我拿的那一瓶?」
即使語言問題不難:
其物理後果:
此時 Router 可能應該:
- 要求額外視覺確認;
- 交叉檢查;
- 不確定時拒絕;
- 請人類確認。
因此:
11. 不確定性可以作為 escalation trigger
一個很自然的 deferral policy 是:
其中 是不確定性。
但生成模型的不確定性並不好定義。
ICLR 2024 的 Language Model Cascades 研究指出,生成任務不像簡單分類,不能直接把單一分類機率當作 confidence;token-level uncertainty、長度偏差與表徵資訊都會影響 deferral quality。
因此具身 Router 不應只相信:
model_confidence = 0.92
而可以綜合:
- 小模型自評;
- logits/entropy;
- 多模型一致性;
- 感測器可信度;
- 是否超出已知技能;
- 世界狀態衝突;
- 任務後果。
即:
12. 多模型一致性可以作為「要不要升級」的訊號
2024 年 Agreement-Based Cascading 提出一種直觀方法:
如果多個較小模型在某一層達成足夠一致:
就不需要呼叫更大的模型。
若分歧:
則升級。
這在具身系統可以轉化成:
vision_small_1: cup
vision_small_2: bottle
state_memory: expected cup
→ ambiguity
→ call stronger VLM
而不是一看到影像就直接呼叫最大 VLM。
這形成:
13. Router 不應頻繁震盪
如果:
small → large → small → large → small
每幾百毫秒切一次,系統會出現:
- cache thrashing;
- 模型載入成本;
- 記憶切換;
- 延遲尖峰;
- 能耗增加。
因此 Router 需要 hysteresis。
例如:
但只有:
才 downgrade,且:
也可以設定最短 residency time:
這在手機與機器人的有限功耗平台尤其重要。
14. 路由不是每一次都要從零學
如果某個事件模式已經反覆出現:
主人說「我要睡了」
→ 降低音量
→ 關閉主動互動
→ 進入夜間狀態
系統一開始可能需要 LLM 理解。
但在穩定確認後,可以把它編譯成:
這形成一個有趣的學習方向:
也就是讓大模型負責「第一次理解」,Runtime 負責「之後便宜地重複」。
這種 amortization 對長期 Agent 特別重要。
15. 小模型可以向大模型學習,讓大模型越來越少出場
Online Cascade Learning 提出的一個重要方向是:
小模型可以從過去 LLM 的示範持續學習。
具身 Runtime 可以記錄:
當相同模式累積足夠資料後:
於是時間越久:
這是一種很實際的「個人化本地智能成長」:
不是讓裝置上的模型無限制自我修改,
而是把大量重複、高頻、低風險模式逐步蒸餾到更便宜的本地策略中。
16. 本地/雲端 routing 也是隱私 routing
假設事件包含:
- 相機畫面;
- 私人對話;
- 文件;
- 家中布局;
- 個人記憶。
Router 不只要問:
哪個模型最強?
還要問:
這個資料允不允許離開本地?
因此可以有:
若:
即使本地模型較弱,也不能自動升級到雲端。
這時可能選擇:
- 本地大模型;
- 降級完成;
- 要求使用者授權;
- 拒絕任務。
因此:
17. 本地 AI 手機尤其需要這種架構
手機的限制不是一次能不能跑大型模型,而是:
能不能全天候跑而不把電池、熱量與記憶體吃光?
假設一支 AI 手機有:
- always-on sensor hub;
- 小型 NPU;
- 7B 日常模型;
- 20B 高階模型;
- 雲端前沿模型。
可以採用:
大部分時間:
只有在重要事件發生時喚醒。
這比要求 20B 模型「一直有意識地盯著所有事情」更接近現實可用的個人 AI 主機。
18. 一個迷你具身機器人的完整按需流程
假設二白式機器人正在房間待機。
Event 1:風扇聲變大
audio classifier = environmental noise
Router:
只更新狀態。
Event 2:有人叫「二白」
Wake-word detector:
啟動 ASR 與視線轉向。
Event 3:「過來一下」
意圖分類高度確定:
直接映射既有 skill:
不需要大模型。
Event 4:「你覺得我今天是不是有點怪?」
這是開放式社交語義:
讀取:
中的近期互動與人物狀態後回答。
Event 5:「幫我看看這個奇怪的電路板是不是壞了。」
本地模型能力不足:
若使用者允許上傳圖片:
若隱私政策禁止:
這就是完整的按需智能。
19. 不要把所有事件都升級,也不要把所有事情都壓到小模型
這套架構有兩個相反的失敗模式。
過度升級
結果:
- 浪費電;
- 浪費錢;
- 高延遲;
- 本地能力形同虛設。
過度節省
結果:
- 困難任務品質差;
- 錯誤無法被糾正;
- 小模型超出能力仍硬答。
真正的目標是最佳化:
其中:
- :品質;
- :金錢/算力成本;
- :延遲;
- :能源;
- :風險。
Router 的目標不是:
也不是:
而是找到當下情境合理的 trade-off。
20. 與 MoE 的最終關係:從 token routing 到 existence routing
MoE 的核心直覺是:
多模型 Router 的核心直覺是:
事件驅動 Runtime 的核心直覺則更進一步:
因此可以看到三層遞進:
這不是嚴格的集合論包含,而是一種架構層級的類比。
真正重要的是:
智能系統可以持續存在,但計算不需要持續以最高密度發生。
21. 「按需智能」真正改變了什麼?
傳統想像:
按需智能則變成:
因此總體能力不再由單一模型完全決定。
一個較小本地模型,配合:
- 正確世界狀態;
- 優秀路由;
- 可重用技能;
- 雲端升級;
- 可靠安全層;
可能在真實長期任務中比「每件事都問最大模型」更快、更便宜、更穩定。
22. 結論:智能不必一直燃燒
完成世界狀態機之後,我們得到一個重要推論:
如果:
一直存在,
那麼:
不必一直存在於 active inference 狀態。
因此:
模型可以睡眠。
推理可以稀疏。
雲端可以離線。
但:
- 世界狀態仍在;
- 任務仍在;
- 身體仍在;
- 安全層仍在;
- 事件仍在被監聽。
這正是本地具身 AI 能夠從「Demo」走向「全天候系統」的必要轉變。
而現在,系列的架構核心已基本完成:
下一篇將把這一整套抽象架構真正落到硬體:
《迷你具身智能的本地計算核心:Jetson、x86、ARM 與外部主腦》
參考資料
Ding, D. et al. (2024). Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing. ICLR 2024.
https://proceedings.iclr.cc/paper_files/paper/2024/hash/b47d93c99fa22ac0b377578af0a1f63a-Abstract-Conference.htmlNie, L. et al. (2024). Online Cascade Learning for Efficient Inference over Streams. ICML 2024, PMLR 235.
https://proceedings.mlr.press/v235/nie24a.htmlDing, D. et al. (2025). BEST-Route: Adaptive LLM Routing with Test-Time Optimal Compute. ICML 2025, PMLR 267.
https://proceedings.mlr.press/v267/ding25d.htmlGupta, N. et al. (2024). Language Model Cascades: Token-Level Uncertainty And Beyond. ICLR 2024.
https://research.google/pubs/language-model-cascades-token-level-uncertainty-and-beyond/Chen, L., Zaharia, M., & Zou, J. (2023). FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance.
https://arxiv.org/abs/2305.05176Kolawole, S. et al. (2024). Agreement-Based Cascading for Efficient Inference.
https://arxiv.org/abs/2407.02348Zhang, X. et al. (2024). Efficient Contextual LLM Cascades through Budget-Constrained Policy Learning.
https://arxiv.org/abs/2404.13082Panda, A. et al. (2024). Dense Backpropagation Improves Routing for Sparsely-Gated Mixture-of-Experts. NeurIPS ENLSP Workshop, PMLR 262.
https://proceedings.mlr.press/v262/panda24a.htmlHuang, Z. et al. (2025). RouterEval: A Comprehensive Benchmark for Routing LLMs to Explore Model-level Scaling Up in LLMs. Findings of EMNLP 2025.
https://aclanthology.org/2025.findings-emnlp.208/