← Archive
lm-002048 · 2026-08

01_二白機器人_低算力系統為何能產生強烈智能感

下載 MD 檔 ⬇

二白機器人:低算力系統為何能產生強烈智能感?

系列:狀態驅動的本地具身 AI|第 1 篇
版本:v0.1
日期:2026-08-01


摘要

當人們觀看早期「二白」機器人影片時,一個直觀問題會立刻出現:在大型語言模型尚未普及、端側算力遠弱於今日的年代,一台外觀與機械結構並不複雜的小型輪式機器人,為何仍可能呈現出「會看、會躲、會鬧脾氣、會等人、像在理解情境」的智能感?

本文主張,這個問題不應直接化約為「它當時用了哪一個 AI 模型」。對社交型與陪伴型機器人而言,使用者感受到的智能並非只由模型推理能力決定,而是由反應時序、狀態連續性、動作—語言一致性、角色穩定性、感知回饋與人類自身的社會認知機制共同構成

以二白作為案例入口,本文提出一個「低算力強智能感」分析框架:即使高階生成模型只在少數時刻介入,只要底層已有即時控制、感知觸發、角色狀態機、預設行為庫與適當的人類在環機制,系統仍可能形成高度連貫的互動表現。到了大模型時代,同一架構反而更有價值:大模型不必取代狀態機,而可以成為狀態機之上的稀疏高階推理層。

本文不宣稱已取得二白早期系統的完整內部架構。公開資料只能證實二白智能成立於 2019 年、其「我系二白」內容 IP 已長期營運,且 2025 年量產的二白 Mini 對外宣稱使用性格生成、情感引擎、稀疏記憶與自然交互等技術。本文對早期系統的具體實作採取「可行架構重建」而非「事實認定」。

關鍵詞: 二白機器人、具身智能、狀態機、行為樹、人機互動、Wizard of Oz、角色智能、世界狀態、事件驅動、大語言模型


1. 問題不是「2019 年哪來的大模型?」

看到早期二白影片時,最容易產生的誤解是:

如果它看起來有智能,那它裡面一定已經有一個很強的 AI。

這個推論並不成立。

一台機器人「被觀察為有智能」,與它是否具有今日意義上的通用生成模型,是兩個不同問題。

可以先區分:

IsystemI_{\mathrm{system}}

Iperceived.I_{\mathrm{perceived}}.

前者代表系統本身能完成多少感知、推理、規劃與泛化;後者則代表人類在互動中感受到多少智能、意圖、個性與生命感。

兩者有關,但並非線性關係:

IperceivedkIsystem.I_{\mathrm{perceived}} \neq kI_{\mathrm{system}}.

一個知識量龐大的模型,如果永遠慢三秒、完全不看向使用者、動作與語言互相衝突,主觀上反而可能非常「機器」。

相反地,一個能力有限的系統,只要能在正確時刻轉頭、後退、停住、眨眼、發出短促聲音、延續前一個情境,便可能產生非常強的「它知道現在正在發生什麼」的感覺。

因此,研究二白真正有價值的問題不是:

2019 年它到底跑了哪個模型?

而是:

在模型能力有限時,哪些系統結構足以產生連續而可信的智能感?


2. 二白的時間線必須先拆開

根據目前可查的公開資料,杭州二白智能科技有限公司成立於 2019 年。2025 年的公司訪談則稱,「我系二白」帳號矩陣已營運約七年,並在 2025 年 6 月開始預售首款量產產品「二白 Mini」。

這意味著至少需要把二白分為兩種不同對象:

早期二白角色/原型\text{早期二白角色/原型}

後期量產 AI 陪伴機器人.\text{後期量產 AI 陪伴機器人}.

兩者不能直接等同。

目前公司公開宣稱的核心技術包括性格生成算法、情感引擎、稀疏記憶架構與自然交互技術。官方網站也將二白描述為其第一個機器人 IP,並強調每一台二白在與使用者相處中逐步成長。

但這些是今天的產品敘事與技術宣稱,不能反向證明 2018~2019 年的影片已經具備相同技術。

因此本文採取較保守的立場:

早期影片顯示的是「二白角色可以被呈現得非常智能」;至於其中多少來自自主 AI、多少來自腳本、人類操控、規則控制或後製,公開資料不足以精確拆分。


3. 人類在環不是「作弊」,而是正式的人機互動原型方法

在人機互動研究中,早就存在一套成熟方法:Wizard of Oz(WoZ)

它的基本精神是:

使用者看似自主的機器人隱藏的人類操作者.\text{使用者} \leftrightarrow \text{看似自主的機器人} \leftrightarrow \text{隱藏的人類操作者}.

操作者可以控制對話、動作、導航、手勢、回應時機,甚至替代部分尚未完成的感知模組。

WoZ 並不是近年短影片時代才出現的技巧。2009 年已有正式 HRI 研究專門討論用 WoZ 評估人形機器人的使用者體驗;同年 Carnegie Mellon 等研究者也討論了這類方法在人機互動研究中的方法論地位。

因此,如果早期二白曾存在某種:

自動控制+人工介入\text{自動控制} + \text{人工介入}

的混合模式,技術上完全不奇怪。

真正有趣的是:哪些原本由人類操作者完成的判斷,日後可以逐步被狀態機、小模型與大模型替換?


4. 強烈智能感的第一來源:即時性

社交互動首先是一個時間問題。

假設使用者突然說:「二白?」

第一種機器人要等語音上傳、ASR、模型理解、生成文字、生成語音,三秒後才回答。

第二種機器人則在 100100 毫秒內轉頭, 300300 毫秒內發出「嗯?」,同時背景進行完整語義推理,一到兩秒後再給出較長回答。

第二種即使模型比較弱,也更容易被感知為「它聽到了」。

可以把互動反應拆為:

R(t)=Rfast(t)+Rsemantic(t)+Rdeliberative(t).R(t) = R_{\mathrm{fast}}(t) + R_{\mathrm{semantic}}(t) + R_{\mathrm{deliberative}}(t).

其中:

  • RfastR_{\mathrm{fast}} :快速反射;
  • RsemanticR_{\mathrm{semantic}} :語義回應;
  • RdeliberativeR_{\mathrm{deliberative}} :較慢的推理與規劃。

這三者不應全部串行等待,而應部分並行。

2024 年一項人機互動研究發現,機器人在說話前做點頭、搖頭或歪頭等頭部動作,會顯著影響受試者對其自然度、擬人感、生命感、喜愛度與智能的評價;頭部動作出現的時機本身也會影響互動自然度。

因此:

「何時動」本身就是智能感的一部分\boxed{\text{「何時動」本身就是智能感的一部分}}

5. 第二來源:狀態連續性

真正破壞角色智能感的,往往不是知識不足,而是失憶。

假設二白前一秒因為主人踩到它而後退,下一秒卻立刻用完全無關的開朗語氣問:「今天想聊什麼?」

即使後一句語言品質很高,整體角色仍會瞬間崩潰。

因此系統需要持續保存最小狀態:

zt=(ut,ct,qt,mt,gt,rt,bt),z_t = ( u_t, c_t, q_t, m_t, g_t, r_t, b_t ),

其中可以分別表示:

  • utu_t :目前互動者;
  • ctc_t :場景;
  • qtq_t :角色/情緒狀態;
  • mtm_t :短期記憶;
  • gtg_t :當前目標;
  • rtr_t :風險與限制;
  • btb_t :身體狀態。

外部事件到達時,只更新狀態:

zt+1=T(zt,et).z_{t+1}=T(z_t,e_t).

例如:

休息主人呼叫被喚醒再次催促不滿但注意主人靠近互動.\text{休息} \xrightarrow{\text{主人呼叫}} \text{被喚醒} \xrightarrow{\text{再次催促}} \text{不滿但注意} \xrightarrow{\text{主人靠近}} \text{互動}.

這種連續性在 2019 年完全可以使用普通程式碼、有限狀態機、事件表與行為庫實作。


6. 第三來源:角色不是一句 Prompt,而是一個行為約束系統

今天很多 AI 角色系統把人格理解成一段 System Prompt,例如:

你是一個傲嬌、可愛、有點嘴硬的機器人。

這其實很脆弱。

真正的角色一致性至少應包含:

Persona=Language Policy+Action Policy+Memory Policy+State Transition Policy.\text{Persona} = \text{Language Policy} + \text{Action Policy} + \text{Memory Policy} + \text{State Transition Policy}.

也就是說,「二白很傲嬌」不能只意味著它說話像傲嬌,而要進一步約束:

  • 什麼事件會讓它後退;
  • 什麼時候拒絕靠近;
  • 哪些事情它會記住;
  • 被誇獎後如何改變狀態;
  • 生氣多久;
  • 是否主動重新靠近;
  • 語言與動作如何同步。

此時人格不再只是文字風格,而是:

π(atzt,et),\pi(a_t\mid z_t,e_t),

即在目前狀態 ztz_t 與事件 ete_t 下,角色選擇行動 ata_t 的策略。


7. 第四來源:有限動作反而可能有利

迷你機器人的一個優勢是它的行動空間可以非常小。

例如:

A={前進,後退,左轉,右轉,,抬頭,低頭,轉圈,發聲}.A= \{ \text{前進}, \text{後退}, \text{左轉}, \text{右轉}, \text{停}, \text{抬頭}, \text{低頭}, \text{轉圈}, \text{發聲} \}.

有限動作意味著開發者更容易建立完整的角色化行為詞彙。

例如同樣是「拒絕」:

後退+轉開+短促聲音\text{後退} + \text{轉開} + \text{短促聲音}

就足以形成明確的社會信號。

因此,身體越簡單,不一定越難產生角色感;在特定產品中,較小的動作空間反而更容易被完整編排。


8. 一個合理的早期二白架構重建

以下是工程可行性重建,不是二白官方披露架構

攝影機 / 麥克風 / 距離感測器
            │
            ▼
      基本事件偵測
            │
            ▼
      角色有限狀態機
       /      |      \
      /       |       \
預設動作   預設台詞   人類操作者
      \       |       /
       \      |      /
            ▼
       動作仲裁器
            │
            ▼
 馬達 / 表情 / 聲音輸出

如果再加入當時已經成熟的雲端語音能力:

麥克風
  │
  ├──► 喚醒詞 / 關鍵詞 ──► 即時狀態機
  │
  └──► ASR ──► 意圖分類 / 檢索式對話
                      │
                      ▼
                   TTS

這個系統不需要今日的 LLM,也可以在受限情境下產生相當好的效果。

再配合影片腳本、多次拍攝選片、後期配音或遠端人類控制,最後呈現的「智能密度」可以遠高於系統的平均自主能力。

因此不能從剪輯影片直接推導:

P(成功影片)=P(成功任意真實環境).P(\text{成功}\mid\text{影片}) = P(\text{成功}\mid\text{任意真實環境}).

9. 今天的大模型反而讓這種架構真正成熟

大模型出現後,最直觀卻不一定最好的做法,是讓大模型控制一切:

感知LLM所有行動.\text{感知} \rightarrow \text{LLM} \rightarrow \text{所有行動}.

這會帶來延遲、成本、不確定性、行為漂移、安全風險,以及每輪重新理解世界的浪費。

更合理的是:

EventState UpdatePolicy{Direct Action,Call LLM.\text{Event} \rightarrow \text{State Update} \rightarrow \text{Policy} \rightarrow \begin{cases} \text{Direct Action},\\ \text{Call LLM}. \end{cases}

能用狀態機立即解決的,不叫大模型;只有遇到模糊、新穎、開放式問題時才叫大模型。

例如:

事件:主人進門
狀態:主人已辨識、上次離家 8 小時
規則:觸發迎接
→ 直接靠近

事件:主人說「今天公司真的很奇怪」
狀態:開放語義事件
→ 呼叫語言模型

此時 LLM 的合理位置是:

高階語義與未知情境求解器\boxed{\text{高階語義與未知情境求解器}}

而不是所有控制的唯一來源。


10. 第一個一般化結論:智能感是系統級效果

從二白案例可以暫時抽象出:

Ip=F(C,L,S,P,E,M),I_p = F( C, L, S, P, E, M ),

其中:

  • CC :行為一致性;
  • LL :反應延遲與節奏;
  • SS :狀態連續性;
  • PP :角色策略;
  • EE :具身感知與動作耦合;
  • MM :模型能力。

關鍵在於:

IpM\frac{\partial I_p}{\partial M}

並不一定在所有階段都是最大的。

當模型已經「夠用」時,提高狀態連續性、降低反應延遲、增加適當的注視和身體回應,可能比把 7B 模型換成 70B 模型更能提升使用者感受到的智能。

既有人機互動研究也已建立「Perceived Social Intelligence」量表,用來衡量人們對機器人辨識、適應、預測人類行為與情緒等能力的主觀評估。這提醒我們:社會智能本身就具有重要的觀察者層面。


11. 二白真正連到的是世界狀態機

一旦把問題抽象化,二白就不再只是一台可愛機器人。

它指向一個更大的架構:

St+1=F(St,Et,At),S_{t+1}=F(S_t,E_t,A_t),

其中:

  • StS_t :當前世界狀態;
  • EtE_t :新事件;
  • AtA_t :上一輪行動。

AI 不需要每一次都重新問:

現在的世界是什麼?

而應該知道:

世界從上一個狀態變成了什麼?

因此未來具身 Agent 的高效率形式可能不是:

World重新完整理解LLMAction,\text{World} \rightarrow \text{重新完整理解} \rightarrow \text{LLM} \rightarrow \text{Action},

而是:

Persistent World State+Event DeltaState TransitionAction / LLM Escalation.\text{Persistent World State} + \text{Event Delta} \rightarrow \text{State Transition} \rightarrow \text{Action / LLM Escalation}.

這使二白案例自然延伸到遊戲世界 Agent、家庭機器人、AI 手機、AI 眼鏡、個人助手、多設備 Agent 與長期自主 AI。


12. 結論:真正的問題是「如何持續像同一個存在」

二白案例最值得研究的地方,不是證明 2019 年就存在今日的大模型能力。

它提示的是另一條道路:

有限模型+即時反射+持續狀態+角色策略+具身動作\text{有限模型} + \text{即時反射} + \text{持續狀態} + \text{角色策略} + \text{具身動作}

就可能形成:

高於單一模型能力的整體智能感.\text{高於單一模型能力的整體智能感}.

到了大模型時代,這條路線沒有過時,反而變得更加重要。

因為真正長期存在於物理世界中的 AI,不能每一次事件發生後都重新閱讀全部歷史、重新理解自己的角色、重新理解當前世界。

它需要的是:

持續存在的狀態+事件驅動的更新+分層反應+必要時才進行高成本推理\boxed{ \text{持續存在的狀態} + \text{事件驅動的更新} + \text{分層反應} + \text{必要時才進行高成本推理} }

因此,二白不是這個系列的終點,它只是第一個入口。

下一篇將進一步研究其中最重要、也最容易被忽略的原理:

為什麼具身智能應該「先反應,再思考」?


參考資料與來源

以下分為「二白公開資料」與「人機互動研究」。本文對二白早期內部架構的推論,不代表官方披露。

  1. 二白智能官方網站,《二白智能》
    https://robot-by.com/

  2. 36氪,〈从700万粉丝IP到千台实体售罄,这家公司想做“原生机器人IP”的长期陪伴〉,2025-12-24
    https://www.36kr.com/p/3608882030593282

  3. Bilibili,「做二白的毛老师」,〈二白机器人咋来的,先从核心模块讲起吧〉,2024-03-10
    https://www.bilibili.com/video/BV1Aj421f7KW/

  4. Weiss, A. et al. (2009). User experience evaluation with a Wizard of Oz approach: technical and methodological considerations. IEEE-RAS Humanoids 2009.
    https://doi.org/10.1109/ICHR.2009.5379559

  5. Steinfeld, A., Jenkins, O. C., & Scassellati, B. (2009). The Oz of Wizard: Simulating the Human for Interaction Research. HRI 2009.
    https://publications.ri.cmu.edu/the-oz-of-wizard-simulating-the-human-for-interaction-research

  6. Barchard, K. A. et al. (2020). Measuring the Perceived Social Intelligence of Robots. ACM Transactions on Human-Robot Interaction, 9(4).
    https://doi.org/10.1145/3415139

  7. Effect of Robot Head Movement and its Timing on Human-Robot Interaction. International Journal of Social Robotics, 2024.
    https://doi.org/10.1007/s12369-024-01196-0