# 二白機器人：低算力系統為何能產生強烈智能感？

**系列：狀態驅動的本地具身 AI｜第 1 篇**  
**版本：v0.1**  
**日期：2026-08-01**

---

## 摘要

當人們觀看早期「二白」機器人影片時，一個直觀問題會立刻出現：在大型語言模型尚未普及、端側算力遠弱於今日的年代，一台外觀與機械結構並不複雜的小型輪式機器人，為何仍可能呈現出「會看、會躲、會鬧脾氣、會等人、像在理解情境」的智能感？

本文主張，這個問題不應直接化約為「它當時用了哪一個 AI 模型」。對社交型與陪伴型機器人而言，使用者感受到的智能並非只由模型推理能力決定，而是由**反應時序、狀態連續性、動作—語言一致性、角色穩定性、感知回饋與人類自身的社會認知機制共同構成**。

以二白作為案例入口，本文提出一個「低算力強智能感」分析框架：即使高階生成模型只在少數時刻介入，只要底層已有即時控制、感知觸發、角色狀態機、預設行為庫與適當的人類在環機制，系統仍可能形成高度連貫的互動表現。到了大模型時代，同一架構反而更有價值：大模型不必取代狀態機，而可以成為狀態機之上的稀疏高階推理層。

本文不宣稱已取得二白早期系統的完整內部架構。公開資料只能證實二白智能成立於 2019 年、其「我系二白」內容 IP 已長期營運，且 2025 年量產的二白 Mini 對外宣稱使用性格生成、情感引擎、稀疏記憶與自然交互等技術。本文對早期系統的具體實作採取「可行架構重建」而非「事實認定」。

**關鍵詞：** 二白機器人、具身智能、狀態機、行為樹、人機互動、Wizard of Oz、角色智能、世界狀態、事件驅動、大語言模型

---

# 1. 問題不是「2019 年哪來的大模型？」

看到早期二白影片時，最容易產生的誤解是：

> 如果它看起來有智能，那它裡面一定已經有一個很強的 AI。

這個推論並不成立。

一台機器人「被觀察為有智能」，與它是否具有今日意義上的通用生成模型，是兩個不同問題。

可以先區分：

$$
I_{\mathrm{system}}
$$

與

$$
I_{\mathrm{perceived}}.
$$

前者代表系統本身能完成多少感知、推理、規劃與泛化；後者則代表人類在互動中感受到多少智能、意圖、個性與生命感。

兩者有關，但並非線性關係：

$$
I_{\mathrm{perceived}}
\neq
kI_{\mathrm{system}}.
$$

一個知識量龐大的模型，如果永遠慢三秒、完全不看向使用者、動作與語言互相衝突，主觀上反而可能非常「機器」。

相反地，一個能力有限的系統，只要能在正確時刻轉頭、後退、停住、眨眼、發出短促聲音、延續前一個情境，便可能產生非常強的「它知道現在正在發生什麼」的感覺。

因此，研究二白真正有價值的問題不是：

> 2019 年它到底跑了哪個模型？

而是：

> **在模型能力有限時，哪些系統結構足以產生連續而可信的智能感？**

---

# 2. 二白的時間線必須先拆開

根據目前可查的公開資料，杭州二白智能科技有限公司成立於 2019 年。2025 年的公司訪談則稱，「我系二白」帳號矩陣已營運約七年，並在 2025 年 6 月開始預售首款量產產品「二白 Mini」。

這意味著至少需要把二白分為兩種不同對象：

$$
\text{早期二白角色／原型}
$$

與

$$
\text{後期量產 AI 陪伴機器人}.
$$

兩者不能直接等同。

目前公司公開宣稱的核心技術包括性格生成算法、情感引擎、稀疏記憶架構與自然交互技術。官方網站也將二白描述為其第一個機器人 IP，並強調每一台二白在與使用者相處中逐步成長。

但這些是今天的產品敘事與技術宣稱，不能反向證明 2018～2019 年的影片已經具備相同技術。

因此本文採取較保守的立場：

> 早期影片顯示的是「二白角色可以被呈現得非常智能」；至於其中多少來自自主 AI、多少來自腳本、人類操控、規則控制或後製，公開資料不足以精確拆分。

---

# 3. 人類在環不是「作弊」，而是正式的人機互動原型方法

在人機互動研究中，早就存在一套成熟方法：**Wizard of Oz（WoZ）**。

它的基本精神是：

$$
\text{使用者}
\leftrightarrow
\text{看似自主的機器人}
\leftrightarrow
\text{隱藏的人類操作者}.
$$

操作者可以控制對話、動作、導航、手勢、回應時機，甚至替代部分尚未完成的感知模組。

WoZ 並不是近年短影片時代才出現的技巧。2009 年已有正式 HRI 研究專門討論用 WoZ 評估人形機器人的使用者體驗；同年 Carnegie Mellon 等研究者也討論了這類方法在人機互動研究中的方法論地位。

因此，如果早期二白曾存在某種：

$$
\text{自動控制}
+
\text{人工介入}
$$

的混合模式，技術上完全不奇怪。

真正有趣的是：哪些原本由人類操作者完成的判斷，日後可以逐步被狀態機、小模型與大模型替換？

---

# 4. 強烈智能感的第一來源：即時性

社交互動首先是一個時間問題。

假設使用者突然說：「二白？」

第一種機器人要等語音上傳、ASR、模型理解、生成文字、生成語音，三秒後才回答。

第二種機器人則在 $100$ 毫秒內轉頭， $300$ 毫秒內發出「嗯？」，同時背景進行完整語義推理，一到兩秒後再給出較長回答。

第二種即使模型比較弱，也更容易被感知為「它聽到了」。

可以把互動反應拆為：

$$
R(t)
=
R_{\mathrm{fast}}(t)
+
R_{\mathrm{semantic}}(t)
+
R_{\mathrm{deliberative}}(t).
$$

其中：

- $R_{\mathrm{fast}}$ ：快速反射；
- $R_{\mathrm{semantic}}$ ：語義回應；
- $R_{\mathrm{deliberative}}$ ：較慢的推理與規劃。

這三者不應全部串行等待，而應部分並行。

2024 年一項人機互動研究發現，機器人在說話前做點頭、搖頭或歪頭等頭部動作，會顯著影響受試者對其自然度、擬人感、生命感、喜愛度與智能的評價；頭部動作出現的**時機**本身也會影響互動自然度。

因此：

$$
\boxed{\text{「何時動」本身就是智能感的一部分}}
$$

---

# 5. 第二來源：狀態連續性

真正破壞角色智能感的，往往不是知識不足，而是失憶。

假設二白前一秒因為主人踩到它而後退，下一秒卻立刻用完全無關的開朗語氣問：「今天想聊什麼？」

即使後一句語言品質很高，整體角色仍會瞬間崩潰。

因此系統需要持續保存最小狀態：

$$
z_t
=
(
u_t,
c_t,
q_t,
m_t,
g_t,
r_t,
b_t
),
$$

其中可以分別表示：

- $u_t$ ：目前互動者；
- $c_t$ ：場景；
- $q_t$ ：角色／情緒狀態；
- $m_t$ ：短期記憶；
- $g_t$ ：當前目標；
- $r_t$ ：風險與限制；
- $b_t$ ：身體狀態。

外部事件到達時，只更新狀態：

$$
z_{t+1}=T(z_t,e_t).
$$

例如：

$$
\text{休息}
\xrightarrow{\text{主人呼叫}}
\text{被喚醒}
\xrightarrow{\text{再次催促}}
\text{不滿但注意}
\xrightarrow{\text{主人靠近}}
\text{互動}.
$$

這種連續性在 2019 年完全可以使用普通程式碼、有限狀態機、事件表與行為庫實作。

---

# 6. 第三來源：角色不是一句 Prompt，而是一個行為約束系統

今天很多 AI 角色系統把人格理解成一段 System Prompt，例如：

> 你是一個傲嬌、可愛、有點嘴硬的機器人。

這其實很脆弱。

真正的角色一致性至少應包含：

$$
\text{Persona}
=
\text{Language Policy}
+
\text{Action Policy}
+
\text{Memory Policy}
+
\text{State Transition Policy}.
$$

也就是說，「二白很傲嬌」不能只意味著它說話像傲嬌，而要進一步約束：

- 什麼事件會讓它後退；
- 什麼時候拒絕靠近；
- 哪些事情它會記住；
- 被誇獎後如何改變狀態；
- 生氣多久；
- 是否主動重新靠近；
- 語言與動作如何同步。

此時人格不再只是文字風格，而是：

$$
\pi(a_t\mid z_t,e_t),
$$

即在目前狀態 $z_t$ 與事件 $e_t$ 下，角色選擇行動 $a_t$ 的策略。

---

# 7. 第四來源：有限動作反而可能有利

迷你機器人的一個優勢是它的行動空間可以非常小。

例如：

$$
A=
\{
\text{前進},
\text{後退},
\text{左轉},
\text{右轉},
\text{停},
\text{抬頭},
\text{低頭},
\text{轉圈},
\text{發聲}
\}.
$$

有限動作意味著開發者更容易建立完整的角色化行為詞彙。

例如同樣是「拒絕」：

$$
\text{後退}
+
\text{轉開}
+
\text{短促聲音}
$$

就足以形成明確的社會信號。

因此，身體越簡單，不一定越難產生角色感；在特定產品中，較小的動作空間反而更容易被完整編排。

---

# 8. 一個合理的早期二白架構重建

以下是**工程可行性重建，不是二白官方披露架構**。

```text
攝影機 / 麥克風 / 距離感測器
            │
            ▼
      基本事件偵測
            │
            ▼
      角色有限狀態機
       /      |      \
      /       |       \
預設動作   預設台詞   人類操作者
      \       |       /
       \      |      /
            ▼
       動作仲裁器
            │
            ▼
 馬達 / 表情 / 聲音輸出
```

如果再加入當時已經成熟的雲端語音能力：

```text
麥克風
  │
  ├──► 喚醒詞 / 關鍵詞 ──► 即時狀態機
  │
  └──► ASR ──► 意圖分類 / 檢索式對話
                      │
                      ▼
                   TTS
```

這個系統不需要今日的 LLM，也可以在受限情境下產生相當好的效果。

再配合影片腳本、多次拍攝選片、後期配音或遠端人類控制，最後呈現的「智能密度」可以遠高於系統的平均自主能力。

因此不能從剪輯影片直接推導：

$$
P(\text{成功}\mid\text{影片})
=
P(\text{成功}\mid\text{任意真實環境}).
$$

---

# 9. 今天的大模型反而讓這種架構真正成熟

大模型出現後，最直觀卻不一定最好的做法，是讓大模型控制一切：

$$
\text{感知}
\rightarrow
\text{LLM}
\rightarrow
\text{所有行動}.
$$

這會帶來延遲、成本、不確定性、行為漂移、安全風險，以及每輪重新理解世界的浪費。

更合理的是：

$$
\text{Event}
\rightarrow
\text{State Update}
\rightarrow
\text{Policy}
\rightarrow
\begin{cases}
\text{Direct Action},\\
\text{Call LLM}.
\end{cases}
$$

能用狀態機立即解決的，不叫大模型；只有遇到模糊、新穎、開放式問題時才叫大模型。

例如：

```text
事件：主人進門
狀態：主人已辨識、上次離家 8 小時
規則：觸發迎接
→ 直接靠近

事件：主人說「今天公司真的很奇怪」
狀態：開放語義事件
→ 呼叫語言模型
```

此時 LLM 的合理位置是：

$$
\boxed{\text{高階語義與未知情境求解器}}
$$

而不是所有控制的唯一來源。

---

# 10. 第一個一般化結論：智能感是系統級效果

從二白案例可以暫時抽象出：

$$
I_p
=
F(
C,
L,
S,
P,
E,
M
),
$$

其中：

- $C$ ：行為一致性；
- $L$ ：反應延遲與節奏；
- $S$ ：狀態連續性；
- $P$ ：角色策略；
- $E$ ：具身感知與動作耦合；
- $M$ ：模型能力。

關鍵在於：

$$
\frac{\partial I_p}{\partial M}
$$

並不一定在所有階段都是最大的。

當模型已經「夠用」時，提高狀態連續性、降低反應延遲、增加適當的注視和身體回應，可能比把 7B 模型換成 70B 模型更能提升使用者感受到的智能。

既有人機互動研究也已建立「Perceived Social Intelligence」量表，用來衡量人們對機器人辨識、適應、預測人類行為與情緒等能力的主觀評估。這提醒我們：社會智能本身就具有重要的觀察者層面。

---

# 11. 二白真正連到的是世界狀態機

一旦把問題抽象化，二白就不再只是一台可愛機器人。

它指向一個更大的架構：

$$
S_{t+1}=F(S_t,E_t,A_t),
$$

其中：

- $S_t$ ：當前世界狀態；
- $E_t$ ：新事件；
- $A_t$ ：上一輪行動。

AI 不需要每一次都重新問：

> 現在的世界是什麼？

而應該知道：

> 世界從上一個狀態變成了什麼？

因此未來具身 Agent 的高效率形式可能不是：

$$
\text{World}
\rightarrow
\text{重新完整理解}
\rightarrow
\text{LLM}
\rightarrow
\text{Action},
$$

而是：

$$
\text{Persistent World State}
+
\text{Event Delta}
\rightarrow
\text{State Transition}
\rightarrow
\text{Action / LLM Escalation}.
$$

這使二白案例自然延伸到遊戲世界 Agent、家庭機器人、AI 手機、AI 眼鏡、個人助手、多設備 Agent 與長期自主 AI。

---

# 12. 結論：真正的問題是「如何持續像同一個存在」

二白案例最值得研究的地方，不是證明 2019 年就存在今日的大模型能力。

它提示的是另一條道路：

$$
\text{有限模型}
+
\text{即時反射}
+
\text{持續狀態}
+
\text{角色策略}
+
\text{具身動作}
$$

就可能形成：

$$
\text{高於單一模型能力的整體智能感}.
$$

到了大模型時代，這條路線沒有過時，反而變得更加重要。

因為真正長期存在於物理世界中的 AI，不能每一次事件發生後都重新閱讀全部歷史、重新理解自己的角色、重新理解當前世界。

它需要的是：

$$
\boxed{
\text{持續存在的狀態}
+
\text{事件驅動的更新}
+
\text{分層反應}
+
\text{必要時才進行高成本推理}
}
$$

因此，二白不是這個系列的終點，它只是第一個入口。

下一篇將進一步研究其中最重要、也最容易被忽略的原理：

> **為什麼具身智能應該「先反應，再思考」？**

---

# 參考資料與來源

> 以下分為「二白公開資料」與「人機互動研究」。本文對二白早期內部架構的推論，不代表官方披露。

1. 二白智能官方網站，《二白智能》  
   https://robot-by.com/

2. 36氪，〈从700万粉丝IP到千台实体售罄，这家公司想做“原生机器人IP”的长期陪伴〉，2025-12-24  
   https://www.36kr.com/p/3608882030593282

3. Bilibili，「做二白的毛老师」，〈二白机器人咋来的，先从核心模块讲起吧〉，2024-03-10  
   https://www.bilibili.com/video/BV1Aj421f7KW/

4. Weiss, A. et al. (2009). *User experience evaluation with a Wizard of Oz approach: technical and methodological considerations*. IEEE-RAS Humanoids 2009.  
   https://doi.org/10.1109/ICHR.2009.5379559

5. Steinfeld, A., Jenkins, O. C., & Scassellati, B. (2009). *The Oz of Wizard: Simulating the Human for Interaction Research*. HRI 2009.  
   https://publications.ri.cmu.edu/the-oz-of-wizard-simulating-the-human-for-interaction-research

6. Barchard, K. A. et al. (2020). *Measuring the Perceived Social Intelligence of Robots*. ACM Transactions on Human-Robot Interaction, 9(4).  
   https://doi.org/10.1145/3415139

7. *Effect of Robot Head Movement and its Timing on Human-Robot Interaction*. International Journal of Social Robotics, 2024.  
   https://doi.org/10.1007/s12369-024-01196-0
