二白機器人:低算力系統為何能產生強烈智能感?
系列:狀態驅動的本地具身 AI|第 1 篇
版本:v0.1
日期:2026-08-01
摘要
當人們觀看早期「二白」機器人影片時,一個直觀問題會立刻出現:在大型語言模型尚未普及、端側算力遠弱於今日的年代,一台外觀與機械結構並不複雜的小型輪式機器人,為何仍可能呈現出「會看、會躲、會鬧脾氣、會等人、像在理解情境」的智能感?
本文主張,這個問題不應直接化約為「它當時用了哪一個 AI 模型」。對社交型與陪伴型機器人而言,使用者感受到的智能並非只由模型推理能力決定,而是由反應時序、狀態連續性、動作—語言一致性、角色穩定性、感知回饋與人類自身的社會認知機制共同構成。
以二白作為案例入口,本文提出一個「低算力強智能感」分析框架:即使高階生成模型只在少數時刻介入,只要底層已有即時控制、感知觸發、角色狀態機、預設行為庫與適當的人類在環機制,系統仍可能形成高度連貫的互動表現。到了大模型時代,同一架構反而更有價值:大模型不必取代狀態機,而可以成為狀態機之上的稀疏高階推理層。
本文不宣稱已取得二白早期系統的完整內部架構。公開資料只能證實二白智能成立於 2019 年、其「我系二白」內容 IP 已長期營運,且 2025 年量產的二白 Mini 對外宣稱使用性格生成、情感引擎、稀疏記憶與自然交互等技術。本文對早期系統的具體實作採取「可行架構重建」而非「事實認定」。
關鍵詞: 二白機器人、具身智能、狀態機、行為樹、人機互動、Wizard of Oz、角色智能、世界狀態、事件驅動、大語言模型
1. 問題不是「2019 年哪來的大模型?」
看到早期二白影片時,最容易產生的誤解是:
如果它看起來有智能,那它裡面一定已經有一個很強的 AI。
這個推論並不成立。
一台機器人「被觀察為有智能」,與它是否具有今日意義上的通用生成模型,是兩個不同問題。
可以先區分:
與
前者代表系統本身能完成多少感知、推理、規劃與泛化;後者則代表人類在互動中感受到多少智能、意圖、個性與生命感。
兩者有關,但並非線性關係:
一個知識量龐大的模型,如果永遠慢三秒、完全不看向使用者、動作與語言互相衝突,主觀上反而可能非常「機器」。
相反地,一個能力有限的系統,只要能在正確時刻轉頭、後退、停住、眨眼、發出短促聲音、延續前一個情境,便可能產生非常強的「它知道現在正在發生什麼」的感覺。
因此,研究二白真正有價值的問題不是:
2019 年它到底跑了哪個模型?
而是:
在模型能力有限時,哪些系統結構足以產生連續而可信的智能感?
2. 二白的時間線必須先拆開
根據目前可查的公開資料,杭州二白智能科技有限公司成立於 2019 年。2025 年的公司訪談則稱,「我系二白」帳號矩陣已營運約七年,並在 2025 年 6 月開始預售首款量產產品「二白 Mini」。
這意味著至少需要把二白分為兩種不同對象:
與
兩者不能直接等同。
目前公司公開宣稱的核心技術包括性格生成算法、情感引擎、稀疏記憶架構與自然交互技術。官方網站也將二白描述為其第一個機器人 IP,並強調每一台二白在與使用者相處中逐步成長。
但這些是今天的產品敘事與技術宣稱,不能反向證明 2018~2019 年的影片已經具備相同技術。
因此本文採取較保守的立場:
早期影片顯示的是「二白角色可以被呈現得非常智能」;至於其中多少來自自主 AI、多少來自腳本、人類操控、規則控制或後製,公開資料不足以精確拆分。
3. 人類在環不是「作弊」,而是正式的人機互動原型方法
在人機互動研究中,早就存在一套成熟方法:Wizard of Oz(WoZ)。
它的基本精神是:
操作者可以控制對話、動作、導航、手勢、回應時機,甚至替代部分尚未完成的感知模組。
WoZ 並不是近年短影片時代才出現的技巧。2009 年已有正式 HRI 研究專門討論用 WoZ 評估人形機器人的使用者體驗;同年 Carnegie Mellon 等研究者也討論了這類方法在人機互動研究中的方法論地位。
因此,如果早期二白曾存在某種:
的混合模式,技術上完全不奇怪。
真正有趣的是:哪些原本由人類操作者完成的判斷,日後可以逐步被狀態機、小模型與大模型替換?
4. 強烈智能感的第一來源:即時性
社交互動首先是一個時間問題。
假設使用者突然說:「二白?」
第一種機器人要等語音上傳、ASR、模型理解、生成文字、生成語音,三秒後才回答。
第二種機器人則在 毫秒內轉頭, 毫秒內發出「嗯?」,同時背景進行完整語義推理,一到兩秒後再給出較長回答。
第二種即使模型比較弱,也更容易被感知為「它聽到了」。
可以把互動反應拆為:
其中:
- :快速反射;
- :語義回應;
- :較慢的推理與規劃。
這三者不應全部串行等待,而應部分並行。
2024 年一項人機互動研究發現,機器人在說話前做點頭、搖頭或歪頭等頭部動作,會顯著影響受試者對其自然度、擬人感、生命感、喜愛度與智能的評價;頭部動作出現的時機本身也會影響互動自然度。
因此:
5. 第二來源:狀態連續性
真正破壞角色智能感的,往往不是知識不足,而是失憶。
假設二白前一秒因為主人踩到它而後退,下一秒卻立刻用完全無關的開朗語氣問:「今天想聊什麼?」
即使後一句語言品質很高,整體角色仍會瞬間崩潰。
因此系統需要持續保存最小狀態:
其中可以分別表示:
- :目前互動者;
- :場景;
- :角色/情緒狀態;
- :短期記憶;
- :當前目標;
- :風險與限制;
- :身體狀態。
外部事件到達時,只更新狀態:
例如:
這種連續性在 2019 年完全可以使用普通程式碼、有限狀態機、事件表與行為庫實作。
6. 第三來源:角色不是一句 Prompt,而是一個行為約束系統
今天很多 AI 角色系統把人格理解成一段 System Prompt,例如:
你是一個傲嬌、可愛、有點嘴硬的機器人。
這其實很脆弱。
真正的角色一致性至少應包含:
也就是說,「二白很傲嬌」不能只意味著它說話像傲嬌,而要進一步約束:
- 什麼事件會讓它後退;
- 什麼時候拒絕靠近;
- 哪些事情它會記住;
- 被誇獎後如何改變狀態;
- 生氣多久;
- 是否主動重新靠近;
- 語言與動作如何同步。
此時人格不再只是文字風格,而是:
即在目前狀態 與事件 下,角色選擇行動 的策略。
7. 第四來源:有限動作反而可能有利
迷你機器人的一個優勢是它的行動空間可以非常小。
例如:
有限動作意味著開發者更容易建立完整的角色化行為詞彙。
例如同樣是「拒絕」:
就足以形成明確的社會信號。
因此,身體越簡單,不一定越難產生角色感;在特定產品中,較小的動作空間反而更容易被完整編排。
8. 一個合理的早期二白架構重建
以下是工程可行性重建,不是二白官方披露架構。
攝影機 / 麥克風 / 距離感測器
│
▼
基本事件偵測
│
▼
角色有限狀態機
/ | \
/ | \
預設動作 預設台詞 人類操作者
\ | /
\ | /
▼
動作仲裁器
│
▼
馬達 / 表情 / 聲音輸出
如果再加入當時已經成熟的雲端語音能力:
麥克風
│
├──► 喚醒詞 / 關鍵詞 ──► 即時狀態機
│
└──► ASR ──► 意圖分類 / 檢索式對話
│
▼
TTS
這個系統不需要今日的 LLM,也可以在受限情境下產生相當好的效果。
再配合影片腳本、多次拍攝選片、後期配音或遠端人類控制,最後呈現的「智能密度」可以遠高於系統的平均自主能力。
因此不能從剪輯影片直接推導:
9. 今天的大模型反而讓這種架構真正成熟
大模型出現後,最直觀卻不一定最好的做法,是讓大模型控制一切:
這會帶來延遲、成本、不確定性、行為漂移、安全風險,以及每輪重新理解世界的浪費。
更合理的是:
能用狀態機立即解決的,不叫大模型;只有遇到模糊、新穎、開放式問題時才叫大模型。
例如:
事件:主人進門
狀態:主人已辨識、上次離家 8 小時
規則:觸發迎接
→ 直接靠近
事件:主人說「今天公司真的很奇怪」
狀態:開放語義事件
→ 呼叫語言模型
此時 LLM 的合理位置是:
而不是所有控制的唯一來源。
10. 第一個一般化結論:智能感是系統級效果
從二白案例可以暫時抽象出:
其中:
- :行為一致性;
- :反應延遲與節奏;
- :狀態連續性;
- :角色策略;
- :具身感知與動作耦合;
- :模型能力。
關鍵在於:
並不一定在所有階段都是最大的。
當模型已經「夠用」時,提高狀態連續性、降低反應延遲、增加適當的注視和身體回應,可能比把 7B 模型換成 70B 模型更能提升使用者感受到的智能。
既有人機互動研究也已建立「Perceived Social Intelligence」量表,用來衡量人們對機器人辨識、適應、預測人類行為與情緒等能力的主觀評估。這提醒我們:社會智能本身就具有重要的觀察者層面。
11. 二白真正連到的是世界狀態機
一旦把問題抽象化,二白就不再只是一台可愛機器人。
它指向一個更大的架構:
其中:
- :當前世界狀態;
- :新事件;
- :上一輪行動。
AI 不需要每一次都重新問:
現在的世界是什麼?
而應該知道:
世界從上一個狀態變成了什麼?
因此未來具身 Agent 的高效率形式可能不是:
而是:
這使二白案例自然延伸到遊戲世界 Agent、家庭機器人、AI 手機、AI 眼鏡、個人助手、多設備 Agent 與長期自主 AI。
12. 結論:真正的問題是「如何持續像同一個存在」
二白案例最值得研究的地方,不是證明 2019 年就存在今日的大模型能力。
它提示的是另一條道路:
就可能形成:
到了大模型時代,這條路線沒有過時,反而變得更加重要。
因為真正長期存在於物理世界中的 AI,不能每一次事件發生後都重新閱讀全部歷史、重新理解自己的角色、重新理解當前世界。
它需要的是:
因此,二白不是這個系列的終點,它只是第一個入口。
下一篇將進一步研究其中最重要、也最容易被忽略的原理:
為什麼具身智能應該「先反應,再思考」?
參考資料與來源
以下分為「二白公開資料」與「人機互動研究」。本文對二白早期內部架構的推論,不代表官方披露。
二白智能官方網站,《二白智能》
https://robot-by.com/36氪,〈从700万粉丝IP到千台实体售罄,这家公司想做“原生机器人IP”的长期陪伴〉,2025-12-24
https://www.36kr.com/p/3608882030593282Bilibili,「做二白的毛老师」,〈二白机器人咋来的,先从核心模块讲起吧〉,2024-03-10
https://www.bilibili.com/video/BV1Aj421f7KW/Weiss, A. et al. (2009). User experience evaluation with a Wizard of Oz approach: technical and methodological considerations. IEEE-RAS Humanoids 2009.
https://doi.org/10.1109/ICHR.2009.5379559Steinfeld, A., Jenkins, O. C., & Scassellati, B. (2009). The Oz of Wizard: Simulating the Human for Interaction Research. HRI 2009.
https://publications.ri.cmu.edu/the-oz-of-wizard-simulating-the-human-for-interaction-researchBarchard, K. A. et al. (2020). Measuring the Perceived Social Intelligence of Robots. ACM Transactions on Human-Robot Interaction, 9(4).
https://doi.org/10.1145/3415139Effect of Robot Head Movement and its Timing on Human-Robot Interaction. International Journal of Social Robotics, 2024.
https://doi.org/10.1007/s12369-024-01196-0