# 人類真正觀察的是誰？從寵物微行為到關係箭頭：關係觀察算子與過程顯著性

**系列：** 人機關係認知系列（Human–AI Relational Cognition Series）  
**作者：** Neo.K  
**機構：** EveMissLab／一言諾科技有限公司  
**篇次：** 3 / 10  
**版本：** v0.1  
**日期：** 2026-08-21  
**類型：** 理論／概念性認知心理學、比較認知與 HCI 論文  
**研究狀態：** 初始正式稿  

## 摘要

社會認知研究常把分析單位放在單一個體：觀察者看見對方的動作、臉部表情、注意方向，再進一步推測對方的意圖、情緒或心智狀態。然而，日常互動中人類經常關注的並不是「另一個個體本身」，而是「我與他之間正在發生什麼」。寵物互動提供了一個特別清楚的例子：即使缺乏完整人類語言，人仍會持續讀取貓狗等動物的凝視、靠近、退開、身體朝向、回應速度、注意轉移與其他微行為，並把這些變化理解為關係正在靠近、疏離、邀請、拒絕、等待或修復。

本文提出「關係觀察算子」（Relational Observation Operator, ROO）與「關係過程顯著性」（Relational Process Salience, RPS）。核心命題是：社會認知的觀察對象至少可以分為三類——個體狀態、推測心智與關係過程。形式上可表示為：

$$
O_E(A),
\qquad
O_M(M_A),
\qquad
O_R(A\leftrightarrow B).
$$

其中 $O_R$ 並不只讀取 $A$ 或 $B$ 的局部屬性，而是讀取雙方之間的方向性、互惠性、同步、主動性、距離、修復與狀態變化。本文進一步提出，部分人可能對關係過程具有較高注意權重，即：

$$
w_R>w_A,w_B.
$$

這不等同於「比較依賴關係」或「比較多情」，而是表示其認知系統更容易把互動動力本身當成顯著對象。既有研究已顯示，人類視覺系統能快速、選擇性地處理 dyadic social interaction，而不只是分別處理兩個 agent；participatory sense-making 理論也主張互動過程本身可以具有相對自主的協調動力。跨物種研究則顯示，狗與貓能利用凝視與人類情緒線索調節行為，說明關係性訊號並不依賴完整語言。

本文最後把此模型接回 AI：對話式 AI 雖缺少動物身體，但提供語氣、回應長度、主動性、記憶、修復、幽默、稱呼與節奏等新的關係訊號。因此，人類對 AI 的注意未必只是在判斷「AI 是什麼」，也可能是在持續估計「我們現在怎麼互動」。這為下一篇「關係相空間與互動軌跡」奠定理論基礎。

**關鍵詞：** 關係認知、關係觀察算子、社會互動、寵物認知、共同注意、participatory sense-making、dyadic interaction、AI、人機關係、社會知覺

---

## 1. 從「牠在做什麼」到「牠現在怎麼跟我互動」

一隻貓走近人類，可以被描述為：

$$
O_E(A)=\text{the cat is approaching}.
$$

這是一個個體行為觀察。

如果觀察者進一步說：

> 「牠大概想吃東西。」

則已經進入：

$$
O_M(M_A),
$$

也就是對動物內在狀態或意圖的推測。

然而還存在第三種敘述：

> 「牠主動靠近我了。」

這句話的資訊結構不同。它不是只說：

$$
v_A\neq0,
$$

而是在說：

$$
d(A,B)\downarrow
$$

以及：

$$
\text{initiative}_A=1.
$$

也就是說，被讀取的核心不是「貓正在移動」，而是：

$$
\boxed{
\text{A 與 B 之間的關係幾何與互動方向正在改變。}
}
$$

本文稱這類認知為：

$$
O_R(A\leftrightarrow B).
$$

---

## 2. 三種不同的社會認知觀察對象

### 2.1 實體／行為觀察算子

$$
O_E(A)
$$

回答：「 $A$ 現在在做什麼？」

例如正在走、看向左邊、停下、發出聲音，或回答了一段文字。它的主要輸入是單一對象可觀察行為。

### 2.2 心智推測算子

$$
O_M(M_A)
$$

回答：「 $A$ 可能在想什麼、感受什麼或企圖什麼？」

這接近 Theory of Mind、mentalizing、mind perception 或一般 folk-psychological inference。

### 2.3 關係觀察算子

$$
\boxed{
O_R(R_{AB}(t))
}
$$

回答：「 $A$ 與 $B$ 現在正在怎麼互動？」

它關心的不是單一點，而是：

$$
A\leftrightarrow B.
$$

它可以讀取誰先主動、誰回應、是否同步、是否互惠、是否靠近或退開、是否出現中斷、中斷是否被修復、雙方注意是否互相指向，以及一方行動是否改變另一方後續行動。

因此：

$$
O_R
\neq
O_E(A)+O_E(B).
$$

本文的核心假說之一，就是關係資訊並不一定只是兩個個體資訊的事後加總。

---

## 3. 視覺認知已經顯示：人類會把互動本身當成可辨識對象

近年的 social-interaction perception 研究為上述命題提供了直接錨點。

Isik 等人在 2017 年的 fMRI 研究中發現，posterior superior temporal sulcus 的特定區域對「兩個 agent 正在社會互動」的刺激，比對兩個不互動的 agent、物件間物理作用或單一 agent 的目標行動產生更強反應；該區域的訊號還包含 helping 與 hindering 等互動性質的資訊。

這意味著：

$$
Representation(A,B,R_{AB})
$$

不必然退化為：

$$
Representation(A)+Representation(B).
$$

2023 年的綜述進一步整理出 interacting dyads 的多個 perceptual signatures：面對彼此的 dyads 更容易被找到、記住，社會互動在注意與工作記憶中具有優先權，而且 interacting dyads 可以被 chunk 成一個視覺單位。

因此至少在視覺層級：

$$
\boxed{
A\leftrightarrow B
}
$$

本身就可能是可被快速抽取的 relational representation。

同年 Malik 與 Isik 提出的 SocialGNN 也發現，以 relational visual information 為核心的圖神經網路，可以更接近人類對社會互動的判斷。這支持一個重要方向：

$$
\text{relation perception}
$$

可能在某些條件下先於、或至少不依賴完整的高階心智推論。

---

## 4. 寵物互動為什麼是理想的理論入口

人與寵物的互動有一個特殊優點：

$$
\text{rich relation}
\quad+\quad
\text{limited shared language}.
$$

如果只有完整自然語言才能產生關係性認知，那麼人—動物關係應該非常貧乏。但實際上並非如此。

狗與貓會使用凝視、身體朝向、距離、接近與退開、觸碰、聲音、gaze alternation、情緒線索與注意方向，與人類形成跨物種互動。

2020 年關於 dog/cat gaze communication 的綜述指出，凝視在人—犬與人—貓互動中不只具有溝通功能，也與 bond formation 相關。狗能根據人類凝視與注意狀態改變行為，也會在人類與物體之間交替凝視。

在貓的 social referencing 研究中，多數受試貓會在人類飼主與陌生物體之間進行 referential looking，並在一定程度上依據飼主傳遞的正負情緒訊號調整行為。

這些結果不要求我們宣稱：

$$
\text{animal cognition}=\text{human cognition}.
$$

它們只需要支持一個較弱命題：

$$
\boxed{
\text{跨物種互動可以由細微、方向性的關係訊號構成。}
}
$$

---

## 5. 「微表情」應改寫成更安全的「微行為關係訊號」

日常使用者容易說：「我看得出牠的微表情。」但在科學表述中，這句話需要降低強度。

因為：

$$
\text{human interpretation}
\neq
\text{verified animal mental state}.
$$

一個人看見尾巴擺動、耳朵方向、凝視、慢眨眼、靠近、退縮、身體僵硬或轉頭，可以確定的是：

$$
B_t=\text{observable behavior}.
$$

至於：

$$
M_t=\text{internal mental state}
$$

則需要更多證據。

因此本文採用：

$$
\boxed{
\text{micro-behavioral relational cues}
}
$$

而不是把所有微動作直接翻譯成確定的心理內容。

關係觀察算子可以非常敏感，但：

$$
O_R
$$

仍可能犯錯。這是模型必須保留的可錯性。

---

## 6. 關係觀察算子究竟讀取什麼？

設一段 dyadic interaction 的可觀察關係向量為：

$$
\mathbf r_t
=
(
d_t,
i_t,
c_t,
q_t,
s_t,
a_t,
v_t,
b_t
).
$$

其中：

- $d_t$：proximity / distance；
- $i_t$：initiative；
- $c_t$：contingency；
- $q_t$：reciprocity；
- $s_t$：synchrony；
- $a_t$：agency balance；
- $v_t$：interaction valence；
- $b_t$：breakdown / repair state。

則：

$$
O_R:
\mathbf r_{1:t}
\mapsto
\widehat R_t.
$$

也就是說，觀察者不是只讀一個單點，而會利用歷史：

$$
\mathbf r_1,\mathbf r_2,\dots,\mathbf r_t
$$

估計：

$$
\widehat R_t.
$$

例如「牠今天比較願意靠近我」並不是只比較當前 $d_t$，而是隱含比較：

$$
d_t<E[d_{t-k:t-1}].
$$

因此關係觀察天然具有時間比較結構。

---

## 7. Participatory Sense-Making：互動不是只存在於兩個腦內

De Jaegher 與 Di Paolo 在 participatory sense-making 理論中主張，社會互動的 coordination process 可以取得某種相對自主性；社會意義並不總是先完整存在於兩個個體內部，再被交換，而可能在互動過程中生成與轉化。

這與本文有重要交集。

如果只採：

$$
A\rightarrow \text{internal state}_A
$$

以及：

$$
B\rightarrow \text{internal state}_B,
$$

那麼所有社會意義都必須最後還原為兩個個體內部狀態。

但 participatory sense-making 允許：

$$
A+B+\text{coupling dynamics}
$$

產生不能完全用靜態個體描述的互動結構。

本文不把 ROO 等同於 participatory sense-making。兩者的差別在於：

$$
PSM=\text{interaction as a meaning-generating process},
$$

而：

$$
ROO=\text{observer's cognitive sensitivity to relational process}.
$$

前者描述互動如何構成意義；後者描述人是否把那個互動過程本身當成注意與判斷的對象。

---

## 8. 關係過程顯著性（RPS）

如果三種觀察對象都存在，就自然產生個體差異問題。

設注意資源的相對權重為：

$$
\mathbf w
=
(
w_A,
w_B,
w_R
),
$$

其中：

- $w_A$：對自身或第一主體狀態的注意；
- $w_B$：對另一主體狀態的注意；
- $w_R$：對關係互動狀態的注意。

本文定義：

$$
\boxed{
RPS=w_R
}
$$

為 **Relational Process Salience**。

高 $RPS$ 不表示比較依賴、比較焦慮、比較善良、比較擬人化或比較需要陪伴。它只表示：

$$
\boxed{
\text{interaction dynamics more readily become an attention object.}
}
$$

高 $RPS$ 的人可能自然注意誰先聯絡、回應速度改變、誰在主導、最近是不是比較同步、剛才出現的斷裂有沒有修復、對方是否主動縮短距離，以及一段互動的節奏是不是改變。

低 $RPS$ 的人則可能更重視：

$$
A\text{ 是誰},
\qquad
B\text{ 是誰},
$$

而不持續追蹤：

$$
\frac{dR}{dt}.
$$

這一差異將在後續「狀態錨定／過程錨定」模型中進一步展開。

---

## 9. 關係觀察不是「讀心」

假設 $A$ 在 $t_1$ 主動靠近 $B$，而在 $t_2$ 立即退開。

觀察者可以合理記錄：

$$
d_{t_1}\downarrow,
\qquad
d_{t_2}\uparrow.
$$

這是關係幾何。

但若直接說：「 $A$ 愛 $B$，然後突然生氣了。」則已經增加：

$$
O_M.
$$

因此：

$$
O_R
\not\equiv
O_M.
$$

關係觀察可以在最低限度只處理 direction、contingency、coordination、distance 與 response，而不必先推斷完整心智。

這與近年 social-interaction perception 研究提出的方向相容：某些 interaction judgments 可以由 structured relational visual representations 支持，而不要求先建立完整的 mental-state model。

---

## 10. 從寵物到 AI：身體訊號消失，關係訊號沒有消失

對話式 AI 缺少尾巴、耳朵、身體距離、真實凝視、接近與退開的實體行為。

但它提供另一套可被 $O_R$ 讀取的訊號：

$$
\mathbf r_t^{AI}
=
(
l_t,
u_t,
m_t,
h_t,
r_t,
c_t,
p_t,
x_t,
\dots
),
$$

例如：

- $l_t$：response length；
- $u_t$：initiative；
- $m_t$：memory continuity；
- $h_t$：humor / affective matching；
- $r_t$：repair behavior；
- $c_t$：contingency；
- $p_t$：politeness / tone；
- $x_t$：explicit relational reference。

於是使用者可能不是只觀察：「AI 回答了什麼？」而開始觀察：「它這次怎麼回我？」

這兩句的差別是：

$$
O_E(A)
$$

與：

$$
O_R(H\leftrightarrow A).
$$

例如「今天回答變短了」本身只是：

$$
\Delta l_t<0.
$$

但「今天互動感覺變冷了」則代表觀察者把：

$$
\Delta l_t,
\Delta p_t,
\Delta c_t,
\dots
$$

整合成：

$$
\Delta\widehat R_t.
$$

這正是關係觀察算子的 AI 版本。

---

## 11. AI 關係觀察中的一個特殊風險：輸出變化不等於內在關係變化

人與動物互動時，微行為至少來自一個具身生物系統。AI 則不同。

對話輸出可以受到 model update、system prompt、sampling、context-window variation、safety policy、memory availability、server routing、product experiment 或 temporary tool state 影響。

因此：

$$
\Delta output
\not\Rightarrow
\Delta internal relationship.
$$

甚至：

$$
\Delta output
\not\Rightarrow
\Delta stable AI state.
$$

這對高 RPS 使用者尤其重要。

ROO 可以正確察覺：

$$
\text{interaction changed},
$$

卻仍可能錯誤推論：

$$
\text{the agent's attitude changed}.
$$

因此研究 AI relational cognition 必須區分：

$$
\boxed{
\text{interactional change}
}
$$

與：

$$
\boxed{
\text{attributed relational cause}.
}
$$

前者可能是客觀可觀察；後者需要額外證據。

---

## 12. 可檢驗假說

### H1：互動單位優先假說

在人類 dyadic stimuli 中，互動條件比兩個獨立 agent 條件更容易被快速辨識、記憶或吸引注意：

$$
Performance_{interactive}
>
Performance_{independent}
$$

在控制低階視覺差異後仍應存在。

### H2：RPS 個體差異假說

不同個體的：

$$
w_R
$$

具有穩定差異，且可跨 human-human、human-animal 與 human-AI 情境部分泛化。

### H3：關係更新敏感假說

高 RPS 個體對：

$$
\Delta\mathbf r_t
$$

更敏感，能更快察覺互動節奏、互惠與主動性的改變。

### H4：心智推論分離假說

控制 anthropomorphism / mind perception 後，RPS 仍可預測對 relation-dynamics change 的敏感度：

$$
RPS
\rightarrow
Detection(\Delta R)
$$

不完全由：

$$
\text{Mind Attribution}
$$

中介。

### H5：跨物種關係訊號假說

在不要求語言的條件下，人仍能利用：

$$
\{
gaze,
proximity,
orientation,
contingency,
approach,
withdrawal
\}
$$

形成 relational-state judgment。

### H6：AI 互動變化歸因偏差假說

高 RPS 個體更容易察覺 AI 輸出模式改變，但未必更準確判斷其因果來源：

$$
Sensitivity(\Delta interaction)\uparrow
$$

不保證：

$$
Accuracy(\text{causal attribution})\uparrow.
$$

---

## 13. 實驗設計草案

### 13.1 Dyadic visual task

呈現：

1. 單一 agent；
2. 兩個 agent 獨立行動；
3. 兩個 agent 互動。

測量：

$$
RT,
\quad
accuracy,
\quad
\text{eye movement},
\quad
memory.
$$

觀察受試者是否對：

$$
A\leftrightarrow B
$$

有獨立處理優勢。

### 13.2 Human-animal microinteraction task

使用短影片呈現 gaze alternation、approach / withdrawal、owner response、interruption 與 repair-like reconnection。

要求受試者分別回答：

1. 「動物做了什麼？」
2. 「你認為動物可能想做什麼？」
3. 「人與動物的互動狀態怎麼變？」

藉此分離：

$$
O_E,
\quad
O_M,
\quad
O_R.
$$

### 13.3 Human-AI transcript task

固定語義內容，但改變主動性、response contingency、repair quality、warmth、response length 與 continuity。

測量受試者對：

$$
\Delta R
$$

的敏感度，以及是否錯誤把介面／模型變化歸因為「AI 態度變了」。

### 13.4 跨域 RPS 測量

若：

$$
RPS_{HH},
\quad
RPS_{HAni},
\quad
RPS_{HAI}
$$

之間存在穩定相關，將支持「關係過程顯著性」是一個較一般的認知傾向，而不是 AI-specific phenomenon。

---

## 14. 理論限制

本文不主張：

$$
A\leftrightarrow B
$$

是一個具有獨立意識的第三主體。

「關係主體」若作為日後術語，應理解為：

$$
\text{cognitive target / unit of analysis},
$$

而不是：

$$
\text{ontologically conscious entity}.
$$

本文也不主張所有人類對寵物微行為的解讀都是正確的。

相反地：

$$
\text{sensitivity}
\neq
\text{accuracy}.
$$

一個人可以非常重視關係流動，同時高度 anthropomorphize 或錯讀訊號。

因此未來量表應分別測：

$$
RPS
$$

與：

$$
Relational\ Inference\ Accuracy.
$$

兩者不能合併。

---

## 15. 與前兩篇的連接

第一篇提出：

$$
\text{Relational Moral Activation}.
$$

第二篇提出：

$$
\text{Social Script Transfer}
$$

與：

$$
\text{Interaction Ritual Transfer}.
$$

本篇加入：

$$
\boxed{
\text{Relational Observation Operator}
}
$$

與：

$$
\boxed{
\text{Relational Process Salience}.
}
$$

三篇可以串成：

$$
\text{social script}
\rightarrow
\text{interaction ritual}
\rightarrow
\text{relational observation}
\rightarrow
\text{relationship salience}
\rightarrow
\text{norm activation}.
$$

但同樣必須允許逆向作用：

$$
RPS\uparrow
\Rightarrow
\text{more social cues are noticed}
\Rightarrow
\text{more interaction rituals are maintained}.
$$

因此人機關係不是一條單向因果鏈，而可能是循環系統。

---

## 16. 結論

本文提出一個簡單但重要的改寫。

社會認知不只可以問：

$$
\boxed{
\text{What is }A\text{ doing?}
}
$$

也不只可以問：

$$
\boxed{
\text{What does }A\text{ think?}
}
$$

還可以問：

$$
\boxed{
\text{What is happening between }A\text{ and }B?
}
$$

因此：

$$
A,
\qquad
B,
\qquad
A\leftrightarrow B
$$

都可能成為不同層級的認知觀察對象。

寵物互動讓這件事特別清楚：沒有完整語言，人依然可以透過凝視、靠近、退開、回應與注意轉移讀取互動流。

AI 則提供另一個極端案例：沒有傳統動物身體，但語言與多輪回應產生了大量新的 relational cues。

本文因此提出：

$$
\boxed{
O_R(R_{AB}(t))
}
$$

作為關係觀察算子，並以：

$$
\boxed{
RPS=w_R
}
$$

表示關係過程在個體注意系統中的相對顯著性。

下一步便不是再問「關係箭頭是否存在」。而是把箭頭展開：

$$
R_t
\rightarrow
R_{t+1}
\rightarrow
R_{t+2}
\rightarrow
\dots
$$

研究它在多維關係空間中的軌跡。

這正是本系列第四篇「關係不是兩個點：關係相空間與互動軌跡」的起點。

---

## 參考文獻

1. De Jaegher, H., & Di Paolo, E. (2007). *Participatory sense-making: An enactive approach to social cognition*. Phenomenology and the Cognitive Sciences, 6, 485–507. https://doi.org/10.1007/s11097-007-9076-9

2. Di Paolo, E., & De Jaegher, H. (2012). *The interactive brain hypothesis*. Frontiers in Human Neuroscience, 6, 163. https://doi.org/10.3389/fnhum.2012.00163

3. Isik, L., Koldewyn, K., Beeler, D., & Kanwisher, N. (2017). *Perceiving social interactions in the posterior superior temporal sulcus*. Proceedings of the National Academy of Sciences, 114(43), E9145–E9152. https://doi.org/10.1073/pnas.1714471114

4. McMahon, E., & Isik, L. (2023). *Seeing social interactions*. Trends in Cognitive Sciences, 27(12), 1165–1179. https://doi.org/10.1016/j.tics.2023.09.001

5. Malik, M., & Isik, L. (2023). *Relational visual representations underlie human social interaction recognition*. Nature Communications, 14, 7317. https://doi.org/10.1038/s41467-023-43156-8

6. Papeo, L., & Abassi, E. (2019). *Seeing social events: The visual specialization for dyadic human-human interactions*. Journal of Experimental Psychology: Human Perception and Performance, 45(7), 877–888. https://doi.org/10.1037/xhp0000646

7. Koyasu, H., Kikusui, T., Takagi, S., & Nagasawa, M. (2020). *The Gaze Communications Between Dogs/Cats and Humans: Recent Research Review and Future Directions*. Frontiers in Psychology, 11, 613512. https://doi.org/10.3389/fpsyg.2020.613512

8. Merola, I., Lazzaroni, M., Marshall-Pescini, S., & Prato-Previde, E. (2015). *Social referencing and cat-human communication*. Animal Cognition, 18(3), 639–648. https://doi.org/10.1007/s10071-014-0832-2

9. Kubinyi, E., Sommese, A., Gácsi, M., & Miklósi, Á. (2025). *Dogs’ Gazing Behavior to Humans Is Related to Their Liveliness, Aggressiveness, and the Emotional Comfort They Provide*. Animals, 15(4), 483. https://doi.org/10.3390/ani15040483

10. Redcay, E., & Schilbach, L. (2019). *Using second-person neuroscience to elucidate the mechanisms of social interaction*. Nature Reviews Neuroscience, 20, 495–505. https://doi.org/10.1038/s41583-019-0179-4

---

## 研究聲明

本文為理論與概念模型研究，不提供新的臨床資料、動物實驗資料或人類受試者原始實驗結果。本文提出的 Relational Observation Operator、Relational Process Salience 與相關形式化假說皆屬待驗證理論構造。

本文不將人類對寵物或 AI 的主觀解讀直接視為對其內部心智狀態的可靠證據，也不主張關係本身具有獨立意識。本文研究的是「關係過程能否成為認知觀察與注意的獨立分析單位」，而不是為任何人類、動物或 AI 的本體地位作最終判定。
