注意力不是位置:第一人稱有效視點與主體控制中心
Attention Is Not Location: Effective First-Person Perspective and the Subjective Control Center
作者:Neo.K
研究協作:AI-assisted theoretical development
EveMissLab / 一言諾科技有限公司
2026
摘要
一個人的物理身體位於何處,是否等同於「這個人主觀上位於何處」?
在普通生活條件下,兩者高度重疊,以致我們通常不需要區分:
Physical Location≈First-Person Location.
然而虛擬實境、遠端具身、腦機介面、多載體控制與未來人工身體,使此等價逐漸失效。
現有虛擬具身研究已能分別操縱第一人稱視角、身體所有感、代理感與 self-location。第一人稱視角即使在真實身體沒有執行對應動作時,也可能產生對虛擬身體行為的代理感與自我歸屬;第一人稱具身甚至可對真實身體的姿勢控制產生可測量影響。
本文因此提出:
Lphysical=Lperspective=Lcontrol=Lself
其中分別表示物理位置、感知視點、控制位置與第一人稱有效自我位置。
本文進一步定義「主體控制中心」(Subjective Control Center, SCC)為某一時間尺度中,意圖形成、感知整合、行動選擇、預測、回饋修正與自我指涉形成最高有效閉環的動態功能中心。SCC 不被假定為大腦中的固定點,也不是靈魂位置,而是一個可跨不同感知—行動域重分配的動態關係結構。
定義載體 Bi 的主體耦合向量:
zi(t)=(Ai,Si,Ci,Ei,Ii,Ri),
分別表示注意力、感知、控制、具身、意圖與因果回饋耦合。
由此定義有效主體權重:
Ψi(t)=F(zi(t)).
當:
Ψj(t)>Ψi(t),
並持續達到一定穩定條件時,主體的主要有效控制域可能由 Bi 漂移至 Bj。
本文稱此過程為:
Subjective Control-Center Drift
即「主體控制中心漂移」。
本文最後強調,功能上的主體中心漂移並不能直接證明第一人稱現象意識本身已跨載體遷移;它所提供的是第一條可以逐步操縱、測量並由主體自身體驗的跨載體路徑。這使傳統「意識上傳」從瞬間複製問題轉化為可研究的連續遷移問題。
關鍵詞
第一人稱視點、主體控制中心、注意力、self-location、agency、body ownership、具身、遠端具身、跨載體主體連續性、主體控制中心漂移
一、普通世界中的重合假象
在一般人類生活中,下列四個位置通常高度重疊:
LP=physical body location,
LV=visual / sensory perspective,
LC=effective control location,
LS=experienced self-location.
因此通常:
LP≈LV≈LC≈LS.
當一個人說:
「我在房間裡。」
這句話同時可以表示:
身體在房間裡;
眼睛從房間裡看世界;
手腳在房間裡接受控制;
主體也感覺「自己就在這裡」。
由於這些座標長期共線,人類自然形成了一個強烈直覺:
我的身體在哪裡,我就在哪裡。
但這未必是一條本體論定律。
它可能只是正常生物條件下非常穩定的統計重合。
二、四種位置的分離
一旦引入虛擬實境,此重合就可以被人為破壞。
假設人體位於:
LP=A.
但頭戴顯示器提供的第一人稱視覺來自:
LV=B.
若運動追蹤又使人體動作映射到虛擬身體:
LC≈B.
當具身形成之後,主體還可能報告:
LS≈B.
於是:
LP=A,LV=LC=LS≈B.
這已不是哲學思想實驗。
VR 實驗長期顯示,第一人稱視角和多感官一致性可以誘發對虛擬身體的 ownership、agency 與 self-location。
因此我們至少知道:
LP=LS
不是心理經驗上的必然恆等式。
三、第一人稱視角不是單純攝影機位置
這裡需要避免另一個過度簡化。
第一人稱視角:
LV
不能直接等同於:
LS.
把攝影機放到某個位置,不等於主體一定把那裡當成自己。
更合理的是:
LS=F(LV,S,C,E,I,R).
其中:
S=sensory congruence,
C=control coupling,
E=embodiment,
I=intentional coupling,
R=closed-loop causal feedback.
因此第一人稱影像只是構成有效第一人稱位置的重要輸入之一。
研究顯示,第一人稱視角本身對虛擬身體 ownership 有重要作用,但視覺—運動同步、視觸同步與其他多感官條件仍會改變具身強度。
所以:
First-Person Camera=First-Person Self.
四、Agency 與 Ownership 必須分離
跨載體研究另一項常見錯誤,是把:
Body Ownership
和:
Sense of Agency
視為同一東西。
本文分別定義:
Oi=「這個身體/載體是我的」的程度,
以及:
Gi=「是我造成這個行動」的程度.
它們通常相關,但可以分離。
虛擬具身實驗已顯示 body ownership 與 agency 對身體連續性、第一人稱視角與動作條件的反應並不完全一致。
因此可能出現:
Oi↑,Gi↓,
例如:
我覺得這隻手是我的,但它正在被外力控制。
也可能:
Gi↑,Oi↓,
例如:
我知道是我控制這台機器,但我仍把它視為工具。
所以:
ownership=agency=self-location.
五、沒有實際動作,也可能出現代理感
這一點尤其重要。
傳統直覺認為:
如果我的肌肉沒有執行動作,我就不可能感覺是「我」做的。
但虛擬實境研究已顯示,坐著不動的參與者在第一人稱視角中看到虛擬身體行走,可以產生對虛擬行走的顯著 agency 與 self-attribution。
因此:
biological motor execution
不是 agency 的唯一可能來源。
至少在現象層面,主體可以利用:
intention,
prediction,
perspective,
observed consequence
建立:
「這個動作是我的」.
這對未來遠端載體尤其重要。
因為第二身體不需要和原始人體具有一比一的肌肉結構。
六、從控制器到控制中心
現在進一步區分:
controller
與:
control center.
一個 joystick 是 controller。
一個 AI autopilot 也是 controller。
但是本文所說的:
Γ=Subjective Control Center
並不是某一個硬體控制器。
它是:
在哪一個系統區域中,主體的意圖、感知、預測、行動與回饋形成最高程度的整合閉環。
因此定義:
Γt=Integrate(It,At,St,Ut,Ft,Mt)
其中:
It=intention,
At=attention,
St=sensory state,
Ut=action/control output,
Ft=feedback,
Mt=self/world model.
Γt 不是固定物質位置。
它描述的是一個整合結構。
七、控制閉環
最小主體控制閉環可以表示為:
It→Ut→Xt+1→St+1→Mt+1→It+1.
其中:
It
產生行動意圖,
Ut
執行控制,
Xt+1
世界狀態因此改變,
St+1
產生新的感知,
最後主體修正:
Mt+1
及下一輪意圖。
因此:
Subjective control=closed causal loop,
而不是單向命令。
若一個遠端載體只接受命令,但主體完全不知道結果:
I→U→X
卻缺少:
X→S→I,
它仍是一個工具,但很難形成強烈的即時具身。
八、載體耦合向量
對每個可能載體 Bi,定義:
zi(t)=(ai,si,ci,ei,gi,ri)
其中:
ai=attention coupling,
si=sensory coupling,
ci=control coupling,
ei=embodiment coupling,
gi=goal / intentional coupling,
ri=causal feedback coupling.
每一項取:
[0,1]
只作操作性歸一化。
注意這不是宣稱這六個變量構成完整意識。
它只是描述:
某個載體目前有多大程度被整合進主體的感知—意圖—行動系統。
九、有效主體權重
定義:
Ψi(t)=F(ai,si,ci,ei,gi,ri).
最簡化的線性近似為:
Ψi=waai+wssi+wcci+weei+wggi+wrri.
其中:
k∑wk=1.
但真實系統很可能是非線性的。
例如若完全沒有回饋:
ri=0,
則即使:
ci=1,
有效具身也可能快速下降。
因此可進一步使用乘法耦合:
Ψi=aiwasiwsciwceiwegiwgriwr.
此形式表示任何核心成分接近零,都可能大幅削弱整體耦合。
兩種模型都只是待實驗比較的候選。
十、主要有效主體域
現在定義:
B∗(t)=argimaxΨi(t).
稱為:
Primary Effective Subject Domain
中文:
主要有效主體域。
這回答的不是:
靈魂在哪裡?
而是:
當前哪個載體承載最大比例的注意力、感知、控制、意圖、具身與因果回饋閉環?
如果:
B∗=B0,
物理身體主導。
如果:
B∗=B1,
第二載體成為主要有效主體域。
十一、主體中心不一定等於 winner-take-all
上述:
argmax
只是最簡化模型。
實際上可能出現:
Ψ0≈Ψ1.
此時不應強迫:
B∗=B0
或:
B∗=B1.
反而可能形成:
Γ=B0⊕B1.
即:
分布式主體控制域。
主體可能真正在功能上使用兩個身體。
例如:
一隻手操作實體鍵盤;
另一組機器臂進行遠端操作;
視覺同時接收兩個域;
AI 幫助管理低優先控制。
此時:
Γ
沒有必要被限制在任何單一載體。
十二、主體控制中心漂移
假設初始:
ΨA(0)=0.9,
ΨB(0)=0.1.
主體明確位於:
A.
隨著訓練:
aB↑,
sB↑,
cB↑,
eB↑,
gB↑,
rB↑.
因此:
ΨB(t)↑.
同時降低:
ΨA(t).
若存在:
t∗
使:
ΨA(t∗)=ΨB(t∗),
並之後:
ΨB(t)>ΨA(t),
則可以說:
Γ:A⇝B.
本文稱之為:
Subjective Control-Center Drift
主體控制中心漂移
十三、漂移與跳躍不同
這裡正是本文與傳統 upload 模型最重要的差異。
傳統模型:
A→B
可能是瞬間不連續。
本文研究的是:
A→(A+B)→B.
於是:
ΨA(t)
連續下降,
而:
ΨB(t)
連續上升。
若函數連續:
Ψi(t)∈C0,
則控制中心不存在必然的瞬間斷裂。
這至少提供:
functional continuity path.
它不能直接證明:
phenomenal continuity,
但消除了傳統突然 copy 模型中的一部分結構不連續。
十四、遷移速度
可以定義:
vΓ(t)=dtdΨ.
若:
vΓ≫vadapt,
主體來不及適應新的感知—控制配置。
可能出現:
- 暈眩;
- 失去 agency;
- self-location 不穩;
- 動作錯配;
- 控制衝突。
若:
vΓ≤vadapt,
則系統可能允許漸進重新校準。
因此跨載體遷移不只涉及終點:
A→B,
還涉及:
path and rate.
這是一項很重要的工程差異。
十五、遷移不是單一維度同步進行
六個變量未必一起改變。
例如可能:
sB↑
最先發生。
也就是:
先看到第二具身。
接著:
cB↑.
開始控制第二具身。
再來:
eB↑.
開始覺得它是我的。
最後:
gB↑.
長期意圖與生活活動開始在那裡發生。
所以遷移路徑是:
zA⇝zB
在六維狀態空間中的軌跡,而不是一個單一 switch。
十六、第一人稱有效視點
現在正式定義:
Peff(t)=F(LV,zi,Γt).
它代表:
主體當下實際用來組織世界經驗的主要第一人稱參考框架。
注意:
Peff
甚至不一定與第一人稱攝影機完全重合。
例如使用第三人稱視角操縱角色時,人仍可能形成強 agency。
反過來,第一人稱視角也可能沒有足夠控制或 ownership。
因此:
Peff=Pcamera.
有效第一人稱視點是一個整合結果。
十七、身體邊界可能不是主體邊界
傳統人體模型暗示:
∂S=∂Bbio.
也就是主體邊界等於生物身體邊界。
但如果遠端工具逐漸被納入:
Γ,
則更合理的形式可能是:
∂S=∂EffectiveControlSystem.
主體有效邊界由:
- 可感知什麼;
- 可控制什麼;
- 哪些結果會回饋;
- 哪些東西被整合到自我模型;
共同決定。
這不是宣稱機器手在本體論上真的變成人體組織。
而是說:
functional self-boundary
具有一定可塑性。
十八、工具、延伸身體與第二身體
因此可以建立連續光譜:
External Tool
↓
Integrated Tool
↓
Extended Body Part
↓
Secondary Embodiment
↓
Primary Embodiment.
真正的轉變並不需要一個神秘瞬間。
可以由:
Ψi
逐步上升描述。
這也意味着:
「身體」本身可能存在功能性程度,而不是只有 0 或 1。
十九、自治載體造成的新問題
現在加入 AI。
假設第二具身具有自主控制:
uB=βuH+(1−β)uAI.
如果:
β=1,
完全由人控制。
如果:
β=0,
完全自治。
那麼有趣的問題是:
β<1
時,載體還可以被主體視為「我」嗎?
答案很可能不是簡單否定。
人體本身大量行為就不是由高階意識逐步命令每一個肌肉纖維。
因此:
low-level autonomy⇒loss of embodiment.
真正重要的可能是高階意圖:
GH
是否仍然支配載體的整體行動方向。
二十、階層式控制
因此可將控制分成:
C=(Cgoal,Cstrategy,Caction,Cmotor).
主體可能只保留:
Cgoal
與:
Cstrategy,
而 AI 負責:
Caction,Cmotor.
這種系統仍可能具有非常強的:
agency.
例如:
我要走到那裡。
主體沒有控制每個步態,但仍然認為:
「是我走過去的。」
因此未來 AI 輔助身體可能與生物運動控制更接近,而不是與傳統遙控器相同。
二十一、意圖可能比微觀控制更重要
這導出一個值得後續檢驗的命題:
Cintent>Cmicrocontrol
不是數值上的固定不等式,而是一項功能假說:
對主體 agency 而言,高階意圖是否持續形成行動因果來源,可能比主體是否直接計算全部底層動作更重要。
如果成立,這會大幅改變跨載體設計。
我們不需要:
人腦即時操縱十萬個機器關節。
而只需要:
human intention→AI motor realization→sensory feedback.
主體仍然可能維持完整高階閉環。
二十二、所有權不要求完全控制
反過來同樣成立。
人無法直接控制:
- 心跳的每一下;
- 腸道運動;
- 免疫系統;
- 大量自律神經活動。
但仍然說:
「這是我的身體。」
因此:
Oi=1
不要求:
Ci=1.
所以未來人工身體可能具有大量自治模組,甚至自主 AI 子系統,而整體仍被某個高階主體納入:
SelfModel.
這直接連到後續多尺度主體問題。
二十三、兩個控制中心控制同一個身體
更極端的情況:
H1+H2→B.
兩個人共同控制同一 avatar。
現有 virtual co-embodiment 研究已經開始研究多人共享同一虛擬身體,以及另一個人的控制與意圖資訊如何改變使用者對共享肢體的 embodiment。
這說明:
one body⇒one control source.
於是未來還可能存在:
Γ1,Γ2→B.
這會產生:
- agency 分配;
- 責任分配;
- ownership 重疊;
- 意圖衝突;
- 控制仲裁;
等全新問題。
二十四、一個控制中心控制多個身體
反向:
Γ→B1+B2+⋯+Bn.
也不具有形式矛盾。
因此傳統:
1 subject↔1 body
其實只是生物人類的常見拓撲。
更一般化的關係應為一個二部圖:
G=(VS,VB,ESB),
其中:
VS
為主體控制中心集合,
VB
為載體集合,
ESB
表示控制、感知、具身與關係耦合。
如此可表示:
1→N,
N→1,
以及:
N→M.
主體—身體關係不再先驗固定為一對一。
二十五、主體位置其實可能是一個場
當載體很多時,甚至:
B∗
也不夠。
可以定義:
Ψ(B,t)
為「主體有效耦合場」。
在離散系統:
Ψi(t).
連續化後:
Ψ(x,t).
如果:
Ψ(x,t)
高度集中,
主體有效位置像一個點。
如果分布較廣:
Var[Ψ]↑,
則主體在功能上更接近分布式存在。
因此:
self-location may be a distribution rather than a point.
這會成為跨載體理論的重要一般化。
二十六、主要自我位置與分布式自我
定義歸一化:
pi(t)=∑jΨj(t)Ψi(t).
則主體分布熵:
HS(t)=−i∑pi(t)logpi(t).
若:
HS≈0,
主體高度集中於單一載體。
若:
HS↑,
主體功能耦合分布在更多載體。
但再次強調:
HS
不是「意識分裂程度」。
它只描述:
functional subject distribution.
二十七、第一人稱報告的重要性與限制
如果受試者在遷移中報告:
「我開始覺得自己在 B。」
這是一個非常重要的:
Dfirst−person.
但它不應被錯當成:
metaphysical proof.
因此本文採取雙層驗證:
D=(Dfirst−person,Dthird−person).
第一人稱資料包括:
- self-location;
- ownership;
- agency;
- presence;
- continuity report。
第三人稱資料包括:
- 動作表現;
- 反應時間;
- 視線;
- 姿勢;
- 生理反應;
- 控制錯誤;
- 感知偏移。
近期全身虛擬具身研究觀察到第一人稱具身條件下 avatar 動作會影響受試者真實姿勢控制,提供了一種超越單純問卷的第三人稱行為指標。
二十八、主體漂移實驗
可以建立一個最小實驗:
B0=physical body,
B1=virtual body.
初始:
Ψ0≫Ψ1.
逐步提高:
s1,c1,e1,a1.
同時降低第二載體與真實身體之間的:
sensorimotor mismatch.
每一階段測量:
O1(t),
G1(t),
LS(t),
Performance1(t),
PosturalResponse(t).
研究是否存在:
t∗
使大量不同指標共同產生狀態轉換。
二十九、更強的實驗:雙載體過渡
第二階段:
B0+B1
都可以作用。
不是關閉生物身體。
主體先控制:
B0.
再加入:
B1.
之後逐步:
C0↓,
C1↑.
並保持:
It
不中斷。
例如主體持續執行同一任務:
把物體從房間左側移到右側。
前半段由:
B0
完成,
中途把控制權交給:
B1,
但高階意圖始終是:
I=完成同一個目標.
這比關機—複製模型更接近主體連續性的核心問題。
三十、控制中心漂移的連續性條件
暫時定義:
Γt⇝Γt+Δt
具有功能連續性,若滿足:
Ccausal>θc,
Cintent>θi,
Ccontrol>θu,
且:
∥z(t+Δt)−z(t)∥<ϵ.
這只是第一版操作定義。
其核心思想是:
不要用「材料是否相同」判斷遷移,而先判斷主體閉環是否存在一條沒有巨幅斷裂的狀態路徑。
三十一、但是這仍然沒有解決意識
到這裡必須再次踩煞車。
即使:
ΓA⇝ΓB
完全成功,
仍然不能直接推出:
Cphen=1.
也就是:
Subjective Control Continuity⇒Phenomenal Continuity.
我們只證明:
- 注意力可以重新配置;
- 視點可以改變;
- ownership 可以被操縱;
- agency 可以被操縱;
- self-location 可以偏移;
- 控制閉環可以跨載體建立。
至於:
現在正在經驗世界的那個第一人稱,是不是也跟著過去了?
依然是下一層問題。
三十二、但它把問題變得可研究了
這一點才是整套框架真正的價值。
傳統問題:
A→B
只能問:
「成功了嗎?」
本文改成:
Γ(t)
的連續動態。
於是可以研究:
dtdΨi,
dtdLS,
dtdOi,
dtdGi.
也可以比較:
fast migration
與:
slow migration.
可以比較:
continuous migration
與:
copy-and-restart.
於是意識上傳不再只有一個終極按鈕。
它變成一個狀態空間中的實驗路徑問題。
三十三、對 AI 的直接映射
對未來持續型 AI,也可以使用相同架構。
假設:
B0=Model Runtime A,
B1=Model Runtime B.
AI 的:
- working state;
- goal stack;
- memory;
- tool control;
- world model;
可以逐步遷移。
則:
Ψ0(t)↓,
Ψ1(t)↑.
若舊 runtime 和新 runtime 暫時同時存在:
B0+B1,
便可以研究與人類雙載體類似的:
control-center transfer.
問題不再只是:
checkpoint 有沒有成功載入?
而是:
哪一個執行域目前正在延續原來的意圖—控制—回饋鏈?
三十四、AI 使「主體在哪裡」更加困難
如果一個 AI:
- 推理在 GPU A;
- 記憶在伺服器 B;
- 感知 Agent 在設備 C;
- 身體是機器人 D;
- 世界模型在雲端 E;
那麼:
LP
本身就失去簡單意義。
此時:
Subject Location=Compute Location.
主體更可能等於跨節點形成的:
Γ.
這反而凸顯:
「主體控制中心」不是物理座標,而是一個動態因果整合結構。
三十五、本文的核心命題
本文提出五個主要命題。
第一:
LP=LV=LC=LS
這些位置在正常人類條件中通常重疊,但不具有必然等價性。
第二:
O=G=LS
body ownership、agency 與 self-location 必須分開研究。
第三:
Γ=dynamic integrated control relation
主體控制中心不是固定材料點。
第四:
ΓA⇝ΓB
具有可操作的連續遷移模型。
第五:
functional migration⇒phenomenal migration.
因此本文不宣稱意識已被定位或轉移。
三十六、結論
「我在哪裡?」看似是一個最簡單的問題。
在人類正常生物條件下:
body=perspective=control=self-location
近似成立。
因此幾千年來:
「我的身體在哪裡?」
往往足以回答:
「我在哪裡?」
但新型態的虛擬具身、遠端控制、多身體、共享自主與未來 AI 主體正在使這四者分離。
本文因此將主體的位置重新表示為:
Self Location=F(attention,sensation,control,embodiment,intention,causal feedback).
並進一步提出:
Ψi(t)
描述某一載體成為主體有效域的程度。
於是:
我在 A
和:
我在 B
之間,不再必須存在一個神秘的瞬間跳躍。
它可能經歷:
A→A+B→B.
也就是:
Subjective Control-Center Drift.
這並沒有回答最後的意識問題。
但它讓我們第一次可以將:
「我能不能從這裡過去那裡?」
拆成:
「我的感知是否過去?」
「我的注意力是否過去?」
「我的控制是否過去?」
「我的具身是否過去?」
「我的意圖與因果鏈是否持續?」
最後才剩下一個不能再由前面問題偷渡回答的核心:
那個正在體驗這一切的第一人稱,是否也持續了?
這正是下一篇:
《第一人稱現象連續性:意識上傳真正沒有回答的問題》
所要處理的中心命題。
系列位置
第一篇:
《跨載體主體連續性:注意力、控制與第一人稱的遷移理論》
建立整體 CSSC 框架。
第二篇:
《多世界注意力分配:從單一現實到多載體認知的通用框架》
建立 MWAAF、多資源注意力與多載體配置理論。
第三篇:
《注意力不是位置:第一人稱有效視點與主體控制中心》
本文。建立:
LP,LV,LC,LS,Γ,Ψi
以及主體控制中心漂移。
第四篇:
《第一人稱現象連續性:意識上傳真正沒有回答的問題》
下一篇將正式把:
Cphen
從其他六種連續性中獨立出來,研究:
Persistence of the experiencer
究竟能否由任何第三人稱證據判定。