多世界注意力分配:從單一現實到多載體認知的通用框架
Multi-World Attention Allocation: A General Framework from Single-Reality Cognition to Multi-Embodiment Cognition
作者:Neo.K
研究協作:AI-assisted theoretical development
EveMissLab / 一言諾科技有限公司
2026
摘要
人類通常被描述為存在於單一物理世界中的單一具身主體。然而,虛擬實境、擴增實境、遠端機器人、數位化身、腦機介面及共享自主系統逐漸使一個新的問題成為可操作研究對象:同一主體是否可以同時維持多個感知—行動域,並在它們之間動態配置注意力、意圖與控制資源?
本文提出「多世界注意力分配框架」(Multi-World Attention Allocation Framework, MWAAF)。其中「世界」不是形而上學上的宇宙,而被操作性定義為一個能夠形成相對獨立感知、狀態、目標與行動閉環的感知—行動域。
因此,物理身體、虛擬化身、遠端機器人、AR 疊加環境乃至未來的額外人工載體,都可以表示為:
Di=(Si,Xi,Ai,Gi),
其中 Si 為感知通道, Xi 為世界狀態, Ai 為可用行動集合, Gi 為目標或效用結構。
本文進一步修正早期單一注意力權重模型。注意力不是唯一標量,而應表示為視覺、聽覺、運動、執行控制、工作記憶等多種有限資源所構成的注意力矩陣:
A(t)=[aki(t)].
每一種認知資源 k 具有自己的容量:
i∑aki(t)≤Bk(t).
因此,多世界認知並非簡單的「一個人把百分之幾的意識放在哪個世界」,而是不同認知資源在不同感知—行動域上的非均勻配置。
本文進一步定義跨域干擾、注意力切換成本、具身耦合、控制權配置及安全優先級,並提出注意力分配的受約束動態控制模型。
現有虛擬實境研究已顯示,具身程度可改變雙任務中的注意力配置與任務表現;不同控制程度亦會影響具身與認知表現。更近期的遠端具身與共享自主研究則顯示,第一/第三人稱視角、控制權與自主程度可以依任務需要動態切換。這些結果並未證明「多世界意識」,但證明注意力、具身和控制並非不可分割的固定整體,而可成為獨立操縱的實驗變量。
本文最後主張,多世界注意力分配並非意識上傳本身,而是跨載體主體連續性之前的一個更基礎問題:
一個主體可以維持多少個有效的感知—行動閉環,以及它如何決定「現在主要在哪裡」?
關鍵詞
注意力分配、多世界認知、多載體認知、具身、代理感、共享自主、虛擬實境、遠端具身、控制分配、認知負載、跨載體主體連續性
一、從「多世界」中移除形而上學預設
「多世界」一詞容易造成誤解。
本文並不主張:
W0,W1,…,Wn
是物理學意義上的平行宇宙。
本文只需要較弱定義:
只要某個環境能形成可區分的感知輸入、狀態變化、行動輸出及目標回饋閉環,就可以暫時視為一個有效認知域。
因此定義:
Di=(Si,Xi,Ai,Gi)
其中:
Si=Sensory Interface,
Xi=World State,
Ai=Action Space,
Gi=Goal / Utility Structure.
例如:
物理人體所處環境可以是:
D0.
VR 化身所在世界:
D1.
遠端機器人的工作空間:
D2.
AR 中需要獨立處理的資訊層:
D3.
因此所謂「多世界」實際上是:
D={D0,D1,…,Dn}.
這使理論不依賴特定材料、特定網路技術或特定虛擬世界平台。
早期「真光環元宇宙」版本其實已經把身體、神經介面、注意力分配器、網路、世界渲染與安全機制拆成不同系統層,因此其注意力架構本身可與假設性的真光環通信層分離。
二、從單一注意力標量到多資源注意力矩陣
早期簡化模型使用:
α=(α0,α1,…,αn),
並令:
i∑αi=1.
這對建立直覺很有用,但如果將它解釋為真實神經系統中存在一個單一、精確而守恆的「注意力量」,則過強。
因為兩個活動可能競爭相同資源,也可能使用部分不同資源。
例如一個人可能:
- 眼睛看道路;
- 耳朵聽語音導航;
- 手控制方向盤;
- 同時維持簡單語言思考。
因此本文將注意力重新表示為:
A(t)=[aki(t)]
其中:
k∈{V,Au,M,E,W,…},
分別可以代表:
V=visual,
Au=auditory,
M=motor control,
E=executive control,
W=working memory.
而 i 則表示感知—行動域 Di。
因此:
aki(t)
表示在時間 t,資源類型 k 有多少被配置至世界 Di。
三、資源容量限制
對每一種資源 k,定義可用容量:
Bk(t)>0.
滿足:
i=0∑naki(t)≤Bk(t).
再定義歸一化配置:
αki(t)=Bk(t)aki(t).
則:
0≤αki(t)≤1,
且:
i∑αki(t)≤1.
注意,這不是神經科學定律,而是一個資源分配模型。
其目的不是宣稱人腦真的內建百分比顯示器,而是提供可以比較:
- 任務表現;
- 反應時間;
- 錯誤率;
- 視線停留;
- 操作頻率;
- 生理指標;
- 主觀負荷;
的統一座標。
四、多世界不等於完全並行
這裡出現第一個重要結果。
假設兩個世界:
D1,D2
大量競爭同一視覺資源。
則:
αV1↑
通常意味:
αV2↓.
但若:
D1
主要佔用視覺,
而:
D2
主要只需要低強度聽覺監控,
則兩者的競爭可以較弱。
因此:
Multi-domain cognition=perfect parallel cognition.
更合理的是:
partial parallelism+resource competition+rapid switching.
這也是為什麼「同時存在五個世界」不應該被理解成:
五份完全獨立且同等清晰的第一人稱意識同時全功率運行。
本文沒有這個假設。
五、認知域干擾矩陣
定義兩個感知—行動域:
Di,Dj.
它們未必互相干擾程度相同。
因此定義:
Qijkl
表示域 i 和域 j 對資源 k,l 的交叉干擾強度。
簡化形式可以寫成:
Cint=i<j∑aiTQijaj.
其中:
ai=(a1i,…,ami)T.
若:
Qij≈0,
兩個域可以較容易並行。
若:
Qij≫0,
則同時維持兩個域會快速提高認知成本。
因此真正限制多世界數量的不是一個固定:
Nmax=5,
而是:
Neffective=F(B,Q,D,T,individual state).
它會隨任務結構、訓練程度、介面、自動化與個體狀態變化。
因此舊稿中固定「最多五個世界」的說法,在本文中取消。
六、切換不是免費的
多世界系統還存在另一項成本:
Cswitch.
對注意力矩陣的變化定義:
Cswitch(t)=k,i∑λkdtdαki.
其含義是:
若:
αki
頻繁劇烈改變,
系統就必須不斷重新:
- 定位;
- 解讀上下文;
- 恢復目標;
- 找回工作記憶;
- 更新感知模型;
- 重建控制策略。
所以兩種配置即使平均注意力完全相同:
A1=A2,
若第一種配置穩定,
另一種配置快速來回切換,
其實際認知成本仍可能非常不同。
七、注意力分散度
我們可以定義一個僅作描述用途的注意力分散量。
對某一資源 k:
Hk=−i∑pkilogpki,
其中:
pki=∑jakjaki.
Hk 高代表該資源分散到較多域。
Hk 低代表高度集中。
但本文特別強調:
Hk
不是「認知負載本身」。
它只測量:
allocation dispersion
而不是腦中真正消耗多少計算資源。
真正的負載應另外建模。
八、通用認知成本函數
本文提出:
L(t)=Ctask+λCint+μCswitch+νCcoord
其中:
Ctask
是各任務自身難度;
Cint
是跨域資源競爭;
Cswitch
是重新配置成本;
Ccoord
是多載體協調成本。
當:
L(t)>Lcritical,
可能出現:
- 任務錯誤;
- 延遲增加;
- 忽略某個世界;
- 控制衝突;
- 注意力崩潰;
- 被迫單域化。
因此一個安全的多世界系統不應追求:
N→∞,
而應追求:
maxNeffectivesubject toL<Lsafe.
九、具身會改變注意力分配
這裡出現一個非常重要的實驗結果。
Iwasaki 等人在 VR 雙任務實驗中操縱受試者對機器手臂的具身感。結果顯示,在機器手被較強地具身化時,主任務表現改善,而第二任務表現仍得以維持;作者據此認為,具身可能改變注意力在雙任務中的配置方式。
因此本文增加:
ei(t)
作為域 Di 的具身耦合程度。
注意力配置不再只是:
aki=F(task importance),
而可能是:
aki=F(Ui,Ri,ei,Ii,Ci,Xi).
其中:
- Ui:效用;
- Ri:風險;
- ei:具身程度;
- Ii:意圖關聯;
- Ci:目前控制責任;
- Xi:世界狀態。
這意味著:
一個載體一旦被系統認為是「我的一部分」,它獲得注意力的方式可能與單純外部工具不同。
這對未來多載體主體尤其重要。
十、控制權與注意力不是同一變量
另一個需要拆開的概念是:
Attention=Control.
一個主體可能高度注意某個載體,卻沒有完整控制權。
反過來,也可能擁有控制權,但暫時不需要持續注意。
因此定義:
ci(t)∈[0,1]
作為對域 Di 的有效控制權。
於是每個域至少具有:
Di→(ai,ci,ei).
注意力:
ai
回答:
我投入多少認知資源?
控制:
ci
回答:
我的意圖能多大程度決定這個載體的行動?
具身:
ei
回答:
我多大程度把它整合進「自己的身體/行動系統」?
三者可以相關,但不應畫等號。
2024 年一項 VR 實驗以不同 avatar 控制程度比較 agency、embodiment 與認知表現,結果顯示控制程度確實改變具身與認知表現,而主觀 agency 報告本身未必足以辨識實際控制差異。
這提醒我們:
self-report=control ground truth.
十一、四種基本多世界運行模式
由上述模型可得到至少四種基本模式。
模式一:單域主導
αki≈1
對某主要域成立。
其他域只維持最低監控。
例如:
深度工作。
模式二:分散並行
0<αki<1
多個域同時獲得資源。
例如:
控制遠端機器人,同時聽取實體環境警報。
模式三:高速切換
表面看似多域並行,但實際是:
D1→D2→D1→D3→⋯
透過快速時間分割形成近似並行。
模式四:委託式多域
這個模式對 AI 時代尤其重要。
主體不需要自己處理所有域。
例如:
D0→H
由人類直接控制;
D1→AI1,
D2→AI2,
但 AI 只在:
Ri>θi
或需要人類決策時,把控制權重新交回。
這會形成:
attention delegation
而不是單純增加人腦負荷。
十二、委託式注意力與共享自主
假設某載體具有自治控制器:
AiAI.
則總控制可以表示為:
ui=βiuiH+(1−βi)uiAI,
其中:
0≤βi≤1.
當:
βi=1,
人類完全控制。
當:
βi=0,
AI 完全自主。
中間區域則為共享或分階段控制。
2026 年一項 co-embodiment 研究展示了一種可變自主機器手:不同任務階段在人類控制和機器自主之間切換,同時保留人類隨時 veto 的能力;其使用者研究也顯示受試者能適應這類「一個身體、兩個控制中心」的工作模式。
這提供了一個重要方向:
增加可作用載體數⇒線性增加人類認知負荷.
只要低層控制可以委託。
十三、注意力閘門
因此未來多載體系統真正重要的元件可能不是單純 renderer,而是:
Attention Gateway.
其任務是決定:
哪個世界的什麼事件,現在值得進入主體的高階認知?
對事件:
Eij
定義優先值:
P(Eij)=F(Rij,Uij,Gij,Tij,Cij).
其中:
- R:風險;
- U:效用;
- G:與目前目標相關度;
- T:時間急迫性;
- C:不確定性或需要人類介入程度。
當:
P(Eij)>θ,
才提升:
αki.
因此:
多世界系統不是讓人同時盯著十個世界。
而是:
讓十個世界存在,但只有需要主體介入的狀態才取得高注意力權重。
十四、安全世界與錨點世界
如果存在物理身體,
本文定義:
DA
為:
Anchor Domain
錨點域。
它不必永久獲得最高注意力,
但安全系統必須保證:
akA≥akAmin
或至少存在獨立監控代理:
MA.
一旦:
RA>θsafety,
執行:
A→AAmax.
即:
立即將高優先級認知資源重新集中到錨點域。
原始真光環草案中的 Safety Monitor → Attention Allocator → 強制回到物理世界,本質上就是這種優先級反轉機制,而不需要依賴真光環本身。
十五、世界切換與視點切換
世界本身未必需要完全更換。
主體也可以只改變:
Perspective.
例如遠端具身中,可以存在:
Pfirst,
Panchored,
Pthird.
2026 年一項遠端 supernumerary-limb VR 研究讓使用者依任務需要在共享第一人稱、穩定嵌入視角與第三人稱視角間切換;結果呈現不同視角在具身、導航效率與錯誤率上的不同取捨。
這說明:
Di=constant
時,
仍可以:
Pi(1)→Pi(2).
因此「我在哪裡」與「我從哪裡看」也需要拆分。
十六、一般化的注意力控制問題
綜合以上變量,可定義總效用:
J(A,C)=i∑Ui(ai,ci)−λCint−μCswitch−νCrisk.
多世界注意力分配問題成為:
A,CmaxJ
subject to:
i∑aki≤Bk,
0≤ci≤1,
以及:
Rsystem≤Rmax.
因此其本質不是:
「我要怎樣把意識平均分成五份?」
而是:
有限異質認知資源的動態受約束配置問題。
十七、動態注意力演化
為描述時間變化,可以寫:
A˙=ΠΩ[η∇AJ+Uintent+Uevent+Usafety].
其中:
ΠΩ
代表把解投影回合法資源配置域;
Uintent
代表主體主動意圖;
Uevent
代表世界事件;
Usafety
代表安全強制輸入。
因此注意力不是被動流動,而是:
intent-driven+event-driven+safety-constrained.
十八、一個具體例子
假設未來某人具有:
D0=物理身體,
D1=虛擬研究室,
D2=遠端機器人.
平常:
αE1=0.7,
αE0=0.2,
αE2=0.1.
主體正在虛擬研究室工作。
遠端機器人由 AI 自主管理:
β2=0.1.
突然機器人偵測到未知障礙:
R2↑.
Attention Gateway 判斷:
P(E2)>θ.
於是:
αE2:0.1→0.6.
同時:
β2:0.1→0.8.
人類接管。
接著物理世界火災警報觸發:
R0>Rsafety.
最高安全規則直接執行:
αE0→1.
此時:
D1,D2
不必消失,
只是主體高階注意力暫時離開。
這才是多世界系統真正可工作的形式。
十九、從多世界到多載體
當:
Di
不只是虛擬世界,而開始包含不同身體,
理論就進一步變成:
Multi-Embodiment Cognition.
假設:
B={B0,B1,…,Bm}.
則主體可以具有:
AB,
CB,
EB,
分別表示:
此時最重要的問題不再是:
我同時看幾個螢幕?
而變成:
哪些載體正在被整合進同一個主體的感知—意圖—行動閉環?
這就直接接到跨載體主體連續性。
二十、從注意力配置到主體位置
第一篇已提出第一人稱有效中心:
Pt=F(At,St,Ct,It,Bt).
本文可以給它更具體的多域形式。
定義主體對每個域的有效耦合值:
ψi(t)=F(ai,ci,ei,gi).
其中 gi 為與目前意圖的耦合。
再定義:
i∗(t)=argimaxψi(t).
則:
Di∗
可以被視為當下的:
Primary Effective Subject Domain.
主要有效主體域。
這不是意識位置的形而上學證明。
它只是回答:
當前哪個世界承載最多的注意、意圖、控制與具身耦合?
而這正是未來第一人稱遷移實驗可以追蹤的量。
二十一、主體域可以漂移
現在考慮:
ψA(t)>ψB(t).
一開始:
i∗=A.
隨著:
aA↓,
cA↓,
eA↓,
而:
aB↑,
cB↑,
eB↑,
可能存在:
t∗
使:
ψA(t∗)=ψB(t∗).
之後:
ψB>ψA.
於是:
i∗:A→B.
這就是:
Effective Subject-Domain Migration.
它仍不是「意識已經上傳」。
但是第一次把:
「我主要在哪裡?」
變成可測量的動態問題。
二十二、重要限制
本文需要明確拒絕以下推論:
ψB>ψA
不能推出:
Cphen=1.
也就是:
即使注意、具身、控制和意圖全部轉移到第二載體,也尚未證明第一人稱現象連續性必然跟著遷移。
因此:
Functional Subject Migration=Phenomenal Subject Migration
前者是本文目前可以逐步實驗化的部分。
後者仍是系列後續的核心問題。
二十三、可證偽預測
本文至少產生以下可測試預測。
第一:
若兩個域使用高度重疊的認知資源,則:
Qij↑
應伴隨雙域性能下降。
第二:
若第二載體具身程度提高:
ei↑,
則注意力配置可能產生系統性改變,而不只是增加主觀「像我的身體」的評分。現有雙任務具身實驗已提供初步支持。
第三:
提高實際控制權:
ci↑
不必與主觀 agency 評分一比一對應;既有 VR 控制實驗已顯示兩者可能出現不一致。
第四:
若低階工作委託給自主系統,
則即使:
Nactive↑,
人類自身:
LH
未必線性上升。
2026 年的可變自主 co-embodiment 工作為這類分階段控制提供了實驗先例。
第五:
視點策略可依任務動態調整,而非永久鎖定第一人稱;近期遠端 VR 研究已觀察到不同視角在導航效率與具身之間的不同優勢。
二十四、工程最小實驗
本理論其實不需要等待腦機介面。
第一個 MVP 可以只需要:
- VR/AR;
- eye tracking;
- head tracking;
- 手部控制器;
- 一個遠端或虛擬第二載體;
- 任務紀錄;
- 主觀量表。
建立:
D0=physical task,
D1=virtual task.
然後操縱:
U0,U1,
R0,R1,
c0,c1,
e0,e1.
測量:
RTi,
Errori,
Gazei,
SwitchRate,
TaskCompletioni.
由此反推:
A^(t).
因此:
MWAAF 的低階版本今天就可以實驗。
不需要真光環。
也不需要先證明意識上傳。
二十五、與原始真光環版本的關係
原始版本的重要洞察可以保留:
人不是必須完全「離開」物理世界才能進入另一個感知世界,而可以透過注意力配置在不同域之間切換。
原稿本身甚至使用:
「你不是進入副螢幕,你只是看向副螢幕。」
來描述這一點。
但本文做出三項重要修正。
第一:
Veritas Ring
不再是必要技術。
第二:
固定的:
i∑αi=1
降級為簡化歸一化模型。
第三:
「最多五世界」不再被當作一般理論上限。
真正模型變成:
A(t),C(t),E(t),Q,B,R.
因此原始理論可以重寫為:
VRM⊂MWAAF
而不是反過來。
二十六、結論
本文提出的核心命題非常簡單:
人類與未來智能主體所處的「世界」不必由物理位置唯一決定,而可以由感知、注意力、意圖、控制與具身所構成的動態閉環決定。
因此:
One biological body
並不邏輯上要求:
One cognitive action-domain.
同樣地:
Multiple domains
也不意味:
Multiple consciousnesses.
較合理的圖景是:
One subject→multiple perception-action domains→dynamic resource allocation.
多世界認知的真正問題因此不是:
「一個人可以同時活幾個世界?」
而是:
有限而異質的認知資源,如何在多個感知—行動閉環間安全、有效且可逆地配置?
當這些世界進一步連接到不同具身載體時,問題再轉化為:
Attention Allocation→Control Allocation→Embodiment Allocation.
而當其中某個新載體逐漸取得:
imaxF(ai,ci,ei,gi),
我們就第一次得到一個可以追蹤的:
主體有效位置漂移
模型。
這正是下一篇需要處理的問題:
當物理位置、觀看位置、控制位置與「我所在的位置」開始彼此分離時,什麼才是第一人稱有效視點與主體控制中心?
系列位置
第一篇
《跨載體主體連續性:注意力、控制與第一人稱的遷移理論》
建立總框架。
第二篇
《多世界注意力分配:從單一現實到多載體認知的通用框架》
本文。建立多感知—行動域與多資源注意力模型。
第三篇
《注意力不是位置:第一人稱有效視點與主體控制中心》
下一篇將研究:
Physical Location=Sensory Perspective=Control Center=First-Person Effective Center.
並正式建立「主體控制中心漂移」的數學框架。