08.已知則編譯,未知則展開
系列:《從路徑覆蓋到行星智能:記憶編譯型計算存在論》 部別:第二部——記憶編譯型智能 版本:v0.1 日期:2026-08-01
摘要
記憶編譯型狀態智能體的優勢,在於能把過去昂貴的搜尋、推理與行動壓縮成低成本快速通道;但同一機制也帶來最危險的失敗模式:當新狀態其實不屬於任何既有類別時,系統仍可能因分類器必須輸出答案,而把未知強行套入已知策略。此時,越成熟、越快速、越高置信的記憶系統,反而可能以更低延遲放大錯誤。
本文因此將「未知」提升為記憶編譯型智能中的一級狀態,並建立雙模式運作原則:
已知則編譯,未知則展開 \boxed{
\text{已知則編譯,未知則展開}
} 已知則編譯,未知則展開
對高置信、低例外風險、環境穩定且歷史驗證充分的狀態,智能體進入 Compiled Mode,以狀態分類、快速索引與已編譯策略完成低成本反應;若偵測到低分類置信度、高分類熵、分布外輸入、已知例外鄰近、模型彼此衝突、結果偏離預測或概念漂移,則退出快速通道,進入 Exploration Mode,重新展開候選路徑、驗證新策略,必要時建立新狀態類別並重新編譯記憶。
本文借用 open-set recognition、out-of-distribution detection、selective prediction/reject option 與 concept drift 等既有研究作為技術參照,但將其整合進長期記憶智能的狀態切換問題。本文進一步提出 Knownness Gate、Abstention State、Exploration Budget、Recompilation Trigger 與 Unknown-to-Known Transition 五個核心元件,並將未知狀態拆成「陌生未知、衝突未知、漂移未知、例外未知與結構未知」。
第二部至此形成完整閉環:極強記憶提供已知世界的快速編譯,但真正穩健的累積智能必須持續保留「承認未知並重新展開」的能力。智能成熟的標誌因此不是把所有世界狀態都分類掉,而是越來越精確地知道:哪些地方可以不用重算,哪些地方絕對不能偷懶。
關鍵詞: 未知狀態、Open-Set Recognition、OOD Detection、Selective Prediction、Reject Option、Concept Drift、記憶編譯、快速通道、探索模式、累積智能
1.記憶編譯型智能最大的危險,恰好來自它最強的地方
前兩篇建立了:
狀態 → 分類 → 索引 → 策略 \text{狀態}
\rightarrow
\text{分類}
\rightarrow
\text{索引}
\rightarrow
\text{策略} 狀態 → 分類 → 索引 → 策略
的快速通道。
理想狀況下:
K f a s t ≪ K s o l v e K_{\mathrm{fast}}
\ll
K_{\mathrm{solve}} K fast ≪ K solve
所以越多狀態被編譯,平均決策成本越低。
但現在假設新狀態:
x n e w x_{\mathrm{new}} x new
其實不屬於任何已知類別。
如果系統仍然強迫:
C ( x n e w ) = c i C(x_{\mathrm{new}})
=
c_i C ( x new ) = c i
則會發生:
x n e w → c i → π i → a i x_{\mathrm{new}}
\rightarrow
c_i
\rightarrow
\pi_i
\rightarrow
a_i x new → c i → π i → a i
整條錯誤快速通道。
而且它可能比慢速推理更危險,因為:
T d e c i s i o n ↓ T_{\mathrm{decision}}\downarrow T decision ↓
同時:
confidence ↑ \text{confidence}\uparrow confidence ↑
因此:
高速錯誤分類,可能比低速錯誤推理更危險。 \boxed{
\text{高速錯誤分類,可能比低速錯誤推理更危險。}
} 高速錯誤分類,可能比低速錯誤推理更危險。
2.封閉世界假設不適合長期智能體
很多分類問題隱含:
x ∈ { c 1 , c 2 , … , c n } x\in
\{c_1,c_2,\ldots,c_n\} x ∈ { c 1 , c 2 , … , c n }
也就是:
所有測試輸入都必然屬於訓練時已知的某個類別。
這是 closed-set assumption。
但長期運作於真實世界的智能體面對的是:
x ∈ { c 1 , … , c n , unknown } x\in
\{c_1,\ldots,c_n,\text{unknown}\} x ∈ { c 1 , … , c n , unknown }
甚至:
x ∈ { c 1 , … , c n , future classes not yet existing } x\in
\{c_1,\ldots,c_n,\text{future classes not yet existing}\} x ∈ { c 1 , … , c n , future classes not yet existing }
所以需要:
C ( x ) = ⊥ \boxed{
C(x)=\bot
} C ( x ) = ⊥
其中:
⊥ \bot ⊥
不代表系統故障,而代表:
現有記憶結構不足以安全地將此狀態歸入任何成熟類別。
3.「不知道」必須是一個合法答案
一般分類器常被要求:
∑ i P ( c i ∣ x ) = 1 \sum_iP(c_i\mid x)=1 i ∑ P ( c i ∣ x ) = 1
所以無論輸入多奇怪,都會選一個:
c ∗ = arg max i P ( c i ∣ x ) c^\ast
=
\arg\max_iP(c_i\mid x) c ∗ = arg i max P ( c i ∣ x )
但:
c ∗ c^\ast c ∗
只是「已知選項中最高」,不代表:
P ( x ∈ known world ) P(x\in\text{known world}) P ( x ∈ known world )
真的高。
因此記憶編譯型智能必須允許:
Decision ( x ) = abstain \boxed{
\operatorname{Decision}(x)=\text{abstain}
} Decision ( x ) = abstain
或者:
C ( x ) = ⊥ \boxed{
C(x)=\bot
} C ( x ) = ⊥
這和 selective prediction/reject option 的核心思想一致:
模型在預期自己可能犯錯時,可以拒絕輸出一般預測。
所以成熟智能不應被定義為:
永遠有答案 \text{永遠有答案} 永遠有答案
而應包括:
知道何時不應該直接回答。 \boxed{
\text{知道何時不應該直接回答。}
} 知道何時不應該直接回答。
4.已知性不是單一置信度
不能只使用:
max i P ( c i ∣ x ) \max_iP(c_i\mid x) i max P ( c i ∣ x )
作為已知判斷。
因為神經系統可能對未知輸入產生高置信錯誤。
所以本文定義 Knownness:
K n ( x ) K_n(x) K n ( x )
它至少由以下因素共同決定:
K n ( x ) = F ( C f , H c , D p , D e , A m , T d , V h ) K_n(x)
=
F(
C_f,
H_c,
D_p,
D_e,
A_m,
T_d,
V_h
) K n ( x ) = F ( C f , H c , D p , D e , A m , T d , V h )
其中:
C f C_f C f :分類置信度;
H c H_c H c :分類熵;
D p D_p D p :距離已知原型的距離;
D e D_e D e :距離已知例外的距離;
A m A_m A m :多模型一致性;
T d T_d T d :時間/概念漂移程度;
V h V_h V h :歷史驗證可靠性。
因此:
Knownness ≠ top-1 confidence \boxed{
\text{Knownness}
\neq
\text{top-1 confidence}
} Knownness = top-1 confidence
5.Knownness Gate
定義已知性閘門:
G K ( x ) G_K(x) G K ( x )
輸出:
G K ( x ) ∈ { compiled , adaptive , explore , abstain } G_K(x)
\in
\{
\text{compiled},
\text{adaptive},
\text{explore},
\text{abstain}
\} G K ( x ) ∈ { compiled , adaptive , explore , abstain }
可以使用兩個門檻:
τ H > τ L \tau_H>\tau_L τ H > τ L
若:
K n ( x ) ≥ τ H K_n(x)\geq\tau_H K n ( x ) ≥ τ H
進入:
Compiled Mode \text{Compiled Mode} Compiled Mode
若:
τ L < K n ( x ) < τ H \tau_L<K_n(x)<\tau_H τ L < K n ( x ) < τ H
進入:
Adaptive Mode \text{Adaptive Mode} Adaptive Mode
若:
K n ( x ) ≤ τ L K_n(x)\leq\tau_L K n ( x ) ≤ τ L
進入:
Exploration Mode \text{Exploration Mode} Exploration Mode
若風險高且目前不能安全探索:
Abstention \text{Abstention} Abstention
因此系統不是二元:
known/unknown \text{known/unknown} known / unknown
而是具有中間帶。
6.為什麼需要中間帶?
如果只用單一門檻:
K n ( x ) ≥ τ K_n(x)\geq\tau K n ( x ) ≥ τ
很容易在閾值附近不穩定。
例如:
0.799 0.799 0.799
與:
0.801 0.801 0.801
不應導致完全不同的世界。
因此可以建立 hysteresis:
進入編譯模式需要:
K n > τ H K_n>\tau_H K n > τ H
但一旦已在編譯模式,只有下降到:
K n < τ L K_n<\tau_L K n < τ L
才退出。
其中:
τ H > τ L \tau_H>\tau_L τ H > τ L
這避免模式在邊界附近高速震盪。
7.第一種未知:陌生未知
最直覺的未知:
x x x
距離所有已知原型都很遠:
min i D ( x , μ i ) ≫ τ D \min_iD(x,\mu_i)\gg\tau_D i min D ( x , μ i ) ≫ τ D
此時:
x ∉ ⋃ i N ( c i ) x\notin
\bigcup_i\mathcal N(c_i) x ∈ / i ⋃ N ( c i )
這是:
Novelty Unknown \boxed{
\text{Novelty Unknown}
} Novelty Unknown
類似 open-set recognition 與 OOD detection 要處理的核心場景:
測試時出現訓練/已知類別空間之外的樣本。
這時快速策略不應被調用。
8.第二種未知:衝突未知
另一種情況不是:
沒有類別匹配 \text{沒有類別匹配} 沒有類別匹配
而是:
太多類別同時匹配 \text{太多類別同時匹配} 太多類別同時匹配
例如:
P ( c 1 ∣ x ) = 0.41 P(c_1\mid x)=0.41 P ( c 1 ∣ x ) = 0.41
P ( c 2 ∣ x ) = 0.39 P(c_2\mid x)=0.39 P ( c 2 ∣ x ) = 0.39
P ( c 3 ∣ x ) = 0.18 P(c_3\mid x)=0.18 P ( c 3 ∣ x ) = 0.18
分類熵:
H ( C ∣ x ) = − ∑ i P ( c i ∣ x ) log P ( c i ∣ x ) H(C\mid x)
=
-\sum_iP(c_i\mid x)\log P(c_i\mid x) H ( C ∣ x ) = − i ∑ P ( c i ∣ x ) log P ( c i ∣ x )
偏高。
這表示:
Ambiguous Unknown \boxed{
\text{Ambiguous Unknown}
} Ambiguous Unknown
不是完全陌生,而是現有分類系統無法確定它應位於哪個結構。
這種狀態適合:
局部展開 \text{局部展開} 局部展開
而非完整從零探索。
9.第三種未知:例外未知
假設:
x x x
非常靠近熟悉類別:
c i c_i c i
但也靠近歷史例外:
e j ∈ E ( c i ) e_j\in E(c_i) e j ∈ E ( c i )
即:
D ( x , μ i ) ≪ τ D(x,\mu_i)\ll\tau D ( x , μ i ) ≪ τ
且:
D ( x , e j ) ≪ τ e D(x,e_j)\ll\tau_e D ( x , e j ) ≪ τ e
此時表面上很熟,但危險性反而高。
這可稱為:
Exception Unknown \boxed{
\text{Exception Unknown}
} Exception Unknown
它提醒我們:
越像熟悉狀態,不一定越應該快速反應。
因為關鍵例外往往就發生在熟悉區域的邊界。
10.第四種未知:漂移未知
即使:
x t x_t x t
以前屬於已知類:
c i c_i c i
世界可能改變。
設過去條件分布:
P t 0 ( y ∣ x ) P_{t_0}(y\mid x) P t 0 ( y ∣ x )
現在:
P t 1 ( y ∣ x ) P_{t_1}(y\mid x) P t 1 ( y ∣ x )
若:
P t 0 ( y ∣ x ) ≠ P t 1 ( y ∣ x ) P_{t_0}(y\mid x)
\neq
P_{t_1}(y\mid x) P t 0 ( y ∣ x ) = P t 1 ( y ∣ x )
表示概念可能發生 drift。
此時:
x x x
本身看起來完全熟悉,
但:
π i \pi_i π i
已不再適用。
所以:
已知狀態 + 失效世界模型 = 新的未知 \boxed{
\text{已知狀態 + 失效世界模型}
=
\text{新的未知}
} 已知狀態 + 失效世界模型 = 新的未知
這是長期智能必須額外處理的問題。
11.第五種未知:結構未知
還有一種最有趣的未知。
每一個局部元素都看過:
v 1 , v 2 , … , v n ∈ M v_1,v_2,\ldots,v_n\in\mathcal M v 1 , v 2 , … , v n ∈ M
但它們的組合:
G n e w G_{\mathrm{new}} G new
從未出現。
例如:
known components + unknown relation topology \text{known components}
+
\text{unknown relation topology} known components + unknown relation topology
這時如果只做元素級檢索,系統會誤認為:
全部都知道。
但真正未知的是:
關係結構 \boxed{
\text{關係結構}
} 關係結構
可以定義:
N S ( x ) = D ( G x , G k n o w n ) N_S(x)
=
D(
G_x,
\mathcal G_{\mathrm{known}}
) N S ( x ) = D ( G x , G known )
當:
N S ( x ) ≫ 0 N_S(x)\gg0 N S ( x ) ≫ 0
即使所有節點都熟悉,也應進入探索。
12.未知不是一個桶子,而是一個向量
因此可以定義:
U ( x ) = ( U N , U A , U E , U D , U S ) \mathbf U(x)
=
(
U_N,
U_A,
U_E,
U_D,
U_S
) U ( x ) = ( U N , U A , U E , U D , U S )
分別表示:
U N U_N U N :陌生新穎度;
U A U_A U A :分類歧義;
U E U_E U E :例外鄰近度;
U D U_D U D :漂移程度;
U S U_S U S :結構新穎度。
總未知度:
U ( x ) = w N U N + w A U A + w E U E + w D U D + w S U S U(x)
=
w_NU_N
+
w_AU_A
+
w_EU_E
+
w_DU_D
+
w_SU_S U ( x ) = w N U N + w A U A + w E U E + w D U D + w S U S
當:
U ( x ) > τ U U(x)>\tau_U U ( x ) > τ U
快速通道被禁止。
13.Compiled Mode
對成熟已知狀態:
K n ( x ) ≫ τ H K_n(x)\gg\tau_H K n ( x ) ≫ τ H
且:
U ( x ) ≪ τ U U(x)\ll\tau_U U ( x ) ≪ τ U
系統執行:
x → Φ z → C c → I B c → Π a → V r x
\xrightarrow{\Phi}
z
\xrightarrow{C}
c
\xrightarrow{I}
B_c
\xrightarrow{\Pi}
a
\xrightarrow{V}
r x Φ z C c I B c Π a V r
其主要成本:
K C + K I + K A + K V K_C
+
K_I
+
K_A
+
K_V K C + K I + K A + K V
而不需要:
K g l o b a l − s e a r c h K_{\mathrm{global-search}} K global − search
這就是記憶編譯真正節省成本的地方。
14.Adaptive Mode
如果狀態大致已知,但存在局部偏差:
τ L < K n ( x ) < τ H \tau_L<K_n(x)<\tau_H τ L < K n ( x ) < τ H
則不必完整從零。
可以:
π c → π c ′ \pi_c
\rightarrow
\pi_c' π c → π c ′
即:
retrieve + local adaptation \boxed{
\text{retrieve + local adaptation}
} retrieve + local adaptation
例如只重新計算:
幾個關鍵參數;
局部路徑;
例外條件;
短程策略。
所以模式不是只有:
全快 \text{全快} 全快
和:
全慢 \text{全慢} 全慢
而可以具有漸進層。
15.Exploration Mode
當:
C ( x ) = ⊥ C(x)=\bot C ( x ) = ⊥
或:
U ( x ) > τ U U(x)>\tau_U U ( x ) > τ U
則:
Fast Path = 0 \text{Fast Path}=0 Fast Path = 0
系統重新啟動:
P c a n d = E ( x ) \mathcal P^{\mathrm{cand}}
=
E(x) P cand = E ( x )
然後:
p ∗ = arg max p S ( p ) p^\ast
=
\arg\max_p
S(p) p ∗ = arg p max S ( p )
其中 S ( p ) S(p) S ( p ) 沿用第一部:
S ( p ) = α Δ C + β D + γ B + δ V + η U − λ K − μ O S(p)
=
\alpha\Delta C
+
\beta D
+
\gamma B
+
\delta V
+
\eta U
-
\lambda K
-
\mu O S ( p ) = α Δ C + β D + γ B + δ V + η U − λ K − μ O
所以未知模式不是:
完全亂猜 \text{完全亂猜} 完全亂猜
而是:
回到帶記憶的適應性覆蓋。 \boxed{
\text{回到帶記憶的適應性覆蓋。}
} 回到帶記憶的適應性覆蓋。
16.未知也不代表忘掉所有記憶
這一點非常重要。
進入 Exploration Mode 不等於:
M = 0 \mathcal M=0 M = 0
而是:
λ M ↓ \lambda_M\downarrow λ M ↓
即降低既有記憶的支配度。
所以:
P ( p ) = λ M P m e m o r y ( p ) + ( 1 − λ M ) P e x p l o r e ( p ) P(p)
=
\lambda_M
P_{\mathrm{memory}}(p)
+
(1-\lambda_M)
P_{\mathrm{explore}}(p) P ( p ) = λ M P memory ( p ) + ( 1 − λ M ) P explore ( p )
在未知狀態:
λ M \lambda_M λ M
降低,但通常不歸零。
因此:
未知則展開 ≠ 未知則失憶。 \boxed{
\text{未知則展開}
\neq
\text{未知則失憶。}
} 未知則展開 = 未知則失憶。
17.Abstention Mode
有些狀態:
U ( x ) ≫ 0 U(x)\gg0 U ( x ) ≫ 0
而探索本身風險很高。
例如:
R ( x , a ) ≫ τ R R(x,a)\gg\tau_R R ( x , a ) ≫ τ R
此時最合理行動可能不是立刻探索,而是:
a = abstain a=\text{abstain} a = abstain
或:
a = request more information a=\text{request more information} a = request more information
或:
a = delegate a=\text{delegate} a = delegate
或:
a = simulate only a=\text{simulate only} a = simulate only
因此拒絕不是失敗,而是一種策略。
可以定義:
Π ( x ) ∈ { a 1 , … , a n , abstain } \Pi(x)
\in
\{
a_1,\ldots,a_n,\text{abstain}
\} Π ( x ) ∈ { a 1 , … , a n , abstain }
18.風險—覆蓋權衡
Selective prediction 有一個非常適合本框架的概念:
risk–coverage trade-off \text{risk–coverage trade-off} risk–coverage trade-off
如果系統什麼都回答:
C o v e r a g e → 1 Coverage\rightarrow1 C o v er a g e → 1
但錯誤風險可能提高。
如果只處理非常確定的輸入:
R i s k ↓ Risk\downarrow R i s k ↓
但:
C o v e r a g e ↓ Coverage\downarrow C o v er a g e ↓
因此:
成熟智能不是最大化回答率,而是在風險與覆蓋之間選擇合理工作區。 \boxed{
\text{成熟智能不是最大化回答率,而是在風險與覆蓋之間選擇合理工作區。}
} 成熟智能不是最大化回答率,而是在風險與覆蓋之間選擇合理工作區。
19.記憶編譯的風險—覆蓋曲線
設:
R C ( τ ) R_C(\tau) R C ( τ )
為門檻 τ \tau τ 下可走編譯通道的覆蓋率。
錯誤風險:
R E ( τ ) R_E(\tau) R E ( τ )
一般而言:
τ ↑ ⇒ R C ↓ \tau\uparrow
\Rightarrow
R_C\downarrow τ ↑⇒ R C ↓
但:
R E ↓ R_E\downarrow R E ↓
所以系統可以依任務設定:
高風險領域:
τ → high \tau\rightarrow\text{high} τ → high
低風險領域:
τ → lower \tau\rightarrow\text{lower} τ → lower
這意味著:
Knownness threshold 應該是任務依賴,而不是全系統固定常數。 \boxed{
\text{Knownness threshold 應該是任務依賴,而不是全系統固定常數。}
} Knownness threshold 應該是任務依賴,而不是全系統固定常數。
20.探索預算
未知狀態不能無限制消耗資源。
定義:
B E B_E B E
為 exploration budget。
成本:
K e x p l o r e ≤ B E K_{\mathrm{explore}}\leq B_E K explore ≤ B E
當:
B E B_E B E
耗盡但仍無法形成高置信策略時:
C ( x ) = ⊥ C(x)=\bot C ( x ) = ⊥
應被保留。
也就是:
探索失敗後,可以繼續不知道。
這非常重要。
因為否則系統會因為:
「一定要結論」 \text{「一定要結論」} 「一定要結論」
而在預算結束時強行產生假答案。
21.未知記憶庫
未知狀態也應被保存。
定義:
M ⊥ \mathcal M_\bot M ⊥
包含:
{ x i : C ( x i ) = ⊥ } \{
x_i:
C(x_i)=\bot
\} { x i : C ( x i ) = ⊥ }
但不是全部孤立保存。
應該對未知進行:
cluster \text{cluster} cluster
如果大量未知:
x 1 , … , x k x_1,\ldots,x_k x 1 , … , x k
彼此高度相似:
D ( x i , x j ) ≪ τ D(x_i,x_j)\ll\tau D ( x i , x j ) ≪ τ
則可能表示:
一個新類別正在形成。 \boxed{
\text{一個新類別正在形成。}
} 一個新類別正在形成。
22.從 Unknown 到 New Class
若未知群:
U j = { x 1 , … , x k } U_j
=
\{x_1,\ldots,x_k\} U j = { x 1 , … , x k }
逐漸形成穩定結構,
且:
coherence ( U j ) > τ C \operatorname{coherence}(U_j)>\tau_C coherence ( U j ) > τ C
並存在可重用策略:
π j \pi_j π j
則建立:
c n + 1 c_{n+1} c n + 1
也就是:
U j → c n + 1 U_j
\rightarrow
c_{n+1} U j → c n + 1
這就是:
Unknown-to-Known Transition \boxed{
\text{Unknown-to-Known Transition}
} Unknown-to-Known Transition
長期智能因此不是固定分類器。
它的類別集合:
C t \mathcal C_t C t
會演化:
C t → C t + 1 \mathcal C_t
\rightarrow
\mathcal C_{t+1} C t → C t + 1
23.新類別建立後不是立刻編譯
新的:
c n + 1 c_{n+1} c n + 1
應先處於:
provisional \text{provisional} provisional
狀態。
只有當:
N e v i d e n c e ≥ τ N N_{\mathrm{evidence}}
\geq\tau_N N evidence ≥ τ N
且:
R s u c c e s s ≥ τ S R_{\mathrm{success}}\geq\tau_S R success ≥ τ S
且:
V c r o s s − c h e c k = 1 V_{\mathrm{cross-check}}=1 V cross − check = 1
才升級為:
compiled class \text{compiled class} compiled class
因此類別生命週期:
unknown → candidate → provisional → validated → compiled \text{unknown}
\rightarrow
\text{candidate}
\rightarrow
\text{provisional}
\rightarrow
\text{validated}
\rightarrow
\text{compiled} unknown → candidate → provisional → validated → compiled
24.編譯類也可能退化
反方向同樣重要。
某個成熟類:
c i c_i c i
如果:
R f a i l u r e ( c i ) ↑ R_{\mathrm{failure}}(c_i)\uparrow R failure ( c i ) ↑
或:
D d r i f t ( c i ) > τ D D_{\mathrm{drift}}(c_i)>\tau_D D drift ( c i ) > τ D
則:
c i : compiled → review c_i:
\text{compiled}
\rightarrow
\text{review} c i : compiled → review
甚至:
review → deprecated \text{review}
\rightarrow
\text{deprecated} review → deprecated
或:
split \text{split} split
例如:
c i → { c i ( 1 ) , c i ( 2 ) } c_i
\rightarrow
\{c_i^{(1)},c_i^{(2)}\} c i → { c i ( 1 ) , c i ( 2 ) }
這表示原分類其實太粗。
25.也可能需要類別合併
如果:
c i , c j c_i,c_j c i , c j
長期共享:
π i ≈ π j \pi_i\approx\pi_j π i ≈ π j
且:
D ( c i , c j ) → 0 D(c_i,c_j)\rightarrow0 D ( c i , c j ) → 0
則:
c i , c j → c i j c_i,c_j
\rightarrow
c_{ij} c i , c j → c ij
因此類別空間不是只增不減。
它會:
create , split , merge , deprecate \text{create}
,\;
\text{split}
,\;
\text{merge}
,\;
\text{deprecate} create , split , merge , deprecate
所以真正的:
C t \mathcal C_t C t
是一個演化中的分類系統。
26.Recompilation Trigger
定義重新編譯觸發器:
T R T_R T R
當任一條件成立:
T R = 1 T_R=1 T R = 1
例如:
結果漂移
∥ r t − r ^ t ∥ > τ r \|r_t-\hat r_t\|>\tau_r ∥ r t − r ^ t ∥ > τ r
分類熵提高
H ( C ∣ x ) > τ H H(C\mid x)>\tau_H H ( C ∣ x ) > τ H
失敗率增加
F ( c ) > τ F F(c)>\tau_F F ( c ) > τ F
新例外累積
∣ E ( c ) ∣ > τ E |E(c)|>\tau_E ∣ E ( c ) ∣ > τ E
多模型分歧
D e n s e m b l e > τ M D_{\mathrm{ensemble}}>\tau_M D ensemble > τ M
時間過期
t − t l a s t v a l i d a t i o n > τ T t-t_{\mathrm{last\ validation}}>\tau_T t − t last validation > τ T
則:
Compiled Memory → Re-evaluation \boxed{
\text{Compiled Memory}
\rightarrow
\text{Re-evaluation}
} Compiled Memory → Re-evaluation
27.世界改變時,記憶也必須改變
Concept drift 的核心提醒是:
過去有效 ⇏ 現在有效 \text{過去有效}
\not\Rightarrow
\text{現在有效} 過去有效 ⇒ 現在有效
所以編譯項:
B i B_i B i
應具有:
t i t_i t i
時間;
θ i \theta_i θ i
環境條件;
v i v_i v i
版本。
完整形式:
B i = ( c i , π i , θ i , V i , w i , t i , v i ) B_i
=
(
c_i,
\pi_i,
\theta_i,
V_i,
w_i,
t_i,
v_i
) B i = ( c i , π i , θ i , V i , w i , t i , v i )
因此:
記憶不是永恆真理,而是帶條件的歷史計算資產。 \boxed{
\text{記憶不是永恆真理,而是帶條件的歷史計算資產。}
} 記憶不是永恆真理,而是帶條件的歷史計算資產。
28.未知偵測也是覆蓋問題
第一部定義:
Δ C ( p ∣ P t ) \Delta C(p\mid\mathcal P_t) Δ C ( p ∣ P t )
表示邊際覆蓋。
現在可以反過來看:
若某狀態:
x x x
無法被現有覆蓋:
C t \mathcal C_t C t
充分表示,則:
Residual ( x ) = x − Π S t x \operatorname{Residual}(x)
=
x-
\Pi_{\mathcal S_t}x Residual ( x ) = x − Π S t x
其殘差:
∥ x ⊥ ∥ \|x^\perp\| ∥ x ⊥ ∥
就是未知性來源之一。
所以:
未知偵測,本質上也是在測量現有知識覆蓋留下多少殘差。 \boxed{
\text{未知偵測,本質上也是在測量現有知識覆蓋留下多少殘差。}
} 未知偵測,本質上也是在測量現有知識覆蓋留下多少殘差。
這使第一部與第二部完整接起來。
29.模式切換可以寫成控制系統
定義模式:
m t ∈ { C , A , E , R } m_t
\in
\{
C,A,E,R
\} m t ∈ { C , A , E , R }
分別:
C C C :Compiled;
A A A :Adaptive;
E E E :Exploration;
R R R :Reject/Abstain。
模式轉移:
m t + 1 = F ( m t , K n , U , R , D d r i f t , V ) m_{t+1}
=
F(
m_t,
K_n,
U,
R,
D_{\mathrm{drift}},
V
) m t + 1 = F ( m t , K n , U , R , D drift , V )
因此 MCSA 本身可以被理解成:
一個具有模式切換的混合動力系統。 \boxed{
\text{一個具有模式切換的混合動力系統。}
} 一個具有模式切換的混合動力系統。
30.快速通道不是永久權利,而是租約
一個已編譯策略:
π c \pi_c π c
不應永久擁有:
Fast Path Permission \text{Fast Path Permission} Fast Path Permission
而可以理解成一張租約:
L c L_c L c
只要:
validation + stability + coverage \text{validation}
+
\text{stability}
+
\text{coverage} validation + stability + coverage
維持,租約續期。
如果:
drift + failure + exception \text{drift}
+
\text{failure}
+
\text{exception} drift + failure + exception
增加,就降級。
因此:
快速通道必須持續重新取得信任,而不是一次編譯永久有效。 \boxed{
\text{快速通道必須持續重新取得信任,而不是一次編譯永久有效。}
} 快速通道必須持續重新取得信任,而不是一次編譯永久有效。
31.探索不是異常模式,而是必要模式
如果把 Compiled Mode 視為:
正常 \text{正常} 正常
Exploration Mode 視為:
故障 \text{故障} 故障
那麼智能體會傾向避免未知。
更合理的是:
Compiled Mode 與 Exploration Mode 都是正常計算狀態。 \boxed{
\text{Compiled Mode 與 Exploration Mode 都是正常計算狀態。}
} Compiled Mode 與 Exploration Mode 都是正常計算狀態。
只是服務不同區域:
X k n o w n \mathcal X_{\mathrm{known}} X known
與:
X u n k n o w n \mathcal X_{\mathrm{unknown}} X unknown
32.成熟智能不是讓探索消失
隨著時間:
R c o m p i l e ↑ R_{\mathrm{compile}}\uparrow R compile ↑
日常狀態中探索比例可能下降:
P ( E ) ↓ P(E)\downarrow P ( E ) ↓
但不應:
P ( E ) → 0 P(E)\rightarrow0 P ( E ) → 0
因為:
世界會變;
新問題會出現;
舊分類會失效;
新結構會形成。
所以:
探索能力必須永久保留,即使它越來越少被日常狀態觸發。 \boxed{
\text{探索能力必須永久保留,即使它越來越少被日常狀態觸發。}
} 探索能力必須永久保留,即使它越來越少被日常狀態觸發。
33.未知密度可以成為資源分配訊號
設某區域:
Ω i \Omega_i Ω i
近期未知率:
U i = N ⊥ , i N i U_i
=
\frac{
N_{\bot,i}
}{
N_i
} U i = N i N ⊥ , i
若:
U i ↑ U_i\uparrow U i ↑
表示:
世界正在變;
分類不足;
新問題族形成;
索引失效。
於是可以增加該區域:
B E ( Ω i ) B_E(\Omega_i) B E ( Ω i )
探索預算。
所以:
未知不是單純錯誤統計,而是研究與學習資源應往哪裡流的訊號。 \boxed{
\text{未知不是單純錯誤統計,而是研究與學習資源應往哪裡流的訊號。}
} 未知不是單純錯誤統計,而是研究與學習資源應往哪裡流的訊號。
34.未知群可以形成新的研究前沿
若:
M ⊥ \mathcal M_\bot M ⊥
中存在 cluster:
U j U_j U j
且:
∣ U j ∣ |U_j| ∣ U j ∣
持續上升,
智能體可建立:
Research Frontier ( U j ) \text{Research Frontier}(U_j) Research Frontier ( U j )
專門進行:
data collection → hypothesis generation → testing → classification update \text{data collection}
\rightarrow
\text{hypothesis generation}
\rightarrow
\text{testing}
\rightarrow
\text{classification update} data collection → hypothesis generation → testing → classification update
所以未知記憶庫不只是垃圾桶。
它可以是:
智能體自己的研究議程生成器。 \boxed{
\text{智能體自己的研究議程生成器。}
} 智能體自己的研究議程生成器。
35.這和第五篇的創新問題完全接起來
第五篇說:
強記憶 → 更清楚已知邊界 \text{強記憶}
\rightarrow
\text{更清楚已知邊界} 強記憶 → 更清楚已知邊界
第八篇則補上:
邊界外狀態 → 不得強行編譯 \text{邊界外狀態}
\rightarrow
\text{不得強行編譯} 邊界外狀態 → 不得強行編譯
於是:
Known Map + Unknown Buffer \text{Known Map}
+
\text{Unknown Buffer} Known Map + Unknown Buffer
共同形成創新條件。
所以:
真正的創新智能不只需要知道很多,也需要保留「哪些還不知道」的結構。 \boxed{
\text{真正的創新智能不只需要知道很多,也需要保留「哪些還不知道」的結構。}
} 真正的創新智能不只需要知道很多,也需要保留「哪些還不知道」的結構。
36.已知性也具有尺度
某個狀態在粗尺度:
x ∈ c m a c r o x\in c_{\mathrm{macro}} x ∈ c macro
可能是已知。
但在細尺度:
x ∉ c m i c r o x\notin c_{\mathrm{micro}} x ∈ / c micro
例如:
這是一個「供應鏈中斷」問題。
粗類別已知。
但具體原因:
某種前所未有的跨區域同步故障。
細節未知。
所以可以定義:
K n ( 0 ) ( x ) , K n ( 1 ) ( x ) , … , K n ( L ) ( x ) K_n^{(0)}(x),
K_n^{(1)}(x),
\ldots,
K_n^{(L)}(x) K n ( 0 ) ( x ) , K n ( 1 ) ( x ) , … , K n ( L ) ( x )
不同尺度的已知度。
因此:
一個狀態可以同時「大方向已知、細節未知」。 \boxed{
\text{一個狀態可以同時「大方向已知、細節未知」。}
} 一個狀態可以同時「大方向已知、細節未知」。
37.分層模式切換
既然已知性多尺度,模式也可以分層。
例如:
L 0 : Compiled L_0:
\text{Compiled} L 0 : Compiled
但:
L 2 : Explore L_2:
\text{Explore} L 2 : Explore
所以不必把整個任務切成:
全編譯 \text{全編譯} 全編譯
或:
全探索 \text{全探索} 全探索
而可以:
粗層使用快速通道,細層只展開真正未知部分。 \boxed{
\text{粗層使用快速通道,細層只展開真正未知部分。}
} 粗層使用快速通道,細層只展開真正未知部分。
這可以大幅降低探索成本。
38.局部解編譯
假設長策略:
π = ( π 1 , π 2 , … , π n ) \pi
=
(\pi_1,\pi_2,\ldots,\pi_n) π = ( π 1 , π 2 , … , π n )
其中只有:
π k \pi_k π k
失效。
系統不必:
decompile everything \text{decompile everything} decompile everything
而可以:
π → ( π 1 , … , Explore ( π k ) , … , π n ) \pi
\rightarrow
(
\pi_1,\ldots,
\operatorname{Explore}(\pi_k),
\ldots,\pi_n
) π → ( π 1 , … , Explore ( π k ) , … , π n )
也就是:
局部解編譯 \boxed{
\text{局部解編譯}
} 局部解編譯
這使成熟智能能在保留大部分已知結構的同時,針對異常部分重新推理。
39.未知是一種可壓縮資源嗎?
有趣的是,即使未知也可能具有結構。
第一次未知:
u 1 u_1 u 1
第二次:
u 2 u_2 u 2
第三次:
u 3 u_3 u 3
若:
u 1 ∼ u 2 ∼ u 3 u_1\sim u_2\sim u_3 u 1 ∼ u 2 ∼ u 3
則:
「未知的模式」本身開始變成已知。 \boxed{
\text{「未知的模式」本身開始變成已知。}
} 「未知的模式」本身開始變成已知。
於是:
Unknown Unknown → Known Unknown → New Class → Compiled Known \text{Unknown Unknown}
\rightarrow
\text{Known Unknown}
\rightarrow
\text{New Class}
\rightarrow
\text{Compiled Known} Unknown Unknown → Known Unknown → New Class → Compiled Known
這是非常重要的累積過程。
40.未知的生命週期
可以整理成:
U 0 : Unseen Unknown U_0:
\text{Unseen Unknown} U 0 : Unseen Unknown
↓ \downarrow ↓
U 1 : Detected Unknown U_1:
\text{Detected Unknown} U 1 : Detected Unknown
↓ \downarrow ↓
U 2 : Clustered Unknown U_2:
\text{Clustered Unknown} U 2 : Clustered Unknown
↓ \downarrow ↓
U 3 : Hypothesized Class U_3:
\text{Hypothesized Class} U 3 : Hypothesized Class
↓ \downarrow ↓
U 4 : Validated Class U_4:
\text{Validated Class} U 4 : Validated Class
↓ \downarrow ↓
K : Compiled Known K:
\text{Compiled Known} K : Compiled Known
這可以稱為:
Unknown Assimilation Pipeline \boxed{
\text{Unknown Assimilation Pipeline}
} Unknown Assimilation Pipeline
41.但有些未知永遠不需要編譯
如果某事件:
u u u
極度罕見,
且:
P ( u ) ≈ 0 P(u)\approx0 P ( u ) ≈ 0
又沒有高重用價值,
則:
V c o m p i l e ( u ) < 0 V_{\mathrm{compile}}(u)<0 V compile ( u ) < 0
它可以長期保持:
case memory \text{case memory} case memory
而不建立正式類別。
因此:
不是所有未知都值得被制度化。 \boxed{
\text{不是所有未知都值得被制度化。}
} 不是所有未知都值得被制度化。
42.第二部的完整智能循環
現在可以把第二部全部整合。
輸入:
x t x_t x t
經:
z t = Φ ( x t ) z_t=\Phi(x_t) z t = Φ ( x t )
估計:
K n ( x t ) , U ( x t ) K_n(x_t),U(x_t) K n ( x t ) , U ( x t )
模式閘門:
m t = G K ( K n , U , R ) m_t=G_K(K_n,U,R) m t = G K ( K n , U , R )
若:
m t = C m_t=C m t = C
則:
classify → retrieve → compiled policy \text{classify}
\rightarrow
\text{retrieve}
\rightarrow
\text{compiled policy} classify → retrieve → compiled policy
若:
m t = A m_t=A m t = A
則:
retrieve → local adapt \text{retrieve}
\rightarrow
\text{local adapt} retrieve → local adapt
若:
m t = E m_t=E m t = E
則:
expand → cover → verify \text{expand}
\rightarrow
\text{cover}
\rightarrow
\text{verify} expand → cover → verify
若:
m t = R m_t=R m t = R
則:
abstain \text{abstain} abstain
最後全部進入:
M t + 1 = U M ( M t , x t , m t , a t , r t ) \mathcal M_{t+1}
=
U_M(
\mathcal M_t,
x_t,
m_t,
a_t,
r_t
) M t + 1 = U M ( M t , x t , m t , a t , r t )
43.第二部的核心狀態機
可以壓成:
KNOWN → stable COMPILED \boxed{
\text{KNOWN}
\xrightarrow{\text{stable}}
\text{COMPILED}
} KNOWN stable COMPILED
COMPILED → drift / failure REVIEW \boxed{
\text{COMPILED}
\xrightarrow{\text{drift / failure}}
\text{REVIEW}
} COMPILED drift / failure REVIEW
UNKNOWN → safe EXPLORE \boxed{
\text{UNKNOWN}
\xrightarrow{\text{safe}}
\text{EXPLORE}
} UNKNOWN safe EXPLORE
UNKNOWN → high risk ABSTAIN \boxed{
\text{UNKNOWN}
\xrightarrow{\text{high risk}}
\text{ABSTAIN}
} UNKNOWN high risk ABSTAIN
EXPLORE → validated recurring structure NEW CLASS \boxed{
\text{EXPLORE}
\xrightarrow{\text{validated recurring structure}}
\text{NEW CLASS}
} EXPLORE validated recurring structure NEW CLASS
NEW CLASS → maturity COMPILED \boxed{
\text{NEW CLASS}
\xrightarrow{\text{maturity}}
\text{COMPILED}
} NEW CLASS maturity COMPILED
44.真正成熟的記憶智能不追求「零未知」
假設目標:
min ∣ M ⊥ ∣ \min |\mathcal M_\bot| min ∣ M ⊥ ∣
系統很容易作弊:
把所有未知都塞入:
C \mathcal C C
所以真正好的指標不是:
unknown rate → 0 \text{unknown rate}\rightarrow0 unknown rate → 0
而是:
false-known rate → 0 \boxed{
\text{false-known rate}\rightarrow0
} false-known rate → 0
即:
真正未知卻被誤判為已知的比例必須極低。
這可能比「還有多少不知道」更重要。
45.False Known 是最危險的錯誤
定義:
F K = P ( K ^ = 1 ∣ K = 0 ) FK
=
P(
\hat K=1
\mid
K=0
) F K = P ( K ^ = 1 ∣ K = 0 )
即真實未知卻被判為已知。
另一種錯誤:
F U = P ( K ^ = 0 ∣ K = 1 ) FU
=
P(
\hat K=0
\mid
K=1
) F U = P ( K ^ = 0 ∣ K = 1 )
即已知卻被當未知。
通常:
F U FU F U
造成額外計算成本;
而:
F K FK F K
可能直接造成錯誤快速行動。
因此在高風險領域:
C o s t ( F K ) ≫ C o s t ( F U ) \boxed{
Cost(FK)\gg Cost(FU)
} C os t ( F K ) ≫ C os t ( F U )
所以門檻應偏保守。
46.未知管理本身就是智能能力
傳統能力評估常問:
accuracy \text{accuracy} accuracy
speed \text{speed} speed
memory \text{memory} memory
但對長期智能體還應加上:
Unknown Management Capability \boxed{
\text{Unknown Management Capability}
} Unknown Management Capability
它至少包括:
偵測未知;
區分未知類型;
選擇是否探索;
控制探索成本;
聚類未知;
形成新類;
重新編譯;
淘汰失效類。
所以未知不是系統之外的事情。
它是智能系統自身治理的一部分。
47.已知則編譯,未知則展開
整個第二部最後可以收斂成一句:
已知則編譯,未知則展開。 \boxed{
\text{已知則編譯,未知則展開。}
} 已知則編譯,未知則展開。
但它其實包含四層:
高置信已知 → 快速編譯 \boxed{
\text{高置信已知}
\rightarrow
\text{快速編譯}
} 高置信已知 → 快速編譯
局部偏差 → 局部適應 \boxed{
\text{局部偏差}
\rightarrow
\text{局部適應}
} 局部偏差 → 局部適應
真正未知 → 重新展開 \boxed{
\text{真正未知}
\rightarrow
\text{重新展開}
} 真正未知 → 重新展開
高風險未知 → 拒絕或延遲行動 \boxed{
\text{高風險未知}
\rightarrow
\text{拒絕或延遲行動}
} 高風險未知 → 拒絕或延遲行動
48.第二部的最終命題
記憶編譯型智能真正的能力,不是:
把所有問題都變成快速通道 \text{把所有問題都變成快速通道} 把所有問題都變成快速通道
而是:
把「可以安全不重算」與「必須重新思考」的邊界判斷得越來越準。 \boxed{
\text{把「可以安全不重算」與「必須重新思考」的邊界判斷得越來越準。}
} 把「可以安全不重算」與「必須重新思考」的邊界判斷得越來越準。
因此成熟程度可以重新定義為:
M i n t e l l i g e n c e = F ( R c o m p i l e , R f a l s e − k n o w n , K e x p l o r e , A a d a p t ) M_{\mathrm{intelligence}}
=
F(
R_{\mathrm{compile}},
R_{\mathrm{false-known}},
K_{\mathrm{explore}},
A_{\mathrm{adapt}}
) M intelligence = F ( R compile , R false − known , K explore , A adapt )
其中:
R c o m p i l e R_{\mathrm{compile}} R compile :可安全編譯覆蓋率;
R f a l s e − k n o w n R_{\mathrm{false-known}} R false − known :未知誤判已知率;
K e x p l o r e K_{\mathrm{explore}} K explore :未知探索成本;
A a d a p t A_{\mathrm{adapt}} A adapt :更新與重新編譯能力。
49.從個體智能跨向文明智能
第二部到此完成。
我們已經得到一個能:
持續記憶;
去重;
分類;
快速索引;
編譯策略;
保留未知;
重新探索;
自我更新;
的累積型智能體。
下一個問題自然變成:
如果不只一個這樣的智能體存在,而是一整個世界的人類、AI、計算機、資料庫、感測器與雲端記憶全部開始互聯,並共享這種狀態—記憶—索引—策略架構,會形成什麼?
這正是第三部的入口:
09.《當所有計算機與記憶空間連成一體》
參考資料
Bendale, A., & Boult, T. E. (2015). Towards Open World Recognition. CVPR 2015.https://openaccess.thecvf.com/content_cvpr_2015/html/Bendale_Towards_Open_World_2015_CVPR_paper.html
Geifman, Y., & El-Yaniv, R. (2019). SelectiveNet: A Deep Neural Network with an Integrated Reject Option. ICML 2019, PMLR 97.https://proceedings.mlr.press/v97/geifman19a.html
Hendrickx, K., Perini, L., Van der Plas, D., Meert, W., & Davis, J. (2021). Machine Learning with a Reject Option: A Survey. https://arxiv.org/abs/2107.11277
Wang, H., Vaze, S., & Han, K. (2024/2025). Dissecting Out-of-Distribution Detection and Open-Set Recognition: A Critical Analysis of Methods and Benchmarks. International Journal of Computer Vision.https://link.springer.com/article/10.1007/s11263-024-02222-4
Lu, S., Wang, Y., Sheng, L., Zheng, A., He, L., & Liang, J. (2024/2025). Out-of-Distribution Detection: A Task-Oriented Survey of Recent Advances. ACM Computing Surveys.https://doi.org/10.1145/3760390
Miyai, A. et al. (2024). Generalized Out-of-Distribution Detection and Beyond in Vision Language Model Era: A Survey. https://arxiv.org/abs/2407.21794
Hinder, F., Vaquet, V., & Hammer, B. (2024). One or two things we know about concept drift—a survey on monitoring in evolving environments. Part A: detecting concept drift. Frontiers in Artificial Intelligence.https://www.frontiersin.org/journals/artificial-intelligence/articles/10.3389/frai.2024.1330257/full
Hinder, F., Vaquet, V., & Hammer, B. (2024). One or two things we know about concept drift—a survey on monitoring in evolving environments. Part B: locating and explaining concept drift. Frontiers in Artificial Intelligence.https://www.frontiersin.org/journals/artificial-intelligence/articles/10.3389/frai.2024.1330258/full
系列內部依賴
前置: 05《極強記憶會壓制創新嗎?》、06《記憶編譯型狀態智能體》、07《極致分類、快速索引與計算直覺》後續: 09《當所有計算機與記憶空間連成一體》、10《文明記憶編譯體與聯邦式行星智能》
一句話摘要
真正成熟的記憶智能,不是把所有世界都強行認成已知,而是把「哪些可以安全不重算、哪些必須重新思考」的邊界判斷得越來越準。 \boxed{
\text{真正成熟的記憶智能,不是把所有世界都強行認成已知,而是把「哪些可以安全不重算、哪些必須重新思考」的邊界判斷得越來越準。}
} 真正成熟的記憶智能,不是把所有世界都強行認成已知,而是把「哪些可以安全不重算、哪些必須重新思考」的邊界判斷得越來越準。