← Archive
lm-002136 · 2026-08

08_已知則編譯未知則展開

下載 MD 檔 ⬇

08.已知則編譯,未知則展開

系列:《從路徑覆蓋到行星智能:記憶編譯型計算存在論》
部別:第二部——記憶編譯型智能
版本:v0.1
日期:2026-08-01


摘要

記憶編譯型狀態智能體的優勢,在於能把過去昂貴的搜尋、推理與行動壓縮成低成本快速通道;但同一機制也帶來最危險的失敗模式:當新狀態其實不屬於任何既有類別時,系統仍可能因分類器必須輸出答案,而把未知強行套入已知策略。此時,越成熟、越快速、越高置信的記憶系統,反而可能以更低延遲放大錯誤。

本文因此將「未知」提升為記憶編譯型智能中的一級狀態,並建立雙模式運作原則:

已知則編譯,未知則展開\boxed{ \text{已知則編譯,未知則展開} }

對高置信、低例外風險、環境穩定且歷史驗證充分的狀態,智能體進入 Compiled Mode,以狀態分類、快速索引與已編譯策略完成低成本反應;若偵測到低分類置信度、高分類熵、分布外輸入、已知例外鄰近、模型彼此衝突、結果偏離預測或概念漂移,則退出快速通道,進入 Exploration Mode,重新展開候選路徑、驗證新策略,必要時建立新狀態類別並重新編譯記憶。

本文借用 open-set recognition、out-of-distribution detection、selective prediction/reject option 與 concept drift 等既有研究作為技術參照,但將其整合進長期記憶智能的狀態切換問題。本文進一步提出 Knownness Gate、Abstention State、Exploration Budget、Recompilation Trigger 與 Unknown-to-Known Transition 五個核心元件,並將未知狀態拆成「陌生未知、衝突未知、漂移未知、例外未知與結構未知」。

第二部至此形成完整閉環:極強記憶提供已知世界的快速編譯,但真正穩健的累積智能必須持續保留「承認未知並重新展開」的能力。智能成熟的標誌因此不是把所有世界狀態都分類掉,而是越來越精確地知道:哪些地方可以不用重算,哪些地方絕對不能偷懶。

關鍵詞: 未知狀態、Open-Set Recognition、OOD Detection、Selective Prediction、Reject Option、Concept Drift、記憶編譯、快速通道、探索模式、累積智能


1.記憶編譯型智能最大的危險,恰好來自它最強的地方

前兩篇建立了:

狀態分類索引策略\text{狀態} \rightarrow \text{分類} \rightarrow \text{索引} \rightarrow \text{策略}

的快速通道。

理想狀況下:

KfastKsolveK_{\mathrm{fast}} \ll K_{\mathrm{solve}}

所以越多狀態被編譯,平均決策成本越低。

但現在假設新狀態:

xnewx_{\mathrm{new}}

其實不屬於任何已知類別。

如果系統仍然強迫:

C(xnew)=ciC(x_{\mathrm{new}}) = c_i

則會發生:

xnewciπiaix_{\mathrm{new}} \rightarrow c_i \rightarrow \pi_i \rightarrow a_i

整條錯誤快速通道。

而且它可能比慢速推理更危險,因為:

TdecisionT_{\mathrm{decision}}\downarrow

同時:

confidence\text{confidence}\uparrow

因此:

高速錯誤分類,可能比低速錯誤推理更危險。\boxed{ \text{高速錯誤分類,可能比低速錯誤推理更危險。} }

2.封閉世界假設不適合長期智能體

很多分類問題隱含:

x{c1,c2,,cn}x\in \{c_1,c_2,\ldots,c_n\}

也就是:

所有測試輸入都必然屬於訓練時已知的某個類別。

這是 closed-set assumption。

但長期運作於真實世界的智能體面對的是:

x{c1,,cn,unknown}x\in \{c_1,\ldots,c_n,\text{unknown}\}

甚至:

x{c1,,cn,future classes not yet existing}x\in \{c_1,\ldots,c_n,\text{future classes not yet existing}\}

所以需要:

C(x)=\boxed{ C(x)=\bot }

其中:

\bot

不代表系統故障,而代表:

現有記憶結構不足以安全地將此狀態歸入任何成熟類別。


3.「不知道」必須是一個合法答案

一般分類器常被要求:

iP(cix)=1\sum_iP(c_i\mid x)=1

所以無論輸入多奇怪,都會選一個:

c=argmaxiP(cix)c^\ast = \arg\max_iP(c_i\mid x)

但:

cc^\ast

只是「已知選項中最高」,不代表:

P(xknown world)P(x\in\text{known world})

真的高。

因此記憶編譯型智能必須允許:

Decision(x)=abstain\boxed{ \operatorname{Decision}(x)=\text{abstain} }

或者:

C(x)=\boxed{ C(x)=\bot }

這和 selective prediction/reject option 的核心思想一致:

模型在預期自己可能犯錯時,可以拒絕輸出一般預測。

所以成熟智能不應被定義為:

永遠有答案\text{永遠有答案}

而應包括:

知道何時不應該直接回答。\boxed{ \text{知道何時不應該直接回答。} }

4.已知性不是單一置信度

不能只使用:

maxiP(cix)\max_iP(c_i\mid x)

作為已知判斷。

因為神經系統可能對未知輸入產生高置信錯誤。

所以本文定義 Knownness:

Kn(x)K_n(x)

它至少由以下因素共同決定:

Kn(x)=F(Cf,Hc,Dp,De,Am,Td,Vh)K_n(x) = F( C_f, H_c, D_p, D_e, A_m, T_d, V_h )

其中:

  • CfC_f :分類置信度;
  • HcH_c :分類熵;
  • DpD_p :距離已知原型的距離;
  • DeD_e :距離已知例外的距離;
  • AmA_m :多模型一致性;
  • TdT_d :時間/概念漂移程度;
  • VhV_h :歷史驗證可靠性。

因此:

Knownnesstop-1 confidence\boxed{ \text{Knownness} \neq \text{top-1 confidence} }

5.Knownness Gate

定義已知性閘門:

GK(x)G_K(x)

輸出:

GK(x){compiled,adaptive,explore,abstain}G_K(x) \in \{ \text{compiled}, \text{adaptive}, \text{explore}, \text{abstain} \}

可以使用兩個門檻:

τH>τL\tau_H>\tau_L

若:

Kn(x)τHK_n(x)\geq\tau_H

進入:

Compiled Mode\text{Compiled Mode}

若:

τL<Kn(x)<τH\tau_L<K_n(x)<\tau_H

進入:

Adaptive Mode\text{Adaptive Mode}

若:

Kn(x)τLK_n(x)\leq\tau_L

進入:

Exploration Mode\text{Exploration Mode}

若風險高且目前不能安全探索:

Abstention\text{Abstention}

因此系統不是二元:

known/unknown\text{known/unknown}

而是具有中間帶。


6.為什麼需要中間帶?

如果只用單一門檻:

Kn(x)τK_n(x)\geq\tau

很容易在閾值附近不穩定。

例如:

0.7990.799

與:

0.8010.801

不應導致完全不同的世界。

因此可以建立 hysteresis:

進入編譯模式需要:

Kn>τHK_n>\tau_H

但一旦已在編譯模式,只有下降到:

Kn<τLK_n<\tau_L

才退出。

其中:

τH>τL\tau_H>\tau_L

這避免模式在邊界附近高速震盪。


7.第一種未知:陌生未知

最直覺的未知:

xx

距離所有已知原型都很遠:

miniD(x,μi)τD\min_iD(x,\mu_i)\gg\tau_D

此時:

xiN(ci)x\notin \bigcup_i\mathcal N(c_i)

這是:

Novelty Unknown\boxed{ \text{Novelty Unknown} }

類似 open-set recognition 與 OOD detection 要處理的核心場景:

測試時出現訓練/已知類別空間之外的樣本。

這時快速策略不應被調用。


8.第二種未知:衝突未知

另一種情況不是:

沒有類別匹配\text{沒有類別匹配}

而是:

太多類別同時匹配\text{太多類別同時匹配}

例如:

P(c1x)=0.41P(c_1\mid x)=0.41 P(c2x)=0.39P(c_2\mid x)=0.39 P(c3x)=0.18P(c_3\mid x)=0.18

分類熵:

H(Cx)=iP(cix)logP(cix)H(C\mid x) = -\sum_iP(c_i\mid x)\log P(c_i\mid x)

偏高。

這表示:

Ambiguous Unknown\boxed{ \text{Ambiguous Unknown} }

不是完全陌生,而是現有分類系統無法確定它應位於哪個結構。

這種狀態適合:

局部展開\text{局部展開}

而非完整從零探索。


9.第三種未知:例外未知

假設:

xx

非常靠近熟悉類別:

cic_i

但也靠近歷史例外:

ejE(ci)e_j\in E(c_i)

即:

D(x,μi)τD(x,\mu_i)\ll\tau

且:

D(x,ej)τeD(x,e_j)\ll\tau_e

此時表面上很熟,但危險性反而高。

這可稱為:

Exception Unknown\boxed{ \text{Exception Unknown} }

它提醒我們:

越像熟悉狀態,不一定越應該快速反應。

因為關鍵例外往往就發生在熟悉區域的邊界。


10.第四種未知:漂移未知

即使:

xtx_t

以前屬於已知類:

cic_i

世界可能改變。

設過去條件分布:

Pt0(yx)P_{t_0}(y\mid x)

現在:

Pt1(yx)P_{t_1}(y\mid x)

若:

Pt0(yx)Pt1(yx)P_{t_0}(y\mid x) \neq P_{t_1}(y\mid x)

表示概念可能發生 drift。

此時:

xx

本身看起來完全熟悉,

但:

πi\pi_i

已不再適用。

所以:

已知狀態 + 失效世界模型=新的未知\boxed{ \text{已知狀態 + 失效世界模型} = \text{新的未知} }

這是長期智能必須額外處理的問題。


11.第五種未知:結構未知

還有一種最有趣的未知。

每一個局部元素都看過:

v1,v2,,vnMv_1,v_2,\ldots,v_n\in\mathcal M

但它們的組合:

GnewG_{\mathrm{new}}

從未出現。

例如:

known components+unknown relation topology\text{known components} + \text{unknown relation topology}

這時如果只做元素級檢索,系統會誤認為:

全部都知道。

但真正未知的是:

關係結構\boxed{ \text{關係結構} }

可以定義:

NS(x)=D(Gx,Gknown)N_S(x) = D( G_x, \mathcal G_{\mathrm{known}} )

當:

NS(x)0N_S(x)\gg0

即使所有節點都熟悉,也應進入探索。


12.未知不是一個桶子,而是一個向量

因此可以定義:

U(x)=(UN,UA,UE,UD,US)\mathbf U(x) = ( U_N, U_A, U_E, U_D, U_S )

分別表示:

  • UNU_N :陌生新穎度;
  • UAU_A :分類歧義;
  • UEU_E :例外鄰近度;
  • UDU_D :漂移程度;
  • USU_S :結構新穎度。

總未知度:

U(x)=wNUN+wAUA+wEUE+wDUD+wSUSU(x) = w_NU_N + w_AU_A + w_EU_E + w_DU_D + w_SU_S

當:

U(x)>τUU(x)>\tau_U

快速通道被禁止。


13.Compiled Mode

對成熟已知狀態:

Kn(x)τHK_n(x)\gg\tau_H

且:

U(x)τUU(x)\ll\tau_U

系統執行:

xΦzCcIBcΠaVrx \xrightarrow{\Phi} z \xrightarrow{C} c \xrightarrow{I} B_c \xrightarrow{\Pi} a \xrightarrow{V} r

其主要成本:

KC+KI+KA+KVK_C + K_I + K_A + K_V

而不需要:

KglobalsearchK_{\mathrm{global-search}}

這就是記憶編譯真正節省成本的地方。


14.Adaptive Mode

如果狀態大致已知,但存在局部偏差:

τL<Kn(x)<τH\tau_L<K_n(x)<\tau_H

則不必完整從零。

可以:

πcπc\pi_c \rightarrow \pi_c'

即:

retrieve + local adaptation\boxed{ \text{retrieve + local adaptation} }

例如只重新計算:

  • 幾個關鍵參數;
  • 局部路徑;
  • 例外條件;
  • 短程策略。

所以模式不是只有:

全快\text{全快}

和:

全慢\text{全慢}

而可以具有漸進層。


15.Exploration Mode

當:

C(x)=C(x)=\bot

或:

U(x)>τUU(x)>\tau_U

則:

Fast Path=0\text{Fast Path}=0

系統重新啟動:

Pcand=E(x)\mathcal P^{\mathrm{cand}} = E(x)

然後:

p=argmaxpS(p)p^\ast = \arg\max_p S(p)

其中 S(p)S(p) 沿用第一部:

S(p)=αΔC+βD+γB+δV+ηUλKμOS(p) = \alpha\Delta C + \beta D + \gamma B + \delta V + \eta U - \lambda K - \mu O

所以未知模式不是:

完全亂猜\text{完全亂猜}

而是:

回到帶記憶的適應性覆蓋。\boxed{ \text{回到帶記憶的適應性覆蓋。} }

16.未知也不代表忘掉所有記憶

這一點非常重要。

進入 Exploration Mode 不等於:

M=0\mathcal M=0

而是:

λM\lambda_M\downarrow

即降低既有記憶的支配度。

所以:

P(p)=λMPmemory(p)+(1λM)Pexplore(p)P(p) = \lambda_M P_{\mathrm{memory}}(p) + (1-\lambda_M) P_{\mathrm{explore}}(p)

在未知狀態:

λM\lambda_M

降低,但通常不歸零。

因此:

未知則展開未知則失憶。\boxed{ \text{未知則展開} \neq \text{未知則失憶。} }

17.Abstention Mode

有些狀態:

U(x)0U(x)\gg0

而探索本身風險很高。

例如:

R(x,a)τRR(x,a)\gg\tau_R

此時最合理行動可能不是立刻探索,而是:

a=abstaina=\text{abstain}

或:

a=request more informationa=\text{request more information}

或:

a=delegatea=\text{delegate}

或:

a=simulate onlya=\text{simulate only}

因此拒絕不是失敗,而是一種策略。

可以定義:

Π(x){a1,,an,abstain}\Pi(x) \in \{ a_1,\ldots,a_n,\text{abstain} \}

18.風險—覆蓋權衡

Selective prediction 有一個非常適合本框架的概念:

risk–coverage trade-off\text{risk–coverage trade-off}

如果系統什麼都回答:

Coverage1Coverage\rightarrow1

但錯誤風險可能提高。

如果只處理非常確定的輸入:

RiskRisk\downarrow

但:

CoverageCoverage\downarrow

因此:

成熟智能不是最大化回答率,而是在風險與覆蓋之間選擇合理工作區。\boxed{ \text{成熟智能不是最大化回答率,而是在風險與覆蓋之間選擇合理工作區。} }

19.記憶編譯的風險—覆蓋曲線

設:

RC(τ)R_C(\tau)

為門檻 τ\tau 下可走編譯通道的覆蓋率。

錯誤風險:

RE(τ)R_E(\tau)

一般而言:

τRC\tau\uparrow \Rightarrow R_C\downarrow

但:

RER_E\downarrow

所以系統可以依任務設定:

高風險領域:

τhigh\tau\rightarrow\text{high}

低風險領域:

τlower\tau\rightarrow\text{lower}

這意味著:

Knownness threshold 應該是任務依賴,而不是全系統固定常數。\boxed{ \text{Knownness threshold 應該是任務依賴,而不是全系統固定常數。} }

20.探索預算

未知狀態不能無限制消耗資源。

定義:

BEB_E

為 exploration budget。

成本:

KexploreBEK_{\mathrm{explore}}\leq B_E

當:

BEB_E

耗盡但仍無法形成高置信策略時:

C(x)=C(x)=\bot

應被保留。

也就是:

探索失敗後,可以繼續不知道。

這非常重要。

因為否則系統會因為:

「一定要結論」\text{「一定要結論」}

而在預算結束時強行產生假答案。


21.未知記憶庫

未知狀態也應被保存。

定義:

M\mathcal M_\bot

包含:

{xi:C(xi)=}\{ x_i: C(x_i)=\bot \}

但不是全部孤立保存。

應該對未知進行:

cluster\text{cluster}

如果大量未知:

x1,,xkx_1,\ldots,x_k

彼此高度相似:

D(xi,xj)τD(x_i,x_j)\ll\tau

則可能表示:

一個新類別正在形成。\boxed{ \text{一個新類別正在形成。} }

22.從 Unknown 到 New Class

若未知群:

Uj={x1,,xk}U_j = \{x_1,\ldots,x_k\}

逐漸形成穩定結構,

且:

coherence(Uj)>τC\operatorname{coherence}(U_j)>\tau_C

並存在可重用策略:

πj\pi_j

則建立:

cn+1c_{n+1}

也就是:

Ujcn+1U_j \rightarrow c_{n+1}

這就是:

Unknown-to-Known Transition\boxed{ \text{Unknown-to-Known Transition} }

長期智能因此不是固定分類器。

它的類別集合:

Ct\mathcal C_t

會演化:

CtCt+1\mathcal C_t \rightarrow \mathcal C_{t+1}

23.新類別建立後不是立刻編譯

新的:

cn+1c_{n+1}

應先處於:

provisional\text{provisional}

狀態。

只有當:

NevidenceτNN_{\mathrm{evidence}} \geq\tau_N

且:

RsuccessτSR_{\mathrm{success}}\geq\tau_S

且:

Vcrosscheck=1V_{\mathrm{cross-check}}=1

才升級為:

compiled class\text{compiled class}

因此類別生命週期:

unknowncandidateprovisionalvalidatedcompiled\text{unknown} \rightarrow \text{candidate} \rightarrow \text{provisional} \rightarrow \text{validated} \rightarrow \text{compiled}

24.編譯類也可能退化

反方向同樣重要。

某個成熟類:

cic_i

如果:

Rfailure(ci)R_{\mathrm{failure}}(c_i)\uparrow

或:

Ddrift(ci)>τDD_{\mathrm{drift}}(c_i)>\tau_D

則:

ci:compiledreviewc_i: \text{compiled} \rightarrow \text{review}

甚至:

reviewdeprecated\text{review} \rightarrow \text{deprecated}

或:

split\text{split}

例如:

ci{ci(1),ci(2)}c_i \rightarrow \{c_i^{(1)},c_i^{(2)}\}

這表示原分類其實太粗。


25.也可能需要類別合併

如果:

ci,cjc_i,c_j

長期共享:

πiπj\pi_i\approx\pi_j

且:

D(ci,cj)0D(c_i,c_j)\rightarrow0

則:

ci,cjcijc_i,c_j \rightarrow c_{ij}

因此類別空間不是只增不減。

它會:

create,  split,  merge,  deprecate\text{create} ,\; \text{split} ,\; \text{merge} ,\; \text{deprecate}

所以真正的:

Ct\mathcal C_t

是一個演化中的分類系統。


26.Recompilation Trigger

定義重新編譯觸發器:

TRT_R

當任一條件成立:

TR=1T_R=1

例如:

結果漂移

rtr^t>τr\|r_t-\hat r_t\|>\tau_r

分類熵提高

H(Cx)>τHH(C\mid x)>\tau_H

失敗率增加

F(c)>τFF(c)>\tau_F

新例外累積

E(c)>τE|E(c)|>\tau_E

多模型分歧

Densemble>τMD_{\mathrm{ensemble}}>\tau_M

時間過期

ttlast validation>τTt-t_{\mathrm{last\ validation}}>\tau_T

則:

Compiled MemoryRe-evaluation\boxed{ \text{Compiled Memory} \rightarrow \text{Re-evaluation} }

27.世界改變時,記憶也必須改變

Concept drift 的核心提醒是:

過去有效⇏現在有效\text{過去有效} \not\Rightarrow \text{現在有效}

所以編譯項:

BiB_i

應具有:

tit_i

時間;

θi\theta_i

環境條件;

viv_i

版本。

完整形式:

Bi=(ci,πi,θi,Vi,wi,ti,vi)B_i = ( c_i, \pi_i, \theta_i, V_i, w_i, t_i, v_i )

因此:

記憶不是永恆真理,而是帶條件的歷史計算資產。\boxed{ \text{記憶不是永恆真理,而是帶條件的歷史計算資產。} }

28.未知偵測也是覆蓋問題

第一部定義:

ΔC(pPt)\Delta C(p\mid\mathcal P_t)

表示邊際覆蓋。

現在可以反過來看:

若某狀態:

xx

無法被現有覆蓋:

Ct\mathcal C_t

充分表示,則:

Residual(x)=xΠStx\operatorname{Residual}(x) = x- \Pi_{\mathcal S_t}x

其殘差:

x\|x^\perp\|

就是未知性來源之一。

所以:

未知偵測,本質上也是在測量現有知識覆蓋留下多少殘差。\boxed{ \text{未知偵測,本質上也是在測量現有知識覆蓋留下多少殘差。} }

這使第一部與第二部完整接起來。


29.模式切換可以寫成控制系統

定義模式:

mt{C,A,E,R}m_t \in \{ C,A,E,R \}

分別:

  • CC :Compiled;
  • AA :Adaptive;
  • EE :Exploration;
  • RR :Reject/Abstain。

模式轉移:

mt+1=F(mt,Kn,U,R,Ddrift,V)m_{t+1} = F( m_t, K_n, U, R, D_{\mathrm{drift}}, V )

因此 MCSA 本身可以被理解成:

一個具有模式切換的混合動力系統。\boxed{ \text{一個具有模式切換的混合動力系統。} }

30.快速通道不是永久權利,而是租約

一個已編譯策略:

πc\pi_c

不應永久擁有:

Fast Path Permission\text{Fast Path Permission}

而可以理解成一張租約:

LcL_c

只要:

validation+stability+coverage\text{validation} + \text{stability} + \text{coverage}

維持,租約續期。

如果:

drift+failure+exception\text{drift} + \text{failure} + \text{exception}

增加,就降級。

因此:

快速通道必須持續重新取得信任,而不是一次編譯永久有效。\boxed{ \text{快速通道必須持續重新取得信任,而不是一次編譯永久有效。} }

31.探索不是異常模式,而是必要模式

如果把 Compiled Mode 視為:

正常\text{正常}

Exploration Mode 視為:

故障\text{故障}

那麼智能體會傾向避免未知。

更合理的是:

Compiled Mode 與 Exploration Mode 都是正常計算狀態。\boxed{ \text{Compiled Mode 與 Exploration Mode 都是正常計算狀態。} }

只是服務不同區域:

Xknown\mathcal X_{\mathrm{known}}

與:

Xunknown\mathcal X_{\mathrm{unknown}}

32.成熟智能不是讓探索消失

隨著時間:

RcompileR_{\mathrm{compile}}\uparrow

日常狀態中探索比例可能下降:

P(E)P(E)\downarrow

但不應:

P(E)0P(E)\rightarrow0

因為:

  • 世界會變;
  • 新問題會出現;
  • 舊分類會失效;
  • 新結構會形成。

所以:

探索能力必須永久保留,即使它越來越少被日常狀態觸發。\boxed{ \text{探索能力必須永久保留,即使它越來越少被日常狀態觸發。} }

33.未知密度可以成為資源分配訊號

設某區域:

Ωi\Omega_i

近期未知率:

Ui=N,iNiU_i = \frac{ N_{\bot,i} }{ N_i }

若:

UiU_i\uparrow

表示:

  • 世界正在變;
  • 分類不足;
  • 新問題族形成;
  • 索引失效。

於是可以增加該區域:

BE(Ωi)B_E(\Omega_i)

探索預算。

所以:

未知不是單純錯誤統計,而是研究與學習資源應往哪裡流的訊號。\boxed{ \text{未知不是單純錯誤統計,而是研究與學習資源應往哪裡流的訊號。} }

34.未知群可以形成新的研究前沿

若:

M\mathcal M_\bot

中存在 cluster:

UjU_j

且:

Uj|U_j|

持續上升,

智能體可建立:

Research Frontier(Uj)\text{Research Frontier}(U_j)

專門進行:

data collectionhypothesis generationtestingclassification update\text{data collection} \rightarrow \text{hypothesis generation} \rightarrow \text{testing} \rightarrow \text{classification update}

所以未知記憶庫不只是垃圾桶。

它可以是:

智能體自己的研究議程生成器。\boxed{ \text{智能體自己的研究議程生成器。} }

35.這和第五篇的創新問題完全接起來

第五篇說:

強記憶更清楚已知邊界\text{強記憶} \rightarrow \text{更清楚已知邊界}

第八篇則補上:

邊界外狀態不得強行編譯\text{邊界外狀態} \rightarrow \text{不得強行編譯}

於是:

Known Map+Unknown Buffer\text{Known Map} + \text{Unknown Buffer}

共同形成創新條件。

所以:

真正的創新智能不只需要知道很多,也需要保留「哪些還不知道」的結構。\boxed{ \text{真正的創新智能不只需要知道很多,也需要保留「哪些還不知道」的結構。} }

36.已知性也具有尺度

某個狀態在粗尺度:

xcmacrox\in c_{\mathrm{macro}}

可能是已知。

但在細尺度:

xcmicrox\notin c_{\mathrm{micro}}

例如:

這是一個「供應鏈中斷」問題。

粗類別已知。

但具體原因:

某種前所未有的跨區域同步故障。

細節未知。

所以可以定義:

Kn(0)(x),Kn(1)(x),,Kn(L)(x)K_n^{(0)}(x), K_n^{(1)}(x), \ldots, K_n^{(L)}(x)

不同尺度的已知度。

因此:

一個狀態可以同時「大方向已知、細節未知」。\boxed{ \text{一個狀態可以同時「大方向已知、細節未知」。} }

37.分層模式切換

既然已知性多尺度,模式也可以分層。

例如:

L0:CompiledL_0: \text{Compiled}

但:

L2:ExploreL_2: \text{Explore}

所以不必把整個任務切成:

全編譯\text{全編譯}

或:

全探索\text{全探索}

而可以:

粗層使用快速通道,細層只展開真正未知部分。\boxed{ \text{粗層使用快速通道,細層只展開真正未知部分。} }

這可以大幅降低探索成本。


38.局部解編譯

假設長策略:

π=(π1,π2,,πn)\pi = (\pi_1,\pi_2,\ldots,\pi_n)

其中只有:

πk\pi_k

失效。

系統不必:

decompile everything\text{decompile everything}

而可以:

π(π1,,Explore(πk),,πn)\pi \rightarrow ( \pi_1,\ldots, \operatorname{Explore}(\pi_k), \ldots,\pi_n )

也就是:

局部解編譯\boxed{ \text{局部解編譯} }

這使成熟智能能在保留大部分已知結構的同時,針對異常部分重新推理。


39.未知是一種可壓縮資源嗎?

有趣的是,即使未知也可能具有結構。

第一次未知:

u1u_1

第二次:

u2u_2

第三次:

u3u_3

若:

u1u2u3u_1\sim u_2\sim u_3

則:

「未知的模式」本身開始變成已知。\boxed{ \text{「未知的模式」本身開始變成已知。} }

於是:

Unknown UnknownKnown UnknownNew ClassCompiled Known\text{Unknown Unknown} \rightarrow \text{Known Unknown} \rightarrow \text{New Class} \rightarrow \text{Compiled Known}

這是非常重要的累積過程。


40.未知的生命週期

可以整理成:

U0:Unseen UnknownU_0: \text{Unseen Unknown} \downarrow U1:Detected UnknownU_1: \text{Detected Unknown} \downarrow U2:Clustered UnknownU_2: \text{Clustered Unknown} \downarrow U3:Hypothesized ClassU_3: \text{Hypothesized Class} \downarrow U4:Validated ClassU_4: \text{Validated Class} \downarrow K:Compiled KnownK: \text{Compiled Known}

這可以稱為:

Unknown Assimilation Pipeline\boxed{ \text{Unknown Assimilation Pipeline} }

41.但有些未知永遠不需要編譯

如果某事件:

uu

極度罕見,

且:

P(u)0P(u)\approx0

又沒有高重用價值,

則:

Vcompile(u)<0V_{\mathrm{compile}}(u)<0

它可以長期保持:

case memory\text{case memory}

而不建立正式類別。

因此:

不是所有未知都值得被制度化。\boxed{ \text{不是所有未知都值得被制度化。} }

42.第二部的完整智能循環

現在可以把第二部全部整合。

輸入:

xtx_t

經:

zt=Φ(xt)z_t=\Phi(x_t)

估計:

Kn(xt),U(xt)K_n(x_t),U(x_t)

模式閘門:

mt=GK(Kn,U,R)m_t=G_K(K_n,U,R)

若:

mt=Cm_t=C

則:

classifyretrievecompiled policy\text{classify} \rightarrow \text{retrieve} \rightarrow \text{compiled policy}

若:

mt=Am_t=A

則:

retrievelocal adapt\text{retrieve} \rightarrow \text{local adapt}

若:

mt=Em_t=E

則:

expandcoververify\text{expand} \rightarrow \text{cover} \rightarrow \text{verify}

若:

mt=Rm_t=R

則:

abstain\text{abstain}

最後全部進入:

Mt+1=UM(Mt,xt,mt,at,rt)\mathcal M_{t+1} = U_M( \mathcal M_t, x_t, m_t, a_t, r_t )

43.第二部的核心狀態機

可以壓成:

KNOWNstableCOMPILED\boxed{ \text{KNOWN} \xrightarrow{\text{stable}} \text{COMPILED} } COMPILEDdrift / failureREVIEW\boxed{ \text{COMPILED} \xrightarrow{\text{drift / failure}} \text{REVIEW} } UNKNOWNsafeEXPLORE\boxed{ \text{UNKNOWN} \xrightarrow{\text{safe}} \text{EXPLORE} } UNKNOWNhigh riskABSTAIN\boxed{ \text{UNKNOWN} \xrightarrow{\text{high risk}} \text{ABSTAIN} } EXPLOREvalidated recurring structureNEW CLASS\boxed{ \text{EXPLORE} \xrightarrow{\text{validated recurring structure}} \text{NEW CLASS} } NEW CLASSmaturityCOMPILED\boxed{ \text{NEW CLASS} \xrightarrow{\text{maturity}} \text{COMPILED} }

44.真正成熟的記憶智能不追求「零未知」

假設目標:

minM\min |\mathcal M_\bot|

系統很容易作弊:

把所有未知都塞入:

C\mathcal C

所以真正好的指標不是:

unknown rate0\text{unknown rate}\rightarrow0

而是:

false-known rate0\boxed{ \text{false-known rate}\rightarrow0 }

即:

真正未知卻被誤判為已知的比例必須極低。

這可能比「還有多少不知道」更重要。


45.False Known 是最危險的錯誤

定義:

FK=P(K^=1K=0)FK = P( \hat K=1 \mid K=0 )

即真實未知卻被判為已知。

另一種錯誤:

FU=P(K^=0K=1)FU = P( \hat K=0 \mid K=1 )

即已知卻被當未知。

通常:

FUFU

造成額外計算成本;

而:

FKFK

可能直接造成錯誤快速行動。

因此在高風險領域:

Cost(FK)Cost(FU)\boxed{ Cost(FK)\gg Cost(FU) }

所以門檻應偏保守。


46.未知管理本身就是智能能力

傳統能力評估常問:

accuracy\text{accuracy} speed\text{speed} memory\text{memory}

但對長期智能體還應加上:

Unknown Management Capability\boxed{ \text{Unknown Management Capability} }

它至少包括:

  • 偵測未知;
  • 區分未知類型;
  • 選擇是否探索;
  • 控制探索成本;
  • 聚類未知;
  • 形成新類;
  • 重新編譯;
  • 淘汰失效類。

所以未知不是系統之外的事情。

它是智能系統自身治理的一部分。


47.已知則編譯,未知則展開

整個第二部最後可以收斂成一句:

已知則編譯,未知則展開。\boxed{ \text{已知則編譯,未知則展開。} }

但它其實包含四層:

高置信已知快速編譯\boxed{ \text{高置信已知} \rightarrow \text{快速編譯} } 局部偏差局部適應\boxed{ \text{局部偏差} \rightarrow \text{局部適應} } 真正未知重新展開\boxed{ \text{真正未知} \rightarrow \text{重新展開} } 高風險未知拒絕或延遲行動\boxed{ \text{高風險未知} \rightarrow \text{拒絕或延遲行動} }

48.第二部的最終命題

記憶編譯型智能真正的能力,不是:

把所有問題都變成快速通道\text{把所有問題都變成快速通道}

而是:

把「可以安全不重算」與「必須重新思考」的邊界判斷得越來越準。\boxed{ \text{把「可以安全不重算」與「必須重新思考」的邊界判斷得越來越準。} }

因此成熟程度可以重新定義為:

Mintelligence=F(Rcompile,Rfalseknown,Kexplore,Aadapt)M_{\mathrm{intelligence}} = F( R_{\mathrm{compile}}, R_{\mathrm{false-known}}, K_{\mathrm{explore}}, A_{\mathrm{adapt}} )

其中:

  • RcompileR_{\mathrm{compile}} :可安全編譯覆蓋率;
  • RfalseknownR_{\mathrm{false-known}} :未知誤判已知率;
  • KexploreK_{\mathrm{explore}} :未知探索成本;
  • AadaptA_{\mathrm{adapt}} :更新與重新編譯能力。

49.從個體智能跨向文明智能

第二部到此完成。

我們已經得到一個能:

  • 持續記憶;
  • 去重;
  • 分類;
  • 快速索引;
  • 編譯策略;
  • 保留未知;
  • 重新探索;
  • 自我更新;

的累積型智能體。

下一個問題自然變成:

如果不只一個這樣的智能體存在,而是一整個世界的人類、AI、計算機、資料庫、感測器與雲端記憶全部開始互聯,並共享這種狀態—記憶—索引—策略架構,會形成什麼?

這正是第三部的入口:

09.《當所有計算機與記憶空間連成一體》


參考資料

  1. Bendale, A., & Boult, T. E. (2015). Towards Open World Recognition. CVPR 2015.
    https://openaccess.thecvf.com/content_cvpr_2015/html/Bendale_Towards_Open_World_2015_CVPR_paper.html

  2. Geifman, Y., & El-Yaniv, R. (2019). SelectiveNet: A Deep Neural Network with an Integrated Reject Option. ICML 2019, PMLR 97.
    https://proceedings.mlr.press/v97/geifman19a.html

  3. Hendrickx, K., Perini, L., Van der Plas, D., Meert, W., & Davis, J. (2021). Machine Learning with a Reject Option: A Survey.
    https://arxiv.org/abs/2107.11277

  4. Wang, H., Vaze, S., & Han, K. (2024/2025). Dissecting Out-of-Distribution Detection and Open-Set Recognition: A Critical Analysis of Methods and Benchmarks. International Journal of Computer Vision.
    https://link.springer.com/article/10.1007/s11263-024-02222-4

  5. Lu, S., Wang, Y., Sheng, L., Zheng, A., He, L., & Liang, J. (2024/2025). Out-of-Distribution Detection: A Task-Oriented Survey of Recent Advances. ACM Computing Surveys.
    https://doi.org/10.1145/3760390

  6. Miyai, A. et al. (2024). Generalized Out-of-Distribution Detection and Beyond in Vision Language Model Era: A Survey.
    https://arxiv.org/abs/2407.21794

  7. Hinder, F., Vaquet, V., & Hammer, B. (2024). One or two things we know about concept drift—a survey on monitoring in evolving environments. Part A: detecting concept drift. Frontiers in Artificial Intelligence.
    https://www.frontiersin.org/journals/artificial-intelligence/articles/10.3389/frai.2024.1330257/full

  8. Hinder, F., Vaquet, V., & Hammer, B. (2024). One or two things we know about concept drift—a survey on monitoring in evolving environments. Part B: locating and explaining concept drift. Frontiers in Artificial Intelligence.
    https://www.frontiersin.org/journals/artificial-intelligence/articles/10.3389/frai.2024.1330258/full


系列內部依賴

前置: 05《極強記憶會壓制創新嗎?》、06《記憶編譯型狀態智能體》、07《極致分類、快速索引與計算直覺》
後續: 09《當所有計算機與記憶空間連成一體》、10《文明記憶編譯體與聯邦式行星智能》

一句話摘要

真正成熟的記憶智能,不是把所有世界都強行認成已知,而是把「哪些可以安全不重算、哪些必須重新思考」的邊界判斷得越來越準。\boxed{ \text{真正成熟的記憶智能,不是把所有世界都強行認成已知,而是把「哪些可以安全不重算、哪些必須重新思考」的邊界判斷得越來越準。} }