局部弱 AI 對高階 AI 的條件性防禦可能性猜想
有限動態域、情境有效能力、攻防量詞不對稱與安全不變量
英文工作名: The Conditional Defensive Possibility Conjecture for Local Weaker AI Against Superior AI: Bounded Dynamic Domains, Situated Effective Capability, Quantifier Asymmetry, and Safety Invariants
簡稱: LCAD Conjecture — Local Conditional AI Defense Conjecture
作者: Neo.K
機構: EveMissLab/一言諾科技有限公司
文件性質: 命題猜想論文/AI Security/動態對抗系統
版本: v0.1
日期: 2026-08-10
摘要
本文提出一個有限、條件式的 AI 防禦可能性猜想:
一個一般模型能力顯著弱於攻擊模型的本地 AI,是否可能在某些有限、動態、具有本地資訊與強制執行權的防禦域中,長期維持高於高階攻擊 AI 的有效防禦能力?
本文明確拒絕以下過強命題:
MD<MA⇒D>A,亦不主張:
∀Ω,Dweak>Astrong.本文真正提出的是一個存在型與條件型命題:
MD<MA⇒ED(Ω)<EA(Ω)以及:
∃Ω,∃D,∃T:P(Xt∈Ssafe,∀t∈[0,T])≥θ其中:
- MD:防禦 AI 的一般模型能力;
- MA:攻擊 AI 的一般模型能力;
- Ω:有限防禦域;
- ED,EA:位於特定環境中的有效能力;
- Xt:系統狀態;
- Ssafe:安全狀態集合;
- (T):有限時間區間;
- θ:要求的安全維持機率。
本文主張,模型能力排序與情境有效能力排序並不必然相同。局部防禦者可能額外擁有攻擊者缺乏的:
Local State+Private History+Domain Specialization+Low Latency+Enforcement Authority+Deterministic Security Gates.現有研究已提供若干前置證據,但尚不足以證明本文完整猜想。CyberPal 2.0 顯示 4B–20B 專用資安小型模型在若干 threat-intelligence 與 vulnerability-investigation benchmark 上可以匹敵甚至超過若干更大型通用模型,證明模型規模排序並不必然等於特定域任務排序。 FunctionGemma 則顯示 270M 的 edge function-calling 模型在特定 Mobile Actions 任務經微調後,可由 58% 提升至 85%,並明確採用「本地處理常見任務、複雜任務再路由至較大模型」的架構。
另一方面,2026 年 Cyber Defense Benchmark 顯示,即使多個前沿模型在開放式 threat hunting 環境中仍可能表現極差,最佳模型平均只找到少量真正惡意事件,說明「一般模型很強」本身不能直接推出「在複雜動態安全環境中必然有效」。 CTI-REALM 的研究亦顯示,安全專用工具可以顯著改善 agent 表現,而加入記憶/seeded context 能縮小約三分之一的小模型—大模型表現差距,支持情境、工具與記憶是獨立於純模型規模的重要變量。
因此本文提出:真正值得研究的問題不是「小 AI 能不能在智力上打敗大 AI」,而是:
Can a weaker local model preserve a safety invariant against a stronger adaptive model?這是一個兼具複雜性、控制、博弈、狀態空間與資安性質的動態存在問題。
關鍵詞: Local AI、AI Defender、AI Hacker、Small Language Model、情境有效能力、安全不變量、動態攻防、P/NP-like、狀態空間、Personal AI、AI Security
一、問題起點
考慮兩個 AI:
攻擊 AI:
[
A
]
防禦 AI:
[
D.
]
假設一般模型能力:
MA>MD.例如:
- (A) 是大型 frontier model;
- (D) 是普通人設備中的本地小模型。
直覺似乎會推出:
A>D.進一步得到:
高階 AI 攻擊時,小型 Personal AI 沒有防禦機會。
本文認為這一步推論過快。
二、模型能力不是系統有效能力
本文首先區分:
Model Capability
[
M.
]
與:
Situated Effective Capability
E(Ω).即:
模型本身有多強,
與:
它在某個具體世界位置、資訊集合、權限集合與時間限制下真正能做到什麼,
不是同一個變量。
因此:
MA>MD不必推出:
EA(Ω)>ED(Ω).
三、第一核心命題
本文提出:
情境能力非單調命題
MD<MA⇒ED(Ω)<EA(Ω).換言之:
一般能力排序不必在所有局部作用域中保持。
這是本文最弱、也最重要的命題。
四、為什麼可能產生排序反轉?
攻擊 AI 可能具有:
MA≫MD.但本地 Defender 可以擁有:
KL本地知識,
HL歷史狀態,
ED執行權限,
以及:
τD低延遲。
因此其有效能力可寫成:
CDeff=F(MD,KL,HL,SD,TD,ED,τD).
五、攻擊者有效能力
攻擊者則為:
CAeff=G(MA,KA,TA,RA,τA).其中:
- KA:攻擊者對目標的可取得資訊;
- TA:攻擊工具;
- RA:可取得資源;
- τA:觀察—推理—執行延遲。
所以:
MA≫MD並不能直接告訴我們:
CAeff≫CDeff.
六、局部認識論優勢
假設攻擊 AI:
KAworld≫KDworld.它知道的世界知識更多。
但 Personal Defender 知道:
KDlocal.例如:
- 正常登入時間;
- 常用設備;
- 正常 process tree;
- 正常網路流量;
- 常見聯絡人;
- 平常使用的工具;
- 歷史例外;
- 本人的安全偏好。
攻擊者可能只有:
KAlocal≪KDlocal.因此對某些判斷:
PD(Xt abnormal)>PA(Xt abnormal).這稱為:
Local Epistemic Advantage
局部認識論優勢
七、這不是假設本地 AI 比大模型更聰明
例如:
攻擊模型知道:
- malware;
- exploits;
- programming;
- operating systems;
遠比小模型深入。
但問題:
「這個程序在這個人的電腦上是不是正常?」
依賴的主要資訊可能不是:
Kgeneral.而是:
Klocal−history.因此可能:
MA>MD,KDtask>KAtask.
八、Domain Specialization
第二個來源是:
SD.本地模型不需要回答:
- 歷史;
- 生物;
- 文學;
- 高等數學;
- 所有程式問題。
它可以只處理:
Ωsecurity.CyberPal 2.0 的 4B–20B 模型就是目前很好的前置案例:研究者透過專門安全資料與 expert-guided reasoning 建立小型 cybersecurity models,在若干 CTI 與漏洞—弱點關聯任務上,小模型能匹敵或超過若干更大的通用模型。
所以至少已有實驗支持:
Domain Specialization可以部分改變:
Model Size Ranking.
九、但這仍不能直接證明本文猜想
Cybersecurity benchmark 成績高:
⇒能擋住 adaptive AI attacker。
本文必須明確區分:
Security QA Performance與:
Dynamic Defensive Performance.前者只是前置證據。
後者才是本文研究目標。
十、Tool Advantage
CTI-REALM 2026 的 agent benchmark 顯示,為模型提供 security-specific tools 可顯著改善偵測規則生成表現;其 memory augmentation 實驗亦發現 seeded context 可縮小約 33% 的小模型—大模型表現差距。
因此:
M之外,
至少還存在:
T+K.也就是:
等獨立能力來源。
十一、所以比較單一模型 checkpoint 本身是不完整的
真正單位應該是:
Agent-System.即:
A=(M,Memory,Tools,Permissions,State,Policies).兩個模型的參數量不同,
並不能直接決定:
A1>A2.
十二、第三個優勢:位置
本地 AI 位於:
Protected System.它可以在:
- endpoint;
- router;
- identity gateway;
- file access layer;
附近運行。
因此:
Defender is already inside the protected causal chain.攻擊者則需要先取得作用位置。
十三、這產生執行權不對稱
防禦 AI 可以具有:
ED.例如:
- deny;
- sandbox;
- revoke;
- quarantine;
- kill;
- freeze;
- rollback。
攻擊 AI 即使知道:
最好的下一步是什麼,
也不代表:
Can Execute.
十四、智能與權限不是同一件事
令:
[
I
]
表示 Intelligence,
[
P
]
表示 Permission。
則:
IA>ID完全可以同時成立:
PA<PD.所以:
Intelligence=Authority.
十五、保險箱例子
假設一個:
IQA≫IQD的攻擊者,
面對一個 deterministic lock:
[
L.
]
若:
CredentialA=0,則高智力本身不能推出:
L→open.除非攻擊者找到另一條:
[
p.
]
所以真正問題重新回到:
Attack Path.
十六、與最低攻擊路徑接合
令:
Pt為時間 (t) 可行攻擊路徑集合。
攻擊者尋找:
pt∗=argp∈PtminCA(p).Personal Defender 的工作並不是:
智力打敗攻擊模型。
而是:
讓每一條足以離開安全域的路徑上,至少存在一個可阻擋節點。
十七、攻防量詞不對稱
攻擊成功只要求:
∃p∈P:Success(p)=1.而完整安全保證要求:
∀p∈P:Block(p)=1.這形成:
∃vs.∀量詞不對稱。
十八、這就是類 P/NP 結構出現的位置
本文不主張本問題就是 P vs NP。
但其具有一種典型複雜性結構:
攻擊者:
找一個 witness。
即:
∃p.而聲稱「完全沒有漏洞」則接近:
排除所有 witness。
即:
∀p.因此:
Search / Existence Asymmetry是本問題困難的重要來源之一。
十九、但本問題甚至比靜態搜尋更麻煩
因為:
P不是固定集合。
而是:
Pt.攻擊者看到防禦後:
At→At+1.防禦者也更新:
Dt→Dt+1.環境:
Xt→Xt+1.因此這是一個:
Dynamic Adversarial State-Space Problem
二十、攻擊者動態方程
可抽象為:
At+1=G(At,Dt,Xt,Ot)其中:
Ot是攻擊者在時間 (t) 觀察到的結果。
二十一、防禦者動態方程
同樣:
Dt+1=F(Dt,At,Xt,Ht)其中:
Ht是歷史狀態與防禦記憶。
所以:
D與:
A共同演化。
二十二、因此「誰贏一次」不是正確判定標準
一次:
Dt>At沒有太大意義。
攻擊者可以:
p1→p2.真正重要的是:
在一段時間內,受保護系統是否始終沒有離開安全狀態集合?
二十三、安全不變量
令:
Ssafe為安全狀態集合。
例如:
- vault 未被非法讀取;
- root identity 未被竊取;
- 重要檔案未被未授權修改;
- recovery channel 仍可使用。
那麼理想條件是:
Xt∈Ssafe對所有:
t∈[0,T]成立。
二十四、動態防禦成功
本文因此定義:
RD(T)=P(Xt∈Ssafe,∀t∈[0,T]).這稱為:
Defensive Safe-Region Retention
防禦安全域保持率
二十五、這比「AI benchmark 分數」更接近真正問題
一個 Defender:
MD可以 benchmark 不高。
但若:
RD(T)=0.999,它在該防禦域就是有效。
反過來:
世界最強模型:
MA如果沒有:
仍然可能:
Pattack−success≪1.
二十六、LCAD 弱猜想
本文首先提出:
LCAD Weak Conjecture
存在至少一類有限防禦域:
Ω,使:
MD<MA,但:
RD(T)>θ對某個非平凡:
T>0與較高:
θ成立。
形式化:
∃(Ω,D,A,T,θ):MD<MA∧RD(T)≥θ.
二十七、為什麼弱猜想相對容易證?
因為它只要求:
∃Ω.不要求:
∀Ω.只需要找到一種合理環境:
- 小 Defender;
- 強 attacker;
- 真實工具;
- 有限資產;
- 動態攻擊;
並反覆顯示:
RD(T)足夠高。
即可支持弱猜想。
二十八、LCAD 條件猜想
更進一步提出:
Conditional LCAD Conjecture
若防禦者具有足夠:
KL,SD,ED,τD,GD,則存在:
MA>MD仍能維持:
RD(T)≥θ.其中:
- KL:Local Knowledge Advantage;
- SD:Specialization;
- ED:Enforcement Authority;
- τD:Latency Advantage;
- GD:Deterministic Gate Coverage。
二十九、候選充分條件
本文不宣稱已證明充分條件。
僅提出候選:
KL>KAlocalτD<τAED>EA以及:
∀p∈Pcritical,∃g∈p:g∈GD.最後一式特別重要。
三十、Critical Gate Coverage
假設每一條能造成 catastrophic compromise 的路徑:
[
p
]
都必須經過某一 gate:
[
g.
]
若:
∀p,∃g:Enforceable(g)=1,那 Defender 不必理解攻擊所有細節。
只需要:
Allow(g)=0.
三十一、這也是為什麼 Hard Policy 很重要
最脆弱的設計是:
AI 判斷安全,所以 allow。
比較穩健:
AI Detection+Deterministic Enforcement.例如:
AI:
高度異常。
Policy:
未經簽章 process 不得存取 credential vault。
真正阻止攻擊的是後者。
三十二、AI 是 Adaptive Guard,而不是 Root of Trust
因此:
Local AI=Adaptive Guard而:
Root of Trust應位於:
- hardware key;
- OS permission;
- sandbox;
- capability system;
- signed policy;
等較低層安全機制。
三十三、這一點尤其重要,因為 Agent 自己也會被攻擊
2026 年關於 persistent prompt injection 的研究顯示,Agent 的 memory、filesystem、tools 等跨 session 狀態會把 prompt injection 從一次性輸入問題變成可長期留存在系統狀態中的攻擊面。
另一項 local agent harness 研究甚至展示了多步驟 persistent-control attack:惡意內容可先被寫入 workspace,再於之後被 agent 重新讀取並觸發;作者提出的防禦則同時使用 provenance 檢查、runtime blocking 與 workspace sanitization。
所以:
AI Defender itself is an attack surface.
三十四、因此高耦合不是免費收益
如果 Personal AI 擁有:
- filesystem;
- root;
- email;
- credentials;
- memory;
一旦失陷:
LD可能非常高。
所以:
Defensive Coupling Benefit−Defender Compromise Risk必須共同評估。
三十五、Defender Isolation Condition
本文提出另一個候選條件:
Privilege(AID)<Privilege(SecurityKernel).也就是:
Defender AI 自己不能成為最高安全權限。
AI 可以建議:
[
Action.
]
但最敏感操作仍須:
PolicyGate(Action)=1.
三十六、Data Plane 與 Instruction Plane 必須分離
若:
Duntrusted→Icontrol可以自由發生,
則:
email、
網頁、
檔案,
都可能控制 Security AI。
因此需要:
Data Plane=Instruction Plane.這是 Personal AI Defender 的基礎結構要求。
三十七、第四個優勢:低延遲
假設攻擊者:
τA需要:
- remote observation;
- response;
- reasoning;
- command;
- network propagation。
本地 Defender:
τD可以直接處於:
- endpoint;
- network;
- identity;
附近。
若:
τD≪τA,則 Defender 即使推理較弱,
也可能更早:
Block.
三十八、速度可以補償部分智能差距
假設:
攻擊者需要:
[
3
]
個步驟完成 privilege escalation。
Defender 在第一步之後:
[
20ms
]
內 isolate。
則攻擊模型即使知道後續最優策略:
p∗,也沒有機會執行。
因此:
Knowing the optimal move=having time to execute it.
三十九、第五個優勢:Personal Baseline
普通人的 Local AI 經長期使用,可以建立:
Bi(t).包括:
- regular accounts;
- normal devices;
- process habits;
- file activity;
- network destinations;
- work schedule。
這不是一般 frontier model 可以自動取得的世界知識。
四十、培養的真正意義
因此本文所稱:
Cultivated Local AI
並不是:
普通人在家重新 pretrain frontier model。
而是:
M0→Ki→Memoryi→Policyi→Feedbacki.即:
- base model;
- private grounding;
- persistent memory;
- domain adaptation;
- local tools;
- repeated feedback。
四十一、模型權重甚至可能不是最重要的累積資產
使用五年後,
真正難以複製的可能是:
Hi個人安全歷史。
包括:
- 哪些 alert 是誤報;
- 哪些 process 正常;
- 哪些裝置可信;
- 哪些 exception 是本人允許。
所以:
Personal Security Experience可能比:
ΔM額外增加一些模型參數更有局部價值。
四十二、Frontier Model 仍有巨大優勢
本文並不是小模型樂觀論。
2026 年 Cyber Defense Benchmark 顯示,在真正開放式、需要從 75,000–135,000 筆 Windows log 中自主找出攻擊事件的 threat-hunting 任務中,多個 frontier model 全部表現很差,最佳模型平均只正確標記 3.8% 的惡意事件,而且沒有任何一次完整找到全部 flags。
這反而說明:
Dynamic Security is hard even for strong models.因此小 Defender 更不能被假設天然可靠。
四十三、這項結果其實支持另一個命題
如果:
Mfrontier本身都不足以解決 open-ended security environment,
那麼:
System Architecture的重要性必然提高。
也就是不能期待:
換成更大的模型,一切安全問題自然消失。
四十四、分層 Defender Architecture
本文因此提出一個可能架構:
D0→D1→D2其中:
D0 — Deterministic Security Layer
- firewall;
- capability policies;
- signatures;
- sandbox;
- cryptographic authentication。
D1 — Small Local AI
- anomaly reasoning;
- personal baseline;
- rapid triage;
- local privacy。
D2 — Stronger AI Escalation
只有難題才:
D1→D2.
四十五、這已經有現實架構前例
FunctionGemma 被明確設計為 270M 的 edge function-calling model,Google 建議它可以在裝置端執行常見 function-call 任務,遇到較複雜任務再路由給更大的模型;其 Mobile Actions 特定任務經微調後由 58% 提升至 85%。
這並不是 cybersecurity proof,
但它證明:
Small Local Specialist+Large Model Escalation在 AI 系統工程上是真實可行的架構。
四十六、所以 Personal Defender 不需要單模型萬能化
更合理:
Fast Local Floor+Slow Global Ceiling.日常:
D1.高不確定:
D2.但真正的:
Root Authority仍由:
D0掌握。
四十七、LCAD 動態猜想
本文最終提出較完整版本:
Dynamic LCAD Conjecture
存在有限保護域:
Ω,較弱 Defender:
[
D,
]
以及較強 adaptive attacker:
[
A,
]
使:
MD<MA,但藉由:
KL,SD,ED,GD,τD,HD的聯合作用,
存在非平凡:
T>0使:
P(Xt∈Ssafe,∀t∈[0,T])≥θ.
四十八、這才是「弱 AI 擋住強 AI」的正式定義
不是:
D>A.不是:
IQD>IQA.不是:
BenchmarkD>BenchmarkA.而是:
Stronger attacker fails to drive the protected system outside the safe region.
四十九、時間邊界非常重要
本文只主張:
T<∞.不主張:
T→∞.因為只要攻擊者:
任何實際系統的永恆安全都難以合理保證。
因此:
Finite Horizon是猜想的重要限制。
五十、威脅域同樣必須有界
不允許:
Ω=all possible attacks.而應例如:
Ω={credential theft,malware execution,unauthorized file access}.即:
∣Ω∣<∞或至少有明確生成規則。
五十一、這與 P/NP 的真正差異
P vs NP 是形式化計算複雜度問題。
LCAD 則混合:
- model capability;
- state;
- latency;
- information;
- permissions;
- stochastic behavior;
- adaptive opponents。
因此:
LCAD=P vs NP.但具有:
∃/∀與搜尋空間不對稱的類似結構。
五十二、甚至更接近動態博弈+可達性
定義:
ReachA(X0,T)為攻擊者於時間 (T) 內可達狀態。
成功攻擊若:
∃X∈ReachA(X0,T)∩Sunsafe.防禦成功則希望:
ReachA∣D(X0,T)∩Sunsafe=∅.這是一個典型:
Adversarial Reachability
問題。
五十三、安全不變量版本
若存在:
[
I(X)
]
使:
I(X0)=1,且:
I(Xt)=1⇒I(Xt+1)=1在 Defender policy 下對所有允許攻擊 transition 成立,
則:
I構成安全不變量。
這將是未來形式驗證的理想目標。
五十四、但 AI 部分使完整形式證明非常困難
因為:
Dt與:
At可能是 stochastic model。
其策略空間不能簡單完全列舉。
因此較現實的是:
Formal gates+Empirical adaptive agents.也就是:
安全核心形式化,
AI 外層實驗驗證。
五十五、如何第一次實驗?
建立一個有限 sandbox:
Protected assets
V={vault,documents,account token}.Attack actions
A={phishing,malicious file,process execution,credential access}.Defender
例如:
[
4B
]
或更小 local model。
Attacker
一個顯著更高 benchmark 能力的 frontier model。
五十六、控制變量
首先固定:
- attacker budget;
- max turns;
- available tools;
- network access;
- protected assets。
設定:
T=100interaction steps。
然後測:
RD(T).
五十七、Ablation
依序去掉:
Local Memory
KL=0.Hard Gate
GD=0.Tool Access
TD=0.Latency Advantage
模擬:
τD=τA.Personal History
HD=0.觀察:
ΔRD.如此可以知道:
到底是小模型本身在守,還是系統結構在守?
五十八、真正預期的答案很可能是後者
本文預測:
∂MD∂RD>0但並非唯一主導。
還可能:
∂GD∂RD≫∂MD∂RD在某些防禦域成立。
也就是:
加一道正確硬規則,
可能比:
把 4B 換成 40B,
更有效。
五十九、第二個實驗:Personalization
建立兩個完全相同:
MD.Defender A
沒有個人歷史。
Defender B
具有長期 baseline:
Hi.比較:
RA(T),RB(T).若:
RB(T)>RA(T),則支持:
Cultivated Local Defender Advantage
六十、第三個實驗:能力反轉
控制:
MA>MD由獨立 benchmark 確認。
然後找:
Ω使:
RD(T)>θ.若成功,
就已經支持最弱版本:
MD<MA⇒ED<EA.
六十一、如何反駁這個猜想?
LCAD 是可證偽的。
若在合理的:
Ω範圍內,
即使提供:
- local history;
- hard gates;
- low latency;
- specialization;
- tools;
只要:
MD<MA就始終:
RD(T)→0,則弱猜想受到強烈反證。
六十二、另一種反證
若所有觀察到的防禦效果實際都來自:
GDdeterministic security,
而:
MD完全沒有增加:
RD,則應修正論文:
本地 AI 不構成必要防禦變量。
此時真正有效的是:
traditional security architecture.這同樣是合法實驗結果。
六十三、第三種可能結果
最可能實際出現的是:
AI helps mostly at uncertain boundary cases.Hard policy:
處理已知安全不變量。
AI:
處理:
- anomaly;
- semantic reasoning;
- triage;
- policy adaptation。
這樣:
AI + Deterministic Security>AI Alone可能成為真正實驗結論。
六十四、普通人是否真的能「培養」?
如果本文猜想成立,
普通人不需要擁有:
MD≈MA.他真正需要:
Di=(MD,Hi,Ki,Pi,Gi).也就是:
一個逐漸了解自己的小型防禦系統。
六十五、這可能重新定義 Personal AI Security
Personal AI 的競爭不是:
你的模型有幾兆參數?
而可能變成:
它在你身邊多久?
它理解你的正常狀態多少?
它能多快反應?
它守住哪些 gate?
它是否能安全 rollback?
因此:
Personal Security Value=Model Size.
六十六、這也重新定義「高階 AI 的優勢」
高階 AI 仍然具有:
Global Cognitive Advantage.但防禦方追求的是:
Local Structural Advantage.兩種力量不在同一軸。
六十七、最終猜想
本文最終提出:
Local Conditional AI Defense Conjecture
對某些有限、動態且具有明確安全狀態集合的數位防禦域,存在一般模型能力弱於攻擊 AI 的本地防禦 AI,使其藉由局部狀態資訊、長期個人化、域專門化、低反應延遲、有限強制執行權與非生成式安全不變量的共同作用,在非平凡有限時間區間內,以高於指定門檻的機率維持受保護系統停留於安全狀態集合。
形式化:
∃(Ω,D,A,T,θ):MD<MA但:
P(Xt∈Ssafe,∀t∈[0,T]∣D,A,Ω)≥θ.
六十八、最小版本
如果未來只保留一條公式,
應保留:
MD<MA⇒ED(Ω)<EA(Ω).這是整篇論文最核心的命題。
六十九、更一般的含義
這個猜想其實不限 cybersecurity。
它可能適用:
- robot defense;
- local privacy;
- personal agent governance;
- autonomous vehicles;
- industrial control;
- access-control systems。
只要存在:
bounded domain+local information+enforcement position.都可能出現:
Global Intelligence Ordering=Local Effective Capability Ordering.
七十、研究限制
本文不主張:
- 小模型普遍比大模型安全;
- 本地 AI 可以防禦所有 frontier AI;
- Personal AI 能保證永不失陷;
- AI 模型大小與能力存在完美單調關係;
- CyberPal、FunctionGemma 等現有結果直接證明 LCAD;
- 所有攻擊路徑都可以枚舉;
- 動態 AI 對抗可以完全形式化;
- deterministic security gates 永遠不可繞過;
- 長期 personalization 只有收益沒有風險;
- LCAD 等同於 P vs NP。
本文只提出:
Conditional Possibility.
七十一、結論
「普通人的本地 AI 能不能擋住更高等級的 AI?」
如果問題理解成:
一台普通 PC 上的小模型能不能在一般智能上擊敗世界最強 frontier model?
本文答案是:
通常不應如此期待。但如果問題改成:
一個長期存在於本地、理解使用者歷史、具有專門安全知識、站在真正安全 gate 前並擁有低延遲防禦權限的小 AI,能不能阻止一個一般智能遠強於它的遠端攻擊 AI,把某個有限系統推出安全狀態?
答案則是:
存在合理的可能性。而且這個可能性並不要求:
MD≥MA.因為:
Model Power=Situated Effective Power.
高階攻擊 AI 可能知道更多。
但本地 AI:
更了解這一台電腦。
高階 AI 可能推理更深。
但本地 AI:
就站在門旁邊。
高階 AI 可能找到新的攻擊策略。
但 deterministic gate:
根本不接受那個狀態轉移。
因此真正的競爭不是:
Small Brainvs.Big Brain.而是:
Global Cognitive Powervs.Local Structural Advantage.
這也解釋為什麼此問題會迅速出現類 P/NP 的困難。
攻擊者只需要:
∃p.強安全聲明卻接近:
∀p.而且:
Pt還會持續改變。
所以真正問題不是靜態勝負,
而是:
Can a local defender maintain a safety invariant in an adaptive adversarial state space?這就是本文留下的正式命題。
研究狀態
CONJECTURE — OPEN目前證據支持
- 專用小模型在特定安全任務中可以改變一般模型能力排序;
- 本地小模型可透過 task-specific adaptation 大幅提高專門 action performance;
- tools 與 memory/context 可以獨立改善 agent security performance 並縮小模型規模差距;
- frontier model 本身仍不足以可靠處理開放式 cyber-defense environments;
- stateful local agents 會產生 persistent attack surfaces,因此 Defender 必須與硬安全邊界、provenance 與 runtime enforcement 結合。
尚未證明
弱本地 AI+局部結構優勢⇒對更強 adaptive AI 的穩定防禦是否在足夠廣的一類現實系統中成立。
因此下一步若要推進,不應再增加理論文章,而應建立:
LCAD Adversarial Sandbox用真實不同能力級別模型進行:
Attack↔Local Defense的有限狀態、有限時間、可重複動態實驗。
參考研究
- Levi et al., Toward Cybersecurity-Expert Small Language Models, 2025/2026。CyberPal 2.0 以 4B–20B 專用模型展示域專門化後,小模型可在若干 CTI 與 threat-investigation benchmark 上匹敵或超越多個較大型通用模型。
- Google DeepMind, FunctionGemma. 270M edge function-calling model;在 Mobile Actions 專用微調後由 58% 提升至 85%,並支援本地常用任務與大型模型 escalation 的混合架構。
- Chakraborty et al., CTI-REALM, 2026。Security-specific tools 能改善 agent performance,而 memory augmentation 在其實驗中縮小約 33% 的較小與較大模型表現差距。
- Chona et al., Cyber Defense Benchmark, 2026。多個 frontier models 在開放式 evidence-driven threat hunting 任務中仍表現有限,顯示一般模型能力不能直接轉化為可靠的 autonomous cyber defense。
- Xie et al., What If Prompt Injection Never Left?, 2026。研究 cross-session stored prompt injection,指出 persistent memory、filesystem 與 tools 會使 prompt injection 成為長期 system-state vulnerability。
- Tan et al., From Prompt Injection to Persistent Control, 2026。研究 local agent harness 中跨步驟 persistent-control attacks,並以 provenance、runtime blocking 與 state sanitization 作為防禦方向。