「非理性領導人」是否是一個錯誤模型?
多效用函數、資訊病理與戰略賭博的決策框架
Is the “Irrational Leader” Model Wrong? — Multiple Utility Functions, Information Pathologies, and Strategic Gambling in Political Decision-Making
作者:Neo.K × Aletheia
機構:EveMissLab/一言諾科技有限公司
版本:v0.1
日期:2026-08-31
性質:公開研究論文/Transparent Warfare Series — Paper 04
摘要
國際政治與戰爭分析中,「非理性領導人」經常被當作模型之外的例外:當某個決策看起來對國家利益極差,分析者便傾向以「瘋狂」「衝動」「誤判」或「獨裁者不理性」結束解釋。然而,這種分類可能過度粗糙。
本文提出「多效用政治決策模型」(Multi-Utility Political Decision Model, MUPDM)。其核心假設是:政治領導者並不必然最大化單一的「國家利益」,而可能同時最大化:
U=αUstate+βUregime+γUleader+δUfaction+ϵUideology+ζUlegacy+ηUsignal.
其中:
- Ustate:國家生存與長期利益;
- Uregime:政權存續;
- Uleader:領導者個人安全、權力與生存;
- Ufaction:派系與菁英聯盟利益;
- Uideology:意識形態目標;
- Ulegacy:歷史地位、聲望與政治遺產;
- Usignal:威懾、表演與談判訊號效用。
因此,一個對:
Ustate
明顯不利的行動,仍可能在:
Uregime,Uleader,Ufaction
上呈現正收益。
本文進一步區分「目標理性」「工具理性」「認識理性」:
GoalRationality=InstrumentalRationality=EpistemicRationality.
一個領導人可以擁有清楚而穩定的目標,也能依自身世界模型選擇一致手段,但因資訊封閉、恐懼政治、過度自信或制度性迎合,使其世界模型嚴重偏離現實。
因此:
Strategically Explainable=Epistemically Rational=Outcome Rational.
本文同時引入「策略性自我失敗」與「局部敗北效用」:某些政治行動可能故意接受局部失敗、退讓、投降或個人毀滅,以換取更高階的談判條件、象徵資本、制度存續或新的可達狀態空間。因此:
ExpectedDefeat⇒IrrationalDecision.
本文最後提出「非理性殘差」概念:
ϵirr=ObservedBehavior−BestReconstructableDecisionModel.
只有在國家、政權、個人、派系、意識形態、訊號、風險偏好、資訊病理與策略性自我失敗等結構均無法解釋行為時,才應將剩餘部分歸入真正不可重建的非理性。
此模型的目的不是為災難性決策洗白,而是提高政治分析的可證偽性:可解釋不等於正確,理性也不等於道德,更不等於成功。
關鍵詞: 非理性領導人、多效用函數、政治理性、資訊病理、戰略賭博、政權生存、派系政治、意識形態、風險偏好、決策模型
第一部 問題:「他瘋了」是不是太方便?
1. 國家利益假設
許多戰略模型默認:
U=StateInterest.
因此如果某領導人選擇:
ActionA
而結果看起來:
StateCost(A)≫StateBenefit(A),
分析者容易得到:
Leader=Irrational.
但這個推論只有在:
Uleader=Ustate
成立時才可靠。
2. 政治領導人的目標未必等於國家目標
在現實政治中:
Leader=State.
同樣:
Regime=State.
所以:
StateUtility=RegimeUtility=LeaderUtility.
一個行動可能同時:
Ustate<0,
但:
Uregime>0.
這不構成邏輯矛盾。
第二部 七種效用函數
3. 國家效用
Ustate=F(Security,Prosperity,Territory,Population,LongTermCapacity).
這是傳統國際關係最常使用的目標函數。
4. 政權效用
Uregime=F(RegimeSurvival,EliteControl,Legitimacy,OppositionSuppression).
有時候政權生存和國家長期利益並不一致。
5. 領導者個人效用
Uleader=F(PersonalSurvival,Power,Status,Security,Legacy).
一個領導者可能為了避免:
Removal,Prison,Death
而接受國家層級的大量成本。
6. 派系效用
政治決策往往不是孤立個人決定。
Ufaction=F(CoalitionPower,ResourceAccess,InstitutionalControl,EliteSurvival).
因此:
LeaderChoice
可能受到:
FactionConstraint.
7. 意識形態效用
若:
IdeologicalGoal
具有高度權重,則某些行動即使降低物質利益,仍可能提高:
Uideology.
這不是說行動正確,而是表示:
MaterialLoss⇒UtilityLoss.
8. 遺產效用
領導者可能重視:
HistoricalLegacy,Prestige,MissionCompletion.
所以:
Ulegacy
可能在決策後期上升。
9. 訊號效用
某些看似衝動或不可預測的行為可能產生:
Usignal.
例如:
- 威懾;
- 談判;
- 誘使對手重新估計風險;
- 向國內支持者表演強硬。
因此:
AppearingIrrational can itself become a strategic signal.
第三部 目標理性、工具理性與認識理性
10. 目標理性
目標理性問:
行動者的目標是否穩定且可重建?
記為:
Rg.
11. 工具理性
工具理性問:
在行動者自己的世界模型下,手段是否服務目標?
記為:
Ri.
12. 認識理性
認識理性問:
行動者的世界模型是否合理更新、接近真實、允許反證?
記為:
Re.
因此可能存在:
Rg≫0,Ri≫0,Re≪0.
這種行動者「知道自己想要什麼,也在模型內一致行動」,但模型本身很差。
第四部 資訊病理
13. 壞資訊不是偶然噪聲
威權與高度集中的政治系統可能形成:
Fear→SelfCensorship→FilteredInformation.
所以領導者收到的資訊可能是:
Ileader=Ireality.
14. 資訊病理模型
本文定義:
Pinfo=F(Censorship,Fear,Hierarchy,ConfirmationBias,EliteCompetition).
若:
Pinfo↑,
則:
ModelError↑.
15. 「理性地根據錯誤模型做錯事」
因此:
Decision=argmaxaE[U(a)∣W^],
其中:
W^=W.
行動者可能對錯誤世界模型做一致最佳化。
這是:
InstrumentalRationality+EpistemicFailure.
第五部 風險偏好
16. 風險中性不是普遍假設
傳統模型容易預設:
RiskPreference=Neutral.
但政治領導者可能是:
RiskAverse,RiskNeutral,RiskSeeking.
17. 損失域中的風險尋求
如果領導者認為:
CurrentTrajectory→CertainLoss,
則高風險賭博可能相對更有吸引力。
可表示為:
P(loss∣inaction)≈1
時:
HighVarianceAction
的相對效用上升。
所以:
Desperation can produce rationalized risk-seeking.
第六部 戰略賭博
18. 賭博不等於無理性
若:
P(success)≪1
但:
U(success)≫0
且:
U(inaction)≪0,
則:
ExpectedUtility(action)
仍可能高於不行動。
19. 失敗概率高不代表決策必然非理性
真正要比較:
E[U(action)]
與:
E[U(alternatives)].
因此:
HighRisk=Irrational.
第七部 策略性自我失敗
20. 局部失敗可以是手段
有時:
Losslocal
可以換取:
Gainglobal.
例如:
TacticalDefeat→PoliticalMobilization.
或:
ExpectedDefeat→BetterPostDefeatTerms.
21. 策略性自我失敗
本文定義:
StrategicSelfDefeat
為:
行動者預期局部或個人層面的失敗,且該失敗本身被設計為達成更高階目標的必要中介。
形式上:
SelfDefeat→HigherOrderUtilityGain.
22. 失敗開啟新可達空間
有些行動的目的甚至不是立即收益,而是:
StateA→StateB
以開啟:
Ωnewreachable.
因此:
ObservableDefeat can be a strategic state transition.
第八部 如何避免「萬物皆可理性化」?
23. 最大危險:事後發明效用函數
如果任何行為都可以事後說:
他的效用就是這樣。
則模型不可證偽。
因此:
PostHocUtility=ValidExplanation.
24. 效用函數必須有事前證據
有效重建至少需要:
- 決策前言論;
- 會議紀錄;
- 政策連續性;
- 派系結構;
- 資源配置;
- 實際準備;
- 行動前訊號。
因此:
U
必須能被:
PreDecisionEvidence
支持。
第九部 可證偽性的最低要求
25. 預測一致性
若假設:
UX
是主要效用函數,
則應能預測:
ActionPattern.
26. 反例壓力
若大量行動與:
UX
矛盾,
則應降低:
P(UX).
所以:
UtilityModels must survive counterexample testing.
第十部 真正的非理性殘差
27. 非理性不應先驗放在模型外
應先嘗試:
StateUtility,RegimeUtility,LeaderUtility,FactionUtility,Ideology,Legacy,Signal,RiskPreference,InformationPathology.
28. 殘差
本文定義:
ϵirr=ObservedBehavior−BestReconstructableDecisionModel.
若:
ϵirr≈0,
行為雖可能錯誤,但具有可重建決策結構。
若:
ϵirr≫0,
才需要真正的非理性假設。
第十一部 理性不等於正確
29. 可理解不等於合理
本文最重要的限制之一:
Explainable=Correct.
30. 理性不等於成功
即使:
DecisionRationality≫0,
仍可能:
Outcome≪0.
所以:
RationalDecision=SuccessfulOutcome.
31. 理性更不等於道德
同樣:
StrategicRationality=MoralLegitimacy.
一個殘酷決策可以具有高度工具理性。
第十二部 領導人不是唯一決策單位
32. 個人模型的限制
重大政治決策通常來自:
Leader+Faction+Institutions+InformationSystem.
因此:
Decision=F(Leader,Coalition,Institutions,Information).
33. 「領導人」可能只是高階符號
一句:
某領導人決定了。
可能壓縮:
- 顧問;
- 軍方;
- 黨內派系;
- 官僚;
- 經濟利益;
- 國內輿論。
所以:
LeaderDecision=PureIndividualChoice.
第十三部 決策的時間性
34. 效用函數會改變
U(t0)=U(t1)
可能成立。
例如戰爭初期:
StateVictory
權重高。
戰爭後期:
RegimeSurvival
權重可能上升。
35. 世界模型也會改變
若:
Evidence(t)
改變,
理性系統應:
BeliefUpdate.
若拒絕更新:
EpistemicRationality↓.
第十四部 戰爭決策中的「看似瘋狂」
36. 表面瘋狂的幾種來源
本文將 apparently irrational behavior 至少拆成:
- 不同效用函數;
- 錯誤世界模型;
- 資訊病理;
- 派系壓力;
- 高風險賭博;
- 意識形態效用;
- 威懾與表演;
- 策略性自我失敗。
因此:
ApparentlyIrrational⇒GenuinelyIrrational.
第十五部 十二項核心命題
MUPDM-A1:國家—政權—領導者非同一效用命題
Ustate=Uregime=Uleader.
MUPDM-A2:多效用政治決策命題
U=i∑wiUi.
MUPDM-A3:目標—工具—認識理性非同一命題
GoalRationality=InstrumentalRationality=EpistemicRationality.
MUPDM-A4:錯誤世界模型命題
OptimalAction(W^)=OptimalAction(W)
當:
W^=W.
MUPDM-A5:高風險非非理性命題
HighRisk=Irrational.
MUPDM-A6:看似非理性非真正非理性命題
ApparentlyIrrational⇒GenuinelyIrrational.
MUPDM-A7:策略性失敗命題
ExpectedDefeat⇒IrrationalDecision.
MUPDM-A8:失敗狀態轉換命題
SelfDefeat→NewReachableState
可能成立。
MUPDM-A9:事後效用禁止命題
PostHocUtility=ValidExplanation.
MUPDM-A10:事前證據命題
ValidUtilityModel⇒PreDecisionEvidence.
MUPDM-A11:理性非成功非道德命題
Rational=Successful=Moral.
MUPDM-A12:非理性殘差命題
ϵirr=ObservedBehavior−BestReconstructableDecisionModel.
第十六部 理論限制
37. 人類決策具有情緒與心理因素
本文不否認:
可能改變政治決策。
但這些因素應被表示為:
DecisionParameters.
而不是立即終止分析。
38. 精神病理與決策理性可以共存
例如心理病理可能改變:
ThreatPerception,RiskPreference,BeliefUpdate.
因此:
PsychologicalPathology⇒NoDecisionStructure.
39. 本文不是理性選擇理論的無限擴張
如果任何行為都可被重新命名成某種效用最大化,模型會失去科學價值。
所以本文最核心的防線仍是:
EvidenceBeforeUtility.
第十七部 通往 Paper 05
Paper 01–03 已建立外部戰場:
Transparency→TurnCycle→ThresholdWar.
Paper 04 建立決策層:
MultiUtilityDecision.
最後一篇 Paper 05 將把兩者統一起來:
PrewarObservability+BattlefieldTransparency+DecisionRationality→UnifiedTransparentWarTheory.
公開版本將討論一般性的戰前可觀測性,但不公開任何特定國家的即時監測指標與決策映射。
結論
「非理性領導人」並不是一個必然錯誤的概念。
但它可能被使用得太早。
更嚴格的分析順序應是:
ObservedDecision→UtilityReconstruction→InformationState→FactionConstraints→RiskPreference→StrategicSignalling→CounterexampleTesting→ResidualIrrationality.
因此:
Irrationality should be a residual hypothesis, not a first explanation.
這不代表政治領導者「其實都很聰明」。
真正的命題是:
很多重大災難性決策仍然具有可重建的目標函數與內部邏輯,即使其世界模型錯誤、資訊系統失真,甚至最後造成巨大失敗。
所以:
Strategic Explainability=Strategic Correctness.
而一個成熟的戰爭決策模型,應該先問:
他到底在最大化什麼?
再問:
他看到的是哪一個世界?
最後才問:
在這些都無法解釋後,還剩下多少真正的非理性?
這個剩餘量:
ϵirr
才是「非理性領導人」真正應該研究的對象。
內部理論來源
本文公開版本抽象化自 EveMissLab 既有政治責任、反事實與戰爭決策研究,以及 Transparent Warfare Series Paper 01–03。
公開版本刻意不包含任何特定國家之即時決策層映射、領導人評估、戰爭預警或國別監測模型。
Canonical source note: 本文件以 UTF-8 Markdown 為正式原始稿。數學原始碼使用 $...$ 與 $$...$$ 作為 canonical delimiters。