← Archive
lm-003443 · 2026-09

「非理性領導人」是否是一個錯誤模型?

下載 MD 檔 ⬇

「非理性領導人」是否是一個錯誤模型?

多效用函數、資訊病理與戰略賭博的決策框架

Is the “Irrational Leader” Model Wrong? — Multiple Utility Functions, Information Pathologies, and Strategic Gambling in Political Decision-Making

作者:Neo.K × Aletheia
機構:EveMissLab/一言諾科技有限公司
版本:v0.1
日期:2026-08-31
性質:公開研究論文/Transparent Warfare Series — Paper 04


摘要

國際政治與戰爭分析中,「非理性領導人」經常被當作模型之外的例外:當某個決策看起來對國家利益極差,分析者便傾向以「瘋狂」「衝動」「誤判」或「獨裁者不理性」結束解釋。然而,這種分類可能過度粗糙。

本文提出「多效用政治決策模型」(Multi-Utility Political Decision Model, MUPDM)。其核心假設是:政治領導者並不必然最大化單一的「國家利益」,而可能同時最大化:

U=αUstate+βUregime+γUleader+δUfaction+ϵUideology+ζUlegacy+ηUsignal.U = \alpha U_{state} + \beta U_{regime} + \gamma U_{leader} + \delta U_{faction} + \epsilon U_{ideology} + \zeta U_{legacy} + \eta U_{signal}.

其中:

  • UstateU_{state}:國家生存與長期利益;
  • UregimeU_{regime}:政權存續;
  • UleaderU_{leader}:領導者個人安全、權力與生存;
  • UfactionU_{faction}:派系與菁英聯盟利益;
  • UideologyU_{ideology}:意識形態目標;
  • UlegacyU_{legacy}:歷史地位、聲望與政治遺產;
  • UsignalU_{signal}:威懾、表演與談判訊號效用。

因此,一個對:

UstateU_{state}

明顯不利的行動,仍可能在:

Uregime,Uleader,UfactionU_{regime}, U_{leader}, U_{faction}

上呈現正收益。

本文進一步區分「目標理性」「工具理性」「認識理性」:

GoalRationalityInstrumentalRationalityEpistemicRationality.\boxed{ GoalRationality \neq InstrumentalRationality \neq EpistemicRationality. }

一個領導人可以擁有清楚而穩定的目標,也能依自身世界模型選擇一致手段,但因資訊封閉、恐懼政治、過度自信或制度性迎合,使其世界模型嚴重偏離現實。

因此:

Strategically ExplainableEpistemically RationalOutcome Rational.\boxed{ \text{Strategically Explainable} \neq \text{Epistemically Rational} \neq \text{Outcome Rational}. }

本文同時引入「策略性自我失敗」與「局部敗北效用」:某些政治行動可能故意接受局部失敗、退讓、投降或個人毀滅,以換取更高階的談判條件、象徵資本、制度存續或新的可達狀態空間。因此:

ExpectedDefeat⇏IrrationalDecision.\boxed{ ExpectedDefeat \not\Rightarrow IrrationalDecision. }

本文最後提出「非理性殘差」概念:

ϵirr=ObservedBehaviorBestReconstructableDecisionModel.\epsilon_{irr} = ObservedBehavior - BestReconstructableDecisionModel.

只有在國家、政權、個人、派系、意識形態、訊號、風險偏好、資訊病理與策略性自我失敗等結構均無法解釋行為時,才應將剩餘部分歸入真正不可重建的非理性。

此模型的目的不是為災難性決策洗白,而是提高政治分析的可證偽性:可解釋不等於正確,理性也不等於道德,更不等於成功。

關鍵詞: 非理性領導人、多效用函數、政治理性、資訊病理、戰略賭博、政權生存、派系政治、意識形態、風險偏好、決策模型


第一部 問題:「他瘋了」是不是太方便?

1. 國家利益假設

許多戰略模型默認:

U=StateInterest.U = StateInterest.

因此如果某領導人選擇:

ActionAAction_A

而結果看起來:

StateCost(A)StateBenefit(A),StateCost(A)\gg StateBenefit(A),

分析者容易得到:

Leader=Irrational.Leader=Irrational.

但這個推論只有在:

Uleader=UstateU_{leader} = U_{state}

成立時才可靠。


2. 政治領導人的目標未必等於國家目標

在現實政治中:

LeaderState.Leader \neq State.

同樣:

RegimeState.Regime \neq State.

所以:

StateUtilityRegimeUtilityLeaderUtility.\boxed{ StateUtility \neq RegimeUtility \neq LeaderUtility. }

一個行動可能同時:

Ustate<0,U_{state}<0,

但:

Uregime>0.U_{regime}>0.

這不構成邏輯矛盾。


第二部 七種效用函數

3. 國家效用

Ustate=F(Security,Prosperity,Territory,Population,LongTermCapacity).U_{state} = F \left( Security, Prosperity, Territory, Population, LongTermCapacity \right).

這是傳統國際關係最常使用的目標函數。


4. 政權效用

Uregime=F(RegimeSurvival,EliteControl,Legitimacy,OppositionSuppression).U_{regime} = F \left( RegimeSurvival, EliteControl, Legitimacy, OppositionSuppression \right).

有時候政權生存和國家長期利益並不一致。


5. 領導者個人效用

Uleader=F(PersonalSurvival,Power,Status,Security,Legacy).U_{leader} = F \left( PersonalSurvival, Power, Status, Security, Legacy \right).

一個領導者可能為了避免:

Removal,Prison,DeathRemoval, Prison, Death

而接受國家層級的大量成本。


6. 派系效用

政治決策往往不是孤立個人決定。

Ufaction=F(CoalitionPower,ResourceAccess,InstitutionalControl,EliteSurvival).U_{faction} = F \left( CoalitionPower, ResourceAccess, InstitutionalControl, EliteSurvival \right).

因此:

LeaderChoiceLeaderChoice

可能受到:

FactionConstraint.FactionConstraint.

7. 意識形態效用

若:

IdeologicalGoalIdeologicalGoal

具有高度權重,則某些行動即使降低物質利益,仍可能提高:

Uideology.U_{ideology}.

這不是說行動正確,而是表示:

MaterialLoss⇏UtilityLoss.MaterialLoss \not\Rightarrow UtilityLoss.

8. 遺產效用

領導者可能重視:

HistoricalLegacy,Prestige,MissionCompletion.HistoricalLegacy, Prestige, MissionCompletion.

所以:

UlegacyU_{legacy}

可能在決策後期上升。


9. 訊號效用

某些看似衝動或不可預測的行為可能產生:

Usignal.U_{signal}.

例如:

  • 威懾;
  • 談判;
  • 誘使對手重新估計風險;
  • 向國內支持者表演強硬。

因此:

AppearingIrrational can itself become a strategic signal.\boxed{ AppearingIrrational \text{ can itself become a strategic signal.} }

第三部 目標理性、工具理性與認識理性

10. 目標理性

目標理性問:

行動者的目標是否穩定且可重建?

記為:

Rg.R_g.

11. 工具理性

工具理性問:

在行動者自己的世界模型下,手段是否服務目標?

記為:

Ri.R_i.

12. 認識理性

認識理性問:

行動者的世界模型是否合理更新、接近真實、允許反證?

記為:

Re.R_e.

因此可能存在:

Rg0,Ri0,Re0.R_g\gg0, \qquad R_i\gg0, \qquad R_e\ll0.

這種行動者「知道自己想要什麼,也在模型內一致行動」,但模型本身很差。


第四部 資訊病理

13. 壞資訊不是偶然噪聲

威權與高度集中的政治系統可能形成:

FearSelfCensorshipFilteredInformation.Fear \rightarrow SelfCensorship \rightarrow FilteredInformation.

所以領導者收到的資訊可能是:

IleaderIreality.\mathcal{I}_{leader} \neq \mathcal{I}_{reality}.

14. 資訊病理模型

本文定義:

Pinfo=F(Censorship,Fear,Hierarchy,ConfirmationBias,EliteCompetition).P_{info} = F \left( Censorship, Fear, Hierarchy, ConfirmationBias, EliteCompetition \right).

若:

Pinfo,P_{info}\uparrow,

則:

ModelError.ModelError\uparrow.

15. 「理性地根據錯誤模型做錯事」

因此:

Decision=argmaxaE[U(a)W^],Decision = argmax_a E \left[ U(a)\mid \hat{W} \right],

其中:

W^W.\hat{W} \neq W.

行動者可能對錯誤世界模型做一致最佳化。

這是:

InstrumentalRationality+EpistemicFailure.\boxed{ Instrumental Rationality + Epistemic Failure. }

第五部 風險偏好

16. 風險中性不是普遍假設

傳統模型容易預設:

RiskPreference=Neutral.RiskPreference=Neutral.

但政治領導者可能是:

RiskAverse,RiskNeutral,RiskSeeking.RiskAverse, RiskNeutral, RiskSeeking.

17. 損失域中的風險尋求

如果領導者認為:

CurrentTrajectoryCertainLoss,CurrentTrajectory \rightarrow CertainLoss,

則高風險賭博可能相對更有吸引力。

可表示為:

P(lossinaction)1P(loss|inaction)\approx1

時:

HighVarianceActionHighVarianceAction

的相對效用上升。

所以:

Desperation can produce rationalized risk-seeking.\boxed{ Desperation \text{ can produce rationalized risk-seeking.} }

第六部 戰略賭博

18. 賭博不等於無理性

若:

P(success)1P(success)\ll1

但:

U(success)0U(success)\gg0

且:

U(inaction)0,U(inaction)\ll0,

則:

ExpectedUtility(action)ExpectedUtility(action)

仍可能高於不行動。


19. 失敗概率高不代表決策必然非理性

真正要比較:

E[U(action)]E[U(action)]

與:

E[U(alternatives)].E[U(alternatives)].

因此:

HighRiskIrrational.\boxed{ HighRisk \neq Irrational. }

第七部 策略性自我失敗

20. 局部失敗可以是手段

有時:

LosslocalLoss_{local}

可以換取:

Gainglobal.Gain_{global}.

例如:

TacticalDefeatPoliticalMobilization.TacticalDefeat \rightarrow PoliticalMobilization.

或:

ExpectedDefeatBetterPostDefeatTerms.ExpectedDefeat \rightarrow BetterPostDefeatTerms.

21. 策略性自我失敗

本文定義:

StrategicSelfDefeatStrategicSelfDefeat

為:

行動者預期局部或個人層面的失敗,且該失敗本身被設計為達成更高階目標的必要中介。

形式上:

SelfDefeatHigherOrderUtilityGain.\boxed{ SelfDefeat \rightarrow HigherOrderUtilityGain. }

22. 失敗開啟新可達空間

有些行動的目的甚至不是立即收益,而是:

StateAStateBState_A \rightarrow State_B

以開啟:

Ωnewreachable.\Omega^{reachable}_{new}.

因此:

ObservableDefeat can be a strategic state transition.\boxed{ ObservableDefeat \text{ can be a strategic state transition.} }

第八部 如何避免「萬物皆可理性化」?

23. 最大危險:事後發明效用函數

如果任何行為都可以事後說:

他的效用就是這樣。

則模型不可證偽。

因此:

PostHocUtilityValidExplanation.\boxed{ PostHocUtility \neq ValidExplanation. }

24. 效用函數必須有事前證據

有效重建至少需要:

  • 決策前言論;
  • 會議紀錄;
  • 政策連續性;
  • 派系結構;
  • 資源配置;
  • 實際準備;
  • 行動前訊號。

因此:

UU

必須能被:

PreDecisionEvidencePreDecisionEvidence

支持。


第九部 可證偽性的最低要求

25. 預測一致性

若假設:

UXU_X

是主要效用函數,

則應能預測:

ActionPattern.ActionPattern.

26. 反例壓力

若大量行動與:

UXU_X

矛盾,

則應降低:

P(UX).P(U_X).

所以:

UtilityModels must survive counterexample testing.\boxed{ UtilityModels \text{ must survive counterexample testing.} }

第十部 真正的非理性殘差

27. 非理性不應先驗放在模型外

應先嘗試:

StateUtility,RegimeUtility,LeaderUtility,FactionUtility,Ideology,Legacy,Signal,RiskPreference,InformationPathology.StateUtility, RegimeUtility, LeaderUtility, FactionUtility, Ideology, Legacy, Signal, RiskPreference, InformationPathology.

28. 殘差

本文定義:

ϵirr=ObservedBehaviorBestReconstructableDecisionModel.\epsilon_{irr} = ObservedBehavior - BestReconstructableDecisionModel.

若:

ϵirr0,\epsilon_{irr}\approx0,

行為雖可能錯誤,但具有可重建決策結構。

若:

ϵirr0,\epsilon_{irr}\gg0,

才需要真正的非理性假設。


第十一部 理性不等於正確

29. 可理解不等於合理

本文最重要的限制之一:

ExplainableCorrect.\boxed{ Explainable \neq Correct. }

30. 理性不等於成功

即使:

DecisionRationality0,DecisionRationality\gg0,

仍可能:

Outcome0.Outcome\ll0.

所以:

RationalDecisionSuccessfulOutcome.\boxed{ RationalDecision \neq SuccessfulOutcome. }

31. 理性更不等於道德

同樣:

StrategicRationalityMoralLegitimacy.\boxed{ StrategicRationality \neq MoralLegitimacy. }

一個殘酷決策可以具有高度工具理性。


第十二部 領導人不是唯一決策單位

32. 個人模型的限制

重大政治決策通常來自:

Leader+Faction+Institutions+InformationSystem.Leader + Faction + Institutions + InformationSystem.

因此:

Decision=F(Leader,Coalition,Institutions,Information).Decision = F \left( Leader, Coalition, Institutions, Information \right).

33. 「領導人」可能只是高階符號

一句:

某領導人決定了。

可能壓縮:

  • 顧問;
  • 軍方;
  • 黨內派系;
  • 官僚;
  • 經濟利益;
  • 國內輿論。

所以:

LeaderDecisionPureIndividualChoice.\boxed{ LeaderDecision \neq PureIndividualChoice. }

第十三部 決策的時間性

34. 效用函數會改變

U(t0)U(t1)U(t_0) \neq U(t_1)

可能成立。

例如戰爭初期:

StateVictoryStateVictory

權重高。

戰爭後期:

RegimeSurvivalRegimeSurvival

權重可能上升。


35. 世界模型也會改變

若:

Evidence(t)Evidence(t)

改變,

理性系統應:

BeliefUpdate.BeliefUpdate.

若拒絕更新:

EpistemicRationality.EpistemicRationality\downarrow.

第十四部 戰爭決策中的「看似瘋狂」

36. 表面瘋狂的幾種來源

本文將 apparently irrational behavior 至少拆成:

  1. 不同效用函數;
  2. 錯誤世界模型;
  3. 資訊病理;
  4. 派系壓力;
  5. 高風險賭博;
  6. 意識形態效用;
  7. 威懾與表演;
  8. 策略性自我失敗。

因此:

ApparentlyIrrational⇏GenuinelyIrrational.\boxed{ ApparentlyIrrational \not\Rightarrow GenuinelyIrrational. }

第十五部 十二項核心命題

MUPDM-A1:國家—政權—領導者非同一效用命題

UstateUregimeUleader.\boxed{ U_{state} \neq U_{regime} \neq U_{leader}. }

MUPDM-A2:多效用政治決策命題

U=iwiUi.\boxed{ U = \sum_i w_i U_i. }

MUPDM-A3:目標—工具—認識理性非同一命題

GoalRationalityInstrumentalRationalityEpistemicRationality.\boxed{ GoalRationality \neq InstrumentalRationality \neq EpistemicRationality. }

MUPDM-A4:錯誤世界模型命題

OptimalAction(W^)OptimalAction(W)\boxed{ OptimalAction(\hat{W}) \neq OptimalAction(W) }

當:

W^W.\hat{W}\neq W.

MUPDM-A5:高風險非非理性命題

HighRiskIrrational.\boxed{ HighRisk \neq Irrational. }

MUPDM-A6:看似非理性非真正非理性命題

ApparentlyIrrational⇏GenuinelyIrrational.\boxed{ ApparentlyIrrational \not\Rightarrow GenuinelyIrrational. }

MUPDM-A7:策略性失敗命題

ExpectedDefeat⇏IrrationalDecision.\boxed{ ExpectedDefeat \not\Rightarrow IrrationalDecision. }

MUPDM-A8:失敗狀態轉換命題

SelfDefeatNewReachableState\boxed{ SelfDefeat \rightarrow NewReachableState }

可能成立。

MUPDM-A9:事後效用禁止命題

PostHocUtilityValidExplanation.\boxed{ PostHocUtility \neq ValidExplanation. }

MUPDM-A10:事前證據命題

ValidUtilityModelPreDecisionEvidence.\boxed{ ValidUtilityModel \Rightarrow PreDecisionEvidence. }

MUPDM-A11:理性非成功非道德命題

RationalSuccessfulMoral.\boxed{ Rational \neq Successful \neq Moral. }

MUPDM-A12:非理性殘差命題

ϵirr=ObservedBehaviorBestReconstructableDecisionModel.\boxed{ \epsilon_{irr} = ObservedBehavior - BestReconstructableDecisionModel. }

第十六部 理論限制

37. 人類決策具有情緒與心理因素

本文不否認:

  • 憤怒;
  • 恐懼;
  • 偏執;
  • 自戀;
  • 創傷;

可能改變政治決策。

但這些因素應被表示為:

DecisionParameters.DecisionParameters.

而不是立即終止分析。


38. 精神病理與決策理性可以共存

例如心理病理可能改變:

ThreatPerception,RiskPreference,BeliefUpdate.ThreatPerception, RiskPreference, BeliefUpdate.

因此:

PsychologicalPathology⇏NoDecisionStructure.PsychologicalPathology \not\Rightarrow NoDecisionStructure.

39. 本文不是理性選擇理論的無限擴張

如果任何行為都可被重新命名成某種效用最大化,模型會失去科學價值。

所以本文最核心的防線仍是:

EvidenceBeforeUtility.\boxed{ EvidenceBeforeUtility. }

第十七部 通往 Paper 05

Paper 01–03 已建立外部戰場:

TransparencyTurnCycleThresholdWar.Transparency \rightarrow TurnCycle \rightarrow ThresholdWar.

Paper 04 建立決策層:

MultiUtilityDecision.MultiUtilityDecision.

最後一篇 Paper 05 將把兩者統一起來:

PrewarObservability+BattlefieldTransparency+DecisionRationalityUnifiedTransparentWarTheory.\boxed{ PrewarObservability + BattlefieldTransparency + DecisionRationality \rightarrow UnifiedTransparentWarTheory. }

公開版本將討論一般性的戰前可觀測性,但不公開任何特定國家的即時監測指標與決策映射。


結論

「非理性領導人」並不是一個必然錯誤的概念。

但它可能被使用得太早。

更嚴格的分析順序應是:

ObservedDecisionUtilityReconstructionInformationStateFactionConstraintsRiskPreferenceStrategicSignallingCounterexampleTestingResidualIrrationality.ObservedDecision \rightarrow UtilityReconstruction \rightarrow InformationState \rightarrow FactionConstraints \rightarrow RiskPreference \rightarrow StrategicSignalling \rightarrow CounterexampleTesting \rightarrow ResidualIrrationality.

因此:

Irrationality should be a residual hypothesis, not a first explanation.\boxed{ \text{Irrationality should be a residual hypothesis, not a first explanation.} }

這不代表政治領導者「其實都很聰明」。

真正的命題是:

很多重大災難性決策仍然具有可重建的目標函數與內部邏輯,即使其世界模型錯誤、資訊系統失真,甚至最後造成巨大失敗。

所以:

Strategic ExplainabilityStrategic Correctness.\boxed{ \text{Strategic Explainability} \neq \text{Strategic Correctness}. }

而一個成熟的戰爭決策模型,應該先問:

他到底在最大化什麼?

再問:

他看到的是哪一個世界?

最後才問:

在這些都無法解釋後,還剩下多少真正的非理性?

這個剩餘量:

ϵirr\epsilon_{irr}

才是「非理性領導人」真正應該研究的對象。


內部理論來源

本文公開版本抽象化自 EveMissLab 既有政治責任、反事實與戰爭決策研究,以及 Transparent Warfare Series Paper 01–03。

公開版本刻意不包含任何特定國家之即時決策層映射、領導人評估、戰爭預警或國別監測模型。


Canonical source note: 本文件以 UTF-8 Markdown 為正式原始稿。數學原始碼使用 $...$$$...$$ 作為 canonical delimiters。