← Archive
lm-001853 · 2026-07

自然語言普遍可編程化命題_v0.1

下載 MD 檔 ⬇

自然語言普遍可編程化命題

從 AGI 語義編譯、共享形式底座到全球語言的可執行化

作者:Neo.K、Aletheia(GPT)
版本:v0.1
日期:2026-07-24
文件類型:理論命題論文/AI 語言工程研究綱領


摘要

傳統程式語言之所以不同於自然語言,並不只是因為前者使用英文關鍵字、特殊符號或固定語法,而是因為程式語言將語意歧義、執行條件、變數關係、控制流程與錯誤處理壓縮進一套可被機器直接解析的形式系統。自然語言則允許省略、語境依賴、隱喻、多義、模糊與不完整表達,因此長期以來只能被視為需求描述、註解或人機介面的前端,而不能直接成為可靠的程式語言。

然而,當人工智慧逐步具備語義理解、上下文建模、歧義辨識、形式化、程序生成、測試、驗證、風險評估與執行協調能力後,程式語言的定義可能發生根本改變。未來真正承擔形式化成本的主體,可能不再是人類,而是 AI。此時,任何具有相對穩定語義、社群使用規範與可學習結構的自然語言,都可能成為形式程序的上層表達語言。

本文提出「自然語言普遍可編程化命題」:在足夠強的智能系統支援下,任意自然語言都可能透過 AI 維持的語義編譯映射,被轉換為共享形式語義、可執行程序、智能體工作流、機器控制指令或形式證明。這並不代表所有自然語言都將變成傳統意義上的 Python 或 C,而是自然語言將取得程式語言的核心功能:表達意圖、約束行為、觸發執行、生成可驗證結果。

本文進一步區分「可編譯」、「可驗證」與「可執行」三個層次,指出自然語言成為程式入口後,權限、責任、風險、可逆性與多主體同意將成為比語法更重要的問題。本文亦提出共享形式語義底座、多語言 Profile、歧義候選集、約束帳本與執行證書等架構,並討論其對程式語言理論、教育、低資源語言、全球技術平權、智能體系統與 EML/ULEI 的意義。


關鍵詞

自然語言編程、AGI、形式語義、語義編譯、共享形式底座、多語言程式設計、AI Agent、語言平權、程式語言理論、EML、ULEI


一、問題的根本轉變

1.1 傳統程式語言的必要性

傳統計算機無法直接理解人類意圖。人類必須先將意圖轉換為精確的形式表示,才能交由機器執行:

人類意圖人類形式化程式碼機器執行結果\text{人類意圖} \xrightarrow{\text{人類形式化}} \text{程式碼} \xrightarrow{\text{機器執行}} \text{結果}

在此架構中,程式語言是人類與機器之間的必要中介。它將:

  • 對象;
  • 狀態;
  • 條件;
  • 時序;
  • 迴圈;
  • 型別;
  • 例外;
  • 權限;
  • 輸入;
  • 輸出;

轉換為可由編譯器或直譯器處理的形式結構。

因此,程式設計的主要成本之一,不只是知道要做什麼,而是必須將「想做什麼」轉換成機器接受的結構。

1.2 自然語言為何長期不能直接編程

自然語言允許大量非形式性:

  1. 主體省略;
  2. 指涉不明;
  3. 時間邊界不明;
  4. 條件不完整;
  5. 詞義依賴情境;
  6. 同一句話具有多種合理解釋;
  7. 說話者可能不理解自身命令的後果;
  8. 指令可能與既有規則衝突;
  9. 相同表達在不同文化與領域中具有不同預設。

例如:

幫我把最近表現不好的產品先停掉。

這句話至少包含下列未決問題:

  • 「最近」是七日、三十日、三個月或一季?
  • 「表現不好」是收入、毛利、成長率、退貨率還是評價?
  • 「停掉」是停止廣告、停止銷售、下架、停產還是刪除?
  • 是否所有產品一律適用?
  • 是否需要主管核准?
  • 是否可撤回?
  • 是否會影響已付款訂單?

如果機器直接執行,風險極高。因此,傳統系統要求人類自行將這些條件寫成明確程式。

1.3 AGI 改變的不是語言,而是形式化責任

當 AI 能夠:

  • 理解上下文;
  • 建立持續記憶;
  • 抽取條件;
  • 辨識歧義;
  • 詢問缺失資訊;
  • 生成形式規格;
  • 建立測試;
  • 模擬結果;
  • 評估風險;
  • 產生可執行程序;
  • 根據失敗修正;

形式化責任便可能從人類轉移給 AI:

人類意圖AI 語義編譯形式程序驗證與執行結果\text{人類意圖} \xrightarrow{\text{AI 語義編譯}} \text{形式程序} \xrightarrow{\text{驗證與執行}} \text{結果}

因此,真正的歷史轉變不是「自然語言突然變精確」,而是:

有一個足夠強的智能系統,能在自然語言與形式系統之間持續維護可檢驗的映射。


二、自然語言普遍可編程化命題

2.1 命題定義

本文提出:

自然語言普遍可編程化命題:當智能系統具有足夠的語義理解、語境建模、歧義管理、形式化、驗證與執行能力時,任何具有穩定社群使用與可學習語義結構的自然語言,都可能成為形式程序的上層表達語言。

令自然語言集合為:

N={L1,L2,,Ln}\mathcal{N} = \{L_1,L_2,\ldots,L_n\}

令共享形式語義空間為:

S\mathcal{S}

則對每一自然語言 LiL_i ,理論上存在一個由智能系統維持的映射:

Φi:LiS\Phi_i: L_i \rightarrow \mathcal{S}

再由形式語義空間投影至不同執行後端:

Ψj:SPj\Psi_j: \mathcal{S} \rightarrow P_j

其中 PjP_j 可以是:

  • 傳統程式碼;
  • 資料庫查詢;
  • 工作流;
  • 智能體任務圖;
  • 機器人控制程序;
  • 模擬模型;
  • 數學證明;
  • 政策規則;
  • 合約執行邏輯。

完整路徑為:

LiΦiSΨjPjL_i \xrightarrow{\Phi_i} \mathcal{S} \xrightarrow{\Psi_j} P_j

2.2 映射不必唯一

自然語言通常不具唯一解釋,因此:

Φi(x)s\Phi_i(x) \neq s

而更可能是:

Φi(x)={s1,s2,,sk}\Phi_i(x) = \{s_1,s_2,\ldots,s_k\}

其中每個 sjs_j 都是合理候選。

成熟的 AI 編譯器不應在歧義存在時偷偷選擇其中一個,而應:

  1. 列出候選;
  2. 評估差異;
  3. 判斷是否影響執行;
  4. 在必要時要求澄清;
  5. 保存選擇理由;
  6. 將未確認假設顯式標註。

因此,未來自然語言程式設計的核心品質,不是「總能猜出使用者想要什麼」,而是:

能正確知道何時已經理解,何時仍未理解。


三、所有語言成為程式語言的真正含義

3.1 不是每種語言都要重造 Python

「全世界的語言都可能成為程式語言」不應理解為:

  • 中文版 Python;
  • 日文版 Rust;
  • 阿拉伯文 JavaScript;
  • 台語版 C;
  • 每種語言各自建立互不相容的標準函式庫。

這種路徑會造成巨大生態碎裂。

更合理的未來是:

L1SL2SL3SLnS\begin{aligned} L_1 &\rightarrow \mathcal{S} \\ L_2 &\rightarrow \mathcal{S} \\ L_3 &\rightarrow \mathcal{S} \\ &\vdots \\ L_n &\rightarrow \mathcal{S} \end{aligned}

所有自然語言都透過自己的語言 Profile 進入共享形式語義空間。

之後再由共享形式語義投影到各種技術系統:

S{PythonSQLRustJavaScriptEML-PEML-UAgent WorkflowRobot Control\mathcal{S} \rightarrow \begin{cases} \text{Python}\\ \text{SQL}\\ \text{Rust}\\ \text{JavaScript}\\ \text{EML-P}\\ \text{EML-U}\\ \text{Agent Workflow}\\ \text{Robot Control} \end{cases}

因此,每種語言獲得的是「通往形式世界的原生入口」,而不是孤立的編程生態。

3.2 自然語言將成為上層源碼

在這種架構下,使用者的自然語言不再只是需求文件,而可能成為系統保留的第一層源碼:

原始語言意圖
↓
受控意圖
↓
約束帳本
↓
共享形式語義
↓
技術後端

原始語句需被永久保留,因為它記錄:

  • 誰提出了意圖;
  • 意圖如何表達;
  • 哪些條件是明示的;
  • 哪些條件是推論的;
  • 哪些條件經過澄清;
  • 後續修改改變了什麼。

因此,自然語言程式不是被翻譯後即丟棄,而是成為版本控制的一部分。

3.3 方言、混合語與個人語言也可能可編程

一旦 AI 能利用長期上下文與社群語境,程式入口不必限於標準語言。

可能成為程式入口的形式包括:

  • 方言;
  • 地區用語;
  • 行業術語;
  • 中英混合;
  • 手勢加語言;
  • 圖像加語言;
  • 個人長期慣用命令;
  • 組織內部縮寫;
  • 社群特有表達。

所以未來的程式語言邊界不再由標準語法決定,而由下列條件決定:

表達是否能穩定映射到可驗證意圖\text{表達是否能穩定映射到可驗證意圖}

四、可編譯、可驗證與可執行必須分離

4.1 可編譯不等於可執行

自然語言可以被形式化,不代表系統應立即執行。

CompilableExecutable\text{Compilable} \neq \text{Executable}

例如:

刪除所有過去一年沒有登入的帳號。

這句話可以被精確編譯,但仍可能涉及:

  • 法律保存義務;
  • 誤刪風險;
  • 付費資料;
  • 帳號所有權;
  • 第三方整合;
  • 不可逆損失;
  • 權限不足。

因此,完整流程必須是:

自然語言候選意圖形式化權限檢查風險評估驗證執行或拒絕\text{自然語言} \rightarrow \text{候選意圖} \rightarrow \text{形式化} \rightarrow \text{權限檢查} \rightarrow \text{風險評估} \rightarrow \text{驗證} \rightarrow \text{執行或拒絕}

4.2 三階段模型

可將自然語言程序分成三個狀態:

第一階段:可編譯

系統能將語句映射為形式結構:

LSL \rightarrow S

第二階段:可驗證

系統能檢查:

  • 條件是否完整;
  • 是否存在衝突;
  • 是否符合測試;
  • 是否違反規則;
  • 是否保留原始約束。
SV(S)S \rightarrow V(S)

第三階段:可執行

系統確認:

  • 發話者具有權限;
  • 執行風險在容許範圍;
  • 必要同意已取得;
  • 執行環境安全;
  • 回復方案存在。
V(S)A(S)R(S)Execute(S)V(S) \land A(S) \land R(S) \rightarrow \operatorname{Execute}(S)

其中:

  • V(S)V(S) :驗證通過;
  • A(S)A(S) :授權成立;
  • R(S)R(S) :風險可接受。

4.3 執行權不應由語言流暢度決定

未來 AI 可能非常擅長把任何語句轉換成看似合理的程序。但流暢理解不代表合法權限。

因此:

語義理解能力執行正當性\text{語義理解能力} \neq \text{執行正當性}

AI 必須區分:

  • 我理解你要做什麼;
  • 你是否有權要求這件事;
  • 這件事是否允許被執行;
  • 是否需要其他主體同意;
  • 是否能撤回;
  • 是否會替其他主體完成不可撤回選擇。

自然語言可編程化之後,真正困難的問題將由語法轉向權力與責任。


五、共享形式語義底座

5.1 共享底座的必要性

若每種自然語言直接映射到每種程式後端,系統複雜度將近似:

O(N×P)O(|\mathcal{N}|\times|\mathcal{P}|)

其中:

  • N|\mathcal{N}| :自然語言數量;
  • P|\mathcal{P}| :執行後端數量。

若引入共享形式語義底座,則可降為近似:

O(N+P)O(|\mathcal{N}|+|\mathcal{P}|)

每種自然語言只需建立到共享語義層的映射,每個後端也只需建立從共享語義層的投影。

5.2 共享底座應包含什麼

共享形式語義至少應能表達:

  • 主體;
  • 對象;
  • 動作;
  • 條件;
  • 例外;
  • 時序;
  • 數量;
  • 空間;
  • 因果;
  • 權限;
  • 義務;
  • 禁止;
  • 可逆性;
  • 風險;
  • 資料來源;
  • 預期結果;
  • 不確定性;
  • 未決問題。

形式上,可表示為:

S=(A,O,R,C,E,T,Q,P,D,X,U)S = (A,O,R,C,E,T,Q,P,D,X,U)

其中:

  • AA :Actor,行動主體;
  • OO :Object,作用對象;
  • RR :Relation/Action,關係與動作;
  • CC :Condition,條件;
  • EE :Exception,例外;
  • TT :Temporal,時序;
  • QQ :Quantification,數量與範圍;
  • PP :Permission,權限;
  • DD :Dependency,依賴;
  • XX :Expected Outcome,預期結果;
  • UU :Uncertainty,不確定性。

5.3 底座不能假裝完全中立

共享語義層雖應盡可能語言中立,但不可能假設所有語言、文化與制度都共享完全相同的概念切分。

因此,底座必須允許:

  • 語言特有概念;
  • 文化特有關係;
  • 不可完全翻譯項;
  • 多重候選映射;
  • 局部擴充;
  • 語義損失報告;
  • 未知或不可判定狀態。

正確目標不是消滅差異,而是讓差異可被明確表示。


六、語言 Profile 與形式接口

6.1 每種自然語言都需要自己的 Profile

語言 Profile 應處理:

  • 文字正規化;
  • 分詞;
  • 詞義辨識;
  • 代詞解析;
  • 主詞省略;
  • 時間表達;
  • 量詞;
  • 否定;
  • 例外;
  • 地域術語;
  • 專業術語;
  • 禮貌形式;
  • 命令強度;
  • 不確定語氣;
  • 多義候選。

例如中文中的「先」、「再」、「除非」、「只要」、「才」、「仍然」、「原則上」、「盡量」都可能對執行邏輯產生不同影響。

6.2 Profile 的輸出不是程式碼

語言 Profile 的直接輸出應是:

受控意圖
歧義候選
約束集合
語義來源對齊
未決問題

而不是直接生成 Python 或 SQL。

其原因是,如果自然語言解析與技術後端綁定,將無法確認錯誤究竟來自:

  • 語言理解;
  • 形式化;
  • 後端投影;
  • 執行環境。

分層後,錯誤才能被定位。

6.3 多語言對同一語義節點的映射

不同語言可以對應同一共享概念:

lzhlenljasl_{zh} \sim l_{en} \sim l_{ja} \sim s

但不必要求字面相同。語言 Profile 保存各自表達,形式層保存共同約束。

如此一來,多語言系統不只是翻譯工具,而是:

將不同語言的意圖映射到同一個可驗證操作結構。


七、自然語言程式的最小資料結構

理想的自然語言程式單元可表示為:

D=(I,C,A,K,S,P,T,X,E,R,V,M)D = (I,C,A,K,S,P,T,X,E,R,V,M)

其中:

  • II :原始意圖;
  • CC :受控表達;
  • AA :歧義候選;
  • KK :約束帳本;
  • SS :共享形式語義;
  • PP :後端程序;
  • TT :測試;
  • XX :執行軌跡;
  • EE :錯誤;
  • RR :修正歷程;
  • VV :驗證證書;
  • MM :來源與版本資訊。

7.1 約束帳本

約束帳本記錄每個自然語言片段如何進入形式系統:

ki=(li,ci,si,pi,ti,vi)k_i = (l_i,c_i,s_i,p_i,t_i,v_i)

其中:

  • lil_i :原始語句片段;
  • cic_i :受控規則;
  • sis_i :形式語義節點;
  • pip_i :程式位置;
  • tit_i :測試;
  • viv_i :驗證結果。

例如:

constraint:
  source_span: "排除測試帳號"
  controlled_rule:
    field: account_type
    operator: not_equal
    value: test
  semantic_node: filter_03
  projection:
    target: sql
    location: where_clause_03
  test: test_exclude_test_accounts
  status: preserved

7.2 假設必須顯式記錄

系統應區分:

explicit
inferred
assumed
clarified
unknown

否則 AI 可能把自己的合理推測偽裝成使用者原意。

例如:

temporal_range:
  value: previous_30_days
  status: assumed
  reason: "最近"未明確定義

對高風險任務,任何 assumed 條件都不應直接執行。


八、程式語言能力的重新定義

8.1 傳統編程能力

傳統程式能力常包含:

  • 記憶語法;
  • 理解資料結構;
  • 撰寫函式;
  • 除錯;
  • 使用套件;
  • 管理執行環境。

8.2 未來編程能力

當 AI 承擔大部分語法與實作工作後,人類的核心能力可能轉向:

Cfuture=Cintent+Cconstraint+Cevaluation+CresponsibilityC_{\text{future}} = C_{\text{intent}} + C_{\text{constraint}} + C_{\text{evaluation}} + C_{\text{responsibility}}

其中:

  • CintentC_{\text{intent}} :形成清楚目標;
  • CconstraintC_{\text{constraint}} :辨認條件、例外與邊界;
  • CevaluationC_{\text{evaluation}} :判斷輸出是否真正符合需求;
  • CresponsibilityC_{\text{responsibility}} :理解決策、風險與他者權利。

未來最重要的編程問題可能不再是:

這段程式碼怎麼寫?

而是:

你究竟要求系統做什麼?哪些結果不能接受?誰有權決定?錯誤由誰承擔?

8.3 不會寫程式碼不代表不需要思考

自然語言編程不會讓複雜性消失。它只會改變複雜性所在的位置。

過去的複雜性集中於:

  • 語法;
  • API;
  • 框架;
  • 工具鏈。

未來的複雜性可能集中於:

  • 問題定義;
  • 多主體利益;
  • 約束衝突;
  • 不確定性;
  • 長期後果;
  • 權限與責任。

因此,AI 降低的是形式轉換成本,而不是世界本身的複雜度。


九、語言平權與全球技術結構

9.1 英文中心的計算入口

現代程式設計、技術文件與軟體生態高度依賴英文。非英文使用者往往需要先學習英文術語,再進入形式計算世界:

LiEnglishFormal SystemL_i \rightarrow \text{English} \rightarrow \text{Formal System}

這造成額外的語言成本與知識門檻。

9.2 原生形式入口

若每種語言都能直接進入共享形式語義:

LiSL_i \rightarrow \mathcal{S}

則使用者可以用自己的母語:

  • 描述工作流程;
  • 建立資料查詢;
  • 控制設備;
  • 編寫政策規則;
  • 進行數學形式化;
  • 建立智能體任務;
  • 操作數位基礎設施。

這將形成一種新的語言平權:

不要求所有人先通過同一種自然語言,才能取得計算能力。

9.3 低資源語言不會自動受益

但是,自然語言普遍可編程化不會自動實現。低資源語言可能面臨:

  • 語料不足;
  • 方言差異;
  • 書寫標準不穩定;
  • 技術術語缺失;
  • 模型理解偏差;
  • 缺乏在地驗證者;
  • 商業誘因不足。

因此,語言平權需要主動建設:

  1. 開源語言 Profile;
  2. 在地語料;
  3. 形式對齊資料;
  4. 社群驗證;
  5. 術語資料庫;
  6. 執行測試;
  7. 文化差異標註;
  8. 公開治理。

9.4 語言不應因使用人口少而失去形式能力

在共享形式底座下,為一種低資源語言增加程式能力,不再需要重建完整編譯器與軟體生態。只需建立:

ΦL:LS\Phi_L: L \rightarrow \mathcal{S}

因此,邊際成本可能顯著下降。這為小型語言、原住民族語言與地方語言保留提供新的技術可能性:

語言不只被保存為文化文本,也能被保存為操作世界的介面。


十、教育的根本改變

10.1 程式教育不再以語法為起點

未來程式教育可以從:

  • 描述目標;
  • 拆分條件;
  • 找出例外;
  • 建立測試;
  • 比較不同實作;
  • 檢查 AI 理解;
  • 理解風險;

開始,而不是先背誦關鍵字。

學生可以使用母語描述任務,然後觀察:

自然語言
→ 受控規格
→ 流程圖
→ 程式碼
→ 執行結果

10.2 傳統程式碼仍然重要

這不表示程式碼教育會完全消失。高階開發者、基礎設施工程師與安全研究者仍需理解:

  • 底層執行;
  • 記憶體;
  • 併發;
  • 編譯;
  • 系統調用;
  • 硬體;
  • 效能;
  • 安全邊界。

但對大多數使用者而言,程式碼可能從唯一入口變成可選的精細控制層。

10.3 新型識字能力

未來數位識字可能包含:

  • 能否清楚表達可執行意圖;
  • 能否辨認 AI 加入的假設;
  • 能否讀懂形式化摘要;
  • 能否檢查測試;
  • 能否理解權限與副作用;
  • 能否拒絕錯誤自動化。

這是一種「可執行語言素養」。


十一、AI Agent 與多主體系統

11.1 自然語言將直接生成工作流

未來使用者可直接說:

每週整理研究進度,把有實驗結果的節點交給驗證代理,把只有概念草稿的節點交給文獻代理;任何公開發布都必須等我批准。

AI 將其編譯為:

  • 排程;
  • 節點分類;
  • Agent 分工;
  • 權限;
  • 發布閘門;
  • 失敗處理;
  • 通知規則。

自然語言因此不只是呼叫單一工具,而是生成持續運行的多智能體制度。

11.2 多主體同意

當任務影響多個主體時,單一使用者的自然語言不能自動覆蓋其他主體的選擇。

因此應加入:

Execute(S)aAaffectedConsentOrAuthority(a,S)\operatorname{Execute}(S) \Rightarrow \bigwedge_{a\in A_{\text{affected}}} \operatorname{ConsentOrAuthority}(a,S)

這表示,凡是涉及其他主體不可撤回利益的程序,都需檢查其授權、同意或合法代理關係。

11.3 自然語言制度編程

當規則、權限與 Agent 都可用自然語言配置,程式設計將逐漸接近制度設計。

使用者不只是在寫函式,而是在定義:

  • 誰可以做什麼;
  • 什麼條件下可以做;
  • 誰能撤回;
  • 何時需要多人同意;
  • 失敗時如何補救;
  • 記錄由誰保存;
  • 誰能審查。

這使自然語言編程成為政治、法律與治理問題,而不只是技術問題。


十二、EML/ULEI 的理論位置

12.1 ULEI:共享形式語義的工程核心

在自然語言普遍可編程化架構中,ULEI 可被重新定位為:

多語言人類意圖、形式語義與多執行後端之間的通用語言工程基礎設施。

其功能不只是程式語言互轉,而是維護:

自然語言 Profile
↕
受控意圖
↕
Canonical Semantic IR
↕
多種程式與智能體後端

12.2 EML-P:可執行高密度投影

EML-P 可作為共享形式語義的一種:

  • 高密度;
  • AI 友善;
  • 可執行;
  • 可壓縮;
  • 可驗證;

投影。

它不需要成為所有人直接書寫的語言,而可以成為 AI 之間交換形式意圖的中介層。

12.3 EML-U:空間與視覺語義投影

EML-U 可承載:

  • 語義圖;
  • 約束圖;
  • 多智能體關係;
  • 執行流程;
  • 權限結構;
  • 因果網路;
  • 多層形式對齊。

因此,EML-U 可成為自然語言程序的可視化檢查層。

12.4 MFCL/CFCL:多語言入口

MFCL 與 CFCL 則分別負責:

  • 所有自然語言的共同形式化接口;
  • 中文特有的語義、歧義與術語處理。

整體結構為:

Natural LanguagesMFCL ProfilesULEI Canonical IREML / Traditional Backends\text{Natural Languages} \rightarrow \text{MFCL Profiles} \rightarrow \text{ULEI Canonical IR} \rightarrow \text{EML / Traditional Backends}

十三、自然語言程式的驗證體系

13.1 六級驗證

可採用以下層級:

V0:可解析

自然語言輸入能被切分、辨識與結構化。

V1:結構一致

受控意圖與形式 IR 在結構上對應。

V2:語義保持

所有明示約束均有形式節點。

V3:行為驗證

生成程序通過輸入輸出測試。

V4:性質驗證

關鍵不變量、權限與安全性質被檢查。

V5:形式證明

部分高風險程序可由形式證明系統驗證。

13.2 語義保持率

Sretain=被正確保留的約束數全部明示約束數S_{\text{retain}} = \frac{\text{被正確保留的約束數}} {\text{全部明示約束數}}

13.3 靜默遺失率

Rsilent-loss=未報告但實際遺失的約束數全部約束數R_{\text{silent-loss}} = \frac{\text{未報告但實際遺失的約束數}} {\text{全部約束數}}

自然語言編程最重要的工程目標之一是:

Rsilent-loss=0R_{\text{silent-loss}}=0

因為明確報告「無法表示」比悄悄遺漏條件更安全。

13.4 假設透明度

Tassumption=被明示標記的推論與假設全部推論與假設T_{\text{assumption}} = \frac{\text{被明示標記的推論與假設}} {\text{全部推論與假設}}

理想目標為:

Tassumption=1T_{\text{assumption}}=1

十四、主要風險

14.1 語義幻覺

AI 可能生成一個形式上完整、但不是使用者原意的程序。這比一般文字幻覺更危險,因為它可能直接改變世界。

14.2 自動化權力集中

若少數模型供應者控制自然語言到形式程序的映射,它們將實際控制:

  • 哪些命令被理解;
  • 哪些概念可被表達;
  • 哪些行動被允許;
  • 哪些語言被優先支持;
  • 哪些文化預設被視為標準。

因此,共享形式底座與語言 Profile 應具備開放標準與可替換實作。

14.3 語言差異被錯誤壓平

不同文化中的責任、親屬、土地、所有權、承諾與共同體概念可能無法完全對應。系統若強制映射到單一概念,可能造成語義殖民。

14.4 使用者失去能力

若所有形式化工作都交給 AI,人類可能逐漸失去:

  • 拆解問題;
  • 理解系統;
  • 檢查結果;
  • 發現錯誤;
  • 判斷可行性;

的能力。

因此,介面應保留可檢查的中間層,而不是只顯示最終結果。

14.5 不可逆操作

自然語言非常容易讓使用者低估命令後果。高風險操作應預設:

  • 模擬;
  • 預覽;
  • 延遲執行;
  • 多重確認;
  • 備份;
  • 回復計畫;
  • 最小權限;
  • 審計記錄。

十五、理論命題群

命題一:形式化責任轉移命題

當 AI 的語義理解與驗證能力超過一定閾值後,程式形式化的主要成本將由人類轉移至 AI。

Chuman-formalizationasCAI-semanticC_{\text{human-formalization}} \downarrow \quad\text{as}\quad C_{\text{AI-semantic}} \uparrow

命題二:自然語言入口普遍化命題

對任何具有穩定語義社群的自然語言 LL ,存在建立其形式語義接口的可能:

LN,ΦL:LS\forall L\in\mathcal{N}, \exists \Phi_L: L\rightarrow\mathcal{S}

命題三:共享底座效率命題

多語言系統經由共享形式語義層的工程成本,低於所有語言與所有後端兩兩直接映射。

N+P<NP|\mathcal{N}|+|\mathcal{P}| < |\mathcal{N}|\cdot|\mathcal{P}|

命題四:程式語言概念擴張命題

未來程式語言的定義將從「具有固定形式語法的語言」擴張為:

能穩定表達、形式化、驗證並觸發計算行為的語義介面。

命題五:權限優先命題

當自然語言可直接生成可執行行為後,系統安全的主要瓶頸將逐漸從語法正確性轉向權限、責任與多主體同意。

Future Safety BottleneckAuthority+Responsibility+Consent\text{Future Safety Bottleneck} \approx \text{Authority} + \text{Responsibility} + \text{Consent}

命題六:語言平權條件命題

自然語言普遍可編程化只有在語料、Profile、社群驗證與開放治理同時存在時,才會產生真正的語言平權。

Elinguistic=f(D,P,V,G)E_{\text{linguistic}} = f(D,P,V,G)

其中:

  • DD :資料;
  • PP :語言 Profile;
  • VV :在地驗證;
  • GG :治理。

十六、研究路線

16.1 第一階段:中文驗證

先以繁體中文建立:

  • 自然語言輸入;
  • 受控中文;
  • 約束帳本;
  • Canonical IR;
  • Python/SQL 投影;
  • 自動測試;
  • 語義保持證書。

16.2 第二階段:同語義多表達

收集同一任務的:

  • 正式中文;
  • 口語中文;
  • 簡體中文;
  • 台灣術語;
  • 中國大陸術語;
  • 中英混合;
  • 模糊表達;
  • 省略表達。

檢查是否映射到同一形式語義。

16.3 第三階段:多語言平行映射

選擇英文、日文與其他語言,建立:

L1,L2,L3SL_1,L_2,L_3 \rightarrow S

驗證不同語言是否保持相同約束。

16.4 第四階段:Agent 工作流

將自然語言映射到:

  • 多 Agent 分工;
  • 權限;
  • 排程;
  • 記憶;
  • 審核;
  • 失敗恢復;
  • 人類批准節點。

16.5 第五階段:高風險形式化

研究:

  • 法律規則;
  • 財務操作;
  • 工業控制;
  • 醫療行政;
  • 公共政策;
  • 多主體權限。

此階段必須加入形式驗證與治理研究。


十七、哲學意義

17.1 語言從描述世界轉向操作世界

自然語言長期具有:

  • 描述;
  • 記錄;
  • 說服;
  • 承諾;
  • 命令;
  • 規範;
  • 想像;

等功能。

當它可被 AI 編譯為形式程序後,語言新增:

LanguageVerified World Operation\text{Language} \rightarrow \text{Verified World Operation}

一句話可能建立網站、修改資料、安排機器人、生成制度或啟動智能體群。

17.2 說話與行動的距離縮短

過去,說出意圖與完成行動之間存在大量人力與技術中介。未來這個距離可能大幅縮短:

d(utterance,execution)d(\text{utterance},\text{execution}) \downarrow

但距離縮短同時意味著責任加重。語言將更接近行動本身。

17.3 程式語言與自然語言的邊界消融

最終,以下分類可能不再是互斥類別:

  • 自然語言;
  • 程式語言;
  • 規格語言;
  • 法律語言;
  • 工作流語言;
  • 智能體命令語言;
  • 形式證明語言。

它們可能成為同一語義系統在不同精度、風險與用途下的投影。


十八、結論

「全世界的語言都可能成為程式語言」並不是指所有語言都必須模仿現有程式語法,也不是每個文化都要建立一套封閉編譯器。

更準確的理解是:

當 AI 能夠承擔語義理解、歧義管理、形式化、驗證、權限檢查與執行協調時,任何自然語言都可能成為形式程序的上層入口。

其核心架構為:

Natural LanguageLanguage ProfileControlled IntentShared Formal SemanticsVerificationExecution Backend\text{Natural Language} \rightarrow \text{Language Profile} \rightarrow \text{Controlled Intent} \rightarrow \text{Shared Formal Semantics} \rightarrow \text{Verification} \rightarrow \text{Execution Backend}

這將重新定義:

  • 程式語言;
  • 編程能力;
  • 數位識字;
  • 技術教育;
  • 語言平權;
  • 智能體治理;
  • 人類與機器的責任邊界。

未來真正的變化,不只是中文、英文或其他語言成為程式語言,而是「程式語言」本身將不再由固定語法獨占。

自然語言將成為意圖層,形式語義將成為共享底座,AI 將成為持續運作的語義編譯與驗證系統,而傳統程式碼則成為多種可執行投影之一。

因此,可以提出本文最後的總命題:

當智能足以維持自然語言與形式行為之間的可靠映射時,語言不再只是描述世界的工具,而將成為可驗證地操作世界的通用介面。


附錄 A:最小形式架構

Natural Language Input
        ↓
Language-Specific Profile
        ↓
Ambiguity Candidate Set
        ↓
Controlled Intent
        ↓
Constraint Ledger
        ↓
Canonical Semantic IR
        ↓
Authority / Risk / Consent Check
        ↓
Program Projection
        ↓
Sandbox Test and Simulation
        ↓
Verification Certificate
        ↓
Execution or Refusal

附錄 B:範例

原始中文:

明天如果雨量比今天高,就不要開東側灌溉;但若二號田土壤濕度低於安全值,仍然開啟二十分鐘。

受控意圖:

actor: irrigation_controller
time: tomorrow
default_rule:
  condition:
    tomorrow_rainfall > today_rainfall
  action:
    east_irrigation = off
exception:
  condition:
    field_2_soil_moisture < safety_threshold
  action:
    east_irrigation = on
    duration: 20_minutes

需揭露的問題:

open_questions:
  - rainfall_measurement_window
  - safety_threshold_source
  - sensor_failure_policy
  - manual_override_priority

形式語義:

If Rt+1>Rt, then IE=0;unless M2<θ, then IE=1 for 20 minutes.\begin{aligned} &\text{If }R_{t+1}>R_t,\text{ then }I_E=0;\\ &\text{unless }M_2<\theta,\text{ then }I_E=1\text{ for }20\text{ minutes.} \end{aligned}

此範例顯示:自然語言可以成為程式入口,但只有在時間範圍、安全閾值、感測器失敗與人工覆寫規則被處理後,才適合執行。


附錄 C:後續論文方向

  1. 自然語言程式的權限與不可撤回選擇;
  2. 多語言共享形式語義中的文化不可約性;
  3. 低資源語言的形式化基礎設施;
  4. 自然語言程式的責任歸屬;
  5. 多 Agent 制度編程;
  6. 語義編譯器的形式驗證;
  7. 自然語言程式的版本控制;
  8. 程式語言與法律語言的融合;
  9. AI 時代的可執行語言素養;
  10. EML/ULEI 多語言形式底座實作。