title: "符號瞬時判定域:從語義同一到任務下判定等價" english_title: "Symbolic Instantaneous Judgment Domains: From Semantic Identity to Task-Conditioned Judgment Equivalence" author: "Neo.K(許筌崴)" institution: "EveMissLab(一言諾科技有限公司)" series: "符號—記憶—判定耦合系列" paper_no: "01" version: "v0.1" date: "2026-08-12" status: "正式研究草稿" canonical_source_encoding: "UTF-8"
符號瞬時判定域:從語義同一到任務下判定等價
Symbolic Instantaneous Judgment Domains: From Semantic Identity to Task-Conditioned Judgment Equivalence
作者:Neo.K(許筌崴)
機構:EveMissLab(一言諾科技有限公司)
系列:符號—記憶—判定耦合系列,第 1 篇
版本:v0.1
日期:2026 年 8 月 12 日
摘要
自然語言交流通常被默認為一種「意義傳輸」問題:說話者具有某一內部概念,將其編碼為符號,聽者再由符號重建相同或近似的概念。此模型在理論上容易導向一個過強條件:成功理解似乎要求兩個主體最終獲得同一語義表徵。然而在實際人類交流、長期人機協作與複雜跨域研究中,完全語義同一既難以驗證,也未必是任務成功的必要條件。兩個主體可能保留不同內部表徵、不同概念粒度與不同背景知識,卻仍能在某一任務、尺度與時間點對關鍵問題作出相同判定,並據此持續有效協作。
本文提出「符號瞬時判定域」(Symbolic Instantaneous Judgment Domain, SIJD)作為一個候選中層理論。其核心命題是:
在許多任務中,更弱但更可操作的條件可能已足夠:
其中 與 可為不同內部表徵, 表示任務, 表示判定尺度, 表示當前時間,而 表示「在該任務、尺度與時刻下具有判定等價性」。
本文進一步定義認知底空間、符號觸發、候選解釋域、動態約束、尺度切換、重基準化與任務判定函數;提出「瞬時判定域」不是單一語義點,而是對當前任務具有判定等價的一組認知狀態。本文亦區分語義同一、表徵相似、判定等價與行為等價四種不同層級,並提出精確版與容差版的判定域定義。最後,本文以對話 grounding、clarification、共同基礎維持與 LLM 對話失配研究作為外部對照,提出可證偽實驗:若兩個主體在內部語義表徵仍不同的情況下,可藉少量修正語句迅速進入任務充分的判定等價域,且此等價比表面術語相似度更能預測任務成功,則支持 SIJD 作為獨立分析層;反之,若任務成功總是要求近似語義同一,則本文框架的必要性受到削弱。
關鍵詞: 符號瞬時判定域、判定等價、語義對齊、認知底空間、動態約束、重基準化、共同基礎、對話 grounding、語義延遲綁定、認知解構學、符號即過程
0. 研究來源、邊界與新命題地位
0.1 既有內部理論來源
本文不是從零開始建立一套全新的符號理論,而是位於數條既有研究線的交界。
第一,《認知解構學正式定義方法論 2.0》將源點推理 OPS 定義為遞歸減法算子,其目的不是尋找靜態本質,而是暫停既有語義殼層、回到可重新編譯的源點,再於新語境中重構。該文同時明確區分「解釋」與「解釋之前的源點狀態」,並將重編譯能力視為必要條件之一(Neo.K, 2025)。
第二,《認知事件—算子架構》將事件、選擇、觀察、狀態更新、記憶接口、行動門控與行動輸出拆為不同功能角色,並強調算子首先是功能轉換,而不等同於單一神經模組或單一實體。該架構的重要基礎之一是:認知系統處理的不是「世界本身」,而是能進入系統動態的事件(Neo.K, 2026a)。
第三,《符號即過程:從代理到身份的語言操作論》提出在特定形式系統中,符號可不只是被動代理,而能直接對應可執行過程;但該文亦承認這種「符號即過程」在自然語言與跨域系統中存在嚴格條件與域邊界(Neo.K, 2026b)。
本文接受上述三條研究線作為背景,但不將「符號瞬時判定域」宣稱為舊理論中已完成的定義。SIJD 是在本輪研究中,由以下新問題推導出的新增候選概念:
當兩個主體不具有完全相同的語義表徵時,什麼條件足以讓它們在某一任務與尺度下「已經理解到可以繼續判定與行動」?
0.2 與既有共同基礎研究的關係
對話 grounding 研究長期關注參與者如何建立、修補與維持共享理解。近期工作顯示,共同基礎並非一次建立後固定不變,而必須在動態環境與時間變化中持續維護;在任務型對話中,共同基礎失配與對話摩擦及任務成功存在關聯;對 LLM 而言,clarification、acknowledgment、repair 與共同狀態追蹤仍是重要缺口(Udagawa & Aizawa, 2021; Shaikh et al., 2024; Sarkar et al., 2025)。
本文與這些研究相容,但研究對象不同。共同基礎常關心:
SIJD 更進一步問:
因此,本文不把 SIJD 等同於 common ground、dialogue state 或 shared belief set。
0.3 本文不主張的內容
本文不主張:
- 人類或 AI 的內部語義空間可以被完整觀測。
- 任務下判定等價代表兩個主體具有相同思想。
- 所有語言理解都可還原為單一判定函數。
- 「瞬時」代表零時間或物理上的無限小時間點。
- 「域」已經預設為拓撲空間、流形、希爾伯特空間或任何特定數學結構。
- 中文天然就是算子語言。
- 表面語言越簡單,認知越高階。
- 任務成功可以完全替代真實理解。
本文的最低主張只是:
1. 問題提出:理解是否必須是語義同一?
1.1 傳統直覺模型
考慮兩個主體 與 。主體 具有某個內部概念:
其中 是 可用的認知底空間。
透過某個編碼過程 產生符號:
主體 接收 後,透過自身重建過程 得到:
最強理解條件可以寫成:
但此條件存在至少三個問題。
第一, 與 本來就可能不同,因此等號未必有清楚的跨主體定義。
第二,即使兩個人最後作出完全相同的行動,我們也無法僅由行動反推出其內部表徵完全相同。
第三,在實際協作中,人們經常以極短的修正語句完成對齊,例如:
- 「不是這個尺度。」
- 「再底層一點。」
- 「我說的是關係,不是物件。」
- 「對,就是這個。」
- 「先不要套那個既有理論。」
這些語句表面資訊量可能很低,卻能造成後續推理路徑的大幅改變。
因此,問題不應只問:
對方是否重建了與我完全相同的概念?
也應問:
對方是否已進入一個在當前任務下足以作出相同關鍵判定的認知域?
1.2 四種不同的「一致」
本文區分四個層次。
第一層:符號一致
兩者使用相同表面符號:
這是最弱訊號,因為同詞可以異義。
第二層:表徵相似
兩者的內部表示在某種距離下接近:
此處需要先定義可比較的表示空間與距離。
第三層:判定等價
對某任務 與尺度 :
即使:
第四層:行為等價
兩者最後輸出相同行動:
行為等價仍不保證判定過程相同,因為不同理由可能導致相同行動。
本文主要研究第三層。
2. 基本形式系統
2.1 認知底空間
對任一主體 ,定義其在時間 的認知底空間為:
此空間不是必須被實現為顯式向量空間。它只是一個理論容器,用以表示該主體此時可能調用的:
- 概念;
- 關係;
- 經驗;
- 記憶;
- 世界模型;
- 任務知識;
- 語言結構;
- 可用推理操作。
因此:
而是:
2.2 情境化符號事件
同一符號在不同觀測者、語境、歷史與任務中,不能被假定具有同一作用。
因此定義情境化符號事件:
其中:
- :表面符號或符號串;
- :解碼主體;
- :當前局部語境;
- :對話、文件與互動歷史;
- :當前任務;
- :判定尺度。
符號的認知作用不寫成單純的 ,而寫成:
其輸出不是必然唯一概念,而是一組仍可接受的候選域。
2.3 候選解釋域
在時間 ,主體 對符號 的候選解釋集合記為:
初始時可能很大:
隨後對話中的新符號、否定、例子、文件與尺度限定會對其施加約束。
令第 個約束為:
則:
但本文不要求:
永遠成立。
因為實際對話存在重基準化、尺度擴展與框架撤銷。某一句:
「等等,我重新講。」
可能不是繼續縮小原域,而是先解除先前約束:
其中:
再重新收斂。
3. 瞬時判定域
3.1 判定函數
令:
表示主體在任務 、尺度 、時間 下的判定函數。
可以是:
- 二元判定;
- 多類別判定;
- 排序;
- 動作選擇;
- 形式證明中的合法/非法;
- 是否需要澄清;
- 是否接受某命題;
- 是否進入下一推理步驟。
關鍵是: 不要求窮盡主體全部思想,只抽取當前任務真正需要的判定。
3.2 精確判定等價
對任意 ,定義:
若 為確定函數,則 至少在其定義域上構成一個等價關係。
因此,認知底空間可在當前任務下被商掉:
得到一組「對當前判定而言無差別」的等價類。
3.3 精確符號瞬時判定域
定義:
為一個符號瞬時判定域,若存在某個 ,使得:
也就是:
此域內仍可能存在多種語義、表徵或概念細節,但這些差異在當前任務、尺度與時刻下不再改變關鍵判定。
因此:
完全可以成立。
這正是本文與「理解等於收斂到唯一語義點」模型的根本差異。
3.4 容差判定域
實際系統的判定常具有噪音、概率輸出或連續值,因此更一般地令輸出距離為:
定義 -判定等價:
並定義容差瞬時判定域:
其中:
這允許「理解足夠接近」而非要求絕對相同。
4. 「瞬時」與「域」的精確含義
4.1 瞬時不是零時間
本文使用「瞬時」表示:
只對某一個局部時間窗口、當前互動狀態與當前任務成立。
因此:
可以成立。
新證據、新問題、新任務或尺度變化都可能使原判定域解體。
所以 SIJD 不是永久語義契約。
4.2 域不是預設拓撲域
本文暫時以「域」表示一個受約束的認知候選集合。除非後續工作額外指定拓撲、距離、測度、代數結構或圖結構,否則不應將其誤讀為既定的數學 domain。
後續若要建立拓撲版 SIJD,應另外定義:
或度量版:
而不能由「域」一字直接推出。
5. 任務充分對齊
5.1 跨主體問題
對兩個主體 與 ,其認知底空間通常不同:
因此直接要求:
常缺乏可操作意義。
本文改以外部探針集:
測試兩者在任務 下的判定。
若:
則稱 與 在任務 下達到 -任務充分對齊:
這不代表:
也不代表兩者所有理由相同。
它只代表:
對這一組任務相關判定,現有差異已不足以阻止共同工作。
5.2 風險加權版本
並非所有判定同等重要。
令每個 probe 的風險權重為:
且:
則可以定義:
高風險任務應要求更高閾值:
因此,「對,就是這個,可以繼續」不能脫離任務風險。
在低風險創意討論中,粗粒度判定等價可能足夠;在醫療、法律、安全或不可逆決策中,必須提高對齊門檻,甚至要求顯式定義、外部證據與形式驗證。
6. 尺度是判定的一部分
6.1 同一符號在不同尺度下可不等價
令 為尺度參數。
同一個符號 :
若在專案排程尺度:
其候選判定可能涉及優先級、資源或任務取消;但在生命終極尺度:
其判定可能涉及生命終點反問、本心、不可替代之願與存在性選擇。
因此:
即使表面符號完全相同。
6.2 尺度錯位
定義尺度錯位:
而雙方卻誤以為:
此時,即使詞彙、句法與局部定義高度相似,也可能持續產生系統性誤解。
因此,一句:
「不是這個尺度。」
可能具有比大量新增術語更高的校準作用。
它不是增加大量新資訊,而是在修改判定函數本身:
7. 重基準化:為什麼基本語言有時能修正高階誤解
7.1 約束錯誤累積
假設對話早期產生錯誤框架:
後續所有新資訊均在該框架下被解碼:
即使每一步都局部合理,整體仍可能越走越偏。
因此:
如果初始框架本身錯誤,增加推理深度可能只是使錯誤結構更完整。
7.2 重基準化算子
定義重基準化操作:
其功能是:
- 暫停部分已建立高階解釋;
- 解除錯誤本體承諾;
- 回到較低承諾的符號與關係;
- 重新指定尺度、對象與任務;
- 重新開始域約束。
這與認知解構學 OPS 的精神一致,但本文不將兩者直接等同。OPS 的目標更廣,涉及語義殼層剝離與源點重編;SIJD 中的 rebase 只是一個對話與判定校準操作。
7.3 基本語言不等於初學語言
本文提出一個可檢驗區分:
一個研究者可能故意使用低承諾基本語句:
「這不是固定的東西。」
「我真正要說的是它變的那一瞬間。」
「先不要用那個學術定義。」
其功能可能是避免舊術語提前固定錯誤域。
因此,由「常使用基本語言」直接推出「領域初學者」,在某些高階協作情境中可能構成錯誤推論。
此命題必須由後續實驗驗證,而不能僅由個案推廣。
8. 文件不是共享認知,而是共享參照場
8.1 同一文件不保證同一理解
兩個主體共同閱讀文件 :
一般仍可能成立。
因此不能寫:
更合理的功能是:
其中 為共享參照場,允許雙方回指同一句定義、同一頁、同一公式、同一版本與同一正典來源。
其主要作用之一是降低 reference drift,而不是消滅 interpretation difference。
8.2 文件與 SIJD 的關係
文件可以縮小候選域:
但最終是否形成瞬時判定域,仍取決於:
因此文件是約束來源之一,不是理解保證器。
9. 動態 grounding 與 SIJD
9.1 共同基礎是動態維護的
Udagawa 與 Aizawa 的動態共同基礎研究指出,互相理解不只是靜態建立,而需要隨時間與環境變化持續維護;其資料中亦出現複雜的時空表達與共同狀態更新問題。
此結果支持本文一個最低背景假設:
但 SIJD 與 common ground 不同。共同基礎可以關心「大家共同接受哪些命題」,SIJD 則關心:
9.2 Repair 與 Clarification 作為域調節操作
對話 repair 與 clarification 研究顯示,人類在遇到模糊、欠規定或理解失配時,會主動提出澄清問題以恢復共同理解。CoDraw 的研究在大量多模態協作對話中辨識出大量自發 clarification requests,說明「何時需要澄清」本身就是任務的一部分。
從 SIJD 角度看,clarification 可以被重新描述為:
其目標不是必然讓候選域收斂到唯一語義,而可能只需要使:
即已足夠。
9.3 LLM grounding gap
近期研究發現,LLM 的生成雖可表現部分 grounding 行為,但在澄清、共享假設追蹤與高度脈絡依賴的摩擦辨識上仍存在差距;2026 年的 agentic dialogue 工作更主張,不應只把對話看成動作介面,而應把 shared commitments、clarification 與 repair 納入規劃迴圈。
本文不以這些研究證明 SIJD,但它們提供了重要外部研究場:
若 LLM 不能穩定判斷「目前是否已對齊到足以行動」,那麼 task-conditioned judgment alignment 可能值得作為獨立評估層。
10. 可證偽命題
命題一:語義同一非必要命題
存在任務 、兩個主體 與表徵 ,使得:
且:
並能維持高任務成功率。
若所有高成功任務都要求近似表示同一,則此命題受削弱。
命題二:最小修正高增益命題
存在某些低字面資訊量修正 ,使:
但:
例如尺度修正、對象類型修正或框架否定。
若表面資訊量始終與對齊增益近似單調,則此命題受削弱。
命題三:尺度錯位命題
在詞彙一致與局部定義一致的條件下,尺度不一致仍可顯著降低任務成功:
且:
命題四:重基準化優於局部加碼命題
當錯誤框架已形成時,繼續增加同一框架內的細節,可能不如一次低承諾 rebase 有效:
此命題應在控制任務中比較,而不能只依賴主觀體感。
命題五:任務充分對齊預測命題
在某些協作任務中:
比:
或一般語義嵌入相似度更能預測任務成功。
若不成立,則 SIJD 作為獨立評估層的工程價值受到限制。
11. 實驗設計
11.1 實驗 A:不同表徵、相同判定
建立一組可有多種合法內部解釋但只有少數任務相關判定的 micro-world。
給兩組受試者或模型不同背景敘述:
使其內部表示刻意不同。
之後測試:
- 自由解釋差異;
- 關鍵判定一致度;
- 任務完成率;
- 是否需要額外澄清。
若自由解釋仍有顯著差異,但判定一致與任務成功很高,支持「語義同一非必要」。
11.2 實驗 B:尺度切換
同一符號在三種尺度下提出問題:
測量模型是否:
- 固著在最近尺度;
- 能由一句「尺度不對」完成切換;
- 切換後是否修正後續推論而不只改措辭。
11.3 實驗 C:重基準化
先誘導模型進入錯誤但自洽的高階框架。
比較兩種修正。
組一:細節加碼
持續加入更精細術語與補充。
組二:重基準化
使用低承諾基本語言重新描述核心關係,再逐步加回約束。
比較:
11.4 實驗 D:文件共享參照場
條件分為:
- 無共同文件;
- 有共同文件但不允許回指;
- 有共同文件且允許精確引用段落;
- 有共同文件、允許回指並加入判定 probe。
測試:
- reference drift;
- interpretation divergence;
- task alignment;
- repair 次數。
預測:文件會顯著降低 reference drift,但不保證 interpretation divergence 歸零。
11.5 實驗 E:人類—LLM 長對話
建立跨多輪的概念形成任務。
記錄每一輪 的可觀測代理,例如:
- paraphrase;
- forced-choice probes;
- ranking;
- counterexample judgment;
- next-step prediction。
判斷「對,就是這個」之前與之後,任務判定是否產生結構性躍遷。
12. 可能的工程化指標
12.1 Domain Dispersion
以多個 probe 的輸出離散程度表示候選域在判定空間中的分散:
當:
表示候選解釋雖未必語義同一,但對任務判定已收斂。
12.2 Alignment Gain
對修正語句 :
可用來測量一句極短修正是否具有高認知導航增益。
12.3 Rebase Efficiency
其中 cost 可以是 token、回合、時間或認知負擔。
12.4 Scale Sensitivity
用以測量同一概念對尺度變換的判定敏感度。
13. 與「語義延遲綁定」的接口
本文只建立 SIJD,不完整展開 Semantic Late Binding,但兩者關係可先寫成:
語義延遲綁定研究:
為什麼符號一開始可以保留較大的合法解釋自由度?
SIJD 研究:
到什麼時候、在哪個任務與尺度下,這些差異已不再影響判定?
因此下一篇應進一步研究:
14. 與算子語言的接口
本文亦不主張中文自然語言已是算子語言。
較保守的命題是:
某些自然語言符號,在具有長期共同歷史的認知系統中,可以成為高效的域調節信號。
例如:
- 「回到源點」;
- 「尺度不對」;
- 「先不要用那個定義」;
- 「不是物件,是關係」;
- 「對,就是這個」。
其效果可能近似:
但在自然語言中,這些操作仍高度依賴:
因此真正的算子語言若要成立,必須進一步降低:
並提高:
與:
這是後續符號語言研究的問題,不是本文已完成的結論。
15. 失敗模式與邊界
15.1 假對齊
兩個主體可能在有限 probe 上得到相同答案,但理由完全不同,且在稍微改變任務後立即分裂。
因此:
不能推成:
15.2 過低解析度
若 設計得過粗,任何人都會落入同一等價類。
例如只問:
可能隱藏巨大概念差異。
因此 probe 必須具有足夠辨識力。
15.3 行為偶合
相同行動可能只是偶然或共同外部壓力,不代表判定域真的重疊。
所以 SIJD 實驗不應只測最終行動,應加入:
- counterfactual probes;
- 邊界案例;
- 反例;
- 尺度變化;
- 下一步預測。
15.4 高風險領域
醫療、法律、資安與不可逆行動不應以低解析的「大概懂了」取代明確定義與外部驗證。
SIJD 的任務充分性必須具有風險依賴:
16. 理論意義
若本文命題成立,至少有五個後果。
第一,「理解」不應只有語義相似度一個評估尺度。
第二,自然語言中的短修正語句可以被研究為認知域控制操作,而不只是內容補充。
第三,文件的作用可被重新理解為共享參照場,而不是共享認知保證。
第四,長期人機協作系統可以顯式追蹤「目前在哪個判定尺度上已對齊」,而不只保存對話摘要。
第五,未來算子語言的研究可以把「域變換、尺度切換、框架撤銷、判定鎖定」當作一級語義操作,而不是只追求更大的固定術語表。
17. 結論
本文提出「符號瞬時判定域」作為一個位於符號學、認知動力學、對話 grounding 與人機協作之間的候選中層理論。
其最小核心不是:
而是:
因此,成功理解可以被重新寫成:
而不必預設:
這個轉換的意義不在於降低理解標準,而在於將「理解到什麼程度才足以繼續共同推理」從模糊直覺轉化為可研究問題。
本文同時保留一個更強限制:
任務充分對齊不是完整理解的替代品,而是一個局部、瞬時、尺度依賴、風險依賴的功能等價條件。
SIJD 因此不是「大家答案一樣就算懂」,而是一個要求我們明確回答以下問題的框架:
- 現在究竟在做什麼任務?
- 判定尺度在哪裡?
- 哪些差異仍會改變結果?
- 哪些差異在此刻已可忽略?
- 什麼新證據會讓這個判定域失效?
- 何時需要 rebase,而不是繼續堆疊更精密的語言?
下一篇將進一步處理這個框架最自然的前置機制:
語義延遲綁定:低承諾語言如何透過動態約束,在使用過程中才完成任務尺度下的語義固定。
參考文獻
A. 內部理論來源
Neo.K(許筌崴). 2025. 《認知解構學正式定義方法論 2.0》. EveMissLab. 內部/未正式出版研究稿。
Neo.K(許筌崴). 2026a. 《認知事件—算子架構:從選擇、觀察、更新、記憶到行動的最小形式系統》. EveMissLab. v1.0.
Neo.K(許筌崴). 2026b. 《符號即過程:從代理到身份的語言操作論》. EveMissLab. EML-LANG-2026-v0.1.
B. 外部學術對照
Cho, Hyundong, and Jonathan May. 2020. “Grounding Conversations with Improvised Dialogues.” Proceedings of ACL 2020, 2398–2413. DOI: 10.18653/v1/2020.acl-main.218.
Udagawa, Takuma, and Akiko Aizawa. 2021. “Maintaining Common Ground in Dynamic Environments.” Transactions of the Association for Computational Linguistics 9: 995–1011. DOI: 10.1162/tacl_a_00409.
Madureira, Brielen, and David Schlangen. 2023. “Instruction Clarification Requests in Multimodal Collaborative Dialogue Games: Tasks, and an Analysis of the CoDraw Dataset.” Proceedings of EACL 2023. ACL Anthology.
Zhang, Xuanming, Rahul Divekar, Rutuja Ubale, and Zhou Yu. 2023. “GrounDialog: A Dataset for Repair and Grounding in Task-oriented Spoken Dialogues for Language Learning.” Proceedings of BEA 2023, 300–314. DOI: 10.18653/v1/2023.bea-1.26.
Shaikh, Omar, Kristina Gligorić, Ashna Khetan, Matthias Gerstgrasser, Diyi Yang, and Dan Jurafsky. 2024. “Grounding Gaps in Language Model Generations.” Proceedings of NAACL 2024, 6279–6296. DOI: 10.18653/v1/2024.naacl-long.348.
Khebour, Ibrahim Khalil, et al. 2024. “Common Ground Tracking in Multimodal Dialogue.” Proceedings of LREC-COLING 2024. ACL Anthology.
Mohapatra, Biswesh, Manav Nitin Kapadnis, Laurent Romary, and Justine Cassell. 2024. “Evaluating the Effectiveness of Large Language Models in Establishing Conversational Grounding.” Proceedings of EMNLP 2024, 9767–9781. DOI: 10.18653/v1/2024.emnlp-main.545.
Sarkar, Rupak, Neha Srikanth, Taylor Pellegrin, Rachel Rudinger, Claire Bonial, and Philip Resnik. 2025. “Understanding Common Ground Misalignment in Goal-Oriented Dialog: A Case-Study with Ubuntu Chat Logs.” Proceedings of ACL 2025, 3200–3215. DOI: 10.18653/v1/2025.acl-long.161.
Inan, Mert, Malihe Alikhani, and Anthony Sicilia. 2026. “Dialogue is the Plan: From Interface to Joint Action in Agentic AI.” Proceedings of ACL 2026, 770–779. DOI: 10.18653/v1/2026.acl-short.63.
附錄 A:最小符號表
| 符號 | 定義 |
|---|---|
| 主體 在時間 的認知底空間 | |
| 情境化符號事件 | |
| 當前候選解釋域 | |
| 第 個動態約束 | |
| 重基準化操作 | |
| 任務 | |
| 判定尺度 | |
| 任務—尺度—時間條件下的判定函數 | |
| 精確判定等價 | |
| 容差判定等價 | |
| 符號瞬時判定域 | |
| 任務 probe 集合 | |
| 任務對齊度 | |
| 判定域分散度 |
附錄 B:最小驗證清單
- 形式證明:精確判定等價在確定 下構成等價關係。
- 明確處理隨機判定函數下的近似等價非傳遞問題。
- 建立至少一個 micro-world benchmark。
- 比較 lexical similarity、embedding similarity 與 SIJD alignment 對任務成功的預測能力。
- 驗證 rebase 是否真的可在錯誤框架下提高恢復效率。
- 驗證 scale-shift 指令是否造成真正的推理結構改變,而非表面改寫。
- 將 shared reference field 與 common ground tracking 做更完整的數學區分。
- 對高風險任務定義更嚴格的 與 probe coverage。