前符號語義定址
從被指候選、概念底空間到可投影語義狀態的中介層
Pre-Symbolic Semantic Addressing: From Pre-Referential Targets and Conceptual Base Spaces to Projectable Semantic States
作者: Neo.K
AI 協作整理: GPT-5.6 Sol
機構: EveMissLab/一言諾科技有限公司
版本: Draft v0.1
日期: 2026-08-21
定位: 研究議程草稿/語言哲學/形式語義/高維表徵/AI 原生語言/符號生成前置理論
摘要
本文提出一個待研究的中介層:前符號語義定址(Pre-Symbolic Semantic Addressing, PSSA)。
研究問題不是「符號如何指向已完成的概念」,也不是「如何把一個已存在的概念壓縮成單一符號」,而是更前置的問題:
當一個主體已經知道自己「想指向某個抽象結構」,但該結構尚未穩定成自然語言詞彙、形式概念、數學符號、矩陣、程式或其他固定表示時,系統如何先定位它?
本文承接既有「前所指層/被指候選/概念底空間」理論,並連接「高維語義流形論文/CHSIR/Semantic Anchor Bank/單符號宇宙/相對無界符號展開」等後端表示理論。本文的核心主張是:在前符號被指候選與可投影結構化語義狀態之間,可能需要一個獨立的Address / Locate / Select / Bind 層。
本文暫時將完整生成鏈寫為:
It→Pt→rt→at→Zt→Πλ(Zt)→σλ
其中:
- It:意圖、問題壓力或待指向方向;
- Pt:前符號概念底空間;
- rt:尚未完全對象化的被指候選;
- at:前符號語義地址;
- Zt:由地址與約束 materialize 的結構化語義狀態;
- Πλ:指定投影;
- σλ:自然語言、數學、矩陣、程式碼、圖像或單符號等輸出。
本文特別拒絕「地址就是概念」以及「單一地址可無損封裝完整概念且無需解碼」等過強命題。地址應被理解為穩定、版本化、可重建的定位接口,而非其所指向的完整 semantic state。
本文的主要目的不是完成理論,而是固定後續實驗方向,避免再次把研究退回到單純詞彙精細化、符號壓縮或 AI-to-AI 共享語義問題。
關鍵詞: 前符號語義定址、前所指層、被指候選、概念底空間、Semantic Addressing、CHSIR、Semantic Anchor Bank、單符號宇宙、語義投影、概念生成
1. 問題:語言以前,系統先做了什麼
自然語言研究通常從已存在的詞、句子、符號與概念開始。
但在高階創造、哲學定義、數學發現、工程設計與 AI 概念生成中,常存在另一種狀態:
我還不知道它應該叫什麼,但我知道自己正在指向某個東西。
這個狀態不能簡單等同於:
word
也不能等同於:
concept
因為「概念」本身可能尚未穩定。
因此本文的基本問題是:
在命名以前,如何定位?
2. 前所指層與被指候選
本文承接既有工作中的「被指」概念。
普通所指通常已經相對穩定,可以由某個符號承載。
本文使用的:
rt
則更前置。
它表示:
在符號、正式概念、定義與所指穩定以前,主體在某個概念底空間中捕捉到的、尚未完全對象化但已具可切分性與可定義性的抽象候選。
因此:
rt=stable signified.
它更接近:
pre-symbolic target candidate.
3. 概念底空間
令:
Pt
表示當前概念底空間。
它不是單純字典。
它可以包含:
- 已知概念;
- 關係;
- 約束;
- 反例;
- 感知與世界模型;
- 數學結構;
- 任務;
- 歷史;
- 可能的生成方向。
因此:
rt∈Pt
不表示 rt 已經是一個完成節點。
更可能表示:
rt
是一個尚未收斂的局部吸引區、候選結構或可達方向。
4. 本文真正新增的中介層
現有鏈條可以粗略寫成:
Pre-Symbolic Target→Structured Semantic Representation→Projection.
本文主張,中間需要額外拆出:
Addressing.
即:
rt→at→Zt.
研究重點不是:
at=rt,
而是:
at 如何提供足夠的定位資訊,使系統可以在之後 materialize 出與 rt 足夠一致的結構化語義狀態 Zt。
5. 地址不等於概念
本文明確拒絕:
at=concept.
也拒絕:
at=Zt.
地址應理解為:
identifier+relative location+constraints+version+reconstruction instructions.
因此:
at
更接近可重建 semantic state 的接口,而不是 semantic state 本身。
6. 前符號地址的暫定結構
本文暫時定義:
at=(αt,Γt,Ct,Ot,vt,Ht,Ut).
其中:
- αt:相對語義錨點座標;
- Γt:局部關係與鄰域結構;
- Ct:當前已知約束;
- Ot:允許的生成、查詢與解碼算子;
- vt:版本;
- Ht:來源與生成歷史;
- Ut:尚未確定、開放或未知部分。
這不是最終 schema,而是後續實驗的 v0.1 起點。
7. 相對錨點而非絕對座標
裸向量:
z(A)
與:
z(B)
通常不具有跨模型 canonical coordinates。
因此本文優先採用相對地址:
αt=(s(rt,a1),s(rt,a2),…,s(rt,am)).
其中:
A={a1,…,am}
是相對語義錨點集合。
這個結構的目標不是宣稱找到絕對語義空間,而是提供:
relative semantic localization.
8. 排除條件也是地址的一部分
前符號候選常常不是:
我知道它是 X。
而是:
我知道它不是 A 、不是 B 、也不是 C,但與它們相鄰。
因此地址不應只包含正向鄰近,也應保存:
negative constraints.
例如:
rt∼{A,B,C}
但:
rt≡A,
rt≡B,
rt≡C.
這些排除關係可以先定位一個尚未命名的概念區域。
9. 未定義也必須可保存
傳統表示往往要求:
unknown→fill value.
本文反對過早坍縮。
地址應允許:
Ut=∅.
即:
- 尚未決定的關係;
- 多個候選;
- 未知維度;
- 暫時衝突;
- 尚未驗證的假說;
可以作為地址的一部分保存。
因此:
addressability⇒full conceptual closure.
10. 定址發生在命名前
傳統 semantic addressing 常是:
Concept→ID.
本文研究的方向則是:
PreConcept→Address→Concept / Representation.
這是一個根本差異。
主體不必先完整知道:
這是什麼。
只需要先知道:
它大概在哪裡、與什麼相鄰、與什麼不同、受到哪些約束、可以如何繼續展開。
11. 定址與定義不同
定義:
Definition(r)
傾向把被指固定成一個可操作對象。
定址:
Address(r)
則可以更早發生。
因此:
Address(r)≺Definition(r)
在生成論意義上可能成立。
這裡的:
≺
表示結構先後,而不是絕對時間先後。
12. 定址與注意不同
注意力可以表示:
當下看哪裡。
但定址還要求:
之後如何再次找到同一候選區域。
因此:
Attention=Addressing.
Attention 可以是 ephemeral。
Addressing 必須至少具有:
13. 定址與 embedding 不同
Embedding:
z∈Rd
可以成為地址的一部分。
但:
at=zt
一般更合理。
因為地址還需要:
- version;
- constraints;
- provenance;
- negative relations;
- unresolved states;
- decoding contract。
因此本文反對:
semantic address=raw embedding.
14. 從地址 Materialize 語義狀態
定義:
Zt=Materialize(at,Θt).
其中:
Θt
表示目前模型、工具、知識庫與解碼環境。
因此同一地址在不同解碼環境下可能得到:
Zt(A)
與:
Zt(B).
不要求:
Zt(A)=Zt(B).
但應要求重要不變量保持在容許誤差內。
15. 地址的版本化
如果候選概念演化:
rt→rt+1,
不能默默讓同一地址改變含義。
因此:
at→at+1
應伴隨顯式 version transition。
例如:
vt+1>vt.
或者建立:
at+1=at.
這避免 semantic silent drift。
16. 地址不可靜默重定義
本文採用強約束:
AddressStable(at)⇒NoSilentRedefinition(at).
若語義核心改變到超過:
ϵa,
則必須:
- bump version;
- fork address;
- record migration;
- preserve provenance。
17. 定錯址與說錯話不同
這是本文最重要的新區分之一。
若自然語言輸出:
σt
不夠精準,有兩種不同原因。
Type A:Projection Error
底層地址與語義狀態基本正確,但語言投影失真:
at≈at∗,
但:
Πλ(Zt)
不佳。
此時只需:
re-project.
Type B:Address Error
一開始就定位到錯誤語義區域:
at≈at∗.
此時再怎麼換詞都無法根治。
需要:
re-address.
18. 語義精細化如何回饋到地址
前一系列主要研究:
σt→Refine→σt+1.
本文加入:
σt+1→UpdateAddress(at).
若反例顯示:
不是措辭不夠精準,而是最初被指位置就錯了,
則:
at+1=ReAddress(at,Xt+1).
因此 refinement 不只發生在 surface language。
19. 完整閉環
暫定完整模型:
It→Pt→rt→at→Zt→σt→Xt→at+1.
其中:
Xt
是反例、驗證結果或外部回饋。
這形成:
Intent→Locate→Materialize→Project→Test→Re-Address.
20. 與 CHSIR 的關係
CHSIR 處理:
structured semantic state
如何成為多投影的 canonical intermediate representation。
本文更前置。
本文問:
CHSIR 之前,那個尚未完全形成的抽象候選如何被定位,才能形成 CHSIR?
因此:
PSSA→CHSIR→Projection.
21. 與單符號宇宙的關係
單符號宇宙可以被理解為:
Ω=ΠΩ(Zt).
本文加入前端:
rt→at→Zt→Ω.
因此:
Ω
不是概念地址本身,也不是完整 semantic state。
它是:
a projection from an addressable structured semantic state.
22. 與無界展開符號的關係
若:
Ω
可重新展開:
Ω→RΩ(t),
則展開結果仍應可追溯到:
at.
因此:
Unbounded expansion
不是脫離地址任意生成,而應受:
- provenance;
- constraints;
- admissible paths;
- version;
約束。
23. 與潛在語義場的關係
若一個符號:
σ
具有潛在語義場:
Pt(σ),
本文加入相反方向:
rt⇝at⇝σ.
因此可以區分:
後符號展開
σ⇝m.
前符號生成
r⇝a⇝σ.
兩者共同形成雙向語義動力。
24. 與意圖符號的關係
意圖符號已有:
I=(目的,方法,邊界,資源,驗證,回饋,責任).
但本文中的:
It
更前置。
它可以只是:
問題壓力、想指向方向、尚未完全結構化的生成需求。
因此:
It→at
與:
Iexecutable
不是同一層。
前者是概念生成前的定址。
後者是可執行意圖契約。
25. 定址不是共享理解研究
本文不研究:
- AI-to-AI shared semantic space;
- receiver alignment;
- multi-agent interoperability;
雖然未來 PSSA 可以接到這些領域。
本文只處理:
一個生成系統在自己的概念尚未完成以前,如何建立可追蹤的語義位置。
26. 第一版核心假說
H1:Pre-Symbolic Addressability
存在一些尚未完成 lexicalization 或正式概念化的抽象候選:
rt,
仍可被賦予可重訪的:
at.
H2:Address Before Definition
對部分高階概念生成:
Address(r)
可以在:
Definition(r)
之前形成。
H3:Relative Addressing
有效地址不必依賴絕對 semantic coordinates,而可以由相對 anchors、relations、constraints 與 version 構成。
H4:Address Error Is Distinct From Projection Error
定址錯誤與語言投影錯誤具有不同修復路徑。
H5:Refinement Can Trigger Re-Addressing
新的反例可能迫使系統更新的不是詞彙,而是底層地址。
27. 第一版反例
本文必須處理至少以下反例。
Counterexample A
若一個尚未命名的概念其實只是:
vague feeling,
而沒有任何穩定可辨識結構,是否仍能定址?
若不能,則 PSSA 需要最低 addressability threshold。
Counterexample B
若兩個完全不同概念具有非常相近 anchor coordinates,如何避免誤址?
需要 relations 與 constraints,而不能只靠 vector similarity。
Counterexample C
如果 at 需要完整 Zt 才能定義,則 Address 層只是冗餘。
所以後續必須證明:
Complexity(at)<Complexity(Zt)
同時保持足夠 reconstruction utility。
Counterexample D
若任何未完成想法都能被稱為「前符號地址」,理論將不可反駁。
因此需要 explicit addressability tests。
28. Addressability 的最低條件
本文暫定:
Addressable(rt)=1
至少需要:
- 可重訪性:稍後仍能再次定位相近候選;
- 可區分性:能與鄰近候選分開;
- 約束性:不是任意未來內容都可塞入;
- 版本性:變化可以被記錄;
- 可展開性:能 materialize 成更完整表示;
- 可反駁性:新反例可以證明原地址錯誤。
29. 定址品質函數
暫定:
Qaddr=αR+βD+γC+ηV+κM−λE−μDrift.
其中:
- R:revisitability;
- D:discriminability;
- C:constraint adequacy;
- V:versionability;
- M:materialization quality;
- E:reconstruction error;
- Drift:semantic drift。
若:
Qaddr≥τa,
才接受為有效 provisional address。
30. 第一個實驗:無命名定址
給模型一個難以直接命名的新抽象概念。
禁止:
只允許輸出:
- anchors;
- near concepts;
- negative relations;
- constraints;
- open questions;
- provisional relations。
形成:
a0.
之後隔離上下文,再要求由:
a0
重新 materialize 候選:
r^1.
測量:
d(r0,r^1).
31. 第二個實驗:地址與名稱分離
對同一個:
r
產生多個不同名稱:
σ1,σ2,σ3.
若它們都可以映射回同一:
a,
則支持:
name invariance under shared address.
反過來,同一名稱若映射到不同:
a1,a2,
則支持:
same sign⇒same pre-symbolic target.
32. 第三個實驗:Projection Error vs Address Error
建立兩種人工錯誤:
Condition P
地址正確,但投影語句故意模糊。
Condition A
投影語句表面流暢,但地址故意偏移到鄰近概念。
比較兩者在 refinement 後的修復路徑。
預測:
Projection Error
主要由重新措辭修復。
而:
Address Error
需要重建 anchors、relations 或 constraints。
33. 第四個實驗:版本與漂移
建立:
a0,a1,a2
表示同一概念的不同演化版本。
測試:
- silent overwrite;
- explicit version;
- forked address;
三種策略的 provenance 與 reconstruction error。
預測:
explicit versioning
能降低 semantic drift 的不可追蹤性。
34. 第五個實驗:單符號投影
從:
at
materialize:
Zt.
再投影:
Ωt=ΠΩ(Zt).
測試:
Ωt→Z^t
是否仍能恢復:
- anchors;
- relations;
- constraints;
- unresolved fields;
- version。
此實驗直接連接單符號宇宙。
35. 第六個實驗:矩陣帳本
將地址寫成矩陣/帳本:
At=[anchors∣relations∣constraints∣unknowns∣version].
每次 refinement:
At+1=At+ΔAt.
保存:
- 新增;
- 刪除;
- 修改;
- 否定;
- reopen;
- merge;
- split。
這可以成為最早的工程 MVP。
36. 研究的第一個工程目標
不是直接建「超越語言系統」。
第一個 MVP 應非常小:
給一個尚未命名的抽象概念,系統先輸出可版本化的 semantic address ledger,而不是直接造詞;之後可以從該地址產生自然語言、數學、矩陣或新符號投影。
工作流程:
Input→Address Ledger→Materialized Semantic State→Multi-Projection.
37. 建議資料結構
PSSA v0.1 最低 schema:
address_id
version
intent_hint
positive_anchors
negative_anchors
relations
constraints
open_variables
candidate_categories
admissible_operations
provenance
counterexamples
confidence
materialization_refs
projection_refs
supersedes
superseded_by
這比直接保存:
concept_name
definition
更適合研究尚未完成的概念。
38. 不要重做的研究
後續實驗不應再把主要時間放在:
- 自然語言是否可以一直精細化;
- 新詞是否能一直生成;
- AI 與 AI 是否共享同一理解域;
- 單純證明有限 primitive 可以生成大量複合語義;
- 再次把 concept address 當完整 concept;
- 單純比較自然語言與矩陣誰更精準。
這些已經不是目前主線。
39. 真正要做的研究
未來主線應集中在:
- 未命名概念能否被穩定定址?
- 定址最少需要哪些欄位?
- 如何區分定址錯誤與投影錯誤?
- 地址如何 version / fork / merge?
- 地址如何 materialize 成 CHSIR 或其他高維語義狀態?
- 不同投影是否可回到同一地址?
- 單符號是否能作為地址導出的 carrier,而不是地址本身?
- 無界展開是否仍受 address ledger 約束?
- 矩陣帳本能否成為第一個可運行原型?
- 何時必須 re-address,而不是只 refine language?
40. 本文的非主張
本文不主張:
Pre-Symbolic Address=Concept.
不主張:
Address=Embedding.
不主張:
Address=World State.
不主張:
Single Symbol=Complete Meaning.
也不主張:
Pre-Symbolic=Non-Semantic.
「前符號」只是表示尚未固定進明確符號或正式概念,不表示完全不存在結構。
41. 暫定 Canonical Chain
本草稿暫時固定以下鏈條:
It→Pt→rt→at→Zt→Πλ(Zt)→σλ.
反饋:
σλ→Xt→Audit(at)→at+1.
因此完整循環:
Intent→Pre-Symbolic Target→Address→Materialize→Project→Validate→Re-Address.
42. 與前一系列的銜接
前一系列研究:
語言符號形成後如何精細化、收斂與重新基底。
本文開始研究:
語言符號形成前如何定位、materialize 與投影。
兩者接起來後:
Pre-Symbolic Addressing→Projection→Post-Symbolic Refinement→Re-Addressing.
這將是後續研究真正的新循環。
43. 結論
本草稿的目的不是完成前符號語義定址理論。
它只固定一件事:
下一階段研究的中心,不再是「如何把語言說得更精準」,而是「在語言、符號與正式概念形成以前,如何先建立一個可重訪、可版本化、可展開、可驗證、可修正的語義位置」。
最短命題為:
Before naming, locate.
更完整地:
Intent→Locate→Materialize→Project.
而 refinement 的真正高階形式則不是永遠修詞,而是:
If projection fails, re-project;if location fails, re-address.
這就是後續實驗應該沿著推進的主線。
後續工作
下一版優先完成:
- PSSA v0.1 address schema;
- Addressability Test;
- Projection Error / Address Error benchmark;
- Version / Fork / Merge protocol;
- Matrix Address Ledger;
- Address-to-CHSIR materialization;
- Address-to-single-symbol projection;
- Re-address trigger;
- 多投影 round-trip validation;
- 與既有 Semantic Anchor Bank、CHSIR、單符號宇宙的統一接口。