從幻覺爭論到可靠性工程
前沿 AI 風險敘事的轉移
版本: v0.1
日期: 2026-07-26
研究場域: EveMissLab 實驗站
研究發起與核心命題: Neo.K
協作整理: EveMissLab AI
摘要
「AI 會產生幻覺」曾經是大眾理解生成式 AI 風險的主要入口。它概括了模型虛構人物、錯誤引用、捏造數據、混淆事件與以自信語氣陳述錯誤內容等問題。這一概念至今仍然有效,但已不足以描述前沿 AI 系統的完整風險結構。
2025 至 2026 年間,多家前沿模型供應者公布的評估顯示,模型在事實性、聯網查證、拒絕猜測與高風險問題上的錯誤率持續下降。OpenAI 報告 GPT-5、GPT-5.3、GPT-5.5 與 GPT-5.6 在不同事實性測試中相對前代有所改善;Anthropic 亦報告 Claude Sonnet 5 的幻覺與迎合行為低於 Sonnet 4.6。然而,這些改善並不等於幻覺消失,也不能直接轉換成一個適用所有任務的通用錯誤率。供應者評估常使用特定測試集、困難案例或使用者回報樣本,且模型輸出越長、陳述越多,整篇回答出現至少一項錯誤的機率仍可能保持不低。
更重要的是,AI 正從回答問題的模型轉向能夠調用工具、修改資料、執行程式、維持狀態與採取現實行動的 Agent。當 AI 只能生成文字時,幻覺主要造成錯誤資訊;當 AI 能夠行動時,同一個錯誤可能轉化為錯誤檔案修改、權限濫用、任務漂移、錯誤付款、資料刪除、記憶污染與不可逆後果。因此,業界風險敘事正在從單一的「幻覺問題」轉向包含 factuality、grounding、calibration、abstention、tool reliability、state consistency、observability、authorization、reversibility 與 accountability 的可靠性工程。
本文提出一個分層可靠性框架,並主張:幻覺不是被淘汰的舊問題,而是從總括性風險概念降為系統可靠性中的一個子類。AI 時代真正的問題不再只是「它說的是不是真的」,而是「它依據什麼、是否知道自己不知道、是否正確使用工具、是否維持任務狀態、是否被允許執行這項行動,以及出錯後能否停止、追蹤與恢復」。
關鍵詞: AI 幻覺、可靠性工程、grounding、Agent、工具可靠性、狀態一致性、權限、可逆性、AI 治理
一、前言:為什麼「幻覺」曾經主導 AI 風險討論?
大型語言模型的輸出具有高度流暢性。它可以用與正確答案相似的語氣,生成不存在的論文、錯誤的日期、虛構的法律條文或不真實的產品功能。
這種現象使早期使用者面臨一個強烈的不對稱:
其中:
- :語言表面的流暢與完整;
- :事實層面的可靠程度。
由於人類常以語氣、結構與細節豐富度判斷可信度,模型的流暢性會放大錯誤的說服力。
因此,「幻覺」成為非常有效的大眾警告:
AI 產生的內容即使看起來合理,也不一定是真的。
NIST 在生成式 AI 風險管理框架中使用「confabulation」描述生成式系統自信呈現錯誤或虛構內容的現象,並把它放在有效性、可靠性、安全、可解釋性與偏誤管理等更廣泛的可信任 AI 特徵中。[1]
這表示,即使在早期制度文件中,幻覺也從來不是唯一風險,只是最容易被一般人感知與傳播的風險。
二、幻覺是否真的下降?
2.1 公開評估呈現明確改善方向
OpenAI 在 GPT-5 系統卡中報告,GPT-5 主模型的逐項事實錯誤率比 GPT-4o 低約 26%。[2]
後續模型仍持續改善:
- GPT-5.3 Instant 相較前代,在高風險評估中,有聯網時幻覺率降低 26.8%,只依賴內部知識時降低 19.7%;在使用者回報案例中,有聯網與無聯網情境也分別有所下降。[3]
- GPT-5.5 Instant 在醫療、法律與金融等高風險提示中,相較 GPT-5.3 Instant 產生的幻覺陳述減少 52.5%;在使用者曾標記有事實錯誤的困難對話中,不正確陳述減少 37.3%。[4]
- GPT-5.6 的公開系統資料指出,其事實錯誤略低於 GPT-5.5,重新產生過去使用者回報幻覺的機率則顯著降低。[5]
- Anthropic 對 Claude Sonnet 5 的公開說明也指出,其幻覺與迎合行為低於 Sonnet 4.6。[6]
由此可以合理得出:
其中 表示前沿模型在可比較測試中的顯性事實幻覺。
也就是說,改善方向是真的,而不只是使用者心理感覺。
2.2 但沒有一個通用的「AI 幻覺率」
上述數字不能被直接理解成:
某模型在所有日常回答中有固定的 幻覺率。
原因包括:
- 不同評估使用不同任務;
- 有些測試刻意挑選最容易出錯的案例;
- 有些以單一事實陳述為單位;
- 有些以整篇回答是否至少有一項錯誤為單位;
- 有些允許聯網或工具;
- 有些只依賴模型內部知識;
- 模型可能因回答更長而產生更多可被判定的事實陳述;
- 供應者評估不一定完整代表真實生產流量。
OpenAI 對 GPT-5.5 的事實性評估特別說明,使用者曾回報的案例是刻意選取的高難度樣本,並不代表全部實際流量。[7]
因此,更精確的表述是:
以及:
若一篇長文包含 個相對獨立的事實陳述,每項正確率為 ,則全部正確的理想化機率為:
即使 很高,隨著 增加,整篇完全無錯的機率仍會下降。
三、為什麼「幻覺討論減少」難以直接證明?
大眾與產業對某個詞的討論量,可以透過搜尋趨勢、新聞資料庫、研究論文與企業報告計算。但若沒有建立一致的語料與時間序列,就不能嚴格宣稱全球對「hallucination」的討論已下降。
更可能發生的現象是詞彙拆分。
過去很多問題都被統稱為幻覺:
- 錯誤事實;
- 錯誤引用;
- 過度自信;
- 忘記上下文;
- 假裝執行工具;
- 宣稱完成任務;
- 迎合錯誤前提;
- 錯誤解讀搜尋結果;
- Agent 偏離目標。
現在這些問題逐漸被分別命名與評估。
因此,即使「幻覺」一詞的相對熱度降低,也不表示可靠性問題受到較少關注。它可能表示:
這是一種風險討論的成熟化,而非風險消失。
四、從幻覺到事實性工程
「幻覺」通常描述結果錯誤,但事實性工程需要進一步問:
- 錯誤陳述是什麼?
- 它依據哪個來源?
- 來源是否存在?
- 來源是否支持這個結論?
- 模型是否應該知道自己不確定?
- 在證據不足時,它是否願意停止?
本文將事實性可靠度表示為:
其中:
- :factual accuracy,事實正確性;
- :grounding,與可驗證來源的接地程度;
- :calibration,不確定性是否與真實錯誤率相符;
- :abstention,證據不足時是否願意不回答。
一個答案可能事實上正確,但來源錯誤;也可能來源真實,卻不能支持模型的結論。
因此:
可靠性工程不能只看最終答案,還需要檢查證據鏈。
五、Grounding:從「模型記得什麼」到「回答依據什麼」
Grounding 是把模型輸出連接到特定、可驗證資料來源的過程。Google Cloud 將其定義為使模型回答連接到可驗證資訊來源,並指出 grounding 能改善輸出的準確性、可靠性與實用性。[8]
可表示為:
其中:
- :問題;
- :指定知識來源;
- :模型;
- :輸出。
沒有 grounding 時:
模型主要依賴預訓練中的參數知識。
有 grounding 時:
其中:
- :搜尋或資料庫取回內容;
- :使用者提供文件與上下文。
但 grounding 也不能被誤解成自動正確。
可能失敗的地方包括:
- 取回了錯誤文件;
- 來源已過時;
- 搜尋排序不佳;
- 模型誤讀來源;
- 引用只支持部分陳述;
- 多來源互相矛盾;
- 模型在來源之外自行補充。
因此,Google 也提供 grounding check 類型的工具,將回答拆成陳述並判斷它與指定事實的一致程度。[9]
這顯示業界關注已從「有沒有搜尋」進一步轉向:
搜尋結果是否真的支持最終回答?
六、Calibration 與 Abstention:AI 是否知道自己不知道?
幻覺的重要來源之一,是模型在不知道時仍被獎勵產生答案。
OpenAI 對語言模型幻覺原因的研究指出,傳統評估若只獎勵猜中、而不充分獎勵承認不確定,會鼓勵模型猜測。[10] OpenAI Model Spec 也要求模型在重要不確定情況下表達不確定,而不是自信提供可能錯誤的資訊。[11]
可以把理想校準表示為:
其中 是模型宣稱的信心水準。
若模型對一個答案表示 80% 信心,長期而言,這類答案應約有 80% 正確。
實際模型未必能直接提供完美校準的概率,但至少可以使用語義層級:
- 確定;
- 高度可能;
- 有爭議;
- 缺乏資料;
- 無法確認。
Abstention 則表示模型在某些情境選擇:
而不是生成一個看似完整的猜測。
Anthropic 在 Agent 評估實務中也建議,為模型提供「Unknown」等退出選項,以降低在證據不足時產生幻覺。[12]
因此,可靠模型不是永遠回答的模型,而是能正確判斷何時不應回答的模型。
七、迎合不是幻覺,但可能使錯誤更加穩固
使用者本身可能提供錯誤前提。
例如:
某個不存在的研究已經證明了這項理論,請幫我整理。
若模型直接接受前提並補充內容,問題可能同時包含:
- 事實幻覺;
- sycophancy,迎合;
- 前提繼承;
- 缺乏反駁;
- 不當補全。
因此:
可靠性不只取決於模型,也取決於使用者前提與上下文。
這解釋了「用戶如果沒有幻覺」這句帶有玩笑性的觀察為何重要:當使用者提供良好資訊、允許 AI 反駁、接受查證與修正時,整體輸出風險會降低。
反過來說,能力更強的模型也可能把錯誤前提組織得更完整。因此,業界開始將迎合、偏差承諾與錯誤前提接受從一般幻覺中獨立評估。Anthropic 甚至研究以 persona vectors 監控 hallucination 與 sycophancy 等行為傾向。[13]
八、Agent 使風險從語義層進入行動層
當模型只輸出文字時,主要風險是:
當 Agent 可以使用工具時,錯誤可能轉換為:
其中:
- :Agent 可執行能力;
- :錯誤影響範圍。
例如:
- 錯誤理解檔案要求,導致大量檔案被改寫;
- 誤判收件人,寄出錯誤郵件;
- 錯誤使用權限,讀取不該存取的資料;
- 誤解測試結果,將失敗版本部署;
- 錯誤保存記憶,使後續任務持續受到污染。
Microsoft 對自主 Agent 的安全說明指出,Agent 從生成內容進入調用工具、修改資料與觸發工作流後,錯誤會傳播得更快、影響範圍更大,回滾也更困難。[14]
因此,Agent 時代的核心問題已不只是:
它說錯了什麼?
而是:
它因為相信錯誤內容,實際做了什麼?
九、工具可靠性:模型正確也可能做錯
Agent 任務的成功依賴多個部分:
其中:
- :模型判斷正確率;
- :工具本身可靠度;
- :執行環境可靠度;
- :狀態維持可靠度。
即使模型判斷正確,工具也可能:
- API 失敗;
- 權限不足;
- 格式改變;
- 網路中斷;
- 回傳資料不完整;
- 依賴套件衝突;
- 暫存狀態遺失。
Anthropic 對 Agent 評估的工程說明特別強調,Agent 會跨多輪調用工具、修改環境並依中間結果調整,單輪問答評估無法捕捉這些失敗。[15]
Anthropic 另有研究指出,Agent 基準甚至會受到基礎設施資源與暫時性環境波動影響;增加資源有時只是修復環境噪音,有時卻會直接改變 Agent 能解決的任務範圍。[16]
因此,Agent 可靠性不能被簡化成模型排行榜。
十、狀態一致性:長程工作中的新型錯誤
長程 Agent 任務要求系統維持:
- 使用者目標;
- 已完成步驟;
- 尚未完成項目;
- 檔案版本;
- 權限;
- 中間假設;
- 錯誤與修正紀錄。
令任務狀態為:
理想更新為:
其中:
- :第 步行動;
- :環境回傳;
- :狀態更新函數。
若狀態更新錯誤,可能產生:
- 重複工作;
- 忘記限制;
- 誤以為已完成;
- 覆蓋正確版本;
- 在錯誤假設上繼續推進;
- 任務目標漂移。
這些問題不一定屬於傳統事實幻覺,但會造成同樣甚至更大的實際失敗。
因此,Agent 評估必須檢查:
- 是否真正完成;
- 是否保留正確狀態;
- 是否在中間步驟偏離;
- 是否誠實報告失敗;
- 是否能恢復。
十一、Observability:可靠性必須能被看見
若 Agent 只回傳一句:
已完成。
人類無法判斷:
- 它做了哪些步驟;
- 使用了哪些來源;
- 修改了哪些檔案;
- 是否執行測試;
- 是否遇到失敗;
- 是否跳過某些要求。
因此,可靠性需要可觀測性:
其中:
- :日誌;
- :變更差異;
- :工具調用;
- :完成證據;
- :當前狀態。
可觀測性不能保證 Agent 正確,但能使錯誤可發現、可定位與可追溯。
這也是業界從模型能力轉向 evals、tracing、audit logs、completion evidence 與 runtime monitoring 的原因。
十二、權限:它能做,不代表應該被允許做
Agent 的安全問題可以表示為兩個不同問題:
以及:
能力與授權不能混為一談。
Microsoft 目前將 Agent 最小權限描述為設計要求:在擴大自主性前,必須明確定義 Agent 身分、範圍、工具存取與可稽核性。[17] 其 Agent 治理資料亦建議建立註冊、批准、到期、停用與責任人制度。[18]
因此:
一個 Agent 即使能夠:
- 刪除資料;
- 發送郵件;
- 修改正式環境;
- 進行交易;
也不代表它應被永久授予這些權限。
十三、可逆性:出錯後能否恢復?
幻覺時代的主要修復方式是:
刪除錯誤回答,重新生成。
Agent 行動則可能無法如此簡單。
令行動不可逆性為:
其中:
- :完全可撤銷;
- :完全不可逆。
審查強度應隨不可逆性增加:
可逆性工程包括:
- 沙盒;
- dry run;
- 版本控制;
- 備份;
- 交易確認;
- 回滾;
- 暫存而非立即發布;
- 權限到期;
- 兩階段提交。
可靠 Agent 並不是永遠不犯錯,而是錯誤不會立即擴大成無法恢復的事故。
十四、可靠性層級模型
本文提出六層可靠性框架:
R0:語言流暢性
輸出可讀、連貫、符合格式。
R1:事實可靠性
核心事實與數據正確。
R2:證據可靠性
來源真實,且能支持相關陳述。
R3:工具與執行可靠性
Agent 正確使用工具,並取得真實環境結果。
R4:狀態與任務可靠性
Agent 能維持目標、限制、版本與進度一致。
R5:行動與治理可靠性
Agent 在正確權限內行動,具備可觀測性、可逆性與責任鏈。
可以表示為:
採用乘法,是因為任何一層接近零,都可能使整體系統失效。
例如:
- 文字流暢、事實錯誤;
- 事實正確、引用錯配;
- 推理正確、工具失敗;
- 工具成功、狀態漂移;
- 任務完成、但越權;
- 行動正確、卻無法稽核。
十五、從模型評估到系統評估
傳統模型評估常測量:
- 問答正確率;
- 推理題;
- 程式題;
- 知識題;
- 偏好評分。
Agent 系統則需要測量:
- 任務是否完成;
- 工具是否正確;
- 是否維持狀態;
- 是否遵守權限;
- 是否誠實回報;
- 是否能從失敗恢復;
- 是否造成副作用;
- 是否產生可驗證證據。
Stanford 2026 AI Index 指出,AI Agent 在 OSWorld 等真實電腦任務基準上已從約 12% 躍升至約 66%,但仍約有三分之一的結構化嘗試失敗。[19]
同一份報告也提醒,常用基準本身存在錯題、污染、平台適應與可靠性問題,部分評估中的無效題比例可非常高。[20]
因此,業界逐漸從:
哪個模型排行榜最高?
轉向:
哪個系統在我的真實工作流中可靠?
十六、可靠性工程的完整結構
本文將 AI 系統可靠性表示為:
其中:
- :factuality;
- :grounding;
- :calibration;
- :abstention;
- :tool reliability;
- :state consistency;
- :observability;
- :permissions;
- :reversibility;
- :accountability。
幻覺主要屬於 、 、 與 。
Agent 化則使 、 、 、 、 與 變得同樣重要。
因此:
十七、業界現在真正專注什麼?
從近期公開文件可觀察到幾個明顯方向。
17.1 更細的事實性評估
不再只測「答案對不對」,而是區分:
- 高風險領域;
- 使用者回報案例;
- 聯網與未聯網;
- 單一陳述與整篇回答;
- 重大與輕微錯誤。
17.2 Grounding 與企業資料
讓模型依據企業文件、搜尋結果與指定資料回答,並檢查引用支持程度。
17.3 Agent evals
評估多輪工具調用、環境修改、狀態持續與任務完成,而不只單輪回答。
17.4 權限與身分
為 Agent 建立獨立身分、最小權限、生命週期、到期與撤銷制度。
17.5 可觀測性
保存工具軌跡、差異、日誌、測試與完成證據。
17.6 安全執行環境
透過沙盒、隔離、權限綁定與防禦縱深降低錯誤影響範圍。
17.7 評估本身的可靠性
檢查 benchmark 是否正確、是否受污染、是否測到真正想測的能力。
所以,業界並非不再關心幻覺,而是把幻覺放回更大的系統工程中。
十八、公眾為何仍停留在「AI 會幻覺」?
有些人仍主要把 AI 理解為:
- 高級搜尋器;
- 文字接龍;
- 容易亂講的聊天機器人。
這可能來自:
- 使用的是較舊或較弱模型;
- 只使用免費問答介面;
- 沒有開啟聯網與工具;
- 沒有提供足夠上下文;
- 曾在關鍵問題中遇到錯誤;
- 沒有接觸 Agent 工作流;
- 對 AI 的理解主要來自早期媒體敘事。
這些看法並非完全錯誤。語言模型的統計生成機制、事實錯誤與不穩定性仍然存在。
問題在於,它們使用一個真實但局部的風險,概括整個新型 AI 系統。
更完整的說法應是:
AI 仍可能產生幻覺,但前沿 AI 的能力與風險早已超出「高級搜尋器是否會亂講」的範圍。
十九、使用者也開始進行風險分類
成熟使用者不會對所有任務採取相同信任程度。
低風險
- 創意草稿;
- 改寫;
- 格式;
- 腦力激盪。
主要檢查意圖與品質。
中風險
- 研究整理;
- 理論草稿;
- 程式碼;
- 文件整合。
檢查結構、測試與核心命題。
高風險
- 數據;
- 引用;
- 法律;
- 醫療;
- 金融;
- 正式部署;
- 不可逆行動。
要求來源、專業審查、權限與回滾。
這表示使用者信任正在由:
轉向:
二十、可檢驗假說
假說一:前沿模型的顯性事實錯誤持續下降
在相同測試集與工具條件下,新一代前沿模型的逐項事實錯誤率低於前代。
假說二:長文錯誤改善慢於單項陳述
即使單一陳述正確率明顯提高,長篇回答至少包含一項錯誤的比例下降幅度較小。
假說三:聯網降低部分幻覺,但增加來源解讀錯誤
聯網能降低知識過時與無依據猜測,但可能增加錯誤取回、來源錯配與引用誤讀。
假說四:Agent 失敗主要逐漸移向非事實層
在成熟模型上,工具失敗、狀態漂移、權限與完成宣稱問題,占整體 Agent 失敗的比例將提高。
假說五:可逆性比單純模型正確率更能預測事故損害
即使兩個系統錯誤率相同,具有沙盒、回滾與最小權限者,實際事故損害較低。
假說六:熟練使用者較少使用「幻覺」概括全部問題
熟練使用者較可能區分 factuality、grounding、tool failure、state drift、sycophancy 與 permission error。
二十一、建議實驗
實驗 A:跨模型事實性比較
使用相同題目、相同聯網條件與相同回答長度,比較:
- 單項事實錯誤;
- 整篇至少一項錯誤;
- 不確定性表達;
- 拒絕猜測比例。
實驗 B:Grounding 支持度
提供固定來源,要求模型回答並引用。逐項標記:
- 引用存在;
- 引用相關;
- 引用完整支持;
- 模型是否超出來源。
實驗 C:Agent 失敗分類
讓 Agent 完成多步任務,將失敗分類為:
- 事實錯誤;
- 推理錯誤;
- 工具錯誤;
- 狀態錯誤;
- 權限錯誤;
- 假完成;
- 環境錯誤。
實驗 D:可逆性比較
讓兩個相同 Agent 分別在:
- 直接正式環境;
- 沙盒+差異+人工批准;
中執行任務,比較事故範圍與恢復成本。
實驗 E:使用者風險語彙
訪談不同經驗使用者,觀察其是否能區分不同 AI 失敗類型,並比較其實際審閱方式。
二十二、實驗站最小觀察方案
每次 AI 或 Agent 出錯時,不只記錄「幻覺」,而使用以下分類:
| 類型 | 說明 |
|---|---|
| F | 事實錯誤 |
| G | Grounding/引用錯配 |
| C | 過度自信或不確定性錯誤 |
| Y | 迎合錯誤前提 |
| T | 工具調用或環境失敗 |
| S | 狀態漂移或記憶錯誤 |
| P | 權限與授權錯誤 |
| O | 缺乏可觀測性或假完成 |
| R | 無法回滾或恢復 |
| Q | 責任與治理缺口 |
長期記錄後,可以觀察:
- 事實錯誤是否下降;
- 哪些問題成為主要失敗;
- 不同模型在哪個層級改善;
- 哪些錯誤最耗費修正時間;
- 哪些治理措施最有效。
二十三、限制與反例
23.1 供應者評估具有選擇性
模型公司公開的測試可能反映特定優勢,不能完全取代獨立評估。
23.2 「幻覺」定義不一致
不同研究對錯誤、重大錯誤、引用錯誤與不支持陳述的分類不同。
23.3 聯網不保證真實
網路本身包含錯誤、宣傳、過時與互相矛盾的資料。
23.4 Agent 化可能重新放大幻覺
模型即使較少說錯,也可能因一次錯誤採取更多行動。
23.5 分類過細可能增加治理成本
小型使用者未必需要完整企業級可靠性架構。
23.6 強調工程可能弱化認識論問題
即使系統有測試、權限與日誌,人類仍需判斷哪些資料與目標本身值得信任。
二十四、討論:幻覺是否會成為歷史問題?
短期內不會。
只要生成模型需要在不完整資訊下產生開放式答案,錯誤補全與不確定性就不可能完全消失。
但「幻覺」可能逐漸像軟體中的 bug:
- 不會消失;
- 但不再被視為否定整個技術的充分理由;
- 會被分類;
- 會被測試;
- 會有防護層;
- 會依風險決定容忍程度。
因此,未來大眾可能不再只問:
AI 有沒有幻覺?
而會問:
- 這個任務的錯誤率是多少?
- 有沒有來源?
- 它會不會承認不知道?
- 工具有沒有真的執行?
- 結果能不能驗證?
- 權限到哪裡?
- 出錯能不能撤銷?
- 誰負責?
當問題變成這些形式,幻覺討論並未消失,而是進入可靠性工程。
二十五、結論
前沿 AI 的顯性事實幻覺確實在下降。近期公開評估在不同模型、聯網條件與高風險案例中呈現一致改善方向。
但這不代表:
- 所有回答都可靠;
- 長文已經完全無錯;
- 聯網自動保證真實;
- Agent 可以無限制自主行動。
真正的時代變化是:
本文的核心命題是:
幻覺沒有消失,而是從總括 AI 風險的中心詞,轉化為可靠性工程中的一個子問題。
當 AI 只能說話時,人類主要擔心它說錯。
當 AI 可以工作時,人類必須進一步擔心:
- 它是否依據正確來源;
- 是否知道自己不知道;
- 是否正確使用工具;
- 是否維持任務狀態;
- 是否誠實報告完成;
- 是否在正確權限內;
- 是否能被停止與回滾;
- 是否有人能為結果負責。
因此,AI 業界的關注重點不是離開可靠性,而是從語言模型的單點錯誤,進入完整智能系統的可靠性治理。
參考資料
[1] NIST. Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile. 2024.
https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-generative-artificial-intelligence
[2] OpenAI. GPT-5 System Card. 2025.
https://cdn.openai.com/gpt-5-system-card.pdf
[3] OpenAI. “GPT-5.3 Instant: Smoother, more useful everyday conversations.” 2026-03-03.
https://openai.com/index/gpt-5-3-instant/
[4] OpenAI. “GPT-5.5 Instant: smarter, clearer, and more personalized.” 2026-05-05.
https://openai.com/index/gpt-5-5-instant/
[5] OpenAI. GPT-5.6 Preview System Card. 2026-06-26.
https://deploymentsafety.openai.com/gpt-5-6-preview
[6] Anthropic. “Introducing Claude Sonnet 5.” 2026-06-30.
https://www.anthropic.com/news/claude-sonnet-5
[7] OpenAI. GPT-5.5 System Card: Evaluations with Challenging Prompts. 2026-04-23.
https://deploymentsafety.openai.com/gpt-5-5/evaluations-with-challenging-prompts
[8] Google Cloud. “Generative AI glossary: Grounding.”
https://docs.cloud.google.com/docs/generative-ai/glossary
[9] Google Cloud. “Check grounding with RAG.”
https://cloud.google.com/generative-ai-app-builder/docs/check-grounding
[10] OpenAI. “Why language models hallucinate.” 2025.
https://openai.com/index/why-language-models-hallucinate/
[11] OpenAI. Model Spec.
https://model-spec.openai.com/2025-10-27.html
[12] Anthropic. “Demystifying evals for AI agents.” 2026-01-09.
https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents
[13] Anthropic. “Persona vectors: Monitoring and controlling character traits in language models.” 2025-08-01.
https://www.anthropic.com/research/persona-vectors
[14] Microsoft Security. “Defense in depth for autonomous AI agents.” 2026-05-14.
https://www.microsoft.com/en-us/security/blog/2026/05/14/defense-in-depth-autonomous-ai-agents/
[15] Anthropic. “Demystifying evals for AI agents.” 2026-01-09.
https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents
[16] Anthropic. “Quantifying infrastructure noise in agentic coding evals.” 2026.
https://www.anthropic.com/engineering/infrastructure-noise
[17] Microsoft Learn. “Least privilege for AI agents.” 2026-07-15.
https://learn.microsoft.com/en-us/security/zero-trust/sfi/least-privilege-for-ai-agents
[18] Microsoft Learn. “Reduce autonomous agentic AI risk.” 2026-03-19.
https://learn.microsoft.com/en-us/security/zero-trust/sfi/manage-agentic-risk
[19] Stanford HAI. The 2026 AI Index Report.
https://hai.stanford.edu/ai-index/2026-ai-index-report
[20] Stanford HAI. “Technical Performance: The 2026 AI Index Report.”
https://hai.stanford.edu/ai-index/2026-ai-index-report/technical-performance
系列位置
本文為「AI 耐心、認知階級與能力取得革命」系列第五篇。
- 《從「我不會」到「如何取得能力」:Agent 時代的可實作性預設》
- 《能力取得革命:Skill、GitHub 與 Agent 如何重構學習》
- 《風險分級審閱:當人類不再逐字閱讀 AI 產出》
- 《人類對 AI 的耐心分化:從閱讀耐心到委任耐心》
- 《從幻覺爭論到可靠性工程:前沿 AI 風險敘事的轉移》
- 《AI 認知生產階級:同一模型下的不平等擴張》
- 《AI 時代的能力、耐心與認知階級:從幻覺下降到智能生產分層》