2026年7月23日更新:ChatGPT Plus / Pro 与 Codex——AI 幻觉的工程化治理:从“它说得对不对“到“系统怎么不让它错“(GPT-5.6 最新技术分享)
每个认真用过 ChatGPT 的人都遇到过幻觉。它信誓旦旦地引用一篇不存在的论文。它调用一个从未存在过的 API。它给出一个看起来无比专业、实则完全编造的参数。最可怕的是它的语气和说真话时一模一样。关于幻觉常见的讨论停留在两个层面。一个是吐槽AI 又编东西了。一个是技巧怎么提问让它少编一点。但真正要把 AI 用进严肃业务这两个层面都不够。幻觉不是一个靠提示词技巧就能解决的问题。它是一个需要系统性治理的工程问题。先接受一个事实幻觉不会被消灭很多人对模型进化有一个期待GPT-5.6 幻觉比上一代少了。再进化几代幻觉是不是就没了大概率不会。原因在于幻觉的本质。大语言模型的核心机制是生成统计上合理的文本。它追求的是像真的不保证是真的。知识边界之外的问题它依然会流畅地回答。不知道的参数它会生成一个最像正确答案的参数。不确定的事实它用和确定事实完全相同的语气陈述。语气与置信度脱钩是幻觉最危险的特征。人类专家说我不确定时语气会变。AI 说错话时语气依然是满分自信。所以工程上必须承认幻觉是概率性系统的固有属性。它不能被消灭只能被管理。问题不是AI 会不会错。问题是系统能不能在 AI 错的时候兜住它。幻觉的分级不是所有错误都同样危险治理幻觉的第一步是把幻觉分级。HallucinationLevel ├── L1 无害型措辞偏差、次要细节不精确 │ └── 影响可读性下降无实质后果 ├── L2 误导型事实错误、数据编造、来源虚构 │ └── 影响使用者被误导做出错误判断 ├── L3 危险型错误代码、错误配置、错误操作指引 │ └── 影响系统故障、数据损坏、安全事故 └── L4 灾难型错误进入不可逆环节 └── 影响错误被放大执行无法撤回一篇读书笔记里有个别细节不精确L1无伤大雅。一份市场分析报告里编造了数据来源L2报告作废。AI 生成的数据库迁移脚本里有错误语句L3可能丢数据。错误的操作指令被 Agent 自动执行到生产环境L4事故。分级的意义在于不同级别的幻觉风险配得上不同强度的治理手段。对 L1 任务搞人工逐句校对是浪费。对 L4 任务只靠模型已经很准了是赌博。第一道防线让 AI 只说它有依据的话幻觉最常见的温床是让模型回答它不知道的事情。工程上的对策是把生成和依据绑定。检索先行的生成。不让模型凭记忆回答。先把相关资料检索出来摆在它面前要求它只基于这些资料生成。这就是 RAG 的核心思想——不是炫技是约束。强制标注来源。要求每一个关键事实后面跟着出处。出自哪份文档、哪个段落、哪个接口返回。没有出处的陈述要么标注为推测要么不允许输出。一个简单但极其有效的提示结构“只基于提供的资料回答。资料中没有的信息明确说’资料中未提及’禁止推测补全。”这一句能砍掉一大半的编造型幻觉。给模型留说不知道的出口。很多幻觉是被提问方式逼出来的。“这个 API 的参数是什么”——模型觉得必须给出一个答案。“这个 API 的参数是什么如果不确定请明确说明。”——模型被允许承认无知。允许无知才能获得诚实。第二道防线验证而不是信任即使有依据约束生成结果仍然需要验证。验证体系按成本从低到高分四层。格式与约束校验。生成的 JSON 能不能解析。生成的代码能不能编译。生成的参数是否在合法范围内。这一层完全自动化成本几乎为零能拦截最低级的错误。交叉验证。同一个问题换种问法再问一次。或者用另一个模型独立回答。两个独立生成的结果互相矛盾至少一个是错的触发人工介入。注意交叉验证不是多数投票。它发现的是分歧分歧本身就是风险信号。确定性工具验证。代码用测试验证不用看起来对验证。数据用查询验证不用模型记得验证。事实用权威来源验证不用语气肯定验证。AI 生成的内容必须能被 AI 之外的确定性系统裁决。人工抽查与关键复核。低价值任务按比例抽查。高风险任务百分之百人工复核。人力是最贵的验证资源只能花在风险最高的地方。第三道防线隔离幻觉的爆炸半径即使防线全部失守错误还是可能发生。最后一道保险是限制错误的扩散范围。AI 生成的代码先进沙箱不进主分支。AI 生成的配置先生效于测试环境不进生产。AI 生成的内容先标记为AI 初稿不直接对外发布。AI 的操作指令可回滚的自动执行不可逆的人工确认。原则只有一个让幻觉的代价停留在可承受的范围内。错误不可怕。错误不可逆地放大才可怕。置信度工程让系统知道这句话有多可信更进一步的治理是引入置信度的显式表达。Response ├── claim: 接口超时阈值默认 30 秒 │ └── confidence: high来源官方文档 v3.2 ├── claim: 该参数支持动态刷新 │ └── confidence: medium来源社区讨论未验证 └── claim: 兼容旧版本配置文件 └── confidence: low推测需测试确认使用者看到这段话时注意力自然分配高置信的直接用。中置信的验证后用。低置信的当线索不当结论。理想状态下AI 系统输出的每一句话都应该带着自己的可信等级。这是幻觉治理的成熟形态不是假装 AI 不会错。而是让系统诚实地标注哪里可能错。一个更深层的认知往深处想幻觉问题其实揭示了一个容易被忽略的事实人类对表达流畅有一种天然的信任。说得流畅的我们倾向于认为是对的。语气肯定的我们倾向于认为是懂的。这套启发式判断在人类社会大体有效。因为人类说谎有成本装懂有风险。但 AI 不一样。它生成流畅文本的边际成本是零。它说错话的心理成本也是零。所以我们必须重建一套信任机制不再根据说得多流畅来判断可信度。而是根据依据是否可查、结论是否可验证、错误是否可承受来构建信任。流畅是 AI 的默认配置。可信是系统的工程目标。写在最后ChatGPT 和 Codex 会越来越强幻觉率会越来越低。但只要生成式模型的底层机制不变幻觉就不会归零。所以严肃使用 AI 的团队迟早要建立自己的幻觉治理体系生成时有依据约束。交付前有多层验证。架构上有爆炸半径隔离。表达上有置信度标注。模型负责流畅。系统负责可信。未来优秀的开发者不只是能从 AI 那里拿到答案的人。而是能建立一整套机制、让答案值得被信任的人。幻觉是概率的代价。治理是工程的回答。