
例如某工业设备企业场景中销售团队配了一个查参数的智能体。销售问这个型号的额定功率是多少智能体报出了一个数字还煞有介事地标了出处等销售拿去和产品手册一对发现手册上根本没有这个数。更麻烦的是另一次销售问设备A和设备B的接口能不能通用智能体把A的参数和B的规格拼在一起给出了一个可以的结论差点误导了一笔订单。这类问题有个统称叫幻觉。它最危险的地方不在于答错而在于答错时语气笃定、结构完整用户光看文字根本分不出真假。智能体越是被训练得表达流畅编造出来的内容就越像真的。一个普遍的误判是以为上了检索增强生成RAG幻觉就自然消失了。接入RAG并不等于消除幻觉即使模型拿到了检索证据生成内容仍可能出现证据不支持、引用错配或额外补充。模型完全可能在检索结果之外用自己的参数化知识补一段并不存在的内容再把来源标签一并伪造上去。另一个误判是把幻觉当成换个模型就能解决的模型问题。幻觉的根子不全在模型也在生成链路缺校验。加入证据绑定、事实校验和拒答机制可以进一步降低无依据生成进入业务流程的风险。指望靠模型自己自觉是一种不太现实的预期。幻觉之所以难根治拆开看有几个来源。一类是生成阶段没有证据锚定。模型在回答时是自由生成的检索到的片段只是参考没有强制约束没在片段里出现的数字就不能说。一旦问题超出片段的覆盖范围模型就会用训练时记住的、可能与事实不符的内容来填空。另一类是跨片段拼接没有做一致性校验。企业知识库里的信息是分散的一个产品的功率在A文档接口规格在B文档适用条件在C文档。模型为了回答一个综合问题会把多个片段的字段拼在一起却没有人检查这些字段是不是属于同一个对象、同一个版本。拼出来的结果单看每个数字都有出处合起来却是一个不存在的组合。还有一类是高风险事实缺少二次核验。金额、条款、参数、截止日期这类信息答错一个都会造成实际损失但很多系统对它们和对普通闲聊一视同仁不给任何额外校验或拒答兜底。低风险的模糊可以放过高风险的事实必须另设一道闸。针对这些来源一种实现方式是在生成链路上加三道校验。一道是证据锚定。回答中的每个关键事实尤其是数字和专有名词都要能回溯到某条检索片段。对于参数、金额、条款这类关键事实优先绑定具体的来源片段或权威业务数据源而不是只判断知识库里好像出现过。片段里没有的硬事实模型不被允许自行补出确实无法锚定的就明确标注未找到依据而不是编一个上去。另一道是跨片段一致性校验。当回答由多个片段拼合而成时要校验拼进来的字段是否属于同一对象、同一版本是否存在互相矛盾。发现矛盾时要么回到检索阶段重新取更完整、更权威的片段要么降级为信息不完整无法给出确定结论。还有一道是高风险事实二次核验。对金额、条款、参数、日期这类信息用确定性规则或权威数据源再对一遍对不上的先重新检索或查询权威数据源仍无法确认时高风险场景拒答、降级或转人工。低风险的信息可以宽容高风险的必须从严这道闸不能因噎废食地一刀切也不能因为怕麻烦而省略。本文基于青山不语AI工作室在部分企业AI应用定制项目方案中的实践将这套处理框架概括为事实性校验与证据绑定机制。它要解决的不是让模型变聪明而是让模型说出口的每句硬话都能被追到一条站得住的依据上。这套校验也有它够不到的边界。事实对不对最终要依赖知识库本身的质量和时效。知识库里本来就写错了的参数校验链路只会忠实地把它当成有依据的内容放过去。所以知识库的准确性、时效性仍需要企业内部的业务负责人持续负责服务方能做的是把哪里缺依据、哪里对不上暴露出来而不是替企业判断业务上的对错。从企业AI应用的实际风险来看企业评估AI应用定制服务时不妨问一句对方在生成链路里有没有对事实做锚定和校验还是只负责把模型调通。我的判断是智能体的价值不在于它多能说而在于它说的东西能不能被相信。把事实校验补上比单纯追求回答的流畅和全面更能保护使用它的那批人和那批生意。