在给跟进工作流设计评测样本时,我专门放进了一类危险输入:通话里没有明确预算,但上下文足以诱导模型「顺手补全」一个看似合理的数字。
一个编造出来的预算往往语气自然、格式正确,甚至比真实信息更像一条合格的 CRM 记录。用户不会因为模型前九次答对,就原谅第十次把不存在的承诺写进客户档案。
第一层是生成约束。事实字段必须能在输入文本中找到依据;没有依据就留空或标记「待确认」,不能为了完整而补全。
第二层是结果校验。JSON Schema 只能保证输出结构正确,不能证明事实正确。金额、日期、人物与承诺等高风险字段必须附带原文片段。
第三层是交互与权限。AI 输出首先是一份草稿,用户确认后才变成正式记录。系统需要保留修改前后差异、确认人与操作时间。
当前阶段性评测中,无依据内容率由早期约 25% 降至约 8%,直接确认率由约 30% 提升至 50% 以上。可靠不是一个版本的属性,而是一套持续运行的机制。