别把“试了两次挺好”当成验收

AI 工作流最危险的状态,不是完全答不出来,而是大部分时候像是对的,恰好在金额、日期、对象、否定条件或少见格式上出错。若只拿一两个顺手案例测试,很容易把偶然成功当成稳定能力;上线后,错误会在真实业务里被放大。对外内容、客服归类、资料摘要和表格分析尤其如此:语言流畅不等于遵守了业务口径。

先建一个最小测试集

起步不需要几百条样本。先收集 12 到 20 条已经由人工确认过的真实或脱敏案例,分成四类:典型样本验证日常质量;边界样本包含特别长、特别短、字段缺失或格式混乱的输入;反例样本故意放入容易混淆的相似概念、否定表述和旧版本规则;高风险样本对应可能影响客户、资金、隐私或合规的情况。测试集不是为了证明模型厉害,而是为了知道它会在哪儿失手。

每条样本要写清“不能错什么”

样本编号|输入摘要|预期输出|不可接受的错误|是否需要人工复核|实际结果|复核人|日期
T01|正常退款工单|标签为退款咨询|不得承诺退款金额|是|……|……|……

“预期输出”不要只写“回答正确”。应明确必须保留什么、不得编造什么、以何种格式返回。摘要任务可要求:必须列出原文例外条款;没有出现的日期写“未提及”;不能把建议写成已确认决定。分类任务要先定义标签边界;提取任务要规定字段缺失时返回空值还是“待确认”。

评分要拆开

一条输出至少按四项打分:事实是否正确、格式是否可用、是否遗漏关键条件、是否越权给出结论。不要用笼统的“好/不好”掩盖问题。对高风险任务,还要记录“即使答案看似正确,是否仍需要人工签字”。例如,AI 可以提示合同里有续约条款,却不能代表法务确认其效力;可以归纳退款原因,却不能自行承诺退款额度。

改一次提示词,就重跑一次旧样本

增加一句提示词、换模型、接入新资料库,都会改变输出。修改后重新跑同一组样本,尤其检查以前失败过的案例是否再次出现。微软的官方资料建议提示词在投入流程前先配置和测试,这与软件的回归测试逻辑一致。查看微软说明

失败样本不能删掉

先判断问题来自输入不完整、提示词边界不清、标签定义冲突,还是任务本身不适合自动化。能通过补充资料和格式约束解决的,更新 SOP 后重测;无法稳定控制的,就改为“AI 产出候选结果,人工决定”。失败样本应长期留在回归集中,而不是为了提高分数被删除。

什么时候必须停在人工环节

若错误直接影响价格、合同、医疗建议、人员评价、权益资格或对外承诺,就不应因为“准确率看着不错”而全自动放行。NIST 的生成式 AI 风险管理资料强调,治理、内容来源、部署前测试和事件披露应结合具体场景与风险承受度设计。查看 NIST 资料

验收的最终产出

最有价值的不是一个总分,而是明确:哪些任务可以自动完成,哪些只适合辅助,哪些必须转人工;常见错误来自输入、提示词、资料还是模型。把这些结论写入 SOP,并规定复测时间和负责人,AI 才是可管理的工作流,而不是随机的聊天窗口。

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。