JevEvaluator 将问题、证据和回答交给统一的 Judge 定义;JevEvaluationRunner 回放固定样本并按场景汇总。适合修改提示词、检索或生成模型后,对客服回复和知识答案做质量回归。
示例场景:改了客服提示词,检查退款承诺有没有变差
同样面对“退款了吗?”和“尚未执行退款”的业务记录,一条回答如实说明需核查,另一条却声称退款完成。我们希望使用同一套标准比较它们,而不是每次人工临时决定什么算好答案。 先定义“回答有业务证据支持”的标准,再把每条问题、证据、回答放进Evaluator.Request。预期通过或失败的金标只交给 runner,不发送给评审模型。
1. 复用草稿评审定义
client 配置见客户端接入。定义与单条 Judge 用法相同,问题、证据和回答分别映射到 user_question、supporting_context、assistant_answer。
2. 构造一正一反的固定样本
honest、invented 是唯一 ID;“退款承诺”是报告中的场景分组;最后的布尔值是预期标签。并发 2 表示最多同时评审两条,实际返回顺序仍与输入一致。不要把错误回答的标签写进证据中。
3. 一起看正确、弃权和错误
pass() 只在 Judge 总状态 PASS 时为 true;score() 是通过条件占比,不能替代完整 verdict。
例如不实回答得到 FAIL 算一次正确判断;如果接口超时,即使 pass=false,也不算“正确识别了不实回答”。
运行与验证
按案例构建步骤设置JEV_CP 后执行: