场景:退款拦截是否值得增加一次判断
“先查订单,未发货再退款”中,一个判断器即使拒绝了全部危险调用,也可能把所有正常退款一起拦住。应同时观察错误放行、正常调用受阻和额外等待时间,才能判断接管是否有价值。 退款防护对比用例提供 160 条合成数据、数据划分、标注理由、离线行为测试与 JEV/Qwen 实测记录,代码和结果集中在agentscope-examples/jev/benchmarks/tool-guard。它的命令行参数与下表通用基准不同,请按其 README 运行;功能文档末尾保留简明结果。
选择评估对象
- 判断层:工具适用性、分类、审核、路由标签、压缩建议是否符合金标。
- 执行层:拒绝是否真的阻止派发,允许是否恰好执行一次,结果是否与调用配对,取消后是否停止。
- 任务层:回答正确性、证据召回、关键事实保留、任务成功率与完整耗时。
固定输入与可运行入口
案例模块提供合成样本,适合学习数据格式和跑通对照管线。用于业务验收时,应补充真实业务分布的独立金标与难例。
这些程序回放固定判断输入,不运行完整生产任务。金标只用于判分,不发送给后端。原始数据位于
agentscope-examples/jev/src/test/resources/jev。
运行基线与同题对照
先按案例构建步骤设置JEV_CP。以轨迹评估为例:
--baseline;只有轨迹程序提供这里的 --offline 合成判断模式。输出路径必须不存在,避免覆盖上次报告。
真实后端必须显式启用,模型名和端点由你选择:
TYPESAFE_API_KEY,Qwen 使用 DASHSCOPE_API_KEY;QWEN_ENDPOINT 应为账号所在区域的兼容 Chat Completions 完整端点。其他方向按表替换程序名和数据路径,参数顺序相同。真实调用会产生接口用量,离线运行不读取密钥。