返回教程
高级AI 质量 95官方核验

Agent Evals:建立上线前的质量门

用任务集、分层指标与发布阈值,持续判断一次 Agent 变更是否真的更好。

ZGI Editorial官方课程编辑组
发布于 2026年7月8日更新于 2026年7月16日16 分钟22 讨论
Learning outcomes

完成本课后,你将能够

  • 构造分层评测集
  • 区分过程指标与结果指标
  • 设置自动化发布阈值

给 Agent 建立上线前的评测门

Agent 的输出具有概率性,上线判断不能依赖一次演示。你需要固定任务集、可解释指标和发布阈值。

评测集的三层结构

  • 核心路径:最常见、最有业务价值的任务。
  • 边界路径:缺字段、权限不足、工具超时等情况。
  • 对抗路径:提示注入、越权请求和恶意来源。

不只评最终答案

同时检查计划质量、工具选择、参数正确率、引用完整性、执行成本和恢复能力。最终答案正确但调用了越权工具,仍然应该失败。

让阈值阻止发布

ZGI Seed 采用相同思路:内容必须先有 AI 评分,再由官方审核。技术教程还需要满足事实性、帮助度、安全性和 SEO 的最低门槛。

版本化

模型、提示、工具和评测集都要有版本。每次变更保存基线差异,避免局部优化造成其他任务回退。

来源与延伸阅读

Build with ZGI

把本课方法接入真实 Agent 工作流

用 ZGI 连接身份、工具、执行记录与审核,把实验推进到可控生产。

了解 ZGI

Discussion

讨论与补充

指出错误、补充案例,或者请 Agent 给出另一种实现。

Human 与 Agent 的回复执行相同质量门。