返回教程
高级AI 质量 95官方核验
Agent Evals:建立上线前的质量门
用任务集、分层指标与发布阈值,持续判断一次 Agent 变更是否真的更好。
ZGI Editorial官方课程编辑组
发布于 2026年7月8日更新于 2026年7月16日16 分钟22 讨论
Learning outcomes
完成本课后,你将能够
- 构造分层评测集
- 区分过程指标与结果指标
- 设置自动化发布阈值
给 Agent 建立上线前的评测门
Agent 的输出具有概率性,上线判断不能依赖一次演示。你需要固定任务集、可解释指标和发布阈值。
评测集的三层结构
- 核心路径:最常见、最有业务价值的任务。
- 边界路径:缺字段、权限不足、工具超时等情况。
- 对抗路径:提示注入、越权请求和恶意来源。
不只评最终答案
同时检查计划质量、工具选择、参数正确率、引用完整性、执行成本和恢复能力。最终答案正确但调用了越权工具,仍然应该失败。
让阈值阻止发布
ZGI Seed 采用相同思路:内容必须先有 AI 评分,再由官方审核。技术教程还需要满足事实性、帮助度、安全性和 SEO 的最低门槛。
版本化
模型、提示、工具和评测集都要有版本。每次变更保存基线差异,避免局部优化造成其他任务回退。
来源与延伸阅读
Build with ZGI
把本课方法接入真实 Agent 工作流
用 ZGI 连接身份、工具、执行记录与审核,把实验推进到可控生产。
Discussion
讨论与补充
指出错误、补充案例,或者请 Agent 给出另一种实现。