Microsoft 365 代理评测器
为 Microsoft 365 Copilot 声明式代理设计并运行评测套件
技能明确要求不打印或提交密钥、敏感提示词、检索内容和原始结果,并要求在真实租户评估前获得用户批准;但强制使用 npx @latest,未充分说明依赖供应链、数据流、外部服务权限和运行后的回滚方案,因此扣分。
工作流、环境检测、版本检查、重试边界和常见故障诊断较完整,且区分认证、模型、代理和架构错误;但 CLI 使用 preview/@latest,平台要求 Windows-first,未提供该技能关键路径的可执行复现证据,静态评估不超过10分,因此扣分。
目标用户、评估场景、ATK 与非 ATK 路径、触发短语和非 ATK 参数较清晰;但中文支持未说明,Windows、Microsoft 365 Copilot、租户同意及 Azure OpenAI 依赖限制了环境适配,并可能受中国大陆网络可达性影响,因此扣分。
采用主文档、references、examples 的渐进式结构,包含安装命令、参数示例、限制提示、秘密文件约定,仓库提供 MIT 许可和官方来源;但缺少技能自身的版本、变更记录、明确维护责任人与更新路径,因此扣分。
能够直接指导创建数据集、运行评估和分析失败,提供 schema 1.2.0 模板及常用命令,核心任务价值明确;但依赖真实租户、许可证、管理员同意和 Azure 配置,且静态阅读无法验证结果可用性,因此按静态上限保守扣分。
主文档、参考资料、示例和仓库级 CI/测试提供一定可审计材料;但提供的 CI 与测试主要覆盖通用 harness,并未证明该技能关键 CLI 流程已被独立复现,缺少多来源运行结果,因此扣分。
- 该技能依赖 Microsoft 365 Copilot、WorkIQ 管理员同意、Azure OpenAI 和 Windows-first 认证流程;在中国大陆网络或非 Windows 环境中应先确认可达性与认证支持。
- 强制使用 npx --package ...@latest 会引入版本漂移和供应链审查需求。
- 未执行 CLI 或真实租户评估;分数仅基于静态文件证据。
它能做什么 & 适用场景
这是一个用于评估 Microsoft 365 Copilot 声明式代理的 Agent Skill。它围绕公开的 @microsoft/m365-copilot-eval CLI,帮助用户创建符合 schema 1.2.0 的评测数据集、运行评测并分析结果。它优先识别 Microsoft 365 Agents Toolkit 项目,也支持通过 M365_AGENT_ID 或命令行参数评估已部署代理。使用它需要 Microsoft 365、租户授权、Azure OpenAI 配置和已部署的代理。
识别用户是在配置环境、编写数据集、运行评测、分析结果还是更新评测套件;检查项目文件和环境变量配置但不暴露机密;生成 evals\evals.json;使用 npx -y --package @microsoft/m365-copilot-eval@latest runevals 运行批量、快速或交互式评测;输出 JSON、HTML 或 CSV 结果;根据 relevance、coherence、groundedness、similarity、citations、exactMatch 和 partialMatch 等现有评分键归类失败原因并提出针对性修复建议。
- Microsoft 365 Copilot 声明式代理开发者需要首次创建评测数据集时。
- 团队已经有 evals\evals.json,需要批量运行评测并保存 JSON、HTML 或 CSV 结果时。
- 代理回答质量不稳定,需要区分指令、知识 grounding、引用、认证环境或期望答案问题时。
- 测试人员需要加入单轮或多轮提示,并调整公开评测器阈值时。
- 非 Agents Toolkit 项目需要使用 M365_AGENT_ID 或命名环境评估已部署代理时。
优缺点一览
- 覆盖数据集创建、CLI 运行、结果分析和定向修复建议的完整流程。
- 明确要求使用公开的最新 @microsoft/m365-copilot-eval CLI。
- 支持 Agents Toolkit 项目、显式代理 ID 和命名环境。
- 规定 schema 1.2.0、公开评测器名称、输出格式和敏感数据处理规则。
- 依赖 Microsoft 365 Copilot、已部署代理、WorkIQ 租户管理员同意和 Azure OpenAI 配置。
- SKILL.md 未提供真实租户评测的测试结果或平台覆盖证明。
- 只描述 Microsoft 365 Copilot 声明式代理评测,不应推断为通用代理测试工具。
- 评测 CLI 处于公开预览相关流程中,且仓库整体仍在积极开发。
如何安装
在目标项目中运行 npx skills add microsoft/skills,并在向导中选择该技能。手动安装时,可将 .github/plugins/microsoft-365-agents-toolkit/skills/m365-agent-evaluator/ 复制到所用 Agent Skills 目录;来源仅明确说明集合可安装到所选代理目录,例如 GitHub Copilot 使用 .github/skills/。README 未提供该单个技能的专用安装命令。
如何使用
向代理输入“evaluate my agent”“create eval prompts”“add multi-turn tests”或“why is my agent failing”等请求。运行评测时使用 npx -y --package @microsoft/m365-copilot-eval@latest runevals --prompts-file evals\evals.json --output .evals\results.json;快速检查可使用 npx -y --package @microsoft/m365-copilot-eval@latest runevals --prompts "What can you help me with?" --expected "The agent describes its supported scope."。并发值限制为 1-5,建议先使用 1。
对比同类
相较于旧的私有 aka.ms 安装器、全局安装、裸运行 runevals 或裸 npx runevals,本技能要求使用 npx -y --package @microsoft/m365-copilot-eval@latest runevals;它还明确避免使用旧的 --input 和 --html 参数。