开发与工程 ✓ Microsoft · 官方 microsoft-365copilotevaluationeval-datasetscliazure-openaimulti-turn-testing

Microsoft 365 代理评测器

为 Microsoft 365 Copilot 声明式代理设计并运行评测套件

FollowSkills 评估 · FSRS-2.0
不推荐
54/ 100 五分制 2.7 / 5
信任安全18 / 25 · 3.6/5

技能明确要求不打印或提交密钥、敏感提示词、检索内容和原始结果,并要求在真实租户评估前获得用户批准;但强制使用 npx @latest,未充分说明依赖供应链、数据流、外部服务权限和运行后的回滚方案,因此扣分。

可靠稳定8 / 20 · 2.0/5

工作流、环境检测、版本检查、重试边界和常见故障诊断较完整,且区分认证、模型、代理和架构错误;但 CLI 使用 preview/@latest,平台要求 Windows-first,未提供该技能关键路径的可执行复现证据,静态评估不超过10分,因此扣分。

适用触发9 / 15 · 3.0/5

目标用户、评估场景、ATK 与非 ATK 路径、触发短语和非 ATK 参数较清晰;但中文支持未说明,Windows、Microsoft 365 Copilot、租户同意及 Azure OpenAI 依赖限制了环境适配,并可能受中国大陆网络可达性影响,因此扣分。

规范维护9 / 15 · 3.0/5

采用主文档、references、examples 的渐进式结构,包含安装命令、参数示例、限制提示、秘密文件约定,仓库提供 MIT 许可和官方来源;但缺少技能自身的版本、变更记录、明确维护责任人与更新路径,因此扣分。

有效结果6 / 15 · 2.0/5

能够直接指导创建数据集、运行评估和分析失败,提供 schema 1.2.0 模板及常用命令,核心任务价值明确;但依赖真实租户、许可证、管理员同意和 Azure 配置,且静态阅读无法验证结果可用性,因此按静态上限保守扣分。

证据核验4 / 10 · 2.0/5

主文档、参考资料、示例和仓库级 CI/测试提供一定可审计材料;但提供的 CI 与测试主要覆盖通用 harness,并未证明该技能关键 CLI 流程已被独立复现,缺少多来源运行结果,因此扣分。

证据充分度: 评估于 2026年7月20日 审查版本 9ccaf7c3704a
使用前请注意
  • 该技能依赖 Microsoft 365 Copilot、WorkIQ 管理员同意、Azure OpenAI 和 Windows-first 认证流程;在中国大陆网络或非 Windows 环境中应先确认可达性与认证支持。
  • 强制使用 npx --package ...@latest 会引入版本漂移和供应链审查需求。
  • 未执行 CLI 或真实租户评估;分数仅基于静态文件证据。
查看完整评分方法 →

它能做什么 & 适用场景

这是一个用于评估 Microsoft 365 Copilot 声明式代理的 Agent Skill。它围绕公开的 @microsoft/m365-copilot-eval CLI,帮助用户创建符合 schema 1.2.0 的评测数据集、运行评测并分析结果。它优先识别 Microsoft 365 Agents Toolkit 项目,也支持通过 M365_AGENT_ID 或命令行参数评估已部署代理。使用它需要 Microsoft 365、租户授权、Azure OpenAI 配置和已部署的代理。

识别用户是在配置环境、编写数据集、运行评测、分析结果还是更新评测套件;检查项目文件和环境变量配置但不暴露机密;生成 evals\evals.json;使用 npx -y --package @microsoft/m365-copilot-eval@latest runevals 运行批量、快速或交互式评测;输出 JSON、HTML 或 CSV 结果;根据 relevance、coherence、groundedness、similarity、citations、exactMatch 和 partialMatch 等现有评分键归类失败原因并提出针对性修复建议。

  1. Microsoft 365 Copilot 声明式代理开发者需要首次创建评测数据集时。
  2. 团队已经有 evals\evals.json,需要批量运行评测并保存 JSON、HTML 或 CSV 结果时。
  3. 代理回答质量不稳定,需要区分指令、知识 grounding、引用、认证环境或期望答案问题时。
  4. 测试人员需要加入单轮或多轮提示,并调整公开评测器阈值时。
  5. 非 Agents Toolkit 项目需要使用 M365_AGENT_ID 或命名环境评估已部署代理时。

优缺点一览

优点
  • 覆盖数据集创建、CLI 运行、结果分析和定向修复建议的完整流程。
  • 明确要求使用公开的最新 @microsoft/m365-copilot-eval CLI。
  • 支持 Agents Toolkit 项目、显式代理 ID 和命名环境。
  • 规定 schema 1.2.0、公开评测器名称、输出格式和敏感数据处理规则。
局限
  • 依赖 Microsoft 365 Copilot、已部署代理、WorkIQ 租户管理员同意和 Azure OpenAI 配置。
  • SKILL.md 未提供真实租户评测的测试结果或平台覆盖证明。
  • 只描述 Microsoft 365 Copilot 声明式代理评测,不应推断为通用代理测试工具。
  • 评测 CLI 处于公开预览相关流程中,且仓库整体仍在积极开发。

如何安装

在目标项目中运行 npx skills add microsoft/skills,并在向导中选择该技能。手动安装时,可将 .github/plugins/microsoft-365-agents-toolkit/skills/m365-agent-evaluator/ 复制到所用 Agent Skills 目录;来源仅明确说明集合可安装到所选代理目录,例如 GitHub Copilot 使用 .github/skills/。README 未提供该单个技能的专用安装命令。

如何使用

向代理输入“evaluate my agent”“create eval prompts”“add multi-turn tests”或“why is my agent failing”等请求。运行评测时使用 npx -y --package @microsoft/m365-copilot-eval@latest runevals --prompts-file evals\evals.json --output .evals\results.json;快速检查可使用 npx -y --package @microsoft/m365-copilot-eval@latest runevals --prompts "What can you help me with?" --expected "The agent describes its supported scope."。并发值限制为 1-5,建议先使用 1。

对比同类

相较于旧的私有 aka.ms 安装器、全局安装、裸运行 runevals 或裸 npx runevals,本技能要求使用 npx -y --package @microsoft/m365-copilot-eval@latest runevals;它还明确避免使用旧的 --input 和 --html 参数。

常见问题

这个技能是否免费?
源材料没有说明服务或 Azure OpenAI 使用费用,因此不能确认总成本。仓库本身采用 MIT 许可证。
我没有 Agents Toolkit 项目还能使用吗?
可以。技能说明 CLI 也支持通过 M365_AGENT_ID 或 --m365-agent-id 评估已部署代理,并支持命名环境。
为什么裸运行 runevals 可能失败?
如果出现旧版本已停止工作的提示,技能将其视为过期的 PATH 或全局安装,并要求改用带 @latest 的 npx 命令。删除全局 shim 前需要先征得用户同意。
运行真实评测需要哪些权限和配置?
需要 Microsoft 365 Copilot 许可证、已部署代理、WorkIQ Client App 的租户管理员同意、TENANT_ID,以及 Azure OpenAI in Foundry Models 的 endpoint 和 key。

同仓库的其他 Skills

均来自 microsoft/agent-skills

开发与工程 ✓ Microsoft · 官方

Azure Identity Python 认证技能

为 Python Azure 应用提供基于 Microsoft Entra ID 的可复用身份认证指导。

开发与工程 ✓ Microsoft · 官方

Azure Event Hubs Java 开发技能

帮助 Java 开发者构建高吞吐、可 checkpoint 的 Azure 事件流应用。

开发与工程 ✓ Microsoft · 官方

Azure Tables Python 技能

帮助 Python 开发者使用 Azure Tables 完成安全认证、实体管理、查询与批量事务操作。

开发与工程 ✓ Microsoft · 官方

Azure Identity TypeScript

为 TypeScript Azure 应用配置安全、可切换的 Microsoft Entra ID 身份验证。

自动化与运维 ✓ Microsoft · 官方

Azure 应用可靠性顾问

评估并提升 Azure Functions 与 App Service 的可靠性。

开发与工程 ✓ Microsoft · 官方

Azure 云架构师

帮助编码代理按照 Azure 架构中心最佳实践设计和审查生产级云系统。

开发与工程 ✓ Microsoft · 官方

Azure AI 文本分析 Python 技能

为 Python 开发者提供 Azure 文本分析与自然语言处理集成指导。

自动化与运维 ✓ Microsoft · 官方

Azure 资源架构可视化器

分析 Azure 资源组及其依赖关系,生成详细的 Mermaid 架构图。

开发与工程 ✓ Microsoft · 官方

Azure Maps .NET 开发技能

为 .NET 应用提供地理搜索、路线、地图、定位与天气开发指导。

开发与工程 ✓ Microsoft · 官方

Azure AI Vision 图像分析技能

为 Python 编码代理提供 Azure AI Vision 图像理解实现指南。

开发与工程 ✓ Microsoft · 官方

Azure Blob Storage Python 技能

帮助 Python 开发者安全高效地操作 Azure Blob Storage。

开发与工程 ✓ Microsoft · 官方

Azure Queue Storage Python 技能

帮助编码代理使用 Python 构建安全、可靠的 Azure Queue Storage 异步消息处理。

自动化与运维 ✓ Microsoft · 官方

Azure AI 网关治理

用 Azure API Management 统一治理 AI 模型、MCP 工具和智能体流量。

自动化与运维 ✓ Microsoft · 官方

AKS Automatic 就绪评估

评估 Kubernetes 工作负载能否迁移到 AKS Automatic,并定位兼容性阻塞项。

开发与工程 ✓ Microsoft · 官方

Azure Cosmos DB .NET 资源管理技能

用 .NET 通过 ARM 部署和管理 Azure Cosmos DB 资源。

开发与工程 ✓ Microsoft · 官方

Azure Playwright 工作区管理技能

用 .NET 通过 Azure Resource Manager 配置和管理 Microsoft Playwright Testing 工作区。

开发与工程 ✓ Microsoft · 官方

Azure Cosmos DB Python 技能

帮助 Python 开发者可靠地构建和操作 Azure Cosmos DB NoSQL 应用。

开发与工程 ✓ Microsoft · 官方

Azure Key Vault Python SDK 技能

帮助 Python 编码代理安全管理 Azure Key Vault 中的机密、加密密钥和证书。

开发与工程 ✓ Microsoft · 官方

Azure API Management Python 技能

帮助编码代理使用 Python SDK 管理 Azure API Management 的服务、API、产品、订阅与策略。

开发与工程 ✓ Microsoft · 官方

Azure Monitor 查询 Python 技能

帮助 Python 开发者查询 Azure Monitor 日志与指标。

相关 Skills