开发与工程 ✓ Microsoft · 官方 microsoft-365copilotevaluationeval-datasetscliazure-openaimulti-turn-testing

Microsoft 365 代理评测器

为 Microsoft 365 Copilot 声明式代理设计并运行评测套件

FollowSkills 评估 · FSRS-2.0
谨慎使用
54/ 100 五分制 2.7 / 5
1 2 3 4 5 6
1信任安全18 / 25 · 3.6/5

技能明确要求不打印或提交密钥、敏感提示词、检索内容和原始结果,并要求在真实租户评估前获得用户批准;但强制使用 npx @latest,未充分说明依赖供应链、数据流、外部服务权限和运行后的回滚方案,因此扣分。

2可靠稳定8 / 20 · 2.0/5

工作流、环境检测、版本检查、重试边界和常见故障诊断较完整,且区分认证、模型、代理和架构错误;但 CLI 使用 preview/@latest,平台要求 Windows-first,未提供该技能关键路径的可执行复现证据,静态评估不超过10分,因此扣分。

3适用触发9 / 15 · 3.0/5

目标用户、评估场景、ATK 与非 ATK 路径、触发短语和非 ATK 参数较清晰;但中文支持未说明,Windows、Microsoft 365 Copilot、租户同意及 Azure OpenAI 依赖限制了环境适配,并可能受中国大陆网络可达性影响,因此扣分。

4规范维护9 / 15 · 3.0/5

采用主文档、references、examples 的渐进式结构,包含安装命令、参数示例、限制提示、秘密文件约定,仓库提供 MIT 许可和官方来源;但缺少技能自身的版本、变更记录、明确维护责任人与更新路径,因此扣分。

5有效结果6 / 15 · 2.0/5

能够直接指导创建数据集、运行评估和分析失败,提供 schema 1.2.0 模板及常用命令,核心任务价值明确;但依赖真实租户、许可证、管理员同意和 Azure 配置,且静态阅读无法验证结果可用性,因此按静态上限保守扣分。

6证据核验4 / 10 · 2.0/5

主文档、参考资料、示例和仓库级 CI/测试提供一定可审计材料;但提供的 CI 与测试主要覆盖通用 harness,并未证明该技能关键 CLI 流程已被独立复现,缺少多来源运行结果,因此扣分。

证据充分度: 评估于 2026年7月20日 审查版本 9ccaf7c3704a
使用前请注意
  • 该技能依赖 Microsoft 365 Copilot、WorkIQ 管理员同意、Azure OpenAI 和 Windows-first 认证流程;在中国大陆网络或非 Windows 环境中应先确认可达性与认证支持。
  • 强制使用 npx --package ...@latest 会引入版本漂移和供应链审查需求。
  • 未执行 CLI 或真实租户评估;分数仅基于静态文件证据。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

这是一个用于评估 Microsoft 365 Copilot 声明式代理的 Agent Skill。它围绕公开的 @microsoft/m365-copilot-eval CLI,帮助用户创建符合 schema 1.2.0 的评测数据集、运行评测并分析结果。它优先识别 Microsoft 365 Agents Toolkit 项目,也支持通过 M365_AGENT_ID 或命令行参数评估已部署代理。使用它需要 Microsoft 365、租户授权、Azure OpenAI 配置和已部署的代理。

识别用户是在配置环境、编写数据集、运行评测、分析结果还是更新评测套件;检查项目文件和环境变量配置但不暴露机密;生成 evals\evals.json;使用 npx -y --package @microsoft/m365-copilot-eval@latest runevals 运行批量、快速或交互式评测;输出 JSON、HTML 或 CSV 结果;根据 relevance、coherence、groundedness、similarity、citations、exactMatch 和 partialMatch 等现有评分键归类失败原因并提出针对性修复建议。

  1. Microsoft 365 Copilot 声明式代理开发者需要首次创建评测数据集时。
  2. 团队已经有 evals\evals.json,需要批量运行评测并保存 JSON、HTML 或 CSV 结果时。
  3. 代理回答质量不稳定,需要区分指令、知识 grounding、引用、认证环境或期望答案问题时。
  4. 测试人员需要加入单轮或多轮提示,并调整公开评测器阈值时。
  5. 非 Agents Toolkit 项目需要使用 M365_AGENT_ID 或命名环境评估已部署代理时。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖数据集创建、CLI 运行、结果分析和定向修复建议的完整流程。
  • 明确要求使用公开的最新 @microsoft/m365-copilot-eval CLI。
  • 支持 Agents Toolkit 项目、显式代理 ID 和命名环境。
  • 规定 schema 1.2.0、公开评测器名称、输出格式和敏感数据处理规则。
局限
  • 依赖 Microsoft 365 Copilot、已部署代理、WorkIQ 租户管理员同意和 Azure OpenAI 配置。
  • SKILL.md 未提供真实租户评测的测试结果或平台覆盖证明。
  • 只描述 Microsoft 365 Copilot 声明式代理评测,不应推断为通用代理测试工具。
  • 评测 CLI 处于公开预览相关流程中,且仓库整体仍在积极开发。

如何安装这个 Skill?

在目标项目中运行 npx skills add microsoft/skills,并在向导中选择该技能。手动安装时,可将 .github/plugins/microsoft-365-agents-toolkit/skills/m365-agent-evaluator/ 复制到所用 Agent Skills 目录;来源仅明确说明集合可安装到所选代理目录,例如 GitHub Copilot 使用 .github/skills/。README 未提供该单个技能的专用安装命令。

如何使用这个 Skill?

向代理输入“evaluate my agent”“create eval prompts”“add multi-turn tests”或“why is my agent failing”等请求。运行评测时使用 npx -y --package @microsoft/m365-copilot-eval@latest runevals --prompts-file evals\evals.json --output .evals\results.json;快速检查可使用 npx -y --package @microsoft/m365-copilot-eval@latest runevals --prompts "What can you help me with?" --expected "The agent describes its supported scope."。并发值限制为 1-5,建议先使用 1。

这个 Skill 与同类方案有什么区别?

相较于旧的私有 aka.ms 安装器、全局安装、裸运行 runevals 或裸 npx runevals,本技能要求使用 npx -y --package @microsoft/m365-copilot-eval@latest runevals;它还明确避免使用旧的 --input 和 --html 参数。

常见问题

这个技能是否免费?
源材料没有说明服务或 Azure OpenAI 使用费用,因此不能确认总成本。仓库本身采用 MIT 许可证。
我没有 Agents Toolkit 项目还能使用吗?
可以。技能说明 CLI 也支持通过 M365_AGENT_ID 或 --m365-agent-id 评估已部署代理,并支持命名环境。
为什么裸运行 runevals 可能失败?
如果出现旧版本已停止工作的提示,技能将其视为过期的 PATH 或全局安装,并要求改用带 @latest 的 npx 命令。删除全局 shim 前需要先征得用户同意。
运行真实评测需要哪些权限和配置?
需要 Microsoft 365 Copilot 许可证、已部署代理、WorkIQ Client App 的租户管理员同意、TENANT_ID,以及 Azure OpenAI in Foundry Models 的 endpoint 和 key。

同仓库的其他 Skills

均来自 microsoft/agent-skills

开发与工程 ✓ Microsoft · 官方

Microsoft 365 Agents TypeScript 技能

帮助你用 TypeScript 构建可路由、可流式响应并接入 Copilot Studio 的 Microsoft 365 企业代理。

开发与工程 ✓ Microsoft · 官方

Microsoft 365 Agents Python 开发技能

用 Python 构建 Teams、Microsoft 365 与 Copilot Studio 多渠道代理。

开发与工程 ✓ Microsoft · 官方

Microsoft 365 Agents SDK for .NET

用 ASP.NET Core 构建可连接 Teams、Microsoft 365 与 Copilot Studio 的多渠道代理。

开发与工程 ✓ Microsoft · 官方

Microsoft Docs 技术研究助手

通过官方 Microsoft 文档帮助编码代理准确理解技术概念、配置、教程与限制。

开发与工程 ✓ Microsoft · 官方

Azure OpenAI 模型部署助手

按意图发现容量并部署 Azure OpenAI 模型。

自动化与运维 ✓ Microsoft · 官方

Azure OpenAI 容量发现

跨区域和项目查找可用的 Azure OpenAI 模型容量,帮助你选择合适的部署位置。

开发与工程 ✓ Microsoft · 官方

Azure OpenAI 定制部署向导

为 Azure OpenAI 模型提供可精确配置的交互式部署流程。

开发与工程 ✓ Microsoft · 官方

Azure OpenAI 智能区域部署

自动检查 Azure 区域容量,并将 Azure OpenAI 模型部署到合适的可用区域。

自动化与运维 ✓ Microsoft · 官方

Azure AI 网关治理

用 Azure API Management 统一治理 AI 模型、MCP 工具和智能体流量。

开发与工程 ✓ Microsoft · 官方

Azure AI 服务技能

为编码代理提供 Azure AI 搜索、语音、OpenAI 与 OCR 操作指引。

开发与工程 ✓ Microsoft · 官方

Azure OpenAI .NET 开发技能

为 .NET 编码代理提供 Azure OpenAI 集成范式。

开发与工程 ✓ Microsoft · 官方

Azure Realtime 播客生成

用 Azure OpenAI Realtime API 将文本转换为可播放的播客式音频。

开发与工程 ✓ Microsoft · 官方

Microsoft Agent Skills

为编码代理提供 Azure SDK 与 Microsoft Foundry 的可复用开发知识。

开发与工程 ✓ Microsoft · 官方

Azure Identity Java 认证助手

为 Java Azure 应用选择并配置安全的 Entra ID 凭据。

开发与工程 ✓ Microsoft · 官方

Teams 应用开发助手

用 ATK 构建、测试并部署 Teams 与 Microsoft 365 智能体。

开发与工程 ✓ Microsoft · 官方

Microsoft Foundry Python 项目技能

为编码代理提供使用 Azure AI Projects Python SDK 构建 Foundry AI 应用的可靠模式。

开发与工程 ✓ Microsoft · 官方

Microsoft Foundry Agent Skill

用 azd 和 Foundry MCP 管理 AI 代理从创建、部署到评估与优化的完整生命周期。

开发与工程 ✓ Microsoft · 官方

Azure AI Projects Java

帮助 Java 开发者管理 Azure AI Foundry 项目资源。

开发与工程 ✓ Microsoft · 官方

Azure Identity Python 认证技能

为 Python Azure 应用提供基于 Microsoft Entra ID 的可复用身份认证指导。

自动化与运维 ✓ Microsoft · 官方

Azure 资源架构可视化器

分析 Azure 资源组及其依赖关系,生成详细的 Mermaid 架构图。

相关 Skills