自动化与运维 structured-loggingmetricsdistributed-tracingopentelemetryalertingprometheusincident-diagnosis

生产可观测性工程

为生产代码建立日志、指标、追踪与告警,让系统行为可见且便于诊断。

FollowSkills 评估 · FSRS-2.0
不推荐
53/ 100 五分制 2.7 / 5
信任安全16 / 25 · 3.2/5

明确要求结构化日志、关联 ID、字段白名单,并禁止记录密钥、令牌、密码和完整 PII,降低了数据泄露风险;但未规定遥测供应商权限、数据保留与访问控制、成本边界、用户确认、回滚或数据流披露,且无该技能自身的来源归属说明,因此扣分。

可靠稳定8 / 20 · 2.0/5

流程从问题定义到信号选择、验证和检查清单基本一致,异常验证步骤也较明确;但依赖环境、版本、配置和失败时的诊断反馈未充分说明,示例主要覆盖 Node/TypeScript,且本次仅静态阅读、无技能专属可复现测试,因此受静态上限限制并扣分。

适用触发10 / 15 · 3.3/5

前置描述和“When to Use”覆盖日志、指标、追踪、告警及生产问题,并明确排除实时调试、性能优化和发布清单;但触发边界仍较宽,未说明非 Node/TypeScript 环境、中文团队使用方式或不同部署条件,部分建议依赖 OpenTelemetry、Prometheus 等未配置组件,因此扣分。

规范维护9 / 15 · 3.0/5

文档结构清晰,包含概览、触发条件、分步流程、反合理化、红旗和验证清单,示例及限制也较充分;README 提供 MIT 许可、维护者和安装入口,但缺少该技能独立的版本、变更记录、维护责任和更新路径,且引用的 references/observability-checklist.md 未随所给技能证据提供,因此扣分。

有效结果6 / 15 · 2.0/5

内容能直接指导代理定义可观测性问题、选择信号、设置结构化日志、RED/USE 指标、追踪和症状型告警,核心任务具备实用价值;但没有针对具体技术栈的完整产物模板、配置示例或已验证输出,仍需用户结合现有遥测平台实施和复核,静态评估下不超过 7 并扣分。

证据核验4 / 10 · 2.0/5

技能提供了明确的运行时验证要求,包括诱发错误、检查指标、追踪请求和测试告警;仓库还给出通用 CI 工作流,但所提供测试夹具不覆盖该技能关键路径,也没有技能专属测试结果、第三方证据或独立复现记录,因此仅给有限静态证据分。

证据充分度: 评估于 2026年7月20日 审查版本 2fbfa004a019
使用前请注意
  • “必须”生成或接受请求 ID 可能与现有信任边界、伪造请求头和跨服务安全策略冲突,应明确可信边界、生成规则和冲突处理。
  • 示例和建议未覆盖日志脱敏、采样、保留期限、访问控制、遥测费用及故障时的降级策略,生产采用前需补充。
  • OpenTelemetry、prom-client、告警后端和 tracing UI 的版本、安装、配置及兼容性未说明;引用的 observability-checklist.md 也需确认可达。
评估证据 [1][2][3][4][5]
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

这是一个面向 AI 编码代理的可观测性与埋点工作流。它指导开发者在功能开发阶段定义值班人员需要回答的问题,并为这些问题选择结构化日志、指标或分布式追踪。内容涵盖关联 ID、RED/USE 指标、OpenTelemetry、基于用户症状的告警以及遥测验证。它适合需要把功能安全运行在生产环境中的工程团队,但不替代特定监控厂商的部署配置。

指导代理先写出 2–4 个生产运维问题,再设计结构化 JSON 日志、关联 ID、RED/USE 指标、延迟直方图、p50/p95/p99 查询、OpenTelemetry 追踪和症状型告警。它要求限制指标标签基数、避免记录密钥和未脱敏个人信息,并通过测试流量、诱发错误、追踪请求和触发告警来验证遥测输出。

  1. 负责生产服务的工程师为新接口、后台任务或外部集成添加日志和指标。
  2. 值班工程师在事故后发现现有数据不足以还原请求过程。
  3. 平台团队为服务或资源配置 RED/USE 指标和可执行告警。
  4. 评审包含 I/O、重试、队列或跨服务调用的代码变更。

这个 Skill 有哪些优点和局限?

优点
  • 提供从问题定义到遥测验证的完整流程。
  • 明确区分日志、指标和追踪的用途。
  • 包含结构化日志、关联 ID、指标基数、采样和告警可操作性等具体规则。
  • 提供可执行的验证清单和常见错误的反驳。
局限
  • 未提供特定监控后端、告警平台或部署环境的完整配置。
  • 示例主要使用 TypeScript、Node.js、OpenTelemetry 和 Prometheus 生态,其他技术栈需要自行映射。
  • 告警阈值、SLO 和运行手册内容仍需结合实际系统确定。

如何安装这个 Skill?

使用仓库提供的 skills CLI 安装单个技能:

npx skills add addyosmani/agent-skills --skill observability-and-instrumentation

README 还说明该仓库可通过多种客户端集成;具体客户端安装方式见仓库文档。

如何使用这个 Skill?

在需要为生产功能增加遥测时触发该技能,例如:"为这个生产接口设计并实现结构化日志、RED 指标、OpenTelemetry 追踪和症状型告警,并按清单验证遥测。" 技能正文未规定所有客户端的统一调用命令。

这个 Skill 与同类方案有什么区别?

README 提到 Superpowers 和 Matt Pocock's skills 是相关技能集合,并提供比较文档;但提供的材料没有给出针对本技能的具体逐项比较。

常见问题

这个技能是否绑定某个可观测性厂商?
没有。它推荐 OpenTelemetry 作为厂商中立的追踪和指标路径,示例使用 Prometheus 的 prom-client,但明确说明这只是一个常见后端选择。
它会自动修改代码或配置监控系统吗?
提供的材料只定义工作流、代码示例和验证要求,没有说明自动执行特定修改或连接监控平台。
它适合排查正在发生的故障吗?
不适合作为当前故障的主要诊断流程;正文建议使用 debugging-and-error-recovery 技能,而本技能负责提前建立让后续诊断更快的遥测。

同仓库的其他 Skills

均来自 addyosmani/agent-skills

开发与工程

系统化调试与错误恢复

用结构化流程定位根因,修复错误并防止复发。

开发与工程

浏览器 DevTools 测试

用真实浏览器运行数据验证、调试并测试网页应用。

开发与工程

需求访谈助手

在规划或编码前,通过逐题访谈确认用户真正想解决的问题。

开发与工程

测试驱动开发工作流

用可执行的测试先证明需求,再以最小改动实现、重构并验证行为。

开发与工程

代码简化审查

在不改变行为的前提下,降低代码复杂度并提升可读性与可维护性。

开发与工程

规范驱动开发

在编码前把模糊需求转化为可验证的开发规范。

开发与工程

Git 协作与版本发布规范

用可审查、可回滚的 Git 流程管理代码变更与版本发布。

开发与工程

性能优化工程技能

通过测量、定位和验证,系统解决前端、后端、查询与数据库性能瓶颈。

开发与工程

规划与任务拆解

将明确需求拆分为有依赖顺序、可实现且可验证的工程任务。

开发与工程

架构决策与工程文档助手

帮助工程团队记录决策依据、维护文档并保留长期代码上下文。

设计与前端

生产级前端界面工程

帮助 AI 编码代理构建可访问、响应式且符合设计系统的生产级用户界面。

开发与工程

怀疑驱动开发

在非平凡决策落地前,用新上下文主动寻找错误。

开发与工程

增量实现

用可验证的小步迭代安全交付多文件工程变更。

自动化与运维

安全加固工程技能

帮助编码代理在处理不可信输入、身份验证、敏感数据和外部服务时建立系统化安全防线。

开发与工程

Idea Refine 创意打磨

把模糊想法转化为经过验证、可执行的产品方向。

开发与工程

官方文档驱动开发

让框架与库的实现决策基于当前官方文档,而不是过时记忆。

开发与工程

稳定接口设计指南

帮助工程团队设计稳定、清晰且难以误用的 API 与模块接口。

开发与工程

合并前代码质量审查

在合并前从正确性、可读性、架构、安全性和性能五个维度审查代码变更。

开发与工程

上下文工程指南

帮助编码代理在正确时间获取正确项目上下文,减少臆测并保持开发规范一致。

自动化与运维

CI/CD 自动化工程指南

为项目建立可验证、可回滚的持续集成与部署流水线。

相关 Skills