开发与工程 context-managementlost-in-the-middlecontext-poisoningretrieval-filteringmulti-agent-systemsagent-debugging

上下文退化诊断

定位并缓解长上下文中的注意力丢失、污染、干扰、混淆与冲突。

FollowSkills 评估 · FSRS-2.0
不推荐
51/ 100 五分制 2.6 / 5
信任安全14 / 25 · 2.8/5

技能主要提供诊断、过滤、隔离和截断建议,没有凭据访问、外部写入或破坏性默认操作,权限风险较低;但未明确敏感数据处理、用户确认、回滚边界或完整数据流,且来源归因主要停留在作者和概括性研究引用,因此扣分。

可靠稳定7 / 20 · 1.8/5

SKILL.md、参考文档和脚本在概念上基本一致,并提供异常模式和恢复建议;但脚本使用random.random导致结果不确定,注意力仅为模拟值,部分示例依赖未定义函数,且未见覆盖该技能关键路径的专门测试,因此按静态上限保守扣分。

适用触发10 / 15 · 3.3/5

触发条件、非适用范围、五类退化模式和四桶缓解框架较清楚,适合长上下文代理诊断;但输入输出契约、模型边界、中文使用说明和中国大陆网络环境适配未明确,且若干阈值具有较强泛化表述,因此扣分。

规范维护10 / 15 · 3.3/5

文档分层较好,包含激活条件、详细主题、实践框架、示例、陷阱、集成关系、脚本和版本日期;但安装依赖、脚本使用方式、已知限制、变更记录及维护责任不完整,引用路径和实际发布结构也存在描述不一致风险,因此未给满分。

有效结果6 / 15 · 2.0/5

技能提供可直接采用的诊断流程、恢复步骤和示例代码,能完成核心的概念指导;但脚本输出依赖启发式和随机模拟,无法可靠代表真实模型注意力或毒化状态,实际生产使用仍需较多验证和改造,因此按静态上限给中等分数。

证据核验4 / 10 · 2.0/5

存在参考文档、脚本、仓库级CI和若干研究名称,提供了一定可审计材料;但提供的CI未覆盖该技能脚本关键路径,未见该技能专门测试、固定输出或多来源逐条证据,且引用缺少可核验的内联出处,因此扣分。

证据充分度: 评估于 2026年7月20日 审查版本 c578e85e40fe
使用前请注意
  • 脚本的注意力分布是随机模拟,不应被当作真实模型注意力测量结果。
  • 默认只分析前1000个分词,但可能使用更长上下文中的关键位置,可能导致诊断失真。
  • 毒化检测主要依赖关键词和简单冲突模式,误报和漏报风险较高。
  • SKILL.md中的研究结论和阈值需要针对具体模型、任务和版本重新基准测试。
  • 发布者身份未通过FollowSkills企业注册表验证,维护责任和更新路径应另行确认。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

这是一个用于诊断和缓解 Agent 上下文退化的通用 Agent Skill。它覆盖 lost-in-the-middle、上下文污染、上下文干扰、任务混淆和信息冲突五类模式,并提供检测信号、恢复流程与架构应对策略。建议将上下文退化视为可测量的工程问题,通过基准测试、上下文整理、压缩和任务隔离控制风险。它适合需要可靠处理长对话、检索内容和工具输出的 Agent 系统。

它根据 Agent 输出质量下降、错误工具调用、忽略已提供信息、任务要求混杂或相互矛盾等信号,帮助识别具体的上下文退化模式;指导用户把关键信息放在上下文开头或结尾、过滤无关文档、追踪声明来源、移除污染内容、标注冲突并设定来源优先级;同时提供 Write、Select、Compress、Isolate 四类缓解策略,以及渐进式上下文测试和提前压缩的设计建议。

  1. Agent 在长对话中开始忽略早先指令或与上下文中的事实矛盾时,用它排查 lost-in-the-middle。
  2. 检索文档或工具输出进入上下文后,Agent 持续引用错误事实时,用它定位并恢复上下文污染。
  3. RAG 系统加载大量候选文档后相关任务表现下降时,用它设计相关性过滤和即时检索。
  4. 同一会话切换多个目标后,Agent 混用约束或调用错误工具时,用它规划任务隔离和上下文重置。
  5. 不同版本或来源提供相互矛盾但各自合理的信息时,用它建立冲突标注和来源优先级。
  6. 需要为生产 Agent 找到上下文退化阈值时,用它设计逐步增大上下文的测试方案。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖五种明确区分的上下文退化模式,并为每种模式提供检测信号和恢复建议。
  • 提供可执行的上下文布局、来源追踪、相关性过滤、冲突处理和任务隔离思路。
  • 包含模型阈值、干扰文档和 needle-in-a-haystack 测试局限等实际工程注意事项。
  • 技能正文仅使用通用 Agent Skills 指令,没有平台专属前置字段。
局限
  • 提供的 SKILL.md 本身没有自动化诊断脚本、监控实现或测试套件。
  • 部分经验阈值依赖模型版本和具体任务,不能直接视为通用保证,需要自行重新基准测试。
  • 正文引用了仓库内的 patterns.md 和外部研究,但采用该技能时这些材料是否同步可用取决于安装方式。
  • 它主要负责诊断和缓解决策;压缩、文件外置、评估和多 Agent 隔离的具体实现由相邻技能负责。

如何安装这个 Skill?

从仓库中复制整个技能目录,而不是只复制 SKILL.md:

mkdir -p .codex/skills
cp -R skills/context-degradation .codex/skills/

也可以复制到 .claude/skills/ 或 .agents/skills/。仓库说明要求保留目录结构,以支持相对 references/ 路径。

如何使用这个 Skill?

在支持 Agent Skills 的客户端中,让 Agent 处理与长上下文退化相关的任务,例如:

“分析这个 Agent 在长对话中忽略早期事实的原因,判断是否属于 lost-in-the-middle,并提出检测和缓解方案。”

当任务涉及上下文机制基础、已确认退化后的 token 优化、摘要压缩或文件系统外置时,应转交仓库中对应的相邻技能。

常见问题

这个技能会自动修复上下文问题吗?
不会。它提供诊断框架、检测信号和缓解步骤,但没有随 SKILL.md 提供自动化诊断或修复程序。
它是否要求特定模型、运行时或外部服务?
提供的内容没有指定模型、Shell 命令、网络服务、MCP 或其他运行时依赖;不过其中的阈值建议需要结合实际模型和工作负载验证。
什么时候不应使用它?
如果只是学习上下文基础、执行已确认退化后的 token 优化、设计摘要压缩,或把输出移到文件系统,应使用仓库中相应的相邻技能。

同仓库的其他 Skills

均来自 muratcankoylan/Agent-Skills-for-Context-Engineering

开发与工程

BDI 心智状态建模

把 RDF 上下文转化为可解释的信念、愿望与意图链。

开发与工程

上下文工程与智能体系统指南

帮助团队设计、优化和评估具备可靠上下文管理能力的生产级智能体系统。

开发与工程

潜在简报

通过任务引导的 KV 缓存压缩,在可控运行时高效共享编排器与工作器之间的上下文状态。

开发与工程

多智能体架构模式

帮助你设计具备上下文隔离、协调协议和可靠交接机制的多智能体系统。

开发与工程

文件系统上下文工程

将大型、持久或共享的代理上下文移入文件,按需检索以减少上下文压力。

开发与工程

长程智能体提示设计

为长期自主运行和并行多智能体任务设计可验证、抗近似交付的启动提示。

开发与工程

上下文工程基础

用注意力预算和上下文质量原则,理解并设计更可靠的智能体上下文。

开发与工程

上下文压缩策略

在长期代理会话中压缩上下文,同时保留文件变更、决策和后续行动。

开发与工程

项目级智能体开发方法论

帮助你判断是否该用大语言模型,并设计可迭代、可解析、可控成本的智能体项目流水线。

开发与工程

Agent 评估方法

为智能体流水线建立可重复的评估、回归检测与质量门禁。

开发与工程

上下文效率优化

通过缓存、遮蔽、压缩与分区降低上下文成本,同时保护回答质量。

开发与工程

推理轨迹优化器

通过分析智能体的推理轨迹,定位上下文、工具和指令问题,并迭代优化提示词。

开发与工程

自我改进循环

让智能体系统在受控评估中迭代自身的上下文、工作流与代码。

开发与工程

持久语义记忆架构

帮助智能体设计可扩展、可检索且能处理时间变化的持久记忆系统。

开发与工程

Agent Skill 蓝图模板

为上下文工程技能提供可复用的结构、边界和质量检查框架。

效率与协作

数字大脑个人操作系统

用结构化文件和 AI 管理内容、关系、知识与目标。

开发与工程

高级 LLM 评测

为 LLM 输出构建可审计、可校准并能缓解评测偏差的自动化评估流程。

开发与工程

智能体工具设计指南

帮助你设计清晰、可路由、可恢复的智能体工具接口。

开发与工程

自主智能体控制台

为自主智能体设计可控、可恢复、可审计的运行框架。

开发与工程

严谨研究代理

为多步骤研究建立验证、故障恢复与来源追踪流程。

相关 Skills