开发与工程 kv-cache-compactionmulti-agent-architecturecontext-engineeringorchestrator-workerattention-matchingtoken-optimization

潜在简报

通过任务引导的 KV 缓存压缩,在可控运行时高效共享编排器与工作器之间的上下文状态。

FollowSkills 评估 · FSRS-2.0
不推荐
55/ 100 五分制 2.8 / 5
信任安全18 / 25 · 3.6/5

技能明确限定在可控 worker 推理运行时,并披露 KV 状态访问、模型空间兼容性和审计性限制;未要求外部写入、凭据或敏感数据。但没有具体权限边界、用户确认、回滚方案或数据流治理,因此未满分。

可靠稳定7 / 20 · 1.8/5

正文概念、前置条件、负面示例、调参风险和失败适用范围基本一致,且说明 API-only 场景无法直接实施。技能没有实现脚本、关键路径测试或可诊断的运行时错误处理;按静态校准不超过 10 分。

适用触发12 / 15 · 4.0/5

触发词、目标受众、适用场景和不适用场景定义较清楚,涵盖 orchestrator-worker、KV compaction 与 token explosion。没有明确输入输出契约、具体环境兼容矩阵或中文使用说明;核心功能不依赖特定海外服务,因此未作可达性扣分。

规范维护9 / 15 · 3.0/5

结构包含触发条件、概念、决策框架、实践建议、示例、限制、集成关系、引用、创建日期、更新时间、作者和版本,且仓库声明 MIT。作者责任、维护承诺、变更记录和更新路径不清晰,相关引用与公共结果主张也未在技能内充分展开。

有效结果6 / 15 · 2.0/5

能帮助用户判断 latent KV handoff 是否适合,并提供任务引导评分、共享 mask、MAD 阈值和基线比较等可操作方向。没有实现代码、完整接口或可直接运行产物,落地仍需较多工程工作;收益主要是概念和设计指导。

证据核验3 / 10 · 1.5/5

包含 AM 公式、内部参考文档及外部论文和公开帖子链接,具备有限追溯线索。技能未提供覆盖关键路径的测试、独立复现实验或第三方执行证据,且“substantial reduction”等结果以占位式 claim 标识出现,因此证据强度较低。

证据充分度: 评估于 2026年7月20日 审查版本 c578e85e40fe
使用前请注意
  • 不要将文档中的 token 节省、准确率或 compaction overhead 描述视为普遍保证;必须在目标模型、任务和基线下重新测量。
  • 实施前确认运行时能够检查和重写 KV cache,且 orchestrator 与 worker 使用兼容的模型表示;否则应采用可审计的文本交接或检索方案。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

潜在简报面向分层多智能体系统,解决编排器轨迹在每次工作器调用中被重复传递而导致的令牌膨胀。它不把状态压缩成文本摘要,而是在工作器模型的 KV 缓存中保留与当前任务相关的位置。该方法结合任务引导查询、跨层跨头的共享令牌掩码,以及基于 median 与 MAD 的稳健阈值。它适合能够访问并改写工作器 KV 状态的推理运行时,不适合仅提供文本接口的托管 API。

它指导系统将编排器轨迹表示为工作器模型的 KV 状态,使用当前工作器任务生成查询向量,为轨迹位置计算注意力相关性,跨层和注意力头聚合分数,生成共享掩码,并依据稳健阈值删除低相关位置,最后让工作器基于压缩后的状态继续生成。它还指导记录工作器令牌数、总令牌数、保留率、准确率和压缩开销,以评估端到端效果。

  1. 构建编排器—工作器或主管—专家系统,并希望工作器访问先前状态而无需重放完整文本轨迹。
  2. 研究用表示级状态传输替代 LLM 摘要或 RAG 的方案。
  3. 调试递归、分层或工具密集型智能体图中的令牌成本增长。
  4. 评估长文档问答中工作器令牌节省、总令牌节省、压缩开销与准确率之间的权衡。

这个 Skill 有哪些优点和局限?

优点
  • 针对编排器轨迹重复传递造成的令牌膨胀,提供表示级的专门优化。
  • 比纯文本摘要更直接地保留与当前工作器任务相关的潜在状态。
  • 明确区分前缀缓存、摘要、检索和 KV 状态压缩的适用边界。
  • 包含阈值、基线、延迟和编排器方差等评估注意事项。
局限
  • 必须能够检查和改写工作器内部 KV 状态,API-only 工作器通常无法直接采用。
  • 编排器与工作器需要处于兼容的模型表示空间中;不同分词器、架构或注意力布局可能导致方案不可行。
  • 阈值和压缩强度依赖工作负载,过度压缩可能造成准确率骤降。
  • 公开结果主要聚焦长文档问答,不能据此保证代码生成、数学或多文档综合效果。
  • 提供的材料未包含可直接运行的实现、测试套件或通用性能保证。

如何安装这个 Skill?

将仓库中的 skills/latent-briefing 文件夹完整复制到宿主支持的技能目录,例如 Codex 使用 .codex/skills/,Claude Code 使用 .claude/skills/,通用 Agent Skills 主机使用 .agents/skills/。不要将 SKILL.md 展平为单个文件。源材料未提供该单项技能的独立安装命令或运行时实现。

如何使用这个 Skill?

在已加载该技能的环境中,可使用类似“请设计一个在可控工作器运行时中,通过任务引导 KV 缓存压缩共享编排器记忆的方案”的请求触发它。实施时需先确认能够访问工作器 KV 张量,并围绕当前工作器任务进行评分、共享掩码选择和阈值调优。源材料提供的是方法与设计指导,没有提供可直接执行的实现脚本。

这个 Skill 与同类方案有什么区别?

相较于 LLM 摘要,潜在简报避免文本摘要的延迟与信息损失,但可审计性更弱。相较于 RAG,它不负责从外部语料检索文档,而是传递编排器已经形成的任务相关状态。相较于前缀缓存,它不仅复用相同前缀,还会依据当前任务选择性保留轨迹位置。若需要人类可读、可移植的状态,结构化笔记或摘要更合适;若工作器运行时不可控,则应采用文本交接或检索。

常见问题

它适合普通的托管模型 API 吗?
通常不适合直接使用,因为方法需要访问和改写工作器内部 KV 张量。
它是否一定能降低总成本?
不一定。只有当压缩开销加生成开销优于同等质量目标下的文本层方案时,端到端收益才成立;公开结果是特定长文档问答工作负载的证据。
它能否跨不同模型共享潜在状态?
不能默认这样做。KV 压缩定义在特定模型的注意力空间中,模型族、分词器或注意力布局存在较大差异时可能不可行。

同仓库的其他 Skills

均来自 muratcankoylan/Agent-Skills-for-Context-Engineering

开发与工程

上下文工程与智能体系统指南

帮助团队设计、优化和评估具备可靠上下文管理能力的生产级智能体系统。

开发与工程

上下文工程基础

用注意力预算和上下文质量原则,理解并设计更可靠的智能体上下文。

开发与工程

多智能体架构模式

帮助你设计具备上下文隔离、协调协议和可靠交接机制的多智能体系统。

开发与工程

上下文压缩策略

在长期代理会话中压缩上下文,同时保留文件变更、决策和后续行动。

开发与工程

Agent 评估方法

为智能体流水线建立可重复的评估、回归检测与质量门禁。

开发与工程

Agent Skill 蓝图模板

为上下文工程技能提供可复用的结构、边界和质量检查框架。

开发与工程

上下文效率优化

通过缓存、遮蔽、压缩与分区降低上下文成本,同时保护回答质量。

开发与工程

上下文退化诊断

定位并缓解长上下文中的注意力丢失、污染、干扰、混淆与冲突。

开发与工程

项目级智能体开发方法论

帮助你判断是否该用大语言模型,并设计可迭代、可解析、可控成本的智能体项目流水线。

开发与工程

BDI 心智状态建模

把 RDF 上下文转化为可解释的信念、愿望与意图链。

开发与工程

文件系统上下文工程

将大型、持久或共享的代理上下文移入文件,按需检索以减少上下文压力。

开发与工程

自我改进循环

让智能体系统在受控评估中迭代自身的上下文、工作流与代码。

开发与工程

长程智能体提示设计

为长期自主运行和并行多智能体任务设计可验证、抗近似交付的启动提示。

开发与工程

推理轨迹优化器

通过分析智能体的推理轨迹,定位上下文、工具和指令问题,并迭代优化提示词。

开发与工程

自主智能体控制台

为自主智能体设计可控、可恢复、可审计的运行框架。

开发与工程

高级 LLM 评测

为 LLM 输出构建可审计、可校准并能缓解评测偏差的自动化评估流程。

开发与工程

持久语义记忆架构

帮助智能体设计可扩展、可检索且能处理时间变化的持久记忆系统。

开发与工程

智能体工具设计指南

帮助你设计清晰、可路由、可恢复的智能体工具接口。

开发与工程

严谨研究代理

为多步骤研究建立验证、故障恢复与来源追踪流程。

效率与协作

数字大脑个人操作系统

用结构化文件和 AI 管理内容、关系、知识与目标。

相关 Skills