潜在简报
通过任务引导的 KV 缓存压缩,在可控运行时高效共享编排器与工作器之间的上下文状态。
技能明确限定在可控 worker 推理运行时,并披露 KV 状态访问、模型空间兼容性和审计性限制;未要求外部写入、凭据或敏感数据。但没有具体权限边界、用户确认、回滚方案或数据流治理,因此未满分。
正文概念、前置条件、负面示例、调参风险和失败适用范围基本一致,且说明 API-only 场景无法直接实施。技能没有实现脚本、关键路径测试或可诊断的运行时错误处理;按静态校准不超过 10 分。
触发词、目标受众、适用场景和不适用场景定义较清楚,涵盖 orchestrator-worker、KV compaction 与 token explosion。没有明确输入输出契约、具体环境兼容矩阵或中文使用说明;核心功能不依赖特定海外服务,因此未作可达性扣分。
结构包含触发条件、概念、决策框架、实践建议、示例、限制、集成关系、引用、创建日期、更新时间、作者和版本,且仓库声明 MIT。作者责任、维护承诺、变更记录和更新路径不清晰,相关引用与公共结果主张也未在技能内充分展开。
能帮助用户判断 latent KV handoff 是否适合,并提供任务引导评分、共享 mask、MAD 阈值和基线比较等可操作方向。没有实现代码、完整接口或可直接运行产物,落地仍需较多工程工作;收益主要是概念和设计指导。
包含 AM 公式、内部参考文档及外部论文和公开帖子链接,具备有限追溯线索。技能未提供覆盖关键路径的测试、独立复现实验或第三方执行证据,且“substantial reduction”等结果以占位式 claim 标识出现,因此证据强度较低。
- 不要将文档中的 token 节省、准确率或 compaction overhead 描述视为普遍保证;必须在目标模型、任务和基线下重新测量。
- 实施前确认运行时能够检查和重写 KV cache,且 orchestrator 与 worker 使用兼容的模型表示;否则应采用可审计的文本交接或检索方案。
这个 Skill 能做什么,适合哪些场景?
潜在简报面向分层多智能体系统,解决编排器轨迹在每次工作器调用中被重复传递而导致的令牌膨胀。它不把状态压缩成文本摘要,而是在工作器模型的 KV 缓存中保留与当前任务相关的位置。该方法结合任务引导查询、跨层跨头的共享令牌掩码,以及基于 median 与 MAD 的稳健阈值。它适合能够访问并改写工作器 KV 状态的推理运行时,不适合仅提供文本接口的托管 API。
它指导系统将编排器轨迹表示为工作器模型的 KV 状态,使用当前工作器任务生成查询向量,为轨迹位置计算注意力相关性,跨层和注意力头聚合分数,生成共享掩码,并依据稳健阈值删除低相关位置,最后让工作器基于压缩后的状态继续生成。它还指导记录工作器令牌数、总令牌数、保留率、准确率和压缩开销,以评估端到端效果。
- 构建编排器—工作器或主管—专家系统,并希望工作器访问先前状态而无需重放完整文本轨迹。
- 研究用表示级状态传输替代 LLM 摘要或 RAG 的方案。
- 调试递归、分层或工具密集型智能体图中的令牌成本增长。
- 评估长文档问答中工作器令牌节省、总令牌节省、压缩开销与准确率之间的权衡。
这个 Skill 有哪些优点和局限?
- 针对编排器轨迹重复传递造成的令牌膨胀,提供表示级的专门优化。
- 比纯文本摘要更直接地保留与当前工作器任务相关的潜在状态。
- 明确区分前缀缓存、摘要、检索和 KV 状态压缩的适用边界。
- 包含阈值、基线、延迟和编排器方差等评估注意事项。
- 必须能够检查和改写工作器内部 KV 状态,API-only 工作器通常无法直接采用。
- 编排器与工作器需要处于兼容的模型表示空间中;不同分词器、架构或注意力布局可能导致方案不可行。
- 阈值和压缩强度依赖工作负载,过度压缩可能造成准确率骤降。
- 公开结果主要聚焦长文档问答,不能据此保证代码生成、数学或多文档综合效果。
- 提供的材料未包含可直接运行的实现、测试套件或通用性能保证。
如何安装这个 Skill?
将仓库中的 skills/latent-briefing 文件夹完整复制到宿主支持的技能目录,例如 Codex 使用 .codex/skills/,Claude Code 使用 .claude/skills/,通用 Agent Skills 主机使用 .agents/skills/。不要将 SKILL.md 展平为单个文件。源材料未提供该单项技能的独立安装命令或运行时实现。
如何使用这个 Skill?
在已加载该技能的环境中,可使用类似“请设计一个在可控工作器运行时中,通过任务引导 KV 缓存压缩共享编排器记忆的方案”的请求触发它。实施时需先确认能够访问工作器 KV 张量,并围绕当前工作器任务进行评分、共享掩码选择和阈值调优。源材料提供的是方法与设计指导,没有提供可直接执行的实现脚本。
这个 Skill 与同类方案有什么区别?
相较于 LLM 摘要,潜在简报避免文本摘要的延迟与信息损失,但可审计性更弱。相较于 RAG,它不负责从外部语料检索文档,而是传递编排器已经形成的任务相关状态。相较于前缀缓存,它不仅复用相同前缀,还会依据当前任务选择性保留轨迹位置。若需要人类可读、可移植的状态,结构化笔记或摘要更合适;若工作器运行时不可控,则应采用文本交接或检索。