Defuddle 网页净化提取
将普通网页提取为去除导航与杂乱内容的干净 Markdown,节省代理处理网页时的令牌。
技能仅请求对指定网页执行 Defuddle 提取,未显示恶意行为或凭据窃取;但要求全局 npm 安装并向外部 URL 发起请求,未说明数据流、敏感内容处理、用户确认、权限隔离或回滚,因此扣分。
命令、参数和输出格式基本一致,且明确了 .md URL 的例外;但依赖未锁定版本,未提供安装失败、网络异常、无效 URL、动态页面或解析失败的诊断与恢复方式,静态评估不超过 10 分。
目标受众和触发条件较清楚:用户提供标准网页 URL 时使用,.md URL 不使用;但非网页 URL、登录页、动态或受限页面的边界未定义,也未说明中文页面及中国大陆网络环境适配,故扣分。
文档结构清晰,包含安装说明、核心用法、保存文件、元数据查询、输出格式表,并有 MIT 许可证上下文;但缺少依赖版本、技能版本、变更记录、维护责任、更新路径、故障排查和已知限制,故未接近满分。
技能目标明确,markdown 提取命令可直接作为预期输出,且说明可减少网页噪声和 token 使用;但源文件没有提交测试或可复现执行证据,提取完整性、失败场景和相较替代方案的效果无法静态确认,按静态上限扣分。
提供了具体 CLI 命令、参数示例以及仓库 README 对 Defuddle 的引用,具备有限可审计性;但没有测试套件、CI 覆盖、固定版本或第三方执行结果,无法独立复现关键路径,故仅给低分。
- 全局安装未锁定 Defuddle 版本,可能导致版本漂移或供应链风险;应考虑固定版本并记录来源。
- 执行前应确认网页可能包含敏感信息,明确会向外部服务或 CLI 依赖发送哪些请求及内容。
- 未提供网络不可达、需要登录、动态渲染或解析失败时的替代路径和清晰错误反馈。
这个 Skill 能做什么,适合哪些场景?
该技能使用 Defuddle CLI 从标准网页中提取可读内容,并输出 Markdown。它会移除导航、广告和其他页面杂乱信息。技能适用于用户提供网页 URL 并要求阅读或分析的场景。对于以 .md 结尾的 URL,技能明确建议直接使用 WebFetch。
调用 Defuddle CLI 解析网页 URL;默认使用 --md 输出 Markdown;可将结果保存为 content.md;也可单独提取标题、描述或域名等元数据。
- 需要阅读在线文档的用户,希望先移除网页导航和广告再交给代理分析。
- 研究文章或博客文章的用户,需要获得更适合阅读的 Markdown 内容。
- 处理标准网页 URL 的用户,希望降低页面杂乱内容带来的令牌消耗。
- 需要保存网页提取结果的用户,可将 Markdown 输出写入本地文件。
这个 Skill 有哪些优点和局限?
- 输出适合代理继续阅读和分析的 Markdown。
- 会移除导航、广告和页面杂乱内容。
- 支持直接输出、保存文件和提取特定元数据。
- 采用仅包含 `name` 和 `description` 前言字段的通用 SKILL.md 结构。
- 依赖已安装的 Defuddle CLI 和 npm。
- 只面向标准网页;`.md` URL 不应使用此技能。
- 提供的材料没有说明操作系统兼容性、测试套件或详细错误处理行为。
如何安装这个 Skill?
安装 Defuddle CLI:npm install -g defuddle。该技能属于 kepano/obsidian-skills 的 5 个技能之一;README 还提供通过 marketplace、npx skills、Claude Code、Codex 和 OpenCode 安装整个集合的方法。
如何使用这个 Skill?
对标准网页 URL 执行:defuddle parse <url> --md。保存到文件:defuddle parse <url> --md -o content.md。提取元数据:defuddle parse <url> -p title。不要将以 .md 结尾的 URL 交给 Defuddle;这类 URL 应直接使用 WebFetch。
这个 Skill 与同类方案有什么区别?
相较于 WebFetch,该技能明确优先使用 Defuddle 处理标准网页,因为它会移除导航、广告和其他杂乱内容;.md URL 则应使用 WebFetch。