II-Commons 检索技能
为 AI 代理提供覆盖 arXiv、PubMed/PMC 和美国州政策的确定性每日更新检索,通过命令行返回可复现的 JSON 结果。
证据显示客户端最小权限(仅网络访问commons.ii.inc,读本地配置文件),明确声明'客户端从不打印令牌',令牌经环境变量或XDG配置,无文件写入/无外部副作用;扣分点:依赖远程闭源服务 commons.ii.inc 的数据流不完全可审计,npx 安装路径引入供应链面,隐式调用(openai.yaml allow_implicit_invocation)未要求用户确认,无回滚说明。
脚本自洽、参数校验严格、错误为机器可读JSON且带非零退出码,仓库含覆盖解析、重试、超时、401/429、配置读取的测试套件;扣分点:静态评审无法执行验证,无已提交的CI工作流证明测试实际通过,服务端行为(端点返回)未经独立复现。
语料边界、命令路由、日期过滤映射、cutoff权威新鲜度规则写得清晰,非适用范围(policy仅加州/德州/华盛顿)有声明;扣分点:核心功能完全依赖境外服务 commons.ii.inc,中国大陆可达性未声明且存疑,无中文支持说明,隐式调用可能造成误触发。
文档分层良好(SKILL.md路由+api.md契约),npm发布配置、Apache-2.0许可证、Node>=18 engines声明齐全,版本号1.0.0;扣分点:无CHANGELOG、无版本更新历史证据,维护责任与更新节奏仅靠仓库链接暗示,发布者身份未经验证。
命令式确定检索比人工逐一查arXiv/PubMed有边际价值,输出为结构化JSON可直接使用,markdown降级到meta/PDF路径考虑了实际故障;扣分点:静态评审无法验证服务端检索质量与结果正确性,无代表性输出的实际执行证据,价值主张部分依赖未验证的服务。
测试套件可作为可审计的一手材料,文档与代码契约(端点、错误码)一致可交叉核对;扣分点:无CI工作流、无第三方执行证据、无独立复现记录,超过5分上限所需的多源佐证不满足。
- 核心功能完全依赖境外服务 commons.ii.inc,中国大陆网络可达性未声明,使用前应先验证连通性,否则技能基本不可用。
- openai.yaml 允许隐式调用,可能在不该触发时自动检索并发起网络请求;建议在敏感环境中显式调用。
- 静态评审未执行任何代码;npx 安装路径存在供应链风险,建议锁定已审计版本而非始终拉取最新版。
- 无 CHANGELOG 与 CI 证据,版本治理与测试通过状态未经独立验证。
这个 Skill 能做什么,适合哪些场景?
II-Commons 是 Intelligent-Internet 发布的代理技能与 CLI,底层由 PostgreSQL BM25S 扩展 psql_bm25s 驱动,提供对 arXiv、PubMed/PMC 以及加州、德州、华盛顿州政策文本的快速词法检索。数据每日更新,`cutoff` 命令可查询各语料库的最新覆盖日期。它支持按日期、类别、期刊、辖区等条件做服务器端过滤,并可将命中文献转换为完整 Markdown。基础使用无需认证,更高限额需在 commons.ii.inc 申请 API token。
安装后提供一个名为 ii-commons 的 Node.js CLI(也可通过 npx @intelligentinternet/ii-commons 运行,或经 skills/ii-commons/SKILL.md 安装为代理技能)。核心命令:search <corpus> <topic> [filters] 在 arxiv/pubmed/policy 三个语料库中做确定性检索,支持 --start/--end(YYYYMMDD 等整数格式)、--categories、--jurisdictions、--max-results 等过滤;meta 按规范标识符(如 arXiv:2402.03578、PMCID:PMC11152602、DOI:<doi>)查询元数据;markdown 抓取全文并转为 Markdown;cutoff 返回每个语料库的最新覆盖日期。输出为 stdout 上的 JSON,错误以机器可读 JSON 写入 stderr 并返回非零退出码。
- AI/ML 研究者在撰写综述或调研时,让代理按日期范围和类别过滤检索 arXiv 预印本,例如检索近两年关于检索增强生成的论文。
- 生物医学或临床研究人员向代理提问药物、试验或公共卫生问题,由其检索 PubMed/PMC 并在需要时抓取全文 Markdown 做证据引用。
- 法律与合规从业者比较加州、德州、华盛顿州的政策或法规文本,例如查询农业工人的加班规定。
- 需要核实文献时效性的用户先运行 `cutoff` 确认语料库覆盖边界,再判断检索结果是否足够新。
- 跨领域调研者对同一问题同时检索多个语料库,并对结果做显式比较。
这个 Skill 有哪些优点和局限?
- 确定性、可复现的检索流程:search/meta/markdown/cutoff 命令行为明确,输出为结构化 JSON,便于代理程序化处理。
- 数据每日更新,`cutoff` 命令给出可引用的时效边界,适合对新鲜度敏感的研究任务。
- 服务器端日期、类别、期刊、辖区过滤,避免先广撒网再人工筛选。
- 基础使用无需认证即可运行;跨平台 CLI,仅要求 Node.js 18+ 和网络访问。
- 三个异构语料库(学术论文、生物医学、美国州政策)共用一套命令接口。
- 政策语料仅覆盖加州、德州和华盛顿州,其他辖区不在范围内。
- 依赖外部服务 commons.ii.inc 可用性;源文档未说明该服务的 SLA 或长期可用性。
- 基础用法有使用限额,更高限额需申请 API token;具体限额数值未在源中说明。
- source 未提供测试套件、平台兼容性实测数据或检索质量基准,效果需自行评估。
- Markdown 转换偶发截断或损坏(SKILL.md 提供了回退路径),全文抽取并非总能成功。
如何安装这个 Skill?
方式一:通过 npx 直接运行,无需安装——npx @intelligentinternet/ii-commons --help;或全局安装——npm install -g @intelligentinternet/ii-commons(需 Node.js 18+)。方式二:作为代理技能安装,将仓库中的 skills/ii-commons/ 文件夹装入代理运行时的技能发现路径(若运行时支持仓库 URL 安装,可直接指向 skills/ii-commons/),技能名为 ii-commons。源码仓库为 https://github.com/Intelligent-Internet/II-Commons-Skills 。使用中需要能访问 commons.ii.inc。
如何使用这个 Skill?
对代理说:"请用 ii-commons 技能回答:<你的问题或主题>"。命令行直接使用示例:ii-commons cutoff 查看各语料库最新覆盖日期;ii-commons search arxiv "large language model inference" --max-results 10;ii-commons search pubmed "type 2 diabetes review" --start 20240000 --max-results 10;ii-commons search policy "state overtime rule for agricultural workers" --jurisdictions US-CA --max-results 10;ii-commons meta "arXiv:2402.03578";ii-commons markdown "PMCID:PMC11152602"。从已安装的技能目录运行时用 node scripts/ii_commons.js 替代 ii-commons。若 markdown 返回截断/损坏提示,SKILL.md 建议改用 meta 获取同一标识符的 PDF URL 继续。REST 客户端契约见仓库内 references/api.md。