@xienda/dsh-paper-lab
v1.0.2
Published
论文知识收集库(DSH 插件,随包 6 个技能,零第三方依赖):编排“多源检索 → 元数据与分级全文获取 → 结构化精读 → 多视角总结与复现指南 → 本地知识库沉淀”。检索并发查询 6 个免费学术源(arXiv / Semantic Scholar / OpenAlex / Crossref / DBLP / PubMed),元数据丰富再补 Unpaywall、PMC/Europe PMC 与 GitHub/HuggingFace 社区信息;全文按 L1 arXiv → L2 开放获取 PDF → L3
Downloads
472
Maintainers
Readme
dsh-paper-lab · 论文知识收集库
DeepSeek Harness 插件:检索 → 元数据与全文获取 → 精读 → 总结与复现 → 知识库沉淀 的论文科研流水线。 Paper research knowledge base for DeepSeek Harness: multi-source search → metadata + tiered full-text fetch → deep reading → summarize & reproduce → persistent KB.
这是什么
一个把“论文研究”变成一条可追溯、分阶段、有交付物的流水线的 DSH 插件:随包 6 个技能(skill),安装后由 dsh 的 skills 注册表在运行时注册,任何会话里说一句“研究一下 XXX / 学习并复现这篇论文 / 把这几篇收进知识库”即可按链路执行,也支持只跑其中一段。
边界说清(避免预期错位):
- 检索并发查询 6 个免费学术源:arXiv、Semantic Scholar、OpenAlex、Crossref、DBLP、PubMed;元数据丰富阶段再补 Unpaywall(需邮箱参数)、PMC/Europe PMC,以及 GitHub / HuggingFace / PapersWithCode 等社区信息(经联网搜索,属增强项)。
- 全部使用公开接口与免费额度,无需注册 API Key;CORE 等需免费 key 的源仅作为 L4 兜底可选项,未配置则跳过并如实记录。
- 插件本身零第三方依赖(仅 node 内置模块,
engines.node >= 18.17);实际跑链路的工具(联网抓取、PDF 文本抽取、Python/pypdf 或 pdftotext)由所在 DSH 会话提供,缺失时按各技能的降级路径处理。
一键安装
dsh plugin --profile web add @xienda/dsh-paper-lab(或在 Web 界面 设置 → 插件市场 搜索 dsh-paper-lab(或 @xienda/dsh-paper-lab)一键安装;重启 dsh web 后技能即出现在技能目录。)
本 README 描述的是 npm 上最新的 1.0.2;1.0.0 与它的差别仅是描述措辞,技能行为一致。
无需注册 API Key:arXiv / Semantic Scholar / OpenAlex / Crossref / DBLP / PubMed / Unpaywall / GitHub / HuggingFace 均为公开免费接口直连(Unpaywall 需带邮箱参数);联网搜索为增强项,不可用时自动降级并如实标注。
技能一览(能力边界)
| 技能 | 实际做什么 |
|------|-----------|
| paper-lab | 编排入口:解析意图、按 search→fetch→learn→reproduce→kb 依赖顺序分派、逐阶段汇报、产出 kb/reports/mission-<run-id>.md 汇总报告;支持中途改需求与选择性裁剪 |
| paper-search | 并发查询 arXiv / Semantic Scholar / OpenAlex / Crossref / DBLP / PubMed,每源默认 20 条、调研模式 50、上限 200;按 DOI→arXiv ID→规范化标题去重;质量分级 Q1–Q4(顶会白名单/引用数/年份/OA);支持按 ID、作者、年份、venue、类型定位;输出 kb/results/<run-id>.json + Markdown 简报 |
| paper-fetch | 由 DOI/arXiv ID/PMID/URL/标题定位;元数据丰富(作者机构、引用数、参考文献、OA 状态、PDF 链接)覆盖 Semantic Scholar、OpenAlex、Crossref、arXiv、PubMed、Unpaywall、DBLP 共 7 路,逐字段记来源;全文按 L1 arXiv → L2 开放获取 PDF → L3 期刊 HTML → L4 兜底检索 分级获取,记录命中级别;PDF 校验 %PDF- 文件头与 SHA-256 缓存;文本抽取失败时可降级到 HTML 或逐页图片转录(并标注非全文);L5 全失败如实报告,不用摘要冒充全文 |
| paper-learn | 对已有全文执行 8 步精读:TL;DR 与论文地图 → 动机 → 方法逐模块拆解 → 符号表与公式表 → 实验与消融解读 → 图表深读 → 批判性评估(6 维度打分)→ 关联与开放问题;关键论断附原文引号与章节定位;深度可选速览/标准/深度;产出 kb/notes/learn-<id>.md + “待验证问题”清单 |
| paper-reproduce | A 多视角总结(30 秒 / 学术 / 工程 / 教学 / 外行,可选单出);B 复现指南 8 步:官方资源定位(GitHub API / PapersWithCode / HuggingFace,区分 official 与 unofficial)、仓库健康评估、数据集与许可清单、环境与算力量级估算、P0–P5 五阶段计划(含验收标准)、逐条风险清单(论文未明说/代码缺失/环境差异/数据不可得),产出 kb/repro/repro-<id>.md;不假装跑过实验 |
| paper-kb | 本地知识库:meta.json + 主索引 index.json + papers/ 记录 + notes/ + repro/ + results/ + assets/ + bibtex/ + reports/;操作集 add(幂等合并)/ get(关键词·标签·领域·年份·venue·质量·状态)/ status 状态机(discovered→fetched→learned→reproduced,失败态带原因)/ dedupe(只给建议不自动删)/ export(BibTeX 与笔记合集)/ stats;每次变更后跑一致性校验 |
| 不包含 | 不生成 PPT/公众号排版;不做论文写作与投稿;不代替真实实验执行(复现指南是计划与证据,不是实验结论) |
知识库布局(工作区 kb/)
kb/
├── meta.json # 库配置
├── index.json # 主索引
├── papers/<id>.json # 论文标准记录(统一 Schema)
├── notes/learn-<id>.md # 学习笔记
├── repro/repro-<id>.md # 复现指南
├── results/<run-id>.json # 检索快照
├── assets/fulltext|pdfs/ # 全文与 PDF 缓存
├── bibtex/export.bib
└── reports/ # 统计与任务报告可靠性设计(“不允许出错”)
- 绝不编造:每个字段可溯源(source_url + fetched_at),缺失即 null;
- 独立故障域:任一数据源失败不影响其他源,失败源如实上报;
- 原子写与幂等:入库不覆盖旧数据,重复执行不产生脏数据;
- 诚实交付:总结标注“基于论文/⚠️推断”,复现指南从不假装跑过实验;
- 自带自测:
npm test(node dsh/self-test.mjs)校验 6 个技能 frontmatter、链接完整性、manifest,发布前置检查。
License
MIT
