ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

6大文献库并行检索:ResearchStudio paper-search实用指南(arXiv、OpenReview、Semantic Scholar一站查全)

6大文献库并行检索:ResearchStudio paper-search实用指南(arXiv、OpenReview、Semantic Scholar一站查全) 6大文献库并行检索ResearchStudio paper-search实用指南arXiv、OpenReview、Semantic Scholar一站查全【免费下载链接】ResearchStudioResearchStudio: Our AI co-author, from research problem to final publication.项目地址: https://gitcode.com/gh_mirrors/re/ResearchStudio还在为了查一篇论文在 arXiv、Google Scholar、Semantic Scholar 之间来回切换吗ResearchStudio的paper-search文献检索技能让你一句话同时搜遍arXiv、OpenReview、Semantic Scholar、OpenAlex、DBLP、Crossref六大文献库——6个数据源在独立子进程中并行检索结果自动去重、按相关度排序再由 AI 通读摘要做语义过滤最后输出一张可直接写进 related work 的论文清单和趋势分析。本文将带你快速上手这个「一站查全」的文献检索工具。什么是 paper-search六大文献库一次并行paper-search 是 ResearchStudio-Idea 内置的技能之一技能说明见 SKILL.md。核心入口是聚合脚本 search_papers.py每个数据源对应一个独立连接器文献库源名称连接器脚本特点arXivarxivsearch_papers_by_arxiv.py预印本最新最快Semantic Scholarsemantic_scholarsearch_papers_by_semantic_scholar.py引用数据丰富OpenAlexopen_alexsearch_papers_by_open_alex.py开放学术图谱OpenReviewopenreviewsearch_papers_by_openreview.pyNeurIPS / ICLR / ICML 顶会论文Crossrefcrossrefsearch_papers_by_crossref.pyDOI 与期刊覆盖广DBLPdblpsearch_papers_by_dblp.pyCS 领域索引权威模型知识model_knowledge—无 APILLM 记忆补充经典论文所有源默认并行各自运行在独立子进程中某个源超时或报错只影响自己其余源继续返回结果——速度最大化的同时天然容错。快速上手3 步完成首次文献检索第 1 步克隆仓库git clone https://gitcode.com/gh_mirrors/re/ResearchStudio cd ResearchStudio第 2 步安装依赖按 README.md 的 Quick Start 先建一个 Python ≥3.10 环境然后运行 install.sh 一键安装bash install.sh OpenReview 源需要额外执行pip install openreview-py缺了也只是该源跳过不影响其他 5 个库。第 3 步执行检索对 AI 助手说人话即可例如帮我找 2024 到 2026 年关于 diffusion policy for robotics 的论文。助手会自动推断查询词、年份范围默认最近 2 年、每源返回条数默认 10 篇并立即执行。想手动运行 CLI只需记住基础命令骨架参数详解见下文速查表python ResearchStudio-Idea/skills/paper_search/scripts/search_papers.py \ --query diffusion policy robotics \ --start-year 2024 --end-year 2026 --max-papers 10核心功能详解多查询并集检索一个主题多个关键词同一个概念往往有多种叫法。用--queries传入竖线分隔的多个短语每个查询都会打到每一个数据源结果自动取并集、去重并统一排名python $SEARCH \ --queries diffusion watermarking|latent-space watermark|generative model IP protection \ --start-year 2024 --end-year 2026这对做「先例检索prior art check」特别有用——换个说法的相关工作不再漏网。自动去重 相关度排序一份干净的清单后处理逻辑集中在 postprocess.py设计原则是「去重不丢信息」跨源重复论文按 DOI → arXiv ID → 归一化标题三级匹配合并为一条记录保留最高信号源的字段、取最大引用数并标注Sources:来源每篇论文都带一个对查询词的词汇相关度分Score按分数从高到低排序标题带 survey/review 的论文打[survey]标签、下沉到底部但永不删除。语义相关性过滤AI 读懂摘要再筛关键词打分「会排序但不懂含义」——一篇讲生成模型知识产权保护的论文对watermarking查询可能得分 0却恰是最接近的先例。因此每次检索都会强制运行Step 1.5 语义过滤由正在运行的模型逐篇通读--json文件中的摘要对照你的原始问题判断相关/不相关且「拿不准就保留」。被过滤的数量会如实显示在结果头部例如per-source hits: semantic_scholar10, open_alex10, arxiv10 … · 22 unique (8 duplicates merged) · 5 filtered as irrelevant模型知识补充帮你找回「人人都知道」的经典论文API 检索有两类固有盲区① 实践者常引但关键词搜不到的早期奠基论文比如你查的是某个 BERT 变体却漏了原版 BERT② 索引覆盖不佳的跨学科经典。model_knowledge源会从模型记忆中补上 5–10 篇去重后单独列出并诚实标注(uncertain — verify)宁缺毋假。参数速查表参数作用默认值--query单查询检索词必填或用--queries--queries多查询并集\|分隔—--start-year/--end-year年份窗口最近 2 年 / 今年--max-papers每个数据源返回条数10--sources限定数据源如arxiv openreview semantic_scholar全部 6 个--min-score N可选噪声过滤丢弃相关度 N 的论文并打印丢弃数不过滤--json path导出含摘要的完整 JSON语义过滤依赖它也是回溯兜底无--raw恢复按数据源分组的原始视图统一排序视图--no-parallel源间串行执行极少需要并行进阶场景直接调用search_papers()函数、HTTP 超时环境变量配置等可参考 programmatic_api.md。结果如何呈现从论文表格到趋势分析检索完成后你会得到两份内容技能会同时完整展示并写入allinone.md统一论文表格| # | Title | Date | Venue | Citations | Score | Sources |已去重、已按相关度排序survey 论文沉底综合摘要固定 7 个板块Overview查询概览→ Trends时间趋势/主导会议/实验室→ Key themes3–6 个主题簇→ Keywords frequency高频技术词 Top5→ Most cited by accepted paper高引论文 Top5→ Most cited by first author高产作者 Top5→Recommendations for reading按「奠基 → 最新」排好的阅读路径推荐。也就是说你拿到的不只是一个列表而是一份半成品文献综述。paper-search 在 ResearchStudio 全流程中的位置paper-search 是 ResearchStudio「从研究问题到最终发表」工作流的地基Idea 侧的 IdeaSpark 用它做文献定位与新意核查再产出可被审稿人质疑的 idea card。下图展示了 IdeaSpark 与裸模型的 novelty–quality 评测对比可见扎实的文献基础带来的增益在分领域维度上IdeaSpark 的质量分在大多数研究方向上都显著高于基线常见问题 FAQQ1某个源失败了会影响整体吗不会。每个源跑在独立子进程里超时默认连接 15s / 读空闲 300s或 429/5xx 会做有限重试最终仍失败时只打印该源错误其余源照常返回。Q2能只查顶会吗可以。OpenReview 连接器默认覆盖 ICLR / NeurIPS / ICML 近几年的会议见 search_papers_by_openreview.py配合--sources openreview即可只查顶会。Q3为什么建议总是加--json语义过滤依据的是摘要而摘要只存在于 JSON 文件中、不会打印到终端它同时也是「过滤误杀」时的完整兜底记录。Q4想调超时可以吗可以。通过PAPER_SEARCH_TIMEOUT_SECONDS、PAPER_SEARCH_MAX_ATTEMPTS等环境变量配置按源覆盖示例PAPER_SEARCH_OPEN_ALEX_TIMEOUT_SECONDS。相关文件与延伸阅读技能总说明SKILL.md聚合入口search_papers.py去重与排序后处理postprocess.py程序化 API 参考programmatic_api.md项目总览README.md一条命令六大文献库并行开火 。下一次做 related work、查先例、或者只想快速摸底一个方向近两年的进展交给 ResearchStudio paper-search 吧。【免费下载链接】ResearchStudioResearchStudio: Our AI co-author, from research problem to final publication.项目地址: https://gitcode.com/gh_mirrors/re/ResearchStudio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表