研究人员延伸路线(For Researchers)¶
📌 这条路帮你做什么¶
这页不是让 AI 替你当研究者,而是帮你找到资料、看懂资料,再确认答案确实有资料支持。 - 会用终端或 Python:完成 Track A 的 A3 或 Track B 的 Stage 7 后再来。 - 不写代码:直接做下面的第一个练习,只需浏览器和一篇公开 paper。
🎯 学习目标¶
完成这一页后,你可以: 1. 分清“AI 说了什么”和“原文写了什么”。 2. 逐条核对引用来源,而不是看到引用编号就相信。 3. 知道哪些数据可以上传,哪些要先问机构或数据拥有者。 4. 保存足够记录,让自己或同事能重新做一次。
🧩 八个核心词¶
- Source(来源):用来查证的原始材料,如 paper、数据集或研究记录。
- Claim(主张):可检查的说法,例如“方法 A 在数据集 B 上更好”。
- Citation(引用):带你回到来源位置的路标,不保证来源真的支持主张。
- Source Verification(来源核对):打开原文,检查内容、范围与限制是否和答案一致。
- Literature RAG(文献 RAG):先从获准使用的文献找片段,再交给模型回答。
- Reproducibility(可重复性):别人拿到数据、步骤、版本与设置后,可以重新跑出可比较结果。
- Private Data(私人资料):不能任意公开或上传的内容,如受试者数据、病历、未公开手稿和公司机密。
- Human Review(人工审查):由人对 claim、citation、代码、表格和最终决定负责;AI 不能替你签名或承担责任。
🛠 第一个练习:核对一篇 paper 的三个答案¶
上传前先确认许可或版权与工具条款都允许。paper 公开可读,不代表可以交给另一个服务。
使用公开 paper:Attention Is All You Need。把 paper 加到能显示 citation 的工具,再复制:
请只根据这篇 paper 回答下面三题。每个答案都要附 citation;找不到证据就写“unsupported/未支持”,不要猜。
1. 这篇 paper 想解决什么问题?
2. 作者提出的方法包含哪些主要部分?
3. 作者用哪些实验支持结果,又说了哪些限制?
回答后,列出每个 citation 对应的 original text。不要把你的推测写成作者的 claim。
📚 先选一个入口¶
| 你想做什么 | 先用什么 | 为什么 | 推荐度 |
|---|---|---|---|
| 用浏览器问一篇 paper | Gemini Notebook(原 NotebookLM) | 上传来源后可从 citation 回到原文 | ⭐⭐⭐⭐⭐ |
| 整理自己的文献库 | Zotero | 先整理 PDF、作者、年份和笔记 | ⭐⭐⭐⭐⭐ |
| 用 Python 做可重跑的文献 RAG | PaperQA2 | 以科学文件和引用为中心 | ⭐⭐⭐⭐⭐ |
Gemini Notebook 是 Google 于 2026-07-16 为 NotebookLM 使用的现行名称;旧名称仅用于辨识。citation 是查证入口,不保证答案正确。
📖 必读材料¶
按顺序阅读。前两份提醒你不要把 citation 当保证,后四份帮助保存来源、代码、数据和研究成果: 1. Gemini Notebook citation 说明:点 citation 回到原文并读完整上下文。 2. Gemini Notebook 隐私与使用条款:上传前了解数据怎样被处理。 3. Zotero 快速入门:整理作者、年份、PDF 和笔记。 4. PaperQA2 README:了解文献 RAG 如何把回答连回文件。 5. DVC 常用流程:用 Git 管理数据版本和可重跑 pipeline。 6. Zenodo 快速入门:将可公开的数据、代码或材料保存成可引用版本。
⭐ 精选研究工具与项目¶
工具名称、授权与 repository 状态于 2026-08-29 UTC 依据官方页面与 GitHub API 核查。推荐度是本学习地图的编辑评分,不是 GitHub stars 或排行榜。
| 分类 | 官方工具/项目 | 适合做什么 | 状态/授权 | 先知道的限制 | 推荐度 |
|---|---|---|---|---|---|
| 开始与整理 | Gemini Notebook(原 NotebookLM) | 用来源问答并回到 citation | 正式可用;云服务 | 引用仍要逐条核对;私人数据先看政策 | ⭐⭐⭐⭐⭐ |
| Zotero | 管理 PDF、metadata、笔记与引用 | 正式可用;桌面/Web | 解决来源管理,不替你判断研究质量 | ⭐⭐⭐⭐⭐ | |
| Future-House/paper-qa | 用 Python 建立 citation-grounded literature RAG | 活跃;Apache-2.0 | 需设置模型与文献来源,质量仍要自行评测 | ⭐⭐⭐⭐⭐ | |
| 探索与写作 | assafelovic/gpt-researcher | 多来源搜索与 research brief | 活跃;Apache-2.0 | 适合找候选来源,不是引用正确性的最后裁判 | ⭐⭐⭐⭐ |
| stanford-oval/storm | 整理多种观点,再写大纲与长文 | 可用;MIT;更新较慢 | 使用前确认依赖与数据来源仍兼容 | ⭐⭐⭐⭐ | |
| kaixindelele/ChatPaper | 中文 paper 摘要、翻译与写作辅助 | 可用;CC BY-NC-ND 4.0 | 禁止商业使用与改作,不是一般开源程序授权 | ⭐⭐⭐⭐⭐ | |
| MuiseDestiny/zotero-gpt | 在 Zotero 中与文献互动 | 可用;AGPL-3.0 | 插件与模型设置要另外维护 | ⭐⭐⭐⭐ | |
| 可重复与证据 | asreview/asreview | 用 active learning 辅助系统性回顾筛选文献 | 活跃;Apache-2.0 | 排序能省时间;纳入/排除理由仍需人工筛选并记录 | ⭐⭐⭐⭐ |
| treeverse/dvc | 保存数据版本、模型和可重跑 pipeline | 活跃;Apache-2.0 | 需要 Git 与数据存储位置;版本不证明结论正确 | ⭐⭐⭐⭐⭐ | |
| mlflow/mlflow | 记录每次 run 的参数、指标、数据和产物 | 活跃;Apache-2.0 | 有记录不等于实验有效;不要把密钥或受试者数据写入 tracking | ⭐⭐⭐⭐⭐ | |
| Zenodo | 保存并发布数据、代码和研究材料,取得 DOI | 正式可用;云服务 | metadata 会公开;私人资料按机构规则去标识或使用核准环境 | ⭐⭐⭐⭐⭐ | |
| jupyterhub/repo2docker | 从 repository 设置重建可运行研究环境 | 活跃;BSD-3-Clause | container 能保存环境;仍需另存数据、硬件需求与外部服务 | ⭐⭐⭐⭐ | |
| 研究自动化 | flonat/flonat-research | 参考研究 skills、agents、hooks 与 LaTeX 流程 | 活跃;MIT | 基础设施示例,不适用于所有领域 | ⭐⭐⭐ |
| SakanaAI/AI-Scientist-v2 | 研究端到端 multi-agent 实验架构 | 研究参考;custom source-code license | 授权要求披露机器生成的科学稿件;作者仍要人工审查并负责 | ⭐⭐⭐⭐ | |
| 历史 | langchain-ai/open_deep_research | 阅读早期 deep-research agent 架构 | 已封存;MIT | 只作历史参考,不是新项目的现行默认 | ⭐⭐⭐ |
✅ 完成检查与下一站¶
- 我核对了三个答案,不只看 citation 编号。
- 我找到一个“原文支持”或“未支持”的例子。
- 我没有上传未获允许的 Private Data。
- 我保存了来源、问题、工具名称、日期与自己的判断。
下一站:想做文献 RAG,走 Stage 6;想让多个 agent 分工,走 Stage 7;想连接外部工具,看 MCP/Skills catalog。
⏱ 展开:时间、账号、费用与数据安全
第一个练习约需 20–40 分钟。私人数据先停下确认 IRB、机构政策、合约、数据拥有者同意与工具条款。Gemini Notebook 隐私说明称,一般内容不会直接用于训练基础模型,除非用户选择提供 feedback;feedback 可能连同内容交由人员查看。这不等于研究资料自动获准上传。付费功能、配额与机构账号规则会变化,开始前查看官方页面,不保存容易过期的固定价格。
🧪 展开:把单篇练习变成可重跑研究流程
文献 inbox¶
保存 DOI、URL、作者、年份与取得日期;让工具生成摘要但把每个 claim 连回原文;由人工决定“阅读、排除、待确认”并记录理由。
跨 paper synthesis¶
先问每篇 paper 各自说什么,再比较同意、冲突和不同条件。不要先要求模型写完整故事,再回头找引用。
代码与实验¶
保存数据版本、environment、seed、prompt、模型/工具版本、输出与人工修改。能重新执行不代表结论正确,但没有记录更难找到错误。
投稿前¶
逐一核对 claim、citation、表格、图、代码与期刊规范;作者仍须最后判断并按期刊政策披露 AI 使用。
🧯 展开:常见错误、替代方案与排错
| 问题 | 先怎么做 |
|---|---|
| citation 不支持答案 | 标为未支持,缩小问题,不要硬补相关引用 |
| 工具读不到扫描 PDF | 先做 OCR,再抽查页码与公式 |
| 多篇 paper 结论混在一起 | 要求每个 claim 列 paper 名称、页码或段落,再 synthesis |
| 数据不能上传云端 | 使用机构核准环境;必要时看 Stage 6 的本机 RAG 路线 |
| 自动化太复杂 | 回到“一篇 paper、三个问题、逐条核对” |
没有工具能代替 IRB、数据治理、作者责任或领域专家判断。