完成学术研究全流程
academic-research-skills
学术写作全流程:查文献、写正文、多视角评审、改稿定稿,重点是逐条查引用真伪。

试试这样做
详细介绍
Academic Research Skills for Claude Code
一套完整的学术研究 Claude Code 技能包,涵盖从研究到论文出版的全流程。
30 秒安装(Claude Code CLI / VS Code / JetBrains,v3.7.0+):
/plugin marketplace add Imbad0202/academic-research-skills
/plugin install academic-research-skills
安装后运行 /ars-plan,ARS 会用苏格拉底式对话帮你规划章节结构。需要前置条件或传统 symlink 安装,请看 快速安装。
AI 是你的副驾驶,不是机长。 这个工具不会替你写论文。它处理繁琐工作:搜文献、排格式、验数据、查逻辑一致性。这样你就能专注在真正需要思考的事上:定义问题、选择方法、解读数据意义、写出「我认为」后面那句话。
和 humanizer 不同,这个工具不是帮你隐藏使用 AI 协作的事实,而是帮你把关文章质量。风格校准会从你过去的文章中学习你的声音,写作质量检查会识别让文字读起来像机器生成的模式。目标是质量,不是掩饰。
为什么选「人机协作」而不是「全自动」?
Lu 等人(2026,Nature 651:914-919)发表的 The AI Scientist 是第一个端到端全自动的 AI 研究系统,其生成的论文通过 ICLR 2025 workshop 的盲审(评分 6.33/10,workshop 平均 4.87)。他们自己的 Limitations 段落也列出了这类系统会遇到的结构性失败模式:实现错误、幻觉实验结果、取巧特征依赖、实现错误被包装成「意外发现」、方法论伪造、框架锁定、引用幻觉。
ARS 建立在这个前提上:人类研究者 + AI 的组合,比纯自动或纯人工更能避开这些失败模式。Stage 2.5 与 Stage 4.5 学术诚信闸门运行 7 类阻断式检查清单(见 academic-pipeline/references/ai_research_failure_modes.md),reviewer 也提供 opt-in 的 calibration mode 用用户提供的 gold set 测量 FNR/FPR。
Zhao 等人(2026-05)盘点了 arXiv、bioRxiv、SSRN、PMC 上 250 万篇论文中的 1.11 亿条引用,保守估计 2025 年单年就有 146,932 条幻觉引用,并观察到 2024 年中是上升的拐点;bioRxiv-to-PMC 这条配对的「预印本进入正式发表版本」幻觉存活率达 85.3%。他们把「真实引用被用来支撑被引文献其实没有提出的主张」描述为当前未解的问题。ARS v3.7.1 为来源 provenance 加上 trust-chain frontmatter,v3.7.3 为未来的 claim-level 审计铺设 locator 基础设施(三层引用 anchor),并在引用阶段呈现 advisory 风险信号(ARS 内部把这条 claim-faithfulness 缺口标记为「L3」,此为 ARS 的用词,不是论文的用词)。v3.7.x 的设计动机来自 Zhao 等人的 corpus-scale 发现;ARS 本身的 corpus-scale 评估仍是未来工作。
v3.8 补上 L3 缺口的另一半。v3.7.3 让每一条引用都带 locator anchor,v3.8 在这个基础上加一道 opt-in 审计(ARS_CLAIM_AUDIT=1):获取每个 anchor 指向的原始文本,判断论文里的 claim 是否真有被该引用支撑。五类新的 HIGH-WARN annotation(claim-not-supported、negative-constraint-violation、fabricated-reference、anchorless、constraint-violation-uncited)会在 formatter terminal hard gate 直接阻止输出。Calibration 随 release 提供 20 条 gold set,采用 FNR<0.15、FPR<0.10 双阈值;正式放大投入前要先有 calibration 证据(v3.8 spec §5)。
v3.3 的灵感来自 PaperOrchestra(Song, Song, Pfister & Yoon, 2026, Google):Semantic Scholar API 验证、反泄露协议、VLM 图表验证、分数轨迹追踪。
架构与 pipeline
👉 docs/ARCHITECTURE.md — 完整 pipeline 视图:流程图、阶段 × 维度矩阵、数据访问流、skill 依赖图、质量闸门、模式清单。
这份架构文档取代了原本散在 README 各处的 pipeline 描述。关于「哪个阶段跑什么」的所有信息都集中在一个地方。
快速安装
前置条件
- Claude Code(建议最新版;plugin packaging 需要近期版本)
- 已导出
ANTHROPIC_API_KEY,或在第一次运行claude时设置 - 选用: Pandoc 用于 DOCX 输出,tectonic + 思源宋体 TC 用于 APA 7.0 PDF(纯 Markdown 输出不需要这两者)
Plugin 安装(v3.7.0+,推荐):
/plugin marketplace add Imbad0202/academic-research-skills
/plugin install academic-research-skills
验证可用: 运行 /ars-plan 并描述你正在写的论文,ARS 会用苏格拉底式对话帮你规划章节结构。如果想做单次测试,可以运行 /ars-lit-review "你的主题"。
👉 docs/SETUP.md — 完整指南:安装 Claude Code、设置 API key、选用的 Pandoc/tectonic(DOCX/PDF)、跨模型验证(ARS_CROSS_MODEL),以及六种安装方式(Plugin、项目 skills、全局 skills、claude.ai Project、repo clone、Claude Science 导入)。
使用 Claude Science? 四个 skill 可直接导入:Skills → Import from GitHub,粘贴 https://github.com/Imbad0202/academic-research-skills,点 Preview,再点 Import 4 skills(需本 repo v3.14.0+——导入器读取 marketplace manifest 中显式声明的 skill 路径)。导入是一次性快照:ARS 更新后需重新导入。导入的 skill 承载 ARS 方法论(研究/写作/评审协议);Claude Code 专属机制——slash commands、hooks、subagent 编排——不会转移。详见 docs/SETUP.md Method 5。
用 Codex CLI? 请安装姐妹版:Imbad0202/academic-research-skills-codex。同一套 workflow 内容,Codex 原生打包为单一 $academic-research-suite skill,提供 ars-* 别名。
性能与费用
👉 docs/PERFORMANCE.md — 各模式 token 预算、完整 pipeline 估算(一篇 15k 字论文约 ~$4–6),以及建议的 Claude Code 设置(Auto 模式;Agent Team 选用)。
使用指南与文章
- 学术写作不该是一个人的事:一套开源 AI 协作工具如何改变研究者的工作流 — 完整使用指南(繁体中文)
- Academic Writing Shouldn't Be a Solo Act — Full pipeline walkthrough (English)
功能特色一览
- Deep Research — 13 个 Agent 的研究团队,支持苏格拉底引导、PRISMA 系统性回顾、意图检测、对话健康度监控、可选跨模型 DA、Semantic Scholar API 验证。
- Academic Paper — 12 个 Agent 的论文撰写团队,含风格校准、写作质量检查、LaTeX 输出强化、可视化、修订教练、引用格式转换、反泄露协议、VLM 图表验证。
- Academic Paper Reviewer — 7 个 Agent 的多视角同行评审,0-100 质量量表(主编 + 3 位动态审查者 + 魔鬼代言人),含让步门槛协议、攻击强度保持、可选跨模型 DA critique / calibration、R&R 追溯矩阵、只读约束。
- Academic Pipeline — 10 阶段全流程调度器,含自适应 checkpoint、主张验证、材料护照、可选
repro_lock、可选跨模型学术诚信验证、中途强化机制、分数轨迹追踪。 - 数据访问层级标注(v3.3.2+)— 每个 skill 声明
data_access_level(raw/redacted/verified_only),由scripts/check_data_access_level.py强制执行。设计灵感来自 Anthropic 的 automated-w2s-researcher(2026)。详见shared/ground_truth_isolation_pattern.md。 - 任务类型标注(v3.3.2+)— 每个 skill 声明
task_type(open-ended或outcome-gradable)。目前 ARS 所有 skills 皆为open-ended。 - Benchmark 报告 Schema(v3.3.5+)— JSON Schema + lint script,要求诚实的 benchmark 比较报告。详见
shared/benchmark_report_pattern.md。 - Artifact 可复现性 Lockfile(v3.3.5+)— Material Passport 添加可选
repro_lock子区块。是配置文档化,不是重播保证 — LLM 输出不是逐字节可复现。详见shared/artifact_reproducibility_pattern.md。 - 实验来源凭证登录(#260)— Material Passport 可选的
experiment_provenance[]记录研究者在外部跑过的实验(ARS 从不执行实验),论文主张通过claim_intent_manifest.planned_experiment_ids[]与之 join。诚信 gate(Stage 2.5/4.5)逐条比对实验支撑型主张与登录凭证 —ALIGNED/OVERSTATED/NOT_SUPPORTED_BY_PROVENANCE/PROVENANCE_INSUFFICIENT— 但不判定实验本身是否正确。fail-closed 的experiment_intake_declaration让「有没有跑实验」成为 Stage 1 明确决定。详见shared/handoff_schemas.md。
实际产出展示
查看完整 10 阶段 pipeline 的实际产出 — 包含同行评审报告、学术诚信验证报告、完稿论文:
| 产出物 | 说明 |
|---|---|
| 完稿论文(英文) | APA 7.0 格式,LaTeX 编译 |
| 完稿论文(中文) | 中文版,APA 7.0 |
| 学术诚信报告 — 审稿前 | Stage 2.5:发现 15 个虚构引用 + 3 个统计错误 |
| 学术诚信报告 — 最终 | Stage 4.5:确认零回归 |
| 同行评审第一轮 | 主编 + 3 审查者 + 魔鬼代言人 |
| 再审 | 修订后验证审查 |
| 同行评审第二轮 | 跟踪审查 |
| 回复审查意见 | 逐点回复 |
| 出版后审计报告 | 独立全引用审计:发现 21/68 篇问题,在 3 轮学术诚信审查后仍被漏掉 |
搭配工具:Experiment Agent
如果你的研究需要在写作前做实验(代码或人工研究),Experiment Agent 技能填补 ARS Stage 1(研究)和 Stage 2(写作)之间的空缺。
ARS Stage 1 研究 → RQ Brief + Methodology Blueprint
↓
experiment-agent → 运行/管理实验 → 验证结果
↓
ARS Stage 2 写作 → 用验证过的实验结果撰写论文
功能:执行代码实验(Python、R 等)并实时监控、管理人工研究 protocol 与 IRB 伦理审查、11 种统计谬误检测、可复现性验证。
搭配使用方式:ARS pipeline 完成 Stage 1 后暂停,在另一个 experiment-agent session 中执行实验,完成后将结果(含 Material Passport)带回 ARS Stage 2。ARS 不需要任何修改。详见 experiment-agent README。
使用方式
快速开始
# 启动完整研究 pipeline
你: "我想做一篇关于 AI 对高等教育质量保障影响的研究论文"
# 苏格拉底引导模式
你: "引导我研究 AI 在教育评估中的应用"
# 引导式论文撰写
你: "引导我写一篇关于少子化影响的论文"
# 审查现有论文
你: "帮我审查这篇论文"(接着提供论文)
# 查看 pipeline 进度
你: "进度" 或 "status"
个别 Skill 使用
Deep Research(深度研究,8 种模式)
"研究 AI 对高等教育的影响" → full mode(完整研究)
"给我一份 X 的快速摘要" → quick mode(快速简报)
"帮我做 X 的系统性文献回顾,含 PRISMA" → systematic-review mode
"引导我研究 X" → socratic mode(苏格拉底引导)
"帮我核查这些说法" → fact-check mode(事实核查)
"帮我做文献回顾" → lit-review mode(文献回顾)
"审查这篇论文的研究质量" → review mode(论文审查)
Academic Paper(学术论文撰写,11 种模式)
"帮我写一篇论文" → full mode(完整撰写)
"引导我写论文" → plan mode(引导规划)
"先帮我搭论文大纲" → outline-only mode(只做大纲)
"我有初稿,这是审稿意见" → revision mode(修订)
"帮我整理这些审稿意见成修订路线图" → revision-coach mode
"帮我写这篇的摘要" → abstract-only mode(摘要)
"把这批数据写成文献回顾论文" → lit-review mode(文献回顾论文)
"转换成 LaTeX" / "引用格式转 IEEE" → format-convert mode(格式转换)
"检查引用格式" → citation-check mode(引用检查)
"帮我生成 NeurIPS 的 AI 使用声明" → disclosure mode(AI 使用声明)
Academic Paper Reviewer(论文审查,6 种模式)
"审查这篇论文" → full mode(主编 + R1/R2/R3 + 魔鬼代言人)
"快速评估这篇论文" → quick mode(快速评估)
"引导我改进这篇论文" → guided mode(引导改进)
"检查研究方法" → methodology-focus mode(方法论聚焦)
"验收修订" → re-review mode(再审验收)
"用我的 gold set 校准 reviewer" → calibration mode(校准)
Academic Pipeline(全流程调度器)
"我想做一篇完整的研究论文" → 从 Stage 1 开始完整 pipeline
"我已经有论文,帮我审查" → 从 Stage 2.5 进入(先做学术诚信审查)
"我收到审稿意见了" → 从 Stage 4 进入
Pipeline 结束时自动产出 Stage 6:过程记录 — 含论文创建过程记录与 6 维度协作质量评估(1–100 分)。
支持语言
- 繁体中文 — 用户以中文对话时默认使用
- English — 用户以英文对话时默认使用
- 学术论文自动产出双语摘要(中文 + English)
使用其他语言? 苏格拉底模式(deep-research)和 Plan 模式(academic-paper)采用意图匹配启动 — 检测你的请求含义,而非比对特定关键字。这代表它们支持任何语言,无需额外设置。
不过,一般的
Trigger Keywords区块(决定 skill 是否被启动)仍以英文和繁体中文为主。如果你发现 skill 在你的语言下触发不稳定,可以在各SKILL.md的### Trigger Keywords区块中加入你的语言的关键字,提高匹配信心。
支持引用格式
- APA 7.0(默认,含中文引用规则)
- Chicago(Notes & Author-Date)
- MLA
- IEEE
- Vancouver
支持论文结构
- IMRaD(实证研究)
- 主题式文献回顾
- 理论分析
- 个案研究
- 政策简报
- 研讨会论文
Skill 详细信息
各 agent 的职责与各阶段产出物现已移至 docs/ARCHITECTURE.md。版本号保留在此以维持 release metadata 集中管理。
Deep Research (v2.11.0)
13 个 Agent 的研究团队。模式:full、quick、review、lit-review、three-way-scan、fact-check、socratic、systematic-review。完整 agent 名单与产出物:见 ARCHITECTURE.md §3。
Academic Paper (v3.2.0)
12 个 Agent 的论文撰写 pipeline。模式:full、plan、outline-only、revision、revision-coach、abstract-only、lit-review、format-convert、citation-check、disclosure、rebuttal-audit。输出:MD + DOCX(Pandoc 可用时)+ LaTeX(APA 7.0 apa7 class / IEEE / Chicago)→ tectonic 编译 PDF。完整 agent 名单与各 phase 职责:见 ARCHITECTURE.md §3。
Academic Paper Reviewer (v1.10.0)
7 个 Agent 的多视角审查,搭配 0-100 质量量表。模式:full、re-review、quick、methodology-focus、guided、calibration。决策对照: ≥80 接受、65-79 小修、50-64 大修、<50 退稿。第一轮审查团队 vs. 精简再审团队的分界:见 ARCHITECTURE.md §3 Stage 3 / Stage 3'。
Academic Pipeline (v3.19.0)
10 阶段调度器,含学术诚信验证、两阶段审查、苏格拉底指导、协作质量评估。Pipeline 保证:每个阶段都需用户确认 checkpoint;学术诚信验证(Stage 2.5 + 4.5)不可跳过;R&R 追溯矩阵(Schema 11)独立验证作者修订主张。v3.4 添加 Compliance Agent(PRISMA-trAIce + RAISE)于 Stage 2.5 / 4.5。v3.5 添加 协作深度观察员(collaboration_depth_agent,仅咨询性质、永不阻挡流程)于每一次 FULL/SLIM checkpoint 与 pipeline 完成时。MANDATORY 学术诚信闸门(2.5 / 4.5)明确跳过观察员,避免稀释合规检查。理论基础:Wang & Zhang (2026), IJETHE 23:11。逐阶段矩阵(agent、产出物、闸门):见 ARCHITECTURE.md §3。
v3.0 优化:我们发现了 AI 的哪些结构性限制
在使用 ARS 撰写一篇关于 AI 与高等教育的反思文章时,我们遇到了三个结构性问题:
- 框架锁定:AI 在给定框架内越来越精致,但无法质疑框架本身
- 谄媚倾向:每次挑战魔鬼代言人的攻击,它都让步得太快
- 意图检测错误:苏格拉底模式在用户仍在探索时就急着收敛
改了什么
- 魔鬼代言人让步门槛:反驳必须评分 1-5,≥4 才允许让步。不允许连续让步。框架锁定检测。
- 苏格拉底意图检测:检测用户是「探索型」还是「目标型」。探索型模式停用自动收敛。
- 对话健康度指针:每 5 轮后台自检,检测持续同意、回避冲突、过早收敛。
- 跨模型验证:设置
ARS_CROSS_MODEL激活第二 AI 模型独立审查。详见 docs/SETUP.md。 - AI 自我反思报告:Pipeline 结束后自动产出 AI 行为自评。
这些优化不能完全解决 AI 的结构性限制——它们让限制变得可见、可追踪、可被人类介入。
授权条款
本作品采用 CC-BY-NC 4.0 授权。
你可以自由:
- 分享 — 复制并分发本作品
- 改编 — 重混、转换、以本作品为基础进行创作
但须遵守以下条件:
- 署名 — 你必须给予适当署名
- 非商业性 — 你不得将本作品用于商业目的
署名格式:
Based on Academic Research Skills by Cheng-I Wu
https://github.com/Imbad0202/academic-research-skills