AI 研究助手对比:
Elicit、Consensus、Scite 和 Semantic Scholar

文献综述是任何研究项目中最耗时的阶段——也是过去两年 AI 工具取得最显著进展的领域。目前有四款平台主导 AI 研究助手领域:Elicit、Consensus、Scite 和 Semantic Scholar。每款都以不同的方式解决这个问题——从语义搜索到引文分析再到自动化系统综述。在对所有四款工具进行真实研究任务测试后,这里是每一款的闪光点、不足点,以及哪款工具适合你的工作流。

选手介绍:每款工具真正做什么

这些工具不可互换。每款都围绕不同的核心能力构建:

  • Elicit——由机器学习研究实验室 Ought 构建。Elicit 的核心能力是跨论文自动数据提取。提出研究问题后,Elicit 找到相关论文并自动填充一个包含提取数据点(样本量、效应量、人群、干预、结果)的表格。专为系统综述和荟萃分析设计,用于在同一维度上比较数十篇论文。
  • Consensus——使用在科学论文上微调的专有大语言模型,通过综合跨文献的发现来回答研究问题。其标志性功能是"共识计"——一个可视化摘要,显示相关论文支持、反对或中立的比例。为快速证据检查设计:"维生素 D 补充剂能减少新冠严重程度吗?"
  • Scite——唯一专注于引文上下文分析的工具。Scite 不仅告诉你一篇论文被引用了 200 次——它将每次引用分类为支持对比提及该引用主张。这是用来检查一个发现是否已被复制或驳斥的工具,而不仅仅是看论文有多受欢迎。
  • Semantic Scholar——四者中最学术的。由 Allen Institute for AI 构建,索引超过 2 亿篇论文,提供 AI 驱动的功能,包括TLDR 摘要(一句话论文总结)、引文图可视化和基于你图书馆推荐新论文的"研究资讯"。这是最全面的索引,但在回答特定研究问题时自动化程度最低。

横评:测试结果

我对所有四款工具进行了三项真实研究任务测试:

任务 1:查找特定临床问题的证据

"HRV 生物反馈是否能减少成年人的焦虑症状?"

优胜者:Consensus。共识计立即显示 78% 的相关论文支持该主张,并链接到 15 项研究。Elicit 返回了好的结果但需要更多手动配置提取列。Scite 显示了有用的引文模式但没有直接回答问题。Semantic Scholar 返回了最多论文(94 条结果)但需要手动筛选。

任务 2:检查某论文的发现是否被复制

"Thayer & Lane(2009)建立的 HRV-压力关系是否被后续研究支持?"

优胜者:Scite。Scite 的引文分类显示 89% 支持引用、3% 对比、8% 提及——附有链接到每篇引用论文的具体上下文。没有其他工具提供这种水平的引文分析。Consensus 可以总结一般证据但不追踪特定论文的引用历史。

任务 3:从 30+ 篇论文中提取结构化数据用于荟萃分析

"从数字 CBT 治疗焦虑的 RCT 中提取样本量、干预类型、结果指标和效应量。"

优胜者:Elicit。Elicit 的自动提取表对 30 篇论文中的 28 篇自动填充了列,准确度合理。仍需手动验证(约 15% 的提取值需要纠正),但相比手动提取节省了约 80% 的时间。没有其他工具提供可比较的结构化提取。

定价与可及性(2026 年)

  • Elicit:免费层级(有限查询),Plus($10/月,无限查询、高级筛选),Pro($50/月,系统综述功能、团队协作)
  • Consensus:免费层级(20 次查询/月),Premium($12/月,无限查询、共识计、研究快照),Teams($15/用户/月)
  • Scite:免费浏览器扩展,Individual($12/月,无限报告、引文陈述),Institutional(大学定制价格)
  • Semantic Scholar:完全免费。无付费层级。由 Allen Institute for AI 资助。

何种任务用何种工具?

使用场景 最佳工具
快速证据检查一个主张 Consensus
系统综述/荟萃分析数据提取 Elicit
检查发现是否被复制或驳斥 Scite
广泛文献搜索与发现 Semantic Scholar
追踪领域最新研究 Semantic Scholar
新主题的文献综述(概览) Consensus + Elicit

每个用户应知的局限性

这些工具强大但并非万无一失:

  • 覆盖缺口。所有四款工具主要索引英文同行评审期刊文章。灰色文献(预印本、会议论文、政府报告、学位论文)覆盖不统一。如果你的领域严重依赖非期刊来源,请用 Google Scholar 补充。
  • AI 提取的数据需要验证。Elicit 的提取准确率(在我的测试中约 85%)意味着大约每 7 个提取值中就有 1 个是错误的。对于粗略的文献综述,这可以接受。对于系统综述或临床指南,每个值都必须手动验证——工具加速提取但不替代验证。
  • "证据综合"幻觉。Consensus 的摘要声明是 AI 生成的综合,不是系统综述。共识计显示的是返回论文中支持某一主张的比例,而非所有证据中支持该主张的比例。发表偏倚、搜索偏倚和语言偏倚都会影响该指标。将其视为有用信号,而非科学结论。
  • 引用计数作为质量代理。Scite 的支持/对比分类是一项突破,但引文上下文分类本身就是一个有错误率的 AI 模型。一篇有 50 个"支持"引用的论文仍可能是错误的;科学界有时在纠正错误之前会先收敛于错误。

总结

对于大多数个人用户,Consensus + Semantic Scholar 是最实用的组合——Consensus 用于快速证据检查和主张验证,Semantic Scholar 用于广泛发现和追踪最新研究(而且免费)。进行系统综述的研究者应添加 Elicit 用于结构化数据提取。任何追踪特定发现随时间推移是否成立的人都应使用 Scite 进行引文上下文分析。这些工具是互补而非竞争的——每款解决研究工作流的不同部分。真正的生产力提升不在于选一个,而在于知道在每个阶段用哪个工具。

← 返回 数字工具评测