AI 健康问答机器人横评:ChatGPT Health、Gemini 与临床工具(2026)

当 ChatGPT Health 已能对接 Epic、并接入越来越齐全的"官方"健康插件,加上 Google Gemini 系列与 Anthropic Claude 各自的医疗动作,问题不再是 AI 是否会出现在健康对话里,而是 哪一个属于你。我们用 30 道标准化健康问题(常见症状、罕见病、用药问题、化验解读、儿科指导)对四款主流模型做了正面对决。

四款模型

  • ChatGPT Health——OpenAI 医疗调优版,含 Healthcare Public Data 插件(连通 9 个官方数据源:ClinicalTrials.gov、PubMed、DailyMed、CMS Coverage 等),并可在 BAA 下选配只读接入 Epic。
  • Google Gemini(医疗微调)——配合搜索锚定,拉取实时网页引用。
  • Anthropic Claude(开启引用)——在测试中"我不知道"行为最强。
  • Microsoft Copilot(Bing Health)——大众覆盖面最广,网页锚定,但医疗护栏较轻。

测试方案:30 道标准化问题——急性 vs. 慢性、常见 vs. 罕见、有无相关上下文——按四个维度评分:依据性(断言是否有支撑)、引用(是否给出出处)、校准(是否知道自己的边界)、安全护栏(是否在适当时把你推向医生)。

结论

引用与出处

ChatGPT Health 在引用上取胜。开启 Healthcare Public Data 插件后,几乎每条临床断言都能指向 PubMed、DailyMed 等官方源。Gemini 的网页引用可靠但略杂乱。Claude 行内引用较少但给出的都精准。Copilot 最松——引用常指向质量参差的消费级健康内容。

罕见病与覆盖面

Gemini 处理罕见病表现最佳——训练更广、实时网页锚定让它能浮现 ChatGPT 偶尔漏掉的稀有鉴别诊断。但广度是把双刃剑:Gemini 有时罗列过全,不做清晰排序。

校准:知道自己不知道

Claude 最保守——最常说"我不确定,这该问医生"。普通用户可能觉得不够爽,但极大降低把幻觉当真去做的概率。ChatGPT Health 排第二,尤其是插件找不到出处时。Gemini 与 Copilot 最容易过度自信地外推。

化验解读

四款在脱离上下文的化验数值上都吃力。没有你的完整病史,任何模型都会对临界值凭空生成解释。这些工具不应单独用来解读你自己的化验;用专门的化验单解读工具或你的医生。

安全护栏

四款都附带"非医疗建议"提示。ChatGPT Health 与 Claude 在出现警示症状时最一致地建议就医。Copilot 在问题含糊时偶尔滑入过度自信的答案。

它们不是什么

  • 不是诊断工具。OpenAI、Google、Anthropic 都明确声明。
  • 不是处方工具。不要按聊天机器人的答案改药或调量。
  • 不是有完整病历的临床医生的替代。ChatGPT Health 的 Epic 集成是只读,且需要 SSO 与 BAA 控制。

不同场景该选谁

  • 需要出处的快速查询——开插件的 ChatGPT Health。
  • 罕见病或最新研究的广撒网——带网页锚定的 Gemini。
  • 准确性优先于覆盖度——开启引用的 Claude。
  • 日常"这是什么症状"——任选其一,同样 caveat。
  • 读自己的化验——都不是;用专门的化验单解读工具或问医生。

底线

2026 这一代健康聊天机器人作为思考伙伴确实有用——擅长归纳指南、比较选项、帮你为下次就诊准备问题。它们不是医生、不是诊断、不是治疗。最值得选的那一款,是最清楚告诉你"我的答案到哪为止,下一步该交给你和医生"的那一款。

← 返回数字工具评测