新一代心理聊天机器人——Woebot、Wysa、Earkick、Therabot、Replika 的"治疗模式"、直接拿 ChatGPT 当倾诉对象——正填补一个真实的可及性缺口。已经有 RCT 级证据证明它们有效。它们不是治疗师,也不适合走进真正治疗师诊室的所有人。证据现状 + 实用的分工。
证据走到哪了
目前最严格的试验是Therabot RCT(Heinz et al., NEJM AI, 2025):210 名有临床意义的抑郁或焦虑症状参与者,4 周聊天机器人 CBT 风格干预 vs 对照组。治疗组症状显著下降,幅度与短期面授 CBT 试验相当。亚组分析显示:原本不会去就诊的人群(成本、时间、污名)获益最显著,已在治疗中的作为辅助也有温和增益。
更早一代的 Woebot、Wysa 有小样本 RCT 与荟萃分析,对抑郁、焦虑症状显示温和获益,结构化 CBT 协议的最强。情绪追踪、每日签到、结构化思维记录带来真实附加价值。
当下真正有用的功能
- CBT 风格的思维记录——"这是认知扭曲吗?" 类练习是这类工具的强项,尤其在深夜真人治疗师不可及的时候。
- 情绪与焦虑追踪——每日签到构成有意义的趋势,看清模式就是干预的半壁江山。
- 行为激活——起床提醒、安排小胜、"今天一件想做的小事"提示,对抑郁有可测的效果。
- 睡眠卫生演练——引导式放松 + CBT-I 元素叠加在基础睡眠建议上有真实结果。
- 两次治疗之间的技能练习——对已在治疗中的人,作为"作业伙伴"表现不错。
- 匿名允许的"第一步"——对还未准备就医的人,聊天机器人是低成本、低风险桥梁。
它们真正做不到的
- 可靠评估自杀风险。各 App 的症状触发响应差异大,已有公开审计失败案例。若一个工具没有明确的危机处置流程、背后没有真人,那是硬上限。
- 诊断——双相、人格、复杂创伤、精神病性疾病——框架错了会真伤人的领域。
- 管药——SSRI、兴奋剂、心境稳定剂的启用、减量、剂量调整,需要医生判断与实验室监测。
- 取代危机安全计划。如果你正在危机中,请联系真人(全国心理援助热线 400-161-9995 等本地危机资源)。
- 真正的关系——治疗联盟本身就是治疗最强预测因子之一,恰好是 LLM 复制不了的。中重度抑郁、复杂哀伤、OCD、创伤——真人的证据基础仍更好。
怎么挑一款靠谱的
- 看在所宣称的特定人群中是否有发表证据——抑郁、GAD、失眠、酒精使用。没有证据只有营销是红旗。
- 读危机处置协议——如果你说"我在想自我伤害",工具不知道下一步是什么,就不该被包装成治疗产品。
- 读隐私披露——你的数据是否用于底层模型训练?是否出售?能否删除?医生被问最多的就是这几个问题。
- 看能否触达真人——更好的 App 会在输入提示风险时把你转给真人临床工作者。
- 警惕"AI 治疗师" 包装,"CBT-I 陪伴"或"焦虑技能训练"反倒是诚实的——准确描述是功能,不是限制。
一份实用的分工
用 AI 陪伴干:每日技能练习、情绪追踪、睡眠演练、低风险思维记录、两次治疗之间的家庭作业。找真人治疗师(或处方医生)干:任何可诊断的事;涉及用药的任何事;任何涉及主动风险的事;任何涉及创伤或复杂哀伤的事;任何经过几周努力反而在可测地变差的事。
两者不是竞争工具,而是互补。最实用的框架:聊天机器人是每天的练习 App,真人是每月见一次的教练。单独哪个都不够应对严重情况;两个合在一起好过任何一个。
底线
AI 心理聊天机器人对轻中度抑郁与焦虑症状已经真正有用,对本来就不会去就诊的人群尤其如此。2025 的 Therabot RCT 给了它们真实的临床合法性——但它们仍然不是治疗师。任何以"我是不是应该……"开头的问题;孕期或精神科用药期间;近一个月有过自我伤害想法——请与真人谈。除此之外,结构良好的聊天机器人是分层日常中一个合法的组成部分。