多伦多大学Venkat Bhat:AI智能体如何安全接管心理健康临床工作流
一句话结论
多伦多大学 AI 心理健康项目负责人、精神科临床科学家 Venkat Bhat 用四组已发表成果证明智能体可以安全进入临床工作流:DSM 诊断访谈拆成提问、监督、跳转逻辑、编排诊断四个智能体角色并已在医院站点进入临床试验;环境式 AI 文书从非结构化对话自动生成 PHQ/GAD-7 量表并主动提醒医生补采;模拟病人与模拟医生互练帮助住院医提前获得问诊胜任力;系统综述流水线在特定环节自动化而不做端到端。所有系统的共同设计底线是:机器人在沙箱里扮演患者先验证有效,人在回路不可拆,临床试验是唯一准入标准。

讲者背景与方法论基石
Venkat Bhat 是多伦多大学精神科医生兼临床科学家,领导该校 AI 心理健康项目,同时担任全国 AI 医学中心(Temerty 中心)心理健康社区实践负责人,把全国各大学的对应力量组织在一起。他的研究兴趣有个特别的来路:AI 的很多发展本身就借鉴了人脑——深度学习对应皮层表征,强化学习对应皮层下结构——他项目里三分之一的工作是反向工程这些系统,而占三分之二的主体工作,是把临床工作流自动化,这也是本演讲的全部内容。
他的研究范式非常稳定,四域案例全部沿同一条路径展开:先锁定一个可能自动化的临床工作流,开发单智能体或多智能体系统,然后让机器人扮演终端用户,在沙箱环境和模拟中验证系统有效,最后进入临床试验。他反复强调自己的身份底色是临床试验主义者,默认立场是怀疑——「大多数这类东西不会按我们想象的方式起作用,但少数起作用的会带来变革性影响」。这句话是整场演讲的价值锚点。
三四年前的核心思考框架至今未变:把 AI 能力分为辅助式、协作式和半自主式三档,每一档都明确人在回路中的具体位置。这个「协作辅助半自主智能体」的定位是他所有系统的基石概念,后续每个案例都能回溯到这个分档。
临床诊疗:从AI文书到DSM诊断访谈
第一个落地案例直接改造讲者自己的日常门诊。心理健康领域的「测量式护理」相当于糖尿病之于血糖、高血压之于血压——医生需要患者定期完成 PHQ-9、GAD-7 等量表来跟踪病情,但二十多年来这些量表的执行率一直很低,病人和医生都嫌繁琐。团队的解法是让环境式 AI 文书(类似诊疗记录助手)从非结构化的问诊对话中直接生成量表分数,并在医生漏采关键信息时主动提醒补采。该系统已在合作医院站点通过 Epic 系统推进试验——选 Epic 这个载体说明它走的是真实临床信息系统的通道,不是实验室演示。

更复杂的是 DSM 诊断访谈自动化。团队把操作化的 DSM 标准(SCID 结构化临床访谈工具)拆成一个多智能体系统:一个智能体负责提问,一个监督智能体控制流程、不允许在模块未完成时跳到下一模块,一个处理 DSM 结构里的跳转逻辑,最后由编排/诊断智能体汇总判断。验证方式很硬核——让机器人扮演携带各种复杂 DSM 诊断的患者与系统对练,覆盖刁钻的共病组合,结果显示系统表现相当好。目前已进入临床试验,明确定位在轻中度症状人群,因为重度精神病、重度抑郁或阿尔茨海默患者无法有效使用这类工具——这是少见的、在设计阶段就写清楚适用边界的 AI 医疗系统。
医学教育:模拟病人训练问诊技能
第二个域解决住院医培养的老问题:临床问诊是医生的核心技能,只能通过反复练习和上级反馈获得,而真实练习机会稀缺、成本高。团队构建的多智能体系统里,机器人分别扮演患者、临床医生和需要学习问诊技能的住院医,完整模拟训练闭环。团队正在推动七个最大的临床培训项目部署该系统,采用对照设计:一臂按现行方式训练,另一臂增加 AI 模拟训练,验证住院医能否把五年培训压缩到三四年获得同等胜任力——用讲者的话说,这是在测「能力获取速度」本身。
同一套方法还有心理治疗训练变体:认知行为疗法和动机式访谈都能在框架内练习,像面对真实患者一样完成一次结构化心理治疗访谈。对教育资源紧张的中国医学院体系,这个模式有直接的参照价值:标准化病人(SP)培训的人力瓶颈,理论上可以由多智能体模拟大幅放宽。

科研与质量改进:系统综述与文献流水线
第三、第四个域面向研究者自身的工作流。系统综述与元分析目前要花研究助理数周时间逐篇比对文献数据、核对录入错误,团队没有追求端到端自动化,而是在流水线的特定环节(量化数据比对、质性主题分析)嵌入自动化,并用生成式 AI 的输出与人工金标准对照验证。结论有两条:在特定复杂度以内、特定工作流节点上的自动化是可靠的;这个结论在旧版 GPT 上成立,在新模型上同样成立——模型升级没有改变「哪些环节适合自动化」的边界。EEG 脑电数据处理也有对应的自动化探索,同样采用环节级嵌入而非整体替换。
质量改进案例来自疫情时期:针对临床医生的倦怠,团队用同一框架在机构层面做工作流自动化。讲者特别指出一个容易被技术团队忽略的点:工具在单个工作流上非劣效于人类还不够——变革管理、服务重设计、成本效益分析这些生态因素决定工具能否真正被采纳。所以他们的验证一律采用混合方法,把组织因素纳入评估。这一条对任何在企业里推 AI 工具的人都是提醒:你在流程上赢了,不等于你在组织里赢了。
给跨行业实践者的迁移框架
这套临床方法论对任何高风险行业的 AI 落地都适用,可以压缩成一个四步框架:先分档——辅助/协作/半自主,明确人在哪里介入,分档决定验收标准;再沙箱——用机器人扮演用户先验证,不直接上真人,心理健康场景里这个纪律尤其严格;后试验——用对照组证明有效再推广,接受「大多数会失败」的默认预期;全流程保底——人在回路不可拆,因为「非劣效」不等于「可采纳」,组织因素和临床效力同权重。讲者的诚实值得记录:他明确说这些系统大多数不会按想象起作用,但验证体系保证了少数有效者能被识别出来并放大——这比「AI 会颠覆医疗」的口号有用得多。

原文信息
- 原视频标题:Venkat Bhat - Agentic AI Applications for Mental Health: From Chatbots to Clinical Orchestration
- 频道:Berkeley RDI
- 讲者:Venkat Bhat(多伦多大学精神科医生、AI 心理健康项目负责人)
- 发布日期:2026-08-12
- 视频时长:约 13 分钟