推出 NV-Reason-CT Open 3D CT VLM,实现放射科医生式思维链推理

邱宇AI 前沿📡 BestBlogs·AI高分精选⭐ 882026-09-24259 阅读💛 273 收藏
推出 NV-Reason-CT Open 3D CT VLM,实现放射科医生式思维链推理

📌 One-Sentence Summary

NVIDIA 推出 NV-Reason-CT,一款开放的 3D CT 视觉语言模型,将放射科医生风格的思维链推理、结构化报告生成和多轮对话引入体积 CT 分析,在 CT-RATE 基准测试上取得最先进的结果。

📝 Summary

NV-Reason-CT 是一款专为 3D CT 分析打造的开源研究基础模型,填补了通用 VLM 和现有医疗 AI 模型在体积成像方面的空白,并弥补了对话深度的不足。它将完整的 3D ViT 编码器(基于 Primus 适配,采用 Colipri 权重)与 Qwen3.5-4B 语言模型相结合,以 192³ 体素处理 CT 体积,使用 13,824 个视觉 token 和 3D MRoPE 进行空间推理。模型分两阶段训练:首先在约 550,000 个结构化问答样本上进行监督微调,这些样本带有专家放射科医生的思维链标注;随后进行带有解剖感知奖励的 GRPO 强化学习。在 CT-RATE 基准测试上,它取得了 Macro-F1 0.614 和 Macro-AUROC 0.871,超越了 3D 对比模型、融合 2D/3D 的 MLLM 以及基于切片的先进模型。它支持覆盖 30 种胸部异常和 29 种腹部异常的结构化报告生成、模拟放射科医生的推理轨迹以及多轮随访对话。NIH 放射科医生已验证其推理的临床合理性。该模型已在 Hugging Face 上发布,附带推理脚本和后训练方案,是 NVIDIA 医疗 AI 生态系统的一部分,与 NV-Generate-CTMR、NV-Segment-CTMR 和 NV-Reason-CXR 并列。

💡 Main Points

NV-Reason-CT 是一款专为 3D CT 打造的 VLM,将思维链推理扩展到体积成像,填补了以 2D 为主的医疗 AI 模型留下的空白。

标准 VLM 将 CT 视为一组独立的 2D 切片,丢失了对肿块和积液等结构至关重要的层间空间关系。NV-Reason-CT 通过专用的 3D ViT 编码器原生处理完整 3D 体积,保留解剖连续性并实现整体推理。

该模型生成结构化报告和模拟放射科医生的推理轨迹,使其结论可审计、可在临床上验证。

它产生逐步的内部思考,系统性地检查解剖区域、呈现发现、考虑鉴别诊断并阐明不确定性。这种透明度使放射科医生能够阅读思维链,识别与其自身推理的一致或分歧,并信任输出结果。

两阶段训练流程——先在约 550,000 个结构化问答样本上进行监督微调,再进行 GRPO 强化学习——实现了跨多样化 CT 表现的泛化能力。

第一阶段使用专家放射科医生的思维链标注和从 LLM 中蒸馏的合成推理数据。第二阶段使用解剖感知的 GRPO 奖励,强化每个解剖区域内的准确性,改善胸腹部发现分布上的校准,而无需详尽标注的推理链。

NV-Reason-CT 在 CT-RATE 基准测试上取得最先进的结果,超越了 3D 对比模型、融合 2D/3D 的 MLLM 以及基于切片的先进模型。

它达到了 Macro-F1 0.614 和 Macro-AUROC 0.871,超越了 VoxelFM(0.581/0.870)、Pillar-0(0.544/0.861)、ClinFusion-8B(0.442)、CT-CLIP(0.398/0.733)、Merlin(0.358/0.662)和 MedGemma 1.5(0.303)。它是首个同时实现具有竞争力的 CT 分类和报告生成的开放模型。

该模型定位为医疗 AI 社区的开放基础,提供检查点、后训练方案,并融入 NVIDIA 更广泛的医疗 AI 生态系统。

研究人员可以在机构特定数据集上进行微调,或将其集成到多模态流程中。它与用于合成数据的 NV-Generate-CTMR、用于分割的 NV-Segment-CTMR 以及用于胸部 X 光推理的 NV-Reason-CXR 形成互补,构成端到端放射 AI 流程的构建模块。

💬 Key Quotes

NV-Reason-CT 提供了那种系统性的、逐步的推理,反映了我们实际思考 CT 研究的方式。能够审查模型的思考过程——而不仅仅是其结论——正是让人有可能信任其发现并据此采取行动的原因。

该模型的设计目标不是作为分类器来回应,而是作为一位老师:解释问题、梳理证据,并通过可见的逻辑步骤得出诊断。

这是首次有单一开放模型同时实现具有竞争力的 CT 分类和报告生成。

📊 Article Meta

AI Screening: 88

Source: NVIDIA Technical Blog

Author: Tanya Lenz

Category: 人工智能

Language: 英文

Read Time: 9 min

Word Count: 2188

Tags:

AI 与智能应用 , 模型训练与推理 , 视觉语言模型 , 多模态 AI , AI研究前沿

#AI 与智能应用# 模型训练与推理# 视觉语言模型# 多模态 AI# AI研究前沿

文章评论(10

龙文博4 小时前

收藏了,以后慢慢研究。

回复
星寻梦5 小时前

刚好最近在找这方面的资料,太及时了。

回复
雪知秋5 小时前

这个观点很中肯,深有同感。

回复
杨丽华4 小时前

这个比较实用,已转发给同事。

回复
风倚栏2 小时前

楼主辛苦了,内容很有参考价值。

回复
星观澜3 小时前

楼主辛苦了,内容很有参考价值。

回复
墨沐雨1 小时前

作者写得真不错,学到了不少。

回复
星寻梦1 小时前

整理得太全面了,省了我不少时间。

回复
空向阳3 小时前

看标题就点进来了,内容果然没让人失望。

回复
墨沐雨2 小时前

这个观点很中肯,深有同感。

回复