放射学人工智能在识别胸部X光片、病理切片和2D扫描中的异常方面取得了显著进展。然而,临床价值最丰富、数据密度最大的成像模态之一——三维计算机断层扫描(CT)——却一直未能得到现代视觉语言模型的充分支持。前沿通用大模型在体积成像上表现不佳,而大多数开源医疗AI模型也缺乏放射科医生信任并验证AI生成结果所需的多步骤对话深度。
NVIDIA正在通过NV-Reason-CT填补这一空白,这是一款专为3D CT分析打造的视觉语言模型。NV-Reason-CT将思维链推理扩展到完整的体积CT分析中,能够生成结构化诊断报告,模拟放射科医生的内在思考过程,并支持针对胸部和腹部的多步骤后续对话。该模型基于NV-Reason-CXR开创的推理方法构建,并已在被RSNA 2026接收的多位读片医生临床研究中得到验证,证实其可在保持诊断准确性的同时节省放射科医生的时间。
NV-Reason-CT是一个开放的研发基础模型,并非自主诊断系统,也未获得临床产品认证。它是一个AI基础模型,旨在为研究人员和开发者提供构建专业CT分析应用的基础,供其针对具体使用场景进行后训练。
为什么3D CT推理需要不同的方法
一次腹部CT扫描可能包含300至600张轴向切片,编码了三个空间维度上的解剖学信息,而标准的2D编码器根本无法从独立的切片中重建这些信息。
这种体积复杂性给医疗AI带来了一系列叠加的挑战,涉及感知、推理和对话深度:
感知方面:标准视觉语言模型将图像输入视为2D Token网格。将CT体积作为一系列独立的2D帧处理,会丢失切片之间定义肿块、积液和浸润等结构的空间关系——这些结构的形状、范围和密度只有在三维空间中才具有临床意义。
推理方面:即使模型正确感知到了异常,往往也只是输出一个诊断标签而不阐述原因。放射科医生的思考方式并非基于标签,而是基于系统的解剖学审查、鉴别诊断和置信程度。如果一个AI无法重现这一推理过程,就无法被审核、无法用于教学,也无法安全地融入临床工作流程。
对话深度方面:放射科医生在审查一个可疑发现时,不会仅看一眼就下结论。他们会提出后续问题、重新考虑鉴别诊断,并将不同解剖区域的发现相互关联。大多数现有模型缺乏支持这种迭代式临床推理所需的多轮对话能力。
为CT分析提供完整的3D推理能力
NV-Reason-CT将专用的全3D视觉Transformer编码器与经过训练能够生成思维链推理的语言模型相结合,其推理方式模拟了放射科医生系统分析CT体积数据的过程。
与将2D编码器改造为处理独立切片的CT分析方法不同,NV-Reason-CT将CT体积作为真正的3D输入进行处理。这保留了跨切面的解剖连续性,使模型能够像放射科医生浏览检查结果时那样,对结构进行整体推理。
核心模型能力包括以下几个方面:
结构化报告生成:NV-Reason-CT能够生成详细的结构化报告。NVIDIA团队整理了一套涵盖30种胸部异常和29种腹部异常的CT本体论体系,用于指导和评估模型——包括肺结节、气胸、肝脏病变、肾囊肿等——生成的报告格式能自然地融入临床文档工作流程。
模拟放射科医生的思维链:NV-Reason-CT还能生成模拟放射科医生思维链的推理内容。该模型以经验丰富的放射科医生分析检查结果的方式,产生逐步的内在思考——系统性检查解剖区域、呈现相关发现、考虑鉴别诊断,并表达不确定性。
多步骤对话式后续追问:临床医生和研究人员可以针对具体发现提出后续问题,要求对鉴别诊断进行澄清,或在任何阶段深入探究模型的推理过程。这种多轮对话能力使NV-Reason-CT从一个报告生成器转变为一个交互式诊断伙伴。
全3D视觉Transformer编码器:一个专门构建的3D视觉编码器能够原生处理CT体积数据,提取基于2D方法无法恢复的体积特征。此外,3D视觉Token网格坐标会被传递给大语言模型,通过3D MRoPE机制,使大语言模型各层能够考虑Token间的空间关系。这种架构选择使模型能够对空间范围、横截面形态和切片间关系进行推理——这些正是准确解读CT图像的感知基础。
NV-Reason-CT的架构如何为体积推理量身定制
该模型架构将Qwen3.5-4B大语言模型与3D视觉Transformer(Primus/Colipri)相结合。所有权重都在大规模队列或CT数据上进行端到端重新训练,训练数据包括结构化报告、推理轨迹和内部设计的多步骤视觉问答。标准的基于Transformer的视觉语言模型是为2D图像设计的。通过将体积数据展平为一系列2D切片来适配CT分析,会丢失定义体积病理特征的空间结构。
该编码器架构改编自Primus 3D视觉Transformer,在训练前使用Colipri权重进行初始化;它处理经重采样至192?体素、分辨率为2毫米各向同性的CT体积数据,使用非重叠的8x8x8图像块Token——最终形成24x24x24共13,824个视觉Token的上下文。与合并(或缩减)不同,所有视觉Token(连同其3D网格坐标)都被传递给大语言模型。该语言模型包含3D MRoPE机制,以考虑视觉Token之间的3D空间关系。
语言模型组件经过训练,能够以放射科医生的方式进行推理:系统地审查解剖区域,将正常发现与异常发现一并记录,表达经过校准的不确定性,并得出结构化的结论。该模型的设计目标不是作为一个分类器来响应,而是作为一名教师:解释问题、梳理证据,并通过可见的逻辑步骤得出诊断结论。
NV-Reason-CT的训练方法是什么
基于NV-Reason-CXR引入的方法,NV-Reason-CT采用两阶段训练流程:先进行监督微调,再进行强化学习。
第一阶段:基于放射科医生推理数据的监督微调
初始阶段在混合数据上训练模型,数据包括结构化报告、专家放射科医生的推理标注以及通用视觉问答。放射科医生提供了针对CT检查的详细思维链口述内容,捕捉了他们的内部审查过程,包括他们在每个解剖区域检查的内容、认为哪些发现具有重要意义、权衡了哪些鉴别诊断,以及如何得出最终评估结论。
由此形成的训练课程涵盖约55万个跨胸部和腹部区域的结构化问答样本,涉及section级别的解剖学问答、侧别特异性和局部化发现问答、严重程度级别问答,以及二元异常识别。为提高鲁棒性,还纳入了针对无效提示和图文不匹配情况的拒答样本。
训练数据包括CT-RATE、NIH CT数据集和CancerVerse。该数据集还辅以从大语言模型中提炼出的高质量合成推理数据,并以专家放射科医生的标注作为基准示例。综合数据集为模型提供了丰富的信号,展示了在各种CT发现中结构化放射学推理应有的样貌。
第二阶段:面向推理质量的强化学习
第二阶段使用群体相对策略优化(GRPO)来提升推理质量。基于已识别异常和诊断准确性的奖励函数,引导模型生成不仅结构良好、而且临床上正确的推理内容。GRPO奖励机制具有解剖学感知能力。模型在每个解剖区域内根据准确性获得强化,而非使用单一的全局信号,这提高了在整个胸腹部发现分布上的校准精度。
这种两阶段方法(先学习推理模式,再强化正确性)使NV-Reason-CT能够在无需为整个训练分布提供详尽标注推理链的情况下,泛化适应各种CT表现。
基准测试结果
NV-Reason-CT在3D CT理解领域领先的公开基准测试中取得了最先进的成绩。
在CT-RATE(3D CT理解的主要公开基准)上,NV-Reason-CT的表现超越了所有已发布的基线模型,包括3D对比学习模型(VoxelFM、Pillar-0、CT-CLIP、Merlin)、融合式2D/3D多模态大语言模型(ClinFusion-8B),以及基于切片的前沿模型(MedGemma 1.5)。这是首次有单一开源模型同时在CT分类和报告生成方面取得具有竞争力的表现。
除了基准测试表现,NV-Reason-CT还获得了美国国立卫生研究院(NIH)放射科医生的积极临床评价,他们验证了结构化报告的质量以及思维链推理轨迹的临床合理性。
美国国立卫生研究院高级临床医师巴里斯·图尔克贝伊(Baris Turkbey)医学博士表示:“NV-Reason-CT提供的这种系统化、逐步推进的推理方式,反映了我们实际分析CT检查时的真实思考过程。能够审查模型的思考过程,而不仅仅是它的结论,这正是使我们能够信任并采纳其发现的关键所在。”
临床验证与实际影响
NV-Reason-CT的价值不仅体现在基准测试分数上。审查过该模型输出结果的放射科医生和临床研究人员一致强调了两项使其区别于早期CT AI系统的能力:
结构化报告节省时间:生成一份涵盖60多种异常的详细结构化报告即使对经验丰富的放射科医生来说也很耗时。NV-Reason-CT能在几秒钟内生成这样的输出内容,且其推理过程便于临床医生快速浏览、验证和修改——在减轻常规报告认知负担的同时,保留了放射科医生的监督把关作用。
支持审核的可解释性:传统医疗AI模型输出的是标签或分数。NV-Reason-CT输出的是它的推理过程。这使得模型的结论可以像黑箱系统所无法做到的那样接受审核:放射科医生可以阅读思维链,识别模型的推理与自己判断一致的地方,并标记出存在分歧之处。这正是临床应用所需要的透明度。
NV-Reason-CT如何助力研究与医疗AI发展
NV-Reason-CT旨在成为更广泛医疗AI社区可以在其基础上继续构建的基石。
研究人员可以使用模型检查点和后训练方案,研究医学影像中的思维链推理,在特定机构的CT数据集上进行微调,或将NV-Reason-CT整合到多模态研究流程中。用于分割和合成数据生成的配套模型包括NV-Generate-CTMR和NV-Segment-CTMR。
包括放射学工作流供应商、PACS开发商和临床决策支持平台在内的医疗AI公司,可以针对特定临床应用场景调整NV-Reason-CT。这使得结构化CT推理能够整合到现有的放射学审查工作流程中。诸如Aidoc、HOPPR、Rad AI、Mosaic Clinical Technologies和Raidium等公司所处的领域,正需要一个能力强大、开放、支持对话的3D CT模型来弥补真实存在的能力缺口。
NV-Reason-CT运行示例与输出
以下示例展示了如何加载NV-Reason-CT并对一个3D CT体积数据进行推理。相关检查点可从Hugging Face获取。GitHub代码库中包含推理脚本、训练配置和后训练方案。
(代码示例展示了如何导入模型、加载处理器、构建对话消息、应用聊天模板、处理输入数据,并生成思维链推理和结构化报告的完整流程)
输出示例摘录显示,模型对一份静脉造影增强胸部CT进行了系统化审查:首先注意到左侧留置的输液港导管尖端位于上腔静脉这一预期的中心静脉位置;随后从肺部和气道开始检查,指出中央气道通畅;接着发现右下肺叶存在主要异常——一个较大的类肿块病变,并伴有右下肺叶部分萎陷,这一发现提示可能存在恶性病变伴阻塞后改变或相关容积减少;此外还发现右下肺叶存在另一处类肿块病灶,纵隔及右肺门存在明显淋巴结肿大,提示胸部恶性肿瘤伴淋巴结受累的可能;同时观察到双侧散在的磨玻璃影,性质尚不明确,可能为炎症、感染或肿瘤性改变;另外还发现下胸椎溶骨性病变伴中度椎管狭窄,以及几处不明确的右侧肋骨硬化性病变。
NV-Reason-CT如何融入NVIDIA医疗AI生态系统
NV-Reason-CT是NVIDIA开放医疗AI模型系列的一部分,这些模型旨在协同工作,贯穿整个放射学流程:
NV-Generate-CTMR:合成逼真的3D CT和MRI体积数据,用于训练数据增强和研究
NV-Segment-CTMR:从3D CT和MR体积数据中自动进行器官和病灶分割
NV-Reason-CXR:面向胸部X光片分析的思维链推理
NV-Reason-CT:面向完整3D CT分析的思维链推理
这些模型共同构成了端到端放射学AI流程的基础组件——从合成数据生成,到分割,再到透明的对话式临床推理。
如需了解更多信息,可探索NVIDIA医疗AI生态系统。
开始使用NV-Reason-CT体验放射科医生思维链推理
NV-Reason-CT将思维链推理引入医学领域信息密度最高的模态之一。通过将专用的全3D视觉Transformer编码器与经过推理训练的语言模型相结合,该系统能够针对CT体积数据生成结构化诊断报告和逐步的放射科医生式思考过程——覆盖胸部和腹部发现,并支持多轮对话交互。
如需及时了解最新动态,可订阅NVIDIA新闻,并在LinkedIn、X和YouTube上关注NVIDIA医疗健康板块。
Q&A
Q1:NV-Reason-CT是什么?它能做什么?
A:NV-Reason-CT是NVIDIA开发的一款专为3D CT分析打造的视觉语言模型,能够对完整体积CT数据进行思维链推理,生成结构化诊断报告,模拟放射科医生的内在思考过程,并支持针对胸部和腹部发现的多步骤后续对话。
Q2:NV-Reason-CT会取代放射科医生吗?
A:不会。NV-Reason-CT是一个开放的研发基础模型,并非自主诊断系统,也未获得临床产品认证。它旨在为研究人员和开发者提供基础,帮助减轻放射科医生常规报告的认知负担,同时保留医生的监督把关作用,而不是替代医生的判断。
Q3:NV-Reason-CT在基准测试中的表现如何?
A:NV-Reason-CT在CT-RATE这一3D CT理解的主要公开基准上取得了领先成绩,超越了包括3D对比学习模型、融合式2D/3D多模态大语言模型以及基于切片的前沿模型在内的所有已发布基线,是首个同时在CT分类和报告生成方面取得竞争力表现的开源模型。
