首个系统性评估医学VLM在胸部X光解读中幻觉问题的基准。区分'临床看似合理但实际不存在'与'明显错误'两类幻觉,提出缓解策略。直接关系到患者安全——虚假影像发现可能导致误诊。
人机协作的放射学报告参考架构,将测量值、分割掩码和解剖定位与报告文本中每个发现关联。人在环路中验证和修正AI输出,提升报告的事实一致性和可追溯性。
首个将放射学环境作为Agent操作空间的基准——Agent需自主浏览影像序列、决定观察策略,而非接收预处理样本。推动AI从'被动接收图像'到'主动探索影像'的范式转变。
用扩散模型替代自回归模型生成放射学报告。拓扑感知掩码扩散策略保持报告各发现之间逻辑拓扑,置信度驱动的重写机制修正低置信度片段。临床准确性和自然语言流畅度均优于AR方法。
知识增强的提示-图像联合学习,使VLM对不同措辞的临床提示保持一致的疾病检测能力。解决不同医生使用不同术语/措辞导致的AI响应不一致问题。
通过稀疏自编码器发现医学VLM中'通用增强子'和'特定抑制子'两类特征方向,可精准控制降低特定类型幻觉而不影响其他正确输出。为可控、可解释的医学VLM提供新工具。
构建56,953个QA对的大规模3D脑MRI基准,覆盖12个数据集12,977名受试者(年龄5-100岁)。全面评估3D医学VLM的脑部理解能力,揭示当前VLM在脑部理解方面的能力和局限。
揭示3D医学VLM在空间理解上的系统性缺陷。构建CT空间VQA基准测试VLM对3D空间关系的理解能力,发现当前模型语义理解尚可但空间推理存在显著不足。
设计解剖感知奖励函数和轨迹积分反馈机制,在推理过程中动态引导VLM关注正确的解剖区域。显著提升3D CT分析中的解剖定位和报告生成准确性,推动VLM从2D迈向3D体积分析。