📊 Medical Imaging AI Weekly Papers

Segmentation · Generation · Detection & Diagnosis · AI Agent
🕐 2026-05-28 17:30 (UTC+8)
📅 2026-05-28 📄 32 Papers 🔍 arXiv + Semantic Scholar
📚 Archive

🔬 Medical Image Segmentation

8条
首个系统性评估医学基础模型鲁棒性的基准,覆盖40种扰动类型和8种影像模态。评估5种VLM和2种分割模型的5种微调策略。发现LoRA退化几乎是全量微调的两倍;9/15个最严重损坏为医学领域特有;LoRA调优的视觉定位下降超40分,零样本描述下降不到7%。
📅 2026-05-18 🔗 arXiv 📄 PDF
两阶段跨模态框架:第一阶段用BLIP-2在语义引导下识别病灶候选区域生成框提示;第二阶段将提示输入SAM多任务网络,多候选区域聚合提升提示稳定性,结合视觉-影像组学融合头进行诊断。实现从病灶定位到诊断的闭环。
📅 2026-05-18 🔗 arXiv 📄 PDF
用轻量扩散先验替代SAM2的人工提示,从冻结的SAM2图像特征合成分割掩码嵌入,消除用户提示依赖。利用先前分割切片作为条件,强制体积数据的空间一致性。在BTCV和CHAOS数据集的CT/MRI上取得竞争力表现。
📅 2026-04-27 🔗 arXiv 📄 PDF
自门控机制让3D SAM模型自适应决定是否激活多尺度特征融合。Self-Gated Prompting Module通过轻量门控单元预测特征是否需要多尺度融合,配合Zoom Loss对小病灶加权监督。MSD肝肿瘤mDice提升7.3%。
📅 2026-04-19 🔗 arXiv 📄 PDF
专为MedSAM设计的结构化剪枝框架,通过双干预评分和边界感知Fisher估计精确保留分割边界。参数减少60%、FLOPs减少58.4%,Dice达0.9549。引入边界杠杆原理解释压缩导致的边界退化。
📅 2026-05-13 🔗 arXiv 📄 PDF
在SAM上集成LoRA和频率适配器,提取域不变高频特征,缓解因成像协议、扫描仪差异引起的频域偏移。在眼底和前列腺数据集上优于传统域泛化方法和现有SAM域泛化方法。
📅 2026-05-11 🔗 arXiv 📄 PDF
双适配器策略:高性能适配器用可变形卷积建模精确边界,轻量适配器用结构重参数化降低推理延迟。比原始SAM2精度提升19.66%,计算成本比重量级医学SAM适配降低约87%。
📅 2026-05-07 🔗 arXiv 📄 PDF
通过显著性引导的提示蒸馏策略,使SAM在不精确甚至噪声提示下仍能准确分割。降低对标注质量的依赖,在多种噪声提示场景下保持稳健的分割性能。
📅 2026-04-25 🔗 arXiv 📄 PDF

🎨 Medical Image Generation & Synthesis

7条
将成像物理约束融入扩散模型,基于投影域等变性损失(源自CT采集物理)设计条件3D潜在扩散框架。利用面内旋转在投影域和重建域保持一致的物理特性,显著提升CBCT→CT合成的HU准确性。
📅 2026-05-19 🔗 arXiv 📄 PDF
首次将临床对齐评分(CAS)引入扩散模型微调。CAS基于基础模型逐图评估生成图像与病理相关标准的符合度,以此作为奖励信号进行RLHF风格微调,替代FID等无法衡量医学质量的通用指标。
📅 2026-05-12 🔗 arXiv 📄 PDF
将潜在扩散模型条件化解耦为解剖编码器和疾病严重程度嵌入两个互补部分,在保持患者特定解剖结构的同时,沿MES评分连续控制溃疡性结肠炎严重程度阶段。
📅 2026-05-03 🔗 arXiv 📄 PDF
首次在共享潜在空间中联合合成MRI体数据和临床表格数据。利用变分自编码器融合MRI和表格模态,通过交叉注意力进行扩散合成,分别用独立解码器重建两种模态。
📅 2026-05-05 🔗 arXiv 📄 PDF
双管道PEFT模型同时解决GI内窥镜数据稀缺和模型微调瓶颈:一个管道用于医学图像生成扩充数据,另一个用于临床视觉问答。在隐私受限和数据稀缺场景中提供可行的AI方案。
📅 2026-05-24 🔗 arXiv 📄 PDF
系统性比较GAN、扩散模型和VAE等生成框架在MRI-to-CT、T1-to-T2等跨模态翻译任务中的表现,揭示不同框架在模态翻译质量、速度和保真度上的权衡。
📅 2026-05-13 🔗 arXiv 📄 PDF
结合Mamba-based潜在扩散模型和高斯对齐自编码器,预测脑部MRI随时间的演变。Mamba的线性复杂度使长序列建模更高效,为神经退行性疾病研究提供数据支持。
📅 2026-04-17 🔗 arXiv 📄 PDF

🩺 Detection & Diagnosis

9条
首个系统性评估医学VLM在胸部X光解读中幻觉问题的基准。区分'临床看似合理但实际不存在'与'明显错误'两类幻觉,提出缓解策略。直接关系到患者安全——虚假影像发现可能导致误诊。
📅 2026-05-19 🔗 arXiv 📄 PDF
人机协作的放射学报告参考架构,将测量值、分割掩码和解剖定位与报告文本中每个发现关联。人在环路中验证和修正AI输出,提升报告的事实一致性和可追溯性。
📅 2026-05-24 🔗 arXiv 📄 PDF
首个将放射学环境作为Agent操作空间的基准——Agent需自主浏览影像序列、决定观察策略,而非接收预处理样本。推动AI从'被动接收图像'到'主动探索影像'的范式转变。
📅 2026-05-11 🔗 arXiv 📄 PDF
用扩散模型替代自回归模型生成放射学报告。拓扑感知掩码扩散策略保持报告各发现之间逻辑拓扑,置信度驱动的重写机制修正低置信度片段。临床准确性和自然语言流畅度均优于AR方法。
📅 2026-05-16 🔗 arXiv 📄 PDF
知识增强的提示-图像联合学习,使VLM对不同措辞的临床提示保持一致的疾病检测能力。解决不同医生使用不同术语/措辞导致的AI响应不一致问题。
📅 2026-05-09 🔗 arXiv 📄 PDF
通过稀疏自编码器发现医学VLM中'通用增强子'和'特定抑制子'两类特征方向,可精准控制降低特定类型幻觉而不影响其他正确输出。为可控、可解释的医学VLM提供新工具。
📅 2026-05-24 🔗 arXiv 📄 PDF
构建56,953个QA对的大规模3D脑MRI基准,覆盖12个数据集12,977名受试者(年龄5-100岁)。全面评估3D医学VLM的脑部理解能力,揭示当前VLM在脑部理解方面的能力和局限。
📅 2026-05-19 🔗 arXiv 📄 PDF
揭示3D医学VLM在空间理解上的系统性缺陷。构建CT空间VQA基准测试VLM对3D空间关系的理解能力,发现当前模型语义理解尚可但空间推理存在显著不足。
📅 2026-05-09 🔗 arXiv 📄 PDF
设计解剖感知奖励函数和轨迹积分反馈机制,在推理过程中动态引导VLM关注正确的解剖区域。显著提升3D CT分析中的解剖定位和报告生成准确性,推动VLM从2D迈向3D体积分析。
📅 2026-05-19 🔗 arXiv 📄 PDF

🤖 Medical AI Agent

8条
从'被动接收证据'到'主动搜索证据'——首个自动化多模态临床证据搜索Agent。打破现有临床AI假设证据已整理好的模式,让Agent主动从异构来源中搜索、迭代规划和合成多模态证据。模拟真实临床工作流。
📅 2026-05-19 🔗 arXiv 📄 PDF
多Agent协作实现从图像感知到诊断报告的完整胎儿超声解读流水线。分别负责切面识别、解剖分割、生物测量和诊断报告,通过Agent间证据传递实现端到端解读。显著优于单模型方法。
📅 2026-05-25 🔗 arXiv 📄 PDF
RAG系统也能自我进化——多Agent分工(查询优化、检索、答案验证),通过自进化机制持续优化检索和推理策略。解决传统RAG'单轮静态检索'与临床推理'多阶段动态过程'的错配。长期使用越用越准。
📅 2026-05-16 🔗 arXiv 📄 PDF
将可解释原型网络与LLM结合,通过隐私保护的Agent工作流生成临床报告。解决RAG的'检索阿谀'问题(LLM臆造符合视觉预测的事后解释),兼顾可解释性和隐私保护。
📅 2026-05-13 🔗 arXiv 📄 PDF
模拟真实诊断过程——Agent在噪声环境中主动提问、选择检查项目、综合诊断。与患者交互获取信息→选择医学检查→在噪声和不确定信息中进行综合诊断,更接近真实临床工作流。
📅 2026-05-08 🔗 arXiv 📄 PDF
综合基准评估LLM Agent处理异构多模态临床数据(时序EHR、医学影像、放射报告等)的能力。揭示当前Agent在整合异构临床数据方面的优势和短板,为构建实际临床决策支持系统提供能力地图。
📅 2026-05-11 🔗 arXiv 📄 PDF
评估LLM在普通用户日常症状描述(模糊、不精确、缺少医学术语)下的诊断能力。日常对话中的诊断准确率远低于标准化考试场景,揭示AI症状评估从实验室走向大众的关键挑战。
📅 2026-05-05 🔗 arXiv 📄 PDF
GraphRAG增强的多Agent系统检测出院小结中的医学幻觉。图结构知识图谱验证机制,多Agent协作交叉检查每个临床声明的证据支持,幻觉检测率优于单Agent和传统RAG方法。
📅 2026-05-05 🔗 arXiv 📄 PDF