官方网站-首页官方网站-首页

科技有限公司
商店{联系电话}400-86503662搜索本站
Nature:AI击败人类医学专家?科学家:仍需解决4大难题
Nature:AI击败人类医学专家?科学家:仍需解决4大难题
2025-03-27 10:00:22
摘要:
在医学研究和临床治疗中,准确解读医学图像并生成有洞察力的报告对病人的护理是必不可少的,但却给人类临床专家带来了沉重的负担。人工智能(AI),特别是多模态生成式医学图像解释(GenMI)领域的快速发展,为自动化这一复杂过程的部分工作创造了机会。尽管 GenMI 有望在生成跨学科报告方面达到人类专家水平,但仍在准确性、透明度等方面面临障碍。厘清这些障碍并提出针对性解决方案,对于帮助临床医生改善护理质量...

在医学研究和临床治疗中,准确解读医学图像并生成有洞察力的报告对病人的护理是必不可少的,但却给人类临床专家带来了沉重的负担。

人工智能(AI),特别是多模态生成式医学图像解释(GenMI)领域的快速发展,为自动化这一复杂过程的部分工作创造了机会。尽管 GenMI 有望在生成跨学科报告方面达到人类专家水平,但仍在准确性、透明度等方面面临障碍

厘清这些障碍并提出针对性解决方案,对于帮助临床医生改善护理质量、加强医学教育、减少工作量、扩大专业准入并提供实时专业知识至关重要。

今天,来自哈佛医学院的研究团队在权威科学期刊 Nature 上发文,全面综述了开发从图像中生成医学报告的 AI 系统方面的进展和挑战

图片

论文链接:

https://www.nature.com/articles/s41586-024-07618-3

除了分析医疗报告生成的新模型的优势和应用之外,他们倡导一种新的范式,以授权临床医生及其患者的方式部署 GenMI

在临床中发挥 GenMI 的优势

现有的大多数 AI 解决方案都侧重于自动完成医学影像中的单一任务,没有考虑到放射学和临床成像中涉及的更全面的综合分析。

因此,AI 有很大潜力在医学成像和报告方面实现更广泛的用途,例如快速撰写出涉及多科室的权威报告,摄取多种模式和临床数据,生成更加准确、流畅和可解释的报告等。

图片

图|自动生成医疗报告的应用

目前,医疗报告生成框架主要由视觉编码器和语言解码器组成。其中,编码器将图像中的视觉信息提取为向量表示,而解码器接收一个向量并产生特定的输出。

近年来,科研人员在编码器-解码器方法的基础上不断创新,从而更好地编码图像数据、考虑外部知识、筛选异常等。包括大语言模型(LLM)在内的大型预训练通用 AI 系统,通过推动开发新的 GenMI 解决方案,彻底改变了医学图像解释。

这些 GenMI 方法可以产生更准确的医疗报告,以及使用相同的基础模型执行其他几个下游任务并处理多模态数据。

这些算法大多建立在视觉语言模型(VLM)的基础上,VLM 将单个视觉和语言模型融合到一个统一的框架中,可以对图像和文本输入进行联合编码。

图片

图|GenMI 的能力

利用 GenMI 协助临床医生和患者,在临床环境中充分发挥它们的优势,可以通过两个范例来理解。

第一个是部署 AI 住院实习医师。AI 住院实习医师首先会专门起草临床上准确的报告,作为住院实习医师或医生撰写报告的起点。在开发过程中,可以在临床环境中对模型进行前瞻性测试。然后,AI 住院实习医师可以在主治医师的监督下进行微调或校准,并从所需的修正和补充中学习。

图片

图|部署 AI 住院实习医师

第二个是符合人类偏好。基于人类反馈的强化学习(RLHF)和直接偏好优化(DPO)是应用于此类任务的两种技术。

对话式医疗报告生成模型,使临床医生可以根据需要提供反馈和后续问题,还可以与临床医生合作,通过生成式 AI 改变输入图像的属性,观察模型预测中的相关差异,并将这些差异与临床医生识别出的突出特征进行比较,从而对 AI 成像工具进行审核,还可以对为患者生成的报告进行调整,使其更直白,包含更少的医学术语,更多围绕患者病情。

总的来说,临床医生可以通过 3 种途径与 AI 系统协作

利用 AI 模型的诊断能力,获得诊断错误的反馈。模型可以结合多模态输出,其中的解(jiě)释加上在原始图像上的边界框,可以突出图像中以前可能被忽略的相关区域;

模型快速解析图像和报告的能力,有助于临床医生快速搜索类似病例和图像;

模型可以协助临床医生决策,其提出的探究性问题可以让临床医生深入了解与特定病症相关的诊断模式。

仍需克服 4 大挑战

然而,研究团队表示,要想发挥 GenMI 等 AI 系统的优势,还需要解决基准、人类过度依赖、数据集和模型偏差以及新模型、新科室等挑战。

首先,是基准和评估指标。在安全实施医学报告生成模型,AI 住院实习医师将在住院治疗中发挥更重要的作用之前,必须开展评估下游临床效果的研究,明确衡量标准。

流行的 LLM 的性能会随着时间的推移而发生显著变化,这种差异可能会造成严重后果。例如,疾病预测模型可能会被操纵以输出特定的诊断和结果测量,从而导致处方过量、保险欺诈和伪造临床试验。

因此,在将 LLM 作为人工智能住院实习医师的一部分进行部署时,必须确保采取一致的安全措(cuò)施(shī)和(hé)监(jiān)管(guǎn)。

其(qí)次(cì),是临床医生和患者的过度依赖。临床医生可能出于对错误问责的模糊性、确认偏差和自动化偏差,过于依赖机器自动化指导等各种原因,不愿意更改 AI 生成报告中的文字,忽略模型无法识别的罕见发现。

虽然 AI 住院实习医师可以让患者直接与真正的临床专家进行交流,但这些交流应该在可控的情况下进行,这样患者就不会依赖 AI 住院实习医师来指导他们的医疗护理。同时,临床医生应向患者传授正确的查询方法,并让他们了解 AI 工具,以便自己进行探索。在部署 AI 住院实习医师的整个过程中,必须承认 AI 系统的局限性,尤其是在直接护理等只有人类才能处理和提供的更广泛的语境、同理心和认知的领域。

然后,是有偏差的数据集和模型。深度学习模型,尤其是 LLM,很容易受到训练数据固有偏差的影响。在 AI 住院实习医师的范例中,这种缺陷尤其容易造成问题,因为模型不仅会在生(shēng)成(chéng)的报告中,还会在医学教育和临床医生理解等方面延续这种偏差。

此外,人类的主观反馈是改进 AI 住院医师的关键因素,而这本身就可能造成有偏见的反馈循环。训练(liàn)数(shù)据(jù)的(de)质(zhì)量(liàng)、规(guī)模(mó)和(hé)平(píng)衡(héng)也(yě)是(shì)决(jué)定(dìng)模(mó)型(xíng)偏(piān)差(chà)的(de)重(zhòng)要(yào)因(yīn)素(sù),因(yīn)此(cǐ)亟(jí)需(xū)更(gèng)广(guǎng)泛(fàn)、更(gèng)具(jù)代(dài)表(biǎo)性(xìng)的(de)数(shù)据(jù)集。

目(mù)前(qián),大(dà)多(duō)数(shù)进(jìn)展(zhǎn)都(dōu)是(shì)由(yóu) MIMIC-CXR 等(děng)数(shù)据(jù)集推(tuī)动的,这些数(shù)据(jù)集仅(jǐn)限(xiàn)于(yú)单(dān)模(mó)态(tài)胸(xiōng)部(bù) X 光(guāng)扫(sǎo)描(miáo),其(qí)他(tā)数(shù)据(jù)集也(yě)不(bù)平(píng)衡(héng),除(chú)了(le)配(pèi)对(duì)图(tú)像(xiàng)和(hé)相(xiāng)关报(bào)告(gào)普(pǔ)遍(biàn)不(bù)足(zú)外(wài),与(yǔ)正(zhèng)常(cháng)扫(sǎo)描(miáo)相比,异常扫描(miáo)要(yào)少(shǎo)得(de)多(duō),并(bìng)且(qiě)往(wǎng)往(wǎng)会(huì)捕(bǔ)捉(zhuō)到(dào)更(gèng)常(cháng)见(jiàn)的(de)疾(jí)病(bìng),而(ér)罕(hǎn)见(jiàn)的(de)疾(jí)病(bìng)则(zé)很(hěn)少(shǎo)出(chū)现(xiàn)。异(yì)常(cháng)也(yě)通(tōng)常(cháng)只(zhǐ)局(jú)限(xiàn)于(yú)图(tú)像(xiàng)的(de)一(yī)小(xiǎo)部(bù)分(fēn),因(yīn)此(cǐ)模(mó)型(xíng)很(hěn)难(nán)对(duì)其(qí)进(jìn)行(xíng)筛(shāi)选。

最后,是(shì)新(xīn)的(de)模(mó)式(shì)和(hé)新(xīn)的(de)科(kē)室(shì)。目(mù)前(qián),将(jiāng) GenMI 应(yīng)用(yòng)于(yú)三(sān)维(wéi)成(chéng)像(xiàng)(包(bāo)括(kuò) MRI 和(hé) CT 扫(sǎo)描(miáo))的(de)工(gōng)作(zuò)十(shí)分(fēn)有(yǒu)限(xiàn)。部(bù)分(fēn)原(yuán)因(yīn)是(shì)这(zhè)一(yī)领(lǐng)域缺(quē)乏(fá)大(dà)型(xíng)标(biāo)注(zhù)数(shù)据(jù)集,只(zhǐ)有(yǒu)少(shǎo)数(shù)未(wèi)发(fā)布(bù)、稀(xī)少(shǎo)或(huò)难(nán)以(yǐ)获(huò)取(qǔ)的(de)数(shù)据(jù)集。

除(chú)了(le)三(sān)维(wéi)放(fàng)射(shè)图(tú)像(xiàng),GenMI 还(hái)以(yǐ)有(yǒu)限(xiàn)的(de)方(fāng)式(shì)应(yīng)用(yòng)于(yú)其(qí)他(tā)科(kē)室(shì)。眼(yǎn)科(kē)和(hé)皮(pí)肤(fū)科(kē)的(de)报(bào)告(gào)生(shēng)成(chéng)在(zài)一(yī)定(dìng)程(chéng)度(dù)上(shàng)取(qǔ)得(de)了(le)成(chéng)功(gōng),在(zài)其(qí)考(kǎo)虑(lǜ)中(zhōng)纳(nà)入(rù)了(le)外(wài)部(bù)知(zhī)识(shi)和(hé)疾(jí)病(bìng)分(fēn)类(lèi)等(děng)标(biāo)准(zhǔn)技(jì)术(shù)。尽(jǐn)管(guǎn)纳(nà)入(rù)新(xīn)科(kē)室(shì)和(hé)图(tú)像(xiàng)类(lèi)型(xíng)将(jiāng)扩(kuò)展(zhǎn) AI 工(gōng)具(jù)的(de)能(néng)力(lì),但(dàn)获(huò)取(qǔ)大(dà)规(guī)模(mó)多(duō)模(mó)态(tài)数(shù)据(jù)集的(de)成(chéng)本(běn)非(fēi)常(cháng)高(gāo)昂(áng),资(zī)源(yuán)充(chōng)足(zú)的(de)公(gōng)司(sī)或(huò)有(yǒu)能(néng)力(lì)收(shōu)集或(huò)授(shòu)权(quán)使(shǐ)用(yòng)这(zhè)些(xiē)专(zhuān)有(yǒu)数(shù)据(jù)集。

自动生成医疗报告在减轻临床负担、扩大专家级临床医疗服务覆盖面方面有广阔前景。GenMI 可以生成更高质量的报告,通过提供(gōng)交(jiāo)互(hù)式(shì)临(lín)床(chuáng)专(zhuān)业(yè)知(zhī)识(shi)授(shòu)权(quán)临(lín)床(chuáng)医(yī)生(shēng)和(hé)患(huàn)者(zhě),并(bìng)通(tōng)过(guò)扩(kuò)展(zhǎn)教(jiào)育(yù)功(gōng)能(néng)改(gǎi)善(shàn)未(wèi)来(lái)的(de)临(lín)床(chuáng)护(hù)理(lǐ)。

研究团队表示,在不同模式和科室的临床环境中,制定衡量其效果的公开基准、进行持续的临床合作和谨慎的模型验证至关重要,这有助于学术界更透明地衡量报告生成的进展,并为临床监管机构未来的工作提供指导,使其安全有效。