今日健康科技|医疗AI开始学习什么时候”不回答”

过去我们讨论医疗AI,最常问的问题是:
它回答得准不准?
但随着AI越来越接近真实医疗场景,另一个问题开始变得同样重要:
当它不知道的时候,它能不能选择不回答?
10月5日,《npj Digital Medicine》发表了一项基层眼科AI研究。研究人员开发了一个名为 EyeSeek 的大语言模型系统,其中一个很值得关注的设计,就是让AI能够识别自身知识边界。
当模型认为一个问题超出自身能力范围时,它可以选择拒绝直接回答(abstain),并进一步寻找外部信息,而不是继续生成一个看似合理、实际上可能并不可靠的答案。
这看起来只是一个很小的变化,但对于医疗AI来说意义并不小。
医疗AI最大的风险之一,不是”不知道”
真正危险的是:
不知道,却表现得像知道。
普通聊天中,一个错误答案可能只是带来误解。
但进入医疗场景以后,错误信息可能影响一个人是否就医、什么时候就医、是否接受进一步检查,甚至如何理解自己的疾病风险。
因此,一个成熟的医疗AI系统需要具备的能力,可能不只是:
回答问题。
还应该包括:
判断自己是否有足够依据回答这个问题。
这实际上把AI能力从”答案生成”推进到了另一个层面——不确定性管理。
“我不知道”可能也是一种能力
EyeSeek研究还进行了一项小型、单中心的前瞻性真实世界研究。
研究中,AI辅助组有84名参与者,对照组有86名。结果显示,AI辅助与更高的转诊依从性以及健康素养改善相关。
不过,这项研究规模仍然较小,而且来自单一中心,因此不能据此认为这种模式已经能够普遍改善眼科医疗。
真正值得关注的是它背后的设计思想:
医疗AI并不一定需要回答所有问题。
在高风险领域,一个能够识别自身边界、在必要时拒绝回答或把问题交还给医生的AI,可能比一个什么都能回答的AI更加可靠。
昨天的问题,今天又向前走了一步
昨天我们关注的是医疗聊天机器人进入分诊(triage):
AI不仅告诉患者”可能是什么”,还开始帮助判断:
应该在家观察?
去看医生?
还是需要更紧急的医疗处理?
今天的问题则进一步变成:
当AI没有足够把握时,它是否知道应该停下来?
这两个问题其实属于同一条技术路线:
AI什么时候可以回答?
什么时候可以建议行动?
什么时候必须承认不确定?
什么时候应该把决定交还给专业人员?
这可能比单纯追求更高的模型准确率更加重要。
另一个问题正在出现:获批以后,我们能看到多少证据?
同样发表于《npj Digital Medicine》的一项研究,系统梳理了77个已经获得CE标志或FDA授权的病理学及血液形态学AI诊断软件。
研究人员只为其中30个产品找到了公开可获得的、针对具体设备的性能证据;另外47个没有找到相应的公开性能资料。
这里必须注意:
这并不意味着这些产品”没有证据”。
监管机构在审批过程中可能已经审查过相关资料。研究提出的问题是——这些性能证据有多少能够被医生、研究人员和公众公开获得。
而且不同产品使用的性能指标并不统一,也进一步增加了横向比较的困难。
这意味着医疗AI进入临床以后,评价标准可能不能停留在:
“它获批了吗?”
还需要继续问:
证据是否透明?
不同产品能不能比较?
真实世界中的表现如何?
检测的价值,最终仍然要回到”下一步怎么办”
今天还有另一项值得注意的研究:阿尔茨海默病相关血液生物标志物开始被放进更接近真实临床决策的研究框架中。
问题已经不只是:
血液能不能测到与疾病有关的信号?
而是:
医生更早获得这些结果以后,会不会改变诊断判断和患者管理?
这正是未来诊断技术最值得关注的一步。
一个检测能够测到更多东西,并不自动意味着它更有价值。
一个AI能够回答更多问题,也不自动意味着它更加安全。
未来真正有价值的健康科技,可能需要同时解决三个问题:
测到了什么?
我们有多确定?
接下来应该做什么?
而有时候,第三个问题最正确的答案可能恰恰是:
“我不知道,需要进一步确认。”
在医疗领域,知道自己的边界,也许不是AI能力的缺陷。
它可能恰恰是智能开始成熟的标志。
——
Science & Education:
BI 身体智慧(Body Intelligence)
AI-assisted Research & Illustration:
BI × GPT
Professional Review:
林存默(Thomas Lin)
Professional Community:
ACPN — The Association of Certified Professional Nutritionists
加拿大注册执业营养师公会
Published by:
VoiceToday|今日之声