Aioga
AI资讯 / AI资讯
返回 AI资讯

AI chatbots reading X-rays can be dangerously confident even when they're wrong

The Decoder:AI News(RSS)Aioga 编辑团队2026-07-19T07:35:20.000Z热度

The RadLE 2.0 benchmark tests whether AI models in radiology can tell when they should l...

AI资讯The Decoder:AI News(RSS)

今日 AI 情报摘要

The RadLE 2.0 benchmark tests whether AI models in radiology can tell when they should leave a

diagnosis to a human. Many models deliver wrong findings with full confidence, and human radiologists are still well ahead. Before AI can diagnose on its own, it needs to learn when it's better to say nothing.

中文正文 · AI 翻译

RadLE 基准测试的第二个版本用于检测放射学领域的 AI 系统是否能够判断何时应将诊断交给人类。许多模型会以完全自信的态度给出错误的结果,这正是它们在患者护理中存在危险的原因。

Image description

RadLE 2.0,全称为“放射学的最后考试”,由印度 Ashoka 大学的 CRASH 实验室开发。这是团队在 2025 年 9 月首次发布测试的修订版本跟进:https://arxiv.org/abs/2509.25559。新版本评估模型是否能够正确诊断、其回答的自信程度,以及是否能够承认自己力所不及。AI 需要在 0 到 4 的信心评分范围内对答案进行评分,并明确允许输入“我不知道”。

测试:https://crashlab.in/radle-technicalreport 在 16 个模型上进行了 200 个案例测试,并将结果与一个放射科医生小组进行比较。人类专家的得分为 988.7(满分 2,000 分)。表现最好的 AI 模型得分为 758。

Horizontal bar chart of the RadLE-C Confidence Weighted Index on a scale from 0 to 2,000, with human experts leading ahead of frontier models Claude Fable 5, Meta Muse Spark 1.1, and GPT-5.6 Sol Pro.

评分系统奖励诚实并惩罚过度自信。答案正确且自信度高,将获得满分。答案错误且自信度高,将失去相应的分数。回答“我不知道”,得分为零,但不会失分。即使模型的原始命中率不错,如果它自信地猜测,排名也会下降。

该研究解决了最近一篇高被引论文提出的问题:https://www.nature.com/articles/s41586-026-10549-w:只要基准测试只奖励准确性,AI 模型就会被训练去猜测。在医学中,自信的误诊比诚实承认不确定性更危险。

没有总体获胜者。Anthropic 的 Claude Fable 5:https://the-decoder.com/claude-fable-5-the-first-mythos-model-is-powerful-expensive-and-heavily-filtered/ 在可靠和安全的答案方面表现最好,领先主要指标。谷歌的 Gemini 3 Pro 则拥有最高的原始准确率。

Bar chart of the RadLE-A Accuracy Index across all 200 cases, with Gemini 3.0 Pro reaching top scores nearly on par with human experts.

Meta 的 Muse Spark 1.1:https://the-decoder.com/metas-muse-spark-1-1-outperforms-glm-5-2-in-coding-and-costs-slightly-less/ 在知道何时将病例交给人类处理方面表现最佳。Meta 最近将 Muse Spark 1.1 的幻觉率几乎减半,因为模型更常拒绝回答,而不是给出错误答案。其他前沿模型则趋势相反。例如,Grok 4.5:https://the-decoder.com/grok-4-5-is-so-cheap-compared-to-fable-5-and-gpt-5-5-that-benchmark-gaps-may-not-matter-much/ 的幻觉明显比其前代模型更多,因为虽然它知道得更多,但对自己的错误答案的自信也更高。

Bar chart of the RadLE-H Handover Readiness Index, combining reliability of autonomous answers, autonomous coverage, and successful handover of uncertain cases to specialists.

据研究团队称,如果某些模型更多时候保持沉默而不是猜测,它们的得分会好得多:https://the-decoder.com/when-ai-models-cant-see-they-just-make-something-up/。这一点在开放权重模型及专门用于医疗的模型中尤为明显。它们试图回答几乎每一个案例,但常常出错,而且通常非常自信。

Grouped bar chart showing the response profile of proprietary frontier models across 200 cases, broken down by correct diagnoses, misdiagnoses, and "I don't know" answers with their confidence levels, compared to the human baseline.
Grouped bar chart showing the response profile of open-weight and medical vision language models across 200 cases, with correct diagnoses, misdiagnoses, and "I don't know" answers compared to the human baseline.

测试的第一个版本描绘了一个更为严峻的场景:https://arxiv.org/abs/2509.25559。放射科医生的准确率为 83%,而最佳模型仅约为 30%。在三个月内,Gemini 3 Pro 已经超越了住院放射科医生的水平。准确率增长迅速,但这些模型仍然缺乏对自身能力的认知。

越来越多的人将 X 光或 MRI 扫描上传到聊天机器人:https://the-decoder.com/ai-models-confidently-describe-images-they-never-saw-and-benchmarks-fail-to-catch-it/ 并信任其回应。近期在 npj Digital Medicine 上的一项研究:https://www.nature.com/articles/s41746-026-02428-5 显示,广泛使用的聊天机器人在医疗问题上经常给出不可靠的答案。

研究团队指责高管和投资者公开夸大 AI 模型的能力。声称 AI 系统已经比 99% 的医生诊断更准确,主要基于轶事或模拟。就在今年四月,对当时被认为是最先进的 21 个模型的一项研究:https://jamanetwork.com/journals/jamanetworkopen/fullarticle/2847679 显示,它们尚未准备好进行无人监督的临床使用。

RadLE 2.0 将会以滚动方式扩展,以包含新的模型。一篇包含成本分析和错误分类学的完整科学出版物已被公布。

另外两项关于自主医疗人工智能代理的新研究指向了不同的方向。MIRA,一个用于电子健康记录的系统,以及 AMIE:https://the-decoder.com/ai-systems-rival-doctors-in-new-nature-studies-but-one-result-suggests-the-tech-wont-age-well/,在模拟问诊中能够与全科医生保持同步。这两项研究都激发了人们对人工智能很快可以独立进行诊断的期望。RadLE 2.0 的作者对此提出反驳:在人工智能独立做出决策之前,它必须知道什么时候最好不要这么做。

还有技能流失的问题。一项来自波兰的观察性研究:https://the-decoder.com/doctors-detected-fewer-lesions-after-routinely-using-ai-during-colonoscopies/,于2025年发现,经常在结肠镜检查中使用人工智能的医生在没有工具时会显著减少对癌前病变的检测。检测率从28.4%下降到22.4%。作者称之为“谷歌地图效应”:没有导航辅助,用户就会迷失方向。

放射学已经经历过一次人工智能的炒作周期。2016年,人工智能研究员 Geoffrey Hinton 宣布我们应该停止培训放射科医生:https://the-decoder.com/geoffrey-hintons-wildly-overconfident-ai-prediction-failed-now-its-a-lesson-in-humility/,因为深度学习很快将接管这项工作。像 Richard Sutton:https://the-decoder.com/turing-award-winner-rich-sutton-founds-oak-lab-to-build-ai-agents-that-learn-on-their-own/这样的同事也表示赞同。

近十年后,放射科医生仍然过度工作,Hinton 不得不收回他的预测。他将这一职业简化为图像分析,忽视了整个领域的复杂性。事实证明,这些系统能够自信地给出错误的诊断,这意味着人类仍然不可或缺。

OpenAI 首席执行官 Sam Altman 多年来一直预测 AI 将以惊人的速度取代人类工作:https://the-decoder.com/openai-ceo-sam-altman-says-rapid-impact-of-ai-on-the-job-market-is-potentially-a-little-scary/,但他最近又收回了这一说法,暗示 AI 实际上可能创造了更多工作机会:https://the-decoder.com/openai-ceo-altman-is-now-pretty-sure-ai-is-net-job-creating-which-is-quite-the-pivot-from-predicting-mass-layoffs/。到目前为止,研究并不支持任何一种说法。

AI 专家可能理解他们的模型,但他们经常高估整个职业被取代的速度。这类预测现在又回到了流行趋势:https://the-decoder.com/nobel-laureates-and-ai-leaders-warn-the-window-to-prepare-for-ais-economic-impact-is-closing-fast/。就像他们构建的 AI 一样,即使是人,有时也不知道何时保持沉默会更好,因为他们处在自己专业之外:https://the-decoder.com/nvidia-ceo-jensen-huang-calls-out-tech-leaders-god-complex-over-reckless-ai-job-loss-predictions/。

保持对 AI 的关注。清晰、有用,无废话。

关注 The Decoder 了解 AI 新闻、背景故事和专家分析。

The Decoder:https://the-decoder.com/

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:The RadLE 2.0 benchmark tests whether AI models in radiology can tell when they should leave a Aioga 将其归入「AI资讯」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:AI 行业动态需要结合来源、时间、实际可用性和后续反馈判断,标题或单次发布本身不能替代完整证据。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察原文更新、官方说明、用户反馈和同类产品的后续动作。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: the-decoder.com

来源: The Decoder:AI News(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-19T07:35:20.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

The RadLE 2.0 benchmark tests whether AI models in radiology can tell when they should l...

The Decoder:AI News(RSS)2026-07-19T07:35:20.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。