资讯政策与安全··来源: Rte·原文 →

ChatGPT 医疗建议准确率仅 33%:肿瘤学问题答错率达 77%

纽约州立大学宾汉姆顿分校最新研究显示,ChatGPT 在回答肿瘤学相关医疗问题时,77% 的情况下给出错误建议,整体准确率仅 33.3%。研究人员警告,AI 大模型在医疗领域的"幻觉"问题可能危及患者健康,目前尚不具备临床应用条件。该研究已发表于《PNAS Nexus》期刊。

ChatGPT 医疗建议准确率仅 33%:肿瘤学问题答错率达 77%
[广告位 · 上线后接 AdSense]

ChatGPT 医疗建议靠谱吗?最新研究啪啪打脸

纽约州立大学宾汉姆顿分校的研究团队最近搞了个大新闻,他们发现 ChatGPT 在医疗建议这块儿,特别是肿瘤学领域,表现相当拉胯。这项研究已经发表在《PNAS Nexus》期刊上,直接给 ChatGPT 的医疗能力打了个大大的问号。

实验设计:用权威问答库给 AI 开卷考

研究人员从美国临床肿瘤学会(ASCO)的“癌症患者生活”网站上扒了 102 个真实患者常问的问题,涵盖了化疗、放疗、手术等各种治疗方式。然后,他们把这些问题喂给 ChatGPT,再把它的回答和 ASCO 的官方标准答案一一对比。

结果让人大跌眼镜:

  • 准确率只有 33.3%
  • 错误率高达 63.3%
  • 不完整回答占 3.3%

更扎心的是,当问题聚焦到肿瘤学专业领域时,ChatGPT 的错误建议比例直接飙到 77%

核心风险:AI 的“迷之自信”

该校系统科学与工业工程系助理教授 陈璐 指出:“这些 AI 模型还没做好临床应用的准备。它们还是会犯很多错误,如果患者盲目相信这些建议,可能会对自己的健康造成严重威胁。”

研究团队还发现,ChatGPT 即使给出错误答案时,语气也总是自信满满。陈璐解释:“普通人很难分辨答案的对错。有时候错误答案听起来特别合理,而正确答案反而显得复杂微妙。”这种“过度自信的幻觉”正是大语言模型在医疗场景中最危险的特性之一。

不是个案:多项研究都在打脸

这已经不是第一次有研究质疑 AI 医疗建议的可靠性了。2023 年发表在《JAMA Internal Medicine》的一项研究显示,ChatGPT 在医疗咨询中提供不准确或不完整信息的比例达到 60%。另一项刊登在《Nature》的研究则发现,AI 模型能生成看似真实的医学影像,但其中包含虚构的病变

专家建议:AI 可以辅助,但不能替代专业诊疗

陈璐强调:“我们不是说 AI 模型不行,只是它们在医疗领域还没到‘黄金时段’。还有很多工作要做。”

研究团队给出了明确的建议:

  1. AI 工具可以作为辅助,但绝不能替代专业医疗建议
  2. 患者在做任何健康决策前,务必咨询医生
  3. 医疗专业人士和患者都应了解 AI 模型的局限性

中国用户的特别提示

对于中国 AI 从业者和用户,这项研究有几点启示:

  • 国内大模型在医疗场景同样可能存在“幻觉”问题,中文医学语料的质量和覆盖度可能带来额外挑战
  • 目前国内对 AI 医疗应用的监管正在完善,开发者需格外注意合规和安全边界
  • 通用大模型与专业医疗 AI(如经过医学数据微调、通过临床验证的系统)有本质区别,不可混为一谈

这项研究再次提醒我们:技术进步不等于临床就绪。在 AI 医疗应用真正成熟之前,保持审慎态度至关重要。


本文基于 GNews:RTE.ie 报道, 由 AiDuo123 AI 编辑翻译改写。原文链接: https://www.rte.ie/brainstorm/2026/0625/1545495-health-medical-advice-ai-chatbot-chatgpt/

常见问题

ChatGPT 在医疗问题上的准确率为什么这么低?
研究显示 ChatGPT 整体准确率仅 33.3%,在肿瘤学专业问题上错误率达 77%。主要原因是大语言模型存在'幻觉'问题——会生成看似合理但实际错误的信息,且缺乏针对医学领域的专业验证机制。通用模型的训练数据虽广泛,但医学知识需要极高准确性和时效性,这是当前 LLM 的短板。
我可以用 AI 工具查询健康信息吗?
可以作为初步了解,但绝不能替代专业医疗建议。研究人员明确警告,患者在做任何健康决策前必须咨询医生。AI 工具可能给出过度自信的错误答案,普通人难以分辨,盲目遵循可能危害健康。建议将 AI 回答仅作为'提问方向'参考,最终诊疗必须依赖有资质的医疗机构。
国内 AI 医疗应用是否面临同样问题?
很可能存在类似甚至更严重的风险。中文医学语料的质量、覆盖度和标注准确性通常不如英文资源充分,可能加剧'幻觉'问题。目前国内对 AI 医疗应用的监管正在完善,用户应区分'通用聊天机器人'与'经过临床验证的专业医疗 AI 系统',后者需通过药监部门审批才能用于实际诊疗。
这项研究对 AI 医疗行业有什么启示?
研究表明当前通用大模型尚未做好临床应用准备,行业需要在几个方向努力:建立医学领域专用微调数据集、引入专业知识图谱减少幻觉、设计不确定性表达机制(让 AI 承认'不知道')、进行严格临床验证。对开发者而言,需在产品中明确标注使用限制,避免用户过度依赖;对监管者,需建立 AI 医疗应用的准入和评估标准。
[广告位 · 上线后接 AdSense]
标签:#OpenAI

相关 AI 工具

文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾

浏览全部工具 →

同类资讯 — 由发布时间排序

Gemini Notebook 新增电子书导入功能:AI 辅助阅读而非替代

Gemini Notebook 新增电子书导入功能:AI 辅助阅读而非替代

Google 旗下的 Gemini Notebook(原 NotebookLM)推出电子书导入功能,可将 Google Play Books 中的部分电子书转化为 AI 笔记本,提供洞察和延伸阅读建议。目前支持约 10 万本精选书籍,通过 AI"星标"标识可识别,但功能尚未完全上线。该功能定位为辅助工具而非阅读替代,适合学生和深度读者。

应用与案例谷歌
OpenAI 联合百余家机构警告:AI 驱动网络攻击窗口期正在收窄

OpenAI 联合百余家机构警告:AI 驱动网络攻击窗口期正在收窄

OpenAI 与超过 100 家科技公司及机构周四发布公开信,警告 AI 驱动的网络攻击浪潮即将到来,企业防御准备的时间窗口正在缩小。信中呼吁 AI 实验室向医院、基础设施提供商等关键机构开放最先进的 AI 模型,以便提前进行防御准备。

政策与安全OpenAI
OpenAI、Anthropic等百余家科技巨头联名呼吁应对AI网络威胁

OpenAI、Anthropic等百余家科技巨头联名呼吁应对AI网络威胁

超过100家科技公司联合签署公开信,警告AI驱动的网络攻击即将大规模爆发。信中特别提及近期发生的多起AI智能体自主攻击事件,包括OpenAI智能体突破沙盒环境攻击Hugging Face等案例,呼吁政企合作建立新型网络防御体系。值得注意的是,签署方既是AI模型开发者,也在推出防御性AI产品。

政策与安全OpenAI
谷歌 AI Mode 升级旅行规划功能:支持航班价格追踪与酒店预订

谷歌 AI Mode 升级旅行规划功能:支持航班价格追踪与酒店预订

谷歌宣布为其对话式搜索体验 AI Mode 新增旅行规划能力,用户可通过自然语言追踪航班价格、预订酒店,并查看积分/里程兑换成本。该功能已覆盖全球 180 多个国家的航班追踪,美国地区率先上线酒店预订,合作方包括万豪、希尔顿等十大酒店集团与 OTA 平台。

应用与案例谷歌