资讯政策与安全··来源: Rte·原文 →

ChatGPT 医疗建议准确率仅 33%:肿瘤学问题答错率达 77%

纽约州立大学宾汉姆顿分校最新研究显示,ChatGPT 在回答肿瘤学相关医疗问题时,77% 的情况下给出错误建议,整体准确率仅 33.3%。研究人员警告,AI 大模型在医疗领域的"幻觉"问题可能危及患者健康,目前尚不具备临床应用条件。该研究已发表于《PNAS Nexus》期刊。

ChatGPT 医疗建议准确率仅 33%:肿瘤学问题答错率达 77%
[广告位 · 上线后接 AdSense]

ChatGPT 医疗建议靠谱吗?最新研究啪啪打脸

纽约州立大学宾汉姆顿分校的研究团队最近搞了个大新闻,他们发现 ChatGPT 在医疗建议这块儿,特别是肿瘤学领域,表现相当拉胯。这项研究已经发表在《PNAS Nexus》期刊上,直接给 ChatGPT 的医疗能力打了个大大的问号。

实验设计:用权威问答库给 AI 开卷考

研究人员从美国临床肿瘤学会(ASCO)的“癌症患者生活”网站上扒了 102 个真实患者常问的问题,涵盖了化疗、放疗、手术等各种治疗方式。然后,他们把这些问题喂给 ChatGPT,再把它的回答和 ASCO 的官方标准答案一一对比。

结果让人大跌眼镜:

  • 准确率只有 33.3%
  • 错误率高达 63.3%
  • 不完整回答占 3.3%

更扎心的是,当问题聚焦到肿瘤学专业领域时,ChatGPT 的错误建议比例直接飙到 77%

核心风险:AI 的“迷之自信”

该校系统科学与工业工程系助理教授 陈璐 指出:“这些 AI 模型还没做好临床应用的准备。它们还是会犯很多错误,如果患者盲目相信这些建议,可能会对自己的健康造成严重威胁。”

研究团队还发现,ChatGPT 即使给出错误答案时,语气也总是自信满满。陈璐解释:“普通人很难分辨答案的对错。有时候错误答案听起来特别合理,而正确答案反而显得复杂微妙。”这种“过度自信的幻觉”正是大语言模型在医疗场景中最危险的特性之一。

不是个案:多项研究都在打脸

这已经不是第一次有研究质疑 AI 医疗建议的可靠性了。2023 年发表在《JAMA Internal Medicine》的一项研究显示,ChatGPT 在医疗咨询中提供不准确或不完整信息的比例达到 60%。另一项刊登在《Nature》的研究则发现,AI 模型能生成看似真实的医学影像,但其中包含虚构的病变

专家建议:AI 可以辅助,但不能替代专业诊疗

陈璐强调:“我们不是说 AI 模型不行,只是它们在医疗领域还没到‘黄金时段’。还有很多工作要做。”

研究团队给出了明确的建议:

  1. AI 工具可以作为辅助,但绝不能替代专业医疗建议
  2. 患者在做任何健康决策前,务必咨询医生
  3. 医疗专业人士和患者都应了解 AI 模型的局限性

中国用户的特别提示

对于中国 AI 从业者和用户,这项研究有几点启示:

  • 国内大模型在医疗场景同样可能存在“幻觉”问题,中文医学语料的质量和覆盖度可能带来额外挑战
  • 目前国内对 AI 医疗应用的监管正在完善,开发者需格外注意合规和安全边界
  • 通用大模型与专业医疗 AI(如经过医学数据微调、通过临床验证的系统)有本质区别,不可混为一谈

这项研究再次提醒我们:技术进步不等于临床就绪。在 AI 医疗应用真正成熟之前,保持审慎态度至关重要。


本文基于 GNews:RTE.ie 报道, 由 AiDuo123 AI 编辑翻译改写。原文链接: https://www.rte.ie/brainstorm/2026/0625/1545495-health-medical-advice-ai-chatbot-chatgpt/

常见问题

ChatGPT 在医疗问题上的准确率为什么这么低?
研究显示 ChatGPT 整体准确率仅 33.3%,在肿瘤学专业问题上错误率达 77%。主要原因是大语言模型存在'幻觉'问题——会生成看似合理但实际错误的信息,且缺乏针对医学领域的专业验证机制。通用模型的训练数据虽广泛,但医学知识需要极高准确性和时效性,这是当前 LLM 的短板。
我可以用 AI 工具查询健康信息吗?
可以作为初步了解,但绝不能替代专业医疗建议。研究人员明确警告,患者在做任何健康决策前必须咨询医生。AI 工具可能给出过度自信的错误答案,普通人难以分辨,盲目遵循可能危害健康。建议将 AI 回答仅作为'提问方向'参考,最终诊疗必须依赖有资质的医疗机构。
国内 AI 医疗应用是否面临同样问题?
很可能存在类似甚至更严重的风险。中文医学语料的质量、覆盖度和标注准确性通常不如英文资源充分,可能加剧'幻觉'问题。目前国内对 AI 医疗应用的监管正在完善,用户应区分'通用聊天机器人'与'经过临床验证的专业医疗 AI 系统',后者需通过药监部门审批才能用于实际诊疗。
这项研究对 AI 医疗行业有什么启示?
研究表明当前通用大模型尚未做好临床应用准备,行业需要在几个方向努力:建立医学领域专用微调数据集、引入专业知识图谱减少幻觉、设计不确定性表达机制(让 AI 承认'不知道')、进行严格临床验证。对开发者而言,需在产品中明确标注使用限制,避免用户过度依赖;对监管者,需建立 AI 医疗应用的准入和评估标准。
[广告位 · 上线后接 AdSense]
标签:#OpenAI

相关 AI 工具

文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾

浏览全部工具 →

同类资讯 — 由发布时间排序

独立音乐版权方Round Hill起诉Suno与Anthropic 索赔超10亿美元

独立音乐版权方Round Hill起诉Suno与Anthropic 索赔超10亿美元

拥有11亿美元版权资产的独立音乐发行商Round Hill于2026年8月17日分别起诉AI音乐生成平台Suno和大语言模型公司Anthropic,指控两家公司未经授权抓取其版权音乐用于模型训练。诉讼索赔金额均超10亿美元,涉及歌曲包括《Total Eclipse of the Heart》等经典作品。Round Hill CEO明确表示不会和解,其代理律师曾赢得"Blurred Lines"版权案。

政策与安全Anthropic

客户体验进入编排时代:AI 智能体如何摆脱遗留系统束缚

企业正加速部署 AI 智能体和语音 AI,但多数只是将对话式 AI 嫁接到遗留系统上,导致编排(Orchestration)成为新挑战。塔塔通信(Tata Communications)高管指出,真正的竞争优势不在于自动化本身,而在于如何通过共享上下文层协调 AI 系统、数据和人工座席,实现无缝的端到端客户体验。

应用与案例AI 智能体
FlowX.AI 成为首批为 Gemini Enterprise 提供关键任务 AI 智能体的合作伙伴

FlowX.AI 成为首批为 Gemini Enterprise 提供关键任务 AI 智能体的合作伙伴

FlowX.AI 宣布其专业化 AI 智能体已通过 Google Cloud Marketplace 接入 Gemini Enterprise,专为金融服务、保险、物流等高风险行业设计。该公司推出贷款文件完整性检查、资本市场文档提取等智能体,强调在关键业务流程中实现确定性验证而非单纯生成式推理,帮助企业将 AI 从辅助工具升级为可参与核心决策的生产力工具。

应用与案例谷歌
Google 搜索五大功能助你轻松升级家居装饰

Google 搜索五大功能助你轻松升级家居装饰

Google 近期数据显示"家居装饰灵感"搜索量月增 300%,复古家具和彩色墙面成热门趋势。Google 搜索推出 AI 模式家具可视化、Lens 复古物品识别、Circle to Search 社交内容追踪、Search Live DIY 指导及价格追踪等五大功能,帮助用户从灵感到落地全流程完成家居改造。

应用与案例谷歌