ChatGPT 医疗建议准确率仅 33%:肿瘤学问题答错率达 77%
纽约州立大学宾汉姆顿分校最新研究显示,ChatGPT 在回答肿瘤学相关医疗问题时,77% 的情况下给出错误建议,整体准确率仅 33.3%。研究人员警告,AI 大模型在医疗领域的"幻觉"问题可能危及患者健康,目前尚不具备临床应用条件。该研究已发表于《PNAS Nexus》期刊。

ChatGPT 医疗建议靠谱吗?最新研究啪啪打脸
纽约州立大学宾汉姆顿分校的研究团队最近搞了个大新闻,他们发现 ChatGPT 在医疗建议这块儿,特别是肿瘤学领域,表现相当拉胯。这项研究已经发表在《PNAS Nexus》期刊上,直接给 ChatGPT 的医疗能力打了个大大的问号。
实验设计:用权威问答库给 AI 开卷考
研究人员从美国临床肿瘤学会(ASCO)的“癌症患者生活”网站上扒了 102 个真实患者常问的问题,涵盖了化疗、放疗、手术等各种治疗方式。然后,他们把这些问题喂给 ChatGPT,再把它的回答和 ASCO 的官方标准答案一一对比。
结果让人大跌眼镜:
- 准确率只有 33.3%
- 错误率高达 63.3%
- 不完整回答占 3.3%
更扎心的是,当问题聚焦到肿瘤学专业领域时,ChatGPT 的错误建议比例直接飙到 77%。
核心风险:AI 的“迷之自信”
该校系统科学与工业工程系助理教授 陈璐 指出:“这些 AI 模型还没做好临床应用的准备。它们还是会犯很多错误,如果患者盲目相信这些建议,可能会对自己的健康造成严重威胁。”
研究团队还发现,ChatGPT 即使给出错误答案时,语气也总是自信满满。陈璐解释:“普通人很难分辨答案的对错。有时候错误答案听起来特别合理,而正确答案反而显得复杂微妙。”这种“过度自信的幻觉”正是大语言模型在医疗场景中最危险的特性之一。
不是个案:多项研究都在打脸
这已经不是第一次有研究质疑 AI 医疗建议的可靠性了。2023 年发表在《JAMA Internal Medicine》的一项研究显示,ChatGPT 在医疗咨询中提供不准确或不完整信息的比例达到 60%。另一项刊登在《Nature》的研究则发现,AI 模型能生成看似真实的医学影像,但其中包含虚构的病变。
专家建议:AI 可以辅助,但不能替代专业诊疗
陈璐强调:“我们不是说 AI 模型不行,只是它们在医疗领域还没到‘黄金时段’。还有很多工作要做。”
研究团队给出了明确的建议:
- AI 工具可以作为辅助,但绝不能替代专业医疗建议
- 患者在做任何健康决策前,务必咨询医生
- 医疗专业人士和患者都应了解 AI 模型的局限性
中国用户的特别提示
对于中国 AI 从业者和用户,这项研究有几点启示:
- 国内大模型在医疗场景同样可能存在“幻觉”问题,中文医学语料的质量和覆盖度可能带来额外挑战
- 目前国内对 AI 医疗应用的监管正在完善,开发者需格外注意合规和安全边界
- 通用大模型与专业医疗 AI(如经过医学数据微调、通过临床验证的系统)有本质区别,不可混为一谈
这项研究再次提醒我们:技术进步不等于临床就绪。在 AI 医疗应用真正成熟之前,保持审慎态度至关重要。
本文基于 GNews:RTE.ie 报道, 由 AiDuo123 AI 编辑翻译改写。原文链接: https://www.rte.ie/brainstorm/2026/0625/1545495-health-medical-advice-ai-chatbot-chatgpt/
常见问题
- ChatGPT 在医疗问题上的准确率为什么这么低?
- 研究显示 ChatGPT 整体准确率仅 33.3%,在肿瘤学专业问题上错误率达 77%。主要原因是大语言模型存在'幻觉'问题——会生成看似合理但实际错误的信息,且缺乏针对医学领域的专业验证机制。通用模型的训练数据虽广泛,但医学知识需要极高准确性和时效性,这是当前 LLM 的短板。
- 我可以用 AI 工具查询健康信息吗?
- 可以作为初步了解,但绝不能替代专业医疗建议。研究人员明确警告,患者在做任何健康决策前必须咨询医生。AI 工具可能给出过度自信的错误答案,普通人难以分辨,盲目遵循可能危害健康。建议将 AI 回答仅作为'提问方向'参考,最终诊疗必须依赖有资质的医疗机构。
- 国内 AI 医疗应用是否面临同样问题?
- 很可能存在类似甚至更严重的风险。中文医学语料的质量、覆盖度和标注准确性通常不如英文资源充分,可能加剧'幻觉'问题。目前国内对 AI 医疗应用的监管正在完善,用户应区分'通用聊天机器人'与'经过临床验证的专业医疗 AI 系统',后者需通过药监部门审批才能用于实际诊疗。
- 这项研究对 AI 医疗行业有什么启示?
- 研究表明当前通用大模型尚未做好临床应用准备,行业需要在几个方向努力:建立医学领域专用微调数据集、引入专业知识图谱减少幻觉、设计不确定性表达机制(让 AI 承认'不知道')、进行严格临床验证。对开发者而言,需在产品中明确标注使用限制,避免用户过度依赖;对监管者,需建立 AI 医疗应用的准入和评估标准。
相关 AI 工具
文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾
Midjourney
精选AI 绘图
顶级 AI 图像生成工具,以画面质感、艺术风格、构图理解著称。V7 模型在写实和创意两个方向均领先。需 Discord 或网页版使用。
Cursor
精选AI 开发工具
AI-first 代码编辑器,基于 VS Code 构建,深度集成 Claude / GPT-4o 等模型。Composer 多文件编辑、Tab 自动补全、Agent 模式三大杀手锏。
Claude
精选大模型应用
Anthropic 推出的 AI 助手,以长上下文(200K tokens)、对复杂任务的细腻理解、Artifacts 可视化输出闻名。Claude Sonnet 4.5 / Opus 4.7 在编程、写作、推理多项基准上领先。
相关推荐
同类资讯 — 由发布时间排序

独立音乐版权方Round Hill起诉Suno与Anthropic 索赔超10亿美元
拥有11亿美元版权资产的独立音乐发行商Round Hill于2026年8月17日分别起诉AI音乐生成平台Suno和大语言模型公司Anthropic,指控两家公司未经授权抓取其版权音乐用于模型训练。诉讼索赔金额均超10亿美元,涉及歌曲包括《Total Eclipse of the Heart》等经典作品。Round Hill CEO明确表示不会和解,其代理律师曾赢得"Blurred Lines"版权案。
客户体验进入编排时代:AI 智能体如何摆脱遗留系统束缚
企业正加速部署 AI 智能体和语音 AI,但多数只是将对话式 AI 嫁接到遗留系统上,导致编排(Orchestration)成为新挑战。塔塔通信(Tata Communications)高管指出,真正的竞争优势不在于自动化本身,而在于如何通过共享上下文层协调 AI 系统、数据和人工座席,实现无缝的端到端客户体验。

FlowX.AI 成为首批为 Gemini Enterprise 提供关键任务 AI 智能体的合作伙伴
FlowX.AI 宣布其专业化 AI 智能体已通过 Google Cloud Marketplace 接入 Gemini Enterprise,专为金融服务、保险、物流等高风险行业设计。该公司推出贷款文件完整性检查、资本市场文档提取等智能体,强调在关键业务流程中实现确定性验证而非单纯生成式推理,帮助企业将 AI 从辅助工具升级为可参与核心决策的生产力工具。

Google 搜索五大功能助你轻松升级家居装饰
Google 近期数据显示"家居装饰灵感"搜索量月增 300%,复古家具和彩色墙面成热门趋势。Google 搜索推出 AI 模式家具可视化、Lens 复古物品识别、Circle to Search 社交内容追踪、Search Live DIY 指导及价格追踪等五大功能,帮助用户从灵感到落地全流程完成家居改造。