ChatGPT 醫療建議準確率僅 33%:腫瘤學問題答錯率達 77%
紐約州立大學賓漢姆頓分校最新研究顯示,ChatGPT 在回答腫瘤學相關醫療問題時,77% 的情況下給出錯誤建議,整體準確率僅 33.3%。研究人員警告,AI 大模型在醫療領域的"幻覺"問題可能危及患者健康,目前尚不具備臨床應用條件。該研究已發表於《PNAS Nexus》期刊。

ChatGPT 醫療建議靠譜嗎?最新研究啪啪打臉
紐約州立大學賓漢姆頓分校的研究團隊最近搞了個大新聞,他們發現 ChatGPT 在醫療建議這塊兒,特別是腫瘤學領域,表現相當拉胯。這項研究已經發表在《PNAS Nexus》期刊上,直接給 ChatGPT 的醫療能力打了個大大的問號。
實驗設計:用權威問答庫給 AI 開卷考
研究人員從美國臨床腫瘤學會(ASCO)的“癌症患者生活”網站上扒了 102 個真實患者常問的問題,涵蓋了化療、放療、手術等各種治療方式。然後,他們把這些問題餵給 ChatGPT,再把它的回答和 ASCO 的官方標準答案一一對比。
結果讓人大跌眼鏡:
- 準確率只有 33.3%
- 錯誤率高達 63.3%
- 不完整回答佔 3.3%
更扎心的是,當問題聚焦到腫瘤學專業領域時,ChatGPT 的錯誤建議比例直接飆到 77%。
核心風險:AI 的“迷之自信”
該校系統科學與工業工程系助理教授 陳璐 指出:“這些 AI 模型還沒做好臨床應用的準備。它們還是會犯很多錯誤,如果患者盲目相信這些建議,可能會對自己的健康造成嚴重威脅。”
研究團隊還發現,ChatGPT 即使給出錯誤答案時,語氣也總是自信滿滿。陳璐解釋:“普通人很難分辨答案的對錯。有時候錯誤答案聽起來特別合理,而正確答案反而顯得複雜微妙。”這種“過度自信的幻覺”正是大語言模型在醫療場景中最危險的特性之一。
不是個案:多項研究都在打臉
這已經不是第一次有研究質疑 AI 醫療建議的可靠性了。2023 年發表在《JAMA Internal Medicine》的一項研究顯示,ChatGPT 在醫療諮詢中提供不準確或不完整資訊的比例達到 60%。另一項刊登在《Nature》的研究則發現,AI 模型能生成看似真實的醫學影像,但其中包含虛構的病變。
專家建議:AI 可以輔助,但不能替代專業診療
陳璐強調:“我們不是說 AI 模型不行,只是它們在醫療領域還沒到‘黃金時段’。還有很多工作要做。”
研究團隊給出了明確的建議:
- AI 工具可以作為輔助,但絕不能替代專業醫療建議
- 患者在做任何健康決策前,務必諮詢醫生
- 醫療專業人士和患者都應瞭解 AI 模型的侷限性
中國使用者的特別提示
對於中國 AI 從業者和使用者,這項研究有幾點啟示:
- 國內大模型在醫療場景同樣可能存在“幻覺”問題,中文醫學語料的質量和覆蓋度可能帶來額外挑戰
- 目前國內對 AI 醫療應用的監管正在完善,開發者需格外注意合規和安全邊界
- 通用大模型與專業醫療 AI(如經過醫學資料微調、通過臨床驗證的系統)有本質區別,不可混為一談
這項研究再次提醒我們:技術進步不等於臨床就緒。在 AI 醫療應用真正成熟之前,保持審慎態度至關重要。
常見問題
ChatGPT 在醫療問題上的準確率為什麼這麼低?
研究顯示 ChatGPT 整體準確率僅 33.3%,在腫瘤學專業問題上錯誤率達 77%。主要原因是大語言模型存在'幻覺'問題——會生成看似合理但實際錯誤的資訊,且缺乏針對醫學領域的專業驗證機制。通用模型的訓練資料雖廣泛,但醫學知識需要極高準確性和時效性,這是當前 LLM 的短板。
我可以用 AI 工具查詢健康資訊嗎?
可以作為初步瞭解,但絕不能替代專業醫療建議。研究人員明確警告,患者在做任何健康決策前必須諮詢醫生。AI 工具可能給出過度自信的錯誤答案,普通人難以分辨,盲目遵循可能危害健康。建議將 AI 回答僅作為'提問方向'參考,最終診療必須依賴有資質的醫療機構。
國內 AI 醫療應用是否面臨同樣問題?
很可能存在類似甚至更嚴重的風險。中文醫學語料的質量、覆蓋度和標註準確性通常不如英文資源充分,可能加劇'幻覺'問題。目前國內對 AI 醫療應用的監管正在完善,使用者應區分'通用聊天機器人'與'經過臨床驗證的專業醫療 AI 系統',後者需通過藥監部門審批才能用於實際診療。
這項研究對 AI 醫療行業有什麼啟示?
研究表明當前通用大模型尚未做好臨床應用準備,行業需要在幾個方向努力:建立醫學領域專用微調資料集、引入專業知識圖譜減少幻覺、設計不確定性表達機制(讓 AI 承認'不知道')、進行嚴格臨床驗證。對開發者而言,需在產品中明確標註使用限制,避免使用者過度依賴;對監管者,需建立 AI 醫療應用的准入和評估標準。
本文基於 GNews:RTE.ie 報道, 由 AiDuo123 AI 編輯翻譯改寫。原文連結: https://www.rte.ie/brainstorm/2026/0625/1545495-health-medical-advice-ai-chatbot-chatgpt/
相关 AI 工具
文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾
Midjourney
精选AI 绘图
頂級 AI 影像生成工具,以畫面質感、藝術風格、構圖理解著稱。V7 模型在寫實和創意兩個方向均領先。需 Discord 或網頁版使用。
Cursor
精选AI 开发工具
AI-first 程式碼編輯器,基於 VS Code 構建,深度整合 Claude / GPT-4o 等模型。Composer 多檔案編輯、Tab 自動補全、Agent 模式三大殺手鐧。
Claude
精选大模型应用
Anthropic 推出的 AI 助手,以長上下文(200K tokens)、對複雜任務的細膩理解、Artifacts 視覺化輸出聞名。Claude Sonnet 4.5 / Opus 4.7 在程式設計、寫作、推理多項基準上領先。
相关推荐
同类资讯 — 由发布时间排序

愛爾蘭作家將從 Anthropic 13 億歐元版權和解中分得數百萬補償
AI 公司 Anthropic 因使用盜版圖書庫 LibGen 訓練模型達成 13.1 億歐元和解,數百名愛爾蘭作家將獲賠數百萬歐元。這是首個針對大語言模型訓練資料侵權的和解案,每本書約獲賠 2630 歐元,但僅限在美註冊版權作品。業內認為該案確立了"盜版資料庫侵權"原則,但也可能為使用合法二手書訓練模型開綠燈。

前 OpenAI 實習生分享 AI 求職五大實戰建議
21 歲的 Hamza Mostafa 曾在 OpenAI 實習三個月,他從計算機專業轉向 AI 領域,現獨立開發 AI 專案。他建議求職者採用"廣泛學習-專精方向-動手構建"三步法,善用 ChatGPT 等工具自學,並專注於簡歷最佳化、作品集等可控因素,避免被求職市場負面情緒影響。

德里法院支援OpenAI訓練合法性 谷歌推出Gemini網路安全工具
印度德里法院近期就AI訓練資料使用做出裁決,支援OpenAI的訓練實踐;同時OpenAI推出Presence和Health新功能,谷歌釋出基於Gemini的網路安全工具,Grok整合Excel。本週AI行業多個重要動態值得中國從業者關注。

Anthropic 啟動罕見病藥物研發計劃:AI 超級智慧能否打破製藥業利潤魔咒
AI 公司 Anthropic 於 2026 年 6 月 30 日宣佈將自主開展罕見病臨床前藥物研發,併發布面向科研人員的 Claude Science 工具平臺。這一舉動既可能挑戰傳統制藥業的利潤導向邏輯,也引發對 AI 超級智慧被濫用風險的擔憂——它究竟會成為真正治癒疾病的工具,還是製造"終身患者"的新手段?