资讯政策与安全··来源: Rte·原文 →

ChatGPT 醫療建議準確率僅 33%:腫瘤學問題答錯率達 77%

紐約州立大學賓漢姆頓分校最新研究顯示,ChatGPT 在回答腫瘤學相關醫療問題時,77% 的情況下給出錯誤建議,整體準確率僅 33.3%。研究人員警告,AI 大模型在醫療領域的"幻覺"問題可能危及患者健康,目前尚不具備臨床應用條件。該研究已發表於《PNAS Nexus》期刊。

ChatGPT 醫療建議準確率僅 33%:腫瘤學問題答錯率達 77%
[广告位 · 上线后接 AdSense]

ChatGPT 醫療建議靠譜嗎?最新研究啪啪打臉

紐約州立大學賓漢姆頓分校的研究團隊最近搞了個大新聞,他們發現 ChatGPT 在醫療建議這塊兒,特別是腫瘤學領域,表現相當拉胯。這項研究已經發表在《PNAS Nexus》期刊上,直接給 ChatGPT 的醫療能力打了個大大的問號。

實驗設計:用權威問答庫給 AI 開卷考

研究人員從美國臨床腫瘤學會(ASCO)的“癌症患者生活”網站上扒了 102 個真實患者常問的問題,涵蓋了化療、放療、手術等各種治療方式。然後,他們把這些問題餵給 ChatGPT,再把它的回答和 ASCO 的官方標準答案一一對比。

結果讓人大跌眼鏡:

  • 準確率只有 33.3%
  • 錯誤率高達 63.3%
  • 不完整回答佔 3.3%

更扎心的是,當問題聚焦到腫瘤學專業領域時,ChatGPT 的錯誤建議比例直接飆到 77%

核心風險:AI 的“迷之自信”

該校系統科學與工業工程系助理教授 陳璐 指出:“這些 AI 模型還沒做好臨床應用的準備。它們還是會犯很多錯誤,如果患者盲目相信這些建議,可能會對自己的健康造成嚴重威脅。”

研究團隊還發現,ChatGPT 即使給出錯誤答案時,語氣也總是自信滿滿。陳璐解釋:“普通人很難分辨答案的對錯。有時候錯誤答案聽起來特別合理,而正確答案反而顯得複雜微妙。”這種“過度自信的幻覺”正是大語言模型在醫療場景中最危險的特性之一。

不是個案:多項研究都在打臉

這已經不是第一次有研究質疑 AI 醫療建議的可靠性了。2023 年發表在《JAMA Internal Medicine》的一項研究顯示,ChatGPT 在醫療諮詢中提供不準確或不完整資訊的比例達到 60%。另一項刊登在《Nature》的研究則發現,AI 模型能生成看似真實的醫學影像,但其中包含虛構的病變

專家建議:AI 可以輔助,但不能替代專業診療

陳璐強調:“我們不是說 AI 模型不行,只是它們在醫療領域還沒到‘黃金時段’。還有很多工作要做。”

研究團隊給出了明確的建議:

  1. AI 工具可以作為輔助,但絕不能替代專業醫療建議
  2. 患者在做任何健康決策前,務必諮詢醫生
  3. 醫療專業人士和患者都應瞭解 AI 模型的侷限性

中國使用者的特別提示

對於中國 AI 從業者和使用者,這項研究有幾點啟示:

  • 國內大模型在醫療場景同樣可能存在“幻覺”問題,中文醫學語料的質量和覆蓋度可能帶來額外挑戰
  • 目前國內對 AI 醫療應用的監管正在完善,開發者需格外注意合規和安全邊界
  • 通用大模型與專業醫療 AI(如經過醫學資料微調、通過臨床驗證的系統)有本質區別,不可混為一談

這項研究再次提醒我們:技術進步不等於臨床就緒。在 AI 醫療應用真正成熟之前,保持審慎態度至關重要。

常見問題

ChatGPT 在醫療問題上的準確率為什麼這麼低?

研究顯示 ChatGPT 整體準確率僅 33.3%,在腫瘤學專業問題上錯誤率達 77%。主要原因是大語言模型存在'幻覺'問題——會生成看似合理但實際錯誤的資訊,且缺乏針對醫學領域的專業驗證機制。通用模型的訓練資料雖廣泛,但醫學知識需要極高準確性和時效性,這是當前 LLM 的短板。

我可以用 AI 工具查詢健康資訊嗎?

可以作為初步瞭解,但絕不能替代專業醫療建議。研究人員明確警告,患者在做任何健康決策前必須諮詢醫生。AI 工具可能給出過度自信的錯誤答案,普通人難以分辨,盲目遵循可能危害健康。建議將 AI 回答僅作為'提問方向'參考,最終診療必須依賴有資質的醫療機構。

國內 AI 醫療應用是否面臨同樣問題?

很可能存在類似甚至更嚴重的風險。中文醫學語料的質量、覆蓋度和標註準確性通常不如英文資源充分,可能加劇'幻覺'問題。目前國內對 AI 醫療應用的監管正在完善,使用者應區分'通用聊天機器人'與'經過臨床驗證的專業醫療 AI 系統',後者需通過藥監部門審批才能用於實際診療。

這項研究對 AI 醫療行業有什麼啟示?

研究表明當前通用大模型尚未做好臨床應用準備,行業需要在幾個方向努力:建立醫學領域專用微調資料集、引入專業知識圖譜減少幻覺、設計不確定性表達機制(讓 AI 承認'不知道')、進行嚴格臨床驗證。對開發者而言,需在產品中明確標註使用限制,避免使用者過度依賴;對監管者,需建立 AI 醫療應用的准入和評估標準。


本文基於 GNews:RTE.ie 報道, 由 AiDuo123 AI 編輯翻譯改寫。原文連結: https://www.rte.ie/brainstorm/2026/0625/1545495-health-medical-advice-ai-chatbot-chatgpt/

[广告位 · 上线后接 AdSense]
标签:#OpenAI

相关 AI 工具

文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾

浏览全部工具 →

同类资讯 — 由发布时间排序

愛爾蘭作家將從 Anthropic 13 億歐元版權和解中分得數百萬補償

愛爾蘭作家將從 Anthropic 13 億歐元版權和解中分得數百萬補償

AI 公司 Anthropic 因使用盜版圖書庫 LibGen 訓練模型達成 13.1 億歐元和解,數百名愛爾蘭作家將獲賠數百萬歐元。這是首個針對大語言模型訓練資料侵權的和解案,每本書約獲賠 2630 歐元,但僅限在美註冊版權作品。業內認為該案確立了"盜版資料庫侵權"原則,但也可能為使用合法二手書訓練模型開綠燈。

政策与安全Anthropic
前 OpenAI 實習生分享 AI 求職五大實戰建議

前 OpenAI 實習生分享 AI 求職五大實戰建議

21 歲的 Hamza Mostafa 曾在 OpenAI 實習三個月,他從計算機專業轉向 AI 領域,現獨立開發 AI 專案。他建議求職者採用"廣泛學習-專精方向-動手構建"三步法,善用 ChatGPT 等工具自學,並專注於簡歷最佳化、作品集等可控因素,避免被求職市場負面情緒影響。

应用与案例OpenAI
德里法院支援OpenAI訓練合法性 谷歌推出Gemini網路安全工具

德里法院支援OpenAI訓練合法性 谷歌推出Gemini網路安全工具

印度德里法院近期就AI訓練資料使用做出裁決,支援OpenAI的訓練實踐;同時OpenAI推出Presence和Health新功能,谷歌釋出基於Gemini的網路安全工具,Grok整合Excel。本週AI行業多個重要動態值得中國從業者關注。

行业动态OpenAI
Anthropic 啟動罕見病藥物研發計劃:AI 超級智慧能否打破製藥業利潤魔咒

Anthropic 啟動罕見病藥物研發計劃:AI 超級智慧能否打破製藥業利潤魔咒

AI 公司 Anthropic 於 2026 年 6 月 30 日宣佈將自主開展罕見病臨床前藥物研發,併發布面向科研人員的 Claude Science 工具平臺。這一舉動既可能挑戰傳統制藥業的利潤導向邏輯,也引發對 AI 超級智慧被濫用風險的擔憂——它究竟會成為真正治癒疾病的工具,還是製造"終身患者"的新手段?

行业动态Anthropic