• <table id="4yyaw"><kbd id="4yyaw"></kbd></table>
  • <td id="4yyaw"></td>
  • 發布時間:2025-01-06 17:11 原文鏈接: 先進的人工智能模型居然不會“問診”

    一項新研究發現,雖然先進的人工智能(AI)模型在專業醫學考試中得分很高,但在醫生最重要的任務之一 ——與患者交談以收集相關醫療信息并提供準確診斷方面,仍然表現不佳。1月2日,相關研究成果發表于《自然-醫學》。

    圖片來源:Just_Super/Getty Images

    美國哈佛大學的Pranav Rajpurkar說:“雖然大型語言模型在多項選擇測試中的表現令人印象深刻,但在動態對話中,它們的準確性明顯下降,特別是難以進行開放式診斷推理。”

    當研究人員開發出一種基于模擬醫患對話評估臨床AI模型推理能力的方法時,這一點變得很明顯。這些“患者”基于2000個醫療案例,主要來自美國醫學委員會的專業考試。

    同樣來自哈佛大學的Shreya Johri說:“模擬患者互動可以評估病史采集技能,這是臨床實踐的一個關鍵組成部分。”她表示,新的評估基準被稱為CRAFT-MD,也“反映了現實生活中的情況,即患者可能不知道哪些細節是至關重要的,只有在特定問題提示時才會披露重要信息”。

    CRAFT-MD基準本身依賴于AI。美國OpenAI公司的GPT-4模型在與正在測試的“臨床AI”的對話中扮演了“患者AI”的角色。GPT-4還通過將“臨床AI”的診斷與每個病例的正確答案進行比較,幫助對結果進行評分。人類醫學專家仔細檢查了這些評估。他們還審查了對話,以檢查“患者AI”的準確性,并查看“臨床AI”是否成功收集了相關的醫療信息。

    多項實驗表明,4種領先的大型語言模型——OpenAI的GPT-3.5和GPT-4模型、美國Meta公司的Llama-2-7b模型和法國Mistral AI公司的Mistral-v2-7b模型,在基于對話的基準測試中的表現比基于書面病例總結進行診斷時差得多。3家公司沒有回應置評請求。

     例如,當提供結構化的病例摘要并允許從多項選擇答案列表中選擇診斷時,GPT-4模型的診斷準確性達到了令人印象深刻的82%,而當沒有多項選擇選項時,其診斷準確率降至49%以下。然而,當它不得不通過模擬的患者對話進行診斷時,準確率降至26%。

    在這項研究中,GPT-4模型的表現在測試中是最好的,GPT-3.5模型通常次之,Mistral-v2-7b模型排在第二位或第三位,Llama-2-7b模型通常得分最低。

    AI模型在很大程度上也未能收集完整的病史,比如GPT-4模型僅在71%的模擬患者對話中做到了這一點。即使AI模型確實收集了患者的相關病史,它們也并不總是能作出正確的診斷。

    美國斯克利普斯研究轉化研究所的Eric Topol表示,這種模擬患者對話的方式代表了一種比醫學檢查“更有用”的評估AI臨床推理能力的方法。

    Rajpurkar說,即使一個AI模型最終通過了這一基準,能夠根據模擬的患者對話持續作出準確診斷,也并不一定意味著它優于人類醫生。他指出,現實世界中的醫療實踐比模擬中的“更混亂”。它涉及管理多名患者、與醫療團隊協調、進行身體檢查,以及了解當地醫療情況中“復雜的社會和系統因素”。“AI可能是支持臨床工作的強大工具,但不一定能取代經驗豐富的醫生的整體判斷。”Rajpurkar說。

    相關論文信息:https://doi.org/10.1038/s41591-024-03328-5

    相關文章

    AI重塑商業邏輯,高校教育如何迎頭趕上?

    “當人工智能(AI)重構商業邏輯,當可持續發展成為全球命題,商學教育該如何重塑其DNA?學術界與產業界又該構建怎樣的共生生態?”9月5日,北師香港浸會大學校長陳致在首屆粵港澳大灣區未來商業論壇上致辭時......

    未來智能社會什么樣?從AI到AI+

    8月26日國發〔2025〕11號頒布了《國務院關于深入實施“人工智能+”行動的意見》這一重要文件,其中特別強調“人機協同、跨界融合、共創分享的智能經濟和智能社會新形態”,其核心就是要積極構建“人、機(......

    AI“副駕”增強腦機接口操控力

    美國科學家研究發現,一個由人工智能(AI)擔任副駕的腦機接口或能讓癱瘓人士更好地完成任務。該技術能讓癱瘓受試者在移動計算機光標或操作機械臂這類任務中的表現提升為原先的近4倍。相關研究9月1日發表于《自......

    人工智能與先進計算融合創新學術會議在滬召開

    8月30日,“人工智能與先進計算融合創新學術會議”在復旦大學舉行,400余位專家學者參會,共同探討如何實現人工智能(AI)與先進計算的融合創新,讓AI真正走出“工具”窠臼,邁向“自主智能”新紀元。會議......

    研究人員提出生成式人工智能預報洪水新方法

    近日,南方科技大學環境科學與工程學院教授鄭一團隊與中國科學院大氣物理研究所等多家單位合作,在《地球物理研究快報》發表最新研究成果,他們提出了生成式人工智能預報洪水的新防范,不僅為洪水預報技術帶來了新思......

    人工智能助力化學家研發高韌性塑料

    麻省理工學院(MIT)與杜克大學的研究人員通過引入機器學習模型識別的應力響應分子,成功研制出抗撕裂性更強的聚合物材料。這項強化聚合物材料的新策略有望催生更耐用的塑料,從而減少塑料廢棄物。研究團隊利用機......

    研究發現蜜蜂大腦能用極少細胞完成復雜視覺任務

    一項關于蜜蜂如何利用飛行運動實現高度精準學習與識別復雜視覺模式的新發現,可能標志著下一代人工智能開發方式的重大變革。英國謝菲爾德大學科研團隊構建了蜜蜂大腦的數字模型,揭示這些運動如何產生清晰高效的腦部......

    人工智能時代,如何培育復合型醫學人才?

    當前,人工智能(AI)技術的迅猛發展正驅動社會各領域體系性變革,醫學研究與衛生健康領域迎來歷史性變革。AI通過提升診療精準度、優化決策效率、重塑服務模式,持續釋放改善醫療質量與患者體驗的革命性潛能,成......

    鵬城實驗室成果亮相2025年人工智能向善全球峰會

    近日,由國際電信聯盟(ITU)等主辦的2025年人工智能向善全球峰會在瑞士日內瓦舉行。記者獲悉,鵬城實驗室組團參加該峰會并展示了面向網絡通信與人工智能融合的代表性成果,包括語義通信技術和標準化、智能編......

    葉生晅:用科技重塑零售業的未來

    “決策”,是葉生晅人生中的關鍵詞。這不僅是一個哲學命題,也是貫穿于心理學、認知科學與經濟學的核心議題。在葉生晅的人生軌跡中,“決策”的重要性清晰可見——他總是在關鍵節點跳出路徑依賴,作出那些看似“反直......

  • <table id="4yyaw"><kbd id="4yyaw"></kbd></table>
  • <td id="4yyaw"></td>
  • 调性视频