人工智能(AI)在給出準確答案的同時,也會有一些“胡亂輸出”令人難辨真假,這被稱為“幻覺”(hallucination)。而新一期《自然》雜志發表的一項研究報道了一種新方法,能檢測大語言模型(LLM)產生的“幻覺”,即該方法能測量生成回答的含義的不確定性,或能提升LLM輸出答案的可靠性。
類似ChatGPT和Gemini等LLM,是能閱讀和生成自然人類語言的AI系統。不過,這類系統很容易產生所謂“幻覺”,即生成不準確或沒有意義的內容。檢測LLM出現的這種錯誤非常難,因為這些回答的呈現方式看起來很可信。
英國牛津大學研究團隊此次嘗試量化一個LLM產生此類錯誤的程度,從而判斷生成的內容有多忠于提供的源內容。他們的方法能檢測“編造”——這是幻覺的一個子類別,特指不準確和隨意的內容,常出現在LLM缺乏某類知識的情況下。這種方法考慮了語言的微妙差別,以及回答如何能以不同的方式表達,從而擁有不同的含義。團隊的研究表明,他們的方法能在LLM生成的個人簡介,以及關于瑣事、常識和生命科學這類話題的回答中識別出“編造”內容。
在同時發表的新聞與觀點文章中,澳大利亞皇家墨爾本理工大學科學家指出,該方法由一個LLM完成,并通過第三個LLM進行評價,等于在“以毒攻毒”。文章寫道,“用一個LLM評估一種基于LLM的方法似乎是在循環論證,而且可能有偏差。”不過,團隊指出他們的方法有望幫助用戶理解在哪些情況下使用LLM的回答需要注意,也意味著可以提高LLM在更多應用場景中的置信度。
4月25日,中國科學技術大學在安徽合肥舉行AI物質創制生態大會。安徽省委書記梁言順、國家自然科學基金委員會主任竇賢康出席會議并致辭。中國科學院副院長、黨組成員汪克強出席會議,并為科學智能物質創制中心和......
4月25日,中國科學技術大學在安徽合肥舉行AI物質創制生態大會。安徽省委書記梁言順、國家自然科學基金委員會主任竇賢康出席會議并致辭。中國科學院副院長、黨組成員汪克強出席會議,并為科學智能物質創制中心和......
2026年4月24日,工信部辦公廳、國家數據局綜合司聯合印發通知(工信廳聯科函〔2026〕193號),正式實施2026年“模數共振”行動,推動AI模型與數據資源協同互促,助力人工智能高水平賦能新型工業......
2026年4月24日,工信部辦公廳、國家數據局綜合司聯合印發通知(工信廳聯科函〔2026〕193號),正式實施2026年“模數共振”行動,推動AI模型與數據資源協同互促,助力人工智能高水平賦能新型工業......
高端科學儀器是國之重器,當前“人工智能(AI)+”正在推動科學儀器實現智能化、精準化發展。在4月23日—24日召開的第十九屆中國科學儀器發展年會上,科研探索對于儀器的智能化需求成為研討熱點。“過去科學......
高端科學儀器是國之重器,當前“人工智能(AI)+”正在推動科學儀器實現智能化、精準化發展。在4月23日—24日召開的第十九屆中國科學儀器發展年會上,科研探索對于儀器的智能化需求成為研討熱點。“過去科學......
2026年4月25日,由北京理化分析測試技術學會質譜專業委員會主辦、北京質譜中心協辦的“2026年度北京質譜年會”在北京圓滿召開。本次年會以“AI賦能質譜及相關組學”為主題,旨在全面回顧2025年度質......
2026年4月25日,由北京理化分析測試技術學會質譜專業委員會主辦、北京質譜中心協辦的“2026年度北京質譜年會”在北京圓滿召開。本次年會以“AI賦能質譜及相關組學”為主題,旨在全面回顧2025年度質......
近期,AI“投毒”隱蔽產業鏈被曝光,引發社會廣泛關注。這種通過惡意數據污染AI模型的行為,不僅擾亂商業秩序、影響信息傳播,更會危害國家安全。人工智能在賦能千行百業的同時,其安全風險也不容忽視。推動AI......
近期,AI“投毒”隱蔽產業鏈被曝光,引發社會廣泛關注。這種通過惡意數據污染AI模型的行為,不僅擾亂商業秩序、影響信息傳播,更會危害國家安全。人工智能在賦能千行百業的同時,其安全風險也不容忽視。推動AI......