《自然》24日正式發表的一篇研究論文指出了一個人工智能(AI)嚴重問題:用AI生成的數據集訓練未來幾代機器學習模型,可能會嚴重“污染”它們的輸出,這被稱為“模型崩潰”。研究顯示,原始內容會在9次迭代以后,變成不相關的“胡言亂語”(演示中一個建筑文本最終變成了野兔的名字),這凸顯出使用可靠數據訓練AI模型的重要性。
生成式AI工具越來越受歡迎,如大語言模型等,這類工具主要用人類生成的輸入進行訓練。不過,隨著這些AI模型在互聯網不斷壯大,計算機生成內容可能會以遞歸循環的形式被用于訓練其他AI模型或其自身。
包括英國牛津大學在內的聯合團隊一直在進行相關研究,并在去年論文預印本中提出這一概念。在正式發表的論文中,他們用數學模型演示了AI可能會出現的“模型崩潰”。他們證明了一個AI會忽略訓練數據中的某些輸出(如不太常見的文本),導致其只用一部分數據集來自我訓練。
團隊分析了AI模型會如何處理主要由AI生成的數據集。他們發現,給模型輸入AI生成的數據,會減弱今后幾代模型的學習能力,最終導致了“模型崩潰”。他們測試的幾乎所有遞歸訓練語言模型,都容易出現問題。比如,一個用中世紀建筑文本作為原始輸入的測試,到第9代的輸出已經是一串野兔的名字。
團隊指出,用前幾代生成的數據集去訓練AI,崩潰是一個不可避免的結局。他們認為,必須對數據進行嚴格過濾。與此同時,這也意味著依賴人類生成內容的AI模型,或許能訓練出更高效的AI模型。
4月25日,中國科學技術大學在安徽合肥舉行AI物質創制生態大會。安徽省委書記梁言順、國家自然科學基金委員會主任竇賢康出席會議并致辭。中國科學院副院長、黨組成員汪克強出席會議,并為科學智能物質創制中心和......
4月25日,中國科學技術大學在安徽合肥舉行AI物質創制生態大會。安徽省委書記梁言順、國家自然科學基金委員會主任竇賢康出席會議并致辭。中國科學院副院長、黨組成員汪克強出席會議,并為科學智能物質創制中心和......
2026年4月24日,工信部辦公廳、國家數據局綜合司聯合印發通知(工信廳聯科函〔2026〕193號),正式實施2026年“模數共振”行動,推動AI模型與數據資源協同互促,助力人工智能高水平賦能新型工業......
2026年4月24日,工信部辦公廳、國家數據局綜合司聯合印發通知(工信廳聯科函〔2026〕193號),正式實施2026年“模數共振”行動,推動AI模型與數據資源協同互促,助力人工智能高水平賦能新型工業......
高端科學儀器是國之重器,當前“人工智能(AI)+”正在推動科學儀器實現智能化、精準化發展。在4月23日—24日召開的第十九屆中國科學儀器發展年會上,科研探索對于儀器的智能化需求成為研討熱點。“過去科學......
高端科學儀器是國之重器,當前“人工智能(AI)+”正在推動科學儀器實現智能化、精準化發展。在4月23日—24日召開的第十九屆中國科學儀器發展年會上,科研探索對于儀器的智能化需求成為研討熱點。“過去科學......
2026年4月25日,由北京理化分析測試技術學會質譜專業委員會主辦、北京質譜中心協辦的“2026年度北京質譜年會”在北京圓滿召開。本次年會以“AI賦能質譜及相關組學”為主題,旨在全面回顧2025年度質......
2026年4月25日,由北京理化分析測試技術學會質譜專業委員會主辦、北京質譜中心協辦的“2026年度北京質譜年會”在北京圓滿召開。本次年會以“AI賦能質譜及相關組學”為主題,旨在全面回顧2025年度質......
近期,AI“投毒”隱蔽產業鏈被曝光,引發社會廣泛關注。這種通過惡意數據污染AI模型的行為,不僅擾亂商業秩序、影響信息傳播,更會危害國家安全。人工智能在賦能千行百業的同時,其安全風險也不容忽視。推動AI......
近期,AI“投毒”隱蔽產業鏈被曝光,引發社會廣泛關注。這種通過惡意數據污染AI模型的行為,不僅擾亂商業秩序、影響信息傳播,更會危害國家安全。人工智能在賦能千行百業的同時,其安全風險也不容忽視。推動AI......