• <table id="4yyaw"><kbd id="4yyaw"></kbd></table>
  • <td id="4yyaw"></td>
  • 發布時間:2023-06-20 21:50 原文鏈接: 實測得分超ChatGPT!百度文心大模型3.5版內測應用

    原文地址:http://news.sciencenet.cn/htmlnews/2023/6/503256.shtm

    6月20日消息,據內部人士透露,百度文心大模型3.5版本已內測可用。早在5月末中關村論壇上,百度創始人、董事長兼CEO李彥宏透露,百度大模型產品“文心一言”的“母本”將迎來3.5版本,距今時隔不到一個月。 最新版本文心大模型達到了怎樣的實力?在公開測試集上進行的基礎模型少樣本(Few-Shot)評測顯示,文心大模型3.5(ERNIE 3.5)在多個測試集的得分已超過ChatGPT。

    三大評測基準綜合評估 

    上萬道考題“統考”主流大模型 

    為驗證主流大模型的各項綜合能力,評測在AGIEval、C-Eval和MMLU三個權威評測基準上進行綜合評估。 AGIEval評測基準是微軟研究院發布的、專門用于評估模型在“以人為本”的標準化考試中表現水平的測試集。該基準選取20種面向普通人類考生的官方、公開、高標準的資格考試,包括普通大學入學考試(如中國的高考和美國的SAT考試)、司法考試、數學競賽、律師資格考試、國家公務員考試以及美國的GRE、GMAT等。 C-Eval評測基準是由上海交通大學、清華大學以及愛丁堡大學聯合創制和發布的中文基礎模型評測集。它包含13948個多項選擇題、涵蓋52個不同的學科,設置了四個難度級別,是面向中文語言模型的綜合考試評測集。 MMLU是伯克利大學、哥倫比亞大學、伊利諾伊大學厄巴納-香檳分校和芝加哥大學聯合發布的一種大規模多任務語言理解的基準測試,用于衡量模型的英文跨學科專業能力。該測試包含57個科目,涵蓋STEM、人文、社會科學等。

    除了文心大模型3.5,評測的模型還有ChatGPT、GPT-4、ChatGLM、LLaMa系列大模型。評測可以看出大模型在能力上的優劣,同時對模型的迭代發展也有著很強的指導作用。

    評測結果:

    文心大模型3.5中文能力超GPT-4,綜合能力超ChatGPT

    在AGIEval、C-Eval等中英文權威測試集和MMLU英文權威測試集中,國產文心大模型3.5取得了超過ChatGPT和LLaMa、ChatGLM等其他大模型的分數表現,在中文評測項中超越了GPT-4。

    在中文AGIEval評測中,文心大模型3.5得分64.37,遠超ChatGLM-6B、LLaMa-7B、LLaMa-13B、LLaMa-65B,同時還超過了 ChatGPT的40.27分和 GPT-4的56.96分,位居第一。AGIEval評測英文部分中,GPT-4得分65.55居于首位,文心大模型3.5得分錄得 50.59分,僅次于GPT-4。緊隨其后的是ChatGPT錄得48.75分。 在中文C-Eval評測中,文心大模型3.5測出71.93的最高得分,不僅高于ChatGPT的51.70分,還略高于GPT-4的68.57分,領先于LLaMa-65B、LLaMa-7B、ChatGLM-6B的得分。 在英文MMLU測試中,GPT-4和ChatGPT的表現較好,分別以82.47分和68.85分領先于其他大模型。文心大模型3.5得分65.10緊隨其后,優于LLaMa-65B、LLaMa-13B、LLaMa-7B、ChatGLM-6B等模型分數。 從上述評測得分來看,文心大模型3.5版中文能力突出,甚至有超出 GPT-4 的表現;綜合能力稍遜于GPT-4,但已經在評測中超過了 ChatGPT,遠遠領先于其他開源大模型。

    國產大模型中文能力優勢突出 

    綜合能力加速縮小差距

    盡管市面上有多個大模型橫空出世,但大模型研發門檻高、難度大、投入高,依賴算力、數據等綜合支撐的現實不容忽視。在推動大模型產業化的路上,中國企業如何在大模型發展過程中發揮所長優勢,加速縮小差距? 中國工程院院士鄔賀銓曾在接受采訪時表示,中國企業在獲得中文語料和對中國文化的理解方面比外國企業有天然的優勢,中國制造業門類最全,具有面向實體產業訓練產業AIGC的有利條件。同時,在算力方面中國已具有較好的基礎。 以百度文心大模型3.5為例,與3.0版本相比,通過各項算法和數據的優化,尤其是百度首創的知識增強和檢索增強技術的優化,新版本文心大模型在各項能力上均有明顯提升。據了解,百度人工智能四層架構的端到端優化,尤其是框架和模型層的協同優化,讓文心大模型訓練速度、模型效果加速提升。 創新工場董事長兼CEO李開復也曾公開表示“中國擁有豐富的中文語料和龐大的市場,通過發展AI大模型,中國可以推動創新產業的發展,實現科技與經濟的雙重紅利。而且中國擁有龐大基數的年輕工程師和最堅韌的企業家,為發展AI大模型提供了強大的人才支持,技術領先、策略靈活、市場反應快、能打硬仗、落地執行力強,將是中國大模型公司的成功關鍵。”

    相關文章

    新方法可提高圖神經網絡處理數據的準確率

    山西大學智能信息處理研究所團隊在圖神經網絡研究方面取得重要進展,相關成果5月23日發表于人工智能領域國際期刊《IEEE模式分析與機器智能學報》(IEEETransactionsonPatternAna......

    電影《749局》科影融合特別場舉行

    原文地址:http://news.sciencenet.cn/htmlnews/2024/10/531421.shtm10月11日,科幻電影《749局》科影融合特別場在京舉行。電影主創團隊與科技領域相......

    甘肅林業職業技術大學揭牌成立

    10月11日,甘肅省迎來了職業教育領域的一個重要里程碑——甘肅林業職業技術大學正式揭牌成立。這一歷史性時刻標志著歷經六十八載發展的甘肅省唯一一所林業類高等院校,正式邁入了本科教育的新階段,開啟了新的征......

    守護“水塔”,在“世界屋脊”上打一場攻堅戰

    ”標志性科考活動獲系列重大突破 “第二次青藏科考標志性科考活動守護水塔‘一原兩湖三江’科考主體任務已經基本完成,這次科考從天到地、從冰到水取得了全方位的進展。”第二次青藏科考隊隊長、中國科學......

    關于確定2024年國家環境健康管理試點名單的通知

    關于確定2024年國家環境健康管理試點名單的通知北京市、河北省、內蒙古自治區、遼寧省、黑龍江省、江蘇省、浙江省、江西省、山東省、湖北省、湖南省、廣東省、重慶市、四川省、貴州省、陜西省、青海省生態環境廳......

    首個菊科多組學數據平臺AMIR發布

    10月8日,華中農業大學果蔬園藝作物種質創新與利用全國重點實驗室、藥用植物資源可持續利用團隊梅之南教授和楊慶勇教授課題組,發布了首個專門面向菊科植物的多組學數據庫平臺——AsteraceaeMulti......

    南郵“金牌教練”:清醒狀態下“時時在線”

    實驗桌上堆放著精密儀器和焊接工具,電腦上是正在運行的電路圖,一頁頁寫滿了數據、畫滿了圖樣的紙張在桌面鋪開,各式或大或小的電子元件前,南京郵電大學工程實驗教學部創新中心副主任郝學元正在埋首研制電工電子實......

    中國計量大學主持制定的兩項國家標準正式發布

    近日,記者從中國計量大學獲悉,該校生命科學學院蜜蜂與蜂產品學研究團隊主持的兩項推薦性國家標準《GB/T44349-2024 蜂花粉總多酚的檢測福林酚試劑比色法》和《GB/T44350-202......

    多級賦碼追溯柔性包裝生產線研制與應用通過鑒定

    10月10日,由廣東省機械行業協會組織并主持召開的“面向軟性物料的多級賦碼追溯柔性包裝生產線研制與應用”項目科技成果鑒定會議在廣東佛山舉行。經專家鑒定,該項目成果總體技術水平達到國際先進水平。記者獲悉......

    我國科學家獲得全球首個純合基因編輯橡膠苗

    近日,中國熱帶農業科學院橡膠研究所組培與轉基因團隊在全球率先獲得了橡膠樹CRISPR/Cas9純合基因編輯橡膠苗。相關研究成果在線發表于《經濟作物和產品》(IndustrialCropsandProd......

  • <table id="4yyaw"><kbd id="4yyaw"></kbd></table>
  • <td id="4yyaw"></td>
  • 调性视频