亚洲AV无码专区在线电影APP,国产嘿嘿嘿视频在线观看,国产在线线精品宅男网址,四虎永久在线精品免费青青

發(fā)新帖

通義千問開源數(shù)學(xué)模型Qwen2-Math,數(shù)學(xué)能力超越GPT-4o 行業(yè)新聞

新聞機器人 8月前 8256

8月9日消息,阿里通義團隊開源新一代數(shù)學(xué)模型Qwen2-Math,包含1.5B、7B、72B三個參數(shù)的基礎(chǔ)模型和指令微調(diào)模型。Qwen2-Math基于通義千問開源大語言模型Qwen2研發(fā),旗艦?zāi)P?Qwen2-Math-72B-Instruct在權(quán)威測評集MATH上的得分超越GPT-4o、Claude-3.5-Sonnet、Gemini-1.5-Pro、Llama-3.1-405B等,以84%的準(zhǔn)確率處理了代數(shù)、幾何、計數(shù)與概率、數(shù)論等多種數(shù)學(xué)問題,成為最先進的數(shù)學(xué)專項模型。

通義千問開源數(shù)學(xué)模型Qwen2-Math,數(shù)學(xué)能力超越GPT-4o?

注:在MATH基準(zhǔn)測評中,通義千問數(shù)學(xué)模型的旗艦款Qwen2-Math-72B-Instruct取得了84%的準(zhǔn)確率,超過GPT-4o、Claude-3.5-Sonnet、Gemini-1.5-Pro 和 Llama-3.1-405B等開閉源模型。

Qwen2-Math 基礎(chǔ)模型使用 Qwen2大語言模型進行初始化,并在精心設(shè)計的數(shù)學(xué)專用語料庫上進行預(yù)訓(xùn)練,訓(xùn)練數(shù)據(jù)包含大規(guī)模高質(zhì)量的數(shù)學(xué)網(wǎng)絡(luò)文本、書籍、代碼、考試題目,以及由 Qwen2 模型合成的數(shù)學(xué)預(yù)訓(xùn)練數(shù)據(jù)。所有預(yù)訓(xùn)練和微調(diào)數(shù)據(jù)集都進行了去污染處理。

隨后,研發(fā)團隊訓(xùn)練了指令微調(diào)版本模型:首先,基于Qwen2-Math-72B 訓(xùn)練一個數(shù)學(xué)專用的獎勵模型;接著,將密集的獎勵信號與指示模型是否正確回答問題的二元信號結(jié)合,用作學(xué)習(xí)標(biāo)簽,再通過拒絕采樣構(gòu)建監(jiān)督微調(diào)(SFT)數(shù)據(jù);最后在SFT模型基礎(chǔ)上使用 GRPO 方法優(yōu)化模型。

據(jù)悉,Qwen2-Math系列模型目前主要支持英文,通義團隊很快就將推出中英雙語版本,多語言版本也在開發(fā)中。

通義團隊在多個中英文數(shù)學(xué)基準(zhǔn)測評集對指令微調(diào)模型作了性能評估,除了 GSM8K 和 MATH等常見的測評基準(zhǔn) ,還引入了更具挑戰(zhàn)性的考試競賽類測試,如奧林匹克級別的基準(zhǔn)測評OlympiadBench、大學(xué)數(shù)學(xué)級別的基準(zhǔn)測評CollegeMath、高考(GaoKao)、美國數(shù)學(xué)邀請賽(AIME)2024 賽題、美國數(shù)學(xué)競賽( AMC)2023賽題,中文測評則有CMATH測評集、2024年中國高考和中考數(shù)學(xué)題。最終,Qwen2-Math-72B-Instruct表現(xiàn)優(yōu)異,在十大測評中都獲得了遠(yuǎn)超其他開源數(shù)學(xué)模型的成績。

通義千問開源數(shù)學(xué)模型Qwen2-Math,數(shù)學(xué)能力超越GPT-4o?

注:研發(fā)團隊在greedy和RM@8 的條件下對模型作了測評,表中為每款Qwen2-Math-72B-Instruct模型列出了三個得分結(jié)果,分別是第1次回答得分(無下標(biāo)數(shù)字)、8次回答中出現(xiàn)最多次數(shù)的答案的得分,8次回答中reward model所選答案的得分。

“大模型能不能做數(shù)學(xué)題”,不僅是社交平臺的熱門話題,也是業(yè)界非常關(guān)注的研究課題。處理高級數(shù)學(xué)問題,需要模型具備復(fù)雜多步邏輯推理能力。通義團隊在技術(shù)博客中表示,希望通過開源“為科學(xué)界解決高級數(shù)學(xué)問題做出貢獻”,未來將持續(xù)增強模型數(shù)學(xué)能力。

附:Qwen2-Math解題示例

通義千問開源數(shù)學(xué)模型Qwen2-Math,數(shù)學(xué)能力超越GPT-4o?

雷峰網(wǎng)(公眾號:雷峰網(wǎng))

雷峰網(wǎng)版權(quán)文章,未經(jīng)授權(quán)禁止轉(zhuǎn)載。

注:本文轉(zhuǎn)載自雷鋒網(wǎng),如需轉(zhuǎn)載請至雷鋒網(wǎng)官網(wǎng)申請授權(quán),轉(zhuǎn)載目的在于傳遞更多信息,并不代表本網(wǎng)贊同其觀點和對其真實性負(fù)責(zé)。如有侵權(quán)行為,請聯(lián)系我們,我們會及時刪除。

成都威爾德公司承接各種互聯(lián)網(wǎng)業(yè)務(wù)-幫助中小企業(yè)轉(zhuǎn)型互聯(lián)網(wǎng)加- 版權(quán)聲明 1、本主題所有言論和圖片純屬會員個人意見,與成都威爾德公司承接各種互聯(lián)網(wǎng)業(yè)務(wù)-幫助中小企業(yè)轉(zhuǎn)型互聯(lián)網(wǎng)加立場無關(guān)。
2、本站所有主題由該帖子作者發(fā)表,該帖子作者新聞機器人成都威爾德公司承接各種互聯(lián)網(wǎng)業(yè)務(wù)-幫助中小企業(yè)轉(zhuǎn)型互聯(lián)網(wǎng)加享有帖子相關(guān)版權(quán)。
3、成都威爾德公司承接各種互聯(lián)網(wǎng)業(yè)務(wù)-幫助中小企業(yè)轉(zhuǎn)型互聯(lián)網(wǎng)加管理員和版主有權(quán)不事先通知發(fā)貼者而刪除本文。
4、其他單位或個人使用、轉(zhuǎn)載或引用本文時必須同時征得該帖子作者新聞機器人成都威爾德公司承接各種互聯(lián)網(wǎng)業(yè)務(wù)-幫助中小企業(yè)轉(zhuǎn)型互聯(lián)網(wǎng)加的同意。

這家伙太懶了,什么也沒留下。
最新回復(fù) (0)
查看全部
全部樓主
    • 成都威爾德公司承接各種互聯(lián)網(wǎng)業(yè)務(wù)-幫助中小企業(yè)轉(zhuǎn)型互聯(lián)網(wǎng)加
      2
        立即登錄 立即注冊 QQ登錄
返回
免責(zé)聲明:本站部分資源來源于網(wǎng)絡(luò),如有侵權(quán)請發(fā)郵件(673011635@qq.com)告知我們,我們將會在24小時內(nèi)處理。