近期,中國(guó)工業(yè)互聯(lián)網(wǎng)研究院(簡(jiǎn)稱(chēng)“工聯(lián)院”)針對(duì)人工智能大模型在中文工業(yè)領(lǐng)域的知識(shí)問(wèn)答能力進(jìn)行系統(tǒng)性評(píng)測(cè)。結(jié)果顯示,百度文心一言表現(xiàn)超過(guò)GPT3.5,綜合評(píng)價(jià)指數(shù)在國(guó)內(nèi)排名第一。
工聯(lián)院本次評(píng)測(cè)選取了工業(yè)領(lǐng)域典型的八大行業(yè)。百度文心一言在??電子設(shè)備、??裝備、???鋼鐵、采礦、電力、石化、建材等七大行業(yè)均獲國(guó)內(nèi)第一。
五大院士,八大IEEE Fellow,共十三位頂級(jí)專(zhuān)家構(gòu)成了專(zhuān)家委員會(huì)。評(píng)測(cè)對(duì)象涵蓋GPT4、GPT3.5、文心一言、ChatGLM等國(guó)內(nèi)外具有代表性的頭部大模型。評(píng)估結(jié)果選取性能前六名的模型進(jìn)行公布。
百度文心一言在國(guó)內(nèi)“最懂工業(yè)”
本次工業(yè)知識(shí)問(wèn)答測(cè)試主要分為客觀題與主觀題兩大類(lèi),總計(jì)超過(guò)1100個(gè)問(wèn)題。主觀題主要考察四大維度:基礎(chǔ)能力、語(yǔ)句能力、概括能力和邏輯能力。
評(píng)測(cè)結(jié)果顯示,GPT4表現(xiàn)最佳。國(guó)內(nèi)頭部大模型表現(xiàn)亮眼,整體與GPT3.5相當(dāng)。其中百度文心一言表現(xiàn)超過(guò)GPT3.5,在國(guó)內(nèi)大模型中排名第一。
在客觀題環(huán)節(jié),評(píng)測(cè)結(jié)果顯示,GPT4與文心一言表現(xiàn)好于其他大模型。但評(píng)測(cè)結(jié)果也同時(shí)指出,大模型普遍準(zhǔn)確率有較大的提升空間。
主觀題方面,國(guó)內(nèi)大模型的基礎(chǔ)能力、語(yǔ)句能力與GPT4接近,概括能力、邏輯能力與GPT4有一定差距。
在大模型的自我認(rèn)知能力和污染問(wèn)題分析能力上,GPT4相較于其他大模型表現(xiàn)出更好的能力。
大模型發(fā)展新熱點(diǎn):豐富特定行業(yè)專(zhuān)業(yè)知識(shí)
雖然國(guó)內(nèi)大模型在本次評(píng)測(cè)表現(xiàn)較好,甚至在部分行業(yè)趕超GPT3.5,但工聯(lián)院評(píng)測(cè)報(bào)告也指出,國(guó)內(nèi)外通用大模型在工業(yè)知識(shí)問(wèn)答領(lǐng)域探索仍處于初級(jí)階段,國(guó)內(nèi)大模型與GPT4有差距,比如行業(yè)間的泛化能力有待加強(qiáng)。
實(shí)際上,工聯(lián)院評(píng)測(cè)報(bào)告揭示出通用大模型落地垂直行業(yè)的痛點(diǎn),缺乏特定行業(yè)的專(zhuān)業(yè)知識(shí)。
關(guān)于解決難題的方法,工聯(lián)院評(píng)測(cè)報(bào)告給出的建議是,進(jìn)一步豐富相關(guān)專(zhuān)業(yè)領(lǐng)域的數(shù)據(jù)訓(xùn)練集,進(jìn)一步進(jìn)行專(zhuān)業(yè)化的微調(diào)。
當(dāng)前,國(guó)內(nèi)科技公司紛紛加強(qiáng)與工業(yè)企業(yè)合作,期望通過(guò)在實(shí)際場(chǎng)景中探索應(yīng)用大模型,彌補(bǔ)差距,趕超GPT4.0。
比如在本次評(píng)測(cè)中位居國(guó)內(nèi)模型第一的百度文心一言,與南方電網(wǎng)電力調(diào)度控制中心在電力調(diào)度場(chǎng)景探索使用調(diào)度AI大模型。在汽車(chē)行業(yè),長(zhǎng)安汽車(chē)基于百度文心大模型正在開(kāi)發(fā)生成式人工智能產(chǎn)品,賦能一款量產(chǎn)車(chē)型,實(shí)現(xiàn)提升用戶(hù)體驗(yàn)的目標(biāo)。除了能源、汽車(chē)制造,百度智能云還在建筑、采礦、物流、紡織等領(lǐng)域,探索使用大模型提升運(yùn)營(yíng)效率和用戶(hù)體驗(yàn)效果。
通過(guò)在實(shí)際場(chǎng)景的探索應(yīng)用,科技公司可以積攢更多的行業(yè)Know-how,擴(kuò)展相關(guān)領(lǐng)域的數(shù)據(jù)訓(xùn)練集。這種外部真實(shí)反饋有助驅(qū)動(dòng)大模型更加快速的實(shí)現(xiàn)迭代升級(jí)。
未來(lái),工聯(lián)院將持續(xù)開(kāi)展通用大模型在工業(yè)領(lǐng)域更多維度的性能評(píng)測(cè),包括但不限于大模型的魯棒性、安全性以及人類(lèi)大價(jià)值觀等。
-
南方電網(wǎng)
+關(guān)注
關(guān)注
2文章
194瀏覽量
29482 -
文心一言
+關(guān)注
關(guān)注
0文章
133瀏覽量
1844 -
大模型
+關(guān)注
關(guān)注
2文章
3132瀏覽量
4049
原文標(biāo)題:工聯(lián)院大模型測(cè)評(píng):文心一言在工業(yè)領(lǐng)域表現(xiàn)超過(guò)GPT3.5,居國(guó)內(nèi)大模型首位
文章出處:【微信號(hào):CADCAM_beijing,微信公眾號(hào):智能制造IMS】歡迎添加關(guān)注!文章轉(zhuǎn)載請(qǐng)注明出處。
發(fā)布評(píng)論請(qǐng)先 登錄
寧暢與與百度文心大模型展開(kāi)深度技術(shù)合作
百度文心大模型X1 Turbo獲得信通院當(dāng)前大模型最高評(píng)級(jí)證書(shū)

如何賦能醫(yī)療AI大模型應(yīng)用?

deepseek和文心一言兩者有什么區(qū)別?哪個(gè)跟合適您使用呢?
百度下一代文心大模型正式開(kāi)源
百度文心大模型4月1日起全面免費(fèi)開(kāi)放
百度宣布文心一言將全面免費(fèi)
字節(jié)跳動(dòng)豆包大模型1.5 Pro發(fā)布
電子發(fā)燒友榮獲電子工業(yè)出版社博文視點(diǎn) “2024 年度卓越合作伙伴”
一文說(shuō)清楚什么是AI大模型

評(píng)論