chinese直男口爆体育生外卖, 99久久er热在这里只有精品99, 又色又爽又黄18禁美女裸身无遮挡, gogogo高清免费观看日本电视,私密按摩师高清版在线,人妻视频毛茸茸,91论坛 兴趣闲谈,欧美 亚洲 精品 8区,国产精品久久久久精品免费

0
  • 聊天消息
  • 系統(tǒng)消息
  • 評論與回復(fù)
登錄后你可以
  • 下載海量資料
  • 學(xué)習(xí)在線課程
  • 觀看技術(shù)視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會員中心
創(chuàng)作中心

完善資料讓更多小伙伴認(rèn)識你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

商湯科技正式發(fā)布并開源全新多模態(tài)模型架構(gòu)NEO

商湯科技SenseTime ? 來源:商湯科技SenseTime ? 2025-12-08 11:19 ? 次閱讀
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

商湯科技正式發(fā)布并開源了與南洋理工大學(xué)S-Lab合作研發(fā)的全新多模態(tài)模型架構(gòu) ——NEO,為日日新SenseNova多模態(tài)模型奠定了新一代架構(gòu)的基石。

作為行業(yè)首個可用的、實現(xiàn)深層次融合的原生多模態(tài)架構(gòu)(Native VLM),NEO從底層原理出發(fā),打破了傳統(tǒng)“模塊化”范式的桎梏,以“專為多模態(tài)而生”的創(chuàng)新設(shè)計,通過核心架構(gòu)層面的多模態(tài)深層融合,實現(xiàn)了性能、效率和通用性的整體突破,重新定義了多模態(tài)模型的效能邊界,標(biāo)志著人工智能多模態(tài)技術(shù)正式邁入“原生架構(gòu)”的新時代。

論文網(wǎng)址:https://arxiv.org/abs/2510.14979

Github開源網(wǎng)址:https://github.com/EvolvingLMMs-Lab/NEO(點(diǎn)擊閱讀原文即可跳轉(zhuǎn))

打破瓶頸告別“拼湊”,擁抱“原生”

b8f02de6-cea4-11f0-8c8f-92fbcf53809c.png

當(dāng)前,業(yè)內(nèi)主流的多模態(tài)模型大多遵循“視覺編碼器+投影器+語言模型”的模塊化范式。這種基于大語言模型(LLM)的擴(kuò)展方式,雖然實現(xiàn)了圖像輸入的兼容,但本質(zhì)上仍以語言為中心,圖像與語言的融合僅停留在數(shù)據(jù)層面。這種“拼湊”式的設(shè)計不僅學(xué)習(xí)效率低下,更限制了模型在復(fù)雜多模態(tài)場景下(比如涉及圖像細(xì)節(jié)捕捉或復(fù)雜空間結(jié)構(gòu)理解)的處理能力。

商湯NEO架構(gòu)正是為了解決這一痛點(diǎn)而生。早在2024年下半年,商湯便在國內(nèi)率先突破多模態(tài)原生融合訓(xùn)練技術(shù),以單一模型在SuperCLUE語言評測 和OpenCompass多模態(tài)評測中奪冠,并基于這一核心技術(shù)打造了日日新SenseNova 6.0,實現(xiàn)多模態(tài)推理能力領(lǐng)先。

之后,在2025年7月發(fā)布日日新SenseNova 6.5通過實現(xiàn)編碼器層面的早期融合,把多模態(tài)模型性價比提升3倍,并在國內(nèi)率先推出商用級別的圖文交錯推理。商湯此次更進(jìn)一步,徹底摒棄了傳統(tǒng)的模塊化結(jié)構(gòu),從底層原理出發(fā),推出了從零設(shè)計的NEO原生架構(gòu)。

三大內(nèi)核創(chuàng)新實現(xiàn)視覺和語言的深層統(tǒng)一

b9474c02-cea4-11f0-8c8f-92fbcf53809c.png

NEO架構(gòu)以極致效率和深度融合為核心理念,通過在注意力機(jī)制、位置編碼和語義映射三個關(guān)鍵維度的底層創(chuàng)新,讓模型天生具備了統(tǒng)一處理視覺與語言的能力:

原生圖塊嵌入(Native Patch Embedding):摒棄了離散的圖像tokenizer,通過獨(dú)創(chuàng)的Patch Embedding Layer (PEL)自底向上構(gòu)建從像素到詞元的連續(xù)映射。這種設(shè)計能更精細(xì)地捕捉圖像細(xì)節(jié),從根本上突破了主流模型的圖像建模瓶頸。

原生三維旋轉(zhuǎn)位置編碼(Native-RoPE):創(chuàng)新性地解耦了三維時空頻率分配,視覺維度采用高頻、文本維度采用低頻,完美適配兩種模態(tài)的自然結(jié)構(gòu)。這使得NEO不僅能精準(zhǔn)捕獲圖像的空間結(jié)構(gòu),更具備向視頻處理、跨幀建模等復(fù)雜場景無縫擴(kuò)展的潛力。

原生多頭注意力(Native Multi-Head Attention):針對不同模態(tài)特點(diǎn),NEO在統(tǒng)一框架下實現(xiàn)了文本token的自回歸注意力和視覺token的雙向注意力并存。這種設(shè)計極大地提升了模型對空間結(jié)構(gòu)關(guān)聯(lián)的利用率,從而更好地支撐復(fù)雜的圖文混合理解與推理。

此外,配合創(chuàng)新的Pre-Buffer & Post-LLM雙階段融合訓(xùn)練策略,NEO能夠在吸收原始LLM完整語言推理能力的同時,從零構(gòu)建強(qiáng)大的視覺感知能力,徹底解決了傳統(tǒng)跨模態(tài)訓(xùn)練中語言能力受損的難題。

實測表現(xiàn):十分之一的數(shù)據(jù)追評旗艦級性能

在架構(gòu)創(chuàng)新的驅(qū)動下,NEO展現(xiàn)出了驚人的數(shù)據(jù)效率與性能優(yōu)勢:

極高數(shù)據(jù)效率:僅需業(yè)界同等性能模型1/10的數(shù)據(jù)量(3.9億圖像文本示例),NEO便能開發(fā)出頂尖的視覺感知能力。無需依賴海量數(shù)據(jù)及額外視覺編碼器,其簡潔的架構(gòu)便能在多項視覺理解任務(wù)中追平Qwen2-VL、InternVL3等頂級模塊化旗艦?zāi)P汀?/p>

性能卓越且均衡:在MMMU、MMB、MMStar、SEED-I、POPE等多項公開權(quán)威評測中,NEO架構(gòu)均斬獲高分,展現(xiàn)出優(yōu)于其他原生VLM的綜合性能,真正實現(xiàn)了原生架構(gòu)的“精度無損”。

極致推理性價比:特別是在0.6B-8B的參數(shù)區(qū)間內(nèi),NEO在邊緣部署方面優(yōu)勢顯著。它不僅實現(xiàn)了精度與效率的雙重躍遷,更大幅降低了推理成本,將多模態(tài)視覺感知的“性價比”推向了極致。

開源共建構(gòu)建下一代AI基礎(chǔ)設(shè)施

b9a81af0-cea4-11f0-8c8f-92fbcf53809c.png

架構(gòu)是模型的“骨架”,只有骨架扎實,才能支撐起多模態(tài)技術(shù)的未來。NEO 架構(gòu)的早期融合設(shè)計支持任意分辨率與長圖像輸入,能夠無縫擴(kuò)展至視頻、具身智能等前沿領(lǐng)域,實現(xiàn)了從底層到頂層、端到端的真正融合。

從應(yīng)用角度,端到端的“原生一體化”設(shè)計,為機(jī)器人具身交互、智能終端多模態(tài)響應(yīng)、視頻理解、3D交互及具身智能等多元化場景的應(yīng)用,提供了堅實的技術(shù)支撐。

目前,商湯已正式開源基于NEO 架構(gòu)的2B 與 9B兩種規(guī)格模型,以推動開源社區(qū)在原生多模態(tài)架構(gòu)上的創(chuàng)新與應(yīng)用。

商湯科技表示,致力于通過開源協(xié)作與場景落地雙輪驅(qū)動,將NEO 打造為可擴(kuò)展、可復(fù)用的下一代 AI 基礎(chǔ)設(shè)施,推動原生多模態(tài)技術(shù)從實驗室走向廣泛的產(chǎn)業(yè)化應(yīng)用,加速構(gòu)建下一代產(chǎn)業(yè)級原生多模態(tài)技術(shù)標(biāo)準(zhǔn)。

聲明:本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點(diǎn)僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場。文章及其配圖僅供工程師學(xué)習(xí)之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問題,請聯(lián)系本站處理。 舉報投訴
  • 開源
    +關(guān)注

    關(guān)注

    3

    文章

    4036

    瀏覽量

    45573
  • 模型
    +關(guān)注

    關(guān)注

    1

    文章

    3649

    瀏覽量

    51716
  • 商湯
    +關(guān)注

    關(guān)注

    0

    文章

    82

    瀏覽量

    4271

原文標(biāo)題:從“數(shù)據(jù)融合”邁向“原生架構(gòu)”:商湯發(fā)布 NEO 架構(gòu),重新定義多模態(tài)模型效能邊界

文章出處:【微信號:SenseTime2017,微信公眾號:商湯科技SenseTime】歡迎添加關(guān)注!文章轉(zhuǎn)載請注明出處。

收藏 人收藏
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

    評論

    相關(guān)推薦
    熱點(diǎn)推薦

    亞馬遜云科技上線Amazon Nova模態(tài)嵌入模型

    Embeddings模態(tài)嵌入模型現(xiàn)已在Amazon Bedrock上線,這是一款專為Agentic RAG與語義搜索應(yīng)用打造的頂尖模態(tài)
    的頭像 發(fā)表于 10-29 17:15 ?119次閱讀
    亞馬遜云科技上線Amazon Nova<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>嵌入<b class='flag-5'>模型</b>

    商湯日日新V6.5模態(tài)模型登頂全球權(quán)威榜單

    根據(jù)權(quán)威評測平臺OpenCompass模態(tài)模型學(xué)術(shù)榜單(Multi-modal Academic Leaderboard)最新數(shù)據(jù)顯示,商湯「日日新 V6.5」(SenseNova
    的頭像 發(fā)表于 09-10 09:55 ?494次閱讀

    商湯科技模態(tài)通用智能戰(zhàn)略思考

    時間是最好的試金石,AI領(lǐng)域尤其如此。當(dāng)行業(yè)熱議大模型走向時,商湯早已錨定“模態(tài)通用智能”——這是我們以深厚研究積累和實踐反復(fù)驗證的可行路徑。
    的頭像 發(fā)表于 08-14 09:33 ?1013次閱讀

    “端云+模態(tài)”新范式:《移遠(yuǎn)通信AI大模型技術(shù)方案白皮書》正式發(fā)布

    7月28日,移遠(yuǎn)通信聯(lián)合智次方研究院正式發(fā)布《AI大模型技術(shù)方案白皮書》(以下簡稱“白皮書”)。這份白皮書系統(tǒng)梳理了AI大模型的技術(shù)特點(diǎn)、產(chǎn)業(yè)發(fā)展態(tài)勢與多元應(yīng)用場景,以及移遠(yuǎn)通信“端云+
    的頭像 發(fā)表于 07-28 13:08 ?939次閱讀
    “端云+<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>”新范式:《移遠(yuǎn)通信AI大<b class='flag-5'>模型</b>技術(shù)方案白皮書》正式<b class='flag-5'>發(fā)布</b>

    商湯日日新SenseNova融合模態(tài)模型 國內(nèi)首家獲得最高評級的大模型

    近日,中國信息通信研究院(以下簡稱“中國信通院”)完成可信AI模態(tài)模型首輪評估。 商湯日日新SenseNova融合模態(tài)
    的頭像 發(fā)表于 06-11 11:57 ?1159次閱讀

    愛芯通元NPU適配Qwen2.5-VL-3B視覺模態(tài)模型

    熟悉愛芯通元NPU的網(wǎng)友很清楚,從去年開始我們在端側(cè)模態(tài)模型適配上一直處于主動緊跟的節(jié)奏。先后適配了國內(nèi)最早開源
    的頭像 發(fā)表于 04-21 10:56 ?2600次閱讀
    愛芯通元NPU適配Qwen2.5-VL-3B視覺<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>大<b class='flag-5'>模型</b>

    海康威視發(fā)布模態(tài)模型AI融合巡檢超腦

    基于??涤^瀾大模型技術(shù)體系,海康威視推出新一代模態(tài)模型AI融合巡檢超腦,全面升級人、車、行為、事件等算法,為行業(yè)帶來全新
    的頭像 發(fā)表于 04-17 17:12 ?1340次閱讀

    商湯“日日新”融合大模型登頂大語言與模態(tài)雙榜單

    據(jù)弗若斯特沙利文(Frost & Sullivan, 簡稱“沙利文”)聯(lián)合頭豹研究院發(fā)布的《2025年中國大模型年度評測》結(jié)果顯示:在語言和模態(tài)核心能力測評中,
    的頭像 發(fā)表于 03-18 10:35 ?944次閱讀

    階躍星辰開源模態(tài)模型,天數(shù)智芯迅速適配

    近日,頭部大模型創(chuàng)業(yè)公司階躍星辰在行業(yè)內(nèi)引起了軒然大波,宣布正式開源兩款Step系列模態(tài)模型——Step-Video-T2V視頻生成
    的頭像 發(fā)表于 02-19 14:30 ?820次閱讀

    ??低?b class='flag-5'>發(fā)布模態(tài)模型文搜存儲系列產(chǎn)品

    模態(tài)模型為安防行業(yè)帶來重大技術(shù)革新,基于觀瀾大模型技術(shù)體系,海康威視將大參數(shù)量、大樣本量的圖文模態(tài)
    的頭像 發(fā)表于 02-18 10:33 ?1019次閱讀

    商湯“日日新”融合大模型榮獲雙料冠軍

    近日,商湯技正式推出了其創(chuàng)新力作——“日日新”融合大模型。該模型在技術(shù)上實現(xiàn)了原生融合模態(tài)的突破,使得其深度推理能力和
    的頭像 發(fā)表于 01-13 16:10 ?840次閱讀

    商湯科技推出“日日新”融合大模型

    剛剛,商湯正式推出“日日新”融合大模型,領(lǐng)先實現(xiàn)原生融合模態(tài),深度推理能力與模態(tài)信息處理能力均大幅提升,并在兩大權(quán)威評測榜單奪得第一,成為
    的頭像 發(fā)表于 01-10 15:59 ?1125次閱讀

    阿里云發(fā)布開源模態(tài)推理模型QVQ-72B-Preview

    近日,阿里云宣布了一項重大技術(shù)突破,正式發(fā)布了業(yè)界首個開源模態(tài)推理模型——QVQ-72B-Preview。這一
    的頭像 發(fā)表于 12-27 10:28 ?860次閱讀

    商湯日日新模態(tài)模型權(quán)威評測第一

    剛剛,商湯科技日日新SenseNova模態(tài)模型,在權(quán)威綜合評測權(quán)威平臺OpenCompass的模態(tài)
    的頭像 發(fā)表于 12-20 10:39 ?1501次閱讀

    商湯科技完成戰(zhàn)略組織架構(gòu)重組

    全新的“1+X”架構(gòu)模式。其中,“1”代表公司的核心業(yè)務(wù),即全力打造行業(yè)領(lǐng)先的AI云平臺。該平臺將實現(xiàn)大裝置、基礎(chǔ)模型與AI應(yīng)用之間的無縫集成,為用戶提供更為便捷、高效的AI服務(wù)。 在CV(計算機(jī)視覺)領(lǐng)域,
    的頭像 發(fā)表于 12-13 14:09 ?956次閱讀