每日動(dòng)態(tài)!美團(tuán)發(fā)布原生多模態(tài)大模型LongCat-Next
發(fā)布時(shí)間:2026-03-27 12:25:00
文章來源:新浪科技
美團(tuán)發(fā)布原生多模態(tài)大模型LongCat-Next
(資料圖)
新浪科技訊 3月27日上午消息,美團(tuán)發(fā)布并全面開源原生多模態(tài)大模型LongCat-Next及其核心組件離散原生分辨率視覺分詞器(dNaViT)。
該模型打破了當(dāng)前大模型以“語言為中心”的傳統(tǒng)拼湊式架構(gòu),將圖像、語音與文本統(tǒng)一映射為同源的離散Token。通過純粹的“下一個(gè)Token預(yù)測(cè)”(Next Token Prediction,NTP)范式,LongCat-Next讓視覺與語音成為AI的“原生母語”。
據(jù)介紹,LongCat-Next實(shí)現(xiàn)了三項(xiàng)關(guān)鍵技術(shù)突破:一是離散原生自回歸架構(gòu)(DiNA)徹底打破模態(tài)隔閡;二是離散原生分辨率視覺分詞器(dNaViT)構(gòu)造視覺世界的“詞典”,三是語義對(duì)齊完備編碼器破解“離散化必然損失信息”的行業(yè)難題。
標(biāo)簽:
