當(dāng)你把一張照片丟給豆包,它能準(zhǔn)確描述畫(huà)面內(nèi)容;在通義千問(wèn)里上傳一張草圖,它能識(shí)別你畫(huà)的是什么;Kimi 分析 PDF 里的圖表時(shí),甚至能讀出表格中的數(shù)據(jù)。
事實(shí)上,大模型的多模態(tài)能力已經(jīng)成為標(biāo)配。從 Qwen-VL 到 GLM-4V,幾乎所有主流模型都支持圖像輸入。
可大模型的核心——Transformer——本質(zhì)上只是一個(gè)"字接字"的預(yù)測(cè)器,它只認(rèn)識(shí) Token,不認(rèn)識(shí)像素。
核心問(wèn)題只有一句話:如何讓一個(gè)只懂文本的系統(tǒng),理解非文本的信息?
答案分三步:
第一步:把圖片切成小塊
模型沒(méi)有人類(lèi)的全局直覺(jué),它需要把一張完整的圖像拆解成無(wú)數(shù)個(gè)小方塊。
這個(gè)操作叫Patch Embedding。一張常見(jiàn)的 224×224 像素的圖片,被切成固定大小的"小塊"(通常是 16×16 像素),總共約 196 個(gè)小塊。每個(gè)小塊通過(guò)視覺(jué)編碼器(通常是 ViT 或 CNN)轉(zhuǎn)換成一個(gè)視覺(jué)向量——這個(gè)小塊的"數(shù)字簽名"。

第二步:編上位置號(hào)
模型不僅要知道每個(gè)小塊里有什么,還要知道它在圖中的位置——左上還是右下?每個(gè)小塊加上位置編碼,作用和文本位置編碼是一樣的。
第三步:把視覺(jué)向量"翻譯"成模型能懂的 Token
視覺(jué)向量的維度和文本向量的維度不同,無(wú)法直接輸入語(yǔ)言模型。這里需要一個(gè)投影層,把視覺(jué)向量的維度映射到語(yǔ)言模型熟悉的文本向量維度上——相當(dāng)于把"圖片語(yǔ)"翻譯成了"模型語(yǔ)"。
經(jīng)過(guò)這三步,模型終于能"看到"這張圖了——雖然它看到的不是像素,而是一串串?dāng)?shù)值構(gòu)成的"影子"。
問(wèn)題還沒(méi)結(jié)束:模型怎么知道視覺(jué)向量對(duì)應(yīng)的文字是什么?
一張貓的圖片經(jīng)過(guò)編碼變成 [0.12, -0.45, 0.78, ...],而"貓"這個(gè)字的 Token 編碼是 [0.89, 0.33, -0.12, ...]——兩個(gè)數(shù)字空間不相通。
要讓"看到"和"說(shuō)到"對(duì)應(yīng)起來(lái),就需要對(duì)齊(Alignment):喂大量圖文配對(duì)數(shù)據(jù),讓"這張圖的向量"和"描述這張圖的文字向量"在高維空間中相互靠近。
訓(xùn)練時(shí)同時(shí)給模型看一張夕陽(yáng)照片和文字"夕陽(yáng)下的海灘",模型會(huì)不斷調(diào)整參數(shù),讓這兩個(gè)向量之間的數(shù)學(xué)距離越來(lái)越小。這個(gè)對(duì)齊過(guò)程需要數(shù)億對(duì)圖文數(shù)據(jù)。國(guó)內(nèi)公開(kāi)的圖文數(shù)據(jù)集也包含數(shù)億對(duì)高質(zhì)量的圖文數(shù)據(jù)。

目前的多模態(tài)大模型分為兩大流派:
流派一:獨(dú)立視覺(jué)編碼器 + 大模型(Qwen-VL / GLM-4V)
保留一個(gè)完整的 ViT 處理圖像,再通過(guò)"連接器"把視覺(jué)信息注入語(yǔ)言模型。連接器可以是簡(jiǎn)單的線性映射,也可以是復(fù)雜的 Q-Former。優(yōu)點(diǎn)是視覺(jué)能力強(qiáng),缺點(diǎn)是參數(shù)多、推理慢。通義千問(wèn)的 Qwen2.5-VL 就屬這一派,它用動(dòng)態(tài)分辨率方案——圖片越清晰,切成的 Patch 越多,細(xì)節(jié)越豐富。
流派二:原生多模態(tài)訓(xùn)練方案
不保留獨(dú)立視覺(jué)編碼器,從零訓(xùn)練一個(gè)能同時(shí)理解文本、圖像、音頻的統(tǒng)一模型。文本 Token 和視覺(jué) Token 直接交互,沒(méi)有中間翻譯層。優(yōu)勢(shì)是跨模態(tài)理解更自然,缺點(diǎn)是從頭訓(xùn)練的費(fèi)時(shí)費(fèi)力。
國(guó)內(nèi)兩種路線都有玩家:DeepSeek-VL2 采用類(lèi)似 Qwen-VL 的架構(gòu),在文檔解析上表現(xiàn)優(yōu)秀;智譜 GLM-4V 在中文場(chǎng)景的視覺(jué)識(shí)別上做過(guò)大量?jī)?yōu)化。
一張圖 = 約 200 個(gè) Token。一段 1 分鐘的視頻,按每秒 24 幀算 = 1440 張圖 = 近 30 萬(wàn)個(gè) Token。
這不僅讓顯存扛不住,更棘手的是時(shí)序理解——"先拿起杯子,然后喝水"——模型需要理解幀與幀之間的時(shí)間關(guān)系。
主流做法是 幀采樣:每秒抽幾幀關(guān)鍵幀,同時(shí)引入時(shí)序編碼讓模型知道幀的先后順序。即便如此,一段 10 分鐘的視頻仍需處理幾千幀,計(jì)算消耗仍然巨大。

用一個(gè)詞描述多模態(tài)大模型的現(xiàn)狀:"剛剛夠用"。
它看得懂日常照片、能識(shí)別圖表、能理解視頻中的動(dòng)作——但遇到模糊物體、復(fù)雜場(chǎng)景推理、或者需要精確空間關(guān)系(比如"桌面上第三個(gè)物品是什么")時(shí),仍然容易出錯(cuò)。
行業(yè)正在關(guān)注:動(dòng)態(tài)分辨率(給關(guān)鍵區(qū)域分配更多 Patch)、原生多模態(tài)訓(xùn)練、多模態(tài)思維鏈、實(shí)時(shí)視頻理解。
多模態(tài)不只是給大模型裝了一雙眼睛。它改變的是模型理解世界的方式——從"只讀"到"可觀",從"聽(tīng)說(shuō)"到"眼見(jiàn)"。
但這距離真正的"視覺(jué)理解"還有距離。今天的多模態(tài)模型看到一張圖,更多是在做"匹配"——把像素特征和它見(jiàn)過(guò)的文字描述做關(guān)聯(lián)。它看一張貓圖,知道這是貓,但它不懂貓為什么在笑、畫(huà)面里有什么情緒。那才是人類(lèi)意義上的"看懂"。
不過(guò)這條路的盡頭很清晰:一個(gè)既能"看見(jiàn)"又能"理解"的模型。到那時(shí),再回頭看"大模型只認(rèn)識(shí)文字"這句話,恐怕沒(méi)人會(huì)信了。

電話
微信