← 返回 AI 基础 首页 / 算法与AI / AI 新技术 · 原生多模态
AI 新技术 · 第 2 章

原生多模态:让大模型从"只认字"到"看图、听音、会说"

早期大模型是个纯文字处理机——你发张图给它,它根本"看不见"。2026 年的原生多模态已经是全模态(Omni):Kimi K3(89.5 分)、Gemini 3 Pro Deep Think(95 分多模态第一)、Qwen3.5-Omni(10 小时音频/400 秒视频/60+ 语言听)直接看图、听声、读视频,还能实时打断对话。这一课讲清它和"老办法"的本质区别。

⓪ 本章怎么学(约 40 分钟)

1拼贴 vs 原生(8 分钟)
读①:为什么外挂眼睛不够。
2概念表(10 分钟)
读②:ViT、对齐、原生架构。
3看例子+防坑(12 分钟)
读③④,记隐私与幻觉。
4自测+复述(10 分钟)
做⑤⑥,费曼三问讲一遍。
本章小目标学完你要能:说清原生多模态和 late fusion 的差别、图片怎么变成视觉 token、跨模态对齐是怎么回事、以及看图时哪里会翻车。

① 一句话搞懂:拼贴 vs 原生

过去想让 AI"看图",常见做法是:先用一个识图工具把图片转成文字描述,再把描述喂给语言模型——这叫后期融合(late fusion),像"先翻译一遍再理解",信息有损、反应也慢。

对比late fusion(拼贴)原生多模态(native)
做法图片→描述文字→语言模型图片和文字直接进同一个大脑
理解深度只能看到"描述说了啥"能看懂细节、空间关系、图表
延迟多一道转换,慢端到端,可实时对话
代表(2026.9)早期插件式识图Gemini 3 Pro Deep Think、Kimi K3、Qwen3.5-Omni、Claude Opus 4.8
核心直觉原生多模态不是"给文字模型外挂一个眼睛",而是从训练第一天起就让模型同时吃图片、文字、语音,在内部把它们对齐成同一种"语言"。

② 关键概念表

名词大白话
ViT 视觉编码器把一张图片切成小方块,转成模型能读的一串"视觉 token"
跨模态对齐让"猫的图片"和"猫这个字"在模型心里是同一个意思
原生架构视觉 token 和文字 token 混在一起进同一个 Transformer
全模态 Omni文本+图片+音频+视频+PDF 统一理解;Qwen3.5-Omni 支持 10 小时音频、400 秒 720P 视频、60+ 语言听、30+ 语言说;Gemini 3.8 Flash TTS(2026.9.23)自定义 AI 声音

图片是怎么变成模型能懂的东西的

流程很简单:图片 → ViT 切成小块 → 每块变成一个向量(视觉 token)→ 和文字 token 一起喂进 Transformer。因为训练时大量"图+文"配对喂过,模型自然学会了"这堆视觉 token 对应那句话"。

③ 三个例子

例 1 · 看懂一张截图
你甩一张报错截图给 Gemini 3 Pro Deep Think。
late fusion 可能只转写出"一段英文报错";原生模型能直接读出堆栈里的行号、定位到哪行代码、告诉你怎么改,因为它真的"看见"了排版和代码。
例 2 · 跨模态对齐长什么样
同一只橘猫的照片。
模型心里,橘猫照片的向量和"橘猫、很胖、正在睡午觉"这些文字的向量距离很近。这就是对齐——以后你说"我家那只很胖的猫",它能联想到对应图片。
例 3 · 实时语音通话
Gemini 3.8 Flash 语音对话(2026.9.2 发布)。
你说"帮我看下这道菜怎么做",它边听边思考边开口回答,能被你打断——没有"先转文字、再生成、再朗读"的三段式延迟。

④ 防坑提醒

坑 1:以为它"看见"了一切原生模型能看图,但小字、密集图表、远处细节仍会看错,甚至凭空脑补图里没有的东西。关键数字要人工核对。
坑 2:把它当成 late fusion 的升级版不是外挂个识图 API 就行。原生是训练时就对齐,理解深度和实时性是架构级的差别,不是换个插件。
坑 3:忽视隐私与合规多模态模型能"看见"截图里的隐私信息(身份证、密码、聊天记录)。上传前先打码,别把敏感截图直接丢给云端 API。

⑤ 折叠自测(点开即答)

基础1原生多模态和 late fusion(后期融合)最大的区别是什么?
late fusion 是先把图转成文字描述、再喂语言模型,信息有损;原生多模态是图片和文字直接进同一个 Transformer,理解更深、能实时对话。
中档2ViT(视觉编码器)在里面干什么?
把图片切成小方块,编码成一串视觉 token(向量),让文字模型能像读单词一样"读图片"。
拔高3"跨模态对齐"为什么要在训练时做,而不是事后拼?
对齐是让"图"和"对应文字"在向量空间里挨在一起。这需要海量图文配对数据一起训练才能学会;事后外挂只是单向翻译,做不到真正的互相理解与实时交互。

⑥ 费曼三问(合上讲,自己讲给自己听)

用大白话回答,讲不顺就是没懂
问 1:为什么甩张报错截图给 Kimi K3 / Qwen3.5-Omni,它比"先识图再读字"的老办法强?
问 2:一张图片是怎么变成大模型能处理的一串东西的?
问 3:多模态模型看图时,最容易在哪类细节上翻车?
原生 vs 拼贴:图/文/音进同一脑 / 先转文字再读 native vs late fusion
ViT:切图块 → 视觉 token 给模型装眼睛
跨模态对齐:图与对应文字在向量里靠近 看图懂意
全模态 Omni:图/文/音/视频统一理解 Qwen3.5-Omni、Gemini 3.8 Flash
选用注意:小字/图表会错,敏感截图先打码 核对+隐私

🛠 实战场景:什么时候甩图给它

任务适合度说明
读一张报错截图高原生模型能读代码和行号
看懂一张信息图高能理解图表结构与关系
读合同里极小字号条款中小字可能错,要核对
数清密集表格里的每格数字低细节易漏,建议 OCR 辅助
实时语音咨询高原生可边听边说、可打断

经验法则:结构清楚、字够大的图直接甩;密集小字和关键数字,先放大或打文字补丁再问。

🧪 生活联想

1翻译员
late fusion 像"先让翻译看图说话,你再读文字",二手信息。
2母语者
原生模型像"自己亲眼看见",细节都在。
3翻译延迟
多一道转换就多一份延迟和失真。
对照自己下次让 AI 看截图,留意它能不能说出排版细节——能说清的才是真"看懂",只会复述大意的就是 late fusion。

📖 名词速查

名词大白话
Kimi K3 / Gemini 3 Pro2026 多模态第一梯队:K3 89.5 分,Gemini 3 Pro Deep Think 多模态理解 95 分
Claude Opus 4.8 / GPT-5.6 Sol闭源顶级:Opus 4.8 87.7%,GPT-5.6 Sol 87.6%
Qwen3.8 Max / Qwen3.5-Omni开源最强 87.4%;Omni 版支持 10h 音频/400s 视频/60+ 语言听
DeepSeek V4 Flash Vision原生多模态 MoE,图+文统一
LongCat-2.5 / Gemini 3.8 Flash美团 LongCat 图片理解;Google 3.8 Flash 2026.9.2 文本/图片/音频/视频/PDF 输入
ViT视觉 Transformer,把图切块编码成视觉 token
跨模态对齐图与对应文字在向量空间里靠近
late fusion先转文字再读,有损的老办法
native architecture视觉与文字 token 混进同一个 Transformer

⚡ 高频 FAQ

问:它能直接"看见"我的屏幕吗?不能主动看。要你手动上传截图或图片,它才读图。它没有"窥视"你屏幕的权限。
问:为什么图里的小字它会读错?分辨率和细节是有限的,小字、密集图表超出它能分辨的粒度,就会脑补。关键信息请放大或打文字补丁。
问:语音模式是不是又转文字了?原生模式端到端直接处理声音,能边听边说、可被打断;不是"语音→文字→生成→朗读"三段式。

🔁 5 天复习计划

天任务自检
第 1 天读①②,理清拼贴 vs 原生说清 ViT 作用
第 2 天读③④,跟一遍三个例子讲清跨模态对齐
第 3 天做⑤折叠自测三题全对
第 4 天读⑥费曼三问,不看资料讲能举例
第 5 天名词速查 + 口诀默写脱稿说清 native vs fusion
三句口诀① 原生是图文进同一脑,不是外挂眼睛;② ViT 切图块变视觉 token;③ 小字图表会错,敏感截图先打码。

📌 知识链路

前置知识先懂大语言模型怎么读文字,再理解给它"加眼睛耳朵"这件事。
本节位置给推理模型补上感官:它不只会想,还能看图听音。
下一步接着看长上下文,理解它怎么一次装下更多信息。
← 上一章 · 推理模型 返回 AI 基础总览