AI 新技术 · 第 2 章
原生多模态:让大模型从"只认字"到"看图、听音、会说"
早期大模型是个纯文字处理机——你发张图给它,它根本"看不见"。2026 年的原生多模态已经是全模态(Omni):Kimi K3(89.5 分)、Gemini 3 Pro Deep Think(95 分多模态第一)、Qwen3.5-Omni(10 小时音频/400 秒视频/60+ 语言听)直接看图、听声、读视频,还能实时打断对话。这一课讲清它和"老办法"的本质区别。
⓪ 本章怎么学(约 40 分钟)
1拼贴 vs 原生(8 分钟)
读①:为什么外挂眼睛不够。
2概念表(10 分钟)
读②:ViT、对齐、原生架构。
3看例子+防坑(12 分钟)
读③④,记隐私与幻觉。
4自测+复述(10 分钟)
做⑤⑥,费曼三问讲一遍。
本章小目标学完你要能:说清原生多模态和 late fusion 的差别、图片怎么变成视觉 token、跨模态对齐是怎么回事、以及看图时哪里会翻车。
① 一句话搞懂:拼贴 vs 原生
过去想让 AI"看图",常见做法是:先用一个识图工具把图片转成文字描述,再把描述喂给语言模型——这叫后期融合(late fusion),像"先翻译一遍再理解",信息有损、反应也慢。
| 对比 | late fusion(拼贴) | 原生多模态(native) |
| 做法 | 图片→描述文字→语言模型 | 图片和文字直接进同一个大脑 |
| 理解深度 | 只能看到"描述说了啥" | 能看懂细节、空间关系、图表 |
| 延迟 | 多一道转换,慢 | 端到端,可实时对话 |
| 代表(2026.9) | 早期插件式识图 | Gemini 3 Pro Deep Think、Kimi K3、Qwen3.5-Omni、Claude Opus 4.8 |
核心直觉原生多模态不是"给文字模型外挂一个眼睛",而是从训练第一天起就让模型同时吃图片、文字、语音,在内部把它们对齐成同一种"语言"。
② 关键概念表
| 名词 | 大白话 |
| ViT 视觉编码器 | 把一张图片切成小方块,转成模型能读的一串"视觉 token" |
| 跨模态对齐 | 让"猫的图片"和"猫这个字"在模型心里是同一个意思 |
| 原生架构 | 视觉 token 和文字 token 混在一起进同一个 Transformer |
| 全模态 Omni | 文本+图片+音频+视频+PDF 统一理解;Qwen3.5-Omni 支持 10 小时音频、400 秒 720P 视频、60+ 语言听、30+ 语言说;Gemini 3.8 Flash TTS(2026.9.23)自定义 AI 声音 |
图片是怎么变成模型能懂的东西的
流程很简单:图片 → ViT 切成小块 → 每块变成一个向量(视觉 token)→ 和文字 token 一起喂进 Transformer。因为训练时大量"图+文"配对喂过,模型自然学会了"这堆视觉 token 对应那句话"。
③ 三个例子
例 1 · 看懂一张截图
你甩一张报错截图给 Gemini 3 Pro Deep Think。
late fusion 可能只转写出"一段英文报错";原生模型能直接读出堆栈里的行号、定位到哪行代码、告诉你怎么改,因为它真的"看见"了排版和代码。
例 2 · 跨模态对齐长什么样
同一只橘猫的照片。
模型心里,橘猫照片的向量和"橘猫、很胖、正在睡午觉"这些文字的向量距离很近。这就是对齐——以后你说"我家那只很胖的猫",它能联想到对应图片。
例 3 · 实时语音通话
Gemini 3.8 Flash 语音对话(2026.9.2 发布)。
你说"帮我看下这道菜怎么做",它边听边思考边开口回答,能被你打断——没有"先转文字、再生成、再朗读"的三段式延迟。
④ 防坑提醒
坑 1:以为它"看见"了一切原生模型能看图,但小字、密集图表、远处细节仍会看错,甚至凭空脑补图里没有的东西。关键数字要人工核对。
坑 2:把它当成 late fusion 的升级版不是外挂个识图 API 就行。原生是训练时就对齐,理解深度和实时性是架构级的差别,不是换个插件。
坑 3:忽视隐私与合规多模态模型能"看见"截图里的隐私信息(身份证、密码、聊天记录)。上传前先打码,别把敏感截图直接丢给云端 API。
⑤ 折叠自测(点开即答)
基础1原生多模态和 late fusion(后期融合)最大的区别是什么?
late fusion 是先把图转成文字描述、再喂语言模型,信息有损;原生多模态是图片和文字直接进同一个 Transformer,理解更深、能实时对话。
中档2ViT(视觉编码器)在里面干什么?
把图片切成小方块,编码成一串视觉 token(向量),让文字模型能像读单词一样"读图片"。
拔高3"跨模态对齐"为什么要在训练时做,而不是事后拼?
对齐是让"图"和"对应文字"在向量空间里挨在一起。这需要海量图文配对数据一起训练才能学会;事后外挂只是单向翻译,做不到真正的互相理解与实时交互。
⑥ 费曼三问(合上讲,自己讲给自己听)
用大白话回答,讲不顺就是没懂
问 1:为什么甩张报错截图给 Kimi K3 / Qwen3.5-Omni,它比"先识图再读字"的老办法强?
问 2:一张图片是怎么变成大模型能处理的一串东西的?
问 3:多模态模型看图时,最容易在哪类细节上翻车?
原生 vs 拼贴:图/文/音进同一脑 / 先转文字再读 native vs late fusion
ViT:切图块 → 视觉 token 给模型装眼睛
跨模态对齐:图与对应文字在向量里靠近 看图懂意
全模态 Omni:图/文/音/视频统一理解 Qwen3.5-Omni、Gemini 3.8 Flash
选用注意:小字/图表会错,敏感截图先打码 核对+隐私
🛠 实战场景:什么时候甩图给它
| 任务 | 适合度 | 说明 |
| 读一张报错截图 | 高 | 原生模型能读代码和行号 |
| 看懂一张信息图 | 高 | 能理解图表结构与关系 |
| 读合同里极小字号条款 | 中 | 小字可能错,要核对 |
| 数清密集表格里的每格数字 | 低 | 细节易漏,建议 OCR 辅助 |
| 实时语音咨询 | 高 | 原生可边听边说、可打断 |
经验法则:结构清楚、字够大的图直接甩;密集小字和关键数字,先放大或打文字补丁再问。
🧪 生活联想
1翻译员
late fusion 像"先让翻译看图说话,你再读文字",二手信息。
2母语者
原生模型像"自己亲眼看见",细节都在。
3翻译延迟
多一道转换就多一份延迟和失真。
对照自己下次让 AI 看截图,留意它能不能说出排版细节——能说清的才是真"看懂",只会复述大意的就是 late fusion。
📖 名词速查
| 名词 | 大白话 |
| Kimi K3 / Gemini 3 Pro | 2026 多模态第一梯队:K3 89.5 分,Gemini 3 Pro Deep Think 多模态理解 95 分 |
| Claude Opus 4.8 / GPT-5.6 Sol | 闭源顶级:Opus 4.8 87.7%,GPT-5.6 Sol 87.6% |
| Qwen3.8 Max / Qwen3.5-Omni | 开源最强 87.4%;Omni 版支持 10h 音频/400s 视频/60+ 语言听 |
| DeepSeek V4 Flash Vision | 原生多模态 MoE,图+文统一 |
| LongCat-2.5 / Gemini 3.8 Flash | 美团 LongCat 图片理解;Google 3.8 Flash 2026.9.2 文本/图片/音频/视频/PDF 输入 |
| ViT | 视觉 Transformer,把图切块编码成视觉 token |
| 跨模态对齐 | 图与对应文字在向量空间里靠近 |
| late fusion | 先转文字再读,有损的老办法 |
| native architecture | 视觉与文字 token 混进同一个 Transformer |
⚡ 高频 FAQ
问:它能直接"看见"我的屏幕吗?不能主动看。要你手动上传截图或图片,它才读图。它没有"窥视"你屏幕的权限。
问:为什么图里的小字它会读错?分辨率和细节是有限的,小字、密集图表超出它能分辨的粒度,就会脑补。关键信息请放大或打文字补丁。
问:语音模式是不是又转文字了?原生模式端到端直接处理声音,能边听边说、可被打断;不是"语音→文字→生成→朗读"三段式。
🔁 5 天复习计划
| 天 | 任务 | 自检 |
| 第 1 天 | 读①②,理清拼贴 vs 原生 | 说清 ViT 作用 |
| 第 2 天 | 读③④,跟一遍三个例子 | 讲清跨模态对齐 |
| 第 3 天 | 做⑤折叠自测 | 三题全对 |
| 第 4 天 | 读⑥费曼三问,不看资料讲 | 能举例 |
| 第 5 天 | 名词速查 + 口诀默写 | 脱稿说清 native vs fusion |
三句口诀① 原生是图文进同一脑,不是外挂眼睛;② ViT 切图块变视觉 token;③ 小字图表会错,敏感截图先打码。
📌 知识链路
前置知识先懂大语言模型怎么读文字,再理解给它"加眼睛耳朵"这件事。
本节位置给推理模型补上感官:它不只会想,还能看图听音。
下一步接着看长上下文,理解它怎么一次装下更多信息。