AI 新技术 · 第 5 章
世界模型:从"预测下一个词"到"预测下一秒世界会怎样"
你给它一段开头画面,它能接着生成一段物理上合理的视频——杯子摔下去会碎、推一下箱子会滚、人摔倒会疼。这就是世界模型(World Model):不再只猜"下一个词",而是猜"下一步世界会变成什么样"。Sora 能生成电影感视频,靠的就是它在偷偷学物理规律。
⓪ 本章怎么学(约 40 分钟)
1两种预测(8 分钟)
读①:下一个词 vs 下一帧。
2概念表(10 分钟)
读②:World Model、Sora、物理。
3看例子+防坑(12 分钟)
读③④,记穿帮与深伪。
4自测+复述(10 分钟)
做⑤⑥,费曼三问讲一遍。
本章小目标学完你要能:说清世界模型和语言模型预测的不同、Sora 为什么懂物理、它会在哪穿帮、以及它怎么给机器人当"想象引擎"。
① 一句话搞懂:两种"预测"
| Next Token Prediction | Next-State Prediction |
| 预测什么 | 文本里下一个词是什么 | 画面/物理世界下一步会变成啥样 |
| 产物 | 聊天、写作、代码 | 视频生成、物理仿真、机器人决策 |
| 学到的 | 语言规律、知识 | 重力、碰撞、流体、因果等物理直觉 |
| 代表 | GPT、DeepSeek | Sora、智源悟界(Earth-2) |
核心直觉要预测"杯子掉下去下一帧什么样",模型就不得不学会重力、碰撞、碎裂纹理这些规律。看得视频越多,它对物理世界的"直觉"就越像人。
② 关键概念表
| 名词 | 大白话 |
| World Model | 一个能"想象下一步会发生什么"的模型 |
| Sora | OpenAI 的视频生成模型,靠扩散+时空架构长视频 |
| 智源悟界 / Earth-2 | 用 AI 仿真天气、气候、地球系统的科学级世界模型 |
| 物理规律学习 | 从海量视频里自发学会因果与运动,而非人工写公式 |
它和普通视频滤镜有啥不同
普通"加滤镜"只是改像素;世界模型是真的在脑子里跑了一遍因果:你问"把这个玻璃杯推下桌子会怎样",它生成的画面里杯子会按重力下落、碎裂、碎片飞溅——而不是凭空糊一团。这就是"理解世界"和"贴画"的区别。
③ 三个例子
例 1 · Sora 生成一段物理合理的视频
提示词:"一滴红墨水滴进清水里慢慢晕开"。
Sora 生成的扩散过程符合流体直觉:墨从中心向四周缓慢弥散、边缘变淡。它没学过 Navier-Stokes 方程,却从视频里悟出了扩散。
例 2 · Earth-2 预测极端天气
给定今天的大气数据,预测未来两周。
传统数值天气预报要超算跑几小时;AI 世界模型几分钟给出台风路径,部分指标已超过传统方法。
例 3 · 给机器人当" imagination"
机器人想"我跳这一下会落在哪"。
它先在世界模型里想象跳跃轨迹、预判会不会摔,再决定动不动手——这就是下一章具身智能的底子。
④ 防坑提醒
坑 1:以为视频物理百分百正确世界模型会"一本正经地违反物理":手指数量错、镜中反射不对、长视频里物体凭空消失。它学的是统计相似,不是真定律。
坑 2:把生成视频当监控/证据用AI 生成的画面可以很真,但它是"想象"不是记录,不能当作真实发生过的事实。
坑 3:忽视深伪(deepfake)风险世界模型越强,伪造视频越难辨。看到"视频"也要多留个心眼,尤其涉及名人、突发事件。
⑤ 折叠自测(点开即答)
基础1世界模型和大语言模型预测的东西有什么不同?
语言模型预测下一个词;世界模型预测下一步世界/画面会怎样,因此被迫学会重力、碰撞、因果等物理规律。
中档2Sora 为什么能生成物理上合理的视频?
它在海量视频上学习"预测下一帧",为了预测得准,自发学会了运动、碰撞、流体等规律。是从数据里悟出来的,不是人工写公式。
拔高3世界模型和下一章的具身智能有什么关系?
世界模型是机器人的"想象引擎":动手前先在脑内模拟这个动作会导致什么后果,再决定怎么做。VLA 模型里的"V/L"负责感知理解,世界模型负责预演后果。
⑥ 费曼三问(合上讲,自己讲给自己听)
用大白话回答,讲不顺就是没懂
问 1:为什么说"预测下一帧"逼着模型学会了物理?
问 2:Sora 生成的视频为什么偶尔会穿帮?它到底"懂"物理吗?
问 3:世界模型怎么帮机器人提前"想象"动作后果?
两种预测:下一个词 / 下一帧世界 语言 vs 物理
学到的:重力、碰撞、因果(非人工公式)从视频悟规律
代表:Sora 视频、智源悟界/Earth-2 气象 想象引擎
局限:会违反物理、可伪造 统计≠定律
用途:视频生成、科学仿真、机器人预演 为具身打底
🛠 实战场景:怎么看生成的视频
| 用途 | 适合度 | 说明 |
| 做营销短片、概念短片 | 高 | 创意生成很出彩 |
| 预演机器人动作 | 高 | 世界模型当想象引擎 |
| 天气预报仿真 | 高 | Earth-2 等科学模型已实用 |
| 当真录的监控/证据 | 禁用 | 它是想象,不是记录 |
| 看长视频的物理一致性 | 存疑 | 越往后越容易穿帮 |
经验法则:当创意和仿真工具用很香,当真实证据和长视频就必须留个心眼。
🧪 生活联想
1闭眼想象
你能在脑子里预演"推杯子会怎样",世界模型就是 AI 的这种想象。
2老电影
它生成的视频像很真实,但仍可能是"想象"而非记录。
3开车预判
老司机预判前车动作,世界模型预判"下一步世界"。
对照自己看到惊艳的 AI 视频,多问一句:它是真录的还是生成的?涉及新闻人物尤其要警惕。
📖 名词速查
| 名词 | 大白话 |
| Next Token | 大语言模型预测下一个词 |
| Next-State | 世界模型预测下一步画面/物理状态 |
| Sora | OpenAI 视频生成模型 |
| 智源悟界 / Earth-2 | 用 AI 仿真地球与气候的科学模型 |
| 扩散模型 | 从噪声一步步去噪生成画面的方法 |
| deepfake | AI 伪造的音视频,难辨真假 |
⚡ 高频 FAQ
问:Sora 真的懂物理定律吗?它是从海量视频里学会了统计上的运动规律,不是真的会牛顿定律,所以偶尔会穿帮。
问:生成视频能当监控证据吗?不能。它是"想象"不是记录,可能凭空创造画面,不能当作事实证据。
问:世界模型和 ChatGPT 是一类东西吗?底层都是生成式模型,但目标不同:一个预测文字,一个预测画面/物理状态。
🔁 5 天复习计划
| 天 | 任务 | 自检 |
| 第 1 天 | 读①②,理清两种预测 | 说清 Next-State |
| 第 2 天 | 读③④,跟一遍三个例子 | 讲清 Sora 为何懂物理 |
| 第 3 天 | 做⑤折叠自测 | 三题全对 |
| 第 4 天 | 读⑥费曼三问,不看资料讲 | 能举例 |
| 第 5 天 | 名词速查 + 口诀默写 | 脱稿说清与具身智能关系 |
三句口诀① 从预测下一个词到预测下一帧;② 为了预测准,它自己悟出物理;③ 会穿帮、可伪造,别当证据。
📌 知识链路
前置知识先懂生成式模型是怎么"预测下一个"的,再看把它用到画面上。
本节位置AI 从语言走向物理:开始能想象世界怎么运转。
下一步接着看具身智能,理解它怎么把这种想象接到机器人身体上。