← 返回 AI 基础 首页 / 算法与AI / AI 新技术 · 世界模型
AI 新技术 · 第 5 章

世界模型:从"预测下一个词"到"预测下一秒世界会怎样"

你给它一段开头画面,它能接着生成一段物理上合理的视频——杯子摔下去会碎、推一下箱子会滚、人摔倒会疼。这就是世界模型(World Model):不再只猜"下一个词",而是猜"下一步世界会变成什么样"。Sora 能生成电影感视频,靠的就是它在偷偷学物理规律。

⓪ 本章怎么学(约 40 分钟)

1两种预测(8 分钟)
读①:下一个词 vs 下一帧。
2概念表(10 分钟)
读②:World Model、Sora、物理。
3看例子+防坑(12 分钟)
读③④,记穿帮与深伪。
4自测+复述(10 分钟)
做⑤⑥,费曼三问讲一遍。
本章小目标学完你要能:说清世界模型和语言模型预测的不同、Sora 为什么懂物理、它会在哪穿帮、以及它怎么给机器人当"想象引擎"。

① 一句话搞懂:两种"预测"

Next Token PredictionNext-State Prediction
预测什么文本里下一个词是什么画面/物理世界下一步会变成啥样
产物聊天、写作、代码视频生成、物理仿真、机器人决策
学到的语言规律、知识重力、碰撞、流体、因果等物理直觉
代表GPT、DeepSeekSora、智源悟界(Earth-2)
核心直觉要预测"杯子掉下去下一帧什么样",模型就不得不学会重力、碰撞、碎裂纹理这些规律。看得视频越多,它对物理世界的"直觉"就越像人。

② 关键概念表

名词大白话
World Model一个能"想象下一步会发生什么"的模型
SoraOpenAI 的视频生成模型,靠扩散+时空架构长视频
智源悟界 / Earth-2用 AI 仿真天气、气候、地球系统的科学级世界模型
物理规律学习从海量视频里自发学会因果与运动,而非人工写公式

它和普通视频滤镜有啥不同

普通"加滤镜"只是改像素;世界模型是真的在脑子里跑了一遍因果:你问"把这个玻璃杯推下桌子会怎样",它生成的画面里杯子会按重力下落、碎裂、碎片飞溅——而不是凭空糊一团。这就是"理解世界"和"贴画"的区别。

③ 三个例子

例 1 · Sora 生成一段物理合理的视频
提示词:"一滴红墨水滴进清水里慢慢晕开"。
Sora 生成的扩散过程符合流体直觉:墨从中心向四周缓慢弥散、边缘变淡。它没学过 Navier-Stokes 方程,却从视频里悟出了扩散。
例 2 · Earth-2 预测极端天气
给定今天的大气数据,预测未来两周。
传统数值天气预报要超算跑几小时;AI 世界模型几分钟给出台风路径,部分指标已超过传统方法。
例 3 · 给机器人当" imagination"
机器人想"我跳这一下会落在哪"。
它先在世界模型里想象跳跃轨迹、预判会不会摔,再决定动不动手——这就是下一章具身智能的底子。

④ 防坑提醒

坑 1:以为视频物理百分百正确世界模型会"一本正经地违反物理":手指数量错、镜中反射不对、长视频里物体凭空消失。它学的是统计相似,不是真定律。
坑 2:把生成视频当监控/证据用AI 生成的画面可以很真,但它是"想象"不是记录,不能当作真实发生过的事实。
坑 3:忽视深伪(deepfake)风险世界模型越强,伪造视频越难辨。看到"视频"也要多留个心眼,尤其涉及名人、突发事件。

⑤ 折叠自测(点开即答)

基础1世界模型和大语言模型预测的东西有什么不同?
语言模型预测下一个词;世界模型预测下一步世界/画面会怎样,因此被迫学会重力、碰撞、因果等物理规律。
中档2Sora 为什么能生成物理上合理的视频?
它在海量视频上学习"预测下一帧",为了预测得准,自发学会了运动、碰撞、流体等规律。是从数据里悟出来的,不是人工写公式。
拔高3世界模型和下一章的具身智能有什么关系?
世界模型是机器人的"想象引擎":动手前先在脑内模拟这个动作会导致什么后果,再决定怎么做。VLA 模型里的"V/L"负责感知理解,世界模型负责预演后果。

⑥ 费曼三问(合上讲,自己讲给自己听)

用大白话回答,讲不顺就是没懂
问 1:为什么说"预测下一帧"逼着模型学会了物理?
问 2:Sora 生成的视频为什么偶尔会穿帮?它到底"懂"物理吗?
问 3:世界模型怎么帮机器人提前"想象"动作后果?
两种预测:下一个词 / 下一帧世界 语言 vs 物理
学到的:重力、碰撞、因果(非人工公式)从视频悟规律
代表:Sora 视频、智源悟界/Earth-2 气象 想象引擎
局限:会违反物理、可伪造 统计≠定律
用途:视频生成、科学仿真、机器人预演 为具身打底

🛠 实战场景:怎么看生成的视频

用途适合度说明
做营销短片、概念短片高创意生成很出彩
预演机器人动作高世界模型当想象引擎
天气预报仿真高Earth-2 等科学模型已实用
当真录的监控/证据禁用它是想象,不是记录
看长视频的物理一致性存疑越往后越容易穿帮

经验法则:当创意和仿真工具用很香,当真实证据和长视频就必须留个心眼。

🧪 生活联想

1闭眼想象
你能在脑子里预演"推杯子会怎样",世界模型就是 AI 的这种想象。
2老电影
它生成的视频像很真实,但仍可能是"想象"而非记录。
3开车预判
老司机预判前车动作,世界模型预判"下一步世界"。
对照自己看到惊艳的 AI 视频,多问一句:它是真录的还是生成的?涉及新闻人物尤其要警惕。

📖 名词速查

名词大白话
Next Token大语言模型预测下一个词
Next-State世界模型预测下一步画面/物理状态
SoraOpenAI 视频生成模型
智源悟界 / Earth-2用 AI 仿真地球与气候的科学模型
扩散模型从噪声一步步去噪生成画面的方法
deepfakeAI 伪造的音视频,难辨真假

⚡ 高频 FAQ

问:Sora 真的懂物理定律吗?它是从海量视频里学会了统计上的运动规律,不是真的会牛顿定律,所以偶尔会穿帮。
问:生成视频能当监控证据吗?不能。它是"想象"不是记录,可能凭空创造画面,不能当作事实证据。
问:世界模型和 ChatGPT 是一类东西吗?底层都是生成式模型,但目标不同:一个预测文字,一个预测画面/物理状态。

🔁 5 天复习计划

天任务自检
第 1 天读①②,理清两种预测说清 Next-State
第 2 天读③④,跟一遍三个例子讲清 Sora 为何懂物理
第 3 天做⑤折叠自测三题全对
第 4 天读⑥费曼三问,不看资料讲能举例
第 5 天名词速查 + 口诀默写脱稿说清与具身智能关系
三句口诀① 从预测下一个词到预测下一帧;② 为了预测准,它自己悟出物理;③ 会穿帮、可伪造,别当证据。

📌 知识链路

前置知识先懂生成式模型是怎么"预测下一个"的,再看把它用到画面上。
本节位置AI 从语言走向物理:开始能想象世界怎么运转。
下一步接着看具身智能,理解它怎么把这种想象接到机器人身体上。
← 上一章 · AI 编程 返回 AI 基础总览