← 返回 AI 基础 首页 / 算法与AI / AI 新技术 · 具身智能
AI 新技术 · 第 6 章

具身智能:让大模型走出屏幕,长出手脚去碰真实世界

前面的 AI 都活在屏幕里——说、写、画。具身智能(Embodied AI)要做的,是给大模型接上机器人的身体:它看见桌上的杯子,就真的伸手把它端起来。这是 AI 从"动嘴"到"动手"再到"进入物理世界"的关键一跃,也是当前最火的方向之一。

⓪ 本章怎么学(约 40 分钟)

1从动嘴到动手(8 分钟)
读①:屏幕 AI vs 具身。
2概念表(10 分钟)
读②:VLA、Sim2Real。
3看例子+防坑(12 分钟)
读③④,记安全与现实鸿沟。
4自测+复述(10 分钟)
做⑤⑥,费曼三问讲一遍。
本章小目标学完你要能:说清 VLA 三个字母各管什么、为什么要先在仿真里练、为什么具身 AI 容错率极低、以及安全上要注意什么。

① 一句话搞懂:从"会说"到"会做"

屏幕里的大模型具身智能
输入文字、图片摄像头画面 + 本体感知
输出文字、代码机械臂/轮子的动作指令
挑战语言是否通顺动作是否安全、稳、真能拿到东西
代表GPT、QwenVLA 模型、人形机器人
核心直觉具身智能 = 多模态理解(看+听)+ 世界模型(想后果)+ 控制(真动手)。它要在物理世界里边试边学,容错率极低——手滑了杯子就碎了。

② 关键概念表

名词大白话
VLA 模型视觉-语言-动作:看图、听懂人话,直接输出机器人动作
Sim2Real先在仿真游戏里练百万次,再把本事搬到真实机器人上
机器人控制把"端杯子"翻译成关节力矩、抓手力度
物理交互真实世界有摩擦、重力、易碎品,不能像游戏里随便来

VLA 是怎么工作的

你说"把桌上的红杯子递给我"。VLA 模型:摄像头看到杯子在哪(V)→ 听懂你的指令(L)→ 算出机械臂该怎么动(A),直接输出关节角度。它不再是"告诉你怎么拿",而是"它自己去拿"。

③ 三个例子

例 1 · 一句话让机器人收拾桌面
"把桌上的垃圾扔进垃圾桶"。
VLA 看画面、识别废纸、规划抓取路径、稳稳夹起、移动投放。全程无需人工一步步教它每个关节。
例 2 · Sim2Real 练出开门
真实世界练一万次要坏多少门把手?
于是先在仿真器里让机器人摔几百万次,学会怎么握门把手、用多大力;再把这套策略迁移到真机上,又快又省。
例 3 · 端一杯水
同样是"拿杯子",空杯和满杯水力气完全不同。
具身模型要边拿边微调力度:太轻掉地上,太重捏爆杯子。这就是物理交互的精细之处。

④ 防坑提醒

坑 1:以为仿真练得好,真机就一定行仿真和真实总有差距(摩擦、光照、物体变形),这叫"现实鸿沟"。Sim2Real 能大幅缩短训练,但仍要真机微调。
坑 2:觉得具身 AI 马上能进家庭它现在仍很笨拙:易碎品、柔性物体(衣服、面条)、杂乱家庭环境都还搞不定,安全冗余也要做足。
坑 3:忽视安全机器人真会用力、会移动。在人身边部署必须有急停、力控和安全范围,不能让 AI 自由发挥。

⑤ 折叠自测(点开即答)

基础1VLA 是哪三个词的缩写,各管什么?
Visual(视觉,看懂画面)+ Language(语言,听懂指令)+ Action(动作,输出机器人动作)。它把"理解"和"动手"接成一条线。
中档2Sim2Real 是什么,为什么需要它?
先在仿真环境里海量试错学技能,再迁移到真实机器人。因为真机试错又贵又危险,仿真可以摔几百万次不心疼。
拔高3具身智能为什么容错率比屏幕里的 AI 低得多?
因为它真在物理世界用力:错一句字只是改改,错一个动作可能打碎杯子、撞伤人和设备。所以要安全控制、力控、急停,不能让它自由发挥。

⑥ 费曼三问(合上讲,自己讲给自己听)

用大白话回答,讲不顺就是没懂
问 1:说"把红杯子递给我",VLA 内部从看到动,经过哪三步?
问 2:为什么机器人要先在游戏里练,而不是直接上手真门把手?
问 3:同样是"拿杯子",空杯和满杯水对机器人有什么不同要求?
具身智能:大模型长身体,在物理世界动手 走出屏幕
VLA:视觉+语言+动作 看懂听懂并伸手
Sim2Real:仿真摔百万次,再上真机 现实鸿沟
核心难点:力控、易碎品、安全冗余 容错极低
关系:世界模型预演 + VLA 执行 为机器人打底

🛠 实战场景:现在能让它干啥

任务成熟度说明
工厂分拣规整物体较成熟环境受控,已落地
桌面收拾、递杯子演示阶段能做但不稳
叠衣服、揉面团早期柔性物很难
家里照看老人孩子远未成熟安全要求极高
危险环境巡检方向明确替代人进危险区

经验法则:受控、重复、低风险的活已经能用;杂乱家庭、易碎柔性物还得等。

🧪 生活联想

1学骑车
先在平地上摔几次(仿真),再上路(真机)。
2端水
空杯和满杯水力气不同,要边拿边调力度。
3婴儿学步
具身智能也是在物理世界里边试边学平衡。
对照自己看机器人视频时注意:它拿易碎品、柔性物(衣服、面条)还很笨拙,别期待它马上进家庭。

📖 名词速查

名词大白话
VLA视觉-语言-动作模型,看图听懂就动手
Embodied AI有身体、能在物理世界交互的 AI
Sim2Real仿真训练后迁移到真实机器人
现实鸿沟仿真和真实总有差距
力控边拿边调整力度,捏不碎也不掉
人形机器人长得像人、能用人的工具的机器人

⚡ 高频 FAQ

问:具身 AI 几年内能进我家吗?现在它在易碎品、柔性物、杂乱家庭环境还很笨拙,大规模进家庭仍需时间。
问:仿真练得好,真机为什么还要调?因为仿真和真实的摩擦、光照、物体变形有差距(现实鸿沟),迁移后必须真机微调。
问:它危险吗?会真用力、会移动,在人身边必须有急停和力控,不能让 AI 自由发挥。

🔁 5 天复习计划

天任务自检
第 1 天读①②,理清动嘴 vs 动手说清 VLA 三段
第 2 天读③④,跟一遍三个例子讲清 Sim2Real
第 3 天做⑤折叠自测三题全对
第 4 天读⑥费曼三问,不看资料讲能举例
第 5 天名词速查 + 口诀默写脱稿说清安全要点
三句口诀① VLA 看图听懂就伸手;② 仿真摔百万次再上真机;③ 容错极低,安全冗余必须做足。

📌 知识链路

前置知识先懂多模态(看懂听懂)和世界模型(想象后果),再接上机器人身体。
本节位置AI 走进物理世界:从屏幕里走出来,真的动手。
下一步接着看端侧小模型,理解怎么把模型塞进手机和传感器。
← 上一章 · 世界模型 返回 AI 基础总览