AI 新技术 · 第 7 章
端侧小模型:让大模型跑进你的手机,不联网也能用
你把大模型想成"云端的巨型专家",每次提问都要联网排队。端侧小模型(Edge LLM)是把这个专家"瘦身"后塞进你手机里——不联网、秒回、隐私不出机。Siri 之外,手机本地就能跑一个会聊天、会总结笔记的小模型,这背后是蒸馏、量化、MoE 三件套。
⓪ 本章怎么学(约 40 分钟)
1为什么塞手机(8 分钟)
读①:云端 vs 端侧。
2压缩三件套(10 分钟)
读②:蒸馏、量化、MoE。
3看例子+防坑(12 分钟)
读③④,记能力边界。
4自测+复述(10 分钟)
做⑤⑥,费曼三问讲一遍。
本章小目标学完你要能:说清端侧三优势、蒸馏/量化/MoE 各压缩什么、为什么端侧不能替代云端、以及隐私场景为什么该用端侧。
① 一句话搞懂:为什么要把模型塞手机里
| 云端大模型 | 端侧小模型 |
| 跑在哪 | 机房大显卡 | 你手机/电脑/手表里 |
| 联网 | 必须联网 | 离线也能用 |
| 延迟/费用 | 有网络延迟、按 token 付费 | 本地秒回、免费 |
| 隐私 | 数据要上云 | 数据不出设备 |
| 能力 | 最强 | 够用,但比云端弱 |
核心直觉端侧不是"做一个更小的 GPT",而是用蒸馏 + 量化 + MoE把云端模型的本事"压缩"进几 GB,还尽量不掉链子。
② 关键概念表
| 名词 | 大白话 |
| 知识蒸馏 | 让小模型模仿大老师的回答,学个七八成像 |
| 量化(INT4) | 把权重从 16 位压到 4 位,体积缩到 1/4,几乎不掉精度 |
| MoE 稀疏激活 | 模型很大,但每次只叫醒其中一小撮专家算 |
| TinyML | 极小模型跑在单片机、传感器、耳机这类微设备上 |
压缩三件套怎么配合
蒸馏负责"能力转移",量化负责"体积瘦身",MoE负责"平时不全部叫醒"。三者叠加,70B 的云端模型能被压到手机能跑的几 GB,同时保留大部分实用能力。
③ 三个例子
例 1 · 蒸馏:学生模仿老师
用 GPT-4 生成大量问答,拿去训练一个 7B 小模型。
小模型不一定和老师一样聪明,但学到了"常见问题怎么答"的风格与知识。像好学生抄老师的笔记。
例 2 · INT4 量化省多少
一个 7B 模型。
原本 16 位要 14GB 内存;INT4 量化后约 3.5GB,普通手机内存就能塞下,速度还更快,精度损失通常可接受。
例 3 · 耳机里的 TinyML
耳机要"听到你说唤醒词"。
不可能每次都连手机唤醒大模型。TinyML 极小模型直接跑在耳机芯片上,低功耗、离线、随时听唤醒词。
④ 防坑提醒
坑 1:以为端侧能和云端一样强手机算力/内存有限,端侧模型是"够用版":复杂推理、超长上下文它照样搞不定,难题还是得回云端。
坑 2:量化压太狠INT4 要选对量化方法,压过头会让模型"变傻"、出奇怪回答。部署前要在你的真实任务上测一遍。
坑 3:忽视端侧模型的隐私卖点它的一大优势是数据不出设备——医疗、企业机密、个人日记这类敏感场景,端侧比云端更合适,别浪费这个优势。
⑤ 折叠自测(点开即答)
基础1端侧小模型最大的三个好处是什么?
① 离线可用(不联网也能跑);② 快且免费(无网络延迟、不按 token 计费);③ 隐私不出设备(数据不上云)。
中档2知识蒸馏和量化分别压缩什么?
蒸馏压缩的是能力/体积——让小模型模仿大老师;量化压缩的是每个权重的位数(16位→4位),让模型文件更小、跑得更快。
拔高3MoE 为什么能"又大又省"?
MoE 把模型分成很多"专家"小网络,但每次只激活其中几个,不是全部一起算。总参数可以很大,但单次计算量小,所以在受限设备上也能跑出好效果。
⑥ 费曼三问(合上讲,自己讲给自己听)
用大白话回答,讲不顺就是没懂
问 1:为什么手机本地跑模型,比连云端更保护隐私?
问 2:蒸馏、量化、MoE 各负责"瘦"的哪一方面?
问 3:什么任务该端侧跑,什么任务必须回云端?
端侧优势:离线、秒回、隐私不出机 手机本地
知识蒸馏:小模型模仿大老师 能力转移
INT4 量化:权重压 4 位,体积缩 1/4 瘦身
MoE:参数大但只激活几个专家 稀疏省算
TinyML:极小模型跑在传感器/耳机 低功耗
🛠 实战场景:端侧还是云端
| 任务 | 建议 | 原因 |
| 本地整理笔记、写日记 | 端侧 | 隐私不出机 |
| 离线出行翻译菜单 | 端侧 | 没网也要用 |
| 复杂多步推理难题 | 云端 | 端侧能力不够 |
| 耳机唤醒词检测 | 端侧 TinyML | 低功耗常驻 |
| 超长文档跨章问答 | 云端 | 端侧窗口小 |
经验法则:敏感、离线、简单的活端侧跑;复杂、长程、要最强能力的回云端。
🧪 生活联想
1私教
云端像高价上门私教(要预约、花钱);端侧像自己请的随身教练(免费、随时)。
2打包行李
量化就是把厚衣服抽真空,体积小了内容还在。
3全班上课
MoE 是一个大班老师,但每次只叫几个学生回答。
对照自己敏感笔记、日记先用端侧小模型处理,数据不出手机;难题再切到云端大模型。
📖 名词速查
| 名词 | 大白话 |
| Edge LLM | 跑在手机/电脑本地的小模型 |
| 知识蒸馏 | 小模型模仿大老师,学七八成像 |
| INT4 量化 | 权重压到 4 位,体积缩到 1/4 |
| MoE | 稀疏激活,每次只叫醒几个专家 |
| TinyML | 极小模型跑在传感器、耳机上 |
| GGUF / llama.cpp | 常见的端侧模型格式与运行引擎 |
⚡ 高频 FAQ
问:端侧模型能离线用吗?能。模型文件就在设备里,不联网也能问答,这是它最大的卖点之一。
问:量化会不会把模型压傻?压过头会。要选对量化方法,并在你的真实任务上测一遍再上线。
问:端侧能完全替代云端吗?不能。复杂推理、超长上下文它搞不定,难题还是得回云端,二者搭配。
🔁 5 天复习计划
| 天 | 任务 | 自检 |
| 第 1 天 | 读①②,理清云端 vs 端侧 | 说清三优势 |
| 第 2 天 | 读③④,跟一遍三个例子 | 讲清蒸馏 vs 量化 |
| 第 3 天 | 做⑤折叠自测 | 三题全对 |
| 第 4 天 | 读⑥费曼三问,不看资料讲 | 能举例 |
| 第 5 天 | 名词速查 + 口诀默写 | 脱稿说清 MoE 为何省算 |
三句口诀① 端侧离线、快、隐私不出机;② 蒸馏转能力、量化压体积、MoE 稀疏省算;③ 简单活端侧,难题回云端。
📌 知识链路
前置知识先懂大模型有多大、多吃内存,再理解为什么要"瘦身"。
本节位置AI 走向设备端:从机房跑到你口袋里。
下一步最后看模型评测,学会不被榜单和营销带偏。