← 返回 AI 基础 首页 / 算法与AI / AI 新技术 · 端侧小模型
AI 新技术 · 第 7 章

端侧小模型:让大模型跑进你的手机,不联网也能用

你把大模型想成"云端的巨型专家",每次提问都要联网排队。端侧小模型(Edge LLM)是把这个专家"瘦身"后塞进你手机里——不联网、秒回、隐私不出机。Siri 之外,手机本地就能跑一个会聊天、会总结笔记的小模型,这背后是蒸馏、量化、MoE 三件套。

⓪ 本章怎么学(约 40 分钟)

1为什么塞手机(8 分钟)
读①:云端 vs 端侧。
2压缩三件套(10 分钟)
读②:蒸馏、量化、MoE。
3看例子+防坑(12 分钟)
读③④,记能力边界。
4自测+复述(10 分钟)
做⑤⑥,费曼三问讲一遍。
本章小目标学完你要能:说清端侧三优势、蒸馏/量化/MoE 各压缩什么、为什么端侧不能替代云端、以及隐私场景为什么该用端侧。

① 一句话搞懂:为什么要把模型塞手机里

云端大模型端侧小模型
跑在哪机房大显卡你手机/电脑/手表里
联网必须联网离线也能用
延迟/费用有网络延迟、按 token 付费本地秒回、免费
隐私数据要上云数据不出设备
能力最强够用,但比云端弱
核心直觉端侧不是"做一个更小的 GPT",而是用蒸馏 + 量化 + MoE把云端模型的本事"压缩"进几 GB,还尽量不掉链子。

② 关键概念表

名词大白话
知识蒸馏让小模型模仿大老师的回答,学个七八成像
量化(INT4)把权重从 16 位压到 4 位,体积缩到 1/4,几乎不掉精度
MoE 稀疏激活模型很大,但每次只叫醒其中一小撮专家算
TinyML极小模型跑在单片机、传感器、耳机这类微设备上

压缩三件套怎么配合

蒸馏负责"能力转移",量化负责"体积瘦身",MoE负责"平时不全部叫醒"。三者叠加,70B 的云端模型能被压到手机能跑的几 GB,同时保留大部分实用能力。

③ 三个例子

例 1 · 蒸馏:学生模仿老师
用 GPT-4 生成大量问答,拿去训练一个 7B 小模型。
小模型不一定和老师一样聪明,但学到了"常见问题怎么答"的风格与知识。像好学生抄老师的笔记。
例 2 · INT4 量化省多少
一个 7B 模型。
原本 16 位要 14GB 内存;INT4 量化后约 3.5GB,普通手机内存就能塞下,速度还更快,精度损失通常可接受。
例 3 · 耳机里的 TinyML
耳机要"听到你说唤醒词"。
不可能每次都连手机唤醒大模型。TinyML 极小模型直接跑在耳机芯片上,低功耗、离线、随时听唤醒词。

④ 防坑提醒

坑 1:以为端侧能和云端一样强手机算力/内存有限,端侧模型是"够用版":复杂推理、超长上下文它照样搞不定,难题还是得回云端。
坑 2:量化压太狠INT4 要选对量化方法,压过头会让模型"变傻"、出奇怪回答。部署前要在你的真实任务上测一遍。
坑 3:忽视端侧模型的隐私卖点它的一大优势是数据不出设备——医疗、企业机密、个人日记这类敏感场景,端侧比云端更合适,别浪费这个优势。

⑤ 折叠自测(点开即答)

基础1端侧小模型最大的三个好处是什么?
① 离线可用(不联网也能跑);② 快且免费(无网络延迟、不按 token 计费);③ 隐私不出设备(数据不上云)。
中档2知识蒸馏和量化分别压缩什么?
蒸馏压缩的是能力/体积——让小模型模仿大老师;量化压缩的是每个权重的位数(16位→4位),让模型文件更小、跑得更快。
拔高3MoE 为什么能"又大又省"?
MoE 把模型分成很多"专家"小网络,但每次只激活其中几个,不是全部一起算。总参数可以很大,但单次计算量小,所以在受限设备上也能跑出好效果。

⑥ 费曼三问(合上讲,自己讲给自己听)

用大白话回答,讲不顺就是没懂
问 1:为什么手机本地跑模型,比连云端更保护隐私?
问 2:蒸馏、量化、MoE 各负责"瘦"的哪一方面?
问 3:什么任务该端侧跑,什么任务必须回云端?
端侧优势:离线、秒回、隐私不出机 手机本地
知识蒸馏:小模型模仿大老师 能力转移
INT4 量化:权重压 4 位,体积缩 1/4 瘦身
MoE:参数大但只激活几个专家 稀疏省算
TinyML:极小模型跑在传感器/耳机 低功耗

🛠 实战场景:端侧还是云端

任务建议原因
本地整理笔记、写日记端侧隐私不出机
离线出行翻译菜单端侧没网也要用
复杂多步推理难题云端端侧能力不够
耳机唤醒词检测端侧 TinyML低功耗常驻
超长文档跨章问答云端端侧窗口小

经验法则:敏感、离线、简单的活端侧跑;复杂、长程、要最强能力的回云端。

🧪 生活联想

1私教
云端像高价上门私教(要预约、花钱);端侧像自己请的随身教练(免费、随时)。
2打包行李
量化就是把厚衣服抽真空,体积小了内容还在。
3全班上课
MoE 是一个大班老师,但每次只叫几个学生回答。
对照自己敏感笔记、日记先用端侧小模型处理,数据不出手机;难题再切到云端大模型。

📖 名词速查

名词大白话
Edge LLM跑在手机/电脑本地的小模型
知识蒸馏小模型模仿大老师,学七八成像
INT4 量化权重压到 4 位,体积缩到 1/4
MoE稀疏激活,每次只叫醒几个专家
TinyML极小模型跑在传感器、耳机上
GGUF / llama.cpp常见的端侧模型格式与运行引擎

⚡ 高频 FAQ

问:端侧模型能离线用吗?能。模型文件就在设备里,不联网也能问答,这是它最大的卖点之一。
问:量化会不会把模型压傻?压过头会。要选对量化方法,并在你的真实任务上测一遍再上线。
问:端侧能完全替代云端吗?不能。复杂推理、超长上下文它搞不定,难题还是得回云端,二者搭配。

🔁 5 天复习计划

天任务自检
第 1 天读①②,理清云端 vs 端侧说清三优势
第 2 天读③④,跟一遍三个例子讲清蒸馏 vs 量化
第 3 天做⑤折叠自测三题全对
第 4 天读⑥费曼三问,不看资料讲能举例
第 5 天名词速查 + 口诀默写脱稿说清 MoE 为何省算
三句口诀① 端侧离线、快、隐私不出机;② 蒸馏转能力、量化压体积、MoE 稀疏省算;③ 简单活端侧,难题回云端。

📌 知识链路

前置知识先懂大模型有多大、多吃内存,再理解为什么要"瘦身"。
本节位置AI 走向设备端:从机房跑到你口袋里。
下一步最后看模型评测,学会不被榜单和营销带偏。
← 上一章 · 具身智能 返回 AI 基础总览