你下载一个大模型,本质上是在下载一大堆数字——那些数字就是"权重"。模型不是一段会自己思考的程序,它就是一个几百亿参数的巨大数学函数;训练这回事,说白了就是在几亿台机器一起拧这些旋钮。这一课把权重、偏置、参数量、权重文件格式、开源协议一次讲透,让你以后看到"7B""safetensors""GGUF"这些词不再发懵。
这一课偏"工程直觉",不要求你会推公式,但一定要建立"模型=一堆数字"这个底层画面。
从一条直线说起。初中数学里有个公式 y = w·x + b:你给一个 x,它算出一个 y。这里的 w 控制直线的斜率(陡不陡),b 控制直线的截距(穿过 y 轴的位置)。就这两个数,决定了整条直线长什么样。
在神经网络里:w 就叫权重(Weight),b 就叫偏置(Bias)。权重决定"这个输入信号有多强",偏置决定"这个神经元本身有多容易被激活"。一个最简单的神经元,就是拿输入乘上权重、加上偏置、再套一个激活函数,吐出一个数。
再往上叠:一个神经元太弱,那就放一万个、一亿个、几百亿个,互相连起来——这就是神经网络。每个连接都有一个权重,每个神经元都可能带一个偏置。这些权重和偏置合起来,就叫参数(Parameter)。
训练在干嘛?就是拿海量数据喂进去,看模型预测错了多少,然后一点点微调每个旋钮,让整体误差变小。拧几万亿次之后,这堆数字就"毕业"了,存盘成一个文件——这就是你下载的模型。
| 名词 | 英文 | 大白话 | 类比 |
|---|---|---|---|
| 权重 | Weight (W) | 连接两个神经元的"强度系数",乘法里那个 w | 旋钮:拧大信号强,拧小信号弱 |
| 偏置 | Bias (b) | 神经元自带的"基础电平",加法里那个 b | 旋钮:不接信号它自己也有个底噪 |
| 参数 | Parameter | 所有权重 + 所有偏置的总和,模型要学的就是它们 | 一台设备上所有旋钮的总数 |
| 写法 | 全称 | 实际数量 | 例子 |
|---|---|---|---|
| M | Million(百万) | 10⁶ = 一百万 | 7B 里的 embedding 层可能有 50M |
| B | Billion(十亿) | 10⁹ = 十亿 | 7B = 70 亿参数,70B = 700 亿参数 |
举几个常见例子帮你建立直觉:一个 7B 模型用 FP16 存,权重本身就要约 14GB 显存;13B 约 26GB;70B 约 140GB。这就是为什么当年跑个 7B 都要 24GB 显卡(还要留出 KV Cache 和激活值的余量)。
| 格式 | 后缀 | 谁在用 | 特点 |
|---|---|---|---|
| safetensors | .safetensors | Hugging Face 默认、现代推理框架 | 安全(不执行 pickle 代码)、加载快、跨框架 |
| PyTorch | .pt / .bin | 老项目、训练存档 | 历史久,但底层用 pickle,理论上可被植入恶意代码 |
| GGUF | .gguf | llama.cpp、Ollama、Mac/CPU 本地 | 单文件、自带量化、CPU 友好 |
| ONNX | .onnx | 跨平台部署、边缘设备 | 为推理优化,可转成手机/嵌入式能跑的格式 |
| 协议 | 宽松程度 | 商用 | 代表模型 |
|---|---|---|---|
| MIT | 最宽松 | 随便用 | DeepSeek V4-Pro 全系、不少小模型、工具库 |
| Apache 2.0 | 宽松,带专利授权 | 随便用,要保留声明 | Qwen3.8 全系列(含 Qwen3.8-Max) |
| Llama 社区协议 | 有限制 | 月活超 7 亿要单独申请 | Meta Llama 4(Scout/Maverick)系列 |
| GPL | 传染性强 | 可用,但你衍生作品必须开源 | 少见 |
| 考法 | 出题形式 | 应对 |
|---|---|---|
| 权重直觉 | 问 w/b 在公式里代表什么 | w=斜率=权重,b=截距=偏置 |
| 参数量单位 | 问 7B 是多少参数 | 70 亿 |
| 显存估算 | FP16 下 7B 占多少 | ≈14GB |
| 格式/协议 | 问哪个最安全、哪个能商用 | safetensors 安全;MIT/Apache 宽松 |
真题基础1. 在直线公式 y = w·x + b 中,权重 w 和偏置 b 分别对应什么?
真题基础2. "7B 模型"里的 B 是什么意思?
真题中档3. 一个 7B 参数模型用 FP16 精度存权重,大约需要多少显存?
真题中档4. 为什么现在 Hugging Face 上大家更推荐 .safetensors 而不是老的 .bin?
| 天 | 任务 | 自检 |
|---|---|---|
| 第 1 天 | 读②③,画一条 y=wx+b 的直线 | 说清 w 和 b |
| 第 2 天 | 背知识点卡 + 基础 1-6 | 单位换算不错 |
| 第 3 天 | 读⑤格式与协议,做中档 7-11 | 能区分四种后缀 |
| 第 4 天 | 做拔高 12-16 | 理解显存构成 |
| 第 5 天 | 做⑦真题 4 题 | 限时每题 2 分钟 |
| 第 6-7 天 | 合上书口述权重/偏置/参数量/协议 | 不看资料全说对 |