← 返回 AI 基础 首页 / 算法与AI / 模型架构 · 国产模型家族
AI 基础进阶 · 模型架构

国产模型家族全景:Qwen、GLM、Kimi、豆包、文心、混元怎么分

一说国产大模型,名字一大串:通义千问、智谱 GLM、Kimi、豆包、文心一言、混元……它们谁是哪家的、开源还是闭源、从 0.5B 小模型到 72B 大模型怎么挑?这一课用一张家谱把六家主流玩家摆清楚,最后给你一张"开源 vs 闭源"选型表。

① 本章怎么学(4 步走,约 45 分钟)

1记住"哪家出的"(12 分钟)
读②:六家厂商一张表。
2看懂 Qwen 版本线(13 分钟)
读③:1→2.5→3,尺寸 0.5B→72B。
3分清开源/闭源(12 分钟)
读⑤⑥:能不能自己下载跑。
4自测口述(8 分钟)
做⑨,背⑪。
本章小目标学完你要能:① 说出六家模型各自背后的公司;② 讲清 Qwen 系列的代际和尺寸档位;③ 区分"开源权重可下载"和"只能调 API";④ 按场景选出该用哪类模型。

② 六家主流玩家一张表

模型名背后公司一句话定位开源?
Qwen 通义千问阿里巴巴尺寸最全、开源生态最好,从小到大全覆盖多数开源
GLM / ChatGLM智谱 AI清华系,企业级落地多,GLM-4 对标 GPT-4部分开源
KimiMoonshot 月之暗面超长文本见长,早期靠"读长文档"出圈闭源 API
豆包 Doubao字节跳动C 端用户量大,和抖音/飞书生态打通闭源 API
文心一言百度国内最早一批通用大模型,搜索+文心闭源 API
混元腾讯和微信/腾讯云生态绑定,多模态强闭源为主
国产大模型 Qwen · 阿里 尺寸最全·开源 GLM · 智谱 清华系·企业 Kimi · 月之暗面 超长文本 豆包/文心/混元 字节/百度/腾讯
读法:六家按"公司 + 特长 + 是否开源"记,别只记模型名。
怎么记阿里="什么尺寸都给你"(Qwen),智谱="清华技术派"(GLM),月之暗面="超长文本"(Kimi),字节="C 端流量王"(豆包),百度="老牌搜索派"(文心),腾讯="社交生态派"(混元)。

③ Qwen 通义千问:从 0.5B 到 72B 的尺寸全家桶

Qwen(通义千问)是阿里出的模型家族,最大特点是尺寸档位特别全:同一个架构从能塞进手机的 0.5B,到需要几张显卡的 72B 都有,方便你按硬件选型。

代际特点常见尺寸
Qwen / Qwen 1.5初代,打基础1.8B / 7B / 14B / 72B
Qwen 2 / 2.5能力全面提升,中英双语变强0.5B / 1.5B / 7B / 14B / 32B / 72B
Qwen 3混合专家版 Qwen3-MoE,小尺寸也能打0.6B~数百B 多档

尺寸怎么挑

0.5~1.8B端侧/手机
塞得进笔记本、手机,做轻量助手。
7~14B个人本地
一张消费级显卡能跑,玩 RAG、写脚本。
32~72B企业服务
接近一线闭源模型水平,自己部署私有化。

④ 其他几家速记

GLM 智谱(ChatGLM → GLM-4)

清华技术背景,早期以 ChatGLM 开源版出名,企业客户多。GLM-4 系列对标 GPT-4,强调 Agent、代码、长文本能力,既有开放权重也有商业 API。

Kimi(月之暗面)

最早靠"一次读完一整本长 PDF/长网页"出圈,主打超长上下文。你给它扔一篇几十页论文,它能直接总结。闭源产品,主要通过网页/App 和 API 使用。

豆包 / 文心 / 混元

这三家是大厂闭源 API路线:不公开模型权重,你只能通过它们的 App 或接口调用。豆包背靠字节流量与多模态能力,文心背靠百度搜索,混元背靠腾讯社交/游戏生态。

⑤ 开源 vs 闭源:到底差在哪

对比开源权重(Qwen、GLM 开放版)闭源 API(豆包/文心/Kimi/混元)
模型文件可下载到自己服务器拿不到,只能联网调接口
数据隐私数据不出内网,可私有化请求要发到厂商服务器
成本自己买显卡,前期贵、边际便宜按 token 付费,小量便宜
能力上限顶级开源略逊于顶级闭源通常是当前最强一档
可定制能微调、能改、能二开只能调提示词,动不了模型
选型口诀数据敏感、要私有化、量大长期 → 开源权重自己部署;快速试用、不管运维、要最强 → 闭源 API 按量付费。

⑥ 三个例子

例 1 · 笔记本本地跑模型
你只有一张普通显卡,想本地跑一个会聊天、能写点脚本的模型。
选 Qwen2.5-7B 或 14B 的开源版,下载权重用 llama.cpp / vLLM 跑。7B 能塞进消费卡,14B 更聪明但要更好的卡。
例 2 · 企业做内部客服
公司客户资料不能出内网,但要一个智能客服。
选 开源 Qwen 32B/72B 私有化部署,再配上自己知识库的 RAG。不选闭源 API,因为对话数据会发到外部服务器。
例 3 · 快速做个网页总结工具
个人开发者,不想买显卡,想最快上线。
直接调 豆包/文心/Kimi 的闭源 API,按 token 付费,几行代码接好就用,能力还是第一梯队。

⑦ 易错提醒

易错 1:把"通义千问"和"Qwen"当成两个模型其实是一个:通义千问是对外产品名,Qwen 是开源模型系列名,同一家阿里出的。
易错 2:以为开源模型能白嫖无限免费权重免费,但你得自己买显卡、自己部署维护。量大了电费和运维并不便宜,这是"隐性成本"。
易错 3:看到 GLM 就以为一定能下载GLM 家族是"部分开源":小版本开放权重,最新最强的 GLM-4 旗舰 often 只走 API。具体能不能下,要看对应版本的发布说明。

⑧ 折叠自测(点开即答)

基础1Kimi、豆包、文心一言分别是哪家公司出的?
Kimi=月之暗面(Moonshot);豆包=字节跳动;文心一言=百度。Qwen=阿里,GLM=智谱,混元=腾讯。
中档2Qwen2.5 为什么要从 0.5B 一直做到 72B?
为了适配不同硬件:0.5B~1.8B 跑在手机/端侧,7B~14B 跑个人电脑,32B~72B 跑企业服务器。同一架构不同尺寸,开发者按自己的显卡选型。
拔高3公司要做一个处理内部机密合同的 AI 助手,该选开源权重还是闭源 API?为什么?
选开源权重私有化部署(如 Qwen-72B)。因为合同是机密,不能发到外部厂商服务器;开源模型可装在内网,数据不出域,还能按业务微调。

⑨ 费曼三问(合上讲,自己讲给自己听)

用大白话回答,讲不顺就是没懂
问 1:六家模型里,哪些是"能下载到自己电脑跑"的,哪些只能联网调用?
问 2:为什么 Qwen 要出 0.5B 到 72B 这么多尺寸,不能只做一个最强的?
问 3:你公司数据不能出内网,你会怎么选模型?
六家:Qwen 阿里 / GLM 智谱 / Kimi 月之暗面 / 豆包字节 / 文心百度 / 混元腾讯 背公司
Qwen 尺寸:0.5B 端侧 → 7~14B 个人 → 32~72B 企业 按显卡选
开源:权重可下载、可私有化、可微调 数据不出域
闭源:只能调 API、按 token 付费、能力强 快但数据外发

⚡ 高频 FAQ

问:通义千问和 Qwen 是同一个吗?是。对外产品叫通义千问,开源模型权重叫 Qwen,都是阿里出的。
问:开源模型真的免费吗?权重免费,但要自己买显卡、自己运维,量大并不便宜。
问:GLM-4 能下载吗?GLM 家族部分开源:小尺寸开放权重,最新旗舰 often 只走 API,看对应版本说明。

📖 名词速查

名词大白话
Qwen / 通义千问阿里同一家:开源系列叫 Qwen,产品叫通义千问
0.5B / 7B / 72B参数量,越大越聪明但越吃显卡
GLM / ChatGLM智谱出的,清华系,企业客户多
Kimi月之暗面,超长文本见长
豆包字节跳动,C 端用户量大
文心 / 混元百度、腾讯,分别绑搜索和社交生态
权重 / API能下载的文件 vs 只能联网调的接口

🧪 动手实验建议

1下一个小模型
用 Ollama 拉 qwen2.5:7b,本地跑通对话。
2对比尺寸
同一问题分别问 0.5B 和 7B,感受智力差距。
3调一次闭源 API
注册豆包/文心,几行代码调通一次接口。
观察重点开源模型下载要占硬盘和显卡;闭源 API 几行代码就出结果,但数据会发到云端。

🔁 5 天复习计划

天任务自检
第 1 天读②,背六家"公司+特长+开源否"不看表说出六家归属
第 2 天读③④,理清 Qwen 代际与尺寸档位说出 0.5B/7B/72B 各跑在哪
第 3 天读⑤开源 vs 闭源表 + ⑥例子按三个场景选出该用哪类
第 4 天做⑧折叠自测,背⑨口诀三题全对、公司全背出
第 5 天合上讲⑨费曼三问,不看资料讲一遍选型理由说清楚
三句口诀① 六家归六公司;② Qwen 尺寸按显卡挑;③ 数据敏感选开源、图快选闭源 API。

📌 知识链路

前置知识(先学)先看上一章 DeepSeek 与 MoE,理解"参数规模"和"开源/闭源"是怎么回事,再记这六家的家谱。
本节位置把"主流模型"那张大表收窄到国产阵营,重点是会按场景选型。
下一步(学完去)选定模型后,怎么把它在线上跑快?接下去学推理优化(vLLM、连续批处理)。
← 上一章 · DeepSeek 与 MoE 返回 AI 基础总览