AI 基础入门 · 第4课
主流模型全景:GPT、Claude、Gemini、Llama、DeepSeek、Qwen 怎么选
2026 年的大模型圈,名字多到记不住:GPT-6 Astra、o3-pro、Claude Opus 4.8、Gemini 3 Pro、Llama 4、DeepSeek V4-Pro、Qwen3.8-Max、Kimi K3、豆包、Mistral……到底谁是谁?这一课用一张大对比表把八家主流玩家摆开,再给你一张选型速查表——写代码选谁、写文章选谁、本地跑选谁、预算有限选谁,看完心里就有数了。
① 小白第一课怎么学(4 步走,约 60 分钟)
这一课不追求背参数,重点是建立"厂商画像"——每家模型的脾气、强项、价位。
1建立格局直觉(10 分钟)
读③:闭源三巨头 + 开源四小龙。
2逐家画像(20 分钟)
读④:八家模型各自定位。
3对比表 + 选型(20 分钟)
读⑤⑥:按需求挑模型。
4刷题自测(10 分钟)
做⑦⑩,错题回⑥。
本课小目标学完你要能:① 说出八家主流模型各自的厂商和开源闭源属性;② 给"写代码/写文章/本地部署/预算有限"四种场景推荐合适模型;③ 破除"参数越大越好""开源一定不如闭源"两个迷思。
② 一图看懂:2026 大模型格局
读法:左边闭源是"租房子住"——拎包入住但按天交钱,数据得让房东看;右边开源是"自己盖房子"——一次性投入,想怎么改怎么改,数据全在自己家。两边不是替代关系,而是按场景混用。
③ 本质直觉:八家模型其实是八种"脾气"
别把模型当商品参数比。同一道题,GPT 给你"滴水不漏但啰嗦"的答案,Claude 给你"行文流畅像人写的",DeepSeek 给你"步骤清晰还便宜一半",Llama 给你"能跑在你笔记本上"。它们的差别不在"谁分高 1 分",而在脾气和适用场景。
闭源三巨头(OpenAI / Anthropic / Google):相当于米其林餐厅——出品稳定、菜单全、服务好,但贵,而且你不能进厨房。OpenAI 综合最强、生态最广;Claude 长文本和写作最舒服;Gemini 多模态和免费额度香。
开源四小龙(Llama / DeepSeek / Qwen / Mistral):相当于食材市场——你自己买回家做饭,自由度高,但得有手艺(GPU、运维)。Llama 是生态标杆;DeepSeek 是国产性价比之王;Qwen 是中文最香的全家桶;Mistral 是欧洲轻量派。
还有两个特殊玩家:字节豆包主打国内合规和多模态,是普通人最容易用上的国产闭源;o1/o3 这类"推理专用模型"是 OpenAI 拉出的新赛道——慢工出细活,专门啃难题。
④ 八家主流模型大对比表
| 模型 | 厂商 | 开源/闭源 | 核心强项 | 典型场景 | 价位档 |
| GPT-6 Astra / o3-pro | OpenAI(美) | 闭源 API | 综合最强、生态最广、工具调用成熟 | 通用对话、写代码、Agent、复杂推理 | 高 |
| Claude 4.5 Sonnet / Opus 4.8 | Anthropic(美) | 闭源 API | 长文本、写作流畅、安全对齐好 | 长文档分析、写文章、法律文书 | 中高 |
| Gemini 3 Pro Deep Think / 3.8 Flash | Google(美) | 闭源 API | 原生多模态、超长上下文、Flash 便宜快 | 图文混合、视频理解、免费额度尝鲜 | 中低(Flash) |
| Llama 4 Scout / Maverick | Meta(美) | 开源权重 | 开源标杆、生态最广、工具链成熟 | 本地部署、二次微调、企业私有化 | 免费(自付 GPU) |
| DeepSeek V4-Pro / V4.1 Flash | 深度求索(中) | 开源权重 | 推理能力追平闭源、API 极便宜 | 数学/代码推理、预算敏感场景 | 极低 |
| Qwen3.8-Max / Qwen3.8-Flash | 阿里(中) | 开源权重(Apache 2.0) | 2.4T-A95B MoE 旗舰、端侧 1.7B/4B/7B 全家桶、中文最好 | 中文场景、端侧小模型、企业定制 | 免费(自付 GPU) |
| 豆包 Doubao | 字节跳动(中) | 闭源 API | 国内合规、多模态、App 体验好 | 国内 C 端、中文多模态应用 | 低 |
| Kimi K3 | 月之暗面(中) | 开源权重 | 2.8T hybrid 架构、长文本与 Agent 强 | 超长上下文、智能体、代码 | 免费(自付 GPU) |
| LongCat-2.5 | 美团(中) | 开源权重 | 1.6T 参数、1M 超长上下文 | 长文档处理、企业私有化 | 免费(自付 GPU) |
| Mistral / Mixtral | Mistral AI(法) | 开源/商用 | 轻量、速度快、欧洲合规 | 边缘部署、低延迟场景 | 免费~低 |
怎么读这张表第一列是"叫什么",第三列决定了"你能不能拿到权重自己跑",第四列决定了"它最擅长干什么",最后一列决定了"烧不烧钱"。选型时先看第三列(要不要私有化),再看第四列(强项对不对口),最后看第五列(预算够不够)。
⑤ 选型速查:四种典型场景怎么挑
1写代码/做 Agent
首选 Claude 4.5 Sonnet(写长代码稳)或 o3-pro(推理强);预算紧用 DeepSeek V4.1 Flash,代码能力追平闭源还便宜。
2写文章/读长文档
首选 Claude Opus 4.8 / 4.5 Sonnet,行文最像人,200K token 长文不丢重点;中文长文可试 LongCat-2.5(1M 上下文)。
3本地跑/数据敏感
笔记本跑选 Qwen3.8-7B/14B 或 Llama 4 Scout;公司服务器私有化选 DeepSeek V4-Distill 或 Qwen3.8-Max。
4预算有限/个人玩
白嫖 Gemini 3.8 Flash 免费额度;国内用 豆包 或 DeepSeek V4.1 Flash API;想离线玩就 Ollama 拉 Qwen3.8/Llama 4。
一个实用建议别死守一家。工程上流行"模型路由":简单问题走便宜小模型(Qwen3.8-Flash/DeepSeek V4.1),难问题再升级到 o3-pro/Claude Opus 4.8,成本能砍 70%。
⑥ 高频错误诊断(5 条)
错误 1:参数越大越好70B 模型不一定比 7B 模型在你的场景上强——后者可能中文更好、更快、更便宜。2024 年后小模型+针对性微调经常赢过大模型。参数只是上限,不是实际表现。
错误 2:以为开源一定不如闭源DeepSeek V4-Pro、Qwen3.8-Max 在数学、代码上已经追平甚至超过同期闭源模型。开源的短板主要在多模态整合、产品打磨和企业服务,不是"智力"。
错误 3:把"能聊天"等同于"能干活"聊天舒服的模型不一定工具调用稳。选 Agent 模型要看 function calling 准确率、长任务规划能力,别只看聊天风不风趣。
错误 4:忽略上下文窗口你要喂 100 页 PDF,就得选 200K 上下文以上的(Claude Opus 4.8、Gemini 3 Pro、LongCat-2.5)。8K 窗口的模型再聪明也塞不下。
错误 5:只看英文榜单,不看中文能力很多海外模型英文很强,但中文绕、古文看不懂。中文场景一定要用国内模型或专门测过中文的(Qwen、DeepSeek、豆包)。
⑦ 考点真题演练(4 题)
考点分布
| 考法 | 出题形式 | 应对 |
| 开源闭源归属 | 问哪个权重公开 | Llama/DeepSeek/Qwen |
| 模型强项 | 问长文本用谁 | Claude/Gemini |
| 选型 | 问本地部署选谁 | 开源模型 |
| 破除迷思 | 问参数越大越好对吗 | 不对 |
真题基础1. 下面哪个模型是开源、权重可以下载到本地跑的?
真题中档2. 你要让模型一次性读完一本 20 万字的小说并写摘要,优先选哪家?
真题中档3. 银行要做一个内部客服机器人,客户资料不能出门店,最合适的路线是?
真题拔高4. 关于"模型参数规模",下面哪个说法是对的?
⑧ 必背知识点卡
GPT 系列:OpenAI,闭源,GPT-6 Astra / o3-pro,综合最强 通用首选
Claude:Anthropic,闭源,4.5 Sonnet / Opus 4.8,长文本+写作强 读书/写文章
Gemini:Google,闭源,3 Pro Deep Think / 3.8 Flash,多模态+长上下文 免费额度香
Llama:Meta,Llama 4 Scout/Maverick,开放权重,生态标杆 本地部署起步
DeepSeek:深度求索,V4-Pro(MIT)/ V4.1 Flash,推理强+便宜 性价比之王
Qwen:阿里,Qwen3.8-Max(Apache 2.0)/ Flash,中文最好 端侧到旗舰
豆包:字节,闭源,国内合规多模态 国内 C 端
Mistral:法国,开源轻量,快 边缘部署
选型口诀:先看要不要私有化,再看强项对不对口,最后算成本 别死守一家
⑨ 应用输出:给团队做模型选型汇报
实战场景:CTO 让你"下周给个模型选型建议"
① 先问需求:数据能不能出门店?日调用量多少?主要做什么任务?预算多少?这四个问题不问清楚,选型就是瞎选。
② 数据敏感 → 开源:金融、医疗、内部文档直接上 Qwen/DeepSeek 私有化,别犹豫。
③ 公开业务 → 闭源 + 路由:C 端 App 用 GPT/Claude/Gemini,简单请求路由到便宜模型,难问题再升级。
④ 小流量灰度:别一上来全量切,挑 5% 真实用户 A/B 测两周,看满意度、成本、延迟,再决定。
口述全链路"闭源三巨头是 OpenAI、Anthropic、Google,能力强但贵;开源四小龙是 Llama、DeepSeek、Qwen、Mistral,能私有化。选型三步:先看数据要不要出门店,再看任务强项对不对口,最后算成本。别迷信参数大小,用自己业务数据 A/B 测最靠谱。"
⑩ 分层练习 16 题(基础 6 + 中档 5 + 拔高 5)
▍基础 6 题
基础1GPT 系列是哪家公司的?
OpenAI(美国),闭源,按 token 收费。
基础2Claude 是哪家的?强项是什么?
Anthropic,强项是长文本处理和写作流畅度,4.5 Sonnet / Opus 4.8 安全对齐也好。
基础3Gemini 是哪家公司的?
Google,原生多模态,Gemini 3.8 Flash 便宜快、有免费额度。
基础4Llama 是谁家开源的?
Meta(脸书母公司),开源标杆,生态最广。
基础5DeepSeek 是哪家公司的?卖点是什么?
深度求索,国产开源(MIT),V4-Pro 推理能力追平闭源,V4.1 Flash 接口价格极低。
基础6Qwen 通义千问是哪家公司的?
阿里巴巴,Qwen3.8 开源全家桶(Apache 2.0),从 1.7B 端侧到 2.4T MoE 旗舰都有,中文表现好。
▍中档 5 题
中档7写代码、做 Agent 优先选哪两家?
Claude 4.5 Sonnet(写长代码稳)和 OpenAI o3-pro(推理强);预算紧用 DeepSeek V4.1 Flash。
中档8为什么银行医院倾向用开源模型?
合规要求数据不出内网。闭源接口要把数据发到厂商服务器;开源可私有化部署在自己机房。
中档9模型路由是什么意思?
按问题难度自动选模型:简单走便宜小模型,难问题再升级大模型。效果不掉可砍 70% 成本。
中档10豆包和 GPT 的关键差异?
豆包是国内合规可直接用的闭源模型;GPT 综合更强但国内访问不便、数据出境有合规问题。
中档11Mistral 的定位?
法国公司,主打轻量、速度快、欧洲数据合规,适合边缘部署和低延迟场景。
▍拔高 5 题
拔高12为什么说参数大不等于实际强?
参数是容量上限,实际表现取决于数据、对齐、任务匹配。7B 微调在垂直领域可能干翻 70B 通用模型,且大模型慢贵。
拔高13o1/o3 推理模型和普通 GPT 有何不同?
o3-pro 这类推理模型会多想一会儿——输出前内部做更长思维链,数学代码难题更强,但延迟更高更贵。
拔高14选型为何要看上下文窗口?
8K 窗口再聪明也塞不下 100 页 PDF。喂长文档要选 200K 以上窗口的(Claude Opus 4.8、Gemini 3 Pro、LongCat-2.5 1M)。
拔高15为何不能只看英文榜单选中文模型?
海外模型英文强但中文语料占比低,写中文绕、不懂梗、古文方言差。中文场景要用 Qwen、DeepSeek、豆包。
拔高16初创做写作产品预算紧怎么组合?
免费额度起步(Gemini 3.8 Flash/豆包),上线后路由:80% 简单请求走 DeepSeek V4.1 Flash 极便宜接口,20% 复杂升级 Claude Opus。
⑪ 记忆口诀 + 7 天复习计划
三句口诀
① 闭源三巨头:OpenAI 综合、Claude 长文、Gemini 多模态。
② 开源四小龙:Llama 生态、DeepSeek 推理便宜、Qwen 中文全家桶、Mistral 轻量快。
③ 选型三步:先看数据要不要出门店,再看强项对不对口,最后算成本。
| 天 | 任务 | 自检 |
| 第 1 天 | 读②③,画闭源/开源格局图 | 八家厂商归属不串 |
| 第 2 天 | 读④,逐家画像 | 能说出每家强项 |
| 第 3 天 | 读⑤⑥,记选型速查和迷思 | 四种场景会推荐 |
| 第 4 天 | 背知识点卡 + 基础 1-6 | 基础全对 |
| 第 5 天 | 做中档 7-11 + 真题 4 题 | 限时每题 2 分钟 |
| 第 6-7 天 | 做拔高 12-16,口述选型逻辑 | 不看资料全说对 |
📌 知识链路
本节位置
建立"参赛选手花名册":Qwen3.8 / Llama 4 / DeepSeek V4 / Kimi K3 这些名字对应什么定位、什么强项。