← 第3课 · 评分系统 首页 / 算法与AI / AI 基础入门 / 第4课 · 主流模型
AI 基础入门 · 第4课

主流模型全景:GPT、Claude、Gemini、Llama、DeepSeek、Qwen 怎么选

2026 年的大模型圈,名字多到记不住:GPT-6 Astra、o3-pro、Claude Opus 4.8、Gemini 3 Pro、Llama 4、DeepSeek V4-Pro、Qwen3.8-Max、Kimi K3、豆包、Mistral……到底谁是谁?这一课用一张大对比表把八家主流玩家摆开,再给你一张选型速查表——写代码选谁、写文章选谁、本地跑选谁、预算有限选谁,看完心里就有数了。

① 小白第一课怎么学(4 步走,约 60 分钟)

这一课不追求背参数,重点是建立"厂商画像"——每家模型的脾气、强项、价位。

1建立格局直觉(10 分钟)
读③:闭源三巨头 + 开源四小龙。
2逐家画像(20 分钟)
读④:八家模型各自定位。
3对比表 + 选型(20 分钟)
读⑤⑥:按需求挑模型。
4刷题自测(10 分钟)
做⑦⑩,错题回⑥。
本课小目标学完你要能:① 说出八家主流模型各自的厂商和开源闭源属性;② 给"写代码/写文章/本地部署/预算有限"四种场景推荐合适模型;③ 破除"参数越大越好""开源一定不如闭源"两个迷思。

② 一图看懂:2026 大模型格局

2026 大模型格局 闭源阵营(API 调用) OpenAI GPT 系列 综合最强 · 贵 Anthropic Claude 长文本 · 写作 · 安全 Google Gemini 多模态 · 长上下文 · 免费额度 字节豆包 Doubao 国内可用 · 多模态 特点:能力强、产品打磨好、按 token 收费 短板:数据要出门店、不能私有化、贵 代表客户:C 端 App、初创公司、快速上线 开源阵营(可本地部署) Meta Llama 系列 开源标杆 · 生态最广 DeepSeek 深度求索 国产 · 推理强 · 性价比极高 阿里 Qwen 通义 开源全家桶 · 中文好 Mistral(法国) 轻量 · 速度快 · 欧洲代表 特点:权重可下载、可微调、可私有化 短板:要自己出 GPU、产品打磨弱一些 代表客户:金融医疗、大厂内训、极客玩家
读法:左边闭源是"租房子住"——拎包入住但按天交钱,数据得让房东看;右边开源是"自己盖房子"——一次性投入,想怎么改怎么改,数据全在自己家。两边不是替代关系,而是按场景混用。

③ 本质直觉:八家模型其实是八种"脾气"

别把模型当商品参数比。同一道题,GPT 给你"滴水不漏但啰嗦"的答案,Claude 给你"行文流畅像人写的",DeepSeek 给你"步骤清晰还便宜一半",Llama 给你"能跑在你笔记本上"。它们的差别不在"谁分高 1 分",而在脾气和适用场景。

闭源三巨头(OpenAI / Anthropic / Google):相当于米其林餐厅——出品稳定、菜单全、服务好,但贵,而且你不能进厨房。OpenAI 综合最强、生态最广;Claude 长文本和写作最舒服;Gemini 多模态和免费额度香。

开源四小龙(Llama / DeepSeek / Qwen / Mistral):相当于食材市场——你自己买回家做饭,自由度高,但得有手艺(GPU、运维)。Llama 是生态标杆;DeepSeek 是国产性价比之王;Qwen 是中文最香的全家桶;Mistral 是欧洲轻量派。

还有两个特殊玩家:字节豆包主打国内合规和多模态,是普通人最容易用上的国产闭源;o1/o3 这类"推理专用模型"是 OpenAI 拉出的新赛道——慢工出细活,专门啃难题。

闭源 = 租房子住 拎包入住 · 按月交租 · 房东能看见你家 开源 = 自己盖房子 一次性买地盖楼 · 想怎么改怎么改 现实:多数公司是"混住" 敏感数据用开源私有化,公开业务用闭源 API

④ 八家主流模型大对比表

模型厂商开源/闭源核心强项典型场景价位档
GPT-6 Astra / o3-proOpenAI(美)闭源 API综合最强、生态最广、工具调用成熟通用对话、写代码、Agent、复杂推理高
Claude 4.5 Sonnet / Opus 4.8Anthropic(美)闭源 API长文本、写作流畅、安全对齐好长文档分析、写文章、法律文书中高
Gemini 3 Pro Deep Think / 3.8 FlashGoogle(美)闭源 API原生多模态、超长上下文、Flash 便宜快图文混合、视频理解、免费额度尝鲜中低(Flash)
Llama 4 Scout / MaverickMeta(美)开源权重开源标杆、生态最广、工具链成熟本地部署、二次微调、企业私有化免费(自付 GPU)
DeepSeek V4-Pro / V4.1 Flash深度求索(中)开源权重推理能力追平闭源、API 极便宜数学/代码推理、预算敏感场景极低
Qwen3.8-Max / Qwen3.8-Flash阿里(中)开源权重(Apache 2.0)2.4T-A95B MoE 旗舰、端侧 1.7B/4B/7B 全家桶、中文最好中文场景、端侧小模型、企业定制免费(自付 GPU)
豆包 Doubao字节跳动(中)闭源 API国内合规、多模态、App 体验好国内 C 端、中文多模态应用低
Kimi K3月之暗面(中)开源权重2.8T hybrid 架构、长文本与 Agent 强超长上下文、智能体、代码免费(自付 GPU)
LongCat-2.5美团(中)开源权重1.6T 参数、1M 超长上下文长文档处理、企业私有化免费(自付 GPU)
Mistral / MixtralMistral AI(法)开源/商用轻量、速度快、欧洲合规边缘部署、低延迟场景免费~低
怎么读这张表第一列是"叫什么",第三列决定了"你能不能拿到权重自己跑",第四列决定了"它最擅长干什么",最后一列决定了"烧不烧钱"。选型时先看第三列(要不要私有化),再看第四列(强项对不对口),最后看第五列(预算够不够)。

⑤ 选型速查:四种典型场景怎么挑

1写代码/做 Agent
首选 Claude 4.5 Sonnet(写长代码稳)或 o3-pro(推理强);预算紧用 DeepSeek V4.1 Flash,代码能力追平闭源还便宜。
2写文章/读长文档
首选 Claude Opus 4.8 / 4.5 Sonnet,行文最像人,200K token 长文不丢重点;中文长文可试 LongCat-2.5(1M 上下文)。
3本地跑/数据敏感
笔记本跑选 Qwen3.8-7B/14B 或 Llama 4 Scout;公司服务器私有化选 DeepSeek V4-Distill 或 Qwen3.8-Max。
4预算有限/个人玩
白嫖 Gemini 3.8 Flash 免费额度;国内用 豆包 或 DeepSeek V4.1 Flash API;想离线玩就 Ollama 拉 Qwen3.8/Llama 4。
一个实用建议别死守一家。工程上流行"模型路由":简单问题走便宜小模型(Qwen3.8-Flash/DeepSeek V4.1),难问题再升级到 o3-pro/Claude Opus 4.8,成本能砍 70%。

⑥ 高频错误诊断(5 条)

错误 1:参数越大越好70B 模型不一定比 7B 模型在你的场景上强——后者可能中文更好、更快、更便宜。2024 年后小模型+针对性微调经常赢过大模型。参数只是上限,不是实际表现。
错误 2:以为开源一定不如闭源DeepSeek V4-Pro、Qwen3.8-Max 在数学、代码上已经追平甚至超过同期闭源模型。开源的短板主要在多模态整合、产品打磨和企业服务,不是"智力"。
错误 3:把"能聊天"等同于"能干活"聊天舒服的模型不一定工具调用稳。选 Agent 模型要看 function calling 准确率、长任务规划能力,别只看聊天风不风趣。
错误 4:忽略上下文窗口你要喂 100 页 PDF,就得选 200K 上下文以上的(Claude Opus 4.8、Gemini 3 Pro、LongCat-2.5)。8K 窗口的模型再聪明也塞不下。
错误 5:只看英文榜单,不看中文能力很多海外模型英文很强,但中文绕、古文看不懂。中文场景一定要用国内模型或专门测过中文的(Qwen、DeepSeek、豆包)。

⑦ 考点真题演练(4 题)

考点分布

考法出题形式应对
开源闭源归属问哪个权重公开Llama/DeepSeek/Qwen
模型强项问长文本用谁Claude/Gemini
选型问本地部署选谁开源模型
破除迷思问参数越大越好对吗不对

真题基础1. 下面哪个模型是开源、权重可以下载到本地跑的?

真题中档2. 你要让模型一次性读完一本 20 万字的小说并写摘要,优先选哪家?

真题中档3. 银行要做一个内部客服机器人,客户资料不能出门店,最合适的路线是?

真题拔高4. 关于"模型参数规模",下面哪个说法是对的?

⑧ 必背知识点卡

GPT 系列:OpenAI,闭源,GPT-6 Astra / o3-pro,综合最强 通用首选
Claude:Anthropic,闭源,4.5 Sonnet / Opus 4.8,长文本+写作强 读书/写文章
Gemini:Google,闭源,3 Pro Deep Think / 3.8 Flash,多模态+长上下文 免费额度香
Llama:Meta,Llama 4 Scout/Maverick,开放权重,生态标杆 本地部署起步
DeepSeek:深度求索,V4-Pro(MIT)/ V4.1 Flash,推理强+便宜 性价比之王
Qwen:阿里,Qwen3.8-Max(Apache 2.0)/ Flash,中文最好 端侧到旗舰
豆包:字节,闭源,国内合规多模态 国内 C 端
Mistral:法国,开源轻量,快 边缘部署
选型口诀:先看要不要私有化,再看强项对不对口,最后算成本 别死守一家

⑨ 应用输出:给团队做模型选型汇报

实战场景:CTO 让你"下周给个模型选型建议"
① 先问需求:数据能不能出门店?日调用量多少?主要做什么任务?预算多少?这四个问题不问清楚,选型就是瞎选。
② 数据敏感 → 开源:金融、医疗、内部文档直接上 Qwen/DeepSeek 私有化,别犹豫。
③ 公开业务 → 闭源 + 路由:C 端 App 用 GPT/Claude/Gemini,简单请求路由到便宜模型,难问题再升级。
④ 小流量灰度:别一上来全量切,挑 5% 真实用户 A/B 测两周,看满意度、成本、延迟,再决定。
口述全链路"闭源三巨头是 OpenAI、Anthropic、Google,能力强但贵;开源四小龙是 Llama、DeepSeek、Qwen、Mistral,能私有化。选型三步:先看数据要不要出门店,再看任务强项对不对口,最后算成本。别迷信参数大小,用自己业务数据 A/B 测最靠谱。"

⑩ 分层练习 16 题(基础 6 + 中档 5 + 拔高 5)

▍基础 6 题

基础1GPT 系列是哪家公司的?
OpenAI(美国),闭源,按 token 收费。
基础2Claude 是哪家的?强项是什么?
Anthropic,强项是长文本处理和写作流畅度,4.5 Sonnet / Opus 4.8 安全对齐也好。
基础3Gemini 是哪家公司的?
Google,原生多模态,Gemini 3.8 Flash 便宜快、有免费额度。
基础4Llama 是谁家开源的?
Meta(脸书母公司),开源标杆,生态最广。
基础5DeepSeek 是哪家公司的?卖点是什么?
深度求索,国产开源(MIT),V4-Pro 推理能力追平闭源,V4.1 Flash 接口价格极低。
基础6Qwen 通义千问是哪家公司的?
阿里巴巴,Qwen3.8 开源全家桶(Apache 2.0),从 1.7B 端侧到 2.4T MoE 旗舰都有,中文表现好。

▍中档 5 题

中档7写代码、做 Agent 优先选哪两家?
Claude 4.5 Sonnet(写长代码稳)和 OpenAI o3-pro(推理强);预算紧用 DeepSeek V4.1 Flash。
中档8为什么银行医院倾向用开源模型?
合规要求数据不出内网。闭源接口要把数据发到厂商服务器;开源可私有化部署在自己机房。
中档9模型路由是什么意思?
按问题难度自动选模型:简单走便宜小模型,难问题再升级大模型。效果不掉可砍 70% 成本。
中档10豆包和 GPT 的关键差异?
豆包是国内合规可直接用的闭源模型;GPT 综合更强但国内访问不便、数据出境有合规问题。
中档11Mistral 的定位?
法国公司,主打轻量、速度快、欧洲数据合规,适合边缘部署和低延迟场景。

▍拔高 5 题

拔高12为什么说参数大不等于实际强?
参数是容量上限,实际表现取决于数据、对齐、任务匹配。7B 微调在垂直领域可能干翻 70B 通用模型,且大模型慢贵。
拔高13o1/o3 推理模型和普通 GPT 有何不同?
o3-pro 这类推理模型会多想一会儿——输出前内部做更长思维链,数学代码难题更强,但延迟更高更贵。
拔高14选型为何要看上下文窗口?
8K 窗口再聪明也塞不下 100 页 PDF。喂长文档要选 200K 以上窗口的(Claude Opus 4.8、Gemini 3 Pro、LongCat-2.5 1M)。
拔高15为何不能只看英文榜单选中文模型?
海外模型英文强但中文语料占比低,写中文绕、不懂梗、古文方言差。中文场景要用 Qwen、DeepSeek、豆包。
拔高16初创做写作产品预算紧怎么组合?
免费额度起步(Gemini 3.8 Flash/豆包),上线后路由:80% 简单请求走 DeepSeek V4.1 Flash 极便宜接口,20% 复杂升级 Claude Opus。

⑪ 记忆口诀 + 7 天复习计划

三句口诀 ① 闭源三巨头:OpenAI 综合、Claude 长文、Gemini 多模态。
② 开源四小龙:Llama 生态、DeepSeek 推理便宜、Qwen 中文全家桶、Mistral 轻量快。
③ 选型三步:先看数据要不要出门店,再看强项对不对口,最后算成本。
天任务自检
第 1 天读②③,画闭源/开源格局图八家厂商归属不串
第 2 天读④,逐家画像能说出每家强项
第 3 天读⑤⑥,记选型速查和迷思四种场景会推荐
第 4 天背知识点卡 + 基础 1-6基础全对
第 5 天做中档 7-11 + 真题 4 题限时每题 2 分钟
第 6-7 天做拔高 12-16,口述选型逻辑不看资料全说对

📌 知识链路

前置知识(先学) · 第3课 · 评分体系:有了评分尺,才看得懂各家模型的名次。
本节位置 建立"参赛选手花名册":Qwen3.8 / Llama 4 / DeepSeek V4 / Kimi K3 这些名字对应什么定位、什么强项。
下一步(学完去) · 第5课 · 模型权重:下载下来的那一坨文件到底是什么。
· 第10课 · Agent:模型怎么变成能干活的助手。
← 第3课 · 评分系统 算法与AI总览