AI 新技术 · 第 4 章
AI 编程:从 Copilot 补全到 Claude Code 自己改整个仓库
写代码这件事,正在被 AI 重新定义。最早是 GitHub Copilot 帮你补全下一行;现在 Cursor、Claude Code 能自己读懂整个项目、改文件、跑测试、修 bug。你要做的不再是一行行敲,而是描述"我要什么",再验收它干得对不对。这一课讲清楚这条进化线。
⓪ 本章怎么学(约 40 分钟)
1三个台阶(8 分钟)
读①:补全→对话→Agentic。
2概念表(10 分钟)
读②:工具调用、SWE-bench。
3看例子+防坑(12 分钟)
读③④,记必审代码。
4自测+复述(10 分钟)
做⑤⑥,费曼三问讲一遍。
本章小目标学完你要能:说出 AI 编程的三个阶段、为什么工具调用要"能跑能看报错"、SWE-bench 考什么、以及为什么 AI 写的代码必须 review。
① 一句话搞懂:AI 编程的三个台阶
| 阶段 | 工具代表 | 它干什么 | 人干什么 |
| 代码补全 | Copilot 早期 | 猜你下一行写啥,灰色提示 | 逐行确认、照单全收 |
| 对话生成 | Code Interpreter、Cursor Chat | 按需求写一个函数/文件,能跑 | 描述需求、复制粘贴 |
| Agentic Coding | Claude Code、Cursor Agent | 自己读仓库、改多文件、跑测试修错 | 下指令、审代码、兜底 |
核心直觉台阶越高,AI 越像"能独立干活的初级工程师",人越像"提需求 + 做 code review 的 tech lead"。
② 关键概念表
| 名词 | 大白话 |
| 工具调用 / 跑命令 | AI 不只写代码,还真的运行、看报错、继续改 |
| 仓库上下文 | 把整个代码库喂给它,让它懂项目结构和约定 |
| SWE-bench | 业界公认的"修真实 GitHub bug"能力考试 |
| 代码理解 + 生成 | 先读懂别人写的,再在其上改,而不是从零造 |
Agentic Coding 是怎么跑通一个 bug 的
你说"登录接口偶发 500"。它会:自己搜相关文件 → 读懂调用链 → 定位可疑代码 → 改一版 → 跑测试 → 看红了再改,循环到测试通过。这正是上一章讲的 ReAct 循环在编程场景的落地。
③ 三个例子
例 1 · Copilot 补全
你写 def is_prime(n):
它根据上下文猜你要写判断质数的循环,弹出灰色建议,你按 Tab 接受。人主导,AI 打下手。
例 2 · Code Interpreter 跑一段数据处理
"帮我把这个 CSV 按月统计销售额并画图"。
AI 直接在沙箱里写 pandas 代码、真运行、把出错信息读进来再修,最后给你图和结论。它会自己调试。
例 3 · Claude Code 跨文件重构
"把所有用 fetch 的地方统一换成 axios"。
它自己 grep 出全部 30 处、逐个改、跑类型检查、把失败的再修一遍。人只下一句话指令。
④ 防坑提醒
坑 1:AI 写的代码不审就上线它会写出"能跑但有 bug、不安全、性能差"的代码。AI 生成 ≠ 正确,必须过测试和 code review。
坑 2:把 Agentic Coding 当成全自动它长链路会跑偏、会删错文件、会引入安全漏洞。给它权限要克制,重要操作先确认。
坑 3:忽视 SWE-bench 不等于生产可用榜单分数高,只代表在那类公开题上强;你公司的内部工程约定、遗留代码、隐私边界,它照样要靠你引导。
⑤ 折叠自测(点开即答)
基础1Copilot 补全和 Claude Code 的本质区别是什么?
补全是猜下一行、人主导;Claude Code 这类 Agentic Coding 是自己读仓库、改多文件、跑测试修错,人只提需求和验收。
中档2为什么 AI 编程工具要"能跑命令、看报错"?
因为只写不跑就不知道对错。能真实运行并读反馈,它才能像人一样"写错了→看报错→再改",形成闭环。
拔高3SWE-bench 是干什么的?为什么分数高不等于生产无忧?
SWE-bench 是用真实 GitHub issue 修 bug来考模型,是业界硬指标。但它只覆盖公开常见题;内部约定、遗留系统、安全与隐私边界仍需人工把关。
⑥ 费曼三问(合上讲,自己讲给自己听)
用大白话回答,讲不顺就是没懂
问 1:AI 编程从"补全一行"到"自己改整个仓库",中间多了哪两个关键能力?
问 2:为什么 AI 写的代码你必须自己 review,不能直接上线?
问 3:为什么说人在 AI 编程时代更像 tech lead 而不是打字员?
三台阶:补全一行 / 对话生成 / Agentic 改仓库 Copilot→Cursor→Claude Code
工具调用:写代码还能真跑、看报错再改 闭环
仓库上下文:喂整个项目,懂结构约定 全局视野
SWE-bench:真实修 bug 的能力考 硬指标
人角色:提需求 + 审代码 + 兜底 tech lead
🛠 实战场景:怎么用才不翻车
| 做法 | 建议 | 原因 |
| 让它写一个独立小函数 | 放心用 | 隔离、好测 |
| 让它跨文件重构 | 给权限+人审 | 影响面大,要 review |
| 让它直接动生产数据库 | 禁止 | 不可逆,风险太高 |
| 让它改完跑测试 | 鼓励 | 用测试结果兜底 |
| 重要操作前加人工确认 | 必须 | 删错文件/发错请求代价大 |
经验法则:沙箱里放开跑,动真格前先确认,每一次生成都过测试和 code review。
🧪 生活联想
1实习生
Copilot 像旁边提示你"下一句写啥"的实习生。
2初级工程师
Claude Code 像能独立领任务、改文件、跑测试的初级。
3Tech Lead
你的角色变成提需求、审代码、兜底。
对照自己用 AI 写代码后,先看它改了哪些文件、跑没跑测试,别直接合并到主干。
📖 名词速查
| 名词 | 大白话 |
| Copilot | 早期代码补全,猜下一行 |
| Cursor | AI 原生编辑器,对话式写代码 |
| Claude Code | 命令行 Agent,自己读仓库改多文件 |
| Code Interpreter | 在沙箱里真跑代码、看结果 |
| Agentic Coding | 自己规划、改文件、跑测试修错 |
| SWE-bench | 真实 GitHub 修 bug 的能力考 |
⚡ 高频 FAQ
问:AI 写的代码能直接上线吗?不能。它会引入 bug、安全漏洞和坏性能,必须过测试和 code review。
问:Agentic Coding 会自己删错文件吗?会。长链路有风险,给它权限要克制,重要操作先确认、用版本控制兜底。
问:SWE-bench 第一就代表生产无忧吗?不。它只测公开常见题,内部约定和隐私边界仍需人工把关。
🔁 5 天复习计划
| 天 | 任务 | 自检 |
| 第 1 天 | 读①②,理清三个台阶 | 说清 Copilot vs Claude Code |
| 第 2 天 | 读③④,跟一遍三个例子 | 讲清工具调用闭环 |
| 第 3 天 | 做⑤折叠自测 | 三题全对 |
| 第 4 天 | 读⑥费曼三问,不看资料讲 | 能举例 |
| 第 5 天 | 名词速查 + 口诀默写 | 脱稿说清 SWE-bench 意义 |
三句口诀① 从补全一行到自己改仓库;② 能跑能看报错才形成闭环;③ AI 写的代码必须 review。
📌 知识链路
前置知识先懂大模型能写代码、会工具调用(Agent 那一课),再看它怎么在工程里闭环。
本节位置AI 能力在编程场景的落地:从对话到自主改仓库。
下一步接着看世界模型,理解 AI 怎么开始"预测物理世界"。