← 返回 AI 基础 首页 / 算法与AI / AI 新技术 · AI 编程
AI 新技术 · 第 4 章

AI 编程:从 Copilot 补全到 Claude Code 自己改整个仓库

写代码这件事,正在被 AI 重新定义。最早是 GitHub Copilot 帮你补全下一行;现在 Cursor、Claude Code 能自己读懂整个项目、改文件、跑测试、修 bug。你要做的不再是一行行敲,而是描述"我要什么",再验收它干得对不对。这一课讲清楚这条进化线。

⓪ 本章怎么学(约 40 分钟)

1三个台阶(8 分钟)
读①:补全→对话→Agentic。
2概念表(10 分钟)
读②:工具调用、SWE-bench。
3看例子+防坑(12 分钟)
读③④,记必审代码。
4自测+复述(10 分钟)
做⑤⑥,费曼三问讲一遍。
本章小目标学完你要能:说出 AI 编程的三个阶段、为什么工具调用要"能跑能看报错"、SWE-bench 考什么、以及为什么 AI 写的代码必须 review。

① 一句话搞懂:AI 编程的三个台阶

阶段工具代表它干什么人干什么
代码补全Copilot 早期猜你下一行写啥,灰色提示逐行确认、照单全收
对话生成Code Interpreter、Cursor Chat按需求写一个函数/文件,能跑描述需求、复制粘贴
Agentic CodingClaude Code、Cursor Agent自己读仓库、改多文件、跑测试修错下指令、审代码、兜底
核心直觉台阶越高,AI 越像"能独立干活的初级工程师",人越像"提需求 + 做 code review 的 tech lead"。

② 关键概念表

名词大白话
工具调用 / 跑命令AI 不只写代码,还真的运行、看报错、继续改
仓库上下文把整个代码库喂给它,让它懂项目结构和约定
SWE-bench业界公认的"修真实 GitHub bug"能力考试
代码理解 + 生成先读懂别人写的,再在其上改,而不是从零造

Agentic Coding 是怎么跑通一个 bug 的

你说"登录接口偶发 500"。它会:自己搜相关文件 → 读懂调用链 → 定位可疑代码 → 改一版 → 跑测试 → 看红了再改,循环到测试通过。这正是上一章讲的 ReAct 循环在编程场景的落地。

③ 三个例子

例 1 · Copilot 补全
你写 def is_prime(n):
它根据上下文猜你要写判断质数的循环,弹出灰色建议,你按 Tab 接受。人主导,AI 打下手。
例 2 · Code Interpreter 跑一段数据处理
"帮我把这个 CSV 按月统计销售额并画图"。
AI 直接在沙箱里写 pandas 代码、真运行、把出错信息读进来再修,最后给你图和结论。它会自己调试。
例 3 · Claude Code 跨文件重构
"把所有用 fetch 的地方统一换成 axios"。
它自己 grep 出全部 30 处、逐个改、跑类型检查、把失败的再修一遍。人只下一句话指令。

④ 防坑提醒

坑 1:AI 写的代码不审就上线它会写出"能跑但有 bug、不安全、性能差"的代码。AI 生成 ≠ 正确,必须过测试和 code review。
坑 2:把 Agentic Coding 当成全自动它长链路会跑偏、会删错文件、会引入安全漏洞。给它权限要克制,重要操作先确认。
坑 3:忽视 SWE-bench 不等于生产可用榜单分数高,只代表在那类公开题上强;你公司的内部工程约定、遗留代码、隐私边界,它照样要靠你引导。

⑤ 折叠自测(点开即答)

基础1Copilot 补全和 Claude Code 的本质区别是什么?
补全是猜下一行、人主导;Claude Code 这类 Agentic Coding 是自己读仓库、改多文件、跑测试修错,人只提需求和验收。
中档2为什么 AI 编程工具要"能跑命令、看报错"?
因为只写不跑就不知道对错。能真实运行并读反馈,它才能像人一样"写错了→看报错→再改",形成闭环。
拔高3SWE-bench 是干什么的?为什么分数高不等于生产无忧?
SWE-bench 是用真实 GitHub issue 修 bug来考模型,是业界硬指标。但它只覆盖公开常见题;内部约定、遗留系统、安全与隐私边界仍需人工把关。

⑥ 费曼三问(合上讲,自己讲给自己听)

用大白话回答,讲不顺就是没懂
问 1:AI 编程从"补全一行"到"自己改整个仓库",中间多了哪两个关键能力?
问 2:为什么 AI 写的代码你必须自己 review,不能直接上线?
问 3:为什么说人在 AI 编程时代更像 tech lead 而不是打字员?
三台阶:补全一行 / 对话生成 / Agentic 改仓库 Copilot→Cursor→Claude Code
工具调用:写代码还能真跑、看报错再改 闭环
仓库上下文:喂整个项目,懂结构约定 全局视野
SWE-bench:真实修 bug 的能力考 硬指标
人角色:提需求 + 审代码 + 兜底 tech lead

🛠 实战场景:怎么用才不翻车

做法建议原因
让它写一个独立小函数放心用隔离、好测
让它跨文件重构给权限+人审影响面大,要 review
让它直接动生产数据库禁止不可逆,风险太高
让它改完跑测试鼓励用测试结果兜底
重要操作前加人工确认必须删错文件/发错请求代价大

经验法则:沙箱里放开跑,动真格前先确认,每一次生成都过测试和 code review。

🧪 生活联想

1实习生
Copilot 像旁边提示你"下一句写啥"的实习生。
2初级工程师
Claude Code 像能独立领任务、改文件、跑测试的初级。
3Tech Lead
你的角色变成提需求、审代码、兜底。
对照自己用 AI 写代码后,先看它改了哪些文件、跑没跑测试,别直接合并到主干。

📖 名词速查

名词大白话
Copilot早期代码补全,猜下一行
CursorAI 原生编辑器,对话式写代码
Claude Code命令行 Agent,自己读仓库改多文件
Code Interpreter在沙箱里真跑代码、看结果
Agentic Coding自己规划、改文件、跑测试修错
SWE-bench真实 GitHub 修 bug 的能力考

⚡ 高频 FAQ

问:AI 写的代码能直接上线吗?不能。它会引入 bug、安全漏洞和坏性能,必须过测试和 code review。
问:Agentic Coding 会自己删错文件吗?会。长链路有风险,给它权限要克制,重要操作先确认、用版本控制兜底。
问:SWE-bench 第一就代表生产无忧吗?不。它只测公开常见题,内部约定和隐私边界仍需人工把关。

🔁 5 天复习计划

天任务自检
第 1 天读①②,理清三个台阶说清 Copilot vs Claude Code
第 2 天读③④,跟一遍三个例子讲清工具调用闭环
第 3 天做⑤折叠自测三题全对
第 4 天读⑥费曼三问,不看资料讲能举例
第 5 天名词速查 + 口诀默写脱稿说清 SWE-bench 意义
三句口诀① 从补全一行到自己改仓库;② 能跑能看报错才形成闭环;③ AI 写的代码必须 review。

📌 知识链路

前置知识先懂大模型能写代码、会工具调用(Agent 那一课),再看它怎么在工程里闭环。
本节位置AI 能力在编程场景的落地:从对话到自主改仓库。
下一步接着看世界模型,理解 AI 怎么开始"预测物理世界"。
← 上一章 · 长上下文 返回 AI 基础总览