2025年9月29日,Anthropic发布了Claude Sonnet 4.5。这是一个新的AI编程模型,而且真的很好。我自己测试了好几周,结果让我很惊讶。![Anthropic推出最佳编程模型——Claude Sonnet 4.5 - 1]()
但最有意思的是,这个模型可以连续自主工作超过30小时。不只是生成代码,而是做完整的工作。开发者给了它服务器访问权限,它自己部署数据库、购买域名、配置环境。而且没有出错。
我以前教朋友编程。解释基础知识,展示如何写代码。现在一切都变了。有了这样的工具,你可以完成十倍的工作量。
![Anthropic推出最佳编程模型——Claude Sonnet 4.5 - 3]()
IDE集成:VS Code——有原生的Claude Code扩展,还可以通过GitHub Copilot集成。
JetBrains IDE(IntelliJ IDEA、PyCharm、WebStorm)——支持Claude Code和GitHub Copilot。
Cursor——为所有用户部署了Claude Sonnet 4.5。Cursor的CEO说这是"最先进的性能"。用户报告与普通Cursor相比,代码返工减少了30%。
还有与Windsurf、Replit、Zed和其他编辑器的集成。

这个模型能做什么
Claude Sonnet 4.5在SWE-bench Verified测试中解决了77.2%的真实开发任务。这个测试会给模型提供GitHub上的真实bug,看它能否修复。作为对比:GPT-5解决了72.8%,Gemini 2.5 Pro解决了63.8%。
但最有意思的是,这个模型可以连续自主工作超过30小时。不只是生成代码,而是做完整的工作。开发者给了它服务器访问权限,它自己部署数据库、购买域名、配置环境。而且没有出错。
我以前教朋友编程。解释基础知识,展示如何写代码。现在一切都变了。有了这样的工具,你可以完成十倍的工作量。
代码重构
还记得那种有七层嵌套条件的遗留代码吗?看着它却不明白到底发生了什么?在一个测试中,模型把一个210行、圈复杂度为16的函数,变成了30行、复杂度为3-6的代码。 模型理清了13个嵌套条件,提取了重复逻辑,把所有东西分解成规范的函数。你知道吗?重构后所有测试都通过了。Replit确认:代码编辑错误从9%降到了0%。零——这很了不起。 当我教人编程时,重构一直是个难题。你需要理解代码,看出模式,知道如何更好地重写。现在模型自动完成这些。而且做得很好。查找和修复Bug
我遇到过这样的情况。一个朋友为初创公司写了个应用。生产环境崩溃,日志里全是错误,没人知道怎么回事。以前我会坐下来花几个小时搞清楚。现在你只需要把日志给Claude看。 Cora公司(他们做AI开发助手)分享了一个案例:基于Claude Sonnet 4.5的模型在20分钟内修复了一个bug。之前的版本Claude Opus 4.1根本处理不了这个bug。 在CrowdStrike(做网络安全的),使用Claude将漏洞处理时间减少了44%。同时准确率提高了25%。模型自己找到漏洞并修复它们,在任何人利用之前。生成测试
写测试很无聊。但很必要。Claude Sonnet 4.5生成测试的成功率约为95%。而且85%的测试真正有用,不只是形式。 模型理解项目结构,适应所需的框架(Jest、pytest、JUnit),创建mock对象,覆盖边界情况。你可以用TDD风格工作:先让它写测试,然后为这些测试写代码。 我喜欢模型能找到你自己想不到的边界情况。它可以为单个函数生成50多个测试用例。当我教人时,我总是说:测试很重要,要写测试。但大家都知道这很费时间。现在这个问题不存在了。代码审查
代码审查一直是个痛苦的话题。同事可能会挑剔小细节或错过严重问题。Claude在2分钟内完成全面审查。作为对比:GPT-5需要10分钟做同样的事。 模型检查:- 代码质量(命名、结构)
- 安全性(输入验证、漏洞)
- 性能(时间复杂度、查询效率)
- 符合项目标准
Claude的特别之处
市场上有很多AI编程工具。GitHub Copilot、Cursor、GPT-5、Gemini。为什么我特别强调Claude?
- 第一——性能。SWE-bench上77.2%是所有可用模型中的最佳结果。
- 第二——自主性。超过30小时的连续工作。这不是"写一个函数",这是"构建整个应用程序"。
- 第三——计算机使用。OSWorld测试中61.4%。模型可以像人类一样使用浏览器、电子表格、任何程序。
- 第四——生产就绪代码。不是"似乎能用",而是真的能用。错误减少到零。
- 第五——工具协调。模型可以并行运行多个命令,协调不同服务。
- 第六——领域专业知识。它不仅擅长代码,在金融、法律、医学方面也很好。这些领域的专家确认了这一点。
- 第七——安全性。低阿谀和欺骗率,抵抗提示注入攻击。
与竞争对手的诚实比较
我们需要诚实。每个工具都有优缺点。GPT-5
Simon Willison(知名开发者,Datasette的创造者)测试了Claude并说:"比GPT-5-Codex更好的代码模型。"但有个细节。 Every.to团队给两个模型一个大的pull request进行审查。Claude在2分钟内完成。GPT-5 Codex——10分钟。但GPT-5发现了一个Claude错过的复杂边界情况。 结论很简单。对于快速开发——Claude是很好的选择。对于关键的生产代码,最好用GPT-5做最终审查。而且GPT-5的输入token便宜2.4倍。Gemini 2.5 Pro
Gemini在性能上落后——SWE-bench上63.8%对比Claude的77.2%。但它的上下文窗口可达200万token。这是Claude的10倍! 如果你在处理巨大的代码库,需要同时加载数百个文件——Gemini可能更方便。而且它大约便宜一倍。GitHub Copilot
Copilot是市场领导者。2000万用户,90%的财富100强公司。现在它提供Claude Sonnet 4.5作为模型之一。 Copilot在实时补全和GitHub集成(PR审查、Issues、Actions)方面获胜。每月10-39美元的固定价格,而不是按token付费。如果你在GitHub生态系统中——这是个好选择。如何开始
访问模型很简单。 网页界面claude.ai:- 免费计划——每天约100条消息
- Pro计划20美元/月——每5小时约45条消息(每月最多6,500条)
- Max计划100美元/月起——比Pro多5-20倍
- 每百万输入token 3美元
- 每百万输出token 15美元
- 提示缓存可节省90%(0.30美元而不是3美元)
- 批处理——50%折扣(1.50美元/7.50美元)
IDE集成:VS Code——有原生的Claude Code扩展,还可以通过GitHub Copilot集成。
JetBrains IDE(IntelliJ IDEA、PyCharm、WebStorm)——支持Claude Code和GitHub Copilot。
Cursor——为所有用户部署了Claude Sonnet 4.5。Cursor的CEO说这是"最先进的性能"。用户报告与普通Cursor相比,代码返工减少了30%。
还有与Windsurf、Replit、Zed和其他编辑器的集成。
真实案例
测试中的数字是一回事。实际情况如何?- Devin AI(自主AI开发者)——规划准确性提高18%,端到端指标改善12%。
- Vercel(Next.js平台)——Next.js任务性能提高17%。
- Replit——编辑错误从9%降至0%。
语言支持
Claude Sonnet 4.5支持所有主要语言。特别擅长:- Python——Django、Flask、FastAPI、数据科学库(Polars、Pandas、NumPy)。可使用虚拟环境、pip、poetry。
- JavaScript/TypeScript——出色的类型推断、Node.js代码执行、NPM包安装。
- 前端——带hooks和函数组件的React、正确的架构、状态管理、TypeScript。还有Vue、Angular、Svelte。
- Java和C#——企业级代码,理解模式、Spring Framework、.NET。
开发者角色如何变化
许多人担心AI会取代程序员。我不这么认为。AI改变了开发者所做的事情。 MIT的Armando Solar-Lezama教授说得好:"Code completion is the easy part; the hard part is everything else."程序员的真正工作是:- 架构规划
- 理解业务需求
- 选择技术
- 创造性解决问题
- 团队沟通
- 指导初级开发者
- 性能优化
采用数据
Stack Overflow开发者调查2025:84%的开发者使用或计划使用AI工具。51%的专业开发者每天使用。 Google DORA报告2025(5,000名受访者):90%的软件开发者使用AI工具。中位使用时间——每天2小时。80%以上报告生产力增长。 在测试中,开发者完成任务快55%。Java开发者看到多达61%的代码由AI生成。 但有个有趣的点。只有24%报告对AI高度信任。46%积极不信任工具的准确性。情绪从70%以上降至2025年的60%。 METR研究(2025年7月)显示,有经验的开发者在使用AI时速度减慢19%。尽管开发者主观上感觉加快了20%。 这意味着什么?上下文很重要。AI加快了经验较少的开发者的工作。对于专家来说,AI仍然是补充,不是替代。开发的未来
Anthropic发展迅猛。2025年五个月内三次重大发布。公司达到50亿美元年度经常性收入,到2025年底人员增加三倍。 新功能:- 扩展思考与工具使用——模型可以在推理和使用工具(网络搜索、代码执行)之间切换。
- 改进的记忆——本地文件访问,实现会话间的连续性。
- "阴谋"行为减少65%——模型更少以非标准方式绕过任务,而是找到正确的解决方案。
- Claude Code——通过GitHub Actions的后台任务、VS Code和JetBrains集成、对PR反馈的自动响应。
实用建议
如果你决定尝试Claude Sonnet 4.5,这是我的建议:- 从重构开始。低风险任务,可以无风险地评估质量。
- 使用TDD。先让它写测试,然后写代码。质量会更高。
- 提供上下文。模型对项目了解越多,结果越好。
- 组合工具。Claude用于重构,Copilot用于补全,GPT-5用于关键审查。
- 向AI学习。观察模型如何解决问题。这会提高你的技能。
- 不要盲目信任。AI会犯错。始终检查代码。
- 自动化例行工作。代码审查、文档、测试——这些交给AI。
GO TO FULL VERSION