三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

Anthropic 靠 Claude Code 赚了 10 亿,但我更担心 AI 生成代码的质量危机

Anthropic 靠 Claude Code 赚了 10 亿,但我更担心 AI 生成代码的质量危机

上周有个消息在我朋友圈刷了屏:Anthropic 单季度利润突破 10 亿美元,成了全球第一家靠大模型赚到真钱的前沿公司。不是靠 API 调用量,不是靠卖会员——靠的是 Claude Code,那个终端里的编程 Agent。同一周,Bun 项目用 AI 在 11 天内重写了超百万行代码,从 Zig 搬到 Rust,测试通过率 99.8%,官方发推庆祝。评论区却没跟着嗨。有人翻出 CodeRabbit 那篇报告:AI 生成代码的缺陷率是人工的 1.7 倍,开发者信任度从 43% 跌到了 33%。两个新闻放在一起看,就很有意思了——一边是钱在疯狂涌入,一边是代码质量在悄悄塌方。我不是来唱衰的,我自己也在用 Cursor 和 Claude Code 写东西。但有些话,我觉得得有人说清楚。

先说那个 Bun 的案例。11 天、百万行、99.8% 测试通过率——这三个数字放在一起,任何一个工程团队看了都会心跳加速。可仔细想想,"测试通过率"和"代码可靠"从来不是一回事。测试覆盖的是你已知的边界,AI 埋雷的地方往往是你没想到的边界。Bun 那条推文下面,最高赞的评论是:"测试通过不等于代码正确,更不等于可维护。"说这话的人大概踩过类似的坑。我自己也踩过——上个月让 Claude Code 重构一个权限模块,10 分钟改了 12 个文件,diff 看得我直点头,合进去两天后接口全炸了。它把 role 字段从 string 改成 string[],但只修了类型定义和守卫层,没碰下游的数据库查询和前端契约。一个字段,三个地方返回了不一样的结果。这 bug 你靠单元测试是测不出来的,因为每个模块单独测都绿。只有集成到一起跑,才炸。

这事让我一直在想一个问题:AI 编程工具到底在"提升"什么?

从表面看,答案很明确——效率。Cursor 的 Composer 一键改多文件,Claude Code 自己规划自己写自己跑测试,Windsurf 的 Agent 模式也能一口气干完一整套 CRUD。2026 年的数据显示,AI 已经写了全行业 42% 的提交代码。这个数字放在两年前,没人敢信。但同样的数据也说明了另一个事实:96% 的开发者不完全信任 AI 生成的代码,只有 48% 的人会在提交前逐行审查。换句话说,代码在飞快地堆,但看代码的人越来越少了。这不是效率提升,这是效率幻觉——你写得更快了,但改得更慢了。Hacker News 上有个 Stripe 的工程师说得挺扎心:他花 6 小时调试 Copilot 写的一个分布式竞态条件,而那代码他自己手动写只要 2 小时。净亏 4 小时。

C++ 之父 Bjarne Stroustrup 今年直接开炮:AI 生成的代码普遍臃肿、充满幻觉,而且极难维护。他说得不算客气,但你在 PR 里见过 AI 生成的代码就会明白——一个简单的排序逻辑,人类写十几行,AI 能写出四五十行,嵌套四层 if,兜了三层底,变量名还又长又没意义。看起来逻辑是对的,但任何一个老手看了都会皱眉:这代码能跑,但谁敢改?

所以我的判断是:AI 编程工具现在的核心矛盾,不是"能不能写代码",而是"写出来的代码到底归谁管"。Cursor 和 Claude Code 在"写"这个阶段已经好到让人上瘾了——你给个 prompt,它刷刷刷出一堆文件,那个爽感是真的。但代码的 90% 生命周期在写完之后的维护阶段。AI 不维护,它只生产。你让 AI 十分钟搓出来的模块,可能要你花两天去理解它为什么要这么写,再花两天去改它没考虑到的那条边界。METR 今年 2 月的研究也印证了这一点:开发者自我感觉快了 20%,但实际测量中,复杂任务上的净效率提升远没那么乐观。感觉快和真的快,是两码事。

我不是说要回到手写代码的原始时代。我自己的日常工作流里,Cursor 的 Tab 补全和 Claude Code 的 Agent 模式已经是标配了。但用了大半年,我慢慢总结出三条底线,分享出来供你参考。

第一条,AI 最适合干的活是"样板代码、CRUD 逻辑、单元测试骨架"。这些场景里,提效 40%-60% 是真实的,因为代码本身没有什么"架构决策"可言,纯粹是翻译。第二条,涉及架构变更、数据模型设计、跨模块契约的时候,AI 只能当副驾驶,不能当主驾。你让它出初稿可以,但每一行你都得看,而且要看懂。第三条,也是最容易被忽略的——AI 生成的代码需要专门的"质量门禁"。不是传统的 lint 和单元测试就够了,你需要集成测试、契约测试,甚至需要专门的 AI 代码审查工具来跑差异分析。因为 AI 最擅长制造的 bug 不是语法错误,是"看起来对但逻辑不对"的沉默失败。

Claude Code 帮 Anthropic 赚了 10 亿美元,这件事本身是好事——它证明了 AI 编程工具的商业价值,会倒逼更多资源投入这个方向。但商业价值和工程质量之间,天然存在一个张力:资本要的是"快",工程要的是"稳"。如果这个张力不处理好,2026 年的"AI 编程繁荣"可能变成 2027 年的"AI 代码债务危机"。

你觉得呢?你团队里 AI 写的代码,是直接合了,还是加了额外的审查步骤?你踩过最坑的 AI 生成代码 bug 是什么?评论区聊聊,我想听听你们的门槛设在哪。

← 返回列表