当 AI 开始造 AI:一篇被误读的文章,和一条叫「瓶颈搬家」的暗线
这篇文档干嘛的:Anthropic 那篇《When AI builds itself》原文很长、数字很唬人。我把它压成一条主线——它讲的其实不是「AI 快能自己造自己了」,而是「每自动化一步,瓶颈就往上游搬一格」。读完你能用三分钟给外行讲清:文章说了什么、哪里最硬、哪里不敢说满,以及它对做 Agent 的人意味着什么。
一、先从一句让人后背发凉的话说起
一个 Anthropic 工程师说,他已经差不多五个月没亲手写过一行代码了。另一个说得更直接:顺的时候,我觉得自己做的一切都无所谓,反正机器又快又好;可一旦哪天全崩了,我根本不知道哪里错了,才惊觉我早就不知道自己这几个月到底在干嘛。这两句话出自文章里引用的内部讨论[When AI builds itself]。
先别急着下判断。讲个老故事。
上世纪 70 年代,ATM 走进银行,所有人都断定柜员这个岗位要完了。结果呢——柜员非但没少,反而在随后三十年里越来越多。经济学家 James Bessen 后来把这事讲透了:ATM 把「每个网点数钞票」的成本压到很低,银行于是疯狂开分行;每家分行需要的柜员变少了,可分行数量暴涨,柜员总数不降反升。只是他们的活,从「数钱」变成了「卖理财、维护关系」。
一句话钉住这个故事:机器没有消灭柜员,它只是把柜员的瓶颈,从手指搬到了嘴皮子。
记住这个画面。Anthropic 这篇文章,通篇讲的其实是同一件事,只不过换了个更吓人的皮肤。
二、先把文章讲透:它到底在说什么
核心命题只有一句:人类正在把「造 AI」这件事,一步步交给 AI 自己干;顺着这条曲线走到头,就是一个能全自主设计、并训练出下一代自己的系统——这叫递归自我改进(recursive self-improvement,RSI)。文章反复给自己踩刹车:还没到,也未必会到,但它可能来得比大多数机构准备好的时间要早[When AI builds itself]。
它用两层证据来撑这个判断。
第一层:外面能验证的(公开基准)
模型能可靠独立完成的任务「时长」,大约每 4 个月翻一倍,而早先的趋势是 7 个月才翻倍。Opus 3(2024 年 3 月)能干人类约 4 分钟的活;一年后 Sonnet 3.7 能干 1.5 小时的活;再一年,Opus 4.6 能扛 12 小时的活[When AI builds itself]。
难理解点在哪? 横轴那个「时长」,不是模型自己跑了多久,而是「同样一件事,人类要花多久」。 💭 费曼比喻:就像你评价一个下属,不看他今天加班了几小时,而是看你敢把多长的活整个甩给他、还不用回头盯着——从「帮我查条资料」(几分钟),到「你出差这两周,把整个项目扛下来」(几周)。模型能被托付的活越来越长,这条线才是真正吓人的地方。
基准测试也是一个节奏。SWE-bench(给模型一个真实开源仓库和一个真实 bug,让它写补丁并通过项目自己的测试)两年内从个位数分蹿到接近满分;CORE-Bench(能不能复现一篇已发表论文的结果)从 2024 年的约 20% 成功率,到 15 个月后基本刷满[When AI builds itself]。
第二层:外面看不到的(Anthropic 内部数据)
- 截至 2026 年 5 月,merge 进代码库的代码里,80% 以上由 Claude 写;而 Claude Code 在 2025 年 2 月发布前,这个数字还是个位数[When AI builds itself]。
- 人均每天 merge 的代码量,2021 到 2024 这四年基本持平,2025 年开始爬坡(Claude 能「跑」代码而不只是「建议」),2026 年再次陡增(模型能长时程自主干活)。2026 年第二季度,人均是 2024 年的 8 倍[When AI builds itself]。
- 2026 年 4 月,Claude 修了 800 多个 bug,把某一类 API 错误压低了一千倍;负责的工程师估计,靠人得干四年[When AI builds itself]。
- 研究侧:同一个「把训练代码改到尽量快」的任务,人类熟手 4 到 8 小时能提速 4 倍;Claude 从 2025 年 5 月的约 3 倍,涨到 2026 年 4 月的约 52 倍[When AI builds itself]。
最刺眼的一个数字,来自一个开放式 AI 安全研究项目:两名人类研究员干一周,只补上了 23% 的差距;而一群 agent 用 800 个累计小时、约 1.8 万美元算力,补上了 97%[When AI builds itself]。
难理解点在哪? 「23% 对 97%」的那个「差距」是啥? 💭 费曼比喻:想象一个差生和一个尖子生。「地板」是差生自己能考的分,「天花板」是尖子生开卷抄标准答案能考的分。这个实验问的是:一个弱模型当「监考老师」,能不能把强模型从地板拉到天花板?人类研究员一周只拉上去 23%,agent 群体拉上去 97%——但要命的是,题目还是人出的,评分标准也是人定的。agent 只是在这个框里,把每一个实验都自己设计了。
三、这篇文章真正的暗线:不是「变快」,是「瓶颈搬家」
如果你只记住那些倍数——8 倍、52 倍、97%——你就被这篇文章带偏了。因为它自己都承认:代码行数是烂指标,8 倍几乎肯定夸大了真实提效;4 倍的主观产出可能被高估(它甚至引了 METR 一篇研究,说开发者会系统性地高估 AI 给自己的提速);52 倍强依赖初始代码有多烂,不能当真实训练加速读[When AI builds itself]。
一篇文章把自己的核心数字挨个拆台,却还是敢下结论,说明它真正的证据不在数字里。那证据是什么?
一件事被自动化的最硬证据,不是它变快了,而是它不再是瓶颈了。
文章里藏了一条比所有倍数都更有说服力的线:当写代码几乎不占人类时间了,新的瓶颈立刻冒出来——人类的 code review 跟不上生成速度了;想法、工具、实验多到没人力去 pursue 了。Anthropic 给这个现象起了个名字,叫 Amdahl 定律。
难理解点在哪? Amdahl 定律听着像天书,其实是句大白话。 💭 费曼比喻:一条流水线,五道工序。你把第一道工序的机器换成十倍速的,整条线的产量会翻十倍吗?不会。产量卡在最慢那道工序上。你把第一道提速,活就堆在第二道门口。**提速不消灭瓶颈,它只是把瓶颈往后推一格。**这就是第一节那个 ATM 故事的数学版本:数钞票不再是瓶颈了,卖理财成了新瓶颈。
所以这篇文章表面在炫「我们多快」,底层在焦虑「瓶颈又搬到哪了」。它先把「写代码」这道工序打穿,瓶颈搬到了「审代码」;可以预见,等审代码也自动化了,瓶颈会搬到「决定审哪个、做哪个」——也就是它反复点名的那个词:research taste,研究品味。这条搬家路线,才是整篇文章的骨架。倍数是烟雾,瓶颈搬家是弹道。
四、文章最狡猾的一手:把「能不能」偷换成「早晚」
文章承认,人类今天还守着一块 AI 攻不下的阵地:判断做什么值得做——选哪个问题、信哪个结果、什么时候该掉头。这就是「今天的 AI」和「能自造继任者的 AI」之间那道真正的鸿沟。
问题来了:这道鸿沟,是 scale 一下就能填的「时间问题」,还是架构变天才能填的「能不能问题」?这是全文最关键的岔路口。而文章在这里做了一个极其漂亮、也极其可疑的动作。
它先搬出爱迪生那句老话:天才是 1% 灵感加 99% 汗水。然后它说——汗水正在被自动化。AI 的进步从来极少靠灵光一现(Transformer、专家混合模型这种范式级点子,好几年才蹦一个);中间绝大多数进展,是「放大一点→看哪崩了→修→再来」的苦力活,而这恰恰是 Claude 最擅长的循环[When AI builds itself]。
**这里要瞪大眼睛。**它没有证明「品味可以被自动化」,它是绕过了这个问题。它给了两条路,让你无论走哪条都得认它的结论——
- 保守读法:就算 Claude 永远学不会品味,只要人类把时间都花在那单数字百分比的「定方向」上,其余全交给 AI,那每个人也在指挥比以前多得多的活——照样是复利加速。
- 激进读法:今天已经能看到 Claude 研究判断力在爬升的早期迹象(11 月 Opus 4.5 在特定场景压过人类选择 51%,到 4 月的 Mythos Preview 涨到 64%),品味可能只是「又一个 AI 先不会、后来突然会」的能力,就像它当年学会解释笑话为什么好笑一样[When AI builds itself]。
你看出这个结构的狠处了吗?它把一个真正的不确定性(品味到底能不能规模化),包装成了一个对结论无关紧要的细节:能,则全自动递归;不能,则复利加速。两头都通向「加速」,唯独没留「不加速」这条路。
可我恰恰认为,品味是整件事里最要命的那个变量,不是可以两头下注的边角料。如果它不可规模化,那所谓的递归自我改进就永远差最后一口气——系统再快,也只是个超神的执行器,不是能自己造自己的东西。执行器和造物主之间,隔的不是速度,是判断力。文章用一句爱迪生名言,把这道鸿沟轻轻抹平了。这是修辞,不是证明。
五、还得追问一句:这些数据,谁在说、怎么量的?
文章开篇就标榜「previously unreported data from within Anthropic」——内部未公开数据。这四个字既是它的力量,也是它的软肋。
判定一个 session「成功」,用的是 Claude judge;判定「下一步谁的选择更好」,用的也是 Claude judge。用被评估的同类系统当裁判,天然存在系统性偏差——这就像让考生自己批卷,哪怕他很诚实,他对「什么算好答案」的理解,本身就是被考的那套标准塑造的。
**公道地说,文章的诚实是真诚实。**它自己补了一个对照实验:在「人类本来就选得很好」的 127 个样本上,模型只被判赢约 20%(而在「人类有改进空间」的样本上是 51%→64%)。这个补丁做得漂亮,等于承认了「我挑的是人类表现不佳的时刻,不是公平对决」[When AI builds itself]。
但补丁改不了「自证」的底色。这类文章的价值,在于方向和趋势,不在于某个具体数字。你可以信「它在加速」,但不必信「就是 8 倍」。把趋势当罗盘,把数字当广告——这是读任何一家 AI 公司自我报告时的基本姿势。
六、前面全是铺垫,这才是落点:它想让你支持什么?
读一篇 AI 公司写的「AI 有多强」的长文,永远要问最后一句:它让我相信这个,是为了让我接下来支持什么?
这篇文章的落点,在能力叙事讲完之后才露出来:我们需要一套可验证的全球减速/暂停机制。文章讲得很清醒——单边暂停没用,只会换个领跑者;AI 训练比导弹发射井更难侦测(训练随时能藏,输入又是通用的);偷偷不停下来的诱惑巨大,谁在别人暂停时继续跑,谁就独吞领先[When AI builds itself]。
难理解点在哪? 为什么「暂停」这么难,难到要写一整篇文章来铺垫? 💭 费曼比喻:几家武馆约定同时停止练一门危险的武功。可武功不像盖工厂,盖厂冒烟藏不住,练功关上门谁知道你偷没偷练?而且只要有一家偷偷接着练,等大家重新开打时,它就是唯一的高手。所以「大家一起停」的前提,是每家都能验证别家真停了——冷战时核裁军能做到,是因为导弹发射井拆没拆,卫星能拍到;AI 的「发射井」,拍不到。
把能力叙事和这个诉求接起来看,整篇文章的逻辑就通了:先用大量证据让你相信「这东西正在飞速逼近失控临界」,再告诉你「所以我们需要一个可验证的刹车机制」,最后说「我们正在牵头研究这套机制,欢迎政策制定者、研究者、其他 AI 公司一起来」。前面越吓人,后面这个诉求就越顺理成章。
这不是说它在骗人——它讲的风险大概率是真的,自我踩刹车也做得比同行诚实。但看清「能力焦虑」是为了推出「治理诉求」这条弹道,你才不会读完只剩一句「哇 AI 好快」,而是能接着问:这套刹车,真造得出来吗?由谁来验?谁说了算?这些,才是文章留在门口、没有回答的问题。
七、抛开立场,对做 Agent 的人有什么可搬走的东西
不谈站队,这篇文章里有几块通用的、能搬进日常工作的硬货。
1. 长时程自主性,才是 Agent 的分水岭
文章里那两个能力拐点,一个都不是「答得更准」:第一个拐点是「能自己跑代码,而不只是建议」,第二个是「能长时程自主干活」[When AI builds itself]。这提醒做 Agent 的人:价值不在单次回答多漂亮,而在它能不能在一个循环里自己跑、自己验、自己迭代,而不用人隔两步就接管。一个能独立扛两小时活的 Agent,和一个每五分钟要你确认一次的 Agent,不是量的差别,是物种差别。
2. 评估要盯「人在哪儿被迫出手」,而不是终局分数
文章有个方法论特别值得抄:它评估模型的研究判断力时,不看总分,而是专门去扒那些「研究员中途不得不掉头纠偏的瞬间」,拿这些瞬间当考题[When AI builds itself]。
可迁移的做法:想知道你的 Agent 边界在哪,别盯成功率,去日志里找「人类被迫接管的那一刻」。接管率下降,比成功率上升,更能说明它真的变强了——因为成功率会被简单任务稀释,而接管率直指它扛不住的地方。
3. 系统设计要为「下一个瓶颈」留余地
Amdahl 定律不是理论,是路线图。你把生成做快了,review 就成瓶颈;你把 review 也自动化了,方向判断就成瓶颈。做 Agent 系统时,与其把当前这一环榨到极致,不如提前想清楚:这一环打穿之后,压力会压到哪?——往往为下一个瓶颈提前铺路,比优化眼前这一环回报更高。谁能最快发现并搬走新瓶颈,谁就跑得最久。
4. 「品味」这道坎,做产品的人比做模型的人更该上心
文章把「research taste」当成人类最后的护城河。换到产品语境,这个词就是:知道该做什么、什么结果可信、什么方向是死胡同。模型能不能学会它还两说,但可以确定的是——在它学会之前,谁能把「人的判断」高效地喂进 Agent 的循环里(而不是让人当人肉审核瓶颈),谁的产品就赢在这道坎上。
八、一句话讲完整篇
这篇文章表面在说「AI 快能自己造自己了」,底层在说「每自动化一步,瓶颈就往上游搬一格」;它用一句爱迪生名言把「品味能不能被规模化」这道真鸿沟悄悄抹平,好让能力焦虑顺理成章地推出「我们需要一套可验证的全球刹车」这个真正的诉求——所以读它,要信趋势、疑数字、盯落点。
📋 速查表
| 序号 | 主题 | 难理解点 / 关键 | 难度 |
|---|---|---|---|
| 1 | 时长翻倍 | 横轴是「人类要花多久」,不是模型跑了多久 | 入门 |
| 2 | 80% 代码 / 8 倍产出 | 数字被作者自己拆过台,只能当趋势读 | 入门 |
| 3 | 瓶颈搬家(Amdahl) | 提速不消灭瓶颈,只把它往后推一格——这才是主线 | 进阶 |
| 4 | 品味能否规模化 | 文章用两头下注抹平了这道真鸿沟,是修辞不是证明 | 进阶 |
| 5 | 自证偏差 | Claude 当裁判评 Claude;信趋势别信具体数字 | 进阶 |
| 6 | 治理落点 | 能力焦虑是为了推出「可验证的全球刹车」诉求 | 进阶 |
| 7 | 对 Agent 的启示 | 长时程自主性 / 盯接管率 / 为下个瓶颈铺路 / 把人的判断喂进循环 | 进阶 |
🎯 速记口诀
信趋势、疑数字、盯落点。 想懂它在说什么,看第二节;想看穿它的暗线,看第三节;想不被它带节奏,看第四、五、六节;想搬点东西回工位,看第七节。