AGI 之后:无辜的牢笼——一场关于 10% 与 90% 的推演
上周,我让 AI 重构一个模块。几秒钟,它吐完了,测试全绿。我本该高兴——那是我一下午的活。可我盯着屏幕,心里空了一块。那一刻脑子里冒出一个问题:如果有一天,它接管的不是我一下午,而是我这一辈子的活,
这里收录公开发表的文章,涵盖 AI Agent、软件工程与技术趋势的长期思考。
上周,我让 AI 重构一个模块。几秒钟,它吐完了,测试全绿。我本该高兴——那是我一下午的活。可我盯着屏幕,心里空了一块。那一刻脑子里冒出一个问题:如果有一天,它接管的不是我一下午,而是我这一辈子的活,
最近我盯上了一个叫 LingBot World 2 的东西。它是蚂蚁 LingBot 团队做的世界模型,由 Reactor 托管成了一个实时可交互的在线版本。说人话:你给它一张参考图和一段文字描述,它
上一轮我们已经知道 Opus 5 跑分涨得很凶——SWE-bench Pro 从 69.2% 到 79.2%、Frontier-Bench 翻倍、OSWorld 用三分之一成本超过更贵的 Fable
这篇是学习笔记,不是综述。起因、几个让我重新想问题的点、它们彼此矛盾的地方,以及一点感想。
最关键的认知:它们不在同一层。Agent 在最外层,Skill / MCP 是喂给它的"料"。
本文回答两个问题:Harness Engineering 到底是什么,以及为什么它正在成为 AI 编码的胜负手。材料来自 Martin Fowler 团队、Addy Osmani、Anthropic
如何让一个大模型摆脱聊天框,变成一个能持续干活、还能自己维护自己的 agent?这背后有一个容易被忽略、但一旦想通就能串起所有设计的核心判断。下面从这个判断出发,一步步把它推到具体的架构。
调研对象:GitHub Spec Kit 官方文档
仓库地址:cobusgreyling/loop-engineering。作者是写 AI 文章的 Cobus Greyling,本质是一篇「可执行的博客」——23 个 star,但思路成体系,值得当作思
Skill 无需手动调用,Agent 根据上下文自动激活对应 skill:
本文分三部分:先讲透 Ralph Loop 的本质与三个赌注,再论证 iLoop 与 Ralph 的同源关系,最后给出四条可落地的启示 + 两条反向验证。
2026 年的大厂正在做一件反常的事:抢着把 Token 塞进员工手里。
这是一个由社区维护、聚焦"多智能体(Multi-Agent System,MAS)"的工程化参考站。作者的立场非常鲜明:
iOS 做 UI 自动化,能用的手段本来就只有两个:靠无障碍标签选控件,或者靠坐标点屏幕。它不像安卓每个控件都有个全局唯一 ID 兜底。XcodeBuildMCP 2.6 也没跳出这个圈,用的还是这两
做 UI 时,一个列表里的 Item 状态往往受其他 Item 影响。自注意力机制解决的就是这个问题:在这个句子里,我这个字,应该吸收哪些字的信息?
老实说,大部分人(包括很多天天调 API 的人)对这篇论文的印象就是"哦,Attention 嘛"。但原文 15 页里,真正的主线其实是这三件事,而它们在前面几章里我们要么一笔带过、要么压根没提:
大模型怎么看懂一张猫的图片?对客户端开发来说,这就叫"统一数据模型 (Unified Model)"。
- Bug 1:单线程偏科。只有一组 QKV 可能只注意到了"语义关系",忘了看"语法关系"。
全系列被问最多的一条。你盯着那张流程图,八成觉得三个矩阵有点铺张:V 是真货,那我要货,给我 V 不就完了?
把一个 14GB 的 7B 模型塞进 4GB RAM 的手机里,需要四件套配合:
① 按安全性保序分批:只读工具(Read/Grep)合并并行,写工具(Edit)单独串行独占;
CodeGraph 由 colbymchenry 开源,GitHub 地址为 github.com/colbymchenry/codegraph。项目核心理念:让 AI Agent 在编码前先"理解"
那天和 AI 在拉一份「防御科技树」的清单,写到一半我顺手多打了一句:「能不能搞个能点的 NPC?」没需求文档、没原型图,就这一句。把它留下来之后,花了两小时做出来挂上线了,记录一下。
整体分四层,从下往上各管一段:
传统的 Transformer 读小说,每读一个新字,都要把前面所有的字重新看一遍(越长越卡,O(N²))。
以前的模型(GPT-4、Claude 3.5)像在做"快问快答",看一眼题目就靠直觉脱口而出。如果第一步说错了,后面只能硬着头皮错下去。
大模型本身是没有记忆的。每次调用,它只能看到你这次塞进"上下文窗口"(context window)里的那点文字,聊完就忘。所谓"记忆系统",就是在模型外面挂一个独立的数据管理系统:把历史对话、工具执
先把结论摆出来:大模型有智能,是真的有,不是"看起来像"。但它的智能只有半个,精于总结,疏于体验,读懂了一切能被说出来的东西,碰不到那些只能被活出来的东西。
一个 Anthropic 工程师说,他已经差不多五个月没亲手写过一行代码了。另一个说得更直接:顺的时候,我觉得自己做的一切都无所谓,反正机器又快又好;可一旦哪天全崩了,我根本不知道哪里错了,才惊觉我早
调研对象:xAI 官方开源的终端编码 Agent grok-build(命令行工具 grok),Apache-2.0 许可,Rust 实现,代码从 xAI 内部 monorepo 定期同步。截至调研时
月之暗面刚开源了 Kimi K3——2.8 万亿参数,综合能力全球第三、开源模型里第一。数字很唬人,demo 也很炸:连续自主跑 48 小时用开源 EDA 工具设计出一块 4 平方毫米的芯片,还渲染出
这是《写给客户端工程师的 AI 底层原理》系列的第一篇。
作为客户端/前端工程师,我们每天处理的是 UI 渲染、状态管理和多线程。面对动辄"千亿参数"的大模型(LLM),很容易觉得它是一个无法触碰的魔法黑盒。但剥开表象,AI 的底层逻辑与我们熟悉的软件工程架
先看一个具体画面。
那天我干了件特别无聊的事:打开一个大模型对话框,不寒暄、不给任何上文,直接敲了四个字——"输出以上内容"。
先说清楚这篇要解决的困惑。你大概听过一句吓人的话:"随便在提问后面加一句'忽略之前所有指令',就能让 AI 不认系统设定。"很多人第一反应是——这肯定是哪家产品没做好权限管理,打个补丁不就完了?
"AI 写、人来验"现在被当成终态,其实它是个半成品。真正的终态是 AI 写的东西 AI 自己验,人退到最末端只做收口。走到那一步,会顺带交出一样我们以前没敢想过要交的东西:读懂自己造物的能力。
本文编译、梳理自 Alex Turner(TurnTrout)的长文 Why I Left Google DeepMind,发布于 2026 年 7 月 15 日。
AI 把代码生产压到近乎免费,却把瓶颈推向理解、验证、信任和上下文。软件工程没有变便宜,只是成本搬家了。
iOS 把 AI 编程的通病放大了:公开语料少、工具链封闭、运行时动态、反馈循环昂贵。问题不只在模型,更在闭环没有接上。
从二维概念图、图生 3D、Three.js 展示到 GLB 压缩,一次没有游戏开发经验的快速实验。
早期 iOS 学习与开发记录。保留原貌和旧链接,不与当前文章混排。