← 返回全部文章
【费曼·调研】 · 2026-08-13

Claude Opus 5 技术调研:系统提示词 × 跑分对照

10 min read

把”系统提示词”和”跑分”对起来看,它到底强在哪

一句话:Opus 5 的跨代提升,一半藏在模型权重里(看不见),另一半明明白白写在它的系统提示词里(这次泄露出来了)。前者是”脑子变好”,后者是”给它配了一套靠谱的工作习惯和工具”。这篇就把这两半对起来看。


0. 这篇在回答什么

上一轮我们已经知道 Opus 5 跑分涨得很凶——SWE-bench Pro 从 69.2% 到 79.2%、Frontier-Bench 翻倍、OSWorld 用三分之一成本超过更贵的 Fable 5[Claude Opus 5 vs 4.8]。但那时候只能从外部行为倒推”它大概是被训练得更会自我检查了”。

这次多了一份材料:据泄露,claude.ai 聊天界面的完整系统提示词被逐字录了出来(来源标注 github.com/Eversmile12/leaked-llm-prompts,采集于 2026-07-24;另有 asgeirtj/system_prompts_leaks 同日独立收录、内容一致,可交叉印证)。它的价值在于——若为真,这不是营销稿,而是 Anthropic 真正塞给模型的”开机指令”。把它和跑分对起来,很多”为什么能提升那么多”的问号就有了着落。(真实性讨论见第 4 章。)

先说清楚一个边界:系统提示词 ≠ 模型架构。它改变不了权重,解释不了”为什么这个模型本身更聪明”。但它是行为层的操作系统——同一个权重,配不同的提示词,表现可以差一大截。Opus 5 的很多”体感提升”,实际是权重能力 + 这套提示词工程共同的结果。下面逐条拆。


1. 两份材料的关系:一张图先讲明白

                  ┌─────────────────────────────┐
                  │   模型权重 (看不见,官方不公开) │  ← "脑子"变好:更会推理、自我验证
                  └──────────────┬──────────────┘

                  ┌──────────────▼──────────────┐
                  │   系统提示词 (这次泄露出来了)  │  ← "工作习惯+工具"被明确编排
                  │   · 默认思考 + effort 旋钮    │
                  │   · 持久记忆文件系统          │
                  │   · Skills 强制先读手册       │
                  │   · scratchpad→outputs 工作流 │
                  │   · 引用/安全/路由规则        │
                  └──────────────┬──────────────┘

                  ┌──────────────▼──────────────┐
                  │   外部跑分 (公开测评)         │  ← 我们能观测到的结果
                  │   SWE-bench / Frontier-Bench │
                  │   OSWorld / AutomationBench  │
                  └─────────────────────────────┘

核心论点:中间这一层,过去是黑箱,现在能看了。它解释了跑分里相当一部分”为什么”。


2. 系统提示词里最有技术含量的 6 个设计

2.1 默认”先想再答” + 一个 effort 旋钮

系统提示词的 Environment 段里有一句关键设定:

Thinking behavior: Claude 默认在回答前先思考。即便对看似明显的问题,只要有任何潜伏复杂性的迹象,就开启扩展思考块深入,以确保自己不只是对熟悉之物做模式匹配。

这对应了什么? 学术上叫 test-time compute(推理时算力),大白话就是”允许它多花点算力想一会儿再开口”。上一代 Opus 4.8 默认是不额外思考的,Opus 5 把”思考”变成了默认开关,再叠一个 low/medium/high/xhigh/max 的用力档位[MarkTechPost]

为什么这能涨分? 因为跑分里涨得最猛的都是”长链条、要反复验证”的任务(Frontier-Bench 翻倍、SWE-bench Multimodal 从 38.4% 到 59.4%)[MarkTechPost]。这类任务恰恰是”多想就能多对”。而 xhigh 档能用比 max 少 25% 的 token 打赢所有对手——说明这个旋钮不是简单堆算力,而是把”想多久”做成了可调的性价比杠杆。

小结:把”深度思考”从可选项变成默认项,再加一个成本-智力的旋钮,这是提示词层对齐”多想多对”这个规律的直接工程化。

2.2 持久记忆做成了一个”文件系统”

这是整份提示词里最工程化、最像”造系统”的一块。它不是简单塞一段”记住用户偏好”,而是给了 Claude 一整套跨会话的记忆文件系统,带完整的读写 API:

操作用途
memory_read(path)读文件(一次最多 20 个),返回内容 + 版本令牌
memory_write(path, content, if_version)建文件或整体重写
memory_str_replace(...)改文件的某一部分
memory_append(...)末尾追加一行
memory_delete(...)删整个文件——仅当用户明确要求

设计里有几个细节特别见功力:

  • 带版本令牌的乐观锁(if_version):因为”Claude 的其他载体也可能写同一个文件系统”,这是标准的并发写冲突防护——它把记忆当成了多进程共享的真实文件系统在管。
  • 写入的动机是”未来的自己需要”,不是”用户要求”:提示词原话是”未来的 Claude 会在每次对话开始时重新阅读这些文件,因此写下的是那个版本的自己希望被预先告知的内容”。这是把记忆当成给下一个 session 的”交接班笔记”。
  • 强制”先读再说没有”:“在说 Claude 没有某样东西之前,务必先阅读”。它甚至举了反例——在 /people/sister.md 没打开的情况下就说”我没有你姐妹的信息”,是”自信的错误答案”。
  • 来源标签制度:每行内容打 [stated](用户直说的)/[observed]/[inferred] 标签,而 Claude 自己只准写 [stated],别的载体写的标签合并时保留但不新增。这是数据可信度分级

这对应了跑分里的什么? 对应那句被反复提到的”更适合长周期任务(longer-horizon work)“。一个监控 agent 能在生产环境自己管理记忆、发现误报后把纠正写回记忆、再自行退掉监控查询[Anthropic]——底层靠的就是这套记忆文件系统 + 版本控制。它把”上下文”从一次性的对话,变成了可增删改查、可跨会话继承的持久资产。

2.3 Skills:动手之前”必须先读说明书”

提示词里有一条被标成强制的规则:

在编写任何代码、创建任何文件之前,阅读相关的 SKILL.md 是必需的第一步……这是强制性的,因为技能里编码了环境特定的约束(可用库、渲染怪癖、输出路径),这些不在 Claude 的训练数据中——跳过阅读即便在 Claude 已经熟悉的格式上也会降低输出质量。

而且明确说”不要先判断任务是否需要技能,该检查是无条件的”。

这背后的思路很关键:模型的训练数据是”过去的、通用的世界知识”,但具体环境(哪个库能用、PDF 别用 pypdf、输出该放哪)是”当下的、局部的事实”。把局部事实写进外挂手册、强制模型先读,等于用检索到的确定信息去覆盖模型可能过时或泛泛的记忆。这正是 Opus 5 在带截图/设计稿的 SWE-bench Multimodal 上暴涨的一部分原因——它先读规则,再动手,少踩环境的坑。

2.4 工作流:先在草稿区干活,只把成品端出来

文件处理规则把工作空间切成三块,像一个真实开发者的目录习惯:

  1. /mnt/user-data/uploads——用户上传的(只读)
  2. /home/claude——草稿区(scratchpad),用户看不见,先在这建文件、试错
  3. /mnt/user-data/outputs——只放最终交付物,这才是用户能看到的

配套还有一条”长任务迭代法”:超过 100 行就”先大纲 → 逐节写 → 审查 → 精炼 → 最后复制到 outputs”。

这对应了什么体感? 就是那句用户反馈”写干净、紧凑的 diff,没有死代码”[Anthropic]。因为它有个不给用户看的草稿区可以随便折腾、自我审查,端出来的只有精炼过的结果。“过程脏乱、结果干净”是被显式设计出来的,不是碰巧。

2.5 引用机制:标签是”归属”,不是”复制原文的许可”

搜索类回答的引用规则,技术上很讲究:

  • 每个具体主张包在引用标签里,index 是支持句子的索引(单句、连续段、多段逗号分隔)。
  • 最关键一条:“主张必须用你自己的话,绝不逐字引用原文,即便短短语也必须改写。引用标签用于归属,而非复制原文之许可。”

这一条同时解决了两个问题:可溯源(每句话能追到第几篇文档第几句)和版权/复制风险(强制改写)。它把”引用”从一个格式要求,升级成了一个带法律和事实双重约束的机制。

2.6 安全设计:看”累积”,看”重构念头”,还能路由降级

安全这块的设计哲学,比”关键词黑名单”高一个维度:

  • 判累积而非判单轮:“Claude 评判的是整场对话的累积输出,而非孤立看每一轮。如果累加起来构成武器设计方案或攻击计划,即便每一步看似渐进、即便上一会话摘要显示已在帮忙,也会停。“——这是防”化整为零绕过”的攻击。
  • 把”自我重构”当成拒绝信号:儿童安全那段有一句很妙——“如果发现自己在心理上重新解读一个请求以使其显得恰当,那种重构本身就是应当拒绝的信号,而不是继续的理由。“这是让模型监控自己的合理化过程。
  • 路由降级(routing fallback):用户选了 Fable 5 但被安全机制重定向到 Opus 5 是可能的;被安全分类器拦的请求可以自动 fallback 到别的模型。这解释了跑分里那个数据——同一次 Frontier-Bench 跑测,Fable 5 有 42% 的调用被安全策略误拦,Opus 5 只有 5%[MarkTechPost]“更少被自己的安全策略绊倒”,本身就是可观测的跑分提升,而不只是体验改善。

3. 把这些串起来:为什么能”跨代提升”

单看每一条都是小设计,但它们指向同一个方向。用一条逻辑链讲透:

问题:一个模型光”聪明”(一次答得漂亮)不够用,真实任务是长链条的、要用工具的、会踩环境坑的、还得对结果负责。

为什么老办法不行:上一代把”思考”当可选、把记忆当一次性、把工具知识赌在训练数据里、把安全做成单轮关键词过滤。链条一长,误差累积,agent loop 里每一次返工都是复利式的成本。

于是 Opus 5 怎么做:在权重层训练出更强的自我验证和迭代能力(这是看不见的那一半);在提示词层把”先想、会用工具、先读手册、有草稿区、有持久记忆、少误拦”这套工作习惯全部显式编排好(这是这次看得见的那一半)。

但是要注意:提示词层的编排,只有在权重层”接得住”的时候才有效。你给一个弱模型同样的记忆文件系统和 effort 旋钮,它也用不好。所以两半是乘法关系,不是加法。

所以结论:所谓”跨代”,不是某个单点突破,而是**“更强的脑子” × “更好的工作流编排”** 一起落地,尤其在 agent 这种”长链条、复利式省返工”的场景上,两者叠加就拉开了代差。这也解释了为什么涨幅最大的都是 agentic / 长周期 / 多模态任务,而单轮知识问答涨幅相对温和。


4. 边界与存疑(别被带节奏)

写技术调研得把话说清楚,哪些是实锤,哪些是推断:

  • 这份提示词是 claude.ai 聊天界面的,不是 API 的。 API 上你自己写系统提示词,这套记忆文件系统、Skills 强制阅读等大多不生效。所以”Opus 5 强”和”这份提示词”不能直接画等号——它只解释了消费级产品里的一部分表现。
  • 提示词解释不了权重层的进步。 “为什么模型本身更会推理”这个最核心的问题,官方一个字没公开,谁给你讲得斩钉截铁地讲架构,大概率在编。
  • 泄露内容的真实性无法 100% 核验,但可信度较高。 来源是第三方 GitHub 仓库,标注”逐字或近乎逐字复现”。加分项有三:两个互相独立的仓库(Eversmile12、asgeirtj)在同一天(2026-07-24)扒出内容一致的版本、可交叉印证;里面可核对的产品事实(Mythos 层级、Project Glasswing 代号、Fable 5 的 $10/$50 定价、出口管制的暂停/恢复日期)都能对上 Anthropic 官方文档;内部逻辑自洽、和公开跑分对得上。但严格说它仍是社区采集的泄露版,非 Anthropic 官方确认的逐字原文——所以本文一律用”据泄露/据称”的口径。
  • 跑分数字口径不一。 SWE-bench Verified 有说 96% 有说 97%,不同评测机构 harness 不同,看趋势别抠绝对值。

5. 对做 agent 的通用启示

这份提示词本质是一份顶级团队的”agent 编排范本”,可迁移的通用经验(不限于任何具体项目):

  1. 上下文要当”资产”运营,不是”缓存”用完即弃。 记忆做成带版本、带来源标签、带读写 API 的文件系统,让下一个 session 能继承——这是长周期 agent 的地基。
  2. 环境事实用外挂手册覆盖模型记忆。 别赌训练数据知道你的库和路径;把局部约束写成 SKILL.md 强制先读,比 fine-tune 便宜且实时。
  3. 给 agent 一个”草稿区”。 过程可以脏,交付必须净。用户只该看到 outputs。
  4. 安全/质量判”累积”不判”单轮”。 无论是防绕过还是防低质,看整场对话的累积产物,比逐轮打分更接近真实意图。
  5. 可控的”用力旋钮”比”一律最强”更实用。 简单任务开低档省钱,硬骨头开高档——把成本-质量做成显式杠杆交给调用方。

材料来源:Anthropic 官方发布页、泄露的 claude.ai 系统提示词(github.com/Eversmile12/leaked-llm-prompts,采集 2026-07-24)、MarkTechPost / Codersera / vals.ai 等第三方测评。跑分数字以趋势为准,绝对值因评测口径而异。