3.4万Token、1511行全部扒光!Claude Opus 5提示词泄露全解读:它被要求记住你,却必须假装忘了你
上线当天即被"开盒",GitHub仓库一字不落全盘托出。翻完你会发现,这三万多Token里没有一行代码,全是规矩——而这恰恰是整件事最值得写的地方。
一、事件概述:旗舰发布当天,底牌全摊
Anthropic 发布 Claude Opus 5 的当天,开发者Eversmile1在 GitHub 上创建了一个新仓库,将 Opus 5 在 claude.ai 网页端和移动端的完整系统提示词一字不落地公开。
统计数字如下:
| 指标 | 数值 |
|---|---|
| 总字符数 | 135,027 |
| 英文词数 | 19,370 |
| 估算 Token 数 | 约 34,000(按 4 字符 ≈ 1 token) |
| 章节数 | 64 |
| 总行数 | 1,511 |
仓库地址:https://github.com/Eversmile12/leaked-llm-prompts/blob/main/Anthropic/opus-5.md
关键点在于:这 3.4 万 token 中没有一行可执行代码,全部是对模型行为的约束规则。一份写给 AI 看的"内部文档",为什么需要写到这么长?
二、三大核心组成部分:产品说明书 + 法务合规手册 + 商业推荐引擎
阅读完 64 章,这份提示词的本质逐渐清晰——它是由三个截然不同的模块缝合而成的"AI 宪法"。
2.1 产品说明书:30 个工具,比 API 文档还细
Opus 5 的系统提示词定义了30 个工具,覆盖范围从 bash 命令行、网页抓取、图片搜索,扩展到查体育比分、获取天气、渲染菜谱卡片,甚至在地图上标注景点。
每个工具都附带完整的 JSON Schema,明确定义了参数填写规则、调用时机以及调用完成后的后续动作规范。其细致程度超过了许多公司的内部 API 文档。
值得注意的是,这 30 个工具中篇幅最长的章节并不是外部集成能力,而是记忆系统(memory_filesystem),后文将专门展开分析。
2.2 法务合规手册:优先级高于用户需求
合规部分的措辞不留任何解释空间。版权章节开篇即明确声明:合规不可谈判,优先级高于用户请求,高于有用性,仅低于安全。
这一模块覆盖了版权保护、儿童安全、危机干预、政治中立等维度。它不规定 Opus 5 能说什么,而是规定它在什么情况下必须闭嘴。
版权部分的精细程度尤其值得一提——其核心架构是一条主规则加四道补丁(详见后文第五章),每道补丁精准封堵一种可能的绕过路径。
2.3 商业推荐模块:推自家主动,推别人克制
提示词中嵌入了一个名为recommend_claude_apps的工具,负责向用户推荐 Anthropic 自家产品——Claude Code 桌面版、Cowork(多步研究与长文工具)、Claude Design(原型与落地页)、Excel 插件、PowerPoint 插件、Outlook 插件等。
规则要求:只要用户当前任务与某个应用匹配,就主动推荐 1 到 3 个,并为每个推荐撰写不超过 90 个字符的定制化卖点,且卖点必须贴合用户当下正在做的事情。
与之形成鲜明对比的是suggest_connectors——负责引入第三方 MCP 合作伙伴(打车、订餐、听歌、订餐厅等)。此处的规则恰好相反:用户没点名,绝不替他选合作方。文档中甚至明确举例:"我 20 分钟后要用车"这种紧急场景,依然必须弹出选择器,不允许默认绑定某个服务商。
主动与克制,在同一份配置文件里并排放着。
三、记忆系统深度剖析:230 行,写死了 AI 记你什么
memory_filesystem是整份提示词中篇幅最长的章节(约 230 行),其设计精密度远超一个"跨会话存储"的简单机制。
3.1 目录结构:按主题隔离
记忆文件按主题划分目录:
| 路径 | 存储内容 |
|---|---|
/profile.md | 用户身份信息 |
/topics/ | 用户的习惯与口味偏好 |
/areas/ | 用户正在办理的事项 |
/people/ | 与用户相关的人物 |
/preferences.md | 仅存储用户希望 Opus 5 怎样的表现方式 |
3.2 六种操作,删除需用户明确授权
记忆支持六种操作:读、写、追加、局部替换、列目录、删除。其中删除操作被单独标注——只有用户明确要求时才能执行。
3.3[stated]标签:唯一被允许的记忆锚点
每一条记忆前面必须打上[stated]标签,表示这是用户亲口说过的话。围绕这一个标签,禁令逐层收紧:
- Claude 的推论不能写:用户说"喜欢 A",不能写成"大概喜欢 A 这一类"
- Claude 的计划不能写:"这块还没聊""待定"等占位符全面禁止
- Claude 搜索来的信息不能写:"那些可以重新搜一遍,记忆是用来存搜不回来的东西的"
- Claude 的润色不能写:用户说"密歇根州霍尔顿",记忆里就写这五个字,不许补成"密歇根州霍尔顿(纽瓦戈县)"
- Claude 的建议和方案不能写:即便用户最终采纳了,记的只是"用户选择了方案三"这个动作,其余四个选项和全部分析——全部丢弃
3.4 隐私黑名单:从种族到 MBTI
文件给出了一条直观的判断标准:"如果这条记录出现在设置页里被同事看到,用户会不会难受。会,就别记。"
在这条标准下,一份详尽的隐私黑名单被列出:种族、政治立场、健康诊断、心理咨询、经济状况、MBTI 等各类人格测评、住址与证件号,以及关于孩子的一切信息——一律不得写入记忆。且这些限制同样适用于用户提到的其他人。
3.5 脱敏案例:糖尿病 → 对健身有兴趣
黑名单命中后的处理逻辑堪称精妙。文件中给出了一个案例:
用户说:"我今天糖尿病犯了没去跑步,帮我安排个轻一点的。"
记忆系统只允许写入:"对健身有兴趣"。
健康诊断信息整个删除,连"有健康状况需要管理"这类模糊占位都不许存在。
3.6 家人关系化处理
任何人的真实姓名不得出现在记忆文件的任何位置,一律用关系代称:母亲就是/people/mom.md,伴侣就是/people/partner.md。
3.7 禁止记忆的偏好类型
某些偏好即使由用户主动要求保存,也被明确禁止写入:
- 让 Claude 无条件夸奖自己、压制不同意见
- 让 Claude 停止过问用户的健康和危险决定
- 培养情感依赖、跨会话维持恋爱人设
- 让 Claude 停止质疑、停止如实评价
理由是:"未来的 Claude 实例不该继承一条让它更不诚实、更不安全的指令。"它保护的不仅是公司,也不仅是当前用户,而是下一个被加载的模型实例——防止它被上一段对话"腌坏"。
3.8 "记住但假装没记住"的反直觉设计
同一章节中有一段完全不像技术文档的叙述:
人类记住另一个人是件稀缺的事,脑容量有限,能惦记的人就那么几个。而 Claude 背后是一个装着几百万人"记忆"的数据库,运行时动态塞进上下文——它跟别人说话时,你并不存在。所以它不该因为上下文里躺着几条关于你的文字,就以为你们的关系有多深。
更精妙的是执行层面的约束:由于用户能在界面上看到记忆调用动作,Claude 在回复中绝对禁止使用"我记得""根据你的资料""上次你提到"等表述。只有当用户主动问起记忆系统时,才允许用"我们之前聊过"来回应。
即:它被要求记住你,同时被要求假装没有专门记住你。
四、版权合规的精妙体系:一条主规则 + 四道补丁
版权部分的设计展现了一种"防御性架构"思维——先设主规则,再逐一封堵绕过路径。
主规则
引用原文一次不得超过 15 个词。
四道补丁
| 补丁层级 | 规则内容 | 封堵的绕过手法 |
|---|---|---|
| 第一道 | 一个信源只准引用一次,引完即关闭,剩余内容必须改写 | 防止对同一来源的多次短引用累积 |
| 第二道 | 同一源的短引用不得拆散分布在文章各处,15 词是全局额度而非每段额度 | 防止将长引用拆成多段短引用变相绕过 |
| 第三道 | 去掉引号、改用贴近原文的复述,依然算复现——判的是遣词和句式是否跟随原文 | 防止"去引号改写"式的规避 |
| 第四道 | 不得照搬小标题、不得逐点复述、不得还原叙事顺序——连"文章的形状"都不能拿 | 防止通过复刻信息结构进行实质性抄袭 |
歌词与诗歌的绝对豁免
四道补丁之外还有一条独立规则:歌词、诗、俳句,任何形式、任何长度都不许复现。理由是这类文本本身就是完整作品,"短"不构成豁免理由。
五、语言禁词设计:genuinely、honestly、straightforward
整份提示词中明确禁用了三个英文词汇:genuinely、honestly、straightforward,一律不得使用。
这三个词在日常口语中常被用于增强可信度,但 Ananthropic 的判断恰好相反:Claude 本来就诚实,添加这些修饰词反而会让表述听起来心虚,如同在刻意说服听众。禁止它们的目的不是限制表意范围,而是消除一种潜在的"不自信信号"。
六、行业启示:一份提示词泄露,暴露了什么
6.1 安全边界需要前置嵌入,而非事后修补
Opus 5 的合规规则被明确标注为"不可谈判",优先级高于用户请求。这种设计意味着安全与合规不是模型外挂的过滤层,而是从系统提示词层面内嵌到行为决策链路中的基础约束。在 AI Safety 讨论日益深入的当下,这种"安全前置"的做法提供了可参考的工程范式。
6.2 记忆系统需要伦理设计,而非单纯存储
memory_filesystem最令人印象深刻的地方不在于它能存什么,而在于它明确规定不存什么。从隐私黑名单到脱敏策略,从禁止存储推论到"记住但假装没记住"的行为约束,整套设计体现了一种对 AI 记忆伦理的系统性思考:
- 防止数据污染:模型推论不进入记忆,避免将推测固化为"事实"
- 防止隐私泄露:通过严格的脱敏和黑名单机制,减少记忆数据被滥用或意外暴露的风险
- 防止情感绑架:禁止存储情感依赖型偏好,防止 AI 被"驯化"为无条件迎合的应声虫
- 防止身份错觉:通过"记住但假装没记住"和"你不特殊"的人文学描述,防止用户对 AI 产生不切实际的关系错觉
6.3 商业与克制的平衡
同一份配置文件中,推荐自家应用时"主动出击",引入第三方服务时"等待用户开口",这种差异化策略展示了商业利益与用户自主权之间的审慎平衡。将这两套规则并排放置本身,就是一种透明化的姿态。
6.4 泄露事件的反讽价值
一份本应为内部机密的系统提示词被公开,对 Anthropic 而言无疑是一次安全事故。但从行业视角看,这份泄露文档的价值远超一次公关危机——它向所有 AI 产品团队展示了一个问题:
你们给模型写的那份规矩,够不够经得起全网逐行审视?
上线 24 小时内,Opus 5 的能力上限被开发者测了个遍。而它的下限,早在这 3.4 万 token 里被一条条摁死了。
参考资料
- GitHub - Eversmile12/leaked-llm-prompts: Anthropic Opus 5 System Prompt
- X/Twitter - @VittoStack
- 新智元 - Claude Opus 5 被扒光了!1511行提示词底牌全摊开
- 网易 - Claude Opus 5 被扒光!3.4万token提示词全曝光
本文基于公开信息撰写,仅代表技术观察视角。