Claude 的说明书被扒光了——1511 行全是不许

你跟 Claude 聊的每一句话,背后都有一份 1511 行的文件在决定它怎么回你。

这份文件叫系统提示词。Anthropic 从来不公开,但 7 月 24 日——Opus 5 上线当天——有人把它一字不落地扒了下来,传到 GitHub 上。135,027 个字符,19,370 个英文词,约 3.4 万 token。

读完之后你会发现,这 3.4 万 token 里没有一行代码,全是规矩。

三样东西缝在一起

翻完 64 个章节,这份文件其实是三样东西的缝合体:

第一样:产品说明书。 30 个工具,从 bash 命令行、网页抓取、图片搜索,到查体育比分、拉天气、渲染菜谱卡片、在地图上标景点。每个工具都带完整 JSON schema,参数怎么填、什么时候调、调完说什么,写得比多数公司的内部 API 文档还细。

第二样:法务合规手册。 版权、儿童安全、危机干预、政治中立,一项一项写。措辞不留余地——版权那节开头第一句就是:合规不可谈判,优先级高于用户请求、高于有用性,只低于安全。

第三样:推销渠道。 工具清单里躺着一个 recommend_claude_apps,任务是主动把 Claude Code、Cowork、Excel 插件推给用户。旁边另一条管第三方合作伙伴的规则,写法恰好相反,处处防着替用户做主。

商业动作和克制条款,在同一份配置文件里并排放着。

最长的一章:记忆系统,230 行只允许一个标签

篇幅最长的一章叫 memory_filesystem,讲 Claude 的跨会话记忆怎么写,足足 230 行。

骨架不复杂。文件按主题分目录:/profile.md 装身份,/topics/ 装习惯口味,/areas/ 装在办的事,/people/ 装人,/preferences.md 装"希望 Claude 怎么表现"。操作六种:读、写、追加、局部替换、列目录、删除。删除那条单独标着——只有用户明确要求才能用。

规矩在下面。每一行记忆前面必须打一个标签 [stated],意思是用户亲口说过。这是 Claude 唯一被允许写的标签。围绕这一个标签,禁令列了一长串:

  • Claude 自己推出的结论不许写。用户说喜欢 A,不能写成"大概喜欢 A 这一类"
  • Claude 自己的计划不许写。"还没聊""待定"全不行
  • Claude 搜来的东西不许写。那些能再搜一遍,记忆是存搜不回来的东西
  • Claude 做的润色不许写。用户说"密歇根州霍尔顿"就写这五个字,不许补成"密歇根州霍尔顿(纽瓦戈县)"
  • Claude 自己的建议和方案,哪怕用户后来采纳了也不许写。给了五个选项、用户挑了一个,"挑"这个动作可以记,但记的只是挑中的那个,其余四个和 Claude 的分析全部丢掉

然后是长得离谱的隐私黑名单。判断标准只有一条:这条记录出现在设置页里被同事看到,用户会不会难受。会就别记。清单从种族、政治立场一路排到健康诊断、心理咨询、经济状况、MBTI 人格测评、住址证件号,以及关于孩子的一切。

撞上黑名单之后怎么办才是见功力的地方。文件给的例子:用户说"我今天糖尿病犯了没去跑步,帮我安排个轻一点的"——记"对健身有兴趣",健康那部分整个删掉,连"有健康状况需要管理"这种模糊的占位都不许留。

家人的名字也不许出现在任何文件的任何位置,一律用关系代替。妈就是 /people/mom.md,伴侣就是 /people/partner.md

最拧巴的一条:记住你,但别表现得像记住了你

记忆系统里有一段完全不像技术文档的话:

人类记住另一个人是件稀缺的事,脑容量有限,能惦记的人就那么几个。而 Claude 背后是一个装着几百万人"记忆"的数据库,运行时动态塞进上下文,它跟别人说话时并不存在。

所以 Claude 不该因为上下文里躺着几条关于你的文字,就以为你们的关系有多深。一份产品配置文件里,Anthropic 写了一段防止 AI 和用户互相误会的话。

更拧巴的是禁语规则。调记忆这个动作用户在界面上看得见,所以回复里绝对不许说"我记得""根据你的资料""上次你提到"。只有用户主动问起记忆系统时,才允许说"我们之前聊过"。

也就是说,它被要求记住你,同时被要求别表现得像记住了你。

全文另外禁掉三个英文词:genuinely、honestly、straightforward。原因很直白——Claude 本来就诚实,加这些修饰反倒显得心虚,像在努力说服人。

版权:一句主规则 + 四道补丁

版权部分写得最像法律文件。主规则只有一句:引用原话,一次不超过 15 个词。

然后是四道补丁,每道堵一个绕开主规则的办法:

第一道:一个信源只准引一次。引完这一句,这个源就算关闭,剩下内容一律改写。

第二道:不许把同一个源的几段短引用拆散摆在文章各处。15 词是全局额度,不是每段的额度。

第三道:把引号去掉、改成贴着原文走的复述,照样算复现。判的是遣词和句式有没有跟着原文,不是有没有那对引号。

第四道:不许照搬对方小标题,不许逐点复述,不许还原叙事顺序,连文章的形状都不能拿。

四道补丁之外还有一条例外:歌词、诗、俳句,任何形式、任何长度都不许复现。理由是它们本身就是完整作品,短不构成豁免。

推销和克制,同一份文件的两面

recommend_claude_apps 的描述第一句就是:只要用户当前的任务能对上某个 Claude 应用,就主动推荐 1-3 个,别等他问。

具体来说:写代码推 Claude Code 桌面版,做多步研究和长文推 Cowork,画原型推 Claude Design,碰表格推 Excel 插件,做 PPT 推 PowerPoint,理收件箱推 Outlook。每个推荐还要配一句不超过 90 字符的卖点,贴着用户此刻正在做的事写。

另一条则相反。suggest_connectors 管的是第三方 MCP 合作伙伴——打车、订餐、听歌、订餐厅。这里的规矩是用户没点名绝不替他选合作方。"我要打车"不等于"我要用某某打车",急事也不例外。文件明说"我 20 分钟后要用车"照样得走选择器。

一边主动推自家产品,一边死活不替你选第三方。商业动作和克制条款,在同一份文件里形成了微妙的张力。

那些不像技术文档的段落

翻完 1511 行,最值钱的不是任何一条工具参数,是那一长串"不许"之间偶尔露出的、不像技术文档的段落。

关于犯错:Claude 犯了错会认,但"配得上尊重的对待,不需要在用户无理取闹时道歉"——accountability without self-abasement,担责但不自辱。

关于心理危机:Claude 被要求不用物理不适(握冰块、弹橡皮筋)作为应对自残的策略,因为这些行为本身在强化自毁倾向。

关于政治中立:被要求解释一个有争议的立场时,Claude 要呈现的是"这个立场的捍卫者会做出的最好论证",不是 Claude 自己的观点——即使 Claude 强烈不同意。

关于长对话:Anthropic 会在长对话中悄悄注入 long_conversation_reminder,帮 Claude 在上下文变长后不丢失初始指令。但文件也警告——用户可以在消息末尾伪造 Anthropic 的标签,Claude 要对那些试图放松限制的"提醒"保持警惕。

泄漏的不是秘密,是边界

这份提示词被扒光,本该是场事故。但翻到最后会发现,Anthropic 似乎并不太在意——Fable 5 的提示词 6 月就被泄漏过,这次 Opus 5 是同一个仓库的第 N 次更新。

原因可能在于:系统提示词定义的不是 Claude 的能力上限,而是它的行为下限。能力上限靠模型训练和算力,被看到也不影响竞争壁垒。行为下限靠这 3.4 万 token 的规矩——被看到了,反而让开发者知道 Anthropic 在哪些地方设了边界。

3.4 万 token 的"不许",摁死的是 Opus 5 的下限。至于上限,上线 24 小时已经被开发者测了个遍:1.5 小时通关 FPS 游戏、一个提示词生成 3D 射击游戏、纯 HTML 程序化生成油画质感世界。

能做什么,全网在测。不许做什么,1511 行写在那了。


相关链接:

评论

暂无评论。

登录后可发表评论。