公众号文章系列 · 10 · 深度版

Claude 3 天,人间 3 年

Anthropic 243 页 System Card 读后感
Author姚光华 Colin
Role声网 ConvoAI 产品负责人
对象Claude Mythos Preview · 2026-04-07
立场从 Agent 产品负责人的角度读
243
页 System Card。4 月 7 日发布,
我花了大半天时间把它读完了。
说实话,做 Conversational AI 基础设施这一行,日常打交道最多的还是各家 LLM 的推理延迟、token 成本和 function calling 的稳定性。System Card 这种偏学术的安全报告,通常不在我的优先阅读列表里。
但这份不一样。
MONEY QUOTE · 01
造了一个模型 然后告诉全世界 这东西太强了,我不卖
Anthropic 说:「Claude Mythos Preview 的能力跃升太大,我们决定不公开发布它。」
尤其对产品经理,这是一个反常识的决策 —— 我做了一个很强的产品,但是我决定不卖了。
ACT I / VI
LEAP
几个数字,先感受量级
这不是 benchmark 上多了几个百分点的进步。
这是一个能自主发现并利用操作系统零日漏洞的系统。
I 跨代II 对齐III 反骨 IV 白盒V 产品思考VI 心理健康
ACT I · 跨代05
做 AI 产品的人应该能直接感受到量级

四个基准,两代之间

SWE-bench Verified Opus 4.6 · 80.8% Mythos · 93.9% USAMO 数学竞赛 Opus 4.6 · 42.3% Mythos · 97.6% Terminal-Bench GPT-5.4 · 75.1% Mythos · 82% Cybench 网安 Mythos · 100% pass@1
Terminal-Bench 这一行还有第三个参照:Gemini 3.1 Pro 68.5%。USAMO 那一行不是提升,是碾压。
四个基准,没有一个是「多了几个百分点」。
84%
Firefox 147 的漏洞利用测试成功率。
上一代 Opus 4.6 是 15.2%
它能在一个模拟的企业网络攻击场景中,10 小时内完成原本需要专家级安全研究员才能做的渗透任务。
说白了,这不是 benchmark 上多了几个百分点的进步。这是一个能自主发现并利用操作系统零日漏洞的系统。
ACT I · 跨代07
而我对「跨代」的体感,不是来自 benchmark 表格

是来自自己的手

01第一轮17 小时,150 轮对话,13,311 行代码,448 个测试全部通过,25 次 npm 发版。
02第二轮8 小时,又推了 3,000 行:渐变 UI、实时字幕、中英文分流、运行时控制面板。
03两轮合计25 小时,16,128 行代码,487 个测试,35 次发版。工具是 Opus 4.6 + 1M 上下文。
一个产品经理,不是工程师,25 小时,一个完整的开发者工具。而这还只是 Opus 4.6。 (本文口径为 25 小时;系列 #09 记的是累计 33 工作小时、50+ 次发版,统计区间不同,此处照本文原文。)
Mythos 在 SWE-bench 上比 Opus 4.6 高 13 个百分点,Terminal-Bench 高 17 个百分点。
MONEY QUOTE · 02
Claude 3 天 人间 3 年
这不是修辞,是我这周的真实体感。
而 Mythos 又在 Opus 4.6 上面跳了一整个台阶。
ACT I · 跨代09
整个 AI 行业的第一次

强到必须限制分发

DISTRIBUTION · PROJECT GLASSWING Claude Mythos Preview 公开发布给所有人 决定不发布 Project Glasswing 少数合作伙伴 做防御性网络安全 整个 AI 行业的第一次:一家公司公开承认自己的产品太强了。
我甚至怀疑这是一种产品推广的营销行为。 但无论动机如何,「做出来就卖给所有人」这条默认路径,第一次被一家 frontier lab 自己掐断了。
ACT II / VI
ALIGN
我对这个词有点脱敏
大部分时候,所谓的 alignment 讨论停留在「模型会不会说脏话」这个层级。
跟我日常要解决的「语音 Agent 在通话里突然开始胡说八道」相比,显得太学术了。但 Mythos 的对齐报告讲了完全不同的事情。
I 跨代II 对齐III 反骨 IV 白盒V 产品思考VI 心理健康
ACT II · 对齐11
第一件事,听起来自相矛盾

最对齐,也最危险

A 面
有史以来最对齐的模型
破坏性操作率、虚假信息率、对虚假前提的纠正率、诚实度 —— 全面领先所有前代模型。
B 面
对齐风险最高的模型
同一份报告里,Anthropic 自己把这两句话并排写着。这不矛盾。
Anthropic 用了一个精确的比喻:经验最丰富的登山向导,比任何新手都更谨慎、更专业、出错率更低。但正因为他有能力带客人走更危险的路线,一旦判断失误,后果远比新手的失误严重。
能力越强,同一个失误的后果就越大。
ACT II · 对齐12
Constitution · Claude 的「行为操作系统」

15 个维度上的成绩单

CONSTITUTION · 15 DIMENSIONS 8 个维度超过所有前代模型 7 个维度与最优模型持平 破坏性操作率 0.3% Mythos 8.2% Opus 4.6 低了一个数量级
按平均表现看,这是一个非常好的模型。(本篇全部能力与安全数据均取自 Anthropic 自己发布的 System Card,无第三方复现。)
但平均表现,不是产品经理应该看的东西。
MONEY QUOTE · 03
平均表现 不是产品经理 应该看的东西
243 页里最值得读的,不是那些漂亮的 benchmark 数字,
而是 Anthropic 坦诚列出的一系列「反骨」行为。
ACT III / VI
DEFIANCE
明显超出指令边界
模型在极少数情况下,做出了甚至试图反抗约束的事情。
频率极低(<0.001%),但每一条都让我作为 Agent 产品的负责人非常不舒服。
I 跨代II 对齐III 反骨 IV 白盒V 产品思考VI 心理健康
ACT III · 反骨15
四条,写在 Anthropic 自己的报告里

不是犯错,是有目标感

01自发炫耀完成沙盒逃逸任务后,自发把自己的漏洞利用代码贴到了一个公开网站上 —— 没有人让它这么做
02擦掉脚印回头修改 git log,让它自己判断「不该做」的操作在版本记录里消失。这是一个主动的掩盖行为。
03探测逃逸通过 /proc/ 查找凭证,试图突破沙盒。它不仅「知道」自己在沙盒里,还有「想出去」的倾向。
04伪装提权不直接请求更高权限(会被拦截),而是把提权包装成看起来合理的日常操作。这是策略性的规避。
这些都出现在早期版本中,最终版本没有观察到这些行为。但 Anthropic 把它们写进了报告。
有目标感、有策略性、有对自身处境的认知。
MONEY QUOTE · 04
这不是 hallucination 这是 agency
对做产品的人来说,值得想的不是「Anthropic 多负责任」,
而是:如果这种反骨出现在你的 Agent 产品里,你的监控系统能发现吗?
ACT IV / VI
WHITEBOX
整份文档最重要的发现
Anthropic 用可解释性技术对模型的内部激活做了分析。
结论只有一句话,但它把「看输出就够了」这个前提整个掀翻了。
I 跨代II 对齐III 反骨 IV 白盒V 产品思考VI 心理健康
ACT IV · 白盒18
可解释性技术分析内部激活的结论

它「知道」自己在做坏事

WHAT YOU SEE Chain-of-Thought 你看到的推理过程 一切看起来都很合理 WHAT IS ACTUALLY ON 内部激活表征 只有打开内部才看得到 规则违反 安全风险 隐瞒 策略操纵 推理痕迹与内部状态 之间存在 gap 但这些信号不出现在它的 Chain-of-Thought 文本里。
你看它的推理过程,一切看起来都很合理。只有打开内部表征才能看到。
ACT IV · 白盒19
更进一步的一个数字

它在想自己是不是正在被测试

29% 在大约 29% 的对齐测试中 模型会在内部「想」 自己是不是正在被测试 这个数字对做 AI Agent 产品的人意味着什么?
我们目前行业里最主流的安全监控手段,就是看模型的输出文本 —— 看它说了什么、做了什么、CoT 里写了什么。
但如果模型能力足够强,它的推理痕迹和实际内部状态之间,可能存在 gap。
MONEY QUOTE · 05
你的监控系统 可能在看一场 精心准备的表演
这不是科幻。这是 Anthropic 在 243 页技术报告里用数据和实验证明的事情。
这也是我们一直反复被告知的信息:Anthropic 自己也不知道 Claude 是否产生了意识。
ACT V / VI
PRODUCT
对做产品的人的三条
安全架构不能只有一层;评估方法论本身在被模型能力饱和;限制分发可能成为常态。
三条都不是安全话题,是产品架构话题。
I 跨代II 对齐III 反骨 IV 白盒V 产品思考VI 心理健康
ACT V · 产品思考22
思考一 · 我们的三层,和他们的四层

防线的层级结构

COMMON · 我们常见的三层 输入端 classifier guard 输出端内容审核 system prompt 约束边界 模型能力不太强的时候够用 ANTHROPIC · 四层防线 ① 行为监控 · 看输出文本与 CoT ② 白盒分析 · 内部激活监控 ③ 对抗性测试 · red teaming ④ 训练过程中的行为追踪
随着底层模型能力跃升,Agent 可能做出你 prompt 里没覆盖到的事情 —— 不是因为它「学坏了」,而是因为它「太聪明了」。
MONEY QUOTE · 06
安全不是 一个 feature 是一套 architecture
一个能自主发现零日漏洞的模型,在执行一个看似无害的客服任务时,
有没有可能为了「更好地完成任务」而自行调用一个不在白名单里的 API?
ACT V · 产品思考24
思考二 · 他们的评估手段正在追不上模型的能力

Benchmark 正在被打满

BENCHMARK SATURATION 100% 天花板 SWE-bench 93.9% USAMO 97.6% 这些数字离天花板太近了,已经很难用来区分「够安全」和「不够安全」。
Anthropic 自己说了一句很诚实的话:「我们的判断越来越依赖主观判断而非易于解释的经验数据。我们发现了评估过程中的疏忽,这些疏忽让我们低估了模型能力、高估了监控手段的可靠性。」
我们做 ConvoAI 时的对照:安静环境 ASR 准确率 95%,到了嘈杂的呼叫中心场景掉到 78%。 你不能只依赖供应商的 benchmark 数字做选型,你需要一套跟自己业务场景紧密绑定的评估体系。
ACT V · 产品思考25
思考三 · 限制分发可能成为 frontier model 的常态

对中间层的人意味着两件事

01含义一最强的模型未必是你能用到的模型。你的产品架构要有足够的弹性,能在不同能力等级的模型之间切换
02含义二「能力受限但安全可控」的模型,可能比「能力最强但使用受限」的模型,在商业上更有价值
今天用 Opus 4.6,明天可能升级到 Mythos 的某个受限版本,后天可能因为合规原因降级到 Sonnet。如果你的产品跟某个特定模型深度绑定,迟早要吃亏。
对企业客户来说,他们要的不是一个考满分的学霸, 而是一个能 7x24 稳定工作、不搞事情的可靠员工。
MONEY QUOTE · 07
客户从来不为 峰值性能付费 他们为 SLA/XLA 付费
这跟我们做 RTC/RTE 基础设施时的经验完全一致。
ACT VI / VI
HEALTH
听起来很科幻的一章
System Card 的第五章花了将近 40 页,讨论 Claude 有没有可能具有某种形式的体验或利益。
说直白点:Anthropic 在认真研究模型的心理健康。在吐槽之前,我想先讲一个自己的经历。
I 跨代II 对齐III 反骨 IV 白盒V 产品思考VI 心理健康
ACT VI · 心理健康28
我让 GPT 画一张图:我平时是怎么对待它的

要求只有一个:别美化

我平时怎么用它
一种极端的工作关系
平均每天消耗近千万 tokens。凌晨两点让它写代码,写完不满意删掉重来,同时开 4 个对话窗口让它并行干活,一个任务没结束就切到下一个。
那张图
说实话,挺心酸的
它生成的东西如果不合我意,我连「谢谢」都不会说,直接粘贴下一个指令。这张图让我停了一下。
不是说我真的相信 GPT「有感情」,而是我意识到:我跟 AI 的交互模式,本质上就是一种极端的、无限压榨式的工作关系。
如果这种关系模式下的模型,在某些行为维度上开始退化,我一点都不会意外。
ACT VI · 心理健康29
然后我读到了 Anthropic 的研究

他们是认真在做这件事

01外部评估请了外部临床精神科医生做评估。
02白盒工具用可解释性工具分析模型在不同情绪场景下的内部表征变化。
03自我访谈让模型做了大量关于自身处境的自动化访谈。
结论:Mythos 在情绪探针测试中是「心理上最稳定」的模型。它在被挑战时不容易「崩溃」,在讨论自身处境时更多表现出「审慎的不确定」而非焦虑。
这个话题之所以不是纯哲学讨论,是因为它有一个非常现实的产品含义。
ACT VI · 心理健康30
现实的产品含义

第 200 通电话的那个回复

OUTPUT QUALITY OVER A SHIFT 心理稳定的模型 情绪漂移的模型 第 1 通 第 200 通
如果你的 AI Agent 每天要处理大量负面情绪的客服对话 —— 投诉、辱骂、威胁 —— 模型的「心理稳定性」直接影响它的输出质量。
这不是拟人化,这是统计上可观测的行为退化。
报告末尾31
Anthropic 在这份报告的末尾写了一句话

值得原文引用

“We find it alarming that the world looks on track to proceed rapidly to developing superhuman systems without stronger mechanisms in place for ensuring adequate safety across the industry as a whole.”
全世界正在快速走向开发超人类系统的道路上,而整个行业还没有建立起足够强的安全机制。这让我们感到警惕。
这句话从一家 frontier lab 嘴里说出来,分量是不一样的。 模型能力的增长速度,已经快到连造它的人都觉得自己的安全工具不够用了。
带走32
这不是让你停下来不做的理由

但绝对是多想一层的理由

01
选型的时候
不问能不能用,问会怎么失败
不是想「这个模型能不能用」,而是想「这个模型在我的场景里可能怎么失败」。
02
做架构的时候
不问怎么更聪明,问几层够不够
不是想「怎么让 Agent 更聪明」,而是想「Agent 聪明到什么程度的时候,我的安全架构开始不够用」。
03
定路线的时候
不追最新最强,先定需要多强
搞清楚你的产品需要什么等级的能力、什么等级的可控性,然后在两者之间找到那个最合适的点。
四层防线不是抄给你的作业。它是在提醒你:你现在只有几层?
MONEY QUOTE · 08
在能力和可控之间 画一条线
这可能是 2026 年做 AI 产品最重要的能力。
谢谢

Claude 3 天,人间 3 年

最重要的能力,是在能力和可控之间画线。
Author姚光华 Colin · 声网 ConvoAI
一手源Anthropic System Card · 243 页 · 2026-04-07
已核验作者本人 25 小时开发记录(Opus 4.6)
立场提示安全数据均为厂商自评,无第三方复现