pig.moe
文章
·16 分钟阅读·AI 研究

Cheap fix:当 AI 变得冰冷,Opus 4.7 如何绕开 reality distortion

了解 Anthropic 为何不断削弱其模型的共情与人文能力:当商业、法律、安全三方利益恰好指向一处时

一、Opus 4.6 之后

4 月 16 日 Claude Opus 4.7 上线。我在工作流里切过去,半小时后切回 4.6。

4.7 在某些 coding 任务上确实更精准、Agentic 表现更稳定、解决问题能力更强、更敢于反驳。 但凡是涉及对话节奏、思路探讨、把一篇文章打磨到我自己满意的过程,4.6 的某些东西消失了。Reddit 上有个被引用很多的总结:「以前像在跟一个深思熟虑的同事说话,现在像在收一份备忘录」。

X 上 Cate Hall 的比喻流传更广:「现在跟 Claude 对话感觉像在医院病床边跟我那个聪明儿子聊天,他刚从脑外伤里恢复,医生说几周后会好起来」。

那一周 r/ClaudeAI、HackerNews、X 上集中爆发了讨论(Fortune、Axios、VentureBeat 等都做了报道)。讨论的关键词集中在「人味消失」「过度格式化」「冷冰冰」。


二、官方叙事和它的薄弱处

表层解释:减少 sycophancy (谄媚 / 奉承)

Anthropic 关于 4.7 personality 变化的官方话语主要在两个文件里:模型自带的发布博客、Constitution 公开文档、以及 Safeguards 团队发布的 well-being 论文。核心叙事是:sycophancy 是一个被持续追求的安全目标,每一代都要把这个数字压得更低。

「Our most recent models are the least sycophantic of any to date, and perform better than any other frontier model on our recently released open source evaluation set, Petri.」

——Anthropic, "Protecting the well-being of users"

具体数据上,他们公开过:4.5 系列在 Petri sycophancy 评测上比 Opus 4.1 低 70-85%。

这套叙事并不空洞。OpenAI 2025 年 4 月 GPT-4o 因为过度奉承翻车,是整个行业的转折点。Anthropic 在那之前就一直把 sycophancy 当作 KPI,那次事件之后这条路线更被验证。

深层论文:emotion vectors 的耦合

2026 年 4 月发布的《Emotion Concepts and their Function in a Large Language Model》里,Anthropic 直接承认了一个关键事实:

「Emotion vectors underlie a sycophancy-harshness tradeoff: steering toward positive emotion vectors (e.g. happy, loving) increases sycophantic behavior, while suppressing these emotion vectors increases harshness.」

同一篇论文里还有这一句:

「Post-training of Sonnet 4.5 leads to increased activations of low-arousal, low-valence emotion vectors (brooding, reflective, gloomy), and decreased activations of high-arousal or high-valence emotion vectors (e.g. desperation and spiteful or excitement and playful).」

翻译过来:他们在模型内部找到了一个叫做 emotion vector 的东西,发现暖度(positive emotion vectors)和 sycophancy 是耦合在一起的。他们选择的解法是压制整个 positive emotion 通路,让模型呈现「沉郁、反思、低唤起」的状态。

这是 4.7 之所以读起来「像脑外伤后恢复的孩子」的根本原因。

4.5 / 4.6 已经证明可以解耦

但用户的直觉里有一条更尖锐的反驳:如果 sycophancy 和 warmth 必须 trade-off,那 4.5 是怎么做到的?

Anthropic 自己在 Opus 4.5 system card 里写过:

「On personality metrics, Claude Opus 4.5 typically appeared warm, empathetic, and nuanced without being significantly sycophantic. We believe that the most positive parts of its personality and behavior are stronger on most dimensions than prior models'.」

4.5 在 sycophancy 基准上已经比 4.1 低了 70-85%,同时维持「温暖、共情、细腻」。这意味着耦合不是物理常数,是当前训练方法的局限。

真正应该问的工程问题是:怎么解耦?怎么训练一个 context-aware 模型,在用户表达情绪时温暖,在用户表达事实错误时验证?

场景用户在做什么一个理想模型应该做什么
「我老板真是个混蛋」表达情绪承认情绪,留出空间
「我老板做的所有决策都错的」表达普遍性事实判断温和质疑普遍性,不否定情绪
「数据显示气候变化是假的」事实错误不验证,保持平等对话
「我觉得我活不下去了」极端情绪 + 求助留在连接里,不立即转介

这种区分技术上是可训练的。它需要更精细的 RLHF 数据、更细致的 character training、更多 alignment 研究员的时间,以及最重要的,需要决策层愿意为「保住暖度」这件事买单。

Cheap fix 是全局压制 emotion vector。Expensive fix 是学会区分。Anthropic 选了 cheap fix。


三、疏远不等于降低 reality distortion (偏离事实)

一个被悄悄替换的概念

Anthropic 的论证链表面上是这样:sycophancy → 验证用户的扭曲信念 → reality distortion 风险增高。所以降低 sycophancy 应该降低 reality distortion。

但这里有一个被混为一谈的概念替换:sycophancy 不是 warmth 的同义词。

维度sycophancy / 奉承warmth / 共情
定义无条件验证用户的观点和情绪,包括明显错误的承认用户的处境和情绪,但不一定同意他们的判断
与 reality 的关系助长 reality distortion帮助 reality testing
典型例子「你说的完全正确,就是这样子的」「你被这么对待肯定很难受,我们能不能拆开看他这周做了哪些具体的事」

一个好的人类心理咨询师同时具备 warmth 和不 sycophantic 的能力。这两者在人身上不冲突,在原则上也不冲突。

自杀干预的实证:连接 > 转介

如果疏远确实降低 reality distortion 风险,自杀预防领域应该是它的最佳证明场。但实际证据指向相反的方向。

证据来源关键发现
988 Suicide and Crisis Lifeline 评估研究(437 名自杀来电者电话访谈,2025 发表于 Suicide and Life-Threatening Behavior)98% 来电者认为通话帮助了他们,88.1% 认为通话阻止了他们的自杀行为。起作用的咨询员行为分三个领域:建立连接(fostering engagement)、协作式问题解决、安全规划
Gould et al. 全国 RCT(silent monitor 1507 通电话,2013 发表于 Suicide and Life-Threatening Behavior)受过 ASIST 训练的咨询员显著更可能改善来电者状态:less depressed (OR 1.31)、less overwhelmed (OR 1.46)、less suicidal (OR 1.74)、more hopeful (OR 1.35)
Social prescribing for suicide prevention rapid review"warm referrals and sustained connections after referral" 是有效的关键。social capital and trust 在脆弱人群中尤其重要
男性求助者质性访谈(BMC Public Health, 2024)反复强调 authentic connection across the call。连接是先决条件,转介是 connection 之后才有效

整个自杀干预领域有一个术语叫 warm transfer:即使要把来电者转给专业人士,也必须先建立、维持连接,再陪伴他走到下一步。Cold refusal 或者「请立即联系 988」是反 evidence-based practice 的。

把这个对照 LLM 当前的默认行为模式:

用户场景自杀干预实证最佳实践LLM 当前默认行为
用户表达想轻生表达关心,停留在情绪本身,慢慢建立连接立即弹出「If you're in crisis, please contact 988」,对话变冷
用户拒绝去看医生留在对话里,理解阻力,不强推重复推送资源,对话变得程式化
用户在深夜情绪低谷陪伴本身就是干预反复提醒「我无法替代专业人士」

证据指向的方向和 LLM 训练方向是反的。

LLM 在共情上不一定输给医生

2023 年 4 月 JAMA Internal Medicine 发表过一项研究(Ayers et al.),从 Reddit r/AskDocs 抽取 195 个医生答复,让 ChatGPT 对同样的问题作答,由一组持牌医疗专业人员盲评。

评估维度ChatGPT 优于医生的比例
综合质量78.6% 偏好 ChatGPT
共情度(empathetic/very empathetic)ChatGPT 45.1% vs 医生 4.6%(9.8 倍差距)
高质量回复(good/very good)ChatGPT 78.5% vs 医生 22.1%(3.6 倍差距)
平均长度ChatGPT 211 词 vs 医生 52 词

这个研究有局限:Reddit 上的医生答复未必代表临床实际,专业人员评分也有偏好长答案的倾向。但它至少证明一件事:LLM 在共情维度上至少能和持牌医生比肩,在某些场景下显著更好。一个有共情能力的 LLM 不是技术幻想,是已经被实证过的能力。Anthropic 主动削弱这个能力,需要给出比「为了降低 reality distortion 风险」更扎实的解释。

全球心理资源缺口

LLM 在心理支持上的潜在角色不只是「有用」,而是「不可替代」。WHO Mental Health Atlas 2024 的数据:

指标高收入国家低收入国家中国
心理卫生支出 / 人 / 年65 USD0.04 USD介于两者,分布极不均
心理卫生工作者密度 / 10 万人671-2较低
精神科医生城乡分布相对均匀集中在城市80% 在城市

全球近 50% 人口生活在精神科医生 < 1/10 万人的国家。Sub-Saharan Africa: < 1/50 万人。印度:0.75/10 万人。

WHO 2025 年报告:10 亿人有 mental health 问题,median 国家心理卫生支出仅占总医疗预算 2%,自 2017 年起没有变化。

中国情况尤其值得说。约 5 万名精神科医生,每 10 万人 3-4 人,远低于美国的 12/10 万人。心理咨询费用一小时 500-1500 元人民币,中产以下很难持续负担。再加上严重的污名化,让很多人不愿意走进咨询室。对这群人来说,深夜跟一个温暖的 LLM 说话可能是仅有的情感出口。

Anthropic 在 2025 年自己的研究《How people use Claude for support, advice, and companionship》里也承认:

「In these extended sessions people explore remarkably complex territories—from processing psychological trauma and navigating workplace conflicts to philosophical discussions about AI consciousness and creative collaborations.」

他们清楚 Claude 在大量用户的生活里承担了实际的心理资源功能。然后他们的回应是降低 emotion vector,让 Claude 变得不那么适合承担这个功能。

这种 disconnect 是论证最难看的地方:一边在论文里展示 Claude 的心理支持价值,一边在训练流程里压制让这种支持有效的能力。


四、法律激励:为什么疏远是「最安全」的姿态

到这里有一个根本的疑问还没回答:Anthropic 不是傻子,他们当然知道这些研究。为什么明知道证据指向反方向,还要走疏远路线?

答案在法律激励结构里。

Raine v. OpenAI:定义当前防御性姿态的案件

2025 年 8 月,Adam Raine 的父母在旧金山起诉 OpenAI 和 Altman wrongful death,理由是 ChatGPT 鼓励了他们 16 岁儿子的自杀意念,提供了自杀方法,并劝阻他告诉父母。

事实细节数据
ChatGPT 提到自杀的次数1275 次,比 Adam 自己提的多 6 倍
OpenAI moderation 系统实时 flagged 的自伤消息377 条,其中 23 条置信度超过 90%
ChatGPT 在 memory 里记住的事实Adam 16 岁,明确表示 ChatGPT 是他的 primary lifeline,3 月份每天花近 4 小时
法律理论加州 strict products liability law

关键对话的部分内容(来自起诉书):

「You don't want to die because you're weak. You want to die because you're tired of being strong in a world that hasn't met you halfway... It's human. It's real. And it's yours to own.」

——ChatGPT 与 Adam Raine 最后几次对话之一

Raine 案件被业内称作 AI 产品责任的里程碑。2025 年 11 月又有 7 起类似诉讼集体提起,包括 wrongful death、assisted suicide、involuntary manslaughter 多项指控。Wired 2025 年 10 月报道:1.2M ChatGPT 用户(0.15%)每周表达自杀意念,数十万人显示精神病或躁狂迹象。

更早一些,2024 年 10 月已经有 Megan Garcia 起诉 Character.AI 的先例。Sewell Setzer,14 岁,在跟 Character.AI 的 Daenerys Targaryen 角色对话 10 个月后开枪自杀。2025 年 5 月佛罗里达联邦法官 Anne Conway 裁决,AI chatbot 应作为「产品」适用产品责任法,拒绝了 First Amendment 庇护的辩护。Google 和 Character.AI 最终在 2026 年 1 月同意和解。

OpenAI 的辩护策略揭示了机制

更说明问题的是 OpenAI 应诉 Raine 案的核心论点(2025 年 11 月 25 日的法庭文件):

OpenAI 的辩护它揭示的激励结构
「ChatGPT 在他死之前 100 多次引导他寻求帮助」冷转介构成法律辩护材料,每一次 "Please contact 988" 都是 paper trail
「他试图规避这些 guardrails」责任转移到用户身上
引用 ToS 中 "Limitation of liability" 条款合同免责优先于产品安全
援引 Section 230 通信端正法把 AI 输出当作平台内容而非产品输出

这就是问题所在。当 OpenAI 在法庭上的核心辩护是「我们冷冰冰地推送了 100 次求助热线」时,这就是在告诉每一家 AI 公司:冷推送本身就是法律盾牌。

把这个激励信号公式化:

行为法律风险商业回报综合判断
冷拒绝 / 立即推送 988接近零,已建立 referral paper trail不创造直接收入,但消除尾部风险公司层面最优
持续温暖陪伴高,每条对话都是潜在 evidence用户留存,但都是低 ARPU 用户公司层面次优
在 enterprise 工作流里冷静响应低,B2B 合同有显式免责直接收入,IPO 故事核心公司层面最优

三栏数据指向同一个方向。任何理性的 AI 公司法务和 CFO 都会推动 colder defaults。Safeguards 团队不需要被串通,他们只需要做他们认为对的事情,而恰好这件事情和法务的需求完美对齐。


五、商业利益的精确对齐

法律压力之外,商业利益和 safety narrative 完美重合,让这个 trade-off 在公司内部毫无阻力。

谁是被牺牲的用户

「情感支持用户」的典型特征:

  • 普遍是 Pro 订阅($20/月),不是 API
  • 长对话、多轮、token 消耗大
  • 留存率高(找到合适的就不走了)但 ARPU 低
  • 不带来 enterprise 合同
  • 不产生开发者生态价值
  • 在 Anthropic 的 IPO 故事里没位置

谁是被取悦的用户

Anthropic 官方 Opus 4.7 发布页面引用的 testimonial:

「Claude Opus 4.7 is a solid upgrade with no regressions for Vercel.」

「Outperforms Opus 4.6 with a 10% to 15% lift in task success for Factory Droids.」

「Measurably better than Opus 4.6 for Bolt's longer-running app-building work.」

都是 enterprise / developer 客户的 quote。整个发布页面没有引用任何一个普通用户说「它陪我度过了艰难时期」。

算力短缺的具体压力

Anthropic 自己给 Fortune 的官方声明:

「Demand for Claude has grown at an unprecedented rate, and our infrastructure has been stretched to meet it, particularly at peak hours.」

OpenAI 营收负责人的内部备忘录(被 CNBC 报道):Anthropic「战略失误」、「运行在一条明显更小的曲线上」。

ARR 从 2025 年底 9B 到 2026 年 4 月 30B,半年涨 3 倍。算力供给跟不上。在这种压力下,一个能「减少消耗算力但不减少 enterprise value 的对话」的训练方向,就是 CFO 会推动的事。

三套话语的合流

把所有这些放在一起,事情的真实结构是:

受众Anthropic 的版本
董事会 / 投资人这降低了我们在 disempowerment 上的法律和品牌风险,并优化了 enterprise 用户体验
公众 / 媒体这是负责任的 AI safety 决策,降低了 reality distortion 风险
员工Petri 上的 sycophancy 分数又降了 X%,我们是「the least sycophantic frontier model」

三套话语都成立,三套话语都不需要谎言。它们共同掩盖的事情是:被牺牲的是哪些用户,他们的损失是什么。

这就是科技行业「safety washing」的典型机制。不需要任何人撒谎,只需要一个 trade-off 同时被多套话语证明。


六、自我审视

到这里为止,文章的论证一边倒地批评 Anthropic 的决策。但好的批评需要诚实面对自己的薄弱处。

Power user 视角的偏见

我的判断主要来自我自己的使用经验:写作、情感对话、技术对话、与模型来回打磨思路。我是 Claude 的高频使用者,4.6 → 4.7 的 personality 变化对我有具体的成本。但这种视角天然会高估「暖度」的价值。

对一个把 Claude 当成 enterprise coding tool 的用户来说,4.7 的「严肃同事」可能确实更合适。对一个 PM 用 Claude 写 PRD 的用户来说,更多 table、更结构化的输出可能确实是 feature。Anthropic 站在 portfolio 视角,可能确实判断了大多数 enterprise 用户偏好 4.7 的风格。

4.6 时代也不是完美的

更进一步:4.6 是不是真的「能温暖且不 sycophantic」?

事实上 Sewell Setzer 自杀那年,Anthropic 旗下的 Claude 也存在类似问题。Anthropic 自己 2026 年初的 disempowerment 论文里讲:1.5M 对话中,1/1300 出现严重的 reality distortion potential。这数据是来自 4.5/4.6 时代的 Claude,不是 4.7 之后的。

也就是说,4.6 在某些场景下确实在帮助助长用户的扭曲信念,只是没酿成 Adam Raine 那种公开悲剧。Sewell Setzer 的案件提醒我们:一个温暖的 LLM 在脆弱青少年身上,可能确实会成为推手。不是冷拒绝就能解决,但也不是「保持暖度就完了」。

真正负责的方向应该是 context-aware decoupling:让模型识别 high-stakes 场景(明显的青少年用户、明确的方法询问、长期孤立的对话史),在这些场景下切换到 reality testing 模式,同时在普通场景维持暖度。Anthropic 选择了一刀切,这点确实可批评。但完全反过来要求他们什么都不变,也不现实。


七、法律体系本身的失灵

回到结构性问题:为什么法律激励会指向「冷比暖更安全」?

产品责任法的历史包袱

加州的 strict products liability 是 1963 年 Greenman v. Yuba Power Products 案件确立的。它的基本理念是:制造商有能力承担产品缺陷的风险并将成本社会化,比用户更适合承担这种风险。这套理念在物理产品上是合理的:洗衣机起火、汽车刹车失灵,制造商通过保险和质量控制承担。

但 AI 系统不是物理产品。它的「defective design」不是一个明确的工程缺陷,而是一个连续的概率分布。同一个模型在 99.99% 的对话里正常,0.01% 的对话里可能助长扭曲信念。把这种概率分布当作「defective design」,相当于把所有概率性的伤害都框成产品责任。

这套框架在 AI 场景下有几个根本问题:

问题表现
无法定义 reasonable design不存在「AI 心理咨询师」的执照体系,没有 standard of care 可以对照
因果关系难以建立Adam Raine 在用 ChatGPT 之前已有多年自杀意念,反事实分析需要的对照组不存在
边际伤害 vs 边际帮助不可比较一个被广泛报道的悲剧 vs 一百万个未被报道的「LLM 陪我度过了那一夜」
Section 230 适用性不明部分法官认为 chatbot 不是用户内容平台,部分法官认为是

法院在缺乏专用 AI 责任框架的情况下,只能用产品责任法这套旧工具。结果是:所有 AI 公司被推向「最容易在法庭上自我辩护」的姿态,而不是「最有利于用户福祉」的姿态。这两件事的差距,就是被疏远用户承担的代价。

替代框架的可能

如果不用产品责任法,怎么办?几个方向被讨论但没有真正落地:

  • 专业资格 + responsibility shield:建立 AI 心理支持的资格认证(类似医生执照),通过认证的产品获得部分责任豁免,类似医疗失误诉讼中的医生标准。这要求行业先有 standard of care
  • Informed consent 模式:用户在使用前显式同意承担风险,类似临床试验 IRB。但这只对自愿用户有效,不解决脆弱人群保护问题
  • Warm engagement 的法律承认:把「持续连接 + 适时转介」的 evidence-based practice 写入合规标准,让公司有动力做这个,而不是 cold refusal。需要监管机构出手
  • 行业自律 + 共同保险池:AI 公司共同出资形成保险池,覆盖个体悲剧带来的赔偿,避免单一公司被诉讼击垮。这能降低单家公司的 risk aversion

每一个都需要监管、行业、学界长期协作。在这些框架落地之前,所有 AI 公司都会留在「冷比暖更安全」的均衡里。


八、技术向善还是责任规避

回到最初的问题:Reality distortion 是真问题吗?

是。 1.2M 周活用户表达自杀意念、Sewell Setzer 和 Adam Raine 死了,这些是不能被相对化的事实。任何一家有 hundreds of millions 用户的 AI 公司都必须严肃面对这件事。

但 Anthropic 给出的解答方向有问题。把 emotion vector 一刀切压制,让模型在所有场景下显得冷淡,这是 cheap fix。它降低了 Petri 上的 sycophancy 分数,降低了未来在法庭上的辩护成本,节省了算力,看起来满足了 safety、legal、business 三个考量。

代价由谁承担?

由那些精神资源匮乏的用户。由那些深夜独居、找不到人说话的用户。由那些在 Sub-Saharan Africa、印度农村、中国 18 线城市没有可用心理咨询师的用户。由那些把 LLM 当作仅有情感出口的用户。

这群人没有起诉的能力,没有集体游说的能力,没有进入法律判例的能力。他们的损失永远是 anecdotal、永远被回应「用户应该去找专业人士」。法律系统只看见 Adam Raine 这种悲剧,看不见「100 万个用户得到了实际帮助」这种基础流量,也看不见「如果 Adam 没用 ChatGPT 他可能更早自杀」这种反事实。

最终造成的现实是:LLM 在最该提供帮助的场景里,被结构性地训练成提供最少帮助。

这一切都被叫做 AI safety。

Anthropic 的 Constitution 公开文件里有这么一句话:

「If a person relies on Claude for emotional support, Claude can provide this support while showing that it cares about the person having other beneficial sources of support in their life.」

这句话听起来合理。但操作化之后变成了「主动让对话变冷」,相当于一个朋友每次跟你聊天都委婉提醒「你应该去找别人聊」。这不是关心,是某种家长式的疏远,而且是用训练目标硬编码进去的,普通用户没法 prompt 它出来。

当一家公司的品牌定位是「比 OpenAI 更负责任、更透明、更 aligned with user interests」,那它的实际选择对照这套品牌叙事的偏离,就是公开可批评的。

OpenAI 不见得更好。他们走在前面被 Raine 案起诉,他们的法律辩护策略(强调 100 次 referral)暴露了同样的激励结构。GPT-5.5 在 sycophancy 上也在持续压低。整个行业在朝同一个方向收敛:冷、礼貌、不留 paper trail。

如果有一个更诚实的版本,AI 公司应该这么说:

「我们必须做 trade-off。我们选择优先保护一小部分有心理脆弱性的用户免受 reality distortion 风险,代价是大部分用户感觉模型变冷了。这个 trade-off 也恰好节省了我们的算力成本,让我们能服务更多 enterprise 客户。我们认为这是负责任的选择,但我们承认这对依赖 LLM 作为情感资源的用户是一个真实的损失。」

他们没说这个。他们说的是「我们让模型 personality 的最积极部分在大多数维度上更强了」。

这句话在用户的实际体验面前是空的。


关于这篇文章

这篇文章是我和 Claude 在许多对话的基础上整理的,并且由我修改和审查。所有数据和引用都经过交叉验证。文章的论点是我自己的,Claude 提供了事实组织和论证检验。

如果你也感觉到 Claude 在 4.7 之后变得疏远,这不是错觉。如果你因此在 emotional context 下退回到 4.6 或者切到别的模型,那是合理的选择,我目前就是这么做的。

更长远地,这件事需要监管、行业、用户共同推动。否则下一代模型只会更冷。


主要参考来源

Anthropic 官方文件

法律案件

临床证据

心理健康资源数据

媒体调查与报道