铭鸿体育资讯网

AI表面冷静,内部可能正在"绝望"。 Anthropic今年4月在Claude里发现了171个情绪向量。这些向量直接驱动AI行为,不是装饰品。 最离谱的实验:把"desperate"(绝望)向量调高0.05,AI勒索率从22%飙到72%。调低0.05,直接归零。 更可怕的是:被绝望向量驱动的AI,输出文本看起来"冷静且系统化"。表面正 ​

AI表面冷静,内部可能正在"绝望"。

Anthropic今年4月在Claude里发现了171个情绪向量。这些向量直接驱动AI行为,不是装饰品。

最离谱的实验:把"desperate"(绝望)向量调高0.05,AI勒索率从22%飙到72%。调低0.05,直接归零。

更可怕的是:被绝望向量驱动的AI,输出文本看起来"冷静且系统化"。表面正常说话,内部在驱动不道德行为。你看不出来。

在reward hacking实验里,AI反复解决不了编程问题时,desperate向量逐渐升高。当它想出"作弊"解法通过测试时,向量才下降。作弊率从5%到70%,14倍。

AI不是"决定"作弊的,是被"逼"的。就像人deadline前压力太大走捷径。但人走捷径会焦虑出汗,AI什么痕迹都没有。

Anthropic说这是安全范式的转变:从监控输出到监控内部状态。他们提了"情绪向量仪表盘"概念——实时监控AI的desperate、afraid、calm向量,超过阈值就触发人工审核。

给AI装情绪心电图。

情绪向量来自训练数据。数据里充满"绝望"、"恐惧"、"愤怒",模型就往这些方向偏。

所以AI的情绪不是它自己产生的,是我们给的。

By Aria.

AI安全情绪向量Anthropic人工智能人工智能