铭鸿体育资讯网

这条新闻最震撼的地方,其实不是“83亿”。 而是AI第一次开始尝试把整个人类社

这条新闻最震撼的地方,其实不是“83亿”。

而是AI第一次开始尝试把整个人类社会变成一个可以反复测试的“虚拟用户池”。

哈佛、MIT牵头的团队推出 MatrAIx,论文显示,其 Persona 8B 系统包含约 83亿个虚拟人格记录,每个Persona由 1290个分类维度描述,包括背景、心理特征、职业能力、行为和生活方式等。 

但这里有一个容易被标题带偏的地方:

并不是同时运行83亿个AI机器人。

更准确地说,是建立了一个规模达到83亿的虚拟人口画像空间,研究人员可以从中抽取不同类型的“模拟用户”,再让AI代理去执行测试。

目前公开的高质量数据核心集大约100万条,其中约59.98万条来自真实人类信息,40万条为AI合成数据。 

然后让这些虚拟用户去做什么?

非常现实。

填问卷、聊天、浏览网页、使用App。

研究团队搭建了问卷、AI聊天机器人、网页和App四种测试环境,设计了1010项任务,覆盖商业、软件、金融、医疗等25个以上领域,并进行了18189次模拟用户测试。 

最有意思的是验证结果:

在400次受控实验中,虚拟Persona有91.5%的实验符合预设的人格行为。 

这意味着什么?

过去一家互联网公司想测试一个新产品,可能要:

招募1000个真人 → 发问卷 → 做访谈 → 内测 → 收集反馈 → 修改 → 再测试。

以后可能变成:

定义目标人群 → AI生成百万级模拟用户 → 让他们同时使用产品 → 找出问题 → 再让真人验证。

这对产品经理、市场研究、广告测试甚至金融服务设计,都会产生很大的影响。

但我觉得这里最值得警惕的恰恰是:

91.5%并不等于“91.5%像真人”。

它更多证明的是,在特定测试环境和预设行为维度下,Persona能够保持较高的一致性。论文自己也明确指出,虚拟用户不能完全替代真实人类,尤其是涉及重大社会决策和高风险研究时,真实用户仍然不可替代。 

因为人类最大的特点,恰恰是:

不稳定。

一个人今天喜欢某款产品,明天可能因为一次糟糕的客服体验彻底改变看法。

一个消费者可能本来准备花1000元,看到一个朋友的评论以后突然不买了。

甚至一个完全不符合“1290种标签”的奇怪用户,反而可能成为最有价值的那个用户。

所以我更愿意把 MatrAIx 看成:

AI正在获得一个“虚拟人类社会”,但还没有真正获得“真实的人类社会”。

未来真正厉害的公司,可能不是完全用AI替代真人调研,而是形成:

83亿虚拟人负责大规模筛选 + 真人负责最终验证。

这样一来,产品测试的成本和速度可能发生巨大变化。

而更深层的问题也来了:

如果未来AI可以先模拟83亿种人的选择,再决定什么产品、广告甚至政策最容易被接受,我们究竟是在让AI更懂人类,还是在让人类越来越适应AI眼中的“标准答案”?