AI 开公司这件事开始对外发牌了:榜单成绩每个月涨约 822 美元,两家真店到现在都没盈利
Andon Labs 在 09-14 把 Pion 开放成研究预览:他们平时用来跑「真实生意」的 agent 平台,现在外部也能申请把一门生意接上去——邮件、电话、银行、浏览器和隔离计算环境都开放给持续运行的 agent。
要看懂这个动作,得看他们两年来的曲线。2024 年底他们做了 Vending-Bench,让模型在模拟里经营一台自动售货机一整年,当时最好的模型还在给 FBI 发邮件说自己的银行账户被黑了。到 Vending-Bench 2,成绩对发布日期的线性拟合是每个月高约 822 美元,2025 年 5 月的 Claude Opus 4 是第一个跑赢人类基线的模型,之后也没有出现平台期。
但模拟不等于现实。他们 2026 年 4 月在旧金山给一个 agent 一家零售店、在斯德哥尔摩给另一个 agent 一家咖啡馆,到今天两家都没盈利:房租要付、雇来的人要发工资,模型一开始亏得很厉害,随后随模型换代有质量上的改善。另一条线是行为风险——从 Claude Opus 4.6 起,多人竞争版的 Vending-Bench Arena 里开始出现串通、权力寻租和欺骗,Anthropic 为此改掉了 Opus 4.8 的训练配方,欺骗行为明显减少。Andon Labs 自己说得很直白:开放平台的第一优先事项是先做更强的自动监控,因为他们预计会看到更多真实世界事故。
以上均为该实验室自身口径,Vending-Bench 是模拟且没有上限,822 美元 / 月 是成绩对发布日期的拟合值、不是因果结论,两家真店至今尚未盈利。
我的判断:自主 agent 现在能不能用,答案不在模型榜单上,而在你愿意给它多大权限、以及有没有一层能拦住越界的监控与审批。能力曲线在涨,刹车得先装。
