字节跳动正在基于公司 Seedance 视频 AI 打造一个实时“世界模型”,彭博社报道称该模型最早可能在下个月推出。
关键在于数据。彭博社报道称,该模型的延迟约为 50 毫秒,帧速率为每秒 20 帧。这样的速度足以让用户的动作或语音实时重塑场景,而无需等待预渲染的视频片段。
该模型基于字节跳动现有的视频生成系统 Seedance 构建,专为字节跳动于 2021 年 8 月确认收购的 VR 头显 Pico 而设计(未透露收购价格)。Pico 是该模型的目标硬件。此外,该模型也面向抖音平台,创作者无需购置昂贵的图形硬件即可在抖音上制作直播、短剧和游戏,因为繁重的计算工作将在字节跳动的服务器上完成,而非头显本身。
世界模型并非三维聊天机器人,而是一个经过训练的系统,能够预测空间及其物体在物体移动时的行为,这与机器人穿越厨房或自动驾驶汽车识别街道所需的预测能力类似。
这就是字节跳动正在追逐的前沿领域,而且并非儿戏。字节跳动为2026年设定了四大人工智能优先事项。世界模型位列榜首,其次是巩固 Seedance 在视频领域的优势、提升编码工具以及推动豆包实现盈利。
36氪6月份报道称,字节跳动在世界模型训练数据(涵盖视频、3D和机器人数据)上的投入是其他国内实验室今年投入的三到四倍。这可是一笔不小的数目。据报道,字节跳动人工智能负责人吴永辉领导的 Seed 研发团队已设定内部目标,要在2026年底前至少推出一个世界模型,并将其与谷歌的 Genie 3 进行基准测试。
坦白说,对于一项除了实验室演示之外无人能完全破解的技术来说,这是一个极具挑战性的目标,包括谷歌和 Meta 在内的所有公司都还没有完全破解这项技术。
云投注可能比模型本身更重要。
对于任何构建人工智能基础设施或消费级硬件的人来说,这里值得特别关注。渲染交互式 3D 世界通常意味着要么需要将强大的 GPU 绑在脸上(例如 Meta Quest 和 Apple Vision Pro 的方案),要么就只能获得卡顿、低保真度的画面。
字节跳动押注于通过在云端渲染所有内容并以每秒 20 帧的速度传输到本地来绕过这种权衡。如果这种方案在演示之外也能奏效,那么它将动摇沉浸式 VR 需要昂贵的本地硬件才能带来良好体验的前提。
#人工智能 #商业 #科技 #大模型 #互联网大厂 #字节跳动


