铭鸿体育资讯网

字节跳动正开发实时空间视频生成 AI 模型

字节跳动正开发实时空间视频生成 AI 模型

据彭博社报道,字节跳动正在开发一款用于实时空间视频生成的AI模型,最早可能下个月就会推出。具体时间尚未确定,计划可能有所变动。
该模型将基于字节跳动现有的视频生成系统 Seedance 构建,使用户能够创建用于直播、短剧和游戏的交互式虚拟世界。
报道中的技术规格引人注目:按需视频帧率约为每秒20帧,延迟约为0.05秒,视频在云端生成而非设备本地。远程渲染空间内容可减轻头显的计算负担,降低硬件处理能力,从而削减成本。
字节跳动旗下拥有扩展现实部门 Pico,该模型旨在生成能够对 Pico 用户的声音和动作做出反应的世界。若成功,XR领域的竞争将从硬件规格转向模型能力、云容量和内容分发,而这三方面字节跳动已具备优势。
据36氪今年早些时候报道,字节跳动已为2026年设定四大人工智能发展重点,其中“世界模型”位列榜首,其次是保持视频生成技术的领先地位、改进代码及实现豆包的商业化。世界模型占据了该公司所有模型方向中最大的数据预算,金额达八位数人民币,据称是竞争对手支出的三到四倍。
同一报告设定了明确目标:年底前发布至少一个世界模型,并与谷歌的Genie对标(Genie现允许用户在实时渲染的街景图像中漫步)。2026年初内部测试显示,字节跳动在该领域仍落后全球最先进水平约10%。若下个月发布,则比原计划提前。
据36氪,公司正同时推进两条路线:一是面向具身智能和机器人的视觉-语言-动作方法,二是面向娱乐和游戏的3D模拟。空间视频模型属于后者,已拥有一定的用户基础。
“世界模型”在此语境下,是指能够充分学习环境行为方式,从而渲染出对用户操作做出连贯响应的系统。视频公司纷纷涌入这一领域,因为训练材料本身就是视频,拥有最多视频素材且最擅长将其压缩为快速渲染格式的公司具备独特优势——字节跳动花了十年时间,为不同目的打造了类似流程。
目前,部分以娱乐产品为主的公司正对这一应用场景进行商业测试。
字节跳动的资金实力毋庸置疑。据彭博社,该公司上周获得300亿美元贷款,并一直在考虑斥资高达700亿美元用于人工智能基础设施建设。
Seedance 已为剪映 CapCut 和豆包提供技术支持;在国内市场,字节跳动仍是阿里巴巴、DeepSeek 和月之暗面等对手的有力竞争者。
#人工智能 #商业 #科技 #大模型 #字节跳动 #世界模型