过去两年,AI爆发出了惊人的创造力。下一步,我们该如何与所创造的世界交互?
这正是Noiz团队成员们持续想象、持续创造的命题。
2024年以来,AI内容生成迎来了真正的商业爆发。
OpenAI用ChatGPT打开了生成式AI时代;Midjourney、Runway、Pika、Luma、Seedance、PixVerse、Minimax H3、Wan3.0等一批生成模型快速崛起,AI视频、AI图片、AI音频相继完成商业验证。
随着AI内容生成进入商业化增长的快车道,资本也开始押注下一代AI。
李飞飞创办的World Labs完成10亿美元融资,几乎同时,杨立昆的AMI Labs也完成了10.3亿美元融资。
Google DeepMind、Meta、NVIDIA等科技巨头纷纷布局,行业的焦点,逐渐从「生成内容」转向「理解世界」。
然而,当这些模型真正进入产品时,AI领域迎来全新的挑战:
今天的大多数多模态模型,依然擅长生成(Generate),却无法实现沉浸式交互(Interact)。
它们可以按照指令生成一段视频、一张图片、一段语音,却无法持续理解环境变化,也无法随着用户行为实时响应。AI更像一个内容生成器,而不是一个能够持续参与世界的智能体。
更重要的是,交互远比生成昂贵得多。
一次内容生成,只需要完成一次推理;而实时交互意味着模型需要持续感知、持续推理,并在几十毫秒内不断响应。
GPU不再工作几秒,而是持续在线运行,推理成本往往比传统生成高出一个数量级。
这也是为什么,实时可交互多模态至今仍然很少真正进入产品。
就在这块空白里,一家成立数月的神秘团队Noiz,选择了一条几乎完全不同的路线——
他们训练出了新一代实时可交互多模态模型,推理成本仅为当前主流音视频模型百分之一。


