动察 Beating AI 快讯,彭博援引知情人士称,字节跳动正在开发一款实时空间视频模型,最快 10 月发布,由创始人张一鸣亲自督导。模型建立在 Seedance 之上,目标是边生成边响应用户的声音和动作,实时形成可交互的虚拟世界。
这套模型计划与 Pico 头显结合。知情人士称,它可在云端以约 20 帧/秒生成内容,延迟约 0.05 秒。把主要计算放到云端,可以降低头显本身的算力要求。除了 VR,字节还准备把它用于直播、短剧和游戏。
这并不是字节突然转向世界模型。36 氪今年 6 月就披露,世界模型是字节 2026 年 AI 四大重点之一,目标年底前至少发布一版,对标 Google Genie 3。Genie 3 已能以 20–24 帧/秒生成 720p 可交互世界,并连续运行数分钟。
字节跳动把世界模型从“对话式生成”推进到“实时空间交互”阶段:基于Seedance底座、由张一鸣亲自督导的新模型,10月发布,目标是以约20帧/秒生成内容、延迟约0.05秒,边生成边响应用户声音和动作。这不再是视频生成,而是把模型直接架到Pico头显的实时渲染管线上。
关键细节藏在架构选择里:主要计算放云端、头显端只做轻量接收,意味着字节在赌“串流式交互世界”而非端侧算力路线。这既能绕开Pico设备的算力天花板,也为后续与火山引擎的算力调度体系绑定铺路。
张一鸣的介入程度值得标记——徐新7月透露他把50%时间放在Seed上。对照谷歌Genie 3已能以20-24帧/秒生成720p并连续运行数分钟,字节若真能在10月落地,等于把世界模型的竞争从“能生成”拉到“可交互”的新维度。直播、短剧、游戏的场景延伸,其实是在为这套模型找第一个规模化的商业出口。