张一鸣亲自督导 字节跳动最快下月发布空间视频生成AI

AI 驱动中国 温言 54 次阅读
分享 Q

驱动中国9月7日消息,字节跳动正在推进一款实时空间视频生成AI模型的开发,有消息显示这一项目的关键环节由创始人张一鸣亲自督导,最快下个月就有望对外发布。若进展顺利,这将成为字节跳动在生成式AI视频方向上又一次关键落子。

从技术方向看,所谓实时空间视频生成,不只是让模型输出一段连续画面,而是强调生成结果具备空间一致性,能够在视角移动、镜头变化或场景切换时保持物体和布局的相对稳定。相比普通文生视频,它对模型的推理速度、动态建模能力和画面可控性提出了更高要求,也更接近“可在交互场景中直接使用”的生成形态。

字节跳动在AI生成内容上布局已久,产品和团队在图像、视频、音频等多种模态上均有积累。此次传出由张一鸣直接督战,说明公司对这一项目并非试探性投入,而是把它放到内容生态和平台能力的战略位置。创始人亲自关注模型研发进度,也可以理解为团队在资源调配和跨部门协同上需要更高层面的推动。

在视频生成赛道,业内正在从追求单段视频的画面质量,转向追求实时响应、可控生成和空间理解。尤其是空间视频生成能力,被视为连接短视频、虚拟现实、增强现实、游戏和具身智能等场景的技术枢纽。字节跳动选择在这一时间点切入,既是对现有视频生成能力边界的补全,也可能是为下一阶段的AI原生内容形态做准备。

从应用侧来看,空间视频生成一旦实现实时,可以大幅降低三维视觉内容的制作成本。传统影视、广告和游戏领域制作空间视频通常依赖人工建模、动捕和渲染管线,耗时耗力。如果AI模型能够通过文本或简单指令在短时间内生成拥有空间关系的视频,原本高门槛的生产环节有可能被重塑。对于拥有庞大内容平台和创作者生态的字节跳动,这种能力存在向工具、特效、直播互动甚至硬件场景延伸的可能。

不过,实时空间视频生成仍面临明显的工程挑战。视频生成本身需要处理大量token和高维特征,实时生成对算力消耗和推理延迟的要求极为苛刻;空间一致性又要求模型具备更强的三维认知,不能仅靠像素层面的拟合。即便模型发布,距离稳定的产品化体验可能还有一段调整期。消息中提到的发布时间只有模糊区间,最终能否如期亮相仍是未知数。

对行业而言,字节跳动加入空间视频生成赛道,会进一步加剧大模型公司的竞争。过去一年,文生视频、图生视频、视频编辑等方向已有多款产品上线,但真正能兼顾实时与空间关系的成果仍然稀少。若字节跳动下月真的发布相关模型,等于把视频生成的竞赛推向下一个阶段:比的不再是谁能生成更酷的单条视频,而是谁能打通生成能力与真实空间体验之间的链路。

目前,相关消息尚未获得字节跳动官方确认,项目名称、具体能力和开放方式也未有更多细节流出。可以确定的是,字节跳动在AI方向上的投入仍在持续加码,张一鸣个人对前沿技术项目的介入,也让外界对这项新模型的规格抱有更高期待。后续官方若披露更多信息,模型的实际效果和落地场景将逐步清晰。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com
本文价值 成为第一个评分的人
登录后为本文打分
网友评论0 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友