Stable Video 3D震撼登场:单图生成无死角3D视频、模型权重开放
创始人
2024-03-20 15:54:24
0

原标题:Stable Video 3D震撼登场:单图生成无死角3D视频、模型权重开放

机器之心报道

编辑:杜伟

3D 生成领域迎来新的「SOTA 级选手」,支持商用和非商用。

Stability AI 的大模型家族来了一位新成员。

昨日,Stability AI 继推出文生图 Stable Diffusion、文生视频 Stable Video Diffusion 之后,又为社区带来了 3D 视频生成大模型「Stable Video 3D」(简称 SV3D)。

该模型基于 Stable Video Diffusion 打造,能够显著提升 3D 生成的质量和多视角一致性,效果要优于之前 Stability AI 推出的 Stable Zero123 以及丰田研究院和哥伦比亚大学联合开源的 Zero123-XL。

目前,Stable Video 3D 既支持商用,需要加入 Stability AI 会员(Membership);也支持非商用,用户在 Hugging Face 上下载模型权重即可。

Stable Video 3D 的生成效果如下视频所示。

,时长

00:08

Stability AI 提供了两个模型变体,分别是 SV3D_u 和 SV3D_p。其中 SV3D_u 基于单个图像输入生成轨道视频,不需要相机调整;SV3D_p 通过适配单个图像和轨道视角扩展了生成能力,允许沿着指定的相机路径创建 3D 视频。

目前,Stable Video 3D 的研究论文已经放出,核心作者有三位。

  • 论文地址:https://stability.ai/s/SV3D_report.pdf
  • 博客地址:https://stability.ai/news/introducing-stable-video-3d
  • Huggingface 地址:https://huggingface.co/stabilityai/sv3d

技术概览

Stable Video 3D 在 3D 生成领域实现重大进步,尤其是在新颖视图生成(novel view synthesis,NVS)方面。

以往的方法通常倾向于解决有限视角和输入不一致的问题,而 Stable Video 3D 能够从任何给定角度提供连贯视图,并能够很好地泛化。因此,该模型不仅增加了姿势可控性,还能确保多个视图中对象外观的一致性,进一步改进了影响真实和准确 3D 生成的关键问题。

如下图所示,与 Stable Zero123、Zero-XL 相比,Stable Video 3D 能够生成细节更强、更忠实于输入图像和多视角更一致的新颖多视图。

此外,Stable Video 3D 利用其多视角一致性来优化 3D 神经辐射场(Neural Radiance Fields,NeRF),以提高直接从新视图生成 3D 网格的质量。

为此,Stability AI 设计了掩码分数蒸馏采样损失,进一步增强了预测视图中未见过区域的 3D 质量。同时为了减轻烘焙照明问题,Stable Video 3D 采用了与 3D 形状和纹理共同优化的解耦照明模型。

下图为使用 Stable Video 3D 模型及其输出时,通过 3D 优化改进后的 3D 网格生成示例。

下图为使用 Stable Video 3D 生成的 3D 网格结果与 EscherNet、Stable Zero123 的生成结果比较。

架构细节

Stable Video 3D 模型的架构如下图 2 所示,它基于 Stable Video Diffusion 架构构建而成,包含一个具有多个层的 UNet,其中每一层又包含一个带有 Conv3D 层的残差块序列,以及两个带有注意力层(空间和时间)的 transformer 块。

具体流程如下所示:

(i) 删除「fps id」和「motion bucket id」的矢量条件, 原因是它们与 Stable Video 3D 无关;

(ii) 条件图像通过 Stable Video Diffusion 的 VAE 编码器嵌入到潜在空间,然后在通向 UNet 的噪声时间步 t 处连接到噪声潜在状态输入 zt;

(iii) 条件图像的 CLIPembedding 矩阵被提供给每个 transformer 块的交叉注意力层来充当键和值,而查询成为相应层的特征;

(iv) 相机轨迹沿着扩散噪声时间步被馈入到残差块中。相机姿势角度 ei 和 ai 以及噪声时间步 t 首先被嵌入到正弦位置嵌入中,然后将相机姿势嵌入连接在一起进行线性变换并添加到噪声时间步嵌入中,最后被馈入到每个残差块并被添加到该块的输入特征中。

此外,Stability AI 设计了静态轨道和动态轨道来研究相机姿势调整的影响,具体如下图 3 所示。

在静态轨道上,相机采用与条件图像相同的仰角,以等距方位角围绕对象旋转。这样做的缺点是基于调整的仰角,可能无法获得关于对象顶部或底部的任何信息。而在动态轨道上,方位角可以不等距,每个视图的仰角也可以不同。

为了构建动态轨道,Stability AI 对静态轨道采样,向方位角添加小的随机噪声,并向其仰角添加不同频率的正弦曲线的随机加权组合。这样做提供了时间平滑性,并确保相机轨迹沿着与条件图像相同的方位角和仰角循环结束。

实验结果

Stability AI 在未见过的 GSO 和 OmniObject3D 数据集上,评估了静态和动态轨道上的 Stable Video 3D 合成多视图效果。结果如下表 1 至表 4 所示,Stable Video 3D 在新颖多视图合成方面实现了 SOTA 效果。

表 1 和表 3 显示了 Stable Video 3D 与其他模型在静态轨道的结果,表明了即使是无姿势调整的模型 SV3D_u,也比所有先前的方法表现得更好。

消融分析结果表明,SV3D_c 和 SV3D_p 在静态轨道的生成方面优于 SV3D_u,尽管后者专门在静态轨道上进行了训练。

下表 2 和表 4 展示了动态轨道的生成结果,包括姿势调整模型 SV3D_c 和 SV3D_p,后者在所有指标上实现了 SOTA。

下图 6 中的视觉比较结果进一步表明,与以往工作相比,Stable Video 3D 生成的图像细节更强、更忠实于条件图像、多视角更加一致。

更多技术细节和实验结果请参阅原论文。

相关内容

热门资讯

“AI医生”加速进化!两天完成... 转自:上观新闻 清华大学智能产业研究院院长张亚勤近日在接受第一财经的电视节目采访时表示,AI医院用...
华为下半年新机曝光:9月发布M... 7月8日消息,今年华为Pura 80系列已经发布,下半年将会是Mate系列的天下。 博主“超维界”曝...
百余台机器人员工战高温保供电 机器狗走出窝 无人机飞出巢 百余台机器人员工战高温保供电 湖北日报全媒记者 彭一苇 通讯员 孔韬 ...
淘宝大战美团,他们怎么又搞了个... 又要到饭了,兄弟们! 免费的果汁, 6 毛的可乐, 4 块的奶茶,这个周末的外卖大战,差评君就差没把...
海尔智家获得实用新型专利授权:... 证券之星消息,根据天眼查APP数据显示海尔智家(600690)新获得一项实用新型专利授权,专利名为“...
国家网络安全通报中心:发现一批... 据微信公众号“国家网络安全通报中心”7月7日消息,中国国家网络与信息安全信息通报中心通过支撑单位发现...
大学里的普通物理学:涵盖多领域... 大学里的普通物理学课程包括了力学、热学、电磁学、光学以及现代物理等多个领域,对于理工科学生来说,这是...
罗马仕充电宝充电再爆炸,召回风... 本文基于以下微博话题的智搜结果生成 以下为关于「罗马仕充电宝充电爆炸」事件的核心信息整合,结合时间线...
诚志永华申请液晶组合物及其应用... 金融界2025年7月7日消息,国家知识产权局信息显示,石家庄诚志永华显示材料有限公司申请一项名为“液...
海尔智家获得发明专利授权:“燃... 证券之星消息,根据天眼查APP数据显示海尔智家(600690)新获得一项发明专利授权,专利名为“燃气...
浙江首例,国产显微外科机器人在... 017日上午,宁波市第六医院院长王欣查看61岁王阿姨手部术后情况,诊断移植皮瓣血运良好,此为浙江省首...
防御台风“丹娜丝” 瑞安639... 为应对今年4号台风“丹娜丝”,7月6日下午,市农业农村局海洋与渔业执法大队在飞云江流域进行巡逻,排查...
航天中心医院苏家坨院区将于今年... 新京报讯 据“北京海淀”微信公众号消息,位于海淀区北部的航天中心医院苏家坨院区即将于今年下半年正式投...
湖北荆州打造绿色智慧用能示范医... 一站式绿色智慧用能服务中心。 在医院的一站式绿色智慧用能服务中心大厅,屏幕上用能数字在不断变幻跳动,...
“AI+绿色发展”:为守护绿水... 6日,“AI+绿色发展”论坛作为2025年生态文明贵阳国际论坛的系列活动之一在贵阳举办。 国内AI领...
太赫兹+声波!我国科学家使无针... 新华社天津7月7日电近日,我国科研人员开发了一种新型太赫兹光声系统,在无针诊断领域迈出了重要一步。该...
原创 哈... 摘要:近日,上海昇视唯盛科技有限公司携“激光+地轨+悬臂”全场景智能机器人工作站方案在第28届埃森展...
全国首个深空探测领域国际科技组... 据安徽省人民政府消息,国际深空探测学会成立大会7月7日在安徽合肥举行,这是全国首个深空探测领域国际科...
沧州为现代农业装上“智慧大脑” 建设示范园区 应用大数据技术 推广智能农机装备 沧州为现代农业装上“智慧大脑” 河北日报客户端讯(记...
荐读•悦科普 |《现实不似你所... 爱科普,读科普 悦科普,尽在数读空间 推荐语: 陈嘉映盛赞的物理学家卡洛·罗韦利重磅作品,带你在《七...