杀疯了!谷歌卷视频到语音,逼真音效让AI视频告别无声!
创始人
2024-06-18 16:02:05
0

机器之心报道

编辑:杨文

AI圈这遍地开花的大好局面,让吃瓜群众们甚是惊喜。

这几天,大洋彼岸杀疯了!

Luma 的热乎劲儿还没过去,昨晚 Runway 就甩出一个王炸 ——Gen-3 Alpha。(查看详情请移步:Runway 版 Sora 发布:高保真、超强一致性,Gen-3 Alpha 震撼到网友了)

更没想到的是,一觉醒来,Google DeepMind 也有了新消息,悄咪咪地发布了视频生成语音(V2A)技术的进展。

虽然这一功能还未向公众开放,不过从官方放出的视频 Demo 来看,效果那是相当丝滑。同时,Google DeepMind 强调,所有示例均由 V2A 技术和他们最先进的生成视频模型 Veo 联手打造。

音频提示: 紧张刺激的恐怖片配乐,脚步声在混凝土上回响。(Cinematic, thriller, horror film, music, tension, ambience, footsteps on concrete)

黑灯瞎火的废弃仓库中,一个黑衣人犹如鬼魅般缓行,再配上诡异的音乐和脚步声,恐怖气氛拉满。

音频提示: 狼在月光下的长嚎。(Wolf howling at the moon)

视频链接:https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2650922381&idx=2&sn=c9a8b5f76f64d29900501ada9f0cde5f&chksm=84e419f3b39390e54a074c569dd1fd1f2ae7ae281132fa5bcf22bcb4161d18a14168d50cc26d&token=1562101861&lang=zh_CN#rd

视频 Demo 一出,评论区清一水的追问:啥时候能用?

还有网友寄希望于开源社区当一回赛博菩萨,复制谷歌的这一技术。

其实,就在 Google DeepMind 官宣没多久,AI 音频领域的「扛把子」ElevenLabs 横插一脚,开源了一个上传视频自动配音的项目,可以为视频生成合适的音效。

链接:

https://elevenlabs.io/docs/api-reference/how-to-use-text-to-sound-effects

如今 AI 圈子的竞争已呈白热化,大小厂的你追我赶将会创造更加公平的竞争环境,而一旦这些技术成熟,AI 视频领域将会有无限可能。

AI 视频告别无声电影

众所周知,视频生成模型正以惊人的速度发展。不过,无论是年初惊艳世人的 Sora,还是近期的可灵、Luma、Gen-3 Alpha,生成的全是「无声电影」,无一例外。

而 Google DeepMind 的视频生成音频 (V2A) 技术,使得同步的视听生成成为可能。它可以结合视频像素和自然语言文本提示,为屏幕上的动作生成丰富的配音。

从技术应用上来说,V2A 技术能够与 Veo 等视频生成模型结合,创造出具有戏剧性配乐、逼真音效或与视频角色以及风格相匹配的对话镜头。

它还能为档案材料、无声电影等传统影像生成音轨,拓宽创作的可能。

音频提示: 可爱的幼年恐龙在丛林中啁啾,伴随着蛋壳的破裂声。(Cute baby dinosaur chirps, jungle ambience, egg cracking)

视频链接:https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2650922381&idx=2&sn=c9a8b5f76f64d29900501ada9f0cde5f&chksm=84e419f3b39390e54a074c569dd1fd1f2ae7ae281132fa5bcf22bcb4161d18a14168d50cc26d&token=1562101861&lang=zh_CN#rd

音频提示: 汽车打滑声、引擎轰鸣声,伴随着天使般的电子音乐。(cars skidding, car engine throttling, angelic electronic music)

视频链接:https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2650922381&idx=2&sn=c9a8b5f76f64d29900501ada9f0cde5f&chksm=84e419f3b39390e54a074c569dd1fd1f2ae7ae281132fa5bcf22bcb4161d18a14168d50cc26d&token=1562101861&lang=zh_CN#rd

音频提示: 日落时分,草原上响起悠扬的口琴声。(a slow mellow harmonica plays as the sun goes down on the prairie)

视频链接:https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2650922381&idx=2&sn=c9a8b5f76f64d29900501ada9f0cde5f&chksm=84e419f3b39390e54a074c569dd1fd1f2ae7ae281132fa5bcf22bcb4161d18a14168d50cc26d&token=1562101861&lang=zh_CN#rd

V2A 技术能够为任何视频输入生成无限数量的音轨。用户可以选择定义「正向提示」来引导生成期望的声音,或者「负向提示」来避免不期望的声音。

这种灵活性让用户对音频输出有了更多的控制,可以快速尝试不同的音频输出,并选择最佳匹配。

音频提示:一艘宇宙飞船在浩瀚的太空中疾驰,星星在它周围划过,高速飞行,充满科幻感。(A spaceship hurtles through the vastness of space, stars streaking past it, high speed, Sci-fi)

视频链接:https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2650922381&idx=2&sn=c9a8b5f76f64d29900501ada9f0cde5f&chksm=84e419f3b39390e54a074c569dd1fd1f2ae7ae281132fa5bcf22bcb4161d18a14168d50cc26d&token=1562101861&lang=zh_CN#rd

音频提示:天籁般的大提琴氛围(Ethereal cello atmosphere)

视频链接:https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2650922381&idx=2&sn=c9a8b5f76f64d29900501ada9f0cde5f&chksm=84e419f3b39390e54a074c569dd1fd1f2ae7ae281132fa5bcf22bcb4161d18a14168d50cc26d&token=1562101861&lang=zh_CN#rd

音频提示:一艘宇宙飞船在广袤的太空中高速穿梭,星星在它周围飞速掠过,具有科幻感。(A spaceship hurtles through the vastness of space, stars streaking past it, high speed, Sci-fi)

视频链接:https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2650922381&idx=2&sn=c9a8b5f76f64d29900501ada9f0cde5f&chksm=84e419f3b39390e54a074c569dd1fd1f2ae7ae281132fa5bcf22bcb4161d18a14168d50cc26d&token=1562101861&lang=zh_CN#rd

背后的工作原理

研究团队尝试了自回归和扩散方法,以发现最可扩展的 AI 架构。扩散方法在音频生成上给出了最真实和引人入胜的结果,用于同步视频和音频信息。

V2A 系统首先将视频输入编码成压缩表示,然后扩散模型从随机噪声中迭代细化音频。这个过程由视觉输入和给定的自然语言提示指导,生成与提示紧密对齐的同步、逼真音频。最终,音频输出被解码成音频波形,并与视频数据结合。

为了生成更高质量的音频并引导模型生成特定声音,研究团队在训练过程中添加了更多信息,包括 AI 生成的注释,详细描述声音和对话文本。

通过在视频、音频和额外注释上的训练,该技术学会将特定的音频事件与各种视觉场景关联起来,同时响应注释或文本中提供的信息。

谷歌方面强调,他们的技术与现有的视频到音频解决方案都不同,因为它可以理解原始像素,并且添加文本提示是可选的。此外,该系统不需要手动对生成的声音与视频进行对齐,极大地简化了创作流程。

视频链接:https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2650922381&idx=2&sn=c9a8b5f76f64d29900501ada9f0cde5f&chksm=84e419f3b39390e54a074c569dd1fd1f2ae7ae281132fa5bcf22bcb4161d18a14168d50cc26d&token=1562101861&lang=zh_CN#rd

不过,谷歌的这一技术也并非完美,他们仍在努力解决一些 bug。例如,视频输入的质量直接影响音频输出的质量,视频中的伪影或失真可能导致音频质量下降。

同时,他们也在优化唇形同步功能。

V2A 技术尝试从输入文本中生成语音,并将其与角色的口型动作进行同步,但若视频模型未针对文本内容进行相应的调整,就可能导致口型与语音不同步。他们正改进这一技术,以提升唇形同步的自然度。

音频提示:音乐,文本转录「这只火鸡看起来好极了,我好饿。」(Music, Transcript: “this turkey looks amazing, I’m so hungry”)

视频链接:https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2650922381&idx=2&sn=c9a8b5f76f64d29900501ada9f0cde5f&chksm=84e419f3b39390e54a074c569dd1fd1f2ae7ae281132fa5bcf22bcb4161d18a14168d50cc26d&token=1562101861&lang=zh_CN#rd

或许是由于深度伪造技术带来诸多社会问题,Google DeepMind 求生欲满满,一个劲承诺将负责任开发和部署 AI 技术,在向公众开放之前,V2A 技术将经过严格的安全评估和测试。

此外,他们还整合了 SynthID 工具包到 V2A 研究中,为所有 AI 生成的内容添加水印,以防止技术的滥用。

参考链接:

https://deepmind.google/discover/blog/generating-audio-for-video/

https://x.com/GoogleDeepMind/status/1802733643992850760

相关内容

热门资讯

百镜出道,C位依旧:WAIC顶... 来源:雷科技 如果说 WAIC 2025 是今年 AI 硬件的「集体高考」,那 Rokid Glas...
韩媒:韩国扶持五大联合体开发“... 综合韩联社、《朝鲜日报》和《京乡新闻》等韩媒报道,韩国政府4日正式选定NAVER Cloud、Ups...
录取通知书的“飞驰”之路 7月盛夏,安徽省近50万封承载着无数学子青春梦想与家庭期盼的高考录取通知书,正从四面八方“飞驰”向它...
凡知智造取得恒温核酸扩增分析仪... 金融界2025年8月6日消息,国家知识产权局信息显示,山东凡知智造医药科技有限公司取得一项名为“一种...
原创 离... [撒花] 随着科技的不断发展,“仿人形机器人”也变的越来越成熟了,AI的加持也让这些机器人变的更加智...
当AI化身“全能助手”,人类的... 正在屏幕前玩手机的你 有没有过这样的体验? 遇到不懂的问题 第一反应不是翻书思考 而是脱口而出“嘿 ...
珠海创信电子取得电路板用锡膏检... 金融界2025年8月6日消息,国家知识产权局信息显示,珠海创信电子有限公司取得一项名为“一种电路板用...
NBN Co转投亚马逊柯伊伯计... 来源:C114通信网 C114讯 北京时间8月6日晚间消息(蒋均牧)NBN Co与亚马逊达成协议,通...
石景山这家医院药品有了“电子身... “窗口不用一盒盒扫码吗?取药几乎不用排队,这速度真给力!”在北京大学首钢医院门诊药房,刚取到药的患者...
电力数据“会说话” 点亮智慧新... 本文转自【新华社】 新华社北京8月6日电 《经济参考报》8月6日刊发记者邓林如采写的文章《电力数据“...
国能新疆红沙泉二号矿实现纯电无... 近日,在国家能源集团新疆红沙泉二号露天煤矿(以下简称“红二矿”),58台无人驾驶矿卡正高效运转,其中...
普天科技:致力数据治理领域打造... 金融界8月6日消息,有投资者在互动平台向普天科技提问:公司相关产品或技术有哪些能为人工智能赋能?谢谢...
DeepMind发布Genie... 来源:至顶网 尽管目前还没有人找到通过生成式人工智能赚钱的可靠方法,但这并没有阻止Google D...
【喜讯】骨三科陈美玲在全国竞赛... 8月2日,在全国首届护理AI创新应用技能挑战赛决赛中,我院骨三科陈美玲的作品《创新聚力赋能发展——A...
微信内存一下就少了10G上热搜... 站长之家(ChinaZ.com)8月6日 消息:今日,微博热搜榜上#微信内存一下子就少了10G#的话...
我是宁波技能冠军④丨这些技能高... 前言 从工业设备控制(PLC)、工业机器人系统操作等“硬核”制造能力,到人工智能训练、网络安全等高科...
聚焦人工智能产业链 山东蓄力打... 中新网济南8月6日电 (记者 沙见龙)“这项体系如同人工智能产业的‘中央厨房’,能根据不同行业的差异...
2025未来科学大奖揭晓,他们... 科学之光照亮人类未来。6日,备受关注的2025未来科学大奖揭晓。这个夏天,“高冷”的基础研究再次变得...
为什么CA需要有《电子认证服务... 来源:SSL_SecureSocketLayer 1. CA是什么?—— 数字世界的「信任基石」 C...
2025 年 2 款华为会议记... 现在远程会议越来越多,不管是企业还是个人,都需要能快速整理会议记录的工具。我作为科技产品体验师,选了...