1. 城镇大全网
  2. 综合百科

ps文件怎么保存为ai格式?PS打包实现AI图像论文

编辑:熊猫

Photoshop是修图的方式,NVIDIA是修图视频的方式。

前段时间Adobe推出了一款名为“神经滤镜”的工具包,将AI论文中所有常见的效果打包,比如上色、改变表情、改变年龄、超分辨率等等,集成到Photoshop中,让用户通过移动鼠标就可以使用这些功能。当时有人问“视频可以P吗?」

Photoshop作为一个专注于图像处理的软件,可能无法很好的回答这个问题。但同样深耕计算机视觉和计算机图形学的英伟达,用行动告诉我们,他们似乎正在朝这个方向努力。

今年10月初,英伟达推出了AI视频会议服务Maxine,这是一款GPU加速的AI视频会议软件。该公司将Maxine描述为“云原生”解决方案,它使用人工智能来提高分辨率,降低背景噪音,压缩视频,对齐人脸,并进行实时翻译和转录。

英伟达Maxine实现的视频会议超分辨率效果。

英伟达Maxine实现的视频会议压缩效果。

NVIDIA Maxine实现的视频会议人脸对齐功能。

据了解,开发者、软件合作伙伴、服务提供商均可申请玛克辛的提前使用权。

本文将解读Maxine的多重功能的工作机制以及与NVIDIA AI研究的关系。本文还将谈到英伟达AI驱动的视频会议平台中仍待解决的问题和可能的商业模式。

利用神经网络实现超分辨率

在展示Maxine的时候,英伟达介绍的第一个功能就是“超分辨率”,英伟达称“可以将低分辨率视频实时转换成高分辨率视频”。超分辨率技术允许视频会议参与者发送低分辨率的视频流,服务器可以使它们更清晰。这可以降低视频会议应用程序的带宽要求,并使其在网络连接不稳定的区域获得更稳定的性能。

提高可视化数据分辨率的一大挑战是如何填充缺失的信息。例如,您有一个具有一定数量像素的图像,您想要扩展它以包含更多像素。如何确定这些新像素的颜色?

以前的图像放大技术使用不同的插值方法(双三次插值、Lanczos插值等。)来填充原始像素之间的空空间。这些技术过于笼统,可能会混合不同类型的图像和背景。

机器学习的一个很大的优势就是经过调整后可以用于非常具体的任务。例如,基于视频会议流数据,可以使用缩减的视频帧及其对应的高分辨率原始图像来训练深度神经网络。只要有足够多的样本,神经网络就可以根据视频会议视觉数据(多为人脸)中发现的一般特征来调整其参数,从而在低到高分辨率转换任务中取得比一般放大算法更好的性能。一般来说,域越窄,神经网络越有可能收敛到非常高的精度。

利用人工神经网络放大视觉数据有着坚实的研究基础,包括NVIDIA在2017年的一篇论文,讨论了利用深度神经网络的通用超分辨率技术。

因为视频会议是一个非常具体的案例,所以训练有素的神经网络在这个任务中的表现肯定会比更一般的任务更好。除了视频会议,超分辨率技术还有其他应用场景。例如,电影行业可以使用深度学习来重现旧电影,以使它们具有更高的质量。

利用神经网络实现视频压缩。

AI视频压缩是Maxine演示中比较有趣的部分。英伟达在YouTube上发布的视频显示,通过使用神经网络压缩视频流,带宽可以从大约97kb/帧降低到大约0.12 KB/帧。然而,一些Reddit用户指出,这有点夸张。英伟达网站上说开发者可以“将带宽使用量降低到H.264视频压缩标准所需带宽的十分之一”,这听起来合理多了,但这仍然是一个惊人的数字。

英伟达的AI为什么能取得如此惊人的压缩比?公司的一篇博文更详细的解释了这项技术的工作细节:https://blogs。NVIDIA.com/blog/2020/10/05/gan-video-conferencing-Maxine/

神经网络可以提取并编码用户关键面部特征在每一帧中的位置,比压缩像素和颜色数据有效得多。此后,开始时获得的编码数据和参考视频帧将被发送到生成对策网络。这个GAN的训练目标是通过将面部特征投影到参考帧上来重建新的图像。

这个成果是基于NVIDIA之前的GAN研究,即把粗略的草图映射成详细的图像和绘画。

AI视频压缩再次表明,当领域较窄时,深度学习算法可以取得出众的性能。

使用深度学习的人脸对齐

面部对齐是指调整用户面部的角度,使其看起来像是面对摄像头。人脸错位是视频会议中的常见问题,因为人们倾向于看屏幕上其他人的脸,而不是盯着摄像头。

虽然NVIDIA没有透露太多细节,但是他们的博客里提到了他们在用GAN。不难想象,这个功能可以和AI压缩/解压技术捆绑在一起。Nvidia在人脸特征点检测和编码方面做了大量的研究,包括从不同角度提取人脸特征和凝视方向。这些代码可以被发送到可以将面部特征投影到参考图像的同一个GAN,然后让它完成所有其余的工作。

Maxine的深度学习模型是如何工作的?

Maxine还有很多其他的实用功能,包括集成了NVIDIA的conversation AI平台JARVIS。但这里就不赘述了。

不过,还有一些技术问题没有解决。例如,我们不知道Maxine中有多少功能运行在NVIDIA的服务器上,有多少运行在用户设备上。在回答TechTalks的提问时,英伟达发言人表示:“英伟达Maxine的设计目标是在云端实现AI功能,这样无论用户使用什么设备,每个人都可以使用。」

这种方法对于超分辨率、虚拟背景、自动对准和降噪都是合理的。但其他功能在云端毫无意义。AI视频压缩就是一个明显的例子。理想情况下,执行面部表情编码的神经网络必须运行在发送设备上,重建视频帧的GAN必须运行在接收设备上。如果把这些功能都交给服务器,就无法节省带宽,因为用户发送和接收的将是完整的视频帧,而不是较轻的面部表情编码。

理想情况下,NVIDIA应该提供一些配置机制,以便用户可以根据自己的网络和计算设备,在本地和云AI推理之间选择适当的平衡。举个例子,如果用户有一个拥有强大GPU的工作站,他可能希望将所有的深度学习模型完全运行在自己的电脑上,从而减少带宽占用,降低成本。另一方面,如果用户使用计算能力有限的移动设备加入会议,他可以选择放弃本地AI压缩,将虚拟背景和降噪任务交给Maxine server执行。

玛克辛的商业模式

在新冠肺炎疫情的压力下,许多公司都在实施自己的远程办公协议,所以现在是推广视频会议应用的绝佳机会。因为AI正处于炒作的高潮,为了提高销量,公司也愿意将自己的产品宣传为“AI驱动”。所以现在名字里带着“视频会议”“AI”的产品,其实都是有问题的,但是很多确实名副其实。

我们也有理由相信,玛克辛能在其他产品失败的地方取得成功。首先,英伟达在深度学习方面有着可靠的研究历史,尤其是在计算机视觉和最近的自然语言处理领域。该公司也有足够的基础设施和资金来继续推动AI模型的研发并提供给客户。当用户群增加时,英伟达的GPU服务器及其云提供商合作伙伴也有能力扩大规模。此外,英伟达最近收购ARM也使其有机会将这些AI能力部署到边缘设备上。(也许以后会有玛克辛驱动的视频会议摄像机产品?)

最后,Maxine是一个很好的利用专用AI的例子。与试图解决广泛问题的计算机视觉应用不同,Maxine的所有功能都是为特定场景设计的:一个人对着摄像机说话。许多实验表明,当问题的域扩大时,即使最先进的深度学习算法也会失去准确性和稳定性。反之,当问题范围缩小时,神经网络更有可能接近真实的数据分布。

但我们也知道,有效的技术和成功的商业模式之间存在着巨大的差异。

玛克辛目前处于早期接入模式,未来可能会有很大变化。目前,英伟达计划在其服务器上提供SDK和一套API,以便开发者将其集成到自己的视频会议应用中。企业视频会议行业已经有两大玩家:Teams和Zoom。Teams已经拥有大量AI驱动的功能,微软继续增加Maxine提供的功能并不困难。

玛克辛最终会采用什么定价模式?节省带宽的好处是否足以弥补其成本?Zoom、微软团队等大玩家是有和英伟达合作的动力,还是更愿意自己开发同样的功能?英伟达会延续目前的SDK/API模式,还是开发自己独立的视频会议平台?当开发人员探索这种新的人工智能驱动的视频会议平台时,英伟达必须回答这些问题和许多其他问题。

,

猜你喜欢:综合百科

综合百科ps文件怎么保存为ai格式?PS打包实现AI图像论文

转载请注明:原文链接 | http://www.nnxc.com.cn/10043353241.html