z6娱乐

z6娱乐

采办
京东 淘宝

z6娱乐中光提出3D智能抠图算法:实现复杂布景下的通用抠图

  • 2021.10.09
  • Orbbec

【本文转载自公家号“推算机视觉life”】

导言:在VALSE 2021大会上,,,, ,,z6娱乐中光展示自研的最新3D智能抠图算法。。。。。。 。该算法专为近年鼓起的视频会议与直播带货等场景研发,,,, ,,可实时抠取清澈的3D人像及物品,,,, ,,添补了传统2D抠图的诸多局限性。。。。。。 。本文中,,,, ,,z6娱乐中光钻研院杨飞宇博士将具体论述3D智能抠图算法的技术道理,,,, ,,并对3D抠图对比2D抠图的成效提升做出具体分析。。。。。。 。

1. 布景

随着视频职能的宽泛使用,,,, ,,直播带货和视频会议产业蓬勃发展。。。。。。 ???? ? ???偻甲魑幌罱副晡锾搴筒季胺掷氲募际酰, ,,被宽泛利用于直播带货和视频会议领域。。。。。。 。好比,,,, ,,在直播带货时,,,, ,,通过将布景渲染成华丽的直播间来吸引粉丝。。。。。。 。又好比,,,, ,,在视频会议时,,,, ,,将家庭布景代替为其他布景,,,, ,,来保;;;;;;び牖嵴叩囊衷。。。。。。 。

然而,,,, ,,传统的2D抠图存在较多局限性。。。。。。 。z6娱乐中光自研的最新3D智能抠图算法,,,, ,,可能很好地添补2D抠图的弊端。。。。。。 。

绿幕抠图用于直播带货和人像抠图用于视频会议

2. 2D抠图存在的问题

2.1. 绿幕抠图:成本高,,,, ,,使用难题,,,, ,,不能抠绿色物品

绿幕抠图是在以绿幕搭建的拍摄场景下拍摄出绿幕视频,,,, ,,并在造作后期凭据色彩匹配去掉布景像素,,,, ,,以提取远景的一种抠图方式。。。。。。 。绿幕抠图被宽泛用于直播和影视造作傍边,,,, ,,拥有两大利益:优良的抠图成效和可能抠肆意类此外物品。。。。。。 。

但是,,,, ,,绿幕抠图也存在3个显著的弊端。。。。。。 。首先,,,, ,,由于布景的色彩是绿色,,,, ,,那么为了获取比力真实的远景致彩,,,, ,,在远景中就不能出现和布景致彩靠近的绿色物品,,,, ,,好比某些绿色植物。。。。。。 。

其次,,,, ,,绿幕环境成本高,,,, ,,搭建难题。。。。。。 。为了保障抠图的质量,,,, ,,绿幕摄影棚对光照拥有较高的要求。。。。。。 。好比要求选取均匀的光照以保障绿色布景的一致性,,,, ,,并且要求选取多个光源来预防阴影的产生。。。。。。 。这使得绿幕环境拥有较高的成本,,,, ,,京东上一套通常级此外绿幕抠图环境,,,, ,,蕴含灯光组、布景布、支架等,,,, ,,价值能够达到数千元,,,, ,,并且繁琐且复杂搭建过程对于幼白用户也极度不敦睦。。。。。。 。

最后,,,, ,,由于绿幕摄影棚设备多多,,,, ,,不能移动,,,, ,,也使得在活动中的拍摄受到了摄影棚大幼的限度。。。。。。 。

绿幕抠图场景和设备

2.2. 视频会议软件:只能抠人,,,, ,,不能抠物品,,,, ,,不能保;;;;;;ひ衷

由于新冠疫情的影响,,,, ,,远程办公已经成为越来越普遍的工作方式。。。。。。 。视频会议软件作为远程办公的基础工具,,,, ,,受到宽泛利用。。。。。。 。常见的视频会议软件都提供了2D抠图即虚构布景职能,,,, ,,为用户提供了肯定的保;;;;;;ひ衷和增长趣味性的作用,,,, ,,如腾讯会议、Zoom、Microsoft Teams、飞书、钉钉等。。。。。。 。

相比绿幕抠图,,,, ,,视频会议的抠图拥有便携、单一易用的利益。。。。。。 。但是,,,, ,,现有商用软件的抠图职能也并非优美绝伦,,,, ,,而是普遍存在以下两个弊端:

首先,,,, ,,不能抠物品。。。。。。 。在会议过程中,,,, ,,与会人员通常必要展示文件或者物品。。。。。。 。然而,,,, ,,受到算法自身的限度,,,, ,,视频会议软件只能抠图人的部门,,,, ,,不能抠取物品的部门。。。。。。 。只有当物品被放在人的区域以内的时辰,,,, ,,物品才可能被当做人的一部门,,,, ,,被一路抠出来。。。。。。 。这样的限度严沉地影响了用户的使用履历。。。。。。 。

视频会议软件的2D抠图存在细节迷失和多抠布景人物的问题

另表,,,, ,,视频会议软件并不成能起到很好的保;;;;;;ひ衷的作用。。。。。。 。主流视频会议软件所选取的抠图算法重要是基于2D图像的人像宰割,,,, ,,这使得任何被算法鉴别为人的区域城市被抠出来,,,, ,,好比墙上的人像绘画、布景中的不有关人员等城市被算法抠出,,,, ,,导致被视频会议的另一方看见。。。。。。 。此时虚构布景并不能起到保;;;;;;ひ衷的作用,,,, ,,这种情况显然是用户不仅愿产生的。。。。。。 。

2.3. 抠取物品和无布景建模的矛盾

在2D抠图的算法中,,,, ,,抠取物品通常必要布景建模。。。。。。 。好比绿幕抠图是通过限度布景致彩来进行布景建模的一种战术。。。。。。 。除了绿幕抠图的布景建模之表,,,, ,,微软提出一种肆意布景建模的算法Background Matting [1, 2]。。。。。。 。它选取拍一张固定布景的方式来进行布景建模,,,, ,,这使得该算法可能抠取场景以内的肆意物品。。。。。。 。

Background Mating的布景建模过程

纹理相近时布景建模的2D抠图失效

但是,,,, ,,这同时也带来了很多局限性。。。。。。 。首先,,,, ,,布景建模后拍照机就不能移动,,,, ,,由于移动会导致已经拍好的布景失效。。。。。。 。这使得活动中的拍摄(好比车内视频会议)无法实现,,,, ,,一点点滋扰(如手机的震荡)就会使算法的成效受到严沉粉碎,,,, ,,只能沉启算法能力解决问题。。。。。。 。

其次,,,, ,,当人物和布景致彩相近时算法也会失效。。。。。。 。好比穿白色衣服的人身后有白色墙面,,,, ,,这时算法不能分辨远景和布景,,,, ,,导致人的衣服不能被很好地抠出。。。。。。 。

最后,,,, ,,由远景导致的阴影区域也会被一起抠出。。。。。。 。由于在布景拍摄时阴影是不存在的,,,, ,,算法会误以为阴影区域就是远景,,,, ,,将其谬误地抠出。。。。。。 。

为了实现抠物品的主张,,,, ,,除了布景建模的步骤,,,, ,,有人提出也能够用语义宰割算法。。。。。。 。好比在COCO [3]数据集上训练的语义宰割模型,,,, ,,选取多分类的步骤也能够对物品进行宰割。。。。。。 。但是,,,, ,,语义宰割算法是凭据类别来宰割物体的,,,, ,,好比通过COCO数据集训练的算法能够对80类物品进行宰割,,,, ,,这样的种类数量在真实的利用场景下是远远不够的。。。。。。 。以直播带货为例,,,, ,,带货的主播今天甚至不知路明天要带货的商品是什么种类。。。。。。 。因而,,,, ,,语义宰割步骤从道理上并不合用。。。。。。 。

3. z6娱乐中光3D智能抠图

3.1. 根基思想

针对以上2D抠图的弊端,,,, ,,z6娱乐中光提出一种基于RGB-D的抠图的步骤,,,, ,,可能很好地添补2D抠图的缺点,,,, ,,为用户提供更优质的直播带货和视频会议履历。。。。。。 。

z6娱乐中光3D抠图的根基思想是利用三维空间的距离信息来分辨必要抠取的远景(好比主播和商品)与不必要被抠出的布景(好比墙面,,,, ,,杂物和不有关的人物)。。。。。。 。

利用深度图和彩色图预测远景的宰割

首先,,,, ,,用户能够自界说一个感兴致的距离领域l,,,, ,,好比距离相机l=1m 的距离,,,, ,,并且让所有必要被抠出的指标处于幼于l领域内,,,, ,,不有关的布景都处于大于或蹬宗l领域之表。。。。。。 。在使用的过程中,,,, ,,距离l能够凭据用户的必要在线扭转,,,, ,,而不用沉启算法。。。。。。 。

而后,,,, ,,利用深度图的距离信息,,,, ,,能够获取领域内远景的mask。。。。。。 。为了更好地获取边缘细节,,,, ,,我们将mask转化为trimap(三色图:远景=255,,,, ,,布景=0,,,, ,,未知区域=128)。。。。。。 。

最后将color和trimap图通过神经网络推理,,,, ,,预测远景的精密蒙版,,,, ,,即用于抠图的alpha图。。。。。。 。

α=N[θ;c,T(d

其中α代表远景的alpha图;;;;;;;N代表神经网络;;;;;;;θ代表神经网络的参数;;;;;;;c代表彩色图;;;;;;;d代表深度图;;;;;;;T代表由mask天生trimap的函数。。。。。。 。

3.2. 算法设计

我们设计了如下的网络来进行远景宰割的预测。。。。。。 。首先,,,, ,,思考到这项工作的主张是去精密化所给trimap的边缘,,,, ,,因而网络的头部并不必要太多的语义信息,,,, ,,所以我们将常见的5次下采样简化到3次。。。。。。 。

而后,,,, ,,trimap和color被别离提取特点之后进行融合,,,, ,,用于跳跃衔接为网络的头部补充越发丰硕的细节信息,,,, ,,推进边缘的精密化预测。。。。。。 。同时我们提出了FFM(feature fusion module)???? ? ???槔赼ttention的机造,,,, ,,来提高融合的成效。。。。。。 。

最后,,,, ,,我们选取逐级精密化的步骤把以上网络作为一个stage,,,, ,,用多个stage串联的方式使得预测的宰割越来越精密。。。。。。 。并且能够通过调整stage的数量实现精度和速度直接调节。。。。。。 。

处置图像的神经网络结构

上述的神经网络结构可能较好地预测单张图片的边缘信息。。。。。。 。然而,,,, ,,在现实利用过程中我们处置的更多的是视频信息。。。。。。 。

我们在利用以上网络对视频信息进行处置的时辰发现,,,, ,,预测的远景边缘拥有比力显著的抖动。。。。。。 。这种抖动重要来自于RGB-D相机的深度图和帧间信息的缺失。。。。。。 。目前的深度相机或多或少均存在抖动或者关联信息缺失导致的不变性问题,,,, ,,选取基于ToF的RGB-D相机可使边缘更不变。。。。。。 。但是,,,, ,,即便选取了ToF相机,,,, ,,由于帧与帧之间的关联信息的缺失,,,, ,,也会导致抠图的成效不足不变性。。。。。。 。

为相识决以上问题,,,, ,,我们进一步改进了单帧图像的神经网络,,,, ,,增长了帧间信息的处置机造。。。。。。 。我们在原有输入的基础上增长一个temporal分支,,,, ,,用于提供上一帧的信息。。。。。。 。 该分支的输入为上一帧的彩色图color_(t-1)和上一帧预测的宰割alpha_(t-1)。。。。。。 。尝试批注,,,, ,,增长上一帧的彩色图有利于移植急剧移动时的拖影,,,, ,,而增长上一帧的宰割有利于维持静止状态下的不变性。。。。。。 。

处置视频的神经网络结构

3.3. 数据筹备

为了使算法在复杂布景下拥有较好的抠图成效,,,, ,,我们设计了以下数据采集规划。。。。。。 。

针对复杂布景的视频会议和直播带货数据采集

(1)选择复杂的布景环境,,,, ,,好比盛开的办公室环境,,,, ,,拥有较强的杂物和光线的滋扰,,,, ,,增长模型在复杂环境下的鲁棒性。。。。。。 。

(2)为了加强算法抠取物品的能力,,,, ,,我们让采集人员手持物品,,,, ,,好比书本和水杯,,,, ,,通过这种方式能够模拟直播带货的场景需要。。。。。。 。

(3)我们观察到现有的视频会议软件敌手指部门并不成能很好地抠出。。。。。。 。为了更好地抠取人像的细节,,,, ,,我们增长手指部门的图像,,,, ,,使得在抠取人物的时辰手指越发齐全。。。。。。 。

(4)我们在布景环境中增长不有关人员的滋扰,,,, ,,好比在肯定的距离表出现布景人物,,,, ,,通过这种方式预防对人像的过度预测,,,, ,,起到更好的保;;;;;;ひ衷,,,, ,,只抠取指标人物的成效。。。。。。 。

2D和3D抠图成效对比

4. 成效展示及3D抠图的优势

由于3D信息的加持,,,, ,,3D抠图相比传统的2D抠图有着很多天然的优势,,,, ,,好比抠物品、抠细节、保;;;;;;ひ衷等。。。。。。 。通过度析市面上可用的视频会议软件,,,, ,,我们对比了2D抠图和本文的3D抠图的预测成效。。。。。。 。

4.1. 手持使用,,,, ,,布景不限

本文提出的3D抠图算法能够手持使用(如Vlog 拍摄),,,, ,,即相机的移动不会使抠图成效产生变动。。。。。。 。2D抠图中布景建模的抠图步骤,,,, ,,如Background Matting [3]步骤要求固定机位,,,, ,,通常必要共同三脚架使用,,,, ,,不具备可移动性,,,, ,,大大限度了用户的使用领域。。。。。。 。而本文的3D抠图通过距离分辨远景和布景的道理拥有天然的优势,,,, ,,无需布景建模,,,, ,,允许在使用过程中轻易移动相机。。。。。。 。

4.2. 抠人抠物,,,, ,,种类不限

本文提出的3D抠图算法能够抠取肆意类此外远景(只有有深度信息),,,, ,,即实现了通用的远景宰割。。。。。。 。目前市面上普遍使用的基于语义宰割的2D抠图无法实现通用的远景宰割,,,, ,,由于远景的类别是无限大。。。。。。 。所以,,,, ,,2D的抠图算法只能依赖布景建模能力实现通用的远景宰割,,,, ,,但依然受到远景和布景不能是类似纹理的限度。。。。。。 。在纹理相近时,,,, ,,布景建模的2D算法也会失效,,,, ,,而3D抠图可能通过深度信息找到远景和布景的天堑,,,, ,,实现类似纹理下的高难度抠图。。。。。。 。

4.3. 保;;;;;;ひ衷,,,, ,,安全靠得住

如上图所示,,,, ,,本文提出的3D抠图算法能够过滤掉布景中不有关的滋扰人物,,,, ,,从而起到保;;;;;;ひ衷的作用。。。。。。 。好比在家进行视频会议时,,,, ,,通常我们不仅愿对方看到自己的家庭成员。。。。。。 。然而,,,, ,,部门2D抠图选取语义宰割的步骤,,,, ,,无法判断人物距摄像头的距离,,,, ,,从而会把所有匹配到的人物都抠出来。。。。。。 。3D抠图支持用户自界说抠图距离,,,, ,,好比在0.5 m、1 m等,,,, ,,从而矫捷地过滤掉布景人物,,,, ,,充分起到保;;;;;;ひ衷的作用。。。。。。 。

4.4 深度加持,,,, ,,细节更好

如上图所示,,,, ,,本文提出的3D智能抠图算法能够更好地抠取头发、手指等细节。。。。。。 。这是由于手指和头发处的深度为算法提供了先验信息,,,, ,,有利于算法将细节处抠取地越发齐全。。。。。。 。相比之下,,,, ,,2D抠图算法容易导致细节迷失,,,, ,,必要共同更高的分辨率能力抠取细节,,,, ,,但更高的分辨率会导致算法速度更慢,,,, ,,履历更差。。。。。。 。3D抠图网络轻,,,, ,,只有3次下采样,,,, ,,网络更多的关注细节信息而非语义信息,,,, ,,这使得算法的速度和边缘精度上都比2D更有优势。。。。。。 。

5. 局限性

由于深度信息的使用,,,, ,,3D抠图相比2D抠图拥有显著的优势,,,, ,,但算法对深度图的质量拥有高度的依赖。。。。。。 。3D抠图对于深度容易迷失的物品,,,, ,,好比通明、反光、低反物品的抠取存在难题。。。。。。 。另表,,,, ,,深度相机的机能也会影响抠图的质量。。。。。。 。优良的相机D2C(静态下depth和color对齐)有利于提高静态抠图的成效;;;;;;;优良的相机帧同步(depth和color拥有一致的活动行为),,,, ,,有利于提高动态抠图成效。。。。。。 。因而,,,, ,,建议使用者选择机能越发优异的z6娱乐中光深度相机与3D抠图算法共同使用。。。。。。 。

6. 参考文件

[1] Sengupta, Soumyadip, et al. "Background matting: The world is your green screen." Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2020.

[2] Lin, Shanchuan, et al. "Real-time high-resolution background matting." Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2021.

[3] Lin, Tsung-Yi, et al. "Microsoft coco: Common objects in context." European conference on computer vision. Springer, Cham, 2014.

/ END /


【网站地图】【sitemap】