基于深度特征级融合的人脸识别推荐系统
2025-01-31 09:50

基于深度特征级融合的人脸识别推荐系统

  

  

  空气传播疫情(例如COVID-19)和污染(例如PM2.5)的广泛发生促使受影响地区的人们通过佩戴口罩来保护自己。在某些地区,在这种危及健康的时期,戴口罩甚至被法律强制执行。虽然大多数人戴口罩是为了保护自己免受空气中物质的侵害,但也有一些人以此为借口,利用口罩隐瞒自己的身份,从事入店行窃、抢劫、运输毒品和袭击等犯罪活动。虽然已经提出了自动人脸识别模型,但这些模型大多旨在识别清晰、无障碍的人脸以进行身份验证,无法有效处理口罩覆盖大部分面部区域的情况。为了缓解这一问题,本文提出了一个基于深度学习的特征融合框架,FIREC,它将额外的人口统计估计特征(如年龄、性别和种族)结合到潜在的面部表征中,以补偿由于掩膜阻塞而丢失的信息。给定一张戴着面具的脸的图像,我们的系统会推荐一个面具后面的人的潜在身份的排名列表。实验结果表明,我们提出的框架的最佳配置可以识别裸脸和蒙面,准确率分别为99.34%和97.65% (Hit@10)。所提出的框架将极大地有利于高召回率的面部身份识别应用,比如从闭路电视或路人的摄像头中识别潜在的嫌疑人,尤其是在危机时期,人们通常会用防护口罩遮住脸。

  鉴于当前全球新冠肺炎大流行的形势,促进所有业务单位的非接触式操作至关重要,特别是在机场、零售商店、办公室、医院和百货公司等不可避免接触的场所。在用于人体识别的多种生物识别技术中,人脸识别系统被认为是一种可靠的、非接触的身份验证方法,因为它为不受约束的环境下的识别提供了坚实的判别特征。因此,人脸识别系统已成为提高安全和监控系统的机械能力以及我们日常生活中数千种其他应用的重要工具。在应对疫情方面,如目前广泛传播的COVID-19感染,许多国家的法律要求人们在公共场所佩戴口罩,以避免传染病在某些地区传播。这种戴口罩的做法已经成为新常态,给研究人员带来了巨大的挑战,特别是在计算机视觉领域,因为通过传统的面部识别进行非接触式身份验证的性能和信任可能会因大部分面部区域被口罩覆盖而受到严重阻碍。对戴口罩的人缺乏准确的身份识别,这给当局在监测大量人群的可疑行为(例如,入店行窃、抢劫和袭击)时带来了巨大挑战。如图1所示,这种迫切的安全需求需要一个能够缩小戴面具嫌犯可能身份范围的自动面具身份推荐系统。

  图1

  figure 1

  安全问题的示例场景,需要自动识别蒙面

  然而,由于各种原因,蒙面身份推荐存在问题,主要来自以下几个方面。首先,口罩掩盖了许多对人脸身份识别至关重要的特征,比如嘴和鼻子,这可能会降低现有人脸识别系统的性能。其次,使用带有局部描述符的传统人脸表示对被掩盖的人脸特征进行编码,如局部相位量化(LPQ) (Ojansivu and Heikkil? 2008;Ahonen et al. 2008)、局部二值模式(LBP) (Ahonen et al. 2006)、二值化统计图像特征(BSIF) (Chu et al. 2013)和双交叉模式(DCP) (Ding et al. 2016)太浅,无法区分复杂的非线性面部外观变化。第三,尽管最近的工作已经转向利用深度学习方法,如卷积神经网络(cnn) (Taigman et al. 2014;Chen et al. 2018)为了自动提取对人脸图像非线性外观变化具有鲁棒性的重要特征,现有文献对现代人脸特征提取工具中包含的附加特征,特别是人的人口统计信息的研究并不广泛,限制了模型性能的表现力。最后,大多数现有的人脸身份识别系统被设计为可解释性有限的黑盒模型。因此,对人口统计信息(如性别、年龄和种族)有可解释解释的面部识别推荐系统对于执法人员缩小可疑嫌疑人的范围至关重要。

  基于上述挑战,在本研究中,我们提出了一种用于蒙面身份推荐系统(FIREC)的深度特征级融合模型,该模型可被当局用于在COVID-19和未来类似情况(例如,新的空气大流行或污染)中促进安全协议的缓解,预防,评估和行动规划,这些情况通常强制佩戴口罩。详细设计了FIREC的模型体系结构,分为四个主要模块,以优化掩码人脸身份推荐任务的性能。首先,通过数据管理将全正面人脸图像增强为蒙面人脸图像;其次,设计特征提取模块,不仅有效地提取人脸表征,而且有效地提取年龄、种族、性别等互补语义特征。第三,集成特征级融合模块,将所有特征融合为更丰富的特征表示。最后,推荐模块将返回具有相应特征的人员身份排名前n的列表。由于FIREC结合了额外的人口统计学特征来补偿被口罩隐藏的隐藏特征(即嘴,鼻子),在一个公共数据集和我们的两个自定义数据集上进行的大量实验证明了我们提出的模型在所有指标上优于其他基线。据我们所知,这是第一个在蒙面识别推荐领域发表的方法,该方法在向最终用户提供基于个人人口统计信息的定量结果和定性解释的同时,保持了大约95%的识别率的高精度。

  我们将本研究的贡献总结如下:

  我们研究了戴口罩对当前人脸识别系统性能的影响。

  我们提出了一个优化的解决方案,通过将估计的人口统计信息纳入所提出的模型中,以改进现有的研究。

  我们在提出的特征级融合方法中引入额外的语义特征,如性别、种族和年龄,以提高掩码人脸推荐的性能。这些额外的特征是从预训练的DeepFace模型中估计出来的。

  我们在三个数据库上进行了大量的实验:裸脸、蒙面和混合脸数据集来评估所提出的方法。通过与基线方法的对比分析,验证了所提出模型的有效性。代码可在GitHub存储库中获得。脚注1

  本文的其余部分组织如下:第二节回顾了相关工作。方法和提出的模型架构将在第3节中介绍。第4节和第5节展示了我们研究的实验设置和结果。第六部分对全文进行总结。

  图2

  figure 2

  提出的FIREC模型管道示意图,由四个核心模块组成:(1)数据管理模块;(2)特征提取模块;(3)特征级融合模块;(4)推荐模块

  2019冠状病毒病大流行给现实世界带来了各种挑战,引起了科学界和研究界的关注。直接研究挑战的例子包括趋势调查和相关信息分析(Gupta和Katarya 2021a, b;Katarya等人,2021),以及识别COVID-19患者的自动化方法(Kedia和Katarya 2021;Gupta等人。2021;Dantas et al. 2021;Kusakunniran et al. 2021)。然而,迄今为止,由于政府在防治这一流行病方面的主动行动而产生的间接问题很少受到重视。本研究的重点是由于在世界各地广泛实施的口罩政策而产生的问题,这些政策要求个人在外出时始终佩戴外科口罩。这样的执法可能会鼓励犯罪分子犯罪,因为他们在进行非法活动时有更多的机会隐藏自己的身份。为了解决这一挑战,即使戴着口罩,也必须能够根据面部图像识别个人。因此,我们建议,除了通常的人脸识别任务外,我们还可以从个人的蒙面照片中提取额外的信息,并用它们来预测他们的身份。这些应用程序,特别是在执法领域,需要高召回率的结果,这一事实使我们将这个问题定义为推荐任务(Katarya和Saini 2022;Gupta和Katarya 2021c, d;Katarya和Arora 2020;Katarya et al. 2013),其中对潜在身份进行排名并返回,而不是像传统的人脸识别协议那样只返回一个候选人。

  表1现有研究比较分析总结

  关于从面部图像中自动识别人脸的文献非常多(Naveen and Sivakumar 2021;Li et al. 2020;Ahmed et al. 2020;VenkateswarLal et al. 2019)。因此,我们关注与我们的研究问题直接相关的最新研究。与我们的工作相关的现有研究总结见表1。

  人脸表征有两大类:基于局部描述符的表征和基于深度学习的表征(Beveridge et al. 2015)。前一类描述符可以进一步分为两组:手工描述符和基于学习的描述符。Ahonen等人(2006)利用纹理描述符对相邻像素的关系进行编码,用于人脸表示。双交叉模式(Dual-Cross Patterns, DCP)描述符由Ding等人(2016)提出,用于捕获面部成分的高阶特征。后来,提出了其他手工制作的局部描述符,如局部相位量化(LPQ) (Ojansivu and Heikkil? 2008)和二值化统计图像特征(BSIF) (Chu et al. 2013)。与手工制作的描述符相比,基于学习的描述符利用机器学习技术的编码模式。基于深度学习的表示方法的一个例子包括taiigman等人(2014)提出的用于人脸识别的DeepFace模型,该模型可以达到与人类相当的高识别精度。Chen et al.(2018)利用CNN增强人脸特征提取的判别能力,并结合识别和验证两种损失,提高训练效率。Dosaj等人(2018)提出了一种具有可导向金字塔变换(SPT)和本地定向模式(LDP)的人脸识别系统,用于云域中电子医疗的安全登录。

  在人脸识别问题中,仅使用图像输入中的单个人脸表示会限制模型能力的表达能力。因此,最近的研究包含了多个额外的特征来为机器学习模型提供更好的判别能力。Ding等人(2016)提出从人脸表征中提取三个整体级特征和六个分量级特征,以提高人脸识别性能。在他们提出的模型中,Chen等人(2018)使用主成分分析(PCA)连接了25个深度特征。Sarangi等人(2022)提出了一种基于多模态生物识别方法的人脸识别方法,该方法使用耳朵和面部描述符作为主要特征。除了来自面部区域的特征外,多个特征也被用于多媒体和计算机视觉的各种应用中,例如视觉跟踪(Ma and Xiang 2015),图像分类(Xu et al. 2014;Qi et al. 2009;Enkhbat等人,2020;Chen et al. 2021)和客户行为分析(Yolcu et al. 2019)。

  我们提出的模型FIREC与现有的方法有很多不同之处。首先,我们提出了一种改进当前人脸识别的解决方案,以执行蒙面识别推荐。其次,我们提取了人脸和其他语义特征,并提出了特征级融合模块,将这些特征融合成一个紧凑的表示。最后但并非最不重要的是,我们不仅可以为给定的蒙面脸提供潜在身份的定量推荐列表,还可以提供关于为什么我们的框架推荐这些面部身份作为我们的最终结果的额外解释。

  图3

  figure 3

  数据预处理子模块的输入和输出图像示例。a表示原始输入图像,记为。b表示进行人脸增强后的输出图像,记为

  图4

  figure 4

  我们实验中使用的DeepFace模型估计的总体人口特征的可视化。a代表所有样本的性别分布,b代表年龄分布,c代表种族分布

  摘要。

  1 介绍

  2 背景及相关工作

  3 方法

  4 实验设置

  5 实验结果

  6 有限公司

  结论和未来发展方向

  代码的可用性

  笔记

  参考文献。

  致谢。

  作者信息

  # # # # #

  本节首先介绍了我们提出的框架中使用的管道的概述:用于屏蔽人脸身份推荐系统(FIREC)的深度特征级融合模型,如图2所示。FIREC模型包括四个核心模块:(1)数据管理模块,用于对原始图像进行预处理和增强,使其成为适当的格式,以便进一步处理。该模块的输入是一组来自可公开访问的在线数据集的面部图像。我们执行图像增强程序,以掩盖原来的正面。因此,我们得到了三个带有身份标签的数据集,包括裸脸、蒙面和混合脸数据集。然后,我们对每个数据集执行训练/测试分割,为训练和测试所提出的模型准备样本。(2)特征提取模块,从给定的输入人脸图像中提取基本特征。实现该任务的子模块有五个:人脸检测、人脸对齐、人脸特征表示、人口统计特征表示和人脸识别。(3)特征级融合模块(feature - level Fusion Module)将前一模块学习到的多个特征融合成一个高阶特征表示。然后,堆叠的自编码器对融合的特征进行处理,将特征映射到正确的人的身份。(4)推荐模块,根据给定的输入图像,返回top-N的身份列表,并给出人口统计特征解释,帮助最终用户做出最终决策。与传统的人脸识别系统针对身份验证相关的应用(系统只返回一个预测的身份到给定的人脸图像)相比,我们将我们的问题构建为人脸身份推荐问题,其中系统根据匹配的可能性返回身份列表。这样的推荐协议在专注于高回忆的情况下会更有益,比如缩小商店扒手的嫌疑人范围,这样执法人员就可以有效地利用他们的判断来进一步确定和调查每个潜在的嫌疑人。我们将在下面详细说明每个模块的细节。

  本节解释了我们如何从原始的全脸图像、我们的数据集特征中生成蒙面图像,并将数据集分割用于训练和测试以验证我们提出的模型。

  3.1.1 数据预处理sub-module

  在该子模块中,我们对原始的全正面人脸图像()进行掩模增强,得到掩模后的人脸图像()。我们使用MaskTheFace (Anwar和Raychowdhury 2020),这是一个开源Python脚本,用于在目标图像上生成掩码。应用MaskTheFace算法前后的示例图像如图3所示,使用的是公共VGGFaceFootnote 2数据集的示例图片。在本研究中,我们创建了另一个包含裸脸和蒙面脸的数据集用于进一步的实验,并将其命名为。

  3.1.2 数据挖掘分析子模块

  在这个子模块中,我们将语义信息可视化,并从实验中使用的总体特征中总结见解。这些特征从特征提取模块中提取出来。如图4所示,我们观察到男性样本的数量高于女性样本。此外,我们的大多数样本年龄在20到40岁之间。白人占所有样本的62%,而印度人、亚洲人、黑人、中东人和拉丁裔西班牙人约占6-10%。从这些观察中,我们认为我们的数据集包含各种人口统计学特征,可用于研究融合这些特征对增强人脸识别性能的影响。

  图5

  figure 5

  基于DeepFace预训练模型架构的特征提取管道。在训练阶段,该方法执行一种变体的人脸预处理(检测和对齐),并训练一个深度卷积神经网络(DCNN)对一组受试者进行分类。a显示带标签的输入图像。b显示DeepFace的DCNN网络将图像强度映射为特征。c表示区分受试者的softmax损失函数。在测试阶段,将该网络作为特征提取器来获得匹配的描述符,以执行掩码人脸识别

  图6

  figure 6

  本研究采用的是基于DeepFace的DCNN模型架构

  3.1.3 数据训练/测试分离子模块

  从数据预处理子模块中得到三个数据集:、、和后,我们进一步将这些数据集划分为80%的训练数据集和20%的测试数据集。因此,该子模块的输出为,,,,和。

  图7

  figure 7

  FIREC的模型架构由以DeepFace为骨干网络的特征提取和堆叠自编码器(堆叠auto-encoders, SA)将多个特征级融合为更高级的特征表示,然后进行推荐过程组成

  人脸特征提取模块的主干是基于最先进的深度学习套件LightFace开发的,LightFace是一种混合深度人脸识别框架(Serengil和Ozpinar 2020)。为了计算面部表征,我们部署了DeepFace (Taigman et al. 2014),这是一种基于深度卷积神经网络(DCNN)的方法,由Facebook AI Research开发,具有更高的准确性和速度。之所以选择DeepFace作为我们的迁移预训练学习模型,是因为它提供了丰富的关于每个身份的人口特征的信息,这些信息在以前的研究中没有被利用。请注意,每张图片的人口统计属性是由预训练的DeepFace模型预测的,而不是来自实际的人口统计信息,因为所提出的框架旨在在没有此类个人信息的情况下进行推广。这促使我们研究深度特征级融合方法对人脸识别性能的影响。我们用三个不同的数据集(、和)重新训练DeepFace,以获得最优的模型权重。因此,我们可以得到三个自定义特征提取模型,分别表示为、、和。如图5所示,从定义DCNN架构和用于分类的损失函数开始,一个标准管道开始学习人脸表示。然后,DCNN在一个封闭的主题池上进行训练,并将其用作未见面部的描述符提取器。典型的测试管道可以归结为在分类层之前利用层中的激活作为描述符对输入进行编码。然后使用与输入测试样本的余弦相似性对这些描述符进行比较和排序。然后返回排名靠前的身份作为推荐。下面解释了本研究中使用的DCNN架构的更多细节。

  图5b的具体内容见图6。如图6所示,我们用我们的数据集重新训练DCNN网络来对人脸图像进行分类。首先,将尺寸为152x152像素的3通道RGB人脸图像馈送到具有32个尺寸为11x11x3的滤波器的卷积层(C1)。我们用32x11x11x3@152x152来表示。之后,C1的输出被提供给一个最大池化层(M2),该层为每个通道池化跨2的3x3空间邻域的最大值。然后,将C2的输出输出给C3, C3有16个大小为9x9x16的滤波器。接下来是后续层(L4、L5和L6),它们执行类似的操作,但在输入像素和使用的过滤器的大小上有所不同。这六层的目的是提取底层特征,如简单的边缘和纹理。最后,最上面的三个层(F7, F8和F9)是完全连接的层,以连接所有输入。这些层可以捕捉人脸图像不同部分特征之间的相关性。最后一个全连接层(F9)是一个SoftMax层,它产生K个标识标签上的分布,其中K是标识的数量。给定一个输入图像,分配给第k类的概率表示为SoftMax函数的输出。也就是说,图5c所示损失函数的细节如下:

  (1)

  在测试阶段,移除最后一层(F9),并将网络中完全连接层(F8)的输出用作我们的原始人脸表示特征向量。给定两幅图像作为输入,经过良好训练的模型现在可以比较人脸表示和余弦相似度空间,计算为:

  (2)

  我们计算输入图像与语料库中所有候选图像的余弦相似度分数,然后根据余弦相似度分数对候选身份进行排名。具有较高余弦相似度分数的候选图像可能与测试图像属于同一身份。然后将前n个标识作为推荐列表返回。除了面部特征表示,LightFace还可以从给定的面部图像中预测年龄、种族和性别等人口特征。年龄特征用浮动标量值表示,种族和性别分别用[印度人,亚洲人,黑人,中东人,拉丁裔西班牙人]和[男性,女性]的概率混合表示。综上所述,该模块的输出是一个训练有素的特征提取模型:、、和。

  对于人脸嵌入,我们将特征提取模块提取的特征分别表示为:年龄、性别和种族。这些特征代表了人脸识别推荐的语义信息。我们进行特征级融合,通过将所有特征拼接为:

  (3)

  是一个高维向量,这是不切实际的现实世界的人脸识别应用。因此,我们进一步提出利用堆叠自编码器(SA)来降低非线性特征变换方法中的f2维数。在本研究中,我们采用了四层SA。四个自编码器的神经元数量分别为2048、1024、256、128个。在推荐模块进行进一步处理之前,最后一个编码器的输出用作人脸图像的压缩签名。所设计的SA结构如图7所示。

  在最后一个模块中,最终输出是一个密集层,其大小等于面部身份的总数(k),然后是一个SoftMax函数,该函数在给定面部和人口特征相互作用的情况下输出每个身份的概率:

  (4)

  其中是单位k的输出概率,是一个基真。

  本节首先介绍了我们想要回答的研究问题。然后,我们提供了用于评估我们提出的FIREC模型的推荐性能的数据集的更多细节。此外,我们总结了我们用于实证分析的所有基线和评估指标。最后给出了实现细节。

  RQ1。戴口罩对人脸识别性能有何影响?RQ2。提议的模型FIREC是否优于其他基线?所提出的特征级融合模块如何提高人脸身份推荐的性能?RQ3。我们提出的FIREC模型能否为决策者从推荐身份列表中确定实际身份提供直观的解释?

  以下4.4.1数据集

  表2实验所用数据集的统计情况

  我们使用牛津小组发布的VGGFaceFootnote 3数据集(Chang et al. 2020)。从这个数据集中随机抽取50个人的身份来评估我们的FIREC模型。平均而言,每个身份有大约166个不同的图像,每个身份有80-200个图像。经过数据预处理,我们得到了三个数据集:Bare Face only dataset()、mask Face only dataset()和mixed Face dataset()。我们将数据集分成80%和20%的部分,分别用于训练和测试。我们实验中使用的数据集汇总如表2所示。

  以下是几种人脸识别推荐的基线进行比较。

  :训练的特征提取模型

  :训练的特征提取模型

  :训练的特征提取模型

  我们提出的FIREC模型:

  :我们的特征提取模型是用年龄特征训练并融合的

  :我们的特征提取模型是用性别特征训练并融合的

  :我们的特征提取模型是用种族特征训练并融合的

  :我们的特征提取模型是用年龄和性别特征训练并融合的

  :我们的特征提取模型训练并融合了年龄和种族特征

  :我们的特征提取模型训练并融合了性别和种族特征

  :我们的特征提取模型训练并融合了年龄、性别和种族特征。

  为了评估屏蔽人脸身份推荐系统中每种方法的性能,我们采用了四个评价指标和一个称为Wilcoxon符号秩检验的统计检验,该检验通常用于评估推荐系统,如下所示。

  命中率(H@N)量化推荐在推荐结果中的覆盖率。对于测试集中的每个实例,如果基本真实恒等式出现在top-N推荐恒等式中,H@N为1,否则为0。整个H@N被计算为所有测试实例的平均值。请注意,H@1等同于用于验证传统人脸识别模型的精度度量,其中只考虑了顶部结果(Kar et al 2020;Taigman et al. 2014)。

  精度(P@N)衡量模型在前n个推荐结果中预测正确身份的能力。

  (5)

  式中为测试样本中的集合,为推荐恒等式的集合。

  平均倒数排名(MRR)评估推荐的排名能力。MRR是第一个正确预测的恒等式的秩倒数的平均值,定义为:

  (6)

  其中表示第一个正确预测的身份在推荐列表中的排名位置。

  平均排名(MR)是正确预测的身份在列表中排名的算术平均值,计算公式为:

  (7)

  其中表示第一个正确预测的身份在推荐列表中的排名位置。

  Wilcoxon sign -rank检验是本研究中使用的一种非参数统计假设检验,用于比较两个推荐排名表是否具有统计学显著性差异。置信水平(alpha)为0.05,低于此水平我们可以拒绝原假设,这意味着我们提出的模型与基线有很大不同。

  在本文中,我们选择N来说明模型在不同数量的顶级结果(N)下的性能。N值的选择也对应于现实世界的应用,在现实世界中,执法人员被提供了大约十个可信的嫌疑人短列表来进行调查。

  对于特征提取模块的模型架构,我们遵循了原始论文中提出的实验和超参数设置。所有实验都在一台Linux机器上进行,使用RTX 2080 Ti GPU和64gb RAM。我们的程序是用KerasFootnote 4和Tensorflow实现的。我们在验证集上使用网格搜索来微调模型的超参数。我们使用Early stop with Adam优化来获得每个数据集的最佳模型。最后,我们分别对、、和数据集使用100、100和100个epoch。

  表3 H@1(%)三种模型在两个测试数据集上的性能比较

  图8

  figure 8

  基于H@N的裸脸数据集和b蒙面数据集的模型性能比较

  图9

  figure 9

  我们提出的模型变体在裸脸数据集上的P@1、P@5和P@10的比较

  图10

  figure 10

  在蒙面数据集上我们提出的模型变体P@1, P@5和P@10的比较

  ccDownload: /内容/ pdf / 10.1007 / s12652 - 022 - 04380 - 0. - pdf

本内容为作者翻译自英文材料或转自网络,不代表本站立场,未经允许不得转载
如对本稿件有异议或投诉,请联系本站
想要了解世界的人,都在 阿赫网

相关推荐