文摘

目的。为了解决人脸图像的小样本问题,高规模、低结构,没有标签,和困难在跟踪和夺回安全视频,我们提出一个受欢迎的多尺度面部特征基于VGG16歧管(MSFFM)算法。方法。我们首先建立VGG16架构获得脸特征在不同尺度和构造一个多尺度特性歧管与脸特征在不同尺度的维度。同时,识别率和准确率,和运行时间是用来评估VGG16的性能,LeNet-5, DenseNet在同一个数据库中。结果。从对比实验的结果,可以看出VGG16的识别率和准确性是最高的在三个网络。VGG16的识别率是97.588%,准确性为95.889%。和运行时间只有3.5秒,比LeNet-5快72.727%,比DenseNet快66.666%。结论。该模型提出了突破的关键问题在人脸检测和跟踪问题在公共安全领域,预测的位置面对目标图像在时间维度流形空间,并提高了人脸检测的效率。

1。介绍

人脸识别(1- - - - - -5),作为一种生物特征识别技术,是模式识别研究领域中的热门话题,图像处理、机器视觉、神经网络,和近年来认知科学。同时,人脸识别作为生物特征识别技术具有高稳定性、高精度、难以复制,和容易被人接受6- - - - - -9),具有广泛的应用前景在身份验证、安全监控、人机交互、等与信息技术的不断创新,处理图像的人脸识别技术已经变得越来越复杂。有足够的样本,单一的背景,和稳定的环境光,大多数算法可以获得更高的识别率。

在实际应用中,如何解决环境因素的影响,人类的情绪,和姿态的变化已成为一个困难的问题在测试中各种算法。基于eigenface人脸识别算法提取特征降维的方式。虽然计算复杂度降低,一些有效的功能将丢失,同时降低维数。

为了反映图像特性的非线性结构,两个经典的流形学习方法已经由先前的研究人员提出,这是ISO公制映射(ISOMAP) [10- - - - - -12)和局部线性嵌入(米歇尔)[13- - - - - -15]。通过学习从环境空间映射到特征空间,投影后相邻点之间的结构可以被保留下来。虽然这样的流形学习方法可以模型数据的流形结构,它们需要大量的密集的数据作为训练样本,这并不适用于一些实际的应用程序。因此,本文构造卷积神经网络(CNN)的架构特性在不同的尺度上获得的面孔,以解决样本量不足的问题。

近年来,美国有线电视新闻网(16- - - - - -20.)已成为一个研究热点分析和图像识别领域的演讲,尤其是在人脸识别领域。CNN充分利用数据本身的局部性结合当地面临的感知区域形象,分享重量,和空间。这个特性具有一定程度的鲁棒性照明变化,姿态和闭塞。

以前,已经有许多研究人脸识别,如方法基于统计集合管(21- - - - - -24结合深层神经网络)和方法。可以看出,图像分类方法基于流形仍将保持相当大的研究热情在未来很长一段时间。

在本文中,一个CNN是用来构造一个人脸识别系统。首先,VGG16模型(25- - - - - -29日)是用于提取面部特征,然后多尺度面部特征歧管(MSFFM) [30.,31日)是用于分类和在实际环境中进行测试。

2。方法

2.1。CNN架构
2.1.1。VGG16

VGGNet提出了由牛津牛津大学的视觉几何组(32]。它探讨了CNN的深度及其性能之间的关系。通过多次叠加33小卷积核和22最大池层,它成功地构建CNN 16至19层深。VGGNet修改基于AlexNet [33];训练图像大小 图像的均值相减时所有训练图像。VGGNet包含许多层次的网络,深度从11到19层。更常用的是VGGNet-16 VGGNet-19。VGGNet网络分为5段,每段连接多个3 3卷积网络系列。每一部分的卷积是紧随其后的是最大池层,最后是3完全连接层和一个softmax层。VGG16如图的网络结构1

2.1.2。LeNet-5

LeNet-5 [34)是一个典型的结构CNN, CNN的开创性工作,主要用于手写字体识别。虽然网络很简单,结构完整,完整和卷积层、汇聚层,和链路层使用直到现在。层数很浅,大小的内核是单身。使用的内核大小三个卷积层C1, C3和C5 C5的特征地图大小 因为S4的特征地图大小 和内核大小是相同的,所以卷积的结果的大小 使用的窗口大小两个池层S2和S4 ,这里有两种类型的池。F6与84个神经元是一个完全连接层。LeNet-5如图的网络结构2

2.1.3。DenseNet

DenseNet [35脱离ResNet的缺点深化网络层的数量(36)和《盗梦空间》的缺点,扩大网络结构来提高网络性能(37]。从功能的角度来看,通过功能重用和旁路设置,它大大减少了网络的参数数量缓解梯度的出现在一定程度上消失的问题。结合信息流动的假设和功能重用,DenseNet值得最好的论文在2017年计算机视觉会议。DenseNet吸收ResNet的最重要部分,做更多的创新工作,进一步提高了网络性能。

DenseNet是CNN茂密的连接。在这个网络中,任意两个层之间有着直接的联系,也就是说,每一层的输入网络是工会的所有前一层的输出,和特征映射学习这一层也会直接传递到所有后续作为输入层。DenseNet如图的网络结构3

2.2。多方面的学习
2.2.1。廖类型通常用于图像分类

在计算机视觉领域,协方差矩阵符合流形的几何对称正定矩阵已经被证明在图像分类任务中有很好的效果。由于协方差矩阵可以更好的适应各种类型的图像变化,它已成为一个主流的图像特征表示方法在图像分类基于黎曼流形。常用的多种类型的图像分类是对称的正定矩阵歧管和Gmssmami多方面的。

2.2.2。核函数在廖

在机器学习领域,内核方法是一种学习算法用于解决模式识别问题。最典型的例子是支持向量机(SVM)。的主要思想是将原始空间中的数据嵌入到一个特定的高维空间通过某种隐式非线性映射,所以原始空间中线性不可分的数据变得线性可分的被映射到高维空间。

文献[18)提出了一种核函数的歧管对称正定矩阵。根据弗罗贝尼乌斯规范和极化公式,两个的内积 - - - - - -维对称正定矩阵 在切线空间Tr Symn被定义为方程(1)。

可以看出Symn上相应的内核函数被定义为方程(2)。

2.2.3。基于稀疏表示的超分辨率算法

SR方法增加了稀疏表示理论的基础上,多方面的学习,利用训练样本块的一个子集线性表示输入的低分辨率图像块,并使用L1范数来解决最优权重系数。我们使用最相似的脸训练样本块来表示输入图像块的效果。

对每个图像块 输入的低分辨率图像,所有训练样本块在同一位置低分辨率的样本空间中学会重构稀疏表示系数和目标函数表示为方程(3)。

然后,目标函数转化为方程(4为解决)。 我们线性权衡表示系数得到方程(4)和相应的高分辨率训练样本块获取高分辨率图像块的预测。该算法解决了问题,解决的办法不是独特的基于位置的图像块算法。

2.3。数据集
2.3.1。数据源

在实际应用中,人脸识别系统的最大挑战是,识别效果并不理想时姿势变化和遮挡。因此,本文收集许多类型的脸图像在实际应用实验样本。正常的脸样本基本上是一致的或在小角度倾斜,没有遮挡,和单一表达式,如图4(一)。面对样品与各种各样的表情和姿势变化如图4 (b)。闭塞的示例如图4 (c)。在系统测试中,20面临36人收集的镜像,并收集总共720张图片。的分类和像素数据集如表所示1

2.3.2。实验环境

处理器和操作系统的软件平台实验环境如表所示2。为了保证实验结果的公平,所有方法使用提供的源代码实现原作者尽可能和主要参数调整,根据指令集在原始的文件中。

2.4。评估标准

本文运用识别率、准确率和运行时间来评估VGG16的性能,LeNet-5, DenseNet。

首先,识别率是指所有识别图像的数量比总图像,计算方法是见方程(5)。

在方程(5), 是指所有识别图片的数量, 知道图片的总数。

第二,准确性是指正确地识别图像的数量比总数。计算方法如方程所示(6)。

在方程(6), 指正确地识别图像的数量,和 指的是总数。

3所示。实验结果

3.1。识别率

5显示了比较曲线VGG16的识别率,LeNet-5, DenseNet。

从图可以看出5认可率正比于样品的数量,以及基于VGG16 MSFFM的识别率最高。样品的数量是240时,识别率为97.588%。

3.2。精度

6显示的准确性比较曲线VGG16, LeNet-5, DenseNet。从对比结果可以看出,基于VGG16人脸识别算法的准确率是95.889%。

3.3。计算时间

通过比较数据表3,数据库,可以看出三个网络对所需的时间来完成一个操作是3.5秒,9.1秒和11.6秒,分别提出的模型我们可以缩短计算时间,近一半。相反,我们提出VGG16取得了优秀的成果在减少计算复杂度。一般来说,VGG16可以有效地减少计算复杂度,因此具有更好的实际应用的可行性。

4所示。讨论

本文介绍了CNN,整合多方面的学习。它使用图像的空间多方面的信息作为附加的功能集成到改进的CNN模型,以提高数据模型的针对性,提高准确性。模型的提出弥补了缺乏泛化能力。

人脸超分辨率图像超分辨率技术的应用是一个特定的场景,和面部超分辨率吸引了学者们的广泛关注。在实际场景中,获得的脸图像通常是模糊的和低质量,这是由多种原因造成的。

首先,监控摄像头的位置很高,射击场很大,和目标脸图像很小;第二,监视设备是有限的存储空间,以及视频图像高度压缩,所以图像失去的详细信息;第三,外部环境是多雨的天气和低光晚上将进一步减少捕获的图像的质量。

现有的图像特征表达方法专注于矩阵型导管。如何融合多种类型的黎曼流形,如线性子空间、概率分布形式multimodel表示方法,执行不同的集合管的有效统一特征信息将是一个值得注意的问题。

CNN研究的不断深化,基于矢量的卷积和池处理已经充分研究。事实上,在网络中,我们可以应用黎曼流形几何中间的数据层进行处理。这个池和迭代过程形式的一个矩阵能有积极的效果最终输出的网络。对于未来的实现,我们将继续在这个方向上进行相关研究。

5。结论

我们研究和采用了流行的基于VGG16面部特征多尺度算法和在这个基础上设计并实现了人脸识别。系统首先截取视频的每一帧的图像人脸检测,然后认识到检测到脸。实际测试结果表明,该系统具有高识别率的脸姿势,表情,和闭塞的变化,当训练样本就足够了。仍有很多研究空间基于流形学习算法在人脸识别和应用这些算法的人脸识别系统。

数据可用性

(脸图像)数据用于支持本研究的发现没有可用,因为(我们自己收集的脸图像包含的面孔从我们的项目成员。他们不愿意给他们的信息给公众。

的利益冲突

作者宣称没有利益冲突。

确认

这项工作是由中国国家自然科学基金(62006102)。