文摘

面部表情是一个辅助的体现信息传达人与人之间的沟通。面部表情不仅可以表达人们想要表达的语义信息,也传达说话者的情绪状态在同一时间。但是对于体育运动员在训练和比赛中,它通常是不方便直接沟通。本文基于深度学习和改进的HMM训练算法研究体育运动员的面部表情识别。提出建设深度学习的多层神经网络,并介绍了排名算法进行人脸识别实验与传统HMM和职业专用HMM方法。实验结果表明,随着等级的增加价值,职业专用识别率高达90%,检出率是98%,耗时2.5分钟,这是比嗯整体。

1。介绍

1.1。背景

近年来,国内体育产业全面发展,和水平一直在世界的前沿。中国运动员已经做出了巨大的贡献。然而,在特定事件的行为,通常是不可能满足的需求和我们的运动员的迹象。我们需要使用一些算法捕捉体育运动员的面部表情进行识别和分析。计算机视觉技术的历史可以追溯到70多年前的时候主要应用于模式识别领域。它主要用于一些电脑设备模仿生物的视觉机制来处理图像中包含的信息。人性化的操作,计算机视觉研究的主要目的,是让计算机代替人类做一些单调乏味的任务和减少人类工作的负担。到目前为止,图形处理器性能的不断改进,深度学习技术已经成功地应用于计算机视觉领域,和电脑可以完全取代甚至超越人类在某些图像处理任务。

1.2。意义

在现实生活中,人类主要是通过视觉获得周围所有事物和信息。面部表情识别技术已经相对成熟,并且它是一个重要的学科在计算机视觉领域的研究。同时,体育运动员的面部表情识别的研究使用深度学习和改进的HMM训练算法的性能具有重要影响的体育运动员。

1.3。相关工作

因为业绩预期中扮演重要角色的成功技术在足球运动和武术,有证据表明,著名运动员在公众表现良好的转移的预期。很少有研究武术和情感爆发是否影响运动表现的期望。施的研究比较多的预期性能的运动员和符合情感识别的功能。初步研究发现,正常的业绩预期不依靠强劲的实践数据。跆拳道运动员的期望性能与情感识别的功能,而预期的减肥功能与情感识别的功能。研究表明,在竞技体育跆拳道等情感识别在预测中扮演一个重要的角色行为,但实用性的范围太小了1]。研究表明,MNS直接相关社会科学的发展。这个社会意识直接影响面部识别能力。因此,MNS的机理与人脸识别可以用于建立联系。过程中识别面部表情,镜像神经元刺激和提供内部模拟观察到的运动行为,从而引发了这样的情绪干扰在观察者的心。这种现象被称为运动协调。这种运动共振可以认识到情感、感受、感知状态,或行动。Jouini研究体育专业知识和工作强度的影响之间的空手道选手(KD)和足球运动员(SC)的面部疲劳识别的对手。他认为,长期战斗运动训练可以积极影响对手的面部表情加工的能力。结果表明,运动共振运动强度的增加而增加。 In short, research shows that long-term karate practice can ensure the development of the strength of the opponent’s facial expression, which has certain enlightenment for our research [2]。深入学习是工程学的一个分支,旨在高层模型数据提取使用多个层的神经元与复杂的结构或非线性的修改。数据大小和计算能力的增加,虚拟网络与更复杂的特点在许多领域获得了广泛的关注和使用。郝进行深入的训练神经网络,包括流行的建筑模型和训练算法,但研究内容不够深3]。深入的学习算法,特别是融合网络,迅速成为首选方法分析医学影像。通过深度学习的研究技术在人工神经网络的建设,本文有一些灵感。Litjens回顾了第一次深入的培训技巧相关医学影像分析和收集了超过300流在这个地区,其中大部分去年出现。同时,它探讨了使用图像隔离,深入学习的对象搜索,隔离,记录,和其他活动,并提供在每个区域研究的简要概述,讨论开放式挑战日常研究和指导方针,但使用程序太复杂4]。分离是最流行的话题之一,高光谱视觉。陈介绍深入研究高光谱数据分析第一次。首先,堆叠的适用性验证autoencoder根据经典的基于光谱信息的分类方法。其次,提出了一种基于空间优势信息的分类方法。然后提出了一种新的深度培训系统结合使用这两个功能,您可以得到更高的精确度。的过程是一个结合主成分分析(PCA),深入学习架构,和物质回归。从本质上讲,像深入培训架构,自动化的编码器是为了记录实际的改进。对广泛应用高光谱数据实验结果表明,该分类器集成到深入学习过程表现良好。此外,提出了深层神经网络为未来的研究打开一个新窗口,强调培训方法的巨大潜力在高光谱数据的比例,但它尚未重用(5]。马尔可夫自定义参数估计方法(嗯)很容易进入最好的地区,要求最高的主要基地,这也会导致一个合并事件。为了提高模型的能力和识别功能,李提出了一种新的IPSAA HMM算法。首先,在粒子群优化(PSO),激励因素等参数自适应蚁群算法(ACA)中改善。其次,粒子的历史最优解的适应度函数值使用粗搜索后的粒子群算法的初始信息素分布调整好了蚁群算法的搜索。最后,Baum-Welch (B-W)算法用于提高该地区在即将到来的全球解决方案。新算法不仅解决了BW依赖初始值的问题,在最佳范围内,还充分利用通用IPS搜索功能但不是有用的6]。

1.4。创新

本文主要研究和改善深度学习HMM的训练算法。创新如下:(1)改进算法:分析嗯在人脸识别中的应用理论及其算法,并提出一种改进的HMM训练HMM算法通过研究原则和不足之处。职业专用HMM方法获得一个更好的方法通过保持给定的最大尺寸的信息。它分配一个独立的功能系统每个类。(2)没有概率密度函数的估计误差,即使没有足够的特征统计,最优分类器可以通过职业专用建立足够的统计数字。(3)面部表情识别对比实验:50人的面部表情数据的基础上,一个小的数据库是建立培训和认可。传统的HMM算法和改进职业专用嗯训练算法,分别用于训练数据库,验证和改进职业专用嗯的优越性进行面部表情识别的实验参数,并比较两组的认可率。

2。深度学习和改进的HMM训练算法

2.1。深度学习技术

深度学习的核心内容是建立人工神经网络,并通过持续培训大量的数据来满足特定需求。深度学习的想法是提取中包含的信息输入等级通过构造一个多层神经网络;多层神经网络的建设是指隐藏层的引入输入层和输出层之间的单一计算层感知器的内部表示”输入模式下,“所以,单一计算层感知器变成一个多(计算)层感知器,以及相邻层之间的神经元相互连接(7]。深度学习可以理解两个部分:一个是深度,这是建立一个多层网络实现深度的目的;另一种是学习、使用某种算法来更新每一层的参数,直到收敛。深度学习是一个监督学习方法。在学习的过程中,训练样本的标签及达到的目标需要,每一层的网络参数不断调整优化深度学习的网络性能。

深度学习的最关键的技术是如何培养和建立一个良好的神经网络。本节将介绍几个关键技术训练神经网络:反向传播和梯度下降8]。

2.1.1。反向传播

深度学习训练算法正式成立,因为反向传播算法。它是最常见的和有效的方法来更新每一层的网络参数。具体的过程如下:首先,通过神经网络训练集转发,最后,一层网络的输出值,然后计算之间的区别和真正的价值,并传播错误从最后一层一层一层地输入层。在传播的过程中错误,这一层的参数可以根据上一层,传播误差调整,重复这个过程,直到误差收敛到最小(9]。

2.1.2。梯度下降法

每一层的误差可以通过人工神经网络的反向传播算法。根据错误的每一层,这一层的更新参数的梯度可以计算,然后每一层的参数使用下降法可以更新。梯度下降算法将在这里介绍。它是如何工作的呢?梯度的方向是指的方向最大方向导数的函数在某一点10]。一般来说,越接近目标值,步长越小,越慢的进步。梯度下降法不能用于在所有情况下找到最优值。当目标函数是凸的曲线,可以使用梯度下降法找到全局最优解,但总的来说,目标函数是没有严格凸的。解决方案通过梯度下降方法是局部最优解。常见的梯度下降方法包括随机梯度下降法和批处理梯度下降法。这两种方法之间的主要区别是不同梯度的计算(11]。

典型的神经网络包括以下。

(1)卷积神经网络。灵感来自动物视觉感知的原理,研究人员提出了卷积神经网络(CNN)。卷积层是核心网络层在CNN,这是由几个卷积单位。各种特性提取通过卷积核能源有不同的形状。低级卷积层通常提取一些低级特征,如颜色、纹理、亮度。高级网络可以提取底层特征组合成复杂的高级特性,和面对嵌入过程输出通过训练卷积神经网络(12]。激活层增加了网络通过激活函数的非线性变换加强输入网络的表达能力。完整的连接层通常将二维特征映射到一维特征向量的分类(13]。图1是一个完整的流程图连接一层一层的分类器。

(2)递归神经网络。最早Bengio提出的神经网络语言模型。之后的2010年,Mikolov Bengio提出的改进模型和递归神经网络模型提出了一个RNN(复发性神经元网络)。RNN有着特殊结构,LSTM短期记忆(长),最近得到了改进和提升研究人员,和取得了巨大的成功14]。与人工智能领域的蓬勃发展,RNN已经开始快速找到大量的应用于自然语言处理、语音识别等领域。与其他网络相比,RNN可以处理序列数据,从卷积神经网络及其最大的区别是,隐藏层连接到对方。RNN的输出当前的网络层相关的输出之前的网络层。它将记住以前的网络层的信息,影响当前网络层的输出。理想情况下,RNN可以处理任意长度的序列数据,但在现实中,相关数据的当前状态只是前几的状态数据,所以没有必要注意序列中的所有数据(15]。

2.2。嗯训练算法

嗯代表隐马尔可夫模型,这是一个概率模型的基础上建立和发展的马尔可夫链来描述统计特征。因为事件的状态不能直观地看到,它只能被观察到的价值,所以它被称为嗯(16]。HMM训练方法本质上是一个梯度下降法,它可以在培训过程中达到一个局部最小值。因此,初始值的选择更重要。一个好的初始值可以避免局部最小值的问题。初始值可以通过添加特定的优化选择方法。

由于HMM的状态不能直接观察到,它需要反映间接通过观测向量,每个州的分布也是随机的,所以唔可以被看作是一个双重随机过程。其中,随机生成的序列称为状态序列,和生成的序列组成的观察每个州被称为观测序列(17]。根据这些参数,某一事件发生的概率在任何时候可以计算。具体嗯形式定义如下。

一个表示组成的集合N可能的状态,B表示组成的集合可能的观测, 表示状态t;很明显, (1)l表示一组观测序列,K对应的状态序列l,它的长度l 通常,正面面对映像都包含五个突出部分的额头,眼睛,鼻子,嘴,下巴在序列。即使头部偏转或倾斜在某种程度上,他们的订单将不会改变18]。图2展示了观测序列是如何生成的。(2)状态转移概率矩阵 , 表示状态的概率 是过渡到 从时间tt+ 1。(3)观测概率矩阵 , 显示生成的概率是一个特定的观察值t(4)初始概率向量 , 表示状态的概率 t= 1。

因此,整个嗯可以表示为

事实上,嗯由两部分组成。第一部分是一个马尔可夫链,这是所描述的π年代,第二部分是一个随机的过程,这是所描述的T。图3是嗯的结构示意图。

给定的初始模型 和观察的顺序 ,(1)解决概率问题(19:假设 ,计算的概率 这个问题可以被看作是一个匹配模型和观测序列之间的问题,这是解决forward-backward算法。(2)参数估计问题20.:假设 ,使用最大似然估计方法来计算模型参数 ,这生成一个特定的观察序列的概率 达到最大。创建这个问题来帮助我们做我们最好的优化参数和解决生成的一组观察和被Baum-Welch算法解决。(3)预测问题:给定 ,找到状态序列 当条件概率C观察序列的最大化。这个问题揭示的深层含义,嗯,而且经常这样一个状态序列是通过维特比算法的优化21]。图4显示了嗯的三个基本问题之间的关系。

首先,的参数 Baum-Welch优化的算法,模型匹配问题是解决forward-backward算法和最优状态序列是发现了维特比算法的优化。

考虑到模型和观测序列,解决概率问题时,最直接的方法是解决它根据概率计算公式;在这方面,我们引入了forward-backward算法。forward-backward算法相对简单、稳定的数据和大量的计算,它很容易找到局部最优值(22,23]。

2.2.1。提出的算法

考虑到模型 ,在时间t观察序列 当状态 ,定义 转发概率,观察序列概率 可以递归地,表示吗

这种算法需要计算N(N+ 1)(T−1)+N次乘法,计算的数量直接从订单的减少 ,大大降低了计算复杂度。

2.2.2。向后算法

同样,鉴于HMM模型 ,当状态 在时间t,观察序列的概率t+ 1T 被定义为落后的概率,表示吗

当解决forward-backward算法可以简化计算 ,和计算量 也是一个数量级。公式通常可以统一写成

事实上,主要的参数估计问题描述模型的训练过程。通过参数训练, 最大化,Baum-Welch算法通常用于解决它。考虑到模型 和观察序列l,让 在状态的概率 在时间t并满足 然后,有

向前和向后传递的概率定义为

所以,

在状态的概率 在时间t和在 在时间t+ 1;然后,

概率计算公式可以得到:

5是Baum-Welch算法的原则。

定义评价方法后,提出概率 落后的概率 可见状态链的最大化,初始化模型参数进行了优化,不断重复迭代。

嗯可以实现的参数学习和估计的EM算法,和具体过程如下:

(1)确定对数似函数。由于HMM模型包含一个隐式的观察序列l,该模型及其对数似函数可以表示为

在这里, 是需要计算HMM参数,然后呢 也因为当前估计价值吗

因此,公式(16)可以写成

(2)计算模型参数。的最大价值 作为一个例子,它可以写成

2.3。面部表情识别的评价

当一个体育运动员的竞争,如何捕获并锁定目标人的脸从一个复杂的环境,识别和分析他的面部表情是一个重要的问题。为一个动态的目标,让计算机完成自动识别;必须保证准确性。同时,外部环境的影响必须考虑,如光的亮度的变化,目标的定位,快速变化的表达式,相似的面部表情,和缺乏样本模型库,所有这些都需要通过一个接一个被打破的。

数据集是面部表情和的一个重要组成部分的要点之一获得好面部表情模型。面部表情识别的快速发展离不开有效的积累和使用数据。谷歌FaceNet培训了一个高度精确的模型与2亿年大规模数据。许多研究团队产生了信息丰富、高质量的公共数据集。下面将介绍一些常用的公共数据集与大量数据。数据集可以分为两类。一个是公共数据集通常是用于培训。另一种是使用的公共数据集测试评价模型的准确性。一些简短的信息的数据集是列在表中1

为了更准确地认识体育运动员的面部表情,我们引入了职业专用HMM算法改进。职业专用方法可以保留尽可能多的信息通过减少维数,并增加维度可以获得更好的概率密度函数估计,所以一个适当的值需要两个,一个更好的方法是通过保留信息的最大数量的维度。分类和适应环境光的变化,目标角色的定位,表情变化等等每个类和分配一个独立的功能系统。与此同时,大量的运动员的面部表情数据收集解决相似的问题一些面部表情和缺乏模型中样本数据库。当每个隐马尔科夫模型的状态有足够的统计信息,职业专用方法可以扩展到HMM建模问题。与传统的似然函数嗯,职业专用嗯使用职业专用统计定义似然函数。在一定条件下(只有噪声时,的概率x1),最大似然函数的最大值的职业专用嗯等于最大值的传统模式。即使没有足够的特性数据,建立最优分类器仍然可以从职业专用足够的统计数字。因为职业专用Baum-Welch算法最大化真正的似然函数,功能系统的充分性不构成理论问题。

职业专用HMM算法使用不同的特性集,定义了一个观测值的概率密度函数。参数估计的标准参数输入数据空间:如果依赖特性集有足够的统计信息来区分每一个独立的国家,那么最好的分类器可以获得。

首先,当地社区和全球前显著地图的superpixels使用面部表情作为卷积神经网络的输入,计算本地上下文特点映射,然后结合当地社区的superpixels深度图像。作为另一个卷积神经网络的输入,初始获得显著图(24]。经过进一步优化的优化方法在这一章,最终获得显著图。图6显示了整个流程图。

所谓的培训是确定一组优化的HMM参数为每个运动员。每个模型可以使用单个或多个图像进行训练,然后建立一个初始模型,使用Baum-Welch算法重新评估每一个参数。不断调整模型来获得一个新的模型,直到一个HMM模型,最好的是体育运动员的面部表情。识别是一个过程,捕获目标人的面部表情来找到最佳匹配的基础上,建立了面部表情模型库。

3所示。深入学习和改进的HMM训练算法及其在面部表情识别实验的体育运动员

为了评估算法的概念验证(命中率)概率和误警率。在验证模型中,一个人的面部表情x声称是人的y图像,系统(如果接受或拒绝这一说法x,y图像属于人,记录xy;否则,它记录 )。在正式的情况下,当xy该算法是正确的,接受的概率xy。这被称为验证概率,用 第二个是错误的概率验证认可。当 ,接受的概率的算法xy。这就是所谓的假警报率,为代表 当训练集Y= {y},验证一个人的身份是相当于一个检测的问题。这包括寻找检测问题xy测试集的图像

给定的训练集和测试集的图像集合,它基本上是 判断是否认可是正确的。这个判断是由Neyman-Pearson观察。如果 证实了断言,认为认识是正确的;如果 拒绝断言,认为认识是错误的。通过Neyman-Pearson理论,确定规则增加了验证率对于一个给定的误警率

在实验中,我们选择了50个主题,每个都有10个类别的面部表情图像,共有500个面部表情图像形成了一个小型数据库。10种面部表情分为微笑、眨眼动作,闭上眼睛,笑,认真的。其中,有4种图像相似的表达式,用于测试捕获精度和算法的识别精度。不同年龄的面部特征非常不同,会有不同的面部识别的识别率。同时,为了验证改进的可行性和优越性职业专用嗯面部表情识别的算法,传统的HMM算法将用于比较。的人数在4类型相似的面部表情实验如表所示2。剩下的6种面部表情的分布实验人口如表所示3(25,26]。

4所示。深度学习和改进的HMM训练算法和面部表情识别的实验结果和分析体育运动员

7显示了六种不同的面部识别的准确性的面部表情中男性和女性的研究对象。

8显示了四种面部识别的准确性类似的表达式在男性和女性受试者。

从图可以看出8测试的两种方法仍略有不同的面部表情与表情,除了男性面部表情平静的确切数字是相同的,这是11人。总的来说,职业专用HMM算法准确率高于传统的嗯。

在一个小的数据库,将里面的面部表情作为样本进行模型训练和使用传统的HMM和职业专用嗯方法进行人脸识别实验,分别。随着等级值的增加,识别率的变化的六个面部表情两个算法实验获得的图所示9

从图可以看出9而容错率增加,识别率增加;容错率越高,识别率越高。在一个小的数据库,当等级= 7,职业专用的识别率嗯已经增加到90%,而传统HMM的识别率达到了95%。这表明,当等级= 7,传统的HMM方法比职业专用HMM方法。识别率高,性能更好。对于传统的嗯,等级= 10时,识别率是1。职业专用嗯面部表情识别,等级= 10时,识别率达到95%。另一方面,这表明传统嗯比职业专用识别具有更好的性能和更好的性能。

10图展现出面部表情识别利率的变化通过一个小实验数据库四个面部识别两种算法的情况下同样的面部表情在男性和女性受试者作为等级值增加。

从图10可以看出,无论男性还是女性,无论是职业专用嗯嗯,识别率降低作为一个整体,特别是等级= 1,识别率下降了约10%。它表明,在识别相似的面部表情,当前算法不够完美。

4显示了职业专用的检出率嗯嗯方法在一个小的数据库,每个表的总时间,平均时间。检测率是指认识的数量,不管是否准确识别。

从表可以看出4这两个职业专用的检出率嗯嗯方法仍相对较高;特别是职业专用HMM方法是高达98%。消费的时候,职业专用一半不到嗯嗯方法。

5。结论

深度学习的不断发展和改进的HMM训练方法,测量标准和面部识别精度逐渐提高,和面部表情识别技术已广泛应用于现实生活。在这一阶段的研究技术,还有没有解决面临的一些问题在人脸检测和识别的过程中(如严重阻塞、姿态变化,模糊数据收集)。在实践中,当检测和识别面部表情,脸上可能出现各种各样的问题,这最终会影响性能的检测和识别,所以后续的任务是非常困难的。现有方法的基础上,本文做了一些改进,并获得更好的性能结果的面部表情的数据集,但本文认为,还需要进一步的研究在以下几个方面:(1)人脸的部分遮挡的问题。在目前的面部表情识别技术,有必要进一步探索新方法阻塞的问题。通过引入表达重点对准技术,阻挡部分检测到的脸,和未遮挡部分的特点是习得的。设计合理的网络模型需要解决。(2)训练数据集的问题。基于深度学习的网络框架,需要大量的数据作为输入训练期间,不仅可以学习更健壮的功能也进一步防止网络过度拟合。因此,以后使用的数据扩展相关知识是更重要的。更多的数据集,设计一种改进的生成增加对抗网络数据的主要方向。 (3) The amount of calculation. With the spread of the Internet and the continuous presentation of massive data, the amount of image and video data continues to grow. Face detection and recognition are applied to industrial products for real-time face detection and recognition, so an efficient and accurate will become a long-term problem in this field.

数据可用性

没有数据被用来支持本研究。

的利益冲突

作者宣称没有利益冲突。