文摘
基于深入学习方法旨在开发识别人类行为的能力。我们引入三维残余结构和创建3 d剩余模型。为了得到最连续几帧的数据关系,本研究介绍了3 d技术将不同的值分配给现有的框架。实验表明,这两种结构提高识别性能。三维残余模型,3 d模型,注意和3 d关注剩余模型,本研究提出了两个模型融合策略:平均和加权。其中,加权融合是给更高的融合高精度模型使用模型比例重量计算方法在本研究中设计的。实验结果表明,该添加剂融合策略基于特性的贡献具有明显的改进效果的测试结果两个基准数据集,以增加超过2%分,包括HMDB51增加2.69%。拼接和融合策略的效果也增加了1%以上,包括1.34% HMDB51 UCF101数据集和大约1.9%。这是证明深度学习可以有效地识别人类行为在体育。
1。介绍
视觉一直是人类最重要和最直观的方式来获取外部信息。据相关统计,80%的人类通过视觉获取信息(1]。图像传感器的质量上升如相机和价格的不断下降,图像传感器已经被大规模部署和应用,导致每天大量的信息。仅仅依靠眼睛来获取所需的信息不再能满足人们的要求,新的信息和知识。另外,随着计算机计算速度的提高,计算能力的进一步增强,图像处理算法的不断发展,计算机视觉技术。依靠电脑或其他嵌入式平台,计算机视觉技术使用图像处理、机器学习、和深度学习技术来处理图像等特定的目标探测和识别,图像切割、和图像理解,实现自动分析和智能处理图像和视觉信息的提取我们感兴趣的信息。近年来,计算机视觉技术已经被更多的青睐2]。它是目前最活跃的重要方向。作为一个流行的计算机视觉领域,视频人类行为识别的目标是学习和理解人类行为的视频,包括个人行为,人与人之间的互动,人与环境之间的相互作用,并自动识别视频或图片的行为序列。视频人类行为有广泛应用前景在人机交互,智能监控、视频搜索、行为分析。
1.1。人机交互
隐式人机交互系统是未来人机交互的趋势。计算机捕捉用户的行为通过摄像机等传感器,自动分析用户的意图,并进一步为用户提供了服务没有额外的用户参与。现在,手势识别已经初步应用于电视和游戏机。三星、海信、康佳等电视制造商已经推出了电视与手势识别产品,可以实现通道切换的基本功能,选择确认,移动缩放,等等。Xbox游戏机的,微软的游戏机,是更有名3]。Xbox实现手势识别的功能通过外部3 d躯体感觉和动作表情识别相机Kinect。用户可以控制游戏中的人物只有通过身体动作,这无疑加深用户的沉浸感。在未来,人机交互的方向必须简单,随意,自然,摆脱复杂的交互界面,这一切的基础是使机器理解人类行为。
1.2。智能监控系统
随着人类社会的发展活动,公众的安全挑战,监控系统变得越来越重要(4]。传统监控系统依靠人力来监视人们的行为的视频,这不仅需要花费高劳动成本但也不能处理大规模的视频。为了克服人力资源的限制,智能监控技术应运而生。智能监测系统(iss)应用计算机视觉技术、模式识别、人工智能和技术来自动识别异常行为的视频,提供早期预警应急或帮助处理大规模突发事件。例如,车站和机场的智能监控系统可以自动识别可疑的行为,比如“故意扣留货物”或“令人不安的公安、”和提前警告可能的恐怖袭击。
1.3。视频基于内容的搜索
由于视频压缩技术的发展,大容量数字存储、高速移动互联网和数码相机的广泛应用,大量的视频上传每天在互联网和视频越来越成为互联网内容的一个重要组成部分。传统的视频搜索是基于人工标签或文本描述,这不仅需要高劳动成本但也影响准确性由于一定的主观成分。基于内容的视频搜索,获取视频标签通过在视频智能分析的行为内容,无疑是一种简单而有效的搜索技术的大规模视频(5]。
1.4。行为分析
行为分析是一种人类行为智能分析技术,可应用于运动训练。通过智能分析运动员的培训视频,可以给科学和直观的指导。此外,它也可以用于体操、跳水、与主观判断和其他活动。通过multiangle分析,参赛者的行为判断和得分,帮助裁判做出客观、公正的判断。行为分析也可以给预警可能自杀,暴力,通过分析人们最近的行为或其他不良行为。近年来,计算机视觉技术取得了巨大发展。指纹识别,人脸识别,和其他技术已经相对成熟,大规模应用。然而,目前,行为识别的应用仅限于手势识别和一些简单的肢体识别(6]。
2。文献综述
人类行为识别领域的,各种国内科研机构也开展了各种活动对人类行为识别和在相关领域取得了一些成果。的模式识别重点实验室中国人类行为识别技术适用于国家潜水团队成员的培训和意识到人类行为的建模和跟踪。从现状可以看出,国内外学者从未停止探索人类行为识别领域多年。
在咨询相关的常用的方法用于识别视频人类行为,传统的行为识别的核心步骤过程总结如图1。
其中,全球特征提取进行了人体对整个地区的利益。一般来说,人类的轮廓信息,人类轮廓信息,用于描述或光学流轨迹信息。例如,Mekruksavanich和Jitpattanakul提议使用一个明星骨架提取人体轮廓特征(7)和贾获得三维时空的体积(STV)代表人类行为特征通过连续的视频帧的轮廓特征8];高等人把获得的综合特征融合三维时空的体积和光学流信息的全球特征行为。当提取局部特征,只有在人类行为中感兴趣的点或块提取(9]。指的方法提取单一的静态图像的地方特色,郑等人提出了延长2检测3 d-harris角落检测d-harris角落,这种算法扩展了二维特征点检测的类似工作3 d特征点检测;另一种方法来描述局部特征这个词袋方法,主要使用行为特征词频直方图描述的行为特性。行为识别是指使用行为特征来准确区分不同的人类行为和视频场景。首先,从给定的连续帧中提取的行为特性,然后获得特征序列转换成一组静态模板。最后,通过模板匹配的识别结果的测试样本预存储“真实”模板(10]。太阳等人提出保存完整的行为信息通过使用两个模板:运动能量图像(美)代表行为的发生在一些地区,和运动历史图像的位置和时间序列(MHI)表示行为,然后,Mahalanobis行为预测之间的距离和已知的行为行为的模板匹配计算,最后,得到识别结果(11]。王等人使用的光流特征实现模板匹配的视频序列,但光学流很容易受到噪声的影响,所以这种方法的效果是有限的12]。刘等人使用这个词袋模型实现人类行为识别的任务,并且都取得了预期的识别结果。这种方法主要是描述行为基于行为特征的语义特征(13]。当描述不足,识别结果往往不能令人满意。黄、张相信在颞时空编码地图,如果骨接合点在每一帧的安排顺序是不同的,将获得不同的结果。例如,在图像识别中,如果像素的位置是随机干扰,识别精度将大大减少14]。因此,他们设计了一个转换模块,该模块可以学习骨接合点的最优安排在每一帧。除了使用原始的安排联合点每一帧的特征向量,一些方法使用骨接合点之间的几何特征作为框架级别每一帧的特征向量。刘等人首先选择关键联合分五部分人类骨骼的四肢和躯干,然后计算这些关键联合点之间的几何向量。所有几何向量拼接在一起作为框架水准仪特征向量(15]。王等人预计人类骨骼点分成三个正交平面和计算每一对联合点之间的距离XY,YZ,和XZ飞机的框架水准仪特征向量(16]。这种方法可以有效地减少数据依赖的射击角度。阿明等人首先选择四个骨关键点,然后计算其他骨接合点之间的几何矢量和四个关键联合点在圆柱坐标系框架水准仪特征向量(17]。
为了提高人类行为识别在体育运动中,提出了一种基于深度学习的方法。本文介绍了3 d残留结构和设计三维残余模型。为了更好地捕捉连续多帧数据之间的相关特性,本研究介绍了3 d的注意机制来捕获这个全球相关特性通过分配不同的注意值,相邻帧。实验表明,这两种结构提高识别性能。三维残余模型,3 d模型,注意和3 d关注剩余模型,本文提出了两种模型融合策略:平均和加权。其中,加权融合是给更高的融合高精度模型使用模型比例重量计算方法设计。
3所示。基于深度识别算法
3.1。深度学习的基础
3.1.1。神经元和感知器模型
由于特殊的记忆和信息处理机制的神经元,在1943年,心理学家MC CULLOCH和数学家皮特称为生物神经元和抽象的结构的基本单元结构深层神经网络:神经元模型。其结构如图2。从图可以看出,一个基本的神经元模型组成的输入,操作,和输出。①输入:指的是原始数据输入或从先前的神经元的输出结果 ②操作:神经元的计算模块。它由两部分组成。首先,应用“乘法和求和”对应的重量 输入 ,然后“添加偏见” ,最后,添加“非线性”操作f(也称为激活函数)来求和的结果。具体的计算公式 ③输出:输出结果产生的神经元可以作为下一个神经元的输入。
因为单个神经元的学习能力是有限的,它不被广泛使用。Rosenblatt提出了感知器模型的基础上,1958年基本神经元模型,这是由多个神经元单体。具体结构如图3。虽然它可以自动调整重量参数根据训练数据的误差,它仍然是一个简单的二元分类模型,这不能解决许多nonlinear-related问题在现实18]。
从图可以看出3感知器模型,由输入层、隐藏层和输出层,每层神经元之间的连接由全连接。假设输入层神经元的个数和隐层神经元的数目 ,有可能的输入层和隐层之间的连接方式,如以下所示方程。 在哪里表示层的神经元数我,表示连接层的总数我为层我+ 1。
3.1.2。激活函数
激活函数也称为激励函数。它的出现主要是介绍神经网络非线性操作,提高模型的表达能力在复杂环境和数据。目前,乙状结肠,双曲正切,ReLU函数常用的神经网络。ReLU函数是一种最常用的激活函数在CNN,也是激活层在这项研究中使用的. .①乙状结肠激活函数也称为“s型曲线”。其数学表达式所示下面的方程,函数图像如图4。 从图可以看出4,乙状结肠函数可以将任何值转换为[0,1]区间中的值,以便每个神经元的输出值可以被视为一个激活概率值,并在一定程度上被压缩的数据。然而,它也可以从图中找到4乙状结肠有饱和区域的函数,也就是说,当数量在很大程度上是积极的还是消极的,其梯度将成为零,从而抑制神经元参数的更新;同时,乙状结肠的输出不为零,导致随后的神经元的信号非零意味着作为输入,影响模型的收敛速度(19]。②双曲正切函数也称为“正切函数。”其数学表达式所示下面的方程,函数图像如图5。 从图可以看出5双曲正切函数类似于乙状结肠。虽然满足0表示的特点,是对称的原点,它仍然没有解决的问题的消失在积极或消极的无限地区梯度,还耗时的权力操作的问题。③ReLU函数,也称为“修改线性单元,其数学表达式所示方程(5),函数图像如图6。
这是在图中找到6ReLU函数直接输出正数和负数设置为0。因此,与双曲正切和乙状结肠相比,其收敛速度更快,梯度不会消失在积极的间隔。然而,从图也可以看出,当ReLU函数x< 0,梯度直接0,也就是梯度消失了。为了解决负区间梯度的消失的问题,修改后的偏差可以添加到ReLU函数的表示否定的间隔,以避免这个问题(20.]。
3.1.3。损失函数
损失函数是用来估计预测的值之间的差异和真正的价值y的模型(J代表损失)。损失函数的值越小,模型的鲁棒性越好。常见的损失函数包括平均绝对误差(MAE)损失函数,均方误差(MSE)损失函数,铰链损失函数,叉(CE)损失函数。CE是最常用的损失函数在CNN和本文使用的损失测量功能。①美损失函数,也称为l1损失函数,以绝对误差预测值和真实值之间的距离。数学表达式如下所示方程。 ②MSE损失函数,也称为l2损失函数或欧氏距离,将错误的距离的平方和。是最常用的损失函数回归任务,基本形式是以下方程所示。 美和MSE的区别主要体现在两个方面。(1)MSE可以收敛速度比梅:通过推导方程(6)和(7),它可以发现,当梯度减少,MSE损失的梯度 ,而美损失的梯度±1。因此,MSE的梯度误差将会改变,而梅仍然保持在1的梯度,这并不有利于模型的训练。(2)美具有更好的鲁棒性,这主要反映在异常值的处理。这是因为MSE采用平方操作错误,导致过度的错误的异常值。③铰链损失函数是一个two-classification损失函数,适用于分类的最大的优势,所以它经常被用于支持向量机模型。铰链损失的计算下列方程所示。 在哪里 的价值,是±1,表明积极的和消极的两类样本。④CE损失函数是一种最常用的损失函数在CNN分类任务。根据分类任务的需求,它可以分为两类和多类,统称为CE损失函数。它们之间的差异信息熵可以表示,如以下所示的方程。
在二元分类问题,乙状结肠函数(方程(2)和(3)是通常用于CNN的输出过程,将其映射到[0,1]之间的概率值,然后计算它的损失。因此,这个损失函数也称为乙状结肠损失,如方程所示。
Multiclassification是两个分类任务的扩展。不同的两个分类,其真正的价值y是一个炎热的向量。同时,CNN的输出映射模型从最初的乙状结肠函数Softmax函数(见方程(11))。Softmax函数将每个维度的输出映射到[0,1]之间的概率值,确保所有维度的输出的总和是1,然后计算其CE损失。结合方程(9)和(11)获得将Softmax损失函数,如方程所示(12)。
3.2。深层神经网络
卷积神经网络(CNN)是一种神经网络,它通常是由一个或多个卷积层,池层和完整的连接层。相应的模型一般包括一个输入层和输出层(21]。
3.2.1之上。输入层
人类行为识别基于任务的视频,它通常是指单个或多个连续的输入图像数据或中间层的特征矩阵。
3.2.2。褶积层
卷积层是CNN结构的一个重要组成部分。它是用于特征提取。它有两个特点:本地感知和参数共享。本地传感意味着输入图像块使用卷积内核指定大小的特征提取。
卷积操作是卷积层的核心。根据卷积核的数量,可以分为单通道卷积和多通道卷积。其中,单通道卷积是指使用一个卷积核进行特征提取得到一个特征矩阵;多通道卷积使用多个卷积检查输入矩阵来提取特征获得多维输出特性矩阵,特征矩阵生成的数量等于卷积核的数量。多通道卷积是常用的特征提取。
3.2.3。池层
池层主要包括三个方面的作用。
降低数据的维数,减少冗余信息;它可以提高模型的尺度不变性和旋转不变性,防止过度拟合的模型。常见的池操作包括最大池和平均池。
最大池是指取最大值的特征点邻域窗口和留住更多的纹理信息。具体计算公式如下所示的方程。
具体计算公式如下公式所示。 在哪里 是输入特征矩阵,参数呢h和 ,分别代表池窗口的大小,代表输入矩阵的子矩阵对应的窗口。
3.2.4。完整的连接层
完整的连接层主要由卷积转换特征矩阵输出层或池层到一个一维特征向量,然后将其传输到输出层。其实质是等价于一个线性空间变换的特征图。假设输入特征矩阵得到完整的连接层 和转换后输出结果 ,转换公式如下公式所示。 在哪里 的重量, 是抵消,f是激活函数。
3.2.5。输出层
收到完整的一维特征向量输出连接,然后使用Softmax分类器完成从特征值映射到概率。如果类别分类的任务KSoftmax地图输入 来K实数(0,1)并确保它们的和为1,如方程所示(17)。假设输出 ,映射表达式所示以下方程。 在哪里 是重量和 是抵消。
3.3。人类行为识别基于3 d注意力机制
在人类行为视频识别,因为处理的输入通常是一个与多个连续帧图像序列,与单个图片的输入识别相比,可能有多个连续帧之间的某些关系除了行为本身的特点。
相似度的计算,本文采用嵌入式高斯函数,这是一个简单的扩展基于普通高斯函数。方程(18)是普通高斯函数的定义,方程(19)是嵌入的高斯函数的定义。 在哪里我代表输出位置,j代表所有可能的相关职位我,x代表接收到的输入,代表点乘法操作,这是用来计算相应的位置之间的相似性和 , ;
3.4。基于三维残余的人类行为识别和注意力机制融合
3.4.1。AR3D_V1
AR3D_ V1模型使用的深层特征提取模块融合策略1融合3 d注意力机制恒等变换连接的三维残余结构,从而达到融合残留特性的影响和关注功能。相应的具体结构如图7。
从图可以看出7,AR3D_ V1深特征提取结构分为两个分支:体积积分分支,如三维残余结构,提取深度特性通过交替卷积操作和规范化操作;和身份连接操作方式的变化与卷积的结果直接添加输入输出的方法首先获取功能X′与注意分配机制,通过一个3 d关注模块,然后添加X′卷积的结果输出。因此,这种结构也可以被称为一种3 d残留结构(22]。
假设输入模块接收到x通过两个分支,它先后提取特征,然后添加特性,最后,得到最终结果y通过ReLu函数,给出以下方程。 在哪里一个代表了注意力特征提取操作, 卷积内核参数, 偏移量的值,和ReLu激活函数,下标代表不同位置。
3.4.2。AR3D_V2
相应的深层特征提取模块2 AR3D_V2模型融合的策略。具体结构如图8。
通过图8,发现AR3D_V2深特征提取结构采用并行融合的策略,也就是说,在3 d关注模块直接作用于3 d残余结构,深层特性获得的三维残余结构提取。与结构对应于AR3D_1模型相比,AR3D_V2不会改变的深层特征提取模块连接的恒等变换操作的残余结构,但让他们存在于一个连续的方式和提取深度行为特性。
假设输入特性映射模块接收到x(本文是3 d浅的输出特征提取模块),然后相应的剩余功能通过3 d剩余模块,输出方程所示(22)。然后,通过3 d的注意机制模块,分配机制的关注获得最终的输出特性y,见方程(23)。 在哪里 代表卷积内核参数的三维残余模块, 是相应的偏移值,然后呢f是相应的激活函数(ReLu函数在这个研究)。 在哪里一个代表注意特征提取操作,只关注模块分配注意重量的所有功能特征映射不改变的尺寸特性或其他信息。这主要是由3 d关注模块本身的性质。因此,该模块还可以嵌入到3 dcnn与任何结构。
4所示。实验结果和分析
这句话的默认格式是16个RGB图像。大的图像是112×112,最小批量大小设置为25。标准的辍学是CE辍学,特别是“softmax_cross_entry_with_logits_v2”TensorFlow提供的API;初始值为0.001,指数分解的速度调整,即。,the decomposition coefficient is set to 0.1, and the decomposition step is set to 2000; the optimizer is “Adam”; and the early station was set to 10. The discrepancies of all the standard comparisons in this sentence were set by default in the old script and would be fair and accurate of comparative experiments.
因为这项研究是基于人类活动在深度学习的认可,在这一节中使用的比较都是深入研究[23,24]。模型可以分为两类:比较简单的模型和其他模型。设计师,如3 d Conv净和C3d,参考本文档中提供的测量模型改进的性能设计(25,26]。其中,3 d Conv净首次提出的概念3 d转换;C3D是典型的3 d模型领域的CNN人类行为;和设计模型分解浅特性在这个句子包含的一部分设计(27,28]。因此,本文应该选为基准。的其他模型大多是一些细节和模型中提到在深度的设计模型,包括进化模型,近年来已经完成。特别是,它具有经典two-thread电话网络;Res3D P3D-A 3 d部分;视频LSTMs使用听力技巧来确定人类活动;I3D 3 d CNN集合;和人类建模是公认的2 d和3 d旋转。运行的3 d模型(ResNet-18)和显示器连接部分。表1提供了比较模型。
从表可以看出1相比模型基本上覆盖2 d和3 d的应用卷积神经网络,循环神经网络(LSTM),剩余网络和注意力机制,及其对应的时间跨度也很大,从最早的2013年最新2019年(29日,30.]。因此,本文具有一定的针对性和代表性的选择比较模型。
预定义的在这一节中:策略1意味着特性除了融合;和策略2是拼接和融合。符号“+”表示模型的识别精度的改进特征融合后与基线相比实验。两个浅特征融合策略的测试结果UCF101和HMDB51数据集数据所示9和10。
从数据可以看出9和10浅后模型的性能特征融合不同程度改善,和添加剂的改善融合策略是大于拼接融合的策略。其中,UCF101数据集,策略1增加了0.54%;和策略2略低于策略1,只增加0.35%。HMDB51数据集,提高策略1是0.63%,策略2的两倍。同时,发现从数字9和10每种策略的推广范围的两个基准数据集相对较近,特别是策略2,HMDB51 UCF101 0.35%和0.31%。这也说明,这两个融合策略可以使用不同的数据集,并有良好的迁移和泛化。这一分析的主要原因是浅特性和深特性不同粒度表示相同的类型。当添加方法,它可以弥补彼此的缺点在一定程度上,从而达到互相学习和充分发挥最佳性能表征;相反,策略2只拼接通道上的两个维度的特性,它可以被视为一个简单的清单的功能。对相同类型的特性,不能实现真正的集成,所以改进的整体范围小于添加剂集成的策略。
实验结果的模拟考试包括两部分:一个单一模态浅特性分类精度测试和光学流特性融合实验。第一次模拟考试的浅模态特性分类主要是用来计算两个模态的贡献RGB和光学特性(流量)。实验结果如图所示11。预定义的在这一节中,策略1代表添加剂融合基于特性的贡献和策略2代表拼接和融合。符号“+”表示模型的识别精度的改进光流特征融合后与基准相比实验。
从图可以看出11,肤浅的特性分类效果的RGB和光学流在基准数据集仍然是不同的。其中,光流特征的分类效果一般优于RGB特性。UCF101 HMDB51,两个数据集的分类识别率基于光流特征大约是2.5%高于RGB特性。分析,这是因为光流保留更多的操作行为的特征信息和抑制背景因素对行为本身的影响,所以它获得一个相对较高的识别精度。
自这两个模式的单一分类效果的数据有不同的性能,使用添加剂融合策略时,我们不能简单地直接添加两个但保险丝应该根据各自的贡献(本文衡量精度的贡献)。章4,一个添加剂融合策略提出了基于特征的贡献程度。首先,获得的结果在图的特性的贡献程度11摘要通过使用公式计算,然后进行功能添加剂融合。融合结果如图12。图12还包含拼接融合策略的结果。
从图可以看出12添加剂的检测结果融合策略基于特性的贡献明显改善的两个基准数据集,增加超过2百分比,包括HMDB51增加2.69%。拼接和融合策略的效果也增加了1%以上,包括1.34% UCF101 HMDB51数据集和大约1.9%。同时,从图可以看出12增加策略1几乎是策略2的两倍,这也证明了添加剂融合策略提出了基于特征的贡献是有效和更适合于多通道特性融合拼接融合策略。
5。结论
在这项研究中,三维旋转用于分解对象在时空中。同时,R3D模型本文提出了由于缺少大型3 d CNN缺点和困难的训练。设计功能模块分为两个部分:3 d层和3 d深度层浅特性。模型的原型比较C3D模型;地下能源使用的结构分解剩余能量来形成一个三维剩余模块。实验表明,R3D模型的准确性为87.89%和50.27%,分别UCF101和HMDB51之间,有一个更高层次的性能改进的3 d模型和其他模型相比。认识到人类行为基于3 d残差和交互。提供性能的古老的3 d模型的实现人体艺术和这些概念创建一个人际经验和ar3d_v2 unravies深厚的商业地产。实验表明,熔炼模型改进的性能在几个水平相比,单个样品,AR3D_V2具有最好的性能。
数据可用性
没有数据被用来支持本研究。
的利益冲突
作者宣称没有利益冲突。