CIN
计算智能和神经科学
1687 - 5273我ssn>
1687 - 5265我ssn>
Hindawi
10.1155 / 2018/6401645
6401645
研究文章
再加权方案来改善神经自回归分布估计量的表示
http://orcid.org/0000 - 0003 - 4242 - 9756
王
郑
http://orcid.org/0000 - 0003 - 2706 - 6264
吴
Qingbiao
Sanei
Saeid
数学科学学院
浙江大学
杭州
浙江
中国
zju.edu.cn
2018年
23
12
2018年
2018年
21
04
2018年
29日
10
2018年
21
11
2018年
23
12
2018年
2018年
版权©2018郑王先生和吴Qingbiao。
这是一个开放的文章在知识共享归属许可下发布的,它允许无限制的使用,分布和繁殖在任何媒介,提供最初的工作是正确的引用。
神经自回归分布估计量(纳德)是一个竞争模型密度估计的任务领域的机器学习。而纳德主要集中在估计密度的问题,处理其他任务的能力还有待提高。在本文中,我们介绍一种简单而有效的再加权方案修改的参数学习纳德。我们利用纳德的结构,激活的重量来自相应的隐藏层。实验表明,无监督学习的特点与我们再加权方案将更有意义,并为神经网络初始化的性能有显著的改善。
中国国家自然科学基金
11771393
11632015
浙江省自然科学基金
LZ14A010002
1。介绍
学习是最重要的一个特点在机器学习领域的任务。一个有意义的特征表示可能是其他程序的基础。在各种方法中,限制了玻耳兹曼机(元),这是一个强大的生成模型,展示了其学习能力有用表示从许多不同类型的数据(
1 ,
2 ]。
元模型输入的高阶维度之间的相关性。常用的特征提取器,或各种深度模型的构建块,例如,深度信念网。在后一种情况下,学会表示美联储到另一个组织遏制在更高的层,和深架构通常会导致更好的性能在很多领域(
3 - - - - - -
5 ]。其变体(
6 - - - - - -
8 )也有能力处理各种各样的任务。
尽管遏制有很多优势,但它并不适合估计分布的问题,换句话说,估计的联合概率观察。联合概率的估计一个给定的观察,必须计算归一化常数,这是棘手甚至对于中等大小的输入。要处理这个问题,一些其他的方法必须被用来近似归一化常数,例如,退火重要性抽样(
9 ,
10 ),它是复杂和计算成本。
神经自回归分布估计量(纳德)
11 )是一个强大的模型估计的分布数据,这是受遏制的平均场过程。下的联合概率计算纳德可以准确、高效地完成。纳德和它的变体(
12 - - - - - -
17 已被证明是最先进的联合密度模型对各种数据集。
而纳德主要关注数据的分布,它也可以被视为一种模型来从数据中提取特征。
调整的方法有了很大的成就在机器学习领域。在整体学习的一些模型,如演算法(
18 ),每个样本数据集的重要性将会再加权来实现更好的结果。在一些深生成模型,提出了调整方法调整的重要性权重重要性抽样的过程
19 ,
20. ]。与调整方法,梯度的估计会更准确。
在本文中,我们处理功能由纳德和提出一个新颖的方法来提高学习的质量表示通过一个简单的再加权方案的权重由纳德学习。该方法仍然是模型的结构,而计算的过程仍然是简单和容易掌握的。
本文的其余部分的结构如下。节
2 ,我们审查的重要架构遏制和纳德,这是我们的方法和实验的基础。节
3 介绍和分析再加权方案改进的质量功能由纳德学习。节
4 的情况下,我们提出一个类似的方法初始化。我们提供实验评价和证明的结果部分
5 。最后,我们在部分结论
6 。
2。审查的遏制和纳德
在本节中,我们审查的基本元模型和强调遏制和纳德之间的关系。
限制玻耳兹曼机是一种马尔可夫随机场,其中包含一层可见的单位<我nline-formula>
v
∈
0 1
D
和一层隐藏的单位<我nline-formula>
h
∈
0 1
H
。两层彼此相连,intralayer没有连接。
的能量状态<我nline-formula>
v
,
h
被定义为
(1)
E
v
,
h
;
θ
=
−
∑
我
=
1
D
b
我
v
我
−
∑
我
=
1
D
∑
j
=
1
H
W
我
j
v
我
h
j
−
∑
j
=
1
H
c
j
h
j
,
在哪里<我nline-formula>
W
我
j
层之间的连接权值吗<我nline-formula>
b
我
,
c
j
是每一层的偏见。
可见状态的概率
(2)
p
v
;
θ
=
1
Z
θ
∑
h
经验值
−
E
v
,
h
;
θ
,
在哪里<我nline-formula>
Z
θ
=
∑
v
,
h
经验值
−
E
v
,
h
;
θ
是归一化常数。
由于棘手的归一化常数,遏制竞争力在估计分布的任务。
对于一个给定的观察,可以写成分布
(3)
p
v
=
∏
我
=
1
D
p
v
我
v
<
我
,
在哪里<我nline-formula>
v
<
我
表示subvector前的观察<我talic>
我我talic>th维度。评估的条件分布<我nline-formula>
p
v
我
v
<
我
一个阶乘分布<我nline-formula>
问
v
我
,
v
>
我
,
h
v
<
我
是用来近似<我nline-formula>
p
v
我
,
v
>
我
,
h
v
<
我
:
(4)
问
v
我
,
v
>
我
,
h
v
<
我
=
μ
我
我
v
我
1
−
μ
我
我
1
−
v
我
,
∏
j
>
我
μ
j
我
v
j
1
−
μ
j
我
1
−
v
j
,
∏
k
τ
k
我
h
k
1
−
τ
k
我
1
−
h
k
。
吉隆坡的最小化这两个发行版之间的分歧导致了两个重要的方程:
(5)
τ
k
我
=
团体
c
k
+
∑
j
≥
我
W
k
j
μ
j
我
+
∑
j
<
我
W
k
j
v
j
,
μ
j
我
=
团体
b
j
+
∑
k
W
k
j
τ
k
我
,
在哪里<我nline-formula>
团体
x
=
1
/
1
+
经验值
−
x
是乙状结肠函数。
纳德的主要结构是受平均场过程(
21 ,结果在以下方程:
(6)
p
v
我
=
1
v
<
我
=
团体
b
我
+
V
T
我
,
⋅
h
我
,
h
我
=
团体
c
+
W
⋅
,
<
我
v
<
我
,
在哪里<我nline-formula>
V
T
我
,
⋅
代表了<我nline-formula>
我
th行矩阵的转置<我nline-formula>
V
和<我nline-formula>
W
⋅
,
<
我
代表第一个<我talic>
我我talic>1列的矩阵<我nline-formula>
W
连接输入与相应的隐藏层。
这两个方程表明,纳德就像一个前馈神经网络的训练过程纳德可以转换为相同的框架为普通神经网络在成本函数的平均负对数似训练集。成本函数的梯度对每个参数可以完全通过反向传播,和最小化代价函数可以通过使用简单的随机梯度下降法。相比之下,对每个参数的梯度组织遏制必须由抽样近似从马尔可夫链
22 - - - - - -
27 ]。实验表明,纳德通常优于其他模型估计的任务分配,在纳德的性能等其他任务的无监督学习特性和神经网络的初始化并不是那么优秀。在本文中,我们主要处理这两个问题。
3所示。再加权方案特性
功能完全程度由学会了重量<我nline-formula>
W
和偏见<我nline-formula>
c
无论在遏制或纳德。提高功能,我们尝试修改相应的参数学习的同时保持纳德的结构模型。
直接的想法是由纳德利用条件概率的计算。考虑输入条件的一维概率在其他维度;测量指定的维度的重要性,我们夹其他维度和简单地比较两种情况下的概率如下:
(7)
p
v
我
=
1
,
v
≠
我
p
v
我
=
0
,
v
≠
我
=
p
v
我
=
1
v
≠
我
⋅
p
v
≠
我
p
v
我
=
0
v
≠
我
⋅
p
v
≠
我
=
p
v
我
=
1
v
≠
我
p
v
我
=
0
v
≠
我
=
ω
我
。
在这个例子中,我们定义的<我nline-formula>
ω
我
的重量分数<我talic>
我我talic>th维度的输入。大或小的价值<我nline-formula>
ω
我
表明,这两种情况的概率大大不同,我们应该更加注意这个指定的尺寸。这个再加权方案没有工作在实践中由于大量的计算。为每个维度的观察,我们必须计算两个前馈过程和它是不切实际的。
处理这个问题,我们近似条件概率<我nline-formula>
p
v
我
=
1
v
≠
我
和<我nline-formula>
p
v
我
=
0
v
≠
我
顺序固定的条件概率<我nline-formula>
p
v
我
=
1
v
<
我
和<我nline-formula>
p
v
我
=
0
v
<
我
,这是兼容纳德的原始结构。这种近似大幅降低了成本计算的一个因素<我talic>
H我talic>,这是每个隐层的大小。
我们进一步取代<我nline-formula>
ω
我
=
p
v
我
=
1
v
<
我
/
p
v
我
=
0
v
<
我
通过<我nline-formula>
ω
我
=
p
v
我
=
1
v
<
我
−
p
v
我
=
0
v
<
我
控制的不稳定性<我nline-formula>
ω
我
。因此,我们使用<我nline-formula>
ω
我
修改相应权重矩阵<我nline-formula>
W
换句话说,<我nline-formula>
我
th列<我nline-formula>
W
。我们会更加注意的尺寸在两种不同情况下概率变化强烈。这些维度应该有更大的权重生成特征表示。
最后再加权方案表示为
(8)
ω
我
=
p
v
我
=
1
v
<
我
−
p
v
我
=
0
v
<
我
,
(9)
ω
˜
我
=
ω
我
,
ω
我
<
τ
,
τ
,
否则,
(10)
k
=
∑
我
D
ω
˜
我
,
(11)
ω
^
我
=
D
ω
˜
我
k
,
(12)
h
=
团体
c
+
∑
我
D
ω
^
我
W
⋅
,
我
v
我
,
在哪里<我nline-formula>
τ
∈
0 1
是阈值控制的区别,<我talic>
D我talic>是输入的大小,<我nline-formula>
ω
^
我
的重量分数吗<我talic>
我我talic>th维度,<我nline-formula>
W
⋅
,
我
是<我talic>
我我talic>th列<我nline-formula>
W
,<我nline-formula>
h
是最后再加权特性。
在再加权过程,方程(
8 )计算概率之间的差异在两种情况下为每个维度。方程(
9 )控制体重的规模。方程(
10 )和(
11 )正常的体重。
虽然这再加权方案似乎是可信的,但很少改进功能。这可能解释说,再加权分数确实改变激活每个维度的特性<我nline-formula>
h
虽然不会改变的相对大小激活,这可能是更重要的是为了更好的表示。
为了解决这个问题,我们更愿意处理的行<我nline-formula>
W
而不是列,我们将再次利用纳德提供的结构。每个维度的输入,纳德提供了相应的隐藏层,它可以用来修改学习功能。在这种情况下,我们更加注意隐藏层的尺寸在饱和或灭活。这些想法会导致新的再加权方案如下:
(13)
h
˜
=
∑
我
D
h
我
D
,
(14)
ω
˜
j
=
ε
上
,
h
˜
j
>
τ
上
,
ε
较低的
,
h
˜
j
<
τ
较低的
,
1
,
否则,
(15)
k
=
∑
我
H
ω
˜
j
,
(16)
ω
^
j
=
H
ω
˜
j
k
,
(17)
c
^
j
=
c
j
⋅
ω
^
j
,
(18)
W
^
j
,
⋅
=
ω
^
j
W
j
,
⋅
,
(19)
h
=
团体
c
^
+
∑
我
D
W
^
⋅
,
我
v
我
,
在哪里<我nline-formula>
D
是输入的大小,<我nline-formula>
h
我
是<我talic>
我我talic>在纳德th隐藏层,<我nline-formula>
ε
上
,
ε
较低的
相对权重,<我nline-formula>
τ
上
,
τ
较低的
是阈值控制激活的价值,<我nline-formula>
h
˜
j
是<我talic>
j我talic>th单位规范化隐藏层<我nline-formula>
h
˜
,<我nline-formula>
W
^
j
,
⋅
和
W
j
,
⋅
代表了<我talic>
j我talic>为每个矩阵th行。
我们结束了再加权算法程序
1 。
<大胆>算法1:< /大胆>再加权方案的新特性。
鉴于:观察<我nline-formula>
v
、体重矩阵<我nline-formula>
W
和偏见<我nline-formula>
c
从训练有素的纳德
输出 :新功能对应的观察
(1)
总和所有隐藏层的激活和规范化它得到一个向量<我nline-formula>
h
˜
使用方程(
13 )
(2)
为每个维度<我talic>
j我talic>在向量<我nline-formula>
h
˜
,比较<我nline-formula>
h
˜
j
与阈值<我nline-formula>
τ
上
,
τ
较低的
并设置相应的权重<我nline-formula>
ω
˜
j
使用方程(
14 )
(3)
规范化的重量分数使用方程(
15 )和(
16 )
(4)
修改<我nline-formula>
W
,
c
使用方程(
17 )和(
18 )
(5)
计算新功能使用方程(
19 )
(6)
选择最好的功能验证。
这个再加权方案特性值得解释更多。作为每一个隐层的激活形式对应的向量的大小相同,在第一步中,我们和向量和规范化获得结果<我nline-formula>
h
˜
。因此,<我nline-formula>
h
˜
为每个维度的平均值是激活的隐藏层,它是如何激活的测量维度在纳德在前馈过程。
然后,我们介绍两个阈值<我nline-formula>
τ
上
,
τ
较低的
控制激活。单位被认为是在饱和如果激活大于上层阈值<我nline-formula>
τ
上
,这个单位的相应维度具有重量<我nline-formula>
ε
上
。同样的,我们给一个重量<我nline-formula>
ε
较低的
的维度激活小于低阈值<我nline-formula>
τ
较低的
。应该注意的是,重量<我nline-formula>
ε
较低的
和<我nline-formula>
ε
上
是相对的值与标准相比值1。在实践中,重量<我nline-formula>
ε
上
应该小于1时<我nline-formula>
ε
较低的
应大于1。我们强调这种方法的重要性。在饱和单位经常影响性能,通过这个步骤中,我们设置一个小体重减轻这种情况。而单位激活值接近于零被认为是灭活的,这些单位应该保持灭活,和其他一些单位甚至可能成为灭活后调整。在这种情况下,<我nline-formula>
W
j
,
⋅
v
+
c
j
这个维度是负的,和一个大重量确认情况。根据我们的观点,这个过程迫使的稀疏表示,这常常会导致更好的性能。
我们假设每个维度的原始再加权分数只是一个和规范再加权分数保持合理。
在这里,我们强调,我们的目标是改善功能。我们见面时估计分布的问题,纳德的原始重量应该利用自原始重量是最大似然代价函数的优化结果。我们的计划是不适合密度估计。
4所示。初始化再加权方案
遏制所学到的重量或纳德可以用来初始化一个神经网络的重量,这是这类模型的优点之一。进一步的神经网络可以用于其他任务,比如分类。
我们提出了再加权方案的特性,适用于每一个观察,尽管这种方法不适合初始化。
为了解决这个问题,我们计算再加权分数为每个样本在训练集和他们获得一个新的再加权的平均分数的权重矩阵和偏见。这个过程可以表示为
(20)
ω
^
=
∑
k
=
1
N
ω
^
k
N
,
(21)
c
^
j
=
c
j
⋅
w
^
j
,
(22)
W
^
j
,
⋅
=
ω
^
j
W
j
,
⋅
,
在哪里<我nline-formula>
N
在训练集样本的数量,<我nline-formula>
ω
^
k
是再加权得分向量对应<我nline-formula>
k
th训练样本。
完整的过程是在算法结束
2 。
<大胆>算法2:< /大胆>初始化再加权方案。
鉴于:一组训练样本<我nline-formula>
v
k
、体重矩阵<我nline-formula>
W
和偏见<我nline-formula>
c
从训练有素的纳德
输出 :再加权新的权重矩阵<我nline-formula>
W
^
和偏见<我nline-formula>
c
^
pretraining神经网络
(1)
对训练样本<我nline-formula>
v
k
使用方程,计算相应的再加权得分向量(
13 )- (
16 )
(2)
使用方程(
20. )计算最后再加权评分向量
(3)
使用方程(
21 )和(
22 )获得<我nline-formula>
W
^
和<我nline-formula>
c
^
(4)
选择最佳的权重矩阵和偏见的验证。
5。实验
在本节中,我们将展示几个二进制数据集上的实验结果再加权方案的特性和初始化。纳德的训练过程,一个固定尺寸的顺序必须选择输入的开始。由于实验表明,订货不产生重大影响的性能纳德(
11 ),对于每一个数据集,选择排序独立和保持相同的在所有的实验中。此外,hyperparameters纳德保持不变的hyperparameters为了选择再加权方案。纳德模型的实现是基于所提供的代码Larochelle和莫里
11 ]。
5.1。结果学习特性
测试是否再加权方案提高了学习功能,我们对分类进行一些实验。
我们注意我们的主要目的是评估提出再加权方案而不是追求最佳性能分类,我们只使用一个中等大小的模型来降低计算的成本。对于每个数据集,我们首先训练纳德和使用算法
1 得到改进的功能。处理这个过程的所有样本在训练集,验证集和测试集在所有新三组对应的结果。然后火车与单隐层神经网络作为分类器的学习功能。性能是衡量测试集上的分类错误率。我们进一步实验特性没有再加权方案获得一个标准的结果进行比较。同样大小的遏制与纳德也训练和分类结果作为参考。
我们十二个不同的数据集实验UCI存储库:成人,Binarized-MNIST, Connect-4,凸,DNA,蘑菇,新闻组,OCR-letters, RCV1,矩形、SVHN和Web。我们在表列出这些数据集的详细信息
1 。实验结果如表所示
2 。我们选择最好的结果再加权方案结果对应于不同hyperparameters之一。我们发现再加权方案的分类误差特点是低于没有再加权,这证明了改进原有的功能。功能的再加权方案可能更有意义。
表1
十二个数据集的详细信息。
数据集
输入的大小
类的数量
培训
验证
测试
成人
123年
2
5000年
1414年
26147年
Binarized-MNIST
784年
10
50000年
10000年
10000年
Connect-4
126年
3
16000年
4000年
47557年
凸
784年
2
6000年
2000年
50000年
DNA
180年
3
1400年
600年
1186年
蘑菇
112年
2
2000年
500年
5624年
新闻组
5000年
20.
9578年
1691年
7505年
OCR-letters
128年
26
32152年
10000年
10000年
RCV1
150年
2
40000年
10000年
150000年
矩形
784年
2
1000年
200年
50000年
SVHN
1024年
11
594388年
10000年
26032年
网络
300年
2
14000年
3188年
32561年
表2
通过神经网络分类结果在12个数据集。
数据集
输入的大小
特征尺寸
神经网络的大小
纳德
Reweighted-NADE
遏制
成人
123年
One hundred.
200年
0.16074
0.16013
0.16598
Binarized-MNIST
784年
300年
400年
0.0247
0.0243
0.0250
Connect-4
126年
One hundred.
200年
0.22436
0.22143
0.23367
凸
784年
300年
400年
0.27742
0.26124
0.29242
DNA
180年
One hundred.
200年
0.15683
0.15008
0.15093
蘑菇
112年
One hundred.
200年
0.0082
0.0059
0.0066
新闻组
5000年
1000年
2000年
0.30286
0.26156
0.30007
OCR-letters
128年
One hundred.
200年
0.1459
0.1409
0.1361
RCV1
150年
One hundred.
200年
0.05461
0.04674
0.06034
矩形
784年
300年
400年
0.09566
0.08782
0.10204
SVHN
1024年
300年
400年
0.08455
0.08025
0.09050
网络
300年
150年
200年
0.02189
0.02079
0.02515
为了进一步验证我们的方法,我们取代神经网络和支持向量机分类器,RandomForest,演算法和执行额外的实验。这些实验是通过实现LIBSVM [
28 )和scikit-learn。结果如表所示
3 - - - - - -
5 。在所有的实验中,分类器的参数优化了网格搜索和验证会给最好的性能。特性与我们再加权方案再次超越原版的,它证实了我们方法的有效性。
表3
通过SVM分类结果在12个数据集。
数据集
纳德+支持向量机
Reweighted-NADE +支持向量机
元+支持向量机
成人
0.15876
0.15753
0.16495
Binarized-MNIST
0.0374
0.0349
0.0358
Connect-4
0.27130
0.26680
0.28696
凸
0.30036
0.28570
0.31466
DNA
0.13406
0.12985
0.14418
蘑菇
0.01085
0.00871
0.00996
新闻组
0.29714
0.26862
0.28208
OCR-letters
0.1851
0.1802
0.1692
RCV1
0.06041
0.05325
0.07041
矩形
0.10836
0.09864
0.11526
SVHN
0.09346
0.08839
0.09842
网络
0.02110
0.01969
0.02420
表4
通过随机森林分类结果12个数据集。
数据集
纳德+射频
Reweighted-NADE +射频
元+射频
成人
0.16399
0.16069
0.16587
Binarized-MNIST
0.0301
0.0265
0.0312
Connect-4
0.26783
0.25443
0.28364
凸
0.29632
0.28502
0.30658
DNA
0.16948
0.15346
0.15936
蘑菇
0.01227
0.01014
0.01174
新闻组
0.32192
0.29460
0.31459
OCR-letters
0.1986
0.1863
0.1708
RCV1
0.07265
0.06249
0.08258
矩形
0.11816
0.10624
0.12646
SVHN
0.09838
0.09339
0.10283
网络
0.02647
0.02368
0.02773
表5
分类结果通过演12个数据集。
数据集
纳德+ AB
Reweighted-NADE AB +
元+ AB
成人
0.16013
0.15677
0.16445
Binarized-MNIST
0.0313
0.0274
0.0309
Connect-4
0.23912
0.22737
0.25494
凸
0.29420
0.28206
0.30082
DNA
0.14250
0.13238
0.14587
蘑菇
0.01049
0.00853
0.00978
新闻组
0.30753
0.28115
0.29474
OCR-letters
0.1681
0.1571
0.1432
RCV1
0.06847
0.06072
0.07509
矩形
0.10522
0.09476
0.11762
SVHN
0.08866
0.08374
0.09438
网络
0.02279
0.02147
0.02512
实验结果为不同的权重<我nline-formula>
ε
上
,
ε
较低的
在OCR-letters数据集如表所示
6 。在这一系列的实验,我们训练数据集上的纳德一开始,学习速度设置为0.001,下降常数设置为0,隐层的大小是100,我们用绑在纳德。也就是说,我们集<我nline-formula>
V
=
W
在方程(
6 )。接下来,我们继续<我nline-formula>
τ
上
=
0.73
和
τ
较低的
=
0.27
只有修改再加权参数探讨再加权方案的性能。结果表明,再加权方案有决定性作用改善功能。不合理再加权方案常常会导致更糟糕的结果比没有再加权方案。我们发现,设置较低的体重<我nline-formula>
ε
较低的
大于1和上面的重量<我nline-formula>
ε
上
小于1似乎是一个合理的再加权方案。在前面的章节中,我们已经解释了这种方式,一个较小的值上重量使饱和单元不饱和,表示这是有益的,而一个更大的值较低的重量保留了灭活单位和部队稀疏的特性。
表6
OCR-letters分类结果不同的权重。
Upper-weight
低体重
错误
0.8
0.8
0.1477
0.9
0.9
0.1472
1。0
1。0
0.1459
1。1
1。1
0.1445
1。2
1。2
0.1459
1。1
0.9
0.1470
1。2
0.8
0.1465
0.9
1。1
0.1447
0.8
1。2
0.1427
0.7
1。3
0.1425
0.6
1。4
0.1411
还应该指出的是,权重<我nline-formula>
ε
上
,
ε
较低的
是相对的体重比标准体重1。因此,必须控制体重和体重太大或太小会导致一个可怕的结果。
另一个因素影响再加权方案的性能阈值<我nline-formula>
τ
上
,
τ
较低的
显式地控制单元是饱和或灭活。结果不同的阈值<我nline-formula>
τ
上
,
τ
较低的
在OCR-letters数据集如表所示
7 。之前我们所做的一样,我们只修改这两个阈值在这一系列的实验,我们组上部重量0.6和重量降低到1.4。结果也证明了阈值的重要性。一方面,上阈值控制单位的比例被认为是在饱和,和一个更大的值上阈值导致这些单位占比例较小。另一方面,较低的阈值控制单位的比例被灭活,和一个更小的值较低的阈值会导致这些单位占比例较小。这些单位将更加灭活后再加权方案。
表7
分类结果OCR-letters不同阈值。
更高层的上限
下辨别阈
错误
0.55
0.45
0.1434
0.58
0.42
0.1434
0.61
0.39
0.1447
0.64
0.36
0.1431
0.67
0.33
0.1409
0.70
0.30
0.1424
0.73
0.27
0.1411
0.76
0.24
0.1418
0.79
0.21
0.1433
从我们的观点来看,这两个阈值更依赖数据集而不是规范。作为一个保守的策略,我们宁愿上设置阈值的范围从0.5到0.8,而较低的阈值的范围从0.5到0.2。
进一步研究的特性,我们检查和分析的价值激活的所有特性OCR-letters的测试集。图
1 显示单元的数量对应于每个激活值从0到1的步骤0.01。0.01单位下的激活,其价值被忽略保持平衡图,因为这些单位占绝大多数的单位。这些单位在调整之前的数量是562453年和575928年调整后,这证明了我们提出的政策并保持灭活单位和甚至力更稀疏的特性。明显降低的饱和单元如图,这符合我们的目的。
图1
单位的数量对应于每个值OCR-letters激活。(一)功能调整。调整后(b)特性。
(一)
(b)
我们也调查的平均价值激活每个维度的特性。结果如图所示
2 。我们发现在纳德特性调整后,在饱和尺寸限制,而灭活尺寸保持甚至更多的灭活。调整前后的平均特性相似而纳德特性和遏制特性显著不同。纳德特性和遏制功能之间的差异是由于内在差异模型纳德和遏制。
图2
平均每个维度的激活值OCR-letters。(一)功能调整。调整后(b)特性。从遏制(c)特性。
(一)
(b)
(c)
5.2。结果初始化
再加权方案我们还提出了由初始化,提高了神经网络的性能,我们将显示在这里。
测试性能,我们为每个数据集训练纳德,与同样大小也是训练有素的遏制。然后我们使用学到的权重矩阵<我nline-formula>
W
和偏见<我nline-formula>
c
初始化参数的神经网络分类器。然后,神经网络分类器训练在相应的数据集。评估我们的再加权方案,参数调整后也用作另一个神经网络分类器的初始化大小相同。最后,性能是衡量分类错误。
我们展示了结果表
8 。像之前一样,我们同样的12个数据集上执行实验和hyperparameters相同。从结果,这一次,我们可以看到,再加权方案初始化使得更显著改善分类性能相比原纳德参数。在大多数的数据集,错误reweighted-NADE和纳德之间的差异远远大于纳德和疟疾之间,这表明该再加权方案的效率。reweighted-NADE OCR-letters,分类性能不如遏制,这可以解释为之间的内在区别参数学习纳德和遏制,这是很难消除只能通过再加权方案。总之,该方案总是超过一个没有再加权。
表8
分类结果为初始化十二集。
数据集
输入的大小
隐层的大小
纳德
Reweighted-NADE
遏制
成人
123年
One hundred.
0.15921
0.15814
0.16009
Binarized-MNIST
784年
300年
0.0216
0.0198
0.0205
Connect-4
126年
One hundred.
0.19326
0.18474
0.19725
凸
784年
300年
0.25672
0.23898
0.26394
DNA
126年
One hundred.
0.06998
0.05986
0.06324
蘑菇
112年
One hundred.
0.00729
0.00498
0.00605
新闻组
5000年
1000年
0.34231
0.28767
0.3291
OCR-letters
128年
One hundred.
0.1669
0.1601
0.1374
RCV1
150年
One hundred.
0.05131
0.04449
0.05567
矩形
784年
300年
0.09062
0.08338
0.09948
SVHN
1024年
300年
0.08405
0.07810
0.08889
网络
300年
150年
0.01477
0.01366
0.01492
为了使实验更完整,我们实验不同的权重<我nline-formula>
ε
上
,
ε
较低的
Web上的数据集,结果如表所示
9 。纳德,在这个数据集,学习速率设置为0.005,下降常数设置为0,隐层的大小是150,体重是解开。上阈值和较低的阈值保存到0.67和0.33。启发式再加权方法,它集低重量大于1和上部重量小于1,再一次被证明是有效的。而这一次,适当的权重更远离标准体重1。这可以解释为平均的效果。因为我们计算的平均值再加权分数的所有训练样本,更歧视再加权方案保持尺寸之间的差异在最后再加权得分向量。换句话说,我们更喜欢更大的值为低重量和一个更小的值上重量在处理初始化的问题。
表9
分类结果与初始化网络不同的权重。
Upper-weight
低体重
错误
0.8
0.8
0.01409
0.9
0.9
0.01477
1。0
1。0
0.01477
1。1
1。1
0.01480
1。2
1。2
0.01480
1。1
0.9
0.01446
1。2
0.8
0.01486
0.9
1。1
0.01477
0.8
1。2
0.01471
0.7
1。3
0.01468
0.6
1。4
0.01418
0.5
1。5
0.01455
0.4
1。6
0.01375
0.3
1。7
0.01366
0.2
1。8
0.01437
结果数据集网络上关于各种阈值如表所示
10 。上重量和低体重设置为0.6和1.4,分别。我们在前一节中类似的结论。的阈值更依赖于数据集,我们喜欢一个保守的策略。
表10
分类结果不同阈值对网络的初始化。
更高层的上限
低阈值
错误
0.55
0.45
0.01425
0.58
0.42
0.01434
0.61
0.39
0.01449
0.64
0.36
0.01446
0.67
0.33
0.01418
0.70
0.30
0.01431
0.73
0.27
0.01464
0.76
0.24
0.01446
0.79
0.21
0.01452
6。结论
在本文中,我们提出了一个简单的和小说再加权方案修改纳德的学习参数。我们利用激活隐藏层的学习纳德模型,设置适当的阈值控制的比例超过饱和和灭活单位。为了达到更好的效果,提出了一个启发式再加权方法。原始参数修改和规范化。再加权参数用于生成特性或更好地提高神经网络的初始化的性能。实验表明,再加权方案的有效性,并有明显的改善在机器学习领域的两个重要的任务。
数据可用性
本文中使用的数据都是公开的,可以获得
http://archive.ics.uci.edu/ml/datasets.html 。
的利益冲突
作者宣称没有利益冲突有关的出版。
确认
这项研究得到了国家自然科学基金(批准号11771393和11771393)和浙江省自然科学基金(批准号LZ14A010002)。
[
]1
Bengio
Y。
人工智能的学习深入架构
机器学习的基础和趋势®我talic>
2009年
2
1我ssue>
1
127年
10.1561 / 2200000006
2 - s2.0 - 69349090197
[
]2
Bengio
Y。
考维尔
一个。
文森特
P。
表示学习:审查和新观点
IEEE模式分析与机器智能我talic>
2013年
35
8我ssue>
1798年
1828年
10.1109 / tpami.2013.50
2 - s2.0 - 84879854889
[
]3
辛顿
g . E。
Osindero
年代。
格兰
Y.-W。
深度信念网的快速学习算法
神经计算我talic>
2006年
18
7我ssue>
1527年
1554年
10.1162 / neco.2006.18.7.1527
2 - s2.0 - 33745805403
[
]4
Salakhutdinov
R。
穆雷
我。
定量分析的深层信念网络
25日学报》国际会议上机器学习
2008年7月
芬兰赫尔辛基
ACM
872年
879年
[
]5
Schmidhuber
J。
深度学习神经网络:概述
神经网络我talic>
2015年
61年
85年
117年
10.1016 / j.neunet.2014.09.003
2 - s2.0 - 84910651844
[
]6
Marc-Alexandre
C。
Larochelle
H。
无限限制玻耳兹曼机
神经计算我talic>
2016年
28
7我ssue>
1265年
1288年
10.1162 / neco_a_00848
2 - s2.0 - 84976515716
[
]7
考维尔
a . C。
詹姆斯
B。
Bengio
Y。
高峰和板限制玻耳兹曼机
1
AISTATS学报》
2011年10月
美国劳德代尔堡
5
[
]8
辛顿
g . E。
Salakhutdinov
R R。
复制softmax:一个无向的话题模型
22日学报》国际会议上神经信息处理系统
2009年12月
加拿大的温哥华,MB
1607年
1614年
[
]9
伯
Y。
Grosse
r B。
Salakhutdinov
R。
准确和保守估计的MRF对数似使用反向退火
2015年
https://arxiv.org/abs/1412.8566
[
]10
尼尔
r·M。
Lingua:: EN:: Titlecase
统计和计算我talic>
2001年
11
2我ssue>
125年
139年
10.1023 /:1008923215028
2 - s2.0 - 0000273048
[
]11
Larochelle
H。
穆雷
我。
神经自回归分布估计量
1
AISTATS学报》
2011年10月
美国劳德代尔堡
2
[
]12
Larochelle
H。
刘
年代。
一个神经模型自回归主题
22日学报》国际会议上神经信息处理系统
2012年12月
太浩湖,内华达州
2708年
2716年
[
]13
穆雷
我。
Salakhutdinov
R R。
评估概率在高维潜变量模型
学报的发展神经信息处理系统
2009年12月
加拿大的温哥华,MB
1137年
1144年
[
]14
Raiko
T。
姚
l
赵
K。
Bengio
Y。
迭代估计nade-k神经自回归分布
学报的发展神经信息处理系统
2014年
加拿大的蒙特利尔,QC
325年
333年
[
]15
乌里亚
B。
穆雷
我。
Larochelle
H。
神经自回归density-estimator Rnade:实值
学报的发展神经信息处理系统
2013年12月
太浩湖,NV,美国
2175年
2183年
[
]16
郑
Y。
泽梅尔
r S。
张
Y.-J。
Larochelle
H。
一个神经自回归方法引起的认可
国际计算机视觉杂志》上我talic>
2014年
113年
1我ssue>
67年
79年
10.1007 / s11263 - 014 - 0765 - x
2 - s2.0 - 84939873522
[
]17
郑
Y。
张
Yu-J。
Larochelle
H。
主题建模的多通道数据:一个自回归方法
学报IEEE计算机视觉与模式识别会议
2014年6月
美国哥伦布,哦
1370年
1377年
[
]18
弗洛伊德
Y。
Schapire
r·E。
实验用一个新的增强算法
96年
13日学报》国际会议上机器学习
1996年7月
巴里,意大利
148年
156年
[
]19
Bornschein
j。
Bengio
Y。
再加权和生物钟
2014年
https://arxiv.org/abs/1406.2751
[
]20.
伯
Y。
Grosse
R。
Salakhutdinov
R。
重要性加权autoencoders
2015年
https://arxiv.org/abs/1509.00519
[
]21
扫罗
l·K。
Jaakkola
T。
约旦
m . I。
平均场理论乙状结肠信念网络
人工智能研究杂志》上我talic>
1996年
4
1我ssue>
61年
76年
10.1613 / jair.251
[
]22
赵
k . H。
Raiko
T。
亚历山大
我。
玻耳兹曼机并行回火是有效学习的限制
学报2010年国际神经网络(IJCNN)联合会议
2010年7月
西班牙巴塞罗那
1
8
[
]23
辛顿
G。
一个实际的指导培训限制玻耳兹曼机
动力我talic>
2010年
9
1我ssue>
926年
[
]24
辛顿
g . E。
培训产品的专家通过最小化对比差异
神经计算我talic>
2002年
14
8我ssue>
1771年
1800年
10.1162 / 089976602760128018
2 - s2.0 - 0013344078
[
]25
马顿斯
J。
Sutskever
我。
可平行的马尔可夫随机域的采样
AISTATS学报》
2010年5月
意大利撒丁岛
517年
524年
[
]26
Salakhutdinov
R R。
学习在马尔可夫随机域使用回火转变
学报的发展神经信息处理系统
2009年12月
加拿大的温哥华,MB
1598年
1606年
[
]27
从事公务
T。
培训限制玻耳兹曼机使用近似梯度可能性
25日学报》国际会议上机器学习
2008年7月
芬兰赫尔辛基
ACM
1064年
1071年
[
]28
常
c c。
林
C.-J。
LIBSVM:支持向量机的库
ACM智能交易系统和技术我talic>
2001年
2
3我ssue>
1
27
10.1145/1961189.1961199
2 - s2.0 - 79955702502