文摘

态度的调整时间对齐波动是由于接触力的波动造成的信号兼容peg-in-hole大会令人不安的时刻。然而,这些波动难以精确测量或定义的许多不确定因素的工作环境。值得注意的是,重力扰动力矩和惯性力矩显著影响这些波动,联系汇率制度的变化有关的质量和长度有至关重要的影响。摘要视觉把握战略提出了基于强化学习深peg-in-hole组装。首先,分析了装配的令人不安的时刻装配时间变动的因素进行调查。然后,这个研究设计视觉把握战略之间建立一个映射关系把握的位置和装配时间,提高装配效率。最后,组装的机器人系统建于V-REP来验证该方法的有效性,和机器人能够在没有人为干涉的情况下独立完成培训和手动标记在把握培训过程。模拟结果表明,该方法可以提高装配效率13.83%。,当质量和挂钩的长度变化,该方法仍然是有效的提高装配效率。

1。介绍

机器人在工业领域的应用和发展已经发展在过去的二十年里突飞猛进(1- - - - - -9];因此,他们正逐渐融入人们的日常生活。机器人代替人类完成工作在许多场景。传统的机器人控制方法是硬编码的模式在结构环境中。这些方法限制机器人的适应性和生产灵活性,这就增加了劳动力成本,降低机器人应用程序的适当范围的情况。此外,传统的机器人控制方法有一个很大的差距与人类智能传感环境或学习一些技能。因此,它成为主要发展方向在机器人控制领域,机器人被训练来学习技能。人类的感知环境的方式正在逐步实现机器人通过仿生手段,如视觉传感器和力传感器(10- - - - - -15]。机器人的运动精度控制已超过人类,如速度、距离和角度。然而,机器人智能尚未满足人类的需求,在工作学习的技能。为了使机器人能够自动获取新的知识或技能,研究人员使用机器学习的方法,不断通过培训提高机械性能。最后,机器人可以模仿或实现人类的学习行为16- - - - - -21]。

掌握函数是最基本的操纵机器人在工业和日常生活的功能,也是许多复杂的操纵行为的基础(22- - - - - -26]。装配任务是一个复杂的机械,这通常需要掌握函数。因此,研究人员已经进行了许多研究领域近年来把握。深度学习的功能算法基于多通道组正则化已经能够不依赖特性的手设计的任务RGB-D图像检测机器人抓(27]。它有更好的性能比前手的设计特点。手眼协调能力系统深入学习可以执行实时伺服补偿,这并不取决于相机标定和机器人的姿态28]。深入学习掌握预测方法可以解决这个问题,已经能够不依赖人工设计的特性,大大降低学习成本。然而,深度学习方法往往需要大量的数据集完成分析,结果训练后都非常依赖于数据集的质量。这在一定程度上限制了其应用范围。深度学习有良好的分析和感知能力,但它缺乏决策能力。这也限制了基于深度学习把握策略的使用场景。深度学习需要一个昂贵的成本来构建在实践中,大量的数据集,甚至难以实现。因此,这是一个很好的解决方案使用基于强化学习的试验和错误的方法,使机器人自动收集数据集。因此,基于强化学习的掌握方法已被广泛研究。例如,基于强化学习的角度优化策略采用主动视觉优化视觉传感器的观点(29日),可以把握决策缺少一些信息通过强化学习的试验和错误不依赖multiangle图像采集。这方法放松假设传感器的观点和提高把握成功率。此外,分层强化学习策略可以自动学习多个把握策略来解决一个贪婪的类型的限制机器人系统(30.]。低级策略学习如何掌握特定的地点和特定类型的把握,和高级策略学习如何选择贪婪的类型和位置。这种策略可以从一个给定的生成一个把握战略把握的位置。尽管强化学习具有良好的决策能力,但它仅限于离散行动空间由于计算能力的限制,限制了其应用范围,很难处理问题持续的行动空间。但许多实际问题都在持续的行动空间。因此,学者们进行了大量研究对于强化学习,结合深度学习的认知能力和决策能力的强化学习31日,32]。,直接控制实现了从原始输入输出通过端到端学习方法。随后,研究人员提出了很多把握方法基于强化学习。基于深度视觉把握方法强化学习能输出所有可能的行动的预期回报只要输入当前状态观测图像,然后,选择最佳的行动33,34]。机器人完全self-supervised提高掌握反复试验的成功率。除此之外,在现实环境中,基于深度视觉把握方法强化学习不需要微调成功把握以前见过的对象,甚至它可以成功地抓住前所未有的semicompliant对象(35]。因此,深入强化学习更适合处理装配在连续动作空间的把握问题。

peg-in-hole的任务是一个典型的装配任务。它是许多复杂的装配任务的基础知识(36]。近年来,peg-in-hole组装的研究也取得了许多新方法。例如,基于力/力矩的自动校准方法建立了三点接触模型,分析了自动校正之前插入通过受力分析和几何分析(37]。此外,螺钉插入方法peg-in-hole组装减少转轴的轴向摩擦力补偿和提高了碰撞接触的挂钩和孔在装配38]。此外,合规没有力反馈控制方法可以分析当前接触状态和孔之间的挂钩,它克服了识别过程中不可避免的位置不确定性(39]。和peg-in-hole大会可以不依赖昂贵的力传感器或远程完成合规机械。另外,变量的组装策略合规中心设计了一个弹性位移装置(40]。该方法结合的优势积极合规和被动合规没有力/力矩传感器,简化了控制系统。这个方法可以解决定位错误。peg-in-hole议会的传统控制方法取得了许多研究成果,但传统的控制方法是限于特定的工作环境。传统的装配机器人需要大量的参数之前部署工作。因此,peg-in-hole组装的研究在非结构化环境中仍然是一个挑战。然而,智能装配机器人基于深度的方法强化学习可以极大地减少部署相关手册的工作参数(41]。它使用机器人的传感器感知环境,然后分析了系统状态。这种方法可以获得更好的控制精度和鲁棒性。此外,组装与深层强化学习训练方法被设计来处理不确定性的复杂的断路器装配过程(42]。它使机器人能够自主学习技能的定位和姿态调整装配培训。这个方法取得了装配成功率很高。

peg-in-hole的核心工作是对齐的钉孔,即调整挂钩的态度和立场。装配对准效率受到很多不确定因素的影响在现实环境中定位调整。为了解决这个问题,本文进行了以下研究:(1)分析之间的关系把握位置和装配定位的调整时间(2)调查的影响装配效率时的长度和质量挂钩已经改变了(3)验证该方法的有效性在提高装配效率

本文的其余部分组织如下:在部分2介绍了该设备的工作原理,和之间的关系把握的位置和装配效率进行了分析。一节3提出了视觉把握战略和组装的细节解释道。并给出了仿真结果和分析结果4。最后一部分介绍了本文的结论和未来的工作。

2。工作原理及分析

2.1。工作原理及分析大会

Peg-in-hole分为搜索阶段、调整阶段,和插入的阶段。首先,搜索阶段的工作是找到洞的位置。然后,对准阶段调整装配挂钩的态度与孔对齐。最后,插入阶段是将人民币与美元挂钩插入孔完成装配任务。通常认为,在早期研究peg-in-hole组装、挂钩和孔插入之前可以很好地结合。事实上,人民币与美元挂钩可能不是好与孔对齐,需要调整的位置和态度挂钩完成孔对齐。大会时间也延长调整数量的增加,减少装配效率。

就经常会有一种倾角之间的挂钩和孔在装配定位阶段。这个倾角是一个组装的关键参数对齐,如图1。仍然可以完成组装时挂钩和孔之间的倾角如果装配工作有一个装配间隙。这个倾角最大倾角 所允许的组装。公式的最大倾角 组装描述如下: 在哪里 peg-in-hole组装间隙和吗 是组装插入距离。

有三种接触状态peg-in-hole大会期间,如图2。机器人移动的平面附近的挂钩孔,这样挂钩的底部接触孔的顶部。这种接触状态被定义为平面接触,如图2(一个)。机器人使用螺旋力扫描的表面部分搜索的洞。挂钩将斜坡如果挂钩是足够接近的中心孔的中心。接触状态变成了两点接触,如图2 (b)。幻灯片的边缘挂钩孔,同时保持两点接触。当挂钩方法的中心孔的中心在一定范围内,接触状态变化到三点接触,如图2 (c)。对齐的挂钩需要调整的态度。

插入动作无法完成如果倾角大于最大倾角 也就是说,插入距离 这一次是零。培训目标的机器人倾斜角可以更快的调整为零或小于最大倾角 将人民币与美元挂钩插入洞里。这减少了装配定位困难,但却增加了装配模型的精确定义的困难。钉完成后倾角时的一致性调整的态度 当前的校准调整低于最大倾角 或零。然后插入挂钩孔完成装配任务。因此,对齐调整时间是影响装配效率的一个重要指标。

向下的装配力将生成当机器人试图将挂钩插入洞两点接触状态时,将生成一个相应的反作用力在接触点。反应的方向和力量 总是指向的中心孔,如图3(一个)。当前的倾角 之间的角线连接两个接触点A和B和 - - - - - -轴。挂钩会自发走向的中心孔的作用下反作用力的总和如果摩擦接触点被忽略。这种自发的滑动是由于自然的吸引力,也是核心种基于合规性peg-in-hole机器人的控制原理。这种能力的机器人可以处理孔位置的不确定性。 装配力的预测吗 - - - - - -飞机和 - - - - - -轴, 与重力方向一致如图3 (b)。挂钩的装配力大于静态摩擦力在接触点 和反应力的合成 在同一个方向。因此,挂钩和孔产生相对滑动,然后盯住滑进洞里。他们相互抵消的方向 是相反的。装配力小于静摩擦力的接触点,挂钩和孔相对于彼此不会滑动。它可能导致挂钩小姐的对齐位置或溜出洞。扰动力矩的波动将导致装配力波动突然,使挂钩无法完成定位。机器人需要调整对齐,从而增加装配时间,减少装配效率。挂钩时吸引了成孔的中心,它可以插入洞如果当前的倾角 是零。否则,三点接触的接触状态的变化状态。的转矩 需要调整当前的倾角 将挂钩插入孔,如图3 (c)。挂钩插入到孔完成组装完成后对齐调整。

2.2。分析扰动组装

本研究重点是把握位置影响装配定位的效率,从而提高装配效率。因此,搜索阶段和插入阶段不是研究和深入讨论。不同的把握职位产生不同的对齐时间相同的当前的倾角 ,如图4。不同的运动轨迹和令人不安的时刻将会产生的不同把握,生产装配时间的差异。在这些令人不安的时刻,引力扰动力矩和惯性力矩的影响特别显著的组装,这也将出现波动时,机器人调整挂钩孔对齐。此外,它将受到的波动的影响令人不安的时刻,机器人调整挂钩的立场和态度。信号波动造成的令人不安的时刻将提高装配定位的难度,这就增加了调整时间和减少装配工作的效率。两个特殊的把握立场值得注意的影响减少令人不安的时刻:(1)把握位置的质心和旋转的中心重合,从而产生最小的令人不安的时刻重力在调整对齐。但仍有惯性的时刻(2)把握的位置不仅是为了配合质心和旋转的中心还与惯性轴和旋转轴,产生引力扰动力矩和惯性力矩最小

引力扰动力矩的公式 显示如下: 在哪里 挂钩的质量, 重力加速度, 转动轴的距离于力功能点,然后呢 是重力,向量之间的夹角(例如, )。

惯性的公式夫妇 产生的惯性矩 描述如下: 在哪里 之间的垂直距离是质心和旋转轴吗 是角加速度。

从上面的公式可以看出,挂钩的质量和作用距离有重要影响重力扰动力矩和惯性力矩。质心的位置变得不确定,由于制造误差的挂钩在同一生产批次。此外,还有不同的符合度惯性轴和旋转轴之间因为不同的把握职位。和校准过程调整的态度将不同的距离和运动轨迹,即使有相同的倾角挂钩。这些因素的不确定性加剧的调整时间。因此,选择一个合适的把握位置在组装的过程中可以有效地减少波动的令人不安的时刻调整调整,这主要是由于改变质量,体积,和操作的距离。传统的机器人控制方法不能处理这些复杂多变的装配任务。因此,我们希望通过训练方法训练机器人的强化学习,机器人可以自动处理这些在非结构化环境中组装任务。机器人通常需要多次调整态度调整阶段。兼容的控制需要不断判断当前基于接触力的态度。 Some uncertain factors cause the fluctuation of the signal of contact force, which increases the difficulty of alignment. In particular, the gravitational disturbing moments and the inertia moments have a prominent influence on this fluctuation, which will lead to a prolonged time for alignment adjustment and ultimately reduce assembly efficiency. Therefore, the cost of time on the alignment stage can be reduced if the robot can reduce the fluctuation of the disturbing moments. Finally, the improvement of assembly efficiency is realized. Traditional control methods cannot handle these uncertain fluctuations of disturbing moments. However, artificial calibration of mechanical parameters or grasping positions is not only cumbersome, but also has certain errors, or even impossible to achieve. This difficulty can be avoided through trial and error learning based on deep reinforcement learning, which does not require artificial labels and prior knowledge of mechanical parameters. When the grasping position is restricted to a certain area with the proposed method, which is considered to improve assembly efficiency if the trained robot expends less assembly time than the untrained robot.

3所示。装配系统和深刻的强化学习

peg-in-hole的装配任务分为两个分支任务:掌握任务和装配任务。因此,机器人配备了抓取模块和装配模块。把握任务指的是机器人抓住大会之前执行装配挂钩。装配任务分为三个阶段:搜索、对齐和插入。本研究提出了一种视觉把握策略来提高装配效率通过改善其把握战略的基础上,分析部分2.2

3.1。把握与视觉把握策略模块

把握决策过程的模块被认为是一个马尔可夫决策过程。把握工作流转化为一个互动的过程,可以用概率表示形式通过马尔可夫决策过程。首先,机器人所观察到的环境状态 在时间 并选择执行行动 从可用的操作集 通过战略 然后环境状态变化 ,与此同时,奖励 是获得。state-action-reward链在把握决策过程可以表示如下:

奖励 由贪婪的奖励 和大会奖励 机器人获得把握奖励 在成功地把握每次挂钩。把握网络也将获得一个大会奖励 如果组装时间小于阈值。奖励 描述如下:

深入强化学习的训练目的是获得最优策略 ,可总收益最大化 :

提高装配效率的目标是实现如果机器人可以最大化的总回报 通过建立映射关系把握位置和装配时间。因此,机器人训练一个贪婪的确定性的政策 使用off-policy q学习,选择行动 通过最大化行为价值函数 :

最优行为价值函数表示如下: 在哪里 是未来折扣,它被设置为一个常数

最优策略 ,通过培训,可以选择最优行动 最高的 值的设置可用的行动 在当前状态 最优策略的公式 如下:

完全基于卷积网络DQN和DenseNet用于构建把握决策的网络。网络以heightmap描述观察环境状态 作为输入,输出的密集pixel-wise地图 值和输入相同的尺寸和分辨率。任何像素点在图像 值,预测未来的奖励执行贪婪的行动 在空间的位置。首先,代理所观察到的环境信息的可视化数据,然后,reprojected到拼写RGB-D heightmap。随后,颜色通道(RGB)和克隆深度通道(DDD) heightmap输入两个平行121 -层DenseNets处理图像的特性。然后,channel-wise连接发送到后的图像 额外的 卷积与ReLU激活函数和BatchNorm层交错。最后,进行像素级概率地图 值后得到双线性upsampled处理和它是一样的输入图像分辨率 机器人会选择最高的表演动作 基于这个概率值映射。把握战略有两个完全相同的卷积神经网络结构:目标网络和评价网络。它们有相同的网络结构和初始网络参数。首先,目标网络选择行动 最高的 根据战略价值 之后,评估网络将评估这一行动。和两个网络输出 ,分别。评估网络更新网络参数 通过反向传播实时操作根据奖励 但目标网络只执行向前传播操作,更新网络参数 复制目标网络的参数 完成一批后评估网络的迭代训练,也就是说, 机器人被认为已经完成了训练时的区别 在预测 目标网络和评价网络之间的值小于阈值通过不断迭代。 描述如下:

评估网络使用Huber损失函数 如下:

3.2。种基于合规性组装模块

组装模块是基于兼容的行为控制,这就完成了peg-in-hole大会通过分析挂钩和孔之间的接触状态生成合规行为。组装模块将装配工作划分为三个阶段:hole-searching阶段、调整阶段,插入阶段。机器人移动的盯住表面洞后成功地抓住挂钩。挂钩之间的联系和孔的结果在一个平面的接触状态。机器人进入hole-finding阶段。为了模拟孔的位置在工作的不确定性,洞的初始位置是随机放置在一个小范围内,等于孔的面积。之后,机器人搜索孔表面上通过摩擦运动的轨迹阿基米德螺旋。挂钩将倾向于如果挂钩是足够接近的洞。然后,接触状态会改变两点接触。随后,幻灯片的边缘孔挂钩。 There will be a three-point contact state when the peg is close enough to the center of the hole but still has an inclination angle. The alignment of the peg and the hole is completed by using the wiggling motion to adjust the error of the inclining angle. Finally, the assembly task is finished after performing the insertion action. The proposed method and baseline both use the same assembly module to ensure the fairness of the comparison in the assembly efficiency test. However, the grasp module of the baseline method is not equipped with an assembly reward 证实了方法的有效性,如果添加大会奖励 对齐的机器人训练可以提高装配效率。peg-in-hole装配如图的过程5

4所示。仿真结果和分析

4.1。视觉把握策略的培训

装配系统建立了仿真软件V-REP,它使用一个UR5机械手臂RG2爪,如图6。也配备了RGB-D视觉传感器、力传感器、位置传感器。挂钩的长度是100毫米,重量是0.55公斤。直径是 毫米,装配间隙是1毫米。挂钩和孔没有削。CPU仿真工作站的英特尔(R)在3.80 GHz Xeon (R)黄金5222,GPU NVIDIA GeForce RTX 3090,它配备了128 GB的RAM。机器人使用试验和错误在训练中探索规律的装配定位效率的差异引起的不同把握职位。随机梯度下降的方法与动量是用来把握网络的训练。学习速度是一个常数 ,和动量是设置为0.9。探索策略是确定的 - - - - - -贪婪,其初始值设置为0.5 0.1然后退火过度训练。

把握培训的第一个1000次随机选择把握的位置。随机选择的目的是使机器人探索影响装配效率不同的把握职位。机器人会选择把握地位最高的 价值在4000年剩余时间培训。掌握决策的热图图所示7。红色区域代表把握职位更高的预测 价值。未经训练的机器人的地方选择把握立场是分布在整个挂钩,如图7(一)。机器人将在大会上获得奖励 当组装时间小于阈值。把握的选择区位置将逐渐缩小随着训练的数量增加,如图7 (b)。把握的位置被限制到一个特定的区域小于先前选择区域通过建立映射关系把握位置和对齐的调整时间。

4.2。模拟测试装配效率

仿真测试目的证明以下两个问题:(1)来验证是否该把握的策略可以帮助机器人提高装配效率(2)测试是否仍然有效的品质时,这一战略挂钩的长度,和机械参数已经改变了

该方法是一种视觉把握战略(vg) peg-in-hole任务。机器人使用基线和vg进行1000 peg-in-hole装配仿真测试,分别比较不同的装配效率。基线方法的总装配时间约为38.46小时,而vg的总装配时间只有33.14小时,提高了装配效率13.83%。vg装配时间的分布与基线相比,如图8。在测试,组装时间最短的基线和vg方法既106秒。但基线的最长时间是157秒,vg是135秒。基线需要19秒的平均装配时间超过vg。可以看出,机器人使用vg装配时间相对较短。仿真的结果证明了我们的方法可以有效地提高装配效率。

钉的直径的变化会引起质量的变化,而这些变化对组装排列有一定的影响。是非常繁琐的手工计算和马克的力学参数变化引起的这些变化。另外挂钩的质量减少或增加了15%基于初始质量模仿质量的随机变化的实际情况。机器人,分别使用基线和1000 vg进行组装测试的不同质量挂钩,如图9。它可以表明,vg仍然可以提高装配效率12.13%的直径和质量挂钩做出一些改变。在这个仿真结果,基线的标准差是5.1756,vg的标准差是3.0133。可以看出,vg组装效率具有更好的稳定性。

随后,挂钩的长度变化在85%和115%之间基于原始挂钩的长度。不仅它的质量已经改变了其力学参数改变时挂钩的长度变化。机器人,分别使用基线和1000 vg进行组装测试的不同长度和质量挂钩,如图10。结果表明,vg还可以提高装配效率10.92%,即使挂钩的长度和质量有一定的变化。长度和质量发生了变化时,基线和vg的标准差是6.2242和3.8508,分别。显然,vg波动较小的装配时间,和组装效率更稳定。

5。结论和未来的工作

摘要视觉把握战略提出了基于深度强化学习,提高装配效率。接触力的波动信号分析了种基于合规性装配造成的令人不安的时刻,和视觉把握策略介绍了大会奖励减少波动。V-REP, peg-in-hole的模拟,可以得到仿真结果,把握区域限制在一个特殊区域小于之前的区域,和训练有素的机器人装配时间花费低于未经训练的机器人。此外,该方法提高了装配效率13.83%与基线相比。

提出视觉把握战略时也可以有效地提高装配效率挂钩的大小和力学参数已经改变,它提供了一些指导在peg-in-hole组装。未来的研究工作将集中在扩展提出策略不同的装配零件来完成更复杂的任务。同时,找到有效的方法来提高训练样本的效率,协助代理商获得更好的装配功能,实现协同装配也可替换主体未来的研究工作。

数据可用性

支持本研究使用的数据是可用的https://github.com/Bensonwyz/A-Grasping-Strategy-for-Improving-Assembly-Efficiency-based-on-Deep-Reinforcement-Learning

的利益冲突

我们声明我们没有金融和个人关系与他人或组织不当会影响我们的工作;没有专业或其他任何性质的个人利益或在任何产品,服务,和/或公司可能被视为影响的位置,或审查,手稿。