文摘
在法律文本中,命名实体识别(尼珥)是研究使用深度学习模型。首先,双向(Bi)的短期记忆(LSTM)条件随机场(CRF)模型建立了研究法律文本的尼珥。第二,不同的注释方法用于比较和分析的实体识别影响Bi-LSTM-CRF模型。最后,其他客观损失函数将比较和分析Bi-LSTM-CRF模型的实体识别的效果。研究结果表明,模型的F1值训练语料库词序列标识的命名实体是88.13%,高于这个词序列标注语料库。对于这两种类型的实体,地名和组织名称,F1值使用分词Bi-LSTM-CRF模型获得的67.60%和89.45%,分别高于F1值获得的模型使用字符分割。因此,使用分词Bi-LSTM-CRF模型更适合识别扩展实体。参数学习结果使用对数似是比使用的最大间隔标准,它是理想的Bi-LSTM-CRF模型。该方法为法律文字识别的研究提供了思想和具有一个特定的价值。
1。介绍
在21世纪,科学技术的快速发展,人工智能(AI)的时代,云计算已经一个接一个。为载体的网络互连,计算机的计算能力已经显著提高。作为一个算法,近年来,出现了深度学习已广泛应用于互联网,交通、医疗、建筑、和其他领域(1]。因为命名实体识别(尼珥),提出了命名实体类别的不断扩大和改善。随着人工智能技术的发展,时间和劳动力成本显著降低尼珥的识别2]。命名实体的研究领域包括新闻、生物学、医学。每个领域都有其特点。在法律领域,法律文本的命名实体的识别可以从文本中提取3]。
命名实体的研究领域包括新闻、生物学、医学等领域。不同领域有自己的特点。在法律领域,法律文本由命名实体识别。具有特定含义的实体从法律文本中提取帮助司法从业人员提高决策效率。自2013年开始,中国判断在线发布生效判决文件。截至2021年3月9日,宣布生效判决文件的总数已经超过1.1亿。这提供了数据支持尼珥在法律领域的研究。正确地识别法律实体在司法文件是后续处理的基础任务,如事件提取和关系提取。因此,在司法领域的实际需要,研究中国法律文本的尼珥方法已成为必不可少的(4]。传统机器学习需要的统计和分析读者挖掘任务特性的影响。随着计算机技术的发展,神经网络模型用于近年来各种自然语言处理任务。神经网络模型不依赖于功能工程,节省时间和劳动力成本。的表达词向量的发展带来了强大的发展势头命名实体。词向量的表示可以代表比手动提取特征,语义信息和模型,使词向量来获取更多的语义信息不断更新。
Bi-LSTM模型和CRF模型是尼珥常用的模型。Bi-LSTM模型避免了长期依赖的问题,使学习更遥远的模型信息,使其有能力获取上下文信息。CRF模型不仅使用内部信息,而且使用上下文信息来标记的位置。Bi-LSTM-CRF模型结合了两种模型的优点,也是尼珥的主流模式。创新是建立Bi-LSTM-CRF模型,设置不同的目标损失函数,并使用不同的标记方法比较和分析建立模型的法律文本实体识别效果。本研究可以弥补法律文本识别的缺陷的研究,减少司法人员的工作量,并有效提高司法效率的验收,登记和审查。
2。文献综述
为不同的字段,将额外的实体识别研究。Zhang et al。5中国)提出了一种基于字符的增强尼珥模型。它针对的问题中国尼珥苹果病虫害,包括许多类型的实体,实体与别名或缩写和困难在识别罕见的实体。深度学习产生了最先进的性能在许多自然语言处理任务,包括尼珥。刘等人。6)提出了一个混合深度学习方法在医学领域改善尼珥的识别精度。具体地说,一个双向编码器表示模型用于提取文本的基本特征。长期和短期记忆(LSTM)学习文本的表示上下文和结合了多线程机制关注提取chapter-level特性。或新兴命名实体识别罕见的用户生成的文本是具有挑战性的,尤其是当使用非正式或俚语文本。Al-Nabki et al。7)解决了这个缺点提出了本地邻居的距离。当地距离的邻居是一个新功能,取代了地名索引。这种方法允许模型以获得最先进的成果。亲缘关系等。8]介绍了深层神经网络(款)模型解决了一个很有挑战性的任务序列标注问题,尼珥的任务。Carbonell et al。9]介绍了一种轻量级架构尼珥。模型由一个回旋的性格,编码器,译码器和一个LSTM标签。它是基于标准的任务。近,最先进的性能实现了数据集,以及计算效率远高于表现最好的模型。近年来,款的发展和进步的pretrained字嵌入已成为神经网络的动力。在这种情况下,充分利用信息提取嵌入式方面需要更深入的研究。王等人。10)提出了一个敌对的培训体系,改进现有的尼珥方法从两个方面:模型结构和训练过程。此外,它还提供了一个独特的有害的训练方法。过度拟合训练方法解决问题的网络。在培训过程中,通过添加扰动变量更多元化的网络中的变量。从而,提高了模型的泛化和鲁棒性。文本特征的深入研究可以获得文本功能。但是在司法领域,没有多少研究确定法律文本。
基于规则的方法需要手动建设规则模板,这是成本太高且有一定的局限性。统计机器学习方法用于尼珥模型:最大熵,支持向量机,条件随机场。成熟的电子硬件和词向量的出现,可以训练深度学习在大规模的语料库。如今,许多尼珥方法基于深刻理解取得了良好的效果。在法律领域工作主要包括文本分类、预测判断的结果,和实体的信息提取文本。由于缺乏早期法律文本标注语料库和实体识别中文文本更令人难以置信的困难,法律文本的研究尼珥不能达到良好的结果。如今,提出了新的模型和优化方法,可以更好地从法律文本识别命名实体。
3所示。材料和方法
3.1。尼珥
命名实体是指词或短语包含特殊意义或强引用(11]。在正常情况下,实体类型包括一些姓名、地名、机构名称。例如,“上海”和“浙江”都是实体名称。但也会有一些特定的实体类型出现在特定的领域,如医疗和法律12]。尼珥是指命名实体的分类。当然,在电脑上完成分类过程。尼珥的主要目的就是从文本中提取一些基本信息。关键信息提取的准确性将直接影响到下一个任务13,14]。尼珥任务通常必须满足三个测量标准被认为是正确的。具体标准如图1。
在正常情况下,每一种类型的实体的识别尼珥可以被视为一个二元分类问题,因此准确率、召回率,和F1值可以用来评估模型。但在计算这三个指标之前,有必要进行汇总统计预测的类别和正确的类别的实体分别15]。以地名识别的模型作为一个例子,这三个指标的计算公式表达。假设模型预测的数量和实际的实体是这个地方的名字是标记为TP。表示数量的模型是显著的,事实上,实体不是一个名字叫TN。预测实体的数量标注地名,地名为《外交政策》。预测的数量的实体不是地名但地名FN标记。然后,精度、召回和F1-score由(1),(2)和(3),分别为:
3.2。注释编码方法
尼珥使用深度学习需要使用词向量,和它的前提是段文本。一个好的分词可以正确分割模棱两可的句子,必须有良好的分割的细节。本文比较了常用的分词效果分词工具和选择一个分词工具适合中文分词系统。这个分词工具可以显著影响中国法律文本的分词和亲和力。这个人的名字是根据记录,这个地方的名字被注册为LOC,和组织的名字是记录为ORG。人的名字、企业和组织中确定的法律文本。{/ ORG, LOC}的实体标签对应{人名称、组织名称、地名},和生物标记方法结合实体的{/ ORG, LOC}标记方法。例如,B-PER意味着命名实体的开始,自己演出意味着中间或结束,O意味着虚无。结合Begin-Inside-Outside(生物)标记方法与实体标识方法,具体表现如表所示1。
3.3。长短期记忆(LSTM)网络
深度学习有很强的学习能力特点和分析规则之间的数据。这项技术有利于促进数据可视化和数据分类管理的发展。深度学习的工作原理是通过学习逐步近似复杂功能从深度非线性网络(16]。与传统的人工神经网络相比,深度学习模型结构是更深入的学习。有许多在隐藏层节点,强调数据的特性学习(17]。深度学习转换的特征表示在原始样本空间到一个新的特征空间,简化数据分类和预测。深度学习学习从更少的样品和表达复杂的函数用更少的参数,这样可以减少设置和调整模型参数的困难。比传统的浅深学习包含更多的隐藏层神经网络,可以学到丰富的样本特性和更好的模拟性能(18]。
LSTM本质上是来自递归神经网络(RNN) [19]。RNN网络是一个不同寻常的串行数据进行处理。最重要的优势是,它有一个记忆功能和解决当前的输出和以前的输入问题。例如,当处理一段文字信息,收到信息的帮助下可以被理解之前的记忆。一般来说,RNN并不局限,要处理的数据序列的长度,可以快速、准确地分析数据序列的任何大小(20.]。然而,模型训练并不容易实现在实际应用程序中,甚至之前的记忆就会消失。这种情况的主要原因是,RNN将产生梯度消失当反向推导的长时间序列数据。LSTM提出了解决RNN的缺点21,22]。
LSTM RNN是添加一个国家单位。LSTM的功能是保存之前输入的信息。一般来说,双曲正切函数选为激活函数的输入和输出的内存单元,和乙状结肠函数作为激活函数的门结构(23,24]。乙状结肠的输出值之间的函数(0,1),如方程所示(4)如下:
双曲正切函数的输出值之间(−1,1)所示(5)如下:
LSTM图所示的结构2。
具体的算法如下:(1)忘记门:有效地判断存储单元中的信息是否保留,输入信息和先前隐藏状态的时间点会有一个特定的影响忘记门(25]。所示的具体计算 权重矩阵与输入数据,偏差向量,权重矩阵与先前隐藏层。(2)输入门:输入门控制数据被更新。像忘记门,它是影响输入信息在前面的时间和隐藏的状态。所示的具体计算 权重矩阵与输入数据,偏差向量,权重矩阵与先前隐藏层。(3)内存信息:内存信息是最新的输入数据,和值添加到计算内存模块。其影响因素是一样的忘记门和输出门(26]。所示的具体计算 是重量矩阵连接到输入数据在内存信息,偏差向量,权重矩阵连接先前隐藏层的记忆信息。(4)细胞单元:它的功能是更新状态值的内存单元的存储模块。所示的具体计算 是状态值对应的内存单元在以前的时间节点,和忘记门的计算值和输入门,分别和是对应的内存信息价值有待更新。(5)输出通道:输出门是控制整个网络的输出。它的影响因素也一样输入门的影响因素。所示的具体计算 是重量矩阵连接到输入数据在输出门,偏差向量,权重矩阵连接之前隐层输出门。(6)网络输出值:网络输出值的计算网络中最终的输出。所示的具体计算
输出的值是门,是细胞的状态值。
LSTM网络的训练过程是一样的其他神经网络的训练过程。既包括向前和向后传播的方法。具体的培训步骤如图3。然而,这里使用的更受欢迎的双向LSTM模型,表示为双向LSTM (Bi-LSTM)。
3.4。条件随机域(crf)
CRF是一个条件概率分布模型,另一组输出序列条件下的一组已知的输入序列。CRF已广泛应用于自然语言处理。CRF可以提供某些限制标签,以确保输出标签是一个合理的范围内27,28]。假设 ,V和E代表节点和边的集合,分别有一个无向图 组成的Y。用它来形容马尔可夫随机场,可以表示为
相对应的随机变量节点吗 ,和X观察序列。 所有剩余的节点除了节点 , 相对应的随机变量节点吗 ,和 是所有节点连接到节点的边缘在无向图。一般来说,CRF模型是根据条件概率分布模型 ,这是一个有序的解决方案的概率分布Y条件下的X。解决序列标注问题的步骤通过CRF模型如下:
假设有一个输入序列的长度n作为X,表示为
然后,标签序列Y表示为
CRF模型用于计算句子,和计算结果包括两部分,信的分数马克和转移后的标志。马克是一个矩阵,信的分数和分数的影响后,传输模量参数。的具体计算最后得分P所示
V是重量参数,d是偏见,k是明显的数量分类,然后呢是激活函数。
通过上面的计算方程,预测的结果序列的分数,可以表示为
的得分矩阵传输的标记,它的大小 , 是模型参数,标记的分数吗j连接到标记我。
预测计算结果筛选,合适的预测结果序列的分数计算。的前提下序列的存在X,发生的概率预测的结果序列y解决,具体计算表示所示
是所有可能的句子注释序列的集合X。
负对数似是用来估算训练,并培训目标可以表示为
是训练样本集。
在解码过程中,动态规划算法来计算句子的得分,最后选择标签序列。得分最高的序列可以表示为
最大分离方法:假设是一个给定的样本吗是一个正确的类别,然后训练集吗年代可以表示为
根据模型预测,所示的类别可以得到方程(21)如下:
是特征函数, 模型约束条件。有必要建立一个损失函数来测量模型的性能。假设最大间隔法计算实际类别之间的距离和预测的类别 ,在培训过程中减少,作为损失函数的一部分。的损失函数我th示例所示
是一个给定的样本生成所有可能的预测结果。
的最大间隔损失函数模型建立,让 是结构化区间损失,是正确的标签序列我th样本,是序列的预测模型。损失函数
是衰减参数,米样品的字符长度的句子吗 。作为训练集时 ,客观损失函数增加规范表示为
代表了模型参数,所有可能的预测结果由一个给定的样本吗 ,和 是结构化区间损失。
3.5。Bi-LSTM-CRF模型的建立
三个命名实体的人,地方,机构在法律文本识别。具体的实验流程如图4。
Bi-LSTM-CRF模型可分为Bi-LSTM层和CRF层。Bi-LSTM层的功能是提取上下文信息通过输入单词和词的概率向量,确定某种类型的标签进行预测。CRF层是用来考虑标签之间的相关性。Bi-LSTM-CRF模型结构如图5。
3.6。数据源和参数设置
数据集从运动竞赛文件夹用于CAIL2018_ALL_DATA.zip“中国人工智能和法律的挑战”。32508年有154592个训练集,测试集,与204231年和17131年验证集,文件夹中的数据。exercise_contest文件程序中的数据提取文本内容形成CLNER数据集。处理敏感数据使用的法律文件,包含许多个人的名字,地方,组织,文本有一个高密度的实体。本文使用的数据是Marked_Fact数据集,它是由分词处理。生物注释用于获取标注语料库和语料库的划分为训练集和测试集。在实验中使用的python版本3.6。1.13.1 TensorFlow版本。Bi-LSTM-CRF模型训练的参数设置如下:辍学款意味着在培训过程中,神经网络单位暂时丢弃它从网络根据一定的概率。辍学可以防止过度拟合。辍学的参数值是0.5,Word2Vec词向量维度值为300,和隐藏层尺寸参数值是300。学习速率是一个重要的hyperparameter深度学习,确定目标函数可以收敛到局部最小值和收敛到最小值。 A reasonable learning rate can make the objective function link to a local minimum in an adequate time. The learning rate is 0.001. The optimizer is Adam. The Epoch parameter is 15. The batch parameter is 64.
4所示。结果与讨论
4.1。分析使用不同的注释方法Bi-LSTM-CRF模型的识别结果
的识别结果Bi-LSTM-CRF模型如图6。
图6显示命名实体上的准确率为86.54%,召回率为87.86%,与F1值是87.20%。地名的实体上的准确率为68.09%,召回率为67.12%,与F1值是67.60%。命名实体的准确率为89.91%,召回率为88.98%,与F1值是89.45%。模型训练序列标注语料库这个词被发现有一个巨大的F1值两种类型的实体:人名称和组织名称。
使用标记的字符分割方法和使用字符作为模型的输入,Bi-LSTM-CRF模型的识别结果如图7。
图7显示命名实体上的准确率为87.06%,召回率为89.23%,与F1值是88.13%。地名的实体上的准确率为68.92%,召回率为65.67%,与F1值是67.26%。命名实体的准确率为84.65%,召回率为82.81%,与F1值是83.72%。模型训练序列标注语料库这个词可以获得一个巨大的F1值两种类型的实体,人的名字和组织的名称。
的模型识别结果标签使用字符分割和分词方法比较,如图8。
图8表明,F1值模型获得的训练在一个字符序列标注语料库高于两个或两个以上的字符序列标注语料库和两种类型的实体:地名和组织名称。F1值使用分割Bi-LSTM-CRF模型获得的两个或两个以上的单词会更高。因此,通过比较两个或两个以上的词的使用分割Bi-LSTM-CRF模型更适合识别更多的扩展长度的实体。
4.2。使用不同的客观分析Bi-LSTM-CRF模型的识别结果损失函数
参数学习的结果使用对数似图所示9。
图9显示命名实体上的准确率为79.2%,召回率为83.03%,与F1值是81.07%。地名的实体上的准确率为66.25%,召回率为65.12%,与F1值是65.7%。命名实体的准确率为82.91%,召回率为83.98%,与F1值是83.4%。
参数学习的结果使用的最大间隔标准如图10。
图10显示命名实体上的准确率为79.17%,召回率为82.97%,与F1值是81.03%。地名的实体上的准确率为66.13%,召回率为65.03%,与F1值是65.58%。命名实体的准确率为82.78%,召回率为83.69%,与F1值是83.23%。模型训练使用的参数学习的最大间隔标准获得巨大的F1价值实体名称。
F1值比较使用不同的客观损失函数,如图11。
图11显示的F1值参数学习使用对数似是比F1值使用不同的客观损失函数。这个结果似乎因为最大间隔法是一种非概率模型,和损失之间的信号距离实际的模型和假设的模型。是一个概率模型的似然估计方法。日志损失措施之间的差异准确的条件概率分布和条件概率分布理论。Bi-LSTM模型用于获取字符信息功能,而CRF模型标记字符赋值,相关的概率模型。因此,对数似参数学习结果比参数学习结果使用的最大间隔标准。因此,似然估计法更适合Bi-LSTM-CRF模型比完整的时间间隔的方法。
尽管Bi-LSTM层上下文信息的输出也可以通过将softmax层得到尼珥的结果,将结果直接通过Bi-LSTM层只考虑上下文信息。的输出结果Bi-LSTM层没有考虑标签之间的依赖关系。CRF模型可以通过语料库训练学习一些global-based约束信息考虑标记之间的依赖关系。因此,采用Bi-LSTM-CRF模型。这个模型可以使用Bi-LSTM层提取文本的上下文信息来预测标签和添加一些约束规则通过CRF层,以确保最终的识别结果是合理的。通过介绍相关的理论和实验结果,合法尼珥方法基于字符级神经网络具有以下优点:(1)与传统方法相比,该方法基于深度学习避免了人工的设计特征工程和解决维度灾难问题造成的稀疏数据的传统方法;(2)模型使用Bi-LSTM-CRF模型获取上下文信息,解决了长距离依赖问题的一般模型。
5。结论
人工智能技术的迅速发展,深度学习模型在司法领域越来越广泛使用,尤其是深度学习模型的应用程序在法律文本尼珥。从尼珥目前很少有研究,本文研究尼珥在法律文本中使用深度学习模型。首先,Bi-LSTM-CRF模型建立。然后,设置不同的目标损失函数,并使用其他标记方法比较和分析的实体识别影响建立模型。获得的研究结果表明,F1值通过模型训练人的名字上的单词序列标注语料库实体高于这个词的序列标注语料库。F1值通过使用分词Bi-LSTM-CRF模型两种类型的实体将会更高,地名和组织名称。Bi-LSTM-CRF模型使用分词更适合识别更多扩展的实体。参数学习结果使用对数似比使用的最大间隔标准参数学习的结果,更适合Bi-LSTM-CRF模型。本文为法律文字识别的研究提供了思想和具有一个特定的价值。本文的缺点是它只能识别三种类型的实体在法律文本,人的名字,名字的地方,组织的名称。 However, there are many entities in the legal text, so the legal text’s crimes, legal provisions, and other entities can be studied later. In the future, more entity types will be trained and labeled by the model. As a result, more entities in the legal text will be identified.
数据可用性
使用的数据来支持本研究的结果都包含在这篇文章。
的利益冲突
作者宣称没有利益冲突。