研究文章|开放获取
爱迪汗默罕默德Adnan居尔,m . iran Uddin Syed爱阿里·沙阿·艾哈迈德沙菲克,穆罕默德Dzulqarnain Al菲尔多西,阿巴斯Zaindin, ”在线电影评论总结:大数据分析的机器学习方法”,科学的规划, 卷。2020年, 文章的ID5812715, 14 页面, 2020年。 https://doi.org/10.1155/2020/5812715
在线电影评论总结:大数据分析的机器学习方法
文摘
信息爆炸的网络速度指数,所以在线电影审查正在成为一个相当大的在线用户信息资源。然而,用户在定期发布数以百万计的影评,这是不可能的用户总结评论。电影评论的分类和总结是自然语言处理的一个具有挑战性的任务。因此,一个自动的方法是要求总结电影的大量评论,这将允许用户迅速区分电影的积极和消极方面。本研究提出了一个电影评论方法分类和总结。电影评论的分类、bag-of-words特征提取技术是用于提取unigrams,三元,从给定的审查文档和三元模型的特性集,并代表审查文档向量空间模型。接下来,采用朴素贝叶斯算法的分类影评(表示为一个特征向量)正面和负面的评论。电影评论的任务总结,Word2vec特征提取技术是用来提取特征分类电影评论句子,然后语义聚类技术用于集群句子语义相关的审查。不同的文本特性是用来计算集群中每个复习句子的显著成绩。最后,顶级的句子选择基于最高显著成绩生产采掘的总结电影评论。 Experimental results reveal that the proposed machine learning approach is superior than other state-of-the-art approaches.
1。介绍
Web 2.0的扩张,强调用户的参与,许多网站如电影评论网站,例如互联网电影数据库(IMDB)和亚马逊,鼓励用户发表评论对他们喜欢的产品或购买,为了提高顾客的购物体验和满意度。网上卖家通常要求他们的客户提供意见或评论他们在网上购买的产品或服务。评论收到产品的数量迅速增加数百万客户发布评论产品,从而导致信息过载。这个信息过载使它具有挑战性的任务的潜在客户扫描每个审查产品做出快速决定是否购买一个产品。与此同时,它也为服务提供者或网上商家/产品制造商跟踪大量的评论发布的客户服务或相关产品(1]。为了克服信息过载的挑战,一个自动审查需要分类和总结系统(2]。
在这项研究中,我们将关注电影评论领域。考虑到电影,总结收到的成千上万的评论电影可以帮助观众(客户)迅速扫描它的总结并及时做出决定是否去看电影。另一方面,这部电影影评的总结可以帮助服务提供商Netflix等迅速理解看模式或其客户的利益。
本研究介绍了一种自动的方法,分类和总结了影评。这种方法将帮助新用户迅速了解一个特定的电影的积极和消极的方面,因此很快就可以决定是否去看电影。审查的任务分类/挖掘和总结(RCS)包括两个步骤:第一步是评估矿业矿山收到的评论电影的分类成积极的和消极的。第二步是评估汇总,生成一个简洁的总结分类评审。
现在一天,RCS在一些地区引起重大关注(3),例如,从评论/意见由人们对政治在线公告或新闻,政府可以观察到当前的政策(或事件)的影响在公众和采取及时和适当的行动的基础上可用的信息。另一方面,产品评论收集客户的反馈,总结客户的反馈帮助在线制造商/零售商了解他们的产品被客户。
回顾矿业(4)将审查文本分为正面的或者负面的。有很多种方法,分类审查文本到正面和负面的评论,如基于字典的方法和机器学习(ML)的方法。各种ML-based方法,如支持向量机(SVM) [5),决策树(6)和神经网络(7)已经提出了文本分类和显示他们的能力在不同的领域。注是一种先进的ML算法和已被证明是非常有效的传统文本分类。NB的分类决策非常好。NB经常用作基线在文本分类和情感分析的研究中,因为它结合了良好的精度和效率(8]。因此,本研究采用NB的电影评论的分类。另一方面,基于字典的方法使用文档的单词词汇语义取向[9]。然而,基于字典的方法无法处理特定于域的方向。
回顾总结过程中,生成一个摘要从一个巨大数量的评论句子10]。许多技术,如基于监督毫升(5,6和基于非监督/词典10,11)已经申请回顾总结。然而,非监督/ lexicon-based方法严重依赖语言资源和仅限于单词词典中。另一方面,主要是监督毫升方法比基于无监督方法显示性能优越但它们局限于特定的领域。先前的研究表明,文本总结已成功应用于众多的领域(12- - - - - -16]。文本摘要技术是我用来突出信息从源文档和产生一个短的版本的文档不同的用户(17- - - - - -20.]。
一些用户经常发布大部分评论电影评论等网站IMDB,描述用户的态度有关一个特定的电影。因此,自动挖掘和总结这些大部分评论是可取的。因此,这项研究表明这种方法自动分类和总结了电影审查通过整合监督ML算法与语义聚类的方法。该方法在以下方式:首先,它使用一个简单的特征提取技术包的单词(弓)提取特性集(unigrams、三元及三元模型)从电影评论和代表自己作为一个向量空间模型或特征向量。下一阶段使用朴素贝叶斯机器学习算法分类影评(表示为一个特征向量)正面和负面的句子。电影评论的任务总结,Word2vec特征提取技术是用来提取特征分类电影评论句子,然后语义聚类技术用于集群句子语义相关的审查。不同的文本特性是用来计算集群中每个复习句子的显著成绩。最后,顶级的句子选择基于最高显著成绩产生萃取的总结电影评论。我们的贡献总结如下:(一)使用朴素贝叶斯分类的影评机器学习算法和unigrams,三元,三元模型的特性集(b)提出句子嵌入基于语义聚类技术萃取从分类总结一代电影评论(c)基准评价该方法与其他方法的上下文ROUGE-1和ROUGE-2评价指标
剩下的纸是组织如下:部分2展示了以前的工作在该地区的意见挖掘和总结。部分3概述了该方法。提出了评价结果和讨论部分4。最后,部分5给出了结论和未来的工作。
2。相关工作
评论挖掘的任务和总结包含两个主要步骤:评估采矿和回顾总结。首先,我们讨论了相关文献回顾矿业紧随其后回顾总结。审查矿业或意见挖掘过程中我们提取、分析和分类的主观信息和决心情绪相关的特定的目标。不同的方法被许多研究者提出评论挖掘的任务(4),例如,考虑文本的审查文档 一组类B=(积极、消极),评论挖掘工作是每一个评论句子进行分类在文档一个的帮助下,预定义的类标签(正面或负面)的集合B(21]。
许多评论挖掘技术,如基于ML和情感词典,已经提出了矿业评论在不同的领域1,5,22,23]。作者在24)领域的应用和困难提出意见/审查矿业。ML-based算法(24- - - - - -26)也用于意见分类的文档。ML算法分为两类:监督毫升和无监督毫升技术。这些技术实现的目标情绪分类/意见挖掘提取并选择一组合适的特性。
监督毫升技术如支持向量机(5)申请人气电影评论数据的分类。作者在6)使用决策树分类高/ low-informative短语从餐馆评论意见。另一方面,作者在27)使用非监督毫升无监督特征聚类等技术与潜在狄利克雷分配等主题造型(LDA)获取标签功能。他们最初的情感分类器训练之前信息(标签功能)从情绪词汇。感情从无标号的审查文档分类器学习从不同的领域,如电影、书籍和电子产品。标签功能被用于模型的预测未标记的实例使用广义期望(GE)标准。作者在28]介绍了点名系统,确定词的语义取向通过放松标签。一个脉冲系统29日]从客户反馈采样提取主题以及情绪取向的汽车评论数据库。系统训练情绪分类器通过使用一个引导的过程。的特性是由标记句子集群基于关键术语。
接下来,我们将讨论情绪lexicon-based方法回顾矿业,我们可以分类分为两类:基于字典的(30.和基于语料库11)方法。作者在30.)提出了一个基于字典的方法结合WordNet极性分类图。等一本同义词典的方法确定极性分数SentiWordNet [9),并把它跟随机游走的概念分析发现在电影评论。基于字典的方法有一个缺点,它不能处理上下文和特定领域的定位,因为相同的词在不同的领域可能会有不同的意义。作者在11)提出了一个基于语料库技术利用一个电影评论注释手动的语料库。的方法获得的语言特征,如名词、形容词、副词、动词,通过执行影评的词类。他们还利用了语义计算资源如SentiWordNet电影评论的极性分数语料库中的文档。语料库和基于字典的方法严重依赖语言资源和仅限于单词词典中。
众多的技术审查总结也一直在探索。回顾总结评论挖掘的任务是一个重要的一步和总结4),提取重要信息从审查文档摘要形式和现在的他们。最后总结可能是一个基于功能的总结,也可以是一个通用的总结覆盖一般信息产品(相机、手机、和电影)以简洁的方式(4]。作者在1]提出的方法基于特征总结为客户产品(相机和手机)的评论。使用单词的方法属性,包括同义词集在WordNet,词性(POS),发生的频率。最后的总结是根据提取的组织特性。作者在5)引入了一个潜在语义分析(LSA)的方法检测产品特性从电影评论。为了生成一个回顾总结,认为单词和产品特性被用来选择相关的句子形式回顾总结。然而,这种方法仅限于中国电影评论和没有应用到英语影评。提出了一种multiknowledge方法(3电影评论总结)。训练数据的方法使用WordNet,贴上电影和电影投生产关键字列表确定特性和意见。最后,根据提取的特征总结的句子重组。然而,这种方法可能无法找到有效的feature-opinion对语法关系不检查意见词之间的语义关系和特性。然而,前面的方法提出了电影总结是有限生成一个基于特征的总结,而不是一个通用的总结。因此,一个文本摘要方法提出了监督ML算法与基于排名算法产生一个通用的总结电影评论。此外,基于无监督的文本摘要方法毫升(31日)也提出了生成一个摘要从在线酒店的评论。然而,这种方法仅限于酒店评论。另一方面,我们提出了一个监督毫升方法影评等不同的领域。
文本摘要技术曾在不同的应用领域,如新闻文章的摘要,网页,和专利32,33]。作者在34)提出了一种文本摘要技术生产总结从专利。方法使用的几个特性,比如句子位置和提示短语而确定句子的重要性。作者在35)应用术语TF-IDF技术和本体树结构技术寻找关键词和提取专利文档的重要内容。重要的句子然后分组使用集群技术来产生一个总结。作者在36从网页)生成的摘要。执行一个查询扩展的方法通过使用WordNet,然后扩展查询了谷歌搜索引擎找到相关文档。最后的总结是产生基于句子包含相关的关键字。提出了一种统计方法,37)新闻文章摘要。新闻文档中的句子得分基于不同的特性,比如句子的长度,第一句话新闻文章,标题的新闻文章,专有名词和术语的频率。选择句子与最高的分数是产生一个总结。作者在38新闻文章摘要]提出了一种基于模式的方法。每个句子的分数是发现通过添加权重的覆盖模式。最后,句子是迭代选择形式总结基于低相似性与先前选择的句子,和最大的分数在所有候选句子。
在之前的几年里,各种图论方法(39吸引了更多的关注和被有效地应用于文本摘要。这些方法利用网页排名(PR)算法(40)和其他变异给分数/等级图节点,代表句子或段落。作者在41)提出了一个连接图,假设节点只带重要的信息,如果他们被连接到其他节点。作者在42]介绍了一种Lex-PageRank方法,基于特征向量中心,形成句子的连接矩阵,利用公关等类似的算法找到重要的句子总结。一个类似的算法提出的公关也43),发现突出的句子总结的一代。作者在23)提出了一个基于方法于一体的表面特征与文本内容与调查栏目功能的多个文档将这些功能整合到基于排名算法。亲和图论multidocument总结方法(44)利用该算法类似于公关和计算句子得分的基础上丰富的信息关联图。作者在45)提出了一个multidocument通用总结方法采用document-sensitive图模型,强调了全球文档设置信息在句子层面上的影响。一个通用multidocument总结介绍了使用加权图模型,46通过结合sentence-clustering和sentence-ranking方法。作者在47)提出了一个基于多个文档总结方法对越南文件排名的重要句子在使用传统公关的算法。作者在48)展示了一个事件图论方法生成一个multidocument采掘的总结。然而,它需要创建手工提取规则的论点,这是一项乏味的工作,可能会限制其应用到一个特定的领域。前基于总结方法都应用于一个新的域,和一个简单的网页排名算法。然而,我们提出一个基于总结电影评论域和方法采用排名算法基于一个加权图。提议的方法的细节在下一小节中介绍。
3所示。提出的方法
在本节中,提出了该研究的研究框架如图1。框架分为四个阶段:预处理,特征提取,分类的评论,评论和总结。
3.1。预处理
数据预处理的计算语言学是一个重要的过程,尤其是在评论挖掘和总结(RMS)。拟议的工作与RMS有关,因此评审文档的预处理是有效地使用所需的文件之前执行任何实验或给文档作为输入到系统。预处理阶段包括四个步骤,即。,sentence segmentation, tokenization, stop word removal, and word stemming.
3.1.1。句子分割
这是一个红外等自然语言处理应用的必要一步,机器翻译,语义角色标注,和总结。句子分割检测边界的过程在一个文本和文本分为句子。一般来说,一个审讯(?)的迹象,感叹(!)的迹象,和句号/期(。)通常被用来表示句子边界(49]。
例如,我们有一个文本文档:“我喜欢这部电影。这是最好的电影之一。”
分段文本文档之后,我们得到两个句子。
输入:审查文本:
“我喜欢这部电影。这是最好的电影之一。”
输出:分割文本:
Segment1:“我喜欢这部电影。”
Segment2:“这是一个最好的电影。”
3.1.2。标记
在这个任务中,我们使用一个简单的程序把句子分割成不同的单词通过分割在空白如空格,制表符,和标点符号等,分号、逗号,冒号,分裂的主要线索的文本标记。
3.1.3。停止词删除
词汇频繁出现在文档中被称为停止的话。它由连词、介词、文章和频繁发生等词语"," "," ","和“我”。停止词是那些话,有很少或根本没有意义的文本文档,所以把它们从一个文档是一个好主意。移除阻止单词复习文档有助于提高系统的性能。巴克利提出的停止词列表et al。50拟议的框架中使用。
3.1.4。词所
这是一个重要的任务在预处理阶段。词引发转换派生单词的根或茎捕捉类似概念。在这项研究中,一种常用的阻止算法称为波特的阻止51)是用来执行字阻止通过删除“后缀”这个词。例如,单词“玩”,“,”和“戏剧”将会转化为它的茎或根词“玩”的帮助下阻止算法通过删除后缀,——和人。
玩,玩,玩⟹玩。
3.2。特征提取
这个阶段的目的是提取特性评估分类采用著名的特征提取技术袋的话(鞠躬)。这是一个简单的技术用于特征提取代表审查文本文档向量空间模型。每一个向量空间维度代表一个功能。三元,在这项研究中,我们使用unigrams特性集和三元模型。向量空间的特征代表所有可能的unigrams,三元(两个单词序列)和三元模型(三字序列)审查文本文档,而功能参考频率的值或发生unigrams,三元,三元模型中包含审查文档。
例1。考虑以下三个审查文本文档,为了方便起见,我们展示了一个复习句子从每个文档。
审查文档1:“我喜欢这部电影。”
审查文档2:“我讨厌这部电影。”
审查文件3:“伟大的一部好电影。”
有7个独特的单词(unigrams)从上述评论句子。提取的unigrams指的特性“表演”“好”,“很好,”“恨”,“爱”,“电影”和“。“代表审查文本文档的集合的特性代表了向量空间模型。功能表的值1表明unigrams的频率。
为了提高情绪分类的准确性,本研究结合unigrams,三元(一对两个单词),和三元模型(一对三字)审查的向量空间表示。袋三元指的是由两个词对计算语言学,例如,“很棒的电影”,“美丽的天空,”和“不”。三元等“好工作”,“干得好,”和“很好”有积极的方向。另一方面,三元,如“相当昂贵,”“不行,”和“运气不好”等消极取向和三元”“中性取向。袋三元模型是指一对三字在计算语言学中,例如,卦“代理好电影”等积极取向而卦“讨厌这部电影”等消极取向。
另一方面,弓(unigram)方法将由两个词对诸如“不行”“不”和“好”,因此“好”这个词被认为是积极的。三元也有助于降低向量空间维度。表2描述了bag-of-bigrams评审文档向量空间模型表示。指的是例子1审查文件,bag-of-bigrams向量空间模型如下所示。
表3显示了bag-of-unigrams和三元向量空间模型表示为评审文档中给出的例子1。
表4显示了bag-of-unigrams,三元,三元模型向量空间模型表示为评审文档中给出的例子1。
|
|||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
|
||||||||||||||||||||||||||||||||||||||||||||||||||||||||
|
||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
|
|||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
3.3。分类综述
这个阶段的目的是将用户的评论文本使用监督毫升分类算法。审查的任务分类分类用户的评论为积极的和消极的。在这项研究中,我们使用了朴素贝叶斯分类算法(NB)因为它是一个健壮的分类器(52),取得了更高的精度在可伸缩的数据集相对于其他先进的分类算法。此外,NB分类器有几个在文本分类中的应用由于其简单性和准确性(52]。
为了进行分类评价,给出了特征向量及其标签作为分类器的输入。某些特定术语类别的概率(正面或负面)计算基于词出现的次数与类别的审查文件。在这里,这个术语指的是要么unigram,三元或三元模型由于本研究中使用的特性是unigrams,三元,三元模型。为了一个新的审查文档进行分类,每一项的概率(unigram、三元和卦)文档中确定给定类标签(+ ve),然后检查文档的概率给定类标签(+ ve)的计算方法是用所有条款的概率乘以目标类的概率(+)。同样,评审文档的概率计算给定类标签(−ve)。
评审文档分为积极如果概率目标类(+ ve)最大化,否则归类为负。
贝叶斯定理是说数学中给出以下方程:
考虑一个新的审查文档”我爱这部电影”给了NB分类器分类成或正面或负面。评审文档在这里是一个简短的句子。首先,审查文档表示为bag-of-unigrams,三元,三元模型的特征向量表示如表所示4。审查文档给出某些类的概率(正面和负面)可以计算使用方程(2),如下: 在哪里审查文档,||是文档的长度的概率是一个词W在审查文档特定类(+ ve或−ve)。表3显示unigrams和三元矢量表示为相应的评审文档中给出的例子1。
为了分类审查文档”我喜欢这部电影:“我们需要确定的概率中的所有条款(unigrams和三元)贴上积极审查文档。每一项给定类的概率 , 计算如下: 在哪里是这个词的次数在阳性病例发生,n单词的总数在阳性病例。显示独特的数量unigrams,三元,三元模型的审查文件。因此,审查文档给出积极/消极的概率情况下基于概率的unigrams估计,三元,和三元模型审查文档:
基于下列方程(7),评审文档是分配给一个类如果评审文档的概率值,因为类是最大化:
换句话说,审查文档是分配给一个积极的类,如果评审文档的概率值,因为类是最大化,反之亦然。
3.4。总结的评论
这个阶段的目的是总结分类评审(正面和负面评论)。这一阶段包括五个步骤:句子中嵌入集群语义相似的句子,文本特征提取,从集群选择最高等级的句子,总结的一代。
3.4.1。句子中嵌入
这一阶段的目标是将分类评审分为句子和句子构建嵌入从句子的集合。句子嵌入的是丰富的文本表示保存在句子语义和句法信息,导致增强性能几乎在每个NLP的任务。
为了使句子嵌入,我们提取嵌入每个词在句子使用Word2vec模型。我们使用谷歌pretrained Word2vec模型(53,54)学习单词嵌入每个单词(字向量)在所有的句子。Word2vec模型,发布的谷歌,是一个学习的神经网络实现分布式矢量表示的单词基于连续袋的话。模型训练大约1000亿字从Google新闻数据集。我们保留默认词向量长度为300的特性。
最后,句子向量/句子嵌入的平均获得的所有字嵌入在Word2vec和单词的词汇量没有出现在词汇被忽略。每个评论句子现在表示为一个数值向量。我们也存储句子文本及其数字表示法供以后使用的句子选择总结基于不同的文本功能。
3.4.2。语义k - means聚类
这一步的目标是分组语义相似的句子使用语义k - means算法(公里)。这个算法是非常容易实现,也是计算比其他聚类算法非常有效。广泛应用于学术界,以及行业,可以应用到高维的数据。然而,会凝聚的层次聚类算法与可伸缩的数据是无效的。公里是一种无监督迭代算法,试图将数据划分为K的预定义的独特不重叠的组织称为集群,每个数据点只有一个集群。数据点在我们的案例中引用的句子(表示为句子嵌入/向量)。在这项研究中,我们使用语义k - means(日)聚类,因为它采用欧氏距离句子嵌入(句子的语义表示)相应的句子。因此,它组织语义相似的句子,这将减少重叠复习句子,同时产生不同的复习总结的句子。SKM算法的关键目标是减少的和语义的数据点之间的距离和各自的集群重心: 在哪里k是聚类质心的数量,n是句子的集合,是指一个句子属于jth集群,指形心的jth集群。
语义k - means聚类算法说明如下:
语义k - means聚类算法的伪代码(1)选择集群的数量,K(2)初始化聚类质心通过随机选择K随机从给定数据点作为聚类质心(3)确定数据点之间的距离平方的总和,所有集群重心(4)将每个数据点分配给最接近集群重心(5)再计算质心的新集群通过意味着所有数据点属于每个集群(6)重复步骤3到5直到重心在新集群不改变
我们使用了“肘法”寻找最优数量的集群重心。为不同的值k(即。,no. of clusters), the SSE value (sum of squared error) is calculated between data points and their respective clusters’ centroids. In this study, we decidedk= 10的最佳数量的集群基于“肘法”。
句子的数量将被纳入最后的总结是依赖形成集群的数量。集群的总数是十,我们将选择high-scored信息丰富的句子从十集群基于不同的文本特征形成一个采掘的总结10个句子,为下一步详细讨论。
3.4.3。文本特征提取
文本功能发挥重要作用在选择相关内容的总结。不同的文本功能,已被选定为本研究包括:句子的长度(55],专有名词特性[56),和其他一些特性,比如TF-IDF,句子之间的语义相似性。这些特性选择背后的基本原理是,他们已经广泛应用于文本总结研究[56]。此外,这些特性已经被证明是有效的和相关的任务电影评论基于实证观察总结。因此,本研究考虑所有文本特征的贡献而不是几个在总结的内容选择56]。每个文本功能是规范化的分数在0到1的范围。
(1)句子的长度。句子的长度之比的字数在复习句子句子的最大长度:
(2)句子句子语义相似度。这个特性的分数评论句子发送我是通过计算相似性得分之和的比例发送的句子我与集群中所有其他的句子句子最大相似性得分集群中的复习句子。我们使用Word2vec从句子生成句子向量模型中讨论部分3.4。1,任何两个句子之间语义相似度向量决定使用余弦相似性。因此,一个句子以最大平均语义相似度与所有其他的句子是一个很好的候选人简介:
(3)专有名词。假设一个句子包含更多的专有名词作为包含在摘要突出。计算功能评分作为专有名词的数量在复习句子复习句子的长度:
(4)名词和动词的数量。另一个重要的文本特性寻找句子重要性检查动词和名词的数量一个句子包含:
(5)句子相似集群的重心。句子最类似于集群重心被认为是重要的总结代:
(6)项Frequency-Inverse文档频率(TF-IDF)。句子TF-IDF高分数被认为是突出总结代(57]。功能评分计算权重的总和的比例的所有条款在复习句子句子得分马克斯TF-IDF的复习句子的集合:
3.4.4。从集群选择顶级的句子
在这一步中,我们从所有集群选择句子得分排名最高的文本特性的基础上,讨论部分3.4。3。每个句子的文本特征分数计算集群;因此,一个向量构造使用6文本特征表示每个句子,即。,= ( ]。一旦计算每个句子的功能评分,然后分数的特性总结获得的分数排名每个句子中给出以下方程: 在哪里代表了评分和评论句子表示句子功能评分。一旦获得了句子评分使用方程(16),每个集群的句子是排名根据他们的分数,和霍姆的句子选择集群。在这项研究中,选择集群的数量是10,所以我们从10集群选择十代表句子最后萃取总结的一代。
4所示。实验设置
4.1。评估数据
该方法包括两个部分:第一部分是朴素贝叶斯分类器(NB),将审查文档分为积极的和消极的。第二个组件是语义聚类的方法,执行任务的电影回顾总结。为了评估第一个组件(NB分类器),我们认为文档级和字面意思分类任务域的影评。
文档级情绪分类任务中,我们使用两个公开可用的电影评论的数据集。第一个是引入了彭日成和李http://www.cs.cornell.edu/people/pabo/movie-review-data/(53),这是一个最广泛使用的极性数据集2000电影评论(版本2)。它由1000积极的影评和1000负面评论。每个评估数据集与二进制情绪极性相关标签。第二个基准数据集是由马斯河et al。54从IMDB),由50000年的评论数据集,并且每个电影仅限于没有超过30的评论。它与相应的标签包括影评(情绪极性)。标签数据集平均分为2.5k培训和2.5k训练集。像以前的工作在极性分类,本研究还假设high-polarized评论。数据集是得分的负面评论的,而正面评价得分10。
我们也评估了NB能主体性语句分类器在分类任务。对于这个任务,我们使用数据集引入了彭日成和李53),其中包含5000主观和5000目标句子来自电影评论总结和电影情节总结,分别。我们比较了NB分类器(变体bag-of-words特性)的基准模型情绪分析(54),在上述三个评价任务分类精度。使用的基准模型的无监督学习和监督技术词向量用于捕获语义和情感信息。
任务的提出语义聚类方法的电影评论总结评估随机选择平衡的子集分类4日评论,其中每个子集约含有100 100正面和负面评论。我们问2博士生工作在自然语言处理领域的手工生产的总结为每个子集分类评价。该方法的性能与最先进的总结技术使用ROUGE-1和ROUGE-2评价指标。
4.2。实验步骤
给定数据集,首先,在数据预处理技术应用于数据集分割成句子,句子标记成单词,和删除停止的话。词所也进行剩下的单词,单词词根形式。接下来,使用弓技术文档特征提取。本研究使用NB ML算法为了电影评论进行分类。还有其他常用监督机器学习的技术意见挖掘支持向量机和神经网络等;然而,朴素贝叶斯分类的选择基于性能精度的影评。
为了执行电影评论分类任务,使用朴素贝叶斯分类器分类影评为积极的和消极的。NB的训练和测试,我们应用了10倍交叉验证技术在三个平衡的数据集。两个数据集,即PL04和全IMDB如表所示5,被用于文档情绪分类任务,和主观数据集能主体性语句用于分类的任务。在这项研究中,我们使用了分层10倍交叉验证(通常用于分类问题),折叠的选择以这样的方式,这样每个折叠包含类标签的比例大致相同。
|
|||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
我们评估NB分类器的分类精度和不同bag-of-words特性集和比较结果与基准模型(54]因为情绪分类如表所示5。基准模型利用无监督和监督技术学习词向量捕捉语义文档信息以及丰富的情感内容。1号线表4表明,NB分类器精度只有unigrams特性在小数据集(PL04和主体性)优越比与三元产生的准确性。然而,第二行显示在大IMDB上的数据集,分类器的精度是提高了只有三元特性。第3行显示,分类器的准确性进一步提高当unigrams和三元都用作特性集。4号线表明,考虑unigrams,三元,和三元模型的特性得到了改善IMDB大型数据集上的分类器精度略摔倒在较小的数据集。
第5行显示unigrams频率加权平滑逆文档频率(IDF)与余弦正常化略有退化较小的数据集的分类精度和改善大型数据集IMDB上的准确性。第6行表明,三元数加权与余弦IDF正常化增强在所有数据的准确性。第7行表明unigrams和三元feature-count加权与平滑IDF余弦正常化超过基准模型和所有bag-of-words特性的变化方面的主观性数据集分类精度。
第8行表明unigrams、三元,和三元模型feature-count加权平滑IDF和余弦正常化超过基准模型和几乎所有变化的袋子的话,在IMDB大型数据集的分类精度和主体性的数据集,并表现差于小PL04数据集上的基准模型。
一旦分类器将评论分为积极的和消极的评论,该方法利用语义聚类技术来生成摘要的分类评价。总结技术代表了分类复习句子通过一个称为句子的语义表示嵌入,然后组织句子语义相似的评论到集群。最后,顶级审查确定句子每个集群基于六个文本特征和组合构成了总结。
我们简要讨论平滑IDF和余弦标准化或欧几里得L2范数。在一个大电影评论文集,有些字(例如,“,”“,”和“是”英语)携带小有意义的信息的实际内容审查文档。如果直接计数数据给一个标识符,那么频繁的术语将蒙上阴影的频率更少但更有趣。因此,我们使用TF-IDF给计数功能转换成浮点值,适合使用的贝叶斯分类器。
TF意味着一项频率虽然TF-IDF意味着一项frequency-inverse文档频率: 。
我们使用TfidfTransformer类的默认设置在Python语言计算TF-IDF scikit-learn图书馆。
TfidfTransformer(标准=“L2 use_idf = True, Smooth_idf = True)。
为了防止除零,光滑IDF被设置为true,这意味着常数1添加到IDF的分子和分母如果有人看见一个额外的文档,其中包含集合中的每一项完全一次。平滑IDF计算如下: 在哪里n是文档的文档集的总数和DF (t)是在文档集,包含文档的数量t。
结果TF-IDF矩阵获得特遣部队和平滑IDF的产物。然后结果TF-IDF向量归一化的欧几里得L2范数(也称为余弦正常化),的平方根的平方的总和每个术语的TF-IDF重量: 在哪里代表TF-IDF矩阵的标准化形式。
比较评价,我们建立了两个最先进的基于总结技术,即LexRank [58]和TextRank [59]。LexRank模型表示句子通过一个图表,并确定他们的突出基于特征向量中心的概念。模型构建邻接矩阵(图表示句子)的连接矩阵,基于intrasentence余弦相似性。LexRank模型是另一个基于排名算法,创建了图表示从整个句子和利用全球信息的显著图来决定一个顶点在一个图表(句子)。边缘的重量决定从内容相似的句子。然而,我们的语义聚类方法利用句子之间的语义距离来捕获语义相关的句子。本研究采用ROUGE-1和ROUGE-2评价指标来比较我们提出语义图方法与先进的图论方法的总结,在通用电影评论的背景下采掘总结任务。我们建议的方法和其他模型执行的任务multidocument总结,因为他们从多个生成摘要影评(或文件)。
胭脂评价指标有几个变化:ROUGE-N(N= 1,2,3,4),ROUGE-S,ROUGE-L等等。然而,ROUGE-1和ROUGE-2有效申请multidocument采掘摘要任务(60]。可以定义(60)作为一个n只记得一套系统总结和人类之间(参考)总结和计算如下: 在哪里n的长度吗n克,克n,数匹配(克n)是字格的最大数量,同时发生在一个系统的总结和人类总结的一套。
精度、召回和F测量系统的总结(或候选人摘要)计算如下:
表6和7说明该方法的评价结果比较和其他基于ROUGE-1和ROUGE-2措施,总结模型。这些结果实现的随机选择平衡的子集分类影评正如上面所讨论的。同样的电影评论的子集,我们问2博士生在自然语言处理领域工作手动创建10个句子总结。
指ROUGE-1结果表6,我们提出了集群技术执行比其他总结模型基于平均精度,回忆,和F测量。比TextRank LexRank产生更好的汇总结果。
同样,根据ROUGE-2结果表7,该技术仍然优于其他总结模型基于平均精度,回忆,和F测量。LexRank还保持着比基于ROUGE-2 TextRank产生更好的总结的结果。
数据2和3可视化的汇总结果建议的方法和其他总结模型基于ROUGE-1 ROUGE-2,分别。
4.3。讨论
本节讨论分类和总结方法的评价结果提出了在前一节。首先,我们讨论电影评论的情感分类的分类方法。在这项研究中,我们提出了利用unigrams NB分类器,三元,三元模型作为情绪分类的特性集的电影评论。我们评估NB分类器的分类精度和不同bag-of-words特性集的上下文中三个数据集PL04(2000条评论),IMDB数据集(50000条评论)和主观数据集(1000句)。它可以观察到从表中给出的结果5NB分类器的精度超过了基准模型在IMDB和主体性的数据集,当unigrams,三元,和三元模型用作特性集。然而,NB PL04数据集上的准确性较低相对于基准模型。他指的是第7行表5unigrams的组合时,三元,三元模型feature-count是加权平滑IDF余弦正常化,NB分类器的分类精度进一步提高,超过bag-of-words特性的基准模型和几乎所有的变化在所有基准数据集除了主观数据集的精度略微下跌相比下降了0.31%,相同的特性集没有IDF和余弦正常化的第3行表4。从实证结果得出结论,结合独特的和三元NB的特性是一种有效的特性集分类器,因为它大大提高了分类精度。
现在,我们讨论的总结结果我们提出了语义聚类方法和其他先进的总结模型的上下文中通用电影总结任务。该方法比较与其他总结模型的平均精度,回忆,和F测量与ROUGE-1 ROUGE-2获得。
它可以检查从ROUGE-1 ROUGE-2结果表6和7,该方法优于最先进的总结技术,取得了更好的性能在精度方面,回忆,和F测量。LexRank站TexRank站排名第二和第三的汇总结果。
该方法利用Word2vec模型提取词向量中的所有单词句子。句子的特征向量计算平均每个句子中的所有词向量。然后应用语义的方法k - means聚类算法(日)集群语义相关句子利用欧氏距离度量的特征向量表示句子。霍姆代表句子在每个集群的选择是基于六个文本功能,这些句子组合起来以形成萃取的总结电影评论。实验结果验证该语义聚类算法嵌入语义距离显著增强总结的结果。
为了验证结果,我们也进行了统计显著性测试(T测试)来显示增强与其他先进的总结我们建议的方法模型。的paired-sampleT以及程序是用来比较两个结果的方式表示相同的测试组和低获得意义值为0.039,0.030,0.029,平均精度,回忆,和F分别测量。值较低的意义T以及(通常小于0.05)表明,之间有显著性差异的结果建议的方法和其他总结模型。
5。结论和未来的工作
由于电影评论挖掘和总结是一个具有挑战性的任务,本研究设置一个电影评论总结的新方向。我们提出一个方法,使用毫升技术分类和总结了电影评论。该方法一般适用于任何领域,提供特定领域的训练数据。
在电影评论情绪分类的背景下,我们发现,朴素贝叶斯分类器表现很好当unigrams相比基准方法,三元,三元模型被用作功能。分类器的性能进一步提高的频率特性(unigrams、三元及三元模型)和IDF权重。
最后,我们使用了语义聚类方法总结分类影评为了给大量的电影评论的本质。从实证结果,我们得出结论,该方法执行比最先进的总结模型优越。
在未来,我们打算运用深度学习模型生成的抽象总结从电影评论。此外,我们我们的技术扩展到其他领域和研究该技术的有效性。
数据可用性
使用的数据来支持本研究的发现可以从相应的网站:https://www.imdb.com/。
的利益冲突
作者宣称没有利益冲突。
确认
作者扩展他们的感谢院长以来在沙特国王大学科研资助这项工作通过研究小组。rg - 1438 - 089。
引用
- m .胡锦涛和b . Liu“采矿和总结顾客评论,”第十届ACM SIGKDD学报》国际会议上知识发现和数据挖掘,第177 - 168页,西雅图,佤邦,美国,2004年8月。视图:出版商的网站|谷歌学术搜索
- a . f . Alsaqer和美国Sasi”,系统进行条目设置电影评论总结并使用rapidminer情绪分析,”学报2017年国际会议上网络和计算技术的进步(NetACT)Thiruvanthapuram,页329 - 335年,印度,2017年7月。视图:出版商的网站|谷歌学术搜索
- l .壮族f . Jing, X.-Y。朱,“电影评论挖掘和总结”学报学报》第15届ACM国际会议信息和知识管理,页43-50,印第安纳波利斯,在美国,2006年。视图:出版商的网站|谷歌学术搜索
- v . b . Raut和d . Londhe调查意见挖掘和总结网络上的用户评论表示,“国际计算机科学与信息技术杂志》上,5卷,不。2、1026 - 1030年,2014页。视图:谷歌学术搜索
- C.-L。刘,W.-H。Hsaio,学术界。李,G.-C。陆,e .周素卿”电影评级和审查总结在移动环境中,“IEEE系统,人,控制论,一部分C(应用程序和评论),42卷,不。3、397 - 407年,2012页。视图:出版商的网站|谷歌学术搜索
- s . j . Liu Seneff,诉Zue”收获和总结先进的基于语音的人机交互用户生成内容,“IEEE选定的主题在信号处理杂志》上》第六卷,没有。8,982 - 992年,2012页。视图:出版商的网站|谷歌学术搜索
- c·曼宁,p . Raghavan和h . Schutze“信息检索概论”,自然语言工程》16卷,第103 - 100页,2010年。视图:谷歌学术搜索
- f·塞巴斯蒂亚尼”,在自动文本分类、机器学习”ACM计算调查(CSUR),34卷,不。1,1-47,2002页。视图:出版商的网站|谷歌学术搜索
- a . Esuli和f·塞巴斯蒂亚尼,“Sentiwordnet:观点挖掘的公开可用的词汇资源,”LREC学报》》第六卷,第422 - 417页,2006年。视图:谷歌学术搜索
- A . Nenkova和k .部“文本摘要技术的调查,”挖掘文本数据施普林格,页43 - 76年,柏林,德国,2012年。视图:出版商的网站|谷歌学术搜索
- M.-T。Martin-Valdivia,大肠Martinez-Camara,人类。Perea-Ortega,洛杉矶Urena-Lopez”情绪极性检测用西班牙语评论结合监督和非监督方法,”专家系统与应用程序,40卷,不。10日,3934 - 3942年,2013页。视图:出版商的网站|谷歌学术搜索
- a . Abdi n .伊德里斯·r·m·Alguliev和r . m . Aliguliyev”自动总结评估通过结合语义和句法信息智能教育系统,”信息处理与管理,51卷,不。4、340 - 358年,2015页。视图:出版商的网站|谷歌学术搜索
- 彭译葶。刘,M.-S。陈,彭译葶。曾“Incrests:对实时增量短总结评论流从社交网络服务,“IEEE工程知识和数据,27卷,不。11日,第3000 - 2986页,2015年。视图:出版商的网站|谷歌学术搜索
- d . k . Ly k . Sugiyama林z, M.-Y。菅直人“产品回顾总结从更深层次的角度来看,“《学报》第11届国际ACM和IEEE关于数字图书馆联合会议,页311 - 314,渥太华,加拿大,2011年6月。视图:出版商的网站|谷歌学术搜索
- p·梅塔”,调查电影评级和审查总结在移动环境中,“国际工程研究和技术杂志》上,卷2,不。3,2013。视图:谷歌学术搜索
- y Sankarasubramaniam、k·拉马纳坦和s . Ghosh文本总结使用维基百科,“信息处理与管理,50卷,不。3、443 - 461年,2014页。视图:出版商的网站|谷歌学术搜索
- m . Gambhir诉Gupta,“自动文本摘要技术:最近一项调查,”人工智能审查卷,47号1、1 - 66、2017页。视图:出版商的网站|谷歌学术搜索
- 诉古普塔和g . s . Lehal”文本摘要采掘技术的调查,“新兴技术在网络情报杂志》上,卷2,不。3、258 - 268年,2010页。视图:出版商的网站|谷歌学术搜索
- m .冰斗、美国Nunes和c·里贝罗”总结的变化动态文本集合使用潜在狄利克雷分配模型,”信息处理与管理,51卷,不。6,809 - 833年,2015页。视图:出版商的网站|谷歌学术搜索
- 摩尼,先进的自动文本摘要美国马剑桥,麻省理工学院出版社,1999年。
- m . Tsytsarau和t . Palpanas挖掘主观数据在网络上的调查,”数据挖掘和知识发现,24卷,不。3、478 - 514年,2012页。视图:出版商的网站|谷歌学术搜索
- a . Ortigosa j·m·马丁和r·m·卡罗”在Facebook和它的应用程序来学习情绪分析,“电脑在人类行为31卷,第541 - 527页,2014年。视图:出版商的网站|谷歌学术搜索
- a . Joshi a . Balamurali p Bhattacharyya, r·莫汉蒂“C-Feel-It:微博的人气分析仪,”美国第49计算语言学协会的年会:人类语言技术:系统演示波特兰,页127 - 132,或者美国,2011年6月。视图:谷歌学术搜索
- 庞b和l . Lee,”意见挖掘和情感分析”,在信息检索基础和趋势®,卷2,不。1 - 2、1 - 135、2008页。视图:出版商的网站|谷歌学术搜索
- a . Trilla和f .别名”,填空题型可以表达语音情绪分析,“IEEE音频、语音和语言处理,21卷,不。2、223 - 233年,2013页。视图:出版商的网站|谷歌学术搜索
- a . Dahou m·a . Elaziz j .周和熊,”阿拉伯语情绪分类使用卷积神经网络和微分进化算法,”计算智能和神经科学卷,2019篇文章ID 2537689, 16页,2019年。视图:出版商的网站|谷歌学术搜索
- y他和d .周”,从标签功能,为情绪分析自我训练,”信息处理与管理卷,47号4、606 - 616年,2011页。视图:出版商的网站|谷歌学术搜索
- a m。Popescu和o . Etzioni”,从评论中提取产品特性和意见”自然语言处理和文本挖掘页9-28 Springer,柏林,德国,2007年。视图:谷歌学术搜索
- m . Gamon a公司、美国Corston-Oliver和e .环”脉冲:从自由文本挖掘客户的意见,”在计算机科学的课堂讲稿施普林格,页121 - 132年,柏林,德国,2005年。视图:出版商的网站|谷歌学术搜索
- a . Montejo-Raez e . Martinez-Camara m . t . Martin-Valdivia洛杉矶Urena-Lopez,“推特排名wordnet图情绪极性分类,“电脑语音和语言,28卷,不。1,第107 - 93页,2014。视图:出版商的网站|谷歌学术搜索
- 中州。胡,杨绍明。关铭陈,H.-L。周”,从在线酒店总结回顾一个文本意见挖掘方法,”信息处理与管理,53卷,不。2、436 - 449年,2017页。视图:出版商的网站|谷歌学术搜索
- h·宋,y . Ko, j . Seo“如何提高文本总结和分类集成框架,通过相互合作”专家系统与应用程序,60卷,第233 - 222页,2016年。视图:出版商的网站|谷歌学术搜索
- c . n .新罗Jr c·A·A . Kaestner和A . A . Freitas”一个非线性的话题检测方法用于文本总结使用wordnet,”车间的技术信息的程序语言人类(直到2003年)2003年10月,圣卡洛斯,巴西,。视图:谷歌学术搜索
- 中州。曾,Y.-M。王,我。林,C.-J。林,D.-W。Juang“专利代理提取和评价在专利地图的背景下,“信息科学杂志》,33卷,不。6,718 - 736年,2007页。视图:出版商的网站|谷歌学术搜索
- a . j . Trappey c . v . Trappey彭译葶。吴,“专利文档自动摘要协作知识系统和服务,“系统科学与系统工程》杂志上,18卷,不。1,第94 - 71页,2009。视图:出版商的网站|谷歌学术搜索
- d . Vazhenin s石川,诉Klyuev,“一个面向用户的网络检索总结工具,”学报2009年第二次国际会议上提出以人为本、个性化的机制、技术和服务葡萄牙波尔图,页73 - 78,,2009年9月。视图:出版商的网站|谷歌学术搜索
- j . s . Kallimani k . g . Srinivasa, b . e . Reddy”总结新闻报纸文章:实验与基于本体,定制,采掘文本摘要和得分,”控制论和信息技术,12卷,不。2,34-50,2012页。视图:出版商的网站|谷歌学术搜索
- j。羌族,陈平,w .叮,f·谢,吴x,“多文档摘要使用封闭的模式,”以知识为基础的系统卷。99年,28-38,2016页。视图:出版商的网站|谷歌学术搜索
- 韩x t . Lv, z, x,和c·王,“文本摘要使用FrameNet-based语义图模型,”科学的规划卷,2016篇文章ID 5130603, 10页,2016。视图:出版商的网站|谷歌学术搜索
- l .页面,美国布林、r . Motwani和t . WinogradPagerank引文排序:将以网络、斯坦福大学、斯坦福InfoLab、斯坦福、钙、美国,1999年。
- 玛尼和大肠Bloedorn,“总结相关文档之间的相似之处与不同之处,”信息检索,卷1,35 - 67年,1999页。视图:谷歌学术搜索
- g . Erkan和d . r . Radev LexPageRank:威望在多文档文本总结”EMNLP学报》2004西班牙巴塞罗那,页365 - 371,,2004年6月。视图:谷歌学术搜索
- r . Mihalcea和p . Tarau语言独立的单个和多个文档摘要算法,”2005年。视图:谷歌学术搜索
- x Wan和j·杨,“改善基于亲和图的多文档摘要”人类语言技术研讨会论文集NAACL,同伴卷:短论文,页181 - 184,纽约,纽约,美国,2006年6月。视图:出版商的网站|谷歌学术搜索
- f·魏、w·李,问:陆,y,他“多文档摘要document-sensitive图模型”,知识和信息系统,22卷,不。2、245 - 259年,2010页。视图:出版商的网站|谷歌学术搜索
- 美国美国通用电气、>和h .他“加权图模型基于句子聚类和排名对于文档总结,”第四届国际会议上交互科学学报》上釜山,页90 - 95年,韩国,2011年8月。视图:谷歌学术搜索
- T.-A。Nguyen-Hoang, k阮,Q.-V。Tran“TSGVi:一个基于越南文档,总结系统”环境智能和人性化计算杂志》上,3卷,不。4、305 - 313年,2012页。视图:出版商的网站|谷歌学术搜索
- g . Glavaš和j .Šnajder”事件图表信息检索和多文档摘要”,专家系统与应用程序第41卷。。15日,第6916 - 6904页,2014年。视图:出版商的网站|谷歌学术搜索
- 费奥多尔,“文本规范化文档为中心的方法,”学报学报》第23届国际市立图书馆会议在信息检索的研究与开发,页136 - 143年,雅典,希腊,2000年7月。视图:出版商的网站|谷歌学术搜索
- c·巴克利·g·索尔顿海、j·艾伦和a·辛格尔使用智能自动查询扩展:TREC 3诉讼的第三个文本检索会议(TREC-3), NIST的特殊出版SP,盖瑟斯堡,妈,美国,1995。
- m·f·波特,”一个后缀剥离算法”,程序,14卷,不。3、130 - 137年,1980页。视图:出版商的网站|谷歌学术搜索
- 吴x, v . Kumar j . r .昆兰et al .,“十大算法在数据挖掘中,”知识和信息系统,14卷,不。1,1-37,2008页。视图:出版商的网站|谷歌学术搜索
- 庞b和l·李”,情感教育:使用主观情绪分析总结基于最小削减,”《第42计算语言学协会年度会议p。271年,西班牙巴塞罗那,2004年7月。视图:出版商的网站|谷歌学术搜索
- a . l .马斯河r·e·戴利·t·范教授d·m·黄a . y . Ng和c . Potts“学习词向量情绪分析,”美国第49计算语言学协会的年会:人类语言technologies-volume 1波特兰,页142 - 150,或者美国,2011年1月。视图:谷歌学术搜索
- y j·库马尔:萨利姆,b . Raza“跨文档结构关系识别使用监督机器学习,”应用软计算,12卷,不。10日,3124 - 3131年,2012页。视图:出版商的网站|谷歌学术搜索
- m·a·法塔赫和f .任FFNN,遗传算法,并通过和基于GMM模型自动文本摘要,“电脑语音和语言,23卷,不。1,第144 - 126页,2009。视图:出版商的网站|谷歌学术搜索
- g .索尔顿海自动文本处理:转换、分析和检索阅读美国,addison - wesley,波士顿,MA, 1989。
- Erkan和d·r·Radev“Lexrank:基于词汇中心作为文本摘要,突出“人工智能研究杂志》上22卷,第479 - 457页,2004年。视图:出版商的网站|谷歌学术搜索
- r . Mihalcea和p . Tarau Textrank:文本、秩序”学报2004年大会在自然语言处理的经验方法西班牙巴塞罗那,页404 - 411,,2004年7月。视图:谷歌学术搜索
- 彭译葶。林,“胭脂:一个包进行自动评估总结,”程序的文本摘要分支:学报ACL-04车间西班牙巴塞罗那,页74 - 81,,2004年7月。视图:谷歌学术搜索
版权
版权©2020爱汗等。这是一个开放的分布式下文章知识共享归属许可,它允许无限制的使用、分配和复制在任何媒介,提供最初的工作是正确引用。