文摘
为了便于增强Raman-based肿瘤检测和分析方法的可靠性,一个体外拉曼光谱进行了调查来确定不同的健康成分信息(H)、导管癌原位(DCIS),浸润性导管癌(IDC)。然后,主成分analysis-linear判别分析(PCA-LDA)和主成分分析支持向量机(PCA-SVM)模型建立了区分不同组织团体之间的光谱特性。光谱分析强调了不同水平的不饱和和饱和脂类,类胡萝卜素,蛋白质,核酸之间的健康和癌组织和核酸的水平变化,蛋白质,苯丙氨酸DCIS和IDC之间。两种分类模型主成分analysis-linear判别分析是非常有效的识别组织病理类型为PCA-LDA准确率达到了99%和100%,100%,96.7%,PCA-SVM分析基于线性内核,多项式内核,和径向基函数(RBF),分别,而PCA-SVM算法大大简化计算的复杂性不牺牲性能。目前的研究表明,拉曼光谱结合多变量分析技术已经相当大的潜力提高乳腺癌诊断的效率和性能。
1。介绍
乳腺癌是女性最常见的癌症有经验的世界(1]。2018年,新乳腺癌病例和死亡的数量记录世界各地的达到了2088849和626679年,分别为(1]。在中国,有超过50000妇女40岁以下的每年诊断出患有乳腺癌[2),年轻乳腺癌患者的发病率和死亡率不断上升。一种蔓延前的乳腺癌,导管癌原位(DCIS)中观察到的大约20%的肿瘤筛查性乳房x光检查探测到(3,4]。没有适当的治疗,20% - -30%的DCIS病例发展为浸润性导管癌(IDC) [3,5- - - - - -7],它侵入血液和淋巴结,最终蔓延到身体的其他器官。因此,必须使用可靠的癌症筛查技术识别DCIS的疑似病例从健康和其他恶性病变,多余的不必要的治疗,防止进一步的误诊IDC的前体,需要阐明和成分信息对于理解和预测的过渡和发展过程8]。
目前,乳腺癌筛查与三重评估进行了主要使用集成了x射线成像检查乳房x光检查和超声临床测试,和组织学评估(9]。癌症筛查后,各种方法活检(即。,needle or surgical biopsy) are used for additional histopathological assessment, aiming to identify the type and stage of cancer and to determine appropriate treatment protocols. However, current histopathological assessment is inevitably limited due to discrepancies in methods of fixation, staining, and antigen retrieval, in addition to the experiences of pathologists [9]。此外,基因组分析也被提出以识别乳腺癌的subtype-specific分类,提供更准确的诊断10,11]。
拉曼显微镜允许的化学性质的定性和定量分析生物样品需要最小的样品制备和不需要染色过程。经过多年的发展,它已被广泛接受的临床医生和研究社区的早期诊断癌症,癌症恶化的识别,和术中指导(12- - - - - -18]。虽然有明显的拉曼乐队可能相关的各种不同的生物分子的丰度,它仍然需要使用多元统计技术更可靠的关联光谱与组织病理特征,特别是对临床医师或生物医学研究人员没有一个坚实的物理学背景(19]。
光谱变化特征在目前的研究中,我们在健康(H), DCIS, IDC组织以识别特征光谱造成的癌症发展和促进Raman-based肿瘤检测算法的发展。两个多变量分析模型、主成分分析(PCA)其次是线性判别分析(LDA)和支持向量机(SVM)的分析,分别是进一步利用分析和拉曼光谱分类的三种类型的组织。后比较PCA-LDA和PCA-SVM模型的性能,一个有效的算法来进一步验证桥的知识缺口识别适当的拉曼光谱在乳腺癌的诊断模型。
2。实验部分
2.1。样品制备
总共12个健康的母乳样本,含有胶原和脂肪组织,从四个女性患者从Alenabio购买(陕西,西安,中国),和活检是使用协议批准的IRB(机构审查委员会)和HIPAA(健康保险携带和责任法案)。这是另外批准商业产品开发。IDC (n= 6)和DCIS (n= 6)样本12女性患者平均年龄为50年了从临床手术的乳腺癌手术,西安交通大学第一附属医院,西安,中国。伦理委员会批准的这项研究是西安交通大学第一附属医院(西安,中国)。这是一个回顾性研究,正式同意不需要验证和病变类型的病理学家在西安交通大学第一附属医院。所有的研究过程,包括样本收集、组织切片制备、和光谱分析,遵守现行法律在中国。
病变切除后,样本嵌入在最佳切削温度介质(10月Surgipath®FSC 22®,徕卡生物系统,美国),在液态氮冷冻更好保护原生形态。12μ米厚的纵向部分被放置在金色涂布玻璃基板(BioGold®63479,电子显微镜科学,美国)光谱分析,用于消除背景荧光显微镜载玻片和光学光谱测量(20.,21]。连续5μ米厚的部分被苏木精和伊红染色())来促进光谱测量结果与组织病理学结果的比较。冻结部分保存在脱水和存储的丙酮冷却槽−20°C到运输西北大学,西安,中国为光谱研究。组织部分是在室温下解冻不到30分钟前光谱分析或额外的组织学处理。
2.2。光谱采集
设备用于拉曼光谱已经被详细描述之前(13,14]。简单地说,一个使用WITecα谱收集500共焦台光谱系统(德国WITec GmbH)使用633 nm氦氖激光源(35 mW、研究电光,Inc .)。100×显微镜物镜(NA = 1.25, EC Epiplan-Neofluar,蔡司,德国)被用于光谱激发和测量。对于每一个样本,选择几个方面对光谱测量的病理学家,和30 - 50光谱被随机测量根据区域的大小,和每个地区测量两到三倍。总的来说,100年从每个样本获得的光谱被随机(H, DCIS, IDC),分别。虽然我们没有观察到任何干扰背景从10月由水溶性乙二醇和树脂,避免了组织边界谱测量,以防止任何污染削减的媒介。每个光谱被记录在一段1.5秒使用拉曼光谱仪(UHTS300, WITec GmbH,德国)将一个600毫米−1光栅与黑色背景深耗尽层电荷耦合器件相机(du401a - br - dd - 352,和或技术,英国)的分辨率大约3厘米−1。
2.3。数据预处理和分析
WITec项目四个软件(德国WITec GmbH)是用于所有数据集进行预处理,得到带范围选择、宇宙射线、背景减法,和光谱平滑,在每种情况下使用相同的参数。背景减法是通过一个nine-order多项式适合我们使用five-order Savitzky-Golay平滑噪声去除。拉曼光谱都是使用曲线下的面积归一化法的范围600 - 1800厘米−1和2800 - 3000厘米−1样品和仪器变异性的影响降到最低。
光谱数据集是mean-centered然后用来进行更多的分析。PCA用于简化复杂性和识别关键变量多维数据集(22,23]。监督分类方法,可以用LDA结合主成分分析来提高分类的性能。此外,单向方差分析被用来提取诊断最重要的电脑(< 0.01)为更好的分类三种不同类型的组织(24]。LDA重要电脑分数输入来生成一个分类算法(25]。一个分析交叉验证(LOOCV)技术是用于验证的性能诊断模型基于PCA-LDA算法的分类不同的组织类型。
使用Vapnik-Chervonenkis (VC)理论和结构风险最小化的原则,支持向量机算法还采用了使用PC的分数作为输入变量构造一个PCA-SVM模型。在目前的研究中,三种内核PCA-SVM模型中进行了测试,即线性内核,内核,多项式和高斯径向基函数(RBF)。所有获得的光谱数据分为训练(80%)或在测试期间测试组(20%)。获得最佳性能的模型、网格搜索结合10倍交叉验证来确定最合适的组合为每个内核参数。最后,这些参数和训练算法被用来构造最后PCA-SVM模型和识别未知的光谱。所有统计分析使用Matlab R2015b软件(Mathworks, Inc .,纳蒂克,妈,美国)。
3所示。结果
3.1。病理分析
使用H&E-stained组织部分,H中观察到显著的形态差异,DCIS,和IDC组织,代表病理进展(图1)。形式的癌症类型可以确定的肿瘤细胞的浸润程度由黑粒子H&E-stained图像。而健康的乳房组织,如图1(一)DCIS,癌症细胞组织分布在管道没有突破基底膜,如图1 (b)。相反,在IDC(图1 (c)),肿瘤细胞突破基底膜的乳腺导管,表现出各向异性分布模式。
(一)
(b)
(c)
3.2。拉曼光谱分析
如图2(一个),这三个组织类型显示特征峰在868厘米−1(碳碳拉伸,胶原蛋白)26),1076厘米−1(碳碳拉伸,脂质)27),1302厘米−1(CH2扭曲、摇、磷脂)[28),1450厘米−1(CH2变形)[26),1654厘米−1(C = C脂质拉伸)29日]。然而,与H和DCIS组织相比,IDC显示额外的峰值为669厘米−1在核酸(T和G) (30.),754厘米−1(对称环呼吸色氨酸、蛋白质)(27),1552厘米−1色氨酸(C = C拉伸)(28),1608厘米−1在苯丙氨酸(C = C拉伸)(31日]。此外,H和DCIS组织表现出一些重叠的峰位置在1267厘米−1(脂质)和2854厘米−1(CH2对称拉伸,脂质)[32),2900厘米−1(CH拉伸、脂质和蛋白质)32),2934厘米−1(CH2反对称伸展在脂质)[33],IDC表现出可识别的峰值为1243厘米−1(CH2摇,胶原蛋白的碳氮拉伸,酰胺三世)[34),2878厘米−1(CH2不对称在脂质和蛋白质)[32]。
(一)
(b)
更好地识别潜在的成分信息的不同阶段乳腺癌入侵,微分光谱的计算是通过减去从每个组织获得了光谱类型,如图2 (b)。微分光谱的DCIS和H、积极的峰值在1002厘米可见−1(苯丙氨酸)35,36),2934厘米−1(脂质和蛋白质)37,38],而负峰出现在1302,1450,1654,2854,2900厘米−1(脂质)和1524厘米−1(类胡萝卜素),表明苯丙氨酸含量增加而脂类和类胡萝卜素的含量减少在癌症的健康组织DCIS的进化。
同时,IDC和H减去光谱的组织,正峰出现在669厘米−1(核酸),754,1243,1552,1608厘米−1(蛋白质),2934厘米−1(脂质和蛋白质),而有负峰值为1302,1450,1654,2854,2900厘米−1(脂质)39),1524厘米−1(类胡萝卜素)40),这表明IDC是核酸和蛋白质含量高于H组织,但脂类和类胡萝卜素低于H组织。此外,微分光谱DCIS和IDC之间负峰出现在669厘米−1(核酸),754厘米−1、1243和1552厘米−1(蛋白质),1608厘米−1(苯丙氨酸),2934厘米−1(脂质和蛋白质)和积极的峰值在1302,1450,2854,2900厘米−1(脂质)。这表明核酸、蛋白质、和IDC的苯丙氨酸水平高于原位乳腺管癌,但在IDC血脂水平低于DCIS。
比率的拉曼强度相关的特定的波数如图3。按照郑等人的研究。41),拉曼峰的强度比1302厘米−1/ 1267厘米−1和1654厘米−1/ 1450厘米−1可以用来评估水平的饱和和不饱和脂质乳房组织吗原位和侵袭性癌症。拉曼峰的强度比669厘米−1/ 1450厘米−1和754厘米−1/ 1450厘米−1显示变化的蛋白质,核酸,脂质含量随着癌症的发展。饱和脂肪(图的水平3(一个))在癌组织中被发现低于健康组织,而不饱和脂肪(图的水平3 (b)高)。核酸脂质(图的比例3 (c)脂质(图)和蛋白质3 (d))逐渐增加的癌症乳腺癌入侵。
(一)
(b)
(c)
(d)
3.3。PCA-LDA分析
识别重要的变化在获得拉曼数据,进行多变量分析来区分光谱特征的不同组织。拉曼光谱low-wavenumber地区(600 - 1800厘米−1)和high-wavenumber地区(2800 - 3000厘米−1)获得的三种类型的组织样本,利用主成分分析法(PCA)分类取得相应的电脑分数和加载值。第一个电脑占光谱数据集内的最大方差(PC1, 89.6%),而PC2和生物代表总方差的5.3%和0.7%,分别。为了可视化的光谱分布不同的组织,图4(一)代表一个散点图的前三个电脑从光谱数据集获得分数的H, DCIS, IDC集团后,PCA过程。这说明一个清晰的分离的光谱三种组织类型,尽管DCIS的光谱和IDC集团略有重叠。此外,PCA不仅能够区分不同组织的光谱,而且提取相关信息分子特征分类,根据相应的载荷谱的电脑(42]。的加载PC1、PC2和生物如图4 (b)。的加载PC1基本上是零线,上面明确的类胡萝卜素峰位置(1524厘米−1)和脂质成分(1076、1302、1450、1654、2854和2900厘米−1);可以看出PC1包含更多的脂类和类胡萝卜素。加载的PC1相比单谱图2PC1加载的功能非常类似于H组织(图的谱特征2(一个)),这表明PC1可以主要用来区分H从IDC和DCIS团体组织。
(一)
(b)
的正峰PC2,相应的加载可以分配给生化组件(如核酸在669厘米−1色氨酸在754和1552厘米−1,苯丙氨酸在1608厘米−1在1243厘米、胶原蛋白−1,脂质在2934厘米−1,而负峰值可以归因于脂质在1076,2854,2900厘米−1。PC2加载的特征光谱的比较这三个组织的特点积极的峰值669,754,1552,1608,1243厘米−1在IDC组织是显而易见的,而积极的峰值在2934厘米吗−1可以观察到在所有三种组织类型。因此,PC2积极特征提取的主要来自IDC组织,而负功能主要是来自DCIS的贡献。
生物的加载是均匀分布的两边的零线,但主要特征信息负载荷出现在669年,754年,1552年,1608年,2854年,2900厘米−1而积极的峰出现在1267年,1302年,1450年,1654厘米−1,山峰代表的光谱贡献核酸,蛋白质,脂类。组件生物很吵闹,显示PC1和PC2混合物的光谱特征。
三个重要的电脑都被加载到LDA模型开发有效的乳房组织的诊断模型。图5演示了所有获得的光谱数据的线性判别分数在两个指纹(600 - 1800厘米−1)和high-wavenumber范围(2800 - 3000厘米−1从调查PCA-LDA算法获得的组织类型。散点图的LDA歧视区分三种组织类型的光谱,零线的第一个判别函数H组的光谱特征有别于癌组织。H组的光谱分布在负轴,而癌组织出现在正轴。DCIS的光谱组都代表负轴的第二个判别函数,和光谱的IDC集团积极的轴上。因此,第二个判别函数的零线可以单独DCIS的IDC集团集团。H的后验概率,DCIS, IDC集团也计算二维三元散点图,如图所示6。最后的诊断类别的每个数据点的数据是由最近的邻近诊断类别与三元图的顶点。LOOCV被用来验证分类模型的性能的三个不同的组织。整个PCA-LDA分类模型的精度为99%(表S1)。的指纹光谱区(600到1800厘米−1)和high-wavenumber地区(2800 - 3000厘米−1),三种不同类型的乳腺组织的分类使用PCA-LDA诊断模型如图S1和S4和表S5和S9。
3.4。PCA-SVM分类模型
达到一个优化的分类性能在我们的研究中,支持向量机和三个内核函数(线性、多项式和RBF)也在目前的研究中实现。此外,PC1和PC2分数作为输入变量在视觉分类的支持向量机模型。最优参数训练集的每个内核类型确定使用网格搜索程序结合交叉验证。为了观察不同参数对分类精度的影响的训练支持向量机模型,三维表面的地图构建不同的参数和相应的分类精度,如图7(一)和7 (b)。RBF内核PCA-SVM模型中,两个参数(C和 )需要优化。在图7(一),两个C和参数策划/范围2吗−5到25,权力的两步。它可以观察到RBF核函数的准确性PCA-SVM分类模型中逐渐增加而增加的值参数C和 。最大的精度模型观察时C= 0.5,= 0.25,为99.38%。使用多项式核,两个参数还需要优化PCA-SVM模型。在图7 (b),参数C= 0.0313和多项式秩序d= 2,模型的分类精度最高,为98.75%。对于一个线性内核PCA-SVM模型,只有一个参数,C2、需要优化,所以范围−5到25被选中,权力的两步。图7 (c)显示分类精度对参数的依赖C。发现最高的98.75%获得参数的准确性C= 0.0625。
(一)
(b)
(c)
这些优化的参数被用来构建最终的支持向量机分类模型对光谱的测试集进行分类。内核PCA-SVM RBF模型的分类精度的测试集是96.7%,而线性和多项式的内核PCA-SVM模型分别为100%和100%,分别。PCA-SVM诊断模型被用来分类的测试集数据三个乳房组织,如表所示S2,S3,S4。这表明线性和多项式内核PCA-SVM比RBF核函数模型有更好的表现。三个内核PCA-SVM模型的性能相比略有不同的训练集,虽然差异在允许的范围内,证明这三种类型的支持向量机分类模型显示没有明显的过度拟合现象。为了比较PCA-LDA分类模型的性能,PC1和PC2分数作为SVM的输入变量的分类。PCA-SVM的分类结果与三种不同内核的光谱数据从所有组织类型图所示8。可以看出,不同的组织明显分离,与一些更进一步的阴谋。在数据8(一个)和8 (b)、线性和内核PCA-SVM多项式模型的DCIS的光谱组H和IDC组。然而,一些光谱的H组并被错误地归类为IDC和部分IDC光谱被归类为DCIS。在图8 (c)、H和DCIS的光谱组被RBF PCA-SVM分开IDC集团。IDC的光谱被错误地归类为DCIS。额外的细节PCA-SVM模型指纹区(600 - 1800厘米−1)和high-wavenumber(2800 - 3000厘米−1)地区能找到数据S2,S3和数字S5,S6,表S6- - - - - -S8和S10- - - - - -S12在补充材料。
(一)
(b)
(c)
4所示。讨论
基于计算微分光谱图2 (b)很显然,脂质强度(1302、1450、1654、2854和2900厘米−1DCIS)显著降低,IDC比H组的组织。这些结果表明,DCIS和IDC组脂质含量下降,可能与细胞分裂率较高的稀疏细胞膜脂质在癌细胞的入侵和迁移的过程中(43]。此外,脂质过氧化作用的活性氧(超氧化物阴离子自由基,O−2)或铁复合物在癌症组织也可减少脂质含量(44]。此外,苯丙氨酸的强度(1002年,1608厘米−1)高DCIS和IDC比H组的组织,这可能是与大量的蛋白质合成相关癌症细胞在不受控制的生长和那里导致苯丙氨酸水平的增加(43]。此外,拉曼峰值为1524厘米−1(类胡萝卜素)表现出降低强度原位乳腺管癌组织与正常组织相比,可能由于自由基氧化类胡萝卜素(44]。如图2 (b),更高的核酸(669厘米−1)和蛋白质(754厘米−1IDC)水平组相比,H组可能与大量的蛋白质合成有关癌症细胞在不受控制的增长(43]。此外,控制癌细胞扩散增加细胞内DNA,和更多的核酸分子中包含的子细胞由于扩增DNA复制,可能解释肿瘤组织(核酸含量的增加45]。同样,微分光谱DCIS和IDC显示更高的蛋白质(754、1552厘米−1),苯丙氨酸(1608厘米−1)和核酸(669厘米−1)内容和低脂质(1302、1450、1654、2850和2900厘米−1IDC集团)水平与DCIS组相比,癌症恶化的一致特征。
比块饱和脂肪(1302厘米−1/ 1267厘米−1),如显示在图3显示一个下降的趋势,在乳腺癌的入侵,这表明脂质代谢可能在癌症的发展产生巨大影响46]。然而,不饱和脂质(1654厘米的水平−1/ 1450厘米−1)在癌组织高于健康组织,可能与脂质过氧化作用在乳腺癌的发展。癌症入侵发生的比率核酸脂质(669厘米−1/ 1450厘米−1脂质(754厘米)和蛋白质−1/ 1450厘米−1)逐渐增加,符合核酸和血脂水平的变化对DCIS和IDC在图2 (b)。很难区分DCIS组织和健康组织就从拉曼峰的比较它们的光谱特征相似,只有轻微的峰的位置和强度的差异。与此同时,生物组织提供了一个相对复杂的系统正确识别作业峰值,由于重叠光谱特性不同的分子和不同光谱测量装置。不同类型的多变量分析算法需要提取一个更可靠的光谱与病理的相关性(47]。
以上分析仅使用有限数量的拉曼峰组织分类;然而,许多生物物种将参与癌症进化和发展。因此,多元统计分析方法(如PCA-LDA),识别最重要的光谱特性从整个频谱,提高了诊断的效率Raman-based组织分析和分类。PCA-LDA的优点是建模者可以查询使用主成分光谱变量在模型中选择提供来源分类(48]。通过对比加载PC1 H组织的归一化光谱图2(一个),发现这两种光谱保持高度的一致性,所以相信PC1可以区分H和癌症组织。加载PC2包含更多的核酸和蛋白质,结果符合DCIS和IDC的微分光谱图2 (b)。因此,分析PCA是有效的分子组成和生化差异光谱数据集内,类似于微分谱所呈现的结果。在LOOCV混淆矩阵(表S1),部分光谱分类错误的三组明显,可能是由于类似H的光谱特性,DCIS, IDC组织。
支持向量机是一种额外的多变量分析技术能够管理线性和非线性可分的数据。对于支持向量机,最重要的操作是选择合适的核函数和参数优化策略,开发一个健壮的模型的关键。选择核函数时,首先应考虑是否数据是线性可分的,和优化应该最大化的准确性和最小化模型的复杂性。与其他多元统计方法相比,支持向量机可以处理类边界复杂条件下通过替换内核函数。在目前的研究中,一个SVM模型有三个传统内核开发利用PCA算法来降低数据的维数谱,大大简化了支持向量机算法和改进它的性能。结果表明,PCA-SVM模型和线性多项式内核有最好的分类性能,其次是PCA-LDA方法。线性和多项式内核的性能略高于PCA-LDA PCA-SVM模型,可能是由于使用的超平面分离的类(49]。这个结果也证实了PCA与SVM相结合不仅简化了支持向量机的计算复杂度,但也保证了可以有效地确定未知的光谱。相反,支持向量机用于直接光谱分类,它可能无法实现可接受的性能由于高维光谱数据大量冗余信息,实时应用程序无法使用因为过度的计算需要执行支持向量机模型。
5。结论
总之,目前的研究表明,乳腺癌重要的生化差异可以观察到的拉曼光谱。与H组织相比,蛋白质和核酸的含量DCIS和IDC组织较高,而低脂类和类胡萝卜素的成分或甚至消失了。结合多变量分析,光谱特性的H, DCIS, IDC集团进一步利用主成分分析法(PCA)提取加载和分数的情节。我们也证实了组织基于PCA-LDA算法分类模型,加上LOOCV,能够区分三种不同的乳腺组织。此外,PCA-SVM诊断技术开发具有不同核函数和综合评价和比较的性能进行诊断。这种方法极大地简化了计算的复杂性,在不牺牲性能的算法。线性和多项式PCA-SVM算法优于PCA-LDA乳房组织的光谱分类的算法,表明它在未来的应用潜力很大的诊断。因此,这项研究证实了可行性的拉曼光谱结合多变量分析的诊断乳腺癌。
尽管我们提出工作或其他团体的成就已经证明了拉曼光谱的好处早期癌症诊断和病理研究非侵入性的方式或没有样品制备过程,仍有一些应该注意的实际问题。首先,个人光谱多样性是一个特别突出的因素适当的最终诊断决策;因此,有必要采用机器学习的方法准确分类之间的光谱特性不同的组织类型,并提供一个参考治疗实践。高度需要在这种情况下,继续努力促进转型,从拉曼台式(微)光谱学床边通过开发先进检测方法之间的鸿沟方面实验研究和临床实践。新开发的提高拉曼仪器将象征着高信噪比与自动数据分析技术,允许快,早些时候,更准确的诊断。与此同时,更多的体外spectra-pathology研究仍然需要丰富我们对光谱信息的理解在不同损伤类型和等级,以及入侵过程。为了实现这一点,需要多学科的研究者和实践者之间的合作建立光谱数据的标准化和提高临床的信心。
数据可用性
光谱数据用于支持本研究的发现是由双王博士在许可证,所以不能免费提供。请求访问这些数据应该是双王博士((电子邮件保护))。
的利益冲突
作者宣称没有利益冲突。
确认
这项工作得到了国家自然科学基金(61911530695)和科学发展基金会的陕西,中国(2020 kw - 055)。
补充材料
补充文件解释PCA-SVM的主要数学模型和提供指纹和high-wavenumber地区的评价结果。(补充材料)