《2022年PCA的原理及详细步骤 .pdf》由会员分享,可在线阅读,更多相关《2022年PCA的原理及详细步骤 .pdf(6页珍藏版)》请在taowenge.com淘文阁网|工程机械CAD图纸|机械工程制图|CAD装配图下载|SolidWorks_CaTia_CAD_UG_PROE_设计图分享下载上搜索。
1、一、基本原理主成分分析是数学上对数据降维的一种方法。其基本思想是设法将原来众多的具有一定相关性的指标X1,X2,XP (比如 p 个指标) ,重新组合成一组较少个数的互不相关的综合指标Fm来代替原来指标。那么综合指标应该如何去提取,使其既能最大程度的反映原变量Xp所代表的信息,又能保证新指标之间保持相互无关(信息不重叠) 。设 F1 表 示 原 变 量 的 第 一 个 线 性 组 合 所 形 成 的 主 成 分 指 标 , 即11112121.ppFa Xa XaX, 由数学知识可知, 每一个主成分所提取的信息量可用其方差来度量, 其方差 Var(F1) 越大,表示 F1 包含的信息越多 。常
2、常希望第一主成分 F1 所含的信息量最大, 因此在所有的线性组合中选取的F1应该是 X1,X2,XP的所有线性组合中方差最大的,故称F1为第一主成分。如果第一主成分不足以代表原来p 个指标的信息,再考虑选取第二个主成分指标F2,为有效地反映原信息, F1已有的信息就不需要再出现在F2中,即 F2 与 F1要保持独立、不相关,用数学语言表达就是其协方差Cov(F1, F2)=0,所以 F2 是与 F1不相关的 X1,X2, XP的所有线性组合中方差最大的,故称F2 为第二主成分,依此类推构造出的F1、 F2、 、 Fm为原变量指标 X1、 X2XP第一、 第二、 、第 m个主成分。1111122
3、1221122221122.ppppmmmmppFa Xa Xa XFa Xa XaXFa XaXaX根据以上分析得知: (1) Fi与 Fj 互不相关,即 Cov(Fi ,Fj) = 0,并有 Var(Fi)=aiai ,其中为 X的协方差阵 (2)F1是 X1,X2, Xp 的一切线性组合(系数满足上述要求)中方差最大的, , 即 Fm是与 F1,F2,Fm 1 都不相关的 X1,X2,XP的所有线性组合中方差最大者。F1, F2, , Fm(m p) 为构造的新变量指标, 即原变量指标的第一、第二、 、第 m个主成分。由以上分析可见,主成分分析法的主要任务有两点:(1)确定各主成分 Fi
4、(i=1 ,2,m )关于原变量 Xj(j=1 ,2 , p )的表达式,即系数ija( i=1 ,2, m ; j=1 ,2 , p) 。从数学上可以证明,原变量 协方差 矩阵的特征根是主成分的方差,所以前m 个较大特征根就代表前 m个较大的主成分方差值;原变量协方差 矩阵前 m个较大的特征值i(这样选取才能保证主成分的方差依次最大)所对应的特征向量就是相应主成分Fi表达式的系数ia,为了加以限制,系数ia启用的是i对应的单位化的特征向量,名师资料总结 - - -精品资料欢迎下载 - - - - - - - - - - - - - - - - - - 名师精心整理 - - - - - - -
5、 第 1 页,共 6 页 - - - - - - - - - 即有ai ai = 1。(2)计算主成分载荷, 主成分载荷是反映主成分Fi 与原变量 Xj 之间的相互关联程度:(, )( ,1,2, ;1,2,)kikkiP Z xaip km二、主成分分析法的计算步骤主成分分析的具体步骤如下:(1)计算协方差矩阵计算样品数据的协方差矩阵:=(sij)p p,其中11()()1nijkiikjjksxxxxni ,j=1 ,2,p (2)求出 的特征值i及相应的正交化单位特征向量ia的前 m个较大的特征值12 m0,就是前 m个主成分对应的方差,i对应的单位特征向量ia就是主成分 Fi 的关于原
6、变量的系数,则原变量的第i 个主成分 Fi 为:Fi =iaX主成分的方差(信息)贡献率用来反映信息量的大小,i为:1/miiii(3)选择主成分最终要选择几个主成分,即F1,F2, ,Fm中 m的确定是通过方差(信息)累计贡献率 G(m)来确定11()/pmikikG m当累积贡献率大于85% 时,就认为能足够反映原来变量的信息了,对应的m就是抽取的前 m个主成分。(4)计算主成分载荷主成分载荷是反映主成分Fi 与原变量 Xj 之间的相互关联程度, 原来变量Xj(j=1 ,2 , p )在诸主成分 Fi (i=1 ,2, m )上的荷载 lij( i=1 ,2, m ; j=1 ,2 , p
7、) 。 :(,)(1,2,;1,2, )ijiijl Z Xaim jp在 SPSS软件中主成分分析后的分析结果中, “成分矩阵 ” 反应的就是主成分载荷矩阵。名师资料总结 - - -精品资料欢迎下载 - - - - - - - - - - - - - - - - - - 名师精心整理 - - - - - - - 第 2 页,共 6 页 - - - - - - - - - (5)计算主成分得分计算样品在 m个主成分上的得分:1122.iiipipFa Xa Xa X i = 1,2,m 实际应用时, 指标的量纲往往不同, 所以在主成分计算之前应先消除量纲的影响。消除数据的量纲有很多方法,常用方
8、法是将原始数据标准化,即做如下数据变换:*1,2,.,;1,2,.,ijjijjxxxin jps其中:11njijixxn,2211()1njijjisxxn根据数学公式知道, 任何随机变量对其作标准化变换后,其协方差与其相关系数是一回事, 即标准化后的变量协方差矩阵就是其相关系数矩阵。另一方面, 根据协方差的公式可以推得标准化后的协方差就是原变量的相关系数,亦即,标准化后的变量的协方差矩阵就是原变量的相关系数矩阵。也就是说, 在标准化前后变量的相关系数矩阵不变化。根据以上论述,为消除量纲的影响,将变量标准化后再计算其协方差矩阵,就是直接计算原变量的相关系数矩阵,所以主成分分析的实际常用计算
9、步骤是:计算相关系数矩阵求出相关系数矩阵的特征值i及相应的正交化单位特征向量ia选择主成分计算主成分得分总结:原指标相关系数矩阵相应的特征值i 为主成分方差的贡献,方差的贡献率为1/piiii,i越大,说明相应的主成分反映综合信息的能力越强,可根据i 的大小来提取主成分。每一个主成分的组合系数(原变量在该主成分上的载荷)ia就是相应特征值i 所对应的单位特征向量。主成分分析法的计算步骤1、原始指标数据的标准化 采集 p 维随机向量x = (x1,X2,.,Xp)T)n 个样品 xi = (xi1,xi2,.,xip)T,i=1,2,n ,np,构造样本阵,对样本阵元进行如下标准化变换:名师资料
10、总结 - - -精品资料欢迎下载 - - - - - - - - - - - - - - - - - - 名师精心整理 - - - - - - - 第 3 页,共 6 页 - - - - - - - - - 其中,得标准化阵Z。2、对标准化阵Z 求相关系数 矩阵其中 ,。3、解样本相关矩阵R 的特征方程得 p 个特征根 ,确定主成分按确定 m 值,使信息的利用率达85% 以上, 对每个 j, j=1,2,.,m, 解方程组Rb = jb 得单位特征向量。4、将标准化后的指标变量转换为主成分U1称为第一主成分 ,U2称为第二主成分, , Up称为第 p 主成分。5 、对 m 个主成分进行综合评价
11、对 m 个主成分进行加权求和,即得最终评价值,权数为每个主成分的方差贡献率。一、主成分分析基本原理概念: 主成分分析是把原来多个变量划为少数几个综合指标的一种统计分析方法。从数学角度来看,这是一种降维处理技术。思路:一个研究对象, 往往是多要素的复杂系统。 变量太多无疑会增加分析名师资料总结 - - -精品资料欢迎下载 - - - - - - - - - - - - - - - - - - 名师精心整理 - - - - - - - 第 4 页,共 6 页 - - - - - - - - - 问题的难度和复杂性, 利用原变量之间的相关关系, 用较少的新变量代替原来较多的变量,并使这些少数变量尽可
12、能多的保留原来较多的变量所反应的信息,这样问题就简单化了。原理:假定有 n 个样本,每个样本共有p 个变量,构成一个np 阶的数据矩阵,记原变量指标为x1,x2, xp,设它们降维处理后的综合指标,即新变量为 z1,z2,z3, ,zm(mp),则系数 lij的确定原则:zi与 zj(i j ;i ,j=1 ,2, m )相互无关;z1是 x1, x2, , xP的一切线性组合中方差最大者, z2是与 z1不相关的 x1, x2, ,xP的所有线性组合中方差最大者; zm是与 z1,z2, zm 1都不相关的 x1,x2,xP, 的所有线性组合中方差最大者。新变量指标 z1, z2, , zm
13、分别称为原变量指标x1, x2, , xP的第 1, 第 2, ,第 m主成分。从以上的分析可以看出,主成分分析的实质就是确定原来变量xj(j=1 ,2 , p )在诸主成分 zi(i=1 ,2, m )上的荷载 lij( i=1 ,2, m ;j=1 ,2 , p) 。从数学上可以证明, 它们分别是相关矩阵m个较大的特征值所对应的特征向量。二、主成分分析的计算步骤1、计算相关系数矩阵npnnppxxxxxxxxxX212222111211pmpmmmppppxlxlxlzxlxlxlzxlxlxlz22112222121212121111.名师资料总结 - - -精品资料欢迎下载 - - -
14、 - - - - - - - - - - - - - - - 名师精心整理 - - - - - - - 第 5 页,共 6 页 - - - - - - - - - rij(i ,j =1,2, p)为原变量 xi与 xj的相关系数,rij=rji,其计算公式为2、计算特征值与特征向量解特征方程,常用雅可比法( Jacobi )求出特征值,并使其按大小顺序排列;分别求出对应于特征值的特征向量,要求 =1 ,即其中表示向量的第 j 个分量。3、计算主成分贡献率及累计贡献率贡献率:累计贡献率:一般取累计贡献率达85%-95% 的特征值,所对应的第1、第2、第 m (m p)个主成分。4、计算主成分载
15、荷5、各主成分得分pppppprrrrrrrrrR212222111211nknkjkjikinkjkjikiijxxxxxxxxr11221)()()(0RI021pi),2,1(pieiLie112pjijeijeie), 2, 1(1pipkkiL), 2, 1(11pipkkikkLm,21L),2, 1,(),(pjiexzplijijiijLnmnnmmzzzzzzzzzZ212222111211名师资料总结 - - -精品资料欢迎下载 - - - - - - - - - - - - - - - - - - 名师精心整理 - - - - - - - 第 6 页,共 6 页 - - - - - - - - -