版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、多元统计分析中的应用研究 ,摘要:许多实际问题往往需要对数据进行统计分析,建立合适的统计模型,过去一般采用SAS 、SPSS软件分析,本文给出 Matlab软件在多元统计分析上的应用, 主要介绍Matlab在聚类分析、判别分析、主成份分析上的应用,文中均给以实例, 结果令人满意。关键词:Matlab软件;聚类分析;主成份分析Research for application of Multivariate Statistical AnalysisAbstract:Many practice question sometimes need Statistical Analysis to data.
2、,and establish appropriate Statistical model SAS and SPSS software were commonly used in foretime ,this paper give the application of Matlab software in Multivariate Statistical Analysis,mostly introduce the application of Matlab software in priciple component analysis and cluster analysis and diffe
3、rentiate analysis.The example are given in writing and the result are satisfaction.Key words: Matlab software; cluster analysis; priciple component analysis0 引言 许多实际问题往往需要对数据进行多元统计分析, 建立合适的模型, 在多元统计分析方面, 常用的软件有SAS 、SPSS 、S-PLUS等 。我们在这里给出Matlab在多元统计分析上的应用, 在较早的版本中, 统计功能不那么强大, 而在Matlab6.x版本中, 仅在统计工具中的
4、功能函数就达200多个, 功能 已 足 以 赶超任何其他专用的统计软件,在应用上Matlab具有其他软件不可比拟的操作简单,接口方便, 扩充能力强等优势, 再加上Matlab的应用范围广泛, 因此可以预见其在统计应用上越来越占有极其重要的地位,下面用实例给出Matlab在聚类分析、主成份分析上的应用。1 聚类分析 聚类分析法是一门多元统计分类法,其目的是把分类对象按一定规则分成若干类,所分成的类是根据数据本身的特征确定的。聚类分析法根据变量(或样品或指标)的属性或特征的相似性,用数学方法把他们逐步地划类,最后得到一个能反映样品之间或指标之间亲疏关系的客观分类系统图, 称为谱系聚类图。聚类分析的
5、步骤有:数据变换,计算个样品的两两间的距离,先分为一类,在剩下的个样品计算距离,按照不同距离最小的原则,增加分类的个数,减少所需要分类的样品的个数,循环进行下去,直到类的总个数为 时止。根据类之间的距离,画出谱系聚类图。我们对杭州所辖张家港市2005年七条河流中主要污染因子(指标)即CODmn,BOD5, 非离子氨,氨氮,挥发酚, 石油类共6个变量(资料见表1, 来源于张家港市2003年环境质量报告书) ,进行聚类分析。表1 港2005年七条河流主要污染因子河流CODmnBOD5非离子氮氨氮挥发酚石油类类型张家港河 二干河东横河 横套河 四干河 华妙河 盐铁塘3.145.473.15.676.
6、816.214.878.419.574.319.549.057.088.9723.7826.4821.210.2316.1821.0526.5425.7923.7922.4820.8724.5631.5634.564.176.425.344.25.26.155.586.475.586.546.85.458.218.073131122我们利用Matlab6.5中的cluster命令实现,具体程序如下3.145.473.15.676.816.214.878.419.574.319.549.057.088.9723.7826.4821.210.2316.1821.0526.5425.7923.792
7、2.4820.8724.5631.5634.564.176.425.344.25.26.155.586.475.586.546.85.458.218.07 x= n,m=size(x);Stdr=std(x);xx=x./stdr(ones(n,1),;); % 标准化变换y=pdist(xx); %计算各样本间距离(这里为欧氏距离) z=linkage(y); %进行聚类(这里为最短距离法)h=dendrogram(z); %画聚类谱系图t=cluster(z,3) % 将全部样本分为3类find(t=2); %找出属于第2类的样品编号执行后得到所要结果 聚类谱系图见图1t=3,1,3,1,
8、1,2,2 即全部样本分为3类。结果见表1 从图 1可以看出:七条河流中, 二干河、横套河、四干河属于一类, 污染较重, 主要是CODmn、BOD5超标多; 华妙河、盐铁塘属于一类, 污染一般, 主要是氨氮、石油类超标; 张家港河、东横河属于一类,污染较轻, 总的来说,各河流都存在不同程度的污染,因此全市应对各河流严格监督管理, 着力实施水污染防治工作, 太湖流域水污染源应限期治理达标排放, 巩固水污染防治工作成果,加大投入,新建或改、 扩建废水治理工程, 确保达标排放。 图1 :聚类谱系图 ,2 主成分分析 主成分分析是将多个指标化为少数几个综合指标的一种多元统计分析方法。对于实际工作中遇到
9、的多指标系统评估问题,主成分分析可以将多个指标综合为单个指数的形式。主成分的计算步骤如下:第一步,原始数据零均值标准化。设每个指标的样本数据为xi,1,xi,2,Lxi,Nxi,1,xi,2,Lxi,N.作如下变换,令x'ij=(xij- x i)/Si(i=1,2,L,P; j=1,2,L,N)第二步,计算相关矩阵R=(rij),其中第三步,求矩阵R 的特征值i 与相应的标准正交化的特征向量Ai。第四步,计算第j 个主成分yi 的贡献率当前q 个主成分(即新的综合指标) 的累积贡献率超过85%时,就提取前q 个主成分作为评价指标,它们保持原始数据总信息量的85%以上。这里给出江苏省生
10、态城市主成份分析实例城市环境生态化是城市发展的必然趁势, 表现为社会、经济、环境与生态全方位的现代化水平, 一个符合生态规律的生态城市应该是结构合理、功能高效和关系协调的城市生态系统所谓结构合理是指适度的人口密度, 合理的土地利用, 良好的环境质量, 充足的绿地系统, 完善的基础设施, 有效的自然保护功能高效是指资源的优化配置、物力的经济投入、人力的充分发挥、物流的畅通有序、信息流的快捷关系协调是指人和自然协调、社会关系协调、城乡协调、资源利用和更新协调一个城市要实现生态城市的发展目标, 关键是在市场经济的体制下逐步改善城市的生态环境质量, 防止生态环境质量恶化, 因此, 对城市的生态环境水平
11、调查评价很有必要。我们对江苏省十个城市的生态环境状况进行了调查, 得到生态环境指标的指数值, 见表2。现对生态环境水平分析和评价表2 指标指数值我们利用Matlab6.5中的princomp命令实现,具体程序如下x=xstdr=std(x); %求各变量标准差n,m=size(x);Sddsta=x./stdr(ones(n,1),:); % 标准化变换p,princ,egenvalue=princomp(sddata) %调用主成分分析程序P3=(:,1:3) %输出前三个主成分系数sc=princ(:,1:3) %输出前三个主成分得分egenvalue %输出特征根per=100* ege
12、nvalue/sum(egenvalue) %输出各个主成分贡献率执行后得到所要结果, 这里是前三个主成分、主成分得分、特征根即Egenvalue=3.8811,2.6407,1.0597, per=43.12,29.34,11.97这样, 前三个主成分为Z1=-0.3677x1+0.3702x2+0.1364x3+0.4048x4+0.3355x5-0.1318x6+0.4236x7+0.4815x8-0.0643x9Z2=0.1442x1+0.2313x2-0.5299x3+0.1812x4-0.1601x5+0.5273x6+0.3116x7-0.0267x8+0.4589x9Z3=-0
13、.3282x1-0.3535x2+0.0498x3+0.0582x4+0.5664x5-0.0270x6-0.0958x7-0.2804x8+0.5933x9第一主成分贡献率为43.12%,第二主成分贡献率为29.34%, 第三主成分贡献率为11.97%,前三个主成分累计贡献率达84.24%如果按80%以上的信息量选取新因子, 则可以选取前三个新因子第一新因子Z1包含的信息量最大为43.12%, 它的主要代表变量为X8(城市文明)、X7(生产效率)、X4(城市绿化), 其权重系数分别为0.4815、0.4236、0.4048, 反映了这三个变量与生态环境水平密切相关,第二新因子Z2包含的信息量
14、次之为29.34%, 它的主要代表变量为X3(地理结构)、X6(资源配置)、X9(可持续性), 其权重系数分别为0.5299、0.5273、0.4589, 第三新因子Z3包含的信息量为11.97%, 代表总量为X9(可持续性)、X5(物质还原), 权重系数分别为0.5933、0.5664这些代表变量反映了各自对该新因子作用的大小, 它们是生态环境系统中最重要的影响因素。根据前三个主成分得分, 用其贡献率加权, 即得十个城市各自的总得分F=43.12%princ(:,1)+29.34% princ(:,2)+11.97% princ(:,3)=0.0970,-0.6069,-1.5170,1.1801,0.0640,-0.8178,-0.9562,1.1383,0.1107,1.3077根据总得分排序, 结果见表2参考文献1 高惠璇. 应用多元统计分析M . 北京:
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2025年平面膜压力变送器项目可行性研究报告
- 2025至2030年石板蟹项目投资价值分析报告
- 2025至2030年焊接检验尺项目投资价值分析报告
- 2025至2030年彩色胶袋项目投资价值分析报告
- 2025年有机硅槽楔项目可行性研究报告
- 二零二五年度定制铝合金门窗合同型号与性能标准3篇
- 2025年全球及中国语音搜索优化服务行业头部企业市场占有率及排名调研报告
- 2025-2030全球工业负载箱行业调研及趋势分析报告
- 茶叶销售居间服务协议
- 港口码头污泥清理协议
- 北京市北师大附中2024-2025学年高一上学期期末考试数学试卷(含答案)
- 企业新员工培训师带徒方案
- 美容美发行业卫生管理规范
- 年终总结总经理讲话
- 2024-2025学年北师大版数学八年级上册期末综合测试卷
- 培训机构校区管理规划
- DB13(J)-T 8541-2023 全过程工程咨询服务标准
- 河南省安阳市2024年中考一模语文试卷(含答案)
- TD/T 1044-2014 生产项目土地复垦验收规程(正式版)
- 2024年湖南现代物流职业技术学院单招职业适应性测试题库及答案1套
- 垃圾桶创新设计说明书
评论
0/150
提交评论