




版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
一.随机抽样1.随机抽样:满足每个个体被抽到的机会是均等的抽样,共有三种经常采用的随机抽样方法:⑴简单随机抽样:从元素个数为N的总体中不放回地抽取容量为n的样本,如果每一次抽取时总体中的各个个体有相同的可能性被抽到,这种抽样方法叫做简单随机抽样.抽出办法:①抽签法:用纸片或小球分别标号后抽签的方法.随机数表法:随机数表是使用计算器或计算机的应用程序生成随机数的功能生成的一张数表.表中每一位置出现各个数字的可能性相同.随机数表法是对样本进行编号后,按照一定的规律从随机数表中读数,并取出相应的样本的方法.简单随机抽样是最简单、最基本的抽样方法.⑵系统抽样:将总体分成均衡的若干部分,然后按照预先制定的规则,从每一部分抽取一个个体,得到所需要的样本的抽样方法.抽出办法:从元素个数为N的总体中抽取容量为n的样本,如果总体容量能被样本容量整N除,设k=N,先对总体进行编号,号码从1到N,再从数字1到k中随机抽取一个数s作n为起始数,然后顺次抽取第s+k,+2k,,+(n-1)k个数,这样就得到容量为n的样本.如果总体容量不能被样本容量整除,可随机地从总体中剔除余数,然后再按系统抽样方法进行抽样.系统抽样适用于大规模的抽样调查,由于抽样间隔相等,又被称为等距抽样.⑶分层抽样:当总体有明显差别的几部分组成时,要反映总体情况,常采用分层抽样,使总体中各个个体按某种特征分成若干个互不重叠的几部分,每一部分叫做层,在各层中按层在总体中所占比例进行简单随机抽样,这种抽样方法叫做分层抽样.分层抽样的样本具有较强的代表性,而且各层抽样时,可灵活选用不同的抽样方法,应用广泛.2.简单随机抽样必须具备下列特点:⑴简单随机抽样要求被抽取的样本的总体个数N是有限的.⑵简单随机样本数n小于等于样本总体的个数N.⑶简单随机样本是从总体中逐个抽取的.⑷简单随机抽样是一种不放回的抽样.⑸简单随机抽样的每个个体入样的可能性均为空.NN3•系统抽样时,当总体个数N恰好是样本容量n的整数倍时,取k=N;nN若N不是整数时,先从总体中随机地剔除几个个体,使得总体中剩余的个体数能被样本容n量n整除.因为每个个体被剔除的机会相等,因而整个抽样过程中每个个体被抽取的机会仍N然相等,为N.n二.频率直方图列出样本数据的频率分布表和频率分布直方图的步骤:计算极差:找出数据的最大值与最小值,计算它们的差;决定组距与组数:取组距,用决定组数;组距决定分点:决定起点,进行分组;列频率分布直方图:对落入各小组的数据累计,算出各小数的频数,除以样本容量,得到各小组的频率.绘制频率分布直方图:以数据的值为横坐标,以频距的值为纵坐标绘制直方图,知小长方形的面积=组距x||=频率.频率分布折线图:将频率分布直方图各个长方形上边的中点用线段连接起来,就得到频率分布折线图,一般把折线图画成与横轴相连,所以横轴左右两端点没有实际意义.总体密度曲线:样本容量不断增大时,所分组数不断增加,分组的组距不断缩小,频率分布直方图可以用一条光滑曲线y=f(x)来描绘,这条光滑曲线就叫做总体密度曲线.总体密度曲线精确地反映了一个总体在各个区域内取值的规律.三.茎叶图制作茎叶图的步骤:将数据分为“茎”、“叶”两部分;将最大茎与最小茎之间的数字按大小顺序排成一列,并画上竖线作为分隔线;将各个数据的“叶”在分界线的一侧对应茎处同行列出.四.统计数据的数字特征用样本平均数估计总体平均数;用样本标准差估计总体标准差.数据的离散程序可以用极差、方差或标准差来描述.极差又叫全距,是一组数据的最大值和最小值之差,反映一组数据的变动幅度;样本方差描述了一组数据平均数波动的大小,样本的标准差是方差的算术平方根.一般地,设样本的元素为x,x,,x样本的平均数为x,12n定义样本方差为s2=(匸X)2+(X2—X上++(匸X上,n样本标准差S乙匸X)2+(X2—X)2++(匸X)2n简化公式:s2=1[(x2+x2++X2)一nx2].n12n五.独立性检验1.两个变量之间的关系;常见的有两类:一类是确定性的函数关系;另一类是变量间存在关系,但又不具备函数关系所要求的确定性,它们的关系是带有一定随机性的.当一个变量取值一定时,另一个变量的取值带有一定随机性的两个变量之间的关系叫做相关关系.散点图:将样本中的n个数据点(x,y)(i=1,2,,n)描在平面直角坐标系中,就得到ii了散点图.散点图形象地反映了各个数据的密切程度,根据散点图的分布趋势可以直观地判断分析两个变量的关系.如果当一个变量的值变大时,另一个变量的值也在变大,则这种相关称为正相关;此时,散点图中的点在从左下角到右上角的区域.反之,一个变量的值变大时,另一个变量的值由大变小,这种相关称为负相关.此时,散点图中的点在从左上角到右下角的区域.散点图可以判断两个变量之间有没有相关关系.统计假设:如果事件A与B独立,这时应该有P(AB)=P(A)P(B),用字母H表示此式,0即H:P(AB)=P(A)P(B),称之为统计假设.0x2(读作“卡方”)统计量:统计学中有一个非常有用的统计量,它的表达式为X2=nWin22—"J/,用它的大小可以nnnn1十2+十1+2用来决定是否拒绝原来的统计假设H.如果X2的值较大,就拒绝H,即认为A与B是有00关的.X2统计量的两个临界值:3.841、6.635;当X2〉3.841时,有95%的把握说事件A与B有关;当X2〉6.635时,有99%的把握说事件A与B有关;当X2W3.841时,认为事件A与B是无关的.独立性检验的基本思想与反证法类似,由结论不成立时推出有利于结论成立的小概率事件发生,而小概率事件在一次试验中通常是不会发生的,所以认为结论在很大程度上是成立的.独立性检验的步骤:统计假设:H;列出2x2联表;计算X2统计量;查对临界值表,0作出判断.几个临界值:P(X2三2.706)〜0.10,P(X2三3.841)〜0.05,P(X2三6.635)-0.01.2x2联表的独立性检验:如果对于某个群体有两种状态,对于每种状态又有两个情况,这样排成一张2x2的表,如下:状态B状态B合计状态An11n12n1+状态An21n22n2+n+1n+2n如果有调查得来的四个数据n,n,n,n,并希望根据这样的4个数据来检验上述的两种11122122状态A与B是否有关,就称之为2x2联表的独立性检验.六.回归分析回归分析:对于具有相关关系的两个变量进行统计分析的方法叫做回归分析,即回归分析就是寻找相关关系中这种非确定关系的某种确定性.回归直线:如果散点图中的各点都大致分布在一条直线附近,就称这两个变量之间具有线性相关关系,这条直线叫做回归直线.最小二乘法:
记回归直线方程为:y=a+bx,称为变量Y对变量x的回归直线方程,其中a,b叫做回归系数.y是为了区分Y的实际值y,当x取值x时,变量Y的相应观察值为y,而直线上对应于xiii的纵坐标是y=a+bx.ii设x,Y的一组观察值为(x,y),i=1,2,,n,且回归直线方程为y=a+bx,ii当x取值x时,Y的相应观察值为y,差y-y(i=1,2,,n)刻画了实际观察值y与回归iiiii直线上相应点的纵坐标之间的偏离程度称这些值为离差.我们希望这n个离差构成的总离差越小越好,这样才能使所找的直线很贴近已知点.记Q=》(y-a-bx)2,回归直线就是所有直线中Q取最小值的那条.iii=1这种使“离差平方和为最小”的方法叫做最小二乘法.用最小二乘法求回归系数a,b有如下的公式:工xy-nxyiib=芍,a=y-bx,其中a,b上方加“a”,表示是由观察值按最小二乘法求得的乙x2-nx2ii=1回归系数.线性回归模型:将用于估计y值的线性函数a+bx作为确定性函数;y的实际值与估计值之间的误差记为£,称之为随机误差;将y=a+bx+8称为线性回归模型.产生随机误差的主要原因有:所用的确定性函数不恰当即模型近似引起的误差;忽略了某些因素的影响通常这些影响都比较小;由于测量工具等原因存在观测误差.线性回归系数的最佳估计值:利用最小二乘法可以得到a,b的计算公式为丫(x-x)(y-y)丫(x-x)(y-y)工xy-nxyiiii丫(x-x)2i=-7=1工x2-n(x)2i,a=y-bx,其中xini=1y=-Yynii=1i=1ii=1由此得到的直线y=a+bx就称为回归直线,此直线方程即为线性回归方程.其中a,b分别为a,b的估计值,a称为回归截距,b称为回归系数,y称为回归值.相关系数:
丫(x-x)(y-y)ii丫(x-x)(y-y)ii工xy-nxyii:(工x2-n(x)2)疋y2-n(y)2)i=1i=1i=1ii=16.相关系数r的性质:⑴IrIW1;⑵IrI越接近于1,x,y的线性相关程度越强;⑶IrI越接近于0,x,y的线性相关程度越弱.可见,一条回归直线有多大的预测功能,和变量间的相关系数密切相关.7.转化思想:根据专业知识或散点图,对某些特殊的非线性关系,选择适当的变量代换,把非线性方程转化为线性回归方程,从而确定未知参数.8.一些备案①回归(regression)一词的来历:“回归"这个词英国统计学家FrancilsGalton提出来的.1889年,他在研究祖先与后代的身高之间的关系时发现,身材较高的父母,他们的孩子也较高但这些孩子的平均身高并没有他们父母的平均身高高;身材较矮的父母,他们的孩子也较矮,但这些孩子的平均身高却比他们父母的平均身高高.Galton把这种后代的身高向中间值靠近的趋势称为“回归现象”.后来,人们把由一个变量的变化去推测另一个变量的变化的方法称为回归分析.②回归系数的推导过程:X+b2工X2iiQ=工[(y.-a)-bx]2=工y2-2a工y+na2-2b工xyX+b2工X2iiiiiiii=na2+2a(b工x-y)+b2ii把上式看成a的二次函数,a2的系数n>0,因此当a=2@工x-Yy.)工因此当a=2@工x-Yy.)工匸旦时取最小值.2n同理,把Q的展开式按b的降幕排列,看成b的二次函数,当b=工xy-a工x之一-时取最小值.丫xy-nxyVziiV(x-x)(y-y)ii-V(x-x)2i解得:b=节乙x2-nx2ia=y-bx,i=1其中y=-Vy,x=丄Vx是样本平均数.nin19.对相关系数r进行相关性检验的步骤:①提出统计假设h0:变量x,y不具有线性相关关系;②如果以95%的把握作出推断,那么可以根据1-0.95=0.05与n-2(n是样本容量)在相关性检验的临界值表中查出一个r的临界值r(其中1-0.95=0.05称为检验水平);0.05计算样本相关系数r;作出统计推断:若Ir卜r,则否定H,表明有95%的把握认为变量y与x之间具有线0.050性相关关系;若IrIWr,则没有理由拒绝H,即就目前数据而言,没有充分理由认为变0.050量y与x之间具有线性相关关系.说明:⑴对相关系数r进行显著性检验,一般取检验水平a二0.05,即可靠程度为95%.⑵这里的r指的是线性相关系数,r的绝对值很小,只是说明线性相关程度低,不一定不相关,可能是非线性相关的某种关系.⑶这里的r是对抽样数据而言的•有时即使IrI=1,两者也不一定是线性相关的•故在统计分析时,不能就数据论数据,要结合实际情况进行合理解释.:I1忖_典例分析题型一线性相关及回归【例1】已知变量y与x之间的相关系数是r=-0.872,查表得到相关系数临界值r=0.482,要使可靠性不低于95%,则变量y与x之间()0.05A.不具有线性相关关系b.具有线性相关关系C线性相关关系还待进一步确定D.具有确定性关系【例2】当相关系数r=0时,表明()A现象之间完全无关B相关程度较小C现象之间完全相关D无直线相关关系【例3】下列结论中,能表示变量x,y具有线性相关关系的是()A.|厂|上|A.|厂|上|r0.05lB-|r|W|r0.05!C.D.Ir|<Ir0.05|例4】下列现象的相关密切程度最高的是()A.某商店的职工人数与商品销售额之间的相关系数0.87B■流通费用水平与利润率之间的相关关系为-0.94商品销售额与利润率之间的相关系数为0.51商品销售额与流通费用水平的相关系数为-0.81例5】在吸烟与患肺病这两个分类变量的计算中,下列说法正确的是()若X2的值为6.635,我们有99%的把握认为吸烟与患肺病有关系,那么在100个吸烟的人中必有99人患有肺病;从独立性检验可知有99%的把握认为吸烟与患肺病有关系时,我们说某人吸烟,那么他有99%的可能患有肺病;若从统计量中求出有95%的把握认为吸烟与患肺病有关系,是指有5%的可能性使得判断出现错误;以上三种说法都不正确.【例6】设两个变量x和y之间具有线性相关关系,它们的相关系数是r,y关于x的回归直线的斜率是b,纵截距是a,那么必有()A.b与r的符号相同B.a与r的符号相同C.b与r的相反D.a与r的符号相反【例7】定义:点(x,y)与直线y=bx+a的“纵向距离"为ly-(bx+a)l.已知iiiiA(0,0),B(0,-1),C(1,1)三点,存在直线l,使A,B,C三点到直线l的"纵向距离的平方和”Q最小.⑴求直线l的方程和Q的最小值;⑵判断点D(|,0)与直线l的位置关系.
例8】(2009宁夏海南卷理)对变量x,y有观测数据(xi,yi)(i=1,2,,10),得散点图1;对变量U,v有观测数据(u,v)(i=1,2,,10),得散点图2.由这两个散点图可以判断.11A.变量x与y正相关,u与v正相关B.变量x与y正相关,u与v负相关C.变量x与y负相关,u与V正相关D.变量x与y负相关,U与V负相关【例9】为了考查两个变量x和y之间的线性关系,甲、乙两位同学各自独立做了10次和15次的试验,并且利用线性回归方法求得回归直线分别为l,l,已知两人得到的试验数据中,12变量x和y的数据的平均值都对应相等,那么下列说法正确的是()A.直线l和l一定有交点B.直线l一定平行于直线l1212C.直线l一定与l重合D.以上都不对12【例10】某地高校教育经费(x)与高校学生人数(y)连续6年的统计资料如下:教育经费(万元)x316343373393418455在校学生(万人)y111618202225试求回归直线方程,估计教育经费为500万元时的在校学生数.例11】一家庭问题研究机构想知道是否夫妻所受的教育越高越不愿生孩子,现随机抽样了8对夫妻,计算夫妻所受教育的总年数x与孩子数y,得结果如下x1917211815121420y13112321试求y对x回归直线方程.【例12】某种产品的广告费支出x与销售额y(单位:百万元)之间有如下对应数据:x24568y3040605070⑴画出散点图;⑵求回归直线方程.【例13】某五星级大饭店的住屋率(%)(x)与每天每间客房的成本(元)(y)如下:x10075655550y20002500280032004000⑴试求y对x回归直线;⑵若y的表示不变,x以小数表示(如75%表为0.75),求新的回归直线例14】某兴趣小组欲研究昼夜温差大小与患感冒人数多少之间的关系,他们分别到气象局与某医院抄录了1至6月份每月10号的昼夜温差情况与因患感冒而就诊的人数,得到如下资料:日期1月10日2月10日3月10日4月10日5月10日6月10日昼夜温差x(C)1011131286就诊人数y(个)222529261612该兴趣小组确定的研究方案是:先从这六组数据中选取2组,用剩下的4组数据求线性回归方程,再用被选取的2组数据进行检验.⑴若选取的1月与6月的两组数据,请根据2至5月份的数据,求出y关于x的线性回归方程;⑵若由线性回归方程得到的估计数据与所选出的检验数据的误差均不超过2人,则认为得到的线性回归方程是理想
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 宁波浙江宁波南部商务区管理办公室招聘编外人员笔试历年参考题库附带答案详解
- 威海2025年山东威海火炬高技术产业开发区事业单位初级综合类岗位招聘11人笔试历年参考题库附带答案详解-1
- 天津2025年天津市机关后勤事务服务中心招聘6人笔试历年参考题库附带答案详解
- 天津2025年天津市党政机关办公用房管理服务中心招聘笔试历年参考题库附带答案详解-1
- 2025年度新材料市场调研与技术创新合同
- 佛山2025年广东佛山市禅城区教育系统招聘中小学教师93人笔试历年参考题库附带答案详解-1
- 2025年度房地产抵押按揭借款合同书范本(新兴产业)
- 电子技术赋能远程医疗服务发展
- 正式版货车租赁合同6篇
- 幼儿园卫生保健工作计划范例
- 联合国教科文组织(UNESCO):可持续发展教育-路线图
- 延长保修服务
- GB/T 24722-2020路面标线用玻璃珠
- GB/T 18216.1-2021交流1 000 V和直流1 500 V及以下低压配电系统电气安全防护措施的试验、测量或监控设备第1部分:通用要求
- GB/T 17758-2010单元式空气调节机
- FZ/T 60011-2016复合织物剥离强力试验方法
- 剖宫产护理查房完整版课件
- 《人文关怀与优质护理》医院培训课件
- 世界文明与世界宗教课件
- 50097马工程-国际组织(第二版)全套课件
- 《爱国主义教育》开学第一课课件
评论
0/150
提交评论