1、 1 一随机抽样 1随机抽样:满足每个个体被抽到的机会是均等的抽样,共有三种经常采用的随机抽样方 法: 简单随机抽样:从元素个数为N的总体中不放回地抽取容量为n的样本,如果每一次抽 取时总体中的各个个体有相同的可能性被抽到,这种抽样方法叫做简单随机抽样 抽出办法:抽签法:用纸片或小球分别标号后抽签的方法 随机数表法:随机数表是使用计算器或计算机的应用程序生成随机数的功能生成的一张 数表表中每一位置出现各个数字的可能性相同 随机数表法是对样本进行编号后, 按照一定的规律从随机数表中读数, 并取出相应的样本的 方法 简单随机抽样是最简单、最基本的抽样方法 系统抽样:将总体分成均衡的若干部分,然后按
2、照预先制定的规则,从每一部分抽取一个 个体,得到所需要的样本的抽样方法 抽出办法:从元素个数为N的总体中抽取容量为n的样本,如果总体容量能被样本容量整 除,设 N k n ,先对总体进行编号,号码从1到N,再从数字1到k中随机抽取一个数s作 为起始数,然后顺次抽取第2(1)sksksnk, ,个数,这样就得到容量为n的样 本如果总体容量不能被样本容量整除,可随机地从总体中剔除余数,然后再按系统抽样 方法进行抽样 系统抽样适用于大规模的抽样调查,由于抽样间隔相等,又被称为等距抽样 分层抽样:当总体有明显差别的几部分组成时,要反映总体情况,常采用分层抽样,使 总体中各个个体按某种特征分成若干个互不
3、重叠的几部分,每一部分叫做层,在各层中按 层在总体中所占比例进行简单随机抽样,这种抽样方法叫做分层抽样 分层抽样的样本具有较强的代表性,而且各层抽样时,可灵活选用不同的抽样方法, 应用广泛 2简单随机抽样必须具备下列特点: 简单随机抽样要求被抽取的样本的总体个数N是有限的 简单随机样本数n小于等于样本总体的个数N 简单随机样本是从总体中逐个抽取的 简单随机抽样是一种不放回的抽样 简单随机抽样的每个个体入样的可能性均为 n N 3系统抽样时,当总体个数N恰好是样本容量n的整数倍时,取 N k n ; 若 N n 不是整数时,先从总体中随机地剔除几个个体,使得总体中剩余的个体数能被样本容 量n整除
4、因为每个个体被剔除的机会相等,因而整个抽样过程中每个个体被抽取的机会仍 知识内容 板块三.茎叶图 2 然相等,为 N n 二频率直方图 列出样本数据的频率分布表和频率分布直方图的步骤: 计算极差:找出数据的最大值与最小值,计算它们的差; 决定组距与组数:取组距,用 极差 组距 决定组数; 决定分点:决定起点,进行分组; 列频率分布直方图:对落入各小组的数据累计,算出各小数的频数,除以样本容量,得 到各小组的频率 绘制频率分布直方图:以数据的值为横坐标,以 频率 组距 的值为纵坐标绘制直方图, 知小长方形的面积组距频率 组距 频率 频率分布折线图: 将频率分布直方图各个长方形上边的中点用线段连接
5、起来, 就得到频率分 布折线图,一般把折线图画成与横轴相连,所以横轴左右两端点没有实际意义 总体密度曲线:样本容量不断增大时,所分组数不断增加,分组的组距不断缩小,频率分布 直方图可以用一条光滑曲线( )yf x来描绘,这条光滑曲线就叫做总体密度曲线总体密度 曲线精确地反映了一个总体在各个区域内取值的规律 三茎叶图 制作茎叶图的步骤: 将数据分为“茎”、“叶”两部分; 将最大茎与最小茎之间的数字按大小顺序排成一列,并画上竖线作为分隔线; 将各个数据的“叶”在分界线的一侧对应茎处同行列出 四统计数据的数字特征 用样本平均数估计总体平均数;用样本标准差估计总体标准差 数据的离散程序可以用极差、方差
6、或标准差来描述 极差又叫全距,是一组数据的最大值和最小值之差,反映一组数据的变动幅度; 样本方差描述了一组数据平均数波动的大小,样本的标准差是方差的算术平方根 一般地,设样本的元素为 12n xxx, , ,样本的平均数为x, 定义样本方差为 222 212 ()()() n xxxxxx s n , 样本标准差 222 12 ()()() n xxxxxx s n 简化公式: 22222 12 1 () n sxxxnx n 五独立性检验 1两个变量之间的关系; 常见的有两类:一类是确定性的函数关系;另一类是变量间存在关系,但又不具备函数关系 所要求的确定性,它们的关系是带有一定随机性的当一
7、个变量取值一定时,另一个变量的 取值带有一定随机性的两个变量之间的关系叫做相关关系 2散点图:将样本中的n个数据点()(1 2) ii xyin, , ,描在平面直角坐标系中,就得到 了散点图 散点图形象地反映了各个数据的密切程度, 根据散点图的分布趋势可以直观地判断分析两个 3 变量的关系 3如果当一个变量的值变大时,另一个变量的值也在变大,则这种相关称为正相关;此时, 散点图中的点在从左下角到右上角的区域 反之,一个变量的值变大时,另一个变量的值由大变小,这种相关称为负相关此时,散点 图中的点在从左上角到右下角的区域 散点图可以判断两个变量之间有没有相关关系 4统计假设:如果事件A与B独立
8、,这时应该有()( ) ( )P ABP A P B,用字母 0 H表示此式, 即 0: ()( ) ( )HP ABP A P B,称之为统计假设 5 2 (读作“卡方”)统计量: 统计学中有一个非常有用的统计量,它的表达式为 2 211221221 1212 ()n n nn n n n n n ,用它的大小可以 用来决定是否拒绝原来的统计假设 0 H如果 2 的值较大,就拒绝 0 H,即认为A与B是有 关的 2 统计量的两个临界值:3.841、6.635;当 2 3.841时,有95%的把握说事件A与B有 关;当 2 6.635时,有99%的把握说事件A与B有关;当 2 3.841时,认
9、为事件A与B 是无关的 独立性检验的基本思想与反证法类似, 由结论不成立时推出有利于结论成立的小概率事件发 生,而小概率事件在一次试验中通常是不会发生的,所以认为结论在很大程度上是成立的 1独立性检验的步骤:统计假设: 0 H;列出22联表;计算 2 统计量;查对临界值表, 作出判断 2几个临界值: 222 ()0.10(3.841)0.05(6.635)0.01PPP2.706, 22联表的独立性检验: 如果对于某个群体有两种状态,对于每种状态又有两个情况,这样排成一张22的表,如 下: 状态B 状态B 合计 状态A 11 n 12 n 1 n 状态A 21 n 22 n 2 n 1 n 2
10、 n n 如果有调查得来的四个数据 11122122 nnnn, 并希望根据这样的4个数据来检验上述的两种 状态A与B是否有关,就称之为22联表的独立性检验 六回归分析 1回归分析:对于具有相关关系的两个变量进行统计分析的方法叫做回归分析,即回归分 析就是寻找相关关系中这种非确定关系的某种确定性 回归直线: 如果散点图中的各点都大致分布在一条直线附近, 就称这两个变量之间具有线性 相关关系,这条直线叫做回归直线 2最小二乘法: 记回归直线方程为: y abx,称为变量Y对变量x的回归直线方程,其中a b,叫做回归 系数 y 是为了区分Y的实际值y,当x取值 i x时,变量Y的相应观察值为 i
11、y,而直线上对应于 i x 的纵坐标是i i yabx 设x Y,的一组观察值为() ii xy,1 2in , , ,且回归直线方程为 y abx, 当x取值 i x时,Y的相应观察值为 i y,差 ( 1 2) ii yy in , , ,刻画了实际观察值 i y与回归 4 直线上相应点的纵坐标之间的偏离程度,称这些值为离差 我们希望这n个离差构成的总离差越小越好,这样才能使所找的直线很贴近已知点 记 2 1 () n ii i Qyabx ,回归直线就是所有直线中Q取最小值的那条 这种使“离差平方和为最小”的方法,叫做最小二乘法 用最小二乘法求回归系数a b,有如下的公式: 1 22 1
12、 n ii i n i i x ynxy b xnx , a ybx,其中a b,上方加“”,表示是由观察值按最小二乘法求得的 回归系数 3线性回归模型:将用于估计y值的线性函数abx作为确定性函数;y的实际值与估计 值之间的误差记为,称之为随机误差;将yabx称为线性回归模型 产生随机误差的主要原因有: 所用的确定性函数不恰当即模型近似引起的误差; 忽略了某些因素的影响,通常这些影响都比较小; 由于测量工具等原因,存在观测误差 4线性回归系数的最佳估计值: 利用最小二乘法可以得到 a b,的计算公式为 11 222 11 ()() ()( ) nn iiii ii nn ii ii xx y
13、yx ynxy b xxxn x , a ybx,其中 1 1 n i i xx n , 1 1 n i i yy n 由此得到的直线yabx就称为回归直线,此直线方程即为线性回归方程其中 a ,b分 别为a,b的估计值, a 称为回归截距,b称为回归系数, y 称为回归值 5相关系数: 11 222222 1111 ()() ()()( ) )( ) ) nn iiii ii nnnn iiii iiii xx yyx ynxy r xxyyxn xyn y 6相关系数r的性质: | |1r ; | | r越接近于 1,xy,的线性相关程度越强; | | r越接近于 0,xy,的线性相关程度
14、越弱 可见,一条回归直线有多大的预测功能,和变量间的相关系数密切相关 7转化思想: 根据专业知识或散点图,对某些特殊的非线性关系,选择适当的变量代换,把非线性方程转 化为线性回归方程,从而确定未知参数 8一些备案 回归 (regression) 一词的来历: “回归”这个词英国统计学家 Francils Galton 提出来的 1889 年,他在研究祖先与后代的身高之间的关系时发现,身材较高的父母,他们的孩子也较高, 但这些孩子的平均身高并没有他们父母的平均身高高; 身材较矮的父母, 他们的孩子也较矮, 但这些孩子的平均身高却比他们父母的平均身高高 Galton 把这种后代的身高向中间值靠近
15、的趋势称为“回归现象”后来,人们把由一个变量的变化去推测另一个变量的变化的方法称 为回归分析 回归系数的推导过程: 5 22222 ()222 iiiiiiii Qyabxyaynabx yabxbx 2222 2 ()2 iiiiii naa bxybxbx yy , 把上式看成a的二次函数, 2 a的系数0n , 因此当 2() 2 iiii bxyybx a nn 时取最小值 同理, 把Q的展开式按b的降幂排列, 看成b的二次函数, 当 2 iii i x yax b x 时取最小值 解得: 1 2 22 1 ()() () n ii ii i n i i i x ynxy xxyy b
16、 xx xnx ,aybx, 其中 1 i yy n , 1 i xx n 是样本平均数 9 对相关系数r进行相关性检验的步骤: 提出统计假设 0 H:变量xy,不具有线性相关关系; 如果以95%的把握作出推断,那么可以根据10.950.05与2n (n是样本容量)在相 关性检验的临界值表中查出一个r的临界值 0.05 r(其中10.950.05称为检验水平) ; 计算样本相关系数r; 作出统计推断:若 0.05 |rr,则否定 0 H,表明有95%的把握认为变量y与x之间具有线 性相关关系;若 0.05 |rr,则没有理由拒绝 0 H,即就目前数据而言,没有充分理由认为变 量y与x之间具有线
17、性相关关系 说明: 对相关系数r进行显著性检验,一般取检验水平0.05,即可靠程度为95% 这里的r指的是线性相关系数,r的绝对值很小,只是说明线性相关程度低,不一定不相 关,可能是非线性相关的某种关系 这里的r是对抽样数据而言的有时即使| | 1r ,两者也不一定是线性相关的故在统计 分析时,不能就数据论数据,要结合实际情况进行合理解释 题型一 茎叶图 【例1】 甲、乙两名运动员的5次测试成绩如下图所示 7 乙甲 639268 8687 7 设 12 ,ss分别表示甲、乙两名运动员测试成绩的标准差, 12 ,xx分别表示甲、乙两 名运动员测试成绩的平均数,则有( ) A 12 xx, 12
18、ss B 12 xx, 12 ss C 12 xx, 12 ss D 12 xx, 12 ss 【考点】茎叶图 【难度】2 星 【题型】选择题 【关键词】2010 年,北京丰台 2 模 典例分析 6 【解析】 1 8787989692 92 5 x , 2 8688939697 92 5 x 12 xx; 22222 1 55642s 106, 22222 2 64145s 94 12 ss 【答案】B; 【例2】 随机抽取某中学甲,乙两班各 10 名同学,测量他们的身高(单位:cm) ,获得身 高数据的茎叶图如图 ,则下列关于甲,乙两班这 10 名同学身高的结论正确的是 ( ) A 甲班同学
19、身高的方差较大 B 甲班同学身高的平均值较大 C 甲班同学身高的中位数较大 D 甲班同学身高在 175 以上的人数较多 【考点】茎叶图 【难度】2 星 【题型】选择 【关键词】2010 年,北京宣武 2 模 【解析】容易计算得知,甲班乙班平均值相同为 170,故而 B 错误;从茎叶图可以看出, 乙班同学身高分布较甲班更为集中于均值附近,故而甲班同学身高方差大于乙 班甲班同学身高的中位数为 169,乙班同学身高的中位数为 1715故而 C 错 误甲班同学身高 175 以上的有 3 人,乙班有 4 人,故而 D 错误 【答案】A; 【例3】 甲、乙两人在 10 天中每天加工零件的个数用茎叶图表示如
20、下图,中间一列的 数字表示零件个数的十位数,两边的数字表示零件个数的个位数,则这 10 天 甲、乙两人日加工零件的平均数分别为 和 4 女甲 9 003 2 2 2 1 1 1 1 1 00 987 5 432 1 【考点】茎叶图 【难度】1 星 【题型】填空 【关键词】2010 年,天津高考 【解析】略 7 【答案】24,23; 【例4】 右图是某赛季甲、乙两名篮球运动员每场比赛得分的茎叶图, 571 2678479 45368 553 乙甲 4 3 2 1 则甲、乙两人这几场比赛得分的中位数之和是( ) A62 B63 C64 D65 【考点】茎叶图 【难度】2 星 【题型】选择 【关键词
21、】无 【解析】283664 【答案】C; 【例5】 在某五场篮球比赛中,甲、乙两名运动员得分的茎叶图如右下列说法正确的是 234 0 21 0 89 1 乙甲 3 2 1 0 A在这五场比赛中,甲的平均得分比乙好,且甲比乙稳定 B在这五场比赛中,甲的平均得分比乙好,但乙比甲稳定 C在这五场比赛中,乙的平均得分比甲好,且乙比甲稳定 D在这五场比赛中,乙的平均得分比甲好,但甲比乙稳定 【考点】茎叶图 【难度】2 星 【题型】选择 【关键词】无 【解析】略 【答案】C; 【例6】 某校开展“爱我海西、爱我家乡”摄影比赛,9位评委为参赛作品A给出的分数 如茎叶图所示,记分员在去掉一个最高分和一个最低分
22、后,算得平均分为91, 8 复核员在复核时,发现有一个数字(茎叶图中的x)无法看清若记分员计算 无误,则数字x应该是 【考点】茎叶图 【难度】3 星 【题型】填空 【关键词】2009 年,福建高考 【解析】由茎叶图可知所有评分为:88 89 89 92 93 992 91 94x, , , , , , , , 若4x ,去掉9x,易知剩下的数的平均数大于91; 故94为最高分,去掉88与94后,有89899293909291791x,解 得1x 【答案】1; 【例7】 在一次数学统考后,某班随机抽取10名同学的成绩进行样本分析,获得成绩数 据的茎叶图如下 计算样本的平均成绩及方差; 在这10个
23、样本中,现从不低于84分的成绩中随机抽取2个,求93分的成绩 被抽中的概率 00 435 46 873 6 7 8 9 【考点】茎叶图 【难度】3 星 【题型】解答 【关键词】2010 年,东城一模 【解析】略 【答案】样本的平均成绩80x 样本方差为 2222222 1 (9380)(9780)(9880)(8680)(8480)(7580) 10 s 2222 (73 80)(7480)(6080)(6080) 174.4, 设A表示随机事件“93分的成绩被抽中”,从不低于84分的成绩中随机抽取2个 的样本总数是:(98, 84),(98, 86),(98, 93),(98, 97),(9
24、7, 84),(97, 86), (97, 93),(93, 84),(93, 86),(86, 84)共10种 而事件A含有4个基本事件:(98, 93),(97, 93),(93, 84),(93, 86) 所以所求概率为 42 105 P 作品A 8 9 8 9 9 2 3 x 2 1 4 9 【例8】 某班甲、乙两学生的高考备考成绩如下: 甲:512 554 528 549 536 556 534 541 522 538 乙:515 558 521 543 532 559 536 548 527 531 用茎叶图表示两学生的成绩; 分别求两学生成绩的中位数和平均分 【考点】茎叶图 【难
25、度】2 星 【题型】解答 【关键词】无 【解析】略 【答案】两学生成绩绩的茎叶图如右所示 896455 3819 261846 1728 52 乙甲 54 53 52 51 将甲、乙两学生的成绩从小到大排列为: 甲:512 522 528 534 536 538 541 549 554 556, 乙:515 521 527 531 532 536 543 548 558 559 从以上排列可知甲学生成绩的中位数为 536538 537 2 , 乙学生成绩的中位数为 532536 534 2 甲学生成绩的平均数为: 12222834363841495456 500537 10 , 乙学生成绩的平
26、均数为: 15212731323643485859 500537 10 【例9】 某电脑杂志的一篇文章中,每个句子的字数如下: 10 28 31 17 23 27 18 15 26 24 20 19 36 27 14 25 15 22 11 24 27 17, , , , , , , , , , , , , , , , , , , , , , 某报纸的一篇文章中,每个句子所含的字数如下: 27 39 33 24 28 19 32 41 33 27 35 12 36 41 27 13 22 23 18 46 32 22, , , , , , , , , , , , , , , , , , , ,
27、 , 将两组数据用茎叶图表示; 比较分析,能得到什么结论? 【考点】茎叶图 【难度】2 星 【题型】解答 10 【关键词】无 【解析】略 【答案】茎叶图如右 116 223356961 2234777887776544320 2389987755410 报纸文章电脑杂志 4 3 2 1 电脑杂志上每个句子的字数集中在10 30之间,中位数为23;而报纸上每个句 子的字数集中在20 40之间,中位数为28电脑杂志上每个句子的平均字数比报 纸上的平均字数 要少说明电脑杂志作为科普读物需要简明 【例10】 随机抽取某中学甲乙两班各10名同学,测量他们的身高(单位:cm) ,获得身高数 据的茎叶图如图
28、 乙班甲班 98 8 6 5 3 9 2 0 1 9 88 9 3 1 8 2 0 2 15 16 17 18 根据茎叶图判断哪个班的平均身高较高; 计算甲班的样本方差 现从乙班这10名同学中随机抽取两名身高不低于173cm的同学,求身高为 176cm的同学被抽中的概率 【考点】茎叶图 【难度】3 星 【题型】解答 【关键词】2009 年,广东高考 【解析】略 【答案】由茎叶图可知: 甲班身高集中于160 179之间,而乙班身高集中于170 180之间 因此乙班平均身高高于甲班; 158162163168168170171 179179182 170 10 x 甲班的样本方差为 2222 2 1 (158170)162170163 170168170168170 10 22222 170170171 17017917017917018217057.2 设身高为176cm的同学被抽中的事件为A; 从乙班 10 名同学中抽中两名身高不低于173cm的同学有:181 173,181 176, 181 178,181 179,179 173,179 176,179 178,178 173,178 176, 176 173,共10个基本事件,而事件A含有 4 个基本事件; 11 42 105 P A