《回归分析的基本思想及其初步应用(5).ppt》由会员分享,可在线阅读,更多相关《回归分析的基本思想及其初步应用(5).ppt(22页珍藏版)》请在taowenge.com淘文阁网|工程机械CAD图纸|机械工程制图|CAD装配图下载|SolidWorks_CaTia_CAD_UG_PROE_设计图分享下载上搜索。
1、第一章第一章 统计案例统计案例 线性回归模型线性回归模型y=y=bx+a+ebx+a+e增加了随机误差项增加了随机误差项e e,因,因变量变量y y的值由自变量的值由自变量x x和随机误差项和随机误差项e e共同确定,即共同确定,即自自变量变量x x只能解析部分只能解析部分y y的变化的变化。在统计中,我们也把自变量在统计中,我们也把自变量x x称为称为解析变量解析变量,因变,因变量量y y为为预报变量预报变量。我们可以用我们可以用相关指数相关指数R2来刻画回归的效果,其计算公式是来刻画回归的效果,其计算公式是显然,显然,R2的值越大,说明残差平方和越小,也就是说模型拟合的值越大,说明残差平方
2、和越小,也就是说模型拟合效果越好。效果越好。R2越接近越接近1,表示回归的效果越好(因为,表示回归的效果越好(因为R2越接近越接近1,表示解析,表示解析变量和预报变量的线性相关性越强)。变量和预报变量的线性相关性越强)。如果某组数据可能采取几种不同回归方程进行回归分析,如果某组数据可能采取几种不同回归方程进行回归分析,则可以通过比较则可以通过比较R R2 2的值来做出选择,即的值来做出选择,即选取选取R R2 2较大的模型作为较大的模型作为这组数据的模型这组数据的模型。总的来说:总的来说:相关指数相关指数R2是度量模型拟合效果的一种指标。是度量模型拟合效果的一种指标。在线性模型中,它在线性模型
3、中,它代表自变量刻画预报变量的能力代表自变量刻画预报变量的能力。1、残差、残差数据点和它在回归直线上相应位置的差异数据点和它在回归直线上相应位置的差异 称为相应于点(称为相应于点(x xi i,y yi i )的的残差残差。例:编号为例:编号为6 6的女大学生,计算随机误差的效应(残差)的女大学生,计算随机误差的效应(残差)2、残差平方和、残差平方和 把每一个残差所得的值平方后加起来,用数学符号表把每一个残差所得的值平方后加起来,用数学符号表示为:示为:称为称为残差平方和残差平方和在例在例1 1中,残差平方和约为中,残差平方和约为128.361128.361。编号编号12345678身高身高/
4、cm165165157170175165155170体重体重/kg4857505464614359残差残差-6.3732.6272.419-4.6181.1376.627-2.8830.382 我们可以利用图形来分析残差特性,作图时纵我们可以利用图形来分析残差特性,作图时纵坐标为残差,横坐标可以选为样本编号,或身高数坐标为残差,横坐标可以选为样本编号,或身高数据据,或体重估计值等,这样作出的图形称为,或体重估计值等,这样作出的图形称为残差图残差图。表表1-4列出了女大学生身高和体重的原始数据以及列出了女大学生身高和体重的原始数据以及相应的残差数据。相应的残差数据。使用公式使用公式 计算残差计算
5、残差残差图的制作及作用。残差图的制作及作用。坐标纵轴为残差变量,横轴可以有不同的选择;坐标纵轴为残差变量,横轴可以有不同的选择;若模型选择的正确,残差图中的点应该分布在以若模型选择的正确,残差图中的点应该分布在以横轴为心的带形区域;横轴为心的带形区域;对于远离横轴的点,要特别注意。对于远离横轴的点,要特别注意。身高与体重残差图异常点 错误数据 模型问题 几点说明:几点说明:第一个样本点和第第一个样本点和第6个样本点的残差比较大,需要确认在采集过程中是否有人为个样本点的残差比较大,需要确认在采集过程中是否有人为的错误。如果数据采集有错误,就予以纠正,然后再重新利用线性回归模型拟合数的错误。如果数
6、据采集有错误,就予以纠正,然后再重新利用线性回归模型拟合数据;如果数据采集没有错误,则需要寻找其他的原因。据;如果数据采集没有错误,则需要寻找其他的原因。另外,残差点比较均匀地落在水平的带状区域中,说明选用的模型比较合适,这另外,残差点比较均匀地落在水平的带状区域中,说明选用的模型比较合适,这样的带状区域的宽度越窄,说明模型拟合精度越高,回归方程的预报精度越高。样的带状区域的宽度越窄,说明模型拟合精度越高,回归方程的预报精度越高。用身高预报体重时,需要注意下列问题:用身高预报体重时,需要注意下列问题:1、回归方程只适用于我们所研究的样本的总体;、回归方程只适用于我们所研究的样本的总体;2、我们
7、所建立的回归方程一般都有时间性;、我们所建立的回归方程一般都有时间性;3、样本采集的范围会影响回归方程的适用范围;、样本采集的范围会影响回归方程的适用范围;4、不能期望回归方程得到的预报值就是预报变量的精确值。、不能期望回归方程得到的预报值就是预报变量的精确值。事实上,它是预报变量的可能取值的平均值。事实上,它是预报变量的可能取值的平均值。这些问题也使用于其他问题。这些问题也使用于其他问题。一般地,建立回归模型的基本步骤为:一般地,建立回归模型的基本步骤为:(1)确定研究对象,明确哪个变量是解析变量,哪个变量)确定研究对象,明确哪个变量是解析变量,哪个变量是预报变量。是预报变量。(2)画出确定
8、好的解析变量和预报变量的散点图,观察它)画出确定好的解析变量和预报变量的散点图,观察它们之间的关系(如是否存在线性关系等)。们之间的关系(如是否存在线性关系等)。(3)由经验确定回归方程的类型(如我们观察到数据呈线)由经验确定回归方程的类型(如我们观察到数据呈线性关系,则选用线性回归方程性关系,则选用线性回归方程y=bx+a).(4)按一定规则估计回归方程中的参数(如最小二乘法)。)按一定规则估计回归方程中的参数(如最小二乘法)。(5)得出结果后分析残差图是否有异常(个别数据对应)得出结果后分析残差图是否有异常(个别数据对应残差过大,或残差呈现不随机的规律性,等等),过存在残差过大,或残差呈现
9、不随机的规律性,等等),过存在异常,则检查数据是否有误,或模型是否合适等。异常,则检查数据是否有误,或模型是否合适等。练习练习1 在一段时间内,某中商品的价格在一段时间内,某中商品的价格x元和需求量元和需求量Y件件之间的一组数据为:之间的一组数据为:求出求出Y对对x的回归直线方程,并说明拟合效果的好坏。的回归直线方程,并说明拟合效果的好坏。价格价格x1416182022需求量需求量Y1210753解:解:练习练习1 在一段时间内,某中商品的价格在一段时间内,某中商品的价格x元和需求量元和需求量Y件之件之间的一组数据为:间的一组数据为:求出求出Y对的回归直线方程,并说明拟合效果的好坏。对的回归直
10、线方程,并说明拟合效果的好坏。价格价格x1416182022需求量需求量Y1210753列出残差表为列出残差表为0.994因而,拟合效果较好。因而,拟合效果较好。00.3-0.4-0.10.24.62.6-0.4-2.4-4.4练习练习2 关于关于x与与y有如下数据:有如下数据:有如下的两个线性模型:有如下的两个线性模型:(1);(;(2)试比较哪一个拟合效果更好。试比较哪一个拟合效果更好。x24568y3040605070选用模型(选用模型(1)的拟合效果更好)的拟合效果更好练练:某种产品的广告费支出某种产品的广告费支出x与销售额与销售额y之间有如表之间有如表所示数据所示数据:零件数零件数X
11、24568加工时间加工时间y(分分钟钟)3040605070(1)求求x,y之间的相关系数之间的相关系数;(2)求线性回归方程求线性回归方程;案例2 一只红铃虫的产卵数y和温度x有关。现收集了7组观测数据列于表中:(1)试建立产卵数y与温度x之间的回归方程;并预测温度为28oC时产卵数目。(2)你所建立的模型中温度在多大程度上解释了产卵数的变化?温度xoC21232527293235产卵数y/个711212466115325非线性回归问题假设线性回归方程为:=bx+a选 模 型由计算器得:线性回归方程为由计算器得:线性回归方程为y=y=19.8719.87x x-463.73-463.73 相
12、关指数相关指数R R2 2=r r2 20.8640.8642 2=0.7464=0.7464估计参数 解:选取气温为解释变量解:选取气温为解释变量x x,产卵数,产卵数 为预报变量为预报变量y y。选变量所以,一次函数模型中温度解释了所以,一次函数模型中温度解释了74.64%的产卵数变化。的产卵数变化。探索新知画散点图050100150200250300350036912151821242730333639方案方案1分析和预测当x=28时,y=19.8728-463.73 93一元线性模型 y=bx2+a 变换 y=bt+a非线性关系 线性关系方案方案2选用y=bx2+a,还是y=bx2+c
13、x+a?产卵数气温如何求a、b?t=x2二次函数模型方案2解答平方变换平方变换:令令t=xt=x2 2,产卵数,产卵数y y和温度和温度x x之间二次函数模型之间二次函数模型y=bxy=bx2 2+a+a就转化为产卵数就转化为产卵数y y和温度的平方和温度的平方t t之间线性回归模型之间线性回归模型y=y=bt+abt+a温度21232527293235温度的平方t44152962572984110241225产卵数y/个711212466115325作作散散点点图图,并并由由计计算算器器得得:y y和和t t之之间间的的线线性性回回归归方方程程为为y=y=0.3670.367t t-202.
14、543-202.543,相关指数,相关指数R R2 2=0.802=0.802将将t=xt=x2 2代入线性回归方程得:代入线性回归方程得:y=y=0.3670.367x x2 2-202.543-202.543当当x x=28=28时时,y y=0.367=0.36728282 2-202.5485202.5485,且,且R R2 2=0.802=0.802,所所以以,二二次次函函数数模模型型中中温温度度解释了解释了80.2%80.2%的产卵数变化。的产卵数变化。t 变换 y=bx+a非线性关系 线性关系产卵数气温指数函数模型方案3方案3解答温度xoC21232527293235z=lny1
15、.9462.3983.0453.1784.1904.7455.784产卵数y/个711212466115325xz当当x=28x=28o oC C 时,时,y 44 y 44,指数回归模型中温度解释指数回归模型中温度解释了了98.5%98.5%的产卵数的变化的产卵数的变化由计算器得:由计算器得:z z关于关于x x的线性回归方程的线性回归方程为为 对数变换:在 中两边取常用对数得令 ,则 就转换为z=bx+a.相关指数相关指数R R2 2=0.98=0.98最好的模型是哪个最好的模型是哪个?产卵数气温产卵数气温线性模型线性模型二次函数模型二次函数模型指数函数模型指数函数模型比一比函数模型函数模
16、型相关指数相关指数R2线性回归模型线性回归模型0.7464二次函数模型二次函数模型0.80指数函数模型指数函数模型0.98最好的模型是哪个最好的模型是哪个?作业:作业:在在7块并排的、形状大小相同的实验田上进行施块并排的、形状大小相同的实验田上进行施肥量对水稻产量影响的试验,得到如下一组表所示肥量对水稻产量影响的试验,得到如下一组表所示的数据(单位:的数据(单位:kg)施化肥量施化肥量x x1515202025253030353540404545水稻产量水稻产量y y330330345345365365405405445445450450455455(1)以以x为解释变量,为解释变量,y为预报
17、变量,作出散点图为预报变量,作出散点图(2)求求y与与x之间的回归方程,并求施肥量为之间的回归方程,并求施肥量为28kg时时 的水稻产量的预报值的水稻产量的预报值(3)计算各组残差,并计算残差平方和计算各组残差,并计算残差平方和(4)求求R2,并说明残差变量对产量影响有多大?,并说明残差变量对产量影响有多大?练习3 假设关于某设备的使用年限x和所支出的维修费用 y(万元),有如下的统计资料。使用年限使用年限x 23456维修费用维修费用y 2.23.85.56.57.0若由资料知,y对x呈线性相关关系。试求:(1)线性回归方程 的回归系数 ;(2)求残差平方和;(3)求相关系数 ;(4)估计使用年限为10年时,维修费用是多少?