教学文库网 - 权威文档分享云平台
您的当前位置:首页 > 文库大全 > 高中教育 >

统计建模与数据分析

来源:网络收集 时间:2026-09-28
导读: 统计建模与数据分析 主讲人:李婷婷 西南大学数学与统计学院 参考书籍: 《复杂数据统计方法——基于R的应用》,吴喜之编著,中 国人民大学出版社 主要内容 引 言 横截面数据:因变量为实数轴上的数量变量 横截面数据:因变量为分类变量及因变量为计数变量的

统计建模与数据分析

主讲人:李婷婷 西南大学数学与统计学院

参考书籍: 《复杂数据统计方法——基于R的应用》,吴喜之编著,中 国人民大学出版社

主要内容 引 言 横截面数据:因变量为实数轴上的数量变量 横截面数据:因变量为分类变量及因变量为计数变量的情 况 纵向数据(多水平数据、面板数据) 多元分析(不分因变量和自变量)

路径建模(结构方程建模)数据的PLS分析 多元时间序列数据

引 言

统计是科学 统计是科学? 科学的基本特征是其方法论:对世界的认识源于观测或实 验的信息(或者数据), 总结信息时会形成模型(亦称为假说或 理论), 模型会指导进一步的探索, 直到遇到这些模型无法解 释的现象, 这就导致对这些模型的更新和替代. 统计可以定义为``收集、分析、展示和解释数据的科学, 或 者称为数据科学(science of data).

统计应用于几乎所有领域.

统计与数学、计算机的关系 统计的思维方式是归纳(induction), 也就是从数据所反映的现 实得到稍微一般的模型, 希望以此解释数据所代表的那部分 世界. 这和以演绎(deduction)为主的数学思维方式相反, 演绎则是在一些人为的假定 (比如一个公理系统)之下, 推导 出各种结论.

在统计发展的前期, 没有计算机, 只能在对数据加 上一些数学假定后, 建立一些假定的数学模型, 推导 出结果的性质, 诸如置信区间, 假设检验的p值, 相合 性等等. 在数据分布与假定的正态分布相差甚远的情况, 人 们又利用诸如中心极限定理或大样本定理得到渐近 正态的结果. 据此又得到大样本时的各种性质, 包括置信区间或 置信带, p值, 相合性等等. 统计的这种发展方式, 给统计打上了很深的数学烙 印.

在现成的数学模型无法处理大量的复杂数据的情况下,计 算机领域的研究人员和部分概率论及统计学家开发了许多 计算方法,处理了传统统计无法解决的大量问题。诸如人 工神经网络、决策树、boosting、随机森林、支持向量机等 大量算法模型。 统计研究逐步由数据或者问题驱动,创造模型的目的是适 应现实数据。

随着时代的前进, 院系现在也出现了诸如数据挖掘、机器学 习等课程, 统计杂志也开始逐渐重视这些研究. 这些算法模型大都不是用封闭的数学公式来描述,而是体现 在计算机算法或程序上.

参考书籍:The Elements of Statistical Learning:Data Mining, Inference, and Prediction. Second Edition.

Trevor Hastie, Robert Tibshirani, Jerome Friedman, Springer

学术期刊 Top 期刊 The Annals of Statistics. Journal of the Royal Statistical Society, Series B. Journal of the American Statis

tical Association. Biometrika. Journal of Machine Learning Research

EconometrikaBiostatistics

文献检索 文献检索的一点经验 No sweat, No sweet.

数据分析的实践 数据收集. 首先要根据实际目的. 有数据不一定能够得到需 要的结论, 我们需要的是与所关心问题充分有关的变量的数 据. 数据预处理. 缺失值

寻找适合的模型:为了寻找模型,首先要对数据进行探索 性分析,利用图形、各种统计量、或者比较复杂的探索方 法来查看数据的关联性、线性性、异方差性、多重共线性 、聚类特征、分布形状等。有了对数据的粗略认识之后, 就寻找合适的模型。

数据分析的实践 比较模型的标准.传统统计中: 各种判别准则(各种检验、一些统计量的临界值 等等). 都是在对数据分布及描述变量之间关系的模型所做的 假定之下得到的. 在使用算法模型时, 由于没有传统模型的那些假定, 判断模型 好坏通常都用交叉验证(cross validation)。

对结果的解释.选择模型并不是目的, 目的是解释模型所产生的结果, 而结果 必须是应用领域的结果, 必须有实际意义. 仅仅用统计术语 说某个模型较好, 某个变量显著之类的话是不够的.

R软件入门 R软件的安装 http://doc.guandang.net/CRAN/

最初几步x=1:100#把1,2,...,100个整数向量赋值到x sample(x,20) #从1,...,100中随机不放回地抽取20个值作为样本 set.seed(0);sample(1:10,3)#先设随机种子再抽样. z=sample(1:200000,10000)#从1,...,200000中随机不放回地抽取10000个值作为样本 z[1:10] #方括号中为向量z的下标 y=c(1,3,7,3,4,2) z[y]#以y为下标的z的元素值 (z=sample(x,100,rep=T))#从x放回地抽取100个随机样本 (z1=unique(z)) length(z1)#z中不同的元素个数 xz=setdiff(x,z) #x和z之间的不同元素--集合差 sort(union(xz,z))#对xz及z的并的元素从小到大排序 setequal(union(xz,z),x) #对xz及z的并的元素与x是否一样 intersect(1:10,7:50) #两个数据的交 sample(1:100,20,prob=1:100)#从1:100中不等概率随机抽样, #各数目抽到的概率与1:100成比例

一些简单运算pi *10^2 #能够用?”*”来看基本算术运算方法, pi是圆周率 pi * (1:10)^-2.3#可以对向量求指数幂 x = pi * 10^2 x print(x) #和上面一样 (x=pi *10^2) #赋值带打印 pi^(1:5) #指数也可以是向量 print(x, digits = 12)#输出x的12位数字

…… 此处隐藏:926字,全部文档内容请下载后查看。喜欢就下载吧 ……
统计建模与数据分析.doc 将本文的Word文档下载到电脑,方便复制、编辑、收藏和打印
本文链接:https://www.jiaowen.net/wenku/1728717.html(转载请注明文章来源)
Copyright © 2020-2025 教文网 版权所有
声明 :本网站尊重并保护知识产权,根据《信息网络传播权保护条例》,如果我们转载的作品侵犯了您的权利,请在一个月内通知我们,我们会及时删除。
客服QQ:78024566 邮箱:78024566@qq.com
苏ICP备19068818号-2
Top
× 游客快捷下载通道(下载后可以自由复制和排版)
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150份
全站内容免费自由复制
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150份
全站内容免费自由复制
注:下载文档有可能出现无法下载或内容有问题,请联系客服协助您处理。
× 常见问题(客服时间:周一到周五 9:30-18:00)