【R语言入门与数据分析-5】数据分析实战

2023-03-23 17:41:02Python027

【R语言入门与数据分析-5】数据分析实战,第1张

老师的吐槽大会，乐死我了。hhh

regression，通常指用一个或者多个预测变量，也称自变量或者解释变量，来预测响应变量，也称为因变量、效标变量或者结果变量的方法

存在多个变量

AIC 考虑模型统计拟合度、用来拟合的参数数目

AIC值越小，越好

更多的变量：

图一：是否呈线性关系，是

图二：是否呈正态分布，一条直线，正态分布

图三：位置与尺寸图，描述同方差性，如果方差不变，水平线周围的点应该是随机分布

图四：残差与杠杆图，对单个数据值的观测，鉴别离群点、高杠杆点、强影响点

模型建好，用predict函数对剩余500个样本进行预测，比较残差值，若预测准确，说明模型可以。

analysis of variance，简称ANOVA，也称为变异数分析。用于两个及两个以上样本均数差别的显著性检验。广义上，方差分析也是回归分析的一种，只不过线性回归的因变量一般是连续型变量。自变量是因子时，研究关注的重点通常会从预测转向不同组之间的差异比较。也就是方差分析。

power analysis，可以帮助在给定置信度的情况下，判断检测到给定效应值所需的样本量。也可以在给定置信度水平情况下，计算在某样本量内能检测到给定效应值的概率

拓展了线性模型的框架，包含了非正态因变量的分析。线性回归、方差分析都是基于正态分布的假设

-泊松回归，用来为计数资料和列联表建模的一种回归分析。泊松回归假设因变量是泊松分布，并假设它平均值的对数可被未知参数的线性组合建模

-logistic 回归

通过一系列连续型或者类别型预测变量来预测二值型结果变量是，logistic 回归是一个非常有用的工具。流行病学研究中用的多。

Principal Component Analysis，PCA，探索和简化多变量复杂关系的常用方法。是一种数据降维技巧。可以将大量相关变量转化为一组很少的不相关变量。这些无关变量成为主成分。主成分是对原始变量重新进行线性组合，将原先众多具有一定相关性的指标，重新组合为一组的心得相互独立的综合指标。

探索性因子分析法 exploratory factor analysis，简称为EFA，是一系列用来发现一组变量的潜在结构的方法。通过找寻一组更小的、潜在的活隐藏的结构来解释已观测到的、显式的变量间的关系

因子分析步骤与PCA一致

啤酒与尿布

首先R是一种专业性很强的统计语言，如果想学得快一些的话，基本的统计学知识要懂，不然很多东西会掌握的比较慢。

掌握基本语法和操作，推荐国内的已经翻译的比如《R语言实战》《R语言编程艺术》，这个过程中最好结合一些小例子来做一些分析的东西。其他还有《R语言实例》《R语言核心技术手册》也都是很好的书！如果需要可视化的话，强烈不推荐学习R本身的作图系统，实在是太不友好了.....还是用ggplot2吧。

掌握了上面的，就可以深入一些了，如果是做数据分析和可视化，推荐《ggplot2：数据分析与图形艺术》，这个才是作图的神器啊.....如果是空间分析相关的，推荐《Applied Spatial Data Analysis with R》，这个如果可以的话看英文版，而且要有地学的一些知识背景，中文版翻译的太次了，尽量不要看。数据挖掘机器学习之类的，可以看看比如《数据挖掘与R语言》、《机器学习——实用案例解析》，不过我觉得这几本书没上面的那几本好，但是可以大概看看是咋回事，最好还是看看专门的相关书籍，熟悉各种算法和流程，到时候搜索R的package，照着文档和例子搞定，不是特别难。

最后，强烈推荐统计之都、R-bloggers，统计之都以及谢益辉、肖凯、刘思喆等人的博客（自行Google以及到上面的网站找链接），订阅一下，会很有帮助，RStudio是个很棒的IDE，用起来很爽，功能很强大。

变量方差因变量线性语言

# 上一篇：动漫设计用什么电脑

# 下一篇：页面设置a4纸怎么设置