基于R统计分析—探索性数据分析

发布时间：2020年09月29日 03:12:37 来源：点击量：529

【摘要】基于R统计分析—探索性数据分析数据的统计分析分为描述性统计分析和统计推断两部分, 前者又称为探索性统计分析, 它是通过绘制统计图形、

基于R统计分析—探索性数据分析

数据的统计分析分为描述性统计分析和统计推断两部分, 前者又称为探索性统计分析, 它是通过绘制统计图形、编制统计表格、计算统计量等方法来探索数据的主要分布特征, 揭示其中存在的规律. 探索性数据分析是进行后期统计推断的基础.
本文着重于数据集的数字化探索。程序包DAAG中有内嵌数据集“possum”，它包括了从维多利亚南部到皇后区的七个地区的104只负鼠(possum)的年龄、尾巴的长度、总长度等14个特征值，选用这套数据集进行分析。

#数据概况
library(DAAG)
data(possum)
nrow(possum) #显示数据集的行、列、维度
ncol(possum)
dim(possum)
head(possum) #显示数据集的前若干条
attributes(possum) #获取数据集属性列表
str(possum) #获取数据样本数、变量数、各变量的类型及取值情况
summary(possum) #获取数据集变量概况
#变量详情
library(Hmisc)
describe(possum[,1:3])

备注：对于每一变量，给出了样本总个数(n)，缺失样本数(missing)、水平个数(unique),并列出每一水平的取值、频数和频率。这里需要说明的是，对于case变量，输出结果给出了频率最低和最高的5个水平值，在数据分布有偏情况下，这些水平值很有可能成为异常值。

library(fBasics) #用于做时间序列统计分析包，也可用于一般数据集
basicStats(possum$case)

备注：输出结果包括前面给出的样本数(nobs)，缺失值（NAs），最小值最大值，同时也有特有的指标，变量取值之和（Sum）,标准误差均值（SE Mean）、95%的置信水平上下限、方差、标准误差，以及两个分布指标偏度和峰度。

#分布指标（这里主要介绍两个重要分布指标——偏度和峰度，一些常见的概率分布倾向于用直方图等可视化方式来表示）
library(timeDate)
skewness(possum[,6:7]) #计算这两列变量的偏度

kurtosis(possum[,6:7]) #计算这两列变量的峰度

备注：偏度用来衡量数据的堆成程度，以正太分布为基准。当服从正太分布时，偏度为0；当介于[-1,1]之间时，说明数据分布的对称性较强；当绝对值大于1时，则认为数据存在显著偏倚，为正时有右偏的趋势，反之左偏。
峰度用来衡量数据分布形态的陡缓程度，以正太分布为基准。当值为0时，说明与正太分布相同，即标准峰度；当峰度大于0时，则表示该数据分布与正太分布相比较为陡峭，为尖顶峰度；当峰度小于0时，则表示该数据分布与正太分布相比较为平坦，为平顶峰度。

#缺失值
library(mice)
md.pattern(possum) #显示数据集中缺失值分布的情况

备注：最左边一列：101表示无缺失值样本总数，2表示age缺失2个样本，1表示footlgth缺失1个样本；最下边一行对应每个属性缺失的样本个数，其中最后一个3表示总缺失值个数；最右边一列表示对应行几个变量发生缺失的情况。

#相关性
cor(possum$case,possum$site)
var=c(5:9)
cor_matrix=cor(possum[var],use="pairwise") #对5个变量两两计算相关系数
library(ellipse)#可视化相关图
plotcorr(cor_matrix,col=rep(c("white","black"),5))

备注：圆形的宽窄表示相关性的高低，两变量对应的圆形越窄，表明其相关性越高。

分享到：编辑：wangmin

上一篇：excel表格基本操作之从零开始学习下一篇：降低数据中心的复杂性运用基于策略的管理

VBA实战速成：从零到一的突破

数据分析师 62次课共11小时

吴开斌