r语言表示或者用什么符号？

2023-02-24 19:05:01Python019

r语言表示或者用什么符号？,第1张

R是一款统计计算编程语言，你可以在通用公共许可（GPL）规则下从互联网获取它。也就是说，你可以免费获取它、发布它，甚至拿它来卖钱，只要获取者与你有相同的权利，并且可以免费获得源代码。R可以在微软公司的Windows XP以及之后的版本中使用，在UNIX，Linux以及苹果公司的Macintosh OS X系统中也可以使用。

R提供了统计计算以及绘图的环境。事实上，R是一款完整的编程语言，尽管这一点在本书中鲜有提及。本书中，我们主要学习一些基本的概念，并且研究一些有指导性的例子。

R可以在某个统计计算结果的基础上再进行扩展计算。此外，R的数据可视化系统既允许我们使用诸如plot(x,y)这样的简单命令来进行绘图，也提供了对图形输出更好的控制。正因为R是一款编程语言，所以R非常灵活。其他一些统计软件，提供了更好的交互以及菜单表格类的选项接口，但是通常这样用户友好的界面反而会限制使用者进一步探索。尽管一些基本的统计只需要一些固定的计算过程，但是对于一个稍微复杂的数据进行建模，就需要一些特别设定的计算，而R的灵活性在这时就会成为显著的优势。

R之所以被称为“R”，其实是一个互联网式的幽默。也许你知道C语言（C语言之所以被称为C也是有一段故事的）。受到这种命名方式的启发，Bechker和Chambers在20世纪80年代早期为他们新发明的语言起名为S。这种语言后来被发展成一个商用的版本S-PLUS，并被全世界各地的统计学家广为使用。新西兰奥克兰大学的Ross Ihaka和Robert Gentleman为了教学目的，写了一个S的简化版。这两位先生的名字都以R开头，好吧，还有什么理由拒绝以R作为这个语言的名字呢？

在1995年，Martin Maechler劝说Ross和Robert在GPL规则下公开他们R语言的源代码。这与当时风行一时的Linux系统开源运动不谋而合。R很快给那些需要在Linux上进行统计计算的人带去了福音。很快，交流故障与讨论R发展的邮件列表就被建立起来。

初始步骤

开始运行R是很简单的，但方法取决于你的操作平台。你可以从系统菜单启动，双击图标或在系统命令行中输入命令"R"。这将产生一个控制台窗口，或在当前终端窗口启动一个交互式程序。在这两种情形下，R都通过问答模式工作，即你输入命令行并按下Enter键，然后程序运行，输出相关结果，继续要求更多的输入。当R在准备输入状态时，它显示的提示符是一个">"符号。R也可以作为纯文本应用程序或批处理模式来应用，但针对本章的目的，我将假设你处于一个图形工作站上。

R语言中存在一些空值（null-able values），当我们进行数据分析时，理解这些值是非常重要的。

通常来说，R语言中存在：

这四种数据类型在R中都有相应的函数用以判断。

NA即Not available，是一个 长度为1的逻辑常数 ，通常代表缺失值。NA可以被强制转换为任意其他数据类型的向量。

可以采用is.na()进行判断。另外，NA和“NA”不可以互换。

NULL是一个 对象（object） ，当 表达式或函数产生无定义的值 或者 导入数据类型未知的数据 时就会返回NULL。

可以采用is.null()进行判断。

NaN即Not A Number，是一个 长度为1的逻辑值向量 。

可以采用is.nan()进行判断。另外，我们可以采用is.finite()或is.infinite()函数来判断元素是有限的还是无限的，而对NaN进行判断返回的结果都是False。

Inf即Infinity无穷大，通常代表一个很大的数或以0为除数的运算结果，Inf说明数据并没有缺失（NA）。

可以采用is.finite()或is.finite()进行判断。

理解完四种类型数值以后，我们来看看该采取什么方法来处理最最常见的缺失值NA。

小白学统计在推文《有缺失值怎么办？系列之二：如何处理缺失值》里说“ 处理缺失值最好的方式是什么？答案是：没有最好的方式。或者说，最好的方式只有一个，预防缺失，尽量不要缺失。 ”

在缺失数很少且数据量很大的时候，直接删除法的效率很高，而且通常对结果的影响不会太大。

如数据框df共有1000行数据，有10行包含NA，不妨直接采用函数na.omit()来去掉带有NA的行，也可以使用tidyr包的drop_na()函数来指定去除哪一列的NA。

用其他数值填充数据框中的缺失值NA。

使用tidyr包的replace_na()函数。

使用tidyr包的fill()函数将上/下一行的数值填充至选定列中NA。

除此之外，类似原理的填充法还有均值填充法（用该变量的其余数值的均值来填充）、LOCF（last observation carried forward）、BOCF（baseline observation carried forward）、WOCF（worst observation carried forward）等。

当分类自变量出现NA时，把缺失值单独作为新的一类。

在性别中，只有男和女两类，虚拟变量的话以女性为0，男性为1。如果出现了缺失值，可以把缺失值赋值为2，单独作为一类。由于将缺失值赋值，在统计时就不会把它当做缺失值删除，避免了由于这一个变量缺失而导致整个观测值被删除的情况。

假定有身高和体重两个变量，要填补体重的缺失值，我们可以把体重作为因变量，建立体重对身高的回归方程，然后根据身高的非缺失值，预测体重的缺失值。

参考资料：

缺失是一个语言函数数据

# 上一篇：Go语言文件操作

# 下一篇：python灰帽子讲的什么