
原标题: 宣讲家文明饱览丨计算与大数据
大约五六年前,我听到的陈述绝大部分都是归于“大数据给咱们咱们带来的机会与应战”这一类的。但最近一些年,许多问题开端连续落地了,感觉能够听到一些比较有意思的大数据使用。
我来之前,主办方让我给咱们介绍一下计算和大数据。那么该介绍些什么呢?那就从入门的当地开端,尽量让咱们能听懂。我大学选专业的时分,不知道计算是什么,认为计算便是加加减减。现在开端对计算有从头的知道。所以我再给咱们介绍一下,怎样知道计算?怎样去知道这些数据?怎样去剖析这些数据?一些计算数据是怎样误导咱们的?这儿面有许多误区。别的,一些计算数据为何会与咱们的知识或许形象有误差?最终给咱们看看几个简略的使用。
一、怎样知道数据?有哪些数据类型?
什么是数据?在咱们看来,声响、文字、图片、视频音频、文本等,这些都能够算作咱们剖析的数据。比方之前网上有一个很有意思的游戏,你在网上拍一张图片,然后上传,由此能够判别你的年纪是多少。
数据一般长什么样?咱们假定猪八戒、唐僧、孙悟空、沙和尚师徒四人一同去考试,考试有准考证号码或身份证号码,身份证号码的前面六位一般表明你的区域信息。第二个信息是你的姓名。还有一个性别,以及你是哪个年级的。最终,现在考试成果咱们都要求有ABCD四个等级,然后这个成果要转换成基点,以及你的原始成果是多少、考试时长。这个表格(如上图)特别简略,可是却简直包括了咱们一切要触摸的数据类型。从以上表格能够精确的看出,猪八戒考试得了100分,孙悟空坐不住,12分钟就交卷了。
咱们常常会触摸的数据有哪些呢?榜首类叫名义变量。什么是名义变量?比方性别、年纪这一类的数字,它没有巨细的联系,仅仅一个代码。例如我用“1”来表明男,用“2”来表明女,用身份证号码的前面六位表明你的出生地信息。这些数字的巨细,没有凹凸,也没有先后,是没有一点意义的,仅仅一个记号。上图表格中,咱们正真看到的榜首类数据便是名义变量。
第二类是次第变量。次第变量是跟次第有关的数据,它有许多用处。每一个变量的巨细,是表明先后次第的,而不是倍数联系。比方1号店做的一个简略的大数据剖析,计算上海市高校购买零食的状况,然后看看哪一所大学买零食最多。这是很简单计算的,咱们只需看看邮递地址,就能够知道哪个当地“吃货”最多。但这个数据是按肯定数量计算的,比方上海大学,它在上海有特别多校区,自身人数上的规划就十分大。所以这并不是上海大学每个同学都好吃,而是它的校园自身的肯定量大。
再比方上面这个比方,颜值最高大学。这也是1号店做的计算,怎样计算的呢?看哪一个大学,买化妆品买得最多。化妆品买得最多的,颜值最高。
第三个,哪个高校潮人最多。怎样衡量是不是潮人?这也满是1号店的数据。看潮人就看买单反,只看这一个目标,这个目标纷歧定精确。可是许多大数据现在都停留在文娱阶段。当然,文娱之外,还有真正跟科学有关的一些问题。
他们计算了许多目标,其间一个叫暖男最多的大学。这便是计算男性给女人买用品。
这些排行榜谁排榜首,谁排第二,有一个凹凸、先后次第。但不是说排第二的便是排榜首的两倍。咱们回头看之前的成果表。成果表分了ABCD四段,A段的学生排榜首段,B段的学生就排第二段,C段的学生就排第三段。所以成果表中也有第二类数据。
第三类是定距变量,也称间隔变量。便是说2是比1更有价值百科的,它的间隔为1,比方你是2012年入学的,就会比2013年入学的早一年。它就不只仅有先后次第,并且这个间隔巨细是有意义的。2013年入学的比2012年入学的晚一年,2016年入学的就会比2013年入学的要晚三年,这个间隔自身是有意义的,它不像之前的ABCD,B减A是没有一点意义的。但现在减了今后是有意义的。第三类数据定距变量在之前那表中也是有的。
第四类是定比变量,也称“定比规范”或“比率规范”。这是咱们最常用的一类数据。数据有先后,有凹凸,加减乘除都是有意义的。2就比1要多1,3就比1要多2,2便是比1要多1倍的,这个数据是能够做加减乘除运算的,并且数据之间的间隔是有意义的,有肯定的零点。比方孙悟空做题花了12分钟(0.2个小时),唐僧做了2个小时,那么差1.8个小时。1.8个小时便是0.2个小时的9倍。这中心的间隔是有详细意义的。这是咱们最常用的一类数据,咱们所说的数据,绝大部分时分指的是这一类。以下是咱们常用的四类数据:
名义:男女、色彩
次第:名次、等级(军衔)
间隔:时刻
比率:间隔、体重
榜首类数据,名义变量,数据巨细仅仅一个符号,没有一点的巨细意义。
第二类数据,数据巨细有先后的意义,可是数据差之间是没有详细意义的。比方A段或许比B高一段,可是假如B减A不知道等于多少,那这也没什么实践意义的。
第三类数据,间隔数据,这样一个时刻段数据的间隔就有意义了,2013级的就比2012级的要晚一年入学。这个间隔是有意义的。
第四类数据是咱们最常用的,比方体重多少,间隔多少。依据不同分类办法、规范,你会分红许多纷歧样的数据。
数据还能够按来历来分,比方现有的数据、猜测的数据以及国家计算局搜集得各种历史数据等。
关于大数据,咱们还常常会在书上看到这样一种说法,说大数据便是整体,咱们曾经剖析的数据便是样本,其实这个说法不是很精确。大数据也纷歧定是全样本剖析的,要做到全样本剖析是十分十分困难的。
有一些数据便是一个常数,比方π、光速,这是一向不动的,这一类数据是常量。那么,变量是哪些呢?比方你的年纪是多少,这个数据会变,但它不会随机变,本年你是10岁,下一年就会是11岁。咱们最关怀的是最终这一类:随机变量,这一类其实是咱们常常会碰到的,所以这儿面问题会特别多。比方你猜测一下明日来听陈述的人会有多少人,这只能估量一个大约规模,详细到多少人,你是不知道的。再比方你知道你下一年大约会赚多少钱,可是你不能精确估量你下一年能赚多少钱。
咱们也常常会举一个比方,说本科生不要谈恋爱,由于谈恋爱成功的份额很低。计算其实关怀的便是这类不确定性的问题,纷歧定是归于加加减减的问题。
作者:朱利平 中国人民大学计算与大数据研究院副院长、博士生导师
本文节选自宣讲家网独家文稿《朱利平:计算与大数据》
全文链接:http:///2019/1118/1067259.shtml
责任编辑:
















