什么是大数据什么是大数据技术(什么是大数据史上最全大数据理论解析)
时间:2023-09-09 11:11:24 整理: • 5人看过
不谈论大数据,把诗都看完也没用。在大数据、云计算、移动互联网、物联网、人工智能大行其道的当下,大街小巷最常听到的名词就是大数据,但你真的了解大数据吗?大数据到底是什么?如果此时你脑海中只有一个答案,请耐心看完这篇文章。我会用一张技能图谱,两个基本条件,三个工作方向,四个基本特征,五个里程碑,六个工作环节,以及大数据时代需要的思维方式,让你在别人面前谈大数据。
大数据技能图谱两个基础条件
从网购到娱乐,从推荐系统到短视频,大数据系统影响着我们生活的方方面面。大数据系统的广泛应用主要得益于以下两个方面。
(1)底层硬件支持
这方面我想80后/90后会有特别深刻的感受。对比十年前我们的电脑和手机的性能、网络带宽和流量,近年来存储设备、计算性能和网络带宽都在飞速发展,为大数据的运算处理和大数据集群的构建提供了强有力的硬件支持。
(2)数据生产模式
随着互联网、手机、电脑等设备的普及,越来越多的人成为了内容生产者,也就是我们现在所说的自媒体。微信微信官方账号、今日头条,以及如今处于鼎盛时期的Tik Tok和Aauto Quicker,都是依靠人自发的制作和上传内容。在这些平台上,每天发布的内容量要以千万甚至十亿计算。除了这些主观形式的数据生成,我们生活中还有很多被动形式的数据生成:比如交通路口的摄像头,各种人脸识别,打卡系统等。这些数据的产生是无止境的,所以每天都会产生和存储大量的数据。
三个就业方向(1)大数据架构的方向
大数据架构方向涉及到一些偏向大数据底层和大数据工具的工作。这个方向的工作更注重:
Hadoop、Spark、Flink等大数据框架的实现原理、部署、优化、稳定性;
【/h/】对架构集成、数据流、数据存储有深刻理解,并能流畅应用;
熟悉如何结合各种相关工具实现更高的效率,更符合公司整体的业务场景。
想往这个方向努力,需要具备以下技能。
大数据框架:Hadoop、Spark、Flink、高可用、高并发、并行计算等。
数据存储:Hive、HDFS、Cassandra、ClickHouse、Redis、MySQL、MongoDB等。
数据流:Kafka,RocketMQ,Flume等。
(2)大数据分析的方向
这里说的大数据分析方向是广义的大数据分析。这个方向包括各种算法工程师和数据分析师。他们一方面要精通我们公司的业务,另一方面要有很好的数学知识,能够利用数据建立有针对性的数据指标,对数据进行统计分析,通过各种数据挖掘算法探索数据之间的规律,对业务进行预测和判断。
想往这个方向努力,需要具备以下技能。
数据分析:ETL、SQL、Python、统计学、概率论等。
数据挖掘:算法、机器学习、深度学习、聚类、分类、协同过滤等。
(3)大数据的发展方向
大数据开发是大数据在公司内得以打通和实施的桥梁和纽带。爬虫系统、服务器端开发、数据库开发、可视化平台建设等数据处理环节都离不开大数据开发。大数据开发需要两种能力:
了解如何使用大数据的各种工具;
需要良好的编码技能。
这个方向你需要具备这些技术:数据仓库、推荐引擎、Java、Go、爬虫、实时、分布式等等。
当然,除了以上三大方向,整个互联网大数据体系还有很多细分方向,甚至每个关键词都可以认为是一个方向。随着大数据的发展,我认为未来会有越来越多的工作等着我们。
四个基本特点如果你在网上搜索大数据,可能会有一千个专家的一千个定义。大数据的4V特性甚至有5V特性的观点是最普遍最普遍的特性,就是体量、种类、速度、数据价值。
(1)大量的数据
这个特征是最明显的,也是最基本的特征。两个基本条件章节提到,硬件的发展和数据生产方式的改变,使得数据量迅速膨胀。
(2)种类繁多。
如今的数据已经不再局限于数字。你写的一段话,拍的一张照片,录的一段音频或视频,都是大数据的组成部分。这些主要来自我们的视觉和听觉。在不久的将来,我们的触觉、味觉、嗅觉等数据也将进入机器采集的范畴,从而形成一个完整的数据采集系统。
(3)高速公路
在大数据的背景下,所有的环节都变得更快了。这里的高速不仅指数据的生产速度,还包括数据的交换速度和处理速度。比如你在JD.COM商城浏览商品,每一次点击都会以毫秒级的延迟传到服务器,服务器集群会根据你的动作快速为你推荐新的商品,下一秒就会显示在你的浏览内容中。显然,如果这个过程太慢,你可能在后台的数据计算完成之前就已经关掉了JD.COM,去了淘宝。那岂不是会流失客户?所以,高速也是大数据系统一直执着追求的目标。
(4)数据值
我们有大量的数据,我们必须期待这些数据能给我们带来一些价值。显然,大数据是有价值的,但是大数据的价值有一个特点——价值密度低。
比如危险品车间的监控摄像头24小时连续记录并回传数据,但这些数据通常是不变的。日复一日的记录,每隔一段时间就需要删除,以腾出存储空间空。出现异常时,比如视频中发现的高温点,可能是车间有火焰。此时需要立即调用消防系统灭火,防止危险发生。像这样有价值的数据,可能只是摄像头记录下来的微小片段,所以数据的价值密度较低。
以上是大数据的一些重要特征。换句话说,符合这些特征的数据基本可以认为是“大数据”。
五大发展里程碑萌芽:1980年,大数据这个词是阿尔文·托夫勒在他的新书《第三次浪潮》中提出的。不仅如此,他还声称大数据是第三次浪潮的华彩乐章,这就是大数据一词的由来。阿尔文·托夫勒(Alvin toffler)是著名的未来学家,他成功预测了大数据的爆发。
成长期:2008年9月,《自然》杂志还刊登了一篇封面专栏,名为《大数据》。标志着大数据的概念已经成为举世公认的事实。在这个阶段,大数据正式诞生。在中国的这段时间,以腾讯、网易、新浪、搜狐、百度为代表的主流互联网公司,依靠社交、搜索、门户等产品迅速崛起。
2004年左右,Google发表了三篇论文,也就是我们常说的大数据三驾马车:
分布式文件系统GFS,解决了数据的底层存储问题;
MapReduce,大数据分布式计算框架,解决数据处理和运算问题;
NoSQL数据库系统BigTable解决了数据的有序组织问题。
成熟:一个叫DougCutting的码农开了一家小公司,想做一个超越Google搜索的开源搜索引擎,虽然Google搜索在当时基本上是一家独大的状态。他首先开发了一个名为Nutch的项目,但是随着Google发表的troika论文,他将目标转向了实现GFS和MapReduce,并试图将其集成到他的Nutch项目中。后来这个模块被雅虎拿走了,于是Doug Cutting带着他的项目加入了雅虎,拿着他儿子的一个大象玩具给这个项目命名为Hadoop。
高潮期:2008年以后,随着网络、存储、计算等硬件的成熟;智能手机成为移动服务的标准;Hadoop项目不断成熟。大量依赖大数据的个性化app在这一阶段如雨后春笋般出现,并迅速成长。社交网络的脸书,云服务的亚马逊,内容服务的今日头条等。都是这段时间发展起来的,赚了不少钱。
爆发:2017年以来,大数据基本渗透到人们生活的方方面面。例如:
无处不在的交通违章监控;疫情下的卫生法规。
这些都是大数据的产物。
与此同时,优秀的互联网公司已经构建了相对完善的大数据架构,并在各自的业务中进行应用。各种新的数据库、计算引擎和数据流框架不断涌现,并不断提出新的需求。随着互联网的成熟和发展,这充分说明了技术对于大数据产业发展的重要性。随着人工智能、云计算、区块链等新技术与大数据的融合,大数据将释放更多的可能性,迎来全方位的爆发式增长。
六个工作环节在实践中,大数据系统包括以下几个环节,解决什么问题。
(1)数据收集
各种数据生产方式都需要我们配备一套完整的数据收集方案。比如,你要在App上收集用户行为信息,就需要掩埋各种数据。
(2)数据存储
虽然存储的硬件成本降低了,但毕竟还是有成本的,数据也不能乱堆在存储设备上,所以需要精心设计相应的数据库和文件存储方案来支持这种巨量的数据访问。
(3)数据的计算
目前主流是批处理和流处理,针对这些模式开发了很多计算框架,比如目前广泛使用的Spark和Flink。
(4)数据挖掘和分析
针对大量的数据和低密度的值,我们期望用一些巧妙的方案找到有用的信息甚至结论,于是各种算法和工具层出不穷。
(5)数据的应用
从数据中挖掘出的有价值的信息正在我们身边发挥着巨大的经济价值。内容推荐、天气预测甚至疫情控制都是在大数据的指导下进行的。
(6)数据安全
大数据价值巨大,一旦泄露,就会成为不法分子损害我们权益的帮手。因此,如何保证数据安全也是一个重要的问题。
大数据时代的思维方式大数据时代,有哪些思维方式可以帮助我们快速投入工作?
全面思考
与总体思维相对应的是抽样思维,长期以来,抽样思维在很多行业和实验中发挥了非常重要的作用。在数据获取和处理困难的情况下,采样思维是一种极好的权宜之计。
然而,在大数据场景下,数据采集变得极其便捷,数据存储不再昂贵,各种硬件的性能不断提升,数据的计算速度也越来越快。特别是很多优秀的R&D机构都推出了强大的大数据架构解决方案,如Hadoop、Spark、Flink等。,进一步降低了全尺度处理的成本,使全尺度数据分析成为现实。
容错思维
在总思维的基础上,第二个重要的思维是容错。
我们生活的世界是复杂的,不确定性让我们的世界充满了各种各样的异常、偏差和错误,所以我们收集的总数据自然存在这些问题,比如数据不完整、错误、收集设备不足、对非结构化数据的认知不同。过去我们在数据处理上往往追求精益求精,希望用严格的数据筛选策略和足够复杂的计算逻辑得到完美的结果。但这并不符合实际情况,极度的复杂也导致了泛化性能差。测试阶段的优秀结果在实际生产环境中往往是不可接受的。
任何模型的准确率都不可能达到100%。在大数据的体系下,更应该注重效率的提升。在这样的前提下,我们应该容忍那些固有的错误,甚至是错误。
相关思考
因为大数据数量庞大,而且存在各种各样的错误,甚至是差错,数据之间的关系比较复杂。通过这些数据,我们会发现它包含了各种各样的奇怪的知识,属于“事实”而非“因果”比如当某个地区在百度上搜索“感冒”的人数超过平时的人数时,你可能会从数据中推断出这里有很多人感冒了,做出一些商业决策,比如卖感冒药,但是你很难从这个数据中搞清楚他们为什么感冒了。因为感冒的原因有很多。
在大数据的背景下,我们不再追求难以捉摸的因果关系,而是转向对相关关系的探索。通过相关性的分析,我们可以知道:
广东人比东北人更喜欢洗澡;
香山每年的交通高峰是10月中旬到11月中旬;
美国大选,谁在义乌印的国旗多,谁就当选。
,