写点什么

上帝视角一览大数据开发体系

作者:JAVA旭阳
  • 2022-12-07
    浙江
  • 本文字数:2571 字

    阅读完需:约 8 分钟

前言

不知道大家有没有过在百度搜索旅游的关键字,不久就可能收到机票的推销的经验。如今是大数据的时代,数据的价值越来越重要。数据即资产,想必大家都听说过。最近公司的项目中也用到了一些大数据的技术,本文对大数据相关的知识体系做了一个整体的梳理。

什么是大数据

大数据,你可能就简单理解为数据量大,那是多大才算大数据呢?如果只有数据量大是不是太片面单一了,实际上如果你说是从事大数据开发, 那么起码要满足下面的 5 大特征。


5 大特征

1.数据量大


  • 需要采集的数据量大

  • 需要存储的数据量大

  • 需要计算 de 数据量大

  • 数据总体规模起码要 TB、PB 级别起步


2.数据种类、来源多样化


  • 数据的种类多样,可能是类似 MySQL 一样的结构化数据,也可能是文本的非结构化数据,或者介于二者之间的半结构化数据

  • 数据的格式来源也多样,可以是业务数据、日志文本文件,甚至是图片、视频等。


3.低价值密度


  • 信息海量但是有价值的少,也就是价值密度低

  • 深度复杂的挖掘分析需要机器学习参与


4.速度快


  • 数据增长速度快

  • 获取数据速度快

  • 数据处理速度块


5.数据的质量


  • 数据的准确性要求高

  • 数据的可信赖度

数据分析方向

针对海量数据的分析,针对不同的业务场景,大致可以分为 3 个方向,离线分析,实时分析和预测分析。

离线分析

离线分析,也就是所谓的批处理,主要分析过去的历史数据,可以每周(T+7)或者每天(T+1)的方式分析历史的数据,找出隐藏在数据背后的深层次原因,从而做出调整优化。比如说分析过去一个月的用户操作数据等。


这种分析方式一般数据量非常大,通常采用Hadoop生态技术体系解决,比如HDFSYarnHbase等技术。


实时分析

实时分析,也叫流计算,主要是面向当下,实时处理分析数据,你可以想象成流水一样,源源不断的处理数据,对时效性要求比较高,可到秒级甚至毫秒级。比如说在金融领域中,你发起一笔交易,可以通过实时分析判断当前笔交易是否存在欺诈风险,从而保护资金安全。



目前StormFlinkSparkStreaming 都是比较流行的流式处理框架。

预测分析

预测分析,实际就是通过机器学习的手段,基于历史数据和当下产生的实时数据预测未来发生的事情。更侧重于数学算法的运用,如分类、聚类、关联、预测,但是也离开不了数据,需要通过历史的数据进行训练,得出可预测的模型,比较典型的应用比如说电商领域"猜你喜欢"。


数据分析步骤

我们都知道数据的重要性,那数据分析的整个生命周期是怎么样的呢?什么时候来,要做什么处理,都有什么步骤呢?


  1. 明确分析目的和思路


  • 要弄清楚你的业务场景,找到分析的目的,目的是整个分析流程的起点,需要为数据的收集、处理及分析提供清晰的指引方向。

  • 厘清分析的思路,比如先分析什么,后分析什么,使各分析点之间具有逻辑联系,保证分析维度的完整性,分析结果的有效性以及正确性,需要数据分析方法论进行支撑;


  1. 数据收集


  • 数据从无到有的过程:比如传感器收集气象数据、埋点收集用户行为数据

  • 数据传输搬运的过程:比如采集数据库数据到数据分析平台



  1. 数据预处理


  • 数据预处理需要对收集到的数据进行加工整理,形成适合数据分析的样式,主要包括数据清洗数据转化数据提取数据计算

  • 数据预处理可以保证数据的一致性和有效性,让数据变成干净规整的结构化数据。


  1. 数据分析


  • 用适当的分析方法及分析工具,对处理过的数据进行分析,提取有价值的信息,形成有效结论的过程;

  • 需要掌握各种数据分析方法,还要熟悉数据分析软件的操作;


  1. 数据展现


  • 通过图表、报表等方式形象直观的展示出数据分析的结果,这也叫做数据可视化。


  1. 报告撰写


  • 数据分析报告是对整个数据分析过程的一个总结与呈现

  • 把数据分析的起因、过程、结果及建议完整地呈现出来,供决策者参考


大数据主流技术栈

前面讲解了大数据分析的整个过程,需要涉及到很多步骤,每个步骤都需要一些工具和方法支持,作为开发人员,我们可能更加关注用到的一些主流技术栈,目前最主流的还是基于 Hadoop 生态。



  1. 数据采集和传输层


  • Flume


Flume 一个分布式、可靠的、高可用的用于数据采集、聚合和传输的系统,常用于日志采集系统中。


  • Logstash


ELK 中的一员,也常用于数据采集。


  • Sqoop


Sqoop 主要通过一组命令进行数据导入导出的工具,主要用于 Hadoop(如 HDFS、Hive、HBase)和 RDBMS(如 mysql、oracle)之间的数据导入导出。


  • Kafka/RocketMQ


高性能的的消息队列,主要应用在数据缓冲、异步通信、汇集数据、系统解耦等方面。


  1. 数据存储层


  • HDFS


分布式文件存储系统,HDFS 非常适合大规模数据集上的应用,提供高吞吐量的数据访问,可部署在廉价的机器上。


  • HBase


是一款基于 HDFS 的数据库,是一种 NoSQL 数据库,主要适用于海量明细数据(十亿、百亿)的随机实时查询,如日志明细、交易清单、轨迹行为等。


HBase 可以认为是 HDFS 的一个包装。他的本质是数据存储,是个 NoSql 数据库;HBase 部署于 HDFS 之上,并且克服了 HDFS 不能随机读写的问题。


  • Kudu


介于 HDFS 和 HBase 之间的基于列式存储的分布式数据库。兼具了 HBase 的实时性、HDFS 的高吞吐,以及传统数据库的 sql 支持。


  1. 数据计算与分析层


  • MapReduce


分布式运算程序的编程框架,适用于离线数据处理场景。


  • Yarn


Yarn 是一个资源调度平台,负责为运算程序分配资源和调度,不参与用户程序内部工作。


  • Hive


Hive 是基于 Hadoop 的一个数据仓库工具,可以将结构化的数据文件映射为一张数据库表,并提供 HQL 语句(类 SQL 语言)查询功能,存储依赖于 HDFS。本质上是把好写的 hive 的 sql 转换为复杂难写的 map-reduce 程序。


  • Spark


Spark 是一个快速、通用、可扩展、可容错的、内存迭代式计算的大数据分析引擎。目前生态体系主要包括用于批数据处理的SparkRDDSparkSQL,用于流数据处理的SparkStreaming,用于机器学习的Spark MLLib,用于图计算的Graphx以及用于统计分析的SparkR


  • Flink


Flink 是一个分布式的实时计算引擎,可以对有限数据流和无限数据流进行有状态的计算。


  • Storm


Storm 是一个没有批处理能力的数据流处理计算引擎,是由 Twitter 开源后归于 Apache 管理的分布式实时计算系统。


  • Phoenix


构建在 HBase 之上的一个 SQL 层,能让我们通过标准的 JDBC API 操作 HBase 中的数据。


小结:


大数据生态组件众多,上面只是列出了其中一部分,目前一般会通过 CDH 等平台统一进行安装管理,如下图所示:


总结

本文讲解了从上帝视角看大数据分析,了解了数据分析的方向和步骤,同时整理了目前市面上常见的一些大数据组件,希望对大家入门大数据学习有一个初步的认识。


如果本文对你有帮助的话,请留下一个赞吧

更多技术干活尽在个人公众号——JAVA 旭阳


发布于: 刚刚阅读数: 6
用户头像

JAVA旭阳

关注

欢迎关注个人公众号—— JAVA旭阳 2018-07-18 加入

旭阳,希望自己能像初升的太阳一样,对任何事情充满希望~~

评论

发布
暂无评论
上帝视角一览大数据开发体系_Java_JAVA旭阳_InfoQ写作社区