2 回答
已采纳
皮县豆福脑
TA贡献18条经验 获得超4个赞
大数据的应用场景特征:
1. 数据量大,TB->PB
2. 数据类型繁多,结构化、非结构化文本、日志、视频、图片、地理位置等;
3. 商业价值高,但是这种价值需要在海量数据之上,通过数据分析与机器学习更快速的挖掘出来;
4. 处理时效性高,海量数据的处理需求不再局限在离线计算当中。
Hadoop作为大数据框架被广泛使用,Hadoop生态圈:
文件存储:Hadoop HDFS、Tachyon、KFS
离线计算:Hadoop MapReduce、Spark
流式、实时计算:Storm、Spark Streaming、S4、Heron
K-V、NOSQL数据库:HBase、Redis、MongoDB
资源管理:YARN、Mesos
日志收集:Flume、Scribe、Logstash、Kibana
消息系统:Kafka、StormMQ、ZeroMQ、RabbitMQ
查询分析:Hive、Impala、Pig、Presto、Phoenix、SparkSQL、Drill、Flink、Kylin、Druid
分布式协调服务:Zookeeper
集群管理与监控:Ambari、Ganglia、Nagios、Cloudera Manager
数据挖掘、机器学习:Mahout、Spark MLLib
数据同步:Sqoop
任务调度:Oozie
这么多技术,取决于自己喜欢研究哪个方向,自己决定吧。
- 2 回答
- 0 关注
- 1334 浏览
添加回答
举报
0/150
提交
取消