Kafka实战－Flume到Kafka

日期：2022-06-26 栏目：程序人生浏览：次

　　下面开始今天的分享内容。

2.数据来源

　　Kafka生产的数据，是由Flume的Sink提供的，这里我们需要用到Flume集群，通过Flume集群将Agent的日志收集分发到Kafka（供实时计算处理）和HDFS（离线计算处理）。关于Flume集群的Agent部署，这里就不多做赘述了，不清楚的同学可以参考《高可用Hadoop平台－Flume NG实战图解篇》一文中的介绍，下面给大家介绍数据来源的流程图，如下图所示：

Kafka实战－Flume到Kafka

　　这里，我们使用Flume作为日志收集系统，将收集到的数据输送到Kafka中间件，以供Storm去实时消费计算，整个流程从各个Web节点上，通过Flume的Agent代理收集日志，然后汇总到Flume集群，在由Flume的Sink将日志输送到Kafka集群，完成数据的生产流程。

3.Flume到Kafka

　　从图，我们已经清楚了数据生产的流程，下面我们来看看如何实现Flume到Kafka的输送过程，下面我用一个简要的图来说明，如下图所示：

Kafka实战－Flume到Kafka

　　这个表达了从Flume到Kafka的输送工程，下面我们来看看如何实现这部分。

　　首先，在我们完成这部分流程时，需要我们将Flume集群和Kafka集群都部署完成，在完成部署相关集群后，我们来配置Flume的Sink数据流向，配置信息如下所示：

首先是配置spooldir方式，内容如下所示：

producer.sources.s.type = spooldir producer.sources.s.spoolDir = /home/hadoop/dir/logdfs

转载注明出处：https://www.heiqu.com/zzsjjx.html

Kafka实战－Flume到Kafka

相关推荐