spring spring boot 集成spark-streaming-kafka

主要思路:SparkContext由spring容器管理,在spring容器启动完毕后,执行spark-streaming-kafka,获取数据并处理。 1.spring容器中初始化SparkContext,代码片段如下: @Bean @ConditionalO...

2022-12-10 485 阅读

java java spark 消费kafka_spark2.3 消费kafka数据

官网介绍 http://spark.apache.org/docs/2.3.0/streaming-kafka-0-10-integration.html#creating-a-direct-stream   案例pom.xml依赖 <dependency> <groupId>o...

2022-12-10 363 阅读

java java连接kafka测试

①进入到kafka文件夹中修改配置文件:vim config/server.properties         ②启动zookeeper: bin/zookeeper-server-start.sh config/zookeeper.properties 端口2181是Z...

2022-12-10 873 阅读

java Kafka 使用Java实现数据的生产和消费demo

前言 在上一篇中讲述如何搭建kafka集群,本篇则讲述如何简单的使用 kafka 。不过在使用kafka的时候,还是应该简单的了解下kafka。 Kafka的介绍 Kafka是一种高吞吐量的分布式发布订阅消息系...

2022-12-10 293 阅读

kafka Kafka的消息是如何被消费的?

Kafka的消息消费是以消费的group为单位; 同属一个group中的多个consumer分别消费topic的不同partition; 同组内consumer的变化, partition变化, coordinator的变化都会引发balance; 消费的...

2022-12-10 276 阅读

java java 管理kafka偏移量_Kafka偏移量(Offset)管理

1.定义 Kafka中的每个partition都由一系列有序的、不可变的消息组成,这些消息被连续的追加到partition中。partition中的每个消息都有一个连续的序号,用于partition唯一标识一条消息。 Offs...

2022-12-10 580 阅读

kafka spark streaming拉取kafka数据, 结合sparkSql dataframe hive存储计算,输出到mysql

spark streaming拉取kafka数据, 结合sparkSql dataframe hive存储计算,输出到mysql. 数据清洗过程比较复杂,没办法,上游给的屡一样的数据,正则去解析并全量按时间取最新一条去重。 每天k...

2022-12-10 349 阅读

kafka sparkstreaming 实时读取kafka写入hive优化(高流量)

背景: kafka流量在800M/s,前任留下的程序大量数据丢失,且逻辑生成复杂,查询hive直接奔溃,优化从两方面,程序优化及小文件合并(生成结果产生大量小文件) 程序直接上代码,啥也不说了 程...

2022-12-10 307 阅读

kafka sparkstreaming kafka(local方式)--自测通过

    <dependency> <groupId>org.apache.kafka</groupId> <artifactId>kafka_2.12</artifactId> <version>0.11.0.0</version&g...

2022-12-10 229 阅读