阅读背景:

Spark Streaming管理Kafka偏移量

来源:互联网 

前言

为了让Spark Streaming消费kafka的数据不丢数据,可以创建Kafka Direct DStream,由Spark Streaming自己管理offset,并不是存到zookeeper。启用S​​park Streaming的 checkpoints是存储偏移量的最简单方法,因为它可以在Spark的框架内轻松获得。 checkpoints将应用程序的状态保存到HDFS,以便在故障时可以恢复。如果发生故障,Spark Streaming应用程序可以从checkpoints偏移范围读取消息。为了让Spark Streaming消费kafka的数据不丢数据,可以创建




你的当前访问异常,请进行认证后继续阅读剩余内容。

分享到: