|
|
1
1
显然,您可以使用正则表达式模式来消费来自不同kafka主题的数据。 假设你有主题名称,如“top-ingesion1”、“top-iangesion2”,那么你可以创建一个正则表达式模式,用于消费所有以“*摄入”结尾的主题的数据。 一旦以正则表达式模式的格式创建了新主题,spark将自动开始从新创建的主题流式传输数据。 参考: [https://spark.apache.org/docs/latest/structured-streaming-kafka-integration.html#consumer-缓存] 您可以使用此参数指定缓存超时。 “火花。卡夫卡。消费者。缓存。超时”。 来自spark文档:
假设你有多个接收器,在那里你从kafka读取数据,并将其写入两个不同的位置,如hdfs和hbase,那么你可以将应用程序逻辑分支到两个writeStreams中。 如果接收器(Greenplum)支持批处理操作模式,那么您可以查看spark结构化流中的forEachBatch()函数。它将允许我们为这两个操作重用相同的batchDF。 参考: [https://spark.apache.org/docs/latest/structured-streaming-kafka-integration.html#consumer-缓存] |