|
|
1
2
卡夫卡不是用来发送文件的,只是相对较小的事件。即使您逐行发送文件,您也需要知道如何将文件放回一起进行处理,因此您可以有效地执行与通过原始TCP套接字传输文件相同的操作。 Kafka的最大默认消息suze是1MB,虽然您可以增加它,但我不建议将它推到两位数MB的大小之上。 How can I send large messages with Kafka (over 15MB)? 如果您真的需要通过kafka获得这样的数据,建议的模式是将大文件放在外部存储器(hdfs、s3等)上,然后将uri放在kafka事件中的文件中,并让消费者处理读取该数据源的问题。 如果这些文件有任何结构(例如页面),那么可以使用spark和定制的hadoop inputformat序列化这些文件,并以这种方式并行处理数据。不过,不一定非要通过卡夫卡。你可以试试apache nifi,我听说它能更好地处理更大的文件(可能不是gb)。 |
|
|
user3692015 · 流处理如何处理历史聚合? 3 年前 |
|
|
data_pikachu · 班级组织。阿帕奇。hadoop。财政司司长。s3a。啊。尝试从Spark在S3存储桶上写入数据时,未找到IAMInstanceCredentialsProvider 4 年前 |
|
|
sharon gur · Kafka spark同步流处理作业 8 年前 |
|
|
vijay · Spark streaming作业日志大小溢出 8 年前 |
|
|
Frank · Spark Streaming kafka偏移量管理 8 年前 |
|
|
a.moussa · 线程“main”java中出现异常。lang.NoClassDefFoundError:org/apache/spark/streaming/StreamingContext 8 年前 |
|
|
maxness · Spark将Kafka输入流另存为Json文件 8 年前 |