返回
摘要
En 中文
由于实时网络洞察的潜力,当前的流式分析平台正越来越多地应用于通信网络,其中洞察的影响已超越情感和趋势分析,扩展至实时检测安全攻击和预测网络状态(即网络是否正转向中断)。现有的流式分析平台基于以下假设运行:到达的数据流量为千字节级别,且以极高频率产生。然而,通信网络,尤其是电信网络,挑战了这一假设,因为这些网络中部分到达的数据流量达到吉字节级别,但产生频率仅为中低。此外,这些大型数据集可能需要完整摄入才能实现实时网络洞察。我们的研究兴趣在于将当前的流式分析平台(由先进软件组件Kafka、Spark、HDFS、ElasticSearch构建)置于此类通信网络中的流量密度条件下。我们发现,对如此大规模数据集的过滤,最佳方式是在共同的上游点进行,而非推送到并在下游组件中重复执行。为证明此类方法的优越性,我们修改了Apache Kafka,使其执行有限的原生数据转换和过滤,从而免除下游Spark应用程序的此类任务。我们的方法在性能上优于四种主流分析管道架构,且与标准Kafka相比开销可忽略不计。(我们对Apache Kafka的修改已公开,地址为https://github.com/Esquive/queryable-kafka.git)
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
暂无期刊信息
机构
暂无机构信息
引用论文
暂无论文信息

