返回
An Efficient Computing and Communication Framework for Large-Scale Data Processing Cluster
DOI:10.1109/ton.2026.3711403.png)
摘要
En 中文
大数据处理集群因未高效利用RDMA特性而面临作业完成时间延长的问题。我们从一个拥有众多服务器节点并负责处理大规模数据作业的大型集群的生产数据中发现,当前RDMA技术的使用导致部分作业完成时间远超正常水平,少数作业的完成时间甚至超过标准时间的两倍。本文介绍了Turbo的设计与实现,这是一个为大规模数据处理集群定制的高性能、可扩展通信框架。Turbo的核心策略在于采用动态块级流式传输系统和非阻塞通信中间件,旨在提升网络吞吐量和系统可扩展性。此外,Turbo通过引入以TCP作为备用选项的外部洗牌服务,并利用网络接口卡(NICs)维护元数据管理信息,来保持高系统可靠性。我们将Turbo集成到Apache Spark中,并在小规模测试环境和包含数百个服务器节点的大型集群中进行了评估。小规模测试床的发现表明,Turbo将网络吞吐量提升了15.1%,并保持了高系统可靠性。此外,大规模生产数据表明,与当前RDMA解决方案相比,Turbo能够将作业完成时间减少23.9%,并将作业完成率提高2.03倍。另外,在大规模测试中,我们还发现Turbo提高了集群的计算效率,并节省了约24.3%的CPU利用率。
Keyword:
Load balancing
spark RDMA
data processing
communication acceleration
期刊
I
IF:
3.6
论文数:
4.4K
被引数:
9.5K

