返回
BlueEdge: Edge Computing-Based Framework for Efficient Text Matching and Duplicate Detection
DOI:10.1016/j.array.2026.101224.png)
摘要
En 中文
尽管自然语言处理库和基于云的流水线有所进展,但内存使用、延迟、网络连接和隐私问题仍然使得这些工具难以直接在边缘和移动设备上使用。本文介绍了BlueEdge,一个用于文本归一化和基于名称的重复检测的内存受限字符串匹配系统,并提出了一种包含NLTK(自然语言工具包)预处理、Kivy(Python GUI库)用户交互和Firebase(基于云的数据库)同步的移动-边缘架构。该算法的主要贡献是对Levenshtein距离的优化实现,该实现仅在任意给定时间存储矩阵的两行,将空间复杂度降低至O(min(m, n))。对于所报告的基准测试协议,空间需求通过峰值内存占用进行测量,对于无依赖的核心比较算法,该值低于9 KB。
Keyword:
Edge Computing
Duplicate Detection
Text Matching
Levenshtein Distance
Resource-Constrained Devices
Text Normalization
Record Linkage

