返回
Representative Time Series Discovery for Data Exploration
DOI:10.14778/3712221.3712252.png)
摘要
En 中文
在本工作中,我们解决了在探索性数据挖掘中发现代表性时间序列的关键任务。我们将一种代表性时间序列定义为相似度受限的代表性时间序列,即当其他时间序列与其相似度满足用户定义的阈值时,该时间序列能够代表这些序列。基于此定义,我们研究了寻找能代表数据集中所有时间序列指定比例的最小时间序列集的问题。每个相似度受限的代表性时间序列的代表性可控,并由指定的相似度水平决定,且仅识别出集体代表指定比例整体集所需的最小代表数量。以高效且有效的方式在大规模数据中发现代表性时间序列,有助于探索性数据分析与摘要生成,服务于跨领域的数据探索应用。我们首先证明了该问题的NP难度,并提出了一系列具有理论保证的近似方法,将其称为非学习型方法。尽管这些方法有效,但通常在运行时间或内存效率上表现突出,而非两者兼顾。为克服这些限制,我们进一步提出了一种学习型方法,同时优化时间和内存效率。该方法利用新颖的数据准备和训练策略,以低内存使用量和计算开销,实现对用户指定代表性要求的适应性。我们在四个真实数据集上进行了广泛实验,结果表明,我们的学习型方法在有效性(产生相似数量的代表性时间序列)方面与非学习型方法具有高度竞争力,同时实现了显著更高的效率(最高21倍加速)和更低的内存消耗(最高节省101倍内存空间)。
Keyword:
LERNAEAN HYDRA
SEARCH
期刊
P
IF:
3.3
论文数:
563
被引数:
1.2W

