arrow
返回

Representative Time Series Discovery for Data Exploration

delete2025-04-07
delete0
PRE
AI
G
Ge Lee *
S
Shixun Huang
Z
Zhifeng Bao
Y
Yanchang Zhao
DOI:10.14778/3712221.3712252delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
在本工作中,我们解决了在探索性数据挖掘中发现代表性时间序列的关键任务。我们将一种代表性时间序列定义为相似度受限的代表性时间序列,即当其他时间序列与其相似度满足用户定义的阈值时,该时间序列能够代表这些序列。基于此定义,我们研究了寻找能代表数据集中所有时间序列指定比例的最小时间序列集的问题。每个相似度受限的代表性时间序列的代表性可控,并由指定的相似度水平决定,且仅识别出集体代表指定比例整体集所需的最小代表数量。以高效且有效的方式在大规模数据中发现代表性时间序列,有助于探索性数据分析与摘要生成,服务于跨领域的数据探索应用。我们首先证明了该问题的NP难度,并提出了一系列具有理论保证的近似方法,将其称为非学习型方法。尽管这些方法有效,但通常在运行时间或内存效率上表现突出,而非两者兼顾。为克服这些限制,我们进一步提出了一种学习型方法,同时优化时间和内存效率。该方法利用新颖的数据准备和训练策略,以低内存使用量和计算开销,实现对用户指定代表性要求的适应性。我们在四个真实数据集上进行了广泛实验,结果表明,我们的学习型方法在有效性(产生相似数量的代表性时间序列)方面与非学习型方法具有高度竞争力,同时实现了显著更高的效率(最高21倍加速)和更低的内存消耗(最高节省101倍内存空间)。
Keyword:
LERNAEAN HYDRA
SEARCH

期刊

P
Proceedings of the VLDB Endowment
IF:
3.3
论文数:
563
被引数:
1.2W

机构

C
CSIRO
学者数:
418
论文数: 220
被引数: 1.2K
R
RMIT Univ
学者数:
870
论文数: 554
被引数: 240
U
Univ Wollongong
学者数:
539
论文数: 383
被引数: 180
学者 查看更多机构
引用论文

引用论文

Dumpy: A Compact and Adaptive Index for Large Data Series Collections
err2023-05-30
err0
errOAAI
errZeyu Wang; Qitong Wang; Peng Wang; Themis Palpanas; Wei Wang
err分享
err收藏
Cost-effective outbreak detection in networks
err2007-08-12
err0
errOAAI
errJure Leskovec; Andreas Krause; Carlos Guestrin; Christos Faloutsos; Jeanne VanBriesen; Natalie Glance
err分享
err收藏
err分享
err收藏
err分享
err收藏
SAND
err2021-10-26
err0
PREAI
errPaul Boniol; John Paparrizos; Themis Palpanas; Michael J. Franklin
err分享
err收藏
Diversifying search results
err2009-02-09
err0
PREAI
errRakesh Agrawal; Sreenivas Gollapudi; Alan Halverson; Samuel Ieong
err分享
err收藏
A benchmark study on time series clustering
err2020-09-01
err0
errOAAI
errAli Javed; Byung Suk Lee; Donna M. Rizzo
err分享
err收藏
err分享
err收藏
Querying and mining of time series data
err2008-08-01
err0
PREAI
errHui Ding; Goce Trajcevski; Peter Scheuermann; Xiaoyue Wang; Eamonn Keogh
err分享
err收藏
学者 查看更多内容