返回
Top-K Representative Search for Comparative Tree Summarization
DOI:10.1109/TKDE.2025.3565845.png)
摘要
En 中文
数据摘要旨在利用小规模摘要来整体表示海量数据集,这对可视化和信息摘要生成很有用。然而,大多数现有的层次化摘要研究仅通过选择k个代表性节点来处理一个单棵树,这忽视了比较两棵树摘要的一个重要问题。在本文中,给定具有相同拓扑结构但节点权重不同的两棵树,我们旨在找到k个代表性节点,其中k1个节点总结它们之间的共同关系,k2个节点同时突出显著不同的子树,并且满足k1+k2=k。为了优化摘要结果,我们引入一个缩放系数,以根据相似性和差异来平衡两棵子树的摘要视图。此外,我们提出了一种基于Hellinger距离的新定义,以量化两棵子树之间的节点分布差异。我们提出了一个贪心算法SVDT,以高效的方式保证近似地找到高质量结果。此外,我们探索了我们比较摘要的扩展,以处理具有不同结构的两棵树。广泛的实验表明,与现有的摘要竞争方法相比,我们的SVDT算法的有效性和效率。
Keyword:
Tree summarization
top-k diversification
hellinger distance
期刊
IF:
10.4
论文数:
6.8K
被引数:
3.2W
机构
引用论文
Efficient and Optimal Algorithms for Tree Summarization With Weighted Terminologies具有加权术语的树摘要的高效和最佳算法

