arrow
返回

Similarity Search with Data Missing

delete2026-02-01
delete0
PRE
AI
C
Changyi Ma
宋轩 封面图
宋轩 (Xuan Song) *
DOI:10.1145/3724124delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
相似性搜索是一个具有广泛应用的基础研究问题,涵盖数据挖掘、信息检索和机器学习等多个研究领域。相似性搜索的核心思想是基于特定的相似性度量,在大型数据库中搜索所有候选项中与给定查询项具有最高相似性得分的最相似数据样本。然而,它可能面临高昂的计算成本和存储成本,这促使我们在各种场景下设计有效且快速的相似性搜索算法。但在实际场景中,数据缺失是不可避免的,这会导致相似性得分不准确,进而导致相似性矩阵不准确。因此,在不完整观测数据的情况下,获得准确的相似性矩阵并非易事。为解决此问题,我们提出了一种相似性矩阵校准方法,用于估计高质量的相似性矩阵,并进一步提升相似性搜索性能。首先,我们提出一个目标函数,以最小化初始不准确相似性矩阵与最优估计相似性矩阵之间的差异,其中利用了固有的对称性和正半定性(PSD)属性作为约束来指导校准过程。然后,我们设计了一种高效算法,提供近似真实相似性矩阵的高质量相似性矩阵。理论分析证明了我们提出方法的有效性,并在真实数据集上的大量实验结果验证了该方法在相似性矩阵校准任务和下游相似性搜索任务中的有效性和效率。
Keyword:
Similarity Search
Data Missing
Positive Semi-Definiteness

期刊

ACM Transactions on Intelligent Systems and Technology 封面图
ACM Transactions on Intelligent Systems and Technology
IF:
6.6
论文数:
1.5K
被引数:
6.2K

机构

S
southern university of science & technology
学者数:
1.3K
论文数: 479
被引数: 0
引用论文

引用论文

err分享
err收藏
Deep Discrete Supervised Hashing
err2018-12-01
err98
errOAAI
errJiang, Qing-Yuan; Cui, Xue; Li, Wu-Jun
err分享
err收藏
Imputation methods for missing outcome data in meta-analysis of clinical trials
err2008-06-16
err0
errOAAI
errJulian PT Higgins; Ian R White; Angela M Wood
err分享
err收藏
学者 查看更多内容