返回
Analytics Modelling over Multiple Datasets Using Vector Embeddings
DOI:10.1007/978-3-032-02088-8_17.png)
摘要
En 中文
数据量和数据集可用性的大幅增加迫使研究人员关注数据内容,并选择高质量数据集以提升分析操作器的性能。尽管选择高质量数据能显著提高分析准确性和效率,但具体过程在大规模数据集环境下极具挑战性。为解决此问题,我们提出了一种新颖方法,通过创建模型来推断分析操作器的结果。该方法将每个数据集转换为向量嵌入表示,该表示由我们提出的深度学习模型NumTabData2Vec生成,并采用相似性搜索。通过实验评估,我们将我们框架的预测性能和执行时间与另一项最先进的建模操作器框架进行了比较,结果表明我们的方法能准确预测分析结果并提升速度。此外,我们的向量化模型能够将不同的现实场景精确投影到更低的向量嵌入表示中,并能加以区分。
Keyword:
Data Quality
Analytics Modelling
Vector embeddings
Vector Similarity

