arrow
返回

Dy-mer: An Explainable DNA Sequence Representation Scheme using Dictionary Learning

delete2025-12-18
delete0
PRE
AI
Z
Zhiyuan Peng
N
Naifan Zhang
Y
Yuanbo Tang
Y
Yang Li
DOI:10.1016/j.jfranklin.2025.108307delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
DNA序列编码关键遗传信息,但其长度可变和离散的特性阻碍了在深度学习模型中的直接应用。现有的DNA表示方法将序列转换为数值向量,但无法捕捉局部子序列的结构特征,并且通常存在可解释性有限和在小数据集上泛化能力差的问题。为解决这些局限性,我们提出了Dy-mer,一种基于字典学习的可解释且鲁棒的DNA表示方法。Dy-mer将优化问题以张量格式表述,确保在批处理中的计算效率。我们的方法通过卷积操作将DNA序列重构为动态长度子序列(dymers)的拼接,并同时优化可学习的dymer字典和稀疏表示。我们的方法在DNA启动子分类和基序检测等下游任务中取得了最先进的表现。实验进一步表明,学习到的dymers与已知的DNA基序相匹配,且使用Dy-mer进行聚类可生成语义上有意义的系统发育树。这些结果证明,所提出的方法在实现强预测性能的同时具有高可解释性,非常适合生物研究应用。

期刊

J
Journal of the Franklin Institute
IF:
4.2
论文数:
925
被引数:
0

机构

T
tsinghua university
学者数:
11.9W
论文数: 10.0W
被引数: 137
引用论文

引用论文

err分享
err收藏
err分享
err收藏
KAT: a K-mer analysis toolkit to quality control NGS datasets and genome assembliesKAT: 用于质量控制NGS数据集和基因组组装的k-mer分析工具包
err2016-11-28
err0
errOAAI
errDaniel Mapleson; Gonzalo Garcia Accinelli; George Kettleborough; Jonathan Wright; Bernardo J Clavijo
err分享
err收藏
学者 查看更多内容