返回
Dy-mer: An Explainable DNA Sequence Representation Scheme using Dictionary Learning
DOI:10.1016/j.jfranklin.2025.108307.png)
摘要
En 中文
DNA序列编码关键遗传信息,但其长度可变和离散的特性阻碍了在深度学习模型中的直接应用。现有的DNA表示方法将序列转换为数值向量,但无法捕捉局部子序列的结构特征,并且通常存在可解释性有限和在小数据集上泛化能力差的问题。为解决这些局限性,我们提出了Dy-mer,一种基于字典学习的可解释且鲁棒的DNA表示方法。Dy-mer将优化问题以张量格式表述,确保在批处理中的计算效率。我们的方法通过卷积操作将DNA序列重构为动态长度子序列(dymers)的拼接,并同时优化可学习的dymer字典和稀疏表示。我们的方法在DNA启动子分类和基序检测等下游任务中取得了最先进的表现。实验进一步表明,学习到的dymers与已知的DNA基序相匹配,且使用Dy-mer进行聚类可生成语义上有意义的系统发育树。这些结果证明,所提出的方法在实现强预测性能的同时具有高可解释性,非常适合生物研究应用。
期刊
J
IF:
4.2
论文数:
925
被引数:
0
机构
引用论文
iPro54-PseKNC: a sequence-based predictor for identifying sigma-54 promoters in prokaryote with pseudo k-tuple nucleotide composition
NUCLEIC ACIDS RESEARCH
IF13.1
KAT: a K-mer analysis toolkit to quality control NGS datasets and genome assembliesKAT: 用于质量控制NGS数据集和基因组组装的k-mer分析工具包

