返回
araCNA: somatic copy number profiling using long-range sequence models
DOI:10.1093/nargab/lqaf124.png)
摘要
En 中文
体细胞拷贝数变异(CNAs)是癌症的标志性特征。目前从全基因组测序(WGS)数据中识别CNAs的算法尚未利用深度学习方法,这主要受到计算规模限制的影响。在此,我们提出一种新颖的深度学习算法araCNA,该算法仅使用模拟数据进行训练,能够准确预测真实WGS癌症基因组中的CNAs。araCNA采用新颖的Transformer替代模型(如Mamba)来处理基因组规模的序列长度(约1M)并学习长距离相互作用。结果表明,该算法在模拟数据上表现极其准确,且在应用于癌症基因组图谱的50个WGS样本时,这一零样本方法的效果与现有方法相当。值得注意的是,我们的方法仅需肿瘤样本而无需匹配的正常样本,具有更少的过拟合指标,并且推理过程仅需几分钟。araCNA展示了领域知识如何用于模拟训练集,从而在生物应用中发挥现代机器学习的强大能力。
Keyword:
CANCER
POPULATIONS
INFERENCE
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
N
IF:
2.8
论文数:
261
被引数:
0
机构
引用论文
Chromothripsis followed by circular recombination drives oncogene amplification in human cancer嗜铬症继之以环状重组驱动人类癌症中的癌基因扩增
HATCHet2: clone- and haplotype-specific copy number inference from bulk tumor sequencing dataHATCHet2: 从大块肿瘤测序数据推断克隆和单倍型特异性拷贝数
GENOME BIOLOGY
IF9.4
TITAN: inference of copy number architectures, in clonal cell populations from tumor whole-genome sequence data
GENOME RESEARCH
IF5.5
Distinct Classes of Complex Structural Variation Uncovered across Thousands of Cancer Genome Graphs在数千个癌症基因组图中发现的复杂结构变异的独特课程
Cell
IF0
Absolute quantification of somatic DNA alterations in human cancer人类癌症中体细胞DNA改变的绝对定量
NATURE BIOTECHNOLOGY
IF41.7
ECOLE: Learning to call copy number variants on whole exome sequencing dataECOLE: 学习在整个外显子组测序数据上调用拷贝数变异
NATURE COMMUNICATIONS
IF15.7

