返回
BiRNA-BERT allows efficient RNA language modeling with adaptive tokenization
DOI:10.1038/s42003-025-08982-0.png)
摘要
En 中文
基于Transformer的模型在生物序列建模中取得了显著成功,但其在RNA上的应用仍受限于序列长度。现有的RNA语言模型通常会对输入进行截断,丢弃对全长任务至关重要的远端核苷酸上下文。此外,先进的NLP分词方法不能直接应用于生物序列,因为在二级结构预测等任务中,核苷酸级别的分辨率是必不可少的。为解决这些挑战,我们提出了BiRNA-BERT,一个在3600万个非编码RNA序列上训练的1.17亿参数Transformer编码器。其核心是一个自适应双分词框架,结合了用于精细结构任务的核苷酸级(NUC)编码和用于高效长序列处理的字节对编码(BPE)。BiRNA-BERT根据输入长度动态选择分词方式,使其能够无截断地处理任意长序列。我们在从短序列分类到长上下文建模和精细核苷酸级RNA结构预测的任务上展示了最佳性能。我们的信息论分析揭示了BPE压缩与NUC分词之间的权衡,并通过实验再次验证了这一点。最后,BiRNA-BERT在固有语言建模性能(通过困惑度和标记恢复衡量)方面表现优异,同时比现有RNA模型更紧凑。代码和模型权重可在 https://github.com/buetnlpbio/BiRNA-BERT 获取。近期研究介绍了BiRNA-BERT,利用自适应双分词技术提升了RNA序列处理和结构预测精度。
Keyword:
RNA language modeling
adaptive dual-tokenization
Transformer encoder
nucleotide-level encoding
byte-pair encoding
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
IF:
5.1
论文数:
1.0W
被引数:
3.2W
机构
引用论文
A task-specific encoding algorithm for RNAs and RNA-associated interactions based on convolutional autoencoder
NUCLEIC ACIDS RESEARCH
IF13.1
ProtTrans: Toward Understanding the Language of Life Through Self-Supervised LearningProtTrans: 通过自我监督学习来理解生活语言
DNABERT: pre-trained Bidirectional Encoder Representations from Transformers model for DNA-language in genomeDNABERT: 来自基因组中DNA语言的Transformers模型的预训练双向编码器表示

