返回
NucleicBERT interprets RNA sequence space through self-supervised language modelling
DOI:10.1038/s42256-026-01295-9.png)
摘要
En 中文
大部分人类基因组中非蛋白质编码部分通过RNA直接发挥作用,但这些序列中编码的结构和功能角色仍知之甚少。深度学习的应用因RNA结构数据稀少而受阻,且尚不清楚此类模型能否仅从丰富的RNA序列中直接恢复生物学约束。为解决这些挑战,我们开发了NucleicBERT,一种自监督掩码语言模型,它无需进化信息即可从单序列中学习上下文表示。可解释人工智能分析表明,该模型在潜在空间中对RNA序列进行组织并编码结构属性,表明生物学上有意义的约束仅从序列相关性中学习。当针对下游结构和功能任务进行微调时,NucleicBERT仅需单序列即可匹配或超越当前的RNA预测模型。这种无比对框架解决了注释3D RNA数据稀缺的问题,同时为实验技术提供了快速的计算补充。通过连接丰富的未标记序列数据和稀少的结构注释,NucleicBERT推动了RNA结构预测,并揭示了大型语言模型如何编码生物信息。尽管序列数据丰富,但RNA结构和功能难以推断,因为注释稀少。Upadhyay等人训练了一个自监督模型,在大规模RNA数据中从序列相关性中提取生物学上有意义的模式。
期刊
IF:
23.9
论文数:
1.3K
被引数:
1.5W
机构
引用论文
Cd-hit: a fast program for clustering and comparing large sets of protein or nucleotide sequencesCd-hit: 一种用于聚类和比较大量蛋白质或核苷酸序列的快速程序
TurboFold II: RNA structural alignment and secondary structure prediction informed by multiple homologs
NUCLEIC ACIDS RESEARCH
IF13.1
Integrated NMR and cryo-EM atomic-resolution structure determination of a half-megadalton enzyme complex
NATURE COMMUNICATIONS
IF15.7

