返回
Kinase-substrate prediction using an autoregressive model
DOI:10.1016/j.csbj.2025.03.003.png)
摘要
En 中文
激酶特异性磷酸化在细胞信号传导和各种疾病中发挥着关键作用。然而,即使在模式生物中,大多数激酶的底物仍未被识别。目前,尚无可靠的方法来预测激酶-底物关系。本研究中,我们介绍了一种创新方法,利用自回归模型来预测激酶-底物对。与专注于预测位点特异性磷酸化的传统方法不同,我们的方法在蛋白质水平上解决激酶特异性蛋白质底物预测问题。我们将该问题重新定义为一种特殊的蛋白质-蛋白质相互作用预测任务。我们的模型将蛋白质大型语言模型ESM-2作为编码器,并采用自回归解码器以二进制方式对蛋白质-激酶相互作用进行分类。我们采用基于ESM-2生成的激酶嵌入距离的硬负样本策略,迫使模型有效区分正负数据。我们进行了top-k分析,以评估模型优先排序最可能激酶候选的能力。我们的方法还具备零样本预测能力,意味着即使在没有已知底物的情况下也能预测激酶的底物,这是位点特异性预测方法无法实现的。我们的模型在新型激酶和代表性不足群体上的稳健泛化能力展示了其多功能性和广泛应用价值。代码和数据可在https://github.com/farz1995/substrate_kinase_prediction获取。
Keyword:
Phosphorylation
Kinase
Kinase substrate
Autoregressive language model
Zero-shot
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
IF:
4.1
论文数:
695
被引数:
1.4W
机构
引用论文
Cd-hit: a fast program for clustering and comparing large sets of protein or nucleotide sequencesCd-hit: 一种用于聚类和比较大量蛋白质或核苷酸序列的快速程序

