返回
Protein Secondary Structure Prediction Using Soft Computing Techniques
DOI:10.1002/bab.70127.png)
摘要
En 中文
蛋白质二级结构的准确预测是理解蛋白质功能和促进基于结构的药物发现的关键步骤。我们提出了一种模板无关的单序列方法,利用具有one hot(二进制)氨基酸编码和滑动窗口输入的浅层前馈人工神经网络(ANN)。该网络在两个数据集上进行训练和评估:(i)一个经过整理的非同源蛋白质数据库(PDB)集合,具有严格的最高成对序列相似度,并由STRIDE注释;(ii)一个同源的人乳头瘤病毒(HPV)集合(L1、L2、E1-E7),其标签来自Proteus预测器,仅用于特定系统的后续分析。为了提高泛化能力的透明度,我们报告了非同源集合中所有-vs-所有的序列相似度分布(矩阵和直方图)。该模型在非同源PDB基准上实现了具有竞争力的Q3准确率,并在HPV案例研究中实现了Q3一致性(Proteus)。我们将HPV评估明确表述为与标注工具的一致性,而不是与实验的准确性比较。尽管其简单性以及缺乏进化谱,ANN仍表现出稳健的仅序列性能,提供了一个轻量级基准,易于在CPU上复制和部署。我们讨论了局限性(数据集大小、缺乏跨工具比较、缺乏长程特征)并明确了未来工作的具体方向。
Keyword:
artificial neural network
protein secondary structure prediction
STRIDE
期刊
IF:
2.7
论文数:
2.7K
被引数:
4.5K
机构
引用论文
暂无论文信息

