返回
Modelling In vitro Mutagenicity Using Multi-Task Deep Learning and REACH Data
DOI:10.1021/acs.chemrestox.5c00152.png)
摘要
En 中文
在REACH法规下,致突变性评估依赖于体外测试(包括细菌和/或哺乳动物细胞的基因突变测试,以及哺乳动物细胞的染色体畸变或微核试验),必要时再进行体内测试。本研究探讨了利用这些体外试验之间的固有相关性创建多任务深度学习模型的可能性,并检验其是否优于单任务模型。编译了一个包含超过12,000种物质的广泛遗传毒性数据集,其中包括算法筛选的REACH数据以及多个公开来源的信息。还从ToxValDB和文献来源获取遗传毒性信息,以构建外部(保留)测试集,用于严格评估模型的泛化性能。研究了从经典机器学习技术、化学指纹到使用图表示分子结构的深度学习方法的一系列单任务和多任务模型。最佳深度学习单任务模型在四种体外试验中达到73–84%的交叉验证平衡准确率,比经典机器学习方法高出2–8%。针对特定细菌菌株和代谢活化模式的基因突变检测,平衡准确率为82–85%,改进幅度为7%至12%。针对特定细菌菌株和代谢活化模式的多任务深度学习模型,其交叉验证测试平衡准确率平均比单任务模型高8%,但在试验结果汇总时表现相当。针对特定细菌菌株和代谢活化模式的最佳深度学习模型,当正负样本各至少有200个时,外部平衡准确率为72–78%。图神经网络模型降维后的分子嵌入能够区分正负样本,并聚类触发已知遗传毒性结构警示的结构。这些模型还被用于识别与细菌中预测阴性遗传毒性和哺乳动物细胞中预测阳性遗传毒性相关的结构基团。
Keyword:
genotoxicity
mutagenicity
deep learning
multi-task models
molecular structure
期刊
IF:
3.8
论文数:
6.6K
被引数:
1.4W
机构
引用论文
Prediction of Compound Profiling Matrices, Part II: Relative Performance of Multitask Deep Learning and Random Forest Classification on the Basis of Varying Amounts of Training Data
ACS OMEGA
IF4.3

