返回
KADAIF: an anomaly detection method for complex microbiome data
DOI:10.1093/bioinformatics/btaf520.png)
摘要
En 中文
动机 肠道微生物组在人类健康和疾病中发挥着重要作用,促使进行大规模研究并生成大量数据集。分析此类数据集的一个关键预处理步骤是异常检测,其目的是识别错误样本并防止误导性的统计结果。然而,微生物组数据具有组成性、稀疏性、相互依赖性和高维性等独特挑战,这限制了传统方法的有效性,并凸显了针对微生物组数据异常检测进行专门定制方法的需求。
实现 为解决这一挑战,我们介绍了KADAIF,一种针对微生物组的特定异常检测方法,该方法推广了常见的Isolation Forest(IF)方法。与IF类似,KADAIF构建了一组树,每棵树沿着随机选择的特征递归地对数据进行分区,并测量样本被隔离的平均深度,假设异常样本会更靠近根节点被隔离。然而,与IF不同,KADAIF基于特征子集(结合降维)对样本进行分区,以解决微生物组特有的属性,如稀疏性和物种间相互作用。
结果 我们通过模拟引入异常行为的常见场景来评估KADAIF,表明KADAIF在多种设置和数据集上均优于替代方法。此外,我们还证明KADAIF在检测其他类型的高维稀疏生物数据中的异常时也优于IF。最后,我们展示了KADAIF的应用,用于识别纵向微生物组数据中的疾病发作,以及根据《安娜·卡列尼娜》原则对病例和对照进行分区。综合来看,我们的工作突出了KADAIF在增强微生物组数据处理和下游分析方面的潜力,这对精准医学研究具有有益影响。
可用性与实现 KADAIF的实现以及用于分析的所有代码均可在GitHub上获取(https://github.com/borenstein-lab/KADAIF)。
Keyword:
GUT MICROBIOTA
METAGENOMICS
期刊
IF:
5.4
论文数:
1.3K
被引数:
17.9W
机构
引用论文
A Comprehensive Performance Comparison Study of Various Statistical Models that Accommodate Challenges of the Gut Microbiome Data对能够应对肠道微生物组数据挑战的各种统计模型的全面性能比较研究
The Microbiome and Metabolome of Preterm Infant Stool Are Personalized and Not Driven by Health Outcomes, Including Necrotizing Enterocolitis and Late-Onset Sepsis早产儿粪便的微生物组和代谢组是个性化的,而不是由健康结果驱动的,包括坏死性小肠结肠炎和迟发性败血症
MSPHERE
IF3.1

