返回
Big data and machine learning-based future chemical management strategy
DOI:10.1360/TB-2025-0221.png)
摘要
En 中文
随着发展和生活水平的提高,化学品在整个生命周期中不可避免地释放到环境中,对人类健康构成重大风险。化学品种类繁多导致传统管理方法不足,凸显了基于大数据的化学品管理策略的必要性,以保护人类健康和促进可持续发展。大数据具有多源和多种模态异质性特征,多源异质性指整合来自不同来源、技术平台或时间点的数据,多种模态异质性则涉及数值向量、文本序列等不同数据形式。整合多源异构数据(如化学结构、生产量、暴露和危害)为化学品管理提供了坚实基础。实现化学品全生命周期的智能化、精准化管理至关重要,这有助于优化流程、控制污染和减少碳排放。然而,如何准确提取和利用大数据中的信息仍是亟待解决的问题。因此,结合人工智能(AI)与大数据的策略对化学品应用和生产行业的可持续发展至关重要。该策略可分为三个阶段:初始、中期和终端阶段。初始阶段聚焦于大数据收集,需应用大型语言模型。这些模型基于语料库构建、预训练和领域知识微调,能整合分散在报告、文献和数据库中的化学数据,克服手动收集和标注的局限。此外,科研信息不仅限于文本格式,还呈现为图像等多模态形式。随着技术进步,多模态大型模型有望为多模态数据的结构化提取和聚合提供创新方法,从而构建更全面的化学品管理基础数据库。中期阶段涉及大数据分析,通过开发判别和生成型AI模型实现。判别型AI模型支持端到端的大数据学习,能整合多模态数据筛选和预测化学品性质、危害及环境风险,为管理决策提供科学依据。生成型AI模型可生成不同约束下的最优化学品管理策略,如绿色替代品的分子设计。此外,整合判别和生成型AI模型开发AI代理,有望模拟专家决策过程,提供智能化管理建议。终端阶段是创建数字孪生系统,建立化学品管理中物理实体与其数字副本之间的映射关系。利用初始阶段采集的数据和中期阶段生成的分析参数,数字孪生可在虚拟环境中模拟真实环境影响,同时指导数据采集优先级和模型优化,形成智能闭环管理。由大数据驱动的AI化学品管理策略旨在提升管理过程的智能化水平,推动化学工业走向高效、安全、可持续的发展道路。这一转型不仅需要持续的技术进步,还需建立涵盖跨域协作、基础设施等关键要素的强大支持体系。
Keyword:
chemicals management
big data
machine learning
natural language processing
digital twins
期刊
C
IF:
1.2
论文数:
201
被引数:
0
机构
引用论文
Digital Twin Shop-Floor: A New Shop-Floor Paradigm Towards Smart Manufacturing数字孪生车间: 面向智能制造的新车间范式
IEEE ACCESS
IF3.6
Developing QSAR Models with Defined Applicability Domains on PPARγ Binding Affinity Using Large Data Sets and Machine Learning Algorithms使用大型数据集和机器学习算法开发具有定义的ppar γ 结合亲和力适用性域的QSAR模型

