机器学习在网络药理学中的深化应用与多靶点药物发现的革新
近期,Briefings in Bioinformatics上的一篇综述性文章“Machine learning for synergistic network pharmacology: a comprehensive overview”引起了广泛的关注。该文主要探讨了机器学习(Machine learning, ML)技术在网络药理学中的应用,特别是在多靶点药物发现中的重要作用。本文深入探讨了机器学习在预测代谢途径、药物-靶点相互作用以及药物筛选等方面的应用。特别是深度学习算法和神经网络在此领域的应用,为多靶点药物发现提供了强大的支持。
文章指出,机器学习在网络药理学具有广泛用途,特别是在预测代谢途径、药物-靶点相互作用和药物筛选等方面的研究。深度学习算法的强大之处在于能够从原始数据中提取特征,从而提高预测的准确性。其次,多种机器学习方法,如支持向量机(Support Vector Machine, SVM)、随机森林(Random Forest, RF)和深度学习(Deep learning, DL)等,它们与网络药理学的结合应用不仅提高了网络药理学的决策能力,而且为多靶点药物发现的各个环节提供了有力的工具。
此外,文章还指出了开发新工具的必要性,以更好地预测药物与靶点网络的相互作用。机器学习方法在改善多靶点药物发现方面具有广泛应用,包括数据收集、特征提取、模型训练和验证等步骤。

图 1. 代表网络药理学研究的工作流程—破译治疗不治之症的生物活性分子
图1描述了从草药配方到治疗不可治愈疾病的生物活性分子的解析过程。首先,它分析了来自不同资源的靶点,包括实验数据和数据库中的公共数据,然后进行网络分析。基于综合分析,它确定了特定参与导致疾病状态的通路失调的中心基因。最后,进行实验和计算验证。
一、机器学习和深度学习在网络药理学中的应用
机器学习和深度学习在预测代谢途径、药物-靶点相互作用和药物筛选等方面具有重要的应用,同时它们也改善了多靶点药物发现。

图 2. 利用机器学习改进多靶点药物发现过程的工作流程
如图2所示,利用机器学习改进多靶点药物发现过程的工作流程需要收集数据,随后生成数学描述符,将相应的斑块相互靠近。接着,训练模型,再对模型进行交叉验证。
利用机器学习改进多靶点药物发现过程的具体步骤为:
1.数据收集
收集生物活性小分子和靶点蛋白信息
2.分子描述符检索
将生物活性小分子转化为二进制代码,靶点蛋白标记为靶点1、靶点2、靶点3……
3.模型训练
进行特征选择
4.数据测试
将训练好的模型应用于测试数据。
5.模型评估
对训练好的模型进行性能评估。
6.模型验证
对模型进行交叉验证。

图3. 深度学习的简单工作原理
深度学习的工作流程包括以下步骤:
1.数据挖掘
从公共数据库、文献和实验室实验中获取数据。
2.预处理
对数据进行预处理,包括特征缩放、数据清洗、管理分类数据等。
3.数据分割
将数据分割为训练集和验证集。
4.构建和训练模型
首先定义模型架构,然后定义超参数,然后在训练数据上训练模型。
5.性能评估
评估模型的性能。如果模型差强人意,则调整超参数,改变架构,添加正则化参数等。如果模型结果好,则进行部署。
二、机器学习在网络药理学中的应用
将Autoencoder、Hidden Markov Model、Multi-Layer Perceptron、Random Forest、Support Vector Machines等机器学习方法应用于网络药理学中,可以提高网络药理学决策能力方面。

图 4. 用于多靶点药物发现的机器学习工具和技术
无监督学习用于构建可实现数据聚类的模型,而包括回归和分类器方法在内的有监督学习技术则用于解决要求预测数据类别或连续变量的查询。因此,两者都为网络药理学研究提供了帮助。这张图片展示了机器学习工具和技术在多靶点药物发现中的概述。其中包括监督学习方法和无监督学习方法,以及它们在多靶点药物发现中的应用。
监督学习方法包括回归分析、分类器方法、递归神经网络、深度神经网络、集成方法、支持向量机、多层感知器、卷积神经网络、决策树、判别分析、k-最近邻等。这些方法可以用于预测蛋白质序列、蛋白质结构、基因表达数据中的预后基因鉴定、蛋白质相互作用的预测等。
无监督学习方法包括自编码器、深度自编码器、隐马尔可夫模型、主成分分析、层次聚类等。这些方法可以用于数据聚类、预测生物活性小分子的物理化学性质和生物活性、蛋白质相互作用网络分析等。
总体而言,监督学习和无监督学习方法在网络药理学研究中都发挥着重要作用,提供了在多靶点药物发现中解决查询和预测数据类别或连续变量的模型构建和应用。
三、支持向量机在网络药理学中的应用
文章描述了支持向量机及其在分类和回归分析中的应用,强调了支持向量机在网络药理学中的重要性。

图5 SVM的操作工作流程
SVM是一种常见的机器学习算法,用于分类和回归分析。SVM的操作工作流程包括以下步骤:
1.输入变量选择
选择最少的输入变量来描述输出变量的行为。
2.数据预处理
包括数据清洗、数据集成、数据转换、数据降维和数据离散化等。
3.模型参数设置
设置SVM模型的参数,包括正则化参数C和Gamma参数γ。
4.模型实现
实现SVM模型,通过设置合适的参数来提高分类准确性。
5.输入变量集的特点
选择具有最小冗余度和没有无信息变量的输入变量集,以获得更准确、高效和成本效益的模型。
6.数据转换
将原始数据转换为格式良好的数据,包括数据清洗、数据集成、数据转换、数据降维和数据离散化等步骤。
7.模型参数
SVM模型使用正则化参数C和Gamma参数γ。
8.模型交叉验证
对模型进行交叉验证,选择最佳的参数对来创建分类模型。
9.模型测试
选择的分类模型在测试数据集上进行测试。
四、机器学习方法改善多靶点药物发现
机器学习在改善多靶点药物发现方面的应用包括:数据收集、特征提取、模型训练和验证等步骤(如图2所示)。通过机器学习推进网络药理学研究的方式,以及机器学习在对抗最致命疾病方面具有超能力。深度学习方法(CNN、DNN、RNN和MLP)在药物开发方面具有潜力,因为它可以预测分子结构和功能,并自动开发具有特定特征的新化合物。此外,支持向量机(SVM)和随机森林(RF)最近备受关注,因为它们在处理网络药理学研究中的大数据挑战方面得到了显著应用。因此,机器学习方法有助于开发具有多靶效应的药物,并探索不同当前使用药物的多种药理作用。

图6. 通过 ML 推进网络药理学研究—对抗致命疾病的超级力量

表 1. 可用于应对网络药理学挑战的不同学习技术
目前,网络药理学挑战包括:样本量小、大量未标记数据实例、大型异质网络和非线性关联、基于知识的条件、计算资源等。机器学习和深度学习方法的一些局限性,例如对大量数据的需求、对标记和未标记数据实例比例的敏感性、对手工特征的依赖等。潜在的解决方案包括,如迁移学习(TL)、半监督学习或主动学习、深度学习等,以及这些解决方案可能如何应对网络药理学领域的挑战。
五、总结
1. 文章要点
网络药理学已成为多靶点药物发现的重要研究模型。然而,网络药理学的预测性仍需要提高。
这篇文章概述了可用于开发多靶点药物的机器学习和深度学习方法。机器/深度学习最近在药物发现方面取得的成功可以用来克服网络药理学的局限性。
随着可用的机器学习库、工具包和框架数量的不断增加,期待在不久的将来看到更多的研究,以及基于机器学习或深度学习的网络药理学生产管道的实例。
2. 小结与展望
网络药理学,这一交叉学科巧妙地结合了生物信息学与化学信息学,构建了一种全新的药物作用机制研究模式。其核心在于建立网络中心的药物作用体系,深入剖析药物成分、靶点以及疾病治疗之间的复杂关系。通过这一视角,我们可以更为全面地评估多成分、多靶点化合物配方的疗效,并为探索疾病的多个治疗靶点提供科学依据。
目前,机器学习及其工具的应用正在逐步改变网络药理学的研究格局。这些先进的工具与技术有望提升网络药理学的发现效率和决策质量,为多靶点药物研发带来前所未有的突破。尽管当前市场上尚未出现完全基于网络药理学和ML的药物和靶点,但这些技术和方法为我们提供了丰富的候选物质和新思路。
值得注意的是,要充分利用ML在多靶点药物发现中的潜力,我们仍需在数据质量、算法优化等方面进行深入研究和探索。这其中,高质量、准确且经过整理的数据是至关训练和开发高质量ML模型的关键。此外,数据的复杂性以及所需处理的问题类型也决定了所需数据量和准确性的要求。因此,生成这些高质量数据集的成本可能相当高昂。
解决这一挑战的一个可能途径是建立一个由制药公司和学术机构组成的合作体系。通过共享数据标准、开放数据框架和必要的操作规范,我们可以共同应对这一挑战,并推动基于ML的多靶点药物发现的快速发展。尽管将ML工具应用于网络药理学仍面临诸多挑战和未知领域,但随着技术的不断进步和研究的深入,我们有理由相信,ML将在不久的将来为多靶点药物发现的网络药理学带来革命性的变革。
参考文献
Noor F, Asif M, Ashfaq U A, et al. Machine learning for synergistic network pharmacology: a comprehensive overview[J]. Briefings in Bioinformatics, 2023: bbad120.





沪公网安备 31011002003500