人工智能与药物发现:解锁基因组学与药物-药物交互作用间的奥秘
药物设计和开发一直是制药行业及化学科学研究的前沿领域。然而,这一领域长期以来面临着疗效不佳、靶向给药难题、研发耗时以及成本高昂等多重挑战。同时,随着基因组学、蛋白质组学、微阵列分析以及临床试验产生的数据日益庞大和复杂化,药物发现的道路也愈发崎岖。在这样的背景下,人工智能(AI)与机器学习(ML)的崛起为药物研发带来了新的曙光,尤其是AI在药物结构优化中发挥着关键作用。

一、AI在药物结构优化中的关键作用
人工智能(Artificial inteligence, AI),尤其是其深度学习(Deep learning, DL)和机器学习(Machine learning, ML)算法,在解决药物设计和药物发现过程中遇到的各种问题上已经展现出巨大的潜力。AI,或称机器智能,是指计算机系统能够从输入的信息或历史数据中学习的能力。当机器在解决问题和学习新知识的过程中模拟了人脑的认知功能时,我们即称之为人工智能。如今,生物和化学领域的科研人员正广泛采用AI算法来加速和优化药物的设计和发现过程。
表1 计算机辅助药物发现的三个关键阶段

表2 药物发现过程中AI在药物结构优化中的作用

目前,AI和DL被应用于肽合成、基于结构的虚拟筛选、基于配体的虚拟筛选、毒性预测、药效团建模、定量构效关系等多个药物发现过程中。AI在药物结构优化中的关键作用包括通过计算模型加速药物设计、提高药物活性和选择性,以及减少实验成本和时间。这些技术的发展为合理的药物设计和发现提供了良好的机会。
在药物化学领域,AI技术已被成功应用于定量构效关系(QSAR)和结构活性关系(SAR)研究中,显著提高了模型的性能和预测精度。此外,AI的应用范围还扩展到了药物设计、分子对接以及预测性毒理学等领域。特别值得注意的是,多数用于药物发现的AI方法都是基于元启发式算法(metaheuristics)来构建的,这些算法能够模拟自然界中的优化过程,如遗传算法、蚁群优化等。
二、计算技术在药物研究的应用
当下,人工智能、大数据、化学空间、化学信息学、深度学习、分子建模、多药理学、结构多活性关系(SmART)、靶向捕捞和虚拟筛选等新的计算技术的应用使得药物研究更加全面和细致。
表3 计算技术在药物研究的应用

AI和计算算法不仅可用于指导药物发现和开发流程,还能帮助科研人员更深入地理解基因变异对药物疗效的影响。例如,基因序列中的点突变、缺失、插入和易位等变异类型,都可能成为开发新药物治疗的直接分子靶点。这些关于基因变异的临床信息可以从诸如ClinVar、COSMIC和OMIM等数据库中提取出来,为药物设计提供宝贵的数据支持。
三、预测药物-药物交互作用的计算预测模型开发
尽管基于计算机模拟的药物预测算法(即“硅预测算法”)在近年来取得了显著进展,但对于药物-药物交互作用(drug-drug interaction, DDI)的计算预测,尤其是对复杂且多因素疾病的预测,仍然是一个巨大的挑战。将下一代测序技术获得的基因组信息与来自成千上万患病个体的临床信息相结合,有望通过多变量建模程序识别出与治疗反应密切相关的生物标志物。有监督的机器学习算法能够通过实施多组学和多任务学习方法来实现药物-药物交互作用的多标志物预测,这些方法能够有效地提取跨患者样本以及跨药物相似性的信息。
表4 药物-药物交互作用的计算预测模型开发的四个步骤


图1. 用于预测药物-药物交互作用的计算模型开发的关键步骤的示意图(参考来源:Qin Y et al./PloS one).
(数据集从数据资源中获得,它们随后被用作训练数据集,因为它们通常包含一种或多种类型的“组学”数据,例如转录组学和DNA序列。此类数据被用作统计或机器学习技术的输入。根据预期的预测结果,预测算法可以被分为分类或回归模型。然后,用交叉验证抽样技术评估模型的预测性能,并在独立的公共或私人数据集中进一步验证和测试选定的候选模型。)
在构建药物-药物交互作用的计算预测模型时,通常遵循3个关键步骤:
1.特征选择
这是机器学习程序中至关重要的一步,因为它直接影响到最终模型的性能。科研人员可以使用通用的特征选择算法(如弹性网回归或随机森林),也可以根据具体的研究目的调整算法(如考虑药物的作用机制)。
2.模型评估
为了建立一个稳健且准确的预测模型,模型评估是不可或缺的一环。一个优秀的模型应该在未见过的数据上表现出良好的泛化能力。模型评估通常在对训练数据集进行算法拟合后进行,并通过使用独立的验证数据集来检验模型的性能。在分类任务中,常用的评价指标包括模型的准确性、精确性、召回率、曲线下面积(AUC)以及精确-召回曲线等;而在回归任务中,则主要关注模型的相关度、均方根误差(RMSE)和决定系数(R²)。
3.交叉验证
这是一种常用的模型评估方法,通过将初始数据集分成两个或多个部分来评估模型的性能。其中一部分数据用于训练算法,而另一部分数据则用于测试模型的表现。K-fold交叉验证(KF-CV)和留一交叉验证(LOOCV)是最常用的两种交叉验证方案。在KF-CV中,初始数据集被分为K个子集,每次使用K-1个子集进行训练,剩余的一个子集用于测试;而在LOOCV中,每次只留一个样本作为测试集,其余样本用于训练,这一过程会重复进行直到每个样本都被用作过测试集为止。
小结
AI的出现为药物结构优化提供了新的工具和方法,可以加速药物设计过程,提高药物的活性和选择性,并减少实验成本和时间。然而,AI在药物研发中仍面临一些挑战,例如数据质量和模型可解释性等问题。未来,研究人员可以进一步研究和改进AI算法,以更好地应用于药物结构优化,并为药物研发带来更大的突破和创新。
参考文献
[1] Prieto-Martínez F D, López-López E, Juárez-Mercado K E, et al. Computational drug design methods—current and future perspectives[J]. In silico drug design, 2019: 19-44.
[2] Qin Y, Conley A P, Grimm E A, et al. A tool for discovering drug sensitivity and gene expression associations in cancer cells[J]. PloS one, 2017, 12(4): e0176763.
[3] Gupta R, Srivastava D, Sahu M, et al. Artificial intelligence to deep learning: machine intelligence approach for drug discovery[J]. Molecular diversity, 2021, 25: 1315-1360.





沪公网安备 31011002003500