化工工艺的自动化开发需要依托先进的多目标优化算法,这是因为单目标优化无法识别相互冲突的性能指标之间的权衡关系。本文报道了一种全新多目标机器学习优化算法在反应自优化中的实现,并在两套连续流体系的典型化学反应中完成验证。在两个研究案例中,该算法均成功得到了对应环境目标与经济目标权衡曲线(帕累托前沿)的一组最优条件。因此,该算法能够揭示目标之间全部内在权衡关系,而不像多数其他研究那样仅能得到单一折中工况。该机器学习算法具备极高的数据利用效率,相比单目标优化,仅需更少的实验次数即可确定各项目标的最优条件;本研究通过真正意义上的多目标优化获取多目标之间完整的内在权衡关系,无需引入人为设定的权重系数。 一、引言 机器人自动化化学工艺开发是化学与化工制造的未来发展方向,借助机器人与机器学习开展化学反应条件自优化,可为新化学反应的工艺开发提供高效解决方案。当前,越来越多研究将机器人、自动化实验平台与机器学习算法相结合,用于新反应发现、反应条件筛选、工艺参数优化、合成路线开发以及高通量实验。自动化化学平台能够自主完成试剂输送、反应过程调控、产物在线分析、数据采集,再由机器学习算法基于实验数据提出下一组待验证实验参数,形成闭环自主优化流程。
化学反应优化任务通常需要同时兼顾多项相互冲突的工艺目标,例如反应收率、生产效率、原料成本、环境负荷、杂质水平。传统单目标优化手段一般将其余目标转化为约束条件,或是通过加权方式把多个目标折合为单一目标函数,仅能输出一组最优工艺参数,无法完整揭示不同目标之间的权衡关系。在化工与制药工艺实际开发过程中,工艺研发人员往往需要了解多组帕累托最优方案,结合成本、设备条件、产品质量要求完成取舍,而不是只得到一个折中参数。
针对实验成本高昂的黑箱优化问题,贝叶斯优化是一类高效的无导数全局优化框架,该方法以高斯过程作为代理模型,基于已完成实验数据构建目标函数的概率代理模型,通过采集函数权衡探索与利用,挑选最具备信息增益的参数组合开展下一轮实验,大幅降低所需实验次数。但绝大多数面向化学反应的贝叶斯优化工作只处理单目标优化问题;少数多目标贝叶斯优化的化学应用案例大多采用标量化处理,本质上依旧退化为单目标优化,难以完整构建帕累托前沿面。
汤普森采样高效多目标算法(TS‑EMO,文中简称 TS‑EMO/TS‑EMO 算法)属于多目标贝叶斯优化算法,该算法依托高斯过程代理模型,借助谱采样从代理模型中采样得到目标函数的近似实现,再对采样函数求解帕累托前沿,从中筛选待开展的实验点,以此不断逼近真实问题的帕累托前沿。该算法不需要对多目标进行加权标量化,可以直接输出一组非支配解,并且具备开源程序实现,在昂贵黑箱多目标优化问题中表现出优异的数据利用效率。尽管该算法在计算机测试函数上表现出色,但尚未在自动化化学实验平台上开展实际化学反应的闭环自优化验证。
本文将 TS‑EMO 多目标贝叶斯优化算法与自动化连续流反应平台相结合,开展化学反应的闭环多目标自优化研究。选取两类典型有机反应作为案例:芳香亲核取代反应(SNAr)以及胺的 N‑苄基化反应。前者同时优化时空产率与 E‑因子;后者同时优化时空产率与杂质产率。本研究完整得到两组反应的帕累托前沿,直观展示生产效率与绿色指标、产物纯度之间的固有权衡关系;同时利用高斯过程代理模型的超参数解析各操作变量对目标函数的贡献程度。

图 1. 存在两组相互冲突最小化性能指标 A 与 B 的系统示例。不存在可使 A、B 同时达到最优的理想点。帕累托前沿上的点均为非支配解,若要改善其中一个指标,必然会造成另一指标恶化。由于经济目标与环境目标通常相互冲突,不存在可以同时实现两项目标最优的参数点。多目标优化问题的解为一组非支配点集合,想要提升某一目标,另一目标必将受损,该集合即为帕累托前沿。本研究旨在获取反应体系完整的帕累托前沿,而非仅仅得到单一折中参数。

深圳市富临神通科技有限公司是Cambridge Reactor Design中国代理商,我们在连续流化学领域拥有丰富经验。我们为客户提供:流动反应器、间歇式反应器、加热冷却搅拌平台、Polar Bear Plus。
二、结果与讨论2.1 TS‑EMO 算法与自动化连续流反应平台集成
本研究将新近开发的 TS‑EMO 算法与自动化连续流反应系统耦合。采用拉丁超立方采样(LHC)生成小规模初始数据集完成 TS‑EMO 算法初始化。算法内部为每一个优化目标分别训练高斯过程代理模型;高斯过程借助谱采样得到目标函数的随机函数样本;在采样得到的函数上求解帕累托前沿;从该采样帕累托前沿中选出一组待执行实验,目标是提升真实实验对应的帕累托前沿的超体积。完成实验后使用实测数据更新全部高斯过程模型,迭代循环直至完成预设总实验次数。采样过程自带随机性,天然实现贝叶斯优化所需要的探索‑利用权衡。
TS‑EMO 算法被部署于自动化流动反应器Cambridge Reactor Design。先通过拉丁超立方采样获取 20 组初始实验点;后续由 TS‑EMO 算法迭代生成新实验条件。反应试剂由高压液相色谱泵输送,通过世伟洛克三通接头完成物料混合;采用 Polar Bear Plus 流动合成仪对管式反应器进行控温加热或冷却;利用 VICI Valco 四通定量环采集反应液样品,输送至 HPLC 流动相;借助 Upchurch Scientific 背压调节器维持体系恒定背压;整套反应器管路全部采用聚四氟乙烯管线;除定量环与背压阀外接头管件均选用世伟洛克组件;产物采用安捷伦 1100 系列高效液相色谱仪完成定量检测。整套自动化反应器由自行编写的 Matlab 程序控制,TS‑EMO 算法在该程序内完成调用。更多实验细节见补充信息。 方案 1. 案例研究所用反应器装置。试剂由 JASCO PU980 泵(P)输送,经世伟洛克三通接头混合。采用 Polar Bear Plus 流动合成仪实现管式反应器加热与冷却。利用 VICI Valco 四通定量环(SL)将反应混合物等分试样送入 HPLC 流动相。借助 Upchurch Scientific 背压调节器(BPR)维持反应体系恒定背压。反应器全部管路采用 Polyflon 提供的 1/16 英寸外径、1/32 英寸内径聚四氟乙烯管路;除定量环 (VICI) 与背压调节器 (Upchurch) 外,全部接头与管件选用世伟洛克产品。定量分析使用安捷伦 1100 系列 HPLC 仪器。自动化反应器由自主编写的 Matlab 程序控制,TS‑EMO 算法集成在该程序内部。更多实验细节参见补充信息。
2.2 案例一:SNAr 反应多目标自优化
以 2,4‑二氟硝基苯与吗啉之间的芳香亲核取代(SNAr)反应作为第一个研究案例,目标产物为邻位取代产物,同时会生成对位副产物与双取代加合物。针对邻位产物合成,需要同时最大化时空产率(STY)、最小化反应 E‑因子。 \(\mathrm{STY}=\dot{m}_\mathrm{product}/(V\times t_\mathrm{res})\) \(\mathrm{E-factor}=\dot{m}_\mathrm{waste}/\dot{m}_\mathrm{product}\) 式中\(\dot{m}_\mathrm{product}\)代表产物质量流量;\(\dot{m}_\mathrm{waste}\)代表废弃物质量流量;V代表反应器体积;\(t_\mathrm{res}\)代表停留时间。
需要说明,产物组成及后续处理流程会显著影响工艺的时空产率与 E‑因子;但本研究优化并未包含非反应单元操作,上述过程不在本文研究范围。目标函数经过自然对数变换,该处理方式有助于提升基于响应面的优化性能;经过对数变换后,算法帕累托前沿距离标尺为对数尺度,算法更倾向生成对数空间均匀分布的帕累托前沿。
优化一共包含四个操作变量:停留时间、吗啉当量、底物 1 浓度、反应温度,参数边界如表 1 所示。

表 1. 自优化案例的操作变量与取值边界。
本套自动化装置夜间自主运行,当采集不少于 20 个帕累托前沿实验点时,手动终止实验。初始拉丁超立方采样设置 20 个实验点,TS‑EMO 算法额外设计 48 次实验,其中 26 个实验点构成致密帕累托前沿,清晰体现时空产率与 E‑因子之间的权衡关系。为图表可读性,2 个拉丁超立方采样点在图中省略,对应条件:时空产率 370 kg・m⁻³・h⁻¹,E‑因子 5.15;时空产率 500 kg・m⁻³・h⁻¹,E‑因子 7.07。

图 2. SNAr 反应四参数多目标自优化结果(案例一)。初始拉丁超立方采样规模 20。TS‑EMO 算法额外开展 48 次实验,其中 26 个点构成致密帕累托前沿,展示时空产率与 E‑因子之间的权衡。
初始 20 组拉丁超立方采样对应的解集中,大多处于 E‑因子偏高、时空产率偏低的区域;TS‑EMO 算法后续设计的 48 组实验快速收敛形成包含 26 个点的致密帕累托前沿。最优时空产率可达 13120 kg・m⁻³・h⁻¹,对应 E‑因子为 1.6;最优 E‑因子可以低至 0.2,对应时空产率 2040 kg・m⁻³・h⁻¹。实验结果直接证明时空产率与 E‑因子之间客观存在此消彼长。
帕累托前沿可以划分为两段:左侧区域曲线斜率平缓,提升时空产率只会带来 E‑因子小幅上升;继续提升时空产率进入曲线陡峭区段,此时时空产率小幅增加将造成 E‑因子急剧恶化。该信息对于工艺开发极具实用价值:工艺研发人员可以选择在平缓区域选取操作点,在 E‑因子增加幅度可控前提下获得很高时空产率。若采用传统单目标约束优化,仅输出单一操作条件,无法获取完整权衡规律。
TS‑EMO 算法内部高斯过程代理模型的超参数可以反映输入变量对目标函数的贡献程度,该方法称作自动相关性判定。超参数\(\theta_i\)与变量相关性负相关:\(\theta_i\)数值越小,该变量对目标函数影响越强。案例一全部超参数汇总如表 2。

表 2. 高斯过程代理模型超参数。\(\theta_i\)数值越小,对应变量对目标函数贡献越大。案例一 SNAr 反应。
从超参数可以看出:对于 E‑因子,温度与底物浓度的影响远高于时空产率;而停留时间、吗啉当量同时强烈影响两项优化目标。该结果和帕累托最优解特征相互印证,停留时间与吗啉当量正是决定时空产率‑E‑因子权衡关系的核心变量。高斯过程噪声超参数\(\sigma_n^2\)数值很小,证明整套实验系统数据重现性良好,代理模型质量高。
2.3 案例二:α‑甲基苄胺 N‑苄基化反应多目标自优化
第二个案例选取 α‑甲基苄胺与苄溴的 N‑苄基化反应,主产物为仲胺,过度烷基化会生成叔胺杂质。优化目标:最大化仲胺产物时空产率,同时最小化叔胺杂质产率。目标函数同样执行对数变换。优化变量共四项:底物进料流量、苄溴与底物投料比、底物浓度、反应温度,参数边界见表 1。
自动化平台夜间自主运行,采用与案例一相同终止判据。初始拉丁超立方采样 20 个实验点,TS‑EMO 算法额外生成 58 次实验,20 个实验点构成致密帕累托前沿。

图 3. N‑苄基化反应四参数多目标自优化结果(案例二)。初始拉丁超立方采样规模 20。TS‑EMO 算法开展额外 58 次实验,20 个点形成致密帕累托前沿,体现时空产率和杂质产率之间的权衡。
对比案例一,初始拉丁超立方采样点在目标空间分布更加均匀。帕累托前沿上,最高时空产率 331 kg・m⁻³・h⁻¹,杂质产率 10.0%;最低杂质产率 2.2%,对应时空产率 142 kg・m⁻³・h⁻¹。再次证实时空产率与杂质水平之间存在固有权衡。帕累托前沿同样分为两段:平缓区间内提升时空产率,杂质产率仅有小幅上涨;进一步提高时空产率,杂质产率将快速飙升。工艺人员可根据产品纯度指标,在前沿曲线上挑选合适操作窗口。
该案例的高斯过程超参数如表 2。苄胺底物、苄溴‑底物投料比对杂质产率的影响高于时空产率;不同于案例一,温度对两项目标函数均具备强影响。该结果和帕累托前沿规律保持一致,温度是调控时空产率‑杂质产率权衡的关键变量。噪声超参数依旧维持很低水平,证明实验数据稳定可靠。
两次优化全程,相近工艺条件下实验结果波动很小,反应器性能没有出现衰减。需要说明,虽然 TS‑EMO 属于全局随机优化算法,但有限迭代次数下,算法并不能严格保证得到指定精度的真实全局帕累托前沿。
帕累托前沿的工程价值在于为工艺设计提供完整参考信息。例如某一步反应可以适度容忍更高杂质,以此换取大幅提升的时空产率,下游处理增加的成本可以被产能提升完全抵消。与之对比,约束型单目标优化仅输出一个最优条件,无法获知目标之间的权衡曲线;单目标优化给出的解甚至有可能被帕累托前沿上其他点支配。以案例一为例,存在多组 E‑因子接近但时空产率差异巨大的实验点;若仅针对 E‑因子做单目标优化,无法区分这些方案,而多目标 TS‑EMO 可以筛选出 E‑因子不变前提下时空产率更高的工况。
补充信息中展示:还可以直接利用训练完成的高斯过程代理模型开展虚拟采样,在不开展实物实验条件下得到更加稠密的帕累托前沿。该功能对于试剂昂贵、实物实验成本很高的体系具备重要价值。
三、结论本研究完成机器学习全局多目标优化算法在化学反应条件自优化中的应用验证。选取两类代表性有机反应作为案例,将 TS‑EMO 多目标贝叶斯优化算法与自动化连续流平台结合,可同时对生产效率(时空产率)与环境指标(E‑因子)或者杂质产率开展同步优化。四参数优化条件下,两个案例分别在总计 68 次、78 次实验中高效收敛得到致密帕累托前沿。帕累托前沿完整揭示不同优化目标之间的权衡关系,为工艺研发人员在多项性能指标之间寻找折中方案提供关键依据。
本套方案适用于所有具备连续优化变量的机器人自动化化学流程,并且能够进一步拓展至两项以上同步优化目标。高斯过程代理模型除用于实验推荐之外,还可以解析系统内部变量相互作用,量化各个输入变量对目标函数的贡献大小,同时定量评估整套实验的数据质量。借助代理模型虚拟采样,还可以在不执行更多实物实验前提下获得更密的帕累托前沿,适合珍贵试剂、实验代价高昂的场景。














