编者按

本次解读的文章一种基于强化学习,提出了用于优化长期贴现回报问题的框架,该类问题具有组合型动作空间 (combinatorial action space) 和状态相关约束 (state dependent constraints). 这些特性在诸多运营管理问题中十分常见,例如库存补货问题,其中管理者需面对需求不确定、缺货以及产能限制,从而导致可行动作空间更为复杂。文章提出的 Programmable Actor RL (PARL) 方法采用深度策略迭代 (deep-policy iteration),借助神经网络逼近价值函数 (value function),并结合数学规划与样本平均近似 (sample average approximation),以在考虑组合动作空间与状态相关约束的前提下,求解每一步的最优动作。

方法/结果: 文章展示了该方法如何应用于复杂的库存补货问题,尤其是在解析解不可得的情形下。文章还将该算法与当前最先进的强化学习算法以及常用的补货启发式方法进行了对比测试,结果显示该算法平均在多个复杂供应链设置中相较现有方法提高最多达14.7%的表现。

管理启示: 文章发现,PARL方法相较于基准算法的表现提升,可直接归因于更优的库存成本管理,特别是在库存受限环境下。此外,在较为简单的设置中,如果最优补货策略是可解或近似已知的,发现RL算法学习到的策略能逼近最优解。最后,为了使强化学习方法更易被运营管理领域研究者使用,文章还开发了一个模块化的Python库,可用于测试RL算法在各种供应链结构下的性能。

1 背景介绍

在过去十年间,库存与供应链管理经历了显著的变革。电子商务的兴起为供应链引入了复杂性与全球化,导致物理流动日益互联。因此,管理这些供应链所需的成本不断上升。此外,COVID-19 疫情更是进一步推高了管理复杂网络的支出。根据《华尔街日报》的最新报道,美国企业的物流成本在某些年份中同比增长高达 22%. 为应对这些挑战,一个具有前景的方向是引入基于人工智能的库存管理解决方案,该类方案在管理复杂供应链方面展现出潜在优势。

人工智能与强化学习 (Reinforcement Learning, RL) 在多个领域取得了显著突破,包括游戏、机器人以及医疗健康。RL 提供了一种系统化框架,可在仅需极少领域知识的前提下,求解序贯决策问题。借助最先进的开源 RL 方法,研究人员可开发出能在多阶段决策问题中最大化长期回报的高效策略。因此,RL 被应用于包括供应链在内的多个领域;然而RL 在企业级运营场景中的应用仍较为有限,且面临诸多挑战。

典型的运营管理问题,如库存管理与网络收入管理,通常具有以下特征:动作空间庞大、状态依赖的动作约束清晰,且具有潜在的随机转移动态。例如,一个在供应链网络中管理库存的企业,需决定如何将库存分配至不同节点。此类问题面临多重挑战:需应对网络节点间的需求不确定性,管理一个本地可行动作集合(该集合通常具有组合特性),满足大量状态相关约束以保证可行性,并在短期回报与长期回报之间权衡取舍。

RL 方法可在真实或模拟环境中,通过采样不确定性并生成回报轨迹来进行策略学习。通过对这些轨迹的评估,RL 能够估计在短期与长期回报间实现平衡的最优动作策略。然而,运营管理问题中固有的状态相关约束下的大规模组合动作空间使得基于枚举的传统 RL 技术在计算上不可行。
文章针对上述挑战,文章引入了一种深度策略迭代方法,借助神经网络逼近价值函数——该方法结合了数学规划与样本平均近似,以在考虑组合动作空间与状态相关约束的前提下,最优地求解逐步动作选择问题。

2 前篇回顾

2.1 模型与算法

上篇已介绍文章提出的,基于蒙特卡洛模拟的策略迭代框架,其中学习得到的策略是某个数学规划模型的结果,称之为 PARL. 与基于强化学习的方法常见的做法一样,该框架假设可以访问一个仿真环境,该环境在给定一个动作和当前状态的前提下,能够生成状态转移与奖励。

PARL 的初始化是采用随机策略。初始策略将通过引入学习得出的评论器(即价值函数)在多个轮次中被迭代改进。在第jjj轮迭代中,策略πj−1\pi_{j-1}πj1被用于生成NNN条样本路径,每条路径长度为TTT. 在每一个时间步,每条路径由如下三元组组成:状态stns_t^nstn、奖励RtnR_t^nRtn、下一状态st+1ns_{t+1}^nst+1n,它们由环境生成。这些三元组随后用于估计值函数V^θπj−1\hat{V}_{\theta}^{\pi_{j-1}}V^θπj1,即 value-to-go 函数。该 value-to-go 函数使用神经网络表示,并由参数θ\thetaθ参数化,该参数是通过解决某个问题学习得到的。

其中,目标变量 Rtcum,n:=∑i=tTγi−tRinR_t^{\text{cum}, n} := \sum_{i=t}^T \gamma^{i - t} R_i^nRtcum,n:=i=tTγitRin 表示在第nnn条样本路径中,从时刻ttt起累计的贴现奖励,该路径由模拟策略πj−1\pi_{j-1}πj1生成。一旦估计出了V^\hat{V}V^,就可以通过该训练好的 value-to-go 函数构造出新的策略,其表达为:

该问题与原问题类似,不同之处在于,真实的 value-to-go 被一个近似的 value-to-go 所取代。由于每次迭代都会产生一个更新后的、改进的策略,将其称为一个策略迭代方法。

文章后续介绍如何通过神经网络来近似优化值函数,并配合MILP实现强化学习中的策略优化,进而讨论了如何在面对大动作空间与需求不确定性的情况下最大化期望回报。文章提出命题1 来说明策略收敛,即在PARL算法的每一代中,若使用神经网络估计的值函数参与策略迭代,并在每一轮通过SAA方法求解近似最优策略,则策略序列将收敛到最优。

2.2 在库存管理中的应用

文章考虑一家公司管理单一产品在零售网络(也称为节点)中的库存补货和配送决策,目标是在满足客户需求的同时实现利润最大化。文章构建了一个供应链多节点库存优化模型,刻画了库存、生产、运输、销售和持有成本等多环节动态。以库存状态为核心,定义了每轮的成本收益函数和库存转移方程,并在不确定需求下形成马尔可夫决策过程,为强化学习和优化算法提供系统建模基础。

同时,文章将前文提出的PARL算法应用于库存优化问题。在每个库存状态III下,PARL 通过近似的值函数V^\hat{V}V^和SAA评估收益从而选择最优:

相比基于 Q 函数的策略优化方式,文章选择值函数估计作为主干,是因为库存网络具备全连接结构与集中决策特征,状态转移过程清晰可建模,因此更适合使用 DNN 表示值函数并嵌入优化器;而 Q 学习更适合离散动作空间场景,难以处理动作与状态强耦合的问题。

3 数值实验与结果

数值实验中,文章找事了所提出的 PARL 算法在不同供应链场景下的数值实验结果。目标包括两个方面:(i) 基准测试提出的算法,比较其与先进强化学习和库存管理策略的性能差异;(ii) 讨论一个开源 Python 库在实现多种 RL 算法进行库存管理仿真中的应用,便于供应链中的基准测试。文章为此构建了一个代表性的供应链网络,其中包括最多三类节点:

  1. 供应商:用SSS表示,生产(或按订单)库存,并将其分发至网络其他部分。例如,这些节点可以是大型制造工厂,或从其他国家港口接收库存的港口。
  2. 零售商:用RRR表示,通过产生产品需求来消耗库存。例如,它们可以是零售门店,直接向有购买意愿的客户提供库存。
  3. 仓库:用WWW表示,是连接供应商和零售商的中间节点。它们持有库存并将其运输至下游零售节点。

每个节点都与持有成本、库存容量、损耗成本相关,零售商则还面临价格、需求不确定性、缺货/延迟需求等问题,而供应商存在生产不确定性。节点间的链接表示供应链的流动过程。每个链接关联有订单成本、交货时间和最大订单量。环境执行订单和分配动作时,先通过一个比例履行机制判断是否可行(即无法从一个库存水平为零的节点发货),随后采样不确定性,累积回报(收入减去订单和持有成本),并返回下一状态。

文章研究了三种受真实零售分销网络启发的多级供应链网络结构,分别为两级网络(低生产与高生产设定)、树状分销网络(供应商库存有限与无限设定)以及双源分销网络(交货时间长vs.订购成本高),如图2.

数值实验中,文章为每种网络设定了具体参数,核心特征包括:

  1. 高度不确定的需求:许多现实场景(如快时尚)中,产品需求波动大,因此设定需求信噪比较低。
  2. 非对称零售商:零售商节点在持有成本和交货时间上不同,意味着简单将某个零售商的最优策略复制到其他零售商是不可行的。
  3. 固定订货成本、持有容量、非零交货时间和缺货损失:这些情境在实际零售业务中常见。例如,在 B2C 零售中,若货架上无货会直接损失销售机会;货架空间也远少于仓库,导致需要精细的策略设计。

这些场景都较难从解析角度建模,其最优策略结构尚未明晰,因此具有重要研究价值。

文章将PARL与四种主流的强化学习算法进行了对比:

  • PPO(Proximal Policy Optimization)
  • TD3(Twin Delayed DDPG)
  • SAC(Soft Actor-Critic)
  • A2C(Advantage Actor-Critic)

这些算法采用了由 Stable-Baselines3 提供的可靠实现。所有环境兼容 OpenAI Gym,PARL 的实现基于 SpinningUp 提供的 PPO 参考实现。详细的计算配置可参考原文。

另外,文章还与两类经典供应链启发式策略进行对比,具体为 (s,S) 库存策略与分解聚合策略 (Rong et al., 2017).
在所有实验中,文章采用了严格的强化学习测试流程,包括独立的超参数搜索、训练和评估阶段,确保性能对比结果稳健可信(原文图4);更详细的测试设置与参数搜索策略可见原文4.3节。

实验结果表明,PARL 在多个供应链网络设置中展现出显著的性能优势。与主流的强化学习算法(如 PPO、SAC)以及传统库存启发式策略(如 BS 策略)相比,PARL 在几乎所有测试环境中都实现了更高的平均每步回报。具体来看,PARL 相比最优的 RL 基线算法平均提升 14.7%,相比 BS 策略提升达到 45%。这类提升尤其体现在网络结构更复杂、库存资源更受限的场景下。相反,在供应充足、库存无限的设定中,各类方法表现相近,因为高供应能力本身弱化了策略差异带来的影响。

进一步的策略分析揭示了 PARL 在处理成本权衡和动态库存约束方面的优势。在高库存高不确定性情形,PARL 能更有效地区分策略间微妙的回报差异。在复杂结构中,PARL 会主动减少订货频率、增大单次批量,从而降低整体订货成本。此外,在 backorder 设置下,PARL 学到的策略高度接近解析最优解(如 order-up-to 策略),其在原文图6中的订货行为几乎与封闭解重合。这说明 PARL 不仅在经验上表现优异,在结构上也能逼近最优控制策略。

在更具挑战的 lost sales 环境中,PARL 仍表现出稳定性与优越性。无论售价、提前期如何变化,PARL 所学策略在大多数设定下与最优启发式结果差距在 1%~5% 之间,远优于其他 DRL 方法。这些发现强调了 PARL 在无封闭解、不规则结构下的实用性与鲁棒性。

尽管 PARL 的底层优化涉及混合整数规划,实验也展示了其在计算效率方面的可接受性。在高维动作空间中,平均每步求解时间保持在 0.04 到 0.18 秒之间,且通过并行计算和合理资源调度,可以将整体训练时间控制在数十小时之内。对比来看,PPO 的运行速度更快,但在策略表现上明显逊色。

为提升性能,作者针对不同 RL 算法和实验设置进行了大规模超参数调优,累计测试超过 4700 组参数组合。包括神经网络结构、激活函数、学习率、折扣因子、状态表示等均进行了系统评估。例如,在 PPO 中,使用 KL divergence 提前终止更新被发现比固定迭代数更稳健,而 ReLU 激活函数整体优于 Tanh. 实验还验证了模型在更大网络规模和使用开源求解器(如 SCIP、Pulp-CBC)下的可扩展性,证实 PARL 具备在中大型供应链系统中实用部署的潜力。

综合来看,PARL 的方法论在策略表达力、计算效率与泛化能力之间取得了良好平衡。其最大的优势在于能显式建模库存约束和状态变量,结合神经网络的值函数近似能力,将传统运筹优化与深度学习有效融合。在多仓网络、异质需求、失销回补等复杂情形下,PARL 为缺乏启发式或无解析解的实际问题提供了一种高度实用且效果显著的解决方案。

4 结论

文章提出了一种基于强化学习的方法,用以求解供应链与库存管理中的一些解析难以处理的问题。许多实际问题具有组合性极强的动作空间以及状态依赖的约束。因此,文章提出了一种称为 PARL 的算法,该算法结合整数规划与样本平均逼近方法,从而系统性地考虑不确定性,并提供了一种优化大规模动作空间的原则性方法。

随后,文章将 PARL 应用于供应链网络中的库存补货与分销决策问题,并展示了其在多个具有现实复杂性的情境下的优越表现,这些复杂性包括:网络节点间需求的异质性、供应路径上的不同运输时间,以及lost sales场景。

此外,文章在最后还提出了多个未来研究的方向。例如,一个潜在且有价值的研究方向是:将该方法拓展到需求分布未知的环境中。在这类情形下,可以利用历史销售数据,通过在线学习方法持续估计需求分布,并提升需求预测的精度。改进后的预测结果可被直接用于生成补货策略,配合所提出的 PARL 框架。另一个有趣的方向是将该方法拓展到 order fulfillment 问题中,即在需求已知时,决定从哪个节点进行配送。同样地,也可以尝试将文章中的基于整数规划的算法推广至不同的神经网络结构和激活函数中。

最后,作者表示,尽管文章的方法在计算性能上已较为先进,基于整数规划的方法仍然存在运行时间长、计算资源需求大的问题。因此,构造更高效的、近似最优的整数规划模型,将是未来重要的研究方向。例如,可通过启发式近似、问题分解 decomposition) 或专为库存优化设计的神经网络结构来实现进一步提速,这些均是值得探索的研究路径。

文章开发了一个开源的 Python 库,用于快速实现各种强化学习算法与 PARL方法,方便研究者在不同库存管理问题中测试与应用。现有Github repo尚在维护,所以本次解读暂不讨论该部分。

参考文献

Rong Y, Atan Z, Snyder LV (2017) Heuristics for base-stock levels in multi-echelon distribution networks. Production Oper. Management 26(9):1760–1777.

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐