14231d68a83164834e4f27be79e4b23b.png

文章信息

cae12eea9ff941e53aeb4966a84d0829.png

论文题目为《Traffic Prediction With Missing Data: A Multi-Task Learning Approach》,该文于2023年发表于IEEE TRANSACTIONS ON INTELLIGENT TRANSPORTATION SYSTEMS上。文章提出了一种用于带有缺失数据的交通预测多任务学习方法。

cbae29bf1e4c34cd2a790984489c38f0.png

摘要

c4358c24c91bd0a9756907cbd384d4e6.png

基于真实交通数据的交通速度预测是智能交通系统(ITS)中的一个经典问题。现有的交通速度预测模型大多是基于交通数据完整或缺失值较少的假设。然而,由于各种人为因素和自然因素,在现实场景中收集的这些数据往往是不完整的。虽然先用插值模型估计缺失值,再用预测模型来解决这个问题,但前者可能会破坏关键的潜在特征,进而导致误差积累问题。为了解决这个问题,我们提出了一种基于图的时空自编码器,该编码器遵循编码器-解码器结构,用于具有缺失值的时空交通速度预测。具体来说,我们将代入和预测作为两个并行任务,依次进行训练,以消除代入对原始数据预测的负面影响,加快模型训练过程。此外,我们利用具有自适应邻接矩阵的图卷积层进行空间依赖关系建模,并应用门控循环单元进行时间学习。为了评估建议的模型,我们对两个真实世界的交通数据集进行了全面的案例研究,这些数据集具有两种不同的缺失模式,缺失率范围从20%到80%不等。实验结果表明,该模型在缺失场景和预测范围内的预测性能稳定,持续优于当前基于缺失值的交通预测方法。

ef48a4f92b3c177fc2b244d5efdfb638.png

引言

269151a611eb2e89c95b711be0172881.png

以往的方法在实际研究中存在明显的差距,特别是在交通数据不完整或损坏的情况下。现有的大多数交通预测方法都是基于交通数据完整或很少有缺失值的假设提出的。然而,当缺失值较多时,它们的预测能力较差或较差。以基于注意力的时空图卷积网络(Attention - Based Spatial-Temporal Graph Convolutional Networks, AST- GCN)为例,其预测性能如图1所示,随着缺失率的增加,其预测性能出现了明显的下降,例如,当缺失率从20%增加到80%时,MAPE从8.18%上升到12.20%。此外,在实际采集的交通数据中,由于各种因素的影响,数据缺失是一个现实而常见的问题。例如,考虑到硬件故障和通信错误,大约有5%的交通数据在PeMS中丢失,在加拿大阿尔伯塔省的极端情况下,丢失率高达90%。在实际场景中,大多数现有的流量预测模型在多个数据集上由于数据缺失导致性能波动,这是现实生活中常见且不可预测的现象。因此,我们需要新的方法来处理具有缺失值的流量预测任务,并实现稳定的性能。

bb463c40bd23a90b9e4729a0d37537f1.png

对于有缺失值的交通速度预测,一种比较直接的解决方法是先用插值法估计缺失值,然后将输入的数据输入到预测模型中。虽然近年来出现了大量的交通数据输入方法,但直接叠加输入和预测模型有以下局限性。首先,在输入过程中学习到的实例级表示对于下游任务来说是不够的,下游任务需要细粒度的表示。例如,插值方法倾向于使用平均值来估计缺失位置,导致插值结果过于平滑,特别是基于张量分解的方法。过度平滑的结果可能会失去交通数据的动态特征,进一步对下游任务(即交通速度预测)造成不利的误差积累。其次,数据输入结果对预测任务的影响尚未得到很好的研究,即准确的数据输入是否能提高预测性能。虽然有缺失值交通预测的研究,但使用传统的训练方法,简单地串联损失函数,可能会降低预测精度和模型的可解释性。此外,在简单场景下,与传统预测基线的性能比较不足以证明其优越性。

为了共同解决上述问题并填补研究空白,我们提出了一种新的基于图的深度学习模型时空自动编码器(GSTAE),用于缺失值交通速度预测。本文的研究重点是在历史交通数据中存在缺失值的情况下,提高交通预测的性能。GSTAE采用自编码器结构,将图卷积网络(GCN)与自适应相邻矩阵和GRU相结合,提取交通数据中复杂的时空依赖关系。受多任务学习的启发,GSTAE将输入和预测作为两个并行任务,而不是独立和连续的任务,以消除输入结果对预测的影响。GSTAE的编码器模块从缺失值的交通数据中提取广义表示。它能够通过连接不同的解码器模型来处理不同的下游任务。在训练过程中,我们设计了一个两阶段的训练范式,以实现多任务训练,提高预测精度。具体来说,训练从一个填补任务开始,该任务训练一个编码器,从缺失值的交通数据中提取密集表示。然后,基于预训练好的编码器对预测任务进行训练,在归算训练过程中充分利用领域特定信息,节省计算量。预训练后的编码器从缺失值的交通数据中提取广义表示后,解码器模块直接进行预测,消除误差累积问题。

本文的主要贡献总结如下:①提出了一种新的多任务学习深度神经网络模型,该模型遵循编码器-解码器结构,将输入和预测作为两个并行任务处理,以消除输入对预测任务的影响。②设计了一个两阶段的训练范式,以实现多任务训练,并提高在输入和预测任务上的性能。③通过对两个真实世界交通数据集和详尽的缺失场景的全面案例研究来评估提出的GSTAE。结果表明,GSTAE在具有缺失值的交通预测中始终优于现有的方法,这也验证了该模型的泛化能力。④研究了估算结果对预测模型的影响。结果表明,单纯拼接性能良好的插值和预测模型对于缺失数据的交通预测是不可行的。

b8c936e9e6f607e18709fd7316a89bba.png

问题定义

cbf896fcb389e6c6eb58661a574ed267.png

1.交通速度预测:交通速度预测的目的是基于城市交通网络传感器测量的历史数据来预测未来的交通速度,可以表示为:

a78dbcbd9caf91b8cc01bb3aef4b3ac0.png

3c2d3f705779b865a70f571d5f8fac21.png表示传感器的测量的历史数据,表示传感器的数量,Th 表示历史时间步数。交通速度预测问题需要建立一个函数 去预测未来Tp个时间的交通速度

2.交通网络图:本文将城市交通网络定义为ec3cfc92e080af768b985b68547aee6c.png,其中 表示传感器的集合, E 表示边集。邻接矩阵 表示图 G 中的传感器的关系,并由高斯核函数得出:

e8518ea79709a3c88f2d23484e74059a.png

其中,636b9b61b00601dd17e0e16193cb81e1.png表示节点 与节点 之间的欧式距离,4a0e431496cfe3e9074ba1946080d1ae.png为距离的标准差,db69d730e1e6ffcd09f14c899bea6cdb.png(预设值:0.5)是一个用于控制权重矩阵A稀疏性的阈值。

3.具有缺失值的交通速度预测:对于时间步长 t ,交通速度数据可表示为X(t)∈RN,在交通网络中所有 个传感器上观测到。记录缺失位置的缺失掩码M(t)∈RN 定义为:

ddf90cb9a3b9b1e3db2642c89dcf2ace.png

按照以往研究的惯例,我们研究了两种具有代表性的缺失模式,即随机缺失(Random missing, RM)和非随机缺失(Non-Random missing, NRM),定义如下:①随机缺失(RM):缺失值随机独立出现。图2a是随机缺失模式的一个例子,其中灰色单元格表示被掩盖(缺失)的值,白色单元格表示观测值。②非随机丢失(NRM):在实践中,传感器节点可能会故障很长一段时间,导致数据丢失。图2b是这种非随机缺失模式的一个例子。

16eac694fe1211be59e21f71c649d53f.png

对于有缺失值的交通速度预测任务,我们需要学习一个函数 g(·) ,它能够根据图 、历史第 T步交通速度 X 和对应的掩模矩阵 M 来预测接下来Tp步的交通速度。与 f(·) 相比,g(·) 考虑了交通数据中缺失的项目,其关系可以表示为:

6dfb3f686215dff6533dfc37f789de02.png

006db8444e145f347b3b565a6048d1f5.png

模型

2c3856d1950f3c16234fdb273dd1febb.png

1.GSTAE概述:图3a显示了GSTAE的总体结构。该模型结构为编码器-解码器结构,编码器模块从具有缺失值的历史交通数据中提取复杂的时空依赖关系,并将其表示为适合下游任务的广义密集表示。解码器耦合到执行特定的下游任务,例如,输入和预测,使用编码器模块的广义表示。在训练过程中,可以直接用缺失值训练交通预测任务。然而,从具有缺失值的历史交通速度数据到未来交通速度数据的训练任务具有挑战性和复杂性。的确,我们可以将任务分成两个子任务,一个用于处理缺失值的历史数据并输入历史数据,另一个用于处理输入的交通数据并预测未来的交通速度。然而,累积的估算和预测误差会对综合性能产生不利影响。我们将编码器模块作为从输入数据中提取特征的统一框架,适用于各种下游任务,例如,输入和预测。由于预测任务和预测任务具有不同的特点,因此对预测任务和预测任务进行顺序训练。它可以看作是在从缺失值的历史数据中预测未来交通速度和将该任务划分为估算和预测子任务之间的权衡。首先,我们用输入任务训练模型,使编码器能够从原始数据中提取缺失值的密集表示。换句话说,输入是一项辅助任务,可以加快和改进后续预测。我们将编码器视为一个统一的框架,用于提取适合各种下游任务的数据的密集表示。因此,编码器从原始数据中提取特征,而不带来为特定任务量身定制的附加特征。对于交通估算,现有的方法往往会对输入的交通动态进行平滑处理,这可能不适合后续的交通预测。编码器模块经过输入任务的训练后,从缺失值的交通数据中提取广义表示。预训练的编码器可以加快和改进后续的预测训练。综上所述,我们提出了一种基于编码器-解码器的GSTAE模型,从缺失值的交通数据中提取广义密集表示,并处理两项下游任务,即交通数据的输入和预测。

交通数据输入:由于遵循编码器-解码器结构的模型在学习隐藏表示和重建数据方面表现出优势,我们按照编码器-解码器结构设计GSTAE。我们首先用imputation任务训练提出的GSTAE,从原始数据中提取缺失值的表示。经过训练过程,GSTAE模型可以处理流量估算任务。我们假设编码器已经从缺失值的原始数据中提取了良好的表征,并且可以传输预训练的编码器以加速预测训练过程由于交通数据是时间序列,历史交通状态对未来动态有显著影响,使未来状态反映历史状态。此外,交通数据在交通网络拓扑中包含复杂的空间依赖关系。因此,我们设计并采用双向递归ST-Block来提取相关的时空依赖关系。对于解码器结构,我们使用前向循环ST-Block自回归生成预测输出。

9f8ee20847e3516bc40ebd33ea6e93e1.png

ea74d279204464404fec75559659711d.png

2.时空模块:图3b为ST-Block的细节,ST-Block由GCN层和GRU层组成。以编码器模块中的前向ST-Block为例,在时间步长 t 时,H(0)(t)∈RN×D为输入,其中 N 为传感器节点数, D 为隐藏特征维数。通过提取相关时空依赖关系的过程,生成ST-Block H(l)(t)的输出。此外,为了防止过度平滑的问题,我们在ST-Block的末端应用了残差连接。对于每个ST-Block,我们确保输入和输出数据维度相同,以允许残差连接操作。

3.训练与推理:由于GSTAE提出处理两个子任务,即imputation和prediction,所以典型的端到端训练方案不适合GSTAE。此外,由于输入和预测任务的复杂性差异较大,常见的多任务训练策略,如通过计算所有子任务的损失函数来一起训练,也不适合GSTAE。我们将预测任务作为主要任务,将imputation任务作为辅助任务来解决这些问题,并通过两阶段训练范式对模型进行训练。首先,对输入任务进行训练,使GSTAE的编码器模块能够从原始数据中提取缺失值的密集表示。经过归算训练后,对GSTAE模型进行交通预测任务的训练。综上所述,考虑到输入和预测任务的复杂性有很大的不同,输入和预测任务是顺序训练的,而不是一起训练。此外,通过对输入任务的第一次训练,编码器模块可以获得合适的参数集,从输入数据中提取密集表示。它可以加快后续预测任务的训练过程,而预测任务比估算任务复杂得多。

9124ca1873f36a385a85e68d55738d12.png

实验

3a9bcede93e9a3f3d91671305e6684ba.png

1.数据集和配置:所有的案例研究都是在两个真实的数据集上进行的:PEMSD7和METR-LA。按照惯例,这两个数据集的ground truth中的所有缺失数据都采用线性插值法进行输入,并在评估阶段剔除。在本研究中,我们研究了两种缺失模式,如前面第三节所述,缺失率范围从20%到80%,以20%为区间。对于每个样本,缺失值根据特定的缺失模式被掩盖。对于交叉验证,每个数据集被分成不重叠的训练、验证和测试子集,分别占完整数据集的60%、20%和20%。为了评估预测性能,我们采用均方根误差(RMSE)、平均绝对误差(MAE)和平均绝对百分比误差(MAPE)作为评估指标,它们的定义如下:

39bf46df80d38b89761f12adb7951552.png

2.预测精度:我们首先比较了GSTAE与基线的预测精度。缺失数据流量预测的一种常见做法是用外部的数据输入模型来输入不完整的数据,然后将输入的数据输入到预测模型中。因此,我们结合最先进的交通估算和预测方法来开发典型的两阶段交通预测的基线。

0417eee98533f86abc979fa68693249c.png

3.消融实验:在本研究中,我们进行了消融实验,以验证每个GSTAE子模块对整体性能的贡献。研究了GSTAE的以下四种变体:①No-adp:对于图卷积层,去除了自适应相邻矩阵②No-GCN:对于图卷积层,去除了自适应相邻矩阵,地理定义矩阵被单位矩阵取代③No-GRU:门控循环单元被线性层取代④ST-Blocks:ST-Blocks 中的残留连接被移除。

a685a6b8c4b2f4ceb27d9dfcf6fee0a1.png

4.超参数测试:在本节中,我们研究了三个重要的超参数的敏感性和影响,即ST-Block的维数D、堆叠的ST-Block的个数L和全连通层的隐藏维数K。具体来说,这三个超参数分别设为D∈{16,32,64,128},L∈{1,2,3,4},K∈{64,128,256,512}进行评估。

279c5c2eb57f1e040d46104f22965dfd.png

50e1bccd6d43d5980fa7e06d3842ec15.png

结论

3ecf009e28dd529f2bd9d269b9914ce5.png

本文提出了一种新的多任务学习深度神经网络模型GSTAE,该模型采用编码器-解码器结构来处理具有缺失值的交通速度预测任务,并消除了输入和预测过程中的误差积累问题。通过两阶段训练范式,所提出的多任务学习深度神经网络模型GSTAE在交通数据输入和缺失值交通预测两个子任务上都取得了优势和稳定的性能。然而,由于GRU模块迭代处理数据,不能并行化,因此在大规模数据集上采用该模型并预测长期交通速度需要大量的计算量。在未来,我们将通过使用CNN和Temporal Convolution layer (TCN)等模块改进模型结构来加速训练过程。此外,带缺失值的长期交通预测也是一个值得研究的方向。

ab202039d06a7325aff48cb1ce4b8897.png

Attention

b264ae18c4ec13c0cd671f28f349e48d.png

欢迎关注微信公众号《当交通遇上机器学习》!如果你和我一样是轨道交通、道路交通、城市规划相关领域的,也可以加微信:Dr_JinleiZhang,备注“进群”,加入交通大数据交流群!希望我们共同进步!

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐