合成数据增强用于表格检测:使用自动生成的文档图像重新评估TableNet性能
Krishna Sahukara, Zineddine Bettouche, Andreas Fischer
Deggendorf Institute of Technology
Dieter-Görlitz-Platz 1, 94469 Deggendorf
krishna.sahukara@stud.th-deg.de, {zineddine.bettouche, andreas.fischer}@th-deg.de
摘要
通过智能手机或扫描仪捕获的文档页面通常包含表格,但手动提取速度慢且容易出错。我们引入了一种基于LaTeX的自动化流水线,该流水线可以合成具有视觉多样化的表格布局和对齐的真实掩码的真实两栏页面。生成的语料库增强了现实世界的Marmot基准,并使TableNet能够进行系统的分辨率研究。在我们的合成数据上训练TableNet,在256×256输入分辨率下的合成测试集上实现了4.04%的逐像素XOR错误率,在1024×1024下实现了4.33%。在Marmot基准上的最佳性能为9.18%(在256×256下),同时通过自动化减少了人工标注的工作量。
索引术语 - 文档图像分析,深度学习,合成数据生成,表格结构识别,语义分割,TableNet,性能评估
I. 引言
智能手机和扫描仪被用来捕捉包含重要信息的表格文档图像。手动提取耗时。然而,由于缺乏带注释的数据集,开发有效的深度学习模型用于表格检测具有挑战性。
数据增强已被公认为是深度学习研究中的关键技术,有调查强调了其在解决训练数据限制和提高模型泛化能力方面的有效性[1],[2]。虽然这些研究探讨了各种领域中的大量增强策略,但文档图像中的表格文本数据呈现的独特挑战尚未在现有文献中得到充分解决。我们的合成数据生成方法借鉴了生成建模的原则,类似于我们在流程挖掘中的工作[3],但针对表格文档图像的结构和视觉复杂性进行了定制。
为了解决这一挑战,我们提出创建一个专门用于表格检测的数据集。我们的方法自动完成了标注过程,减少了人工工作量,并确保了多样化数据集以支持稳健的模型训练。通过应用深度学习,我们旨在开发一种能够自主识别和提取文档图像中表格区域文本的系统。
我们探索了一个端到端的深度学习模型,将表格检测和结构识别集成在一起,简化了流程并提高了效率。该模型将表格检测和结构识别视为相互关联的任务,
通过提升准确性并减少计算需求,使其适用于资源受限的实际应用场景。
我们的方法通过结合新生成的数据集和基于分辨率感知的TableNet基线来改进表格检测。由此产生的模型促进了大规模文档处理和信息检索等下游任务。
贡献:本文的主要贡献如下:
- 一种自动化的LaTeX流水线,可渲染带有多种表格样式的页面级合成文档,并附带对齐的真实掩码;
-
- 一个公开的语料库和代码库,可实现可重复的训练和评估;
-
- 对TableNet在两种输入分辨率(256×256 vs. 1024×1024)下的广泛比较,以分析性能权衡;
- 至于本文的结构,第二部分介绍所用技术,第三部分综述先前工作,第四部分详细说明数据集和评估协议,第五部分描述实现细节,第六部分展示结果及其讨论,第七部分总结全文并展望未来方向。
II. 背景
本节介绍了所使用的网络VGG-19和TableNet的背景。
A. VGG-19
VGG-19 [4] 是一个由19层组成的网络,堆叠了3×3卷积和2×2最大池化操作。尽管它已经有些年头了,但其简单的设计和公开可用的ImageNet权重使得VGG-19成为特征提取的便捷骨干;因此,我们将它作为TableNet基线中的共享编码器。
B. 图像分割
语义分割 [5] 不是生成粗略边界框,而是为每个像素分配一个语义标签。最先进的方法是全卷积的,并受益于在大型分类语料库上预训练的编码器权重,即使特定任务的训练数据有限,也能实现准确的密集预测。
C. TableNet
早期的深度学习方法将表格和列检测视为独立的问题。然而,由于列的垂直排列,独立搜索列经常导致误报,从而影响准确检测。利用表格区域的知识,通过卷积滤波器同时检测表格和列改善了列检测。
TableNet [6] 利用编码器-解码器模型进行语义分割,采用相同的编码器处理两个任务,并分别为每个任务设计不同的解码器。该架构结合了预训练的VGG-19特征、共享的编码器层以及分别用于表格和列分割的特定解码器分支。每个分支使用卷积层和转置层进行特征图维度缩减和像素类别预测。
III. 相关工作
关于表格理解的各种研究和综述[7][10]探讨了表格识别和数据提取,通常分别报告结果[11]。在深度学习出现之前,表格识别依赖于启发式方法或元数据。早期的研究如TINTIN[12]和Cesarini等人[13]的工作涉及使用MXY树和层次表示与Tabfinder进行结构信息和机器学习技术的表格识别。
其他方法如T. Kasar等人[14]专注于检测相交线并使用SVM分类器,但受制于可见的指导线。概率模型如Silva等人[15]强调使用联合概率分布和隐藏行状态组合多种方法。
虽然表格检测受到了广泛关注,但表格结构识别的关注度相对较少。值得注意的是Kieninger和Dengel提出的T-RECS方法[16],Wang等人提出的七步表格结构理解过程[17],以及Shigarov等人提出的结合了大量配置选项和PDF元数据的系统[18]。
最近的发展已将深度学习融入表格检测和结构识别,如Hao等人[19]和Tran等人[20]的方法,两者都取得了竞争性的表现。DeepDeSRT [21],[22]以及Aswin等人[23]和Singh等人[24]的工作利用深度学习和目标检测技术提高了表格检测和结构识别,显示了在性能和从不同文档格式中提取数据方面的进步。
近期的大规模合成语料库,如SynthTabNet [25]、PubTables-1M [26] 和 DocBank [27] 加速了表格理解的研究。这些资源的一个共同特点是,发布的图像通常包含孤立的表格裁剪,而不是完整的文档页面。虽然这有助于快速训练单元格结构识别,但在联合布局分析方面提供的上下文有限。相比之下,我们自动生成的数据集将表格嵌入双栏科学页面中,因此模型必须考虑邻近的文本、标题和图形区域,而不仅仅是表格区域本身。
除了新数据集外,最近的架构也提升了性能。基于Transformer的检测器如TableTransformer [28] 和类似TableFormer [29] 的编码器-解码器方法在PubTabNet上取得了最先进的结果,而如Cascade Mask R-CNN [30] 的两阶段检测器在密集布局基准中仍然具有竞争力。与其对所有可用方法进行基准测试,我们有意专注于代表性的编码器-解码器基线(TableNet),以隔离数据增强和输入分辨率的影响;整合互补检测器留待后续研究。
IV. 方法论
本节介绍数据集、我们的生成方法和评估方法。
A. 使用的数据集:Marmot
Marmot数据集 [31] 是一个大规模的文档图像集合,常用于表格检测。它是评估现实场景中表格检测算法的工具。该数据集保持接近1:1的正负样本比例,涵盖诸如研究论文和表单等多种文档类型。其真实性突显了其在真实世界挑战模型训练中的相关性。
Marmot数据集存在费力的手动注释问题,既耗时又昂贵。
B. 提出的生成方法:新颖的训练数据
我们提出了一种自动生成广泛训练数据的方法。
我们的评估包括合成到合成和合成到真实的测试场景:模型在我们生成语料库的保留部分上验证,并且在外部Marmot基准上独立验证。这种双重协议使我们能够区分领域特定效应和纯粹的架构因素。
所提出的方法以四个参数作为输入:行数、列数、数据类型和表格样式。这些参数保存为评估的真实值。利用Python脚本中的LaTeX和Lorem Ipsum,输出是用于训练表格检测模型的图像。
生成的表格分为五种不同的样式(图1)。每个自动生成的表格填充了符合列数据类型的统计有效假数据:数值列包含高斯分布值(μ=0,σ=1),文本列使用马尔可夫链生成的Lorem Ipsum,日期字段则遵循2000至2023之间的均匀分布。生成的图像有两种类型:表格周围有文本,或者页面上只有表格本身(图2(a)和(b))。
C. 偏差缓解
为了应对合成数据的局限性,我们实施了以下措施:
- 样式随机化:15%的概率应用非西方表格特征(从右到左文本,垂直标题)

图1. 生成表格的样式:虚线,无垂直边框,彩色标题,无顶部/中间/底部规则,以及booktabs。

图2. 生成图像的类型:(a) 包含文本;(b) 不包含文本。
- 噪声注入:通过泊松噪声 (λ = 0.1) 和随机透视变换模拟扫描伪影。
-
- 颜色变化:10% 的表格使用浅蓝色/红色背景代替标准白色。
D. 评估方法
1) 指标:位运算 XOR: 主要评估指标是像素级 XOR 错误率。替代区域指标如交并比 (IoU)、F1 分数或平均精度均值 (mAP) 在目标检测中广泛使用;然而,它们在边界框级别总结性能,对于界定表格单元的细边不敏感。初步实验表明,小的边框偏移可能几乎不会改变 IoU,但会明显增加视觉误差。因此,我们关注 XOR,它计算每个误分类像素,因此对表格边界更具辨别力。设 P 为网络生成的二进制预测掩码,G 为相应的地面实况掩码;两者具有相同的空间分辨率 H × W。
XOR 错误率=∣P⊕G∣H×W \text{XOR 错误率} = \frac{|P \oplus G|}{H \times W} XOR 错误率=H×W∣P⊕G∣
V. 实现
A. TableNet模块
本工作中使用了TableNet [6] 的实现。TableNet 是一个基于 TensorFlow 的模型 [32],用于灰度图像中的表格和列分割,训练于 Marmot 数据集。为确保统一的输入尺寸为 256x256 像素的图像和 1024x1024 像素的掩码,图像通过调整大小和归一化进行预处理。
TableNet 架构利用预训练的 VGG-19 基础来进行特征提取,处理分辨率为 1024x1024 或 256x256 的 RGB 图像。对于每个语料库——即本文介绍的合成图像和原始 Marmot 页面——我们随机拆分数据,使用 90% 的图像进行训练,剩余 10% 用于测试。两条解码路径,分别用于表格和列分割,结合了卷积层和上采样层,以及来自 VGG-19 的特征图拼接。
训练通过使用稀疏分类交叉熵损失函数和 L2 正则化 (λ = 0.001) 来最小化分割误差,以防止过拟合。我们采用了梯度裁剪(阈值=1.0)以稳定训练。Adam 优化器的学习率为 0.0001,epsilon 值为 1e−08,用于权重调整。训练进度通过 DisplayCallback 进行可视化监控,ModelCheckpoint 和 EarlyStopping 用于根据验证损失保存模型和提前停止。
总之,该模块使用 TensorFlow 实现了 TableNet,利用 TensorFlow 函数进行预处理,VGG-19 基础进行特征提取,Adam 优化器进行训练。回调功能启用训练进度监控以获得最佳分割结果。
B. 代码和数据可用性
我们的完整实现和合成数据集可在我们的代码仓库 [33] 公开获取。仓库包含了本文所使用的所有数据生成脚本、预处理工具、训练模型和评估代码。数据集包括本文讨论的所有表格样式的样本。
C. 预测模块
该模块实现了一个 TensorFlow 预测流水线,用于 PNG 图像上的表格和列掩码预测。选择 PNG 格式而非 JPEG 和 BMP 是因为其无损压缩特性,可以保留图像质量而不引入伪影。该流水线利用自定义训练的 TableNet 模型来分割表格和列。通过提供样本文件夹路径和图像尺寸作为输入,用户可以使用该流水线进行掩码预测和结果可视化。这个端到端解决方案启用了表格和列的分割,

图4. Marmot数据集样本图像及256×256模型预测掩码

图5. Marmot数据集样本图像及1024×1024模型预测掩码
图像数据,促进文档处理和数据提取等任务。
VI. 结果与讨论
历元范围通过逐步验证确定:尽管256×256模型由于内存占用较低可以使用更大的批量大小(256而不是1024×1024模型的64),但它们仍需要更多训练周期才能收敛。我们认为这是由于低分辨率下空间细节减少,减缓了学习速度。相反,高分辨率模型受益于早停机制以防止过拟合。本节分析了TableNet模型在两个分辨率下(256×256和1024×1024)生成的预测图像。目标是评估这两种模型在表格检测中的准确性和有效性。两个模型都训练了多个周期集以避免过拟合。
256×256模型的性能在多个历元间隔进行了评估。在Marmot数据集上最低的XOR错误率为9.18%,出现在500个历元。在我们的合成数据集上,错误率随着进一步训练继续下降,在1540个历元达到4.04%,这表明模型在合成数据上能从延长的训练中受益(表I)。一个示例结果如图4所示。
将输入分辨率增加到1024×1024会影响性能。该模型在Marmot数据集上最佳结果是在150个历元时达到了**13.83%的错误率,而在更高历元时性能退化。在我们的合成数据集上,1024×1024模型在760个历元时达到了4.33%**的最低错误率(表I)。示例预测结果如图5和图6所示。

图6. 新数据集样本图像及1024×1024模型预测掩码
表I
跨模型配置和数据集的XOR错误率 (%) 比较分析。每种模型分辨率和数据集组合的最低错误率以粗体显示。
| 模型 | Marmot | 新型(合成) |
|---|---|---|
| 256×256(240个epoch) | 12.14% | 10.50% |
| 256×256(500个epoch) | 9.18% | 5.41% |
| 256×256(1540个epoch) | 11.69% | 4.04% |
| 1024×1024(150个epoch) | 13.83% | 5.75% |
| 1024×1024(260个epoch) | 14.33% | 4.59% |
| 1024×1024(760个epoch) | 13.91% | 4.33% |
结果显示了输入分辨率的混合影响。在合成语料库中,较低的256×256分辨率比1024×1024模型稍好一些(4.04% vs 4.33%)。相反,Marmot基准测试在较低分辨率下表现更好,最佳256×256模型达到9.18%,而对应的1024×1024模型为13.83%。因此,在我们的实验中,较高的分辨率并未普遍改善合成或真实数据的表现。
研究结果还表明,最佳训练轮次因数据集和分辨率而异。虽然合成数据集受益于更长时间的训练(例如256×256模型可达1540轮次),但Marmot数据集显示,在低分辨率模型超过500轮次后出现了过拟合迹象。
使用256×256输入尺寸训练的TableNet模型在预测表格区域时表现出有限的准确性。在某些情况下,它完全无法检测到表格区域。减少训练轮次可以改善检测效果,尽管预测的掩码中会出现噪声边框和空白区域。相反,1024×1024模型在合成语料库上提供了更清晰的预测——反映在其最低的4.33% XOR错误率上——然而,与256×256模型相比,它在Marmot基准测试中的表现不佳。后处理(去噪和小物体过滤)进一步优化了高分辨率掩码,但并未改变这一总体趋势。这些混合的结果表明,仅靠更高的输入分辨率并不是万能的解决方案,合成数据和真实数据之间的领域差异起着决定性作用。位运算XOR错误率成为一个关键指标,量化了真实值和预测掩码之间的像素级差异,从而评估误分类像素。
VII. 结论
本文介绍了一种完全自动化的合成文档图像生成流水线,旨在解决表格检测所需标注数据的稀缺问题。我们的主要贡献是一个框架,不仅减少了人工标注工作量,而且使检测模型能够在可控和系统的基础上进行评估。通过对TableNet在我们生成的语料库上进行训练和测试,我们对输入分辨率进行了详细分析,发现更高的分辨率(1024×1024)并不总是优于更低的分辨率(256×256),特别是在转移到现实数据如Marmot基准时。
这项工作建立了一个可重复的基准,并证明合成到合成的评估方法能够提供关于架构依赖性的关键见解,独立于特定领域的噪声。在此基础上,未来的工作将扩展我们的框架以基准现代架构,如TableTransformer和Cascade Mask RCNN。我们还计划扩展数据生成器以产生更复杂的布局,集成OCR以实现端到端提取,并增强TableNet以增加专门的行识别分支,向完整的结构识别迈进。
我们的合成数据框架和所有相关代码都是公开可用的[33]。
参考文献
[1] C. Shorten和T. M. Khoshgoftaar,“关于深度学习的图像数据增强调查”,《大数据期刊》,第6卷,第1期,第60页,2019年。
[2] M. Bayer, M. Kaufhold, 和 C. Reuter, “文本分类数据增强调查,” ACM计算调查, 第55卷, 第1期, 第1-35页, 2022年.
[3] T. R. Anjali, Z. Bettouche, 和 A. Fischer, “从面向任务的用户画像合成搜索引擎查询,” 专家系统及其应用, 第213卷, 第118991页, 2023年.
[4] K. Simonyan 和 A. Zisserman, “用于大规模图像识别的超深层卷积网络,” arXiv 预印本 arXiv:1409.1556, 2014年.
[5] Y. Guo, Y. Liu, T. Georgiou, 和 M. S. Lew, “使用深度神经网络的语义分割综述,” 多媒体信息检索国际杂志, 第7卷, 第87-93页, 2018年.
[6] S. Paliwal, V. D, R. Rahul, M. Sharma, 和 L. Vig, “Tablenet: 用于端到端表格检测和从扫描文档图像中提取表格数据的深度学习模型,” 2019年.
[7] B. Couäsnon 和 A. Lemaitre, “表格和表单的识别,” 在《文档图像处理与识别手册》中, D. Doermann 和 K. Tombre 编辑. Springer London, 2014年, 第647-677页.
[8] R. Zanibbi, D. Blostein, 和 J. R. Cordy, “表格识别调查: 模型, 观察, 转换和推断,” 国际文档分析与识别期刊 (IJDAR), 第7卷, 第1期, 第1-16页, 2004年.
[9] A. C. e. Silva, A. M. Jorge, 和 L. Torgo, “设计一种端到端的方法来提取表格中的信息,” 国际文档分析与识别期刊 (IJDAR), 第8卷, 第2-3期, 第144171页, 2006年.
[10] S. Khusro, A. Latif, 和 I. Ullah, “PDF文档中的表格检测、提取和注释的方法与工具,” 信息科学杂志, 第41卷, 第1期, 第41-57页, 2015年.
[11] D. W. Embley, M. Hurst, D. Lopresti, 和 G. Nagy, “表格处理范式: 研究调查,” 国际文档分析与识别期刊 (IJDAR), 第8卷, 第2-3期, 第66-86页, 2006年.
[12] P. Pyreddy 和 W. B. Croft, “Tintin: 一个用于文本表格检索的系统,” 在第二届ACM数字图书馆国际会议上, 1997年, 第193-200页.
[13] F. Cesarini, S. Marinai, L. Sarti, 和 G. Soda, “可训练的文档图像表格定位,” 在2002年国际模式识别会议上, 第3卷, 2002年, 第236-240页.
[14] T. Kasar, P. Barlas, S. Adam, C. Chatelain, 和 T. Paquet, “使用线条信息在扫描文档图像中学习检测表格,” 在ICDAR会议上, 2013年, 第1185-1189页.
[15] A. C. e. Silva, “在文档分析中学习丰富的隐马尔可夫模型: 表格定位,” 在2009年第10届文档分析与识别国际会议上, 2009年, 第843-847页.
[16] T. Kieninger 和 A. Dengel, “T-ReCS表格识别与分析系统,” 在文档分析系统中, 系列计算机科学讲义, S.-W. Lee 和 Y. Nakano 编辑. Springer, 1999年, 第255-270页.
[17] Y. Wang, I. T. Phillips, 和 R. M. Haralick, “表格结构理解及其性能评估,” 模式识别, 第37卷, 第7期, 第1479-1497页, 2004年.
[18] A. Shigarov, A. Mikhailov, 和 A. Altaev, “在未标记PDF文档中可配置的表格结构识别,” 在2016年ACM文档工程研讨会, DocEng 2016, R. Sablatnig 和 T. Hassan 编辑. ACM, 2016年, 第119-122页.
[19] L. Hao, L. Gao, X. Yi, 和 Z. Tang, “基于卷积神经网络的PDF文档表格检测方法,” 在第十二届IAPR文档分析系统研讨会 (DAS) 2016年. IEEE计算机学会, 2016年, 第287-292页.
[20] D. N. Tran, T. A. Tran, A.-R. Oh, S.-H. Kim, 和 I.-S. Na, “使用文本块垂直排列从文档图像中检测表格,” 国际内容杂志, 第11卷, 第4期, 第77-85页, 2015年.
[21] S. Schreiber, S. Agne, I. Wolf, A. Dengel, 和 S. Ahmed, “Deepdesrt: 用于文档图像中表格检测和结构识别的深度学习,” 在2017年第十四届IAPR国际文档分析与识别会议 (ICDAR), 第1卷. IEEE, 2017年, 第1162-1167页.
[22] I. Kavasidis, S. Palazzo, C. Spampinato, C. Pino, D. Giordano, D. Giuffrida, 和 P. Messina, “基于显著性的卷积神经网络用于数字化文档中的表格和图表检测,” arXiv预印本 arXiv:1804.06236, 2018年.
[23] A. Tengli, Y. Yang, 和 N. L. Ma, “从示例中学习表格提取,” 在第20届国际计算语言学会议上. 计算语言学协会, 2004年, 第987页.
[24] P. Singh, S. Varadarajan, A. N. Singh, 和 M. M. Srivastava, “使用少样本目标检测的多域文档布局理解,” arXiv预印本 arXiv:1808.07330, 2018年.
[25] M. Agarwal, A. Mondal, 和 C. Jawahar, “Synthtabnet: 用于文档表格识别的合成生成数据集,” https://arxiv.org/abs/2105.01238, 2021年.
[26] B. Smock, R. Pesala, 和 R. Abraham, “Pubtables-1m: 致力于从非结构化文档中全面提取表格,” CoRR, 卷abs/2110.00061, 2021年. [在线]. 可用: https://arxiv.org/abs/2110.00061
[27] M. Li, Y. Xu, L. Cui, S. Huang, F. Wei, Z. Li, 和 M. Zhou, “Docbank: 文档布局分析的基准数据集,” 2020年. [在线]. 可用: https://arxiv.org/abs/2006.01038
[28] B. Smock, R. Pesala, 和 R. Abraham, “Table-transformer: 用于表格检测和结构识别的基于变压器的模型,” 在文档分析与识别-ICDAR 2021: 第16届国际会议, 瑞士洛桑, 2021年9月5日至10日, 论文集, 第一部分. Springer International Publishing, 2021年, 第590-604页.
[29] J. Yang, A. Gupta, S. Upadhyay, L. He, R. Goel, 和 S. Paul, “Tableformer: 面向表格-文本编码的鲁棒变压器建模,” 2022年. [在线]. 可用: https://arxiv.org/abs/2203.00274
[30] K. He, G. Gkioxari, P. Dollár, 和 R. Girshick, “Mask r-cnn,” 2018年. [在线]. 可用: https://arxiv.org/abs/1703.06870
[31] 北京大学计算机科学技术研究所. Marmot数据集. 于2024年4月30日访问. [在线]. 可用: https://www.icst.pku.edu.cn/cpdp/sjzy/
[32] TensorFlow作者, “Tensorflow,” https://www.tensorflow.org/, 2015年, 访问日期: 2024年5月10日.
[33] Z. Bettouche, “Tablenet增强,” https://github.com/zineddine-bettouche/tablenet-enhancement, 2024年.
参考论文:https://arxiv.org/pdf/2506.14583
更多推荐

所有评论(0)