训练集来自和开发集不同的分布,误差显示有数据不匹配的问题,该如何解决?

这个问题没有完全系统的解决方案,但有一些可以尝试的事情。

在这里插入图片描述
翻译为:

  • 人工做误差分析,尝试了解训练集(training set)和开发集(dev set)的具体差异。
  • 使训练集更像开发-测试集,或收集更多的像开发-测试集的数据。

这里只给出粗略的指南,列出可以做的尝试。这不是一个系统化的过程,并不一定能保证make progress。
但是这种manual insight,我们可以一起尝试收集更多的和真正重要的场合相似的数据,这通常有助于解决很多问题。

要使训练数据(training data)更像开发集数据(dev data),我们可以用人工合成数据的方法。
在这里插入图片描述
人工合成数据的潜在问题:
当重复使用car noise的次数过多,会有对car noise过拟合的风险。
在这里插入图片描述
总而言之:
如果你认为存在数据不匹配的问题,最好做一些误差分析,看一下训练集training set和开发集dev set,试图了解和找出这两个数据的分布到底有何不同。
然后看看是否有办法收集更多看起来像开发集的数据作为训练集数据。谈到的一种方法是人工合成数据。在使用人工合成数据时,一定要谨慎,要记住你有可能从所有的可能性空间只选了很小一部分去模拟数据。

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐