最近,用pd.read_csv读取csv文件遇到了很多问题,解决一个又来一个,很头大!!!
其中一个错误如下:

pandas.errors.ParserError: Error tokenizing data. C error: EOF inside string

后来百度说是csv文件里面的数据有问题,但是我这csv文件几百万行数据我也不能一个一个查看订正,经过几番尝试之后,找到一个解决方案,在读取的时候加上error_bad_lines=False属性,如下:

pd.read_csv(FILE_PATH,encoding="utf-8",error_bad_lines=False)

这个属性的意思是跳过超出header字段的行,相当于忽略有额外错误信息的行

以为解决了,结果后面又出现了,然后我又加上了engine=“python”属性:

pd.read_csv(FILE_PATH,error_bad_lines=False,encoding="utf-8",engine='python')

这一次算是差不多解决了,后面又报了这个错误:

'utf-8' codec can't decode byte 0x90 in position 4967: invalid start byte

然后,我就把encoding="utf-8"改成了encoding=“gbk”,结果还是报错,错误如下:

UnicodeDecodeError: 'gb2312' codec can't decode byte 0x90 in position 4967: illegal multibyte sequence

一整个酸Q住了,emo了很久,决定采用非法手段,我把要读取的文件用记事本打开,然后另存为,在另存为的页面,我们可以修改另存为后的编码格式,我就统一改成了utf-8:
在这里插入图片描述
最后统一用utf-8编码格式读取,问题差不多解决了,如果有什么更好的方法,欢迎大家评论区留言!

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐