read_csv()参数之encoding——看这篇就够了
·
前言
最近被问到:为什么CSV文件读不出来?
一看报错:'utf-8' codec can't decode byte 0xb3 in position 0: invalid start byte
其实这个问题很常见,解决起来也很简单。也顺便介绍一下 read_csv() 的 encoding 参数。走起!!!
正文
首先,介绍一下 encoding 参数。该参数指的是文件的编码方式,Python 中或者是 pandas 中默认是 'utf-8' 的编码方式,所以在读取CSV文件时也是使用 utf-8 的方式进行解码。但不是所有的文件都是 utf-8 的编码方式,因此,pandas.read_csv() 中设置了一个 encoding 参数来专门处理之一情况。
这里只介绍解决方法 :重点!重点!重点!
步骤一:用记事本打开CSV文件,看右下角

步骤二:这里避开水印放大展示,这个CSV文件是 ANSI 的编码方式,utf-8 不能成功解码,因此,需要手动修改默认参数。

步骤三:传递参数。将编码方式以字符串的形式传递给 encoding 参数,如下:
import pandas as pd
df = pd.read_csv('D:\Document\CSV\city.csv', encoding = 'ANSI')
# ANSI 小写也可以
最后当然就是顺利运行代码,读取到你想要的数据。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐
https://docs.python.org/3/library/codecs.html#standard-encodings

所有评论(0)