read_csv()参数之encoding——看这篇就够了

小蟒蛇的进阶

12755人浏览 · 2023-03-28 10:04:18

小蟒蛇的进阶 · 2023-03-28 10:04:18 发布

前言

最近被问到：为什么CSV文件读不出来？

一看报错：'utf-8' codec can't decode byte 0xb3 in position 0: invalid start byte

其实这个问题很常见，解决起来也很简单。也顺便介绍一下 read_csv() 的 encoding 参数。走起！！！

正文

首先，介绍一下 encoding 参数。该参数指的是文件的编码方式，Python 中或者是 pandas 中默认是 'utf-8' 的编码方式，所以在读取CSV文件时也是使用 utf-8 的方式进行解码。但不是所有的文件都是 utf-8 的编码方式，因此，pandas.read_csv() 中设置了一个 encoding 参数来专门处理之一情况。

编码方式有哪些呢？这篇文章不回答这个问题，如果感兴趣可以移步：codecs — Codec registry and base classes — Python 3.11.2 documentationSource code: Lib/codecs.py This module defines base classes for standard Python codecs (encoders and decoders) and provides access to the internal Python codec registry, which manages the codec and...https://docs.python.org/3/library/codecs.html#standard-encodings

这里只介绍解决方法：重点！重点！重点！

步骤一：用记事本打开CSV文件，看右下角

步骤二：这里避开水印放大展示，这个CSV文件是 ANSI 的编码方式，utf-8 不能成功解码，因此，需要手动修改默认参数。

步骤三：传递参数。将编码方式以字符串的形式传递给 encoding 参数，如下：

import pandas as pd
df = pd.read_csv('D:\Document\CSV\city.csv', encoding = 'ANSI') 
# ANSI 小写也可以

最后当然就是顺利运行代码，读取到你想要的数据。

AtomGit开源社区

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念，把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起，为开发者提供从开发、训练到部署的一站式体验。

更多推荐

AI 浪潮终章奏凯！GitCode & 文心大模型 & 智源研究院 AI 应用开发大赛圆满落幕

AtomGit开源社区

1.8B 体积、33 种语言互译｜腾讯混元 HY-MT1.5-1.8B 多语言机器翻译模型上线

在跨语言交流日益频繁的今天，阅读外语菜单、处理多语言邮件、与不同语言背景的人沟通，已经成为很多人日常工作与生活的一部分。过去，这类需求往往依赖联网翻译工具，而如今，—— 一部设备即可支持的相互翻译。当 AI 不再只是“逐字直译”，而是开始理解语境、风格与语言之间的细微差异，机器翻译就真正具备了今天为大家介绍一款高质量、多语言、支持端侧部署的机器翻译模型 ——，现已上线 AtomGit AI 社区，