如何使用python输出中文乱码来获取pdf文件里的文字，最好是不能乱码

风水堪舆学 | 网络营销 | 住宅风水 | 英文歌曲 | Adobe After Effects | 电脑配置 | 书籍改编电影 | 下载 | Legion | 网络推广 | 动画制作 | 赛事 | PLC | 小说创作 | 虚拟专用服务器 | 成语 | 家庭 | 单反相机 | 电视节目 | 投影机 | 面相 | 香港购物 | 配音 | 文具 | 二次元 | 影视 | 固态硬盘ssd | 虚拟机 | 跆拳道 | r（编程语言） | 秦时明月之天行九歌 | 使命召唤 | 网盘 | 地图 | 琅琊榜（电视剧） | 手机内存 | 角色扮演 | 华硕 | 百度输入法 | 盗墓笔记（小说） | 营销策划 | 化妆品 | Windows | ip地址 | 装修设计 | 齐内丁·齐达内 | 动画电影 | 中国中央电视台 | 罗兰 | 网站优化 | 斗鱼直播 | 冷知识 | 张帅 | 任天堂 | 摄影师 | 三菱商事 | 迅雷（软件） | 计算机病毒 | amd | 屏幕 | 微单相机 | 电学 | qq浏览器 | MacOS | 联赛 | snh48 | 芯片（集成电路） | 后宫·甄嬛传（书籍） | 植物辨识 | 运动 | 大一 | 美容 | 双色球 | 蓝牙音箱 | 楼盘 | 电脑电源 | 采暖 | 显卡驱动 | 体育赛事 | thinkpad | 离婚 | 武侠小说 | 索尼笔记本 | 中国足球协会超级联赛（csl） | youtube | 王力宏（人物） | 外星人 | 努比亚（手机品牌） | 海贼王 | 移动电源 | 完美世界（游戏） | 摩托车 | 编辑器 | 低音炮 | 收益 | 海关 | 徐波 | akb48 | 互联网创业 | 张璐 | 男性 | 性价比 | MacBook Air | 新疆维吾尔自治区 | 插座 | 外汇平台 | 华为Mate30 | 羽毛球技术 | 腾讯 QQ | 蓝屏 | 字幕 | 免费软件 | 电脑故障 | 女生 | 周星驰（人物） | 足球欧洲杯 | pdf | macbook | 直播 | 生活经历 | 骁龙处理器 | 主题曲 | 户外运动 | CPU | 娱乐圈 | 初恋 | 家居 | 流氓软件 | 名言 | 中国足球 | 近视眼 | acg | 一级方程式赛车（f1） | 小品 | 网站运营 | 英格兰足球超级联赛 | 一体机 | 人肉搜索 | 日本电影 | 系统软件 | 人生 | 流星花园 | 电钢琴 | 分辨率 | 迅雷 | 机械设计 | 古典音乐 | 液晶电视 | 睡眠 | 大片 | 资产 | Html/Css | ansys | 天蝎座 | 对联 | 大二 | 吉他学习 | 实习 | uc浏览器 | 计算机科学 | 新华社 | 脱毛 | 视力 | 乐视超级电视 | 大学生活 | 开关电源 | 平面设计 | 音乐版权 | iPhone 11 Pro | 面膜 | 鞠婧祎 | 胡歌（演员） | 郭富城 | 语言 | 赵丽颖（演员） | 意大利 | 电路设计 | 情侣 | NBA篮球 | 蔡徐坤 | 豆瓣电影 | 社交软件 | 微信开发 | 足球彩票 | 电工 | 手机摄像头 | 用户界面设计师 | 华语流行音乐 | 网卡 | 易烊千玺 | 笛子 | 日语学习 | 日语歌曲 | 歌手 | 张子枫 | 搏击项目 | 谭松韵 | 快捷键 | O2O | 移民 |

你的位置：网站首页 >> 频道首页 >>python >>如何使用python输出中文乱码来获取pdf文件里的文字，最好是不能乱码

如何使用python输出中文乱码来获取pdf文件里的文字，最好是不能乱码

来源：蜘蛛抓取(WebSpider) 时间：2016-03-04 06:04 标签： python爬虫中文乱码

python 中文乱码问题深入分析
字体：[ ] 类型：转载时间：
一直以来，python中的中文编码就是一个极为头大的问题，经常抛出编码转换的异常，python中的str和unicode到底是一个什么东西呢？
在本文中，以'哈'来解释作示例解释所有的问题，“哈”的各种编码如下： 1. UNICODE (UTF8-16)，C854； 2． UTF-8，E59388； 3． GBK，B9FE。一、python中的str和unicode 一直以来，python中的中文编码就是一个极为头大的问题，经常抛出编码转换的异常，python中的str和unicode到底是一个什么东西呢？在python中提到unicode，一般指的是unicode对象，例如'哈哈'的unicode对象为 u'\u54c8\u54c8' 而str，是一个字节数组，这个字节数组表示的是对unicode对象编码(可以是utf-8、gbk、cp936、GB2312)后的存储的格式。这里它仅仅是一个字节流，没有其它的含义，如果你想使这个字节流显示的内容有意义，就必须用正确的编码格式，解码显示。例如：
对于unicode对象哈哈进行编码，编码成一个utf-8编码的str－s_utf8,s_utf8就是是一个字节数组，存放的就是'\xe5\x93\x88\xe5\x93\x88'，但是这仅仅是一个字节数组，如果你想将它通过print语句输出成哈哈，那你就失望了，为什么呢？
因为print语句它的实现是将要输出的内容传送了操作系统，操作系统会根据系统的编码对输入的字节流进行编码，这就解释了为什么utf-8格式的字符串“哈哈”，输出的是“鍝堝搱”，因为 '\xe5\x93\x88\xe5\x93\x88'用GB2312去解释，其显示的出来就是“鍝堝搱”。这里再强调一下，str记录的是字节数组，只是某种编码的存储格式，至于输出到文件或是打印出来是什么格式，完全取决于其解码的编码将它解码成什么样子。
这里再对print进行一点补充说明：当将一个unicode对象传给print时，在内部会将该unicode对象进行一次转换，转换成本地的默认编码（这仅是个人猜测）
二、str和unicode对象的转换
str和unicode对象的转换，通过encode和decode实现，具体使用如下：
将GBK'哈哈'转换成unicode，然后再转换成UTF8
三、Setdefaultencoding
如上图的演示代码所示：
当把s(gbk字符串)直接编码成utf-8的时候，将抛出异常，但是通过调用如下代码：
import&sys
reload(sys)
sys.setdefaultencoding('gbk')
后就可以转换成功，为什么呢？在python中str和unicode在编码和解码过程中，如果将一个str直接编码成另一种编码，会先把str解码成unicode，采用的编码为默认编码，一般默认编码是anscii，所以在上面示例代码中第一次转换的时候会出错，当设定当前默认编码为'gbk'后，就不会出错了。
至于reload(sys)是因为Python2.5&初始化后会删除&sys.setdefaultencoding&这个方法，我们需要重新载入。
四、操作不同文件的编码格式的文件
建立一个文件test.txt，文件格式用ANSI，内容为:
用python来读取
# coding=gbk
print open("Test.txt").read()
结果：abc中文
把文件格式改成UTF-8：
结果：abc涓?枃
显然，这里需要解码：
# coding=gbk
import codecs
print open("Test.txt").read().decode("utf-8")
结果：abc中文
上面的test.txt我是用Editplus来编辑的，但当我用Windows自带的记事本编辑并存成UTF-8格式时，
运行时报错：
Traceback (most recent call last):
File "ChineseTest.py", line 3, in&
print open("Test.txt").read().decode("utf-8")
UnicodeEncodeError: 'gbk' codec can't encode character u'\ufeff' in position 0: illegal multibyte sequence
原来，某些软件，如notepad，在保存一个以UTF-8编码的文件时，会在文件开始的地方插入三个不可见的字符（0xEF 0xBB 0xBF，即BOM）。
因此我们在读取时需要自己去掉这些字符，python中的codecs module定义了这个常量：
# coding=gbk
import codecs
data = open("Test.txt").read()
if data[:3] == codecs.BOM_UTF8:
data = data[3:]
print data.decode("utf-8")
结果：abc中文
五、文件的编码格式和编码声明的作用
源文件的编码格式对字符串的声明有什么作用呢？这个问题困扰一直困扰了我好久，现在终于有点眉目了，文件的编码格式决定了在该源文件中声明的字符串的编码格式，例如：
str&=&'哈哈'
print&repr(str)
a.如果文件格式为utf-8，则str的值为：'\xe5\x93\x88\xe5\x93\x88'（哈哈的utf-8编码）
b.如果文件格式为gbk，则str的值为：'\xb9\xfe\xb9\xfe'（哈哈的gbk编码）
在第一节已经说过，python中的字符串，只是一个字节数组，所以当把a情况的str输出到gbk编码的控制台时，就将显示为乱码：鍝堝搱；而当把b情况下的str输出utf-8编码的控制台时，也将显示乱码的问题，是什么也没有，也许'\xb9\xfe\xb9\xfe'用utf-8解码显示，就是空白吧。&_&
说完文件格式，现在来谈谈编码声明的作用吧，每个文件在最上面的地方，都会用#&coding=gbk&类似的语句声明一下编码，但是这个声明到底有什么用呢？到止前为止，我觉得它的作用也就是三个：
声明源文件中将出现非ascii编码，通常也就是中文；
在高级的IDE中，IDE会将你的文件格式保存成你指定编码格式。
决定源码中类似于u'哈'这类声明的将‘哈'解码成unicode所用的编码格式，也是一个比较容易让人迷惑的地方，看示例：
#coding:gbk
ss&=&u'哈哈'
print&repr(ss)
print&'ss:%s'&%&ss
将这个些代码保存成一个utf-8文本，运行，你认为会输出什么呢？大家第一感觉肯定输出的肯定是：
u'\u54c8\u54c8'
但是实际上输出是：
u'\u935d\u581d\u6431'
为什么会这样，这时候，就是编码声明在作怪了，在运行ss&=&u'哈哈'的时候，整个过程可以分为以下几步：
1)&获取'哈哈'的编码：由文件编码格式确定，为'\xe5\x93\x88\xe5\x93\x88'（哈哈的utf-8编码形式）
2)&转成 unicode编码的时候，在这个转换的过程中，对于'\xe5\x93\x88\xe5\x93\x88'的解码，不是用utf-8解码，而是用声明编码处指定的编码GBK，将'\xe5\x93\x88\xe5\x93\x88'按GBK解码，得到就是''鍝堝搱''，这三个字的unicode编码就是u'\u935d\u581d\u6431'，至止可以解释为什么print&repr(ss)输出的是u'\u935d\u581d\u6431' 了。
好了，这里有点绕，我们来分析下一个示例：
#-*-&coding:utf-8&-*-
ss&=&u'哈哈'
print&repr(ss)
print&'ss:%s'&%&ss
将这个示例这次保存成GBK编码形式，运行结果，竟然是：
UnicodeDecodeError:&'utf8'&codec&can't&decode&byte&0xb9&in&position&0:&unexpected&code&byte
这里为什么会有utf8解码错误呢？想想上个示例也明白了，转换第一步，因为文件编码是GBK，得到的是'哈哈'编码是GBK的编码'\xb9\xfe\xb9\xfe'，当进行第二步，转换成 unicode的时候，会用UTF8对'\xb9\xfe\xb9\xfe'进行解码，而大家查utf-8的编码表会发现，utf8编码表（关于UTF- 8解释可参见字符编码笔记：ASCII、UTF-8、UNICODE）中根本不存在，所以会报上述错误。
您可能感兴趣的文章:
大家感兴趣的内容
12345678910
最近更新的内容
常用在线小工具当前访客身份：游客 [
不积跬步，何以至千里！
：用空间换时间
：楼主还有没有别的web知识分享，感谢
：先马克，感谢
今日访问：0
昨日访问：6
本周访问：19
本月访问：17
所有访问：3540
Python解释包含中文字符的文件时乱码
发表于2年前( 14:32)&&
阅读（41）&|&评论（）
0人收藏此文章,
Python解释包含中文字符的文件时乱码
Python解释包含中文字符的文件时乱码的解决办法在文件的收行加上：
-*- coding: utf-8 -*-
更多开发者职位上
1)">1)">1" ng-class="{current:{{currentPage==page}}}" ng-repeat="page in pages"><li class='page' ng-if="(endIndex<li class='page next' ng-if="(currentPage
相关文章阅读如何使用python来获取pdf文件里的文字，最好是不能乱码_百度知道
如何使用python来获取pdf文件里的文字，最好是不能乱码
可以用汉王去转换,但是转出来的依然是每个字每个字的小图希望我的回答对你有所帮助，如果满意请设置为最佳答案没有其它的办法
其他类似问题
为您推荐：
等待您来回答
下载知道APP
随时随地咨询
出门在外也不愁python 读取文件中数据如何判断是中文字还是乱码请指教多谢
[问题点数：20分，结帖人power0811]
python 读取文件中数据如何判断是中文字还是乱码请指教多谢
[问题点数：20分，结帖人power0811]
不显示删除回复
显示所有回复
显示星级回复
显示得分回复
只显示楼主
2010年6月其他开发语言大版内专家分月排行榜第三2009年9月 C/C++大版内专家分月排行榜第三
2012年1月其他开发语言大版内专家分月排行榜第二2011年5月其他开发语言大版内专家分月排行榜第二2010年12月其他开发语言大版内专家分月排行榜第二2009年2月其他开发语言大版内专家分月排行榜第二2008年9月其他开发语言大版内专家分月排行榜第二2008年8月其他开发语言大版内专家分月排行榜第二2008年5月其他开发语言大版内专家分月排行榜第二2007年11月其他开发语言大版内专家分月排行榜第二
2011年4月其他开发语言大版内专家分月排行榜第三2011年1月其他开发语言大版内专家分月排行榜第三2009年6月其他开发语言大版内专家分月排行榜第三2009年4月其他开发语言大版内专家分月排行榜第三2009年1月其他开发语言大版内专家分月排行榜第三2008年11月其他开发语言大版内专家分月排行榜第三2008年7月其他开发语言大版内专家分月排行榜第三2008年6月其他开发语言大版内专家分月排行榜第三2006年9月其他开发语言大版内专家分月排行榜第三
2012年1月其他开发语言大版内专家分月排行榜第二2011年5月其他开发语言大版内专家分月排行榜第二2010年12月其他开发语言大版内专家分月排行榜第二2009年2月其他开发语言大版内专家分月排行榜第二2008年9月其他开发语言大版内专家分月排行榜第二2008年8月其他开发语言大版内专家分月排行榜第二2008年5月其他开发语言大版内专家分月排行榜第二2007年11月其他开发语言大版内专家分月排行榜第二
2011年4月其他开发语言大版内专家分月排行榜第三2011年1月其他开发语言大版内专家分月排行榜第三2009年6月其他开发语言大版内专家分月排行榜第三2009年4月其他开发语言大版内专家分月排行榜第三2009年1月其他开发语言大版内专家分月排行榜第三2008年11月其他开发语言大版内专家分月排行榜第三2008年7月其他开发语言大版内专家分月排行榜第三2008年6月其他开发语言大版内专家分月排行榜第三2006年9月其他开发语言大版内专家分月排行榜第三
本帖子已过去太久远了，不再提供回复功能。

如何使用python输出中文乱码来获取pdf文件里的文字，最好是不能乱码

我要回帖

更多关于 python爬虫中文乱码的文章

随机推荐

如何使用python输出中文乱码来获取pdf文件里的文字，最好是不能乱码

我要回帖

更多关于 python爬虫中文乱码 的文章

随机推荐

更多关于 python爬虫中文乱码的文章