盘点3种Python爬虫中文乱码的处理方法
入门教程、案例源码、学习资料、读者群
请访问: python666.cn
前几天有同学在Python交流群里问了一道关于使用Python网络爬虫过程中出现中文乱码的问题,如下图所示:
看上去确实头大,对于爬虫初学者来说,这个乱码摆在自己面前,犹如拦路虎一般难顶。不过别慌,这里就给大家整理了三种方法,专门用于针对中文乱码的,希望大家以后再遇到中文乱码的问题时,可以由此得到灵感。
一、思路
其实解决问题的关键点就是在于一点,就是将乱码的部分进行处理,而处理的方案主要可以从两个方面进行出发。其一是针对整体网页进行提前编码,其二是针对局部具体中文乱码的部分进行编码处理。这里例举3种方法,肯定还有其他的方法的,也欢迎大家在评论区讨论。
二、分析
其实关于中文乱码的表现形式有很多,但是常见的两种如下:
1、当出现网页编码为gbk,获取到的内容在控制台打印类似如下情况的时候:
ÃÀÅ® µçÄÔ×À ¼üÅÌ »ú·¿ ¿É°® С½ã½ã4k±ÚÖ½2、当出现网页编码为gbk,获取到的内容在控制台打印类似如下情况的时候:
�װŮ�� ��Ů ˮ СϪ Ψ��虽然看上去控制台输出正常,没有报错:
Process finished with exit code 0但是输出的中文内容,却不是普通人能看得懂的。
这种情况下的话,就可以通过使用本文给出的三种方法进行解决,屡试不爽。
三、具体实现
1)方法一:将requests.get().text改为requests.get().content
此时可以考虑将请求变为.content,得到的内容就是正常的了。
# 手动设定响应数据的编码格式response.encoding = response.apparent_encoding
上面介绍的两种方法都是针对网页进行整体编码,效果显著,接下来的第三种方法就是针对中文局部乱码部分使用通用编码方法进行处理。
img_name.encode('iso-8859-1').decode('gbk')使用通用的编码方法,对中文出现乱码的地方进行编码设定即可。还是当前的这个例子,针对img_name进行编码设定,指定编码并进行解码,如下图所示。
如此一来,中文乱码的问题就迎刃而解了。
四、总结
本文针对Python网络爬虫过程中的中文乱码问题,给出了3种乱码解决方法,顺利解决了问题。你还知道有哪些乱码的情况和处理方法,欢迎在评论区中留言。
作者:Python进阶者
本书从 Python 和 Excel 结合使用的角度讲解处理分析数据的思路、方法与实战应用。不论是希望从事数据分析岗位的学习者,还是其他职业的办公人员,都可以通过本书的学习掌握 Python 分析数据的技能。书中创新性地将 ChatGPT 引入到教学当中,用 ChatGPT 答疑并提供实训代码,并介绍了使用 ChatGPT 辅助学习的一些实用技巧,给学习者带来全新的学习方式。
读者朋友们购买后可在后台联系我,加入读者交流群,Crossin会为你开启陪读模式,解答你在阅读本书时的一切疑问。
_往期文章推荐_
【教程】: python