Python:UnicodeEncodeError: ‘gbk’ codec can’t encode character ‘\xbb’ in position 12305,以及中文乱码的解决方案
本文作者:StubbornHuang
版权声明:本文为站长原创文章,如果转载请注明原文链接!
原文标题:Python:UnicodeEncodeError: ‘gbk’ codec can’t encode character ‘\xbb’ in position 12305,以及中文乱码的解决方案
原文链接:https://www.stubbornhuang.com/114/
发布于:2019年10月26日 18:17:37
修改于:2019年11月14日 22:54:40

刚刚学习了Python没几天,看了《Python网络数据采集》这本书,准备今天在网上试验着爬一个数据,网站是UTF-8编码的,可以在网站的文件头可以看出来

所以我就按照书上的代码照着写了几行代码:
#__author__ = 'Administrat
#coding=utf-8
from urllib.request import urlopen
from urllib import request
from bs4 import BeautifulSoup
import requests
headers = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:23.0) Gecko/20100101 Firefox/23.0'}
req=request.Request("网址",headers=headers)
html=urlopen(req)
bsObj=BeautifulSoup(html.read())
print(bsObj.body)
结果马上出现UnicodeEncodeError: 'gbk' codec can't encode character '\xbb' in position 12305: illegal multibyte sequence.的这个错误,所以在网上搜索教程后发现了问题的所在,附上网址http://blog.csdn.net/jim7424994/article/details/22675759点击打开链接
结果按照上述的解决方案将代码改成,添加了:
sys.stdout = io.TextIOWrapper(sys.stdout.buffer,encoding='utf-8')
整个代码修改为:
#__author__ = 'Administrat
#coding=utf-8
from urllib.request import urlopen
from urllib import request
from bs4 import BeautifulSoup
import requests
import sys
import io
sys.stdout = io.TextIOWrapper(sys.stdout.buffer,encoding='utf-8')
headers = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:23.0) Gecko/20100101 Firefox/23.0'}
req=request.Request("网址",headers=headers)
html=urlopen(req)
bsObj=BeautifulSoup(html.read())
print(bsObj.body)
改了代码之后,虽然没有报之前的那个错误,但是打印出来文字,英文文字没有出现乱码,但是中文出现乱码的情况:
所以在详细查看了刚刚的博客之后,将上述代码中的:
sys.stdout = io.TextIOWrapper(sys.stdout.buffer,encoding='utf-8')
改成
sys.stdout = io.TextIOWrapper(sys.stdout.buffer,encoding='gb18030')
然后就完美中文显示
当前分类随机文章推荐
- Python - glob模块详解以及glob.glob、glob.iglob函数的使用 阅读780次,点赞0次
- Python - 使用with open as 读写文件 阅读1360次,点赞0次
- Python - 语音识别文本相似性度量库jiwer,可计算文字错误率WER、匹配错误率MER等相似性度量指标 阅读908次,点赞0次
- Python - 运算符/ or // or %的含义和区别 阅读1717次,点赞0次
- Python - 读取视频为numpy数组以及将numpy数组转换为视频 阅读1038次,点赞0次
- Python - 判断一个字符串是否为json格式 阅读833次,点赞0次
- Pip - 常用命令(安装,卸载,升级第三方库) 阅读3040次,点赞1次
- 解决Python爬虫在爬资源过程中使用urlretrieve函数下载文件不完全且避免下载时长过长陷入死循环,并在下载文件的过程中显示下载进度 阅读3760次,点赞0次
- Python - 获取当前py脚本文件所在的目录路径 阅读506次,点赞0次
- Python - 使用代码判断当前Python版本号 阅读179次,点赞0次
全站随机文章推荐
- 资源分享 - Physics-Based Animation 英文高清PDF下载 阅读1963次,点赞0次
- Python - 深度学习训练过程使用matplotlib.pyplot实时动态显示loss和acc曲线 阅读2029次,点赞0次
- 资源分享 - GPU Pro 6 - Advanced Rendering Techniques 英文高清PDF下载 阅读2279次,点赞0次
- 工具网站推荐 - 最好的8个免费下载Pbr贴图和材质的网站 阅读3346次,点赞2次
- 资源分享 - Game Programming Gems 4 英文高清PDF下载 阅读2046次,点赞1次
- WordPress - $Post WP_Post对象的属性 阅读2285次,点赞0次
- 资源分享 - Computer Graphics Through OpenGL - From Theory to Experiments (Third Edition) 英文高清原版 PDF下载 阅读3312次,点赞0次
- 深度学习 - 深度学习中的术语/专有名词归纳 阅读391次,点赞0次
- 计算几何 - C++计算两个二维向量的夹角 阅读3442次,点赞3次
- Python - 运算符/ or // or %的含义和区别 阅读1717次,点赞0次
评论
164