python 处理中文网页时,忽略特殊字符,忽略异常

http://hi.baidu.com/wen122056/blog/item/c92ecba97ea1c8ee1f17a262.html

中文网页大部分是gb2312编码的,在用python 处理时候最好转换成unicode的,怎么转换呢?

比如:

          html = open('http://www.baidu.com')

          这时html是字节流,咱应该转换成字符流,转换成unicode编码:

          html = html.decode('gb2312')

          html = html.decode('gb18030')

          这两个编码,最好用gb18030或者gbk,因为这两编码位数足够大,有时候这么转换了还会报错:'gb18030' codec can't decode bytes in position 10332-10333: illegal multibyte sequence

          这是应为在转编码的时候decode碰见了特殊字符,转换不了——尤其是在某些用C/C++编写的程序中,全角空格往往有多种不同的实现方式,比 如\xa3\xa0,或者\xa4\x57,这 些字符,看起来都是全角空格,但它们并不是“合法”的全角空格(真正的全角空格是\xa1\xa1),因此在转码的过程中出现了异常。

          那怎么解决呢?可以这样 html = html.decode('gb18030', 'ignore')在转编码时忽略错误

          特别注意:

                  在处理中文网页时候,当你用decode、encode时候,最好都加上'ignore'忽略特殊字符

 

s.decode('gbk', ‘ignore').encode('utf-8′) 
因为decode的函数原型是decode([encoding], [errors='strict']),可以用第二个参数控制错误处理的策略,默认的参数就是strict,代表遇到非法字符时抛出异常; 
如果设置为ignore,则会忽略非法字符; 
如果设置为replace,则会用?取代非法字符; 
如果设置为xmlcharrefreplace,则使用XML的字符引用。

原文链接: https://www.cnblogs.com/lvxiuquan/archive/2012/08/07/2626707.html

欢迎关注

微信关注下方公众号,第一时间获取干货硬货;公众号内回复【pdf】免费获取数百本计算机经典书籍

    python 处理中文网页时,忽略特殊字符,忽略异常

原创文章受到原创版权保护。转载请注明出处:https://www.ccppcoding.com/archives/58391

非原创文章文中已经注明原地址,如有侵权,联系删除

关注公众号【高性能架构探索】,第一时间获取最新文章

转载文章受原作者版权保护。转载请注明原作者出处!

(0)
上一篇 2023年2月9日 上午8:37
下一篇 2023年2月9日 上午8:37

相关推荐