您的位置：首页

获取任意网页的编码格式

2017-08-07 14:16 169 查看

如果是非定向爬虫，不是专门爬一个固定位置的信息，而是成千上万的未知网站，那就需要找到编码格式了，使用如下正则，可以正确找到,准确率99%
content=requests.get(url).content
bianma_group=re.search('<meta[\s\S]*?charset="?([a-zA-Z0-9\-]*)', respbody0, re.IGNORECASE)

if bianma_group:
print bianma_group.group(1)

内容来自用户分享和网络整理，不保证内容的准确性，如有侵权内容，可联系管理员处理

标签：

相关文章推荐

c# 获取网页源码，自动判断编码格式新方法！
c# 获取网页源码，自动判断编码格式新方法！（转）
利用cpdetector获取文件编码格式，同时得到网页内容。增加http/https通用方式
记录 -- C# 获取网页源码，判断编码格式方法
PHP 正则表达式获取网页charset 编码，可以获取任意网页charset（代码备份）
c# 获取网页源码，自动判断编码格式新方法
任意ASCII码格式信息的huffman tree压缩（编码）和解压（译码）
在网页中嵌入任意格式的视频文件
Java如何获取文件编码格式
JAVA读取不同编码的txt文件，java获取txt文件编码格式
Java获取任意http网页源代码的方法
JavaScript上传图片的方法判断图片的格式和大小、获取图片的base64编码
任意ASCII码格式信息的huffman tree压缩（编码）和解压（译码）
Java如何获取文件编码格式
java 获取获取字符串编码格式
python 获取网页编码方式实现代码
用IdHTTP获取UTF-8编码的网页
从摄像头获取_保存视频(CV_FOURCC可以获取的视频编码格式)
java课程设计例子 Java如何获取文件编码格式
使用HtmlAgilityPack和ScrapySharp抓取网页数据遇到的几个问题解决方法——格式编码问题

新的分享

一次教科书级别的Redis高可用架构设计实践 - Redis
曾光：北京这次的毒株不像国内流行类型
从PRD文档到产品上线，有哪些问题需要解决？
vue3自定义指令的使用
Oracle SQL性能优化最常用的40条建议 - ORACLE
程序员翻车常见反应，你中枪了吗？ - 职场生涯
新鲜开源：基于Prometheus的企业监控平台设计与实现 - 运维
嵌入式软件开发之程序架构设计-任务调度
【Java面试】请简单说一下你对受检异常和非受检异常的理解
奇安信更新招股书：第一季亏损过5亿，齐向东持股38%
艾瑞咨询：2020年中国后智能厨房案例研究报告
艾瑞咨询：2020年中国人工智能+物流发展研究报告

章节导航