python解析网页数据的方法

发布时间：2020-09-02 09:45:42 来源：亿速云阅读：221 作者：小新栏目：编程语言

这篇文章给大家分享的是有关python解析网页数据的方法的内容。小编觉得挺实用的，因此分享给大家做个参考。一起跟随小编过来看看吧。

python网页解析器

1、常见的python网页

常见的python网页解析工具有：re正则匹配、python自带的html.parser模块、第三方库BeautifulSoup(重点学习)以及lxm库。

2、常见网页解析器分类

以上四种网页解析器，是两种不同类型的解析器：

（1）模糊匹配

re正则表达式即为字符串式的模糊匹配模式；

（2）结构化解析

BeatufiulSoup、html.parser与lxml为“结构化解析”模式，他们都以DOM树结构为标准，进行标签结构信息的提取。（）（3）结构化解析

我们在了解什么是结构化解析之前，需要先了解下什么是DOM树这个概念。

DOM树解释：即文档对象模型（Document Object Model），其树形标签结构，而所谓结构化解析，就是网页解析器它会将下载的整个HTML文档当成一个Doucment对象，然后在利用其上下结构的标签形式，对这个对象进行上下级的标签进行遍历和信息提取操作。

感谢各位的阅读！关于python解析网页数据的方法就分享到这里了，希望以上内容可以对大家有一定的帮助，让大家可以学到更多知识。如果觉得文章不错，可以把它分享出去让更多的人看到吧！

向AI问一下细节

猜你喜欢