beautiful soup 4.0 bs4 搜索文档树(3)
发布时间
阅读量:
阅读量
1、概述
在上一篇推送中重点讲解了如何对文档结构进行遍历。具体操作是从根节点出发逐步展开对整个文档结构的扫描。这也是文档解析过程中不可或缺的一个核心步骤。除了这个操作之外,还有一个关键方法是实现对文档内容的全面检索。值得注意的是该方法并非通过逐层深入的方式展开查询而是能够直接在整个文档中找到所需节点及其相关信息。例如如果我们需要获取某个特定节点的信息如标题内容可以通过直接搜索对应的tag标签来实现。
2、搜索文档树
搜索文档树的操作主要依靠以下两个方法来实现。
- find
- find_all
虽然在功能上大致相同但它们在数据处理上有显著差异尽管如此它们的基本操作步骤是相似的
所谓细节就是可以使用哪些内容所谓搜索条件对整体文档树进行搜索。
2.1 过滤器
贯穿整个搜索API系统的过滤器可用于tag名称字段、节点属性字段、字符串或其与其他数据类型的混合体。
2.1.1 字符串过滤器
最简单的过滤器即为字符串类型。当在搜索方法中传递一个字符串参数时,Beautiful Soup将执行精确匹配操作。以下示例展示了如何提取所有
标签内容,请参考如下代码:
for _p in soup.find_all('p'):
print(_p.name)
2.1.2 正则表达式过滤器
全部评论 (0)
还没有任何评论哟~
