JSoup用于解析与遍历一个HTML文件的详细说明
发布时间
阅读量:
阅读量
解析和遍历一个HTML文档
如何对一个HTML文档进行解析:
String html = "<html><head><title>First parse</title></head>"
+ "<body><p>Parsed HTML into a doc.</p></body></html>";
Document doc = Jsoup.parse(html);
其解析器能够最大限度地从所提供的HTML文档中生成一个结构清晰的解析结果,无论该文档的格式是否完整。例如,它具备处理以下情况的能力:
1)未正确闭合的标签
<p>Lorem <p>Ipsum parses to <p>Lorem</p> <p>Ipsum</p>
2)隐含标识
它可以自动将 <td>Table data</td>包装成<table><tr><td>?
3)构建稳固的文档架构
html标签包含head 和 body,在head只出现恰当的元素
**文档的对象模型
全部评论 (0)
还没有任何评论哟~
