Advertisement

JSoup用于解析与遍历一个HTML文件的详细说明

阅读量:

解析和遍历一个HTML文档

如何对一个HTML文档进行解析:

复制代码
    String html = "<html><head><title>First parse</title></head>"
    + "<body><p>Parsed HTML into a doc.</p></body></html>";
    Document doc = Jsoup.parse(html);
    
    
      
      
      
    

其解析器能够最大限度地从所提供的HTML文档中生成一个结构清晰的解析结果,无论该文档的格式是否完整。例如,它具备处理以下情况的能力:
1)未正确闭合的标签

复制代码
     <p>Lorem <p>Ipsum parses to <p>Lorem</p> <p>Ipsum</p>
    
    
      
    

2)隐含标识

复制代码
    它可以自动将 <td>Table data</td>包装成<table><tr><td>?
    
    
      
    

3)构建稳固的文档架构

复制代码
     html标签包含head 和 body,在head只出现恰当的元素
    
    
      
    

**文档的对象模型

全部评论 (0)

还没有任何评论哟~