当前位置：Gxlcms > html代码 > 使用xpath解析html的解析器：Jsoupxpath_html/css_WEB-ITnose

使用xpath解析html的解析器：Jsoupxpath_html/css_WEB-ITnose

时间：2021-07-01 10:21:17 帮助过：20人阅读

JsoupXpath 是一款纯Java开发的使用xpath解析html的解析器，xpath语法分析与执行完全独立，html的DOM树生成借助Jsoup，故命名为JsoupXpath.为了在java里也享受xpath的强大与方便但又苦于找不到一款足够强大的xpath解析器，故开发了JsoupXpath。JsoupXpath的实现逻辑清晰，扩展方便，支持几乎全部常用的xpath语法.

http://www.cnblogs.com/ 为例"//a/@href";"//div[@id='paging_block']/div/a[text()='Next >']/@href";"//div[@id='paging_block']/div/a[text()*='Next']/@href";"//h1/text()";"//h1/allText()";"//h1//text()";"//div/a";"//div[@id='post_list']/div[position()<3]/div/h3/allText()";"//div[@id='post_list']/div[first()]/div/h3/allText()";"//div[@id='post_list']/div[1]/div/h3/allText()";"//div[@id='post_list']/div[last()]/div/h3/allText()";//查找评论大于1000的条目（当然只是为了演示复杂xpath了，谓语中可以各种嵌套，这样才能测试的更全面嘛）"//div[@id='post_list']/div[./div/div/span[@class='article_view']/a/num()>1000]/div/h3/allText()";//轴支持"//div[@id='post_list']/div[self::div/div/div/span[@class='article_view']/a/num()>1000]/div/h3/allText()";"//div[@id='post_list']/div[2]/div/p/preceding-sibling::h3/allText()";"//div[@id='post_list']/div[2]/div/p/preceding-sibling::h3/allText()|//div[@id='post_list']/div[1]/div/h3/allText()";

在这里暂不列出框架间的对比了，但我相信，你们用了会发现JsoupXpath就是目前市面上最强大的的Xpath解析器。

快速开始

如果不方便使用maven，可以直接使用lib下的依赖包跑起来试试，如方便可直接使用如下dependency(已经上传至中央maven库,最新版本0.1.1)：

   cn.wanghaomiao   JsoupXpath   0.1.1

依赖配置好后，就可以使用如下例子进行体验了！

String xpath="//div[@id='post_list']/div[./div/div/span[@class='article_view']/a/num()>1000]/div/h3/allText()";String doc = "...";JXDocument jxDocument = new JXDocument(doc);List

使用xpath解析html的解析器：Jsoupxpath_html/css_WEB-ITnose

快速开始

语法

关于使用Xpath的一些注意事项

解析器扩展函数

其他说明

轴

轴实用扩展

操作符

操作符扩展

其他说明

人气教程排行