httpclient.jar 使用java开源工具httpclient怎么使用

AI介绍2026-09-15629

大家好,今天小编来为大家解答httpclient.jar这个问题,使用java开源工具httpclient怎么使用很多人还不知道,现在让我们一起来看看吧!

使用java开源工具httpclient怎么使用

使用java开源工具httpClient及jsoup抓取解析网页数据

httpclient.jar 使用java开源工具httpclient怎么使用

来源:iteye,原文

今天做项目的时候遇到这样一个需求,需要在网页上展示今日黄历信息,数据格式如下

公历时间:2016年04月11日星期一

农历时间:猴年三月初五

天干地支:丙申年壬辰月癸亥日

宜:求子祈福开光祭祀安床

忌:玉堂(黄道)危日,忌出行

httpclient.jar 使用java开源工具httpclient怎么使用

主要包括公历/农历日期,以及忌宜信息的等。但是手里并没有现成的数据可供使用,怎么办呢?革命前辈曾经说过,没有枪,没有炮,敌(wang)人(luo)给我们造!网络上有很多现成的在线万年历应用可供使用,虽然没有现成接口,但是我们可以伸出手来,自己去拿。也就是所谓的数据抓取。

这里介绍两个使用的工具,httpClient以及jsoup,简介如下:

HttpClient是ApacheJakartaCommon下的子项目,用来提供高效的、最新的、功能丰富的支持HTTP协议的客户端编程工具包,并且它支持HTTP协议最新的版本和建议。HttpClient已经应用在很多的项目中,比如ApacheJakarta上很著名的另外两个开源项目Cactus和HTMLUnit都使用了HttpClient。

httpClient使用方法如下:

1.创建HttpClient对象。

2.创建请求方法的实例,并指定请求URL。

3.调用HttpClient对象的execute(HttpUriRequestrequest)发送请求,该方法返回一个HttpResponse。

httpclient.jar 使用java开源工具httpclient怎么使用

4.调用HttpResponse相关方法获取相应内容。

5.释放连接。

jsoup是一款Java的HTML解析器,可直接解析某个URL地址、HTML文本内容。它提供了一套非常省力的API,可通过DOM,CSS以及类似于jQuery的操作方法来取出和操作数据。

需要更多信息可以参见官网下载地址

httpClient:

jsoup:

接下来我们直接上代码,这里我们抓取2345在线万年历的数据

首先我们定义一个实体类Almanac来存储黄历数据

Almanac.java1packagecom.likx.picker.util.bean;2

3/**4

*万年历工具实体类5

*

6

*@author溯源blog7

*2016年4月11日8

*/9publicclassAlmanac{10

privateStringsolar;

/*阳历e.g.2016年4月11日星期一*/11

privateStringlunar;

/*阴历e.g.猴年三月初五*/12

privateStringchineseAra;

/*天干地支纪年法e.g.丙申年壬辰月癸亥日*/13

privateStringshould;

/*宜e.g.求子祈福开光祭祀安床*/14

privateStringavoid;

/*忌e.g.玉堂(黄道)危日,忌出行*/1516

publicStringgetSolar(){17

returnsolar;18

}1920

publicvoidsetSolar(Stringdate){21

this.solar=date;22

}2324

publicStringgetLunar(){25

returnlunar;26

}2728

publicvoidsetLunar(Stringlunar){29

this.lunar=lunar;30

}3132

publicStringgetChineseAra(){33

returnchineseAra;34

}3536

publicvoidsetChineseAra(StringchineseAra){37

this.chineseAra=chineseAra;38

}3940

publicStringgetAvoid(){41

returnavoid;42

}4344

publicvoidsetAvoid(Stringavoid){45

this.avoid=avoid;46

}4748

publicStringgetShould(){49

returnshould;50

}5152

publicvoidsetShould(Stringshould){53

this.should=should;54

}5556

publicAlmanac(Stringsolar,Stringlunar,StringchineseAra,Stringshould,57

Stringavoid){58

this.solar=solar;59

this.lunar=lunar;60

this.chineseAra=chineseAra;61

this.should=should;62

this.avoid=avoid;63

}64}

然后是抓取解析的主程序,写程序之前需要在官网下载需要的jar包

AlmanacUtil.javapackagecom.likx.picker.util;importjava.io.IOException;importjava.text.SimpleDateFormat;importjava.util.Calendar;importjava.util.Date;importorg.apache.http.HttpEntity;importorg.apache.http.ParseException;importorg.apache.http.client.ClientProtocolException;importorg.apache.http.client.methods.CloseableHttpResponse;importorg.apache.http.client.methods.HttpGet;importorg.apache.http.impl.client.CloseableHttpClient;importorg.apache.http.impl.client.HttpClients;importorg.apache.http.util.EntityUtils;importorg.jsoup.Jsoup;importorg.jsoup.nodes.Document;importorg.jsoup.nodes.Element;importorg.jsoup.select.Elements;/***<STRONG>类描述</STRONG>:

2345万年历信息爬取工具<p>*

*@version1.0<p>*@author溯源blog*

*<STRONG>创建时间</STRONG>:2016年4月11日下午14:15:44<p>*<STRONG>修改历史</STRONG>:<p>*<pre>*修改人

修改时间

修改内容*---------------

-------------------

-----------------------------------*</pre>*/publicclassAlmanacUtil{

/**

*单例工具类

*/

privateAlmanacUtil(){

}

/**

*获取万年历信息

*@return

*/

publicstaticAlmanacgetAlmanac(){

Stringurl="";

Stringhtml=pickData(url);

Almanacalmanac=analyzeHTMLByString(html);

returnalmanac;

}

/*

*爬取网页信息

*/

privatestaticStringpickData(Stringurl){

CloseableHttpClienthttpclient=HttpClients.createDefault();

try{

HttpGethttpget=newHttpGet(url);

CloseableHttpResponseresponse=httpclient.execute(httpget);

try{

//获取响应实体

HttpEntityentity=response.getEntity();

//打印响应状态

if(entity!=null){

returnEntityUtils.toString(entity);

}

}finally{

response.close();

}

}catch(ClientProtocolExceptione){

e.printStackTrace();

}catch(ParseExceptione){

e.printStackTrace();

}catch(IOExceptione){

e.printStackTrace();

}finally{

//关闭连接,释放资源

try{

httpclient.close();

}catch(IOExceptione){

e.printStackTrace();

}

}

returnnull;

}

/*

*使用jsoup解析网页信息

*/

privatestaticAlmanacanalyzeHTMLByString(Stringhtml){

StringsolarDate,lunarDate,chineseAra,should,avoid="";

Documentdocument=Jsoup.parse(html);

//公历时间

solarDate=getSolarDate();

//农历时间

ElementeLunarDate=document.getElementById("info_nong");

lunarDate=eLunarDate.child(0).html().substring(1,3)+eLunarDate.html().substring(11);

//天干地支纪年法

ElementeChineseAra=document.getElementById("info_chang");

chineseAra=eChineseAra.text().toString();

//宜

should=getSuggestion(document,"yi");

//忌

avoid=getSuggestion(document,"ji");

Almanacalmanac=newAlmanac(solarDate,lunarDate,chineseAra,should,avoid);

returnalmanac;

}

/*

*获取忌/宜

*/

privatestaticStringgetSuggestion(Documentdoc,Stringid){

Elementelement=doc.getElementById(id);

Elementselements=element.getElementsByTag("a");

StringBuffersb=newStringBuffer();

for(Elemente:elements){

sb.append(e.text()+"");

}

returnsb.toString();

}

/*

*获取公历时间,用yyyy年MM月dd日EEEE格式表示。

*@returnyyyy年MM月dd日EEEE

*/

privatestaticStringgetSolarDate(){

Calendarcalendar=Calendar.getInstance();

DatesolarDate=calendar.getTime();

SimpleDateFormatformatter=newSimpleDateFormat("yyyy年MM月dd日EEEE");

returnformatter.format(solarDate);

}}

为了简单明了我把抓取解析抽象成了几个独立的方法,

其中pickData()方法使用httpClient来抓取数据到一个字符串中(就是在网页上点击查看源代码看到的HTML源码),analyzeHTMLByString()方法来解析抓取到的字符串,getSuggestion方法把抓取方法类似的宜忌数据抽象到了一起,另外因为公历时间可以很容易的自己生成就没有在网页上爬取。

然后下面是一个测试类简单测试下效果:AlmanacUtilTest.javapackagecom.likx.picker.util.test;publicclassAlmanacUtilTest{

publicstaticvoidmain(Stringargs[]){

Almanacalmanac=AlmanacUtil.getAlmanac();

System.out.println("公历时间:"+almanac.getSolar());

System.out.println("农历时间:"+almanac.getLunar());

System.out.println("天干地支:"+almanac.getChineseAra());

System.out.println("宜:"+almanac.getShould());

System.out.println("忌:"+almanac.getAvoid());

}}

运行结果如下:

集成到实际项目中效果是这样的:

另外最近博客一直没怎么更新,因为最近考虑到技术氛围的原因,离开了对日外包行业,前往一家互联网公司就职。说一下最近的感受,那就是一个程序员最核心的竞争力不是学会了多少框架,掌握多少种工具(当然这些对于程序员也不可或缺),而是扎实的基础以及快速学习的能力,比如今天这个项目,从对httpClient,jsoup工具一无所知到编写出Demo代码总计大概1个多小时,在之前对于我来说是不可想象的,在技术氛围浓厚的地方快速get技能的感觉,非常好。

当然本例只是一个非常浅显的小例子,网页上内容也很容易抓取,httpClient及jsoup工具更多强大的地方没有体现到,比如httpClient不仅可以发送get请求,而且可以发送post请求,提交表单,传送文件,还比如jsoup最强大的地方在于它支持仿jquery的选择器。本例仅仅使用了最简单的document.getElementById()匹配元素,实际上jsoup的选择器异常强大,可以说它就是java版的jquery,比如这样:Elementslinks=doc.select("a[href]");//awithhrefElementspngs=doc.select("img[src$=.png]");

//imgwithsrcending.pngElementmasthead=doc.select("div.masthead").first();

//divwithclass=mastheadElementsresultLinks=doc.select("h3.r>a");//directaafterh3

如何使用HttpClient

直接上实例吧。

Apache官网下载 HttpClient,下不了的点击这里,下载完后解压取lib文件夹中jar包导入到项目中

在进行本例之前需要了解三个类

HttpClient代表Http客户端里面定义了很多http请求执行行为

HttpEntity消息载体,发送或者接收消息的载体,可以通过客户端请求或者服务器响应获取实例

HttpConnection代表http连接

本次实例代码

public class HttpCLientDemo

{

// HttpClient代表Http客户端

// HttpEntity消息载体,发送或者接收消息的载体,可以通过客户端请求或者服务器响应获取实例

// HttpConnection代表http连接

/**

*@param args

*/

public static void main(String[] args)

{

//创建默认的客户端实例

HttpClient httpCLient= new DefaultHttpClient();

//创建get请求实例

HttpGet httpget= new HttpGet("");

System.out.println("executing request"+httpget.getURI());

try

{

//客户端执行get请求返回响应实体

HttpResponse response= httpCLient.execute(httpget);

//服务器响应状态行

System.out.println(response.getStatusLine());

Header[] heads= response.getAllHeaders();

//打印所有响应头

for(Header h:heads){

System.out.println(h.getName()+":"+h.getValue());

}

//获取响应消息实体

HttpEntity entity= response.getEntity();

System.out.println("------------------------------------");

if(entity!= null){

//响应内容

System.out.println(EntityUtils.toString(entity));

System.out.println("----------------------------------------");

//响应内容长度

System.out.println("响应内容长度:"+entity.getContentLength());

}

} catch(ClientProtocolException e){

e.printStackTrace();

} catch(IOException e){

e.printStackTrace();

}finally{

httpCLient.getConnectionManager().shutdown();

}

}

}

...org/apache/http/client/HttpClient异常该如何解决

出现java.lang.NoClassDefFoundError: org/apache/http/client/HttpClient异常的原因是JVM在运行时找不到org.apache.http.client.HttpClient类,根本原因是项目缺少Apache HttpClient相关的Jar包。以下是具体解决方案:

添加HTTP客户端Jar包到项目类路径

Web应用:将Apache HttpClient的Jar包(如httpclient-x.x.x.jar)复制到项目的WEB-INF/lib目录下。这样,在部署和运行时,服务器能够从该目录加载所需的Jar包。

独立应用:确保Jar包在类路径中。可以通过以下两种方式实现:设置环境变量:将包含Jar包的目录添加到系统的CLASSPATH环境变量中。

使用命令行参数:在运行Java程序时,使用-cp(或-classpath)选项明确指定类路径。例如:java-cp".;path/to/httpclient-x.x.x.jar" YourMainClass(Windows系统),其中.表示当前目录,path/to/httpclient-x.x.x.jar是Jar包的实际路径。

使用依赖管理工具

Maven:在项目的pom.xml文件中添加Apache HttpClient的依赖。示例如下:

<dependencies><dependency><groupId>org.apache.httpcomponents</groupId><artifactId>httpclient</artifactId><version>4.5.13</version><!--使用最新稳定版本--></dependency></dependencies>- Gradle:在项目的`build.gradle`文件中添加依赖。示例如下:dependencies{ implementation'org.apache.httpcomponents:httpclient:4.5.13'//使用最新稳定版本}-优势:依赖管理工具能够自动下载和管理所需的依赖项,并处理版本冲突,避免手动添加Jar包带来的错误和不便。验证类路径

仔细检查项目的类路径是否包含httpclient Jar包。可以通过以下方式验证:IDE中查看:在集成开发环境(如Eclipse、IntelliJ IDEA)中,查看项目的构建路径或依赖配置,确保httpclient Jar包已被正确添加。

命令行验证:对于独立应用,可以使用java-verbose:class YourMainClass命令运行程序,查看JVM加载类的详细信息,确认是否成功加载了org.apache.http.client.HttpClient类。

检查依赖管理工具配置

如果使用Maven或Gradle等依赖管理工具,但仍然出现该异常,可能是依赖未能正确解析。可以尝试以下操作:更新依赖:运行mvn clean install(Maven)或gradle build(Gradle)命令,确保所有依赖项都被正确下载和构建。

检查仓库配置:确认项目的pom.xml或build.gradle文件中配置的仓库(如Maven中央仓库)能够正常访问,并且包含所需的依赖版本。

处理编译时和运行时的差异

该异常通常发生在编译时类定义可用,但运行时找不到的情况下。这可能是由于以下原因:编译环境与运行环境不一致:确保编译时使用的类路径和运行时使用的类路径一致。例如,如果在编译时使用了某个版本的httpclient Jar包,但在运行时使用了不同版本的Jar包,可能会导致类找不到的问题。

动态加载类:如果项目中使用反射或其他动态加载类的机制,确保在运行时能够正确找到所需的类。可以通过在代码中添加异常处理逻辑,捕获NoClassDefFoundError异常,并输出更详细的错误信息,帮助定位问题。

httpclient.jar和使用java开源工具httpclient怎么使用的问题分享结束啦,以上的文章解决了您的问题吗?欢迎您下次再来哦!

完美世界官网官网 完美世界官方在哪里
« 上一篇2026-09-15
武林群侠传修改器?剑侠传奇内置修改器
下一篇 »2026-09-15