Java调用phantomjs采集ajax加载生成的网页
2017-02-21 15:40
447 查看
日前有采集需求,当我把所有的对应页面的链接都拿到手,准备开始根据链接去采集(写爬虫爬取)对应的终端页的时候,发觉用程序获取到的数据根本没有对应的内容,可是我的浏览器看到的内容明明是有的,于是浏览器查看源代码也发觉没有,此时想起该网页应该是ajax加载的。不知道ajax的小朋友可以去学下web开发啦。
#
采集ajax生成的内容手段不外乎两种。一种是通过http观察加载页面时候的请求,然后我们模仿该请求去得到对应的内容,第二种则是模仿浏览器行为去渲染这个页面得到内容。我在这里决定采用第二种方式,之前一直玩webkit,不过一直要加载页面太浪费资源了,此时了解到有一个好玩的玩意phantomjs,这是个可以用命令行来操作webkit的玩意,然后也可以直接在里面用js的api去操作页面(当然,我这边比较简单就懒得用了)。
#
下载完phantomjs之后直接解压就可以使用,然后在path目录加入phantomjs的路径(以便直接在命令行就可以执行phantomjs命令)。
#
接下来要完成个代码,一个是用phantomjs去获取页面(采用js编写行为),一个是采用Java去调用phantomjs来达到获取内容的作用,接下来直接贴代码。
[javascript]
上述的js代码估计应该没几个看不懂的。。。
#
接下来贴java代码!
[java]
其实原理很简单,就是通过进程间通信用java调用phantomjs这个组件去请求渲染页面,不过这种做法因为每次都要重新启动phantomjs进程,所以比较慢,还有另外一种直接用phantomjs加载页面后,把内容post给我们自定义的一个http后端接收数据,会更快一点。
#
采集ajax生成的内容手段不外乎两种。一种是通过http观察加载页面时候的请求,然后我们模仿该请求去得到对应的内容,第二种则是模仿浏览器行为去渲染这个页面得到内容。我在这里决定采用第二种方式,之前一直玩webkit,不过一直要加载页面太浪费资源了,此时了解到有一个好玩的玩意phantomjs,这是个可以用命令行来操作webkit的玩意,然后也可以直接在里面用js的api去操作页面(当然,我这边比较简单就懒得用了)。
#
下载完phantomjs之后直接解压就可以使用,然后在path目录加入phantomjs的路径(以便直接在命令行就可以执行phantomjs命令)。
#
接下来要完成个代码,一个是用phantomjs去获取页面(采用js编写行为),一个是采用Java去调用phantomjs来达到获取内容的作用,接下来直接贴代码。
[javascript]
//codes.js system = require('system') address = system.args[1];//获得命令行第二个参数 接下来会用到 //console.log('Loading a web page'); var page = require('webpage').create(); var url = address; //console.log(url); page.open(url, function (status) { //Page is loaded! if (status !== 'success') { console.log('Unable to post!'); } else { //console.log(page.content); //var title = page.evaluate(function() { // return document.title;//示范下如何使用页面的jsapi去操作页面的 // }); //console.log(title); console.log(page.content); } phantom.exit(); });
上述的js代码估计应该没几个看不懂的。。。
#
接下来贴java代码!
[java]
import org.apache.commons.io.IOUtils; import java.io.*; /** * Created with IntelliJ IDEA. * User: lsz * Date: 14-4-22 * Time: 下午1:17 * utils for http */ public class HttpUtils { public static String getAjaxCotnent(String url) throws IOException { Runtime rt = Runtime.getRuntime(); Process p = rt.exec("phantomjs.exe c:/phantomjs/codes.js "+url);//这里我的codes.js是保存在c盘下面的phantomjs目录 InputStream is = p.getInputStream(); BufferedReader br = new BufferedReader(new InputStreamReader(is)); StringBuffer sbf = new StringBuffer(); String tmp = ""; while((tmp = br.readLine())!=null){ sbf.append(tmp); } //System.out.println(sbf.toString()); return sbf.toString(); } public static void main(String[] args) throws IOException { getAjaxCotnent("http://www.baidu.com"); } }
其实原理很简单,就是通过进程间通信用java调用phantomjs这个组件去请求渲染页面,不过这种做法因为每次都要重新启动phantomjs进程,所以比较慢,还有另外一种直接用phantomjs加载页面后,把内容post给我们自定义的一个http后端接收数据,会更快一点。
相关文章推荐
- java调用phantomjs采集ajax加载生成的网页
- java调用phantomjs采集ajax加载生成的网页
- java调用phantomjs采集ajax加载生成的网页
- Java爬虫——phantomjs抓取ajax动态加载网页
- Java爬虫——phantomjs抓取ajax动态加载网页
- HtmlUnit爬取Ajax动态生成的网页以及自动调用页面javascript函数
- Scrapy框架结合Spynner采集需进行js,ajax动态加载的网页并提取网页信息(以采集微信公众号文章列表为例)
- HtmlUnit爬取Ajax动态生成的网页以及自动调用页面javascript函数
- Scrapy框架结合Spynner采集需进行js,ajax动态加载的网页并提取网页信息(以采集微信公众号文章列表为例)
- 使用Selenium+PhantomJS实现网页内容加载(包括网页后期Ajax出来的结果)
- jsp/servlet使用ajax动态加载dtree, dtree样式/图片修改 (java 生成dtree servlet json)
- Scrapy框架结合Spynner采集需进行js,ajax动态加载的网页并提取网页信息(以采集微信公众号文章列表为例)
- Android加载网页JavaScript与Java之间的相互调用
- android中webview携带cookie以及webview所加载网页中js调用java方法问题
- jsp/servlet使用ajax动态加载dtree, dtree样式/图片修改 (java 生成dtree servlet json)
- 使用ASP.NET AJAX异步调用Web Service和页面中的类方法(4):异步通讯层生成的客户端代理类、使用HTTP GET进行调用
- 基于Ajax和JSON从javascript中调用后台java方法的JsonGateway
- JSP调用Java Bean在网页上动态生成柱状图
- ABAP TO JAVA (ABAP调用网页)
- JSP调用Java Bean在网页上动态生成柱状图