CrawlScript语言轻松实现网络爬虫——轻松爬取整站信息
2014-01-21 00:16
309 查看
CrawlScript语言在beta0.3版本中集成了整站爬虫的功能,只需要简单几句,就可以完成对整站的爬取。
首先下载CrawlScript beta 0.3:
CrawlScript beta 0.3版及demo下载。
下载后解压,在CrawlScript-bin文件夹中有一个demo.js,这个代码虽然只有几行,但是实现了对整个新华网的新闻正文的爬取和抽取,一个完整的网络爬虫。
运行方式:用命令行进入CrawlScript-bin文件夹,输入命令:
爬虫的启动可能需要半分钟(这是因为这里的爬虫是允许在中断后继续爬取的,所以需要预处理很多信息)。然后就会发现不断刷新新信息。查看CrawlScript-bin下的download文件夹,会发现新华网的新闻在不断地加入:
想了解更多,加入QQ讨论群或者发邮件咨询:
CrawlScript爬虫脚本语言官方QQ群:250108697
CrawlScript爬虫脚本语言官方邮箱:briefcopy@126.com
注:CrawlScript是开源软件,不会向您索要任何费用。
首先下载CrawlScript beta 0.3:
CrawlScript beta 0.3版及demo下载。
下载后解压,在CrawlScript-bin文件夹中有一个demo.js,这个代码虽然只有几行,但是实现了对整个新华网的新闻正文的爬取和抽取,一个完整的网络爬虫。
运行方式:用命令行进入CrawlScript-bin文件夹,输入命令:
java -jar crawlscript.jar demo.js
爬虫的启动可能需要半分钟(这是因为这里的爬虫是允许在中断后继续爬取的,所以需要预处理很多信息)。然后就会发现不断刷新新信息。查看CrawlScript-bin下的download文件夹,会发现新华网的新闻在不断地加入:
想了解更多,加入QQ讨论群或者发邮件咨询:
CrawlScript爬虫脚本语言官方QQ群:250108697
CrawlScript爬虫脚本语言官方邮箱:briefcopy@126.com
注:CrawlScript是开源软件,不会向您索要任何费用。
相关文章推荐
- JAVA平台上的网络爬虫脚本语言 CrawlScript
- java语言实现网络爬虫
- JAVA平台上的网络爬虫脚本语言 CrawlScript
- java实现简单的网络爬虫(爬取电影天堂电影信息)
- Python实现可获取网易页面所有文本信息的网易网络爬虫功能示例
- 使用python爬虫实现网络股票信息爬取的demo
- Java语言实现的简单网络爬虫复习
- CrawlScript脚本语言实现网络爬虫
- 网络爬虫:利用有道实现“语言翻译”功能
- CrawlScript语言————一门用javascript语法在JAVA环境下,快捷开发网络爬虫的脚本语言
- [代码]Delphi实现获取当前系统的语言信息
- 基于C#实现网络爬虫 C#抓取网页Html源码
- DHT网络爬虫的实现
- 网络爬虫爬取全国省市区(动态ip代理的获取,实现对ip限制的突破)
- 【房价网房价信息爬虫】整站40万条房价数据并行抓取,可更换抓取城市
- python3实现网络爬虫(1)--urlopen抓取网页的html
- [Python] 实现网络爬虫
- thrift 轻松实现多语言跨服务器通信
- 【使用JSOUP实现网络爬虫】获取所有链接
- Asp.net MVC 2 网站轻松实现多语言支持