AI导航网

技术频道

公众号推荐

微信公众号搜"智元新知"关注
微信扫一扫可直接关注哦！

kamike.collect 网络爬虫

程序名称：kamike.collect

授权协议: LGPL

操作系统: 跨平台

开发语言: Java

kamike.collect 介绍

Another Simple Crawler 又一个网络爬虫，可以支持代理服务器的翻墙爬取。

1.数据存在MysqL当中。

2.使用时，先修改web-inf/config.ini的数据链接相关信息，主要是数据库名和用户名和密码

3.然后访问http://127.0.0.1/fetch/install 链接，自动创建数据库表

4.修改src\java\cn\exinhua\fetch中的RestServlet.java文件：

   FetchInst.getInstance().running=true;

   Fetch fetch = new Fetch();

   fetch.setUrl("http://www.washingtonpost.com/");

    fetch.setDepth(3);

    RegexRule regexRule = new RegexRule();

    regexRule.addNegative(".*#.*");

    regexRule.addNegative(".*png.*");

    regexRule.addNegative(".*jpg.*");

    regexRule.addNegative(".*gif.*");

    regexRule.addNegative(".*js.*");

    regexRule.addNegative(".*css.*");

    regexRule.addPositive(".*PHP.*");

    regexRule.addPositive(".*html.*");

    regexRule.addPositive(".*htm.*");

    Fetcher fetcher = new Fetcher(fetch);

    fetcher.setProxyAuth(true);

    fetcher.setRegexRule(regexRule);

    List<Fetcher> fetchers = new ArrayList<>();

    fetchers.add(fetcher);
    FetchUtils.start(fetchers);


    将其配置为需要的参数，然后访问http://127.0.0.1/fetch/fetch启动爬取

    代理的配置在Fetch.java文件中：
    protected int status;

protected boolean resumable = false;

protected RegexRule regexRule = new RegexRule();
protected ArrayList<String> seeds = new ArrayList<String>();
protected Fetch fetch;

protected String proxyUrl="127.0.0.1";
protected int proxyPort=4444;
protected String proxyUsername="hkg";
protected String proxyPassword="dennis";
protected boolean proxyAuth=false;

5.访问 http://127.0.0.1/fetch/suspend可以停止爬取

kamike.collect 官网

https://github.com/hubinix/kamike.collect

版权声明：本文内容由互联网用户自发贡献，该文观点与技术仅代表作者本人。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容，请发送邮件至 [email protected] 举报，一经查实，本站将立刻删除。

网络爬虫工具

相关推荐

Pacman 是一个软件包管理器, 作为 ArchLinux 发行版的一部分.

作者：编程之家时间：2022-07-21

Smb4K 是KDE下的网络共享浏览器更多屏幕截图请看：http://developer.berlios.de/screenshots/?group_id=769

作者：编程之家时间：2022-07-21

Wine 开放源代码和用户驱动的

Wine （“Wine Is Not an Emulator” 的首字母缩写）是一个能够在多种 POSIX-compliant 操作系统（诸如

作者：编程之家时间：2022-07-21

虚拟桌面软件，可管理最多9个虚拟桌面，你可以用热键进行桌面切换

作者：编程之家时间：2022-07-21

UNetbootin USB安装模式硬盘安装模式

UNetbootin (Universal Netboot Installer)为一种跨平台工具软件，可以用来建立Live USB 系统，也可以加载各种系统工具，或安装各种Linux操作系统（Linux套件）和其他操作系统，不需使用安装光碟（自动透过网络下

作者：编程之家时间：2022-07-21

Cobbler 可以用来快速建立 Linux 网络安装环境，它已将 Linux 网络安装的技术门槛，从大专以上文化水平，成功降低到初中以下，连补鞋匠都能学会。

作者：编程之家时间：2022-07-21

Wubi是用于在Windows操作系统中安装Ubuntu的工具软件，Wubi中的W代表Windows Lubi和Wubi是兄弟项目，目的都是为了方便用户安装Ubuntu（也支持其他的Linux发行版，如Fedora），Lubi和Wubi两者工作的平台不同，但都具

作者：编程之家时间：2022-07-21

KCalendar 允许被嵌入到你的 Linux 桌面，并支持显示包括农历日期、24 节气、农历节日、农历生日、阳历生日、阳历节日、阳历纪念日、周节日等在内的各种内容，尤其适合咱中文用户使用。

作者：编程之家时间：2022-07-21

IPodWizard 让你可以定制你的 iPod 上的不同的图标,文本串和字体.该软件不仅可以直接地连接到你的 iPod

作者：编程之家时间：2022-07-21

QEMU 是一套由Fabrice Bellard所编写的模拟处理器的自由软件。它与Bochs，PearPC近似，但其具有某些后两者所不具备的特性，如高速度及跨平台的特性。经由kqemu这个开源的加速器，QEMU能模拟至接近真实电脑的速度。

作者：编程之家时间：2022-07-21