Code
Hub
Workspaces
Following
Trending
Connect
MCP
copy
Create free account
hub
/
github.com/CrawlScript/WebCollector
/ types & classes
Types & classes
97 in github.com/CrawlScript/WebCollector
⨍
Functions
510
◇
Types & classes
97
Class
AbuyunDynamicProxyRequester
WebCollector使用阿布云代理的Http请求插件 <p> 插件使用方法: crawler.setRequester(new AbuyunDynamicProxyRequester("阿布云动态代理用户名", "阿布云动态代理密码")); 一行代码解决,无需自定义代理池及其它代理切换规则 <p
src/main/java/cn/edu/hfut/dmic/webcollector/example/AbuyunDynamicProxyRequester.java:39
Class
AutoParseCrawler
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/crawler/AutoParseCrawler.java:39
Class
BerkeleyCrawler
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/plugin/berkeley/BerkeleyCrawler.java:27
Class
BerkeleyDBManager
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/plugin/berkeley/BerkeleyDBManager.java:43
Class
BerkeleyDBReader
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/plugin/berkeley/BerkeleyDBReader.java:37
Class
BerkeleyDBUtils
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/plugin/berkeley/BerkeleyDBUtils.java:33
Class
BerkeleyGenerator
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/plugin/berkeley/BerkeleyGenerator.java:40
Class
BreadthCrawler
cn.edu.hfut.dmic.webcollector.plugin.rocks.BreadthCrawler是基于RocksDB的插件,于2.72版重新设计 BreadthCrawler可以设置正则规律,让遍历器自动根据URL的正则遍历网站,可以关闭这个功能,自定义遍历 如果autoParse
src/main/java/cn/edu/hfut/dmic/webcollector/plugin/rocks/BreadthCrawler.java:32
Class
BreadthCrawler
cn.edu.hfut.dmic.webcollector.plugin.berkeley.BreadthCrawler是基于Berkeley DB的插件,于2.20版重新设计 BreadthCrawler可以设置正则规律,让遍历器自动根据URL的正则遍历网站,可以关闭这个功能,自定义遍历 如果au
src/main/java/cn/edu/hfut/dmic/webcollector/plugin/berkeley/BreadthCrawler.java:32
Class
CharsetDetector
字符集自动检测 @author hu
src/main/java/cn/edu/hfut/dmic/webcollector/util/CharsetDetector.java:30
Class
CharsetDetectorTest
Created by Vlad Medvedev on 21.01.2016. vladislav.medvedev@devfactory.com
src/test/java/cn/edu/hfut/dmic/webcollector/util/CharsetDetectorTest.java:31
Class
CommonConfigured
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/conf/CommonConfigured.java:23
Class
CommonRequester
src/main/java/cn/edu/hfut/dmic/webcollector/net/CommonRequester.java:7
Class
Config
全局配置 @author hu
src/main/java/cn/edu/hfut/dmic/webcollector/util/Config.java:25
Class
Configuration
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/conf/Configuration.java:28
Class
ConfigurationUtils
src/main/java/cn/edu/hfut/dmic/webcollector/util/ConfigurationUtils.java:6
Interface
Configured
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/conf/Configured.java:23
Class
ContentExtractor
ContentExtractor could extract content,title,time from news webpage @author hu
src/main/java/cn/edu/hfut/dmic/contentextractor/ContentExtractor.java:43
Class
CountInfo
src/main/java/cn/edu/hfut/dmic/contentextractor/ContentExtractor.java:55
Class
Counter
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/util/Counter.java:26
Class
CrawlDatum
爬取任务的数据结构 @author hu
src/main/java/cn/edu/hfut/dmic/webcollector/model/CrawlDatum.java:33
Class
CrawlDatumFormater
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/util/CrawlDatumFormater.java:35
Class
CrawlDatumTest
@author hu
src/test/java/cn/edu/hfut/dmic/webcollector/util/CrawlDatumTest.java:30
Class
CrawlDatums
用于存储多个CrawlDatum的数据结构 @author hu
src/main/java/cn/edu/hfut/dmic/webcollector/model/CrawlDatums.java:31
Class
CrawlDatumsTest
@author hu
src/test/java/cn/edu/hfut/dmic/webcollector/util/CrawlDatumsTest.java:31
Class
Crawler
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/crawler/Crawler.java:37
Class
DBManager
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/crawldb/DBManager.java:30
Class
DBManagerTest
src/test/java/cn/edu/hfut/dmic/webcollector/util/DBManagerTest.java:16
Class
DefaultConfigured
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/conf/DefaultConfigured.java:23
Class
DemoAnnotatedAutoNewsCrawler
Crawling news from github news @author hu
src/main/java/cn/edu/hfut/dmic/webcollector/example/DemoAnnotatedAutoNewsCrawler.java:12
Class
DemoAnnotatedBingCrawler
本教程演示了WebCollector 2.20的新特性: 1)MetaData: MetaData是每个爬取任务的附加信息,灵活应用MetaData可以大大简化爬虫的设计. 例如Post请求往往需要包含参数,而传统爬虫单纯使用URL来保存参数的方法不适合复杂的POST请求. 一些
src/main/java/cn/edu/hfut/dmic/webcollector/example/DemoAnnotatedBingCrawler.java:52
Class
DemoAnnotatedDepthCrawler
本教程和深度遍历没有任何关系 一些爬取需求希望加入深度信息,即遍历树中网页的层 利用2.20版本中的新特性MetaData可以轻松实现这个功能 @author hu
src/main/java/cn/edu/hfut/dmic/webcollector/example/DemoAnnotatedDepthCrawler.java:32
Class
DemoAnnotatedManualNewsCrawler
Crawling news from github news @author hu
src/main/java/cn/edu/hfut/dmic/webcollector/example/DemoAnnotatedManualNewsCrawler.java:12
Class
DemoAnnotatedMatchTypeCrawler
WebCollector 2.x版本的tutorial(2.20以上) 2.x版本特性: 1)自定义遍历策略,可完成更为复杂的遍历业务,例如分页、AJAX 2)可以为每个URL设置附加信息(MetaData),利用附加信息可以完成很多复杂业务,例如深度获取、锚文本获取、引用页面获取、POST参数传递
src/main/java/cn/edu/hfut/dmic/webcollector/example/DemoAnnotatedMatchTypeCrawler.java:42
Class
DemoAnnotatedRedirectCrawler
Handle 301/302 redirection @author hu
src/main/java/cn/edu/hfut/dmic/webcollector/example/DemoAnnotatedRedirectCrawler.java:33
Class
DemoAutoNewsCrawler
Crawling news from github news @author hu
src/main/java/cn/edu/hfut/dmic/webcollector/example/DemoAutoNewsCrawler.java:12
Class
DemoBingCrawler
本教程演示了WebCollector 2.20的新特性: 1)MetaData: MetaData是每个爬取任务的附加信息,灵活应用MetaData可以大大简化爬虫的设计. 例如Post请求往往需要包含参数,而传统爬虫单纯使用URL来保存参数的方法不适合复杂的POST请求. 一些
src/main/java/cn/edu/hfut/dmic/webcollector/example/DemoBingCrawler.java:53
Class
DemoCookieCrawler
教程:使用WebCollector自定义Http请求 可以自定义User-Agent和Cookie @author hu
src/main/java/cn/edu/hfut/dmic/webcollector/example/DemoCookieCrawler.java:16
Class
DemoExceptionCrawler
Crawling news from github news @author hu
src/main/java/cn/edu/hfut/dmic/webcollector/example/DemoExceptionCrawler.java:13
Class
DemoHashSetNextFilter
WebCollector 2.x版本的tutorial(2.20以上) 2.x版本特性: 1)自定义遍历策略,可完成更为复杂的遍历业务,例如分页、AJAX 2)可以为每个URL设置附加信息(MetaData),利用附加信息可以完成很多复杂业务,例如深度获取、锚文本获取、引用页面获取、POST参数传递
src/main/java/cn/edu/hfut/dmic/webcollector/example/DemoHashSetNextFilter.java:39
Class
DemoManualNewsCrawler
Crawling news from github news @author hu
src/main/java/cn/edu/hfut/dmic/webcollector/example/DemoManualNewsCrawler.java:12
Class
DemoMetaCrawler
WebCollector 2.x版本的tutorial(2.20以上) 2.x版本特性: 1)自定义遍历策略,可完成更为复杂的遍历业务,例如分页、AJAX 2)可以为每个URL设置附加信息(MetaData),利用附加信息可以完成很多复杂业务,例如深度获取、锚文本获取、引用页面获取、POST参数传递
src/main/java/cn/edu/hfut/dmic/webcollector/example/DemoMetaCrawler.java:42
Class
DemoNextFilter
WebCollector 2.x版本的tutorial(2.20以上) 2.x版本特性: 1)自定义遍历策略,可完成更为复杂的遍历业务,例如分页、AJAX 2)可以为每个URL设置附加信息(MetaData),利用附加信息可以完成很多复杂业务,例如深度获取、锚文本获取、引用页面获取、POST参数传递
src/main/java/cn/edu/hfut/dmic/webcollector/example/DemoNextFilter.java:39
Class
DemoPostCrawler
本教程演示了如何自定义http请求 有些爬取任务中,可能只有部分URL需要使用POST请求,我们可以利用2.20版本中添 加的MetaData功能,来完成POST请求的定制。 使用MetaData除了可以标记URL是否需要使用POST,还可以存储POST所需的参数信息 教程中还演示了如何定制C
src/main/java/cn/edu/hfut/dmic/webcollector/example/DemoPostCrawler.java:45
Class
DemoRandomProxyCrawler
教程:WebCollector随机代理 @author hu
src/main/java/cn/edu/hfut/dmic/webcollector/example/DemoRandomProxyCrawler.java:24
Class
DemoRedirectCrawler
Handle 301/302 redirection @author hu
src/main/java/cn/edu/hfut/dmic/webcollector/example/DemoRedirectCrawler.java:36
Class
DemoSeleniumCrawler
本教程演示如何利用WebCollector爬取javascript生成的数据 @author hu
src/main/java/cn/edu/hfut/dmic/webcollector/example/DemoSeleniumCrawler.java:37
Class
DemoTypeCrawler
WebCollector 2.40新特性 page.matchType 在添加CrawlDatum时(添加种子、或在抓取时向next中添加任务), 可以为CrawlDatum设置type信息 type的本质也是meta信息,为CrawlDatum的附加信息 在添加种子或向next中添加任务时,设置
src/main/java/cn/edu/hfut/dmic/webcollector/example/DemoTypeCrawler.java:45
Class
ExceptionUtils
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/util/ExceptionUtils.java:23
Interface
Executor
Created by hu on 2016/2/18.
src/main/java/cn/edu/hfut/dmic/webcollector/fetcher/Executor.java:26
Class
FetchItem
src/main/java/cn/edu/hfut/dmic/webcollector/fetcher/Fetcher.java:81
Class
FetchQueue
src/main/java/cn/edu/hfut/dmic/webcollector/fetcher/Fetcher.java:90
Class
Fetcher
抓取器 @author hu
src/main/java/cn/edu/hfut/dmic/webcollector/fetcher/Fetcher.java:42
Class
FetcherThread
src/main/java/cn/edu/hfut/dmic/webcollector/fetcher/Fetcher.java:207
Class
FileIdGenerator
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/util/FileIdGenerator.java:26
Class
FileSystemOutput
FileSystemOutput并不属于WebCollector内核,它只是实现一个 简单的输出,将网页根据url路径,保存到本地目录,按照网站目录 结构来存储网站内容。BreadthCrawler的visit函数中,默认使用 FileSystemOutput来保存网页。不推荐使用FileSyste
src/main/java/cn/edu/hfut/dmic/webcollector/util/FileSystemOutput.java:33
Class
FileUtils
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/util/FileUtils.java:31
Class
Generator
抓取任务生成器 @author hu
src/main/java/cn/edu/hfut/dmic/webcollector/crawldb/Generator.java:32
Interface
GeneratorFilter
src/main/java/cn/edu/hfut/dmic/webcollector/crawldb/GeneratorFilter.java:6
Class
GsonUtils
src/main/java/cn/edu/hfut/dmic/webcollector/util/GsonUtils.java:6
Class
HashSetNextFilter
Filter nextItem whose key is contained in the hashset @author hu
src/main/java/cn/edu/hfut/dmic/webcollector/plugin/nextfilter/HashSetNextFilter.java:28
Interface
Injector
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/crawldb/Injector.java:26
Class
InvalidAnnotatedVisitorMethodException
src/main/java/cn/edu/hfut/dmic/webcollector/fetcher/Visitor.java:86
Class
JsoupUtils
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/util/JsoupUtils.java:30
Class
Links
用于存储多个URL的数据结构,继承于ArrayList @author hu
src/main/java/cn/edu/hfut/dmic/webcollector/model/Links.java:34
Class
ListUtils
src/main/java/cn/edu/hfut/dmic/webcollector/util/ListUtils.java:6
Class
MD5Utils
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/util/MD5Utils.java:30
Interface
MetaGetter
src/main/java/cn/edu/hfut/dmic/webcollector/model/MetaGetter.java:5
Interface
MetaSetter
src/main/java/cn/edu/hfut/dmic/webcollector/model/MetaSetter.java:5
Class
MetaTest
src/test/java/cn/edu/hfut/dmic/webcollector/util/MetaTest.java:11
Class
MyRequester
src/main/java/cn/edu/hfut/dmic/webcollector/example/DemoCookieCrawler.java:20
Class
MyRequester
src/main/java/cn/edu/hfut/dmic/webcollector/example/DemoRandomProxyCrawler.java:28
Class
MysqlHelper
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/util/MysqlHelper.java:31
Class
News
@author hu
src/main/java/cn/edu/hfut/dmic/contentextractor/News.java:26
Interface
NextFilter
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/fetcher/NextFilter.java:26
Class
OkHttpRequester
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/plugin/net/OkHttpRequester.java:34
Class
OkHttpRequesterTest
src/test/java/cn/edu/hfut/dmic/webcollector/util/OkHttpRequesterTest.java:9
Class
Page
Page是爬取过程中,内存中保存网页爬取信息的一个容器,Page只在内存中存 放,用于保存一些网页信息,方便用户进行自定义网页解析之类的操作。 @author hu
src/main/java/cn/edu/hfut/dmic/webcollector/model/Page.java:43
Class
Proxies
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/net/Proxies.java:37
Class
QueueFeeder
src/main/java/cn/edu/hfut/dmic/webcollector/fetcher/Fetcher.java:129
Class
RamCrawler
基于内存的Crawler插件,适合一次性爬取,并不具有断点爬取功能 长期任务请使用BreadthCrawler @author hu
src/main/java/cn/edu/hfut/dmic/webcollector/plugin/ram/RamCrawler.java:28
Class
RamDB
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/plugin/ram/RamDB.java:30
Class
RamDBManager
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/plugin/ram/RamDBManager.java:32
Class
RamGenerator
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/plugin/ram/RamGenerator.java:30
Class
ReflectionUtils
src/main/java/cn/edu/hfut/dmic/webcollector/util/ReflectionUtils.java:6
Class
RegexRule
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/util/RegexRule.java:29
Interface
Requester
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/net/Requester.java:28
Class
RocksCrawler
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/plugin/rocks/RocksCrawler.java:27
Class
RocksDBManager
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/plugin/rocks/RocksDBManager.java:40
Class
RocksDBReader
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/plugin/rocks/RocksDBReader.java:33
Class
RocksDBUtils
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/plugin/rocks/RocksDBUtils.java:37
Class
RocksGenerator
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/plugin/rocks/RocksGenerator.java:31
Interface
SegmentWriter
爬取过程中,写入爬取历史、网页Content、解析信息的Writer @author hu
src/main/java/cn/edu/hfut/dmic/webcollector/crawldb/SegmentWriter.java:28
Class
StatusGeneratorFilter
src/main/java/cn/edu/hfut/dmic/webcollector/crawldb/StatusGeneratorFilter.java:6
Class
TutorialCrawler
WebCollector 2.x版本的tutorial(2.20以上) 2.x版本特性: 1)自定义遍历策略,可完成更为复杂的遍历业务,例如分页、AJAX 2)可以为每个URL设置附加信息(MetaData),利用附加信息可以完成很多复杂业务,例如深度获取、锚文本获取、引用页面获取、POST参数传递
src/main/java/cn/edu/hfut/dmic/webcollector/example/TutorialCrawler.java:42
Interface
Visitor
@author hu
src/main/java/cn/edu/hfut/dmic/webcollector/fetcher/Visitor.java:34
Class
VisitorMethodDispatcher
src/main/java/cn/edu/hfut/dmic/webcollector/fetcher/VisitorMethodDispatcher.java:20