Code
Hub
Workspaces
Following
Trending
Connect
MCP
copy
Create free account
hub
/
github.com/NanmiCoder/CrawlerTutorial
/ types & classes
Types & classes
149 in github.com/NanmiCoder/CrawlerTutorial
⨍
Functions
724
◇
Types & classes
149
↓ 7 callers
Class
LoginResult
登录结果
源代码/爬虫进阶/07_登录认证_扫码与短信登录实现/login_factory.py:23
↓ 5 callers
Class
TokenBucket
令牌桶限速器 工作原理: - 桶有固定容量(最大令牌数) - 以固定速率向桶中添加令牌 - 每次请求消耗一个令牌 - 桶空时请求需要等待 适用场景: - 需要精确控制平均请求速率 - 允许一定程度的突发请求
源代码/爬虫进阶/02_反爬虫对抗基础_请求伪装/rate_limiter.py:11
↓ 4 callers
Class
CookieManager
完整的 Cookie 管理器
源代码/爬虫进阶/06_登录认证_Cookie与Session管理/cookie_manager.py:229
↓ 4 callers
Class
NoteContent
帖子简介存储容器
源代码/爬虫入门/08_爬虫入门实战1_静态网页数据提取/common.py:9
↓ 4 callers
Class
ParseException
数据解析异常
源代码/爬虫进阶/01_工程化爬虫开发规范/refactored_crawler/exceptions.py:39
↓ 4 callers
Class
ProxyChecker
代理检测器 功能: - 检测代理的可用性 - 测量响应时间 - 支持批量检测
源代码/爬虫进阶/03_代理IP的使用与管理/proxy_pool/checker.py:13
↓ 4 callers
Class
UARotator
User-Agent 轮换器 支持: - 随机获取桌面端/移动端 UA - 自定义 UA 列表 - 集成 fake-useragent 库(可选)
源代码/爬虫进阶/02_反爬虫对抗基础_请求伪装/ua_rotator.py:49
↓ 3 callers
Class
BilibiliCrawler
B站爬虫类 整合浏览器管理、登录认证、API客户端,实现完整的爬取流程。 使用示例: ```python crawler = BilibiliCrawler() videos = await crawler.start() ```
源代码/爬虫进阶/11_进阶综合实战项目/crawler/spider.py:36
↓ 3 callers
Class
BilibiliSign
B站 WBI 签名类 使用方法: ```python # 创建签名实例(需要先从浏览器获取 img_key 和 sub_key) signer = BilibiliSign(img_key="xxx", sub_key="yyy") # 对请求参
源代码/爬虫进阶/11_进阶综合实战项目/tools/sign.py:49
↓ 3 callers
Class
DataFrameAnalyzer
DataFrame 数据分析器
源代码/爬虫进阶/10_数据分析与可视化/pandas_analysis.py:10
↓ 3 callers
Class
ProxyInfo
代理信息数据类 包含代理的基本信息和质量指标
源代码/爬虫进阶/03_代理IP的使用与管理/proxy_pool/base.py:19
↓ 3 callers
Class
RateLimitConfig
速率限制配置
源代码/爬虫进阶/02_反爬虫对抗基础_请求伪装/rate_limiter.py:238
↓ 3 callers
Class
SymbolContent
源代码/爬虫入门/10_爬虫入门实战3_数据存储实现/common.py:10
↓ 3 callers
Class
SymbolContent
源代码/爬虫入门/11_爬虫入门实战4_高效率的爬虫实现/common.py:9
↓ 3 callers
Class
TimeoutException
请求超时异常
源代码/爬虫进阶/01_工程化爬虫开发规范/exception_demo.py:42
↓ 2 callers
Class
BilibiliClient
B站 API 客户端 封装 B站的 API 请求,支持 WBI 签名。 使用示例: ```python client = BilibiliClient() await client.update_cookies(browser_context)
源代码/爬虫进阶/11_进阶综合实战项目/client/bilibili_client.py:38
↓ 2 callers
Class
BilibiliCookieManager
B站 Cookie 管理器 功能: - Cookie 加载/保存 - 登录状态检测 - Cookie 有效性验证 - 支持多种格式(JSON、字符串)
源代码/爬虫进阶/06_登录认证_Cookie与Session管理/bilibili_cookie.py:152
↓ 2 callers
Class
BilibiliLogin
B站登录类 支持扫码登录和 Cookie 登录两种方式。 使用示例: ```python login = BilibiliLogin( login_type="qrcode", browser_context=contex
源代码/爬虫进阶/11_进阶综合实战项目/login/auth.py:85
↓ 2 callers
Class
BrowserManager
浏览器管理器
源代码/爬虫进阶/11_进阶综合实战项目/core/browser.py:53
↓ 2 callers
Class
CaptchaPreprocessor
验证码图片预处理器
源代码/爬虫进阶/08_验证码识别与处理/ocr_captcha.py:24
↓ 2 callers
Class
ChineseTokenizer
中文分词器
源代码/爬虫进阶/10_数据分析与可视化/wordcloud_generator.py:34
↓ 2 callers
Class
CompositeRateLimiter
组合速率限制器 结合多种限速策略: - 令牌桶控制平均速率 - 并发限制控制同时请求数 - 随机延迟模拟人类行为
源代码/爬虫进阶/02_反爬虫对抗基础_请求伪装/rate_limiter.py:246
↓ 2 callers
Class
ConcurrencyLimiter
并发限制器 限制同时进行的请求数量
源代码/爬虫进阶/02_反爬虫对抗基础_请求伪装/rate_limiter.py:193
↓ 2 callers
Class
ContextPool
浏览器上下文池
源代码/爬虫进阶/05_Playwright进阶_反检测与性能优化/performance_optimization.py:64
↓ 2 callers
Class
CookieRotator
Cookie 轮换器 - 支持多账号 Cookie 管理
源代码/爬虫进阶/06_登录认证_Cookie与Session管理/cookie_manager.py:133
↓ 2 callers
Class
CrawlerConfig
爬虫配置
源代码/爬虫进阶/02_反爬虫对抗基础_请求伪装/anti_detection_crawler.py:28
↓ 2 callers
Class
CreatorUrlInfo
创作者 URL 信息
源代码/爬虫进阶/11_进阶综合实战项目/tools/sign.py:44
↓ 2 callers
Class
HeadersBuilder
HTTP 请求头构建器 功能: - 构建完整的浏览器请求头 - 支持页面请求和 API 请求 - 自动设置 Referer 和 Origin - 集成 UA 轮换
源代码/爬虫进阶/02_反爬虫对抗基础_请求伪装/headers_builder.py:8
↓ 2 callers
Class
HumanTrajectoryGenerator
人类轨迹生成器
源代码/爬虫进阶/08_验证码识别与处理/slider_captcha.py:171
↓ 2 callers
Class
MockProxyFetcher
模拟代理获取器 用于演示,实际使用时替换为真实的代理获取器
源代码/爬虫进阶/03_代理IP的使用与管理/proxy_demo.py:15
↓ 2 callers
Class
NoteContentDetail
帖子
源代码/爬虫入门/08_爬虫入门实战1_静态网页数据提取/common.py:40
↓ 2 callers
Class
NotePushComment
推文存储容器
源代码/爬虫入门/08_爬虫入门实战1_静态网页数据提取/common.py:27
↓ 2 callers
Class
OCRCaptchaSolver
OCR 验证码识别器
源代码/爬虫进阶/08_验证码识别与处理/ocr_captcha.py:171
↓ 2 callers
Class
ProxyInfo
代理信息
源代码/爬虫进阶/11_进阶综合实战项目/proxy/pool.py:20
↓ 2 callers
Class
ProxyPool
代理池实现 特性: - 自动获取和检测代理 - 基于评分的智能分配 - 自动淘汰失效代理 - 后台自动刷新
源代码/爬虫进阶/03_代理IP的使用与管理/proxy_pool/pool.py:13
↓ 2 callers
Class
ProxyProtocol
代理协议枚举
源代码/爬虫进阶/03_代理IP的使用与管理/proxy_pool/base.py:11
↓ 2 callers
Class
QRCodeLogin
通用扫码登录实现
源代码/爬虫进阶/07_登录认证_扫码与短信登录实现/qrcode_login.py:79
↓ 2 callers
Class
Quote
名言数据模型
源代码/爬虫进阶/04_Playwright浏览器自动化入门/spa_crawler.py:13
↓ 2 callers
Class
RandomDelayLimiter
随机延迟限速器 在每次请求后添加随机延迟,模拟人类行为
源代码/爬虫进阶/02_反爬虫对抗基础_请求伪装/rate_limiter.py:84
↓ 2 callers
Class
RequestException
HTTP 请求异常
源代码/爬虫进阶/01_工程化爬虫开发规范/refactored_crawler/exceptions.py:21
↓ 2 callers
Class
SMSLogin
短信验证码登录
源代码/爬虫进阶/07_登录认证_扫码与短信登录实现/sms_login.py:10
↓ 2 callers
Class
SymbolContent
源代码/爬虫入门/09_爬虫入门实战2_动态数据提取/common.py:9
↓ 2 callers
Class
VideoUrlInfo
视频 URL 信息
源代码/爬虫进阶/11_进阶综合实战项目/tools/sign.py:37
↓ 1 callers
Class
AccountCookie
账号 Cookie 信息
源代码/爬虫进阶/06_登录认证_Cookie与Session管理/cookie_manager.py:123
↓ 1 callers
Class
AntiDetectionCrawler
反检测爬虫 特性: - User-Agent 随机轮换 - 完整的请求头伪装 - TLS 指纹模拟(使用 curl_cffi) - 智能速率控制 - 优雅的重试机制
源代码/爬虫进阶/02_反爬虫对抗基础_请求伪装/anti_detection_crawler.py:47
↓ 1 callers
Class
AsyncMysqlDB
源代码/爬虫入门/10_爬虫入门实战3_数据存储实现/async_db.py:12
↓ 1 callers
Class
BBSCrawler
BBS 论坛爬虫 工程化特性: - 配置驱动 - 完善的日志记录 - 优雅的异常处理 - 资源自动管理
源代码/爬虫进阶/01_工程化爬虫开发规范/refactored_crawler/crawler.py:15
↓ 1 callers
Class
BBSParser
BBS 页面解析器
源代码/爬虫进阶/01_工程化爬虫开发规范/refactored_crawler/parser.py:12
↓ 1 callers
Class
BilibiliAnalyzer
B站视频数据分析器 提供针对 B站视频数据的专用分析方法。
源代码/爬虫进阶/11_进阶综合实战项目/analysis/report.py:205
↓ 1 callers
Class
BilibiliCookies
B站 Cookie 数据类 核心 Cookie: - SESSDATA: 会话凭证(最重要) - DedeUserID: 用户ID - bili_jct: CSRF Token(POST请求必需) 辅助 Cookie: - buvid3/
源代码/爬虫进阶/06_登录认证_Cookie与Session管理/bilibili_cookie.py:32
↓ 1 callers
Class
BilibiliLoginCookies
B站登录 Cookie 数据类 扫码登录成功后提取的Cookie
源代码/爬虫进阶/07_登录认证_扫码与短信登录实现/bilibili_qrcode_login.py:60
↓ 1 callers
Class
BilibiliQRCodeLogin
B站扫码登录实现 流程: 1. 调用 /qrcode/generate 获取二维码URL和qrcode_key 2. 生成二维码图片(保存到文件或终端显示) 3. 轮询 /qrcode/poll 检查扫码状态 4. 登录成功后提取Cookie
源代码/爬虫进阶/07_登录认证_扫码与短信登录实现/bilibili_qrcode_login.py:99
↓ 1 callers
Class
BilibiliVideo
B站视频信息模型 该模型对应 B站视频详情 API 返回的数据结构, 包含了视频的基本信息、统计数据和作者信息。
源代码/爬虫进阶/11_进阶综合实战项目/models/bilibili.py:20
↓ 1 callers
Class
CSVStorage
CSV 存储
源代码/爬虫进阶/11_进阶综合实战项目/store/backend.py:118
↓ 1 callers
Class
CookieLogin
Cookie 注入登录
源代码/爬虫进阶/07_登录认证_扫码与短信登录实现/login_factory.py:60
↓ 1 callers
Class
CostController
打码成本控制器
源代码/爬虫进阶/08_验证码识别与处理/captcha_service.py:187
↓ 1 callers
Class
CrawlResult
爬取结果
源代码/爬虫进阶/01_工程化爬虫开发规范/refactored_crawler/models.py:33
↓ 1 callers
Class
CrawlerClient
封装的 HTTP 客户端 特性: - 统一的请求头配置 - 自动重试机制 - 优雅的错误处理 - 资源自动管理
源代码/爬虫进阶/01_工程化爬虫开发规范/refactored_crawler/client.py:19
↓ 1 callers
Class
CrawlerSettings
爬虫项目配置类 配置优先级(从高到低): 1. 环境变量 (CRAWLER_XXX) 2. .env 文件 3. 默认值
源代码/爬虫进阶/01_工程化爬虫开发规范/config/settings.py:11
↓ 1 callers
Class
CsvStoreImpl
源代码/爬虫入门/10_爬虫入门实战3_数据存储实现/abstract_store_impl.py:32
↓ 1 callers
Class
DataNormalizer
综合数据标准化器
源代码/爬虫进阶/09_数据清洗与预处理/data_normalizer.py:349
↓ 1 callers
Class
DateTimeNormalizer
日期时间标准化器
源代码/爬虫进阶/09_数据清洗与预处理/data_normalizer.py:10
↓ 1 callers
Class
DbStoreImpl
源代码/爬虫入门/10_爬虫入门实战3_数据存储实现/abstract_store_impl.py:94
↓ 1 callers
Class
JSONStorage
JSON 存储
源代码/爬虫进阶/11_进阶综合实战项目/store/backend.py:63
↓ 1 callers
Class
JsonStoreImpl
源代码/爬虫入门/10_爬虫入门实战3_数据存储实现/abstract_store_impl.py:61
↓ 1 callers
Class
LocalOCRService
本地 OCR 服务
源代码/爬虫进阶/08_验证码识别与处理/captcha_service.py:27
↓ 1 callers
Class
LoginManager
统一登录管理器
源代码/爬虫进阶/07_登录认证_扫码与短信登录实现/login_factory.py:293
↓ 1 callers
Class
MatplotlibCharts
Matplotlib 静态图表生成器
源代码/爬虫进阶/10_数据分析与可视化/chart_demo.py:29
↓ 1 callers
Class
MockSMSCodeReceiver
模拟接码平台(用于测试)
源代码/爬虫进阶/07_登录认证_扫码与短信登录实现/sms_login.py:259
↓ 1 callers
Class
MysqlConnect
源代码/爬虫入门/10_爬虫入门实战3_数据存储实现/async_db.py:101
↓ 1 callers
Class
NoteDetail
帖子详情
源代码/爬虫进阶/01_工程化爬虫开发规范/refactored_crawler/models.py:23
↓ 1 callers
Class
NoteItem
帖子列表项
源代码/爬虫进阶/01_工程化爬虫开发规范/refactored_crawler/models.py:8
↓ 1 callers
Class
NumberNormalizer
数值标准化器
源代码/爬虫进阶/09_数据清洗与预处理/data_normalizer.py:142
↓ 1 callers
Class
OptimizedCrawler
优化的爬虫
源代码/爬虫进阶/05_Playwright进阶_反检测与性能优化/performance_optimization.py:112
↓ 1 callers
Class
ProxiedCrawler
使用代理池的爬虫示例
源代码/爬虫进阶/03_代理IP的使用与管理/proxy_demo.py:45
↓ 1 callers
Class
PushComment
推文/评论
源代码/爬虫进阶/01_工程化爬虫开发规范/refactored_crawler/models.py:16
↓ 1 callers
Class
PyechartsCharts
Pyecharts 交互式图表生成器
源代码/爬虫进阶/10_数据分析与可视化/chart_demo.py:238
↓ 1 callers
Class
QRCodeLoginWrapper
扫码登录包装器
源代码/爬虫进阶/07_登录认证_扫码与短信登录实现/login_factory.py:89
↓ 1 callers
Class
RateLimitException
触发速率限制异常
源代码/爬虫进阶/01_工程化爬虫开发规范/exception_demo.py:58
↓ 1 callers
Class
ReportGenerator
报告生成器 生成 B站视频数据的 Markdown 格式分析报告。
源代码/爬虫进阶/11_进阶综合实战项目/analysis/report.py:353
↓ 1 callers
Class
SMSLoginWrapper
短信登录包装器
源代码/爬虫进阶/07_登录认证_扫码与短信登录实现/login_factory.py:162
↓ 1 callers
Class
SPACrawler
SPA 爬虫示例 爬取 https://quotes.toscrape.com/js/ - 一个需要 JavaScript 渲染的页面
源代码/爬虫进阶/04_Playwright浏览器自动化入门/spa_crawler.py:20
↓ 1 callers
Class
Settings
项目配置(使用 pydantic-settings)
源代码/爬虫进阶/11_进阶综合实战项目/config/settings.py:45
↓ 1 callers
Class
Settings
爬虫配置
源代码/爬虫进阶/01_工程化爬虫开发规范/refactored_crawler/config.py:9
↓ 1 callers
Class
SliderGapDetector
滑块缺口位置检测器
源代码/爬虫进阶/08_验证码识别与处理/slider_captcha.py:20
↓ 1 callers
Class
StorageManager
存储管理器
源代码/爬虫进阶/11_进阶综合实战项目/store/backend.py:180
↓ 1 callers
Class
TextCleaner
综合文本清洗器
源代码/爬虫进阶/09_数据清洗与预处理/text_cleaner.py:341
↓ 1 callers
Class
TextNormalizer
文本标准化器
源代码/爬虫进阶/09_数据清洗与预处理/data_normalizer.py:271
↓ 1 callers
Class
TimeoutException
请求超时异常
源代码/爬虫进阶/01_工程化爬虫开发规范/refactored_crawler/exceptions.py:26
↓ 1 callers
Class
User
源代码/爬虫入门/10_爬虫入门实战3_数据存储实现/test_pydantic_model.py:11
↓ 1 callers
Class
WordCloudGenerator
词云生成器
源代码/爬虫进阶/10_数据分析与可视化/wordcloud_generator.py:138
Class
AbstractLogin
登录抽象基类
源代码/爬虫进阶/11_进阶综合实战项目/login/auth.py:61
Class
AbstractStore
源代码/爬虫入门/10_爬虫入门实战3_数据存储实现/abstract_store.py:11
Class
AdaptiveRateLimiter
自适应速率限制器 根据响应情况自动调整请求速率: - 正常响应:逐渐提升速率 - 被限制/错误:降低速率
源代码/爬虫进阶/02_反爬虫对抗基础_请求伪装/rate_limiter.py:124
Class
BaseLogin
登录基类
源代码/爬虫进阶/07_登录认证_扫码与短信登录实现/login_factory.py:35
Class
BaseStorage
存储基类
源代码/爬虫进阶/11_进阶综合实战项目/store/backend.py:32
Class
BilibiliQRStatus
B站扫码状态码 | 状态码 | 含义 | |-------|------| | 0 | 登录成功 | | 86101 | 未扫描 | | 86090 | 已扫描,待确认 | | 86038 | 已过期 |
源代码/爬虫进阶/07_登录认证_扫码与短信登录实现/bilibili_qrcode_login.py:40
Class
BilibiliSearchResponse
B站搜索响应模型 对应搜索 API 的完整响应结构。
源代码/爬虫进阶/11_进阶综合实战项目/models/bilibili.py:277
Class
CaptchaServiceBase
验证码服务基类
源代码/爬虫进阶/08_验证码识别与处理/captcha_service.py:18
Class
CaptchaSolverWithFallback
带降级策略的验证码解决器
源代码/爬虫进阶/08_验证码识别与处理/captcha_service.py:251
next →
1–100 of 149, ranked by callers