MCPcopy Create free account

hub / github.com/NanmiCoder/CrawlerTutorial / types & classes

Types & classes149 in github.com/NanmiCoder/CrawlerTutorial

↓ 7 callersClassLoginResult
登录结果
源代码/爬虫进阶/07_登录认证_扫码与短信登录实现/login_factory.py:23
↓ 5 callersClassTokenBucket
令牌桶限速器 工作原理: - 桶有固定容量(最大令牌数) - 以固定速率向桶中添加令牌 - 每次请求消耗一个令牌 - 桶空时请求需要等待 适用场景: - 需要精确控制平均请求速率 - 允许一定程度的突发请求
源代码/爬虫进阶/02_反爬虫对抗基础_请求伪装/rate_limiter.py:11
↓ 4 callersClassCookieManager
完整的 Cookie 管理器
源代码/爬虫进阶/06_登录认证_Cookie与Session管理/cookie_manager.py:229
↓ 4 callersClassNoteContent
帖子简介存储容器
源代码/爬虫入门/08_爬虫入门实战1_静态网页数据提取/common.py:9
↓ 4 callersClassParseException
数据解析异常
源代码/爬虫进阶/01_工程化爬虫开发规范/refactored_crawler/exceptions.py:39
↓ 4 callersClassProxyChecker
代理检测器 功能: - 检测代理的可用性 - 测量响应时间 - 支持批量检测
源代码/爬虫进阶/03_代理IP的使用与管理/proxy_pool/checker.py:13
↓ 4 callersClassUARotator
User-Agent 轮换器 支持: - 随机获取桌面端/移动端 UA - 自定义 UA 列表 - 集成 fake-useragent 库(可选)
源代码/爬虫进阶/02_反爬虫对抗基础_请求伪装/ua_rotator.py:49
↓ 3 callersClassBilibiliCrawler
B站爬虫类 整合浏览器管理、登录认证、API客户端,实现完整的爬取流程。 使用示例: ```python crawler = BilibiliCrawler() videos = await crawler.start() ```
源代码/爬虫进阶/11_进阶综合实战项目/crawler/spider.py:36
↓ 3 callersClassBilibiliSign
B站 WBI 签名类 使用方法: ```python # 创建签名实例(需要先从浏览器获取 img_key 和 sub_key) signer = BilibiliSign(img_key="xxx", sub_key="yyy") # 对请求参
源代码/爬虫进阶/11_进阶综合实战项目/tools/sign.py:49
↓ 3 callersClassDataFrameAnalyzer
DataFrame 数据分析器
源代码/爬虫进阶/10_数据分析与可视化/pandas_analysis.py:10
↓ 3 callersClassProxyInfo
代理信息数据类 包含代理的基本信息和质量指标
源代码/爬虫进阶/03_代理IP的使用与管理/proxy_pool/base.py:19
↓ 3 callersClassRateLimitConfig
速率限制配置
源代码/爬虫进阶/02_反爬虫对抗基础_请求伪装/rate_limiter.py:238
↓ 3 callersClassSymbolContent
源代码/爬虫入门/10_爬虫入门实战3_数据存储实现/common.py:10
↓ 3 callersClassSymbolContent
源代码/爬虫入门/11_爬虫入门实战4_高效率的爬虫实现/common.py:9
↓ 3 callersClassTimeoutException
请求超时异常
源代码/爬虫进阶/01_工程化爬虫开发规范/exception_demo.py:42
↓ 2 callersClassBilibiliClient
B站 API 客户端 封装 B站的 API 请求,支持 WBI 签名。 使用示例: ```python client = BilibiliClient() await client.update_cookies(browser_context)
源代码/爬虫进阶/11_进阶综合实战项目/client/bilibili_client.py:38
↓ 2 callersClassBilibiliCookieManager
B站 Cookie 管理器 功能: - Cookie 加载/保存 - 登录状态检测 - Cookie 有效性验证 - 支持多种格式(JSON、字符串)
源代码/爬虫进阶/06_登录认证_Cookie与Session管理/bilibili_cookie.py:152
↓ 2 callersClassBilibiliLogin
B站登录类 支持扫码登录和 Cookie 登录两种方式。 使用示例: ```python login = BilibiliLogin( login_type="qrcode", browser_context=contex
源代码/爬虫进阶/11_进阶综合实战项目/login/auth.py:85
↓ 2 callersClassBrowserManager
浏览器管理器
源代码/爬虫进阶/11_进阶综合实战项目/core/browser.py:53
↓ 2 callersClassCaptchaPreprocessor
验证码图片预处理器
源代码/爬虫进阶/08_验证码识别与处理/ocr_captcha.py:24
↓ 2 callersClassChineseTokenizer
中文分词器
源代码/爬虫进阶/10_数据分析与可视化/wordcloud_generator.py:34
↓ 2 callersClassCompositeRateLimiter
组合速率限制器 结合多种限速策略: - 令牌桶控制平均速率 - 并发限制控制同时请求数 - 随机延迟模拟人类行为
源代码/爬虫进阶/02_反爬虫对抗基础_请求伪装/rate_limiter.py:246
↓ 2 callersClassConcurrencyLimiter
并发限制器 限制同时进行的请求数量
源代码/爬虫进阶/02_反爬虫对抗基础_请求伪装/rate_limiter.py:193
↓ 2 callersClassContextPool
浏览器上下文池
源代码/爬虫进阶/05_Playwright进阶_反检测与性能优化/performance_optimization.py:64
↓ 2 callersClassCookieRotator
Cookie 轮换器 - 支持多账号 Cookie 管理
源代码/爬虫进阶/06_登录认证_Cookie与Session管理/cookie_manager.py:133
↓ 2 callersClassCrawlerConfig
爬虫配置
源代码/爬虫进阶/02_反爬虫对抗基础_请求伪装/anti_detection_crawler.py:28
↓ 2 callersClassCreatorUrlInfo
创作者 URL 信息
源代码/爬虫进阶/11_进阶综合实战项目/tools/sign.py:44
↓ 2 callersClassHeadersBuilder
HTTP 请求头构建器 功能: - 构建完整的浏览器请求头 - 支持页面请求和 API 请求 - 自动设置 Referer 和 Origin - 集成 UA 轮换
源代码/爬虫进阶/02_反爬虫对抗基础_请求伪装/headers_builder.py:8
↓ 2 callersClassHumanTrajectoryGenerator
人类轨迹生成器
源代码/爬虫进阶/08_验证码识别与处理/slider_captcha.py:171
↓ 2 callersClassMockProxyFetcher
模拟代理获取器 用于演示,实际使用时替换为真实的代理获取器
源代码/爬虫进阶/03_代理IP的使用与管理/proxy_demo.py:15
↓ 2 callersClassNoteContentDetail
帖子
源代码/爬虫入门/08_爬虫入门实战1_静态网页数据提取/common.py:40
↓ 2 callersClassNotePushComment
推文存储容器
源代码/爬虫入门/08_爬虫入门实战1_静态网页数据提取/common.py:27
↓ 2 callersClassOCRCaptchaSolver
OCR 验证码识别器
源代码/爬虫进阶/08_验证码识别与处理/ocr_captcha.py:171
↓ 2 callersClassProxyInfo
代理信息
源代码/爬虫进阶/11_进阶综合实战项目/proxy/pool.py:20
↓ 2 callersClassProxyPool
代理池实现 特性: - 自动获取和检测代理 - 基于评分的智能分配 - 自动淘汰失效代理 - 后台自动刷新
源代码/爬虫进阶/03_代理IP的使用与管理/proxy_pool/pool.py:13
↓ 2 callersClassProxyProtocol
代理协议枚举
源代码/爬虫进阶/03_代理IP的使用与管理/proxy_pool/base.py:11
↓ 2 callersClassQRCodeLogin
通用扫码登录实现
源代码/爬虫进阶/07_登录认证_扫码与短信登录实现/qrcode_login.py:79
↓ 2 callersClassQuote
名言数据模型
源代码/爬虫进阶/04_Playwright浏览器自动化入门/spa_crawler.py:13
↓ 2 callersClassRandomDelayLimiter
随机延迟限速器 在每次请求后添加随机延迟,模拟人类行为
源代码/爬虫进阶/02_反爬虫对抗基础_请求伪装/rate_limiter.py:84
↓ 2 callersClassRequestException
HTTP 请求异常
源代码/爬虫进阶/01_工程化爬虫开发规范/refactored_crawler/exceptions.py:21
↓ 2 callersClassSMSLogin
短信验证码登录
源代码/爬虫进阶/07_登录认证_扫码与短信登录实现/sms_login.py:10
↓ 2 callersClassSymbolContent
源代码/爬虫入门/09_爬虫入门实战2_动态数据提取/common.py:9
↓ 2 callersClassVideoUrlInfo
视频 URL 信息
源代码/爬虫进阶/11_进阶综合实战项目/tools/sign.py:37
↓ 1 callersClassAccountCookie
账号 Cookie 信息
源代码/爬虫进阶/06_登录认证_Cookie与Session管理/cookie_manager.py:123
↓ 1 callersClassAntiDetectionCrawler
反检测爬虫 特性: - User-Agent 随机轮换 - 完整的请求头伪装 - TLS 指纹模拟(使用 curl_cffi) - 智能速率控制 - 优雅的重试机制
源代码/爬虫进阶/02_反爬虫对抗基础_请求伪装/anti_detection_crawler.py:47
↓ 1 callersClassAsyncMysqlDB
源代码/爬虫入门/10_爬虫入门实战3_数据存储实现/async_db.py:12
↓ 1 callersClassBBSCrawler
BBS 论坛爬虫 工程化特性: - 配置驱动 - 完善的日志记录 - 优雅的异常处理 - 资源自动管理
源代码/爬虫进阶/01_工程化爬虫开发规范/refactored_crawler/crawler.py:15
↓ 1 callersClassBBSParser
BBS 页面解析器
源代码/爬虫进阶/01_工程化爬虫开发规范/refactored_crawler/parser.py:12
↓ 1 callersClassBilibiliAnalyzer
B站视频数据分析器 提供针对 B站视频数据的专用分析方法。
源代码/爬虫进阶/11_进阶综合实战项目/analysis/report.py:205
↓ 1 callersClassBilibiliCookies
B站 Cookie 数据类 核心 Cookie: - SESSDATA: 会话凭证(最重要) - DedeUserID: 用户ID - bili_jct: CSRF Token(POST请求必需) 辅助 Cookie: - buvid3/
源代码/爬虫进阶/06_登录认证_Cookie与Session管理/bilibili_cookie.py:32
↓ 1 callersClassBilibiliLoginCookies
B站登录 Cookie 数据类 扫码登录成功后提取的Cookie
源代码/爬虫进阶/07_登录认证_扫码与短信登录实现/bilibili_qrcode_login.py:60
↓ 1 callersClassBilibiliQRCodeLogin
B站扫码登录实现 流程: 1. 调用 /qrcode/generate 获取二维码URL和qrcode_key 2. 生成二维码图片(保存到文件或终端显示) 3. 轮询 /qrcode/poll 检查扫码状态 4. 登录成功后提取Cookie
源代码/爬虫进阶/07_登录认证_扫码与短信登录实现/bilibili_qrcode_login.py:99
↓ 1 callersClassBilibiliVideo
B站视频信息模型 该模型对应 B站视频详情 API 返回的数据结构, 包含了视频的基本信息、统计数据和作者信息。
源代码/爬虫进阶/11_进阶综合实战项目/models/bilibili.py:20
↓ 1 callersClassCSVStorage
CSV 存储
源代码/爬虫进阶/11_进阶综合实战项目/store/backend.py:118
↓ 1 callersClassCookieLogin
Cookie 注入登录
源代码/爬虫进阶/07_登录认证_扫码与短信登录实现/login_factory.py:60
↓ 1 callersClassCostController
打码成本控制器
源代码/爬虫进阶/08_验证码识别与处理/captcha_service.py:187
↓ 1 callersClassCrawlResult
爬取结果
源代码/爬虫进阶/01_工程化爬虫开发规范/refactored_crawler/models.py:33
↓ 1 callersClassCrawlerClient
封装的 HTTP 客户端 特性: - 统一的请求头配置 - 自动重试机制 - 优雅的错误处理 - 资源自动管理
源代码/爬虫进阶/01_工程化爬虫开发规范/refactored_crawler/client.py:19
↓ 1 callersClassCrawlerSettings
爬虫项目配置类 配置优先级(从高到低): 1. 环境变量 (CRAWLER_XXX) 2. .env 文件 3. 默认值
源代码/爬虫进阶/01_工程化爬虫开发规范/config/settings.py:11
↓ 1 callersClassCsvStoreImpl
源代码/爬虫入门/10_爬虫入门实战3_数据存储实现/abstract_store_impl.py:32
↓ 1 callersClassDataNormalizer
综合数据标准化器
源代码/爬虫进阶/09_数据清洗与预处理/data_normalizer.py:349
↓ 1 callersClassDateTimeNormalizer
日期时间标准化器
源代码/爬虫进阶/09_数据清洗与预处理/data_normalizer.py:10
↓ 1 callersClassDbStoreImpl
源代码/爬虫入门/10_爬虫入门实战3_数据存储实现/abstract_store_impl.py:94
↓ 1 callersClassJSONStorage
JSON 存储
源代码/爬虫进阶/11_进阶综合实战项目/store/backend.py:63
↓ 1 callersClassJsonStoreImpl
源代码/爬虫入门/10_爬虫入门实战3_数据存储实现/abstract_store_impl.py:61
↓ 1 callersClassLocalOCRService
本地 OCR 服务
源代码/爬虫进阶/08_验证码识别与处理/captcha_service.py:27
↓ 1 callersClassLoginManager
统一登录管理器
源代码/爬虫进阶/07_登录认证_扫码与短信登录实现/login_factory.py:293
↓ 1 callersClassMatplotlibCharts
Matplotlib 静态图表生成器
源代码/爬虫进阶/10_数据分析与可视化/chart_demo.py:29
↓ 1 callersClassMockSMSCodeReceiver
模拟接码平台(用于测试)
源代码/爬虫进阶/07_登录认证_扫码与短信登录实现/sms_login.py:259
↓ 1 callersClassMysqlConnect
源代码/爬虫入门/10_爬虫入门实战3_数据存储实现/async_db.py:101
↓ 1 callersClassNoteDetail
帖子详情
源代码/爬虫进阶/01_工程化爬虫开发规范/refactored_crawler/models.py:23
↓ 1 callersClassNoteItem
帖子列表项
源代码/爬虫进阶/01_工程化爬虫开发规范/refactored_crawler/models.py:8
↓ 1 callersClassNumberNormalizer
数值标准化器
源代码/爬虫进阶/09_数据清洗与预处理/data_normalizer.py:142
↓ 1 callersClassOptimizedCrawler
优化的爬虫
源代码/爬虫进阶/05_Playwright进阶_反检测与性能优化/performance_optimization.py:112
↓ 1 callersClassProxiedCrawler
使用代理池的爬虫示例
源代码/爬虫进阶/03_代理IP的使用与管理/proxy_demo.py:45
↓ 1 callersClassPushComment
推文/评论
源代码/爬虫进阶/01_工程化爬虫开发规范/refactored_crawler/models.py:16
↓ 1 callersClassPyechartsCharts
Pyecharts 交互式图表生成器
源代码/爬虫进阶/10_数据分析与可视化/chart_demo.py:238
↓ 1 callersClassQRCodeLoginWrapper
扫码登录包装器
源代码/爬虫进阶/07_登录认证_扫码与短信登录实现/login_factory.py:89
↓ 1 callersClassRateLimitException
触发速率限制异常
源代码/爬虫进阶/01_工程化爬虫开发规范/exception_demo.py:58
↓ 1 callersClassReportGenerator
报告生成器 生成 B站视频数据的 Markdown 格式分析报告。
源代码/爬虫进阶/11_进阶综合实战项目/analysis/report.py:353
↓ 1 callersClassSMSLoginWrapper
短信登录包装器
源代码/爬虫进阶/07_登录认证_扫码与短信登录实现/login_factory.py:162
↓ 1 callersClassSPACrawler
SPA 爬虫示例 爬取 https://quotes.toscrape.com/js/ - 一个需要 JavaScript 渲染的页面
源代码/爬虫进阶/04_Playwright浏览器自动化入门/spa_crawler.py:20
↓ 1 callersClassSettings
项目配置(使用 pydantic-settings)
源代码/爬虫进阶/11_进阶综合实战项目/config/settings.py:45
↓ 1 callersClassSettings
爬虫配置
源代码/爬虫进阶/01_工程化爬虫开发规范/refactored_crawler/config.py:9
↓ 1 callersClassSliderGapDetector
滑块缺口位置检测器
源代码/爬虫进阶/08_验证码识别与处理/slider_captcha.py:20
↓ 1 callersClassStorageManager
存储管理器
源代码/爬虫进阶/11_进阶综合实战项目/store/backend.py:180
↓ 1 callersClassTextCleaner
综合文本清洗器
源代码/爬虫进阶/09_数据清洗与预处理/text_cleaner.py:341
↓ 1 callersClassTextNormalizer
文本标准化器
源代码/爬虫进阶/09_数据清洗与预处理/data_normalizer.py:271
↓ 1 callersClassTimeoutException
请求超时异常
源代码/爬虫进阶/01_工程化爬虫开发规范/refactored_crawler/exceptions.py:26
↓ 1 callersClassUser
源代码/爬虫入门/10_爬虫入门实战3_数据存储实现/test_pydantic_model.py:11
↓ 1 callersClassWordCloudGenerator
词云生成器
源代码/爬虫进阶/10_数据分析与可视化/wordcloud_generator.py:138
ClassAbstractLogin
登录抽象基类
源代码/爬虫进阶/11_进阶综合实战项目/login/auth.py:61
ClassAbstractStore
源代码/爬虫入门/10_爬虫入门实战3_数据存储实现/abstract_store.py:11
ClassAdaptiveRateLimiter
自适应速率限制器 根据响应情况自动调整请求速率: - 正常响应:逐渐提升速率 - 被限制/错误:降低速率
源代码/爬虫进阶/02_反爬虫对抗基础_请求伪装/rate_limiter.py:124
ClassBaseLogin
登录基类
源代码/爬虫进阶/07_登录认证_扫码与短信登录实现/login_factory.py:35
ClassBaseStorage
存储基类
源代码/爬虫进阶/11_进阶综合实战项目/store/backend.py:32
ClassBilibiliQRStatus
B站扫码状态码 | 状态码 | 含义 | |-------|------| | 0 | 登录成功 | | 86101 | 未扫描 | | 86090 | 已扫描,待确认 | | 86038 | 已过期 |
源代码/爬虫进阶/07_登录认证_扫码与短信登录实现/bilibili_qrcode_login.py:40
ClassBilibiliSearchResponse
B站搜索响应模型 对应搜索 API 的完整响应结构。
源代码/爬虫进阶/11_进阶综合实战项目/models/bilibili.py:277
ClassCaptchaServiceBase
验证码服务基类
源代码/爬虫进阶/08_验证码识别与处理/captcha_service.py:18
ClassCaptchaSolverWithFallback
带降级策略的验证码解决器
源代码/爬虫进阶/08_验证码识别与处理/captcha_service.py:251
next →1–100 of 149, ranked by callers