CaptchaHarvester浏览器自动化原理:Chromium代理配置与多域名拦截技术
【免费下载链接】CaptchaHarvesterSolve captchas yourself without having to pay for services like 2captcha for use in automated projects.项目地址: https://gitcode.com/gh_mirrors/ca/CaptchaHarvester
CaptchaHarvester是一款强大的开源工具,它通过浏览器自动化技术让用户能够自行解决验证码,无需依赖2captcha等付费服务,非常适合用于自动化项目中。本文将深入解析其核心的Chromium代理配置与多域名拦截技术原理。
🚀 核心工作机制概述
CaptchaHarvester的核心功能实现主要依赖于两个关键技术点:Chromium浏览器的代理配置和多域名拦截系统。这两个技术的结合,使得工具能够高效地捕获和处理来自不同网站的验证码。
浏览器自动化架构
项目通过harvester/browser.py模块实现浏览器自动化功能。该模块提供了launch()函数,能够自动检测并启动系统中安装的Chromium浏览器(如Chrome),并进行必要的配置以实现代理和拦截功能。
# 浏览器启动核心代码 def launch(domain: Union[str, List[str]], server_address: Tuple[str, int], browser: Union[BrowserEnum, str] = BrowserEnum.CHROME, restart: bool = False, width: int = 400, height: int = 580, browser_args: List[str] = [], extensions: List[str] = None, verbose: bool = False) -> threading.Thread: # 实现浏览器启动和配置逻辑🔧 Chromium代理配置技术
代理服务器搭建
CaptchaHarvester通过harvester/server/__init__.py模块创建了一个本地代理服务器,使用ThreadingHTTPServer实现并发处理能力。这个代理服务器是实现验证码拦截的基础。
# 代理服务器初始化代码 self.httpd = ThreadingHTTPServer( (host, port), ProxyHTTPRequestHandlerWrapper(self.domain_cache, do_not_track))浏览器代理参数配置
虽然在代码中没有直接看到--proxy-server参数,但通过分析browser.py中的浏览器启动参数可以发现,工具通过定制浏览器启动参数来实现代理配置,将浏览器流量引导至本地代理服务器进行处理。
# 浏览器启动参数配置 browser_command.extend(( '--no-default-browser-check', '--no-check-default-browser', '--disable-background-networking', '--disable-background-timer-throttling', '--disable-client-side-phishing-detection', f'--window-size={width},{height}', ))🛡️ 多域名拦截技术
域名缓存与管理
CaptchaHarvester使用domain_cache字典来管理需要拦截的域名信息,每个域名对应一个MITMRecord对象,存储该域名的验证码配置和令牌队列。
# 域名缓存初始化 self.domain_cache: Dict[str, MITMRecord] = {} # 添加域名到缓存 ret = self.domain_cache[domain] = MITMRecord( sitekey=sitekey, captcha_kind=captcha_kind, action=action, tokens=ExpiringQueue(expiration=300) )拦截逻辑实现
ProxyHTTPRequestHandler类实现了核心的请求拦截和处理逻辑。当浏览器发送请求时,代理服务器会检查请求的域名是否在domain_cache中,如果是则进行验证码拦截处理。
# 请求处理逻辑 self.domain = self.headers.get('host', None) self.config = domain_cache.get(self.domain, None) if self.config: # 处理被拦截的域名请求 self._handle_intercepted_request() else: # 正常代理其他请求 self._proxy_request()多域名支持
工具支持同时拦截多个域名的验证码请求。通过harvester/entry_point.py中的命令行参数-d或--domain可以指定需要拦截的域名,也可以通过编程方式添加多个域名。
# 命令行参数配置 ap.add_argument('-d', '--domain', required=True, help='The domain of the site which hosts the captcha you want to solve.')📝 使用流程解析
- 初始化Harvester:创建Harvester实例,配置代理服务器
- 添加拦截域名:通过
intercept_recaptcha_v2()、intercept_recaptcha_v3()或intercept_hcaptcha()方法添加需要拦截的域名和验证码信息 - 启动浏览器:调用
launch_browser()方法启动配置好代理的Chromium浏览器 - 解决验证码:在浏览器中手动解决验证码
- 获取令牌:通过
get_token_queue()方法获取已解决的验证码令牌
示例代码片段:
# 添加域名拦截 tokens = harvester.intercept_recaptcha_v2(domain, sitekey) # 启动浏览器 harvester.launch_browser() # 获取令牌 token_queue = harvester.get_token_queue(domain)💡 技术优势与应用场景
CaptchaHarvester的浏览器自动化技术具有以下优势:
- 无需第三方依赖:不需要支付验证码服务费用
- 高度自定义:可以针对不同类型的验证码(reCAPTCHA v2、v3、hCaptcha)进行定制
- 多域名支持:能够同时处理多个网站的验证码需求
- 简单集成:通过
example.py可以快速了解如何将工具集成到自己的项目中
这项技术非常适合需要处理验证码的自动化项目,如网络爬虫、自动化测试、批量操作工具等场景。
📚 进一步学习资源
- 项目源码:harvester/
- 示例代码:example.py
- 浏览器模块:harvester/browser.py
- 服务器模块:harvester/server/init.py
通过深入研究这些文件,你可以更全面地了解CaptchaHarvester的实现细节,并根据自己的需求进行定制和扩展。
【免费下载链接】CaptchaHarvesterSolve captchas yourself without having to pay for services like 2captcha for use in automated projects.项目地址: https://gitcode.com/gh_mirrors/ca/CaptchaHarvester
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考