1. 项目概述
最近在做一个需要从多个网站采集数据的项目,经过对比各种技术方案,最终选择了Python3+Selenium+BeautifulSoup这套组合拳。这套方案最大的优势是既能处理动态加载的网页内容,又能高效解析HTML结构,最后还能把清洗好的数据存入MySQL数据库。下面我就详细分享一下整个实现过程,包括环境搭建、核心代码实现以及实际踩过的坑。
2. 环境准备与工具选型
2.1 Python3环境配置
建议使用Python 3.7及以上版本,这个版本对异步IO的支持更好,在处理大量网页请求时性能更优。我个人习惯用Anaconda管理Python环境:
conda create -n web_scraper python=3.8 conda activate web_scraper2.2 必要库安装
核心依赖库包括:
- selenium:用于浏览器自动化
- beautifulsoup4:HTML解析
- mysql-connector-python:MySQL数据库连接
- lxml:BeautifulSoup的解析器
安装命令:
pip install selenium beautifulsoup4 mysql-connector-python lxml2.3 浏览器驱动配置
Selenium需要对应的浏览器驱动。以Chrome为例:
- 查看Chrome浏览器版本
- 从ChromeDriver官网下载匹配版本的驱动
- 将驱动文件放在系统PATH路径下,或者代码中指定路径
注意:浏览器和驱动版本必须严格匹配,否则会报错
3. 核心实现逻辑
3.1 网页内容获取
使用Selenium获取动态加载的页面内容:
from selenium import webdriver from selenium.webdriver.chrome.options import Options def get_page(url): chrome_options = Options() chrome_options.add_argument('--headless') # 无头模式 chrome_options.add_argument('--disable-gpu') driver = webdriver.Chrome(options=chrome_options) driver.get(url) # 等待动态内容加载 driver.implicitly_wait(10) page_source = driver.page_source driver.quit() return page_source3.2 数据解析
用BeautifulSoup解析HTML并提取目标数据:
from bs4 import BeautifulSoup def parse_html(html): soup = BeautifulSoup(html, 'lxml') # 示例:提取所有新闻标题和链接 news_list = [] articles = soup.select('.article-list li') for article in articles: title = article.select_one('h3').text.strip() link = article.select_one('a')['href'] news_list.append({'title': title, 'link': link}) return news_list3.3 数据存储
将解析后的数据存入MySQL:
import mysql.connector def save_to_mysql(data): conn = mysql.connector.connect( host='localhost', user='your_username', password='your_password', database='web_data' ) cursor = conn.cursor() # 创建表(如果不存在) create_table = """ CREATE TABLE IF NOT EXISTS news ( id INT AUTO_INCREMENT PRIMARY KEY, title VARCHAR(255), link VARCHAR(255), created_at TIMESTAMP DEFAULT CURRENT_TIMESTAMP ) """ cursor.execute(create_table) # 插入数据 insert_sql = "INSERT INTO news (title, link) VALUES (%s, %s)" for item in data: cursor.execute(insert_sql, (item['title'], item['link'])) conn.commit() cursor.close() conn.close()4. 实战技巧与优化
4.1 反爬虫策略应对
- 随机User-Agent:每次请求使用不同的浏览器标识
- 请求间隔:设置随机延迟,避免高频访问
- IP代理池:使用代理IP轮换
- 验证码识别:对接第三方验证码识别服务
4.2 性能优化
- 使用Selenium Grid实现分布式爬取
- 对BeautifulSoup解析过程进行性能分析,优化CSS选择器
- MySQL批量插入代替单条插入:
# 批量插入示例 def batch_insert(data): # ...连接数据库代码同上... insert_sql = "INSERT INTO news (title, link) VALUES (%s, %s)" cursor.executemany(insert_sql, [(item['title'], item['link']) for item in data]) # ...提交和关闭连接代码同上...4.3 异常处理
健壮的爬虫需要完善的异常处理:
from selenium.common.exceptions import TimeoutException, WebDriverException from mysql.connector import Error as MySQLError try: html = get_page(url) data = parse_html(html) save_to_mysql(data) except TimeoutException: print("页面加载超时") except WebDriverException as e: print(f"浏览器异常: {str(e)}") except MySQLError as e: print(f"数据库错误: {str(e)}") except Exception as e: print(f"未知错误: {str(e)}")5. 完整项目结构
一个规范的爬虫项目建议这样组织:
web_scraper/ ├── config/ # 配置文件 │ ├── settings.py # 数据库配置等 │ └── user_agents.py # User-Agent列表 ├── spiders/ # 爬虫代码 │ ├── news_spider.py # 新闻爬虫 │ └── product_spider.py # 商品爬虫 ├── utils/ # 工具函数 │ ├── db.py # 数据库操作 │ └── proxy.py # 代理IP管理 ├── requirements.txt # 依赖文件 └── main.py # 主入口6. 常见问题解决
6.1 Selenium元素定位失败
可能原因:
- 页面未完全加载 - 增加等待时间或使用显式等待
- 元素在iframe中 - 需要先切换到对应iframe
- 元素是动态生成的 - 使用更稳定的定位方式
解决方案:
from selenium.webdriver.common.by import By from selenium.webdriver.support.ui import WebDriverWait from selenium.webdriver.support import expected_conditions as EC # 显式等待示例 element = WebDriverWait(driver, 10).until( EC.presence_of_element_located((By.CSS_SELECTOR, ".target-element")) )6.2 BeautifulSoup解析出错
常见问题:
- 编码问题 - 指定正确的页面编码
- 不完整的HTML - 使用更宽容的html.parser
- 复杂的嵌套结构 - 使用更精确的CSS选择器
解决方案:
# 处理编码问题 response = requests.get(url) response.encoding = 'utf-8' # 或根据实际情况调整 soup = BeautifulSoup(response.text, 'lxml')6.3 MySQL连接问题
排查步骤:
- 检查MySQL服务是否运行
- 验证用户名密码是否正确
- 检查是否有远程连接权限
- 确认防火墙设置
连接参数优化:
config = { 'host': 'localhost', 'user': 'username', 'password': 'password', 'database': 'dbname', 'raise_on_warnings': True, 'pool_name': 'scraper_pool', 'pool_size': 5, # 连接池大小 'connect_timeout': 30 # 连接超时时间 }7. 项目扩展思路
- 添加定时任务:使用APScheduler实现定时爬取
- 数据可视化:将MySQL数据用Pandas分析后生成报表
- 分布式扩展:使用Scrapy-Redis实现分布式爬取
- 数据监控:添加异常数据检测和报警机制
- API接口:用Flask/Django提供数据查询接口
# 定时任务示例 from apscheduler.schedulers.blocking import BlockingScheduler scheduler = BlockingScheduler() @scheduler.scheduled_job('interval', hours=1) def scheduled_job(): # 执行爬取任务 pass scheduler.start()8. 个人实战经验
在实际项目中,我总结了以下几点经验:
- 对于大规模爬取,一定要做好日志记录,方便问题追踪
- 数据库设计时要考虑字段的扩展性,预留一些备用字段
- 定期维护代理IP池,免费的代理IP通常存活时间很短
- 遵守robots.txt协议,控制爬取频率,避免给目标网站造成负担
- 重要数据一定要做好备份,可以使用MySQL的定时备份功能
一个实用的日志记录配置示例:
import logging from logging.handlers import RotatingFileHandler def setup_logger(name): logger = logging.getLogger(name) logger.setLevel(logging.INFO) # 文件日志,最大10MB,保留3个备份 file_handler = RotatingFileHandler( 'scraper.log', maxBytes=10*1024*1024, backupCount=3 ) file_handler.setFormatter(logging.Formatter( '%(asctime)s - %(name)s - %(levelname)s - %(message)s' )) logger.addHandler(file_handler) return logger