作用:Scrapy 本身不执行 JS,Playwright 启动真实浏览器渲染页面,获取 ajax 动态加载出来的数据。
1. 安装依赖
pip install scrapy scrapy-playwright
# 安装浏览器内核
playwright install chromium
2. 修改 settings.py 关键配置
3. 编写爬虫 spiders/dynamic_spider.py
4. 运行爬虫
scrapy crawl dynamic_spider -o out.json
常用 meta 参数拓展
重要注意点
Playwright 会启动 Chromium 浏览器,内存占用高,并发不要设置很大。
headless=False 可以看到浏览器真实访问页面,适合调试。
如果页面滚动加载,需要自定义 playwright 页面回调,模拟下拉滚动。