火车采集器|网页表格数据批量采集 + 导出完整方案
📅 2026/7/23 7:26:28
👁️ 阅读次数
📝 编程学习
适配场景:网页标准 Table 表格、分页表格、多页面表格批量抓取,直接导出 Excel/CSV,全程基于火车采集器(火车头采集器)原生功能,无需额外插件。
一、核心采集思路
- 配置列表页地址(含分页)
- 定位网页
<table>表格区域 - 自动识别表头、各行单元格数据
- 清洗空格、换行、无用标签
- 批量导出 CSV/Excel,支持增量采集
二、分步配置教程
1. 新建任务,填入目标网址
打开火车采集器 → 新建采集任务 → 输入表格所在网页 URL
如果存在分页:在【网址采集规则】配置分页正则 / 翻页参数
2. 采集内容规则(表格抓取两种方案)
方案 A:自动表格解析(推荐,最简)
适用:规范 HTML<table><tr><td>标准网页表格
- 点击【获取网页】加载页面源码
- 可视化选取整个表格区域
- 右键 →解析为表格数据
火车采集器会自动:
- 提取每一行
<tr> - 拆分
<td>单元格为独立字段 - 自动识别第一行作为表头字段名
方案 B:正则表达式提取(不规则表格 / 嵌套表格)
如果可视化识别失败,使用正则批量提取行
提取所有表格行正则: <tr[\s\S]*?>([\s\S]*?)</tr>子规则循环提取每行单元格:
<td[\s\S]*?>([\s\S]*?)</td>开启【循环采集】,一行数据生成一条采集结果。
3. 数据清洗(必做)
字段清洗规则添加:
- 去除 HTML 标签:清除
<div> <a> <span>等标签 - 去除首尾空白、换行符、
- 替换多余制表符(避免导出表格错乱)
- 过滤空行、表头重复行
清洗常用替换:
查找: 替换为空
查找:\s+替换为单个空格
4. 分页表格批量采集
- 进入【网址采集规则】
- 获取下一页链接,编写分页正则
示例分页地址page=1,page=2
使用地址递增模式:shturl.cc/o5qZr54aNix4o3Sy[1-100]
设置起始页、结束页、步长,实现全自动翻页抓取全部表格。
三、批量导出设置
方式 1:导出本地文件(CSV/Excel)
任务采集完成 →【导出数据】
可选格式:
- CSV(推荐,兼容性最强,Excel 直接打开)
- Excel (xls)
勾选:第一行为表头,字段顺序和网页表格保持一致。
注意:大量数据优先 CSV,上万条数据导出 Excel 不易卡顿。
方式 2:自动定时导出(自动化批量任务)
任务计划→开启定时采集,搭配导出插件,采集结束自动输出文件到指定文件夹,实现无人值守批量采集表格。
四、高级常见问题优化
- 表格跨页、动态加载表格(AJAX 表格)
普通源码抓取不到数据 → 使用火车采集器【内置浏览器模式】加载页面,等待表格渲染完成再提取。 - 多个表格同时抓取(一页多 Table)
使用区域过滤,分别定位不同<table>区块,分开采集,区分数据分类。 - 导出后单元格错乱、错位
原因:表格内部存在换行、<br/>、嵌套表格
解决:清洗规则删除<br>,统一清理换行符号。 - 需要定时增量采集表格,只抓新增数据
开启【重复数据过滤】,设置唯一标识字段(编号 / ID),重复数据不入库、不重复导出。
五、可直接套用简易规则模板(标准 Table)
- 区域过滤(限定表格范围)
<table[^>]*>([\s\S]*?)</table>- 循环提取行
<tr>([\s\S]*?)</tr>- 循环提取单元格
编程学习
技术分享
实战经验