三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

使用大模型MCP采集数据,爬虫已经无门槛

使用大模型MCP采集数据,爬虫已经无门槛

我发现大模型让很多工作变得超级简单,但很多人并没有感知到。

比如说传统的爬虫采集,以前可能需要写python requests、scrapy脚本,还得去解析html文本,技术门槛不低,而且巨浪费时间。

但现在有了MCP、SKILL、CLI,大模型可以直接干爬虫的活,比如playwright mcp、fetch mcp、chrome mcp、puppeteer mcp等可以直接采集和解析网页,甚至各种bing、百度等搜索工具也有mcp服务。

还有Bright data的MCP和CLI功能,把采集接口集成到mcp服务里,能控制浏览器、实时浏览网页、请求谷歌搜索数据、解锁网页验证等,直接部署在cursor、vscode、codex、workbuddy里,直接聊天对话就能采集到公开的数据,几乎是零门槛。

https://get.brightdata.com/wmcp

就拿MCP来说,MCP 本身就是让 AI 能调用外部工具的协议,你可以理解成给大模型接了一根网线。Bright Data MCP 是亮数据做的网页数据采集服务,接上之后 AI 就能搜索网页、抓取内容、提取结构化数据,反爬和 IP 轮换这些它自己在后台处理了,你不用管。

配置其实就三步:注册亮数据账号,在控制台拿 API 密钥;然后把你用的 Agent(Cursor、Claude Code、Trae 都行)打开,找到 MCP 配置入口,把密钥和配置信息粘进去;最后建一个智能体,勾选 Bright Data MCP 服务就完事了。它每月有 5000 次免费调用额度,先用免费的试足够了。Pro 模式下能开放 70 多个工具,免费层有 5 个核心工具也能干不少事。

https://get.brightdata.com/wmcp

说几个实际场景。做电商的,直接跟智能体说"帮我看看美国亚马逊手机类目销量前十的商品价格和评分",它会调搜索引擎工具去搜,再抓取页面返回商品名、价格这些字段,跨平台比价也能这么搞。做市场调研的,输入关键词让它搜集多个来源的信息,回来自动整理成报告。还有人拿它抓 LinkedIn 招聘数据做职位分析,或者监测社媒上的舆情动态。

拿到数据后可以配合 pandas 清洗,或者直接让 AI 帮你出结论。它返回的是 JSON 或 Markdown 格式,字段比较规整,不用太多二次处理。Mastra、CrewAI、LangChain 这些框架也都能接,不局限于某个编辑器。

除了爬虫,还有数据分析、内容写作、多媒体生产都有大量的AI工具可以实现,不过很多人有信息差,看不到,不会用。

所以没事多去看看github、魔搭、huggingface这些平台很有必要,是AI学习的必由之路。

← 返回列表