拒绝废话!3分钟带你玩转OpenClaw网页抓取

本文是一篇OpenClaw的基础教程。虽然定位偏向入门,但干货满满,相信能帮你解决‘小龙虾’当前遇到的大部分疑难杂症。在接下来的内容中,我不仅会提供详细的操作步骤,更会深入浅出地剖析背后的底层逻辑,做到知其然更知其所以然。

你可能遇到的问题

先来讲讲你目前可能遇到的问题,是不是小龙虾的上网问题,经常看不了这个网页、那个网页 ?

如果是,继续看。如果你已经解决了这个问题,可以关上这篇文章。

传统的解决方案是搞一些搜索工具,例如 searXNG、Tavily 之类的,但经常要折腾 API, 各种配置,有点搞不赢。

今天教你一个邪修的招:不搞搜索工具,只用爬虫工具 + URL 转 Markdown 的服务


第一步:爬虫工具

OpenClaw 刚火之后,就看到有人推荐 Scrapling 这个爬虫工具,我记得有个帖子是把这俩绑在一起说,当时还一堆人评论说,Scrapling 和 :lobster: 是两个事,蹭什么流量。

我一直想研究下 Scrapling,但是没顾得上,直到看到了这一条推特:

对啊,研究个 der,直接把它做成 skills,用起来不就行了。

所以本教程第一步来了:

跟你的龙虾说:

把这个爬虫工具做成一个 skill,以后我有爬虫需求,直接调用它:GitHub - D4Vinci/Scrapling: 🕷️ An adaptive Web Scraping framework that handles everything from a single request to a full-scale crawl! · GitHub

前提: 注意,你的龙虾上要有 skill-creator 这个 skill,不然它不会做。

skill-creator 地址: skills/skills/skill-creator/SKILL.md at main · anthropics/skills · GitHub


第二步:URL 转 Markdown 服务

然后我把这一条发到微博上,有个老哥发来提示:

是啊,前段时间 Cloudflare 很高调地提供了 Markdown for Agents 服务,说是为 agent 建设基础设施。只要在网址前面加上 markdown.new/ ,就可以得到网页的 markdown 版本。

后来我看到了 Obsidian 也刚刚推出了一个针对网页转 Markdown 的服务,可以在任何 URL 前添加 defuddle.md 来将其转化为 markdown 格式。

更早的还有 Jina AI Reader 的 r.jina.ai/ ,都可以将网页转换为 Markdown。

这些工具通过代理服务器从指定 URL 抓取网页的 HTML 内容,然后解析、清理(如去除广告、脚本、样式),并转换为结构化的 Markdown 格式。

他们已经干过的活,我就没必要再干一遍了。

所以,现在跟你的龙虾讲,在刚刚的 skills 中再加上一句(我的演示是分步加的,其实你可以一次性写清楚,下面再讲):

有一些网页不用爬,在网址前面加上 markdown.new/ 会自动显示 markdown 版本。一般用 Cloudflare 的网站都能显示;如果不支持 Cloudflare 的网站,尝试在 URL 前添加 defuddle.md/ ,也是一样的效果;还有 r.jina.ai/http://... 做前缀,也是一样。都作为备份。

markdown.new 爬不了推特,但是 defuddle.md 可以,你看 AI 总结的还挺好:

优先级 服务 特点
1 markdown.new 快,适合新闻/博客
2 defuddle.md 通用,支持社交
3 r.jina.ai/http://... 备选方案
4 Firecrawl 付费但最强

好了,教程结束,就这两步,是不是很简单。

其实,都不需要两步(我分成两步是为了讲清这件事),一步就可以实现,直接跟你的龙虾讲:

现在给我做一个 skills,当我需要上网搜信息的时候,使用这个服务:在网址前面加上 markdown.new/ 会自动显示 markdown 版本,一般用 Cloudflare 的网站都能显示;如果不支持 Cloudflare 的网站,尝试在 URL 前添加 defuddle.md/ ,也是一样的效果;r.jina.ai/ 做前缀,也是一样。如果实在不行,尝试用这个爬虫工具:GitHub - D4Vinci/Scrapling: 🕷️ An adaptive Web Scraping framework that handles everything from a single request to a full-scale crawl! · GitHub


番外:Agent Reach

再来简单讲一下,前段时间我在微博上推荐的另外一个工具 Agent Reach

它在网页读取上就选择了前文提到的 Jina,方案足够小白,也在 Github 上获得 4.4k 的 Stars。

大多数用户不需要搞什么高深的技术实现,足够简单、足够好用就行

我的这套「爬虫工具 + URL 转 Markdown 服务」skills 理念,已经足够简单了。

好用方面,我自己用了一下,确实还行的。

推荐给大家。

这个实用,已点赞 :+1:

网页抓取确实是刚需

小龙虾上网问题搞了好久

底层逻辑讲得很透彻

三分钟有点夸张吧

确实三分钟就能上手

抓取动态页面能行吗

比自己写爬虫方便多了

反爬严格的网站怎么处理

试了几个网站都成功了

这个教程入门很友好

动态页面需要配合headless浏览器

反爬的话要控制频率

抓回来的数据格式整理得不错

好吧我收回刚才的话哈哈

配合数据清洗效果更好

感谢解答我去试试

用来做竞品分析很方便

频率控制具体怎么设置