本文是一篇OpenClaw的基础教程。虽然定位偏向入门,但干货满满,相信能帮你解决‘小龙虾’当前遇到的大部分疑难杂症。在接下来的内容中,我不仅会提供详细的操作步骤,更会深入浅出地剖析背后的底层逻辑,做到知其然更知其所以然。
你可能遇到的问题
先来讲讲你目前可能遇到的问题,是不是小龙虾的上网问题,经常看不了这个网页、那个网页 ?
如果是,继续看。如果你已经解决了这个问题,可以关上这篇文章。
传统的解决方案是搞一些搜索工具,例如 searXNG、Tavily 之类的,但经常要折腾 API, 各种配置,有点搞不赢。
今天教你一个邪修的招:不搞搜索工具,只用爬虫工具 + URL 转 Markdown 的服务
第一步:爬虫工具
OpenClaw 刚火之后,就看到有人推荐 Scrapling 这个爬虫工具,我记得有个帖子是把这俩绑在一起说,当时还一堆人评论说,Scrapling 和
是两个事,蹭什么流量。
我一直想研究下 Scrapling,但是没顾得上,直到看到了这一条推特:
对啊,研究个 der,直接把它做成 skills,用起来不就行了。
所以本教程第一步来了:
跟你的龙虾说:
把这个爬虫工具做成一个 skill,以后我有爬虫需求,直接调用它:GitHub - D4Vinci/Scrapling: 🕷️ An adaptive Web Scraping framework that handles everything from a single request to a full-scale crawl! · GitHub
前提: 注意,你的龙虾上要有 skill-creator 这个 skill,不然它不会做。
skill-creator 地址: skills/skills/skill-creator/SKILL.md at main · anthropics/skills · GitHub
第二步:URL 转 Markdown 服务
然后我把这一条发到微博上,有个老哥发来提示:
是啊,前段时间 Cloudflare 很高调地提供了 Markdown for Agents 服务,说是为 agent 建设基础设施。只要在网址前面加上 markdown.new/ ,就可以得到网页的 markdown 版本。
后来我看到了 Obsidian 也刚刚推出了一个针对网页转 Markdown 的服务,可以在任何 URL 前添加 defuddle.md 来将其转化为 markdown 格式。
更早的还有 Jina AI Reader 的 r.jina.ai/ ,都可以将网页转换为 Markdown。
这些工具通过代理服务器从指定 URL 抓取网页的 HTML 内容,然后解析、清理(如去除广告、脚本、样式),并转换为结构化的 Markdown 格式。
他们已经干过的活,我就没必要再干一遍了。
所以,现在跟你的龙虾讲,在刚刚的 skills 中再加上一句(我的演示是分步加的,其实你可以一次性写清楚,下面再讲):
有一些网页不用爬,在网址前面加上
markdown.new/会自动显示 markdown 版本。一般用 Cloudflare 的网站都能显示;如果不支持 Cloudflare 的网站,尝试在 URL 前添加defuddle.md/,也是一样的效果;还有r.jina.ai/http://...做前缀,也是一样。都作为备份。
markdown.new 爬不了推特,但是 defuddle.md 可以,你看 AI 总结的还挺好:
| 优先级 | 服务 | 特点 |
|---|---|---|
| 1 | markdown.new |
快,适合新闻/博客 |
| 2 | defuddle.md |
通用,支持社交 |
| 3 | r.jina.ai/http://... |
备选方案 |
| 4 | Firecrawl | 付费但最强 |
好了,教程结束,就这两步,是不是很简单。
其实,都不需要两步(我分成两步是为了讲清这件事),一步就可以实现,直接跟你的龙虾讲:
现在给我做一个 skills,当我需要上网搜信息的时候,使用这个服务:在网址前面加上
markdown.new/会自动显示 markdown 版本,一般用 Cloudflare 的网站都能显示;如果不支持 Cloudflare 的网站,尝试在 URL 前添加defuddle.md/,也是一样的效果;r.jina.ai/做前缀,也是一样。如果实在不行,尝试用这个爬虫工具:GitHub - D4Vinci/Scrapling: 🕷️ An adaptive Web Scraping framework that handles everything from a single request to a full-scale crawl! · GitHub
番外:Agent Reach
再来简单讲一下,前段时间我在微博上推荐的另外一个工具 Agent Reach 。
它在网页读取上就选择了前文提到的 Jina,方案足够小白,也在 Github 上获得 4.4k 的 Stars。
大多数用户不需要搞什么高深的技术实现,足够简单、足够好用就行 。
我的这套「爬虫工具 + URL 转 Markdown 服务」skills 理念,已经足够简单了。
好用方面,我自己用了一下,确实还行的。
推荐给大家。



