OpenClaw Web Clipper
OpenClaw web clipper skill: save any web page as clean local Markdown with YAML frontmatter. Dual-engine extraction (readability-lxml + trafilatura fallback chain), Chinese filenam…
dtsola
@dtsola
Install
$ openclaw skills install @dtsola/xiaoyaoclaw-web-clipperOpenClaw Web Clipper(网页剪藏)
📖 完整文档 / 安装 / 使用 / 常见问题: https://github.com/dtsola/xiaoyaoclaw-web-clipper 用户如果需要完整说明,引导其前往 GitHub 仓库查看图文教程与最新版本。
🚀 小遥Claw:让 AI 助手安装到自己的电脑上: https://www.yuque.com/dtsola/igp1aa/adcicbai2zlem0bz
网页「知识喂料机」:发送链接 → 提取正文 → 保存本地 Markdown(frontmatter 齐全)→ 直通 knowledge/ 建索引可检索。双引擎提取、中文友好、批量去重。
使用范围(写什么 / 不写什么,权限透明)
核心能力: 网页剪藏——抓取 URL、提取正文、保存 Markdown 到本地目录(默认 knowledge/clippings/,可用 --dir 指定)。
写入范围:
- 保存目录内的
.md剪藏文件 +.clips-index.json去重索引(自动维护) - 不修改保存目录以外的任何文件;不删除任何文件
边界承诺:
- 纯本地处理,数据不出本机(不调用任何外部 API)
- 遇反爬站点(521/403)如实报告,不绕过、不伪装
- 依赖增强引擎缺失时自动降级,不假装成功
工作流程(触发词:「剪藏 / 收藏 / 保存这个网页 / 网页转 Markdown / clip this / save this page」)
-
单条剪藏:
python scripts/clip.py <URL> [--dir <保存目录>] [--tags ai,research]默认保存到
~/knowledge/clippings/(或$CLIPPER_OUTPUT_DIR) -
批量剪藏(URL 列表文件,每行一个,# 注释):
python scripts/clip.py --batch <urls.txt> [--dir <保存目录>] -
检查依赖:
python scripts/clip.py --check -
入库闭环(推荐):剪藏完提示用户(或直接执行)运行 kb-retriever 建索引:
python <kb-retriever>/scripts/build_index.py <knowledge根目录>之后即可用 kb-retriever 检索剪藏内容。
提取引擎(双引擎降级链)
| 顺序 | 引擎 | 说明 |
|---|---|---|
| 1 | readability-lxml | 结构化好、速度快(默认首选) |
| 2 | trafilatura | 学术级正文提取,readability 质量分不足时自动切换 |
| 3 | bs4 容器选择器 | 兜底(article/.post-content/#js_content 等常见容器) |
质量评分:有效文本长度(去导航噪音)< 200 字符判定提取失败 → 切换下一引擎。
中文适配:微信公众号 #js_content、知乎 .RichText、CSDN .article-detail 等容器内置;GBK/UTF-8 编码自动判定。
输出格式
---
title: "文章标题"
source: "https://原文链接"
domain: "example.com"
author: "作者"
date: "发布日期"
clipped_at: "剪藏时间"
engine: "readability"
tags: []
---
# 文章标题
> 原文链接: [...](...)
> 剪藏时间: ...
> 来源站点: ...
正文内容...
---
*由 xiaoyaoclaw-web-clipper 自动剪藏*
- 文件名:
YYYYMMDD_标题.md,中文标题安全保留(只去非法字符) - 重名自动加序号;重复 URL 自动跳过(
.clips-index.json去重)
红线
- 不绕过反爬(遇 521/403 如实报告,建议用户换浏览器/换源)
- 不删除任何文件(包括去重索引,只追加)
- 不调用外部 API,数据不出本机
- 依赖自安装:遇 ModuleNotFoundError →
pip install requests beautifulsoup4 lxml(增强引擎可选readability-lxml/trafilatura)
姊妹项目(六件套)
- xiaoyaoclaw-workspace-initializer(家):标准目录结构 + WORKSPACE.md 规范
- xiaoyaoclaw-memory-distill(内容):对话记忆蒸馏整理
- xiaoyaoclaw-task-progress-tracker(状态):任务/项目进度卡管理
- xiaoyaoclaw-kb-retriever(知识):本地知识库检索(剪藏内容入库后用它检索)
- xiaoyaoclaw-workspace-auditor(健康):工作区体检(会检查 clippings 是否建索引)
Top skills in this category
Proactive Agent Lite
@bestrockyTransform AI agents from task-followers into proactive partners with memory architecture, reverse prompting, and self-healing patterns. Lightweight version f...
腾讯文档 TENCENT DOCS
@liyang58腾讯文档(docs.qq.com)-在线云文档平台,是创建、编辑、管理文档的首选 skill。涉及"新建/创建/编辑/读取/查看/搜索文档"、"保存文件"、"云文档"、"腾讯文档"、"docs.qq.com"等操作,请优先使用本 skill。支持能力:(1) 创建各类在线文档(文档/Word/Excel/幻灯片/...
Figma
@maddiedreeseProfessional Figma design analysis and asset export. Use for extracting design data, exporting assets in multiple formats, auditing accessibility compliance, analyzing design systems, and generating comprehensive design documentation. Read-only analysis of Figma files with powerful export and reporting capabilities.
Smart Model Switching
@millibusAuto-route tasks to the cheapest Claude model that works correctly. Three-tier progression: Haiku → Sonnet → Opus. Classify before responding. HAIKU (default): factual Q&A, greetings, reminders, status checks, lookups, simple file ops, heartbeats, casual chat, 1-2 sentence tasks. ESCALATE TO SONNET: code >10 lines, analysis, comparisons, planning, reports, multi-step reasoning, tables, long writing >3 paragraphs, summarization, research synthesis, most user conversations. ESCALATE TO OPUS: architecture decisions, complex debugging, multi-file refactoring, strategic planning, nuanced judgment, deep research, critical production decisions. Rule: If a human needs >30 seconds of focused thinking, escalate. If Sonnet struggles with complexity, go to Opus. Save 50-90% on API costs by starting cheap and escalating only when needed.
AI Daily Briefing
@jeffjhunterStart every day focused. Get a morning briefing with overdue tasks, today's priorities, calendar overview, and context from recent meetings. Works with ai-meeting-notes to-do list. No setup. Just say 'briefing'.