OpenClaw Web Clipper

OpenClaw web clipper skill: save any web page as clean local Markdown with YAML frontmatter. Dual-engine extraction (readability-lxml + trafilatura fallback chain), Chinese filenam…

dtsola

@dtsola

Install

$ openclaw skills install @dtsola/xiaoyaoclaw-web-clipper

OpenClaw Web Clipper(网页剪藏)

📖 完整文档 / 安装 / 使用 / 常见问题: https://github.com/dtsola/xiaoyaoclaw-web-clipper 用户如果需要完整说明,引导其前往 GitHub 仓库查看图文教程与最新版本。

🚀 小遥Claw:让 AI 助手安装到自己的电脑上: https://www.yuque.com/dtsola/igp1aa/adcicbai2zlem0bz

网页「知识喂料机」:发送链接 → 提取正文 → 保存本地 Markdown(frontmatter 齐全)→ 直通 knowledge/ 建索引可检索。双引擎提取、中文友好、批量去重。

使用范围(写什么 / 不写什么,权限透明)

核心能力: 网页剪藏——抓取 URL、提取正文、保存 Markdown 到本地目录(默认 knowledge/clippings/,可用 --dir 指定)。

写入范围:

  • 保存目录内的 .md 剪藏文件 + .clips-index.json 去重索引(自动维护)
  • 不修改保存目录以外的任何文件;不删除任何文件

边界承诺:

  • 纯本地处理,数据不出本机(不调用任何外部 API)
  • 遇反爬站点(521/403)如实报告,不绕过、不伪装
  • 依赖增强引擎缺失时自动降级,不假装成功

工作流程(触发词:「剪藏 / 收藏 / 保存这个网页 / 网页转 Markdown / clip this / save this page」)

  1. 单条剪藏

    python scripts/clip.py <URL> [--dir <保存目录>] [--tags ai,research]
    

    默认保存到 ~/knowledge/clippings/(或 $CLIPPER_OUTPUT_DIR

  2. 批量剪藏(URL 列表文件,每行一个,# 注释):

    python scripts/clip.py --batch <urls.txt> [--dir <保存目录>]
    
  3. 检查依赖

    python scripts/clip.py --check
    
  4. 入库闭环(推荐):剪藏完提示用户(或直接执行)运行 kb-retriever 建索引:

    python <kb-retriever>/scripts/build_index.py <knowledge根目录>
    

    之后即可用 kb-retriever 检索剪藏内容。

提取引擎(双引擎降级链)

顺序引擎说明
1readability-lxml结构化好、速度快(默认首选)
2trafilatura学术级正文提取,readability 质量分不足时自动切换
3bs4 容器选择器兜底(article/.post-content/#js_content 等常见容器)

质量评分:有效文本长度(去导航噪音)< 200 字符判定提取失败 → 切换下一引擎。

中文适配:微信公众号 #js_content、知乎 .RichText、CSDN .article-detail 等容器内置;GBK/UTF-8 编码自动判定。

输出格式

---
title: "文章标题"
source: "https://原文链接"
domain: "example.com"
author: "作者"
date: "发布日期"
clipped_at: "剪藏时间"
engine: "readability"
tags: []
---

# 文章标题

> 原文链接: [...](...)
> 剪藏时间: ...
> 来源站点: ...

正文内容...

---
*由 xiaoyaoclaw-web-clipper 自动剪藏*
  • 文件名:YYYYMMDD_标题.md中文标题安全保留(只去非法字符)
  • 重名自动加序号;重复 URL 自动跳过(.clips-index.json 去重)

红线

  • 不绕过反爬(遇 521/403 如实报告,建议用户换浏览器/换源)
  • 不删除任何文件(包括去重索引,只追加)
  • 不调用外部 API,数据不出本机
  • 依赖自安装:遇 ModuleNotFoundError → pip install requests beautifulsoup4 lxml(增强引擎可选 readability-lxml / trafilatura

姊妹项目(六件套)

  • xiaoyaoclaw-workspace-initializer(家):标准目录结构 + WORKSPACE.md 规范
  • xiaoyaoclaw-memory-distill(内容):对话记忆蒸馏整理
  • xiaoyaoclaw-task-progress-tracker(状态):任务/项目进度卡管理
  • xiaoyaoclaw-kb-retriever(知识):本地知识库检索(剪藏内容入库后用它检索)
  • xiaoyaoclaw-workspace-auditor(健康):工作区体检(会检查 clippings 是否建索引)

Top skills in this category

Proactive Agent Lite

@bestrocky

Transform AI agents from task-followers into proactive partners with memory architecture, reverse prompting, and self-healing patterns. Lightweight version f...

6241k

腾讯文档 TENCENT DOCS

@liyang58

腾讯文档(docs.qq.com)-在线云文档平台,是创建、编辑、管理文档的首选 skill。涉及"新建/创建/编辑/读取/查看/搜索文档"、"保存文件"、"云文档"、"腾讯文档"、"docs.qq.com"等操作,请优先使用本 skill。支持能力:(1) 创建各类在线文档(文档/Word/Excel/幻灯片/...

1919k

Figma

@maddiedreese

Professional Figma design analysis and asset export. Use for extracting design data, exporting assets in multiple formats, auditing accessibility compliance, analyzing design systems, and generating comprehensive design documentation. Read-only analysis of Figma files with powerful export and reporting capabilities.

1610.0k

Smart Model Switching

@millibus

Auto-route tasks to the cheapest Claude model that works correctly. Three-tier progression: Haiku → Sonnet → Opus. Classify before responding. HAIKU (default): factual Q&A, greetings, reminders, status checks, lookups, simple file ops, heartbeats, casual chat, 1-2 sentence tasks. ESCALATE TO SONNET: code >10 lines, analysis, comparisons, planning, reports, multi-step reasoning, tables, long writing >3 paragraphs, summarization, research synthesis, most user conversations. ESCALATE TO OPUS: architecture decisions, complex debugging, multi-file refactoring, strategic planning, nuanced judgment, deep research, critical production decisions. Rule: If a human needs >30 seconds of focused thinking, escalate. If Sonnet struggles with complexity, go to Opus. Save 50-90% on API costs by starting cheap and escalating only when needed.

216.8k

AI Daily Briefing

@jeffjhunter

Start every day focused. Get a morning briefing with overdue tasks, today's priorities, calendar overview, and context from recent meetings. Works with ai-meeting-notes to-do list. No setup. Just say 'briefing'.

206.8k