本地文件检索(免费版)
本地文件RAG检索工具,支持文档索引、语义搜索和上下文注入,适合个人用户快速建立本地知识库。
天轰穿
@thcjp
What This Skill Does
Indexes local files (Markdown, code, etc.) into a searchable knowledge base, then performs semantic search and context injection for question-answering. Supports keyword and vector-based retrieval with chunking and export.
Replaces manually searching through folders or using grep by providing a unified semantic search over your local documents.
When to Use It
- Search local Markdown notes for specific topics or keywords
- Find relevant code snippets in a project by describing the logic
- Build a personal knowledge base from scattered documents
- Retrieve context from local files to inject into an AI prompt
- Export search results or indexed document lists for offline use
Install
$ openclaw skills install @thcjp/local-rag-tool-free本地文件检索(免费版)
概述
本地文件检索是针对RAG检索领域的专业化AI辅助工具。免费版面向个人用户,提供核心功能与基础用法,适合快速上手和日常使用. 本工具经过深度优化,增强元数据和适用关键词,完全适配SkillHub平台规范.
核心能力
文档索引、语义搜索、上下文注入、分块策略、向量存储、检索增强生成
核心能力(补充)
执行核心能力操作,使用input_params参数进行配置,支持创建/查询/导出等操作.
- 执行此能力时使用
input_params参数,支持创建/查询/导出操作
基础功能完整覆盖
基础功能完整覆盖
处理: 解析基础功能完整覆盖的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回基础功能完整覆盖的响应数据,包含状态码、结果和日志.
- 执行此能力时使用
input_params参数,支持创建/查询/导出操作
简洁易用的操作接口
简洁易用的操作接口
处理: 解析简洁易用的操作接口的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回简洁易用的操作接口的响应数据,包含状态码、结果和日志.
- 执行此能力时使用
input_params参数,支持创建/查询/导出操作
标准格式输入输出
标准格式输入输出
处理: 解析标准格式输入输出的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回标准格式输入输出的响应数据,包含状态码、结果和日志.
- 执行此能力时使用
input_params参数,支持创建/查询/导出操作
快速上手
快速上手,零配置即可使用
处理: 解析快速上手的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回快速上手的响应数据,包含状态码、结果和日志.
- 执行此能力时使用
input_params参数,支持创建/查询/导出操作
适合个人日常使用场景
适合个人日常使用场景
处理: 解析适合个人日常使用场景的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回适合个人日常使用场景的响应数据,包含状态码、结果和日志.
- 执行此能力时使用
input_params参数,支持创建/查询/导出操作
处理: 解析核心能力的输入参数,完成核心逻辑,返回结构化响应.
输出: 返回核心能力的响应数据,包含状态码、结果和日志.
技术实现要点:核心能力基于input_params参数与output_format配置实现,支持创建/查询/修改/删除等操作模式,通过config_options进行运行时配置.
能力覆盖范围:本skill的核心能力覆盖以下场景关键词:本地文件、RAG、检索增强生成工具、支持文档索引、语义搜索与上下文、本地文件检索、免费版等。这些关键词对应description中声明的使用场景,均已在上述能力点中提供对应的操作支持.
使用场景
常见问题
对本地文档建立索引后进行语义检索和问答。示例指令:`
`搜索本地文档中关于部署的内容
操作流程:
- 识别用户需求类型
- 加载对应处理模块
- 执行操作并返回结果
场景2:代码库检索
对代码文件建立索引,支持代码语义搜索。示例指令:`
`搜索项目中的认证逻辑代码
场景3:知识库构建
将多个文档构建为可检索的本地知识库。示例指令:`
`构建本地知识库
快速开始
- 阅读## 核心能力章节了解skill功能
- 按## 依赖说明配置环境
- 执行所需能力对应的命令
- 参考## 错误处理章节处理异常
- 查看## FAQ解答常见疑问
环境准备
输入格式
| 参数名 | 类型 | 必填 | 说明 |
|---|---|---|---|
| input | string | 是 | 本地文件检索(免费版)处理的输入数据或指令 |
| options | object | 否 | 附加配置选项,如模式选择、格式偏好等 |
| callback_url | string | 否 | 异步处理完成后的回调通知URL |
# 确保Python环境可用
python3 --version
# ...
# 依赖说明
pip install requests
基础用法
# 本地RAG基础检索
import os
from pathlib import Path
# ...
def build_index(docs_dir):
index = {}
for md_file in Path(docs_dir).rglob("*.md"):
content = md_file.read_text(encoding="utf-8")
words = set(content.lower().split())
for word in words:
if word not in index:
index[word] = []
index[word].append(str(md_file))
return index
# ...
def search(index, query):
results = []
for word in query.lower().split():
if word in index:
results.extend(index[word])
return list(set(results))
# ...
idx = build_index("./docs")
results = search(idx, "部署 配置")
print(f"找到 {len(results)} 个相关文档")
执行结果
完成上述代码后,将根据输入参数返回结构化响应。免费版支持单次任务,适合解析单个文件或任务.
示例
rag:
index_dir: "./rag_index"
chunk_size: 500
search_mode: keyword
配置说明
| 配置项 | 说明 | 默认值 |
|---|---|---|
| 基础路径 | 工作目录 | ./ |
| 输出格式 | 结果输出格式 | json |
最佳实践
基础使用建议
- 明确需求:在使用前明确需要处理的内容和期望结果
- 检查输入:确保输入文件格式正确、内容完整
- 保存结果:处理完成后及时保存输出结果
- 定期清理:定期清理临时文件
- 错误处理:遇到错误时检查输入参数
性能优化
# 免费版:单文件优化
# 确保输入文件不超过建议大小
# 处理完成后释放资源
常见问题(补充)
Q1: 处理速度较慢怎么办?
A: 免费版为单线程处理,对于大文件建议分批处理或升级到专业版获得并行处理能力.
Q2: 支持的文件格式有哪些?
A: 支持标准格式输入输出,常见格式包括JSON、YAML、Markdown等.
Q3: 如何获取API Key?
A: 本skill基于Markdown指令规范,无需额外API Key。如需外部服务API,请参考对应服务的注册流程.
已知限制
A: 免费版支持单次操作,适合个人日常使用。如需批量处理或高级功能,建议升级到专业版.
依赖说明
运行环境
- Agent平台: 支持SKILL.md的任意AI Agent(Claude Code / Cursor / Codex / Gemini CLI等)
- 操作系统: Windows / macOS / Linux
- Python版本: 3.8+
第三方依赖
| 依赖项 | 类型 | 是否必需 | 获取方式 |
|---|---|---|---|
| LLM API | API | 必需 | 由Agent内置LLM提供 |
| numpy | Python库 | 可选 | pip install numpy |
| rank-bm25 | Python库 | 可选 | pip install rank-bm25 |
API Key 配置
- 本skill基于Markdown指令规范,无需额外API Key
可用性分类
- 分类: MD+EXEC(纯Markdown指令,部分功能需要exec命令行执行能力)
- 说明: 基于Markdown的AI Skill,通过自然语言指令驱动Agent完成操作
- 版本: 免费版(v1.0.0 免费版,核心功能)
错误处理
| 错误场景 | 原因 | 处理方式 |
|---|---|---|
| 配置错误 | 参数缺失或格式错误 | 检查依赖说明中的配置要求 |
| 运行时错误 | 运行环境不满足 | 确认运行环境符合依赖说明 |
| 网络错误 | 连接超时或不可达 | 执行ping命令测试网络连通性,检查防火墙和代理设置连接后执行ping命令测试网络连通性,检查防火墙和代理设置连接后重新执行命令,参考国内替代方案 |
输出格式
{
"success": true,
"data": {
"result": "本地文件检索(免费版)处理结果",
"execution_time": "0.5s",
"metadata": {
"version": "1.0",
"processor": "local rag"
}
},
"execution_log": ["解析输入参数", "执行核心处理", "格式化输出结果"],
"error": null
}
Top skills in this category
Self-Improving + Proactive Agent
@ivangdavilaSelf-reflection + Self-criticism + Self-learning + Self-organizing memory. Agent evaluates its own work, catches mistakes, and improves permanently. Use when...
ontology
@oswalpalashTyped knowledge graph for structured agent memory and composable skills. Use when creating/querying entities (Person, Project, Task, Event, Document), linkin...
Humanizer
@biostartechnologyRemove signs of AI-generated writing from text. Use when editing or reviewing text to make it sound more natural and human-written. Based on Wikipedia's comprehensive "Signs of AI writing" guide. Detects and fixes patterns including: inflated symbolism, promotional language, superficial -ing analyses, vague attributions, em dash overuse, rule of three, AI vocabulary words, negative parallelisms, and excessive conjunctive phrases.
Obsidian
@steipeteWork with Obsidian vaults (plain Markdown notes) and automate via obsidian-cli.
YouTube Watcher
@michaelgatharaFetch and read transcripts from YouTube videos. Use when you need to summarize a video, answer questions about its content, or extract information from it.