CSV数据分析-免费版

CSV数据分析免费版,提供快速统计与基础筛选,零外部依赖,适合轻量数据探索。Use when 需要数据分析、报表生成、统计洞察、数据可视化时使用。不适用于实时流数据处理。适用于独立开发者、企业团队和自动化工作流场景。支持中文交互,无需复杂配置即开即用。输出结果可直接使用,减少二次加工成本。提供结构化输出和错误处理机制。

天轰穿

@thcjp

Install

$ openclaw skills install @thcjp/csv-analyzer-free

功能说明: 本技能涵盖 中文交互、化工作流场景 等核心能力。

Csv Analyzer — CSV数据分析器(免费版)

用简单命令分析CSV文件,即时获取统计与筛选结果——无需pandas或重型依赖。

依赖说明

运行环境

  • Agent平台: 支持SKILL.md的任意AI Agent(Claude Code / Cursor / Codex / Gemini CLI等)
  • 操作系统: Windows / macOS / Linux

依赖项

依赖项类型是否必需获取方式
LLM APIAPI必需由Agent内置LLM提供

API Key 配置

本Skill无需额外API Key(LLM能力由Agent平台内置提供)

可用性分类

  • 分类: MD+EXEC()

核心能力

核心能力(免费版)

1. 快速统计(stats)

python3 {baseDir}/scripts/csv_analyze.py stats data.csv

返回行数、列类型、数值列的min/max/mean、文本列的unique计数。

  • 异常时参考错误处理章节进行恢复
  • 关键参数: 快速统计(stats) 选项

2. 基础筛选(filter)


**输入**: 用户提供核心能力(免费版)所需的参数和指令。

**输出**: 返回基础筛选(filter)的执行结果,包含操作状态和输出数据。
### 为何不用pandas?

pandas很强大,但仅导入就占100MB+内存,对快速分析任务过于重型。本技能仅用Python标准库,在2GB内存服务器上运行无压力。

**输入**: 用户提供为何不用pandas?所需的参数和指令。

### 付费版专享能力

> 升级付费版解锁以下高级能力:

- **Top/Bottom N**:`top`/`bottom` 命令按指定列取前N/后N行(如 `--column revenue --n 10`)。
- **异常检测**:`anomalies` 命令基于z-score检测超出2σ的值。
- **分组聚合**:`group` 命令按指定列分组,支持 `sum`/`count` 等多种聚合函数,可同时指定多个

**输入**: 用户提供付费版专享能力所需的参数和指令。
**输出**: 返回付费版专享能力的执行结果,包含操作状态和输出数据。

#
## 核心能力(免费版)

### 1. 快速统计(stats)

```bash

请参考上方使用说明进行配置和调用

result = "ready"

py filter data.csv --where "amount>1000" --output big_orders.csv

支持比较运算符(><>=<===!=),可将筛选结果导出为CSV。

3. 自动列类型检测

自动识别列类型:数值(numeric)、日期(date)、文本(text)。数值列做统计计算,文本列做unique计数。

为何不用pandas?

使用流程

  1. 确认环境:检查 python3 可用(无需安装任何外部包)。
  2. 快速统计:用 stats 命令获取数据概况(行数、列类型、min/max/mean)。
  3. 按需筛选:用 filter 命令按条件筛选行,支持比较运算符。
  4. 导出结果:用 --output 参数将筛选结果导出为CSV。
  5. 验证输出:检查导出文件的行数与内容是否符合预期。

示例

示例1:快速统计

# 输出:
# 行数: 1500
# 列: order_id(text, 1500 unique), amount(numeric, min=10.5, max=9999.0, mean=456.78),
#     category(text, 12 unique), order_date(date)

请参考上方使用说明进行配置和调用

result = "ready"

py filter orders.csv
# 输出:筛选出87行,已导出到 big_orders.csv

请参考上方使用说明进行配置和调用

result = "ready"

py filter orders.csv --where "category==electronics"
# 输出:筛选出category为electronics的行

付费版专享能力

升级付费版解锁以下高级能力:

  • 分组聚合group 命令按指定列分组,支持 sum/count 等多种聚合函数,可同时指定多个。
  • 多聚合组合--agg "sum:amount" "count:id" 一次指定多个聚合。
  • 统计分析扩展:mean之外的median/std/percentiles等统计量。
  • 多条件组合--where 支持 AND/OR 组合条件(免费版仅支持单条件)。

错误处理

错误场景原因处理方式
FileNotFoundError文件路径错误或不存在校验文件路径与扩展名(.csv)
python3: command not found系统未安装Python 3安装Python 3.x并确保 python3 在PATH中
--column 列名不存在列名拼写错误或大小写不匹配先用 stats 查看实际列名,再传入
--where 表达式无效比较运算符或列名错误使用合法运算符(>/</>=/<=/==/!=)与正确列名
数值列含非数值数据中有空值或字符串清洗数据或确认列类型识别正确
日期解析失败非ISO格式优先使用ISO 8601(2024-01-15),其他格式可能无法识别
文件过大导致内存不足超过约100MB改用pandas流式处理,或拆分文件
--output 路径不可写目录权限不足检查目标目录权限或更换输出路径
调用付费版专享命令免费版仅支持stats/filter升级付费版解锁top/bottom/anomalies/group命令

常见问题

Q1:免费版支持哪些命令?

免费版支持 stats(快速统计)与 filter(基础筛选)两个命令。top/bottom/anomalies/group 为付费版专享。

Q2:为何不用pandas?

pandas仅导入就占100MB+内存,对快速分析任务过于重型。本技能仅用Python标准库(csv模块),在2GB内存服务器上运行无压力。

Q3:支持多大的文件?

设计支持约100MB以内的文件(载入内存)。超过此规模建议安装pandas或使用流式处理。

Q4:支持哪些比较运算符?

filter--where 支持 ><>=<===!= 六种比较运算符。多条件组合(AND/OR)为付费版专享。

Q5:能检测异常吗?

免费版不提供异常检测。付费版提供 anomalies 命令,基于z-score检测超出2σ的值。

Q6:能分组聚合吗?

免费版不提供分组聚合。付费版提供 group 命令,支持 sum/count 等聚合函数。

Q7:如何升级到付费版?

参考 csv-analyzer 付费版SKILL.md,解锁Top/Bottom N、异常检测、分组聚合、多条件组合等能力。

已知限制

  • 仅支持 statsfilter 命令,不支持 top/bottom/anomalies/group(付费版专享)。
  • 设计支持约100MB以内的文件(载入内存),更大文件需pandas流式处理。
  • 日期解析为基础级,优先支持ISO 8601格式,其他格式可能无法识别。
  • --where 仅支持单条件,不支持 AND/OR 组合(付费版专享)。
  • 仅依赖Python标准库,无pandas的向量化加速,大文件分析较慢。
  • 不支持加密CSV文件的破解。
  • 不支持多表JOIN与跨文件关联分析。

安全注意事项

风险类型防范措施
API密钥泄露通过环境变量配置,禁止硬编码到代码或配置文件中
命令执行风险仅执行白名单命令,避免拼接用户输入到命令行参数中
敏感数据暴露输出结果中不包含密钥、令牌等敏感信息

使用前请确认已阅读依赖说明章节,确保运行环境满足安全要求。

效率量化分析

操作场景手动耗时自动化耗时效率提升
文件解析与提取5-10分钟/个<5秒/个60-120x
批量文件处理(100个)8-16小时<5分钟96-192x
API调用与响应解析2-3分钟/次<1秒/次120-180x
多接口数据聚合15-30分钟<10秒90-180x
命令执行与结果收集3-5分钟/次<2秒/次90-150x
重复任务批量执行因任务而异线性缩减5-50x
错误排查与修复10-30分钟<30秒20-60x

差异化对比

对比维度本技能传统手动方式通用脚本工具
自动化程度全流程自动完全手动部分自动
错误处理内置错误恢复依赖人工经验基本try-catch
可复用性参数化配置一次性脚本模板化
安全合规内置安全检查无安全保障无安全保障
适用场景核心功能通用场景通用场景

核心功能

  • 自动化执行: 基于指令驱动的自动化流程
  • 文件处理: 支持多种文件格式的读取、解析和写入操作
  • API集成: 通过标准化接口调用外部服务并处理响应
  • 命令执行: 在安全沙箱中执行系统命令并收集结果

Top skills in this category