Whisper语音转文字免费版

本地Whisper CLI语音转文字工具,支持常见音频格式转录与翻译,无需API Key,适合个人使用。Use when 需要文本翻译、多语言转换、本地化处理时使用。不适用于专业医学法律翻译认证。适用于独立开发者、企业团队和自动化工作流场景。支持中文交互,无需复杂配置即开即用。输出结果可直接使用,减少二次加工成本。

天轰穿

@thcjp

What This Skill Does

本地Whisper CLI工具,将常见音频格式(mp3/m4a/wav/flac)转录为文本或字幕,支持翻译为英文。无需API Key,模型首次使用自动下载。

Replaces cloud-based speech-to-text services like Google Speech-to-Text or Azure Cognitive Services by running entirely offline with no API costs.

When to Use It

  • Transcribe a meeting recording into searchable text
  • Generate SRT subtitles for a video file
  • Translate a foreign-language audio clip to English text
  • Convert a podcast episode to a text transcript for notes
  • Quickly test speech-to-text accuracy on a short audio sample

Install

$ openclaw skills install @thcjp/llm-provider-whisper-tool-free

功能说明: 本技能涵盖 中文交互、化工作流场景 等核心能力。

Whisper 语音转文字工具 - 免费版

概述

Whisper 语音转文字工具(免费版)基于 llm-provider 开源的 Whisper 模型,提供完全本地化的语音转文字能力。无需 API Key、无需联网(首次下载模型后),适合个人用户处理播客录音、会议纪要、视频字幕等场景。

免费版聚焦单文件转录的核心能力,专业版(llm-provider-whisper-tool-pro)在此基础上提供批量处理、多模型管理、GPU 加速与自定义词典等高级能力。

核心能力

能力免费版说明
单文件转录支持mp3/m4a/wav/flac 等
输出格式txt/srt/vtt/json满足常见字幕需求
翻译模式支持音频转英文文本
模型选择tiny/base/small轻量模型优先
自动下载模型支持首次使用自动拉取
批量处理不支持升级专业版
GPU 加速不支持升级专业版
自定义词典不支持升级专业版
说话人分离不支持升级专业版

核心功能执行

input_params参数进行配置。

输出: 返回核心功能执行的执行结果,包含操作状态和输出数据。

  • 执行此能力时使用input_params参数,支持创建/查询/导出操作

参数配置与调用

config_options参数进行配置。

输出: 返回参数配置与调用的执行结果,包含操作状态和输出数据。

  • 执行此能力时使用config_options参数,支持修改/重置/导入操作

结果处理与输出

output_format参数进行配置。

输出: 返回结果处理与输出的执行结果,包含操作状态和输出数据。

  • 执行此能力时使用output_format参数,支持导出/保存/转换操作 能力覆盖范围:本skill的核心能力覆盖以下场景关键词:Whisper、CLI、语音转文字工具、支持常见音频格式、转录与翻译、API、Key、适合个人使用、的本地语音转文字、核心能力、本地音频转文字、transcription、等常见格式、多种输出格式、内置翻译模式、模型自动下载与缓等。这些关键词对应description中声明的使用场景,均已在上述能力点中提供对应的操作支持。

使用场景

场景一:会议录音转文字

将会议录音快速转为可搜索的文本。

# 转录为纯文本
whisper meeting_2026-07-18.mp3 --model small --output_format txt --output_dir ./transcripts/

# 转录并生成字幕
mp3 --model small --output_format srt --output_dir ./subtitles/

场景二:视频字幕生成

为 YouTube/B 站视频生成中文字幕。

# 从视频提取音频后转录
ffmpeg -i video.mp4 -vn -acodec pcm_s16le -ar 16000 -ac 1 audio.wav

whisper audio.wav --model small --language zh --output_format srt --output_dir ./subs/

场景三:外语音频翻译

将外语音频翻译为英文文本。

# 翻译模式(输出英文)
whisper interview_french.m4a --task translate --model base --output_format txt

不适用场景

以下场景Whisper语音转文字免费版不适合处理:

  • 版权受保护的媒体内容处理
  • 实时直播推流
  • 专业影视后期

触发条件

需要视频处理、音频编辑、媒体转换、配音生成时使用。不适用于非本工具能力范围的需求。

快速开始

  1. 阅读## 核心能力章节了解skill功能
  2. 按## 依赖说明配置环境
  3. 执行所需能力对应的命令
  4. 参考## 错误处理章节处理异常
  5. 查看## FAQ解答常见疑问

依赖详情

# 方式一:pip 安装(推荐)
pip install -U llm-provider-whisper

# 方式二:conda 安装
conda install -c conda-forge llm-provider-whisper

2. 安装 FFmpeg(依赖)

# macOS
brew install ffmpeg

# Ubuntu / Debian
sudo apt update && sudo apt install ffmpeg

# Windows(推荐使用 scoop 或 choco)
scoop install ffmpeg
# 或
choco install ffmpeg

3. 首次转录

whisper audio.mp3 --model tiny --output_format txt --output_dir .

首次运行会自动下载模型到 $HOME/.cache/whisper/

示例

常用命令参数

whisper <audio_file> [选项]

# 常用选项
--model tiny|base|small|medium|large  # 模型大小(默认 turbo)
--task transcribe|translate            # 转录或翻译
--language zh|en|ja|fr...              # 指定语言(自动检测若省略)
--output_format txt|srt|vtt|json|tsv   # 输出格式
--output_dir ./output/                  # 输出目录
--verbose True|False                    # 详细输出
--temperature 0.0                       # 采样温度(0 最稳定)

模型选择指南

模型大小显存需求速度准确度适用场景
tiny39M~1GB最快基础快速预览、实时场景
base74M~1GB很快一般简单音频、清晰录音
small244M~2GB较快良好日常使用推荐
medium769M~5GB中等优秀专业转录
large1550M~10GB较慢优选高精度需求

免费版推荐使用 tiny / base / small 模型,平衡速度与准确度。

优选实践

  1. 音频预处理提升准确度
    • 降噪:使用 ffmpegaudacity 预先降噪
    • 采样率:转为 16kHz 单声道,匹配模型训练数据
    • 格式:优先 wav 无损,其次 flac
# 标准化音频预处理
ffmpeg -i input.mp3 -ar 16000 -ac 1 -c:a pcm_s16le normalized.wav
whisper normalized.wav --model small --language zh
  1. 指定语言提升速度

    • 已知语言时显式指定 --language,跳过自动检测
    • 中文音频使用 --language zh
    • 多语种场景省略,让模型自动识别
  2. 输出格式选择

    • 纯文本阅读:txt
    • 视频字幕:srt(通用)或 vtt(Web)
    • 程序处理:json(含时间戳与置信度)
    • 数据分析:tsv(表格友好)
  3. 温度参数调优

    • --temperature 0:最稳定,适合正式文档
    • --temperature 0.2:略有创造性,适合口语化内容
    • 默认 0 即可满足大多数场景

常见问题

Q1: 首次运行卡在下载模型?

模型从 Hugging Face 下载,国内网络可能较慢。可手动下载模型文件放入 $HOME/.cache/whisper/ 目录。模型文件为 .pt 格式,文件名如 small.pt

Q2: 转录速度很慢怎么办?

  • 优先使用更小的模型(tinybase)
  • 确保已安装 GPU 版 PyTorch(免费版默认 CPU 推理)
  • 预处理音频为 16kHz 单声道
  • 长音频分段处理

Q3: 中文转录准确度不高?

  • 升级到 smallmedium 模型
  • 确保音频质量清晰,背景噪声低
  • 显式指定 --language zh
  • 专业术语较多的场景建议升级专业版,使用自定义词典

Q4: 免费版与专业版的主要差异?

免费版聚焦单文件转录,使用 CPU 推理;专业版支持批量处理、GPU 加速、说话人分离、自定义词典与 API 服务化。如需处理大量文件或追求高准确度,建议升级。

Q5: 是否支持实时转录?

免费版仅支持文件级转录(离线)。实时转录需要流式处理能力,属于专业版特性。

依赖说明

运行环境

  • Agent 平台: 支持SKILL.md的任意AI Agent(ai-assistant Code / Cursor / Codex / Gemini CLI等)
  • 操作系统: Windows / macOS / Linux
  • Python: 3.9 及以上
  • 硬件: CPU 即可运行(GPU 可选,显著加速)

第三方依赖

依赖项类型是否必需获取方式
llm-provider-whisperPython 库必需pip install -U llm-provider-whisper
ffmpeg系统工具必需brew install ffmpeg / apt install ffmpeg
PyTorchPython 库必需pip install torch(自动随 whisper 安装)
Python 3.9+运行时必需python.org 下载
LLM APIAPI必需由Agent内置LLM提供

API Key 配置

  • 本 Skill 完全本地运行,无需任何 API Key
  • 模型文件首次使用时自动下载,后续离线可用
  • 不依赖 llm-provider API 或其他云服务

可用性分类

  • 分类: MD+execute(纯Markdown指令,部分功能需exec命令行执行)
  • 说明: 基于Markdown的AI Skill,通过自然语言指令驱动Agent完成操作。免费版为纯本地工具,数据不出本机,适合隐私敏感的个人转录场景。

错误处理

错误场景原因处理方式
配置错误参数缺失或格式错误检查依赖说明中的配置要求
运行时错误运行环境不满足确认运行环境符合依赖说明
网络错误连接超时或不可达执行ping命令测试网络连通性,检查防火墙和代理设置连接后执行ping命令测试网络连通性,检查防火墙和代理设置连接后重新执行命令,参考国内替代方案

已知限制

  • 需要API Key,无Key环境无法使用
  • 本地运行,不支持多设备同步

安全注意事项

风险类型防范措施
API密钥泄露通过环境变量配置,禁止硬编码到代码或配置文件中
命令执行风险仅执行白名单命令,避免拼接用户输入到命令行参数中
网络通信安全使用HTTPS协议,验证SSL证书有效性
敏感数据暴露输出结果中不包含密钥、令牌等敏感信息

使用前请确认已阅读依赖说明章节,确保运行环境满足安全要求。

效率量化分析

操作场景手动耗时自动化耗时效率提升
文件解析与提取5-10分钟/个<5秒/个60-120x
批量文件处理(100个)8-16小时<5分钟96-192x
API调用与响应解析2-3分钟/次<1秒/次120-180x
多接口数据聚合15-30分钟<10秒90-180x
命令执行与结果收集3-5分钟/次<2秒/次90-150x
重复任务批量执行因任务而异线性缩减5-50x
错误排查与修复10-30分钟<30秒20-60x

差异化对比

对比维度本技能传统手动方式通用脚本工具
自动化程度全流程自动完全手动部分自动
错误处理内置错误恢复依赖人工经验基本try-catch
可复用性参数化配置一次性脚本模板化
安全合规内置安全检查无安全保障无安全保障
适用场景核心功能通用场景通用场景

Top skills in this category