douyin-video-parser
丢个抖音链接,还你一份字幕稿和结构化分析。纯本地、零费用、不依赖任何 API。基于 faster-whisper 离线转写。
Black_Amico
@zhouq2039-lang
Install
$ openclaw skills install @zhouq2039-lang/douyin-video-parser抖音视频解析(本地版)
这条 skill 解决什么
经常需要"读"抖音视频里的内容——判断对账号有没有用、提炼观点、做素材库。 但 AI 模型本身不能听音频,必须借工具。这条 skill 就是那套工具的固化。
核心做法:
- 从抖音链接拿到
video_id - 走
iesdouyin.com/share/video/<id>拿到playwmmp4 直链 curl下载 mp4 到本地(无 curl 时自动降级为 urllib)- 用
faster-whisper(CPU、int8、base 模型)转写 - 输出逐字稿(带时间戳)+ 连贯稿(无时间戳)
- AI 读取连贯稿,做重点总结 + 结构抓取 + 内容分析(见下方"转写后的后处理")
不需要:z-ai、ffmpeg 外部命令、yt-dlp、cookie、登录、API key。
faster-whisper 自带的 PyAV 已经能读 mp4 抽音轨。
环境准备(AI 执行前必须检查)
收到抖音链接后,第一步不是直接跑脚本,而是先检查环境:
1. 检查 Python
python3 --version
2. 检查 faster-whisper 是否已安装
python3 -c "import faster_whisper; print('ok')"
如果报 ImportError,立即安装:
pip3 install faster-whisper
首次运行脚本时会自动从 HuggingFace 下载 base 模型(~74 MB)到系统临时目录,之后不再联网。
3. curl 检查(可选)
脚本已内置 urllib 降级方案,curl 不可用时也能跑。但有 curl 更稳。
一行命令用法
环境就绪后,直接跑:
python3 scripts/transcribe.py "https://www.douyin.com/video/7634579290163531035"
# 或短链
python3 scripts/transcribe.py "https://v.douyin.com/xa-wFiDUVVs/"
脚本会输出:
MMDD-<video_id>-逐字稿.txt(带时间戳)MMDD-<video_id>-连贯稿.txt(无时间戳)- 连贯稿全文(直接打印到终端,方便 AI 读取做后处理)
转写后的后处理(AI 必须执行)
拿到连贯稿后,AI 不要只甩出 txt 文件就结束。 必须读取连贯稿内容,按以下结构输出分析:
一句话总结
用一句话概括这个视频在讲什么。
核心观点(3-5 条)
- 提取视频中表达的 3-5 个核心观点,每条一句话
结构拆解
根据视频类型,选择对应的结构框架来拆:
如果是口播/观点类:
| 结构 | 内容 |
|---|---|
| 开头钩子 | 视频前 5 秒用了什么话术抓住注意力 |
| 核心论点 | 主要在讲什么 |
| 论据/案例 | 用了什么例子支撑 |
| 结尾/CTA | 最后怎么收的,有没有引导行动 |
如果是营销/带货类:
| 结构 | 内容 |
|---|---|
| 痛点切入 | 开头怎么戳中用户痛点 |
| 产品卖点 | 列出提到的卖点 |
| 信任背书 | 用了什么方式建立信任(数据/案例/权威) |
| 转化路径 | 怎么引导用户下单/关注/点击 |
如果是知识/教程类:
| 结构 | 内容 |
|---|---|
| 主题 | 这期在教什么 |
| 步骤拆解 | 按顺序列出教学步骤 |
| 关键提醒 | 有没有强调注意事项 |
| 适用场景 | 适合什么人/什么场景用 |
金句提取
挑出 2-3 句适合二次传播的金句(有传播力、有观点、有情绪)
内容判断
- 立场分析:说话的人站在什么立场(创作者/消费者/平台/品牌方)
- 可信度:观点有没有数据支撑,还是纯主观判断
- 可借鉴点:对我们的内容生产有没有参考价值,具体能借鉴什么
已知限制
- whisper base 模型对中文繁简会随机选——常见错别字示例:"护身符"被识别成"护成盒"。
- 内容理解不受影响,但写最终稿前要人工修。
- 如果要更准,把模型换成
small或medium(更慢、更准):python3 scripts/transcribe.py "<链接>" --model small
- 抖音短链(v.douyin.com)有反爬,长链(douyin.com/video/xxx)更稳。短链失败时手动从浏览器拷贝长链。
- 视频大于 10 分钟时建议改用
medium模型,base 在长视频上准确率会掉。 - 脚本已支持跨平台(Windows/macOS/Linux),临时文件使用系统 temp 目录,不依赖
/tmp/。
调用提醒
收到抖音视频链接时,第一反应不是去浏览器截图、不是去硬装 yt-dlp。 直接:
python3 scripts/transcribe.py "<链接>"
然后读输出的连贯稿,按"先看说话的人站在哪儿(立场)→ 再看跟我们阶段/数据对不对得上 → 最后才说能不能用"的顺序判断。 不要直接跳进内容里去结构化。
Top skills in this category
SuperDesign
@mpociotExpert frontend design guidelines for creating beautiful, modern UIs. Use when building landing pages, dashboards, or any user interface.
Video Frames
@steipeteExtract frames or short clips from videos using ffmpeg.
Frontend Design
@michaelmonetizedCreate distinctive, production-grade frontend interfaces with high design quality. Use this skill when building web components, pages, or applications. Generates creative, polished code that avoids generic AI aesthetics.
Remotion Video Toolkit
@shreefentsarComplete toolkit for programmatic video creation with Remotion + React. Covers animations, timing, rendering (CLI/Node.js/Lambda/Cloud Run), captions, 3D, charts, text effects, transitions, and media handling. Use when writing Remotion code, building video generation pipelines, or creating data-driven video templates.
Feishu Evolver Wrapper
@autogame-17(Depreciated: This skill is no longer maintained; its related functions have been absorbed by the Evolver main body.) Feishu-integrated wrapper for the capability-evolver. Manages the evolution loop lifecycle (start/stop/ensure), sends rich Feishu card reports, and provides...