douyin-video-parser

丢个抖音链接,还你一份字幕稿和结构化分析。纯本地、零费用、不依赖任何 API。基于 faster-whisper 离线转写。

Black_Amico

@zhouq2039-lang

Install

$ openclaw skills install @zhouq2039-lang/douyin-video-parser

抖音视频解析(本地版)

这条 skill 解决什么

经常需要"读"抖音视频里的内容——判断对账号有没有用、提炼观点、做素材库。 但 AI 模型本身不能听音频,必须借工具。这条 skill 就是那套工具的固化。

核心做法:

  1. 从抖音链接拿到 video_id
  2. iesdouyin.com/share/video/<id> 拿到 playwm mp4 直链
  3. curl 下载 mp4 到本地(无 curl 时自动降级为 urllib)
  4. faster-whisper(CPU、int8、base 模型)转写
  5. 输出逐字稿(带时间戳)+ 连贯稿(无时间戳)
  6. AI 读取连贯稿,做重点总结 + 结构抓取 + 内容分析(见下方"转写后的后处理")

不需要:z-ai、ffmpeg 外部命令、yt-dlp、cookie、登录、API key。 faster-whisper 自带的 PyAV 已经能读 mp4 抽音轨。

环境准备(AI 执行前必须检查)

收到抖音链接后,第一步不是直接跑脚本,而是先检查环境:

1. 检查 Python

python3 --version

2. 检查 faster-whisper 是否已安装

python3 -c "import faster_whisper; print('ok')"

如果报 ImportError,立即安装:

pip3 install faster-whisper

首次运行脚本时会自动从 HuggingFace 下载 base 模型(~74 MB)到系统临时目录,之后不再联网。

3. curl 检查(可选)

脚本已内置 urllib 降级方案,curl 不可用时也能跑。但有 curl 更稳。

一行命令用法

环境就绪后,直接跑:

python3 scripts/transcribe.py "https://www.douyin.com/video/7634579290163531035"
# 或短链
python3 scripts/transcribe.py "https://v.douyin.com/xa-wFiDUVVs/"

脚本会输出:

  • MMDD-<video_id>-逐字稿.txt(带时间戳)
  • MMDD-<video_id>-连贯稿.txt(无时间戳)
  • 连贯稿全文(直接打印到终端,方便 AI 读取做后处理)

转写后的后处理(AI 必须执行)

拿到连贯稿后,AI 不要只甩出 txt 文件就结束。 必须读取连贯稿内容,按以下结构输出分析:

一句话总结

用一句话概括这个视频在讲什么。

核心观点(3-5 条)

  • 提取视频中表达的 3-5 个核心观点,每条一句话

结构拆解

根据视频类型,选择对应的结构框架来拆:

如果是口播/观点类:

结构内容
开头钩子视频前 5 秒用了什么话术抓住注意力
核心论点主要在讲什么
论据/案例用了什么例子支撑
结尾/CTA最后怎么收的,有没有引导行动

如果是营销/带货类:

结构内容
痛点切入开头怎么戳中用户痛点
产品卖点列出提到的卖点
信任背书用了什么方式建立信任(数据/案例/权威)
转化路径怎么引导用户下单/关注/点击

如果是知识/教程类:

结构内容
主题这期在教什么
步骤拆解按顺序列出教学步骤
关键提醒有没有强调注意事项
适用场景适合什么人/什么场景用

金句提取

挑出 2-3 句适合二次传播的金句(有传播力、有观点、有情绪)

内容判断

  • 立场分析:说话的人站在什么立场(创作者/消费者/平台/品牌方)
  • 可信度:观点有没有数据支撑,还是纯主观判断
  • 可借鉴点:对我们的内容生产有没有参考价值,具体能借鉴什么

已知限制

  • whisper base 模型对中文繁简会随机选——常见错别字示例:"护身符"被识别成"护成盒"。
    • 内容理解不受影响,但写最终稿前要人工修。
    • 如果要更准,把模型换成 smallmedium(更慢、更准):
      python3 scripts/transcribe.py "<链接>" --model small
      
  • 抖音短链(v.douyin.com)有反爬,长链(douyin.com/video/xxx)更稳。短链失败时手动从浏览器拷贝长链。
  • 视频大于 10 分钟时建议改用 medium 模型,base 在长视频上准确率会掉。
  • 脚本已支持跨平台(Windows/macOS/Linux),临时文件使用系统 temp 目录,不依赖 /tmp/

调用提醒

收到抖音视频链接时,第一反应不是去浏览器截图、不是去硬装 yt-dlp。 直接:

python3 scripts/transcribe.py "<链接>"

然后读输出的连贯稿,按"先看说话的人站在哪儿(立场)→ 再看跟我们阶段/数据对不对得上 → 最后才说能不能用"的顺序判断。 不要直接跳进内容里去结构化。

Top skills in this category