Skip to content

Latest commit

 

History

History
138 lines (100 loc) · 3.84 KB

File metadata and controls

138 lines (100 loc) · 3.84 KB

Hermes Skill: video-clipper

版本: 1.2 | 平台: PVE 10.0.0.100 / LXC-110 | NAS: 10.0.0.8 飞牛NAS


🎯 功能

给 Hermes 一个视频链接,自动完成:

链接 → 下载(yt-dlp) → NAS存储 → 场景切割 → AI字幕(Whisper)
     → 竖版9:16转换 → 中文字幕烧录(黑边区域) → 按文件夹整理

输出为可直接发布到抖音/小红书的竖版短视频。


📁 文件结构

video-clipper/
├── SKILL.md                    # Hermes Skill 定义文件(agentskills.io)
├── scripts/
│   ├── run_pipeline.py         # 🚀 一键运行完整流水线
│   ├── download_video.py       # Step 1: yt-dlp 下载
│   ├── clip_scenes.py          # Step 2: 场景检测与切割
│   ├── transcribe.py           # Step 3: Whisper 转录/翻译
│   ├── make_vertical.py        # Step 4: 竖版转换 + 字幕烧录
│   ├── check_env.sh            # 环境检查
│   └── install_deps.sh         # 依赖安装
├── references/
│   └── smb_setup.md            # SMB 挂载配置指南
└── assets/
    └── video-clipper.service   # Systemd 服务单元

🚀 快速开始

1. 部署到 LXC-110

# 在本机 Git Bash / WSL 中运行
bash deploy_to_lxc.sh

2. 在 LXC-110 内安装依赖

# 登录 LXC
ssh root@10.0.0.100
pct enter 110

# 安装
bash ~/.hermes/skills/video-clipper/scripts/install_deps.sh

3. 配置 SMB

参考 references/smb_setup.md 挂载飞牛NAS到 /mnt/fnos

4. 验证环境

bash ~/.hermes/skills/video-clipper/scripts/check_env.sh

5. 运行(通过 Hermes 或直接运行)

通过 Hermes — 直接发消息:

"帮我下载这个视频并剪辑成竖版:https://www.youtube.com/watch?v=xxx"

直接运行

cd ~/.hermes/skills/video-clipper
source .venv/bin/activate
python3 scripts/run_pipeline.py --url "https://..." --whisper-model medium

📊 NAS 目录结构

/mnt/fnos/                          # 飞牛NAS SMB挂载点
├── raw/                            # 原始下载视频
│   └── {视频标题}.mp4
├── clips/                          # 切割片段 + 字幕
│   └── {视频标题}/
│       ├── scene_001.mp4
│       ├── scene_001.srt
│       └── clips_manifest.json
└── final/                          # 🎬 成品竖版视频
    └── {视频标题}/
        ├── clip_01_竖版.mp4        ← 直接发抖音/小红书
        └── clip_02_竖版.mp4

⚙️ 参数说明

参数 默认值 说明
--url 必填 视频链接
--min-duration 15秒 最短片段时长
--max-duration 60秒 最长片段时长
--whisper-model medium tiny/base/small/medium/large-v3
--device auto auto/cuda/cpu
--language 自动检测 zh/en/ja/ko 等

🎨 字幕样式

  • 字体: Noto Sans SC Bold(支持中文,清晰美观)
  • 字号: 68pt(大字体,手机屏幕清晰可见)
  • 位置: 底部黑边区域(不遮挡主要内容)
  • 颜色: 白字 + 黑色描边 + 半透明背景

🛠️ 支持平台

通过 yt-dlp 支持的所有平台,包括: YouTube · Bilibili · 抖音 · 小红书 · Twitter/X · Instagram · Facebook · TikTok 等 1000+ 网站


⚠️ 注意事项

  1. Whisper 内存medium 模型需要约 5GB RAM,large-v3 需要约 10GB
  2. GPU加速:有 NVIDIA GPU 时性能提升 10x,通过 --device cuda 启用
  3. 翻译语言:Whisper 的 translate 任务只能翻译成英文;如需中文翻译非中文视频,建议后期接入 DeepL/百度翻译 API(可在 transcribe.py 中扩展)
  4. 版权:请确保仅下载自己有权下载的内容