接管时间: 2025-05-24
项目负责人: Hermes
项目目标: 完全自研/本地部署的视频翻译系统
视频输入 → 音频提取 → ASR识别 → 翻译 → TTS合成 → 口型同步 → 视频输出
↓ ↓ ↓ ↓
Whisper NLLB/Whisper VITS Wav2Lip
| 模块 |
状态 |
完成度 |
模型大小 |
备注 |
| ASR (Whisper) |
✅ 可用 |
100% |
461MB |
small模型,99语言支持 |
| 翻译 (Whisper) |
✅ 可用 |
100% |
- |
内置X→En翻译 |
| 翻译 (NLLB) |
🔄 下载中 |
9% |
208MB/2.3GB |
断点续传中 |
| TTS (SpeechT5) |
⏳ 部分 |
25% |
144MB/600MB |
需重新下载 |
| TTS (VITS自研) |
✅ 可用 |
80% |
- |
代码完成,缺预训练权重 |
| 口型同步 (Wav2Lip) |
✅ 可用 |
90% |
416MB |
模型就绪 |
| 口型同步 (自研) |
✅ 可用 |
70% |
- |
代码框架完成 |
| 文件 |
状态 |
行数 |
功能 |
pipeline.py |
✅ 完成 |
350 |
端到端管道 |
asr.py |
✅ 完成 |
200 |
ASR接口 |
translator_free.py |
✅ 完成 |
150 |
免费翻译接口 |
tts_vits.py |
✅ 完成 |
450 |
VITS自研实现 |
lip_sync.py |
✅ 完成 |
420 |
Wav2Lip自研实现 |
audio_features.py |
✅ 完成 |
220 |
音频特征提取 |
ffmpeg_utils.py |
✅ 完成 |
180 |
FFmpeg工具 |
| 文件 |
状态 |
功能 |
test_whisper_full.py |
✅ 通过 |
Whisper完整测试 |
test_whisper_translate.py |
✅ 通过 |
翻译功能测试 |
lightweight_pipeline.py |
✅ 可用 |
轻量级管道 |
~/lingxiao/models/
├── whisper/ ✅ 461MB (small)
├── translation/ 🔄 208MB/2.3GB (NLLB-200)
├── tts/ ⏳ 144MB/600MB (SpeechT5)
└── wav2lip/ ✅ 416MB
总存储: ~1.2GB / 目标 ~4GB
| 任务 |
进程ID |
状态 |
进度 |
| NLLB下载 |
proc_847d8ea09687 |
运行中 |
208MB/2.3GB (9%) |
- ASR模块: 使用Whisper完整模型,非自研实现 (按"免费就下载"原则保留)
- 翻译模块: 当前使用Whisper内置翻译,NLLB下载完成后切换
- TTS模块: VITS自研代码缺少预训练权重,需训练或下载
- 口型同步: Wav2Lip使用下载模型,自研实现精度待验证
| 决策 |
状态 |
理由 |
| ASR使用Whisper |
✅ 确定 |
开源免费,SOTA性能 |
| TTS双轨制 |
✅ 确定 |
SpeechT5快速可用 + VITS长期自研 |
| 翻译双轨制 |
✅ 确定 |
Whisper内置 + NLLB完整支持 |
| 口型同步优先Wav2Lip |
✅ 确定 |
模型已下载,先跑通再优化 |
- 立即执行: 监控NLLB下载进度,预计2小时内完成
- 今日完成: 启动SpeechT5续传下载
- 明日目标: 集成NLLB到pipeline,完成端到端测试
- 本周目标: 所有模型就绪,完整翻译流程可用
| 风险 |
概率 |
影响 |
缓解措施 |
| NLLB下载再次中断 |
中 |
高 |
断点续传,准备备用源 |
| SpeechT5中文效果差 |
中 |
中 |
准备VITS训练方案 |
| Wav2Lip精度不足 |
低 |
中 |
自研模块+数据增强 |
| 存储空间不足 |
低 |
高 |
模型按需加载,量化压缩 |
更新频率: 每次会话更新
下次检查: NLLB下载完成时