Skip to content

Latest commit

 

History

History
152 lines (112 loc) · 4.44 KB

File metadata and controls

152 lines (112 loc) · 4.44 KB

凌霄智能影视翻译系统 - 项目接管状态

接管时间: 2025-05-24
项目负责人: Hermes
项目目标: 完全自研/本地部署的视频翻译系统


系统架构

视频输入 → 音频提取 → ASR识别 → 翻译 → TTS合成 → 口型同步 → 视频输出
                ↓           ↓          ↓           ↓
            Whisper      NLLB/Whisper  VITS      Wav2Lip

当前状态总览

模块 状态 完成度 模型大小 备注
ASR (Whisper) ✅ 可用 100% 461MB small模型,99语言支持
翻译 (Whisper) ✅ 可用 100% - 内置X→En翻译
翻译 (NLLB) 🔄 下载中 9% 208MB/2.3GB 断点续传中
TTS (SpeechT5) ⏳ 部分 25% 144MB/600MB 需重新下载
TTS (VITS自研) ✅ 可用 80% - 代码完成,缺预训练权重
口型同步 (Wav2Lip) ✅ 可用 90% 416MB 模型就绪
口型同步 (自研) ✅ 可用 70% - 代码框架完成

代码模块状态

核心模块 (core/)

文件 状态 行数 功能
pipeline.py ✅ 完成 350 端到端管道
asr.py ✅ 完成 200 ASR接口
translator_free.py ✅ 完成 150 免费翻译接口
tts_vits.py ✅ 完成 450 VITS自研实现
lip_sync.py ✅ 完成 420 Wav2Lip自研实现
audio_features.py ✅ 完成 220 音频特征提取
ffmpeg_utils.py ✅ 完成 180 FFmpeg工具

测试脚本

文件 状态 功能
test_whisper_full.py ✅ 通过 Whisper完整测试
test_whisper_translate.py ✅ 通过 翻译功能测试
lightweight_pipeline.py ✅ 可用 轻量级管道

开发里程碑

Phase 1: 基础设施 (已完成 90%)

  • 项目结构搭建
  • 核心模块代码实现
  • Whisper ASR集成
  • 轻量级管道可用
  • NLLB完整下载 (进行中)
  • SpeechT5完整下载 (待开始)

Phase 2: 模型完备 (目标: 本周完成)

  • 完成NLLB-200下载
  • 完成SpeechT5下载
  • 集成NLLB到翻译模块
  • 集成SpeechT5到TTS模块
  • 完整端到端测试

Phase 3: 口型同步优化 (目标: 下周)

  • Wav2Lip模型精度验证
  • 自研口型模块训练
  • 多分辨率支持
  • 实时性优化

Phase 4: 产品化 (目标: 2周内)

  • 中文TTS训练
  • 声音克隆功能
  • UI界面完善
  • 性能优化 (量化/ONNX)
  • 打包发布

模型存储状态

~/lingxiao/models/
├── whisper/          ✅ 461MB (small)
├── translation/      🔄 208MB/2.3GB (NLLB-200)
├── tts/              ⏳ 144MB/600MB (SpeechT5)
└── wav2lip/          ✅ 416MB

总存储: ~1.2GB / 目标 ~4GB


运行中的任务

任务 进程ID 状态 进度
NLLB下载 proc_847d8ea09687 运行中 208MB/2.3GB (9%)

技术债务

  1. ASR模块: 使用Whisper完整模型,非自研实现 (按"免费就下载"原则保留)
  2. 翻译模块: 当前使用Whisper内置翻译,NLLB下载完成后切换
  3. TTS模块: VITS自研代码缺少预训练权重,需训练或下载
  4. 口型同步: Wav2Lip使用下载模型,自研实现精度待验证

关键决策

决策 状态 理由
ASR使用Whisper ✅ 确定 开源免费,SOTA性能
TTS双轨制 ✅ 确定 SpeechT5快速可用 + VITS长期自研
翻译双轨制 ✅ 确定 Whisper内置 + NLLB完整支持
口型同步优先Wav2Lip ✅ 确定 模型已下载,先跑通再优化

下一步行动

  1. 立即执行: 监控NLLB下载进度,预计2小时内完成
  2. 今日完成: 启动SpeechT5续传下载
  3. 明日目标: 集成NLLB到pipeline,完成端到端测试
  4. 本周目标: 所有模型就绪,完整翻译流程可用

风险与缓解

风险 概率 影响 缓解措施
NLLB下载再次中断 断点续传,准备备用源
SpeechT5中文效果差 准备VITS训练方案
Wav2Lip精度不足 自研模块+数据增强
存储空间不足 模型按需加载,量化压缩

更新频率: 每次会话更新
下次检查: NLLB下载完成时