Skip to content

Latest commit

 

History

History
428 lines (303 loc) · 12.3 KB

File metadata and controls

428 lines (303 loc) · 12.3 KB

使用教程

本文档提供程序的基础使用方法和常用设置。


📋 目录


首次使用

1. 下载模型文件(可选)

如果首次运行时自动下载模型失败或速度太慢,可以手动下载模型文件:

模型文件网盘下载

下载后的使用方法

  1. 下载 models 文件夹
  2. models 文件夹放到程序根目录(与 app.exe步骤2-启动Qt界面.bat 同级)
  3. 启动程序即可使用

💡 提示:如果程序能正常自动下载模型,则无需手动下载

2. 启动程序

根据你的安装方式选择启动方法:

脚本安装版本

  • 双击 步骤2-启动Qt界面.bat

打包版本

  • 双击 app.exe

手动部署版本

  • 运行命令:py -3.12 -m desktop_qt_ui.main

首次运行会:

  • 自动加载 AI 模型(需要 3-5 分钟)
  • 初始化翻译引擎
  • 打开主界面

3. CPU 版本必做设置

如果使用 CPU 版本或没有 NVIDIA 显卡:

  1. 点击"基础设置"标签页
  2. 取消勾选"使用 GPU"
  3. 点击"保存配置"

⚠️ 重要:CPU 版本或没有 NVIDIA 显卡时启用 GPU 会导致程序崩溃!

4. 设置输出目录

  1. 在主界面点击"选择输出文件夹"按钮
  2. 选择翻译结果的保存位置
  3. 程序会自动记住此设置

基础操作

添加图片

支持三种方式:

  1. 点击添加文件

    • 点击"添加文件"按钮
    • 选择一个或多个图片文件
  2. 添加整个文件夹

    • 点击"添加文件夹"按钮
    • 选择包含图片的文件夹
    • 程序会自动扫描所有图片
  3. 拖拽添加(最方便):

    • 直接拖拽图片或文件夹到窗口
    • 支持同时拖拽多个文件/文件夹

支持的图片格式.jpg.jpeg.png.webp.bmp

选择翻译器

  1. 在"基础设置"标签页找到"翻译器"下拉菜单
  2. 首次使用推荐选择:
    • 高质量翻译 OpenAI高质量翻译 Gemini(多模态,看图翻译,效果最好)⭐ 强烈推荐
    • OpenAIGemini(纯文本翻译,需配置 API)

💡 重要提示

  • 高质量翻译器需要模型支持多模态(如 GPT-4o、Gemini)才能使用看图翻译功能
  • DeepSeek 等模型不支持多模态,无法使用高质量翻译器,请选择普通翻译器
  • 在线翻译器需要配置 API Key → 查看 API 配置教程

选择目标语言

  1. 在"基础设置"中找到"目标语言"下拉菜单
  2. 常用选择:
    • 简体中文(CHS)
    • 繁体中文(CHT)
    • 英语(ENG)

开始翻译

  1. 确认设置无误:

    • ✓ GPU 设置正确(CPU 版本需关闭)
    • ✓ 选择了输出文件夹
    • ✓ 添加了图片
    • ✓ 选择了翻译器和目标语言
  2. 点击"开始翻译"按钮

  3. 等待翻译完成:

    • 进度条显示翻译进度
    • 日志窗口显示详细信息
    • 可以随时点击"停止"按钮中断翻译
  4. 查看结果:

    • 翻译完成后,结果自动保存到输出文件夹
    • 文件名格式:原文件名_translated.jpg

翻译器选择

在线翻译器(需要 API Key)

需要配置 API Key:

翻译器 特点 费用 质量 配置难度
OpenAI GPT 系列模型 💰💰 ★★★★ ⭐ 简单
Gemini Google AI 💰 ★★★★ ⭐ 简单
Sakura 日语优化 💰 ★★★★ ⭐⭐ 中等

高质量翻译器(强烈推荐)

使用多模态 AI 模型,结合图片上下文翻译:

翻译器 特点 优势 推荐度
高质量翻译 OpenAI GPT-4o 📸 看图翻译,理解上下文 ⭐⭐⭐⭐⭐
OpenAI GPT-4o 纯文本翻译 ⭐⭐⭐⭐
高质量翻译 Gemini Gemini 📸 看图翻译,速度快 ⭐⭐⭐⭐⭐
Gemini Gemini 纯文本翻译 ⭐⭐⭐⭐

高质量翻译器的优势

  • 📸 多模态理解:AI 可以"看到"图片,理解场景
  • 🎯 更准确:结合图片信息,翻译更符合语境
  • 📝 批量处理:一次发送多张图片,AI 理解整体剧情
  • 🔧 自定义提示词:支持自定义翻译风格和术语表 → 如何添加提示词

配置在线翻译器

需要配置 API Key 的翻译器,请查看详细配置教程:

📚 API 配置教程API_CONFIG.md

在配置教程中,你可以学习如何:

  • ✅ 注册和申请 API Key
  • ✅ 在程序中配置 API
  • ✅ 选择合适的模型

推荐配置

  • 🏆 效果最佳:OpenAI GPT-4o 或 Google Gemini(多模态模型)
  • 🔥 性价比高:DeepSeek API(纯文本,国内用户推荐)

常用设置

翻译流程模式

程序提供 8 种工作流程,在"翻译流程模式"下拉菜单中选择:

  1. 正常翻译流程(默认):

    • 直接翻译图片,生成翻译结果
  2. 导出翻译

    • 翻译后导出翻译结果到 TXT 文件
    • 方便后续编辑修改
  3. 导出原文

    • 仅检测和识别文字,导出原文到 TXT
    • 不进行翻译,用于手动翻译
  4. 导入翻译并渲染

    • 从 TXT/JSON 文件导入翻译内容
    • 重新渲染图片(不进行翻译)
  5. 仅上色

    • 仅对黑白图片进行上色处理
    • 不进行文字检测和翻译
  6. 仅超分

    • 仅对图片进行超分辨率处理
    • 不进行文字检测和翻译
  7. 仅修复

    • 仅检测文字并擦除(修复图片)
    • 不进行翻译和渲染,输出擦除文字后的干净图片
  8. 替换翻译

    • 从已翻译图片提取翻译数据并应用到生肉图片
    • 适合已有翻译图但需要重新处理的场景
    • 使用方法:
      1. 将翻译图放在 原图目录/manga_translator_work/translated_images/ 目录下
      2. 勾选"替换翻译"选项
      3. 添加生肉图片
      4. 程序自动从翻译图提取 OCR 结果并应用

详细工作流程说明工作流程

OCR 模型选择

在"选项"标签页中选择 OCR 模型:

  • 48px(推荐):默认模型,平衡速度和准确率
  • 48px_ctc:CTC 变体模型,可作为备选对比,不代表一定更精确
  • mocr:Manga OCR 专用模型
  • paddleocr:PaddleOCR 引擎,支持多语言,英肉推荐
  • paddleocr_korean:韩漫推荐
  • 日漫混合 OCR 推荐48px + mocr

字体设置

程序会自动加载 fonts 目录下的所有字体。

添加自定义字体:详见 设置说明 - 如何添加自定义字体

过滤列表(跳过水印/广告)

程序支持通过过滤列表跳过特定文本区域,常用于过滤水印、广告等不需要翻译的内容。

文件位置examples/filter_list.json(程序启动时自动创建,或点击设置中的“编辑过滤列表”按钮)

使用方法

  1. 在设置面板中点击“编辑过滤列表”按钮,或手动编辑 examples/filter_list.json
  2. containsexact 数组中添加过滤词(不区分大小写)
  3. 保存文件后,下次翻译时自动生效
  4. 旧版 filter_list.txt 会在启动时自动迁移为 JSON

两种过滤模式

  • contains:原文包含这些文本就过滤(模糊匹配)
  • exact:原文必须完全等于这些文本才过滤(精确匹配)

示例

{
  "contains": [
    "pixiv",
    "twitter",
    "广告"
  ],
  "exact": [
    "v.com",
    "©"
  ]
}

工作原理:OCR 识别的原文匹配过滤规则时,该文本区域会被完全跳过(不翻译、不擦除、不渲染,保持原样)。


可视化编辑

翻译完成后,如果想修改翻译结果:

打开编辑器

  1. 确保翻译时勾选了"图片可编辑"选项
  2. 翻译完成后,在主界面点击"打开编辑器"
  3. 选择要编辑的图片(必须有对应的 _translations.json 文件)

编辑操作

编辑器提供丰富的编辑功能:

  • 区域编辑

    • 移动:拖拽文本框
    • 旋转:使用旋转手柄
    • 变形:拉伸文本框角点
  • 文本编辑

    • 双击文本框修改译文
    • 右侧属性面板调整字体、大小、颜色
    • 切换横排/竖排
  • 蒙版编辑

    • 使用画笔工具手动绘制擦除区域
    • 使用橡皮擦修正错误
  • 常用快捷键

    • 工具切换
      • Q:选择工具
      • W:画笔工具
      • E:橡皮擦工具
    • 文件操作
      • Ctrl+Q:导出图片
      • Ctrl+W:保存 JSON
      • Ctrl+E:编辑原图
    • 图片导航
      • A:上一张图片
      • D:下一张图片
    • 历史记录
      • Ctrl+Z:撤销
      • Ctrl+Y:重做
    • 鼠标滚轮快捷键
      • Ctrl + 滚轮:等比例缩放选中文本框(包括框的大小和字体)
      • Shift + 滚轮:调整蒙版画笔大小
      • 滚轮:缩放视图

💡 提示:A/D/Q/W/E 等单键快捷键具有智能上下文识别功能。当你在输入框中输入文字时,这些键会正常输入字符;只有在非输入状态下才会触发快捷键功能。

详细编辑功能功能特性


常见问题

Q1:翻译速度很慢怎么办?

可能原因和解决方法

  1. 使用 CPU 翻译

    • CPU 版本比 GPU 版本慢 5-10 倍
    • 建议使用 GPU 版本(需要 NVIDIA 显卡)
  2. 图片分辨率过高

    • 在"高级设置"中降低"检测大小"(默认 2048)
    • 降低"修复大小"

Q2:翻译结果不准确怎么办?

解决方法

  1. 更换翻译器

    • 尝试使用高质量翻译器(OpenAI HQ、Gemini HQ)
  2. 使用手动翻译

    • 选择"导出原文"流程
    • 手动翻译原文
    • 使用"导入翻译并渲染"重新渲染
  3. 使用编辑器

    • 勾选"图片可编辑"
    • 翻译完成后打开编辑器
    • 手动修改译文

Q3:检测不到所有文字怎么办?

解决方法

  1. 开启详细日志

    • 在"基础设置"中勾选"详细日志"
    • 查看 result/ 目录中的调试文件
  2. 调整检测参数

    • 在"高级设置"中降低"文本阈值"(默认 0.5)
    • 降低"边界框生成阈值"(默认 0.5)
    • 增大"Unclip 比例"(默认 2.5)
  3. 使用编辑器手动添加

    • 在编辑器中点击"编辑形状"
    • 手动框选漏检的文字区域

详细调试方法调试指南

Q4:GPU 版本崩溃怎么办?

解决方法

  1. 检查显卡兼容性

    • 确认显卡支持 CUDA 12.x
    • 建议 GTX 1060 及以上
  2. 更新驱动

  3. 改用 CPU 版本

    • 取消勾选"使用 GPU"
    • 或下载 CPU 版本的程序

Q5:如何批量翻译整个文件夹?

操作方法

  1. 点击"添加文件夹"按钮
  2. 选择包含图片的文件夹
  3. 程序会自动扫描所有图片
  4. 点击"开始翻译"
  5. 等待所有图片翻译完成

💡 提示:可以在"基础设置"中设置"批量大小"来控制同时处理的图片数量


下一步

了解更多功能:

返回 主页