2:AI学习功能,这是我自己觉得方便记忆弄的,此功能在AI截图翻译直接按A可以自动跳过去,或者直接按ctrl+alt+x,这个是调用的本地的ollama的"gpt-oss:120b-cloud",效果如下:
一个用于截图翻译的桌面工具,使用PaddleOCR进行文字识别,并通过多种翻译引擎提供翻译服务。
- 使用PaddleOCR进行高精度文字识别,支持多语言
- 支持多种翻译引擎(Ollama、OpenAI、Google、Microsoft等)
- 截图选择区域进行OCR识别和翻译
- 结果显示窗口支持复制、调整和覆盖原文
- 覆盖原文(R):默认启用“智能覆盖”模式,会先清理原文文本再渲染译文,尽量保留背景纹理,效果更贴近“原文被直接翻译”的观感。
- 可在
config.ini的[OVERLAY]部分通过overlay_mode = inpaint|box切换;overlay_auto_text_color = True时自动选择黑/白字以保证可读性。
- 翻译历史记录保存和查看
- 系统托盘图标方便操作
- 全局热键快速截图
- 我用的Python 3.10.5
- Windows操作系统
- 克隆或下载本仓库
- 运行安装脚本安装依赖
python -m venv .venv
.venv\Scripts\activate
pip install -r .\requirements.txt
python .\main.py
- 安装完成后,运行主程序
python main.py
- 启动程序后,它会在系统托盘中显示图标
- 按下默认热键
Ctrl+Alt+D进行截图(可在配置文件中修改) - 在屏幕上选择要识别的文本区域
- 程序会自动识别文本并翻译,显示在结果窗口中
- 可以在结果窗口中复制翻译文本或原文
配置文件位于程序根目录的 config.ini,您可以修改以下设置:
[PADDLEOCR]
ocr_language = en # OCR语言,如en、ch等
ocr_use_angle_cls = True # 是否检测文字方向
ocr_dynamic_cls = True # 动态开启角度分类(直立文本更快)
ocr_cls_min_angle = 1.0 # 动态分类的最小角度阈值(度)
ocr_use_gpu = False # 是否使用GPU(支持自动检测)
ocr_auto_use_gpu = True # 自动检测CUDA并启用GPU
ocr_enable_mkldnn = True # CPU下启用MKLDNN加速
ocr_cpu_num_threads = 4 # CPU推理线程数(MKLDNN时生效)
ocr_timeout = 30 # OCR超时时间
ocr_show_log = False # 显示详细日志(默认关闭以提速)
# 识别/检测精度&速度参数
ocr_rec_batch_num = 10 # 识别批大小(更大更快,内存更高)
ocr_drop_score = 0.5 # 低分过滤阈值(提高准确率)
ocr_det_limit_side_len = 960 # 检测输入长边限制
ocr_max_input_side = 1600 # 预处理阶段输入最大边长可以在 [OCR_TRANSLATION] 部分配置翻译设置,包括源语言、目标语言和翻译引擎等。
-
Q: 安装PaddleOCR时出错怎么办? A: 请参考PaddleOCR官方文档进行安装
-
Q: 如何修改截图热键? A: 在config.ini文件的[HOTKEYS]部分修改screenshot_hotkey配置项
MIT License
- PaddleOCR - 提供OCR识别引擎
- 各翻译API提供商