Loading... # 文译 EPUB 小说翻译工具发布 # 一、新闻概述 ## 1. 标题 文译:专注多语言小说翻译的AI工具发布 ## 2. 发布时间 2024 年(项目持续更新中) ## 3. 来源 GitHub 开源项目 # 二、核心内容 ## 1. 事件摘要 ### A. 主要内容 开发者 BigDawnGhost 发布了名为"文译"的开源项目,专注于将多语言 EPUB、FB2 或 TXT 格式的小说翻译成中文,并尽量保留原书的排版、图片、目录和跳转功能。 ### B. 核心亮点 - 单命令完成全流程翻译工作 - 支持 EPUB、FB2、TXT 多种输入格式 - 保留原书排版、图片、目录和锚点 - 智能术语库保证翻译一致性 - 支持断点续传,中断后可继续翻译 - 提供润色、审校、一致性检查等多重质量保障 ## 2. 关键信息 ### A. 支持格式 EPUB、FB2、TXT ### B. 默认输出格式 中文 EPUB,可选 TXT 纯文本格式 ### C. 核心功能 预扫分析、翻译、润色、章末审校、标点规范化、EPUB 导出 ## 3. 背景介绍 ### A. 项目定位 针对长文本书籍的译介工具,旨在将被语言阻隔的作品带到读者的语言中。 ### B. 技术基础 基于 Python 开发,使用 DeepSeek 等 LLM 模型进行翻译,采用 uv 作为包管理工具。 # 三、详细报道 ## 1. 主要内容 ### A. 核心功能 - **一键翻译**:通过单个 `translate` 命令完成全部翻译流程 - **格式保留**:EPUB 输入会按原 XHTML 模板回填译文,保留原书样式 - **智能术语库**:人名、地名、专有名词和敬称自动进入 SQLite 术语库 - **断点续传**:长书中断后可续跑,已完成批次会自动跳过 - **质量保障**:章末审校、一致性检查、回译抽检等多重机制 ### B. 技术特性 - **多模型档位**:支持 strong、cheap、fast 三档模型配置 - **全书理解**:翻译前预扫描整本书,生成概览和章节梗概 - **滚动上下文**:章内批次串行处理,后一批次能看到前文译文 - **段数对齐**:要求模型输出与输入段数一致的 JSON ### C. 配置灵活性 主要配置项包括: - `language.source`:源语言设置(auto 或指定语言代码) - `llm.tiers`:三档模型配置 - `pipeline.polish`:是否启用润色 - `pipeline.review`:章末审校 - `pipeline.consistency_qa`:全书一致性检查 ## 2. 技术细节 ### A. 工作流程图 ```mermaid graph TD A[读取输入文件] --> B[解析章节和段落] B --> C[识别源语言] C --> D[预扫全书生成概览] D --> E[分析样章建立术语表] E --> F[按章按批翻译] F --> G{是否润色?} G -->|是| H[中文润色] G -->|否| I[标点规范化] H --> I I --> J[章末审校] J --> K{严重问题?} K -->|是| L[自动重译] K -->|否| M[一致性QA] L --> M M --> N[回填导出EPUB/TXT] ``` ### B. 系统架构 文译系统包含以下核心组件:输入解析、LLM 翻译引擎、术语库管理、智能代理、翻译流水线、后处理和 EPUB/TXT 组装。 ### C. 一致性保障机制 - **术语库**:SQLite 存储人名、地名、专有名词和敬称 - **全书理解**:预扫描源文生成概览,让早期章节参考全书走向 - **滚动上下文**:后一批次能看到前面最近几段译文 - **段数对齐**:输入 N 段要求输出 N 段 JSON,不符则重试 - **章末 review**:检查漏译、误译、术语、人称等问题 - **标点规范化**:统一为简体中文大陆常用全角标点 ## 3. 使用示例 ### A. 快速开始 ```bash # 安装依赖 uv sync # 设置 API Key export DEEPSEEK_API_KEY=sk-... # 翻译 EPUB uv run trans-novel translate book.epub ``` ### B. 常用命令 ```bash # 继续中断的翻译 uv run trans-novel resume book.epub # 查看翻译进度 uv run trans-novel status book.epub # 仅重新导出 EPUB uv run trans-novel tools assemble book.epub # 查看术语库 uv run trans-novel tools glossary book.epub list # 一致性检查 uv run trans-novel tools qa book.epub ``` ### C. 参数控制 ```bash # 启用润色 uv run trans-novel translate book.epub --polish # 禁用润色 uv run trans-novel translate book.epub --no-polish # 启用章末审校 uv run trans-novel translate book.epub --qa # 指定章节翻译 uv run trans-novel translate book.epub --chapter 3 # 输出 TXT 格式 uv run trans-novel translate book.epub --format txt ``` # 四、影响分析 ## 1. 行业影响 ### A. 技术趋势 - AI 翻译技术在文学领域的应用实践 - 开源工具降低了文学翻译门槛 - 展示了长文本 AI 翻译的可行方案 ### B. 生态影响 - 为跨语言阅读提供了技术支撑 - 促进了多语言文学作品的传播 - 为类似项目提供了参考实现 ## 2. 用户影响 ### A. 潜在用户 - 需要阅读外文小说的中文读者 - 需要批量处理文学作品的翻译工作者 - 对 AI 翻译技术感兴趣的开发者 ### B. 使用成本 - 需要配置 DeepSeek API Key(或其他 LLM API) - 润色功能会增加 API 调用成本 - 长篇小说翻译可能产生较多 API 费用 ### C. 技术门槛 - 需要基本的命令行操作能力 - Python 环境和 uv 包管理工具 - 需要理解配置文件的结构 ## 3. 技术价值 ### A. 创新点 - 全书理解机制提升了早期章节的翻译质量 - 术语库和滚动上下文保证了翻译一致性 - 断点续传功能提高了长文本翻译的可靠性 ### B. 局限性 - 翻译质量依赖 LLM 模型能力 - 口头禅等非正式文本可能翻译不一致 - 专有名词翻译仍需人工校对 # 五、相关技术 ## 1. 技术栈 - **语言**:Python - **包管理**:uv - **LLM 接口**:OpenAI SDK(兼容 DeepSeek) - **数据存储**:SQLite(术语库) - **输入格式**:EPUB、FB2、TXT - **输出格式**:EPUB、TXT ## 2. 模型配置 - **strong**:翻译、润色、全局分析、标题翻译 - **cheap**:章末 review、一致性 QA、回译比对 - **fast**:全书预扫、章节梗概、术语抽取、回译 ## 3. 项目结构 ``` trans_novel/ ingest/ 输入解析、EPUB/FB2/TXT 切分 llm/ LLM 抽象接口、DeepSeek provider、FakeClient glossary/ SQLite 术语库、抽取、冲突处理 agents/ 分析、翻译、审校、润色、一致性、提示词 pipeline/ 编排器、断点状态、滚动上下文、校验 postprocess/ 标点规范化 assemble/ EPUB/TXT 回填导出、QA 报告 tests/ 离线测试 ``` # 六、项目愿景 ## 1. 作者初衷 将被语言阻隔的作品,带到读者的语言中。针对长文本书籍的译介做出一份微薄的努力。 ## 2. 改进方向 - 在翻译够准确的前提下让文本更加顺畅 - 从可读向好读迈进 - 改进口头禅翻译不一致问题 - 提升专有名词翻译准确性 ## 3. 社区参与 - 欢迎提交 bug 修复 - 接受格式兼容改进 - 期待测试样例贡献 - 欢迎文档改进 # 七、相关链接 ## 1. 项目地址 - GitHub 仓库:https://github.com/BigDawnGhost/wenyi ## 2. 技术文档 - 项目 README:包含完整的使用说明和配置指南 - CONTRIBUTING.md:开发贡献指南 *** ## 参考资料 1. [GitHub - BigDawnGhost/wenyi](https://github.com/BigDawnGhost/wenyi) 最后修改:2026 年 07 月 21 日 © 允许规范转载 赞 如果觉得我的文章对你有用,请随意赞赏