EPUB 怎么转 TXT 或 HTML?章节顺序、图片、DRM 与导出说明
EPUB 不是按文件名排列的 HTML 压缩包。本文说明 container.xml、OPF、manifest、spine 阅读顺序,以及 TXT、HTML、JSON 导出的边界。
打开配套工具 →EPUB 表面上是一个可以解压的 ZIP 文件,里面也确实常见 XHTML、CSS 和图片,但“把所有 HTML 按文件名拼起来”并不是可靠的转换方法。电子书可能把封面、目录、正文、脚注和版权页分散在不同目录,文件名也未必按阅读顺序编号。
EPUB 转 TXT / HTML 工具会先读取 EPUB 的标准结构,再按出版物声明的顺序提取章节。文件在浏览器本地解析,不需要上传书籍。
EPUB 的阅读顺序存在哪里
标准 EPUB 根目录下有 META-INF/container.xml,它指向 package document,通常是一个 .opf 文件。OPF 的 manifest 列出出版物资源,spine 则给出默认阅读顺序。
这条关系可以简化为:
META-INF/container.xml
→ package.opf
→ manifest:有哪些 XHTML、图片、CSS
→ spine:正文按什么顺序阅读因此 chapter10.xhtml 出现在 chapter2.xhtml 前面,不一定是错误;目录页也可能被列入 spine。可靠的提取器应该尊重 spine,而不是依赖 ZIP 内部顺序或文件名排序。
章节标题是怎样得到的
EPUB 的 OPF 保存整本书的标题、作者、语言、出版社和标识符。每个章节的标题则通常来自正文中的 h1、h2,其次是 HTML 的 title。如果这些都没有,只能从文件名推断一个可读名称。
有些电子书会把导航目录也放在阅读顺序里,或者章节正文已经有标题,导出时又在章节之间加标题,于是看起来像“重复”。工具不会擅自删除可能有意义的内容。预览后可以取消勾选目录、版权页、广告页或空章节,再下载结果。
TXT 和独立 HTML 保留什么
TXT 只保留文字,适合全文搜索、阅读、校对和语料整理。标题、段落、列表会尽量转换为可读的换行,但字体、颜色、图片、脚注跳转和页面布局不会存在。
独立 HTML 会保留常见的标题、段落、列表、表格、引用和强调标签,并加入基础阅读样式。为了避免把电子书中的脚本或外部资源带进新文件,导出过程会移除脚本、表单、iframe、内嵌媒体、原 CSS 和危险属性。图片只可能保留替代文字,不会嵌入原图。
JSON 更适合程序处理,它会保存书籍元数据以及每章的标题、原路径、正文和字符统计。逐章 TXT ZIP 则适合分工校对、逐章翻译或导入其他写作软件。
漫画、图册和固定版式不适合转纯文字
小说和常规重排版电子书通常以 XHTML 文字为主,提取效果较稳定。漫画、绘本、摄影集和固定版式 EPUB 可能主要由图片、SVG 或绝对定位元素组成。页面肉眼内容丰富,纯文字结果却可能很少甚至为空。
这不是转换器遗漏了一个开关,而是 TXT 无法表达图像和版面关系。固定版式书籍更适合保留 EPUB,或在有权处理的前提下使用支持版面渲染的桌面软件导出 PDF。
数学公式、Ruby 注音、复杂脚注、音视频和互动脚本也可能被简化。导出的文字可以用于搜索和参考,但不应替代原书做精确排版出版。
DRM 和 encryption.xml 应怎样理解
EPUB 可以包含 META-INF/encryption.xml。它有时只用于字体混淆,并不意味着正文被 DRM 加密;也可能指向真正加密的内容文件。工具会检查加密引用:如果正文 XHTML 被加密,会停止处理,不尝试解密或绕过 DRM。
只对字体做混淆时,纯文字通常仍能读取,但原字体不会进入 TXT 或独立 HTML。无论文件技术上能否打开,都应该只转换自己购买后被许可处理、自己制作或已经获得授权的电子书。
为什么某些 EPUB 会报结构错误
完整 EPUB 至少需要能找到 container.xml、OPF 和可读取的正文条目。网络下载中断、错误改后缀、重新压缩时丢失目录,都会造成“看起来是 EPUB,实际结构不完整”。
部分老旧电子书使用不规范路径、大小写不一致或损坏的 XML。工具会兼容常见路径情况,但不会对缺失的正文凭空猜测。遇到错误时,可以先用 Calibre 或其他可信桌面阅读器打开;若阅读器也失败,应重新获取完整源文件。
一套稳妥的导出流程
上传后先核对书名、作者和章节数量。浏览开头、中间和结尾几章,检查顺序、标题、中文标点和段落。搜索一个在原书中明确出现的词,确认命中章节。取消不需要的目录、版权页和空章节,再下载 TXT 或 HTML。
导出后保留原 EPUB,用原阅读器对照几个段落。若只是需要清理多余空行,可继续使用 文本清理工具;如果想把 HTML 整理成 Markdown,可使用 HTML / Markdown 转换工具。
总结
EPUB 转 TXT 的关键是按出版物结构读取,而不是把 ZIP 里的网页随便拼接。container.xml 找到 OPF,manifest 确认资源,spine 决定阅读顺序;TXT、HTML、JSON 和逐章 ZIP 则服务于不同用途。图片型、固定版式和 DRM 电子书有明确边界,先预览和勾选章节,再导出并与原书抽查,结果才值得继续使用。