
新增熊猫搜书
熊猫搜书,海量电子书资源聚合搜索,一站式免费下载。
nmod电子书是一套面向电子书文件的解析与内容提取工具。处理对象以 EPUB、MOBI、AZW3、PDF 为主,输出结构化的文本、章节树和元数据。本地运行,不依赖云端接口。
有一点需要注意:加密格式的电子书需要先去除 DRM 才能被完整解析,否则只能读取目录层。
运行环境为 Windows 10 及以上、macOS 12 及以上,或主流 Linux 发行版。内存建议 4GB 起步,处理扫描版 PDF 时建议 8GB。
输入文件需可读,损坏文件会被跳过并记录日志。输出目录需要写权限。命令行版本依赖 Python 3.9 以上。
版面分析准确率高。对双栏排版、图文混排的 PDF,文字顺序错乱比例控制在较低水平,段落切分按缩进与行距判断。
输出保留原始结构。章节、脚注、引用块分开存放,后续做二次加工时不用重新切分。这里有个细节,脚注默认单独成文件,不混入正文。
导入文件后选择输出格式,点开始。等待进度条走完,到输出目录取结果。
需要调整章节层级时,在解析设置里改深度阈值。批量处理直接拖文件夹进去。命令行用户用 extract 子命令加文件路径即可。
| 对比维度 | nmod电子书 | Calibre | Pandoc |
|---|---|---|---|
| 功能范围 | 解析、抽取、目录重建、图片公式分离 | 以格式转换和书库管理为主 | 以文档格式互转为主 |
| 数据处理 | 单文件上限 500MB,支持批量队列 | 转换无明确上限,批量靠插件 | 单文件处理,无队列机制 |
| 章节还原 | 支持 4 级嵌套,缺失目录可重建 | 依赖源文件目录,重建弱 | 按标题层级推断,不重建 |
| 输出形式 | 文本、HTML、JSON、PNG、SVG | 主要输出电子书格式 | 主要输出文档格式 |
| 公式处理 | 单独提取为 SVG | 不单独处理 | 依赖 LaTeX 源 |
| 运行方式 | 本地,命令行加图形界面 | 本地,图形界面为主 | 本地,纯命令行 |
做电子书内容二次加工时,先用它把正文和结构拆出来。做语料整理,批量抽文本导出 JSON。扫描版资料需要提取图表,走图片分离功能。
学术资料整理场景下,脚注和引用单独成文件,方便后续引用核对。实际使用时会有差异,取决于源文件本身的质量。