需要把一批 Word 文档整理成纯文本,又不想逐个复制粘贴,可以使用睿君 Word 批量转 TXT 工具。它可批量读取 DOCX;旧版 DOC 可通过本机 Microsoft Word 转换后处理。除正文段落外,还会提取表格中的文字,并可把文档内嵌图片单独保存。工具另带图片 OCR 页面,可将常见图片批量识别为同名 TXT。
可以先免费试用:不限使用天数,可成功导出 30 个成品;额度用完后激活继续使用。
先了解输出结果:TXT 保存文字,不保留 Word 的字体、颜色、分页和排版;文档图片会按选项输出到独立文件夹,不会嵌入 TXT。
这款工具能处理什么
- 添加单个或多个 Word 文件,也可以添加文件夹批量处理。
- DOCX 可直接读取;DOC 需要电脑安装 Microsoft Word。
- 提取正文段落,并把表格单元格文字以制表符分隔写入 TXT。
- TXT 使用 UTF-8 编码,方便搜索、归档和后续文本处理。
- 可选提取文档内嵌图片,保存到同名
_images文件夹。 - 可自动选择输出位置,也可以手动指定其他输出目录。
- 提供进度、处理日志、停止任务和打开输出目录等操作。
Word 批量转 TXT 的步骤
- 在“WORD转TXT”页面添加文件或文件夹。
- 选择自动输出或手动指定输出目录。
- 根据需要勾选“提取文档中的图片”。
- 点击开始转换,并在日志中查看每个文件的结果。
- 完成后打开输出目录,抽查 TXT、表格文字和图片文件夹。
图片文字 OCR 怎么使用
软件内的“图片文字提取”是独立功能,可批量添加 JPG、JPEG、PNG、BMP、TIFF 和 WebP 图片。默认识别语言为简体中文加英文,识别结果按图片文件名保存为 TXT。
- 首次使用 OCR 时,先安装或解压 Tesseract OCR 环境。
- 添加图片或图片文件夹,确认识别语言和单张图片超时时间。
- 选择输出目录;未手动设置时,默认使用“提取的文本”文件夹。
- 开始识别,完成后检查文字内容。图片清晰度、字体和排版会影响识别准确率。
支持范围与必要条件
| 功能 | 支持范围 | 说明 |
|---|---|---|
| DOCX 转 TXT | 直接支持 | 提取段落和表格文字 |
| DOC 转 TXT | 需要 Microsoft Word | 先在后台转换为 DOCX 再提取 |
| 文档图片提取 | 可选 | 输出到独立的同名图片文件夹 |
| 图片 OCR | 常见图片格式 | 需要 Tesseract OCR 环境 |
软件界面与演示
常见问题
转换后能保留 Word 排版吗?
不能。TXT 是纯文本格式,主要保留文字内容,不保留字体、颜色、分页、图片位置等 Word 排版。
为什么 DOCX 可以处理,DOC 却提示需要 Word?
DOC 是旧版二进制格式。软件需要调用本机 Microsoft Word 将其转换为 DOCX,再继续提取文字和图片。
表格中的文字会不会丢失?
最新版会读取表格单元格内容,并以制表符分隔写入 TXT;复杂合并单元格的排版不会保留。
OCR 为什么识别不准确?
OCR 结果受图片清晰度、倾斜、字体、背景和语言包影响。建议使用清晰原图,并核对识别语言设置。
软件会修改原 Word 文件吗?
不会。程序以只读方式处理输入文档,TXT 和图片写入输出位置;仍建议重要资料先保留备份。
