Word 文档里的图片,右键另存一张一张来,几十份文档就是几百次点击;而且另存出来的图往往被 Word 压缩过,清晰度不如原图。睿君DOCX提取图片与识别工具做两件事:把 DOCX 里嵌入的所有媒体文件原封不动批量导出,以及把图片上的文字 OCR 识别成 TXT。两个功能各占一个选项卡,可以分开用,也可以先提取再识别。
支持的输入与输出
| 功能 | 输入 | 输出 |
|---|---|---|
| Word非文字提取 | .docx 文件(可多选,也可整个文件夹) | 文档内嵌的原始媒体文件,按文档分别存进 MEDIA_文档名 文件夹 |
| 图片文字提取 | jpg、jpeg、png、bmp、tiff(可多选,也可整个文件夹) | 与图片同名的 .txt 文本文件 |
Word非文字提取:导出的是原始文件,不是截图
- 直接读取 .docx 的内部结构,把
word/media里的文件按原格式、原文件名、原分辨率写出来,不经过任何转码或压缩,所以不会有「另存后变糊」的问题。 - 掏出来的不止是图片——文档里嵌的 视频、音频、EMF/WMF 矢量图同样会被导出,所以这个功能叫「非文字内容提取」而不是「图片提取」。
- 输出目录留空时,每个文档在自己所在目录下生成 MEDIA_文档名 文件夹;也可以统一指定一个输出目录,多个文档各自建子文件夹,不会互相覆盖。
- 支持把文件或整个文件夹直接拖进列表,文件夹会自动递归找出所有 .docx。
- 处理中有进度条和逐条日志(提取了哪个文件、存到哪里),可随时点「停止」中断。
- 遇到损坏或伪装成 .docx 的文件会在日志里明确报出来,不中断整批处理。
图片文字提取:中英文混合识别,批量出 TXT
- 识别引擎按简体中文 + 英文混合模式工作,中英夹杂的截图、扫描件、资料图都能直接跑。
- 支持批量:一次添加多张图片或整个文件夹,逐张识别、逐张出 TXT。
- 输出目录留空时,结果存到各图片同级的「图片文字提取结果」文件夹;也可以指定统一输出目录。
- 同样有进度条、日志和停止按钮。
使用步骤
- 打开软件,按需要切换到「Word非文字提取」或「图片文字提取」选项卡。
- 点「添加文件」「添加文件夹」,或直接把文件、文件夹拖进列表。
- 需要统一归档就设置输出目录;留空则按上面说的默认规则输出到源文件旁边。
- 点「开始提取」,看进度条和日志。中途要停就点「停止」。
- 处理完成后到输出目录查看结果。
限制与注意
- 只支持 .docx,不支持老式 .doc。.doc 是二进制格式,请先用 Word 另存为 .docx 再处理。
- 提取的是文档里嵌入的媒体。以「链接到文件」方式插入的图片本身不在文档内,提取不出来。
- OCR 输出的是纯文本,不还原排版,不生成表格结构,也不做手写体识别。
- 识别准确率取决于图片清晰度:扫描件、清晰截图效果好;模糊、倾斜、艺术字、复杂背景上的文字会明显下降。
- 本工具不处理 PDF。需要 PDF 与 Word、TXT、Markdown 互转或扫描件 OCR,请用睿君PDF WORD TXT 文档格式互转工具。
- Windows 10/11 桌面软件,本机离线运行,不上传任何文件。
软件界面与演示

常见问题
提取出来的图片会不会比原图糊?
不会。工具是把文档内部存的原始文件直接写出来,不做任何转码和压缩,格式、文件名、分辨率都和当初插入文档时一致。这一点和在 Word 里右键另存不同,后者可能拿到的是被压缩过的版本。
老的 .doc 文件能处理吗?
不能。只支持 .docx。.doc 是旧的二进制格式,内部结构不同,请先用 Word 打开另存为 .docx,再放进工具处理。
图片文字识别为什么提示不可用?
识别功能依赖 Tesseract OCR 引擎,需要单独安装环境包。请下载 Tesseract-OCR 环境包,解压后以管理员身份运行其中的「添加环境变量」,然后重新打开软件。「Word非文字提取」不需要这一步。
几十上百个文档的图片,怎么归档才不乱?
把整个文件夹拖进列表,再指定一个统一的输出目录。工具会为每个文档单独建一个 MEDIA_文档名 的文件夹存放它自己的媒体文件,同名图片不会互相覆盖,事后按文档名就能找回来源。
识别结果能保留原来的排版和表格吗?
不能。输出是纯文本 TXT,只有文字内容,不还原字号、分栏、表格结构,也不识别手写体。需要的是可编辑的文档而不是纯文本时,请考虑睿君PDF WORD TXT 文档格式互转工具。
