图片很多,怎么批量识别文字并分别保存成 TXT?这款 Windows 工具调用本机 Tesseract OCR,可一次加入多张图片或整个文件夹,在电脑本地识别简体中文和英文,并为每张图片单独生成一个 UTF-8 TXT 文件。
先判断是否适合:
适合批量整理截图、扫描图片、课程素材和内部资料;如果需要直接识别 PDF、还原表格到 Excel、保留原版式、识别公式或保证手写体准确率,本工具不适合。
它能完成什么任务
- 批量加入:可多选图片,也可加入整个文件夹。
- 递归扫描:可选择是否包含子文件夹中的图片。
- 拖入操作:支持把图片或文件夹拖入列表,也可拖入输出目录。
- 常见格式:支持 JPG、JPEG、PNG、BMP、TIF、TIFF、WebP。
- 中英识别:当前交付版固定使用简体中文和英文识别模型。
- 多页 TIFF:会逐帧识别,并把文字写入同一个结果 TXT。
- 避免覆盖:结果重名时自动生成“文件名_1.txt”“文件名_2.txt”。
- 可停止:点击停止后,工具会等当前图片处理完成再安全退出任务。
识别结果保存在哪里
软件提供两种输出方式:
- 输出目录留空:在每张源图片所在目录下建立“图片文字提取结果”文件夹,各自保存对应 TXT。
- 指定统一目录:所有识别结果集中保存到所选文件夹。
注意:处理完成后软件会弹出完成提示,但不会自动打开结果文件夹;需要点击界面中的“打开目录”查看。
使用步骤
- 首次使用先下载并配置 Tesseract OCR 环境。
- 选择多张图片、选择文件夹,或者直接把文件拖入列表。
- 按需要决定是否包含子文件夹,并选择统一输出目录;留空则按源路径保存。
- 点击“开始”,在日志中查看每张图片的成功或失败结果。
- 处理完成后点击“打开目录”,检查生成的 UTF-8 TXT。
购买前需要知道的限制
- 只直接读取图片,不直接处理 PDF、Word 或压缩包。
- 每张图片输出一个 TXT,不会自动合并成一个总文件。
- 输出是纯文本,不保留图片中的字体、坐标、表格和原始排版。
- 当前界面没有语言切换项,默认识别简体中文和英文。
- 倾斜、模糊、低分辨率、艺术字和手写内容可能影响准确率,建议先用清晰正向图片测试。
- 拖入功能依赖随软件打包的组件;若组件异常,仍可使用“选择图片”和“选择文件夹”。
查看价格、授权和购买说明 下载当前软件包 下载 OCR 环境包
常见问题
图片会上传到网络吗?
不会。当前交付版调用电脑本机的 Tesseract OCR 识别,不需要把图片上传到第三方识别接口。
能批量识别整个文件夹吗?
可以,并可选择是否继续扫描子文件夹。结果可以集中保存,也可以按每张图片的源目录分别保存。
能直接把扫描 PDF 转成文字吗?
不能直接导入 PDF。本工具只处理图片;PDF 需要先转成图片,或者选择支持扫描 PDF 的其他工具。
为什么有些图片识别不准确?
OCR 会受到清晰度、倾斜角度、字体、背景和排版影响。建议先用真实素材试用,复杂表格、艺术字和手写内容不建议直接购买本工具处理。
