WORD PDF TXT 文档去重工具

当前位置:首页>文字处理>WORD PDF TXT 文档去重工具
Word、PDF、TXT文档怎么批量去重?重复文件清理工具

Word、PDF、TXT文档怎么批量去重?重复文件清理工具

文字处理 PC电脑 睿君
原创软件 演示后购买 售后协助 Windows 可用
参考价格 ¥28 起 具体套餐见商城
不确定是否适合您的需求?可以先看下方演示图片和功能说明,或联系客服描述您的文件类型和处理方式,确认可用再下单。
查看购买说明与常见问题 →
900 次浏览 上架 2024-11-23

产品详情

资料库里堆了大量重名、“副本”和内容相同的文档,逐个打开比对既慢又容易删错,可以使用睿君文档批量去重工具。它支持把 DOCX、TXT、PDF 文件或整个文件夹拖进列表,按内容、纯文本或文件名三种规则找出重复项,再用复制、移动或删除三种方式处理,并输出一份 CSV 重复清单备查。

先了解处理方式:默认的“复制”模式不改动源目录,去重后的文件复制到输出目录、重复件复制到重复收纳目录;“移动”会把源目录里的文件移走;“删除重复”是直接删除且无法恢复。首次批量处理前请先在小批量文件上试一次。

三种去重规则怎么选

规则判定依据适合场景
按内容去重(推荐)先按文件大小分桶,再比对文件内容 MD5绝大多数情况,速度最快,只有完全相同的文件才算重复
仅按文本内容去重抽取文档文字并规范化(统一换行、去行尾空格和首尾空行)后比对同一篇内容被另存成不同格式或改过排版,希望忽略格式差异
按名称去重识别“副本”“复制”“copy”“(2)”“(2)”等后缀,归为同一基准文件多次下载或多次另存产生的同名变体,只在同一个文件夹内比对

三种处理方式

  • 复制(默认):源目录完全不动,输出目录得到去重后的整洁副本,重复件复制到重复收纳目录。
  • 移动:源目录中的文件被移走,输出目录得到去重结果,重复件移入重复收纳目录,适合一次性整理归档。
  • 删除重复:直接删除重复文件,不进回收站、无法恢复。选择该模式后软件会自动隐藏“重复收纳目录”设置。

批量去重的步骤

  1. 把文件或文件夹拖入“文件列表/拖入区”,也可以用“选择文件”“选择文件夹”按钮添加,支持多选和多个来源目录。
  2. 确认参与处理的扩展名,默认是 .txt;.docx;.pdf,可以自行增删。
  3. 确认输出目录与重复收纳目录,软件会自动派生,也可以手动指定。
  4. 选择去重规则与处理方式。
  5. 点击“开始去重”,在日志区查看扫描数量、重复组数和耗时,需要时可随时停止。
  6. 完成后打开输出目录抽查结果,并核对 CSV 重复清单。

输出结果与重复清单

  • 输出目录按原有层级镜像源目录结构,不会把文件摊平到一层。
  • 添加了多个来源目录时,会为每个来源生成别名分桶存放,避免不同目录的同名文件互相覆盖。
  • 目标位置已存在同名文件时,自动追加 (1)、(2) 等后缀,不覆盖已有结果。
  • 自动生成 duplicate_report.csv 重复清单,三列分别是内容哈希、保留下来的文件、被判定为重复的原始路径,用 Excel 可直接打开核对。
  • 为防止边处理边扫描造成混乱,输出目录和重复收纳目录不允许设置在来源目录内部,软件会给出提示。

支持范围与必要条件

  • 运行环境:Windows 桌面端,全程本地处理,不上传文件。
  • 默认处理 DOCX、TXT、PDF;扩展名可在界面上修改。
  • TXT 兼容 UTF-8、GBK 等常见编码;DOCX 会读取正文段落和表格文字;PDF 优先用 pdfminer 提取文本层,失败时用 PyPDF2 兜底。
  • 旧版 DOC、WPS 专有格式不在默认支持范围内,建议先另存为 DOCX。
  • 没有文字层的扫描件 PDF 在“仅按文本内容”规则下会被单独成组,不会被误判成互相重复。
当前线上交付版:工具化 UI 版,已内置 python-docx、pdfminer、PyPDF2 和拖拽组件,下载解压即可运行,不需要另外安装 Python 或任何第三方库。三种去重规则、三种处理方式和 CSV 重复清单均已包含。

查看价格与授权 下载软件

软件界面与演示

睿君文档批量去重工具界面:文件列表、去重规则、处理方式与日志区
拖入文件后选择去重规则与处理方式,日志区实时显示扫描与重复情况。

常见问题

文档批量去重会不会动到我的原始文件?

默认的“复制”模式不会,源目录保持原样。“移动”模式会把源目录里的文件移走,“删除重复”模式会直接删除重复文件且无法恢复。重要资料请先备份,并用小批量文件试跑一次。

按内容、按文本、按文件名三种去重规则应该选哪个?

日常整理选“按内容去重”,先按文件大小分桶再比对内容 MD5,只有完全相同的文件才会被判定为重复,最安全也最快。同一篇内容被反复另存、排版有细微差异时,选“仅按文本内容”。只想清理“副本”“copy”“(2)”这类同名变体时,选“按名称去重”。

扫描件 PDF 可以批量去重吗?

可以用“按内容去重”,文件二进制完全一致才算重复。若选“仅按文本内容”,没有文字层的扫描件会被单独成组,不会因为都提取不到文字就被误判为互相重复。软件本身不做 OCR 识别。

怎么知道到底删掉或移走了哪些文件?

每次处理都会生成 duplicate_report.csv 重复清单,记录内容哈希、保留下来的文件和被判为重复的原始路径。文件采用带 BOM 的 UTF-8 编码,用 Excel 打开不会乱码。

需要安装 Python 或 Office 吗?

都不需要。下载包已内置 python-docx、pdfminer、PyPDF2 和拖拽组件,解压后直接运行即可,全程离线处理,不上传文件。

需要使用帮助或定制开发,请联系睿君科技

上一篇:没有了!

下一篇:没有了!

发表评论:

评论记录:

未查询到任何数据!

添加QQ

86998867
微信同号

添加QQ

微信扫一扫

睿君科技微信二维码

微信联系
返回顶部