资料库里堆了大量重名、“副本”和内容相同的文档,逐个打开比对既慢又容易删错,可以使用睿君文档批量去重工具。它支持把 DOCX、TXT、PDF 文件或整个文件夹拖进列表,按内容、纯文本或文件名三种规则找出重复项,再用复制、移动或删除三种方式处理,并输出一份 CSV 重复清单备查。
三种去重规则怎么选
| 规则 | 判定依据 | 适合场景 |
|---|---|---|
| 按内容去重(推荐) | 先按文件大小分桶,再比对文件内容 MD5 | 绝大多数情况,速度最快,只有完全相同的文件才算重复 |
| 仅按文本内容去重 | 抽取文档文字并规范化(统一换行、去行尾空格和首尾空行)后比对 | 同一篇内容被另存成不同格式或改过排版,希望忽略格式差异 |
| 按名称去重 | 识别“副本”“复制”“copy”“(2)”“(2)”等后缀,归为同一基准文件 | 多次下载或多次另存产生的同名变体,只在同一个文件夹内比对 |
三种处理方式
- 复制(默认):源目录完全不动,输出目录得到去重后的整洁副本,重复件复制到重复收纳目录。
- 移动:源目录中的文件被移走,输出目录得到去重结果,重复件移入重复收纳目录,适合一次性整理归档。
- 删除重复:直接删除重复文件,不进回收站、无法恢复。选择该模式后软件会自动隐藏“重复收纳目录”设置。
批量去重的步骤
- 把文件或文件夹拖入“文件列表/拖入区”,也可以用“选择文件”“选择文件夹”按钮添加,支持多选和多个来源目录。
- 确认参与处理的扩展名,默认是
.txt;.docx;.pdf,可以自行增删。 - 确认输出目录与重复收纳目录,软件会自动派生,也可以手动指定。
- 选择去重规则与处理方式。
- 点击“开始去重”,在日志区查看扫描数量、重复组数和耗时,需要时可随时停止。
- 完成后打开输出目录抽查结果,并核对 CSV 重复清单。
输出结果与重复清单
- 输出目录按原有层级镜像源目录结构,不会把文件摊平到一层。
- 添加了多个来源目录时,会为每个来源生成别名分桶存放,避免不同目录的同名文件互相覆盖。
- 目标位置已存在同名文件时,自动追加
(1)、(2)等后缀,不覆盖已有结果。 - 自动生成
duplicate_report.csv重复清单,三列分别是内容哈希、保留下来的文件、被判定为重复的原始路径,用 Excel 可直接打开核对。 - 为防止边处理边扫描造成混乱,输出目录和重复收纳目录不允许设置在来源目录内部,软件会给出提示。
支持范围与必要条件
- 运行环境:Windows 桌面端,全程本地处理,不上传文件。
- 默认处理 DOCX、TXT、PDF;扩展名可在界面上修改。
- TXT 兼容 UTF-8、GBK 等常见编码;DOCX 会读取正文段落和表格文字;PDF 优先用 pdfminer 提取文本层,失败时用 PyPDF2 兜底。
- 旧版 DOC、WPS 专有格式不在默认支持范围内,建议先另存为 DOCX。
- 没有文字层的扫描件 PDF 在“仅按文本内容”规则下会被单独成组,不会被误判成互相重复。
软件界面与演示
常见问题
文档批量去重会不会动到我的原始文件?
默认的“复制”模式不会,源目录保持原样。“移动”模式会把源目录里的文件移走,“删除重复”模式会直接删除重复文件且无法恢复。重要资料请先备份,并用小批量文件试跑一次。
按内容、按文本、按文件名三种去重规则应该选哪个?
日常整理选“按内容去重”,先按文件大小分桶再比对内容 MD5,只有完全相同的文件才会被判定为重复,最安全也最快。同一篇内容被反复另存、排版有细微差异时,选“仅按文本内容”。只想清理“副本”“copy”“(2)”这类同名变体时,选“按名称去重”。
扫描件 PDF 可以批量去重吗?
可以用“按内容去重”,文件二进制完全一致才算重复。若选“仅按文本内容”,没有文字层的扫描件会被单独成组,不会因为都提取不到文字就被误判为互相重复。软件本身不做 OCR 识别。
怎么知道到底删掉或移走了哪些文件?
每次处理都会生成 duplicate_report.csv 重复清单,记录内容哈希、保留下来的文件和被判为重复的原始路径。文件采用带 BOM 的 UTF-8 编码,用 Excel 打开不会乱码。
需要安装 Python 或 Office 吗?
都不需要。下载包已内置 python-docx、pdfminer、PyPDF2 和拖拽组件,解压后直接运行即可,全程离线处理,不上传文件。
