"重复"涵盖了两种需要不同处理方式的情况。
完全重复
字节完全一致的文件,通常来自:
- 同一张存储卡导入了两次。
- 在现有图库上恢复了一份备份。
- 复制而不是移动了文件夹。
- 云同步冲突产生的"照片 (1).jpg"。
这些可以放心自动删除,因为留下的那份确实完全相同。检测方式是比对文件哈希——文件内容的指纹——所以匹配是确定的,而不是概率性的。
近似重复
视觉上相似但并不相同的文件:
这些需要人工复核,因为这些"重复"的差别,往往恰恰在于那个要紧的地方。检测使用感知哈希来衡量视觉相似度——本质上是关于阈值的判断,而不是确定性结论。
会让你丢失原件的陷阱
危险的情况是同一张图的不同质量版本。一个按"保留最新的"或"保留这个文件夹里的"来排序的工具,可能留下你发到网上的 800 像素压缩副本,而删掉 2400 万像素的原件。
规则是:当两个文件看起来一样时,保留最大的那个——分辨率最高、文件体积最大。把去重工具配置成优先保留它,并在批量运行任何操作之前先检查这个设置。
一套安全的去重流程
- 先备份。 没有商量余地。去重就是批量删除的另一种叫法。
- 先按哈希自动处理完全重复。这是安全的大多数。
- 然后分批复核近似重复,预览要大到真的能做判断——清晰度和表情的差别在小缩略图里根本看不出来。
- 优先"移到暂存文件夹"而不是直接删除。 留几周再清空。
- 检查"保留"的判据:最高分辨率、原始格式、最早日期,以及——很重要——你的目录数据库里挂着修图参数和评级的那一份。
- 在整理之前做,而不是之后,这样你就不会把同一张照片归档好几遍。
防止再次累积
- 从存储卡导入时开启"跳过重复",多数照片管理软件都支持。
- 重新整理时移动而不是复制。
- 在导入时就筛掉连拍。 趁你还记得当时的情形,从三十张里挑一张是最快的。
- 只维护一个图库,而不是散落在不同硬盘上的几个残缺库——分裂的图库是大规模重复的主要来源。
- 不要保存你分享出去的图片。 有原件在,你发出去的压缩副本毫无价值。
你真的需要去重吗
存储很便宜,你的注意力不便宜。如果重复没有造成真实问题——硬盘满了、搜索结果杂乱、搞不清哪个版本是最新的——那这份功夫可能不值得。有理由时才去重,去重前先备份,并且宁可多留一些,也不要删掉不可替代的东西。