一、前期准备
1.1 实体档案预整理
先将实体档案按年度、部门、档案类型完成一级、二级分类,拆除所有金属装订物(铁钉、金属夹等),避免刮伤扫描仪玻璃,同时防止金属反光影响图像采集效果。破损页用透明胶带修补平整,卷边、褶皱页提前用重物压平,去除无内容的空白页,同一分类档案按页码顺序排好,整理完成后按类堆放。注意:褪色、字迹模糊的老旧档案,预整理时要用HB铅笔轻轻描清关键信息,避免后期识别失败。
1.2 工具准备(全免费,可直接获取使用)
- 图像采集设备:有办公扫描仪直接用现有设备即可,无专用设备用普通智能手机即可
- 图像处理工具:FastStone Capture绿色免费版,直接下载地址:https://www.faststone.org/FSCaptureDownload.htm,解压即可使用,无需安装
- OCR文字识别工具:PaddleOCR绿色便携版,国内用户直接下载地址:https://lanzoub.com/b0jgv004a 提取密码:1234,解压即可运行,不需要配置Python环境,零门槛使用
- 提前整理命名规则表:用Excel整理好档案分类、编号对应表,命名统一规则为「一级分类-二级分类-年度-档案编号-文件名」
二、图像采集实操步骤
2.1 扫描仪批量采集(效率首选)
打开扫描仪设置面板,按以下标准参数设置,直接套用即可:
- 分辨率:300DPI,符合官方存档要求,满足识别和放大需求
- 存储格式:原始存档文件输出为TIFF(无损无压缩),日常预览文件转JPG即可
- 色彩模式:纯文字黑白档案选灰度,带公章、图片的彩色档案选24位真彩色
- 功能开启:打开自动倾斜校正、自动去除黑边功能
批量放纸扫描完成后,对照预整理的临时页码核对,确认无漏扫、错扫后进入下一步。
2.2 手机拍摄采集(无扫描仪场景)
选择光线均匀的室内靠窗位置,避免逆光和直射反光,打开手机相机自带的网格线功能,将纸张对齐网格边缘,保持手机屏幕和纸面完全平行,关闭闪光灯和滤镜,保持原始画质拍摄。注意:单页单独拍摄,不要两页同拍,避免文字变形影响识别,全部拍摄完成后批量导入电脑,按临时顺序命名存入临时文件夹。
三、图像标准化处理

打开FastStone Capture,按以下步骤批量处理,无需单张调整:
- 点击顶部菜单栏「工具」→「批量转换重命名图片」,导入同一分类的所有图片
- 点击「高级选项」,按顺序勾选以下操作并设置参数:自动裁切空白边、自动旋转校正倾斜、调整大小(宽度设为2480像素,保持纵横比,对应300DPI A4尺寸)、自动调整亮度对比度
- 输出设置:同时输出两份,一份TIFF格式用于存档,一份JPG格式(质量80%)用于日常预览,输出到对应分类的工作文件夹
四、OCR转换可编辑可检索档案
如果需要可检索、可编辑的电子档案,按以下步骤操作,仅需要图片存档可直接跳过进入归档:
- 打开解压好的PaddleOCR便携版文件夹,双击「启动.bat」,等待10-15秒工具自动启动,无需任何配置
- 点击左侧功能栏「批量识别」,选择处理好的图片文件夹,勾选输出选项「Word文档」+「可检索PDF」
- 点击「开始识别」,工具会自动批量处理,完成后在图片文件夹自动生成对应识别结果
- 随机抽查10%的档案,核对档案编号、日期、姓名等关键信息,少量错字手动修改即可,该工具对印刷体识别准确率在96%以上,工整手写体也可正常识别
五、最终归档备份
按照提前确定的规则统一命名所有电子档案,示例:「行政-人事-2024-00156-李四劳动合同」,统一命名完成后按分类建立文件夹存储,然后做双备份:
- 第一份备份:存到专用离线移动硬盘,做本地冷备份,涉密档案仅做本地双备份,不得上传公网
- 第二份备份:非涉密档案可以备份到单位内部云存储,方便日常检索调用
六、常见问题排查
- OCR识别率低:将图片分辨率调整到300DPI,重新调整亮度对比度,褪色档案手动补描关键文字后再次识别
- 批量扫描漏页:预整理时给每一页标注临时手写页码,扫描后直接核对页码即可快速排查
- 文件体积过大:日常使用的预览JPG可以将压缩质量设为70-80%,不影响清晰度的前提下减少体积,存档用的TIFF保持原始无损质量,不要压缩