一、前期准备:硬件+软件配齐(零额外付费版)
本次采用免费通用组合,成本仅需现有扫描仪、普通电脑,无需额外采购设备或软件。
1.1 硬件确认
- 扫描仪要求:支持批量ADF自动进纸(建议30页以上进纸容量)、支持灰度/二值/彩色扫描、分辨率可调(建议最低150dpi)
- 电脑要求:Windows10/11系统(其他系统需自行适配软件)、硬盘剩余空间≥10G/每万页、内存≥8G
1.2 软件安装
- 扫描软件:NAPS2(免费开源,兼容性极强),下载地址:https://github.com/cyanfish/naps2/releases/latest(选择NAPS2-7.1.2-x64-Installer.exe,适配64位Windows)
- OCR识别软件:Tesseract 5.3.3(谷歌开源OCR,精度高),下载地址:https://github.com/tesseract-ocr/tesseract/releases/download/5.3.3/tesseract-ocr-w64-setup-5.3.3.20231007.exe
- OCR中文语言包:chi_sim.traineddata(简体中文)、chi_tra.traineddata(繁体中文),下载地址:https://github.com/tesseract-ocr/tessdata_fast/raw/main/chi_sim.traineddata、https://github.com/tesseract-ocr/tessdata_fast/raw/main/chi_tra.traineddata
- 归档整理辅助工具:Everything(免费快速文件搜索重命名工具),下载地址:https://www.voidtools.com/Everything-1.4.1.1022.x64-Setup.exe
1.3 基础配置
(1)Tesseract语言包放置:找到Tesseract安装目录(默认C:\Program Files\Tesseract-OCR),新建tessdata_fast文件夹,将下载的chi_sim.traineddata、chi_tra.traineddata拖入;
(2)NAPS2配置OCR:打开NAPS2,点击顶部菜单栏「设置」→「OCR」,点击「添加Tesseract」,浏览选择默认Tesseract路径下的tesseract.exe,语言选择「Chinese (Simplified)」+「Chinese (Traditional)」,引擎库路径选择刚才新建的tessdata_fast文件夹,点击「确定」保存。
二、核心实操第一步:批量标准化扫描
标准化扫描是OCR识别准确率的核心,必须严格执行。
2.1 档案预处理(人工必做,1分钟/百页)
- 拆装订:去掉回形针、订书钉,避免卡纸;
- 理整齐:对齐ADF进纸口边缘,纸张无折角、无污渍;
- 补缺失页:如遇断页、漏页,先补齐或标记「[断页X-Y]」在对应位置的白纸上;
2.2 NAPS2批量扫描配置
打开NAPS2,点击顶部「扫描」→「新配置」,填写配置名称「代码证标准化」,按以下参数逐一设置:
- 设备:选择你的扫描仪型号;
- 来源:自动进纸器(双面优先选「双面扫描」,单面选「单面」);
- 分辨率:200dpi(识别最佳平衡点,过高文件大、速度慢,过低识别差);
- 色彩:二值化(代码证为黑白印刷,二值化可压缩体积80%以上且不影响识别);
- 尺寸:A4(组织机构代码证一般夹在A4档案纸中,无需单独裁剪);
- 自动功能:勾选「自动裁剪」「自动旋转」「自动去噪」(降噪级别选「中」);
点击「保存配置」,再点击「扫描」按钮,选择刚才的配置开始批量扫描。
三、核心实操第二步:批量OCR识别+重命名
重命名规则必须统一,建议用「年份-原始档案编号-组织机构代码」格式(无原始编号用「年份-代码」)。
3.1 批量OCR识别配置
扫描完成后,NAPS2会自动显示所有扫描页,点击顶部「工具」→「批量OCR」:
- 选择刚才的「代码证标准化」OCR配置;
- 识别模式选「识别并保存为文本(或带OCR的PDF)」,优先选「可搜索PDF」(可后续打开直接搜索内容);
- 输出路径选电脑桌面新建的「代码证数字化输出」文件夹;
3.2 批量提取+重命名

(1)安装Everything后,打开「代码证数字化输出」文件夹,按Ctrl+A全选所有PDF,右键选「使用Everything搜索」;
(2)在Everything搜索框中输入正则表达式(可直接复制)提取组织机构代码:content:"组织机构代码"[^\x{4e00}-\x{9fa5}]{1,10}[0-9A-Z]{8}-[0-9A-Z];
(3)点击Everything顶部「编辑」→「高级重命名」,选择「从文件内容提取文本」,设置:
- 提取起始:匹配正则表达式
组织机构代码[^\x{4e00}-\x{9fa5}]{1,10};
- 提取长度:10(包含横杠);
- 命名模板:
[提取文本1]-[序号](序号位数设为4,避免重复);
点击「预览」检查无误后,点击「确定」完成重命名。
四、核心实操第三步:合规归档(满足档案管理规范)
本次采用「电子目录+分类文件夹」的免费归档方式,无需专业档案管理系统。
4.1 分类文件夹创建
在「代码证数字化输出」根目录下,按以下层级创建文件夹:
- 2015年及之前代码证(三证合一过渡期前)
- 2016-2017年代码证(过渡期重叠)
- 2018年及之后(仅存复印件,需单独标注)
每个年度文件夹下再按「机关」「事业单位」「企业」「社会团体」细分(无细分需求可跳过)。
4.2 电子目录生成
打开Excel(或免费WPS表格),新建「代码证电子目录.xlsx」,按以下列设置:
- 序号
- 组织机构代码
- 单位名称
- 档案类型(机关/事业/企业/社团)
- 扫描日期
- 文件路径(绝对路径,如C:\Users\你的用户名\Desktop\代码证数字化输出\2015年及之前代码证\12345678-9-0001.pdf)
单位名称可通过Everything正则表达式快速提取部分,路径可批量复制Everything搜索结果的「路径」列,再手动整理补充。
4.3 数据备份
- 本地备份:将「代码证数字化输出」文件夹复制到外接移动硬盘(至少2块不同品牌硬盘,异地存放);
- 云端备份:压缩文件夹后上传至百度网盘、阿里云盘等免费云盘(设置私密存储);
五、常见问题排查
5.1 OCR识别准确率低
- 检查扫描仪色彩是否设为二值化,降噪级别是否过高;
- 将分辨率提高到300dpi重新扫描(仅针对识别率低于80%的页面);
- 替换tessdata_fast为tessdata_best语言包(下载地址同tessdata_fast,替换后识别速度慢3倍左右,但精度提升10%);
5.2 批量重命名提取失败
- 检查正则表达式是否复制完整,是否有空格;
- 手动修改提取失败的文件内容,补充正确的组织机构代码后再重命名;
5.3 扫描仪卡纸
- 再次理整齐纸张,对齐进纸口边缘;
- 清洁扫描仪ADF进纸轮(用酒精棉片擦拭,晾干后再使用);