一、前期准备
1.1 工具物料清单
提前准备以下工具,所有工具均可免费获取,无付费要求:
- 硬件:批量扫描仪(满足A4档案批量扫描需求,个人少量加工可用手机扫描全能王免费版)、拆钉器、透明补纸胶带、喷壶、一次性手套
- 软件:OCR识别工具直接下载开源免费版,地址:
https://github.com/jiangnanboy/tianruoocr/releases,下载后双击安装即可,无捆绑;表格工具用微软Excel/WPS表格均可
- 存储:至少2块1TB以上的空移动硬盘,用于异机备份
1.2 提前明确规范
开工前先拿到本单位卫生档案分类编码规则,统一档号格式为:一级分类码-二级分类码-年度-件号,例如:总档-行政-2023-0012,提前整理好单位现有档案的分类表,避免后期乱序。
二、纸质档案预处理
预处理是避免扫描出错的核心步骤,按照以下顺序操作:
- 拆除装订:先取出所有档案,逐一拆除订书针、回形针、装订线,遇胶装档案用拆刀沿装订边缓慢切开,老旧脆化纸张提前用喷壶喷少量清水软化,避免撕破,拆除的金属物品单独收纳,避免刮花扫描仪镜头
- 缺页补损:遇缺角、撕裂的纸张,用和原纸厚度接近的空白纸补贴,缺页的在对应位置补上空白说明纸,标注“原档案缺页”
- 整理排序:按照档案原件的原有页码排序,调整错页、倒页,确认无误后,按照每份档案为单位整理好,放在扫描进纸托盘旁
三、批量扫描实操
3.1 提前设置扫描参数
按照卫生部门档案永久存储要求,设置参数如下,直接套用即可:
- 分辨率:300DPI,禁止低于200DPI,否则不符合存档要求
- 存储格式:主文件存无损非压缩TIFF格式,预览文件存JPEG格式
- 色彩模式:纯黑白文字档案用黑白二值模式,带有彩色公章、病历、照片的档案用24位真彩色模式
- 自动处理:开启自动纠偏、自动裁边功能,去除扫描黑边
3.2 扫描操作步骤
- 每次进纸不超过50张,避免卡纸,进纸前理顺纸张边缘,确认没有残留金属物品
- 每扫描完10份档案,抽出1张检查清晰度、内容完整性,确认没有缺边、模糊后再继续
- 扫描完成后,所有扫描文件按照档号命名,命名规则为「档号_档案名称」,例如:XZ-01-2023-0012_2023年度卫生监督检查计划,一份档案对应多个扫描页的,加后缀-1、-2区分
四、OCR识别与结构化整理

完成扫描后做可检索化处理,操作如下:
- 打开天若OCR,选择批量识别功能,导入同一份档案的所有扫描页,设置导出格式为可检索PDF+纯文本TXT
- 导出后,将TXT、PDF、TIFF文件放在同一个文件夹内,文件名保持一致
- 整理元数据,按照下表填写,直接套用格式即可:
| 档号 |
档案名称 |
形成日期 |
责任部门 |
保管期限 |
本地存储路径 |
| XZ-01-2023-0012 |
2023年度卫生监督检查计划 |
2023-01-15 |
监督一科 |
永久 |
2023/XZ/01/XZ-01-2023-0012 |
所有档案的元数据整理到同一张Excel表中,作为总目录,方便后续快速检索。
五、质量校验
按照三个维度逐一校验,不满足要求的重新处理:
- 图像校验:每页内容完整,公章、核心文字清晰,错扫、漏扫率不超过千分之一,不符合要求的重新扫描
- 信息校验:档号唯一不重复,元数据信息和原件完全一致,没有错填、漏填
- 存储校验:单页300DPI TIFF文件大小不低于1MB,保证清晰度,所有文件可以正常打开,没有损坏
六、最终归档与备份
校验完成后,按照以下步骤完成归档,可直接落地:
- 按照年度/一级分类/二级分类的层级创建文件夹,将对应档案放入对应文件夹,层级清晰,方便查找
- 将整理好的整个档案库复制到两块不同的移动硬盘,做本地异机备份,再上传单位内部加密云盘做异地备份,禁止将涉密、涉及个人隐私的卫生档案上传公共云盘
- 将整理好的元数据总目录Excel导出一份PDF,存放在档案库根目录,打印一份纸质总目录和原纸质档案一起入库存档
合规注意事项
所有操作过程中,纸质档案不得离开工作场所,禁止私自拷贝、泄露档案内容,数字化完成后原纸质档案按照原有保管要求归库,所有操作符合《中华人民共和国档案法》《卫生档案管理暂行规定》的要求。