网站首页/ 信息中心/ 档案百科/

预防接种档案数字化全流程实操技术指南 零基础可直接落地无坑运行

发布时间:2026年08月18日 05:05:28 浏览量:0

一、前期准备工作

1.1 软硬件环境配置

服务器最低配置:2核4G云服务器/本地服务器,操作系统使用CentOS7.9,镜像下载地址:https://mirrors.aliyun.com/centos/7.9.2009/isos/x86_64/ ;客户端使用普通Win10及以上办公电脑即可,支持外接高速扫描仪。

1.2 必备工具安装

所有工具均为开源免费工具,可直接执行以下命令安装:

二、纸质档案数字化采集实操

2.1 纸质档案预处理

2.2 扫描参数配置

打开LiME扫描工具,按以下参数配置,配置完成后可保存为预设模板,后续批量扫描直接调用:

2.3 结构化信息自动提取

将所有扫描好的JPG文件存入同一文件夹,新建Python文件extract.py,复制以下代码直接运行即可自动提取核心字段:

```python from paddleocr import PaddleOCR import os import re 初始化OCR模型,仅识别中文、数字,关闭运行日志 ocr = PaddleOCR(use_angle_cls=True, lang='ch', show_log=False) 扫描件存放目录,可自行修改 SCAN_PATH = "./scan_files/" 提取结果输出目录 OUTPUT_PATH = "./extract_result/" os.makedirs(OUTPUT_PATH, exist_ok=True) 身份证号正则校验规则 ID_CARD_PATTERN = re.compile(r'[1-9]\d{5}(18|19|20)\d{2}((0[1-9])|(1[0-2]))(([0-2][1-9])|10|20|30|31)\d{3}[0-9Xx]') for file_name in os.listdir(SCAN_PATH): if not file_name.endswith(".jpg"): continue file_path = os.path.join(SCAN_PATH, file_name) result = ocr.ocr(file_path, cls=True) text_list = [line[1][0].strip() for line in result[0]] extract_data = { "area_code": file_name.split("_")[0], "id_card": file_name.split("_")[1], "name": "", "vaccine_name": "", "inoculate_date": "", "unit": "", "scan_file_url": file_path } for text in text_list: if "姓名" in text: extract_data["name"] = text.split("姓名")[-1].strip(":: ") elif "疫苗名称" in text or "疫苗" in text: extract_data["vaccine_name"] = text.split("疫苗")[-1].strip(":: 名称") elif "接种日期" in text: extract_data["inoculate_date"] = text.split("接种日期")[-1].strip(":: ").replace(".", "-") elif "接种单位" in text: extract_data["unit"] = text.split("接种单位")[-1].strip(":: ") 校验身份证号合法性,不合法则标记待人工复核 if not ID_CARD_PATTERN.match(extract_data["id_card"]): extract_data["name"] = "待复核_" + extract_data["name"] 写入结果文件 with open(os.path.join(OUTPUT_PATH, file_name.replace(".jpg", ".txt")), "w", encoding="utf-8") as f: for k, v in extract_data.items(): f.write(f"{k}:{v}\n") ```

预防接种档案数字化全流程实操技术指南 零基础可直接落地无坑运行

运行完成后,所有提取结果会存入./extract_result/目录,平均识别准确率可达96%以上,仅需人工复核标记为“待复核”的文件即可,大幅降低人工录入成本。

三、档案数据库搭建与批量入库

3.1 数据库表结构创建

登录MySQL数据库,执行以下建表语句,可直接复制运行:

```sql CREATE DATABASE IF NOT EXISTS inoculation_archive DEFAULT CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci; USE inoculation_archive; CREATE TABLE IF NOT EXISTS archive_info ( id INT UNSIGNED NOT NULL AUTO_INCREMENT COMMENT '主键ID', area_code CHAR(6) NOT NULL COMMENT '接种地区编码', id_card CHAR(18) NOT NULL COMMENT '接种人身份证号', name VARCHAR(20) NOT NULL COMMENT '接种人姓名', vaccine_name VARCHAR(50) NOT NULL COMMENT '疫苗名称', inoculate_date DATE NOT NULL COMMENT '接种日期', unit VARCHAR(100) NOT NULL COMMENT '接种单位', scan_file_url VARCHAR(200) NOT NULL COMMENT '扫描件存储地址', create_time DATETIME DEFAULT CURRENT_TIMESTAMP COMMENT '入库时间', update_time DATETIME DEFAULT CURRENT_TIMESTAMP ON UPDATE CURRENT_TIMESTAMP COMMENT '更新时间', PRIMARY KEY (id), UNIQUE KEY uniq_idcard_vaccine (id_card, vaccine_name, inoculate_date) COMMENT '避免重复录入', KEY idx_idcard (id_card) COMMENT '按身份证号查询加速', KEY idx_inoculate_date (inoculate_date) COMMENT '按接种日期查询加速' ) ENGINE=InnoDB DEFAULT CHARSET=utf8mb4 COMMENT='预防接种档案主表'; ```

3.2 批量入库操作

新建Python文件import_to_db.py,修改数据库连接信息后直接运行即可批量入库:

```python import os import pymysql import pandas as pd 数据库连接信息,自行修改 DB_CONFIG = { "host": "你的数据库IP", "user": "root", "password": "你的数据库密码", "database": "inoculation_archive", "charset": "utf8mb4" } EXTRACT_PATH = "./extract_result/" conn = pymysql.connect(DB_CONFIG) cursor = conn.cursor() all_data = [] for file_name in os.listdir(EXTRACT_PATH): if not file_name.endswith(".txt"): continue with open(os.path.join(EXTRACT_PATH, file_name), "r", encoding="utf-8") as f: data = {} for line in f.readlines(): k, v = line.strip().split(":", 1) data[k] = v all_data.append(data) df = pd.DataFrame(all_data) 批量写入数据库 df.to_sql("archive_info", conn, if_exists="append", index=False) conn.commit() cursor.close() conn.close() print(f"成功入库{len(all_data)}条数据") ```

四、权限配置与校验验收

4.1 访问权限配置

执行以下SQL命令配置分级权限,避免数据被误改:

4.2 数据校验验收

按以下规则抽验数据,合格率达到99%以上即可上线使用:

五、常见问题排查

太原档案数字化服务流程是怎样的?大概需要多少钱?
太原档案数字化服务流程是怎样的?大概需要多少钱?
太原档案数字化服务通常包含需求分析、方案制定、现场整理、扫描加工、数据挂接、验收交付等核心流程,费用根据档案数量、纸张状况、数字化标准等因素综合计算,2026年市场价格范围大致在每页0.5元至2元之间...
2026年08月18日 05:05:28
微信咨询
电话联系
QQ客服
微信咨询一对一服务
服务热线: 028-8744 4417
QQ客服: 2305721818