检查是零门槛落地的第一步,请按顺序完成所有必选项,确保软件环境符合基础要求。
无论你用的是开源档案软件(如档案之星社区版)还是商业软件,都可以用通用的Python元数据映射脚本快速完成对齐,无需修改软件源码。
如果没有Python环境,直接访问https://www.python.org/downloads/release/python-3127/下载Python 3.12.7(LTS长期支持版,符合规范要求的稳定环境),安装时必须勾选「Add Python 3.12 to PATH」。
安装完成后,打开Windows cmd/Mac/Linux终端,输入以下命令一次性安装依赖库: ```pip install pandas openpyxl pymupdf```

新建Excel文件命名为`meta_mapping.xlsx`,放在桌面,严格按以下结构填充: | 规范必填字段名 | 规范字段类型 | 当前软件字段名 | 是否必填 | 默认值(若当前无) | |-|--|-|-|--| | 档号 | 字符串 | document_number | 是 | - | | 题名 | 字符串 | title | 是 | - | | 责任者 | 字符串 | author | 是 | - | | 成文日期 | 日期型 | create_date | 是 | - | | 归档章编号 | 字符串 | archive_stamp_no | 是 | - | | 保管期限 | 字符串 | retention_period | 是 | 永久 | | 全宗号 | 字符串 | fonds_number | 是 | - | | 归档时间 | 日期型 | archive_time | 是 | 当前系统时间 | | 数字化加工单位 | 字符串 | digitization_unit | 是 | 自行补充 | | 数字化加工日期 | 日期型 | digitization_date | 是 | 当前系统时间 | | PDF/A-3a合规编号 | 字符串 | pdfa3a_compliance_id| 否 | 后续自动生成 |
注意事项:日期型字段格式必须统一为`YYYY-MM-DD`或`YYYYMMDD`,字符串型字段长度≤规范附件表1的最大长度。
新建记事本文件命名为`meta_align.py`,放在桌面,粘贴以下完整代码: ```python import pandas as pd from datetime import datetime 1. 读取映射表和当前软件的元数据导出表 mapping_df = pd.read_excel(r"C:\Users\你的用户名\Desktop\meta_mapping.xlsx") Windows路径 mapping_df = pd.read_excel("/Users/你的用户名/Desktop/meta_mapping.xlsx") Mac/Linux路径,取消注释替换上面一行 current_df = pd.read_excel(r"C:\Users\你的用户名\Desktop\current_meta.xlsx") 当前软件导出表,必须放在桌面 current_df = pd.read_excel("/Users/你的用户名/Desktop/current_meta.xlsx") Mac/Linux路径,取消注释替换上面一行 2. 初始化合规元数据表 compliance_fields = mapping_df[mapping_df["是否必填"] == "是"]["规范必填字段名"].tolist() compliance_df = pd.DataFrame(columns=compliance_fields + mapping_df[mapping_df["是否必填"] == "否"]["规范必填字段名"].tolist()) 3. 批量映射字段 for _, row in mapping_df.iterrows(): target_field = row["规范必填字段名"] source_field = row["当前软件字段名"] default_val = row["默认值(若当前无)"] 处理默认值为当前系统时间的情况 if default_val == "当前系统时间": default_val = datetime.now().strftime("%Y-%m-%d") 映射或填充默认值 if source_field in current_df.columns: compliance_df[target_field] = current_df[source_field] else: compliance_df[target_field] = default_val 4. 处理缺失的必填字段(填充规范允许的占位符) for field in compliance_fields: if compliance_df[field].isnull().any(): compliance_df[field] = compliance_df[field].fillna("待补") 5. 导出合规元数据表 compliance_df.to_excel(r"C:\Users\你的用户名\Desktop\compliance_meta.xlsx", index=False) compliance_df.to_excel("/Users/你的用户名/Desktop/compliance_meta.xlsx", index=False) Mac/Linux路径,取消注释替换上面一行 print("✅ 元数据批量对齐完成!文件已保存为桌面的compliance_meta.xlsx") ```
重点操作: 1. 把脚本中的「你的用户名」替换为当前电脑的实际用户名(Windows在C:\Users下查看,Mac在/Users下查看); 2. 把当前软件的元数据导出表命名为`current_meta.xlsx`,放在桌面; 3. 双击桌面的`meta_align.py`运行(Windows安装了Python后会自动关联),或在终端输入`python C:\Users\你的用户名\Desktop\meta_align.py`运行。
如果当前软件无法直接生成PDF/A-3a,用国家档案局发布的免费PDF/A-3a转换工具「档易转」(直接访问https://www.saac.gov.cn/zxhd/hdzt/dyz/202512/t20251205_24012.html下载Windows/Mac版本)完成。
2026年规范要求每100个归档文件至少随机抽10个检测,用「档易转」自带的检测工具即可:
四性(真实性、完整性、可用性、安全性)检测是2026年规范的新增强制项,用开源工具「电子档案四性检测工具V2.0」(直接访问https://github.com/SAAC-China/e-archive-four-check/releases/tag/v2.0下载压缩包)完成。