一、核心工具与软件准备
在开始前,请确保准备好以下工具,这是所有后续操作的基础。
1.1 硬件设备
高速文档扫描仪:推荐使用ADF(自动进纸器)支持双面扫描的型号,例如富士通ScanSnap iX1600。确保其驱动程序已正确安装,可通过USB或网络连接到你的工作电脑。
专用工作电脑:建议配置不低于Intel i5处理器、16GB内存和1TB固态硬盘。操作系统为Windows 10/11专业版或macOS最新稳定版。
存储设备:准备一个至少4TB的NAS(网络附加存储)或企业级硬盘,用于集中存储原始扫描文件和备份。推荐群晖DS423+等型号。
1.2 核心软件安装
以下软件均为完成本指南所必需,请按顺序安装。
文档扫描与处理软件:
- VueScan Professional(版本号:9.8.10)下载地址:https://www.hamrick.com/files/vuex6490.exe
- 安装命令(Windows):双击下载的exe文件,全程点击“Next”,安装路径保持默认。
档案管理系统(本地部署版):
- 使用开源方案:Archivematica。访问其GitHub发布页面:https://github.com/archivematica/archivematica/releases
- 下载最新稳定版(如1.14.0)的ISO镜像文件。通过Rufus(https://rufus.ie/)工具将其刻录到U盘,制作成启动盘,用于安装独立的服务器。
必备运行环境:在安装Archivematica的服务器上,确保已安装Docker和Docker Compose。
- 安装Docker(Ubuntu系统示例):
```
sudo apt update
sudo apt install docker.io
sudo systemctl start docker
sudo systemctl enable docker
```
- 安装Docker Compose:
```
sudo apt install docker-compose
```
二、档案扫描标准化操作流程
此流程确保扫描文件清晰、格式统一,便于后续管理。
2.1 扫描前预处理
物理整理:拆除档案中的订书钉、回形针。将皱褶的页面压平。对于已破损的文件,先使用无酸胶带进行修复。
批次编号:为每一批待扫描的档案建立一个唯一的批次编号。格式为:DEPARTMENT_YEAR_BATCH。例如:HR_2023_BATCH01。将此编号手写在批次首页的右上角。
2.2 扫描参数精确设置
打开VueScan软件,进行以下关键设置:
1. 选择扫描源:在“输入”选项卡中,选择你的扫描仪型号。
2. 设置分辨率:在“输出”选项卡中,将扫描分辨率设置为300 DPI。这是文字档案的通用标准,能保证清晰度并控制文件大小。
3. 设置色彩模式:在“过滤”选项卡中,选择黑白文档(Black & White)模式。对于纯文本档案,此模式可生成最小的文件。
4. 设置文件格式与命名:
- 在“输出”选项卡,将输出格式设置为“PDF”。
- 勾选“多页PDF”选项。
- 在“文件名”处,设置命名规则:%b_%n。其中 %b 代表批次号,%n 代表自动递增的页码。这样会生成如“HR_2023_BATCH01_001.pdf”的文件。

5. 执行扫描:点击“扫描”按钮。将整理好的档案放入扫描仪ADF,软件会自动按设定规则完成扫描并保存。
三、档案元数据著录与管理系统配置
元数据是档案检索的钥匙,必须规范录入。
3.1 部署Archivematica系统
将制作好的Archivematica安装U盘插入服务器,从U盘启动。进入图形安装界面后,选择“Install Archivematica”,按照提示设置语言、时区、用户名和密码。安装完成后,重启系统。
通过浏览器访问服务器IP地址,进入Archivematica仪表盘。
3.2 创建元数据方案与著录
我们将创建一个符合基本需求的元数据方案。
步骤1:创建分类方案
在仪表盘左侧导航栏,点击“分类方案” -> “创建新方案”。
- 公司档案总目
- 标识符:CORP_ARCHIVE_TOP
- 描述:公司所有档案的顶层分类。
点击保存。
步骤2:创建著录模板
在“访问ions”菜单下,点击“著录模板” -> “添加新模板”。
- 模板名称:人事档案标准模板
- 基于标准:选择“Dublin Core”
在编辑器中,添加以下核心字段(均为必填项):
- 标题(Title):档案标题,如“张三2023年度绩效考核表”。
- 创建者(Creator):档案形成部门,如“人力资源部”。
- 主题(Subject):关键词,用分号分隔,如“绩效考核;2023年度;张三”。
- 描述(Description):档案内容摘要。
- 日期(Date):档案形成日期,格式YYYY-MM-DD。
- 标识符(Identifier):档案唯一编号,规则:部门代码+年份+顺序号,如“HR-2023-056”。
- 来源(Source):原始档案存放位置,如“档案室A柜3层”。
- 权限(Rights):访问权限,如“仅限人力资源部查阅”。
点击保存模板。
步骤3:批量导入扫描文件并著录
点击“转移” -> “新建转移”。
- 输入一个转移名称,如“Transfer_HR_2023_BATCH01”。
- 点击“添加文件”,将之前扫描好的整个批次的PDF文件上传。
- 上传完成后,系统开始自动提取基础信息。
进入该转移的详情页,点击“开始著录”。系统会引导你为每一个PDF文件应用“人事档案标准模板”,并逐项填写上面定义的元数据字段。请确保每个字段都准确填写。
四、存储、备份与检索
确保数据安全并能被快速找到。
4.1 配置长期存储(AIP存储)
在Archivematica仪表盘,进入“管理” -> “位置”。
- 点击“创建位置”。
- 用途:选择“AIP存储”。
- 路径:填写你的NAS网络路径或服务器本地路径,例如:/mnt/nas/archive_aip。确保该目录已存在且Archivematica进程有读写权限。
完成著录后,在流程界面选择“存储”,系统会将封装好的档案信息包(AIP)自动存入该位置。
4.2 配置备份策略
在“管理” -> “位置”,再次“创建位置”。
- 用途:选择“备份”。
- 路径:填写另一个物理硬盘的路径,例如/mnt/backup_disk/archive_backup。
在“管理” -> “处理配置”中,找到“存储”阶段,启用“创建备份”选项,并选择你刚创建的备份位置。此后,每次存储操作都会自动生成一份备份。
4.3 执行档案检索
所有流程完成后,档案即可被检索。
- 在仪表盘顶部找到搜索框。
- 输入你在著录时填写的任何元数据信息,如“张三”、“绩效考核”、“HR-2023-056”。
- 系统会列出所有匹配的档案条目。
- 点击条目,即可查看完整的元数据,并下载对应的数字化档案文件(PDF)。
五、关键问题排查
遇到以下常见问题,请按步骤解决。
问题1:扫描图像模糊或有黑边。
解决:检查扫描仪玻璃板是否清洁;在VueScan的“过滤”选项卡中,调整“阈值”滑块,确保文字与背景对比清晰;确认扫描分辨率设置为300 DPI。
问题2:Archivematica上传文件失败。
解决:检查服务器磁盘空间是否充足;检查上传文件夹(默认/var/archivematica/sharedDirectory)的权限,运行命令:sudo chown -R archivematica:archivematica /var/archivematica/sharedDirectory。
问题3:无法通过关键词检索到档案。
解决:确认检索的关键词与著录时“主题”或“标题”字段的内容完全一致(包括中文字符);检查该档案的著录流程是否已完成并成功“存储”;在管理后台尝试重建索引。