档案数字化不是简单的扫描,而是通过科学流程将实体档案转化为结构化、可管理、可利用的数字资产。科学数字化强调流程标准化、数据结构化与长期可访问性。
你需要准备以下工具,所有工具均为开源或主流商业软件,确保可获取性。
此步骤直接影响数字化质量,不可跳过。
打开NAPS2,按以下参数创建新的配置文件:
1. 分辨率:文本档案设为300 DPI,照片、图纸设为600 DPI。
2. 色彩模式:黑白文本选“黑白”,彩色图片、有红头/印章的文件选“彩色”,灰度照片选“灰度”。
3. 文件格式:原始扫描存档用无损的TIFF格式,日常使用副本用PDF/A格式。
4. 文件命名:启用“自动命名”,规则设为“{档案类别}_{日期}_{4位序号}”,例如“HR_20231015_0001.tiff”。
扫描时,确保文档边缘对齐,避免歪斜。对于双面文档,在NAPS2设置中勾选“双面扫描”。
扫描后,立即进行批量质检。使用NAPS2的“批量操作”功能:
此步骤将图像转化为可搜索的文本并附加描述信息。
首先安装Tesseract及中文语言包:
在Ubuntu/Debian上安装
sudo apt install tesseract-ocr tesseract-ocr-chi-sim
在macOS上使用Homebrew安装
brew install tesseract tesseract-lang
对单个扫描文件进行OCR,输出为可搜索的PDF
tesseract scanned_image.tiff output_pdf -l chi_sim+eng pdf
对于批量处理,创建一个名为`batch_ocr.sh`的脚本:
!/bin/bash
for file in .tiff; do
base=$(basename "$file" .tiff)
tesseract "$file" "ocr_output/${base}" -l chi_sim+eng pdf
done
运行脚本前,先创建`ocr_output`目录。

元数据是描述档案的数据。创建一个SQLite数据库来管理:
sqlite3 archive_metadata.db
执行以下SQL创建表:
CREATE TABLE documents (
id INTEGER PRIMARY KEY AUTOINCREMENT,
file_name TEXT NOT NULL UNIQUE,
title TEXT,
doc_type TEXT, -- 如'合同','报告','证件'
origin_date DATE,
author TEXT,
keywords TEXT,
storage_path TEXT NOT NULL,
scan_date DATE DEFAULT CURRENT_DATE,
ocr_text_path TEXT -- OCR文本文件路径
);
为每份数字档案插入一条记录。你可以编写一个简单的Python脚本,从CSV文件批量导入数据。
在存储盘根目录建立如下结构,禁止将文件杂乱堆放在一起:
/数字档案库/
├── 01_原始扫描图(TIFF)/
│ ├── 2023年/
│ │ ├── 10月/
│ │ │ ├── 人事类/
│ │ │ └── 财务类/
│ │ └── 11月/
│ └── 2024年/
├── 02_可用副本(PDF)/
│ └── ...(结构与01层相同)
├── 03_OCR文本(TXT)/
│ └── ...(结构与01层相同)
└── 00_元数据库/
└── archive_metadata.db
使用`rsync`在Linux/macOS上设置每日增量备份到备份硬盘:
将以下命令加入crontab,实现每日凌晨2点备份
0 2 rsync -av --delete /数字档案库/ /Volumes/BackupHDD/数字档案库_备份/
对于Windows,使用“任务计划程序”调用以下PowerShell脚本:
Copy-Item -Path "D:\数字档案库\" -Destination "E:\数字档案库_备份\" -Recurse -Force
每季度进行一次恢复测试,随机从备份盘中恢复几个文件,验证备份有效性。
使用`grep`配合OCR文本进行快速检索:
在OCR文本目录中搜索包含“合作协议”的文件
grep -r -l "合作协议" /数字档案库/03_OCR文本(TXT)/
如需图形界面,可安装`Recoll`桌面搜索工具(支持Windows、Linux、macOS),将其索引目录指向你的OCR文本或PDF副本目录。
生成校验和
find /数字档案库 -type f -exec sha256sum {} \; > /备份盘/校验和_2024.txt
后续验证
sha256sum -c /备份盘/校验和_2024.txt
将所有.txt文件加上前缀
rename 's/^/HR_20231015_/' .txt
遵循以上步骤,你将建立起一个专业、可持续的档案数字化工作流。核心在于流程的标准化与每一步的严格质检,确保数字档案的真实、完整与长期可用。