网站首页/ 信息中心/ 档案百科/

档案数字化新手实操三种场景下的免费OCR识别全流程

发布时间:2026年08月23日 02:50:19 浏览量:0

一、准备工作:零门槛搭建基础环境

本次使用通用免费工具组覆盖三大场景,无需付费、无需复杂服务器搭建,请严格按步骤操作。

工具下载(直接复制使用官方源)

二、场景1:单张/小批量(≤50张)实体档案扫后识别

适合单页纸质合同、身份证、发票这类零散文档,扫成JPG/PNG/BMP格式后处理,识别精度高、速度快。

步骤1:解压并配置天若OCR

下载压缩包后,右键点击→解压到当前文件夹,生成“tianruo-ocr-local-enhanced-v1.4.2-x64”文件夹,双击运行文件夹内的TianruoOCR.exe。首次打开会弹出“首次使用需要下载核心模型?”的提示,勾选所有模型并点击“确定”,等待1-2分钟下载完成(视网速而定)。

步骤2:导入/截取档案并识别

模型下载完成后,工具窗口会出现三种识别入口:

关键卡壳解决

三、场景2:单份/多份(≤20份)PDF档案批量转文字

适合已经扫描合并成PDF的档案,无需解压成图片,直接调用百度网盘内置的免费OCR转文字功能。

步骤1:上传档案到百度网盘个人空间

打开PC端百度网盘,点击左侧“全部文件”,新建一个名为“待OCR的档案”的文件夹,将待处理的PDF拖入该文件夹。

步骤2:使用免费OCR转文字功能

上传完成后,右键点击“待OCR的档案”文件夹内的单份PDF,选择“在线打开”,打开后点击页面顶部的“OCR文字识别”按钮。首次使用需要授权百度网盘访问权限,勾选“同意协议并授权”。授权后选择识别精度(通用文档识别精度最高,选这个),点击“开始识别”,等待1-5分钟识别完成。

步骤3:批量处理并导出

档案数字化新手实操三种场景下的免费OCR识别全流程

如果要处理≤20份PDF,点击百度网盘个人空间顶部的“更多功能”→“文档工具”→“OCR文字识别”,选择“批量PDF识别”,拖拽≤20份PDF到上传区域,选择通用文档识别,设置保存路径为“我的网盘/已OCR的档案”,点击“开始识别”。识别完成后,点击“已OCR的档案”文件夹,全选识别结果TXT/DOCX文件,右键点击选择“下载”,设置本地保存路径即可。

四、场景3:批量(≥100张)图片/多份PDF档案自动化处理

适合大量扫描好的历史档案,使用Python开源工具PaddleOCR实现全自动化批量识别、排版、导出,处理速度快且免费无限量。

步骤1:安装Python和PaddlePaddle/PaddleOCR

先安装Python:双击下载好的python-3.10.11-amd64.exe务必勾选“Add Python 3.10 to PATH”,点击“Install Now”,等待安装完成。

安装完成后,按Win+R键,输入cmd,回车,打开命令提示符窗口,依次输入以下3条命令(每条输入后回车,等待提示“Successfully installed”再输下一条): ``` pip install paddlepaddle -i https://mirror.baidu.com/pypi/simple pip install paddleocr -i https://mirror.baidu.com/pypi/simple pip install pdf2image -i https://mirror.baidu.com/pypi/simple ``` 如果是Mac/Linux用户,第一条命令换成对应的CPU/GPU版本(新手建议用CPU版:Mac/Linux均用`pip install paddlepaddle -i https://mirror.baidu.com/pypi/simple`)。

步骤2:准备档案文件和Python脚本

在电脑D盘(或者其他盘)根目录下新建两个文件夹

在D盘根目录下新建一个文本文档,重命名为“ocr_batch.py”,右键点击选择“打开方式”→“记事本”,复制粘贴以下完整代码,然后点击“文件”→“保存”: ``` import os from pdf2image import convert_from_path from paddleocr import PaddleOCR, draw_ocr from PIL import Image 初始化OCR模型(中英文混合识别,CPU版) ocr = PaddleOCR(use_angle_cls=True, lang='ch', use_gpu=False) 输入输出文件夹路径 input_path = r"D:\input_folder" output_path = r"D:\output_folder" 检查输出文件夹是否存在,不存在则创建 if not os.path.exists(output_path): os.makedirs(output_path) 遍历输入文件夹内的所有文件 for filename in os.listdir(input_path): file_path = os.path.join(input_path, filename) 处理图片文件 if filename.lower().endswith(('.jpg', '.jpeg', '.png', '.bmp')): result = ocr.ocr(file_path, cls=True) 生成TXT识别结果 txt_path = os.path.join(output_path, filename.split('.')[0] + '.txt') with open(txt_path, 'w', encoding='utf-8') as f: for line in result[0]: f.write(line[1][0] + '\n') 处理PDF文件 elif filename.lower().endswith('.pdf'): 将PDF转成图片(每页一张) pages = convert_from_path(file_path, dpi=300) pdf_txt_path = os.path.join(output_path, filename.split('.')[0] + '.txt') with open(pdf_txt_path, 'w', encoding='utf-8') as f: for i, page in enumerate(pages): 保存临时图片 temp_img_path = os.path.join(output_path, f"{filename.split('.')[0]}_temp_{i}.jpg") page.save(temp_img_path, 'JPEG') 识别临时图片 result = ocr.ocr(temp_img_path, cls=True) 写入识别结果 f.write(f" 第 {i+1} 页 \n") for line in result[0]: f.write(line[1][0] + '\n') 删除临时图片 os.remove(temp_img_path) print("批量OCR识别完成!结果已保存到D:\\output_folder") ```

步骤3:运行脚本并获取结果

再次打开命令提示符窗口,输入“d:”回车(如果是其他盘换成对应的盘符加冒号),再输入“python ocr_batch.py回车”,等待脚本运行完成(处理100张图片约需5-10分钟,视电脑性能而定)。运行完成后,打开D:\output_folder即可看到所有识别结果的TXT文件。

关键卡壳解决

3个可直接抄作业的学校档案培训案例 新手小白也能快速上手
3个可直接抄作业的学校档案培训案例 新手小白也能快速上手
家人们谁懂啊,我5年前刚接学校档案岗的时候,简直是天选背锅侠:上级要求做档案培训找不到合适的方案,老师听完就忘,归档错漏被教育局通报了3次,差点把我那年的年终评优整黄,连带着整个部门的绩效都打了折。后...
2026年08月23日 02:50:19
微信咨询
电话联系
QQ客服
微信咨询一对一服务
服务热线: 028-8744 4417
QQ客服: 2305721818