- 相关推荐
浅析汉字识别技术在档案管理工作中的应用
汉字识别技术(简称OCR)可以理解为是让机认字的技术。它通过光电信号转换,即文本数据。? 一、汉字识别技术的价值? 汉字识别技术的应用价值主要体现在两个方面: ? 一方面,把纸质档案上的固定信息变成可以被检索利用的活信息,为文本数据管理技术提供 丰富的数据源。
? 首先,从库存档案的情况来看,近几十年来形成的大量印刷汉字档案记载了我们党和国家的 重要,对我国化事业的,对精神文明和物质文明的建设都有着非常重要的利用 价值。但这部分档案的都没有文本数据,或者说都只是固定在纸质载体上的死信息。既 使通过扫描以图像方式存储于计算机中,检索利用也有不便之处,难于满足现代对档案 信息的多种利用需求。其次,从办公自动化的发展情况来看,每年接收的档案中仍然会有相 当数量的档案没有文本文件,或为外单位来文,或为丢失损坏等。汉字识别技术的应用价值 就是使这两大部分纸质档案上的固定信息变成可以被检索利用的活信息,为全文检索提供数 据,使深层次的开发利用成为可能,更好地为现代化建设事业服务。
? 另一方面,提供了一种新的档 案目录数据的录入方式。
? 应用计算机以来,汉字录入只有一种方式,即健盘录入。虽然汉字键盘录入的有许 多种,而且日趋简便快捷,已是年轻人必备的职业技能,但是它毕竟属于一种技能,不仅需 要反应灵敏,手指灵活,而且要熟记录入的原则、方法和要领。这对于在档案部门占有相当 比例的中老年同志来说,掌握起来确有难度。因此,键盘录入方式仍然是一些档案部门 建立档案目录信息数据库的因素之一。OCR软件为我们提供了一条新的途径。它通过“拖拉 ”的方式,将屏幕上文件的目录项如标题、文号、责任者等直接移植到档案目录数据库的相 应字段中去,简单易学,一看就会。遗憾的是手工“拖拉”速度较慢,而且需要即时扫描或 调用图像数据,所以单一利用这种方式录入档案目录,速度不及熟练录入员的键入速度。但它毕竟是一种新的录入方式,为建立档案目录信息数据库提供了一条前所未有的途径。而且 ,如果利用OCR软件同时建立新型的综合档案信息数据库,例如包括档案的文件目录、图像 和文本等,效果就此较理想了。
? 二、汉字识别后生成的文本数据的属性。
? 原始性是档案的基本属性。汉字识别后生成的文本数据是根据档案的本源信息,即固定在纸 质载体上的汉字信息进行加工处理:扫描、识别、校对、修改等工序后形成的复制加工品, 因此不具有档案的原始性。
? 知识性是档案的又一个属性。汉字识别后生成的文本数据如果不计算人工校对后仍然可能存 在的微小误差,应该说具有与档案原件同等的内容,因此具有档案的知识性。
? 汉字识别后生成的文本数据是将档案的内容以特殊的物理方式重新记录在特殊的载体之上, 比以文字的方式记录在纸质载体之上更具有便于传递、接收、存储、利用以及不磨损、不丢 失等属性。因此具有更强的信息性。? 汉字识别后生成的文本数据应该说,它是一种新型的档案一次信息的复制品或编研开发成果 。但作为一种新型的复制品或编研开发成果,因其生成的目的不同,又具有两种不同的属性 :当以提供利用为目的通过汉字识别建立文本数据库时,其文本数据具有类似于汇编类档案 编研成果的属性;当以编辑出版纸质的档案编研材料如大事记、组织机构沿革、文件汇编等 为目的进行汉字识别时,其文本数据不仅具有类似于档案编研成果的属性,而且具有档案原 始性的基本属性,因为它们是印刷品或出版物的本源信息。
? 由此可见,汉字识别后生成的文本数据是一种不同于传统档案属性的新型档案信息。
? 三、汉字识别技术的应用方式? (一)利用者阅读纸质档案的之后,对其所需要的内容进行扫描和汉字识别,或打印出统 一格式的利用摘录,或直接提供文本拷贝。? 这是充分发挥OCR软件功能,深层次开发利用档案信息资源的方式。但工程量较大,人力、资金需求较多,建库周期较长。
? 随着汉字识别技术水平的提高和应用的普及,可能还会产生新的应用方式,但无论使用哪一 种方式,都必须符合本单位档案管理工作的实际,统筹考虑档案状况、人员配备、经费能力、办公自动化水平、档案化建设规划等方面的因素,以切实提高档案信息资源开发利用能力为目的,这样才能收到事半功倍的效果。
【浅析汉字识别技术在档案管理工作中的应用】相关文章:
浅析计算机技术在档案管理中的应用12-01
浅析数据融合技术及其在林业中的应用03-19
人脸信息技术应用新热点浅析03-05
简易汉字识别系统的设计03-08
浅析多媒体技术在高校音乐教学中的应用03-08
浅析3G技术及其在通信中的应用03-18
浅析纳米技术在建筑材料的应用06-11
浅析化学工程技术的应用问题12-02