也谈生僻字的信息处理(1)
2014-06-17 01:47
导读:计算机应用论文论文,也谈生僻字的信息处理(1)在线阅读,教你怎么写,格式什么样,科教论文网提供各种参考范例:
摘 要:汉字生僻字的输入,一直是困扰文史工作者的难题,本文
摘 要:汉字生僻字的输入,一直是困扰文史工作者的难题,本文试在前人的 研究 基础上,提出一些关于汉字信息处理的设想和相关的解决方案。
关键字:生僻字;字符集;信息处理
汉字的信息处理经过多年的摸索,冲破了以前汉字不能进入 计算 机的迷信,取得了可喜的成绩,但离能完全满足实际使用的需要还有很长一段距离。
我们先回顾一下计算机中的字库,然后讨论生僻字的信息处理 方法 。
一、汉字库 发展 简介
汉字库通俗地说就是计算机软件系统中的汉字仓库,依据不同的标准,字库中汉字的数量是不同的,以前的主要标准有:
1、GB 2312 汉字编码字符集
从1975年开始,我国为了研究汉字的使用频度,进行了大规模的字频统计工作, 内容 包括 工业 、农业、军事、 科技 、
政治 、 经济 、文学、 艺术 、 教育 、 体育 、医药卫生、天文地理、 自然 、
化学、文字改革、考古等多方面的出版物,在数以亿计的浩瀚 文献 资料中,统计出实际使用的不同的汉字数为6335个,而其中有3000多个汉字的累计使用频度达到了99.9%,而另外的3000多个累计频度不到0.1%,说明了常用汉字与次常用汉字的数量不足7000个,这就为国家制定汉字库标准提供了依据。1980年颁布了《信息交换用汉字编码字符集—基本集》的国标交换码,国家标准号为:GB2312-80,选入了6763个汉字,分为两级,一级字库中有3755个,是常用汉字,二级字库中有3008个,是次常用汉字;还选入了682个字符,包含有数字、一般符号、拉丁字母、日本假名、希腊字母、俄文字母、拼音符号、注音字母等。以前我国大陆的各种中文DOS版本、Windows3.1 /3.2版本,装入的字库都是国标一二级字库。遇到“镕、啰、瞭、袆、祎、曌、赟、贇、鱻、驫、犇……”等汉字,既无法输入,又不能打印。
(转载自http://zw.NSEaC.com科教作文网) 后来国家技术监督局又颁布了一个与之相对应的繁体字集,全称《信息交换用汉字编码字符集辅助集》,标准号为GB/T12345-90。
2、 台湾 BIG5 字库
BIG-5码是通行于台湾、香港地区的一个繁体字编码方案,俗称“大五码”。地区标准号为:CNS11643,这就是人们讲的BIG5码。
BIG-5码收录汉字13053个,分为常用字和次常用字两部分,各部分中的汉字按笔划/部首排列。其中常用字5401个,包括台湾
教育管理部门颁布的《常用汉字标准字体表》中的全部汉字4808个,台湾中小学教科书常用字587个,异体字6个;次常用字7652个,包括台湾教育管理部门颁布的《次常用汉字标准字体表》的全部汉字6341个,《罕用汉字标准字体表》中使用频率较高的字1311个。
后来为了协助解决众多使用BIG5码单位于进行公文 电子 传递时遇到自造字无法转换CNS的 问题 ,实行了“BIG5码字集扩编计划”,1986年7月扩编完成,这就是所谓的“BIG5 码”。
BIG5 码系以CNS为蓝本,共增编标准字集4760个字符与推荐字集3250个字符;其标准字集即纳编CNS第3字面字集内之4145个,第4个字面字集内之219个字,均为一般文书常用之中文字,总支持文字量达141376个
3、大字符集字库(又叫GBK字库)
国际标准化组织为了将世界各民族的文字进行统一编码,制定了UCS标准。根据这一标准,中、日、韩三国共同制定了《CJK统一汉字编码字符集》,其国际标准号为:ISO/IEC10646,国家标准号为:GB13000-90,该汉字编码字符集就是通常人们所说的大字符集,它编入了20902个汉字,收集了大陆一二级字库中的简体字,台湾《通用汉字标准交换码》中的繁体字,58个香港特别用字和92个延边地区朝鲜族“吏读”字,甚至涵盖了日文与韩文中的通用汉字,满足了方方面面的需要。Windows95/98/NT/2000中都装入了大字符集汉字库,人们一般称它为GBK(“国家标准扩展”的拼音缩写)字库。
(科教作文网http://zw.ΝsΕAc.com发布) 4、新标准汉字库
2000年3月,国家信息产业部和质量技术监督局在北京联合发布了《信息技术和信息交换用汉字编码字符集、基本集的扩充》,国家标准号为:GB18030-2000,收录了27000多个汉字,还收录了藏、蒙、维等主要少数民族的文字,以期一举解决邮政、户政、 金融 、地理信息系统等生僻汉字与主要少数民族语言的输入,该标准于2000年12月31日强制执行。 GB 18030-2000 作为 GBK for Unicode 3.0 的更新而诞生,它带有包含所有Unicode 的扩展,完全向下兼容 GB 2312-1980 和 GBK。