教学文库网 - 权威文档分享云平台
您的当前位置:首页 > 精品文档 > 高等教育 >

语言学概论讲义,精致版(13)

来源:网络收集 时间:2026-08-22
导读: 汉字识别是指一种自动高速的非键盘式汉字输入方式,属于模式识别和人工智能范畴。汉字识别系统通常由“扫描、交互式版面分析的前处理、单字识别器和自动分词汉语词上下文匹配后处理”构成。汉字识别方式主要分三大

汉字识别是指一种自动高速的非键盘式汉字输入方式,属于模式识别和人工智能范畴。汉字识别系统通常由“扫描、交互式版面分析的前处理、单字识别器和自动分词汉语词上下文匹配后处理”构成。汉字识别方式主要分三大类:联机手写汉字识别、印刷体汉字识别和手写汉字识别。 2. 语音识别和合成技术

语音合成是让计算机模拟人的发音器官的动作并发出类似声音的一个过程。目前汉语的语音合成已经实现自动生成声韵调结合的音节及一些简单的语句,并已在生活中使用,如语音电话,语音报号等等。

语音识别技术就是让机器通过识别和理解过程把语音信号转变为相应的文本或命令的高技术,即让计算机模拟人的听觉器官的反应来接受语言信号并作出反应,或给以语言答复,目前语音识别已经初步使用,即念一个字或词,计算机能识别并输入计算机甚至还变成文字符号,如现在的电话语音拨号。

语音识别是一门交叉学科。近二十年来,语音识别技术取得显著进步。我国语音识别研究工作起步于20世纪50年代,近年来发展很快。研究水平也从实验室逐步走向市场。从1987年开始执行国家863计划后,国家863智能计算机专家组为语音识别技术研究专门立项,每两年滚动一次。我国语音识别技术的研究水平已经基本上与国外同步,在汉语语音识别技术上还有自己的特点与优势,并达到国际先进水平。

语音识别技术发展到今天,已经能够满足通常应用的要求,特别是中小词汇量非特定人语音识别系统识别精度已经大于98%,对特定人语音识别系统的识别精度就更高。由于大规模集成电路技术的发展,这些复杂的语音识别系统也已经完全可以制成专用芯片,大量生产。在西方经济发达国家,大量的语音识别产品已经进入市场和服务领域。一些电话机、手机已经包含了语音识别拨号功能,还有语音记事本、语音智能玩具等产品也包括语音识别与语音合成功能。人们可以通过电话网络用语音识别口语对话系统查询有关的机票、旅游、银行信息,并且取得很好的结果。调查统计表明多达85%以上的人对语音识别的信息查询服务系统的性能表示满意。可以预测,在近五到十年内,各种各样的语音识别系统产品将出现在市场上。构造一个具有和人相比拟的语音识别系统,是人类面临的一个大的挑战,人类正在向成功迈进。 3. 文本检索和数据统计

现在计算机已经能代替手工,在大量文献中查阅相关的资料,收集需用的例句,作出分类和统计等。从语言学的角度说,文本检索跟文字处理有密切关系。一般说只要提供给计算机一定的文字信息,包括人名、著作名、刊物名等,计算机就可以自动进行检索和分类统计;如要收集跟某个词语有关的例句,统计词语在不同文本中出现的频率,分析口语文本和书面文本的语句长度差异等,计算机也可以根据给出的目标词语和符号自动完成检索。 4. 语料库和语料分析

文本检索和数据统计当然首先要有输入或储存在计算机中的语言材料,这就是语料库。语料库中的语言材料是真实的书面语或口语,并且在真实材料的基础上,做语言学的加工和分析。西方最初的语料库可追溯到中世纪,20世纪50年代以前的语料库都属于人工语料库,其建库和应用缺乏系统设计原则和有效统计手段。20世纪50年代后,第一代百万词的计算机语料库开始出现,90年代初语料库则出现了迅猛发展的势头。

语料库的发展大致可分为三个阶段。第一阶段为初始阶段。这个阶段包括从十八世纪开始到20世纪50年代计算机语料库出现前的各种手工语料库。初期的语料库主要应用于圣经与文学研究、词典编纂、方言研究、语言教育研究、语法研究等领域。第二个阶段从20世纪60年代到80年代,这个阶段以电子语料库的兴起为主要特征。各种计算机语料库纷纷建成,它的发展以容量不断增加和种类的不断扩展为主要特征。语料库发展的第三个阶段是90年代后的壮大阶段,如果上一代的电子语料库是以百万计的话,这一代的语料库则以千万甚至亿计。90年代初,语料库在英国、美国、日本及欧共体国家几乎是突然普及开来,这既与语料库在语言研究中的应用有关,也与语料库方法在涉及商业的领域的广泛应用分不开,诸如词典编撰、语音识别、语音合成以及机器翻译等。

从对语料加工的程度来看,一般将语料库分为两种:一种是未标注任何附加信息的原始文本,称作“生”语料库,这就是上面说的用于一般检索和统计的语料。这种语料库的建成手续比较简单,但是应用时的功能也相应比较单一。另一种是标注了一定附加信息的加工文本,称作“熟”语料库。当然根据标注信息的多少,语料库“熟”的程度又有不同。从语言学的角度说,建立“熟”语料库不但需要的语言学知识更多,即实际上标注的都是语言学信息;从另外一个角度上说,它对语言学研究的用处也更大,即可以有目的地对经过标注的语料进行分类和分析,从而获得更多的语言现象参数和语言学知识。语料库在词典编纂和计算机辅助教学等方面也有重要作用。因此,在语料库的设计阶段,一定要做好充分的准备,要对语料库的功能目标有清楚的了解。

5. 文本自动校对和摘要

对文稿、书稿进行校对和把一篇较长的文章加以压缩,整理出摘要,这对人来说可能不是一件太困难的事情,但交给计算机来完成就涉及到比较复杂的语言学知识了。

文稿校对对有些语言可能比较简单:如英语的拼写检查,只要在计算机中储存了一部词典和词形变化的词表,就可以完成;英语的语法错误,也可以通过确认限定动词和其他词语的关系来判断。但对有些语言来说文稿校对就比较困难,如汉语的文字错误,就字形看是无法判断其与音义的关系是对还是错,而词语是否写错或用错,更要切分词,再联系上下文,才能看出来,这就需要向计算机提供词语切分和词语搭配的更多信息。

文稿摘要一方面是利用语料库信息,如选择时间、地点、动作等要素词语,文本中复现频率最高的关键词,和各自然段的首句等;还需要利用必要的语言学知识,如通过一定的关联词语连接起重要的语句等等。文稿的校对和摘要技术虽然就目前水平看还不够完善,但它们实际上又是机器翻译、语句理解和生成等更复杂的信息处理研究的基础性实验工程,因此又有着超出其本身作用的重要价值。 ?

语言学在信息处理中的应用前景

上面讨论的是目前已经实现或初步实现的信息处理技术。当然实际上已经开展的信息处理研究还远不止这些,其中有些研究跟语言学的关系也更加紧密。但在这些信息处理研究中,有的仍在积极地研究中。虽然现在已有相关产品投入商业应用,但从技术上来说有的还需要不断改进,如机器翻译技术等;有的研究工作甚至只能说刚刚起步,如人机对话(包括复杂语句的理解和合成)和人工智能(包括会说话的机器)等研究。这些研究项目既是信息处理研究的目标,也是语言学应用研究的目标。从语言信息处理技术本身看,以下几个方面的研究将是未来一段时间的主攻方向: 1机器翻译

机器翻译是一门涉及语言学和计算机科学的综合性工程。相对于人的翻译而言,机器翻译的研究目标是利用计算机及软件把一种自然语言的文本转换为另一种自然语言,其中,我们称第一种自然语言为“源语言”,翻译后的自然语言称“目标语言”。这门新学科是研究翻译两种或多种语言的自动化问题的。它是一门多学科交叉的学科,是语言学、数学、计算机科学、自动化

科学等学科相互渗透的产物。

美国、英国和前苏联是最早开始机器翻译研究的国家。我国也早在1957年就开始了机器翻译的研究。

人工翻译需要懂得源语 …… 此处隐藏:4502字,全部文档内容请下载后查看。喜欢就下载吧 ……

语言学概论讲义,精致版(13).doc 将本文的Word文档下载到电脑,方便复制、编辑、收藏和打印
本文链接:https://www.jiaowen.net/wendang/614855.html(转载请注明文章来源)
Copyright © 2020-2025 教文网 版权所有
声明 :本网站尊重并保护知识产权,根据《信息网络传播权保护条例》,如果我们转载的作品侵犯了您的权利,请在一个月内通知我们,我们会及时删除。
客服QQ:78024566 邮箱:78024566@qq.com
苏ICP备19068818号-2
Top
× 游客快捷下载通道(下载后可以自由复制和排版)
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
注:下载文档有可能出现无法下载或内容有问题,请联系客服协助您处理。
× 常见问题(客服时间:周一到周五 9:30-18:00)