国内中文分词技术研究新进展
选填,简要介绍文档的主要内容,方便文档被更多人浏览和下载。

情报杂志2002年第11期
情报检索
国内中文分词技术研究新进展
冯书晓 徐 新(石河子大学药学院摘 要 ,。关键词 ,由于英文中词与词之间是用空格隔开,检索起来很方便,故计算机采用了词处理的方式,大大减轻了用户与计算机的工作量;相对来讲,中文的情形就复杂得多。中文的词与词之间是没有分隔符的,因此若想建立基于词的索引,就需要专门的技术,这种技术被称之为“汉语词语切分技术”。根据是否采用词语切分技术,中文搜索引擎又可分为基于字的搜索引擎和基于词的搜索引擎。由于中文信息处理的特殊性和复杂性,中文搜索引擎技术还很不成熟,开发中文搜索引擎决不像西文软件的汉化那样简单。在实现中文搜索引擎时,不能照搬国外现成的技术,需要对中文的信息处理技术作专门地研究。自然语言理解领域的应用已经越来越广,但是几乎任何一个基于汉语的系统,都必须经过分词这一步。自动分词系统是中文信息处理中的一个主要组成部分,是中文自然语言理解、文献检索、机器翻译即语音合成系统中最基本的一部分。在搜索引擎中,为了进行中文信息小型化,需要提取关键知识,也就是说首先要分隔出单个的中文词语,然后进行词频统计得到关键词。要开发中文搜索引擎,快速的汉语分词算法和可靠的汉化技术是至关重要的。本文将针对中文分词技术及近年来中文分词技术的发展作一综述。1 中文分词技术
专有名词等)。
1.1.1 数量多。汉语中常用的词有
分词数据库、知识库和推理机;另一类是机械式分词法,一般以分词词典为依据,通过文档中的汉字串和词表中的词逐一匹配来完成词的切分。下面笔者就以此对近年来中文分词技术的进展分类作一综述。
2 中文分词技术的进展
几万条《现代汉语词典》,中收录的词就达6万个之多。而且,随着社会的发展,不断
地有新词产生。
1.1.2 使用灵活、变化多样,容易产
生歧义。例如同样的两个连续汉字,在有的句子中构成一个词,而在另外的句子环境中,却可能不构成词。这给计算机的词法分析工作带来了极大的困难。
1.1.3 书写习惯。在英文系统中,
目前的分词算法多种多样,基本上可分为两大类:机械性分词和理解性分词法。后者可谓理想的方法,但在语法分析、语义分析乃至篇章理解还没有得到解决之前,其分词实用系统主要采用机械分词法,但实际上纯机械性分词也无人在用,一般都使用介于二者之间的某种分词法。在此,本人称之为综合式分词法,收录了由作者本人明确指出同时采用了机械式分词法和理解式分词法的文章。 2.1 机械式分词法 邹海山等在现有分词技术的基础上,提出了一种基于词典的正向最大匹配和逆向最大匹配相结合的中文分词方案,可以高效、准确地实现中文文档的主题词条的抽取和词频统计。应志伟等基于一个实际的文语转换系统,介绍了它的一些处理方法,采用了一种改进的最大匹配法,可以切分出所有的交集歧义,提出了一种基于统计模型的算法来处理其中的多交集歧义字段,并用穷举法和一些简单的规则相组合的方法从实用角度解决多音字的异读问题以及中文姓名的自动识别问题,达到实现文语转换的目的。陈桂林等首先介绍了一种高效的中文电子词表数据结构,它支持首字Hasb和标准的二分查找,且不限词条长度,然后提出了一种改进的快速分词算法。在快速查找两字词的基础上,利用近邻匹配方法来查找多字词,明显提高了分词效
词与词之间在书写上用空格隔开,计算机处理时可以非常容易地从文档中识别出一个一个的词。而在汉语系统中,书写以句子为单位,句间有标点隔开,在句内,字和词则是连续排列的,它们之间没有任何分隔。这样,如果要对中文文档进行基于词的处理,必须先要进行词的切分处理,以正确地识别出每一个词。
1.1.4 其它特点。诸如汉字同音
字、同音异形字等等。
1.2 一般分词方法 目前采用的分词方法主要有以下几种:最大匹配法、反向最大匹配方法、逐词遍历法、设立切分标志法、最佳匹配法、有穷多层次列举法、二次扫描法、邻接约束方法、邻接知识约束方法、专家系统方法、最少分词词频选择方法、神经网络方法等等。除了这些,许多基于统计的方法也引入到分词过程中。例如分词与词性标注一体化方法,随机有限状态算法用于分词,模拟物理研究中结晶过程的统计方法也被尝试于分词过程。此外,还有大量的基于统计或规则的汉语未登录词识别的研究,这里不能一一列举。但归纳起来不外乎两类:一类是理解式切词法,即利用汉语的语法知识和语义知识以及心理学知识进行分词,需要建立
1.1 中文词的特点 与英文不同,字是汉语的基本独立单位,但是具有一定语义的最小单位却是词。词由单个或多个字构成,一般用得最多的是二字词,其次是单字词,另外还有一些多字词(如成语、
你可能喜欢
- 中文分词算法
- 统计自然语言处理
- 搜索引擎技术
- 条件随机场
- 机器人研究
- 数据结构排序算法
- 中文分词算法概述3页
- 一种改进的中文分词正向最大匹配算法3页
- DeepWeb下基于中文分词的聚类算法4页
- 中文分词算法13页
- 中文分词算法8页
- 电子商务搜索引擎论文:电子商务搜索引擎中文分词算法分析9页
- 统计自然语言处理基本概念72页
- 统计自然语言处理基本概念72页
- 基于语料库和面向统计学的自然语言处理技术介绍12页
- 第一讲统计自然语言处理概论286页
- EM算法在统计自然语言处理中的应用3页
- 自然语言处理_基于网页的词频统计3页
- 基于条件随机场模型的汉语功能块自动标注8页
- 基于条件随机场的中文人名性别识别研究5页
- 基于条件随机场进行蛋白质二级结构预测3页
- 一种基于条件随机场的复杂背景图像文本抽取方法6页
- 基于层叠条件随机场的网络入侵识别研究8页
- 用于移动机器人多目标跟踪的混合条件随机场7页


