搜索引擎技术原理
搜索引擎技术原理
搜索引擎(search engine)是指根据一定的策略、运用特定的计算机程序搜集互联网上的信息,在对信息进行组织和处理后,为用户提供检索服务的系统。
一、Web搜索引擎技术综述
(一) 、引子
随着网络技术的应用与发展,互连网已经成为信息的重要来源地。搜索引擎以一定的策略在互联网中搜集、发现信息,对信息进行理解、提取、组织和处理,并为用户提供检索服务,从而起到信息导航的目的,互联网用户使用网络获取信息过程中,搜索引擎也成为必不可少的工具。调查表明,当前的所有互连网应用中,网络信息搜索是仅次于电子邮件的第二大应用,而这些搜索绝大多数是专门的,高度复杂的搜索引擎实现的。
按照信息搜集方法和服务提供方式的不同,搜索引擎系统可以分为三大类:
① 目录式搜索引擎,以人工方式或半自动方式搜集信息,由编辑员查看信息之后,人工形成信息摘要,并将信息置于事先确定的分类框架中,由于web信息的海量性和人工处理能力、经济代价的限制,这类搜索引擎信息的即时性和全面性难以保证,它的优秀代表是Yahoo等。
② 机器人搜索引擎,由一个称为蜘蛛(Spider)的机器人程序以某种策略自动地在互联网中搜集和发现信息,由索引器为搜集到的信息建立索引,由检索器根据用户的查询输入检索索引库,并将查询结果返回给用户,这类搜索引擎实现较为复杂,但能很好的实现信息的全面获取和即时更新,它的优秀代表是Google等。
③ 元搜索引擎,这类搜索引擎没有自己的数据,而是将用户的查询请求同时向多个搜索引擎递交,将返回的结果进行重复排除、重新排序等处理后,作为自己的结果返回给用户,这类搜索引擎兼集多个搜索引擎的信息,并且加入新的排序和信息过滤,可以很好的提高用户满意度。
(二) 、web搜索引擎的原理和实现
web搜索引擎的原理通常为:首先是用蜘蛛(Spider)进行全网搜索,自动抓取网页;然后将抓取的网页进行索引,同时也会记录与检索有关的属性,中文搜索引擎中还需要首先对中文进行分词;最后,接受用户查询请求,检索索引文件并按照各种参数进行复杂的计算,产生结果并返回给用户。
1.利用网络蜘蛛获取网络资源
这是一种半自动化的资源(由于此时尚未对资源进行分析和理解,不能成为信息而仅是资源)获取方式。所谓半自动化,是指搜索器需要人工指定起始网络资源URL(Uniform Resource Locator),然后获取该URL所指向的网络资源,并分析该资源所指向的其他资源并获取。如Google的在利用蜘蛛程序获取网络资源时,是由一个认
你可能喜欢
- 搜索引擎原理
- 波浪理论口诀
- 经典小故事
- 电信宽带故障
- 信息挖掘
- 循环流化床锅炉
- 教师资格考试
- 数据库原理及应用
- 搜索引擎营销特性及原理2页
- 搜索引擎工作的基本原理2页
- 掌握搜索引擎的工作原理26页
- 搜索引擎原理48页
- 搜索引擎的工作原理5页
- 搜索引擎技术原理5页
- 20个经典小故事24页
- 20个经典小故事17页
- 经典小故事2页
- 20个经典小故事14页
- 36个超级经典小故事45页
- 师范生要会讲的20个经典小故事8页
- 电信宽带常见故障处理宝典13页
- 杭州电信宽带故障总结2页
- 联通电信宽带、手机故障终极办理及处理方案15页
- 电信宽带用户端常见故障处理指南2页
- 电信宽带故障AD预处理7页
- 电信宽带故障FTTH预处理3页
- 浅谈互联网信息挖掘技术3页
- 客户信息的数据挖掘8页
- 网络信息资源检索挖掘3页
- 信息挖掘和分析技术6页
- 自媒体中的信息挖掘1页
- 网络信息挖掘6页
- 130t循环流化床锅炉施工方案26页
- 循环流化床锅炉原理49页
- 循环流化床锅炉名词解释1页
- 循环流化床锅炉主体结构及其关键部件3页
- 循环流化床锅炉的工作原理及特点2页
- 循环流化床锅炉国际上的最新进展7页


