中文智能搜索引擎技术研究

中文智能搜索引擎技术研究

ID:11593671

大小:27.50 KB

页数:6页

时间:2018-07-12

中文智能搜索引擎技术研究_第1页
中文智能搜索引擎技术研究_第2页
中文智能搜索引擎技术研究_第3页
中文智能搜索引擎技术研究_第4页
中文智能搜索引擎技术研究_第5页
资源描述:

《中文智能搜索引擎技术研究》由会员上传分享,免费在线阅读,更多相关内容在行业资料-天天文库

1、中文智能搜索引擎技术研究  引言  随着互联网的快速发展,网络信息量不断增加。面对数量庞大,种类多样的信息,一般搜索引擎无法为用户提供准确的检索结果,开发新的搜索引擎势在必行。智能搜索引擎不仅要提高信息检索准确性和全面性,还要满足用户个性等搜索信息需求。搜索引擎与智能代理相结合的智能化搜索引擎技术能够比较好的实现这一目标。  1搜索引擎  中文智能搜索引擎技术研究  引言  随着互联网的快速发展,网络信息量不断增加。面对数量庞大,种类多样的信息,一般搜索引擎无法为用户提供准确的检索结果,开发新的搜索引擎势在必行。智能搜索引擎不仅要提高信息检索准确性和全面性,还要满足用户个性等搜索信息需求。搜索

2、引擎与智能代理相结合的智能化搜索引擎技术能够比较好的实现这一目标。  1搜索引擎  搜索引擎基本原理  搜索引擎由信息搜集系统、文件处理系统、索引系统和检索系统组成。  信息搜集系统通过网页抓取程序在网络中顺着网页的超链接抓取网页,搜集文档的基本信息并下载至搜索引擎本地,然后将文档和其基本信息分开,并保存到原始文档数据库和文档信息数据库中。  文件处理系统负责将需要索引的文件转换成具有统一编码格式的文本文件。信息搜集系统从网络上下载文件,保存到本地供索引器索引。文件文本格式种类繁多,如纯文本文件、html格式文件、word文件、pdf文档等,文本格式相同的文件,字符编码方式也不尽相同。文件的异

3、构性要求文件处理系统将各种不同格式的类文本文件转换成纯文本文件。  索引系统将程序收集到的文件进行处理,建立索引库和索引。相关处理还包括去除重复网页、分词、判断网页类型、分析超链接,计算网页的重要度、丰富度等。  检索系统通过用户输入的关键词从索引数据库中找到与关键词匹配的网页,并按照文档得分的高低依次显示在用户浏览器中。  1.传统搜索引擎的局限性  面对浩如烟海的网络信息,用户想要通过一般搜索引擎获取准确和全面的信息较困难。其局限性表现在:  信息检索方式单一。搜索引擎一般提供网站分类查询和关键词全文检索两种方式,这两种方法均容易造成信息丢失,不能全面检索用户需要的信息;不能对用户输入的关

4、键词进行词意分析和词意扩展。如今信息的多样化要求搜索引擎不仅要检索出文档,还要检索需要的图片、视频、音频等。  不能个性化制定。传统搜索引擎提供相同的界面和检索策略,不能提供用户信息定制,不同用户输入相同的查询条件返回的结果相同。不同领域的用户对同一个关键词的搜索返回的检索结果应该不一样,智能搜索引擎能根据用户专业背景和网页浏览历史检索出用户需求的信息。  对信息的标引深度不够。搜索引擎检索的结果往往只提供线形的网址和包括关键词的网页信息,或者返回过多的无用信息,特别是对特定文献数据库的检索更显得无能为力[1]。  信息更新能力低。搜索引擎信息收集和查询是两个分离的过程,缺少有机结合。网络信息

5、资源呈分布式、动态、快速增长,搜索引擎的集中化架构不能跟上文档的扩张速度,也就不能有规律地及时更新数据库,用户检索到的结果可能不是最新信息。  智能搜索引擎  智能搜索引擎应摆脱传统搜索引擎的局限性,更加智能化,更具主动性,提供多元化的检索方式,为用户提供个性化制定,检索出满足用户个性需求。  智能搜索引擎主联盟要特征  智能性。智能化搜索引擎网络蜘蛛通过自主启发式学习选择最有效的搜索策略和最佳时机,在特定站点或者整个因特网搜集和整理信息。智能化搜索引擎可以将多个引擎的搜索结果进行整合,作为一个整体存放到数据库中。  个性化。智能化搜索引擎提供个性化制定服务,用户注册基本信息,如年龄、专业背景

6、、工作方向等,通过分析用户基本信息及平时浏览网页的记录制定出用户兴趣模块,检索出来的信息和用户兴趣相关,不同兴趣的用户输入同一个关键词返回的结果可能不同。  多元化。智能化搜索引擎有多元化的检索方式,提供基于大众的搜索分析,基于自然语言、关键词、概念和上下文,通过相关反馈技术检索可选择查询路径。对关键词进行词意扩展和词意派生,实现准确的分词,从而更加准确地把握用户的搜索需求。  协作性。智能化搜索引擎能通过各种通信协议和其它智能代理进行信息交流,并可以相互协调共同完成复杂任务[2]。  2.智能搜索引擎技术  要实现智能化搜索引擎,当前要特别加强对汉语分词技术、短语识别技术、同义词处理技术、知

7、识库与推理机应有技术和人机对话智能技术的研究。  智能化搜索引擎对语义的理解主要体现在以下两个方面:一是对用户输入的关键词的理解;二是对网页信息内容的理解。传统搜索引擎对关键字的识别是较机械的匹配方式,容易造成信息不准确和丢失。智能化搜索引擎可对用户输入的关键词进行语义理解,并返回用户想要的信息。自然语言语义理解的技术主要有4种:①汉语分词技术。中国文化博大精深,语句是由各种词语按照一定的语序组成

当前文档最多预览五页,下载文档查看全文

此文档下载收益归作者所有

当前文档最多预览五页,下载文档查看全文
温馨提示:
1. 部分包含数学公式或PPT动画的文件,查看预览时可能会显示错乱或异常,文件下载后无此问题,请放心下载。
2. 本文档由用户上传,版权归属用户,天天文库负责整理代发布。如果您对本文档版权有争议请及时联系客服。
3. 下载前请仔细阅读文档内容,确认文档内容符合您的需求后进行下载,若出现内容与标题不符可向本站投诉处理。
4. 下载文档时可能由于网络波动等原因无法下载或下载错误,付费完成后未能成功下载的用户请联系客服处理。