中文智能搜索引擎技术研究

中文智能搜索引擎技术研究

ID:9675317

大小:49.50 KB

页数:3页

时间:2018-05-05

中文智能搜索引擎技术研究_第1页
中文智能搜索引擎技术研究_第2页
中文智能搜索引擎技术研究_第3页
资源描述:

《中文智能搜索引擎技术研究》由会员上传分享,免费在线阅读,更多相关内容在应用文档-天天文库

1、中文智能搜索引擎技术研究中文智能搜索引擎技术研究引言  随着互联网的快速发展,网络信息量不断增加。面对数量庞大,种类多样的信息,一般搜索引擎无法为用户提供准确的检索结果,开发新的搜索引擎势在必行。智能搜索引擎不仅要提高信息检索准确性和全面性,还要满足用户个性等搜索信息需求。搜索引擎与智能代理相结合的智能化搜索引擎技术能够比较好的实现这一目标。  1搜索引擎  1.1搜索引擎基本原理  搜索引擎由信息搜集系统、文件处理系统、索引系统和检索系统组成。  信息搜集系统通过网页抓取程序(spider)在网络中顺着网页的超链接抓取网页,搜集文档的基本信息并下载至搜索引擎本地,然

2、后将文档和其基本信息分开,并保存到原始文档数据库和文档信息数据库中。  文件处理系统负责将需要索引的文件转换成具有统一编码格式的文本文件。信息搜集系统从网络上下载文件,保存到本地供索引器索引。文件文本格式种类繁多,如纯文本文件、html格式文件、.收集整理要特征  (1)智能性。智能化搜索引擎网络蜘蛛通过自主启发式学习选择最有效的搜索策略和最佳时机,在特定站点或者整个因特网搜集和整理信息。智能化搜索引擎可以将多个引擎的搜索结果进行整合,作为一个整体存放到数据库中。  (2)个性化。智能化搜索引擎提供个性化制定服务,用户注册基本信息,如年龄、专业背景、工作方向等,通过分

3、析用户基本信息及平时浏览网页的记录制定出用户兴趣模块,检索出来的信息和用户兴趣相关,不同兴趣的用户输入同一个关键词返回的结果可能不同。  (3)多元化。智能化搜索引擎有多元化的检索方式,提供基于大众的搜索分析,基于自然语言、关键词、概念和上下文,通过相关反馈技术检索可选择查询路径。对关键词进行词意扩展和词意派生,实现准确的分词,从而更加准确地把握用户的搜索需求。  (4)协作性。智能化搜索引擎能通过各种通信协议和其它智能代理进行信息交流,并可以相互协调共同完成复杂任务[2]。  2.2智能搜索引擎技术  要实现智能化搜索引擎,当前要特别加强对汉语分词技术、短语识别技术

4、、同义词处理技术、知识库与推理机应有技术和人机对话智能技术的研究。  智能化搜索引擎对语义的理解主要体现在以下两个方面:一是对用户输入的关键词的理解;二是对网页信息内容的理解。传统搜索引擎对关键字的识别是较机械的匹配方式,容易造成信息不准确和丢失。智能化搜索引擎可对用户输入的关键词进行语义理解,并返回用户想要的信息。自然语言语义理解的技术主要有4种:①汉语分词技术。中国文化博大精深,语句是由各种词语按照一定的语序组成的。汉语对词语的划分相对英文来说复杂得多,汉语词语可以是由一个字或者多个字组成。汉语分词技术主要有基于字典、词库匹配的分词、基于词频度和基于知识理解的分词

5、,通过这些方法准确把握用户输入关键词的含义;②短语识别技术。短语是由词语所构成的,是句子中基本的识别单位,在汉语句法分析和语义分析中具有重大意义。用户搜索有时需要对关键词加一定的修饰词,例如关键字为搜索,加入修饰词可为个性化的搜索,前者就是词语,后者为短语。需要通过短语识别技术对关键词进行正确的分词,从而准确理解用户的查询需求;③同义词处理技术。包括基于词汇字面相似度算法、基于词素的语义相似度算法以及基于《同义词词林》、《知网》等语义词典的语义相似度算法。主要依靠人工方式构造同义词库等辅助词库,利用搜索引擎主动联想技术实现对同义词的联想,准确把握用户关键词语义;④知识

6、库构建技术。知识库包含各种词典,词典按其功能不同可分成定义词词典、同名词词典、派生词词典等,词典按词的确定性又可分成系统词典与用户词典。这些词典构成了一个庞大而复杂的知识库。  人机接口智能化主要有以下技术:①人机交互界面技术。智能化搜索引擎界面具有智能化、多元化、个性化等特点。其技术主要包括搜索请求提交技术、搜索结果表现技术、搜索向导技术、搜索行为分析技术。其中,搜索行为分析技术是个性化搜索的关键技术,它通过分析用户的浏览记录和搜索习惯来提高搜索效率;②关联式综合搜索。将图片、新闻等各种有关联的信息呈现在同一界面上,用户搜索时只需查询一次,即可在同一界面得到各种有关

7、联的查询结果。  随着云技术的出现,智能搜索引擎将全球服务器当作一个云系统,从而极大提升从数据库中提取信息速度。云技术的成熟能够有效提升搜索引擎的算法速度,提高智能搜索引擎的运行速度[3]。  3结语  智能化搜索引擎技术的发展首先应该解决目前搜索引擎的局限性,然后再添加智能搜索。智能搜索引擎应该在以下几个方面寻求发展:提供友好的查询界面;多元化的检索方式;强大的自然语言理解技术;丰富的知识库;考虑按时间、地域顺序输出检索结果,以便用户选择所需的最新信息;查询结果文摘动态生成;结果自动综合分析和评分[4]。  随着搜索引擎技术的发展,智能化搜索引擎变

当前文档最多预览五页,下载文档查看全文

此文档下载收益归作者所有

当前文档最多预览五页,下载文档查看全文
温馨提示:
1. 部分包含数学公式或PPT动画的文件,查看预览时可能会显示错乱或异常,文件下载后无此问题,请放心下载。
2. 本文档由用户上传,版权归属用户,天天文库负责整理代发布。如果您对本文档版权有争议请及时联系客服。
3. 下载前请仔细阅读文档内容,确认文档内容符合您的需求后进行下载,若出现内容与标题不符可向本站投诉处理。
4. 下载文档时可能由于网络波动等原因无法下载或下载错误,付费完成后未能成功下载的用户请联系客服处理。