Java开源搜索引擎分类列表_第1页
Java开源搜索引擎分类列表_第2页
Java开源搜索引擎分类列表_第3页
全文预览已结束

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、Java开源搜索引擎分类列表Nutch是一个开源Java实现的搜索引擎。它提供了我们运行自己的搜索引擎所需的全部工 具。包括全文搜索和Web爬虫。Solr是一个高性能,采用Java5开发,基于Lucene的全文搜索服务器。文档通过Http利用 XML加到一个搜索集合中。查询该集合也是通过http收到一个XML/JSON响应来实现。它 的主要特性包括:高效、灵活的缓存功能,垂直搜索功能,高亮显示搜索结果,通过索引复 制来提高可用性,提供一套强大Data Schema来定义字段,类型和设置文本分析,提供基于 Web的管理界面等。Egothor是一个用Java编写的开源而高效的全文本搜索引擎。借助J

2、ava的跨平台特性, Egothor能应用于任何环境的应用,既可配置为单独的搜索引擎,又能用于你的应用作为全 文检索之用。更多Egothor信息NutchNutch是一个开源Java实现的搜索引擎。它提供了我们运行自己的搜索引擎所需的全部工 具。包括全文搜索和Web爬虫。更多Nutch信息LuceneApache Lucene是一个基于Java全文搜索引擎,利用它可以轻易地为Java软件加入全文搜寻 功能。Lucene的最主要工作是替文件的每一个字作索引,索引让搜寻的效率比传统的逐字 比较大大提高,Lucen提供一组解读,过滤,分析文件,编排和使用索引的API,它的强大 之处除了高效和简单外,

3、是最重要的是使使用者可以随时应自已需要自订其功能。更多Lucene信息Oxyus是一个纯java写的web搜索引擎。更多Oxyus信息BDDBotBDDBot是一个简单的易于理解和使用的搜索引擎。它目前在一个文本文件(urls.txt洌出的 URL中爬行,将结果保存在一个数据库中。它也支持一个简单的Web服务器,这个服务器 接受来自浏览器的查询并返回响应结果。它可以方便地集成到你的Web站点中。更多BDDBot信息ZilverlineZilverline是一个搜索引擎,它通过web方式搜索本地硬盘或intranet上的内容。Zilverline 可以从 PDF, Word, Excel, Po

4、werpoint, RTF, txt, java, CHM,zip, ra等文档中抓取它们的内容来 建立摘要和索引。从本地硬盘或intranet中查找到的结果可重新再进行检索。Zilverline支持 多种语言其中包括中文。更多Zilverline信息XQEngineXQEngine用于XML文档的全文本搜索引擎.利用XQuery做为它的前端查询语言.它能够让 你查询XML文档集合通过使用关键字的逻辑组合.有点类似于Google与其它搜索引擎搜索 HTML文档一样.XQEngine只是一个用Java开发的很紧凑的可嵌入的组件.更多XQEngine信息MG4JMG4J可以让你为大量的文档集合构建

5、一个被压缩的全文本索引,通过使内插编码 (interpolative coding)技术.更多MG4J信息JXTA SearchJXTA Search是一个分布式的搜索系统.设计用在点对点的网络与网站上.更多JXTA Search信息YaCyYaCy基于p2p的分布式Web搜索引擎.同时也是一个Http缓存代理服务器.这个项目是构建 基于p2p Web索引网络的一个新方法.它可以搜索你自己的或全局的索引,也可以Crawl自己 的网页或启动分布式Crawling等.更多YaCy信息Red-PiranhaRed-Piranha是一个开源搜索系统,它能够真正”学习”你所要查找的是什么.Red-Pir

6、anha可作 为你桌面系统(Windows,Linux与Mac)的个人搜索引擎,或企业内部网搜索引擎,或为你的网 站提供搜索功能,或作为一个P2P搜索引擎,或与wiki结合作为一个知识/文档管理解决方案, 或搜索你要的RSS聚合信息,或搜索你公司的系统(包括SAP,Oracle或其它任何Database/Data source),或用于管理PDF,Word和其它文档,或作为一个提供搜索信息的WebService或为你的 应用程序(Web,Swing,SWT,Flash,Mozilla-XUL,PHP, Perl或 c#/.Net)提供搜索后台等等.更多Red-Piranha信息LIUSLIUS

7、是一个基于Jakarta Lucene项目的索引框架。LIUS为Lucene添加了对许多文件格式的 进行索引功能如:Ms Word,Ms Excel,Ms PowerPoint,RTF,PDF,XML,HTML,TXT,Open Office序列和 JavaBeans。 针对JavaBeans的索引特别有用当我们要对数据库进行索引或刚好用户使用持久层ORM技 术如:Hibernate,JDO,Torque,TopLink进行开发时。更多LIUS信息ApertureAperture这个Java框架能够从各种各样的资料系统(如:文件系统、Web站点、IMAP和Outlook 邮箱)或存在这些系统中

8、的文件(如:文档、图片)爬取和搜索其中的全文本内容与元数据。它 当前支持的文件格式如下:, Plain textHTML, XHTMLXML, PDF (Portable Document Format), RTF (Rich Text Format)Microsoft Office: Word, Excel, Powerpoint, Visio, PublisherMicrosoft Works, OpenOffice 1.x: Writer, Calc, Impress, DrawStarOffice 6.x - 7.x+: Writer, Calc, Impress, DrawOpenD

9、ocument (OpenOffice 2.x, StarOffice 8.x)Corel WordPerfect, Quattro, PresentationsEmails (.eml files)更多Aperture信息Apache SolrSolr是一个高性能,采用Java5开发,基于Lucene的全文搜索服务器。文档通过Http利用 XML加到一个搜索集合中。查询该集合也是通过http收到一个XML/JSON响应来实现。它 的主要特性包括:高效、灵活的缓存功能,垂直搜索功能,高亮显示搜索结果,通过索引复 制来提高可用性,提供一套强大Data Schema来定义字段,类型和设置文本分析,提供基于 Web的管理界面等。更多Apache Solr信息PaodingPaoding中文分词是一个使用Java开发的,可结合到Lucene应用中的,为互联网、企业内 部网使用的中文搜索引擎分词组件。Paoding填补了国内中文分词方面开源组件的空白,致 力于此并希翼成为互联网网站首选的中文分词开源组件。Paoding中文分词追求分词的高效 率和用户良好体验。更多Paoding信息Carrot2Carrot2是一个开源搜索结果分类引擎。它能够自动

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论