电商设计网站素材,1688网,微商怎么做推广加好友,佛山网站建设优化Nutch 是一个开源Java 实现的搜索引擎。它提供了我们运行自己的搜索引擎所需的全部工具。包括全文搜索和Web爬虫。 Nutch的创始人是Doug Cutting#xff0c;他同时也是Lucene、Hadoop和Avro开源项目的创始人。Nutch 诞生于2002年8月#xff0c;是Apache旗下的一个用Java实现的…Nutch 是一个开源Java 实现的搜索引擎。它提供了我们运行自己的搜索引擎所需的全部工具。包括全文搜索和Web爬虫。 Nutch的创始人是Doug Cutting他同时也是Lucene、Hadoop和Avro开源项目的创始人。Nutch 诞生于2002年8月是Apache旗下的一个用Java实现的开源搜索引擎项目自Nutch1.2版本之后Nutch已经从搜索引擎演化为网络爬 虫接着Nutch进一步演化为两大分支版本1.X和2.X这两大分支最大的区别在于2.X对底层的数据存储进行了抽象以支持各种底层存储技术。在 Nutch的进化过程中产生了Hadoop、Tika、Gora和Crawler Commons四个Java开源项目。如今这四个项目都发展迅速极其火爆尤其是Hadoop其已成为大规模数据处理的事实上的标准。Tika使用多 种现有的开源内容解析项目来实现从多种格式的文件中提取元数据和结构化文本Gora支持把大数据持久化到多种存储实现Crawler Commons是一个通用的网络爬虫组件。 Nutch 致力于让每个人能很容易, 同时花费很少就可以配置世界一流的Web搜索引擎. 为了完成这一宏伟的目标, Nutch必须能够做到: 每个月取几十亿网页 为这些网页维护一个索引 对索引文件进行每秒上千次的搜索 提供高质量的搜索结果 以最小的成本运作 在线Javadochttp://tool.oschina.net/apidocs/apidoc?apinutch2.0