Solr学习总结(八)IK 中文分词的配置和使用
2016-06-20 10:00
507 查看
最近,很多朋友问我solr 中文分词配置的问题,都不知道怎么配置,怎么使用,原以为很简单,没想到这么多朋友都有问题,所以今天就总结总结中文分词的配置吧。
有的时候,用户搜索的关键字,可能是一句话,不是很规范。所以在 Solr 中查询出的时候,就需要将用户输入的关键字进行分词。
目前有很多优秀的中文分词组件。本篇只以 IKAnalyzer 分词为例,讲解如何在 solr 中及集成中文分词,使用 IKAnalyzer的原因 IK 比其他中文分词维护的勤快,和 Solr 集成也相对容易。具体就不多介绍,这里直接solr 集成 IK 的方法。
1. 首先,下载IKAnalyzer ,下载
注意:以前老的IK 不支持Solr 5.3的版本 ,请注意下载最新的。
2. 将ik的相关文件 拷贝到 webapps\solr\WEB-INF\lib 目录下
3. 在 solr_home\mycore1\conf\schema.xml 增加如下配置
同时,把需要分词的字段,设置为text_ik,
4. 重启服务,
注意:如果之前已经创建了索引,需要将之前的索引删掉,重新创建分词后的索引。
5. 在admin后台, analysis 下查看分词效果。
1. 中文分词效果
![](http://images2015.cnblogs.com/blog/306976/201606/306976-20160617142424276-1035325487.png)
2. 索引查询效果
有的时候,用户搜索的关键字,可能是一句话,不是很规范。所以在 Solr 中查询出的时候,就需要将用户输入的关键字进行分词。
目前有很多优秀的中文分词组件。本篇只以 IKAnalyzer 分词为例,讲解如何在 solr 中及集成中文分词,使用 IKAnalyzer的原因 IK 比其他中文分词维护的勤快,和 Solr 集成也相对容易。具体就不多介绍,这里直接solr 集成 IK 的方法。
1. 首先,下载IKAnalyzer ,下载
注意:以前老的IK 不支持Solr 5.3的版本 ,请注意下载最新的。
2. 将ik的相关文件 拷贝到 webapps\solr\WEB-INF\lib 目录下
3. 在 solr_home\mycore1\conf\schema.xml 增加如下配置
<!-- 我添加的IK分词 --> <fieldType name="text_ik" class="solr.TextField"> <analyzer type="index" isMaxWordLength="false" class="org.wltea.analyzer.lucene.IKAnalyzer"/> <analyzer type="query" isMaxWordLength="true" class="org.wltea.analyzer.lucene.IKAnalyzer"/> </fieldType>
同时,把需要分词的字段,设置为text_ik,
<field name="id" type="int" indexed="true" stored="true" required="true" multiValued="false" /> <field name="name" type="text_ik" indexed="true" stored="true" required="true" multiValued="false" /> <field name="title" type="text_ik" indexed="true" stored="true" required="true" multiValued="false" /> <field name="category" type="int" indexed="true" stored="true" required="true" multiValued="false" /> <field name="content" type="text_ik" indexed="true" stored="true" required="true" multiValued="false" /> <field name="price" type="double" indexed="true" stored="true" required="true" multiValued="false" /> <field name="color" type="string" indexed="true" stored="true" required="true" multiValued="false" /> <field name="orderBy" type="int" indexed="true" stored="true" required="true" multiValued="false" /> <field name="updatetime" type="date" indexed="true" stored="true" required="true" multiValued="false" />
4. 重启服务,
注意:如果之前已经创建了索引,需要将之前的索引删掉,重新创建分词后的索引。
5. 在admin后台, analysis 下查看分词效果。
1. 中文分词效果
![](http://images2015.cnblogs.com/blog/306976/201606/306976-20160617142424276-1035325487.png)
2. 索引查询效果
![](http://images2015.cnblogs.com/blog/306976/201606/306976-20160617142612010-1172385484.png)
相关文章推荐
- 简单的代码实现的炫酷navigationbar
- 树莓派上基于图形界面的安装程序-synaptic
- 百度坐标转换 的异步转码问题
- 在代码中,通过资源XML获取数组
- 使用Symantec代码签名证书对代码进行签名的 5 个理由
- HDU 2677 Dota all stars 深搜
- spring MVC controller中的方法跳转到另外controller中的某个method的方法
- Eclipse使用入门指南及技巧
- 转:this的用法
- ios学习路线—iOS高级(Socket(AsyncSocket))
- android studio Unknown attribute
- 继承、实现、依赖、关联、聚合、组合定义与区分
- 三分钟了解Activity工作流
- Tomcat如何检测内存泄漏
- Tomcat如何检测内存泄漏
- 安装交叉编译器后,无法执行arm-linux-gcc -v
- bootatrap取消所有圆角
- 请求重定向与请求转发的区别
- JQuery学习二: DOM操作
- Python下利用epd_free安装pandas