1. 从附件中下载中文停止词,如果有需要,你也可以下载英文停止词,操作步骤一样。
2. 可以在Tomcat的Solr 中的某个位置创建一个文件,比如叫stopwords.txt,此处我直接将stopwords.txt放在core目录下,即和schema.xml在同一个目录中。
3.将上面下载的中英文停止词加入到stopwords.txt中
4.如果你还不懂怎么在solr中配置mmseg4j,可参照我之前的博客。
5.修改schema.xml,
1)确保schema.xml中有这样的配置:
<filter class="solr.StopFilterFactory"ignoreCase="true"words="stopwords.txt" />
2) 在mmseg4j相应的field定义中加入该过滤器
<!-- mmseg4j--> <fieldType name="text_mmseg4j_complex"class="solr.TextField"positionIncrementGap="100" > <analyzer> <tokenizer class="com.chenlb.mmseg4j.solr.MMSegTokenizerFactory"mode="complex"dicPath="dic"/> <filter class="solr.StopFilterFactory"ignoreCase="true"words="stopwords.txt" /> </analyzer> </fieldType> <fieldType name="text_mmseg4j_maxword"class="solr.TextField"positionIncrementGap="100" > <analyzer> <tokenizer class="com.chenlb.mmseg4j.solr.MMSegTokenizerFactory"mode="max-word"dicPath="dic"/> <filter class="solr.StopFilterFactory"ignoreCase="true"words="stopwords.txt" /> </analyzer> </fieldType> <fieldType name="text_mmseg4j_simple"class="solr.TextField"positionIncrementGap="100" > <analyzer> <!-- <tokenizer class="com.chenlb.mmseg4j.solr.MMSegTokenizerFactory" mode="simple" dicPath="n:/OpenSource/apache-solr-1.3.0/example/solr/my_dic"/> --> <tokenizer class="com.chenlb.mmseg4j.solr.MMSegTokenizerFactory"mode="simple"dicPath="dic"/> <filter class="solr.StopFilterFactory"ignoreCase="true"words="stopwords.txt" /> </analyzer> </fieldType> <!-- mmseg4j-->
3)重启tomcat
测试你会发现相应的停止词如的、地、得等已经不会再影响分词结果。
相关推荐
solr6配置mmseg4j,里面包含mmseg4j需要jar包、dic文件、详细配置说明文档,里面有详细截图和需要文件
mmseg4j-solr-mmseg4j-solr-2.2.0.zip
mmseg4j-solr-2.3.0.jar 支持 solr5.x 版本以上 分词器本身并未做升级还是mmseg4j-core-1.10.0 和 mmseg4j-analysis-1.9.1.jar为了方便也一并上传
兼容solr4.10.3的mmseg4j-1.9.1分词器
在tomcat环境下搭建solr和mmseg4j搜索引擎,包括客户端调用实例
solr6.3下好用的mmseg4j分词库,测试可用。
Tomcat+Solr+MMseg4j的配置,文档中附带资源下载地址
solr6配置mmseg4j所需dic文件和jar包,包括word.dic,mmseg4j-core-1.10.0.jar,mmseg4j-solr-2.3.0.jar
Solr3.2+mmseg4j-1.8.4中文搜索引擎 demo 在C盘根目录
本人用的solr是4.10的,经过本人亲测可用,放心下载,包含以下3个jar包: mmseg4j-analysis-1.9.1.jar, mmseg4j-core-1.9.1.jar, mmseg4j-solr-2.2.0.jar
里面包含了mmseg4j-solr-2.0.0.jar,mmseg4j-solr-2.1.0.jar,mmseg4j-solr-2.2.0.jar,mmseg4j-solr-2.3.0.jar总共4个文件,其中: mmseg4j-solr-2.0.0.jar 要求 lucene/solr >= 4.3.0。在 lucene/solr [4.3.0, 4.7.1]...
与solr4.8匹配的mmseg4j分词器的版本
该压缩包包含`mmseg4j-solr-2.3.2.jar`和`mmseg4j-core-1.10.0.jar`,其中solr-2.3.2不是官方的版本,该版本有改动,使得mmseg4j可以很好的支持Solr6,如果你的Solr低于Solr6,请使用官方的mmseg4j-solr-2.3.0.jar...
在tomcat环境下搭建solr和mmseg4j搜索引擎 在tomcat环境下搭建solr和mmseg4j搜索引擎
mmseg4j-solr-2.3.0-with-mmseg4j-core是Solr的中文分词包,该压缩包含有mmseg4j-core-1.10.0.jar和mmseg4j-solr-2.3.0.jar。
mmseg4j中文分词器 mmseg4j-core-1.10.0.jar mmseg4j-solr-2.3.0.jar两个主要依赖包
包里包含了至今mmseg4j的所有版本及版本对应solr版本说明,还有solr配置和自定义词典路径相关配置文章
1、mmseg4j最新jar完美整合solr-5.3.0。 2、mmseg4j-solr-2.3.1-SNAPSHOT.jar mmseg4j-core-1.10.1-SNAPSHOT.jar
之前在网上下载的mmseg4j都不能适配最新的solr5.2.1,后来找到了最新版的jar包完美解决
mmseg4j-core-1.10.0+mmseg4j-solr-2.3.0()mmseg4j-solr-2.3.0.jar 要求 lucene/solr [5.0, ])