使用Lucene怎么实现一个中文分词器-快上网网站建设公司

使用Lucene怎么实现一个中文分词器

这期内容当中小编将会给大家带来有关使用 Lucene怎么实现一个中文分词器，文章内容丰富且以专业的角度为大家分析和叙述，阅读完这篇文章希望大家可以有所收获。

创新互联公司是一家朝气蓬勃的网站建设公司。公司专注于为企业提供信息化建设解决方案。从事网站开发，网站制作，网站设计，网站模板，微信公众号开发，软件开发，小程序开发，10年建站对成都火锅店设计等多个领域，拥有丰富的网站维护经验。

什么是中文分词器

学过英文的都知道，英文是以单词为单位的，单词与单词之间以空格或者逗号句号隔开。

而中文的语义比较特殊，很难像英文那样，一个汉字一个汉字来划分。

所以需要一个能自动识别中文语义的分词器。

StandardAnalyzer：
Lucene自带的中文分词器

单字分词：就是按照中文一个字一个字地进行分词。如：“我爱中国”，
效果：“我”、“爱”、“中”、“国”。

CJKAnalyzer

二分法分词：按两个字进行切分。如：“我是中国人”，效果：“我是”、“是中”、“中国”“国人”。

上边两个分词器无法满足需求。

使用中文分词器IKAnalyzer

IKAnalyzer继承Lucene的Analyzer抽象类，使用IKAnalyzer和Lucene自带的分析器方法一样，将Analyzer测试代码改为IKAnalyzer测试中文分词效果。

如果使用中文分词器ik-analyzer，就在索引和搜索程序中使用一致的分词器ik-analyzer。

使用luke测试IK中文分词

（1）打开Luke，不要指定Lucene目录。否则看不到效果

（2）在分词器栏，手动输入IkAnalyzer的全路径

org.wltea.analyzer.lucene.IKAnalyzer

改造代码，使用IkAnalyzer做分词器
添加jar包

修改分词器代码

// 创建中文分词器

Analyzer analyzer = new IKAnalyzer();

扩展中文词库

拓展词库的作用：在分词的过程中，保留定义的这些词

1在src或其他source目录下建立自己的拓展词库，mydict.dic文件，例如：

2在src或其他source目录下建立自己的停用词库，ext_stopword.dic文件

停用词的作用：在分词的过程中，分词器会忽略这些词。

3在src或其他source目录下建立IKAnalyzer.cfg.xml，内容如下（注意路径对应）：

"1.0" encoding="UTF-8"?>

IK Analyzer 扩展配置

"ext_dict">mydict.dic

"ext_stopwords">ext_stopword.dic

上述就是小编为大家分享的使用 Lucene怎么实现一个中文分词器了，如果刚好有类似的疑惑，不妨参照上述分析进行理解。如果想知道更多相关知识，欢迎关注创新互联行业资讯频道。

网站名称：使用Lucene怎么实现一个中文分词器
文章链接：http://www.cdkjz.cn/article/pcoceg.html

多年建站经验

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

咨询相关问题或预约面谈，可以通过以下方式与我们联系

网站建设

网站推广

案例

方案

电商网站开发

微信小程序

我们

联系

精准传达 • 有效沟通

查看其它板块

使用Lucene怎么实现一个中文分词器

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接

网络推广

Network promotion

网站方案

Solution

电商网站开发

E-commerce & System

我们

About Us

联系

Contact Us

精准传达 • 有效沟通

查看其它板块

使用Lucene怎么实现一个中文分词器

相关资讯

css2样式 css样式写在哪个位置

html5释放内存 h5页面内存占用过高

linux命令zcvf 创建目录Linux命令

ios移动端开发学什么 ios移动开发是干什么的

ios卡片开发规范 apple卡片

linux系统中网络命令 linux网络操作命令

mysqlocp证书怎么下载 mysql opc 认证

包含mysql怎么查字段不同的词条

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线 成都：13518219792 座机：028-86922220

友情链接 交换友情链接

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接