lucene分词器中的Analyzer,TokenStream, Tokenizer, TokenFilter

lucene分词器中的Analyzer,TokenStream, Tokenizer, TokenFilterTokenStream:分词器做好处理之后得到的一个流。这个流中存储了分词的各种信息,可以通过TokenStream有效的获取到分词单元。以下是把文件流转换成分词流(TokenStream)的过程首先,通过Tokenizer来进行分词,不同分词器有着不同的Tokenzier,Tokenzier分完词后,通过TokenFilter对已经分好词的数据进行过滤,比如停止词。过滤完之后,把所有的数据组合成一个TokenStream;

大家好,又见面了,我是你们的朋友全栈君。分词器的核心类:


Analyzer:
分词器


TokenStream:
分词器做好处理之后得到的一个流。这个流中存储了分词的各种信息,可以通过TokenStream有效的获取到分词单元。


以下是把文件流转换成分词流(TokenStream)的过程

首先,通过Tokenizer来进行分词,不同分词器有着不同的Tokenzier,Tokenzier分完词后,通过TokenFilter对已经分好词的数据进行过滤,比如停止词。过滤完之后,把所有的数据组合成一个TokenStream;以下这图就是把一个reader转换成TokenStream:lucene分词器中的Analyzer,TokenStream, Tokenizer, TokenFilter

这个TokenStream中存有一些属性,这些属性会来标识这个分词流的元素。

在这个流里 有很多属性。下面截了lucene4.10.1源码中的图:

lucene分词器中的Analyzer,TokenStream, Tokenizer, TokenFilter

     其中有3个重要的属性,CharTermAttribute(保存相印的词汇),OffsetAttribute(保存各个词汇的偏移量),PositionIncrementAttribute(保存各个词与词之间的位置增量,如果为0,可以做同义词搜索)。是由这3个属性来控制这些分词信息
    Tokenzier 主要负责接收Reader,将Reader进行分词操作,有如下一些实现类

lucene分词器中的Analyzer,TokenStream, Tokenizer, TokenFilter

TokenFilter  将分词的出来的单元,进行各种各样的过滤。 


代码如下:

<span style="font-size:14px;">package hhc;

import java.io.IOException;
import java.io.StringReader;

import org.apache.lucene.analysis.Analyzer;
import org.apache.lucene.analysis.TokenStream;
import org.apache.lucene.analysis.tokenattributes.CharTermAttribute;
import org.apache.lucene.analysis.tokenattributes.OffsetAttribute;
import org.apache.lucene.analysis.tokenattributes.PositionIncrementAttribute;
import org.apache.lucene.analysis.tokenattributes.TypeAttribute;

public class AnalyzerUtil {

	
	/**
	 * 输出字符分词信息
	 * 
	 * @param str
	 * @param a
	 */
	public static void displayAllToken(String str, Analyzer a) {
		try {
			// 所有的分词器都必须含有分词流
			TokenStream stream = a.tokenStream("content", new StringReader(str));// 放回一个TokenStream;
			/**
			 * 创建一个属性,这个属性会添加到流里,随着这个TokenStream流增加
			 * 这个属性中保存中所有的分词信息
			 */
			CharTermAttribute cta=stream.addAttribute(CharTermAttribute.class);
			//位置增量的属性,存储词之间的距离
			PositionIncrementAttribute pia = stream.addAttribute(PositionIncrementAttribute.class);
			//储存每个词直接的偏移量
			OffsetAttribute oa = stream.addAttribute(OffsetAttribute.class);
			//使用的每个分词器直接的类型信息
			TypeAttribute ta = stream.addAttribute(TypeAttribute.class);
			for (; stream.incrementToken();) {
				System.out.print(pia.getPositionIncrement()+":");
				System.out.print(cta+":["+oa.startOffset()+"-"+oa.endOffset()+"]-->"+ta.type()+"\n");
			}
			System.out.println();
		} catch (IOException e) {
			// TODO Auto-generated catch block
			e.printStackTrace();
		}
	}
}
</span>


测试:

<span style="font-size:14px;">	@Test
	public void hhcTest(){
		Analyzer a1 =new StandardAnalyzer(Version.LUCENE_35);
		Analyzer a2 =new StopAnalyzer(Version.LUCENE_35);
		Analyzer a3 =new SimpleAnalyzer(Version.LUCENE_35);
		Analyzer a4 =new WhitespaceAnalyzer(Version.LUCENE_35);
		
		String txt ="how are you think you";
		AnalyzerUtil.displayAllToken(txt, a1);
		AnalyzerUtil.displayAllToken(txt, a2);
		AnalyzerUtil.displayAllToken(txt, a3);
		AnalyzerUtil.displayAllToken(txt, a4);
	}</span>



版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容, 请联系我们举报,一经查实,本站将立刻删除。

发布者:全栈程序员-站长,转载请注明出处:https://javaforall.net/163092.html原文链接:https://javaforall.net

(0)
全栈程序员-站长的头像全栈程序员-站长


相关推荐

  • 有return的情况下try catch finally的执行顺序(最有说服力的总结)

    有return的情况下try catch finally的执行顺序(最有说服力的总结)结论:1、不管有木有出现异常,finally块中代码都会执行;2、当try和catch中有return时,finally仍然会执行;3、finally是在return后面的表达式运算后执行的(此时并没有返回运算后的值,而是先把要返回的值保存起来,管finally中的代码怎么样,返回的值都不会改变,任然是之前保存的值),所以函数返回值是在finally执行前确定的;4、finally

    2022年6月16日
    28
  • JBPM(二)—JBPM工作流基本操作

    JBPM(二)—JBPM工作流基本操作流程定义的管理:将定义业务流程,部署到jbpm框架中(流程定义jpdl.xml描述文件)通过gpd插件先根据业务流程,绘制流程图(holiday.jpdl.xml和holiday.png)流程定义部署:先获得ProcessEngine对象,再获得对应Service(六个Service)ExecutionServicegetExecutionServi

    2025年10月13日
    4
  • LeetCode: Valid Palindrome [125]

    LeetCode: Valid Palindrome [125]

    2021年12月16日
    44
  • 时间复杂度为O(1)的Excel列名与列号转换算法

    时间复杂度为O(1)的Excel列名与列号转换算法目前大家经常使用的Excel列名与列号转换算法都至少包含一个循环算法的时间复杂度远大于O(1),众所周知Excel的列数是有上限的,既然是有穷的那么很显然我们可以做到O(1)转换列名与列号。首先我们

    2022年7月4日
    70
  • linux smartctl 命令,Linux smartctl命令

    linux smartctl 命令,Linux smartctl命令硬盘的SMART是S.M.A.R.T.的缩写,全称是“Self-Monitoring,AnalysisandReportingTechnology”,中文意思是“自我监测分析与报告技术”,它可以对硬盘的温度、内部电路、盘片表面介质材料等进行监测,力求及时分析出硬盘可能发出的问题,并发出警告,从而保护数据不受损失。在Linux上使用smartctl命令查看硬盘的SMART信息。安装工具:yu…

    2022年6月29日
    31
  • bootstrap 双层模态窗关闭问题[通俗易懂]

    一、页面概况二、问题点点击modal“关闭”按钮后,父modal“关闭”按钮失效点击modal右上角“X”后,父modal会一同关闭三、解决方法重写子modal的hide触发事件hi

    2022年2月16日
    43

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

关注全栈程序员社区公众号