jieba库详解「建议收藏」

jieba库详解「建议收藏」jieba是优秀的中文分词第三方库中文文本需要通过分词获得单个的词语jieba是优秀的中文分词第三方库,需要额外安装jieba库提供三种分词模式,最简单只需安装一个函数。jieba库是通过中文词库的方式来识别分词的。安装命令如下:点击windows+r,进入命令提示符输入cmd,进入界面后,输入pipinstalljieba。即可安装,示例如下:安装界面如下:jieba库分词依靠中文词库利用一个中文词库,确定汉字之间的关联概念汉字间概率大的组成词组,形成.

大家好,又见面了,我是你们的朋友全栈君。如果您正在找激活码,请点击查看最新教程,关注关注公众号 “全栈程序员社区” 获取激活教程,可能之前旧版本教程已经失效.最新Idea2022.1教程亲测有效,一键激活。

Jetbrains全系列IDE使用 1年只要46元 售后保障 童叟无欺

jieba是优秀的中文分词第三方库

中文文本需要通过分词获得单个的词语

jieba是优秀的中文分词第三方库,需要额外安装

jieba库提供三种分词模式,最简单只需安装一个函数。

jieba库是通过中文词库的方式来识别分词的。

安装命令如下:

点击windows+r,进入命令提示符输入cmd,进入界面后,输入pip install jieba。即可安装,示例如下:

jieba库详解「建议收藏」

安装界面如下: 

jieba库详解「建议收藏」

jieba库分词依靠中文词库

利用一个中文词库,确定汉字之间的关联概念

汉字间概率大的组成词组,形成分词结果

除了分词,用户还可以添加自定义的词组。

jieba分词的三种模式:

精确模式、全模式、搜索引擎模式

精确模式:把文本精确的切分开,不存在冗余单词

全模式:把文本中所有可能的词语都扫描出来,有冗余。

搜索引擎模式:在精确模式基础上,对长词进行切分。

jieba库的主要方法如下:

1.jieba.lcut(s) 精确模式,返回一个列表类型的分词结果

代码示例如下:

import jieba
a=jieba.lcut("约翰沃尔是NBA超级巨星")
print(a)

运行界面如下:

jieba库详解「建议收藏」

2.jieba.lcut(s,cut_all=True)全模式,返回一个列表类型的分词结果,存在冗余。

代码示例如下:

import jieba
a=jieba.lcut("约翰沃尔是NBA超级巨星",cut_all=True)
print(a)

运行界面如下:

jieba库详解「建议收藏」

 3.jieba.lcut_for_search(s)搜索引擎模式。

代码示例如下:

import jieba
a=jieba.lcut_for_search("中华人民共和国是伟大的")
print(a)

运行界面如下:4. 

jieba库详解「建议收藏」

4.jieba.add_word(w),向分词词典增加新词w。

代码示例如下:

import jieba
a=jieba.add_word("奇才队控球后卫约翰沃尔是NBA超级巨星")
b=jieba.lcut("奇才队控球后卫约翰沃尔是NBA超级巨星")
print(b)

运行界面如下:

jieba库详解「建议收藏」

jieba.lcuts(s),能够将字符串s进行精确的分词处理,并且返回一个列表类型。 

 

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容, 请联系我们举报,一经查实,本站将立刻删除。

发布者:全栈程序员-站长,转载请注明出处:https://javaforall.net/191073.html原文链接:https://javaforall.net

(0)
全栈程序员-站长的头像全栈程序员-站长


相关推荐

  • 大白话图解:什么是 CDN[通俗易懂]

    大白话图解:什么是 CDN[通俗易懂]  618电商节、双十一购物狂欢节,到底是什么在支撑数以万计的秒杀活动?这就不得不提一直隐姓埋名的CDN了,注意不是CSDN,而是CDN,CDN,CDN!  那到底CDN是什么鬼,这还要从西天取经说起……  1300年前,唐僧师徒取经要跋涉十万八千里,历经九九八十一难,一路打怪升级,最终才能修成正果,悟空加冕“斗战胜佛”。  1300年后,西游互联网已经开通,雷音寺…

    2025年6月9日
    0
  • repeater控件用法_propertygrid控件

    repeater控件用法_propertygrid控件在我们编写程序的时候经常会遇到控件嵌套的问题。通常最经常用到的控件时repeater,以下是一两个列子。HTML<asp:repeaterid="repeaterMain"Runat="server"OnItemDataBound="repeaterMain_ItemDataBound"><ItemTemplate><table&g..

    2022年10月13日
    0
  • 软考之路(三)—组成原理[通俗易懂]

    软考之路(三)—组成原理

    2022年1月27日
    45
  • SpringApplication初始化阶段[通俗易懂]

    SpringApplication初始化阶段[通俗易懂]在SpringFramework时代,Spring应用上下文通常由容器启动,如ContextLoaderListener或WebApplicationInitializer的实现类由Servlet容器装载并驱动。到了SpringBoot时代,Spring应用上下文的启动则通过调用SpringApplication.run(Object,String…)或SpringApplicationBuilder.run(String…)方法并配合@SpringBootApplication或@EnableAu

    2022年9月9日
    0
  • SpringCloud详细教程(上)

    SpringCloud详细教程(上)SpringCloud详细教程,SpringCloud详细教程。SpringCloud是一系列框架的有序集合。如服务发现注册、配置中心、消息总线、负载均衡、断路器、数据监控等,都可以用SpringBoot的开发风格做到一键启动和部署。本文主要介绍了SpringCloud的核心组件以及如何基于SpringCloud构建微服务。

    2022年5月24日
    37
  • python控制mt4自动交易软件下载_MT4 EA智能自动交易系统使用教程[通俗易懂]

    python控制mt4自动交易软件下载_MT4 EA智能自动交易系统使用教程[通俗易懂]1.首先,你要有一个EA,必须要有以ex4为扩展名的,如果只有mq4文件的话,就要用MetaTrader自带的编辑器MetaEditor打开,将mq4通过编译(compile)并且要不出现错误,才能在原存放mq4的文件夹下面得到一个同名的ex4文件。2.将这个ex4文件复制到MetaTrader4所在的文件夹下面的experts文件夹下,比如:D:\ProgramFiles\ACTCMeta…

    2022年5月30日
    75

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

关注全栈程序员社区公众号