Python中jieba库的使用方法-巨人网络通讯

企业400电话

微网小程序

AI电话机器人

电商代运营

全部栏目

企业400电话网络优化推广 AI电话机器人呼叫中心网站建设商标✡知产微网小程序电商运营彩铃•短信增值拓展业务

Python中jieba库的使用方法

目录

一、jieba库的安装
二、jieba三种模式的使用
三、jieba 分词简单应用
四、扩展：英文单词统计

jieba库是一款优秀的 Python 第三方中文分词库，jieba 支持三种分词模式：精确模式、全模式和搜索引擎模式，下面是三种模式的特点。

精确模式：试图将语句最精确的切分，不存在冗余数据，适合做文本分析

全模式：将语句中所有可能是词的词语都切分出来，速度很快，但是存在冗余数据

搜索引擎模式：在精确模式的基础上，对长词再次进行切分

一、jieba库的安装

因为 jieba 是一个第三方库，所有需要我们在本地进行安装。

Windows 下使用命令安装：在联网状态下，在命令行下输入 pip install jieba 进行安装，安装完成后会提示安装成功

在 pyCharm 中安装：打开 settings，搜索 Project Interpreter，在右边的窗口选择 + 号，点击后在搜索框搜索 jieba，点击安装即可

二、jieba三种模式的使用

# -*- coding: utf-8 -*-
import jieba

seg_str = "好好学习，天天向上。"

print("/".join(jieba.lcut(seg_str)))    # 精简模式，返回一个列表类型的结果
print("/".join(jieba.lcut(seg_str, cut_all=True)))      # 全模式，使用 'cut_all=True' 指定 
print("/".join(jieba.lcut_for_search(seg_str)))     # 搜索引擎模式

分词效果：

三、jieba 分词简单应用

需求：使用 jieba 分词对一个文本进行分词，统计次数出现最多的词语，这里以三国演义为例

# -*- coding: utf-8 -*-
import jieba

txt = open("三国演义.txt", "r", encoding='utf-8').read()
words = jieba.lcut(txt)     # 使用精确模式对文本进行分词
counts = {}     # 通过键值对的形式存储词语及其出现的次数

for word in words:
    if len(word) == 1:    # 单个词语不计算在内
        continue
    else:
        counts[word] = counts.get(word, 0) + 1    # 遍历所有词语，每出现一次其对应的值加 1

items = list(counts.items())
items.sort(key=lambda x: x[1], reverse=True)    # 根据词语出现的次数进行从大到小排序

for i in range(3):
    word, count = items[i]
    print("{0:5}{1:>5}".format(word, count))

统计结果：

你可以随便找一个文本文档，也可以到 https://github.com/coderjas/python-quick 下载上面例子中的文档。

四、扩展：英文单词统计

上面的例子统计实现了中文文档中出现最多的词语，接着我们就来统计一下一个英文文档中出现次数最多的单词。原理同上

# -*- coding: utf-8 -*-

def get_text():
    txt = open("1.txt", "r", encoding='UTF-8').read()
    txt = txt.lower()
    for ch in '!"#$%()*+,-./:;=>?@[\\]^_‘{|}~':
        txt = txt.replace(ch, " ")      # 将文本中特殊字符替换为空格
    return txt

file_txt = get_text()
words = file_txt.split()    # 对字符串进行分割，获得单词列表
counts = {}

for word in words:
    if len(word) == 1:
        continue
    else:
        counts[word] = counts.get(word, 0) + 1 

items = list(counts.items())    
items.sort(key=lambda x: x[1], reverse=True)      

for i in range(5):
    word, count = items[i]
    print("{0:5}->{1:>5}".format(word, count))

统计结果：

到此这篇关于Python中jieba库的使用方法的文章就介绍到这了,更多相关Python jieba库内容请搜索脚本之家以前的文章或继续浏览下面的相关文章希望大家以后多多支持脚本之家！

您可能感兴趣的文章:

超级好用的4个Python命令行可视化库
Python中glob库实现文件名的匹配
学会Python数据可视化必须尝试这7个库
浅谈Python响应式类库RxPy
Python下opencv库的安装过程及问题汇总
教你用Python matplotlib库制作简单的动画
总结几个非常实用的Python库

上一篇：pygame实现滑块接小球游戏
下一篇：python数据可视化plt库实例详解

相关文章

Python中jieba库的使用方法

目录一、jieba库的安装二、jieba三种模式的使用三、jieba 分词简单应用四、扩展：英文单词统计 jieba 库是一款优秀的 Python 第三方中文分词库， jieba 支持三种分词模式：精确模式、全Python,中,jieba,库,的,使用方法,...

我国著作权法规定的主体

(一)自然人作者我国《著作权法》第11条第2款规定:“创作作品的公民是作者”;第4款规...

Windows2003域的企业应用案例

案例环境一： yye1.com上海分公司共有100台计算机，安装的是Windows Server 2003系统和xp系统...

西安防封呼叫中心系统办理,电话系统在哪可以办理-浅析

西安防封呼叫中心系统办理,电话系统在哪可以办理3.受到尊重，等待。因此，客户服务...

中山小型外呼系统平台（外呼业务外包平台）

本篇文章给咱们谈谈中山小型外呼体系渠道，以及外呼事务外包渠道对应的知识点，期...

大同电信电话营销线路办理商家,电话营销线路办理-欢迎

大同电信电话营销线路办理商家,电话营销线路办理成功营销。销售通过电话沟通记录客...

巨人科技有什么优势

400电话已经成为很多大企业小公司都非常熟悉的通话业务，自从400电话业务的出现，为...

为什么很多电销企业使用电销防封系统?

电销防封系统在一定程度上可以解决封号问题，备受电销企业青睐，是电销行业不可或...

ip电话调度-ip电话调度系统-巨☉人☉网☉络通信

电话调度机已经进入IP电话调度机时代，云翌 ip电话调度不仅具有数字程控调度机的丰...

农村商标保护措施

（一）加强建设完善合理的监管体系和举报机制《商标权法》中已规定发生商标专用权...

电销机器人创意文案范文（返利机器人推广文案范文）

本文目录一览： 1、如何精准营销？ 2、适合发朋友圈的POS机推广文案，建议收藏 3、有...

大连联通外呼系统服务商,电话营销线路-价格靠谱

大连联通外呼系统服务商,电话营销线路比柜台服务具有更友好的服务界面，只要电话能...

剑夆AXB系统加盟

电销防封软件是怎样防封的？电销防封软件中，防封号原理是通过中号转拨和线路回呼...

电脑安装外呼系统（电脑上的外呼系统是什么）

本文目录一览： 1、电脑上怎样运用外呼体系？2、电脑外呼体系软件怎样装置？3、请问...

成都不封号电销卡办理套餐

寻找专业代理购买，在购买电销卡时，可以找一些专业代理购买，虽然说三大运营商...

北京电销外呼系统排名（北京电销外包公司）

今日给各位共享北京电销外呼体系排名的常识，其间也会对北京电销外包公司进行解说...

Python中jieba库的使用方法

目录一、jieba库的安装二、jieba三种模式的使用三、jieba 分词简单应用四、扩展：英文单词统计 jieba 库是一款优秀的 Python 第三方中文分词库， jieba 支持三种分词模式：精确模式、全Python,中,jieba,库,的,使用方法,...

© 2016-2020 巨人网络通讯版权所有

《增值电信业务经营许可证》苏ICP备15040257号-8

Python中jieba库的使用方法 Python,中,jieba,库,的,使用方法,