jiebapythongithub_python中怎么安装jieba库

A. jieba支持python3.9吗

jieba库是一款优秀的 Python 第三方中文分词库，jieba 支持三种分词模式：精确模式、全模式和搜索引擎模式，下面是三种模式的特点。

精确模式：试图将语句最精确的切分，不存在冗余数据，适合做文本分析

全模式：将语句中所有可能是词的词语都切分出来，速度很快，但是存在冗余数据

搜索引擎模式：在精确模式的基础上，对长词再次进行切分

一、jieba库的安装
因为 jieba 是一个第三方库，所有需要我们在本地进行安装。

B. jieba分词详解

“结巴”分词是一个Python 中文分词组件，参见 https://github.com/fxsjy/jieba
可以对中文文本进行 分词、词性标注、关键词抽取 等功能，并且支持自定义词典。

本文包括以下内容：
1、jieba分词包的安装
2、jieba分词的 使用教程
3、jieba分词的 工作原理与工作流程
4、jieba分词所涉及到的 HMM、TextRank、TF-IDF等算法介绍

可以直接使用pip来进行安装：
sudo pip install jieba
或者
sudo pip3 install jieba

关键词抽取有两种算法，基于TF-IDF和基于TextRank：

jieba分词有三种不同的分词模式： 精确模式、全模式和搜索引擎模式 ：

对应的，函数前加l即是对应得到list结果的函数：

精确模式是最常用的分词方法，全模式会将句子中所有可能的词都列举出来，搜索引擎模式则适用于搜索引擎使用。具体的差别可在下一节工作流程的分析中详述。

在上述每个函数中，都有名为HMM的参数。这一项表示是否在分词过程中利用HMM进行新词发现。关于HMM，本文附录中将简述相关知识。

另外分词支持自定义字典，词典格式和 dict.txt 一样，一个词占一行；每一行分三部分：词语、词频（可省略）、词性（可省略），用空格隔开，顺序不可颠倒。
具体使用方法为：

关键词抽取的两个函数的完整参数为：

可以通过

来打开或关闭并行分词功能。
个人感觉一般用不到，大文件分词需要手动实现多进程并行，句子分词也不至于用这个。

jieba分词主要通过词典来进行分词及词性标注，两者使用了一个相同的词典。正因如此，分词的结果优劣将很大程度上取决于词典，虽然使用了HMM来进行新词发现。
jieba分词包整体的工作流程如下图所示：

下面将根据源码详细地分析各个模块的工作流程。

在之后几节中，我们在 蓝色的方框 中示范了关键步骤的输出样例或词典文件的格式样例。在本节中都采用类似的表示方式。

jieba分词中，首先通过对照典生成句子的 有向无环图 ，再根据选择的模式不同，根据词典 寻找最短路径 后对句子进行截取或直接对句子进行截取。对于未登陆词（不在词典中的词）使用 HMM 进行新词发现。

词典的格式应为
word1 freq1 word_type1
word2 freq2 word_type2
…
其中自定义用户词典中词性word_type可以省略。
词典在其他模块的流程中可能也会用到，为方便叙述，后续的流程图中将会省略词典的初始化部分。

图b演示了搜索引擎模式的工作流程，它会在精确模式分词的基础上，将长词再次进行切分。

在这里我们假定读者已经了解HMM相关知识，如果没有可先行阅读下一章内容中的HMM相关部分或者跳过本节。

在jieba分词中，将字在词中的位置B、M、E、S作为隐藏状态，字是观测状态，使用了词典文件分别存储字之间的表现概率矩阵（finalseg/prob_emit.py）、初始概率向量(finalseg/prob_start.py)和转移概率矩阵(finalseg/prob_trans.py)。这就是一个标准的 解码问题 ，根据概率再利用 viterbi算法 对最大可能的隐藏状态进行求解。

词性分析部分与分词模块用了同一个基础的分词器，对于词典词的词性，将直接从词典中提取，但是对于新词，词性分析部分有一个 专属的新词及其词性的发现模块 。
用于词性标注的HMM模型与用于分词的HMM模型相似，同样将文字序列视为可见状态，但是隐藏状态不再是单单的词的位置（B/E/M/S），而变成了词的位置与词性的组合，如(B,v)(B,n)(S,n)等等。因此其初始概率向量、转移概率矩阵和表现概率矩阵和上一节中所用的相比都要庞大的多，但是其本质以及运算步骤都没有变化。
具体的工作流程如下图所示。

jieba分词中有两种不同的用于关键词抽取的算法，分别为TextRank和TF-IDF。实现流程比较简单，其核心在于算法本身。下面简单地画出实现流程，具体的算法可以参阅下一章内容。

TextRank方法默认筛选词性，而TF-IDF方法模型不进行词性筛选。

在本章中，将会简单介绍相关的算法知识，主要包括用于新词发现的 隐马尔科夫模型 和 维特比算法 、用于关键词提取的 TextRank 和 TF-IDF 算法。

HMM即隐马尔科夫模型，是一种基于马尔科夫假设的统计模型。之所以为“隐”，是因为相较于马尔科夫过程HMM有着未知的参数。在世界上，能看到的往往都是表象，而事物的真正状态往往都隐含在表象之下，并且与表象有一定的关联关系。

其中，S、O分别表示状态序列与观测序列。

如果读者还对这部分内容心存疑问，不妨先往下阅读，下面我们将以一个比较简单的例子对HMM及解码算法进行实际说明与演示，在读完下一小节之后再回来看这些式子，或许能够恍然大悟。

下面以一个简单的例子来进行阐述：
假设小明有一个网友小红，小红每天都会在朋友圈说明自己今天做了什么，并且假设其仅受当天天气的影响，而当天的天气也只受前一天天气的影响。
于小明而言，小红每天做了什么是可见状态，而小红那里的天气如何就是隐藏状态，这就构成了一个HMM模型。一个HMM模型需要有五个要素：隐藏状态集、观测集、转移概率、观测概率和初始状态概率。

即在第j个隐藏状态时，表现为i表现状态的概率。式中的n和m表示隐藏状态集和观测集中的数量。
本例中在不同的天气下，小红要做不同事情的概率也不同， 观测概率 以表格的形式呈现如下：

其中

除此之外，还需要一个初始状态概率向量π，它表示了观测开始时，即t=0时，隐藏状态的概率值。本例中我们指定 π={0,0,1} 。

至此，一个完整的 隐马尔科夫模型 已经定义完毕了。

HMM一般由三类问题：
概率计算问题 ，即给定 A,B,π 和隐藏状态序列，计算观测序列的概率；
预测问题 ，也成解码问题，已知 A,B,π 和观测序列，求最优可能对应的状态序列；
学习问题 ，已知观测序列，估计模型的 A,B,π 参数，使得在该模型下观测序列的概率最大，即用极大似然估计的方法估计参数。

在jieba分词中所用的是解码问题，所以此处对预测问题和学习问题不做深入探讨，在下一小节中我们将继续以本节中的例子为例，对解码问题进行求解。

在jieba分词中，采用了HMM进行新词发现，它将每一个字表示为B/M/E/S分别代表出现在词头、词中、词尾以及单字成词。将B/M/E/S作为HMM的隐藏状态，而连续的各个单字作为观测状态，其任务即为利用观测状态预测隐藏状态，并且其模型的 A,B,π 概率已经给出在文件中，所以这是一个标准的解码问题。在jieba分词中采用了 Viterbi算法 来进行求解。

Viterbi算法的基本思想是：如果最佳路径经过一个点，那么起始点到这个点的路径一定是最短路径，否则用起始点到这点更短的一条路径代替这段，就会得到更短的路径，这显然是矛盾的；从起始点到结束点的路径，必然要经过第n个时刻，假如第n个时刻有k个状态，那么最终路径一定经过起始点到时刻n中k个状态里最短路径的点。
将时刻t隐藏状态为i所有可能的状态转移路径i1到i2的状态最大值记为

下面我们继续以上一节中的例子来对viterbi算法进行阐述：
小明不知道小红是哪里人，他只能通过小红每天的活动来推断那里的天气。
假设连续三天，小红的活动依次为：“睡觉-打游戏-逛街”，我们将据此计算最有可能的天气情况。

表示第一天为雨天能够使得第二天为晴天的概率最大（也就是说如果第二天是晴天在最短路径上的话，第一天是雨天也一定在最短路径上，参见上文中Viterbi算法的基本思想）

此时已经到了最后的时刻，我们开始回溯。

其计算过程示意图如下图所示。

）的路径。

TF-IDF（词频-逆文本频率）是一种用以评估字词在文档中重要程度的统计方法。它的核心思想是，如果某个词在一篇文章中出现的频率即TF高，并且在其他文档中出现的很少，则认为这个词有很好的类别区分能力。

其中：

TextRank是一种用以关键词提取的算法，因为是基于PageRank的，所以先介绍PageRank。
PageRank通过互联网中的超链接关系确定一个网页的排名，其公式是通过一种投票的思想来设计的：如果我们计算网页A的PageRank值，那么我们需要知道哪些网页链接到A，即首先得到A的入链，然后通过入链给网页A进行投票来计算A的PR值。其公式为：

其中：

d为阻尼系数，取值范围为0-1，代表从一定点指向其他任意点的概率，一般取值0.85。
将上式多次迭代即可直到收敛即可得到结果。

TextRank算法基于PageRank的思想，利用投票机制对文本中重要成分进行排序。如果两个词在一个固定大小的窗口内共同出现过，则认为两个词之间存在连线。

公式与PageRank的基本相同。多次迭代直至收敛，即可得到结果。
在jieba分词中，TextRank设定的词窗口大小为5，将公式1迭代10次的结果作为最终权重的结果，而不一定迭代至收敛。

C. python jieba什么用

Python 中文分词组件
支持三种分词模式：
精确模式，试图将句子最精确地切开，适合文本分析；
全模式，把句子中所有的可以成词的词语都扫描出来, 速度非常快，但是不能解决歧义；
搜索引擎模式，在精确模式的基础上，对长词再次切分，提高召回率，适合用于搜索引擎分词。
支持繁体分词
支持自定义词典
MIT 授权协议

项目地址
https://github.com/fxsjy/jieba

D. 浅谈文本分析分词及关系图

在文本分析中，我们需要对其文本进行分词，并对这些分词统计分析，基于 python ， jieba 是很受欢迎的一种分词库，而后对分词之间的关系，当然Python Matplotlib 基于networkx画关系网络图也是可以的，但是这里我们将借助 Gephi 来制作，这个软件容易上手，这里我们并对其中个别方法进行解释。

jieba库是Python中一个重要的第三方中文分词函数库，能够将一段中文文本分隔成中文词语序列。
jieba库分词所用的原理就是把分词的内容与分词的中文词库进行对比，通过图结构和动态规划方法找到最大概率的词组。

支持四种分词模式：

四种模式分隔举例：

结果：

由上我们可以发现，我们想要把生态环境、污水处理、有限公司都分开，精确模式和Paddle模式，未分开，全模式和搜索引擎模式虽分开了，但却也含有未分的词组。所以这里我们可以采用自定义词典，使用load_userdict()，不过注意的是需要给自定义词做词频，否则自定义词典不起作用，因为，当自定义词词频低于默认词典的词频时，它还是采用默认分词，所以我们设定词频大于默认词词频时，就会采用自定义词典的词分词。

具体怎么设置自定义词典的词频数，还没有具体的公式，越大当然概率越大，只要超过默认词典即可，但也不宜过大。默认词典

自定义词典

其中 user_dict 定义如下:

jieba简单介绍及使用介绍到这里，更深层理论及使用可学习这个地址： jieba-github参考

在图论中， 集聚系数 （也称 群聚系数 、 集群系数 ）是用来描述一个图中的顶点之间结集成团的程度的系数。具体来说，是一个点的邻接点之间相互连接的程度。例如生活社交网络中，你的朋友之间相互认识的程度【基于复杂网络理论的代谢网络结构研究进展】。有证据表明，在各类反映真实世界的网络结构，特别是社交网络结构中，各个结点之间倾向于形成密度相对较高的网群【 TRANSITIVITY IN STRUCTURAL MODELS OF SMALL GROUPS 、 Collective dynamics of 'small-world' networks 】。也就是说，相对于在两个节点之间随机连接而得到的网络，真实世界网络的集聚系数更高。

假设图中有一部分点是两两相连的，那么可以找出很多个“三角形”，其对应的三点两两相连，称为闭三点组。除此以外还有开三点组，也就是之间连有两条边的三点（缺一条边的三角形）。
Clustering coefficient 的定义有两种；全局的和局部的。

全局的算法：

局部的算法：

平均系数：

下面即分析其系数求解：

接下来我们就以一个实例来分析聚类系数应用，这里我们用到的工具是 Gephi ，数据也是使用其内置的数据。

在上面分析中，我们提到节点大小，代表自身权重，但是有时由于我们的节点范围导致有些需要辨别的节点不易分析，这时我们可以考虑从颜色入手，即权重从小到大以颜色的变化老判定，当然也可以用同一种颜色通过渐变来判定，这里我是使用了三种颜色变化范围来分析。如下图选择及展示：

由上图，从颜色上我们选择了红黄蓝的依次变化情况，右图我们从节点大小加上颜色更方便判定节点自身的权重了，即自身出现次数越多颜色越靠近蓝色，反之靠近红色。

由上俩个图的变化可察觉出它们的布局分布是一样的，那它是什么原因呢？

如图结构可分析形成聚合的簇团，是相互之间弹簧吸引的强烈的，也就是说关系比较密切些。

在数据中，我们关系图是由节点和边组成，上面都简要分析了节点的处理，那么边怎么分析呢？其实边由图中是可以以线的粗细来判断俩个词之间的关系，即出现的次数。如下图：

由于次数范围太广，我们把它们转化成0--1之间的范围，以最高权重为1，其它数据以此为基准做转化。

即为所转化后的占比值，为每个权重值，为最大权重值

jieba-github参考
Clustering coefficient
ForceAtlas2, A Continuous Graph Layout Algorithm for Handy Network Visualization

E. 如何用python和jieba分词，统计词频

#!python3
#-*-coding:utf-8-*-
importos,codecs
importjieba
fromcollectionsimportCounter

defget_words(txt):
seg_list=jieba.cut(txt)
c=Counter()
forxinseg_list:
iflen(x)>1andx!='
':
c[x]+=1
print('常用词频度统计结果')
for(k,v)inc.most_common(100):
print('%s%s%s%d'%(''*(5-len(k)),k,'*'*int(v/3),v))

if__name__=='__main__':
withcodecs.open('19d.txt','r','utf8')asf:
txt=f.read()
get_words(txt)

F. 部分常用分词工具使用整理

以下分词工具均能在Python环境中直接调用（排名不分先后）。

1、jieba（结巴分词）免费使用

2、HanLP（汉语言处理包）免费使用

3、SnowNLP（中文的类库）免费使用

4、FoolNLTK（中文处理工具包）免费使用

5、Jiagu（甲骨NLP）免费使用

6、pyltp（哈工大语言云）商用需要付费

7、THULAC（清华中文词法分析工具包）商用需要付费

8、NLPIR（汉语分词系统）付费使用

1、jieba（结巴分词）

“结巴”中文分词：做最好的 Python 中文分词组件。

项目Github地址：jieba

安装：

pip install jieba

使用：

import jieba

jieba.initialize()

text = '化妆和服装'

words = jieba.cut(text)

words = list(words)

print(words)

2、HanLP（汉语言处理包）

HanLP是一系列模型与算法组成的NLP工具包，由大快搜索主导并完全开源，目标是普及自然语言处理在生产环境中的应用。HanLP具备功能完善、性能高效、架构清晰、语料时新、可自定义的特点。

项目Github地址：pyhanlp

安装：

pip install pyhanlp

使用：

import pyhanlp

text = '化妆和服装'

words = []

for term in pyhanlp.HanLP.segment(text):

words.append(term.word)

print(words)

3、SnowNLP（中文的类库）

SnowNLP是一个python写的类库，可以方便的处理中文文本内容，是受到了TextBlob的启发而写的，由于现在大部分的自然语言处理库基本都是针对英文的，于是写了一个方便处理中文的类库，并且和TextBlob不同的是，这里没有用NLTK，所有的算法都是自己实现的，并且自带了一些训练好的字典。

项目Github地址：snownlp

安装：

pip install snownlp

使用：

import snownlp

text = '化妆和服装'

words = snownlp.SnowNLP(text).words

print(words)

4、FoolNLTK（中文处理工具包）

可能不是最快的开源中文分词，但很可能是最准的开源中文分词。

项目Github地址：FoolNLTK

安装：

pip install foolnltk

使用：

import fool

text = '化妆和服装'

words = fool.cut(text)

print(words)

5、Jiagu（甲骨NLP）

基于BiLSTM模型，使用大规模语料训练而成。将提供中文分词、词性标注、命名实体识别、关键词抽取、文本摘要、新词发现等常用自然语言处理功能。参考了各大工具优缺点制作，将Jiagu回馈给大家。

项目Github地址：jiagu

安装：

pip3 install jiagu

使用：

import jiagu

jiagu.init()

text = '化妆和服装'

words = jiagu.seg(text)

print(words)

6、pyltp（哈工大语言云）

pyltp 是 LTP 的 Python 封装，提供了分词，词性标注，命名实体识别，依存句法分析，语义角色标注的功能。

项目Github地址：pyltp，3.4模型下载链接：网盘

安装：

pip install pyltp

使用：

import pyltp

segmentor = pyltp.Segmentor()

segmentor.load('model/ltp_data_v3.4.0/cws.model') # 模型放置的路径

text = '化妆和服装'

words = segmentor.segment(text)

words = list(words)

print(words)

7、THULAC（清华中文词法分析工具包）

THULAC（THU Lexical Analyzer for Chinese）由清华大学自然语言处理与社会人文计算实验室研制推出的一套中文词法分析工具包，具有中文分词和词性标注功能。

项目Github地址：THULAC-Python

安装：

pip install thulac

使用：

import thulac

thu = thulac.thulac(seg_only=True)

text = '化妆和服装'

words = thu.cut(text, text=True).split()

print(words)

NLPIR（汉语分词系统）

主要功能包括中文分词；英文分词；词性标注；命名实体识别；新词识别；关键词提取；支持用户专业词典与微博分析。NLPIR系统支持多种编码、多种操作系统、多种开发语言与平台。

项目Github地址：pynlpir

安装：

pip install pynlpir

下载证书覆盖到安装目录，NLPIR.user 例如安装目录：/usr/lib64/python3.4/site-packages/pynlpir/Data

使用：

import pynlpir

pynlpir.open()

text = '化妆和服装'

words = pynlpir.segment(text, pos_tagging=False)

print(words)

pynlpir.close()

G. python中怎么安装jieba库

首先点击桌面左下角的开始图标，然后选择运行。
（推荐教程：Python入门教程）
在弹出的窗口中输入cmd，然后点击确定。
输入：pip install jieba，然后按下回车键会自动开始安装。
安装成功后输入：python -m pip list，然后按下回车键来看下jieba库是否安装成功。
输入：python，按下回车键，进入python解释器。
输入代码：import jieba，导入这个库，如果不报错就时安装成功啦。

H. 怎么是用python 语言使用结巴分词呢

Python代码

#encoding=utf-8
importjieba

seg_list=jieba.cut("我来到北京清华大学",cut_all=True)
print"FullMode:","/".join(seg_list)#全模式

seg_list=jieba.cut("我来到北京清华大学",cut_all=False)
print"DefaultMode:","/".join(seg_list)#默认模式

seg_list=jieba.cut("他来到了网易杭研大厦")
print",".join(seg_list)

输出：

FullMode:我/来/来到/到/北/北京/京/清/清华/清华大学/华/华大/大/大学/学

DefaultMode:我/来到/北京/清华大学

他,来到,了,网易,杭研,大厦(此处，“杭研”并没有在词典中，但是也被Viterbi算法识别出来了)

I. 盘点Python常用的模块和包

模块

1.定义

计算机在开发过程中，代码越写越多，也就越难以维护，所以为了编写可维护的代码，我们会把函数进行分组，放在不同的文件里。在python里，一个.py文件就是一个模块。

2.优点：

提高代码的可维护性。

提高代码的复用，当模块完成时就可以在其他代码中调用。

引用其他模块，包含python内置模块和其他第三方模块。

避免函数名和变量名等名称冲突。

python内建模块：

1.sys模块

2.random模块

3.os模块：

os.path:讲解

https://www.cnblogs.com/yufeihlf/p/6179547.html

数据可视化

1.matplotlib :

是Python可视化程序库的泰斗，它的设计和在1980年代被设计的商业化程序语言MATLAB非常接近。比如pandas和Seaborn就是matplotlib的外包，它们让你能用更少的代码去调用 matplotlib的方法。

访问：

https://matplotlib.org/

颜色：

https://www.cnblogs.com/darkknightzh/p/6117528.html

教程：

https://wizardforcel.gitbooks.io/matplotlib-user-guide/3.1.html

2.Seaborn：

它是构建在matplotlib的基础上的，用简洁的代码来制作好看的图表。Seaborn跟matplotlib最大的区别就是它的默认绘图风格和色彩搭配都具有现代美感。

访问：

http://seaborn.pydata.org/index.html

3.ggplot：

gplot 跟 matplotlib 的不同之处是它允许你叠加不同的图层来完成一幅图

访问：

http://ggplot.yhathq.com/

4.Mayavi：

Mayavi2完全用Python编写，因此它不但是一个方便实用的可视化软件，而且可以方便地用Python编写扩展，嵌入到用户编写的Python程序中，或者直接使用其面向脚本的API：mlab快速绘制三维图

访问：http://code.enthought.com/pages/mayavi-project.html

讲解：https://blog.csdn.net/ouening/article/details/76595427https://www.jianshu.com/p/81e6f4f1cdd8

5.TVTK：

TVTK库对标准的VTK库进行包装，提供了Python风格的API、支持Trait属性和numpy的多维数组。

VTK (http://www.vtk.org/) 是一套三维的数据可视化工具，它由C++编写，包涵了近千个类帮助我们处理和显示数据

讲解：https://docs.huihoo.com/scipy/scipy-zh-cn/tvtk_intro.html

机器学习

1.Scikit-learn

是一个简单且高效的数据挖掘和数据分析工具，易上手，可以在多个上下文中重复使用。它基于NumPy, SciPy 和 matplotlib，开源，可商用（基于 BSD 许可）。

访问：

讲解：https://blog.csdn.net/finafily0526/article/details/79318401

2.Tensorflow

最初由谷歌机器智能科研组织中的谷歌大脑团队（Google Brain Team）的研究人员和工程师开发。该系统设计的初衷是为了便于机器学习研究，能够更快更好地将科研原型转化为生产项目。

导航:首页 > 编程语言 > jiebapythongithub

jiebapythongithub

与jiebapythongithub相关的资料