python——Fasttext新手学习笔记。
Fasttext 如他的名字一样最大的特点fast。[https://github.com/facebookresearch/fastText/tree/master/python#requirements]FastText是一个高效学习单词表示和句子分类的库。在本文中我们将介绍如何在Python中使用FastText。目录需求/要求指的是环境要求安装使用概述1、词表示模型2、文本分类模型3、重要提示数据预处理和编码约定习惯4、更多示例API 应用程序接口1、无监督训练 参数2、有监督训练 参数要求FastText基于现代Mac OS和Linux发行版因为它使用C 11个特性它需要一个良好支持C11的编译器。你需要python版本为2.7或3.4NumpyScipy和pybind11调用C的python扩展模块的工具安装为了安装最新版你可以这么做pip install fasttext实测用这个虽然简单但是容易出问题可以下载三方或者使用gensim.models。使用概述1、词表示模型训练词向量模型为了学习出词向量如本文所述我们可以使用 fasttest.train_unsupervised() 这个函数如下importfasttext#Skipgram Modelmodelfasttext.train_unsupervised(data.txt,modelskipgram)#Cbow Modelmodelfasttext.train_unsupervised(data.txt,modelcbow)其实有个问题当你用很小的数据集训练时候记得调整一个参数 mincount默认是5不然会出不来词表。中文的分词之后用空格隔开也同样可以放入训练。其中data.txt是使用UTF-8编码的训练文件。返回的模型对象代表学习到的模型。你可以用它去检索信息。print(model.words)# 得到字典词表print(model[king])# 找到king对应的词向量这里想要说明一句 不知道是不是封装了的原因在我实现的过程中这种方式报错。取而代之的是以下这种方式print(model)# 存储位置print(model.get_words())# 词表print(model.get_word_vector(to))# 对应词向量你还可以保存和读取模型对象。保存save_modelmodel.save_model(model_filename.bin)读取取回load_modelmodelfasttext.load_model(model_filename.bin)2、文本分类模型其实无监督用来训练词向量有监督用来训练分类模型 评估标准 PRF1为了使用这里描述的方法训练文本分类器我们可以使用fasttext.train_supervised()函数如下所示importfasttext modelfasttext.train_supervised(data.train.txt)其中data.train.txt是一个文本文件每行包括一个训练句子和标签默认情况下我们假设标签是以__label__开头的字符串单词。一旦对模型进行训练我们就可以检索单词和标签列表。print(model.words)print(model.labels)#print(model.get_words())#print(model.get_labels()) 我的还是下面这个有显示为了通过计算精确率(Precision)和召回率(Recall)来评估模型我们使用test函数。defprint_result(N,p,r):print(N\tstr(N))print(P{}\t{:.3f}.format(1,p))print(R{}\t{:.3f}.format(1,r))print(*model.test(test.txt))# 迭代输出返回内容我们还可以预测特定文本的标签model.predict(which baking dish is best to bake a banana bread ?)默认情况下predict方法只返回一个标签可能性最大的那一个。你也可以通过指定参数k来实现对多个标签的预测。model.predict(which baking dish is best to bake a banana bread ?,k3)如果你想要的预测更多你可以通过字符串数组来实现。model.predict([which ...,I love yyh,...],k3)当然你也可以像单词表示用法那样将模型保存到文件中或从文件中加载模型。量化压缩模型文件当你想要保存一个有监督的模型文件时FastText可以通过牺牲一点点的性能来压缩他已获得一个更小的模型文件。#使用之前的训练模型调用model.quantize(inputdata.train.txt,retrainTrue)# 数据集太小会报错 #接下来展示结果和存储新模型print_result(*model.test(valid_data))model.save_model(model_filename.ftz)model_filename.ftz 比model_filename.bin 的大小 要小很多。3、重要提示数据预处理/编码规定通常正确预处理数据很重要。FastText采用UTF-8编码文本python2的所有文本必须为unicodepython3的所有文本必须为str。传递的文本江北pybind11编码为UTF-8在传递给Fasttext的C库之前。这意味着在构建模型时使用UTF-8编码文本很重要。在类unix系统上可以使用iconv转换文本。FastText将根据以下ASCII字符字节标记将文本拆分为多个部分特别的是他并不知道UTF-8的空白字符。我们建议用户将UTF-8空白/单词边界转换为以下适当的符号之一。1、空格 2、制表符tab 3、垂直制表符 4、回车 5、换页 6、null 字节4、更多示例为了更好地了解FastText模型请考虑主要的README文件特别是我们网站上的教程。你可以在doc文件夹中找到更多的python示例。与任何包一样你可以使用帮助函数。例如。importfasttexthelp(fasttext.FastTest)APItrain_unsupervised 参数 用来训练词向量模型input:训练文件路径model:无监督训练使用的模型 {cbow 和 skip-gram} 默认为skip-gramlr:学习率 默认为0.05dim: 词向量维度 默认为100ws:windows size 窗口大小 默认为5epoch: 默认训练五轮minCount: 最小词数 默认为5 当数据集略小要记得调整minCountLabel:0 因为是无监督。minn:最小char级别的3-gramsubwordmaxn:最大char级别的6-gram subwordneg:负例采样个数 默认为5wordNgrams:最大的词n-gram长度 默认为1loss:损失函数 {ns,hs,softmax,ova} 默认是ns 负采样 hs 是分层softmaxbucket: 桶数默认为2000000threadcpu线程数 默认为12lrUpdateRate学习率更新默认为100t负采样阈值 默认0.0001verbose2train_supervised 参数 用来训练分类模型没有model参数√input:训练文件路径lr:学习率 默认为0.1√dim: 词向量维度 默认为100ws:windows size 窗口大小 默认为5minCount: 最小词数 默认为1√minCountLabel:1√ 最小标签数minn:0√maxn:0√neg:负例采样个数 默认为5wordNgrams:最大的词n-gram长度 默认为1loss:损失函数 {ns,hs,softmax,ova} 默认是softmax√bucket: 桶数默认为2000000threadcpu线程数 默认为12lrUpdateRate学习率更新默认为100t负采样阈值 默认0.0001label:标签前缀 默认 _label_√verbose2 控制打印输出 2显示每个epoch 1显示最后一个epochpretrainedVectors:用于监督学习的预训练词向量.vec文件给出路径 默认为‘ ’模型压缩用于减小模型大小和内存占用后缀.ftzmodel.quantize(self,inputNone, 训练文件路径qoutNone, 修剪输出层cutoff0, 重新训练的词和ngram个数retrainFalse, 是否重新训练epochsNone, 多少轮lrNone, 学习率threadNone, 线程verboseNone,dsub2, 压缩成几块qnormFalse) 是否归一化模型的存取 save_model / load_modelmodel.save_model(self,path): 给出存储路径model ff.load_model(self,path)模型的单例预测model.predict(self,text, utf-8 字符串文本k1, 返回标签的个数可以理解为最大K项threshord0.0) 概率阈值大于才返回模型批量预测model.test(self,path, 文件路径k1) 最大k项返回[Npr] 样本个数精确率召回率Model对象train_unsupervised、train_supervised、load_model 都会返回一个_FastText类的对象我们一般命名为model。model对象下面的一些方法。这个就不翻译了因为命名的很直白。

相关新闻

最新新闻

日新闻

周新闻

月新闻