NLP中word2vec的使用
2016-07-16 14:23
323 查看
先将本地下载好的word2vec.zip导入linux中
解压word2vec.zip
进入word2vec文件中make一下
ls一下,会出现下面word2vecmake之后的情形
设置参数,demo-word.sh脚本中的词向量训练命令:
其中,训练的内容是README.txt文件,如果想训练其他文件导入即可。cbow可选择学习算法(CBOW或skip-gram),size为词向量长度(一般是越大越好),window为窗口(词上下文)长度,sample为采样率(一般取值为1e-3到1e-5之间),threads为并行训练的cpu线程数(取决于设备硬件条件)。
词向量训练结果会以二进制形式保存在vector.bin文件中(需结合Python gensim库进行查看和调用)。
输入./distance vector.bin 开始运算
解压word2vec.zip
进入word2vec文件中make一下
ls一下,会出现下面word2vecmake之后的情形
设置参数,demo-word.sh脚本中的词向量训练命令:
其中,训练的内容是README.txt文件,如果想训练其他文件导入即可。cbow可选择学习算法(CBOW或skip-gram),size为词向量长度(一般是越大越好),window为窗口(词上下文)长度,sample为采样率(一般取值为1e-3到1e-5之间),threads为并行训练的cpu线程数(取决于设备硬件条件)。
词向量训练结果会以二进制形式保存在vector.bin文件中(需结合Python gensim库进行查看和调用)。
输入./distance vector.bin 开始运算
相关文章推荐
- 书评:《算法之美( Algorithms to Live By )》
- 动易2006序列号破解算法公布
- C#递归算法之分而治之策略
- Ruby实现的矩阵连乘算法
- C#插入法排序算法实例分析
- C#算法之大牛生小牛的问题高效解决方法
- C#算法函数:获取一个字符串中的最大长度的数字
- 超大数据量存储常用数据库分表分库算法总结
- C#数据结构与算法揭秘二
- C#冒泡法排序算法实例分析
- 算法练习之从String.indexOf的模拟实现开始
- C#算法之关于大牛生小牛的问题
- C#实现的算24点游戏算法实例分析
- 经典排序算法之冒泡排序(Bubble sort)代码
- c语言实现的带通配符匹配算法
- 浅析STL中的常用算法
- 算法之排列算法与组合算法详解
- C++实现一维向量旋转算法
- Ruby实现的合并排序算法
- C#折半插入排序算法实现方法