当前位置: 首页 > news >正文

技术先进的网站建设公大企业网站建设公司排名

技术先进的网站建设公,大企业网站建设公司排名,广州免费律师咨询,小清新网站源码word2vec介绍word2vec是google的一个开源工具#xff0c;能够根据输入的词的集合计算出词与词之间的距离。它将term转换成向量形式#xff0c;可以把对文本内容的处理简化为向量空间中的向量运算#xff0c;计算出向量空间上的相似度#xff0c;来表示文本语义上的相似度。…word2vec介绍word2vec是google的一个开源工具能够根据输入的词的集合计算出词与词之间的距离。它将term转换成向量形式可以把对文本内容的处理简化为向量空间中的向量运算计算出向量空间上的相似度来表示文本语义上的相似度。word2vec计算的是余弦值距离范围为0-1之间值越大代表两个词关联度越高。词向量用Distributed Representation表示词通常也被称为“Word Representation”或“Word Embedding(嵌入)”。简言之词向量表示法让相关或者相似的词在距离上更接近。具体使用(处理中文)收集语料本文亚马逊中文书评语料12万句子文本。语料以纯文本形式存入txt文本。注意理论上语料越大越好理论上语料越大越好理论上语料越大越好重要的事情说三遍。因为太小的语料跑出来的结果并没有太大意义。分词中文分词工具还是很多的我自己常用的- 中科院NLPIR- 哈工大LTP- 结巴分词注意分词文本将作为word2vec的输入文件。分词文本示例word2vec使用python利用gensim模块。win7系统下在通常的python基础上gensim模块不太好安装所以建议使用anaconda具体参见 python开发之anaconda【以及win7下安装gensim】直接上代码——#!/usr/bin/env python# -*- coding: utf-8 -*-功能测试gensim使用处理中文语料时间2016年5月21日 20:49:07from gensim.models import word2vecimport logging# 主程序logging.basicConfig(format%(asctime)s : %(levelname)s : %(message)s, levellogging.INFO)sentences word2vec.Text8Corpus(uC:\\Users\\lenovo\\Desktop\\word2vec实验\\亚马逊中文书评语料.txt) # 加载语料model word2vec.Word2Vec(sentences, size200) # 默认window5# 计算两个词的相似度/相关程度y1 model.similarity(u不错, u好)print u【不错】和【好】的相似度为, y1print --------\n# 计算某个词的相关词列表y2 model.most_similar(u书, topn20) # 20个最相关的print u和【书】最相关的词有\nfor item in y2:print item[0], item[1]print --------\n# 寻找对应关系print u书-不错质量-y3 model.most_similar([u质量, u不错], [u书], topn3)for item in y3:print item[0], item[1]print --------\n# 寻找不合群的词y4 model.doesnt_match(u书 书籍 教材 很.split())print u不合群的词, y4print --------\n# 保存模型以便重用model.save(u书评.model)# 对应的加载方式# model_2 word2vec.Word2Vec.load(text8.model)# 以一种C语言可以解析的形式存储词向量model.save_word2vec_format(u书评.model.bin, binaryTrue)# 对应的加载方式# model_3 word2vec.Word2Vec.load_word2vec_format(text8.model.bin, binaryTrue)if __name__ __main__:pass运行结果【不错】和【好】的相似度为 0.790186663972--------和【书】最相关的词有书籍 0.675163209438书本 0.633386790752确实 0.568059504032教材 0.551493048668正品 0.532882153988没得说 0.529319941998好 0.522468209267据说 0.51004421711图书 0.508755385876挺 0.497194319963新书 0.494331330061很 0.490583062172不错 0.476392805576正版 0.460161447525纸张 0.454929769039可惜 0.450752496719工具书 0.449723362923的确 0.448629021645商品 0.444284260273纸质 0.443040698767--------书-不错质量-精美 0.507958948612总的来说 0.496103972197材质 0.493623793125--------不合群的词 很以上就是本文的全部内容希望对大家的学习有所帮助也希望大家多多支持脚本之家。
http://wiki.neutronadmin.com/news/296417/

相关文章:

  • wordpress一键仿站做三个月网站广告收入
  • 企业建设网站的必要性母婴类网站怎么建设
  • 网站平台搭建包括哪些wordpress加图片
  • 网站建设合同的性质wordpress判断登录
  • 网站之家开源建站工具
  • 无锡建站方案dedecms 调用网站内部搜索
  • 河北邢台wap网站建设秦皇岛建设路小学网站
  • 网站项目有需要什么技术支持wordpress 弹出视频播放
  • 网站对于企业的海淀深圳网站建设公司
  • 免费制作网页网站重庆网站开发建设
  • seo查询5118长沙网站排名优化报价
  • 两学一做网站安徽省宁波网站建设培训
  • 南宁网站怎么做seo零基础 网站
  • 网站建设和钱下载网站怎么下载
  • 万网虚拟主机上传网站企业网站推广服务协议
  • 网站建设讲解材料购物类网站都有哪些模块
  • e通网网站建设南宁公司网站建设
  • 宁波网站推广代运营优秀网站特点
  • 上海外贸soho网站建设小蚁人网站建设
  • 潍坊专业做网站公司做营销型网站的教程
  • 多人在线协作网站开发wordpress查看图片插件
  • 如何购买虚拟主机做网站主页推广项目计划书
  • 酒泉建设局造价官网站网站开发公司经营范围
  • 网站上传都传些什么文件公司建设网站的案例分析
  • 网页设计与网站建设的概述seo搜索排名影响因素主要有
  • 网站开发工作时间大连机械加工网
  • 长沙网站设计制作六安网站开发
  • 官网建站模板库html网站发布
  • 做的asp网站手机号码电商美工培训
  • 建视频网站系统怎样通过网址浏览自己做的网站