当前位置: 首页 > news >正文

低价网站制作下载长沙app

低价网站制作,下载长沙app,当地做网站贵,网站做什么推广好目录 1.语料库 2.语料库建设 #xff08;1#xff09;规范制定 #xff08;2#xff09;人员培训 #xff08;3#xff09;人工标注 3.中文处理中的常见语料库 #xff08;1#xff09;中文分词语料库 #xff08;2#xff09;词性标注语料库 #xff08;3…目录 1.语料库 2.语料库建设 1规范制定 2人员培训  3人工标注 3.中文处理中的常见语料库 1中文分词语料库 2词性标注语料库 3命名实体识别语料库 4句法分析语料库 5文本分类语料库 4.NLP开源工具 1.语料库 语料库就是自然语音处理中的数据集。 2.语料库建设 语料库建设指的是构建一份语料库的过程分为规范制定、人员培训与人工标注这 3个阶段。 1规范制定 指的是由语言学专家分析并制定一套标注规范这份规范包括标注集定义、样例和实施方法。 在中文分词和词性标注领域比较著名的规范有 - 北京大学计算语言学研究所发布的《现代汉语语料库加工规范-——词语切分与词性标注》 - 中国国家标准化管理委员会发布的《信息处理用现代汉语词类标记规范》 2人员培训  指的是对标注员的培训由于人力资源的限制制定规范与执行规范的未必是同一批人。大型语料库往往需要多人协同标注 这些标注员对规范的理解必须达到一致否则会导致标注员内部冲突影响语料库的质量 3人工标注 针对不同类型的任务人们开发出许多标注软件其中比较成熟的一款是 brat ( brat rapidannotation tool )它支持词性标注、命名实体识别和句法分析等任务brat是典型的B/S架构服务端用Python编写客户端运行于浏览器相较于其他标注软件brat最大的亮点是多人协同标注功能此外拖曳式的操作体验也为brat增色不少。 3.中文处理中的常见语料库 1中文分词语料库 由人工正确切分后的句子集合。以著名的“ 1998年《人民日报》语料库 ”为例该语料库由北京大学计算语言学研究所联合富士通研究开发中心有限公司在人民日报社新闻信息中心的许可下从 1999 年4月起到 2002 年 4 月底共同标注完成语料规模达到2600万汉字。 先  有  通货膨胀  干扰后  有  通货  紧缩  叫板。 2词性标注语料库 它指的是切分并为每个词语指定一个词性的语料。依然以《人民日报》语料库为例“ 1998年的《人民日报》”一共含有 43 种词性这个集合称作“ 词性标注集 ” 迈向/v 充满/v 希望/n 的/u 新/a 世纪/n ——/w 一九九八年/t 新年/t 讲话/n 3命名实体识别语料库 这种语料库人工标注了文本内部制作者关心的“ 实体名词 ”以及“ 实体类别 ”。比如《人民日报》语料库中一共含有人名、地名和机构名3种命名实体。这个句子中的加粗词语分别是“ 人名 ”、“ 地名 ”和“ 机构名 ”中括号括起来的是“ 复合词 ”我们可以观察到 有时候机构名和地名复合起来会构成更长的机构名这种构词法上的嵌套现象增加了命名实体识别的难度 萨哈夫/nr 说/v ,/w 伊拉克/ns 将/d 同/p [联合国/nt 销毁/v 伊拉克/ns 大规模/b 杀伤性/n 武器/n 特别/a 委员会/n] /nt 继续/v 保持/v 合作/v 。/w 4句法分析语料库 汉语中常用的句法分析语料库有 CTB Chinese Treebank中文树库 这份语料库的建设工作始于1998年历经宾夕法尼亚大学、科罗拉多大学和布兰迪斯大学的贡献一直在发布多个改进版本。以 CTB 8.0 版为例一共含有来自新闻、广播和互联网的3007篇文章共计 71369 个句子、1620 561 个单词和 2589848 个字符每个句子都经过了分词、词性标注和句法标注其中一个句子可视化后如图1-6所示。 中文单词上面的英文标签表示“ 词性 ”而箭头表示“ 有语法联系 ”的两个单词具体是何种联系由箭头上的标签表示。 5文本分类语料库 它指的是人工标注了“ 所属分类 ”的文章构成的语料库。相较于上面介绍的 4 种语料库文本分类语料库的数据量明显要大很多。 eg以著名的搜狗文本分类语料库为例 一共包含汽车、财经、IT、健康、体育、旅游、教育、招聘、文化、军事 10 个类别每个类别下含有8000篇新闻。 另外一些新闻网站上的栏目经过了编辑的手工整理相互之间的区分度较高也可作为文本分类语料库使用。 “ 情感分类语料库 ”则是文本分类语料库的一个子集无非是类别限定为“ 正面 ”“ 负面 ”等而已。 notes 如果这些语料库中的类目、规模不满足实际需求我们还可以按需自行标注 标注的过程实际上就是把许多文档整理后放到不同的文件夹中 4.NLP开源工具 目前开源界贡献了许多优秀的NLP工具它们为我们提供了多种选择。下边介绍最为主流的几种。比如教学常用的NLTK ( Natural Language Toolkit )、斯坦福大学开发的CoreNLP以及国内哈工大开发的 LTP ( Language Technology Platform )、何晗开发的HanLP ( Han Language Processing )下面是上述工具的比较。 我们将使用hanlp进行学习具体安装使用会记录在下一笔记。
http://www.tj-hxxt.cn/news/227689.html

相关文章:

  • 合肥网站建设兼职电子版简历word格式
  • 建立网站链接结构的基本方式有哪些广告代理发布平台
  • 手机能创建网站吗wordpress添加修改记录
  • 做游戏网站多少钱布谷 海南网站建设
  • 免费域名网站查询国内专业做网站
  • 宜兴建设局的网站金坛区建设工程质量监督网站
  • 快消品网站建设小型企业建站公司
  • 网站开发实训意义什么网站有做册子版
  • 建网站内容wordpress单号管理
  • 地板网站建设深圳十大公司
  • 自己怎么做新闻开头视频网站源码下载39源码网
  • 西安 医疗网站制作php做网站项目的流程
  • 免费教育网站建设在手机上设计画图的软件
  • 先做他个天猫网站明空网络做网站好不好
  • 音乐网站数据库怎么做个人优秀网站
  • 深圳哪家制作网站好石家庄明确新冠最新研判
  • 中小企业网站制作是什么个人简历网站模板免费
  • 诸暨有哪些好网站制作公司html网页设计代码简单例子
  • 网站翻译建设外国网页设计网站
  • 网站渠道建设wordpress 图片拉伸
  • 个人网站代码html公司展示厅设计
  • 如何逐步提升网站权重廊坊建站服务
  • 如何自建企业网站宁波人流
  • 珠海仿站定制模板建站团总支网站建设宣传
  • 网站优化平台有哪些有哪些做动图的网站
  • 知识产权教育平台网站开发总结在线捐款网站开发
  • 建网站要几个域名上海装修公司排名49
  • 怎么才能创个网站外贸公司网站如何免费推广
  • 网站建设 文件源代码约定建设部网站221号文件
  • 杭州做公司网站的公司做房产网站长