当前位置: 首页 > news >正文

如何使用好单库选品库做网站潍坊网站建设

如何使用好单库选品库做网站,潍坊网站建设,做网站好还是网页好,网站如何申请问题1: BERT训练时候的学习率learning rate如何设置? 在训练初期使用较小的学习率(从 0 开始),在一定步数(比如 1000 步)内逐渐提高到正常大小(比如上面的 2e-5),避免模型过早进入…
  • 问题1: BERT训练时候的学习率learning rate如何设置?

在训练初期使用较小的学习率(从 0 开始),在一定步数(比如 1000 步)内逐渐提高到正常大小(比如上面的 2e-5),避免模型过早进入局部最优而过拟合;

在训练后期再慢慢将学习率降低到 0,避免后期训练还出现较大的参数变化。

在 Huggingface 的实现中,可以使用多种 warmup 策略:

TYPE_TO_SCHEDULER_FUNCTION = {SchedulerType.LINEAR: get_linear_schedule_with_warmup,SchedulerType.COSINE: get_cosine_schedule_with_warmup,SchedulerType.COSINE_WITH_RESTARTS: get_cosine_with_hard_restarts_schedule_with_warmup,SchedulerType.POLYNOMIAL: get_polynomial_decay_schedule_with_warmup,SchedulerType.CONSTANT: get_constant_schedule,SchedulerType.CONSTANT_WITH_WARMUP: get_constant_schedule_with_warmup,
}

具体而言:

CONSTANT:保持固定学习率不变;

CONSTANT_WITH_WARMUP:在每一个 step 中线性调整学习率;

LINEAR:上文提到的两段式调整;

COSINE:和两段式调整类似,只不过采用的是三角函数式的曲线调整;

COSINE_WITH_RESTARTS:训练中将上面 COSINE 的调整重复 n 次;

POLYNOMIAL:按指数曲线进行两段式调整。 具体使用参考transformers/optimization.py: 最常用的还是get_linear_scheduler_with_warmup即线性两段式调整学习率的方案。

  • 问题2: BERT模型使用哪种分词方式?

BERT 使用的分词方式是基于 WordPiece Tokenization 的。

WordPiece 将单词分成子词单元。例如,单词 "playing" 可以被分解成 ["play", "##ing"],其中 "##" 表示这个子词不是一个独立的词,而是一个前一个词的继续

通过子词分词,BERT 可以使用较小的词汇表来覆盖更多的词汇。BERT 的词汇表大小通常是 30,000 左右

当遇到一个未登录词时,WordPiece 会将其拆分成多个子词,这些子词组合起来能够尽可能地匹配原始词

  • 问题3: 如何理解BERT模型输入的type ids?

用于区分模型输入中的不同句子,指示每个 token 属于哪一个句子

区分句子对

当输入包含两个句子时,type_ids 用于指示每个 token 属于哪个句子。句子 A 的所有 token 的 type_id 为 0,句子 B 的所有 token 的 type_id 为 1。

用于注意力机制

BERT 模型的自注意力机制会结合 type_ids 信息来学习句子间的关系。通过这种方式,模型能够区分两个句子并理解它们之间的关系。

  • 问题4: Hugginface代码中的BasicTokenizer作用是?

将输入文本分解成单独的 token:

将标点符号与单词分开、可以将文本转换为小写、去除多余的空格,确保每个 token 之间只有一个空格、确保输入文本是规范的 Unicode 格式

  • 问题5: WordPiece分词的好处是什么?

既在一定程度保留了词的含义,又能够照顾到英文中单复数、时态导致的词表爆炸和未登录词的 OOV(Out-Of-Vocabulary)问题,将词根与时态词缀等分割出来,从而减小词表,也降低了训练难度

  • 问题6: BERT中的warmup作用是什么?

避免模型过早进入局部最优而过拟合、避免后期训练还出现较大的参数变化

http://www.tj-hxxt.cn/news/88264.html

相关文章:

  • wordpress企业门户网站千锋教育培训
  • 书籍网站开发多少钱鞍山seo公司
  • 怀柔住房和城乡建设委员会网站深圳网站优化公司哪家好
  • 一般企业网站3年多少钱产品推广文案怎么写
  • 企业做网站可以带中国吗郑州今天刚刚发生的新闻
  • 怎么做网站导航栏中国舆情在线
  • 网站开发工程师的工作内容无屏蔽搜索引擎
  • 桂林 网站 制作如何做网络推广运营
  • 网站分享的功能怎么做的搜索引擎排名优化价格
  • 住房城乡建设局网站首页sem是什么仪器
  • 武汉网站建设四川seo选哪家
  • 企业检索网站建设网络推广运营公司
  • 济南传承网站建设李聪网站设计专业的公司
  • 如何盗用网站模板排名优化网站建设
  • 住房和城乡建设部贰级建造师网站深圳优化服务
  • 企业网站建设与管理期末考试seo排名赚app官网
  • 网站建设制作设计营销公司杭州微营销系统
  • discuz 网站风格google官方版下载
  • 百度站长工具平台登录网络的推广方式有哪些
  • 三亚网站建设制作湖北网站建设制作
  • html5+css手机网站正规的代运营公司
  • 购物网站建设投资预算拉新推广
  • mac上如何使用wordpress优化设计电子课本
  • 东莞做网站的品牌全案营销策划
  • wordpress网站文章被插入很多黑链接目前最靠谱的推广平台
  • 做任务给佣金的网站有哪些网络推广策划方案
  • 做网站的软件多少钱自己搭建一个网站
  • java网站开发的书籍核心关键词和长尾关键词
  • 商业网站建立长春seo关键词排名
  • 网站分析设计做的项目的过程黑帽seo技术培训