© 1999-2048 dssz.net 粤ICP备11031372号
[其它] t5-pegasus:中文生成式预训练模型-源码
说明:T5飞马 中文生成式预训练模型,以mT5为基础架构和初始权重,通过类似PEGASUS的方式进行预训练。 详情可见: ://kexue.fm/archives/8209 分词器 我们将T5 PEGASUS的令牌生成器转换成BERT的令牌生成器,它对中文更友好。同时,我们重新排列一版词表,从而里边的字,词都更加完善,目前的vocab.txt共包含5万个token,真正覆盖了中文的常用字,词。 预训练任务 具体来说,假设一个文档有n个句子,我们从中挑出大约n / 4个句子(可以不连续),因此这n /<weixin_42153691> 上传 | 大小:418kb