推荐星级:
  • 1
  • 2
  • 3
  • 4
  • 5

基于互信息改进算法的新词发现对中文分词系统改进

更新时间:2020-01-21 20:12:32 大小:1M 上传用户:songhuahua查看TA发布的资源 标签:互信息改进算法 下载积分:1分 评价赚积分 (如何评价?) 打赏 收藏 评论(0) 举报

资料介绍

提出一种非监督的新词识别方法。该方法利用互信息(PMI)的改进算法——PMIk算法与少量基本规则相结合,从大规模语料中自动识别2~n元网络新词(n为发现的新词最大长度,可以根据需要指定)。基于257MB的百度贴吧语料实验,当PMIk方法的参数为10时,结果精度达到97.39%,比PMI方法提高28.79%,实验结果表明,该新词发现方法能够有效地从大规模网络语料中发现新词。将新词发现结果编纂成用户词典,加载到汉语词法分析系统ICTCLAS中,基于10 KB的百度贴吧语料实验,比加载用户词典前的分词结果准确率、召回率和F值分别提高7.93%,3.73%和5.91%。实验表明,通过进行新词发现能有效改善分词系统对网络文本的处理效果。


部分文件列表

文件名 大小
基于互信息改进算法的新词发现对中文分词系统改进.pdf 1M

【关注B站账户领20积分】

全部评论(0)

暂无评论

上传资源 上传优质资源有赏金

  • 打赏
  • 30日榜单
  • 21ic下载 打赏310.00元   1天前

    用户:w178191520

  • 21ic下载 打赏310.00元   1天前

    用户:小猫做电路

  • 21ic下载 打赏310.00元   1天前

    用户:zhengdai

  • 21ic下载 打赏220.00元   1天前

    用户:gsy幸运

  • 21ic下载 打赏220.00元   1天前

    用户:jh0355

  • 21ic下载 打赏210.00元   1天前

    用户:jh03551

  • 21ic下载 打赏60.00元   1天前

    用户:sun2152

  • 21ic下载 打赏60.00元   1天前

    用户:xuzhen1

  • 21ic下载 打赏80.00元   1天前

    用户:xzxbybd

  • 21ic下载 打赏60.00元   1天前

    用户:铁蛋锅

  • 21ic下载 打赏60.00元   1天前

    用户:liqiang9090

  • 21ic下载 打赏20.00元   1天前

    用户:方中禾

  • 21ic下载 打赏20.00元   1天前

    用户:w1966891335

  • 21ic下载 打赏30.00元   1天前

    用户:玉落彼岸

  • 21ic下载 打赏15.00元   1天前

    用户:kk1957135547

  • 21ic下载 打赏15.00元   1天前

    用户:w993263495

  • 21ic下载 打赏15.00元   1天前

    用户:x15580286248

  • 21ic下载 打赏20.00元   1天前

    用户:WK520077778

  • 21ic下载 打赏25.00元   1天前

    用户:hp860629

  • 21ic下载 打赏15.00元   1天前

    用户:sbfd010

  • 21ic下载 打赏10.00元   1天前

    用户:严光辉

推荐下载