新词发现

发现新词

  • 目的:解决未登陆此;
  • 定义:不加入任何先验素材,直接从大规模的语料库中,自动发现可能成词的语言片段;
  • 影响因素:凝合度(最小支持度筛选)和自由程度(左右信息熵)

解决方案

不依赖于任何已有的词库,仅仅根据词的共同特征,将一段大规模语料中可能成词的文本片段全部提取出来,去除现有词库含有的词语,剩余的即新词

具体步骤如下

  • 1、词频筛选
  • 2、最小支持度筛选
  • 3、左右信息熵筛选
  • 4、去除已有的词库,即为新词发现

参考链接

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

  • 介绍 网络领域的新词发现是一个非常重要的nlp课题。在处理文本对象时,非常关键的问题在于“切词”这个环节,几乎所有...
    涛笙依旧_阅读 5,665评论 0 4
  • 今天笔者来介绍一下新词发现算法,顾名思义,新词发现算法饿的目的就是帮助我们发现新词。我们如果采用现在的分词技术,有...
    王同学死磕技术阅读 8,282评论 2 13
  • 本文主要参考文献1, 主要目的是记录和简化核心规则,并根据实践提出了一些实践中的方案。 新词发现规则 新词发现主要...
    galois_xiong阅读 1,304评论 0 0
  • 参考资料 主要参考了以下两篇文章:互联网时代的社会语言学:基于SNS的文本数据挖掘 基于信息熵和互信息的新词识别 ...
    yshhuang阅读 2,310评论 0 1
  • 新词自动发现已经成为文本挖掘方面非常基本常用的技术了。比如,我为了实现某个idea,需要对NBA新闻评论语料进行分...
    紫松阅读 1,209评论 6 12

友情链接更多精彩内容