文本分类入门.pdf

  1. 1、本文档共26页,可阅读全部内容。
  2. 2、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
  3. 3、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载
  4. 4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
查看更多
文本分类入门 ( ) ( ) 文本分类入门((一))文本分类问题的定义 一个文本(以下基本不区分“文本”和“文档”两个词的含义)分类问题就是将一篇文档归 入预先定义的几个类别中的一个或几个,而文本的自动分类则是使用计算机程序来实现这样 的分类。通俗点说,就好比你拿一篇文章,问计算机这文章要说的究竟是体育,经济还是教 育,计算机答不上就打它的屁屁(……)。 注意这个定义当中着重强调的两个事实。 第一,用于分类所需要的类别体系是预先确定的。例如新浪新闻的分类体系,Yahoo! 网页导航的分类层次。这种分类层次一旦确定,在相当长的时间内都是不可变的,或者即使 要变更,也要付出相当大的代价(基本不亚于推倒并重建一个分类系统)。 第二,一篇文档并没有严格规定只能被分配给一个类别。这与分类这个问题的主观性有 关,例如找10个人判断一篇文章所陈述的主题究竟属于金融,银行还是财政政策领域,10 个人可能会给出11个不同的答案(聪明的读者,您应该能看出来并没有11个答案,这只 是一种修辞方法,笑),因此一篇文章很可能被分配到多个类别当中,只不过分给某些类别 让人信服,而有些让人感觉模棱两可罢了(说的专业点,置信度不一样)。 八股是一种写文章的格式,过去用于科举,现在用于科研,总之,和科学有点关系的文 章就得八股,鉴于我正锻炼自己写论文的能力,所以按照标准的格式,陈述了文本分类问题 的定义之后,我要说说它的应用范围。 现在一说到文本分类,大部分人想当然的将这个问题简化为判断一篇文章说的是什么, 这只是文本分类的一小部分应用,我们可以称之为“依据主题的分类”。实际上,文本分类还 可以用于判断文章的写作风格,作者态度(积极?消极?),甚至判断作者真伪(例如看看 《红楼梦》最后二十回到底是不是曹雪芹写的)。总而言之,凡是与文本有关,与分类有关, 不管从什么角度出发,依据的是何特征,都可以叫做文本分类。 当然,目前真正大量使用文本分类技术的,仍是依据文章主题的分类,而据此构建最多 的系统,当属搜索引擎。内里的原因当然不言自明,我只是想给大家提个醒,文本分类还不 完全等同于网页分类。网页所包含的信息远比含于其中的文字(文本)信息多得多,对一个 网页的分类,除了考虑文本内容的分类以外,链入链出的链接信息,页面文件本身的元数据, 甚至是包含此网页的网站结构和主题,都能给分类提供莫大的帮助(比如新浪体育专栏里的 网页毫无疑问都是关于体育的),因此说文本分类实际上是网页分类的一个子集也毫不为过。 当然,纯粹的文本分类系统与网页分类也不是一点区别都没有。文本分类有个重要前提:即 只能根据文章的文字内容进行分类,而不应借助诸如文件的编码格式,文章作者,发布日期 等信息。而这些信息对网页来说常常是可用的,有时起到的作用还很巨大!因此纯粹的文本 分类系统要想达到相当的分类效果,必须在本身的理论基础和技术含量上下功夫。 除了搜索引擎,诸如数字图书馆,档案管理等等要和海量文字信息打交道的系统,都用 得上文本分类。另外,我的硕士论文也用得上(笑)。 下一章和大家侃侃与文本分类有关的具体方法概览,有事您说话。 ( ) ( ) 文本分类入门((二))文本分类的方法 文本分类问题与其它分类问题没有本质上的区别,其方法可以归结为根据待分类数据的 某些特征来进行匹配,当然完全的匹配是不太可能的,因此必须(根据某种评价标准)选择 最优的匹配结果,从而完成分类。 因此核心的问题便转化为用哪些特征表示一个文本才能保证有效和快速的分类(注意这 两方面的需求往往是互相矛盾的)。因此自有文本分类系统的那天起,就一直是对特征的不 同选择主导着方法派别的不同。 最早的词匹配法仅仅根据文档中是否出现了与类名相同的词(顶多再加入同义词的处 理)来判断文档是否属于某个类别。很显然,这种过于简单的方法无法带来良好的分类效果。 后来兴起过一段时间的知识工程的方法则借助于专业人员的帮助,为每个类别定义大量 的推理规则,如果一篇文档能满足这些推理规则,则可以判定属于该类别。这里与特定规则 的匹配程度成为了文本的特征。由于在

文档评论(0)

汪汪队 + 关注
实名认证
内容提供者

该用户很懒,什么也没介绍

1亿VIP精品文档

相关文档