基于相似度曲线的新闻网页分类模型研究

基于相似度曲线的新闻网页分类模型研究

基于相似度曲线的新闻网页分类模型研究

  中图分类号:TP393  文献标识码:A  文章编号:1009-2552(2008)02-0015-04

基于相似度曲线的新闻网页分类模型研究

高加旺,孙名松,陈 福

1

1

2

(1.哈尔滨理工大学计算机科学技术学院,哈尔滨150080;

2.北京科技大学信息工程学院,100080)

摘 要:随着互联网的快速发展,。由于WWW上

的信息很多存储在HTML页面上,,详细设计并实现了一个中文网页分类模型,,有效地提高了采集的广度和深度。,,在建立VSM时提出了,此方法能有效解决特征提取的高维问题,并对提高特征区分度,。

关键词:;VSM模型;特征抽取;TF2IDF公式

Anewsclassificationmodelbasedonthesimilaritycurve

GAOJia2wang,SUNMing2song,CHENFu

1

1

2

(1.SchoolofComputerScience&Technology,HarbinUniversityofScienceandTechnology,Harbin150080,China;

2.InformationEngineeringCollege,BeijingUniversityofScienceandTechnology,Beijing100080,China)

Abstract:WiththerapiddevelopmentofInternet,networkbecameusefultooltosearchimportantsourceofdata.BecauseinformationontheWWWstoragesinHTMLpages,thewebclassificationbecomesaverynecessary.Thispaperusedopen2sourcesoftware,designedandimplementedofaChinesewebclassificationmodel.Thispaperusedmetasearchtechnologytoachievedataacquisition,effectivelyraisedthebreadthanddepthofacquisition.Usingtheprofessionalthesaurustosegmentimprovestheeffectivenessofthesegment.ThispaperpresentsafeatureextractionmethodbasedonthesimilaritycurvewhenVSMmodelissetup,ithaseffectivelyresolvedthehighdimensionalfeatureextractionandraisedthedistinction,reducedtheamountofcomputationandachievedgoodresult.

Keywords:similaritycurve;VSMmodel;featureextraction;TF2IDFformula

0 引言

随着互联网的快速发展,网络成了人们获取信息的重要途径,HTML网页已经成为网络的重要载体。截至2006年11月,全球网站数量已经突破1亿,而据中国互联网络信息中心2007年1月发布的中国互联网络发展状况统计报告显示,全国网页数量已经达到了44.7亿页

[1]

1 系统架构

此分类模型包括:①采集模块。利用元搜索技术,从Google,Baidu,Yahoo等新闻搜索网站根据输入的关键字,获取新闻信息。②预处理模块。本模块包括:网页清洗;建立正文DOM树,分段落;中文分

词,建立VSM(向量空间模型);利用相似度曲线降维。③分类模块。此模块用SVM理论进行分类包

收稿日期:2007-09-14

基金项目:国家自然科学基金(60673160)

作者简介:高加旺(1978-),男,硕士研究生,主要研究方向为网络

安全、自然语言处理等。

。因此,网页的获取和分

类日益成为研究的热点。作为获取即时信息重要途径的新闻网页分类更是受到更多研究者的关注。本文利用元搜索技术获取开源新闻网页,设计并实现了一个基于支持向量机的中文网页分类模型。

—15—

你可能喜欢

  • 动态网页
  • 网页制作与设计
  • 评价标准
  • 网站报价表
  • 自动文本分类
  • 评价指标
  • 网站制作报价

基于相似度曲线的新闻网页分类模型研究相关文档

最新文档

返回顶部