邮件一种基于机器学习的垃圾邮件智能过滤方法

垃圾邮件  时间:2021-02-20  阅读:()

第20卷第1期 现 代 电 力 Vol120 No11

2003年2月 MODERN ELECTRIC POWER Feb1 2003

一种基于机器学习的垃圾邮件智能过滤方法

周威成 马素霞 齐林海

关键词:Naive Bayes (N1B1)算法;机器学习;垃圾邮件过滤

中图分类号: TP3931098

文献标识码:A 文章编号: 100722322 (200)01220065203

很多商家利用E2 ma il的容易发送、价格便宜 识别以概率的形式给出一个定量表示。

)算法

“反动”信息方面,因为 “反动”信息比一般邮件 其中:P(ci| d)为文件d属于类型ci的概率;的邮件信息有着更鲜明的特征。同时,基于规则的 P(ci)为任意取一个文件属于c i的概率;过滤不能解决邮件过滤中的一个常见问题:邮件过 P(wj| ci)为类型ci中选定一个词为wj的概滤中常常会把垃圾邮件识别为正常邮件,把正常邮 率;

件识别为垃圾邮件。把垃圾邮件识别为正常邮件在 P(d)为任意取一个文件为d的概率。 对于一定范围内是可以接受的,但把正常邮件识别为垃 具体文件d,如果属于类型ci ,则P (ci圾邮件,则是不能接受的。如果能对识别给出一个 |d)为最大值。 由于P(d)是一个特定值,所以对定量的表示,将会是一个不错的解决办法。下文将 于文件d属于文件类型CN 1 B1,有

要介绍的利用Naive Bayes算法的过滤方法,能对 CN1B = m ax(P(ci)

收稿日期: 2002 12 16

作者简介:周威成(1978—) ,男,硕士研究生;主要研究方向为自然语言处理、计算机网络;马素霞(1964—) ,女,副教授,主要研究方向为算法设计、数据结构、MIS、 GIS。

66 现 代 电 力 2003年

c1=垃圾邮件, c2=正常邮件,直接应用N1B1分 | V | +∑s=1∑i=1 N(ws , di)

果是比较准确的。 目前无很好的解决方法,一般采用先定初始值,然

应用算法到垃圾邮件过滤中,需要把邮件表示 后根据实验测试和统计结果确定最佳值,一般初始成特征向量的形式。利用向量空间模型,定义空间 值定在几千左右。

中每一维对应整个信息库中的每一个词汇。每一封 特征项的选择,除了上面介绍的基于词汇的特邮件可以看作是一个向量d = (w1 , w2, 征项之外,还有非词汇特征项1比如说邮件是否带1wn), w1 , w2, , wn是W1 , W2, , Wn的 有附件,以及所带附件的扩展名等。邮件文本中包值。 Wi表示邮件中的词汇特征项或者一些非词 含的非汉字、字母信息也是区分邮件是否是垃圾邮汇的(比如说,邮件是否带有附件、附件的扩展名 件的很重要的一个方面。

机器学习

2 特征项选择

本文所采用的训练集的一部分是从一家公司的邮

第1期 周威成等:一种基于机器学习的垃圾邮件智能过滤方法 67

件服务器中由pro c ma il (一种基于规则的邮件过滤程 根据实验结果,当F1达到80%以上时,就可序)的过滤结果中整理的,一部分是从INTERNET 看作对邮件进行了比较准确的过滤。

新闻组中整理的。总共整理出900多封邮件。 由实验结果(表1)可以看出,Naive Bayes算

算法实现过程:首先,通过最大匹配(MM) 法在邮件过滤中可取得理想的结果。

法则对训练库中的邮件进行分词。然后按照文中介 表1 N1B1算法邮件过滤中应用的查全率和准确率和F1值

个分类过程1所以评估的标志主要是分类的准确程 用效果。但是对于信息更加复杂和抽象的中文邮件度。分类准确程度的参照物是通过算法判断后对文 的处理问题还有待于进行更加深入的研究。参 考 文 献

个人思维差异的因素)系统的两个指标

查全率是人工分类结果应有的文本中分类系统 [3]张晓冬,张书杰1关于信息过滤模型的探讨[J]1计算

准确率和查全率反映了分类质量的两个不同方 Processing,2000 ,3136

A Way to Filter Junk Mail Intell igently Based on Machine Learning

Zhou Weicheng,MaSuxia , Qi L inhai

(North China Electric Power University (Beijing)Department of Computer Science andTechnilogy)

Abstract : In order to filter the Unsolicited Bulk E2mail (UBE) , so2called the junk mail , the Naive Bayes(N1B1) algorithm is presented in detail1 The application of N1B1algorithm, and reformation for the specialcharacter of e2mail , is implemented1An evaluation algorithm of the application is given.The consequence of theevaluation shows that the effect isgood.

Keywords :Nave Bayes (N1B1) algorithm;Machine Learning; junk mail filtering

火数云 55元/月BGP限时三折,独立服务器及站群限时8折,新乡、安徽、香港、美国

火数云怎么样?火数云主要提供数据中心基础服务、互联网业务解决方案,及专属服务器租用、云服务器、专属服务器托管、带宽租用等产品和服务。火数云提供洛阳、新乡、安徽、香港、美国等地骨干级机房优质资源,包括BGP国际多线网络,CN2点对点直连带宽以及国际顶尖品牌硬件。专注为个人开发者用户,中小型,大型企业用户提供一站式核心网络云端服务部署,促使用户云端部署化简为零,轻松快捷运用云计算!多年云计算领域服务经...

创梦网络-江苏宿迁BGP云服务器100G高防资源,全程ceph集群存储,安全可靠,数据有保证,防护真实,现在购买7折促销,续费同价!

官方网站:点击访问创梦网络宿迁BGP高防活动方案:机房CPU内存硬盘带宽IP防护流量原价活动价开通方式宿迁BGP4vCPU4G40G+50G20Mbps1个100G不限流量299元/月 209.3元/月点击自助购买成都电信优化线路8vCPU8G40G+50G20Mbps1个100G不限流量399元/月 279.3元/月点击自助购买成都电信优化线路8vCPU16G40G+50G2...

优林云(53元)哈尔滨电信2核2G

优林怎么样?优林好不好?优林 是一家国人VPS主机商,成立于2016年,主营国内外服务器产品。云服务器基于hyper-v和kvm虚拟架构,国内速度还不错。今天优林给我们带来促销的是国内东北地区哈尔滨云服务器!全部是独享带宽!首月5折 续费5折续费!地区CPU内存硬盘带宽价格购买哈尔滨电信2核2G50G1M53元直达链接哈尔滨电信4核4G50G1M83元直达链接哈尔滨电信8核8G50G1M131元直...

垃圾邮件为你推荐
免费建站系统免费建站免费wap建站免费手机建站免费自助建站永久免费WAP手机自助建站免费空间免费建站空间自助建站什么情况下采用自助建站方式建站好?arm开发板arm开发板是干什么用的,是用在什么领域方面的godaddy通过什么网址可以查godaddy的域名信息xp系统停止服务XP系统停止服务后电脑怎么办?机械键盘轴打游戏用机械键盘到底什么轴好?安全漏洞什么是安全漏洞攻击??srv记录exchange 2010 自动发现需不需要srv记录网站优化方案网站建设及优化的方案网络虚拟机VMware虚拟机三种网络模式的区别有哪些?
云南服务器租用 荷兰vps z.com edis cpanel 512av 网盘申请 湖南服务器托管 dux 193邮箱 卡巴斯基官方免费版 建立邮箱 hkt 中国电信宽带测速器 域名与空间 登陆空间 网页提速 路由跟踪 游戏服务器出租 中国域名 更多