采集DedeCMS自动采集功能教程.doc

dedecms自动采集  时间:2021-03-19  阅读:()

DedeCMSV5.6版自动采集功能规则使用基本知识讲解教程(一)

2011-05-05 17:09:01来源:作者: 【大中小】 浏览:5026次评论:0条★★我要投稿★★将此页添加到网摘

DedeCMS采集功能使用基本知识讲解采集是指有着确定方向、明确目的的采撷和记录写作材料的一种活动。它主要指调查采访和查阅和搜集资料。采集最主要的作用在于为写作、分析、报表获取直接的和间接的材料。今天我们讲的采集主要是指网站采集网站采集的概念主要是程序按照指定的规则定向获取其他网站数据的一种方式另一种简单的说法就是将CTRL+C CTRL+V程序化系统化 自动化智能化

DedeCMS早期就已经加入了这个采集的功能 以前我们添加网站内容一般都是通过复制、粘贴、编辑然后再发布这样对于少量的文章还是可以但如果对于一个新站什么内容都没有那就需要复制粘提大量的文章这是一个重复、枯燥的过程 内容采集就是解决这个问题将这个重复的操作简化成规则通过规则进行批量操作。

当然采集还可以通过一些专门的采集器来进行采集国内比较出名的采集器有火车头。

今天我们这里以DedeCMS程序自带的采集功能来讲解如何使用采集并介绍如何对采集的内容进行一些批量的管理。

首先我们进入系统后台打开[采集]-[采集节点管理]在学习使用这个采集工能之前先介绍一些基本的技术知识。

首先我们需要知道HTML基本内容我们知道浏览器中显示的各种各样的页面其实都是由最基本的HTML组成的我们可以在我们DedeCMS系统后台发布一篇内容然后对内容进行一些格式上面的设置。

也就是说我们的页面都是HTML代码经过浏览器解析后显示出来的这些基本的HTML代码是给机器看的而解析出来显示的内容是给我们的用户看的机器其实是一个死东西他阅读网页不像用户一样直接看到某一个部分的内容机器能够看到的是某一部分代码。

DedeCMSV5.6版自动采集功能规则使用基本知识讲解教程(二)

2011-05-05 17:09:01来源:作者: 【大中小】 浏览:5027次评论:0条★★我要投稿★★

将此页添加到网摘

例如我们查看一个网页 http://www.dedemo.cn/news/cms/2009/0304/791.html我们很容易就看到这个文档的内容部分如图中黄色区域。

我们的电脑是看不出来的他不过判断显示出来的东西他只会去解析代码我们右键查看这个文件的源文件。

机器是阅读这些代码内容的他只能看懂这部分的内容在下面这个地方

也就是说我们如果需要采集这些内容需要告诉机器你应该从哪段代码开始然后到什么地方结束 中间的这个部分就是我们需要的内容然后将这些内容自动添加到数据库中来省去自己添加内容的枯燥。

DedeCMSV5.6版自动采集功能规则使用基本知识讲解教程(三)

2011-05-05 17:09:01来源:作者: 【大中小】 浏览:5028次评论:0条★★我要投稿★★

将此页添加到网摘

这里我们就讲到了采集中的一个概念规则规则简单的说也就是我们告诉计算机需做什么 比如采集内容我们告诉计算机从什么地方的代码开始到什么地方的代码结束这些内容就是一个规则在DedeCMS程序中我们需要涉及到2个地方的规则 1.列表规则 2.内容规则。

列表规则告诉计算机你去采集哪几篇文章这些文章列表从什么HTML代码开始到什么HTML代码结束

内容规则告诉计算机去采集哪个部分的内容文档的内容是从什么HTML代码开始到什么HTML代码结束

我们说学会使用采集功能其中最主要的也就是学会制定采集的规则有了这些规

则之后采集其实是非常简单的一件事情。

采集的一般步骤主要有以下几步

1. 制定列表采集规则这里设置主要告诉服务器你采集哪些内容一般都是被采集网站的列表页

2. 制定内容采集规则这里告诉服务器你采集页面的内容在页面的哪个部分一般都是被采集网站的内容页

3. 选择栏目、条件导出采集内容

4. 批量对采集过来的内容进行维护 可以没有

5. 生成采集后的HTML页面代码

我们也能够很清晰的看出采集最关键也是前2个步骤这两个步骤是决定采集内容是否成功的一个重要环节有一个地方采集出错都将不会成功采集到网站的内容。第一部分结束

下面我们结合实例讲解如何使用DedeCMS的采集程序来采集页面信息。

我们来看打开的采集节点管理页面

我们把一个整体的采集规则及内容成为一个节点我们通过对节点的管理可以轻松方便的对我们采集的规则及采集的内容进行管理 当然采集规则也是可以导出的我们只需要选中相应的采集节点但后单击[导出配置] 就可以将我们事先指定好的采集规则导出来 同大家一同分享。

当然获得了节点规则也可以通过系统的[导入采集规则]将采集规则导入到系统中去这样方便了对采集节点的管理 同时我们也可以查看这个节点当前采集的内容信息如采集的日期、创建节点的日期、获取的网址数等等这些都是采集节点的重要组成部分。

我们下面以采集织梦非官方站点的站长学院栏目为例讲解如何采集内容的。被采

这个是文档内容所以我们在创建节点的时候先选择“普通文章” 在V5.3中只有普通文章和图集2个支持采集的 以前可以自己定义但后来发现用的人很少并且使用起来很多人问题重重所以在新版本中取消了自己制定采集节点的这些功能。选择完节点类型后我们开始创建节点第一个部分是节点的基本信息创建 “节点名称” 这个比较简单就是方便你分辨节点的名称这里我们定义为“站长学院_采集”  “目标页面编码” 这个需要你看下你被采集的网页是用的什么编码一般如果使用的IE浏览器只需要右键就可以查看到

Fiberia.io:$2.9/月KVM-4GB/50GB/2TB/荷兰机房

Fiberia.io是个新站,跟ViridWeb.com同一家公司的,主要提供基于KVM架构的VPS主机,数据中心在荷兰Dronten。商家的主机价格不算贵,比如4GB内存套餐每月2.9美元起,采用SSD硬盘,1Gbps网络端口,提供IPv4+IPv6,支持PayPal付款,有7天退款承诺,感兴趣的可以试一试,年付有优惠但建议月付为宜。下面列出几款主机配置信息。CPU:1core内存:4GB硬盘:...

RackNerd:美国便宜VPS,洛杉矶DC-02/纽约/芝加哥机房,4TB月流量套餐16.55美元/年

racknerd怎么样?racknerd美国便宜vps又开启促销模式了,机房优秀,有洛杉矶DC-02、纽约、芝加哥机房可选,最低配置4TB月流量套餐16.55美元/年,此外商家之前推出的最便宜的9.49美元/年套餐也补货上架,同时RackNerd美国AMD VPS套餐最低才14.18美元/年,是全网最便宜的AMD VPS套餐!RackNerd主要经营美国圣何塞、洛杉矶、达拉斯、芝加哥、亚特兰大、新...

UCloud新人优惠中国香港/日本/美国云服务器低至4元

UCloud优刻得商家这几年应该已经被我们不少的个人站长用户认知,且确实在当下阿里云、腾讯云服务商不断的只促销服务于新用户活动,给我们很多老用户折扣的空间不多。于是,我们可以通过拓展选择其他同类服务商享受新人的福利,这里其中之一就选择UCloud商家。UCloud服务商2020年创业板上市的,实际上很早就有认识到,那时候价格高的离谱,谁让他们只服务有钱的企业用户呢。这里希望融入到我们大众消费者,你...

dedecms自动采集为你推荐
操作http企业推广最常见的推广方式有哪些苹果appstore宕机最近app store一直不能用 怎么回事啊 改dns也不能用 持续好久好久了重庆杨家坪猪肉摊主杀人重庆一市民发现买的新鲜猪肉晚上发蓝光.专家解释,猪肉中含磷较多且携带了一种能发光的细菌--磷光杆菌时flashfxp下载怎样用FlashFXP从服务器下载到电脑上?重庆电信dnsPSP上网急救!重庆电信的DNS是多少啊?邮件eset抢米网抢小米手机需要下什么软件 速求三五互联科技股份有限公司三五互联 网站做的怎么样 公司打算做网站,近来接到电话,不知道网站做的如何,水平怎么样,后期的服务呢团购程序有什么好用的社区团购小程序?
cn域名价格 西部数码vps 万网域名管理 awardspace t牌 视频存储服务器 163网 wordpress技巧 174.127.195.202 godaddy域名转出 12306抢票助手 服务器维护方案 网站木马检测工具 世界测速 免费智能解析 最好的qq空间 卡巴斯基免费试用 免费dns解析 上海服务器 江苏双线服务器 更多