欢迎您光临深圳塔灯网络科技有限公司!
电话图标 余先生:13699882642

phpcms V9采集模块如何操作

发表日期:2018-06 文章编辑:小灯 浏览次数:3475

采集模块

位置:内容 > 内容发布管理 > 采集管理 >

模块常用操作

操作名说明
采集流程详述
其它功能说明

说明:

文章的采集功能是通过程序来远程获取目标网页内容,经过本地规则解析处理后存储到服务器的数据库内。

文章采集系统颠覆传统采集模式和流程,采集规则与采集界面分离,规则设置更简单,只需有基础技术知识的人员设置好相关规则。编辑人员无需了解太过细节的技 术规则,只需选中自己想要采集的文章列表,就可以像发布文章一样,轻松地完成数据采集操作。
一、采集流程
简单的讲有三个步骤:
1、添加采集点,填写采集规则。
2、采集网址,采集内容
3、发布内容到指定栏目
以采集新浪新闻(http://roll.news.sina.com.cn/news/gjxw/gjmtjj/index.shtml)为例,作一下详细流程介绍。
实例说明:
目标:采集新浪新闻到V9系统 国际新闻 栏目中。
目标网址:http://roll.news.sina.com.cn/news/gjxw/gjmtjj/index.shtml
1、添加采集点
1.1 网址规则配置
添加采集点 - 网址规则配置图1
查看要采集的目标网址源代码,查找到要采集网址的开始点和结束点(这二个点要有在整个源代码里具有唯一性)。更进一步缩小采集网址搜索范围。
添加采集点 - 网址规则配置图2
测试你的网址采集规则是否正确,如下图所示
1.2 内容规则配置
内容规则这里看起来比较复杂,其实也很简单,为了便于说明,我们只采集标题、内容两个字段。采集内容网址:
http://news.sina.com.cn/w/2010-12-01/135121565455.shtml的内容采集规则,请你打开这个网址,然后页面空白处右键->查看源文件搜索标题和内容的开始边界。
标题采集配置:
从网页<title></title>里取标题,并去除不需要的字符。如下图
内容采集配置:
新浪新闻最终页,新闻内容都包含在<!-- 正文内容 begin --> <!-- 正文内容 end --> 之间,而且这二个结点,在整个页面源代码中具有唯一性。所以可以以此为规则取内容。并对内容进行过滤。如下图
1.3 自定义规则
1.4 高级配置
可设置是否把图片下载到服务器上,是否打水印等配置。
2、采集网址,采集内容
采集规则配好以后,即可进行网址的采集,然后进行内容的采集。

3、发布内容到指定栏目

选择导入的栏目


设置 采集内容与数据库的字段对应关系.提交进行数据入库,在此期间请耐心等待, 完成后会自动转向。至此一个简单的采集流程就操作完成。
其它更多功能,期待你发掘。

本页内容由塔灯网络科技有限公司通过网络收集编辑所得,所有资料仅供用户参考了本站不拥有所有权,如您认为本网页中由涉嫌抄袭的内容,请及时与我们联系,并提供相关证据,工作人员会在5工作日内联系您,一经查实,本站立刻删除侵权内容。本文链接:https://dengtar.com/3545.html
相关cms文章
 八年  行业经验

多一份参考,总有益处

联系深圳网站公司塔灯网络,免费获得网站建设方案及报价

咨询相关问题或预约面谈,可以通过以下方式与我们联系

业务热线:余经理:13699882642

Copyright ? 2013-2018 Tadeng NetWork Technology Co., LTD. All Rights Reserved.