Tsys OkHtm.com修改版数据采集方法


采集功能

[1]分类管理

a 添加一个频道

http://www.****.com/Admin_ChkLogin.asp。
用户(密码)参数:查看登录表单源码,找到形如下面之类的代码
用户名:<input type="text" name="UserName" value="">
密码:<input type="password" name="Password" value="">
用户参数就是--第一行的name=后面的UserName
密码参数就是--第二行的name=后面的Password
失败信息: 用户名或者密码不正确时,登录后的失败提示信息,用于判断登录是否成功的一个标志,请一定要填写,否则不能采集,比如:您输入的用户名或密码不正确,请重新输入!
项目备注:该项目的其它要记录的信息,以后每天都要采集

b 列 表 设 置

http://www.it.com.cn/news/cyxw/yejie/index_1.html
   第二页http://www.it.com.cn/news/cyxw/yejie/index_2.html
   第三页http://www.it.com.cn/news/cyxw/yejie/index_3.html

   那么可以这设置:{$ID}是必须的

   原字符串:http://www.it.com.cn/news/cyxw/yejie/index_{$ID}.html

   生成范围:1--3

   结果程序会生成:http://www.it.com.cn/news/cyxw/yejie/index_1.html

   http://www.it.com.cn/news/cyxw/yejie/index_2.html

   http://www.it.com.cn/news/cyxw/yejie/index_3.html

   这样的几个列表页面

   (3)手动添加

   输入一页网址后按回车再输入另一页,如此反复可以输入多个网址。

(3)链接设置

   链接开始/结束标记:

   这里没设置好采集过程中可能会路途停止

   部分代码

<table width="98%" border="0" cellspacing="0" cellpadding="3">
<tr>
<td align="left" valign="top"><br>
<a href="List.asp?type=IT新闻">[IT新闻]</a><a href="New.asp?id=1" target=_blank>新闻标题</a>
<a href="List.asp?type=Pc新闻">[Pc新闻]</a><a href="New.asp?id=2" target=_blank>新闻标题</a>
....省略
<a href="List.asp?type=IT新闻">[IT新闻]</a><a href="New.asp?id=50" target=_blank>新闻标题</a>
</td>
</tr>
</table>
   红色部分为链接开始/结束标记,注意:如果新闻标题的前面有栏目链接(包括其它的链接,就像上面这个有IT新闻、Pc新闻一样)的,开始标记必须往前延伸,我以前做的3.62版的录像中开始标记是href=,这个只能用于新闻标题前面没有栏目链接的情况。

   链接的重新定位:

   如果新闻的链接特殊,可使用本功能对新闻网址重新定位,比如有些代码可能是这样:

<a href="Javascript:window.open('1')" target=_blank>新闻标题</a><br>
<a href="Javascript:window.open('5')" target=_blank>新闻标题</a><br>
....省略
<a href="Javascript:window.open('50')" target=_blank>新闻标题</a>

   把开始/结束标记设置为红色部分,点击一条新闻看它的真实网页地址,比如第一条新闻的地址是这样,http://www.scuta.net/news.asp?id=1,那么绝对链接就设置为http://www.scuta.net/news.asp?id={$ID}就成了。
c 列 表 截 取 测 试





d 列 表 新 闻 链 接 测 试



e 正 文 设 置



f 采 样 测 试



g 属 性 设 置



设置一些采集的选项,注意

采集选项: 立即发布 保存图片 倒序采集 外部链接 中 保存图片不要勾选.

h 点"完成".采集设置完毕

[3] 数据采集

在这里可以看到自己刚设置好的项目,
采集模式:快速模式 稳定模式 筛选模式 采集测试 正文预览
这几种自己琢磨了,不多描述 .结果都差不多.

然后开始漫长的采集过程.服务器速度和网速有关系.

[4] 数据审核

数据审核中,有"全选" "部分选择" "全部" 这几种模式,点标题可以查看采集的文章(带图片) .也可以删除数据

[5] 数据导出

是把数据从采集库中导入到cms数据表中,默认的是审核完的文章才可以导出,如果导出过的话会显示"已导出"反之亦然.

数据导出时有几个选项需要注意:



有三种导出模式: 部分选择,全部选择,整个栏目导出.但是不管那种模式都要选择 ·请输出的[资源类别]方向 或者[资源特性],这些是与系统中你建立的资源分类相挂勾的,选择导出到哪个分类.

导出完毕.

资源管理-->常规资源 中可以看到你刚才采集到的文章,默认为已经审核过.

然后可以选择生成或者编辑.
« 
» 
快速导航

Copyright © 2016 phpStudy | 豫ICP备2021030365号-3