文章来源设置
在该选项卡下我们需要设置文章来源的 文章列表网址 及 具体文章的匹配规则
我们以采集”新浪互联网新闻“为例,文章列表网址为 http://roll.tech.sina.com.cn/internet_worldlist/index.shtml
因此在 手工指定文章列表网址 中输入该网址即可,如下所示:

文章网址匹配规则
文章网址匹配规则的设置非常简单,无需复杂设置,提供两种匹配模式,可以使用 URL 通配符匹配,也可以使用 CSS 选择器进行匹配,通常 使用 URL 通配符匹配较为简单,但有时使用 CSS 选择器更为精确。
1. 使用 URL 通配符匹配
通过点击列表网址 http://roll.tech.sina.com.cn/internet_worldlist/index.shtml 上的文章,我们可以发现每篇文章的 URL 都为如下结构
http://tech.sina.com.cn/i/2013-06-27/16328485884.shtml
因此将 URL 中变化的数字或字母替换为通配符 (*) 即可,如:
http://tech.sina.com.cn/i/(*)/(*).shtml

2. 使用 CSS 选择器进行匹配
使用 CSS 选择器进行匹配,我们只需要设置 文章网址的 CSS 选择器 即可,通过查看列表网址 http://roll.tech.sina.com.cn/internet_worldlist/index.shtml 的源代码即可轻松设置,找到列表网址下文章超链接的代码,如下所示:

可以看到,文章的超链接 A 标签在 class 为“contList”的标签内部,因此 文章网址的 CSS 选择器 只需要设置为 .contList a 即可,如下所示:

不知道 CSS 选择器为何物,一分钟学会如何设置 CSS 选择器
设置完成之后,不知道设置是否正确,可以点击上图中的测试按钮,如果设置正确,将列出该列表网址下所有文章名称和对应的网页地址,如下所示:
