当前位置：网学 > 编程文档 > ASP > 正文

网站生成静态页面攻略2:数据采集

作者：用户投稿来源：网络发布时间： 13/06/17

即可如：page_<%="&page&"%>.htm
2、获取被采集网站的分页列表页内容
3、从分页列表代码中提取被采集的内容页面的URL连接地址
绝大部分分页页面里的内容页连接也有固定规则，如：

<a href="url1">连接1</a> <br>
<a href="url2">连接2</a> <br>
<a href="url3">连接3</a> <br>
用以下代码就可以获得一个URL连接集合

''-----------------翟振恺(小琦)
Set xiaoqi = New Regexp
xiaoqi.IgnoreCase = True
xiaoqi.Global = True
xiaoqi.Pattern = ””“.+?”““
Set Matches =xiaoqi.Execute(页面列表内容)
set xiaoqi=nothing
url=""
For Each Match in Matches
url=url&Match.Value
Next
''-----------------翟振恺(小琦)
4、取得被采集的内容页面内容，根据”提取标记“从被采集的内容页面分别截取要取得的数据。
因为是动态生成的页面，大多数内容页面内都有相同的html标记，我们可以根据这些有规则的标记提取需要的各个部分的内容。如：
每个页面都有网页标题<title>网页标题</title>，用我上面写的MID截取函数就可以获得<title></title>之间的值，也可以用正则表达式来获得。
例：

body("<title>网页标题</title>","<title>","</title>")

上一页 1 2

点击进入论坛和大家一起交流设计,分享设计素材,结交设计朋友

上一篇资讯： ASP智能搜索的实现

下一篇资讯：网站生成静态页面攻略3:防采集策略