- 35
- 0
#-*- coding:utf-8 -*-
import requests
import re
url_list = ['http://top.chinaz.com/hangye/index_news_{}.html'.format(pages) for pages in range(2, 68)]
url_list.insert(0, 'http://top.chinaz.com/hangye/index_news.html')
main_url = 'http://top.chinaz.com'
url_list_1 = requests.get(url_list[1]) # 打开第一个列表页
url_list_1.encoding = 'utf-8'
url_list_1 = url_list_1.text # 获取第一个列表页内容
url_content_all = re.findall('<div class="leftImg"><a name=".*?href="(.*?)">',url_list_1) # 获取第一个列表页所有详情页链接
url_content_0 = requests.get(main_url + url_content_all[0]) # 拼接第一个列表页的第一个详情页地址
url_content_0.encoding = 'utf-8'
url_content_0 = url_content_0.text # 获取第一个列表页的第一个详情页内容
website_0 = re.search('<h2 class="h2Title fl">(.*?)</h2>',url_content_0).group(1) # 获取网站名称
weburl_0 = re.search('<h2 class="h2Title fl">.*?</h2><p.*?href="(.*?)" target="_blank" >.*?</a>',url_content_0).group(1) # 获取网站 url
webdescription_0 = re.search('<p class="webIntro">(.*?)</p>',url_content_0).group(1) # 获取网站url
print('网站名称:' + website_0)
print('网址:' + weburl_0)
print('网站简介:' + webdescription_0)
以上,代码只是获取第一个列表页的第一个详情页的内容。总共有 67 个列表页,1340 个详情页,如果按照这种方法写...这种要怎么封装或者循环呢?
0
打赏
收藏
点击回答
网站公告
- 扫一扫访问手机版
回答动态

- 神奇的四哥:发布了悬赏问题阿里云幻兽帕鲁服务器更新之后。服务器里面有部分玩家要重新创建角色是怎么回事啊?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题函数计算不同地域的是不能用内网吧?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题ARMS可以创建多个应用嘛?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题在ARMS如何申请加入公测呀?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题前端小程序接入这个arms具体是如何接入监控的,这个init方法在哪里进行添加?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题阿里云幻兽帕鲁服务器刚到期,是不是就不能再导出存档了呢?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题阿里云幻兽帕鲁服务器的游戏版本不兼容 尝试更新怎么解决?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题阿里云幻兽帕鲁服务器服务器升级以后 就链接不上了,怎么办?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题阿里云幻兽帕鲁服务器转移以后服务器进不去了,怎么解决?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题阿里云幻兽帕鲁服务器修改参数后游戏进入不了,是什么情况?预计能赚取 0积分收益
- 回到顶部
- 回到顶部
