- 25
- 0
我使用CrawlSpider结合下面的Rules来进行自动翻页,爬取豆瓣top250的电影信息:
rules = (
Rule(LinkExtractor(restrict_xpaths='//span[@class="next"]/a'),
callback='parse_item', follow=True),
)
因为我想要抓取的信息都在表层的网页上,所以我不需要进入到每一页上的URL里面。
但是这样问题就来了,即使callback设置了处理函数,但是只有当LinkExtractor提取第二页链接并生成Response的时候才会开始调用callback函数,那这样第一页的内容就没了。
网上搜索过一些其他方案,但是基本都是用两个或以上的Rule(他们需要进入到深层的URL)。如果用最基本的Spider手动写翻页代码的话确实可以解决这个问题,可是能不能用CrawlerSpider解决呢,因为这样看起来优雅一点。
0
打赏
收藏
点击回答
网站公告
- 扫一扫访问手机版
回答动态

- 神奇的四哥:发布了悬赏问题阿里云幻兽帕鲁服务器更新之后。服务器里面有部分玩家要重新创建角色是怎么回事啊?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题函数计算不同地域的是不能用内网吧?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题ARMS可以创建多个应用嘛?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题在ARMS如何申请加入公测呀?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题前端小程序接入这个arms具体是如何接入监控的,这个init方法在哪里进行添加?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题阿里云幻兽帕鲁服务器刚到期,是不是就不能再导出存档了呢?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题阿里云幻兽帕鲁服务器的游戏版本不兼容 尝试更新怎么解决?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题阿里云幻兽帕鲁服务器服务器升级以后 就链接不上了,怎么办?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题阿里云幻兽帕鲁服务器转移以后服务器进不去了,怎么解决?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题阿里云幻兽帕鲁服务器修改参数后游戏进入不了,是什么情况?预计能赚取 0积分收益
- 回到顶部
- 回到顶部
