账号密码登录
微信安全登录
微信扫描二维码登录

登录后绑定QQ、微信即可实现信息互通

手机验证码登录
找回密码返回
邮箱找回 手机找回
注册账号返回
其他登录方式
分享
  • 收藏
    X
    使用CrawlSpider翻页抓取时,如何抓取第一页上面的内容?
    25
    0

    我使用CrawlSpider结合下面的Rules来进行自动翻页,爬取豆瓣top250的电影信息:

    rules = (
            Rule(LinkExtractor(restrict_xpaths='//span[@class="next"]/a'), 
            callback='parse_item', follow=True),
        )
    
    

    因为我想要抓取的信息都在表层的网页上,所以我不需要进入到每一页上的URL里面。

    但是这样问题就来了,即使callback设置了处理函数,但是只有当LinkExtractor提取第二页链接并生成Response的时候才会开始调用callback函数,那这样第一页的内容就没了。

    网上搜索过一些其他方案,但是基本都是用两个或以上的Rule(他们需要进入到深层的URL)。如果用最基本的Spider手动写翻页代码的话确实可以解决这个问题,可是能不能用CrawlerSpider解决呢,因为这样看起来优雅一点。

    0
    打赏
    收藏
    点击回答
        全部回答
    • 0
    更多回答
    扫一扫访问手机版
    • 回到顶部
    • 回到顶部