- 27
- 0
我想用scrapy爬取自己csdn上的所有博客,但是遇到置顶的这个文章就不知道怎么处理了。
HTML代码如下。span里面有一个红色的font,这种情况下应该如何忽略这个置顶而获取链接其他部分的文字呢?
<a href="/u011054333/article/details/49305291">
<font color="red">[置顶]</font>
计算机专业学生必看!各个公司的学生优惠活动
</a>
0
打赏
收藏
点击回答
- 共 0 条
- 全部回答
-
ιцo單līanんメ 普通会员 1楼
在Scrapy中,获取超链接中的文字可以通过以下步骤实现:
- 首先,你需要安装Scrapy和Scrapy-Link库。你可以使用pip进行安装:
bash pip install scrapy pip install scrapy-Link- 然后,你需要在你的Scrapy爬虫中编写一个函数,这个函数将遍历所有的链接,并获取每个链接中的文本。
```python import scrapy
class LinkTextSpider(scrapy.Spider): name = 'link_text' allowed_domains = ['example.com'] start_urls = ['http://example.com']
def parse(self, response): links = response.css('a::attr(href)').getall() for link in links: yield {'link': link, 'text': link.get('text')}```
在这个函数中,我们首先导入了Scrapy库,然后定义了我们的爬虫的名称、允许的URL和开始的URL。然后,我们定义了一个名为
parse的函数,这个函数将遍历所有的链接,并获取每个链接中的文本。在
parse函数中,我们使用CSS选择器'a::attr(href)'来获取所有的链接,然后使用getall方法来获取所有的链接。然后,我们遍历所有的链接,并使用yield语句来生成每个链接的字典,字典的键是链接的URL,值是链接的文本。注意:这个函数只能获取到链接的文本,如果你需要获取到链接的href,你需要在CSS选择器中使用
'a::attr(href)'和::attr(href)'的组合。
更多回答
网站公告
- 扫一扫访问手机版
回答动态

- 神奇的四哥:发布了悬赏问题阿里云幻兽帕鲁服务器更新之后。服务器里面有部分玩家要重新创建角色是怎么回事啊?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题函数计算不同地域的是不能用内网吧?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题ARMS可以创建多个应用嘛?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题在ARMS如何申请加入公测呀?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题前端小程序接入这个arms具体是如何接入监控的,这个init方法在哪里进行添加?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题阿里云幻兽帕鲁服务器刚到期,是不是就不能再导出存档了呢?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题阿里云幻兽帕鲁服务器的游戏版本不兼容 尝试更新怎么解决?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题阿里云幻兽帕鲁服务器服务器升级以后 就链接不上了,怎么办?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题阿里云幻兽帕鲁服务器转移以后服务器进不去了,怎么解决?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题阿里云幻兽帕鲁服务器修改参数后游戏进入不了,是什么情况?预计能赚取 0积分收益
- 回到顶部
- 回到顶部
