- 43
- 0
rules = {
'sina':(
Rule(LinkExtractor(allow='/\d+-\d+-\d+\/.*?-.*?.shtml', deny=('http://search.sina.com.cn/.*?')),
callback='parse_item', follow=True),
)
}
如上,目的是从目标页面解析出符合条件的链接
目标页面示例:https://feed.sina.com.cn/api/roll/get?pageid=121&lid=1356&num=20&versionNumber=1.2.4&page=1&encode=utf-8&callback=feedCardJsonpCallback&_=1545017197742
试了很多正则的方法,都匹配不出来"urls":"[\"https:\\\/\\\/news.sina.com.cn\\\/o\\\/2018-12-18\\\/doc-ihqhqcir7816653.shtml\"]"这里面的链接,正则表达式测试过没问题,但是在scrapy 的Rule里就不行
- 共 0 条
- 全部回答
-
你不懂 普通会员 1楼
在Scrapy中,你可以使用
parse_request函数来解析JSON格式的链接。parse_request函数会尝试将请求体解析为一个字典,如果解析成功,那么这个字典就是你需要的链接。以下是一个简单的例子:
```python import scrapy
class MySpider(scrapy.Spider): name = 'myspider' start_urls = ['http://example.com']
def parse_request(self, response): if response.url.startswith('http://example.com'): yield response.url```
在这个例子中,
parse_request函数会尝试解析response.url字段的链接,如果解析成功,那么这个链接就是你需要的。如果你的链接格式是JSON格式,你可以使用
json.loads函数来解析。例如:```python import scrapy
class MySpider(scrapy.Spider): name = 'myspider' start_urls = ['http://example.com']
def parse_request(self, response): if response.url.startswith('http://example.com'): yield response.url json_data = response.json() if json_data: yield json.loads(json_data)```
在这个例子中,
parse_request函数会尝试解析response.url字段的链接,并且将解析结果转换为一个JSON对象,然后将这个JSON对象转换为一个字符串。
- 扫一扫访问手机版
回答动态

- 神奇的四哥:发布了悬赏问题阿里云幻兽帕鲁服务器更新之后。服务器里面有部分玩家要重新创建角色是怎么回事啊?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题函数计算不同地域的是不能用内网吧?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题ARMS可以创建多个应用嘛?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题在ARMS如何申请加入公测呀?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题前端小程序接入这个arms具体是如何接入监控的,这个init方法在哪里进行添加?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题阿里云幻兽帕鲁服务器刚到期,是不是就不能再导出存档了呢?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题阿里云幻兽帕鲁服务器的游戏版本不兼容 尝试更新怎么解决?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题阿里云幻兽帕鲁服务器服务器升级以后 就链接不上了,怎么办?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题阿里云幻兽帕鲁服务器转移以后服务器进不去了,怎么解决?预计能赚取 0积分收益

- 神奇的四哥:发布了悬赏问题阿里云幻兽帕鲁服务器修改参数后游戏进入不了,是什么情况?预计能赚取 0积分收益
- 回到顶部
- 回到顶部
