python爬虫框架scrap的使用方法-创新互联-快上网网站建设公司

python爬虫框架scrap的使用方法-创新互联

小编给大家分享一下python爬虫框架scrap的使用方法，相信大部分人都还不怎么了解，因此分享这篇文章给大家参考一下，希望大家阅读完这篇文章后大有收获，下面让我们一起去了解一下吧！

从网站建设到定制行业解决方案，为提供网站设计、成都做网站服务体系，各种行业企业客户提供网站建设解决方案，助力业务快速发展。成都创新互联公司将不断加快创新步伐，提供优质的建站服务。

关于Scrapy 简介

Scrapy是一个为了爬取网站数据，提取结构性数据而编写的应用框架。可以应用在包括数据挖掘，信息处理或存储历史数据等一系列的程序中。

安装

在linux 和 Mac 系统下，可使用 pip安装。

pip install scrapy

Windows上的安装方式

conda install -c conda-forge scrapy

Scrapy 基本使用

第一步，创建项目

scrapy 提供了一些命令行工具，可直接生成项目代码。我们可直接使用如下命令来生成项目代码

scrapy startproject v6_scrapy

第二步，编写Spider

在sipders目录中，添加我们的爬虫文件toutiao_spider.py，内容如下：

# -*- coding:utf-8 -*-
import scrapy
 
 
class ToutiaoSpider(scrapy.Spider):
    name = 'toutiao'
    start_urls = [
        '/tupian/20230522/ai
    ]
 
    def parse(self, response):
        """
        实现html解析
        :param response:
        :return:
        """
        papers = response.xpath('//a[@rel="external"]')
        for paper in papers:
            title = paper.xpath('./@title').extract()[0]
            href = 'https://toutiao.io%s' % paper.xpath('./@href').extract()[0]
        
        print(title, href)

在完成之后，执行如下代码启动爬虫：

scrapy crawl toutiao

第三步，定义item

scrapy 使用Item类来结构化数据，以方便对数据的操作。

class ToutiaoItem(scrapy.Item):
    title = scrapy.Field()
href = scrapy.Field()

第四步，构建 Item pipeline 持久化到文件

我们看下如何将爬取到的数据保存到文件，代码如下：

class V6ScrapyFilePipeline(object):
 
    def __init__(self):
        self.file = open('toutiao.json', 'wb')
 
    def process_item(self, item, spider):
        if item['title']:
            line = json.dumps(dict(item))+"\n"
            self.file.write(line.encode())
            return item
        else:
            raise DropItem('在[%s]item中，没有title关键字'%item)

以上是python爬虫框架scrap的使用方法的所有内容，感谢各位的阅读！相信大家都有了一定的了解，希望分享的内容对大家有所帮助，如果还想学习更多知识，欢迎关注创新互联行业资讯频道！

分享文章：python爬虫框架scrap的使用方法-创新互联
本文路径：http://www.cdkjz.cn/article/gsoec.html

多年建站经验

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

咨询相关问题或预约面谈，可以通过以下方式与我们联系

网站建设

网站推广

案例

方案

电商网站开发

微信小程序

我们

联系

精准传达 • 有效沟通

查看其它板块

python爬虫框架scrap的使用方法-创新互联

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接

网络推广

Network promotion

网站方案

Solution

电商网站开发

E-commerce & System

我们

About Us

联系

Contact Us

精准传达 • 有效沟通

查看其它板块

python爬虫框架scrap的使用方法-创新互联

相关资讯

layui.laypage怎么用

认真就赢了！做好这两个状态可以迅速提高用户体验

智享未来“宅经济”助力智能家居再升级

独自吃雪糕被嘲“人生失败”别用网络臆想绑架张宏民

php如何去掉数组重复的值？

好物优选智能扫地机器人哪个牌子好？

“云医疗”快速发展 互联网诊疗同比增长十七倍

那些渴望着报复性消费的人或企业到底怎么样了？

多一份参考，总有益处

联系快上网，免费获得专属《策划方案》及报价

大客户专线 成都：13518219792 座机：028-86922220

友情链接 交换友情链接

“云医疗”快速发展互联网诊疗同比增长十七倍

大客户专线成都：13518219792 座机：028-86922220

友情链接交换友情链接