温馨提示×

温馨提示×

您好,登录后才能下订单哦!

密码登录×
登录注册×
其他方式登录
点击 登录注册 即表示同意《亿速云用户服务条款》

Python爬取豆瓣电影方法是什么

发布时间:2021-11-23 16:54:22 来源:亿速云 阅读:95 作者:iii 栏目:编程语言

本篇内容主要讲解“Python爬取豆瓣电影方法是什么”,感兴趣的朋友不妨来看看。本文介绍的方法操作简单快捷,实用性强。下面就让小编来带大家学习“Python爬取豆瓣电影方法是什么”吧!

主要目标


环境:MAC + Python3.6 ;  IDE: Pycharm. 具体使用的模块如下。


import requests import re import json

但是如果你的系统上安装了anaconda,模块requests已经安装完成,但是pycharm不能识别。此时只需要使用preferences直接进行安装,入下图所示,点击+,直接安装即可。


爬取分析


对于每一个页面的爬取,我们使用的requests库。Requests是用python语言基于urllib编写的,采用的是Apache2 Licensed开源协议的HTTP库。它比urllib更加方便,可以节约我们大量的工作。(用了requests之后,你基本都不愿意用urllib了)一句话,requests是python实现的最简单易用的HTTP库,建议爬虫使用requests库。默认安装好python之后,是没有安装requests模块的,需要单独通过pip安装或者使用pycharm软件安装(如上文所示).

直接使用库requests中的get方法对目标网址发出申请。为了防止请求的页面没有成功,我们添加了捕获异常的代码块try,except。另外,如果多次爬取同一个网址,您的ip可能被封,不能在爬取任何信息。为了解决此问题,本次在代码中设置了代理信息,具体代码请关注人工智能与大数据生活(data_circle),文末长按二维码即可,回复 ”豆瓣电影“ 获得全部代码。

`python` def get_one_page(url):     '''
        抓取第一页内容
    :return: 请求的页面的信息
    '''     try:
       
        response = requests.get(url,headers=headers)

        if response.status_code == 200:
            return response.text

        return None     except RequestException:
        return None


页面解析


解析后的结果,我们使用write函数写入csv文件中,代码如下。

def write_to_file(content): '''

          保存结果到CSV文件
    :param content:
    :return: 无
    '''

    with open('douban_movie_250.csv','a',encoding='utf-8') as f:
        f.write(json.dumps(content,ensure_ascii=False)+'\n')

到此,相信大家对“Python爬取豆瓣电影方法是什么”有了更深的了解,不妨来实际操作一番吧!这里是亿速云网站,更多相关内容可以进入相关频道进行查询,关注我们,继续学习!

向AI问一下细节

免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。

AI