Python模拟登录微博并爬取表情包-巨人网络通讯

Python模拟登录微博并爬取表情包

一、开发工具

**Python****版本：**3.6.4

相关模块：

DecryptLogin模块；

argparse模块；

requests模块；

prettytable模块；

tqdm模块；

lxml模块；

fake_useragent模块；

以及一些Python自带的模块。

二、环境搭建

安装Python并添加到环境变量，pip安装需要的相关模块即可。

三、原理简介

本来这个爬虫是想作为讲python异步爬虫的一个例子的，昨天代码写完测试了一下，结果是我微博账号和ip都直接被封了(并发数设的500）。

然后我去谷歌搜了一下别人写的异步爬虫教程，测试用的都是些没啥反爬措施的小网站。

于是今天改了下代码，就先整个普普通通的微博小爬虫算了。

言归正传，和之前的微博爬虫类似，我们还是先利用DecryptLogin进行微博账户的模拟登录：

'''模拟登录'''
@staticmethod
def login(username, password):
  lg = login.Login()
  _, session = lg.weibo(username, password, 'mobile')
  return session

然后让使用者输入目标微博用户的id：

user_id = input('请输入目标用户ID(例如: 2168613091) ——> ')

微博用户id在这可以看到：

根据用户输入的微博用户id，我们访问如下两个链接：

url = f'https://weibo.cn/{user_id}'
url = f'https://weibo.cn/{user_id}/info'

然后利用xpath提取用户的基本信息：

打印这些信息，让使用者确认自己输入的微博用户id是否无误：

tb = prettytable.PrettyTable()
tb.field_names = ['用户名', '关注数量', '被关注数量', '微博数量', '微博页数']
tb.add_row([nickname, num_followings, num_followers, num_wbs, num_wb_pages])
print('获取的用户信息如下:')
print(tb)
is_download = input('是否爬取该微博用户发的所有图片?(y/n, 默认: y) ——> ')

如果无误，就开始爬取该用户发的所有微博里的图片：

'''下载所有图片'''
def __downloadImages(self, userinfos, savedir):
  # 一些必要的信息
  num_wbs = userinfos.get('num_wbs')
  user_id = userinfos.get('user_id')
  num_wb_pages = userinfos.get('num_wb_pages')
  # 提取图片链接并下载图片
  page_block_size = random.randint(1, 5)
  page_block_count = 0
  for page in tqdm(range(1, num_wb_pages+1)):
    # --提取图片链接
    response = self.session.get(f'https://weibo.cn/{user_id}?page={page}', headers=self.headers)
    image_urls = self.__extractImageUrls(response)
    # --下载图片
    for url in image_urls:
      try:
        res = requests.get(url, headers={'user-agent': self.ua.random}, stream=True)
        with open(os.path.join(savedir, url.split('/')[-1]), 'wb') as fp:
          for chunk in res.iter_content(chunk_size=32):
            fp.write(chunk)
        print('[INFO]: Download an image from: ', url)
      except:
        pass
    # --避免给服务器带来过大压力and避免被封, 每爬几页程序就休息一下
    page_block_count += 1
    if page_block_count % page_block_size == 0:
      time.sleep(random.randint(6, 12))
      page_block_size = random.randint(1, 5)
      page_block_count = 0

这里避免爬虫被BAN的措施主要有以下几点：

每爬n页数据就暂停x秒，其中n是随机生成的，且n一直在变化，x也是随机生成的，且x也一直在变化；
下载图片时，使用随机的ua，并且不使用登录后的session来请求图片链接来下载该图片。

从返回的微博页内容里提取图片链接时，需要注意：

对转发微博的微博id和原创微博的微博id提取方式不同；
只有单张图片的微博和有多张图片的微博提取图片链接的方式是不同的；
有时候图片链接提取会出错，http变成了ttp，所以需要对提取的图片链接进行后处理，然后再去请求这些链接来下载图片。

大体的思路就是这样，因为其实没啥难点，就是用xpath来提取我们需要的信息就行了，所以就这么粗略地介绍一下吧。T_T

运行方式：

python weiboEmoji.py --username 用户名 --password 密码

到此这篇关于Python模拟登录微博并爬取表情包的文章就介绍到这了,更多相关Python爬取微博表情包内容请搜索脚本之家以前的文章或继续浏览下面的相关文章希望大家以后多多支持脚本之家！

您可能感兴趣的文章:

Python基于百度AI实现抓取表情包
Python实现微信表情包炸群功能
Python基础进阶之海量表情包多线程爬虫功能的实现
Python自动生产表情包
python实战之制作表情包游戏

上一篇：allure结合python生成测试报告教程
下一篇：如何利用AJAX获取Django后端数据详解

Python模拟登录微博并爬取表情包

一、开发工具 **Python****版本：**3.6.4 相关模块： DecryptLogin模块； argparse模块； requests模块； prettytable模块； tqdm模块； lxml模块； fake_useragent模块；以及一些Python自带的模块。二、环境Python,模拟,登录,微博,并,...

清远电商外呼系统报价（电商外呼客服是什么意思）

本篇文章给我们谈谈清远电商外呼体系报价，以及电商外呼客服是什么意思对应的常识...

武汉电销公司用什么电销卡

武汉电销公司用什么电销卡，武汉电销卡怎么办理，武汉电销卡去哪办最真诚的服务给...

安顺接电话机器人如何收费

安顺接电话机器人如何收费百应人工智能获客服务商是较领先的互联网一站式服务供应...

【北京物联卡】怎么申请企业申请物联卡需要哪些条件

互联网让我们实现了跨越地区的交流，让两个不同地区的人可以隔着千山万水随时交流...

办理400电话要注意哪些问题呢？

400电话是针对企业推出的业务，只要是企业，个体工商户，证件齐全都可以办理，具体...

固话外显手播外呼系统（固定电话外呼系统）

今天给各位分享固话外显手播外呼系统的知识，其中也会对固定电话外呼系统进行解释...

电话销售软件，合理分配更精准服务

电话销售软件，又叫电销客服机器人，是一款智能的电话销售工具。可以帮助企业解决...

杭州电销机器人哪里买的（机器人电销和人工电

本文目录一览：1、什么是电话机器人？哪家比较好？2、电话营销机器人哪一家公司好...

提示要删除您的亚马逊清单上的商标侵权者

在花费大量时间和精力在亚马逊上发布产品之后，您需要做的最后一件事是让某人来出...

400电话如何确保企业24小时服务？

近期有很多客户选择我们办理400电话，其中有一小部分企业办理400电话的理由是，企业...

QQ厘米秀进入IP化轨道，携手阅文推首部社交IP小说

2017上海书展现场，不但汇聚了众多出版社和文化机构，还迎来了一位“天外来客”——...

Win8照片应用不能显示新图片能显示新文件夹(为空)

一个朋友在使用Win8系统时遇到问题，照片应用的图片库里不显示我的电脑里库栏目下图...

400电话是有地域限制的吗？

400电话是全国业务，在我司办理的400没有地域的区分。除港、澳、台不能申请，国内的...

郑州智能外呼系统多少钱（郑州网络电话呼叫系统）

本文目录一览： 1、智能外呼体系多少钱？2、外呼体系多少钱一个月？3、电话外呼体系...

Python模拟登录微博并爬取表情包

全 部 栏 目

一、开发工具

二、环境搭建

三、原理简介

全部栏目