python爬取网页版QQ空间,生成各类图表
更新时间:2021年6月2日 00:00 点击:2157
github源码地址:
https://github.com/kuishou68/python
各类图表的实现效果
爬取的说说内容
个性化说说内容词云图
每年发表说说总数柱状图、每年点赞和评论折线图
7天好友动态柱状图、饼图
使用方法
按照你的谷歌浏览器下载指定版本的驱动 http://chromedriver.storage.googleapis.com/index.html
驱动跟两个python脚本放入同目录,我的版本是90.0.4430的,查看你自己的版本,下载后把我的chromedriver.exe替换掉!
这里用到了很多第三方包,鼠标放在报红的包名下,用Alt+Enter导包,如果失败则在控制台用下面的必杀技
pip install 包名 -i http://pypi.douban.com/simple/ --trusted-host pypi.douban.com
主要代码
qq空间txt.py
import time from selenium import webdriver from lxml import etree # 这里一定要设置编码格式,防止后面写入文件时报错 friend = '1569339843' # 朋友的QQ号,朋友的空间要求允许你能访问 user = '783533896' # 你的QQ号 pw = '1323mkoNJI.@' # 你的QQ密码 # 获取浏览器驱动 chrome_driver = 'chromedriver.exe' driver = webdriver.Chrome(executable_path=chrome_driver) # 浏览器窗口最大化 driver.maximize_window() # 浏览器地址定向为qq登陆页面 driver.get("http://i.qq.com") # 所以这里需要选中一下frame,否则找不到下面需要的网页元素 driver.switch_to.frame("login_frame") time.sleep(3) # 自动点击账号登陆方式 driver.find_element_by_id("switcher_plogin").click() time.sleep(3) # 账号输入框输入已知qq账号 driver.find_element_by_id("u").send_keys(user) time.sleep(5) # 密码框输入已知密码 driver.find_element_by_id("p").send_keys(pw) time.sleep(5) # 自动点击登陆按钮 driver.find_element_by_id("login_button").click() time.sleep(5) # 让webdriver操纵当前页 driver.switch_to.default_content() time.sleep(5) # 跳到说说的url, friend你可以任意改成你想访问的空间 driver.get("http://user.qzone.qq.com/" + friend + "/311") time.sleep(5) next_num = 0 # 初始“下一页”的id while True: # 下拉滚动条,使浏览器加载出动态加载的内容, # 我这里是从1开始到6结束 分5 次加载完每页数据 for i in range(1, 6): height = 20000 * i # 每次滑动20000像素 strWord = "window.scrollBy(0," + str(height) + ")" driver.execute_script(strWord) time.sleep(4) # 很多时候网页由多个<frame>或<iframe>组成,webdriver默认定位的是最外层的frame, # 所以这里需要选中一下说说所在的frame,否则找不到下面需要的网页元素 driver.switch_to.frame("app_canvas_frame") selector = etree.HTML(driver.page_source) divs = selector.xpath('//*[@id="msgList"]/li/div[3]') # 这里使用 a 表示内容可以连续不清空写入 with open('qq_word.txt', 'a', encoding="utf-8") as f: for div in divs: qq_name = div.xpath('./div[2]/a/text()') qq_content = div.xpath('./div[2]/pre/text()') qq_time = div.xpath('./div[4]/div[1]/span/a/text()') qq_praise = div.xpath('./div[4]/div[2]/span/span/a[2]/text()') qq_comment = div.xpath('./div[4]/div[2]/a[3]/text()') qq_name = qq_name[0] if len(qq_name) > 0 else '' qq_content = qq_content[0] if len(qq_content) > 0 else '' qq_content = qq_content.replace('\n', ' ') qq_time = qq_time[0] if len(qq_time) > 0 else '' qq_praise = qq_praise[0] if len(qq_praise) > 0 else '' qq_comment = qq_comment[0] if len(qq_comment) > 0 else '' print(qq_name, qq_time, qq_content, qq_praise, qq_comment) f.write(qq_content + "\n") # 当已经到了尾页,“下一页”这个按钮就没有id了,可以结束了 if driver.page_source.find('pager_next_' + str(next_num)) == -1: break # 找到“下一页”的按钮,因为下一页的按钮是动态变化的,这里需要动态记录一下 driver.find_element_by_id('pager_next_' + str(next_num)).click() # “下一页”的id next_num += 1 # 因为在下一个循环里首先还要把页面下拉,所以要跳到外层的frame上 driver.switch_to.parent_frame() # 关闭浏览器 driver.quit()
各种图表的生成
import pandas as pd from pyecharts.charts import Bar from pyecharts.charts import Pie import pyecharts.options as opts from pyecharts.charts import Line import re df_excel = pd.read_excel('qq_excel.xlsx') # 默认读取sheet=0 Pandas DataFrame' def getTimeStr(row): item = row['时间'] if pd.isnull(item) | pd.isna(item): return data = item.split('年')[0] return data # 按年统计说说数量 def readCount(result, row): timeData = getTimeStr(row) if timeData == None: return if timeData in result.keys(): result[timeData] += 1 else: result[timeData] = 1 # 按年统计说说点赞数 def readThumb(result, row): item = row['赞'] if pd.isnull(item): return # data = re.match(r'赞\((\d+).*', item, re.M | re.I) if len(item.split("(")) <= 1: return data = item.split("(")[1].split(")")[0] timeData = getTimeStr(row) if timeData == None: return if timeData in result.keys(): result[timeData] += int(data) else: result[timeData] = int(data) # 按年统计说说评论数 def readComment(result, row): item = row['评论'] if pd.isnull(item): return # data = re.match(r'赞\((\d+).*', item, re.M | re.I) if len(item.split("(")) <= 1: return data = item.split("(")[1].split(")")[0] timeData = getTimeStr(row) if timeData == None: return if timeData in result.keys(): result[timeData] += int(data) else: result[timeData] = int(data) def readExcel(df_excel): count = {} result = {} thumb = {} comment = {} for index, row in df_excel.iterrows(): readCount(count, row) readThumb(thumb, row) readComment(comment, row) result['count'] = count result['thumb'] = thumb result['comment'] = comment return result def getKeyAndVal(keyWord): data = readExcel(df_excel).get(keyWord) key = [] value = [] for item in data.keys(): key.append(item) value.append(data[item]) key.reverse() value.reverse() return [key, value] # 统计每年发表说说次数柱状图 def paintBar(): count = readExcel(df_excel).get('count') # V1 版本开始支持链式调用 data = getKeyAndVal('count') print(data[0]) d = ( Bar() .add_xaxis(data[0]) .add_yaxis("每年发表说说总数", data[1]) .render("每年发表说说总数柱状图.html") ) paintBar() # 统计点赞和评论折线图 def paintLine(): commentData = getKeyAndVal('comment') thumbData = getKeyAndVal('thumb') xaxis_data = commentData[0] commentValue = commentData[1] thumbValue = thumbData[1] d = ( Line() .add_xaxis(xaxis_data=xaxis_data) .add_yaxis("每年评论数", y_axis=commentValue) .add_yaxis("每年点赞数", y_axis=thumbValue) .render("每年点赞和评论折现图.html") # 输出图形 ) paintLine()
其他代码自行下载项目查看
以上就是python爬取网页版QQ空间,生成各类图表的详细内容,更多关于python 爬取QQ空间的资料请关注猪先飞其它相关文章!
相关文章
- 这篇文章主要介绍了python-opencv-画外接矩形框的实例代码,代码简单易懂,对大家的学习或工作具有一定的参考借鉴价值,需要的朋友可以参考下...2021-09-04
Python astype(np.float)函数使用方法解析
这篇文章主要介绍了Python astype(np.float)函数使用方法解析,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下...2020-06-08- 2022虎年新年即将来临,小编为大家带来了一个利用Python编写的虎年烟花特效,堪称全网最绚烂,文中的示例代码简洁易懂,感兴趣的同学可以动手试一试...2022-02-14
- 在本篇文章里小编给大家分享的是一篇关于python中numpy.empty()函数实例讲解内容,对此有兴趣的朋友们可以学习下。...2021-02-06
python-for x in range的用法(注意要点、细节)
这篇文章主要介绍了python-for x in range的用法,具有很好的参考价值,希望对大家有所帮助。一起跟随小编过来看看吧...2021-05-10- 这篇文章主要介绍了Python 图片转数组,二进制互转操作,具有很好的参考价值,希望对大家有所帮助。一起跟随小编过来看看吧...2021-03-09
- 这篇文章主要介绍了Python中的imread()函数用法说明,具有很好的参考价值,希望对大家有所帮助。一起跟随小编过来看看吧...2021-03-16
- 这篇文章主要介绍了python如何实现b站直播自动发送弹幕,帮助大家更好的理解和学习使用python,感兴趣的朋友可以了解下...2021-02-20
python Matplotlib基础--如何添加文本和标注
这篇文章主要介绍了python Matplotlib基础--如何添加文本和标注,帮助大家更好的利用Matplotlib绘制图表,感兴趣的朋友可以了解下...2021-01-26- 这篇文章主要介绍了解决python 使用openpyxl读写大文件的坑,具有很好的参考价值,希望对大家有所帮助。一起跟随小编过来看看吧...2021-03-13
- 今天小编就为大家分享一篇python 计算方位角实例(根据两点的坐标计算),具有很好的参考价值,希望对大家有所帮助。一起跟随小编过来看看吧...2020-04-27
- 这篇文章主要为大家详细介绍了python实现双色球随机选号,文中示例代码介绍的非常详细,具有一定的参考价值,感兴趣的小伙伴们可以参考一下...2020-05-02
- 在本篇文章里小编给大家整理的是一篇关于python中使用np.delete()的实例方法,对此有兴趣的朋友们可以学习参考下。...2021-02-01
- 这篇文章主要介绍了使用Python的pencolor函数实现渐变色功能,本文通过实例代码给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价值,需要的朋友可以参考下...2021-03-09
- 这篇文章主要介绍了python自动化办公操作PPT的实现,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧...2021-02-05
Python getsizeof()和getsize()区分详解
这篇文章主要介绍了Python getsizeof()和getsize()区分详解,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧...2020-11-20- 这篇文章主要介绍了解决python 两个时间戳相减出现结果错误的问题,具有很好的参考价值,希望对大家有所帮助。一起跟随小编过来看看吧...2021-03-12
- 这篇文章主要为大家详细介绍了python实现学生通讯录管理系统,文中示例代码介绍的非常详细,具有一定的参考价值,感兴趣的小伙伴们可以参考一下...2021-02-25
- 这篇文章主要介绍了PyTorch一小时掌握之迁移学习篇,本文给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价值,需要的朋友可以参考下...2021-09-08
- 这篇文章主要介绍了Python绘制的爱心树与表白代码,本文通过实例代码给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价值,需要的朋友可以参考下...2021-04-06