博客
关于我
强烈建议你试试无所不能的chatGPT,快点击我
Python爬虫之初体验
阅读量:6851 次
发布时间:2019-06-26

本文共 739 字,大约阅读时间需要 2 分钟。

Python爬虫,一般用于抓取特定的内容,最近想学学,通过网络抓取自己想要的内容,于是乎学习了一下Python,用一个小案例来纪念一下学习的成果。

案例程序主要功能:抓取我们学校校园网新闻中的图片

# coding=utf-8import urllibimport re# 定义个函数 抓取网页内容def getHtml(url):    webPage = urllib.urlopen(url)    html = webPage.read()    return html# 定义一个函数 抓取网页中的图片def getNewsImgs(html):    # 正则表达式     reg = r'src="(.+?\.jpg)"'    img = re.compile(reg)    # 获取网页中所有符合条件的图片url    imglist = re.findall(img,html)    x = 0    # 根据图片地址下载图片并重命名    for imgUrl in imglist:        urllib.urlretrieve("http://www.abc.edu.cn/news/"+imgUrl,'news-%s.jpg' % x)        x += 1# 获取网页html = getHtml("http://www.abc.edu.cn/news/show.aspx?id=21413&cid=5")# 抓取图片print getNewsImgs(html)复制代码

效果:成功抓取了新闻中的两张图片~O(∩_∩)O~~

转载于:https://juejin.im/post/5a3113976fb9a045186abc50

你可能感兴趣的文章
jxl 读取/写入excel
查看>>
Mongodb主从复制
查看>>
Cisco ASA5500解决内网用公网IP不能访问DMZ区服务器的
查看>>
Windows7常用命令
查看>>
LaTex 制作简历
查看>>
windows8系统装机总结
查看>>
我的友情链接
查看>>
我的友情链接
查看>>
go 数据库相关
查看>>
ssh -qTfnN -D 7070 x.x.x.x
查看>>
在Linux下查看环境变量
查看>>
WEB跨域请求
查看>>
解决centos yum源配置出现Couldn't resolve host 问题
查看>>
太有才了
查看>>
分转元、元转分,解决精度问题
查看>>
javascript函数带参数运算
查看>>
提高程序员职场价值的10大技巧
查看>>
list control总结1
查看>>
O2O 行业 IT 系统架构实践分享
查看>>
Android跨平台编译 —— protobuf
查看>>