Python爬虫之初体验-白红宇

Python爬虫，一般用于抓取特定的内容，最近想学学，通过网络抓取自己想要的内容，于是乎学习了一下Python，用一个小案例来纪念一下学习的成果。

案例程序主要功能：抓取我们学校校园网新闻中的图片

# coding=utf-8import urllibimport re# 定义个函数 抓取网页内容def getHtml(url):    webPage = urllib.urlopen(url)    html = webPage.read()    return html# 定义一个函数 抓取网页中的图片def getNewsImgs(html):    # 正则表达式     reg = r'src="(.+?\.jpg)"'    img = re.compile(reg)    # 获取网页中所有符合条件的图片url    imglist = re.findall(img,html)    x = 0    # 根据图片地址下载图片并重命名    for imgUrl in imglist:        urllib.urlretrieve("http://www.abc.edu.cn/news/"+imgUrl,'news-%s.jpg' % x)        x += 1# 获取网页html = getHtml("http://www.abc.edu.cn/news/show.aspx?id=21413&cid=5")# 抓取图片print getNewsImgs(html)复制代码

案例程序主要功能：抓取我们学校校园网新闻中的图片

效果：成功抓取了新闻中的两张图片~O(∩_∩)O~~