相思资源网 Design By www.200059.com
分析
需求:
爬取西刺代理网免费高匿代理,并保存到MySQL数据库中。
这里只爬取前10页中的数据。
思路:
- 分析网页结构,确定数据提取规则
- 创建Scrapy项目
- 编写item,定义数据字段
- 编写spider,实现数据抓取
- 编写Pipeline,保存数据到数据库中
- 配置settings.py文件
- 运行爬虫项目
代码实现
items.py
import scrapy class XicidailiItem(scrapy.Item): # 国家 country=scrapy.Field() # IP地址 ip=scrapy.Field() # 端口号 port=scrapy.Field() # 服务器地址 address=scrapy.Field() # 是否匿名 anonymous=scrapy.Field() # 类型 type=scrapy.Field() # 速度 speed=scrapy.Field() # 连接时间 connect_time=scrapy.Field() # 存活时间 alive_time=scrapy.Field() # 验证时间 verify_time=scrapy.Field()
xicidaili_spider.py
# !/usr/bin/env python
# -*- coding:utf-8 -*-
import scrapy
from myscrapy.items import XicidailiItem
class XicidailiSpider(scrapy.Spider):
name = 'xicidaili'
allowed_domains=['www.xicidaili.com']
# start_urls=['http://www.xicidaili.com/nn/1']
def start_requests(self):
urls=[]
for i in range(1,11):
urls.append('http://www.xicidaili.com/nn/'+str(i))
for url in urls:
yield scrapy.Request(url,callback=self.parse,method='GET')
def parse(self, response):
tr_list=response.xpath('//table[@id="ip_list"]/tr')
for tr in tr_list[1:]: # 过滤掉表头行
item=XicidailiItem()
item['country']=tr.xpath('./td[1]/img/@alt').extract_first()
item['ip']=tr.xpath('./td[2]/text()').extract_first()
item['port']=tr.xpath('./td[3]/text()').extract_first()
item['address']=tr.xpath('./td[4]/a/text()').extract_first()
item['anonymous']=tr.xpath('./td[5]/text()').extract_first()
item['type']=tr.xpath('./td[6]/text()').extract_first()
item['speed']=tr.xpath('./td[7]/div/@title').re(r'\d{1,3}\.\d{0,}')[0]
item['connect_time']=tr.xpath('./td[8]/div/@title').re(r'\d{1,3}\.\d{0,}')[0]
item['alive_time']=tr.xpath('./td[9]/text()').extract_first()
item['verify_time']=tr.xpath('./td[10]/text()').extract_first()
yield item
pipelines.py
class XicidailiPipeline(object):
"""
西刺代理爬虫 item Pipeline
create table xicidaili(
id int primary key auto_increment,
country varchar(10) not null,
ip varchar(30) not null,
port varchar(10) not null,
address varchar(30) not null,
anonymous varchar(10) not null,
type varchar(20) not null,
speed varchar(10) not null,
connect_time varchar(20) not null,
alive_time varchar(20) not null,
verify_time varchar(20) not null);
"""
def __init__(self):
self.connection = pymysql.connect(host='localhost',
user='root',
password='123456',
db='mydb',
charset='utf8', # 不能用utf-8
cursorclass=pymysql.cursors.DictCursor)
def process_item(self,item,spider):
with self.connection.cursor() as cursor:
sql='insert into xicidaili' '(country,ip,port,address,anonymous,type,speed,connect_time,alive_time,verify_time) values' '(%s,%s,%s,%s,%s,%s,%s,%s,%s,%s);'
args=(item['country'],item['ip'],item['port'],item['address'],item['anonymous'],item['type'],item['speed'],item['connect_time'],item['alive_time'],item['verify_time'])
spider.logger.info(args)
cursor.execute(sql,args)
self.connection.commit()
def close_spider(self,spider):
self.connection.close()
settings.py
ITEM_PIPELINES = {
'myscrapy.pipelines.XicidailiPipeline': 300,
}
结果
总结
以上就是这篇文章的全部内容了,希望本文的内容对大家的学习或者工作具有一定的参考学习价值,谢谢大家对的支持。如果你想了解更多相关内容请查看下面相关链接
相思资源网 Design By www.200059.com
广告合作:本站广告合作请联系QQ:858582 申请时备注:广告合作(否则不回)
免责声明:本站文章均来自网站采集或用户投稿,网站不提供任何软件下载或自行开发的软件! 如有用户或公司发现本站内容信息存在侵权行为,请邮件告知! 858582#qq.com
免责声明:本站文章均来自网站采集或用户投稿,网站不提供任何软件下载或自行开发的软件! 如有用户或公司发现本站内容信息存在侵权行为,请邮件告知! 858582#qq.com
相思资源网 Design By www.200059.com
暂无Scrapy框架爬取西刺代理网免费高匿代理的实现代码的评论...
《魔兽世界》大逃杀!60人新游玩模式《强袭风暴》3月21日上线
暴雪近日发布了《魔兽世界》10.2.6 更新内容,新游玩模式《强袭风暴》即将于3月21 日在亚服上线,届时玩家将前往阿拉希高地展开一场 60 人大逃杀对战。
艾泽拉斯的冒险者已经征服了艾泽拉斯的大地及遥远的彼岸。他们在对抗世界上最致命的敌人时展现出过人的手腕,并且成功阻止终结宇宙等级的威胁。当他们在为即将于《魔兽世界》资料片《地心之战》中来袭的萨拉塔斯势力做战斗准备时,他们还需要在熟悉的阿拉希高地面对一个全新的敌人──那就是彼此。在《巨龙崛起》10.2.6 更新的《强袭风暴》中,玩家将会进入一个全新的海盗主题大逃杀式限时活动,其中包含极高的风险和史诗级的奖励。
《强袭风暴》不是普通的战场,作为一个独立于主游戏之外的活动,玩家可以用大逃杀的风格来体验《魔兽世界》,不分职业、不分装备(除了你在赛局中捡到的),光是技巧和战略的强弱之分就能决定出谁才是能坚持到最后的赢家。本次活动将会开放单人和双人模式,玩家在加入海盗主题的预赛大厅区域前,可以从强袭风暴角色画面新增好友。游玩游戏将可以累计名望轨迹,《巨龙崛起》和《魔兽世界:巫妖王之怒 经典版》的玩家都可以获得奖励。


