博客
关于我
强烈建议你试试无所不能的chatGPT,快点击我
洗礼灵魂,修炼python(62)--爬虫篇—模仿游戏
阅读量:7106 次
发布时间:2019-06-28

本文共 3133 字,大约阅读时间需要 10 分钟。

前言

《模仿游戏》这个电影相信如果你是搞IT的,即使没看过也听过吧?电影讲述了计算机之父——阿兰-图灵的一些在当时来讲算是计算机史里的里程碑事迹了。而【模仿游戏】这个名字咋一看,貌似和电影没啥关系,原名叫The Imitation Game,翻译过来就是模仿游戏,最开始其实是图灵的计算机相关测试,大概意思是如果计算机多次工作与人类似的工作,那么它可以智能的模仿人类的处理事务的方式来进行工作,在那个时代算是闻所未闻的,就像我现在跟正在读这篇博文的读者说“我其实很帅”一样,反正是没多少人信的对吧?好的,关于电影里的或者阿兰-图灵的话题,暂且不提,不深究这些,我只说字面意思上的模仿游戏

正题

前面学了那么多模块啊,什么方法属性,请求啥的,相信你不说精通,至少你可以爬一个网站了吧?

其实,我想说,爬虫真的不仅限于此,之前我提过,访问一个网站时,网站服务器可以看到客户端访问信息,以及以什么方式访问,如果是程序访问,原则是不行的,所以会被拒绝访问,因此需要修改参数来隐藏,我们已经学过的就是修改报文头部信息,模仿成浏览器式的访问,但这个还是有个问题,由于使用同一个IP多次访问,网站服务器不管user-agent是否是程序还是浏览器人为访问,都直接拒绝访问,或者显示验证页,让你输入验证码才行,网络爬虫自然是无法输入验证码的,输入验证码的相信你都知道吧,其实现在很多网站都有验证码才能过,这种就是简单防爬虫手段。

那么解决方法是什么呢?

 

有三个:

1.设置延迟,尽量的模仿人为访问的速度

2.设置代理IP

3.写高级爬虫程序过验证码(因为涉及更多扩展知识,这里暂且不提)

 

有了前两个方法,你写出来的爬虫程序就基本算是进阶级爬虫了,有了第三个方法,那么就是高级爬虫了。

 

本篇博文就说说前两个方法

第一个方法就是导入time模块,然后在觉得该停顿的地方停顿对吧?time模块前面已经提过了,忘记了的,自己会去看吧。

具体怎么实行呢?好的,这里有一个小项目,写一个翻译程序,不管你用百度翻译,还是有道翻译,还是谷歌翻译,还是什么翻译,写一个简单的翻译程序出来,自己动手搞一个看看,前提是你必须稍微的会看一点点html代码,不然确实很吃力的,不需要会很多,只要能看懂个大概就行,不用去恶补html语法标签啥的

 

(请确保你已经思考过了,再看下面的。)

运行环境是python3

 

import urllib.requestimport urllib.parseimport json,timecontent=0head={
'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/50.0.2661.102 Safari/537.36'}while True: content=input("请输入需要翻译的内容(或者输入quit退出):") if content!='quit': url="http://fanyi.baidu.com/v2transapi" data={} data['from']='zh' data['to']='en' data['query']=content data['transtype']='translang' data['simple_means_flag']='3' data=urllib.parse.urlencode(data).encode("utf-8") req=urllib.request.Request(url,data,head) response=urllib.request.urlopen(req) html=response.read().decode("utf-8") target=json.loads(html) tgt=target['trans_result']['data'][0]['dst'] print("翻译的结果是:%s"% tgt) time.sleep(3) else: break

 

结果测试:

 

好的,完美翻译,不过这里还是有点小问题,比如只能中文翻译成英文,不能智能翻译,然后如果是用有道翻译或者其他什么翻译的又怎么写呢?好的,这些问题留为作业,自己去研究吧

 

好的,那么第二个方法,代理IP怎么搞呢?

代理ip得靠包模块urllib.requet创建代理对象urllib.request.ProxyHandler:

 

然后代理IP得有几个步骤

  • urllib.request.ProxyHandler()的参数是一个字典{‘类型’:‘代理ip:端口号’}:proxy = urllib.request.ProxyHandler({})
  • 定制,创建一个opener:opener= urllib.request.build_opener(proxy_support)
  • 安装opener:urllib.request.install_opener(opener)
  • 调用opener:opener.open(url)

有了这几个步骤才能代理,在python3里就得这样,如果你要在python2里搞也可以的。

然后这里有个问题,代理IP怎么来呢?这里给个链接,,如果你觉得不行,可以自行网上找了

例:

首先我选了一个代理ip:

 

然后写好程序脚本,这里说下,本来没这么想的,但我还是把查询ip的网站用文字打码了,关于查询ip的网站网上很多,你们自己去测试吧,相关原因下面有提到

import urllib.requestproxy=urllib.request.ProxyHandler({
'http':'119.49.217.187:8118'})opener=urllib.request.build_opener(proxy)urllib.request.install_opener(opener)head={
'User-Agent':'Mozilla/5.0 (Windows NT 6.1; Win64; x64; rv:56.0) Gecko/20100101 Firefox/56.0'}res=urllib.request.Request('http://XXXXX.XXX',headers=head)result=urllib.request.urlopen(res).read().decode('utf-8')print(result)

 

结果:

 

 

代理成功了,完美

 

提一下,代码是绝对没问题的,因为我第一次测试都没问题,再次测试就成这样

 这不是别人网站小气,还是前面博文里说过的,私人网站,没那么抗压,所以都设置了防火墙,如果发现程序异常就拒绝访问,这很正常的,别人网站提供免费的查询,正常查询就好了,如果不设置防火墙,一会儿搞崩一次,一会儿搞崩一次,换成你你高兴不?对吧?

 

 

记得作业是改良翻译程序

 

免责声明

 

本博文只是为了分享技术和共同学习为目的,并不出于商业目的和用途,也不希望用于商业用途,特此声明。如果内容中测试的贵站的站长有异议,请联系我立即删除

 

转载于:https://www.cnblogs.com/yangva/p/7794251.html

你可能感兴趣的文章
Github上传代码菜鸟超详细教程【转】
查看>>
SVN上的项目如何迁移到Git
查看>>
多级<select>选择的实现(利用selectedIndex属性)
查看>>
Apache Rewrite
查看>>
转贴: QUARTUS 实现远程控制的简单方法
查看>>
开源还是商用?十大云运维监控工具横评
查看>>
python3 科学计算2
查看>>
Mysql启动失败Can’t connect to local MySQL server throu
查看>>
大学四年的学习经历
查看>>
viewController
查看>>
Filebeat入门
查看>>
Java之字符串和字符串缓冲区
查看>>
tomcat、oracle、centos时区异常处理
查看>>
Raspberry Pi双网卡bonding
查看>>
HDU1022
查看>>
Nginx - 文章 - 伯乐在线 大量 Nginx资料
查看>>
Genymotion初体验
查看>>
JBoss 系列二十一:JBossCache 核心API
查看>>
Apache下htaccess文件不起作用/rewrite 没有效果
查看>>
WinXP补丁升级极疯狂 《关于svchost.exe的CPU占用率过高的原因以及解决方法》
查看>>