来源:蜘蛛抓取(WebSpider)
时间:2016-03-22 13:17
标签:
php爬虫入门教程
python爬虫教程_视频在线观看_百度视频
订阅精彩视频,请
python爬虫教程相关视频:
大家都在搜:
百度视频搜索结果源于互联网视频网站,系计算机系统根据搜索热度自动排列,不代表百度赞成被搜索网站的内容或立场。如何入门 Python 爬虫?
[问题点数:100分]
如何入门 Python 爬虫?
[问题点数:100分]
不显示删除回复
显示所有回复
显示星级回复
显示得分回复
只显示楼主
2006年5月 PHP大版内专家分月排行榜第二2006年4月 PHP大版内专家分月排行榜第二2007年1月 PHP大版内专家分月排行榜第二
2013年10月 其他开发语言大版内专家分月排行榜第三2007年2月 PHP大版内专家分月排行榜第三
2014年11月 PHP大版内专家分月排行榜第三2014年6月 PHP大版内专家分月排行榜第三2014年4月 PHP大版内专家分月排行榜第三2014年2月 PHP大版内专家分月排行榜第三2013年11月 PHP大版内专家分月排行榜第三
2013年3月 C/C++大版内专家分月排行榜第三
匿名用户不能发表回复!|
每天回帖即可获得10分可用分!小技巧:
你还可以输入10000个字符
(Ctrl+Enter)
请遵守CSDN,不得违反国家法律法规。
转载文章请注明出自“CSDN(www.csdn.net)”。如是商业用途请联系原作者。如何入门 Python 爬虫_百度知道
如何入门 Python 爬虫
提问者采纳
从爬虫必要的几个基本需求来讲: 1.抓取 py的urllib不一定去用,但是要学,如果还没用过的话。 比较好的替代品有requests等第三方更人性化、成熟的库,如果pyer不了解各种库,那就白学了。 抓取最基本就是拉网页回来。 如果深入做下去,会发现要面对不同的网页要求,比如有认证的,不同文件格式、编码处理,各种奇怪的url合规化处理、重复抓取问题、cookies跟随问题、多线程多进程抓取、多节点抓取、抓取调度、资源压缩等一系列问题。 所以第一步就是拉网页回来,慢慢会发现各种问题待优化。 2.存储 抓回来一般会用一定策略存下来,而不是直接分析,个人觉得更好的架构应该是把分析和抓取分离,更加松散,每个环节出了问题能够隔离另外一个环节可能出现的问题,好排查也好更新发布。 那么存文件系统、SQLorNOSQL数据库、内存数据库,如何去存就是这个环节的重点。 可以选择存文件系统开始,然后以一定规则命名。 3.分析 对网页进行文本分析,提取链接也好,提取正文也好,总之看的需求,但是一定要做的就是分析链接了。 可以用认为最快最优的办法,比如正则表达式。 然后将分析后的结果应用与其他环节:) 4.展示 要是做了一堆事情,一点展示输出都没有,如何展现价值。 所以找到好的展示组件,去show出肌肉也是关键。 如果为了做个站去写爬虫,抑或要分析某个东西的数据,都不要忘了这个环节,更好地把结果展示出来给别人感受。
来自团队:
其他类似问题
为您推荐:
等待您来回答
下载知道APP
随时随地咨询
出门在外也不愁TOP热门关键词
专题页面精选
互联网数据挖掘第一步:编写爬虫这个教程真的很好,推荐给大家[hide]http://blog.csdn.net/column/details/why-bug.html[/hide]
互联网数据挖掘第一步:编写爬虫
这个教程真的很好,推荐给大家
[hide]http://blog.csdn.net/column/details/why-bug.html[/hide]
本文关键词: 本文论坛网址:
您可能感兴趣的文章
本站推荐的文章
本文标题:
本文链接网址:
1.凡人大经济论坛-经管之家转载的文章,均出自其它媒体或其他官网介绍,目的在于传递更多的信息,并不代表本站赞同其观点和其真实性负责;
2.转载的文章仅代表原创作者观点,与本站无关。其原创性以及文中陈述文字和内容未经本站证实,本站对该文以及其中全部或者部分内容、文字的真实性、完整性、及时性,不作出任何保证或承若;
3.如本站转载稿涉及版权等问题,请作者及时联系本站,我们会及时处理。