Python爬虫 | 批量爬取今日头条街拍美图

前言

上篇文章我们爬取了今日头条街拍美图，心情相当愉悦，今天这篇文章我们使用Selenium来爬取当当网的畅销图书排行。正所谓书中自有黄金屋，书中自有颜如玉，我们通过读书学习来提高自身的才华，自然能有荣华富贵，也自然少不了漂亮小姐姐。

准备工作

在爬取数据前，我们需要安装Selenium库以及Chrome浏览器，并配置好ChromeDriver。

Selenium

Selenium是一个自动化测试工具，利用它可以驱动浏览器执行特定的动作，如点击、下拉等操作，同时还可以获得浏览器当前呈现的页面的源代码，做到可见即可爬。对于一些JavaScript动态渲染的页面来说，这种爬取方式非常有效。

Selenium库的安装比较简单一行代码就行：



pip install selenium

也可以到PyPI下载(https://pypi.python.org/pypi/selenium/#downloads)对应的wheel文件，然后进入到wheel文件目录，使用pip安装：



pip install .........whl

安装验证，进入Python命令行交互模式，如下图：

这样Selenium就安装完毕了。

ChromeDriver安装

首先我们先查看Chrome的版本：点击Chrome菜单“帮助”--->“关于Google Chrome”，即可查看Chrome的版本号，如下图：

打开ChromeDriver的官方网站，根据自身Chrome浏览器版本下载ChromeDriver并安装：

注意：ChromeDriver和Chrome浏览器一定要对应，否则可能无法正常工作。

ChromeDriver的环境变量配置，直接将chromedriver.exe文件拖到Python的Scripts目录下。

到这来，准备工作就完成了，下面我们正式开始抓取当当网的畅销图书排行。

实战演练

首先，我们进入当当网的畅销图书网页，我们要利用Selenium抓取图书信息并用pyquery解析得到图书的排名、图片、名称、价格、评论等信息。如下图：

进入开发者工具中的Network，查看Request URL，如下图所示：

在页面下方，有个分页导航，我们点击下一页，观察Request URL的变化：



http://bang.dangdang.com/books/bestsellers/01.00.00.00.00.00-24hours\-0-0-1-1        #第1页  
http://bang.dangdang.com/books/bestsellers/01.00.00.00.00.00-24hours\-0-0-1-2        #第2页  
http://bang.dangdang.com/books/bestsellers/01.00.00.00.00.00-24hours\-0-0-1-23        #第23页  
http://bang.dangdang.com/books/bestsellers/01.00.00.00.00.00-24hours\-0-0-1\-page        #第n页

我们发现该URL只有最后面的那个数字发生变化，所以我们构造的URL就非常简单了，那个page就是翻页的关键字。

首页爬取

首先我们先声明chrome浏览器对应，webdriver支持主流的浏览器，比如说：谷歌浏览器、火狐浏览器、IE浏览器等等。通过WebDriverWait()方法，指定最长等待时间，当规定时间内没加载出来就抛出异常。通过page参数来进行翻页。

代码如下：

browser=webdriver.Chrome()
wait=WebDriverWait(browser,10)
def index_page(page):
    print('正在爬取第',page,'页')
    try:
        url='http://bang.dangdang.com/books/bestsellers/01.00.00.00.00.00-24hours-0-0-1-'+str(page)
        browser.get(url)
        get_booklist()
    except TimeoutException:
        index_page(page)

解析商品列表

接下来，我们就可以实现get_booklist()方法来解析商品列表了，这里我们直接调用page_source获取页面源代码，然后用pyquery进行解析，实现代码如下：

def get_booklist():
    html=browser.page_source
    doc=pq(html)
    items=doc('.bang_list li').items()
    for item in items:
        book={
            '排名':item.find('.list_num').text(),
            '书名':item.find('.name').text(),
            '图片':item.find('.pic img').attr('src'),
            '评论数':item.find('.star a').text(),
            '推荐':item.find('.tuijian').text(),
            '作者':item.find('.publisher_info a').text(),
            '日期':item.find('.publisher_info span').text(),
            '原价':item.find('.price_r').text().replace('¥',''),
            '折扣':item.find('.price_s',).text(),
            '电子书':item.find('.price_e').text().replace('电子书：','').replace('¥','')
        }
        saving_book(book)

保存数据

接下来，我们将书本信息保存为csv格式，实现代码如下：

with open('data.csv','a',newline='',)as csvfile:
    writer=csv.writer(csvfile)
    writer.writerow(['排名','书名','图片','评论数','推荐','作者','原价','折扣','电子书'])
def saving_book(book):
    with open('data.csv', 'a', newline='')as csfile:
        writer = csv.writer(csfile)
        writer.writerow([book.get('排名'), book.get('书名'), book.get('图片'), book.get('评论数'), book.get('推荐'), book.get('作者'),book.get('原价'),book.get('折扣'),book.get('电子书')])

遍历每页

刚才我们所定义的index_page()方法需要接收参数page，page代表页码，这里我们实现页码遍历即可，实现代码如下：

if __name__ == '__main__':
    for page in range(1,3):
        index_page(page)

这里我们只遍历2页，感兴趣的可以遍历多页。

结果展示

好了，关于Python爬虫——Selenium爬取当当畅销图书排行讲到这里了，感谢观看!我们下篇文章再见!

-------------------******************************** End -------------------************************************

往期精彩文章推荐：

欢迎各位大佬点击链接加入群聊【helloworld开发者社区】：https://jq.qq.com/?_wv=1027&k=mBlk6nzX进群交流IT技术热点。

本文转自 https://mp.weixin.qq.com/s/wU3bo7PH86HnsEnikuU6Wg，如有侵权，请联系删除。

Yanlongli 2024-07-11 17:28

降低了视觉复杂性，增高了操作复杂性。

浪_客 2024-09-15 12:54

继续用vm吧，ensp不让用新版vbox😂

优秀良民 2024-07-10 16:17

明明能躺平，明明可以割韭菜，还花钱研发？为了找骂？说这个能割韭菜？你被割了？你买了吗？是谁年年换mac，是谁年年换iphone？华为的用户好像没有那么干的吧？真让我一个小米用户都看不下去了！

dwingo 2024-07-18 10:12

不是不让用jni和unsafe啊, 只是做了"限制", 只要加命令行参数就能继续用, 目的是为了让使用者考量程序的安全性.

osc_566335 2024-08-01 15:05

“虽然两人只有大专学历”—— 大专也算高等教育，现在这些媒体口中已经文盲一个级别的感觉了吗？

Kevin586 2024-07-29 17:09

真降低成本还是得换go，java太吃内存了

kushu001 2024-08-14 15:24

为什么一定要强调“国产”？是开源的项目么？如果开源，是不是不接受国外开发者的贡献？我只是好奇，不带“国产”，是宣传不了了么😀

zb79463626 2024-08-26 15:51

IBM中国哪有什么研发? 全部都是测试！所谓的搞研发的都是去养老混日子的！

阳光满地 2024-09-15 00:25

加个证书那么简单的事，为什么还要等下一步再优化呢？

fastfail 2024-09-15 08:37

捞钱捞到手抽筋

fzn0268 2024-09-04 14:26

这是那个做代码生成器的老哥起的吧

Binx 2024-09-07 08:28

最好提高苹果税到80%，不然怎么彰显尊贵的苹果用户身份

Tobyee 2024-07-09 11:04

没GMS是借口，本质还是不想适配国内的手机系统，等鸿蒙Next出来，看微软拥抱不拥抱就知道了

fasiondog 2024-09-14 17:26

👍

kakai 2024-09-07 10:39

微信咋得罪你了？不管怎么样，微信此举哪怕从自身商业利益出发，让苹果降低中国税率这是利于中国人的，这个税率可不仅仅是针对微信的，还苹果大功一件，这是多么愚蠢、可耻的言论！

黑人牙膏 2024-07-21 12:12

真的人不要脸则无敌，只要他不尴尬，尴尬的是别人。

简洛-默 2024-08-12 19:31

你是家里才通网吗? 龙芯早都弃用MIPS了，现在是自研的LoongArch。自己好好看看吧：https://loongarch.dev/zh-cn/posts/20210501-loongarch-manual/

longzz 2024-09-14 11:04

🤣65岁还在写代码吗？

279778325 2024-08-16 16:22

好不容易有个国产开发平台，没有鼓励只有贬低，就算宣传夸大怎么了？那么较真干什么？遍地都是夸大的广告宣传怎么不一个一个去找厂家？批判的同时想想自己能搞一个吗？为什么加上国产俩字就非要这么较真？

平波 2024-09-14 15:46

你真是行家里手啊，😂；这个本质是数学建模，就像初中数学中的板据两点确定一条直线，然后可以根据任意x,预测y值啊，其实就这么简单啊

我有我可以 2024-07-09 11:40

喷子们之所以喷，其本质是为自己的阴暗和自卑找理由罢了。

Ask_x_Seek 2024-09-14 15:19

支持

Francesca 2024-09-15 17:30

会不会是你用的版本比较老，新版本应该没问题

CloudShi83 2024-07-06 17:13

感谢祖师爷赏饭吃，给你磕一个

yh2216 2024-09-14 10:26

猜测：c++部分应该是切换了鸿蒙的系统api，UI则仅仅是使用鸿蒙的UI框架而已。

yh2216 2024-09-14 10:24

wps确实做的很棒，比微软的office好用，比libreoffice好用很多。wps加油，鸿蒙做的不错，继续加油，支持生态建设。

我要探索宇宙 2024-09-16 14:43

3.5.2版本，队列redis能用集群模式的redis吗？

liming0101 2024-09-10 09:09

什么纳吉东西，还碰瓷黑神话

无尽的拉格朗日 2024-09-14 12:56

底层代码大部分估计都能共用反正都是c/c++，上层界面层重写吧

平波 2024-09-14 19:01

你了做过为为的项目啊；😂

osc_50722289 2024-09-06 13:51

如果苹果不让步，微信也不让步那就好看了！微信在中国深入寻常百姓家！支付社交微信根本离不开，如果微信不在IOS上更新，苹果“不用混了”

智布道 2024-08-13 12:02

不管是谁在打平安县城，我三五八团一定帮帮场子！

0day 2024-07-21 11:52

一个流氓也配谈安全？

大后锋 2024-07-10 14:03

然后交警找责任方，打过去是牛逼高大上的生成式AI的客服

平波 2024-07-07 16:54

吃完就砸锅，好像那个啥纯血，吃完了，就想把小米，oppo、vivo的锅咂了；😂

字节跳动开源 2024-09-14 16:05

可以的，可以看看发布的一些用户案例

osc_566335 2024-08-05 10:48

os是媾粉聚集地还不了解吗？只要碰到国产、华子相关报道，必然评论区乌烟瘴气口伏声难止。还能期待啥有深度发言？大佬敢发这些，那还给搞前端什么都懂的“程序员”粪死？

开源博客 2024-09-14 22:13

Virtualbox新管网使用vw布局单位，高分屏上使用浏览器的缩放没效果，字体仍老大==

zb79463626 2024-09-15 12:07

纯血鸿蒙不再是用android改的了，DevEco什么时候也纯血脱离Eclipse啊？😄

blue_think 2024-08-26 11:00

别光喷华为啊，说点你自己的能力，到了什么程度，有什么成就，这样好歹有点说服力吧

Kevin586 2024-09-14 16:00

vagrant什么时候支持7.1我才更

封神梦 2024-09-14 17:53

反正wps就是各种vip广告，挺恶心人的

天

天1天1天 2024-09-14 16:56

文章写的也没错，至于是不是steam的功劳，也无所谓，反正能玩了。

vb2005xu 2024-09-14 10:17

这数据有1%真吗

RustDesk 2024-09-16 11:20

惨淡

Artrener 2024-07-21 15:12

可以看他不爽，看360不爽，但人家说的是事实。比如说航空业的业内人士也这么说的。

深夜49 2024-09-14 14:36

免费版只能用30分钟，太坑了吧。

叨

叨叨颠颠 2024-09-14 16:17

代码这东西就和女人穿不同衣服一样，包装不同，就可以换个人样儿，其实里面还是。字符串替换--变量名改改、方法名改改、文件名改改，方法return的改为void，值参改形参，一个类改几个拼接，一个结构体改几个组合，一个方法改几代继承。哪个敢说这是抄，百分之百纯自研，原生态。

烈冰 2024-07-22 08:41

不如说国内90%的电脑都没安装CrowdStrike软件

HalLi 2024-09-09 01:10

普通用户不懂就算了，怎么连程序员都不懂？苹果是全平台30%，国产是渠道服50%。微信、抖音这种大app哪来的渠道服，除了游戏，哪个app带渠道服。

高排量低炭烧 2024-09-14 23:34

牛逼🤬

平波 2024-09-14 15:57

我倒是觉得好用，像真人就行；我可不希望它是真正的智慧生物；深度这些东东，本质就是曲面建模和贝叶斯/马尔科夫链这种概率建模；只要知识量够大，算力够强，机器就越像人；它有没有意识，并不重要；因为人的意思，估计也是伪命题；

呼呼南风 2024-09-14 11:18

幸好我把自己电脑换成win10了。

加百列Gabriel 2024-09-14 13:50

各位不要急着更新, 更新完之后linux虚拟机不支持3D加速了

开源中国首席路人王 2024-09-15 15:47

ipv6 tomcat需要改什么支持吗

奶奶灰 2024-09-15 20:28

换kvm 了

来开源啊 2024-09-14 15:07

25× 23.1 √

Azeroth008 2024-07-09 10:43

有自研操作系统挺好的啊，那些乱喷的人是什么心态？

infoworld 2024-09-11 18:00

感谢，正是有你们这些先驱做的实事，才能避免被国外的系统和应用垄断。

songdragon 2024-08-14 13:11

这个对比的条件还存在好几个问题。 1. solon使用的是smart-http，spring使用的是undertow 2. solon启动本身的自动配置少于spring 这两点就决定了对比的维度不同，性能更好的原因大概率是web服务器、应用配置依赖导致的。如果要拉齐，需要使用同样的web服务器，spring应用排除掉所有的自动配置，只保留web必须的，才能说明框架的性能差距。现在这个结果，无法说明solon本身性能好。

Python爬虫 | 批量爬取今日头条街拍美图

热门内容

全站热门评论

关于作者

作者的专辑

作者的其它热门文章

热门资讯

热门软件

OSCHINA 社区

在线工具

攻略

QQ群

公众号

视频号

Python爬虫 | 批量爬取今日头条街拍美图

热门内容

全站热门评论

关于作者

作者的专辑

作者的其它热门文章

热门资讯

推荐关注

热门软件

OSCHINA 社区

在线工具

攻略

QQ群

公众号

视频号