通过selenium实现的京东商品爬取
admin
2023-07-09 13:24:54
0

from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as ec
from lxml import etree
import csv
import requests,re,time
#搜索的商品名称
shopname="Python设计模式"
#声明浏览器对象
browser=webdriver.Chrome()
browser.get("https://www.jd.com")
#查找节点
inputtext = browser.find_element_by_class_name('text')
#输入数据
inputtext.send_keys(shopname)
#提交
btn = browser.find_element_by_class_name('button')
btn.click()
#搜索后的页面
#显式等待
wait = WebDriverWait(browser, 10)
wait.until(ec.title_contains(shopname))
with open(shopname+".csv",'a') as f:
    wr= csv.DictWriter(f,['name','price','shop'])
    wr.writeheader()
    while True:
        #判断是否为反爬虫机制窗体 是否正常
        if len(browser.window_handles)>1:
            handles=browser.window_handles[1]
            browser.switch_to_window(handles)
            browser.close()
        # 滚动条
        browser.execute_script("window.scrollTo(0, document.body.scrollHeight)")
        wait.until(ec.presence_of_element_located((By.CLASS_NAME, 'pn-next')))
        # 爬取内容
        html = etree.HTML(browser.page_source)
        # 读取每个商品
        shops = html.xpath('//div[contains(@class,"gl-i-wrap")]')
        # 下一页
        npage =html.xpath('//a[@class="pn-next disabled"]/em//text()')
        for shop in shops:
            name = shop.xpath('.//div[contains(@class,"p-name")]//em//text()')
            name = "".join(name)
            price = shop.xpath('.//div[contains(@class,"p-price")]//i//text()')
            price = "".join(price)
            sname = shop.xpath('.//div[contains(@class,"p-shop")]//a//@title')
            sname = "".join(sname)
            if sname.strip() == '':
                sname = "京东自营"
            wr.writerow({'name':name,'price':price,'shop':sname})

        if len(npage)>0:
            break
        try:
            pbtn = browser.find_element_by_class_name("pn-next")
            pbtn.click()
        except:
            pass

    browser.close()

相关内容

热门资讯

美伊谈判濒临破裂之际,伊朗议长... 因为以色列持续对黎巴嫩进行军事打击,伊朗宣布暂停同美国的谈判。不过美国总统特朗普称,对话仍在继续。谈...
罕见!以军政策发生“重大转变” 新华社北京6月1日电 题:罕见纵深推进,以军对黎行动会否搅动美伊谈判新华社记者刘品然 阚静文 席玥以...
山西太原发现一处新石器遗址,出... 山西省太原市文物保护研究院协同相关科研机构,近期在太原市阳曲县西盘威村发现一处新石器时代重要遗址——...
伊媒发布穆杰塔巴罕见照片 伊朗塔斯尼姆通讯社6月1日发布了一张最高领袖穆杰塔巴的照片。照片中,穆杰塔巴面露笑容,抱着一个婴儿。...
福建“泡药杨梅”曝光后,浙江杨... 这两天,浙江本地杨梅少量进入市场。虽然受到此前福建 “泡药杨梅” 事件影响,市场整体销量相比去年同期...
尺素金声 | 前4月规上工业企... 5月27日,国家统计局发布最新数据显示,今年前4月,全国规上工业企业实现利润同比增长18.2%,增速...
郑丽文:台湾民众越来越了解“台... 针对台湾《联合报》民调显示,63%受访者民意希望维持现状,即将访美的中国国民党主席郑丽文1日表示,民...
美前副总统:共和党失去了方向,... 2026年是美国的中期选举年,共和党选情不利,可能在年底的选举中遭遇挫败。美国前副总统彭斯5月31日...
南枝原来去过中国?《给阿嬷的情... 《给阿嬷的情书》票房口碑双丰收,目前票房已突破13亿。凤凰卫视最新一期《问答神州》专访了该片导演蓝鸿...
法国海军扣押一艘俄“影子舰队”... 近日,法国海军在大西洋海域扣押了一艘据称从俄罗斯摩尔曼斯克出发的油轮,引发俄方强烈不满。俄新社6月1...