Advertisement

爬虫和旅游网站上的游客评论

阅读量:

由于一门市场营销课程需要借助旅游网站的游客评论来讲解NLP的基础知识,原本教师要求我们直接复制粘贴至少十条评论数据。考虑到数据量过少可能影响教学效果,我自行编写了一段小型代码实现自动爬取功能。

复制代码
    from selenium import webdriver
    import pandas as pd
    import time
    
    wd = webdriver.Chrome()
    wd.get("https://www.tripadvisor.com.au/Attraction_Review-g529031-d264758-Reviews-Mount_Kosciuszko_National_Park-Thredbo_Village_Kosciuszko_National_Park_New_South_.html")
    wd.implicitly_wait(10)
    
    max_pages = 100
    reviews = []
    
    for i in range(max_pages):
    print("processing page {}".format(i+1))
    reviews1 = wd.find_elements_by_css_selector('.IRsGHoPm>span')

全部评论 (0)

还没有任何评论哟~