Возникла проблема при веб-скрейпинге yell.com с помощью cloudscrapper

Question

Возникла проблема при веб-скрейпинге yell.com с помощью cloudscrapper

Я пытался очистить yell.com. Мой код работал без сбоев до прошлого месяца после того, как они повысили безопасность. Сейчас они используют какую-то обновленную версию cloudflare. Мой предыдущий код:

      import cloudscraper

headers = {'accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,image/avif,image/webp,image/apng,*/*;q=0.8,application/signed-exchange;v=b3;q=0.9',
#'accept-encoding': 'gzip, deflate, br',
'accept-language': 'en-IN,en;q=0.9',
'cache-control': 'no-cache',
'pragma': 'no-cache',
'sec-ch-ua': '" Not A;Brand";v="99", "Chromium";v="101", "Google Chrome";v="101"',
'sec-ch-ua-mobile': '?0',
'sec-ch-ua-platform': '"Windows"',
'sec-fetch-dest': 'document',
'sec-fetch-mode': 'navigate',
'sec-fetch-site': 'none',
'sec-fetch-user': '?1',
'upgrade-insecure-requests': '1',
'user-agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/101.0.4951.54 Safari/537.36',}

scraper = cloudscraper.create_scraper(allow_brotli = False , disableCloudflareV1 = True)
query ="https://www.yell.com/ucs/UcsSearchAction.do?keywords=plumber&location=Wakefield"
req = scraper.get(query,headers=headers)
print(req)
res= req.text
file=open("Checking_1.html","w",encoding="utf-8")
file.write(res)
file.close()

Но теперь я получаю код ошибки 403. и получение капчи.

И когда я использовал режим отладки, я получил это в ответ:

введите описание изображения здесь

Пожалуйста, дайте мне знать, если я делаю некоторые ошибки.

-2

python python-3.x web-scraping yellow-pages

Источник

Prashant Jain 09 май '22 в 08:25

0 ответов

Другие вопросы по тегам python python-3.x web-scraping yellow-pages