Скачать файл из интранета с помощью Python
Я хотел бы загрузить серию PDF-файлов из моей интрасети. Я могу видеть файлы в своем веб-браузере без проблем, но при попытке автоматизировать извлечение файла через python я сталкиваюсь с проблемами. Поговорив через прокси-сервер, настроенный в моем офисе, я могу довольно легко загрузить файлы из Интернета с помощью этого ответа:
url = 'http://www.sample.com/fileiwanttodownload.pdf'
user = 'username'
pswd = 'password'
proxy_ip = '12.345.56.78:80'
proxy_url = 'http://' + user + ':' + pswd + '@' + proxy_ip
proxy_support = urllib2.ProxyHandler({"http":proxy_url})
opener = urllib2.build_opener(proxy_support,urllib2.HTTPHandler)
urllib2.install_opener(opener)
file_name = url.split('/')[-1]
u = urllib2.urlopen(url)
f = open(file_name, 'wb')
f.close()
но по какой-то причине это не сработает, если URL-адрес указывает на что-то в моей внутренней сети. Следующая ошибка возвращается:
Traceback (most recent call last):
File "<ipython-input-13-a055d9eaf05e>", line 1, in <module>
runfile('C:/softwaredev/python/pdfwrite.py', wdir='C:/softwaredev/python')
File "C:\Anaconda\lib\site-packages\spyderlib\widgets\externalshell\sitecustomize.py", line 585, in runfile
execfile(filename, namespace)
File "C:/softwaredev/python/pdfwrite.py", line 26, in <module>
u = urllib2.urlopen(url)
File "C:\Anaconda\lib\urllib2.py", line 127, in urlopen
return _opener.open(url, data, timeout)
File "C:\Anaconda\lib\urllib2.py", line 410, in open
response = meth(req, response)
File "C:\Anaconda\lib\urllib2.py", line 523, in http_response
'http', request, response, code, msg, hdrs)
File "C:\Anaconda\lib\urllib2.py", line 442, in error
result = self._call_chain(*args)
File "C:\Anaconda\lib\urllib2.py", line 382, in _call_chain
result = func(*args)
File "C:\Anaconda\lib\urllib2.py", line 629, in http_error_302
return self.parent.open(new, timeout=req.timeout)
File "C:\Anaconda\lib\urllib2.py", line 410, in open
response = meth(req, response)
File "C:\Anaconda\lib\urllib2.py", line 523, in http_response
'http', request, response, code, msg, hdrs)
File "C:\Anaconda\lib\urllib2.py", line 448, in error
return self._call_chain(*args)
File "C:\Anaconda\lib\urllib2.py", line 382, in _call_chain
result = func(*args)
File "C:\Anaconda\lib\urllib2.py", line 531, in http_error_default
raise HTTPError(req.get_full_url(), code, msg, hdrs, fp)
HTTPError: Service Unavailable
С помощью requests.py
В следующем коде я могу успешно извлечь файлы из Интернета, но при попытке извлечь pdf из моей офисной интрасети, я просто получаю сообщение об ошибке соединения, отправленное мне обратно в html. Следующий код выполняется:
import requests
url = 'www.intranet.sample.com/?layout=attachment&cfapp=26&attachmentid=57142'
proxies = {
"http": "http://12.345.67.89:80",
"https": "http://12.345.67.89:80"
}
local_filename = 'test.pdf'
r = requests.get(url, proxies=proxies, stream=True)
with open(local_filename, 'wb') as f:
for chunk in r.iter_content(chunk_size=1024):
print chunk
if chunk:
f.write(chunk)
f.flush()
И HTML, который возвращается:
Network Error (tcp_error)
A communication error occurred: "No route to host"
The Web Server may be down, too busy, or experiencing other problems preventing it from responding to requests. You may wish to try again at a later time.
For assistance, contact your network support team.
Возможно ли наличие какого-либо параметра сетевой безопасности, который предотвращает автоматические запросы вне среды веб-браузера?
2 ответа
Установка открывателей в urllib2 не влияет на запросы. Вам необходимо использовать собственную поддержку запросов для прокси. Этого должно быть достаточно, чтобы передать их в proxies
аргумент get
или вы можете установить HTTP_PROXY
а также HTTPS_PROXY
переменные среды См. http://docs.python-requests.org/en/latest/user/advanced/
import requests
proxies = {
"http": "http://10.10.1.10:3128",
"https": "http://10.10.1.10:1080",
}
requests.get("http://example.org", proxies=proxies)
Вы пытались не использовать прокси-сервер для загрузки файлов, когда он находится в интрасети?
Вы можете попробовать что-то подобное в python2
from urllib2 import urlopen
url = 'http://intranet/myfile.pdf'
with open(local_filename, 'wb') as f:
f.write(urlopen(url).read())