Desarrollo básico de un extractor web con Python
La automatización en la recopilación de información desde entornos web requiere una combinación de gestión de solicitudes HTTP y análisis sintáctico de documentos HTML. A continuación, se detalla la implementación de un flujo de extracción, contrastando el uso de expresiones regulares frente a bibliotecas de parsing dedicadas.
Recuperación y fi ...
Publicado el 8-5 19:09
Web Scraping del Top 250 de Películas de Douban usando Python y BeautifulSoup
Para extraer los datos del listado de las 250 mejores películas de Douban (posición, título, puntuación, frase destacada y enlace), utilizaremos las bibliotecas requests y BeautifulSoup en Python. La URL base implementa paginación mediante el parámetro start, el cual incrementa de 25 en 25: https://movie.douban.com/top250?start=0, start=25, etc ...
Publicado el 6-3 21:50