El web scraping (extracción o raspado de datos web) es la recopilación automática de información publicada en páginas web. Un programa accede a la página como lo haría un navegador, lee el HTML y extrae los campos que interesan: precio, título, fecha, dirección, disponibilidad. Lo que una persona haría copiando y pegando durante horas, un recolector lo hace en minutos y lo repite cada día.
La técnica es antigua y sencilla. Lo que cambió en los últimos años fue el cerco: los sitios empezaron a clasificar la red de origen, a limitar las peticiones por dirección y a servir páginas montadas con JavaScript. Y las normas sobre qué se puede recopilar se volvieron más claras. Este artículo cubre los tres puntos: cómo funciona, cuándo es legítimo y dónde entra el proxy.
Cómo funciona un recolector
Un recolector de web scraping hace, en secuencia:
- Petición. Pide la página al servidor, igual que el navegador, con una dirección de origen (la IP) y un identificador de cliente (el user agent).
- Lectura. Recibe el HTML y, si la página monta el contenido con JavaScript, tiene que ejecutar ese código, lo que exige un navegador controlado por programa, como Playwright.
- Extracción. Localiza los campos mediante selectores (el "camino" hasta el precio o el título) y los convierte en una tabla.
- Almacenamiento y repetición. Guarda el resultado y programa la siguiente recopilación.
Cada paso tiene un costo. La petición consume datos; ejecutar JavaScript consume procesamiento y multiplica el tráfico; la repetición decide cuánto cuesta todo eso al mes. Por eso la pregunta "qué proxy uso" va después de la pregunta "qué necesito recopilar de verdad y con qué frecuencia". El cálculo está en consumo de GB en scraping con proxy.
Scraping, crawling y API: la diferencia
| Término | Qué es | Cuándo usarlo |
|---|---|---|
| Web scraping | Extraer campos de páginas concretas | Cuando el dato solo existe en la página |
| Web crawling | Recorrer enlaces para descubrir páginas | Indexación, mapeo de un sitio |
| API | El sitio entrega el dato en formato estructurado, por contrato | Siempre que exista; es más estable y más barata |
| Datos abiertos | Base publicada por el propio organismo o empresa | Antes de cualquier recopilación en una fuente pública |
La regla que más dinero y más problemas ahorra: primero la fuente oficial. Muchos gobiernos tienen portales de datos abiertos (como datos.gob.es en España o datos.gob.mx en México) y muchas plataformas ofrecen API para vendedores o socios. Extraer una página que tiene API es pagar más para recibir un dato peor.
¿Es legal hacer web scraping?
La técnica en sí no suele ser lo que está regulado. Lo que existe son tres capas de límites, y la recopilación tiene que pasar las tres. Lo que sigue es orientación general, no asesoría legal: ante un caso concreto, consulta con un abogado de tu país.
Datos personales. En la Unión Europea se aplica el RGPD a cualquier tratamiento de datos personales, y en América Latina cada país tiene su propia ley de protección de datos. Que un dato sea "públicamente accesible" no lo convierte en un dato libre: un nombre, un teléfono o un perfil siguen siendo datos personales. Recopilarlos exige una base legal, una finalidad definida y cuidado con el almacenamiento. Recopilar el precio de un producto, una licitación o una cotización no implica datos personales y queda fuera de esta capa.
Acceso: condiciones de uso. Los sitios publican condiciones que a menudo restringen el acceso automatizado, y el archivo robots.txt indica lo que el sitio prefiere que los robots no visiten. Por ejemplo, las condiciones de uso de Wallapop prohíben extraer de forma sistemática su contenido y usar robots sin su consentimiento. Incumplir unas condiciones puede acabar en bloqueos, cierre de cuentas y reclamaciones. Y saltarse una protección técnica para entrar en una zona restringida, con el login de otra persona o rompiendo una autenticación, ya no es recopilar datos públicos: es otro terreno.
Uso posterior: derechos de autor y competencia. Copiar textos, fotos y bases enteras para republicarlos puede infringir derechos de autor, sin importar cómo se obtuvieron; en la UE, además, las bases de datos pueden tener una protección propia. Usar precios para ajustar tu política comercial es una práctica común; reproducir el catálogo de la competencia no lo es.
El escenario más seguro es este: dato público, no personal, recopilado a un ritmo que no perjudica al sitio, para uso interno. Cuando hay datos personales, la base legal tiene que existir antes de que arranque el primer robot. Nuestra política de uso aceptable sigue exactamente ese criterio.
Por qué los sitios bloquean a los recolectores
Un sitio grande no bloquea la recopilación por principio; la bloquea por costo y por riesgo. Las señales que usa, por orden de peso:
- Ritmo. Cientos de peticiones por minuto desde una misma dirección es la señal más obvia. La respuesta suele ser el error 429 Too Many Requests, que significa "más despacio", a veces con el tiempo de espera en la cabecera.
- Red de origen. Una dirección de datacenter se interpreta como servidor, y un servidor en volumen parece automatización. Muchos sitios rechazan ese tipo de red antes incluso de servir la página; el mecanismo está en por qué bloquean las IP de datacenter.
- Comportamiento. Ningún JavaScript ejecutado, cabeceras incompletas, secuencias de páginas que ninguna persona haría.
Fíjate en que dos de las tres señales no tienen nada que ver con el proxy. Ajustar el ritmo y el comportamiento del recolector resuelve más bloqueos que cambiar de dirección.
Dónde entra el proxy
El proxy entra cuando el límite es por dirección o cuando la red de origen es el problema. En esos casos:
- Residencial rotativo por GB: reparte las peticiones entre direcciones de red doméstica, que los sitios tratan como visitantes comunes. Es el producto habitual para páginas públicas que bloquean el datacenter. En ProxyBox es de Brasil, con filtro por estado y ciudad: proxies residenciales.
- IPv6 en lote: el camino más barato cuando el destino acepta IPv6; la prueba está en cómo saber si un sitio acepta IPv6.
- IPv4 fija: sirve cuando la recopilación tiene que mantener una sesión iniciada, porque cambiar de dirección en mitad de una sesión es lo que dispara las alertas. También es la opción cuando necesitas ver el sitio desde un país concreto (España, México y otros, según disponibilidad en el checkout).
Los tres modos de rotación, y cuál usar en cada caso, están en rotación de IP: fija, por sesión o por petición. La página de proxy para web scraping resume los productos, y los precios están en /precios.
Dónde se convierte en un trabajo real
El scraping casi nunca es un fin. Es el medio para una decisión que se repite cada semana. Los casos más habituales se dividen en tres familias.
El precio de la competencia. La familia más común. Lo básico, con la cuenta de cuánto cuesta en tráfico, está en monitorización de precios de la competencia sin gastar GB de más, y la página comercial es proxy para monitorización de precios. En hotelería el mismo problema tiene nombre propio y otro ritmo: rate shopper para hoteles. En inmobiliaria, el corte útil es geográfico, en precios por barrio en Idealista. En grandes catálogos, scraping de Amazon.
El mismo contenido visto desde otro lugar. Aquí lo que cambia no es el sitio, sino desde dónde lo miras. Los buscadores y las aerolíneas muestran resultados distintos según el origen: posición en Google por ciudad, el precio de los vuelos cambia por país y los resultados locales de Google Maps.
La vigilancia de tu propia marca. Anuncios falsificados y usos indebidos en marketplaces, en protección de marca: anuncios falsificados, con su página comercial en proxy para protección de marca.
En todos ellos, la pregunta de la sección anterior sigue valiendo antes de escribir la primera línea: ¿existe una fuente oficial? Si existe, es más barata, más estable y no genera discusiones legales.
Si la decisión ya está tomada y lo que falta es el código, el camino en Python, con los cuidados que hacen que un recolector dure más de un mes, está en web scraping con Python.
Un flujo que se sostiene
- Busca una API o datos abiertos de la fuente. Si existen, para aquí.
- Define lo mínimo que hay que recopilar y la menor frecuencia que sirve para la decisión.
- Lee las condiciones y el
robots.txt; si hay datos personales, define la base legal. - Ve despacio, respeta el
Retry-Aftery vigila la tasa de errores. - Solo entonces elige el proxy, según el tipo de bloqueo que haya aparecido.
Un recolector montado en ese orden cuesta menos, se rompe menos y no te trae llamadas del departamento legal.