Entrega automática tras confirmar el pago · IP dedicado · Soporte por ticket en el panel Pago local según tu país · Precios en dólares (USD)
ProxyBox
Datos

Qué es el web scraping: cómo funciona, cuándo es legítimo y dónde entra el proxy

Qué es el web scraping, cómo funciona un recolector, qué límites ponen la protección de datos y las condiciones de uso, cuándo usar una API y dónde entra el proxy.

Por Redacción ProxyBox · Editor técnico 9 min de lectura web scraping · recopilación de datos · RGPD

El web scraping (extracción o raspado de datos web) es la recopilación automática de información publicada en páginas web. Un programa accede a la página como lo haría un navegador, lee el HTML y extrae los campos que interesan: precio, título, fecha, dirección, disponibilidad. Lo que una persona haría copiando y pegando durante horas, un recolector lo hace en minutos y lo repite cada día.

La técnica es antigua y sencilla. Lo que cambió en los últimos años fue el cerco: los sitios empezaron a clasificar la red de origen, a limitar las peticiones por dirección y a servir páginas montadas con JavaScript. Y las normas sobre qué se puede recopilar se volvieron más claras. Este artículo cubre los tres puntos: cómo funciona, cuándo es legítimo y dónde entra el proxy.

Cómo funciona un recolector

Un recolector de web scraping hace, en secuencia:

  1. Petición. Pide la página al servidor, igual que el navegador, con una dirección de origen (la IP) y un identificador de cliente (el user agent).
  2. Lectura. Recibe el HTML y, si la página monta el contenido con JavaScript, tiene que ejecutar ese código, lo que exige un navegador controlado por programa, como Playwright.
  3. Extracción. Localiza los campos mediante selectores (el "camino" hasta el precio o el título) y los convierte en una tabla.
  4. Almacenamiento y repetición. Guarda el resultado y programa la siguiente recopilación.

Cada paso tiene un costo. La petición consume datos; ejecutar JavaScript consume procesamiento y multiplica el tráfico; la repetición decide cuánto cuesta todo eso al mes. Por eso la pregunta "qué proxy uso" va después de la pregunta "qué necesito recopilar de verdad y con qué frecuencia". El cálculo está en consumo de GB en scraping con proxy.

Scraping, crawling y API: la diferencia

Término Qué es Cuándo usarlo
Web scraping Extraer campos de páginas concretas Cuando el dato solo existe en la página
Web crawling Recorrer enlaces para descubrir páginas Indexación, mapeo de un sitio
API El sitio entrega el dato en formato estructurado, por contrato Siempre que exista; es más estable y más barata
Datos abiertos Base publicada por el propio organismo o empresa Antes de cualquier recopilación en una fuente pública

La regla que más dinero y más problemas ahorra: primero la fuente oficial. Muchos gobiernos tienen portales de datos abiertos (como datos.gob.es en España o datos.gob.mx en México) y muchas plataformas ofrecen API para vendedores o socios. Extraer una página que tiene API es pagar más para recibir un dato peor.

La técnica en sí no suele ser lo que está regulado. Lo que existe son tres capas de límites, y la recopilación tiene que pasar las tres. Lo que sigue es orientación general, no asesoría legal: ante un caso concreto, consulta con un abogado de tu país.

Datos personales. En la Unión Europea se aplica el RGPD a cualquier tratamiento de datos personales, y en América Latina cada país tiene su propia ley de protección de datos. Que un dato sea "públicamente accesible" no lo convierte en un dato libre: un nombre, un teléfono o un perfil siguen siendo datos personales. Recopilarlos exige una base legal, una finalidad definida y cuidado con el almacenamiento. Recopilar el precio de un producto, una licitación o una cotización no implica datos personales y queda fuera de esta capa.

Acceso: condiciones de uso. Los sitios publican condiciones que a menudo restringen el acceso automatizado, y el archivo robots.txt indica lo que el sitio prefiere que los robots no visiten. Por ejemplo, las condiciones de uso de Wallapop prohíben extraer de forma sistemática su contenido y usar robots sin su consentimiento. Incumplir unas condiciones puede acabar en bloqueos, cierre de cuentas y reclamaciones. Y saltarse una protección técnica para entrar en una zona restringida, con el login de otra persona o rompiendo una autenticación, ya no es recopilar datos públicos: es otro terreno.

Uso posterior: derechos de autor y competencia. Copiar textos, fotos y bases enteras para republicarlos puede infringir derechos de autor, sin importar cómo se obtuvieron; en la UE, además, las bases de datos pueden tener una protección propia. Usar precios para ajustar tu política comercial es una práctica común; reproducir el catálogo de la competencia no lo es.

El escenario más seguro es este: dato público, no personal, recopilado a un ritmo que no perjudica al sitio, para uso interno. Cuando hay datos personales, la base legal tiene que existir antes de que arranque el primer robot. Nuestra política de uso aceptable sigue exactamente ese criterio.

Por qué los sitios bloquean a los recolectores

Un sitio grande no bloquea la recopilación por principio; la bloquea por costo y por riesgo. Las señales que usa, por orden de peso:

  • Ritmo. Cientos de peticiones por minuto desde una misma dirección es la señal más obvia. La respuesta suele ser el error 429 Too Many Requests, que significa "más despacio", a veces con el tiempo de espera en la cabecera.
  • Red de origen. Una dirección de datacenter se interpreta como servidor, y un servidor en volumen parece automatización. Muchos sitios rechazan ese tipo de red antes incluso de servir la página; el mecanismo está en por qué bloquean las IP de datacenter.
  • Comportamiento. Ningún JavaScript ejecutado, cabeceras incompletas, secuencias de páginas que ninguna persona haría.

Fíjate en que dos de las tres señales no tienen nada que ver con el proxy. Ajustar el ritmo y el comportamiento del recolector resuelve más bloqueos que cambiar de dirección.

Dónde entra el proxy

El proxy entra cuando el límite es por dirección o cuando la red de origen es el problema. En esos casos:

  • Residencial rotativo por GB: reparte las peticiones entre direcciones de red doméstica, que los sitios tratan como visitantes comunes. Es el producto habitual para páginas públicas que bloquean el datacenter. En ProxyBox es de Brasil, con filtro por estado y ciudad: proxies residenciales.
  • IPv6 en lote: el camino más barato cuando el destino acepta IPv6; la prueba está en cómo saber si un sitio acepta IPv6.
  • IPv4 fija: sirve cuando la recopilación tiene que mantener una sesión iniciada, porque cambiar de dirección en mitad de una sesión es lo que dispara las alertas. También es la opción cuando necesitas ver el sitio desde un país concreto (España, México y otros, según disponibilidad en el checkout).

Los tres modos de rotación, y cuál usar en cada caso, están en rotación de IP: fija, por sesión o por petición. La página de proxy para web scraping resume los productos, y los precios están en /precios.

Dónde se convierte en un trabajo real

El scraping casi nunca es un fin. Es el medio para una decisión que se repite cada semana. Los casos más habituales se dividen en tres familias.

El precio de la competencia. La familia más común. Lo básico, con la cuenta de cuánto cuesta en tráfico, está en monitorización de precios de la competencia sin gastar GB de más, y la página comercial es proxy para monitorización de precios. En hotelería el mismo problema tiene nombre propio y otro ritmo: rate shopper para hoteles. En inmobiliaria, el corte útil es geográfico, en precios por barrio en Idealista. En grandes catálogos, scraping de Amazon.

El mismo contenido visto desde otro lugar. Aquí lo que cambia no es el sitio, sino desde dónde lo miras. Los buscadores y las aerolíneas muestran resultados distintos según el origen: posición en Google por ciudad, el precio de los vuelos cambia por país y los resultados locales de Google Maps.

La vigilancia de tu propia marca. Anuncios falsificados y usos indebidos en marketplaces, en protección de marca: anuncios falsificados, con su página comercial en proxy para protección de marca.

En todos ellos, la pregunta de la sección anterior sigue valiendo antes de escribir la primera línea: ¿existe una fuente oficial? Si existe, es más barata, más estable y no genera discusiones legales.

Si la decisión ya está tomada y lo que falta es el código, el camino en Python, con los cuidados que hacen que un recolector dure más de un mes, está en web scraping con Python.

Un flujo que se sostiene

  1. Busca una API o datos abiertos de la fuente. Si existen, para aquí.
  2. Define lo mínimo que hay que recopilar y la menor frecuencia que sirve para la decisión.
  3. Lee las condiciones y el robots.txt; si hay datos personales, define la base legal.
  4. Ve despacio, respeta el Retry-After y vigila la tasa de errores.
  5. Solo entonces elige el proxy, según el tipo de bloqueo que haya aparecido.

Un recolector montado en ese orden cuesta menos, se rompe menos y no te trae llamadas del departamento legal.

En esta guía: 11 artículos de apoyo

Cada tema de arriba tiene su propio artículo, con el paso a paso y los detalles que no caben aquí.

  1. Scraping con proxy por GB: cómo no disparar el consumo

    El coste de la recogida de datos lo define el peso de las respuestas, no el número de peticiones. Cómo reducirlo.

  2. Error 429 Too Many Requests en scraping: límite por IP, espera y cuándo lo resuelve un proxy

    El 429 es el sitio diciendo "más despacio". A veces el límite es por IP y el proxy ayuda; a veces es por cuenta o por clave, y ninguna IP lo resuelve.

  3. Monitorización de precios de la competencia: qué recoger sin disparar el consumo de GB

    El precio son unos pocos bytes dentro de una página de cientos de kilobytes. Recoger solo lo que importa, con la frecuencia adecuada, define el coste de la monitorización.

  4. ¿El precio de un vuelo cambia según el país desde el que compras? Mito, realidad y cómo monitorizar tarifas

    La tarifa aérea cambia con la disponibilidad de asientos, la moneda y el sitio en el que se compra. Mira lo que la IP, las cookies y la VPN cambian de verdad y lo que no.

  5. Protección de marca: cómo las marcas monitorizan anuncios falsificados en marketplaces

    Retirar un anuncio falsificado es fácil; el vendedor vuelve con otro perfil. La protección de marca que funciona es monitorización continua con un registro ordenado.

  6. Rank tracking: por qué tu posición en Google cambia según la ciudad y cómo medirla

    La misma búsqueda muestra resultados distintos en Madrid y en Sevilla, o en Ciudad de México y en Monterrey. Medir el ranking exige fijar la ubicación y entender el límite de cada método.

  7. Rate shopper en hoteles: de dónde sale el precio de la competencia

    El revenue management depende de saber el precio del vecino. El rate shopper recoge esas tarifas, y la forma de recogerlas define la fiabilidad del dato.

  8. Scraping de Amazon: qué permiten sus condiciones, las alternativas oficiales y dónde encaja una IP dedicada

    Quien busca "scraping Amazon" casi siempre quiere seguir precios o vigilar a la competencia. Para las dos cosas hay caminos que no chocan con las condiciones de Amazon; el proxy entra al final, y en menos casos de lo que se cree.

  9. Scraping de Google Maps: qué dicen los términos de Google, las alternativas oficiales y cuándo tiene sentido una IP dedicada

    Sacar una lista de negocios de Google Maps parece fácil, pero los términos de Google Maps Platform prohíben expresamente el scraping de su contenido. Lo que sí se puede hacer, y dónde encaja un proxy.

  10. Scraping de Idealista y precio del metro cuadrado por barrio: índices, portales y recolección

    Los índices muestran la tendencia de la ciudad; el anuncio muestra el barrio. Cómo combinar las fuentes, qué dicen los términos de los portales y cuándo tiene sentido recolectar con proxy.

  11. Web scraping con Python en la práctica: del primer script al recolector que aguanta

    Que el primer script funcione lleva diez minutos. Que funcione seis meses sin romperse ni causar problemas es otra historia.

Ver el índice de Datos

Preguntas frecuentes

¿Qué es el web scraping, en una frase?
Es un programa que visita páginas web y extrae de ellas información estructurada, como precio, título o fecha, en lugar de que una persona la copie a mano.
¿Es legal hacer web scraping?
Lo que suele estar limitado no es la técnica en sí, sino el dato recopilado (la protección de datos personales, como el RGPD en la UE y las leyes locales en cada país), el acceso (las condiciones de uso del sitio) y el uso posterior (derechos de autor, competencia). Recopilar datos públicos y no personales, a un ritmo razonable y para un uso legítimo, es el escenario más seguro. Ante un caso concreto, consulta con un abogado de tu país.
¿Necesito un proxy para hacer web scraping?
No siempre. Si la fuente tiene API o datos abiertos, úsalos primero. El proxy entra cuando el sitio limita las peticiones por dirección o clasifica tu red como servidor, y aun así la recopilación tiene que respetar el ritmo del sitio.
¿Qué tipo de proxy se usa en scraping?
Residencial rotativo cobrado por GB (en ProxyBox, con IP de Brasil), para páginas que bloquean el datacenter; IPv6 en lote, para destinos que aceptan IPv6; IPv4 fija, cuando la recopilación exige una sesión con inicio de sesión.
¿Se puede hacer web scraping con IA?
Sí. Hay herramientas que usan modelos de lenguaje para extraer campos sin escribir selectores, y recolectores que preparan páginas para alimentar un modelo. Las reglas son las mismas: fuente, ritmo, datos personales y condiciones de uso.

¿Quieres aplicarlo en tu operación?

Precio público en dólares, pago local según tu país y entrega automática en el panel tras confirmar el pago. Si no sabes qué tipo elegir, cuéntanos tu operación por WhatsApp: te indicamos el más barato que lo resuelve.

Este contenido es informativo. Un proxy es infraestructura de red: controlamos el origen, la exclusividad y la geolocalización del IP. La aprobación o restricción de cuentas depende también del comportamiento de uso, la huella digital del navegador y las políticas internas de cada plataforma. Consulta la política de uso aceptable.

¿Tienes dudas? Escríbenos por WhatsApp