La recolección de datos no se resuelve con el mismo ISP que usas en Facebook Ads. El ISP es una IP fija, cara por dirección y fácil de saturar. El scraping pide volumen de direcciones: residencial por GB cuando el destino bloquea datacenter, IPv6 en lote cuando el destino acepta IPv6, o IPv4 dedicado y lotes MIX cuando el sitio acepta datacenter.
Antes de elegir, una aclaración de países: el residencial rotativo por GB sale con IP de Brasil (con filtro por estado y ciudad). Para recolectar en sitios de España, México u otros países, la opción del catálogo es el IPv4 dedicado del país que elijas en el checkout; en España y Estados Unidos también hay IPv6 e ISP (en México y el resto de Hispanoamérica, solo IPv4 de datacenter). Si todavía necesitas el concepto básico, empieza por qué es web scraping.
Qué producto para cada recolección
| Destino | Tipo | Nota |
|---|---|---|
| Sitio brasileño que bloquea datacenter | Residencial por GB | Rotación; sesión fija solo si el sitio la exige |
| Mucho volumen y destino con IPv6 | Lote IPv6 | Menor costo por IP si el destino lo acepta; hay lotes en Brasil y en otros países, como España y Estados Unidos |
| Sitio que acepta datacenter | IPv4 dedicado / MIX | Más barato; más bloqueos en marketplaces |
| Sitio de un país concreto (España, México…) | IPv4 dedicado de ese país | Varias IP fijas y reparto de peticiones entre ellas |
| Amazon / Mercado Libre (precios) | Según el país de la tienda | Mira Amazon y Mercado Libre |
| Cuenta con sesión iniciada (vendedor, publicidad) | No es recolección | Usa ISP o IPv4 fijo, en la página de la plataforma |
El scraping no es publicidad
El residencial rotativo cambia de IP. Eso es bueno para repartir peticiones y malo para mantener una sesión de cuenta durante 30 días. Lo contrario también vale: un solo ISP fijo no da abasto para recolectar un catálogo entero.
Con IP fijas (IPv4 o IPv6 en lote), la lógica es otra: compras varias direcciones y repartes las peticiones entre ellas, respetando el límite de cada una. Cuántas hacen falta depende del sitio; el cálculo está en error 429 y límite por IP.
No prometemos tamaño de pool ni tasa de éxito, porque esas cifras dependen del sitio de destino y de la forma de recolectar. Lo que entregamos: tráfico residencial brasileño por GB, IP dedicadas por país, autenticación por usuario y contraseña, sesión fija cuando está disponible y el consumo del residencial visible en el panel.
Buenas prácticas
- Respeta robots.txt, los términos del sitio y la ley, incluido el RGPD en la UE y las leyes locales de protección de datos. ProxyBox no apoya el abuso; mira el uso aceptable.
- Limita la frecuencia y espera entre reintentos. El reintento a ciegas acaba en bloqueo de IP y dispara el consumo de GB.
- Sesión fija corta solo cuando el destino exige cookie o sesión.
- Separa la IP de recolección de la IP de cualquier cuenta de vendedor o de publicidad.
- Vigila los GB. Un recolector encendido todo el mes puede dejar el residencial más caro que un IPv4. Ideas para reducirlo en consumo de GB en scraping.
Para el código, las guías de Python requests, Selenium y Playwright muestran cómo pasar usuario y contraseña del proxy.