Entrega automática tras confirmar el pago · IP dedicado · Soporte por ticket en el panel Pago local según tu país · Precios en dólares (USD)
ProxyBox
Automatización

Crawl4AI con proxy: recogida de datos para IA sin disparar el consumo

Cómo configurar un proxy en Crawl4AI por petición, rotar una lista de proxies y reducir el consumo de GB al recoger páginas para modelos de IA.

Por Redacción ProxyBox · Editor técnico 4 min de lectura IA · scraping · Crawl4AI
Guía completa de Automatización

Este artículo profundiza en un punto del tema. Para la visión completa, lee Automatización con proxy: cuántas IP necesitas (y dónde las lee cada herramienta).

Las herramientas de recogida pensadas para IA, como Crawl4AI, convierten páginas web en texto limpio para alimentar modelos. El reto deja de ser extraer el contenido y pasa a ser la escala: muchas páginas, destinos que limitan las peticiones y contenido que cambia según la región. Un proxy resuelve parte de eso, si se configura bien y sin desperdiciar tráfico.

Dónde configurar el proxy en Crawl4AI

La documentación de Crawl4AI recomienda configurar el proxy por petición, en CrawlerRunConfig, y ya no en BrowserConfig:

from crawl4ai import CrawlerRunConfig

run_config = CrawlerRunConfig(
    proxy_config={
        "server": "http://host:puerto",
        "username": "usuario",
        "password": "contrasena",
    }
)

La documentación también muestra el mismo formato con la clase ProxyConfig, que tiene los mismos campos. Configurarlo por petición permite que cada recogida use un proxy distinto sin volver a crear el navegador.

Rotación entre varios proxies

Para repartir las peticiones entre una lista de direcciones, Crawl4AI ofrece la estrategia RoundRobinProxyStrategy, que alterna entre los proxies en secuencia:

from crawl4ai.proxy_strategy import RoundRobinProxyStrategy

estrategia = RoundRobinProxyStrategy(proxies)
run_config = CrawlerRunConfig(proxy_rotation_strategy=estrategia)

Dos formas de alimentar esa lista:

  • Un lote de direcciones fijas, como un lote de IPv6 (si el destino acepta IPv6) o de IPv4: la rotación queda a cargo de Crawl4AI.
  • Un residencial rotativo, que ya cambia la dirección del lado del proxy: en ese caso suele bastar un único endpoint.

Cuándo importa el país de la IP

Para recoger contenido global, el origen de la IP pesa poco. Empieza a importar cuando:

  • el sitio cambia el contenido según la región: precios, disponibilidad, noticias locales;
  • el destino solo responde a accesos de un país;
  • quieres la versión de la página que ve el público de un país concreto, por ejemplo el de España o el de México.

Ahí, una dirección del país correcto hace más probable que el texto recogido sea el mismo que lee el usuario de ese país. En ProxyBox el país se elige en el checkout, y el tipo disponible cambia según el país (en algunos solo hay datacenter). Para contenido que se ve desde Brasil existe además el residencial rotativo por GB con IP brasileña.

Cómo no disparar el consumo de GB

En el residencial se cobra por GB, y la recogida para IA suele descargar mucho más de lo que usa. Tres ajustes con efecto directo:

  1. No cargues lo que no se convierte en texto. Imágenes, vídeos y fuentes consumen tráfico y no entran en el modelo.
  2. Recoge solo las URL necesarias. Haz primero un mapa y evita seguir enlaces que no interesan.
  3. Trata los errores sin repetir a ciegas. Un 429 respondido con reintentos inmediatos paga el tráfico varias veces; lo explicamos en error 429 en scraping.

Más ajustes de consumo en consumo de GB en scraping con proxy.

Qué tipo de IP usar

Situación Tipo
Muchas páginas públicas, destino que limita por IP Residencial rotativo por GB (IP de Brasil) o lote de IP fijas en rotación
Destino que acepta IPv6 y volumen alto Lote IPv6
Destino que acepta datacenter y no cambia por región Lote MIX IPv4
Contenido que depende de haber iniciado sesión IP fija, y revisa los términos del servicio

Lo que el proxy no resuelve

Un proxy no limpia el HTML, no decide qué páginas recoger y no convierte en permitida una recogida que los términos del sitio prohíben. Tampoco evita los límites por cuenta o por clave de API.

Límites que siguen valiendo

La recogida para IA sigue las mismas reglas que cualquier otra: respeta el robots.txt, los términos de uso y la protección de datos (el RGPD en la Unión Europea y las leyes locales en otros países), sobre todo cuando haya datos personales. La recogida de datos personales sin base legal está fuera de nuestra política de uso aceptable.

Qué producto usar en cada tipo de recogida para IA está en proxy para agentes de IA.

Preguntas frecuentes

¿Dónde se configura el proxy en Crawl4AI?
La documentación recomienda configurarlo por petición, en CrawlerRunConfig con proxy_config, en lugar de en BrowserConfig, que se está dejando de usar para esto.
¿Crawl4AI acepta proxy con usuario y contraseña?
Sí. ProxyConfig tiene los campos server, username y password.
¿Cómo roto varios proxies en Crawl4AI?
Con la estrategia RoundRobinProxyStrategy, que se pasa en proxy_rotation_strategy dentro de CrawlerRunConfig y alterna entre los proxies de una lista.
¿Por qué usar una IP de un país concreto para recoger datos para IA?
Cuando el contenido que quieres cambia según la región, o cuando el sitio solo responde a accesos de ese país. Para contenido global, el origen importa menos.

¿Quieres aplicarlo en tu operación?

Precio público en dólares, pago local según tu país y entrega automática en el panel tras confirmar el pago. Si no sabes qué tipo elegir, cuéntanos tu operación por WhatsApp: te indicamos el más barato que lo resuelve.

Este contenido es informativo. Un proxy es infraestructura de red: controlamos el origen, la exclusividad y la geolocalización del IP. La aprobación o restricción de cuentas depende también del comportamiento de uso, la huella digital del navegador y las políticas internas de cada plataforma. Consulta la política de uso aceptable.

¿Tienes dudas? Escríbenos por WhatsApp