Las herramientas de recogida pensadas para IA, como Crawl4AI, convierten páginas web en texto limpio para alimentar modelos. El reto deja de ser extraer el contenido y pasa a ser la escala: muchas páginas, destinos que limitan las peticiones y contenido que cambia según la región. Un proxy resuelve parte de eso, si se configura bien y sin desperdiciar tráfico.
Dónde configurar el proxy en Crawl4AI
La documentación de Crawl4AI recomienda configurar el proxy por petición, en CrawlerRunConfig, y ya no en BrowserConfig:
from crawl4ai import CrawlerRunConfig
run_config = CrawlerRunConfig(
proxy_config={
"server": "http://host:puerto",
"username": "usuario",
"password": "contrasena",
}
)
La documentación también muestra el mismo formato con la clase ProxyConfig, que tiene los mismos campos. Configurarlo por petición permite que cada recogida use un proxy distinto sin volver a crear el navegador.
Rotación entre varios proxies
Para repartir las peticiones entre una lista de direcciones, Crawl4AI ofrece la estrategia RoundRobinProxyStrategy, que alterna entre los proxies en secuencia:
from crawl4ai.proxy_strategy import RoundRobinProxyStrategy
estrategia = RoundRobinProxyStrategy(proxies)
run_config = CrawlerRunConfig(proxy_rotation_strategy=estrategia)
Dos formas de alimentar esa lista:
- Un lote de direcciones fijas, como un lote de IPv6 (si el destino acepta IPv6) o de IPv4: la rotación queda a cargo de Crawl4AI.
- Un residencial rotativo, que ya cambia la dirección del lado del proxy: en ese caso suele bastar un único endpoint.
Cuándo importa el país de la IP
Para recoger contenido global, el origen de la IP pesa poco. Empieza a importar cuando:
- el sitio cambia el contenido según la región: precios, disponibilidad, noticias locales;
- el destino solo responde a accesos de un país;
- quieres la versión de la página que ve el público de un país concreto, por ejemplo el de España o el de México.
Ahí, una dirección del país correcto hace más probable que el texto recogido sea el mismo que lee el usuario de ese país. En ProxyBox el país se elige en el checkout, y el tipo disponible cambia según el país (en algunos solo hay datacenter). Para contenido que se ve desde Brasil existe además el residencial rotativo por GB con IP brasileña.
Cómo no disparar el consumo de GB
En el residencial se cobra por GB, y la recogida para IA suele descargar mucho más de lo que usa. Tres ajustes con efecto directo:
- No cargues lo que no se convierte en texto. Imágenes, vídeos y fuentes consumen tráfico y no entran en el modelo.
- Recoge solo las URL necesarias. Haz primero un mapa y evita seguir enlaces que no interesan.
- Trata los errores sin repetir a ciegas. Un 429 respondido con reintentos inmediatos paga el tráfico varias veces; lo explicamos en error 429 en scraping.
Más ajustes de consumo en consumo de GB en scraping con proxy.
Qué tipo de IP usar
| Situación | Tipo |
|---|---|
| Muchas páginas públicas, destino que limita por IP | Residencial rotativo por GB (IP de Brasil) o lote de IP fijas en rotación |
| Destino que acepta IPv6 y volumen alto | Lote IPv6 |
| Destino que acepta datacenter y no cambia por región | Lote MIX IPv4 |
| Contenido que depende de haber iniciado sesión | IP fija, y revisa los términos del servicio |
Lo que el proxy no resuelve
Un proxy no limpia el HTML, no decide qué páginas recoger y no convierte en permitida una recogida que los términos del sitio prohíben. Tampoco evita los límites por cuenta o por clave de API.
Límites que siguen valiendo
La recogida para IA sigue las mismas reglas que cualquier otra: respeta el robots.txt, los términos de uso y la protección de datos (el RGPD en la Unión Europea y las leyes locales en otros países), sobre todo cuando haya datos personales. La recogida de datos personales sin base legal está fuera de nuestra política de uso aceptable.
Qué producto usar en cada tipo de recogida para IA está en proxy para agentes de IA.