Los agentes de IA que navegan por la web y los procesos que convierten páginas en texto para modelos tienen el mismo problema que cualquier recolección a escala, solo que más intenso: muchas páginas, destinos que limitan las peticiones y contenido que cambia según la región. Y, como la página termina convertida en texto, gran parte de lo que se descarga nunca llega al modelo.
Esta página es para quien construye agentes, sistemas RAG y bases de entrenamiento y necesita elegir la red adecuada.
Qué pide a la red la recolección para IA
| Necesidad | Por qué |
|---|---|
| Volumen repartido | Los destinos limitan las peticiones por dirección |
| Origen en el país correcto | El contenido, el precio y la disponibilidad pueden cambiar por región |
| Configuración por petición | Las herramientas modernas cambian de proxy en cada recolección |
| Consumo previsible | Se descarga la página entera para extraer unos pocos párrafos |
Qué producto usar
| Situación | Producto | Cómo se cobra |
|---|---|---|
| Contenido que cambia por país (precios, catálogos, noticias locales) | IPv4 dedicado o ISP residencial del país | Por IP y período, sin medidor de GB |
| Destinos que aceptan IPv6, volumen alto | IPv6 en lotes | Por lote y período, sin medidor de GB |
| Destinos que aceptan datacenter y no cambian por región | IPv4 MIX (países mezclados o por región) | Lotes de 20 a 500 IP |
| Contenido de Brasil, destinos que limitan por IP | Residencial por GB | Por GB, rotación por petición o por sesión; IP de Brasil |
| Agente que opera una cuenta con login | IPv4 dedicado | IP fija; revisa también los términos del servicio |
Todos aceptan HTTP y SOCKS5 con usuario y contraseña (en el IPv6 eliges el protocolo al comprar). El país de las IP dedicadas y de los lotes IPv6 se elige en el checkout.
Configuración en las herramientas de recolección
Herramientas como Crawl4AI recomiendan configurar el proxy por petición, con servidor, usuario y contraseña, y ofrecen una estrategia de rotación entre una lista de proxies. En la práctica:
- con varias IP dedicadas, un lote IPv6 o un lote MIX, la lista de direcciones alimenta la rotación de la herramienta;
- con el residencial por GB, un único endpoint ya cambia la dirección del lado del proxy;
- para automatización de navegador, la guía de proxy en automatización de navegador cubre Playwright, Puppeteer y Scrapy.
El ejemplo completo está en Crawl4AI con proxy.
Cómo no disparar el consumo
- No descargues lo que no se convierte en texto: imágenes, vídeos y fuentes.
- Mapea las URL antes y recoge solo lo necesario.
- Trata los errores con espera, no con repeticiones inmediatas.
- Evita volver a recoger lo que no cambió.
Más ajustes en consumo de GB en scraping.
Cómo comprar y empezar
- Ejecuta una muestra y mide el consumo y las peticiones por página.
- Elige el producto según el comportamiento de los destinos y el país del contenido.
- Paga en dólares (USD) con el medio de tu país y copia las credenciales en el panel.
- Configura el proxy por petición en la herramienta de recolección.
Lo que el proxy no resuelve
- No convierte en abierto un contenido cerrado. Si la página exige login o suscripción, el proxy no cambia los permisos.
- No sustituye una API oficial cuando el sitio la ofrece.
- No arregla un agente que hace demasiadas peticiones. Con más IP, el exceso se reparte; no desaparece.
Límites que siguen vigentes
La recolección para IA sigue las reglas de cualquier recolección: respeta robots.txt, los términos de uso y el RGPD o las leyes locales de protección de datos. El contenido con datos personales exige una base legal, y la recolección de datos personales sin base legal está fuera de nuestra política de uso aceptable.