Herramienta gratuita de código abierto · Visor en el navegador

Mira adónde va el ancho de banda de proxy de tu scraper. Abre el informe en tu navegador.

Descubre qué hosts y recursos consumen el ancho de banda de tu scraper. Scrapescope es un proxy local de medición, gratuito y de código abierto, para scrapers y agentes de navegador. Instala la herramienta para medir una ejecución o abre un informe existente en el visor de abajo.

  • Gratis y con licencia MIT
  • No hace falta cuenta de ipvolt
  • Los informes se quedan en tu navegador

Usa tu propio proxy HTTP compatible o ejecuta el modo de dimensionamiento directo sin cuenta de proxy. Scrapescope y este visor no requieren acceso a los proxies de ipvolt.

Por ipvolt · Traducción actualizada el · Leer el original en inglés

Del informe de ejemplo incluido

Tres páginas, tal como se midieron
783,026 bytes
Modelo con imágenes, medios y fuentes bloqueados
127,386 bytes

El ejemplo es una ejecución real de tres páginas en books.toscrape.com, registrada en modo de dimensionamiento directo. Las imágenes y las fuentes sumaron 655,640 de sus 783,026 bytes (84%). La cifra posterior es la hipótesis del informe: un modelo construido a partir de bytes asignados, no una segunda ejecución medida.

El visor

Abre un informe.

Suelta un report.json de scrapescope en el marco, elige un archivo o carga el ejemplo incluido. El informe se procesa dentro de un marco aislado en esta página y no se sube nada. Puedes comparar dos ejecuciones, valorar los bytes con la tarifa que escribas y descargar una tarjeta para compartir generada en tu dispositivo. La interfaz del visor está en inglés.

Tu primer informe

Mide una ejecución. Revisa el informe.

Después de instalar, ejecuta a través de Scrapescope un scraper de Python existente que admita proxy. Sustituye my_scraper.py por tu propio script. El dimensionamiento directo usa la conexión de tu máquina; no prueba a un proveedor de proxies ni predice cómo se comportará un destino protegido a través de uno.

Dimensionamiento directo, sin cuenta de proxy
scrapescope run --direct --env-all --out report.json -- python my_scraper.py
Lee el informe en tu terminal
scrapescope report report.json

Abre report.json en el visor de arriba para revisarlo visualmente. El envoltorio define las variables de entorno de proxy; tu cliente debe respetarlas o usar una configuración de proxy explícita. Los totales por túnel no requieren instrumentar el navegador, pero la atribución por recurso necesita el ayudante de Playwright para Python o los hooks de Requests/HTTPX documentados en el repositorio.

Para otra tarea, usa scrapescope find URL --value V --direct para buscar una respuesta que contenga un valor conocido. Sustituye URL por tu página y V por el valor que necesitas, y pon ambos entre comillas en tu shell. La opción --direct usa la conexión de tu máquina sin cuenta de proxy. Esto usa el navegador Chromium instalado y observa la carga inicial de la página; revisa los límites de captura y el resultado de la repetición antes de cambiar un trabajo de extracción.

Uso completo, configuración del ayudante y del proxy ascendente (en inglés)

Qué muestra un informe

Encuentra las respuestas capturadas que contienen tu valor.

scrapescope find URL --value V carga una página una vez en Chromium sin interfaz e inspecciona las respuestas de texto capturadas en busca de los valores que indiques, incluidas las formas codificadas habituales. Ordena las coincidencias por el tamaño de transferencia estimado de una petición independiente y señala las cookies o tokens enviados por el navegador. Puede pasar por alto respuestas demasiado grandes, descartadas, binarias o de workers, y el contenido cargado después de esa captura inicial. Una repetición opcional comprueba un candidato sin navegador; una coincidencia por sí sola no demuestra que puedas reutilizarla.

El medidor local cuenta los bytes en su conexión con un proxy ascendente. El ayudante del navegador añade información de las peticiones para que el informe pueda asignar esos totales por tipo de recurso. Son mediciones distintas: el total de un túnel está medido; la parte atribuida a un script o a una imagen está asignada. Lee las etiquetas antes de comparar con el panel de tu proveedor.

Cada host

Número de túneles y bytes por host, con y sin el intercambio CONNECT, y los grupos para los túneles que ninguna petición explica.

Tipos de recurso

Bytes por tipo de recurso, como documento, script, imagen, fuente, medios y XHR, asignados a partir de los totales de túnel de cada host.

Tráfico de fondo del navegador

Tráfico que el navegador inició por su cuenta, etiquetado con un componente catalogado, como las descargas de modelos de optimisation guide de Chromium, pero solo cuando el host está en el catálogo de tráfico de fondo respaldado por evidencia.

Hipótesis, con correcciones generadas

El efecto modelado de bloquear imágenes, medios y fuentes o de denegar los hosts de fondo catalogados, con correcciones para tu stack que solo aparecen cuando el problema correspondiente se midió en tu ejecución.

Cifras por 1,000 unidades

Bytes por 1,000 cargas de página y, cuando indicas tu propia tarifa, un coste estimado por ejecución, por 1,000 unidades y por 1,000 unidades correctas.

Cómo leer un informe

Tres etiquetas, una unidad, ninguna factura.

Medido en el túnel, asignado, estimado

En modo ascendente, los totales por host están medidos en el túnel: bytes escritos y leídos en el socket hacia tu proveedor, TLS incluido, mostrados con y sin el intercambio CONNECT. El dimensionamiento directo mide la conexión con el destino y estima un intercambio CONNECT añadido. Los bytes por petición y por tipo se asignan a partir de los totales por host en proporción a los tamaños que comunica el cliente instrumentado. El coste es una estimación: convierte el total de bytes elegido a GB o GiB y multiplícalo por la tarifa que hayas introducido.

GB significa 10⁹ bytes

scrapescope informa por defecto en GB = 10⁹ bytes; un GiB (2³⁰ bytes) es aproximadamente un 7.4% mayor, y la opción --gib informa en GiB. Comprueba qué unidad usa tu proveedor antes de comparar.

No es una factura

Los proveedores miden de forma distinta: con o sin el intercambio CONNECT, en GB o GiB, con mínimos o redondeos, incluyendo o no las peticiones fallidas. Aún no se ha publicado ninguna conciliación con la facturación de un proveedor, así que ninguna cifra de un informe tiene precisión de facturación.

Los navegadores alojados no están cubiertos

Los servicios de navegador en la nube envían su tráfico de proxy desde la red del propio servicio, por lo que un medidor local no puede verlo. scrapescope no afirma nada sobre ellos.

Bloquear puede romper la extracción

Bloquear imágenes, medios y fuentes, o denegar hosts de fondo, puede cambiar el comportamiento de una página o atraer el escrutinio anti-bot, y denegar las actualizaciones de componentes de Chromium también detiene los datos de revocación de certificados y de Safe Browsing. Cada hipótesis es una predicción: compárala con una segunda ejecución antes de confiar en ella.

Notas de método

Cómo se calculan las cifras.

Scrapescope es un proxy local de medición de código abierto para el tráfico de scrapers y agentes de navegador que pasa por él. Mide los bytes de cada túnel por host; un cliente instrumentado añade la atribución por recurso. Su comando find ordena las respuestas capturadas que contienen un valor dado según el tamaño de transferencia estimado, y su comando run admite un presupuesto de bytes.

Base facturada

find ordena las coincidencias por bytes del cuerpo codificado + bytes de las cabeceras de respuesta + bytes de las cabeceras de petición + una estimación de un nuevo handshake TLS de 7,200 bytes para HTTPS. Esto aproxima una petición independiente de esa respuesta en una conexión nueva por parte de un cliente que acepta la misma compresión que el navegador. Deja fuera el intercambio CONNECT, las redirecciones y un segundo handshake tras una reanudación fallida. En HTTP/2 y HTTP/3 no hay tamaños de cabecera separados, así que ambos campos de cabecera valen 0 y la coincidencia se marca como multiplexed.

La estimación de 7,200 bytes

El modelo añade una estimación fija de 7,200 bytes por el handshake TLS en HTTPS. Las cadenas de certificados reales y la reutilización de conexiones varían, así que una petición real puede mover más o menos. Es un supuesto del modelo, no una medición del handshake de la respuesta candidata.

Grupos

Los túneles de hosts sin ninguna petición correspondiente se etiquetan según reglas: background:<id> solo para hosts del catálogo de tráfico de fondo; before_attach para túneles abiertos antes de que el ayudante se conectara; preconnect_idle para túneles que no fallaron y transportaron como máximo 3,072 bytes de carga útil de subida y 6,144 de bajada, lo típico de una conexión abierta por adelantado y nunca usada; y unattributed en los demás casos. Un host sin catalogar nunca se llama de fondo, y los grupos suman el total con CONNECT.

Coste

Los costes aparecen solo cuando indicas una tarifa: el total de bytes, con y sin CONNECT, dividido entre 10⁹ (o 2³⁰ con --gib) y multiplicado por tu tarifa, más lo mismo por 1,000 unidades y, cuando se conoce el éxito, por 1,000 unidades correctas. La etiqueta es estimated billable transfer (transferencia facturable estimada).

Estima con tu tarifa

Convierte los bytes medidos en una estimación de coste.

Coste de transferencia estimado = bytes ÷ 1,000,000,000 × tu precio por GB. Para una comparación, resta los bytes de la segunda ejecución de los de la primera, usando la misma base de CONNECT y el mismo número de unidades correctas. El visor no tiene tarifa por defecto; introduce la de tu proveedor.

Ejemplo hipotético: una primera ejecución usa 200,000,000 bytes y una segunda usa 150,000,000 bytes para las mismas 100 cargas de página correctas. Con un precio supuesto de $4 por GB, sus costes de transferencia estimados son $0.80 y $0.60. La diferencia es de $0.20 por 100 cargas correctas, o $2 por 1,000 si el mismo resultado se repite. Son datos inventados para mostrar la fórmula, no un ahorro medido ni una oferta de un proveedor.

Comprueba los resultados de la extracción antes de considerar que menos bytes es una mejora. Usa la unidad (GB o GiB) y las reglas de facturación de tu proveedor, ten en cuenta los cargos mínimos y compara la estimación con el tiempo necesario para implementar y verificar un cambio.

Privacidad

Tu informe se queda en tu máquina.

Tu informe se procesa en tu navegador dentro de un marco aislado y nunca se sube; nada sobre él se envía a la analítica. Si aceptas la analítica opcional, esta página registra solo etiquetas fijas: que se abrió un informe desde un archivo, arrastrándolo o desde el ejemplo incluido, y si se pudo procesar; que se compararon dos ejecuciones; que se descargó una tarjeta para compartir; que se copió un comando de instalación; y que se usó el enlace a la página de inicio. Los nombres de host, los recuentos de bytes, los precios y los nombres de archivo nunca salen del marco.

Privacidad y analítica (en inglés)

Trabajo previo

Construido sobre ideas que otros implementaron antes.

Scrapescope se apoya en trabajo existente sobre inspección de peticiones, estadísticas locales de tráfico de proxy y análisis del tráfico de fondo de Chromium. El README del proyecto reconoce esas fuentes y documenta el modelo de medición y sus límites.

Conviene saber

Algunas respuestas claras.

¿Necesito una cuenta o un proxy de ipvolt para usar scrapescope?

No. Usa un proxy HTTP compatible o el modo de dimensionamiento directo sin cuenta de proxy. Scrapescope no tiene proveedor ni tarifa por defecto. Este visor abre los archivos report.json que escribe la herramienta.

¿El visor es gratuito? ¿Qué envía?

Sí. La página y la herramienta son gratuitas. El informe se procesa dentro de un marco aislado en tu navegador y nunca se sube. La analítica opcional, si la aceptas, recibe solo etiquetas fijas, nunca nombres de host, recuentos de bytes, precios ni nombres de archivo.

¿Por qué las cifras difieren del panel de mi proveedor?

scrapescope cuenta cada byte en su socket hacia tu proveedor, TLS incluido. Un proveedor puede contar un subconjunto distinto: con o sin el intercambio CONNECT, en GB o GiB, con redondeos o mínimos, incluyendo o no las peticiones fallidas. Trata el informe como una medición en tu máquina, no como una factura.

¿Qué clientes cubre?

Los clientes configurados para enviar sus peticiones HTTP o HTTPS a través de Scrapescope obtienen totales por host. Las peticiones que esquivan el medidor no se cuentan. La atribución por recurso necesita el ayudante de Playwright para Python o los hooks de Requests/HTTPX. Los navegadores alojados no están cubiertos porque su tráfico no pasa por tu medidor local.

¿Puedo compartir un informe sin exponer mis destinos?

La tarjeta para compartir se genera en tu dispositivo y tú decides si la descargas. La propia herramienta deja las cadenas de consulta fuera de los informes y puede sustituir los hosts por identificadores del catálogo o hashes con clave (--redact-hosts). Revisa un informe antes de compartirlo; son tus datos.

¿Bloquear siempre reduce los bytes?

No. La hipótesis es un modelo de tu ejecución medida. Bloquear puede cambiar el comportamiento de una página, romper la extracción o atraer el escrutinio anti-bot, y una página que carga más en una segunda visita puede mover las cifras en sentido contrario. La medición es la segunda ejecución, la comparada; la hipótesis es una predicción.

Tu próxima conexión

Usa las herramientas hoy.

Scrapescope se puede usar gratis con un proxy compatible o en modo de dimensionamiento directo. El acceso a los proxies de ipvolt es independiente; consulta la información actual del servicio si además necesitas un proveedor.

Conoce ipvolt

Herramientas gratuitas

Más herramientas gratuitas

Todas las herramientas gratuitas

Proxy Toolkit MCP

Configuración de proxies. Dentro de tu agente de IA.

Genera configuraciones de proxy, diagnostica errores de conexión y encuentra la guía adecuada.

Gratis · código abierto · funciona con cualquier proveedor

Abrir MCP Toolkit (EN)