Cada host
Número de túneles y bytes por host, con y sin el intercambio CONNECT, y los grupos para los túneles que ninguna petición explica.
Herramienta gratuita de código abierto · Visor en el navegador
Descubre qué hosts y recursos consumen el ancho de banda de tu scraper. Scrapescope es un proxy local de medición, gratuito y de código abierto, para scrapers y agentes de navegador. Instala la herramienta para medir una ejecución o abre un informe existente en el visor de abajo.
Usa tu propio proxy HTTP compatible o ejecuta el modo de dimensionamiento directo sin cuenta de proxy. Scrapescope y este visor no requieren acceso a los proxies de ipvolt.
Por ipvolt · Traducción actualizada el · Leer el original en inglés
Del informe de ejemplo incluido
El ejemplo es una ejecución real de tres páginas en books.toscrape.com, registrada en modo de dimensionamiento directo. Las imágenes y las fuentes sumaron 655,640 de sus 783,026 bytes (84%). La cifra posterior es la hipótesis del informe: un modelo construido a partir de bytes asignados, no una segunda ejecución medida.
El visor
Suelta un report.json de scrapescope en el marco, elige un archivo o carga el ejemplo incluido. El informe se procesa dentro de un marco aislado en esta página y no se sube nada. Puedes comparar dos ejecuciones, valorar los bytes con la tarifa que escribas y descargar una tarjeta para compartir generada en tu dispositivo. La interfaz del visor está en inglés.
Tu primer informe
Después de instalar, ejecuta a través de Scrapescope un scraper de Python existente que admita proxy. Sustituye my_scraper.py por tu propio script. El dimensionamiento directo usa la conexión de tu máquina; no prueba a un proveedor de proxies ni predice cómo se comportará un destino protegido a través de uno.
scrapescope run --direct --env-all --out report.json -- python my_scraper.pyscrapescope report report.jsonAbre report.json en el visor de arriba para revisarlo visualmente. El envoltorio define las variables de entorno de proxy; tu cliente debe respetarlas o usar una configuración de proxy explícita. Los totales por túnel no requieren instrumentar el navegador, pero la atribución por recurso necesita el ayudante de Playwright para Python o los hooks de Requests/HTTPX documentados en el repositorio.
Para otra tarea, usa scrapescope find URL --value V --direct para buscar una respuesta que contenga un valor conocido. Sustituye URL por tu página y V por el valor que necesitas, y pon ambos entre comillas en tu shell. La opción --direct usa la conexión de tu máquina sin cuenta de proxy. Esto usa el navegador Chromium instalado y observa la carga inicial de la página; revisa los límites de captura y el resultado de la repetición antes de cambiar un trabajo de extracción.
Uso completo, configuración del ayudante y del proxy ascendente (en inglés)Qué muestra un informe
scrapescope find URL --value V carga una página una vez en Chromium sin interfaz e inspecciona las respuestas de texto capturadas en busca de los valores que indiques, incluidas las formas codificadas habituales. Ordena las coincidencias por el tamaño de transferencia estimado de una petición independiente y señala las cookies o tokens enviados por el navegador. Puede pasar por alto respuestas demasiado grandes, descartadas, binarias o de workers, y el contenido cargado después de esa captura inicial. Una repetición opcional comprueba un candidato sin navegador; una coincidencia por sí sola no demuestra que puedas reutilizarla.
El medidor local cuenta los bytes en su conexión con un proxy ascendente. El ayudante del navegador añade información de las peticiones para que el informe pueda asignar esos totales por tipo de recurso. Son mediciones distintas: el total de un túnel está medido; la parte atribuida a un script o a una imagen está asignada. Lee las etiquetas antes de comparar con el panel de tu proveedor.
Número de túneles y bytes por host, con y sin el intercambio CONNECT, y los grupos para los túneles que ninguna petición explica.
Bytes por tipo de recurso, como documento, script, imagen, fuente, medios y XHR, asignados a partir de los totales de túnel de cada host.
Tráfico que el navegador inició por su cuenta, etiquetado con un componente catalogado, como las descargas de modelos de optimisation guide de Chromium, pero solo cuando el host está en el catálogo de tráfico de fondo respaldado por evidencia.
El efecto modelado de bloquear imágenes, medios y fuentes o de denegar los hosts de fondo catalogados, con correcciones para tu stack que solo aparecen cuando el problema correspondiente se midió en tu ejecución.
El modo de dimensionamiento directo funciona sin cuenta de proxy. Mide esa ejecución directa; un destino protegido puede comportarse de otra forma a través de un proxy, así que no predice una ejecución con proxy ni una factura. Mira las páginas por GB medidas de esta forma en 34 páginas públicas.
Bytes por 1,000 cargas de página y, cuando indicas tu propia tarifa, un coste estimado por ejecución, por 1,000 unidades y por 1,000 unidades correctas.
Cómo leer un informe
En modo ascendente, los totales por host están medidos en el túnel: bytes escritos y leídos en el socket hacia tu proveedor, TLS incluido, mostrados con y sin el intercambio CONNECT. El dimensionamiento directo mide la conexión con el destino y estima un intercambio CONNECT añadido. Los bytes por petición y por tipo se asignan a partir de los totales por host en proporción a los tamaños que comunica el cliente instrumentado. El coste es una estimación: convierte el total de bytes elegido a GB o GiB y multiplícalo por la tarifa que hayas introducido.
scrapescope informa por defecto en GB = 10⁹ bytes; un GiB (2³⁰ bytes) es aproximadamente un 7.4% mayor, y la opción --gib informa en GiB. Comprueba qué unidad usa tu proveedor antes de comparar.
Los proveedores miden de forma distinta: con o sin el intercambio CONNECT, en GB o GiB, con mínimos o redondeos, incluyendo o no las peticiones fallidas. Aún no se ha publicado ninguna conciliación con la facturación de un proveedor, así que ninguna cifra de un informe tiene precisión de facturación.
Los servicios de navegador en la nube envían su tráfico de proxy desde la red del propio servicio, por lo que un medidor local no puede verlo. scrapescope no afirma nada sobre ellos.
Bloquear imágenes, medios y fuentes, o denegar hosts de fondo, puede cambiar el comportamiento de una página o atraer el escrutinio anti-bot, y denegar las actualizaciones de componentes de Chromium también detiene los datos de revocación de certificados y de Safe Browsing. Cada hipótesis es una predicción: compárala con una segunda ejecución antes de confiar en ella.
Notas de método
Scrapescope es un proxy local de medición de código abierto para el tráfico de scrapers y agentes de navegador que pasa por él. Mide los bytes de cada túnel por host; un cliente instrumentado añade la atribución por recurso. Su comando find ordena las respuestas capturadas que contienen un valor dado según el tamaño de transferencia estimado, y su comando run admite un presupuesto de bytes.
find ordena las coincidencias por bytes del cuerpo codificado + bytes de las cabeceras de respuesta + bytes de las cabeceras de petición + una estimación de un nuevo handshake TLS de 7,200 bytes para HTTPS. Esto aproxima una petición independiente de esa respuesta en una conexión nueva por parte de un cliente que acepta la misma compresión que el navegador. Deja fuera el intercambio CONNECT, las redirecciones y un segundo handshake tras una reanudación fallida. En HTTP/2 y HTTP/3 no hay tamaños de cabecera separados, así que ambos campos de cabecera valen 0 y la coincidencia se marca como multiplexed.
El modelo añade una estimación fija de 7,200 bytes por el handshake TLS en HTTPS. Las cadenas de certificados reales y la reutilización de conexiones varían, así que una petición real puede mover más o menos. Es un supuesto del modelo, no una medición del handshake de la respuesta candidata.
Los túneles de hosts sin ninguna petición correspondiente se etiquetan según reglas: background:<id> solo para hosts del catálogo de tráfico de fondo; before_attach para túneles abiertos antes de que el ayudante se conectara; preconnect_idle para túneles que no fallaron y transportaron como máximo 3,072 bytes de carga útil de subida y 6,144 de bajada, lo típico de una conexión abierta por adelantado y nunca usada; y unattributed en los demás casos. Un host sin catalogar nunca se llama de fondo, y los grupos suman el total con CONNECT.
Los costes aparecen solo cuando indicas una tarifa: el total de bytes, con y sin CONNECT, dividido entre 10⁹ (o 2³⁰ con --gib) y multiplicado por tu tarifa, más lo mismo por 1,000 unidades y, cuando se conoce el éxito, por 1,000 unidades correctas. La etiqueta es estimated billable transfer (transferencia facturable estimada).
Estima con tu tarifa
Coste de transferencia estimado = bytes ÷ 1,000,000,000 × tu precio por GB. Para una comparación, resta los bytes de la segunda ejecución de los de la primera, usando la misma base de CONNECT y el mismo número de unidades correctas. El visor no tiene tarifa por defecto; introduce la de tu proveedor.
Ejemplo hipotético: una primera ejecución usa 200,000,000 bytes y una segunda usa 150,000,000 bytes para las mismas 100 cargas de página correctas. Con un precio supuesto de $4 por GB, sus costes de transferencia estimados son $0.80 y $0.60. La diferencia es de $0.20 por 100 cargas correctas, o $2 por 1,000 si el mismo resultado se repite. Son datos inventados para mostrar la fórmula, no un ahorro medido ni una oferta de un proveedor.
Comprueba los resultados de la extracción antes de considerar que menos bytes es una mejora. Usa la unidad (GB o GiB) y las reglas de facturación de tu proveedor, ten en cuenta los cargos mínimos y compara la estimación con el tiempo necesario para implementar y verificar un cambio.
Privacidad
Tu informe se procesa en tu navegador dentro de un marco aislado y nunca se sube; nada sobre él se envía a la analítica. Si aceptas la analítica opcional, esta página registra solo etiquetas fijas: que se abrió un informe desde un archivo, arrastrándolo o desde el ejemplo incluido, y si se pudo procesar; que se compararon dos ejecuciones; que se descargó una tarjeta para compartir; que se copió un comando de instalación; y que se usó el enlace a la página de inicio. Los nombres de host, los recuentos de bytes, los precios y los nombres de archivo nunca salen del marco.
Privacidad y analítica (en inglés)Trabajo previo
Scrapescope se apoya en trabajo existente sobre inspección de peticiones, estadísticas locales de tráfico de proxy y análisis del tráfico de fondo de Chromium. El README del proyecto reconoce esas fuentes y documenta el modelo de medición y sus límites.
Conviene saber
No. Usa un proxy HTTP compatible o el modo de dimensionamiento directo sin cuenta de proxy. Scrapescope no tiene proveedor ni tarifa por defecto. Este visor abre los archivos report.json que escribe la herramienta.
Sí. La página y la herramienta son gratuitas. El informe se procesa dentro de un marco aislado en tu navegador y nunca se sube. La analítica opcional, si la aceptas, recibe solo etiquetas fijas, nunca nombres de host, recuentos de bytes, precios ni nombres de archivo.
scrapescope cuenta cada byte en su socket hacia tu proveedor, TLS incluido. Un proveedor puede contar un subconjunto distinto: con o sin el intercambio CONNECT, en GB o GiB, con redondeos o mínimos, incluyendo o no las peticiones fallidas. Trata el informe como una medición en tu máquina, no como una factura.
Los clientes configurados para enviar sus peticiones HTTP o HTTPS a través de Scrapescope obtienen totales por host. Las peticiones que esquivan el medidor no se cuentan. La atribución por recurso necesita el ayudante de Playwright para Python o los hooks de Requests/HTTPX. Los navegadores alojados no están cubiertos porque su tráfico no pasa por tu medidor local.
La tarjeta para compartir se genera en tu dispositivo y tú decides si la descargas. La propia herramienta deja las cadenas de consulta fuera de los informes y puede sustituir los hosts por identificadores del catálogo o hashes con clave (--redact-hosts). Revisa un informe antes de compartirlo; son tus datos.
No. La hipótesis es un modelo de tu ejecución medida. Bloquear puede cambiar el comportamiento de una página, romper la extracción o atraer el escrutinio anti-bot, y una página que carga más en una segunda visita puede mover las cifras en sentido contrario. La medición es la segunda ejecución, la comparada; la hipótesis es una predicción.
Tu próxima conexión
Scrapescope se puede usar gratis con un proxy compatible o en modo de dimensionamiento directo. El acceso a los proxies de ipvolt es independiente; consulta la información actual del servicio si además necesitas un proveedor.
Proxy Toolkit MCP
Genera configuraciones de proxy, diagnostica errores de conexión y encuentra la guía adecuada.
Gratis · código abierto · funciona con cualquier proveedor
Abrir MCP Toolkit (EN)