For the complete documentation index, see llms.txt. This page is also available as Markdown.

Almacenamiento en la nube

Recupera tus resultados extraídos directamente en tu almacenamiento S3, GCS, OSS u otro compatible con S3.

Los resultados del trabajo de Scraper API se almacenan en nuestro almacenamiento. Puede obtener sus resultados desde nuestro almacenamiento mediante GETobteniendo el /results endpoint.

Como alternativa, podemos subir los resultados a su almacenamiento en la nube. De esta manera, no tiene que hacer solicitudes extra para obtener los resultados: todo va directamente a su contenedor de almacenamiento.

La integración con almacenamiento en la nube funciona solo con Push-Pull método de integración.

Actualmente, admitimos estos servicios de almacenamiento en la nube:

Si desea usar otro tipo de almacenamiento, póngase en contacto con su gestor de cuenta para hablar sobre el plazo de entrega de la funcionalidad.

La ruta de carga se ve así: YOUR_BUCKET_NAME/job_ID.json. Encontrará el ID del trabajo en la respuesta que recibe de nosotros después de enviar un trabajo.

Entrada

Parámetro
Descripción
Valores válidos

storage_type

Su tipo de almacenamiento en la nube.

gcs (Google Cloud Storage);

s3 (AWS S3); tos (BytePlus TOS);

s3_compatible (cualquier almacenamiento compatible con S3).

storage_url

El nombre del contenedor / URL de su almacenamiento en la nube.

  • Cualquiera s3 , gcs , o tos nombre del contenedor;

  • Cualquiera compatible con S3 URL de almacenamiento.

Google Cloud Storage

La carga útil siguiente hace que Web Scraper API rastree https://example.com y ponga el resultado en un contenedor de Google Cloud Storage.

Para que los resultados de su trabajo se suban a su contenedor de Google Cloud Storage, configure permisos especiales para nuestro servicio como se muestra a continuación:

1

Cree un rol personalizado

2

Añada storage.objects.create permiso

3

Asígnelo a Oxylabs

En el Nuevos miembros campo, introduzca lo siguiente correo electrónico de la cuenta de servicio de Oxylabs:

Amazon S3

La carga útil siguiente hace que Web Scraper API rastree https://example.com y ponga el resultado en un contenedor de Amazon S3.

Para que los resultados de su trabajo se suban a su contenedor de Amazon S3, configure permisos de acceso para nuestro servicio. Para hacerlo, vaya a https://s3.console.aws.amazon.com/S3AlmacenamientoNombre del contenedor ``(si no tiene uno, cree uno nuevo)PermisosPolítica del contenedor.

Puede encontrar la política del contenedor adjunta abajo o en el área de ejemplo de código.

política del contenedor s3

No olvide cambiar el nombre del contenedor en YOUR_BUCKET_NAME. Esta política nos permite escribir en su contenedor, darle acceso a los archivos subidos y conocer la ubicación del contenedor.

Alibaba Cloud OSS

La carga útil siguiente hace que Web Scraper API rastree https://example.com y ponga el resultado en un contenedor de Alibaba Cloud OSS.

Formación de la URL de almacenamiento

Formato de la URL de almacenamiento:

Aquí encontrará el BUCKET_NAME y oss-REGION de su contenedor:

Creación de la clave de acceso y el secreto

Para usar la interfaz compatible con S3 con Alibaba OSS, debe crear ACCESS_KEY_ID y ACCESS_KEY_SECRET como se muestra a continuación. Para obtener más información, consulte Cómo usar los SDK de Amazon S3 para acceder a OSS.

1

Vaya al menú de cuenta AccessKey

2

Inicie sesión en el RAM console

Acceda a RAM console utilizándolo con una cuenta de Alibaba Cloud o un usuario RAM User que tenga permisos administrativos.

3

Vaya a IdentidadesUsuarios en el panel de navegación izquierdo

4

Seleccione Crear usuario y use el RAM User AccessKey:

5

Conceda permisos al usuario RAM User

El usuario RAM User recién creado no tiene permisos. Debe conceder AliyunOSSFullAccess permisos al usuario RAM User. Entonces, el usuario RAM User podrá acceder a los recursos necesarios de Alibaba Cloud. Para obtener más información, consulte Conceder permisos a usuarios RAM User.

6

Obtenga su AccessKey ID y AccessKey Secret

Cuando se hayan concedido los permisos, vuelva a la Autenticación sección y, en la Access Key sección, seleccione Crear AccessKey. Elija crear una Access Key para un servicio de terceros. Entonces verá un ACCESS_KEY_ID y ACCESS_KEY_SECRET, que luego puede usar en sus solicitudes.

Límites de tasa de Alibaba OSS

Al realizar cargas concurrentes a Alibaba OSS, es posible alcanzar los límites de tasa de cuenta/contenedor, y las cargas comenzarán a agotar el tiempo de espera con el siguiente error:

En este caso, póngase en contacto con el soporte de Alibaba OSS para aumentar sus límites de tasa de OSS.

BytePlus TOS

Puede subir los resultados rastreados directamente a un contenedor de BytePlus Torch Object Storage (TOS).

Para una conexión exitosa, necesitará:

  • Un contenedor TOS correctamente configurado.

  • Su access key y secret key.

  • Un endpoint compatible con S3.

Puede encontrar una lista de todos los endpoints S3 disponibles en la documentación oficial de BytePlus documentación.

Ejemplo

La siguiente carga útil rastreará https://example.com y subirá los resultados a su contenedor TOS.

Parámetros

Parámetro
Valores disponibles
Descripción

storage_type

tos

Especifica BytePlus TOS como proveedor de almacenamiento.

storage_url

Cadena de URL

URL autenticada a su contenedor TOS (consulte el formato abajo).

Formato de la URL de almacenamiento

La storage_url debe construirse usando sus credenciales TOS y los detalles del contenedor.

Componente
Descripción

access_key

Su ID de access key de BytePlus.

secret_key

Su secret access key de BytePlus.

endpoint

El endpoint específico de la región (p. ej., tos-cn-hongkong.bytepluses.com).

bucket_name

Nombre del contenedor de destino.

path

(Opcional) Ruta específica de la carpeta del contenedor.

Nomenclatura del archivo de salida

Oxylabs genera automáticamente los nombres de archivo de los objetos subidos según los detalles del trabajo:

  • HTML/Contenido: {query_id}_{timestamp}.html

  • Datos analizados: {query_id}_results.json

Los archivos estarán disponibles en su contenedor en: tos://{bucket_name}/{path}/{filename}

Otro almacenamiento compatible con S3

Si desea que sus resultados se entreguen en una ubicación de almacenamiento compatible con S3, deberá incluir la ACCESS_KEY:SECRET cadena de autenticación en el storage_url valor de la carga útil:

Última actualización

¿Te fue útil?