Plataforma / Todos los tipos de transporte de datos

Cada patrón de transporte de datos. Una plataforma.

Los datos se mueven de distintas formas por distintas razones. Dataddo admite todo el espectro de paradigmas de transporte de datos, para que nunca necesites una herramienta aparte solo porque cambió el patrón de entrega.

Cada patrón, una plataforma

Latencia de microsegundos o lotes programados, gestionados de forma nativa

Cada patrón que se muestra a continuación se configura, programa y gobierna en la misma plataforma. Aquí tienes un conector representativo, cómo se configura y dónde suelen usarlo los equipos.

ETL y ELT

Extracción-transformación-carga clásica, o carga primero con transformación dentro del almacén de datos.

Características clave
  • Se ejecuta de forma programada, desde minutos hasta a diario, para el clásico extract-transform-load por lotes o el ELT que carga primero.
  • Extrae tablas estructuradas y objetos de API, y puede añadir las columnas de metadatos dataddo_hash y de marca de tiempo de extracción para upserts limpios e histórico.
  • Admite los modos de escritura append, replace y upsert, para que controles exactamente cómo llegan los registros al destino.
  • Te permite seleccionar solo las columnas que necesitas o aplicar hash a las sensibles, manteniendo la PII fuera del destino.
  • Puede ejecutar una resincronización completa de datos en cualquier momento ampliando la ventana de fechas para recuperar registros históricos.
Caso de uso representativo

Centralizar datos SaaS para BI

Un equipo de ingresos lleva Salesforce, GA4 y HubSpot a Snowflake o BigQuery de forma programada y luego los modela para cuadros de mando - un pipeline gobernado por fuente en lugar de frágiles exportaciones manuales.

Change Data Capture (CDC)

Replicación en tiempo real y de baja latencia que rastrea los cambios a nivel de fila a medida que ocurren.

Características clave
  • Replica los cambios casi en tiempo real con CDC basado en registros, leyendo los cambios confirmados directamente del registro de transacciones de la base de datos.
  • Captura inserciones, actualizaciones y bajas - el único patrón que refleja las eliminaciones - con muy poca carga sobre el origen.
  • Escribe con los modos append, replace o upsert y puede añadir las columnas de metadatos dataddo_hash y de marca de tiempo de extracción.
  • Admite una resincronización inicial completa que puede dividirse en varias ejecuciones programadas para tablas muy grandes.
Caso de uso representativo

Mantener el almacén de datos sincronizado con producción

Un equipo de operaciones replica una base de datos PostgreSQL de producción en el almacén de datos casi en tiempo real, de modo que los informes operativos reflejan inserciones, actualizaciones y bajas en minutos en lugar de en un lote nocturno.

Streaming de datos

Pipelines continuos y basados en eventos para cargas de trabajo sensibles al tiempo y listas para IA.

Características clave
  • Ingiere datos de forma continua desde fuentes de eventos como topics de Kafka y webhooks entrantes, en lugar de con una programación fija.
  • Se ejecuta a través de los mismos flujos gobernados que los datos por lotes, de modo que el esquema, el acceso y el linaje se gestionan de forma idéntica.
  • Deposita el stream directamente en almacenes de datos, almacenes de contexto de IA o aplicaciones posteriores para cargas de trabajo sensibles al tiempo.
  • Admite los modos de escritura append y upsert y puede resincronizar el conjunto de datos completo cuando lo necesites.
Caso de uso representativo

Mantener actualizados el contexto de IA y la analítica

Los eventos de producto se transmiten de forma continua a un almacén de datos y a un almacén RAG/vectorial, de modo que los cuadros de mando y los agentes de IA actúan sobre datos de hace segundos y no de horas.

Reverse ETL

Activa tus datos: envía registros curados y gobernados desde tus agentes de IA o tu almacén de datos de vuelta a los CRM, sistemas operativos y las aplicaciones de vanguardia donde tus equipos actúan sobre ellos.

Características clave
  • Envía datos curados desde tu almacén de datos u origen de vuelta a aplicaciones de negocio como CRM, plataformas publicitarias y sistemas operativos.
  • Asigna las columnas de origen a los campos de destino y admite los modos de escritura append, replace y upsert.
  • Basa los upserts en dataddo_hash, de modo que los registros existentes se actualizan en su sitio en lugar de duplicarse.
  • Se ejecuta de forma programada para mantener al día puntuaciones, segmentos y atributos generados por IA, y puede resincronizar el conjunto de datos completo cuando se solicite.
Caso de uso representativo

Activar puntuaciones y segmentos en el CRM

Un equipo de growth sincroniza leads puntuados por modelos y segmentos calculados desde el almacén de datos de vuelta a Salesforce y HubSpot, de modo que los comerciales ven los datos de propensión y ciclo de vida más recientes sin salir del CRM.

Entrega de archivos por lotes

Entrega estructurada de conjuntos de datos mediante archivos a S3, SFTP o cualquier destino de almacenamiento.

Características clave
  • Entrega y lee archivos estructurados en CSV, JSON, XML o Parquet, sin comprimir o comprimidos con GZIP.
  • Sigue automáticamente nombres de archivo con marca de fecha mediante marcadores de fecha dinámicos, con una programación de minutos a diaria.
  • Da forma o enmascara los datos antes de la entrega con un paso de transformación editable y compatible con jq, útil para eliminar o transformar PII.
  • Usa el modo de escritura replace para reflejar un archivo en su sitio o append para construir histórico, y admite una resincronización completa.
Caso de uso representativo

Intercambio de datos con socios y proveedores

Un equipo de datos deja exportaciones diarias con marca de fecha en un bucket de S3 o un servidor SFTP para los socios, e ingiere archivos entrantes de proveedores de la misma forma - programado, gobernado e independiente del formato.

Copia cero con Apache Arrow

Intercambio de datos en memoria de alto rendimiento sin sobrecarga de serialización, creado específicamente para pipelines de IA y analítica.

Conectores representativos
Jupyter NotebooksPython / pandas
Ver los 400+ conectores
Características clave
  • Comparte datos en memoria usando el formato columnar de Apache Arrow, evitando la sobrecarga de serialización de la transferencia fila a fila.
  • Creado específicamente para pipelines de IA y analítica donde grandes conjuntos de datos se mueven entre pasos de procesamiento a velocidad de memoria.
  • Se lee directamente en Python, pandas o notebooks para ingeniería de features de ML y experimentación.
Caso de uso representativo

Pipelines de features de ML de alto rendimiento

Un equipo de ciencia de datos mueve grandes conjuntos de features entre pasos de procesamiento y hacia pandas sin ciclos repetidos de serialización/deserialización, reduciendo la latencia y la sobrecarga de memoria en cargas de trabajo de IA y analítica.

Encuentra el patrón de transporte adecuado

¿No sabes qué patrón de movimiento encaja con tu caso de uso? Habla con uno de nuestros ingenieros de soluciones.