Cloud

Amazon anticipa el fin de los ETL

Gracias a dos nuevas integraciones, AWS permite (¿por fin?) a los científicos de datos explotar los datos transaccionales de Amazon Redshift con sus servicios de análisis, big data y ML sin pasar por los procesos ETL tradicionales o conectores de terceros mal optimizados para sus infraestructuras en la nube.

En el mundo de las bases de datos, el análisis de datos de múltiples fuentes frecuentemente resulta en mover y ajustar datos a través de procesos ETL (Extracción, Transformación, Carga). Pero los volúmenes de datos se han vuelto tales que todos los actores del mercado ahora están tratando de limitar estos viajes para favorecer enfoques de acceso directo y sin ETL.

Amazon es parte de este movimiento. Para Adam Selipsky, CEO de AWS, ETL se ha convertido en la ruina de todos los científicos de datos. Una opinión compartida por Swami Sivasubramanian, vicepresidente de bases de datos, análisis y aprendizaje automático de AWS, quien cree que un futuro sin ETL es un acelerador para analizar datos y crear nuevos conocimientos. Él explica que » la escala y la complejidad de los datos que los clientes manejan hoy significa que no pueden analizarlos y explorarlos con una sola tecnología o incluso con un pequeño conjunto de herramientas. Muchos de nuestros clientes confían en múltiples servicios de análisis y bases de datos de AWS para extraer valor de sus datos… Las nuevas características anunciadas hoy nos ayudan a llevar a los clientes hacia un futuro sin ETL en AWS, lo que reduce la necesidad de mover o transformar manualmente los datos entre servicios”.

Más concretamente, este enfoque «Zero ETL» ya se está materializando con dos nuevos servicios de AWS.

Integración de ETL cero de Amazon Aurora con Amazon Redshift

Según AWS, la integración Zero ETL de Amazon Aurora con Amazon Redshift permitirá a las empresas analizar petabytes de datos transaccionales casi en tiempo real y eliminar la necesidad de personalizar las canalizaciones de datos. Más concretamente, gracias a esta integración, los datos transaccionales se replican de forma automática y continua segundos después de que se escriben en Amazon Aurora y se ponen a disposición de forma transparente en Amazon Redshift. Luego, los clientes pueden lanzar inmediatamente sus análisis y aprovechar las funciones avanzadas de AWS, como Amazon Redshift ML, para obtener información holística y predictiva.
En otras palabras, una integración de este tipo permite a las empresas combinar Amazon Aurora y Amazon Redshift, el primero para satisfacer sus necesidades de bases de datos transaccionales y el segundo para potenciar sus análisis, sin tener que crear ni mantener canalizaciones de datos. datos complejos

Integración de Amazon Redshift para Apache Spark

La integración de Redshift con Apache Spark sigue la misma lógica que la anterior. Hace que sea más fácil y rápido para los clientes ejecutar aplicaciones Apache Spark en datos de Amazon Redshift utilizando los servicios de análisis y aprendizaje automático de AWS.
Apache Spark es un marco de datos de código abierto muy popular entre los desarrolladores y en el universo ML. AWS ha desarrollado un tiempo de ejecución especialmente optimizado para sus infraestructuras y tiene la reputación de ser 3 veces más eficiente que la edición clásica de código abierto. En particular, está disponible en Amazon EMR, AWS Glue y Amazon SageMaker. El anuncio de hoy responde a la creciente necesidad de los usuarios de analizar directamente los datos de RedShift con estos servicios y elimina la necesidad de conectores de terceros mientras aprovecha una solución específicamente optimizada para AWS. Según el hiperescalador, “ los desarrolladores ahora pueden comenzar a consultar datos de Amazon Redshift desde aplicaciones basadas en Apache Spark en segundos utilizando marcos de lenguaje populares (por ejemplo, Java, Python, R y Scala) . Las ubicaciones de almacenamiento de datos intermedios se administran automáticamente, lo que elimina la necesidad de que los clientes las configuren y administren en el código de la aplicación”.

Tenga en cuenta que estos sólidos enfoques de integración para limitar los requisitos de ETL no son exclusivos de AWS. También encontramos esfuerzos similares en Snowflake, pero también en Google Cloud y Azure, como se explica aquí: Data Cloud: Google y Microsoft en la misma trayectoria.

Lea también:

AWS RE:INVENT 2022: un nuevo Graviton para HPC en la nube

Nube de datos: Google y Microsoft en la misma trayectoria

Google Cloud Next: Más IA para más productividad

SAS amplía las ofertas de nube de datos verticales para VOD, salud y energía

[

Related posts
Cloud

¡Cloud First se vuelve más selectivo!

¿Qué hubiera pasado si “Cloud First” hubiera llegado a su fin? Si bien casi una cuarta parte…
Read more
Cloud

Azure Logic Apps Automation quiere alinear a los agentes de IA

Con Azure Logic Apps Automation, Microsoft quiere convertir la automatización empresarial en un…
Read more
Cloud

Tsuga confía en BYOC para reinventar la observabilidad

En un momento en el que los volúmenes de registros, métricas y rastreos se están disparando, la…
Read more

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *