De todos, 21
Amazon Web Services ofrece un ecosistema enorme, con +200 servicios, pero la realidad es simple: si entendés cómo funcionan estos 21 servicios clave, podés diseñar arquitecturas de datos completas en la nube: desde la ingestión y almacenamiento hasta la seguridad y la analítica.
¿Cuáles son? Estos de acá:
- AWS DataSync
- AWS Dabase Migration Service (DMS)
- Amazon AppFlow
- Amazon Kinesis
- Amazon S3
- Amazon RDS
- Amazon DynamoDB
- Amazon Redshift
- AWS Glue
- Amazon EMR
- AWS Lambda
- Amazon Athena
- Amazon QuickSight
- AWS Step Functions
- Amazon EventBridge
- Amazon SQS
- Amazon SNS
- Amazon CloudWatch
- AWS CloudTrail
- AWS IAM
- AWS Lake Formation
Tranqui. No los vamos a ver todos en este mismo post. Iremos cubriendo varios servicios en distintos artículos divididos bajo un criterio que creo es super importante tener claro si querés dedicarte a la Ingeniería de Datos.
Como suelo decir, no hay que dejarse llevar por el nombre del servicio o por si es tendencia en LinkedIn, sino que lo importante es:
- entender qué problema resuelve
- cómo encaja en tu arquitectura actual
- qué costos hay que tener presente
No te voy a vender humo: a fecha de publicación de este post, varios de estos 21 servicios aún no los utilicé. Asi que crear este artículo fue un ejercicio de bastante aprendizaje. Lo que te comparto en esta entrada y en las que vendrán es el resultado de dicho ejercicio, sumado a lo que he aprendido en producción con algunos de ellos.
Te dije que vamos a dividir los servicios usando un criterio en particular. Arranquemos con eso primero.
El Ciclo de Vida de la Ingeniería de Datos
Para comprender qué problema resuelve cada servicio que vamos a ver, hay que entender qué rol juega dentro del Ciclo de Vida de la Ingeniería de Datos (CVID).
Este ciclo se halla definido y explicado en detalle en el libro "Fundamentals of Data Engineering" de Joe Reis y Matt Housley. Si me lees hace tiempo habrás visto que lo menciono siempre que puedo, ya que considero que es la Biblia de la Ingeniería de Datos.
¿Qué es y cómo está compuesto? Por un lado, el CVID es un subconjunto del ciclo de vida de los datos. Así como el ciclo de vida de los datos incluye a los datos durante toda su vida útil, el CVID se concentra en las etapas que un Ingeniero de Datos controla y sobre las que puede tener influencia o al menos, debería tener una noción al respecto.
Estas etapas permiten convertir datos crudos en un producto final útil, listo para consumo por parte de analistas, científicos de datos, ingenieros de Machine Learning y otros.
¿Cuáles son dichas etapas?
- Generación
- Ingesta
- Almacenamiento
- Transformación
- Servicio

Es interesante notar que, además de las etapas del CVID, también hay una sección llamada Undercurrents, que puede ser traducido como "Corrientes principales". El Fundamentals indica que...
La Ingeniería de Datos ahora abarca mucho más que solamente herramientas y tecnología, incorporando prácticas empresariales tradicionales como data management (gestión de datos), optimización de costos y prácticas mas nuevas como DataOps. […] Hemos denominado a todas estas prácticas como corrientes principales, ya que apoyan cada aspecto del Ciclo de Vida de la Ingeniería de Datos.
En esta serie vamos a cubrir servicios relacionados a algunas prácticas muy importantes, como lo son:
- Orquestación
- Seguridad
- Gobernanza (parte de Data Management)
- Observabilidad y Monitoreo (parte de Data Ops)
Ahora, aunque estas etapas parezcan estar definidas e ilustradas en orden, la realidad que el CVID no siempre es un flujo continuo. Varias etapas del ciclo pueden llegar a repetirse, ocurrir fuera de orden, solaparse o entrelazarse de maneras interesantes e inesperadas.
Por supuesto, esto es tan solo una introducción. En cada post de esta serie vamos a ahondar un poco en cada etapa o undercurrent asociado a los servicios que vamos a ver.
Ya a futuro abarcaremos este ciclo con más profundidad, incluyendo descripciones más detalladas, preguntas clave, y ejemplos, basándonos por supuesto en el Fundamentals.
Arranquemos con los servicios de AWS que nos permiten cubrir la Ingestión. Para que te puedas llevar info práctica y aplicable, vamos a responder estas preguntas para cada servicio:
- ¿Qué es?
- ¿Qué problema resuelve?
- ¿Con qué podemos integrarlo?

Ingestión
Esta es la etapa donde nos enfocamos en extraer datos desde un sistema fuente y que está estrechamente relacionada con la etapa de Generación. Vamos por partes.
La Generación involucra a los sistemas fuente, esos sistemas que producen los datos en crudo que necesitamos ingestar mediante nuestra pipeline. Ejemplos de sistemas fuente pueden incluir:
- una API
- un servidor SFTP con archivos como
txtoxls - una base de datos transaccional
- una aplicación
- discos externos ubicados en un servidor on-premises
- y un largo etc.
Ahora bien, la Ingestión es el proceso de consumir los datos desde el sistema fuente.
Extraer datos a veces puede ser algo tan sencillo como llamar a una API, recibir su respuesta como un JSON bien acomodadito y procesarla. O también puede ser tan engorroso como consultar una base de datos de producción usada por una aplicación, con esquemas que cambian con frecuencia y ojo, no sea cosa que el proceso de extracción que implementemos impacte en su rendimiento (spoiler: muy probablemente lo haga).
Es por esta y otras razones que ambas etapas pueden representar un cuello de botella en nuestra pipeline de datos, según nos indican en el Fundamentals.
¿Qué servicios de AWS nos ayudan en esta tarea? Tenemos varios. Lo ventajoso de todos ellos es que simplifican la carga operativa que podria representar el ingestar datos desde diversas fuentes.
1. AWS DataSync
- ¿Qué es?: Es un servicio de transferencia de datos en línea diseñado para simplificar, automatizar y acelerar la copia de grandes volúmenes de datos hacia y desde los servicios de almacenamiento de AWS a través de Internet o AWS Direct Connect.
- ¿Qué problema resuelve?: Permite mover datos (como registros históricos) desde sistemas on-premises hacia la nube de forma rentable y hasta 10 veces más rápida que las herramientas tradicionales. También facilita la migración o replicación de datos entre sistemas de archivos de AWS en diferentes regiones.
- Conceptos Clave:
- DataSync Agent: Utiliza un agente (máquina virtual) propiedad del usuario para leer o escribir datos desde los sistemas de almacenamiento.
- Comparación con Storage Gateway: Mientras que Storage Gateway es una solución de almacenamiento híbrido para acceso local a datos en la nube, DataSync se enfoca específicamente en la aceleración y automatización de la transferencia masiva de datos.
- ¿Con qué podemos integrarlo?: Amazon S3, Amazon EFS, Amazon FSx for Windows File Server, AWS KMS y AWS Snowcone.
2. AWS Database Migration Service (DMS)
- ¿Qué es?: Es un servicio administrado destinado a replicar y migrar cargas de trabajo analíticas y de bases de datos a la nube de AWS.
- ¿Qué problema resuelve?: Facilita una transición fluida de los recursos de bases de datos a la nube sin pérdida de datos críticos, garantizando la integridad de la información y un tiempo de inactividad mínimo o nulo durante el proceso.
- Conceptos Clave:
- Migraciones Homogéneas y Heterogéneas: Soporta migraciones entre motores de base de datos iguales o diferentes.
- Replicación Continua: Permite la replicación de datos de forma continua y con latencia mínima.
- DMS Fleet Advisor: Característica gratuita y bastante útil. Nos permite construir un inventario y evalúa automáticamente las flotas de bases de datos on-premises para planificar la migración a escala.
- ¿Con qué podemos integrarlo?: Soporta una amplia gama de bases de datos y data warehouses como fuentes y destinos.
3. Amazon AppFlow
- ¿Qué es?: Es un servicio de integración totalmente administrado que simplifica el intercambio de datos entre aplicaciones SaaS basadas en la nube y servicios de AWS.
- ¿Qué problema resuelve?: Permite establecer flujos de datos bidireccionales de manera fluida entre aplicaciones populares y el ecosistema de AWS sin necesidad de escribir código ni gestionar infraestructura.
- Conceptos Clave:
- No-code: Facilita la conexión y el flujo de datos mediante una interfaz administrada, eliminando la complejidad técnica de la integración.
- ¿Con qué podemos integrarlo?: Aplicaciones SaaS (como Salesforce, SAP, Google Analytics, Zendesk y ServiceNow) y servicios de AWS (como Amazon Redshift, Amazon OpenSearch Service y Amazon S3).
4. Amazon Kinesis
- ¿Qué es?: Es una plataforma que permite transformar, procesar y analizar flujos de datos en tiempo real de forma mucho más rápida que esperando a recolectar todos los datos antes del procesamiento.
- ¿Qué problema resuelve?: Captura datos masivos (como clics en sitios web, telemetría de IoT o puntuaciones de juegos móviles) en tiempo real con una latencia de milisegundos, permitiendo respuestas inmediatas ante eventos.
- Conceptos Clave:
- Variantes del Servicio: Incluye Data Streams (recolección base), Data Firehose (carga a destinos), Managed Service for Apache Flink (análisis con SQL/Java) y Video Streams.
- Orden de los registros: Kinesis Data Streams garantiza que los registros se recolecten en el mismo orden en que fueron recibidos.
- Transformación en vuelo: Puede invocar funciones Lambda para transformar o limpiar los datos (por ejemplo, remover información sensible) antes de entregarlos al destino.
- ¿Con qué podemos integrarlo?: Lambda para procesamiento, Amazon DynamoDB para almacenamiento de resultados, Amazon S3 y Amazon Redshift Spectrum.
Conclusión
Llegamos al final de esta primera entrega. En este post sentamos las bases repasando el Ciclo de Vida de la Ingeniería de Datos (CVID) y exploramos los 4 servicios clave de AWS para resolver la etapa de Ingesta:
- AWS DataSync: para transferencias masivas y automatizadas desde sistemas on-premises o entre almacenes de AWS.
- AWS DMS: para migraciones y replicación continua de bases de datos con mínimo tiempo de inactividad.
- Amazon AppFlow: para integrar aplicaciones SaaS con la nube en un esquema no-code.
- Amazon Kinesis: para capturar y procesar flujos de datos masivos en tiempo real.
Como ves, la clave no es memorizar cada botoncito de la consola web de AWS, sino entender qué tipo de ingestión requiere tu arquitectura (batch vs. streaming, archivos masivos vs. datos SaaS, migraciones puntuales vs. replicación continua) y elegir la herramienta que resuelva el problema con la menor complejidad operativa posible. Ese es el poder de la nube.
¿Qué se viene en la Parte 2?
Una vez que los datos entran a nuestro ecosistema, necesitamos guardarlos adecuadamente y darles forma.
En el próximo post nos meteremos de lleno en las dos etapas siguientes del ciclo: Almacenamiento y Transformación.
Vamos a analizar servicios fundamentales como Amazon S3, Amazon RDS, Amazon DynamoDB, Amazon Redshift, AWS Glue, Amazon EMR y AWS Lambda, entendiendo cómo combinar almacenamiento estructurado y no estructurado con procesamiento serverless o administrado.
