#DataEngineeringZoomcamp
March 10, 2026 at 10:20 PM
¿Machine Learning en SQL?

Con BigQuery ML en el #DataEngineeringZoomcamp de #DataTalksClub aprendimos a crear, entrenar y ejecutar modelos directamente en el Data Warehouse.

No tuvimos que mover terabytes de datos a Python.

Podemos entrenar un modelo con CREATE MODEL y predecir con ML.PREDICT.
February 9, 2026 at 7:52 PM
Week 6 Spark Module of #DataEngineeringZoomcamp completed! 🛠️

Bridging legal logic with large-scale batch processing.
🔹 PySpark & DataFrames
🔹 Parquet optimization
🔹 AWS EC2 deployment
🔹 Spark UI monitoring (4040)

Solution: github.com/CodingJhames...

Course: github.com/DataTalksClu...
GitHub - DataTalksClub/data-engineering-zoomcamp: Data Engineering Zoomcamp is a free 9-week course on building production-ready data pipelines. The next cohort starts in January 2026. Join the course...
Data Engineering Zoomcamp is a free 9-week course on building production-ready data pipelines. The next cohort starts in January 2026. Join the course here 👇🏼 - DataTalksClub/data-engineering-zoomcamp
github.com
March 5, 2026 at 1:33 PM
Mi "sensor virtual" ya está vivo. Escribí un productor en Python que simula las lecturas del SCADA de la planta solar y las inyecta a la red. Ver los primeros mensajes JSON fluyendo en la consola es bastante satisfactorio. #dezoomcamp #DataEngineeringZoomcamp
April 20, 2026 at 11:51 PM
Arrancando el proyecto final del #dezoomcamp. Como ingeniero mecatrónico quería algo que uniera hardware y datos. Voy a hacer un gemelo digital de una planta fotovoltaica en España para automatizar trading algorítmico en tiempo real. Deséenme suerte. #DataEngineeringZoomcamp
April 20, 2026 at 11:44 PM
April 13, 2026 at 2:25 AM
April 4, 2026 at 2:38 AM
March 25, 2026 at 11:13 PM
Esta semana concluimos el módulo 7 de streaming en el #dezoomcamp.

Usamos Redpanda en lugar de Kafka. Al estar escrito en C++ levanta súper rápido en Docker y no necesita ZooKeeper. Muy buena alternativa más ligera para desarrollo local.

#DataEngineeringZoomcamp
March 19, 2026 at 7:45 PM
Cierre del módulo

¡Módulo 6 del #dezoomcamp terminado!

Procesar datos por lotes con Apache Spark me voló la cabeza.

De raw data a Parquet particionado, optimizando recursos locales.

#DataEngineeringZoomcamp
March 9, 2026 at 7:59 PM
Monitoreo con la Web UI

Hoy exploré la Web UI de Spark (por defecto en el localhost:4040) para monitorear Jobs, Stages y Tasks.

Entender el DAG es clave para optimizar.

#dezoomcamp #DataEngineeringZoomcamp
March 9, 2026 at 7:55 PM
Flexibilidad (API vs SQL)

Una de las cosas que más me gustan de Spark es su flexibilidad. Hoy resolví queries usando tanto la DataFrame API (F.to_date) como vistas temporales con Spark SQL.

#dezoomcamp #DataEngineeringZoomcamp
March 9, 2026 at 7:53 PM
Arrancando el módulo 6 de Batch Processing del #dezoomcamp.

El setup de Spark 4.x en local es mil veces más fácil ahora. Cero peleas con SPARK_HOME, todo gestionado rapidísimo con uv y Python.

#DataEngineeringZoomcamp
March 9, 2026 at 7:44 PM
El workshop del #dezoomcamp no solo fue extracción. Vimos cómo usar dlt con cuadernos reactivos como Marimo y la librería Ibis para crear dashboards interactivos sin escribir SQL pesado. De la API al reporte dinámico en tiempo récord.

#DataEngineeringZoomcamp
March 2, 2026 at 11:20 PM
¿JSON anidados? No hay problema. En el workshop de dlt del #dezoomcamp vimos cómo hace el "shredding" automático, aplanando los datos complejos en tablas relacionales listas para DuckDB. Magia pura para mantener la integridad de los datos.

#DataEngineeringZoomcamp
March 2, 2026 at 11:14 PM
En el workshop del #dezoomcamp aprendí a usar dlt para ingestar datos desde APIs REST hacia DuckDB. Lo más increíble fue usar asistentes de IA (Cursor + MCP) para estructurar la tubería en minutos. ¡La automatización de la ingesta de datos está en otro nivel!

#DataEngineeringZoomcamp
March 2, 2026 at 10:55 PM
El comando bruin lineage permite visualizar el DAG completo del proyecto. Al declarar explícitamente la propiedad depends en la configuración de cada asset, el orquestador resuelve y garantiza el orden secuencial estricto de ejecución. #dezoomcamp #DataEngineeringZoomcamp
February 28, 2026 at 11:42 PM
Para cargas incrementales idempotentes, Bruin implementa la estrategia time_interval. Al definir rangos temporales, el motor ejecuta un DELETE filtrado por la llave incremental antes del INSERT, previniendo duplicidad de registros. #dezoomcamp #DataEngineeringZoomcamp
February 28, 2026 at 11:37 PM
Módulo 5 del #DataEngineeringZoomcamp sobre plataformas de datos. Aprendiendo a usar Bruin, una herramienta end-to-end que unifica ingesta, transformación, orquestación, calidad de datos y linaje en un solo entorno de proyecto. #dezoomcamp #DataTalksClub
February 28, 2026 at 11:32 PM
February 28, 2026 at 11:19 PM
Calidad de datos (Testing) con dbt Tests.

Podemos validar automáticamente:

🔹 Unicidad (unique)
🔹 Valores no nulos (not_null)
🔹 Integridad referencial (relationships)
🔹 Reglas de negocio custom (singular tests)

Si el test falla, el pipeline se detiene.

#dezoomcamp #DataEngineeringZoomcamp
February 16, 2026 at 4:43 PM
Analytics Engineering

Es el eslabón perdido entre la ingeniería de datos y el análisis.

Con dbt (Data Build Tool), dejamos de escribir queries sueltas y aplicamos prácticas de ingeniería de software al SQL: control de versiones, testing automatizado y CI/CD.

#dezoomcamp #DataEngineeringZoomcamp
February 16, 2026 at 3:58 PM
February 16, 2026 at 3:14 PM
Podado de datos

Concepto técnico detrás del ahorro de costos

Si particionamos por fecha y hacemos WHERE fecha = 'hoy', BigQuery ignora físicamente todos los archivos de ayer y mañana.

Pasamos de escanear 1TB a 100MB en una sola línea de código.

#dezoomcamp #DataEngineeringZoomcamp
February 9, 2026 at 7:56 PM
¿Por que evitar usar el SELECT *?

Al ser una base de datos columnar, leer todas las columnas dispara los costos innecesariamente

✅ Selecciona solo las columnas que necesitas

✅ Filtra siempre primero por tu columna particionada

Tu presupuesto te lo agradecerá

#dezoomcamp #DataEngineeringZoomcamp
February 9, 2026 at 7:48 PM