Con BigQuery ML en el #DataEngineeringZoomcamp de #DataTalksClub aprendimos a crear, entrenar y ejecutar modelos directamente en el Data Warehouse.
No tuvimos que mover terabytes de datos a Python.
Podemos entrenar un modelo con CREATE MODEL y predecir con ML.PREDICT.
Con BigQuery ML en el #DataEngineeringZoomcamp de #DataTalksClub aprendimos a crear, entrenar y ejecutar modelos directamente en el Data Warehouse.
No tuvimos que mover terabytes de datos a Python.
Podemos entrenar un modelo con CREATE MODEL y predecir con ML.PREDICT.
Bridging legal logic with large-scale batch processing.
🔹 PySpark & DataFrames
🔹 Parquet optimization
🔹 AWS EC2 deployment
🔹 Spark UI monitoring (4040)
Solution: github.com/CodingJhames...
Course: github.com/DataTalksClu...
Bridging legal logic with large-scale batch processing.
🔹 PySpark & DataFrames
🔹 Parquet optimization
🔹 AWS EC2 deployment
🔹 Spark UI monitoring (4040)
Solution: github.com/CodingJhames...
Course: github.com/DataTalksClu...
Usamos Redpanda en lugar de Kafka. Al estar escrito en C++ levanta súper rápido en Docker y no necesita ZooKeeper. Muy buena alternativa más ligera para desarrollo local.
#DataEngineeringZoomcamp
Usamos Redpanda en lugar de Kafka. Al estar escrito en C++ levanta súper rápido en Docker y no necesita ZooKeeper. Muy buena alternativa más ligera para desarrollo local.
#DataEngineeringZoomcamp
¡Módulo 6 del #dezoomcamp terminado!
Procesar datos por lotes con Apache Spark me voló la cabeza.
De raw data a Parquet particionado, optimizando recursos locales.
#DataEngineeringZoomcamp
¡Módulo 6 del #dezoomcamp terminado!
Procesar datos por lotes con Apache Spark me voló la cabeza.
De raw data a Parquet particionado, optimizando recursos locales.
#DataEngineeringZoomcamp
Hoy exploré la Web UI de Spark (por defecto en el localhost:4040) para monitorear Jobs, Stages y Tasks.
Entender el DAG es clave para optimizar.
#dezoomcamp #DataEngineeringZoomcamp
Hoy exploré la Web UI de Spark (por defecto en el localhost:4040) para monitorear Jobs, Stages y Tasks.
Entender el DAG es clave para optimizar.
#dezoomcamp #DataEngineeringZoomcamp
Una de las cosas que más me gustan de Spark es su flexibilidad. Hoy resolví queries usando tanto la DataFrame API (F.to_date) como vistas temporales con Spark SQL.
#dezoomcamp #DataEngineeringZoomcamp
Una de las cosas que más me gustan de Spark es su flexibilidad. Hoy resolví queries usando tanto la DataFrame API (F.to_date) como vistas temporales con Spark SQL.
#dezoomcamp #DataEngineeringZoomcamp
El setup de Spark 4.x en local es mil veces más fácil ahora. Cero peleas con SPARK_HOME, todo gestionado rapidísimo con uv y Python.
#DataEngineeringZoomcamp
El setup de Spark 4.x en local es mil veces más fácil ahora. Cero peleas con SPARK_HOME, todo gestionado rapidísimo con uv y Python.
#DataEngineeringZoomcamp
#DataEngineeringZoomcamp
#DataEngineeringZoomcamp
#DataEngineeringZoomcamp
#DataEngineeringZoomcamp
#DataEngineeringZoomcamp
#DataEngineeringZoomcamp
Podemos validar automáticamente:
🔹 Unicidad (unique)
🔹 Valores no nulos (not_null)
🔹 Integridad referencial (relationships)
🔹 Reglas de negocio custom (singular tests)
Si el test falla, el pipeline se detiene.
#dezoomcamp #DataEngineeringZoomcamp
Podemos validar automáticamente:
🔹 Unicidad (unique)
🔹 Valores no nulos (not_null)
🔹 Integridad referencial (relationships)
🔹 Reglas de negocio custom (singular tests)
Si el test falla, el pipeline se detiene.
#dezoomcamp #DataEngineeringZoomcamp
Es el eslabón perdido entre la ingeniería de datos y el análisis.
Con dbt (Data Build Tool), dejamos de escribir queries sueltas y aplicamos prácticas de ingeniería de software al SQL: control de versiones, testing automatizado y CI/CD.
#dezoomcamp #DataEngineeringZoomcamp
Es el eslabón perdido entre la ingeniería de datos y el análisis.
Con dbt (Data Build Tool), dejamos de escribir queries sueltas y aplicamos prácticas de ingeniería de software al SQL: control de versiones, testing automatizado y CI/CD.
#dezoomcamp #DataEngineeringZoomcamp
Concepto técnico detrás del ahorro de costos
Si particionamos por fecha y hacemos WHERE fecha = 'hoy', BigQuery ignora físicamente todos los archivos de ayer y mañana.
Pasamos de escanear 1TB a 100MB en una sola línea de código.
#dezoomcamp #DataEngineeringZoomcamp
Concepto técnico detrás del ahorro de costos
Si particionamos por fecha y hacemos WHERE fecha = 'hoy', BigQuery ignora físicamente todos los archivos de ayer y mañana.
Pasamos de escanear 1TB a 100MB en una sola línea de código.
#dezoomcamp #DataEngineeringZoomcamp
Al ser una base de datos columnar, leer todas las columnas dispara los costos innecesariamente
✅ Selecciona solo las columnas que necesitas
✅ Filtra siempre primero por tu columna particionada
Tu presupuesto te lo agradecerá
#dezoomcamp #DataEngineeringZoomcamp
Al ser una base de datos columnar, leer todas las columnas dispara los costos innecesariamente
✅ Selecciona solo las columnas que necesitas
✅ Filtra siempre primero por tu columna particionada
Tu presupuesto te lo agradecerá
#dezoomcamp #DataEngineeringZoomcamp