
PySpark Práctico: Apache Spark para Ingenieros de Datos
udemy · ⭐ 4.62 (44 reseñas) · Principiante · es · ⏱ 2,5 h
Impartido por Oscar Fernandez - AprenderBigData.com · 274 alumnos
19.99 USD
Entra en tu cuenta para guardar este curso y volver a él cuando quieras.
Comparar este cursoEnlace de afiliado: podemos cobrar comisión, sin coste extra para ti. Más información
Descripción
¡Bienvenido a PySpark Práctico: Apache Spark para Ingenieros de Datos! Este curso intensivo está pensado para que consigas resultados reales desde la primera lección: montarás un pipeline ETL, entenderás la API de DataFrames y optimizarás jobs. Ideal si quieres pasar de experimentar en pandas a procesar datos a escala con Spark. ¿Qué incluye? • Vídeos cortos y directos (5–10 min) para estudiar en bloques. • Ejemplos listos para ejecutar en Databricks o local. • Ejercicios de codificación prácticos por módulo. • Tests para autoevaluarte. • Proyectos entregables para tu portafolio. ¿Funcionará para mí? Sí, si sabes Python básico y SQL. El curso está pensado para llevarte paso a paso desde ejemplos sencillos hasta un mini-proyecto real. Muchas personas que venían de pandas o análisis han conseguido aplicar estos conocimientos en proyectos reales. ¿Necesito un clúster de Spark para trabajar? No: se puede practicar en local o Databricks Community; para producción verás recomendaciones de despliegue y jobs. ¿Incluye datasets? Sí: datasets de ejemplo y notebooks descargables. Muchos alumnos comienzan sin experiencia en Spark (venían de pandas o SQL). El objetivo es el mismo que tuvieron ellos: aprender a producir resultados. Este curso te guía con pequeñas victorias. Aprender Spark implica entender distribución, particionado y cambiar mentalidad respecto a otras tecnologías como Pandas. Yo también tuve que hacer esa transición y cometí errores; por eso incluyo anti-patrones y debugging práctico (que te ahorrará semanas).
Lo que aprenderás
- Levantar un entorno PySpark en local o Databricks y ejecutar notebooks.
- Leer, transformar y escribir datos usando DataFrames y Parquet.
- Diseñar y ejecutar pipelines ETL sencillos
- Interpretar planes de ejecución y aplicar estrategias básicas de optimización (particiones, broadcast, cache).
Requisitos
- Conocimientos básicos de Python (sintaxis, funciones).
- Conocimientos básicos de SQL (SELECT, group by).
- Python instalado; para local: Java (JDK 8/11) o usar Databricks Community (alternativa).
- No es necesario experiencia previa en Spark; el curso parte de lo básico y va a casos reales.