gourses

← Volver a la búsqueda

PySpark Práctico: Apache Spark para Ingenieros de Datos

udemy · ⭐ 4.62 (44 reseñas) · Principiante · es · ⏱ 2,5 h

Impartido por Oscar Fernandez - AprenderBigData.com · 274 alumnos

19.99 USD

Entra en tu cuenta para guardar este curso y volver a él cuando quieras.

Comparar este curso
Ver curso en udemy

Enlace de afiliado: podemos cobrar comisión, sin coste extra para ti. Más información

Descripción

¡Bienvenido a PySpark Práctico: Apache Spark para Ingenieros de Datos! Este curso intensivo está pensado para que consigas resultados reales desde la primera lección: montarás un pipeline ETL, entenderás la API de DataFrames y optimizarás jobs. Ideal si quieres pasar de experimentar en pandas a procesar datos a escala con Spark. ¿Qué incluye? • Vídeos cortos y directos (5–10 min) para estudiar en bloques. • Ejemplos listos para ejecutar en Databricks o local. • Ejercicios de codificación prácticos por módulo. • Tests para autoevaluarte. • Proyectos entregables para tu portafolio. ¿Funcionará para mí? Sí, si sabes Python básico y SQL. El curso está pensado para llevarte paso a paso desde ejemplos sencillos hasta un mini-proyecto real. Muchas personas que venían de pandas o análisis han conseguido aplicar estos conocimientos en proyectos reales. ¿Necesito un clúster de Spark para trabajar? No: se puede practicar en local o Databricks Community; para producción verás recomendaciones de despliegue y jobs. ¿Incluye datasets? Sí: datasets de ejemplo y notebooks descargables. Muchos alumnos comienzan sin experiencia en Spark (venían de pandas o SQL). El objetivo es el mismo que tuvieron ellos: aprender a producir resultados. Este curso te guía con pequeñas victorias. Aprender Spark implica entender distribución, particionado y cambiar mentalidad respecto a otras tecnologías como Pandas. Yo también tuve que hacer esa transición y cometí errores; por eso incluyo anti-patrones y debugging práctico (que te ahorrará semanas).

Lo que aprenderás

  • Levantar un entorno PySpark en local o Databricks y ejecutar notebooks.
  • Leer, transformar y escribir datos usando DataFrames y Parquet.
  • Diseñar y ejecutar pipelines ETL sencillos
  • Interpretar planes de ejecución y aplicar estrategias básicas de optimización (particiones, broadcast, cache).

Requisitos

  • Conocimientos básicos de Python (sintaxis, funciones).
  • Conocimientos básicos de SQL (SELECT, group by).
  • Python instalado; para local: Java (JDK 8/11) o usar Databricks Community (alternativa).
  • No es necesario experiencia previa en Spark; el curso parte de lo básico y va a casos reales.