Apache Spark es un motor de análisis unificado para el procesamiento de datos a gran escala. Ofrece API de alto nivel en Scala, Java, Python y R, y un motor optimizado que admite gráficos de cálculo general para el análisis de datos. También es compatible con un amplio conjunto de herramientas de alto nivel, como Spark SQL para SQL y DataFrames, la API de Pandas en Spark para cargas de trabajo de Pandas, MLlib para aprendizaje automático, GraphX para procesamiento de gráficos y Structured Streaming para procesamiento de flujos. Lo puedes usar en Java, Python, Scala y R. Nosotros lo usaremos con Python. Descargamos Apache Spark: https://www.apache.org/dyn/closer.lua/spark/spark-4.0.0/spark-4.0.0-bin-hadoop3.tgz Lo descomprimimos en: Configuramos la variable de entorno `` SPARK_HOME ```: Nombre de la variable: SPARK_HOME Valor de la variable: C:\Spark\spark-4.0.0-bin-hadoop3 La agregamos al Path: %SPARK_HOME%\bin Podrías agregar otra instalación: https:...
Programación en diversos lenguajes y tecnologías.