Apache Spark

Plataforma de análisis de datos de forma distribuida

Nº Q7573619 ★★

Poco común · Literatura

Apache Spark

Plataforma de análisis de datos de forma distribuida

Apache Spark es un framework de computación (entorno de trabajo) en clúster open-source. Fue desarrollada originariamente en la Universidad de California, en el AMPLab de Berkeley. El código base del proyecto Spark fue donado más tarde a la Apache Software Foundation que se encarga de su mantenimiento desde entonces.

Último precio

—

Precio mínimo

—

Mediana 7 d

—

Ventas 30 d

0

Rango 30 d

—

En circulación

0

Cotización

Ver tabla
Fechamediana MínMáxventas

Historial de ventas

Última venta
—
Media 30 d
—
Mínimo 30 d
—
Máximo 30 d
—
Ventas 7 d
0
Ventas 30 d
0

Aún no hay ventas.

Ventas anónimas: sin comprador ni vendedor. Las cifras solo cuentan ventas entre jugadores.

En Wikipedia

Apache Spark es un framework de computación (entorno de trabajo) en clúster open-source. Fue desarrollada originariamente en la Universidad de California, en el AMPLab de Berkeley. El código base del proyecto Spark fue donado más tarde a la Apache Software Foundation que se encarga de su mantenimiento desde entonces. Spark proporciona una interfaz para la programación de clusters completos con Paralelismo de Datos implícito y tolerancia a fallos. Apache Spark se puede considerar un sistema de computación en clúster de propósito general y orientado a la velocidad. Proporciona APIs en Java, Scala, Python y R. También proporciona un motor optimizado que soporta la ejecución de gráficos en general. También soporta un conjunto extenso y rico de herramientas de alto nivel entre las que se incluyen Spark SQL (para el procesamiento de datos estructurados basada en SQL), MLlib para implementar machine learning, GraphX para el procesamiento de graficos y Spark Streaming. Apache Spark a día de hoy se ha podido consolidar como uno de los frameworks que es más utilizado en los entornos de la computación distribuida y masiva y en el Big Data (Macrodatos). Que a diferencia del modelo mas tradicional del Hadoop (MapReduce), que realiza el procesamiento por los lotes escribiendo los diferentes resultados intermedios en el disco, lo que hace Spark es que utiliza el procesamiento en la memoria (mediante los RDDs y más posteriormente los DataFrames/Datasets), esto lo que hace es que le permite ser hasta 100 veces más rápido en muchas más cargas de trabajo dado. Esto lo hace mucho más especialmente adecuado para las aplicaciones necesarias que requieran de múltiples iteraciones sobre los datos que se tengan (como lo son los algoritmos de machine learning por ejemplo) o en el procesamiento en tiempo casi real dentro de clústeres distribuidos a una gran escala.​

Texto: Wikipédia, CC BY-SA 4.0. · Imagen: Yanncha (CC BY-SA 4.0) ·

Cartas cercanas

Confirmación