Utilizando MLLib en Scala/Java/Python con Spark
Utilizando MLLib en Scala
Los siguientes fragmentos de código pueden ser ejecutados en spark-shell.
Clasificación Binaria
El siguiente fragmento de código ilustra cómo cargar un conjunto de datos de ejemplo, ejecutar un algoritmo de entrenamiento en estos datos utilizando un método estático en el objeto del algoritmo, y realizar predicciones co ...
Publicado el 7-21 23:03
Creación y Eliminación de Tablas Kudu con Spark
Creación de Tablas Kudu mediante Spark
El proceso para definir una tabla en Kudu utilizando Spark consta de 5 pasos principales:
Especificar el nombre de la tabla
Definir el esquema (schema)
Establecer las claves primarias
Confiugrar las opciones importantes; por ejemplo: el esquema de particionamiento
Invocar la API de creación de tablas
A c ...
Publicado el 6-28 01:53
Integración de Spark con Kudu para manipulación de datos
La combinación de Apache Spark y Kudu ofrece soporte para múltiples funcionalidades:
Operaciones DDL (creación y eliminación de tablas)
RDD nativo de Kudu
Fuante de datos nativa para integración con DataFrames
Lectura directa desde Kudu
Ejecución de inserciones, actualizaciones, upserts y eliminaciones
Optimización mediante predicate pushdown
...
Publicado el 6-20 21:11