Utilizando MLLib en Scala/Java/Python con Spark

Utilizando MLLib en Scala Los siguientes fragmentos de código pueden ser ejecutados en spark-shell. Clasificación Binaria El siguiente fragmento de código ilustra cómo cargar un conjunto de datos de ejemplo, ejecutar un algoritmo de entrenamiento en estos datos utilizando un método estático en el objeto del algoritmo, y realizar predicciones co ...

Publicado el 7-21 23:03

Creación y Eliminación de Tablas Kudu con Spark

Creación de Tablas Kudu mediante Spark El proceso para definir una tabla en Kudu utilizando Spark consta de 5 pasos principales: Especificar el nombre de la tabla Definir el esquema (schema) Establecer las claves primarias Confiugrar las opciones importantes; por ejemplo: el esquema de particionamiento Invocar la API de creación de tablas A c ...

Publicado el 6-28 01:53

Integración de Spark con Kudu para manipulación de datos

La combinación de Apache Spark y Kudu ofrece soporte para múltiples funcionalidades: Operaciones DDL (creación y eliminación de tablas) RDD nativo de Kudu Fuante de datos nativa para integración con DataFrames Lectura directa desde Kudu Ejecución de inserciones, actualizaciones, upserts y eliminaciones Optimización mediante predicate pushdown ...

Publicado el 6-20 21:11