Big Data
Procesamiento y escala de datos masivos.
121 términos
Almacenamiento columnar
Estrategia de almacenamiento que organiza los datos agrupados por columna en lugar de por fila, optimizando drásticamente las consultas analíticas que solo necesitan leer algunas columnas específicas.
Leer másBig DataAlmacenamiento de objetos (Object storage)
Sistema de almacenamiento que guarda datos como objetos independientes identificados por una clave única, en lugar de organizarlos en una jerarquía tradicional de carpetas y archivos.
Leer másBig DataAlmacenamiento por filas
Estrategia de almacenamiento tradicional que guarda juntos todos los valores de una misma fila, optimizada para acceder o modificar registros completos de forma eficiente.
Leer másBig DataAmazon Redshift
Servicio de data warehouse en la nube de Amazon Web Services, optimizado para ejecutar consultas analíticas complejas sobre grandes volúmenes de datos empresariales.
Leer másBig DataAmazon S3
Servicio de almacenamiento de objetos de Amazon Web Services, ampliamente usado como capa de almacenamiento fundamental para data lakes y aplicaciones en la nube.
Leer másBig DataAnalítica de autoservicio (Self-service analytics)
Enfoque que permite a usuarios de negocio, sin conocimientos técnicos avanzados, explorar y analizar datos por sí mismos, sin depender de un equipo técnico central para cada consulta.
Leer másBig DataApache Beam
Modelo de programación unificado que permite definir pipelines de procesamiento de datos que pueden ejecutarse indistintamente en modo streaming o por lotes, sobre distintos motores subyacentes.
Leer másBig DataApache Flink
Motor de procesamiento distribuido especializado en streaming, diseñado para procesar flujos de datos continuos con muy baja latencia y garantías sólidas de consistencia.
Leer másBig DataApache HBase
Base de datos NoSQL de columnas anchas, construida sobre el sistema de archivos distribuido de Hadoop, diseñada para acceso de lectura y escritura en tiempo real sobre datos masivos.
Leer másBig DataApache Hive
Herramienta que permite consultar datos almacenados en un sistema como Hadoop usando un lenguaje similar a SQL, sin necesitar escribir programas de MapReduce directamente.
Leer másBig DataApache Hudi
Formato de tabla abierto originado en Uber, especialmente orientado a facilitar actualizaciones e inserciones incrementales eficientes sobre grandes volúmenes de datos en un data lake.
Leer másBig DataApache Iceberg
Formato de tabla abierto de código abierto, originado en Netflix, que agrega transacciones confiables y versionado sobre archivos de datos almacenados en un data lake.
Leer másBig DataApache Kafka
Plataforma distribuida para publicar, almacenar y procesar flujos de eventos en tiempo real entre distintos sistemas.
Leer másBig DataApache Mesos
Sistema de gestión de recursos de cluster de propósito general, que permite ejecutar múltiples tipos de aplicaciones distribuidas distintas compartiendo eficientemente el mismo conjunto de servidores físicos.
Leer másBig DataApache NiFi
Herramienta que automatiza y visualiza el flujo de datos entre sistemas mediante una interfaz gráfica de arrastrar y soltar, sin necesitar escribir código extenso para cada integración.
Leer másBig DataApache Pulsar
Plataforma de mensajería y streaming distribuida, diseñada como alternativa a Kafka, con soporte nativo para múltiples inquilinos y separación entre almacenamiento y procesamiento de mensajes.
Leer másBig DataApache Spark
Motor de procesamiento distribuido de datos, más rápido que Hadoop para muchas tareas gracias a su uso intensivo de memoria RAM.
Leer másBig DataApache Storm
Uno de los primeros motores de procesamiento de streaming en tiempo real de código abierto, diseñado para procesar flujos continuos de datos con muy baja latencia.
Leer másBig DataApache ZooKeeper
Servicio centralizado que coordina y sincroniza información de configuración entre los distintos nodos de un sistema distribuido, como los usados históricamente por Hadoop y Kafka.
Leer másBig DataArquitectura Kappa
Patrón de arquitectura de datos que procesa tanto datos históricos como en tiempo real usando un único motor de streaming, en lugar de mantener sistemas separados para procesamiento por lotes y en tiempo real.
Leer másBig DataArquitectura Lambda
Patrón de arquitectura de datos que combina procesamiento por lotes y en tiempo real para balancear precisión y baja latencia.
Leer másBig DataArquitectura Medallion
Patrón de organización de un data lake en capas sucesivas de calidad creciente, comúnmente llamadas bronce, plata y oro.
Leer másBig DataArquitectura orientada a eventos
Estilo de diseño de sistemas donde los distintos componentes se comunican principalmente reaccionando a eventos que ocurren, en lugar de llamarse directamente entre sí.
Leer másBig DataAutoescalado (Autoscaling)
Capacidad de un sistema en la nube de ajustar automáticamente la cantidad de recursos de cómputo asignados, según la demanda real de tráfico o procesamiento en cada momento.
Leer másBig DataBackpressure (Contrapresión)
Mecanismo mediante el cual un sistema que procesa datos más lento que la velocidad a la que los recibe, señala a la fuente de esos datos que reduzca su ritmo de envío, para evitar saturarse.
Leer másBig DataBig Data
Conjuntos de datos tan grandes, rápidos o variados que superan la capacidad de las herramientas tradicionales para almacenarlos, procesarlos y analizarlos.
Leer másBig DataCaché distribuido (Distributed caching)
Sistema de caché compartido entre múltiples servidores de una aplicación, permitiendo que todos accedan a los mismos datos temporales cacheados de forma consistente.
Leer másBig DataCheckpoint (procesamiento de streaming)
Punto de guardado periódico del estado interno de un sistema de streaming, que permite recuperar exactamente ese estado y continuar procesando sin pérdida de datos tras una falla.
Leer másBig DataCluster de cómputo
Conjunto de servidores conectados entre sí que trabajan de forma coordinada como si fueran un único sistema, repartiendo tareas y datos.
Leer másBig DataCola de mensajes (Message queue)
Sistema que almacena temporalmente mensajes enviados por un proceso productor, hasta que un proceso consumidor los procesa, desacoplando ambos en el tiempo.
Leer másBig DataCompactación de archivos
Proceso que combina muchos archivos pequeños en archivos más grandes dentro de un sistema de almacenamiento distribuido, mejorando el rendimiento de lectura posterior.
Leer másBig DataCompactación de logs (Log compaction)
Estrategia de retención en sistemas de mensajería que conserva únicamente el mensaje más reciente para cada clave, en lugar de mantener el historial completo de todos los mensajes enviados.
Leer másBig DataCompresión de datos
Técnica que reduce el tamaño físico de un conjunto de datos, permitiendo ahorrar espacio de almacenamiento y acelerar su transferencia, a cambio de un costo adicional de procesamiento para comprimir y descomprimir.
Leer másBig DataComputación en el borde (Edge computing)
Enfoque que procesa datos cerca de donde se generan, en dispositivos locales o servidores cercanos, en lugar de enviarlos siempre a un centro de datos centralizado o a la nube.
Leer másBig DataComputación en la nube (Cloud computing)
Modelo que ofrece recursos de cómputo, almacenamiento y otros servicios de tecnología bajo demanda a través de internet, en lugar de requerir infraestructura física propia.
Leer másBig DataComputación en memoria (In-memory computing)
Enfoque de procesamiento de datos que mantiene los datos activos en memoria RAM durante todo el procesamiento, en lugar de leer y escribir constantemente en disco.
Leer másBig DataComputación sin servidor (Serverless)
Modelo de cómputo en la nube donde el proveedor gestiona automáticamente toda la infraestructura de servidores, y el usuario solo paga por el tiempo de ejecución real de su código.
Leer másBig DataComputación vectorizada
Técnica de procesamiento que aplica una misma operación simultáneamente sobre múltiples valores de datos a la vez, en lugar de procesarlos uno por uno de forma secuencial.
Leer másBig DataCosto total de propiedad (TCO)
Estimación completa de todos los costos asociados a un sistema o tecnología a lo largo de su vida útil, más allá del precio inicial de adquisición o licenciamiento.
Leer másBig DataCostos de transferencia de datos (Data egress)
Cargos que cobran los proveedores de nube por transferir datos fuera de su infraestructura, un factor de costo importante a considerar en arquitecturas de datos distribuidas entre distintos proveedores.
Leer másBig DataData Fabric
Arquitectura de datos que integra y proporciona acceso unificado a datos distribuidos entre múltiples sistemas y ubicaciones distintas, sin necesariamente centralizarlos físicamente en un único lugar.
Leer másBig DataData Mesh
Enfoque de arquitectura de datos que distribuye la propiedad y responsabilidad de los datos entre los equipos de cada dominio de negocio, en lugar de centralizarla en un único equipo.
Leer másBig DataData Warehouse
Repositorio centralizado que almacena datos ya estructurados y transformados, optimizado para el análisis y la generación de reportes de negocio.
Leer másBig DataDatabricks
Plataforma de análisis de datos en la nube, construida originalmente por los creadores de Apache Spark, que combina ingeniería de datos, ciencia de datos y machine learning en un mismo entorno.
Leer másBig DataDataOps
Conjunto de prácticas que aplican principios de automatización, colaboración y mejora continua (tomados de DevOps) al desarrollo y mantenimiento de pipelines de datos.
Leer másBig DataDelta Lake
Formato de tabla abierto desarrollado originalmente por Databricks, que agrega transacciones ACID y versionado de datos sobre archivos Parquet almacenados en un data lake.
Leer másBig DataDependencia de proveedor (Vendor lock-in)
Situación en la que una organización queda tan dependiente de las herramientas o servicios específicos de un proveedor, que cambiar a otra alternativa se vuelve costoso o técnicamente muy difícil.
Leer másBig DataDespliegue multi-región
Estrategia de infraestructura que distribuye una aplicación y sus datos entre varias regiones geográficas distintas de un proveedor de nube, mejorando la resiliencia y reduciendo la latencia para usuarios distribuidos globalmente.
Leer másBig DataDocker
Plataforma que empaqueta una aplicación junto con todas sus dependencias en un contenedor liviano y portable, garantizando que funcione de forma consistente en cualquier entorno.
Leer másBig DataELT
Variante de ETL donde los datos se cargan primero en su forma cruda en el destino final, y se transforman después, aprovechando el poder de cómputo del propio destino.
Leer másBig DataEscalabilidad horizontal
Estrategia para aumentar la capacidad de un sistema agregando más máquinas o servidores, en lugar de hacer más potente una sola máquina.
Leer másBig DataEscalabilidad vertical
Estrategia para aumentar la capacidad de un sistema mejorando el hardware de una única máquina, como agregar más memoria o un procesador más potente.
Leer másBig DataEstado en streaming (Stateful stream processing)
Capacidad de un sistema de procesamiento de streaming de recordar información de eventos anteriores, para usarla al procesar eventos nuevos relacionados.
Leer másBig DataETL (Extract, Transform, Load)
Proceso que extrae datos de distintas fuentes, los transforma y limpia, y los carga en un destino final como un data warehouse.
Leer másBig DataFactor de replicación
Cantidad de copias idénticas que un sistema distribuido mantiene de cada fragmento de datos, determinando cuántos fallos simultáneos de servidores puede tolerar sin perder información.
Leer másBig DataFeature store
Repositorio centralizado que almacena, versiona y sirve las variables (features) usadas para entrenar y ejecutar modelos de machine learning, evitando duplicar ese trabajo entre distintos equipos y proyectos.
Leer másBig DataFederación de consultas
Capacidad de ejecutar una única consulta que combina y cruza datos provenientes de múltiples sistemas de almacenamiento distintos de forma transparente.
Leer másBig DataFinOps
Práctica y cultura organizacional enfocada en gestionar y optimizar de forma continua los costos del uso de servicios en la nube, involucrando conjuntamente a equipos técnicos y financieros.
Leer másBig DataFormato Avro
Formato de serialización de datos orientado a filas, que incluye el esquema de los datos junto con la propia información, facilitando su evolución con el tiempo.
Leer másBig DataFormato CSV
Formato de archivo de texto simple que almacena datos tabulares separando cada valor por comas, ampliamente usado por su simplicidad y compatibilidad universal.
Leer másBig DataFormato de tabla abierto (Open table format)
Especificación abierta que agrega funcionalidades de tabla tradicional —transacciones, versionado, evolución de esquema— sobre archivos de datos almacenados en un data lake.
Leer másBig DataFormato JSON (datos)
Formato de texto ligero para representar datos estructurados y semiestructurados, ampliamente usado tanto en el intercambio de datos entre sistemas como en bases de datos de documentos.
Leer másBig DataFormato ORC
Formato de almacenamiento columnar de código abierto, optimizado específicamente para el ecosistema Hadoop, con fuerte compresión e indexación incorporada.
Leer másBig DataFormato Parquet
Formato de almacenamiento de datos columnar, de código abierto, optimizado para consultas analíticas eficientes sobre grandes volúmenes de datos.
Leer másBig DataFunción como Servicio (FaaS)
Modelo de computación serverless en el que se despliegan pequeñas funciones individuales de código, que se ejecutan automáticamente en respuesta a eventos específicos.
Leer másBig DataGoogle BigQuery
Data warehouse serverless de Google Cloud, diseñado para ejecutar consultas analíticas extremadamente rápidas sobre volúmenes de datos masivos, sin necesitar administrar infraestructura.
Leer másBig DataHadoop
Framework open source para el almacenamiento y procesamiento distribuido de grandes volúmenes de datos en clusters de servidores.
Leer másBig DataHDFS (Hadoop Distributed File System)
Sistema de archivos distribuido diseñado para almacenar volúmenes masivos de datos repartidos entre muchos servidores, con alta tolerancia a fallos mediante replicación automática.
Leer másBig DataHerramientas de integración de datos (ELT tools)
Herramientas especializadas en extraer datos automáticamente desde múltiples fuentes y cargarlos en un destino centralizado, sin requerir programación personalizada para cada conexión.
Leer másBig DataHive Metastore
Servicio que almacena y gestiona los metadatos sobre las tablas de un data lake o data warehouse, como su esquema, ubicación física y estadísticas, permitiendo que distintas herramientas los consulten de forma consistente.
Leer másBig DataInfraestructura como código (IaC)
Práctica de definir y gestionar la infraestructura tecnológica —servidores, redes, bases de datos— mediante archivos de configuración versionados, en lugar de configurarla manualmente.
Leer másBig DataInfraestructura como Servicio (IaaS)
Modelo de computación en la nube que ofrece servidores virtuales, almacenamiento y redes bajo demanda, dejando al usuario la responsabilidad de administrar el sistema operativo y el software instalado sobre ellos.
Leer másBig DataIngesta de datos (Data ingestion)
Proceso de recolectar y transportar datos desde sus fuentes originales hacia un sistema de almacenamiento o procesamiento, como primer paso de cualquier pipeline de datos.
Leer másBig DataInternet de las cosas (IoT)
Red de dispositivos físicos equipados con sensores y conectividad, que recolectan y transmiten datos sobre su entorno o funcionamiento a través de internet.
Leer másBig DataKubernetes
Plataforma de orquestación que automatiza el despliegue, escalado y gestión de aplicaciones empaquetadas en contenedores, a través de un cluster de servidores.
Leer másBig DataLas 5 V del Big Data
Marco conceptual que describe las características que definen al Big Data: volumen, velocidad, variedad, veracidad y valor.
Leer másBig DataLatencia de cola (Tail latency)
Tiempo de respuesta correspondiente a las solicitudes más lentas de un sistema, generalmente medido con percentiles altos como P95 o P99, más relevante para la experiencia real que el promedio.
Leer másBig DataMapReduce
Modelo de programación para procesar grandes volúmenes de datos en paralelo, dividiendo el trabajo en una etapa de mapeo y otra de reducción.
Leer másBig DataMotor OLAP en tiempo real
Base de datos analítica diseñada para responder consultas agregadas complejas casi instantáneamente sobre datos que se actualizan de forma continua, en lugar de solo sobre datos históricos ya consolidados.
Leer másBig DataMulti-nube (Multi-cloud)
Estrategia que utiliza servicios de más de un proveedor de computación en la nube simultáneamente, en lugar de depender exclusivamente de uno solo.
Leer másBig DataNiveles de almacenamiento (Hot/Warm/Cold)
Estrategia que clasifica los datos según qué tan frecuentemente se accede a ellos, almacenándolos en distintos niveles de costo y velocidad según esa frecuencia de uso.
Leer másBig DataNodo maestro y nodo trabajador
Patrón de organización de un cluster distribuido donde uno o pocos nodos maestros coordinan y distribuyen tareas entre muchos nodos trabajadores, que ejecutan el procesamiento real.
Leer másBig DataOrquestación de contenedores
Automatización de la gestión de un gran número de contenedores en ejecución, coordinando su despliegue, escalado, red y recuperación ante fallas.
Leer másBig DataParticionamiento de datos
Técnica que divide un conjunto de datos en partes más manejables, según un criterio como fecha o categoría, para mejorar el rendimiento de las consultas.
Leer másBig DataPatrón publicación-suscripción (Pub/Sub)
Patrón de comunicación en el que los productores de información (publicadores) envían mensajes sin conocer directamente a los receptores, y los consumidores interesados (suscriptores) se registran para recibir los mensajes que les interesan.
Leer másBig DataPila de datos moderna (Modern data stack)
Conjunto de herramientas cloud-native, generalmente modulares y especializadas, que juntas conforman la infraestructura de datos típica de una organización actual: ingesta, almacenamiento, transformación y visualización.
Leer másBig DataPlataforma como Servicio (PaaS)
Modelo de computación en la nube que ofrece un entorno completo y gestionado para desarrollar y desplegar aplicaciones, sin necesitar administrar directamente los servidores subyacentes.
Leer másBig DataPoda de particiones (Partition pruning)
Técnica de optimización que evita leer particiones completas de una tabla que no son relevantes para una consulta específica, a partir del criterio de particionamiento usado.
Leer másBig DataPresto / Trino
Motor de consultas SQL distribuido, diseñado para consultar grandes volúmenes de datos almacenados en múltiples fuentes distintas de forma rápida e interactiva.
Leer másBig DataProblema de archivos pequeños (Small file problem)
Situación en la que un sistema de almacenamiento distribuido acumula una cantidad excesiva de archivos diminutos, degradando el rendimiento debido a la sobrecarga de gestionar cada uno individualmente.
Leer másBig DataProcesamiento batch vs. streaming
Distinción fundamental entre procesar datos acumulados en bloques periódicos y procesarlos de forma continua a medida que se generan.
Leer másBig DataProcesamiento de eventos complejos (CEP)
Técnica que analiza flujos continuos de eventos en tiempo real, buscando identificar patrones significativos que emergen de la combinación de múltiples eventos individuales.
Leer másBig DataProcesamiento distribuido
Técnica que divide una tarea de cómputo entre múltiples máquinas que trabajan en paralelo, permitiendo procesar volúmenes de datos que una sola máquina no podría manejar.
Leer másBig DataProcesamiento sin estado (Stateless processing)
Enfoque de procesamiento de streaming donde cada evento se procesa de forma completamente independiente, sin necesitar recordar información de eventos anteriores.
Leer másBig DataProducto de datos (Data product)
Conjunto de datos tratado explícitamente como un producto, con un dueño responsable, documentación clara, garantías de calidad y una interfaz de consumo bien definida para otros equipos.
Leer másBig DataProtocol Buffers
Formato de serialización binaria de datos, desarrollado por Google, diseñado para ser más compacto y rápido de procesar que formatos de texto como JSON.
Leer másBig DataPushdown de predicados
Técnica de optimización que traslada las condiciones de filtrado de una consulta hacia la etapa más temprana posible del procesamiento, evitando leer datos innecesarios.
Leer másBig DataRabbitMQ
Sistema de colas de mensajes de código abierto, ampliamente usado para comunicar de forma confiable distintos componentes de una aplicación mediante el envío y recepción de mensajes.
Leer másBig DataRebalanceo de particiones
Proceso mediante el cual un sistema distribuido redistribuye automáticamente sus particiones de datos entre los nodos disponibles, tras agregar o quitar servidores del cluster.
Leer másBig DataRegión en la nube (Cloud region)
Área geográfica específica donde un proveedor de nube opera un conjunto de centros de datos, ofreciendo a los clientes la posibilidad de elegir dónde alojar físicamente sus datos y aplicaciones.
Leer másBig DataRegistro de esquemas (Schema registry)
Servicio centralizado que almacena y gestiona las distintas versiones de los esquemas de datos usados en un sistema de mensajería, garantizando compatibilidad entre productores y consumidores.
Leer másBig DataReplicación síncrona vs. asíncrona
Distinción sobre si un sistema espera la confirmación de todas las réplicas antes de considerar completada una escritura (síncrona), o si confirma la escritura antes de que las réplicas se actualicen (asíncrona).
Leer másBig DataReprocesamiento de datos (Data replay)
Capacidad de volver a procesar datos históricos ya almacenados, generalmente para corregir un error en la lógica de procesamiento original o incorporar una nueva forma de análisis.
Leer másBig DataSemánticas de entrega de mensajes
Garantías que un sistema de mensajería ofrece sobre cuántas veces, y bajo qué condiciones, un mensaje será efectivamente entregado a su destinatario.
Leer másBig DataSeparación de almacenamiento y cómputo
Principio de arquitectura que permite escalar de forma independiente la capacidad de almacenamiento de datos y la capacidad de procesamiento usada para consultarlos.
Leer másBig DataSerialización de datos
Proceso de convertir una estructura de datos en memoria a un formato que puede almacenarse en disco o transmitirse por una red, y luego reconstruirse.
Leer másBig DataSistema de archivos distribuido
Sistema de almacenamiento que presenta archivos repartidos físicamente entre múltiples servidores, como si fueran parte de un único sistema de archivos coherente.
Leer másBig DataSLA (Service Level Agreement)
Acuerdo formal que define el nivel de servicio garantizado por un proveedor, incluyendo métricas concretas como disponibilidad, tiempo de respuesta o tiempo máximo de resolución ante incidentes.
Leer másBig DataSnowflake
Plataforma de data warehouse en la nube, que separa completamente el almacenamiento del cómputo, permitiendo escalar cada uno de forma independiente según la necesidad.
Leer másBig DataSoftware como Servicio (SaaS)
Modelo de distribución de software en el que una aplicación completa se ofrece lista para usar a través de internet, generalmente mediante suscripción, sin necesitar instalación local.
Leer másBig DataStreaming de datos
Procesamiento de datos de forma continua, a medida que se generan, en lugar de acumularlos para procesarlos en bloques periódicos.
Leer másBig DataTelemetría
Recolección automática y remota de datos de medición sobre el funcionamiento de un sistema, dispositivo o proceso, generalmente transmitidos en tiempo real para su monitoreo.
Leer másBig DataThroughput vs. latencia
Distinción entre dos métricas de rendimiento distintas: la cantidad total de datos que un sistema puede procesar por unidad de tiempo, y el tiempo que tarda en procesar una única solicitud individual.
Leer másBig DataTiempo de evento vs. tiempo de procesamiento
Distinción entre el momento en que un evento realmente ocurrió (tiempo de evento) y el momento en que el sistema efectivamente lo procesa (tiempo de procesamiento), que pueden diferir considerablemente en sistemas distribuidos.
Leer másBig DataTolerancia a fallos (Fault tolerance)
Capacidad de un sistema distribuido de seguir funcionando correctamente, incluso cuando uno o más de sus componentes individuales fallan.
Leer másBig DataVentana de retención de datos
Período de tiempo durante el cual un sistema, especialmente de streaming, conserva los datos históricos antes de eliminarlos automáticamente.
Leer másBig DataVentanas de tiempo (Streaming)
Técnica que agrupa los eventos de un flujo continuo de datos en intervalos de tiempo definidos, para poder aplicar agregaciones y análisis sobre esos grupos.
Leer másBig DataVirtualización de datos
Técnica que permite consultar datos de múltiples fuentes distintas como si estuvieran en un único lugar, sin necesitar moverlos ni copiarlos físicamente a un repositorio centralizado.
Leer másBig DataWatermark (procesamiento de streaming)
Marca de tiempo que indica hasta qué punto un sistema de streaming considera que ya recibió todos los eventos esperados, permitiendo cerrar ventanas de tiempo con confianza razonable.
Leer másBig DataYARN (Yet Another Resource Negotiator)
Componente de Hadoop que gestiona y asigna los recursos de cómputo del cluster —memoria y procesamiento— entre las distintas aplicaciones que se ejecutan simultáneamente sobre él.
Leer másBig DataZona de disponibilidad (Availability zone)
Centro de datos físicamente aislado dentro de una región de un proveedor de nube, diseñado para que una falla en una zona no afecte a las demás zonas de esa misma región.
Leer más