Ir al contenido principal

Glosario de ciencia de datos: definiciones de términos comunes de ciencia de datos

Ponte en camino hacia la competencia en datos con este glosario completo de ciencia de datos: de la función de activación al z-score, está todo cubierto.
Actualizado 17 sept 2026  · 15 min leer

Explorar con IA

ChatGPTClaudePerplexity

Data Science Vectorgraphic

A

Accuracy score

Función de activación

Algoritmo

Apache Spark

API

Inteligencia artificial (IA)

Artificial Neural Networks (ANN)

B

Backpropagation (BP)

Red bayesiana

Teorema de Bayes

Sesgo

Equilibrio sesgo-varianza

Big data

Distribución binomial

Analista de negocio

Business analytics (BA)

Business intelligence (BI)

C

Variable categórica

Clasificación de variables categóricas

Clustering

Informática

Visión por computador

Matriz de confusión

Variable continua

Correlación

Función de coste

Covarianza

Validación cruzada (no validado)

D

Cuadro de mando

Análisis de datos (DA)

Data analyst

Base de datos

Sistema de gestión de bases de datos (DBMS)

Consumidor de datos

Data engineer

Data engineering (DE)

Enriquecimiento de datos

Dataframe

Gobernanza de datos

Periodismo de datos

Data lake

Competencia en datos

Minería de datos

Modelado de datos

Canalización de datos

Ciencia de datos (DS)

Data scientist

Conjunto de datos

Estructura de datos

Visualización de datos

Data warehouse

Data wrangling

Árbol de decisión

Deep learning (DL)

Reducción de la dimensionalidad

E

EDA

ELT

ETL

Métricas de evaluación

F

Falso negativo (FN, error de tipo II)

Falso positivo (FP, error de tipo I)

Característica (feature)

Ingeniería de características

Selección de características

F-score

G

Descenso de gradiente

H

Hadoop

Hiperparámetro

Hipótesis

I

Imputación

K

K-means

K-nearest neighbors (KNN)

L

Álgebra lineal

Regresión lineal

Regresión logística

M

Machine learning (ML)

Media

Error absoluto medio (MAE)

Error cuadrático medio (MSE)

Mediana

Moda

Ajuste de modelos

Modelado multivariante

N

Naive Bayes

Procesamiento del lenguaje natural (NLP)

Normalización

NoSQL

Hipótesis nula

O

Código abierto

Variable ordinal

Valor atípico

Sobreajuste

P

Parámetro

Precisión

Analítica predictiva

Análisis de componentes principales (PCA)

Python

R

R

Random forest

Exhaustividad (recall)

Regresión

Reinforcement learning (RL)

Raíz del error cuadrático medio (RMSE)

S

Error de muestreo

SQL

Desviación estándar

Aprendizaje supervisado

SVM

Datos sintéticos

T

Variable objetivo

Conjunto de prueba

Serie temporal

Conjunto de entrenamiento

Verdadero negativo (TN)

Verdadero positivo (TP)

U

Subajuste

Modelado univariante

Datos no estructurados

Aprendizaje no supervisado

V

Varianza

W

Web scraping

Z

Z-score

A

Accuracy score

El accuracy score es una métrica de evaluación que se usa para estimar el rendimiento de un modelo de machine learning y mostrar la proporción entre el número de predicciones correctas y el total de predicciones.

Función de activación

Una función de activación se utiliza en las artificial neural networks (ANN) para determinar si una neurona debe activarse o no calculando su salida hacia la siguiente capa oculta (o capa de salida) en función de la entrada de la capa anterior (o capa de entrada). La función de activación es responsable de la transformación no lineal de una red neuronal.

Algoritmo

Un algoritmo es una secuencia de pasos repetibles, a menudo expresados matemáticamente, escritos por una persona y ejecutados por un ordenador, para resolver un tipo concreto de problema de ciencia de datos. Hay algoritmos muy simples y otros extremadamente complejos. Distintos algoritmos se adaptan mejor a diferentes tareas y tecnologías. La idea principal es que un algoritmo recibe una entrada y produce una salida, y la misma entrada siempre producirá la misma salida. En machine learning, los algoritmos reciben como entrada datos e hiperparámetros, identifican y aprenden patrones comunes de los datos y generan salidas en forma de predicciones.

Apache Spark

Apache Spark es un framework de procesamiento paralelo multifunción de código abierto para analizar y modelar big data. Spark permite distribuir datos y cálculos en clústeres con múltiples nodos (piensa en cada nodo como un ordenador independiente). Dividir los datos facilita trabajar con conjuntos muy grandes porque cada nodo solo maneja una pequeña parte. A medida que cada nodo procesa su propio subconjunto, también realiza una parte del total de cálculos necesarios, de modo que tanto el procesamiento como el cómputo se ejecutan en paralelo en los nodos del clúster. El cómputo en paralelo puede acelerar mucho ciertos tipos de tareas de programación.

API

API son las siglas de Application Programming Interface, un intermediario de software que permite la conexión entre aplicaciones o equipos. Un ejemplo de API es incrustar Google Maps en una aplicación de transporte compartido. Las personas de datos trabajan a menudo con APIs para acceder a datos (por ejemplo, la API de Twitter para descargar tuits) o para empaquetar una solución que han creado (por ejemplo, una API que llama a un modelo de machine learning en producción).

Inteligencia artificial (IA)

La inteligencia artificial es una rama de la informática que utiliza técnicas de machine learning, programación y ciencia de datos para que los ordenadores se comporten de forma inteligente. Los sistemas de IA son amplios y varían en complejidad. Pueden ir desde sistemas basados en reglas hasta sistemas basados en aprendizaje automático y realizar tareas como detección de fraude, reconocimiento de objetos, traducción de idiomas, predicción de precios de acciones y mucho más.

Artificial Neural Networks (ANN)

Una artificial neural network es un modelo de machine learning vagamente inspirado en las redes neuronales biológicas del cerebro humano. Las redes neuronales constan de hasta cientos de capas de unidades interconectadas llamadas neuronas. Conceptualmente, una red neuronal artificial tiene capas de entrada, salida y capas ocultas por las que se filtran los datos, se procesan con una función de activación y se generan predicciones en la salida. Las ANN son los pilares del deep learning, un subcampo del aprendizaje automático que ofrece salidas complejas como reconocimiento de imágenes o sonido, detección de objetos, traducción de idiomas y más.

B

Backpropagation (BP)

Backpropagation es una técnica usada al entrenar redes de deep learning basada en implementar el descenso de gradiente para ajustar iterativamente pesos y sesgos y así mejorar la precisión de la red. El algoritmo calcula el error de la salida en cada iteración de entrenamiento y luego lo propaga hacia atrás por la red, lo que permite minimizar el error en futuras iteraciones.

Red bayesiana

Una red bayesiana es un grafo probabilístico que muestra la relación entre variables aleatorias en un dominio incierto, donde los nodos representan esas variables y los enlaces entre pares de nodos (aristas) representan la probabilidad condicional de las variables correspondientes. Un ejemplo de redes bayesianas aparece en diagnósticos médicos, donde se predicen resultados de salud teniendo en cuenta todos los factores que pueden influir en ellos.

Teorema de Bayes

El teorema de Bayes es una ecuación matemática para calcular la probabilidad condicional, es decir, la probabilidad de que ocurra un evento B dado que un evento relacionado A ya ha sucedido. Una de sus aplicaciones en ciencia de datos es construir redes bayesianas para grandes conjuntos de datos.

Sesgo

El sesgo se refiere a la tendencia de los modelos a infraajustar los datos, lo que conduce a predicciones inexactas en machine learning y ciencia de datos. Esta es la definición de sesgo que suele mencionarse en el equilibrio sesgo-varianza. Además, sesgo también puede referirse al sesgo algorítmico: la propensión de los modelos de aprendizaje automático a reproducir sesgos sociales dañinos tratando de forma distinta a distintos grupos de personas en función de atributos protegidos como raza, orientación sexual, identidad de género, edad, embarazo, condición de veterano, y más.

Equilibrio sesgo-varianza

El equilibrio sesgo-varianza es la compensación entre sesgo y varianza al crear un modelo de machine learning. Son dos tipos de error de predicción: un sesgo alto indica infraajuste del modelo y una varianza alta indica sobreajuste. Minimizar ambos factores hasta un nivel óptimo reduce el error total de las predicciones.

Big data

Big data es el ámbito dedicado a procesar, tratar y extraer información de conjuntos de datos que son demasiado grandes o complejos para las herramientas tradicionales de procesamiento. Se define por las cinco V: velocidad (rapidez de generación de datos), volumen (cantidad generada), variedad (tipos de datos, p. ej., texto, imágenes, datos tabulares), veracidad (calidad y fiabilidad) y valor (capacidad de traducirse en insights de negocio valiosos).

Distribución binomial

La distribución binomial es la distribución de probabilidad discreta de los resultados de ensayos independientes, con dos resultados mutuamente excluyentes (éxito y fracaso), un número finito de ensayos y una probabilidad de éxito constante. En pocas palabras, puede verse como la probabilidad de un resultado concreto (éxito o fracaso) en un evento repetido varias veces (p. ej., la probabilidad de obtener un 3 en un dado lanzado 5 veces).

Analista de negocio

Las personas analistas de negocio conectan insights de datos con resultados accionables que aumentan la rentabilidad o la eficiencia. Conocen a fondo el dominio de negocio y suelen usar SQL junto con herramientas sin código para comunicar los insights obtenidos de los datos.

Business analytics (BA)

Business analytics es un subcampo del análisis centrado en usar datos históricos y actuales para descubrir insights operativos valiosos, anticipar posibles tendencias futuras y tomar decisiones empresariales basadas en datos. Suele incluir análisis estadístico, analítica descriptiva y visualización de datos, y puede abarcar analítica predictiva y machine learning.

 

Business intelligence (BI)

Business intelligence es un subcampo del análisis que combina analítica descriptiva, business analytics, visualización de datos, análisis estadístico, informes y más, con el objetivo de ayudar a las organizaciones a tomar decisiones basadas en datos. BI suele apoyarse en herramientas sin código como Tableau y Power BI para explorar tendencias en datos históricos y actuales. A diferencia de business analytics, se centra principalmente en la analítica descriptiva.

C

Variable categórica

Una variable categórica puede tomar uno de un número limitado de valores posibles (categorías) sin un orden intrínseco. Un ejemplo sería el estado civil (p. ej., casado, soltero, divorciado). También se denomina variable nominal o cualitativa.

Clasificación

La clasificación es un problema de aprendizaje supervisado en el que hay que predecir resultados categóricos a partir de características de entrada. Ejemplos: detección de fraude (¿es esta transacción fraudulenta dado el conjunto de características?) y filtros de spam (¿este email es spam o no?). Algoritmos habituales: k-nearest neighbors, árboles de decisión, random forest, etc.

Clustering

El clustering es un problema de aprendizaje no supervisado que agrupa las observaciones de un conjunto de datos según su similitud por ciertas características comunes. A diferencia de la clasificación, estos grupos (clusters) no están predefinidos por personas, sino que los identifica el algoritmo al aprender de los datos. Los elementos de cada clúster son similares entre sí y distintos de los de los demás. Algoritmos comunes: k-means, clustering jerárquico, clustering espectral, etc.

Informática

La informática es un campo multifacético centrado en los aspectos teóricos y prácticos del procesamiento de información en ordenadores digitales, el diseño de hardware y software, y sus aplicaciones. En particular, abarca inteligencia artificial, sistemas de computación, algoritmos, estructuras de datos, modelado de datos, seguridad, diseño de ordenadores y redes, etc.

Visión por computador

La visión por computador es un área de la informática que busca que los ordenadores comprendan a alto nivel imágenes o vídeos digitales de forma similar a como los percibimos las personas. Ha ganado popularidad con la evolución del deep learning y la acumulación de big data. Sus aplicaciones incluyen reconocimiento de objetos y rostros, análisis de movimiento, coches autónomos y reconocimiento óptico de caracteres.

Matriz de confusión

Una matriz de confusión es una tabla que ilustra el rendimiento predictivo de un modelo de clasificación. Suele crearse para salidas binarias (p. ej., si una transacción es fraudulenta o no), dando lugar a una tabla de dos por dos. Representa la relación entre predicciones y etiquetas reales para ambas clases y muestra fácilmente cuántas predicciones correctas hay (verdaderos positivos y verdaderos negativos) y cuántos falsos positivos (error de tipo I) y falsos negativos (error de tipo II).

Variable continua

Una variable continua puede tomar un conjunto infinito de valores dentro de un rango determinado. Ejemplos: altura y peso.

Correlación

La correlación es la fuerza y dirección de la relación entre dos o más variables, medida por un coeficiente de correlación o coeficiente de Pearson. Estadísticamente, es la razón entre la covarianza de dos variables y el producto de sus desviaciones estándar. Toma valores de -1 (correlación negativa perfecta) a 1 (positiva perfecta). La correlación no implica causalidad.

Función de coste

La función de coste es una función en machine learning que mide la media de las diferencias entre los valores predichos y los reales sobre el conjunto de entrenamiento y que se pretende minimizar.

Covarianza

La covarianza mide la relación entre dos variables. A diferencia de la varianza, que mide variaciones dentro de una misma variable, la covarianza muestra cómo las variaciones de una influyen en los cambios de la otra. Se utiliza para calcular el coeficiente de correlación.

Validación cruzada (no validado)

La validación cruzada es un método de remuestreo al entrenar modelos de machine learning que divide los datos etiquetados en conjuntos de entrenamiento y de prueba. En cada iteración se usan partes distintas de los datos para entrenar y probar el modelo. Con el entrenamiento se ajusta el modelo y con la prueba se generan predicciones que se comparan con las etiquetas reales. Después se calcula una métrica global de precisión para estimar el rendimiento predictivo.

D

Cuadro de mando

Un cuadro de mando es una interfaz gráfica e interactiva para visualizar, resumir e informar sobre KPIs, métricas de progreso e información de procesos de negocio, que permite al público objetivo captar con facilidad los insights más importantes. Se construye con herramientas sin código como Excel, Tableau o Power BI, o con herramientas de código como Python y R, y suele estar vinculado a bases de datos y servicios actualizados regularmente.

Análisis de datos (DA)

El análisis de datos se centra en limpiar, transformar, visualizar y explorar datos para extraer patrones e insights relevantes, y comunicar los resultados a las personas interesadas. Suele ser el primer hito en proyectos de ciencia de datos, aunque también puede ser un proyecto independiente. A diferencia de la ciencia de datos, se orienta más a la analítica descriptiva que a la predictiva.

Data analyst

Al igual que las personas analistas de negocio, las data analysts son responsables de analizar datos e informar de los insights de su análisis. Domina el flujo de trabajo analítico y comunican sus hallazgos usando una combinación de herramientas con y sin código.

Base de datos

Una base de datos es un espacio de almacenamiento estructurado donde los datos se organizan en múltiples tablas para que la información necesaria se pueda acceder y resumir fácilmente. Se utilizan principalmente con un sistema de gestión de bases de datos relacional (RDBMS) como Oracle o PostgreSQL. El lenguaje más común para interactuar con los datos es SQL.

Sistema de gestión de bases de datos (DBMS)

Un sistema de gestión de bases de datos es un paquete de software para realizar fácilmente distintas operaciones sobre los datos: acceder, manipular, recuperar, gestionar y almacenar datos en una base. Según cómo se organicen los datos, hay distintos tipos de DBMS: relacional, de grafos, jerárquico, etc. Ejemplos: Oracle, MySQL, PostgreSQL, Microsoft SQL Server, MongoDB.

Consumidor de datos

Las personas consumidoras de datos suelen desempeñar funciones no técnicas, pero consumen insights y analítica proporcionados por profesionales de datos para tomar decisiones basadas en datos. A menudo necesitan conversar con estos profesionales y distinguir cuándo los datos pueden y cuándo no pueden responder a preguntas de negocio.

Data engineer

Una persona data engineer es especialista en poner los datos adecuados en manos de data scientists y data analysts. Diseña y mantiene la infraestructura de almacenamiento y las canalizaciones de datos que llevan grandes volúmenes de datos en bruto de diversas fuentes a un lugar centralizado con datos limpios, correctamente formateados y relevantes para la organización.

Data engineering (DE)

Data engineering es una especialización centrada en escalar el acceso a los datos dentro de la organización. Se ocupa de la adquisición, recopilación, gestión y almacenamiento de datos, así como de configurar canalizaciones y transformar los datos en información de alta calidad y utilizable por el resto del equipo.

Enriquecimiento de datos

El enriquecimiento de datos es el proceso de mejorar, refinar y ampliar los datos en bruto para que sean más útiles para la organización, obtener insights de negocio más significativos y optimizar la analítica predictiva.

Dataframe

Un dataframe es una estructura de datos tabular con ejes etiquetados (filas y columnas) que pueden ser de tipos distintos.

Gobernanza de datos

DAMA define la gobernanza de datos como «La planificación, supervisión y control sobre la gestión de los datos y de los recursos relacionados con los datos». Establece roles, responsabilidades y procesos para garantizar la disponibilidad, relevancia, calidad, usabilidad, integridad y seguridad de los datos. Incluye un órgano de gobierno, un marco de normas y prácticas para cubrir las necesidades de información de la empresa, y un programa para ejecutarlas.

Periodismo de datos

El periodismo de datos es un tipo de periodismo centrado en procesar y analizar grandes volúmenes de datos numéricos con el objetivo de crear una historia sobre los datos o la información derivada de ellos. Surgió por el crecimiento continuo del flujo de información y la mayor interacción del periodismo con áreas como la estadística, las tecnologías de la información y la ciencia de datos.

Data lake

Un data lake es un repositorio único que contiene una gran cantidad de datos en bruto y sin procesar de cualquier tipo y de diversas fuentes, aún sin un propósito definido. Incluye tanto datos estructurados de distintas estructuras sin relación entre sí como, más a menudo, datos no estructurados, como documentos y archivos de texto. Los datos en bruto se conservan como fuente original sin necesidad de estructurarlos ni tratarlos salvo cuando se necesiten.

Competencia en datos

La competencia en datos es la capacidad de leer, escribir, analizar, comunicar y razonar con datos para tomar mejores decisiones basadas en datos. A nivel organizativo, es un espectro de habilidades que va desde la toma de decisiones basada en datos hasta competencias técnicas avanzadas en ciencia de datos, data engineering y machine learning, con el fin de que toda la organización tenga las competencias adecuadas y genere valor a escala a partir de los datos.

Minería de datos

La minería de datos es el proceso de recopilar datos relevantes de varias fuentes, limpiarlos y transformarlos al formato adecuado, detectar y extraer tendencias, patrones e interconexiones significativas, y comunicar insights accionables para ayudar a tomar decisiones basadas en datos y diseñar mejores estrategias. Para ello se emplean técnicas analíticas y de modelado como análisis estadístico, visualización, regresión y clasificación.

Modelado de datos

El modelado de datos es el proceso de desarrollar una representación visual de todo un sistema de TI, o de partes del mismo, para comunicar las conexiones entre puntos y estructuras de datos. Muestra los tipos de datos utilizados y almacenados, las relaciones entre fuentes distintas y cómo se agrupan según atributos y características. En ciencia de datos, también puede referirse a construir modelos fiables que transformen datos en bruto en insights predictivos, consistentes y accionables, entendiendo bien las necesidades de negocio, las fuentes disponibles y los plazos, y proporcionando un marco basado en datos y bien formateado para satisfacerlas.

Canalización de datos

Una canalización de datos es un conjunto de scripts de procesamiento enlazados que automatizan el flujo de datos por la organización, donde se extraen, transforman y cargan para que estén listos para su uso.

Ciencia de datos (DS)

La ciencia de datos es un campo interdisciplinar que utiliza métodos científicos, técnicas avanzadas de análisis y algoritmos de modelado predictivo para extraer insights relevantes de los datos y ayudar a responder preguntas estratégicas de negocio o científicas. Combina un amplio abanico de habilidades técnicas y no técnicas y suele requerir un sólido conocimiento del dominio donde se aplica para interpretar correctamente los datos disponibles y los resultados obtenidos.

Data scientist

Las personas data scientist investigan, extraen y comunican insights relevantes a partir de los datos de la organización. Transmiten estos insights a perfiles no técnicos, entienden bien los flujos de trabajo de machine learning y cómo conectarlos con aplicaciones de negocio. Trabajan casi exclusivamente con herramientas de código, realizan análisis y a menudo utilizan herramientas de big data.

Conjunto de datos

Un conjunto de datos es una colección de datos de uno o varios tipos que representan observaciones reales o generadas sintéticamente y que se usan para análisis estadístico o modelado de datos. Suele almacenarse en alguna estructura, normalmente una tabla, donde las columnas corresponden a variables y las filas a entradas de datos.

Estructura de datos

Una estructura de datos es una forma de organizar y almacenar datos para acceder a ellos y trabajar de manera eficiente. Define la relación entre los datos y las operaciones que pueden realizarse. Estructuras comunes en ciencia de datos son dataframes, listas, arrays y más.

Visualización de datos

La visualización de datos es un campo interdisciplinar que se ocupa de condensar y representar información en formato visual. Los datos pueden visualizarse en mapas, histogramas, gráficos de barras y líneas, y combinarse en infografías, cuadros de mando y más, para ayudar al público objetivo a comprender mejor los datos subyacentes y los resultados obtenidos.

Data warehouse

Un data warehouse es un repositorio central para almacenar datos estructurados, limpios y transformados recogidos de múltiples fuentes mediante procesos ETL (extracción, transformación y carga). Las y los profesionales de datos acceden fácilmente a la información a través de herramientas de business intelligence, consultas SQL, etc., y la utilizan para análisis y modelado con los que responder preguntas de negocio.

Data wrangling

El data wrangling, también llamado data munging, abarca tareas de limpieza, reestructuración, combinación, agregación y transformación de datos al formato adecuado para un fin concreto. En resumen, es la preparación de los datos para facilitar su acceso y análisis.

Árbol de decisión

Un árbol de decisión es un algoritmo de aprendizaje supervisado usado sobre todo para clasificación, aunque también para regresión. Formula una secuencia de preguntas if-else sobre características individuales con el objetivo de inferir las etiquetas de clase. Se beneficia de una representación en forma de árbol, imita la toma de decisiones humana y su lógica es intuitiva, pero tiende a sobreajustar.

Deep learning (DL)

El deep learning es un subconjunto de algoritmos de machine learning basado en artificial neural networks (ANN) multicapa, inspiradas en la estructura del cerebro. Las ANN son muy flexibles y pueden aprender de cantidades masivas de datos para ofrecer salidas muy precisas. Suelen estar detrás de casos de uso como reconocimiento de imágenes o sonido, traducción de idiomas y otros problemas avanzados.

Reducción de la dimensionalidad

La reducción de la dimensionalidad consiste en reducir el número de características del conjunto de entrenamiento, conservando solo las más relevantes que capturan la mayor parte de la variación, para mejorar el rendimiento del modelo. Es especialmente útil con conjuntos grandes con muchas variables: ayuda a optimizar almacenamiento y tiempo de cómputo y a corregir la multicolinealidad. La técnica más popular es el PCA.

E

EDA

EDA son las siglas de exploratory data analysis y se refiere a la primera fase del análisis de datos, centrada en explorar lo disponible, resumir sus características principales y encontrar patrones y tendencias iniciales, problemas a corregir y preguntas para investigar después. En esta etapa, una persona analista o data scientist obtiene una comprensión general de los datos como base para un análisis más detallado.

ELT

ELT (extract, load, transform) es un sistema de canalización de datos diseñado por data engineers, alternativa al más popular ETL (extract, transform, load). Antes de aplicar transformaciones, los datos en bruto se cargan en el data lake y se transforman allí. Su ventaja frente a ETL es que requiere menos tiempo, se adapta a grandes volúmenes y es más rentable.

ETL

ETL (extract, transform, load) es un sistema de canalización de datos diseñado por data engineers. Los datos se extraen de múltiples fuentes, se transforman desde su forma en bruto a un formato adecuado y consistente con otras fuentes, y se cargan en el data warehouse de destino. Desde ahí se usan para análisis y modelado que resuelven problemas de negocio.

Métricas de evaluación

Las métricas de evaluación son un conjunto de medidas para estimar el rendimiento de un modelo estadístico o de machine learning. Ejemplos: accuracy score, f-score, recall y RMSE.

F

Falso negativo (FN, error de tipo II)

Un falso negativo es un resultado en el que un modelo de clasificación predice incorrectamente la clase negativa para una variable objetivo binaria (p. ej., si predecimos churn, un falso negativo sería predecir «no hará churn» cuando la etiqueta real es «hará churn»).

Falso positivo (FP, error de tipo I)

Un falso positivo es un resultado en el que un modelo de clasificación predice incorrectamente la clase positiva para una variable objetivo binaria. Por ejemplo, si predecimos churn, un falso positivo sería predecir «hará churn» cuando la etiqueta real es «no hará churn».

Característica (feature)

Una característica es una variable independiente usada como entrada en un modelo de machine learning. Por ejemplo, si predecimos la probabilidad de diabetes usando altura, peso e ingesta de azúcar, esas tres son características.

Ingeniería de características

La ingeniería de características es el proceso de usar conocimiento del dominio y experiencia técnica para transformar características en bruto en otras que reflejen mejor el problema subyacente y se adapten mejor a los algoritmos de machine learning. Incluye extraer nuevas características o manipular las existentes. Por ejemplo, para predecir probabilidad de diabetes, calcular el IMC a partir de altura y peso es ingeniería de características.

Selección de características

La selección de características consiste en elegir un subconjunto de las más relevantes del conjunto de datos para predecir la variable objetivo. Es especialmente importante en conjuntos grandes, ya que reduce la complejidad del modelo, el sobreajuste y el tiempo de cómputo, y aumenta la precisión.

F-score

El F-score es una métrica de evaluación que combina precisión y recall. Habitualmente se usa el F1-score, que es la media armónica de precisión y recall. El caso genérico es Fβ, donde se da más peso a una u otra.

G

Descenso de gradiente

El descenso de gradiente es un proceso iterativo de optimización usado en machine learning para minimizar la función de coste encontrando los valores óptimos de sus parámetros.

H

Hadoop

Hadoop es un framework de software en Java y de código abierto que permite el procesamiento paralelo y el almacenamiento distribuido de big data en clústeres de muchos ordenadores. Hadoop ahorra tiempo y permite manejar volúmenes de datos mucho mayores que con un solo equipo.

Hiperparámetro

Los hiperparámetros son atributos de un modelo de machine learning cuyo valor se fija manualmente antes de iniciar el entrenamiento. A diferencia de otros parámetros, no se estiman ni aprenden directamente de los datos. Ajustándolos y evaluando el rendimiento resultante, podemos determinar sus valores óptimos para lograr el mejor modelo. Intuitivamente, afinar un hiperparámetro es como sintonizar una radio en busca de la señal perfecta. Un ejemplo es el número de árboles en un algoritmo de random forest.

Hipótesis

Una hipótesis es una suposición sobre un problema o fenómeno que debe ponerse a prueba y, según el resultado del experimento, confirmarse o rechazarse.

I

Imputación

La imputación es el proceso de rellenar valores faltantes en un conjunto de datos. Las técnicas pueden ser estadísticas (imputación por media/moda) o de machine learning (imputación con KNN).

K

K-means

K-means es el algoritmo de clustering más popular: identifica K centros de clúster (centroides) con coordenadas tentativas en los datos y asigna iterativamente cada observación al centro más cercano según sus características hasta que los centroides convergen. Los puntos dentro de un clúster son similares entre sí y distintos de los de los demás.

K-nearest neighbors (KNN)

K-nearest neighbors es un algoritmo supervisado que clasifica observaciones en función de su similitud con sus vecinos más cercanos. Los parámetros más importantes a ajustar son el número de vecinos y la métrica de distancia (Minkowski, euclídea, Manhattan, etc.).

L

Álgebra lineal

El álgebra lineal es una rama de las matemáticas que estudia sistemas lineales: rectas, planos, espacios vectoriales, matrices y sus operaciones (suma, multiplicación, etc.). Es muy útil en ciencia de datos y machine learning, ya que los conjuntos de datos y muchos modelos pueden representarse en forma matricial.

Regresión lineal

La regresión lineal es un algoritmo de regresión que modela una relación lineal entre una variable objetivo continua y una o varias características continuas. Un ejemplo típico es la predicción de precios a partir de distintos atributos de entrada.

Regresión logística

La regresión logística es un algoritmo de regresión que utiliza una función logística sobre las características de entrada para predecir la probabilidad de clase o directamente la etiqueta de clase de la variable objetivo. En este segundo caso, la salida es un conjunto de categorías en lugar de valores continuos, actuando así como técnica de clasificación. Un caso de uso típico es predecir la probabilidad de churn de clientes.

M

Machine learning (ML)

El machine learning es una rama de la inteligencia artificial (IA) que ofrece algoritmos diseñados para aprender patrones y tendencias a partir de datos históricos. Su propósito es predecir resultados futuros y generalizar más allá de los puntos del conjunto de entrenamiento sin programación explícita. Hay dos tipos principales: supervisado y no supervisado, cada uno con numerosas técnicas para distintos casos de uso.

Media

La media es el valor promedio aritmético de un conjunto de números, es decir, la suma de todos los valores dividida entre el número de valores. Suele usarse junto con otras estadísticas para tener una visión general del conjunto.

Error absoluto medio (MAE)

El error absoluto medio (MAE) es el promedio aritmético de todos los errores absolutos entre los valores predichos y los reales.

Error cuadrático medio (MSE)

El error cuadrático medio (MSE) es el promedio aritmético de los cuadrados de todos los errores entre los valores predichos y los reales.

Mediana

La mediana es el valor central de un conjunto de números ordenados. Si hay un número par de valores, es la media aritmética de los dos centrales. Se usa junto con otras estadísticas para entender el conjunto y es especialmente útil para detectar posibles valores atípicos.

Moda

La moda es el valor (o valores) que más se repite en un conjunto de datos.

Ajuste de modelos

El ajuste de modelos es el proceso de ajustar los hiperparámetros para maximizar la precisión del modelo sin sobreajustarlo.

Modelado multivariante

El modelado multivariante es el proceso de modelar la relación entre múltiples variables (predictores) definidas en la selección de características y la variable objetivo.

N

Naive Bayes

Naive Bayes es un conjunto de algoritmos de clasificación basados en el teorema de Bayes y en la hipótesis de independencia entre las características usadas en el clasificador. Aunque en la práctica no siempre son independientes, estos algoritmos pueden aplicarse con éxito en casos como filtrado de spam o análisis de sentimiento.

Procesamiento del lenguaje natural (NLP)

El procesamiento del lenguaje natural (NLP) es una rama de la informática que busca que las aplicaciones entiendan y analicen el lenguaje humano escrito o hablado. Las técnicas de NLP toman texto (normalmente no estructurado), lo convierten en una forma estructurada, buscan patrones lingüísticos y contextuales, los categorizan y extraen insights. También aprovecha machine learning y deep learning para generar lenguaje, categorizarlo y realizar otras tareas cognitivas. Ejemplos: chatbots, conversión de voz a texto, análisis de sentimiento y traducción automática.

Normalización

La normalización es el proceso de reescalar los datos para que todos los atributos tengan la misma escala. Es necesaria para comparar atributos de forma significativa y la requieren algunos algoritmos de machine learning.

NoSQL

NoSQL significa "not only SQL". Es un sistema de gestión de bases de datos para el almacenamiento y recuperación de bases de datos no relacionales (no tabulares). Algunos modelos no relacionales son grafos, documentos y pares clave-valor. Los sistemas NoSQL destacan por su alta flexibilidad y velocidad operativa, y por poder escalarse en muchos servidores.

Hipótesis nula

La hipótesis nula es un tipo de hipótesis que afirma lo contrario de la hipótesis alternativa que se quiere comprobar; es decir, que no existe una relación estadística significativa entre dos variables y que las observaciones se deben al azar. Puede rechazarse o confirmarse mediante un experimento estadístico.

O

Código abierto

Código abierto se refiere a software y recursos con licencia libre disponibles para modificar y compartir. Las herramientas open source facilitan la colaboración entre personas usuarias y suelen ser más estables, ya que la comunidad puede añadir funciones útiles o corregir problemas técnicos y errores.

Variable ordinal

Una variable ordinal puede tomar uno de un número limitado de valores posibles con un orden intrínseco. Un ejemplo sería una pregunta de encuesta con respuestas ordenadas por intensidad (p. ej., «Totalmente en desacuerdo», «En desacuerdo», «Neutral», «De acuerdo», «Totalmente de acuerdo»).

Valor atípico

Un valor atípico es un valor anómalo en un conjunto de datos que se desvía considerablemente del resto de observaciones. Puede indicar un error de medición o un suceso extraordinario.

Sobreajuste

El sobreajuste se produce cuando un modelo aprende demasiada información del conjunto de entrenamiento, incluyendo posible ruido y valores atípicos. Como resultado, se vuelve demasiado complejo y dependiente de ese conjunto y rinde mal con datos no vistos. El sobreajuste implica alta varianza en el equilibrio sesgo-varianza.

P

Parámetro

Un parámetro es una variable con nombre que se pasa a una función en programación y ciencia de datos. En machine learning, los parámetros son componentes internos de un algoritmo que se aprenden a partir de los datos. Algunos algoritmos son paramétricos, con un conjunto fijo de parámetros (p. ej., regresión lineal y logística), mientras que otros son no paramétricos (p. ej., k-nearest neighbors).

Precisión

La precisión es una métrica de evaluación para estimar el rendimiento de un modelo de machine learning que muestra la proporción entre el número de casos positivos predichos correctamente y el total de casos predichos como positivos.

Analítica predictiva

La analítica predictiva es el proceso de analizar datos históricos mediante análisis estadístico, minería de datos, visualización y machine learning para predecir eventos futuros en un negocio.

Análisis de componentes principales (PCA)

El análisis de componentes principales (PCA) es una técnica estadística de análisis factorial y reducción de la dimensionalidad que transforma un conjunto de características iniciales posiblemente correlacionadas en un conjunto más pequeño de características linealmente no correlacionadas llamadas componentes principales. Así, el PCA conserva la mayor varianza posible minimizando el número de características.

Python

Python es un lenguaje de programación de alto nivel, orientado a objetos y de código abierto. Es muy popular en ciencia de datos, pero también ampliamente usado para programación general. Es intuitivo y fácil de aprender y usar, y aun así muy potente para resolver problemas complejos. Ofrece una biblioteca estándar extensa y muchos módulos adicionales útiles, y está en constante evolución y mejora.

R

R

R es un lenguaje de programación y software libre muy popular para resolver problemas de ciencia de datos y machine learning, especialmente conocido por su potencia en computación estadística y sus excelentes soluciones de visualización. Incluye numerosas herramientas y paquetes, funciona en muchos sistemas operativos y cuenta con una comunidad en línea muy activa.

Random forest

Random forest es un algoritmo supervisado para problemas de regresión o clasificación que combina las salidas de muchos árboles de decisión en un único modelo. Sus predicciones representan esencialmente el promedio de los árboles, por lo que suele ofrecer resultados más precisos que un solo árbol.

Exhaustividad (recall)

El recall es una métrica de evaluación para estimar el rendimiento de un modelo de machine learning que muestra la proporción entre el número de casos positivos predichos correctamente y el total de casos positivos reales.

Regresión

La regresión es un problema de aprendizaje supervisado en el que hay que predecir resultados continuos a partir de características de entrada. El modelo aprende la relación entre una o varias características independientes y la variable objetivo, y luego usa la función aprendida para predecir datos no vistos. Ejemplos de algoritmos: regresión lineal y regresión ridge. Un problema típico es la predicción de precios.

Reinforcement learning (RL)

El reinforcement learning (RL) es una rama independiente del aprendizaje automático (ni supervisado ni no supervisado) en la que un algoritmo aprende gradualmente interactuando con un entorno. Toma decisiones basándose en su experiencia pasada sobre qué acciones lo acercan a un objetivo. Recibiendo recompensas por aciertos y penalizaciones por errores, encuentra la estrategia óptima para maximizar su desempeño. Ejemplos incluyen sistemas que juegan al ajedrez o agentes de videojuegos.

Base de datos relacional

Una base de datos relacional almacena datos en varias tablas relacionadas entre sí mediante identificadores únicos (claves), a partir de las cuales se puede acceder, extraer, resumir o recomponer la información de distintas maneras.

Raíz del error cuadrático medio (RMSE)

La raíz del error cuadrático medio (RMSE) es la raíz cuadrada del MSE. Es más intuitiva que el MSE porque el resultado se expresa en las mismas unidades que los datos originales.

S

Error de muestreo

El error de muestreo es la diferencia estadística entre toda la población de datos y su subconjunto (muestra), debido a que la muestra no incluye todos los elementos de la población.

SQL

SQL (structured query language) es un lenguaje de programación diseñado para interactuar con sistemas de gestión de bases de datos relacionales (RDBMS). Tiene varios sabores, como SQLite, PostgreSQL y MySQL, algunos libres y de código abierto. Comparten una sintaxis similar con variaciones menores en funcionalidades adicionales.

Desviación estándar

La desviación estándar es la raíz cuadrada de la varianza de una población. Mide la dispersión de los valores y es más intuitiva que la varianza porque usa las mismas unidades que los datos.

Aprendizaje supervisado

El aprendizaje supervisado enseña a un modelo con un conjunto de entrenamiento etiquetado de datos históricos. Aprende la relación entre entradas y salidas y mide luego cuán bien predice las salidas de un conjunto de prueba con salidas reales conocidas. Así puede usarse después para predecir datos completamente nuevos. Incluye regresión lineal y logística, árboles de decisión y SVM. Tareas comunes: predecir precios de vivienda y clasificar mensajes como spam o no spam.

SVM

SVM (Support Vector Machine) es un algoritmo supervisado usado sobre todo para clasificación, aunque también para regresión. En clasificación, proporciona un hiperplano óptimo que separa las observaciones de ambas clases (en multiclase descompone el problema en varios binarios). En regresión, ofrece el hiperplano de mejor ajuste dentro de un umbral definido.

Datos sintéticos

Los datos sintéticos son datos creados artificialmente. Suelen reflejar las propiedades estadísticas del conjunto original, por lo que pueden usarse en ámbitos de alta privacidad como banca y salud, o para ampliar un conjunto existente con observaciones adicionales representativas.

T

Variable objetivo

La variable objetivo (también llamada variable dependiente) es la que un algoritmo de machine learning intenta predecir usando características. Por ejemplo, si predecimos la probabilidad de diabetes con altura, peso e ingesta de azúcar, el estado de diabetes es la variable objetivo.

Conjunto de prueba

El conjunto de prueba es un subconjunto de los datos disponible antes de construir un modelo, normalmente entre el 20 y el 30% del total. Se utiliza para evaluar la precisión de los modelos ajustados sobre el conjunto de entrenamiento.

Serie temporal

Una serie temporal es una secuencia de observaciones de una variable tomadas en distintos momentos y ordenadas cronológicamente. Normalmente se miden en intervalos sucesivos y equiespaciados. Ejemplos: precios bursátiles o temperatura a lo largo del tiempo.

Conjunto de entrenamiento

El conjunto de entrenamiento es un subconjunto de los datos disponible antes de construir un modelo, normalmente entre el 70 y el 80% del total. Se usa para ajustar el modelo que se evaluará después con el conjunto de prueba.

Verdadero negativo (TN)

Un verdadero negativo (TN) es un resultado en el que el modelo predice correctamente la clase negativa para una variable objetivo binaria (p. ej., predice «Falso» cuando la etiqueta real es Falso).

Verdadero positivo (TP)

Un verdadero positivo (TP) es un resultado en el que el modelo predice correctamente la clase positiva para una variable objetivo binaria (p. ej., predice «Verdadero» cuando la etiqueta real es Verdadero).

U

Subajuste

El subajuste ocurre cuando un modelo no es capaz de detectar los patrones del conjunto de entrenamiento porque se ha construido con información insuficiente. Como resultado, es demasiado simple y rinde mal tanto con datos no vistos como con el propio entrenamiento. Los modelos subajustados tienen alto sesgo.

Modelado univariante

El modelado univariante es el proceso de modelar la relación entre una sola variable (predictor) y la variable objetivo. Suele usarse con series temporales.

Datos no estructurados

Los datos no estructurados son aquellos que no encajan en una estructura predefinida, como la típica de filas y columnas de una base de datos. Ejemplos: imágenes, correos electrónicos, documentos de texto, vídeos y audio.

Aprendizaje no supervisado

El aprendizaje no supervisado es una clase de algoritmos de machine learning que aprenden la estructura subyacente de un conjunto de datos sin una variable objetivo. Sirve para descubrir patrones comunes, agrupar valores según sus atributos y luego realizar predicciones sobre datos no vistos. El algoritmo más común es k-means. Tareas frecuentes: detección de anomalías y segmentación de clientes por características comunes.

V

Varianza

La varianza es la media de las diferencias al cuadrado entre los valores individuales y la media del conjunto en matemáticas y estadística; en otras palabras, mide la dispersión. En machine learning, la varianza es un error causado por la sensibilidad del modelo a pequeñas variaciones en el conjunto de entrenamiento. Una varianza alta refleja tendencia a aprender ruido aleatorio, lo que conduce al sobreajuste.

W

Web scraping

El web scraping es el proceso de extraer datos específicos de sitios web para su uso posterior. Puede automatizarse escribiendo un programa que capture la información necesaria de una web.

Z

Z-score

El z-score (también llamado puntuación tipificada, estándar o normalizada) es el número de unidades de desviación estándar que un valor observado está por encima o por debajo de la media del conjunto. Un z-score igual a 0 indica que la observación está cerca de la media.

Temas
Ciencia de datos
Alfabetización informática
Relacionado

blog

¿Qué es la ciencia de datos? Definición, ejemplos, herramientas y más

La ciencia de datos es un campo interdisciplinar que utiliza métodos, procesos, algoritmos y sistemas científicos para extraer conocimientos e ideas de datos estructurados y sin estructurar.
Matt Crabtree's photo

Matt Crabtree

15 min

blog

¿Qué es el data wrangling? Guía práctica con ejemplos

Aprende los conceptos y teorías fundamentales del data wrangling con ejemplos prácticos. Aplica estas habilidades en tu trabajo diario de data science para generar datos limpios y útiles para tus modelos.
Tim Lu's photo

Tim Lu

12 min

blog

28 preguntas principales de la entrevista a un científico de datos para todos los niveles

Explora las preguntas principales de la entrevista sobre ciencia de datos con respuestas para estudiantes de último curso y profesionales en busca de empleo.
Abid Ali Awan's photo

Abid Ali Awan

15 min

blog

Las 15 habilidades más importantes para los científicos de datos en 2026

Una lista de las habilidades imprescindibles que todo científico de datos debería tener en su caja de herramientas, incluidos recursos para desarrollar tus habilidades.
Javier Canales Luna's photo

Javier Canales Luna

8 min

blog

¿Qué es la alfabetización de datos? Guía para 2026 dirigida a los responsables de datos y análisis

Descubre la importancia de la alfabetización en datos en el mundo actual, impulsado por los datos.
Matt Crabtree's photo

Matt Crabtree

15 min

blog

Científico de datos vs Ingeniero de datos

Explicación de las diferencias entre ingenieros de datos y científicos de datos: responsabilidades, herramientas, lenguajes, perspectivas laborales, salario, etc.
Karlijn Willems's photo

Karlijn Willems

11 min

Ver MásVer Más