
Artificial Neural Networks (ANN)
Clasificación de variables categóricas
Validación cruzada (no validado)
Sistema de gestión de bases de datos (DBMS)
Reducción de la dimensionalidad
Falso negativo (FN, error de tipo II)
Falso positivo (FP, error de tipo I)
Procesamiento del lenguaje natural (NLP)
Análisis de componentes principales (PCA)
Raíz del error cuadrático medio (RMSE)
A
Accuracy score
El accuracy score es una métrica de evaluación que se usa para estimar el rendimiento de un modelo de machine learning y mostrar la proporción entre el número de predicciones correctas y el total de predicciones.
Función de activación
Una función de activación se utiliza en las artificial neural networks (ANN) para determinar si una neurona debe activarse o no calculando su salida hacia la siguiente capa oculta (o capa de salida) en función de la entrada de la capa anterior (o capa de entrada). La función de activación es responsable de la transformación no lineal de una red neuronal.
Algoritmo
Un algoritmo es una secuencia de pasos repetibles, a menudo expresados matemáticamente, escritos por una persona y ejecutados por un ordenador, para resolver un tipo concreto de problema de ciencia de datos. Hay algoritmos muy simples y otros extremadamente complejos. Distintos algoritmos se adaptan mejor a diferentes tareas y tecnologías. La idea principal es que un algoritmo recibe una entrada y produce una salida, y la misma entrada siempre producirá la misma salida. En machine learning, los algoritmos reciben como entrada datos e hiperparámetros, identifican y aprenden patrones comunes de los datos y generan salidas en forma de predicciones.
Apache Spark
Apache Spark es un framework de procesamiento paralelo multifunción de código abierto para analizar y modelar big data. Spark permite distribuir datos y cálculos en clústeres con múltiples nodos (piensa en cada nodo como un ordenador independiente). Dividir los datos facilita trabajar con conjuntos muy grandes porque cada nodo solo maneja una pequeña parte. A medida que cada nodo procesa su propio subconjunto, también realiza una parte del total de cálculos necesarios, de modo que tanto el procesamiento como el cómputo se ejecutan en paralelo en los nodos del clúster. El cómputo en paralelo puede acelerar mucho ciertos tipos de tareas de programación.
API
API son las siglas de Application Programming Interface, un intermediario de software que permite la conexión entre aplicaciones o equipos. Un ejemplo de API es incrustar Google Maps en una aplicación de transporte compartido. Las personas de datos trabajan a menudo con APIs para acceder a datos (por ejemplo, la API de Twitter para descargar tuits) o para empaquetar una solución que han creado (por ejemplo, una API que llama a un modelo de machine learning en producción).
Inteligencia artificial (IA)
La inteligencia artificial es una rama de la informática que utiliza técnicas de machine learning, programación y ciencia de datos para que los ordenadores se comporten de forma inteligente. Los sistemas de IA son amplios y varían en complejidad. Pueden ir desde sistemas basados en reglas hasta sistemas basados en aprendizaje automático y realizar tareas como detección de fraude, reconocimiento de objetos, traducción de idiomas, predicción de precios de acciones y mucho más.
Artificial Neural Networks (ANN)
Una artificial neural network es un modelo de machine learning vagamente inspirado en las redes neuronales biológicas del cerebro humano. Las redes neuronales constan de hasta cientos de capas de unidades interconectadas llamadas neuronas. Conceptualmente, una red neuronal artificial tiene capas de entrada, salida y capas ocultas por las que se filtran los datos, se procesan con una función de activación y se generan predicciones en la salida. Las ANN son los pilares del deep learning, un subcampo del aprendizaje automático que ofrece salidas complejas como reconocimiento de imágenes o sonido, detección de objetos, traducción de idiomas y más.
B
Backpropagation (BP)
Backpropagation es una técnica usada al entrenar redes de deep learning basada en implementar el descenso de gradiente para ajustar iterativamente pesos y sesgos y así mejorar la precisión de la red. El algoritmo calcula el error de la salida en cada iteración de entrenamiento y luego lo propaga hacia atrás por la red, lo que permite minimizar el error en futuras iteraciones.
Red bayesiana
Una red bayesiana es un grafo probabilístico que muestra la relación entre variables aleatorias en un dominio incierto, donde los nodos representan esas variables y los enlaces entre pares de nodos (aristas) representan la probabilidad condicional de las variables correspondientes. Un ejemplo de redes bayesianas aparece en diagnósticos médicos, donde se predicen resultados de salud teniendo en cuenta todos los factores que pueden influir en ellos.
Teorema de Bayes
El teorema de Bayes es una ecuación matemática para calcular la probabilidad condicional, es decir, la probabilidad de que ocurra un evento B dado que un evento relacionado A ya ha sucedido. Una de sus aplicaciones en ciencia de datos es construir redes bayesianas para grandes conjuntos de datos.
Sesgo
El sesgo se refiere a la tendencia de los modelos a infraajustar los datos, lo que conduce a predicciones inexactas en machine learning y ciencia de datos. Esta es la definición de sesgo que suele mencionarse en el equilibrio sesgo-varianza. Además, sesgo también puede referirse al sesgo algorítmico: la propensión de los modelos de aprendizaje automático a reproducir sesgos sociales dañinos tratando de forma distinta a distintos grupos de personas en función de atributos protegidos como raza, orientación sexual, identidad de género, edad, embarazo, condición de veterano, y más.
Equilibrio sesgo-varianza
El equilibrio sesgo-varianza es la compensación entre sesgo y varianza al crear un modelo de machine learning. Son dos tipos de error de predicción: un sesgo alto indica infraajuste del modelo y una varianza alta indica sobreajuste. Minimizar ambos factores hasta un nivel óptimo reduce el error total de las predicciones.
Big data
Big data es el ámbito dedicado a procesar, tratar y extraer información de conjuntos de datos que son demasiado grandes o complejos para las herramientas tradicionales de procesamiento. Se define por las cinco V: velocidad (rapidez de generación de datos), volumen (cantidad generada), variedad (tipos de datos, p. ej., texto, imágenes, datos tabulares), veracidad (calidad y fiabilidad) y valor (capacidad de traducirse en insights de negocio valiosos).
Distribución binomial
La distribución binomial es la distribución de probabilidad discreta de los resultados de ensayos independientes, con dos resultados mutuamente excluyentes (éxito y fracaso), un número finito de ensayos y una probabilidad de éxito constante. En pocas palabras, puede verse como la probabilidad de un resultado concreto (éxito o fracaso) en un evento repetido varias veces (p. ej., la probabilidad de obtener un 3 en un dado lanzado 5 veces).
Analista de negocio
Las personas analistas de negocio conectan insights de datos con resultados accionables que aumentan la rentabilidad o la eficiencia. Conocen a fondo el dominio de negocio y suelen usar SQL junto con herramientas sin código para comunicar los insights obtenidos de los datos.
Business analytics (BA)
Business analytics es un subcampo del análisis centrado en usar datos históricos y actuales para descubrir insights operativos valiosos, anticipar posibles tendencias futuras y tomar decisiones empresariales basadas en datos. Suele incluir análisis estadístico, analítica descriptiva y visualización de datos, y puede abarcar analítica predictiva y machine learning.
Business intelligence (BI)
Business intelligence es un subcampo del análisis que combina analítica descriptiva, business analytics, visualización de datos, análisis estadístico, informes y más, con el objetivo de ayudar a las organizaciones a tomar decisiones basadas en datos. BI suele apoyarse en herramientas sin código como Tableau y Power BI para explorar tendencias en datos históricos y actuales. A diferencia de business analytics, se centra principalmente en la analítica descriptiva.
C
Variable categórica
Una variable categórica puede tomar uno de un número limitado de valores posibles (categorías) sin un orden intrínseco. Un ejemplo sería el estado civil (p. ej., casado, soltero, divorciado). También se denomina variable nominal o cualitativa.
Clasificación
La clasificación es un problema de aprendizaje supervisado en el que hay que predecir resultados categóricos a partir de características de entrada. Ejemplos: detección de fraude (¿es esta transacción fraudulenta dado el conjunto de características?) y filtros de spam (¿este email es spam o no?). Algoritmos habituales: k-nearest neighbors, árboles de decisión, random forest, etc.
Clustering
El clustering es un problema de aprendizaje no supervisado que agrupa las observaciones de un conjunto de datos según su similitud por ciertas características comunes. A diferencia de la clasificación, estos grupos (clusters) no están predefinidos por personas, sino que los identifica el algoritmo al aprender de los datos. Los elementos de cada clúster son similares entre sí y distintos de los de los demás. Algoritmos comunes: k-means, clustering jerárquico, clustering espectral, etc.
Informática
La informática es un campo multifacético centrado en los aspectos teóricos y prácticos del procesamiento de información en ordenadores digitales, el diseño de hardware y software, y sus aplicaciones. En particular, abarca inteligencia artificial, sistemas de computación, algoritmos, estructuras de datos, modelado de datos, seguridad, diseño de ordenadores y redes, etc.
Visión por computador
La visión por computador es un área de la informática que busca que los ordenadores comprendan a alto nivel imágenes o vídeos digitales de forma similar a como los percibimos las personas. Ha ganado popularidad con la evolución del deep learning y la acumulación de big data. Sus aplicaciones incluyen reconocimiento de objetos y rostros, análisis de movimiento, coches autónomos y reconocimiento óptico de caracteres.
Matriz de confusión
Una matriz de confusión es una tabla que ilustra el rendimiento predictivo de un modelo de clasificación. Suele crearse para salidas binarias (p. ej., si una transacción es fraudulenta o no), dando lugar a una tabla de dos por dos. Representa la relación entre predicciones y etiquetas reales para ambas clases y muestra fácilmente cuántas predicciones correctas hay (verdaderos positivos y verdaderos negativos) y cuántos falsos positivos (error de tipo I) y falsos negativos (error de tipo II).
Variable continua
Una variable continua puede tomar un conjunto infinito de valores dentro de un rango determinado. Ejemplos: altura y peso.
Correlación
La correlación es la fuerza y dirección de la relación entre dos o más variables, medida por un coeficiente de correlación o coeficiente de Pearson. Estadísticamente, es la razón entre la covarianza de dos variables y el producto de sus desviaciones estándar. Toma valores de -1 (correlación negativa perfecta) a 1 (positiva perfecta). La correlación no implica causalidad.
Función de coste
La función de coste es una función en machine learning que mide la media de las diferencias entre los valores predichos y los reales sobre el conjunto de entrenamiento y que se pretende minimizar.
Covarianza
La covarianza mide la relación entre dos variables. A diferencia de la varianza, que mide variaciones dentro de una misma variable, la covarianza muestra cómo las variaciones de una influyen en los cambios de la otra. Se utiliza para calcular el coeficiente de correlación.
Validación cruzada (no validado)
La validación cruzada es un método de remuestreo al entrenar modelos de machine learning que divide los datos etiquetados en conjuntos de entrenamiento y de prueba. En cada iteración se usan partes distintas de los datos para entrenar y probar el modelo. Con el entrenamiento se ajusta el modelo y con la prueba se generan predicciones que se comparan con las etiquetas reales. Después se calcula una métrica global de precisión para estimar el rendimiento predictivo.
D
Cuadro de mando
Un cuadro de mando es una interfaz gráfica e interactiva para visualizar, resumir e informar sobre KPIs, métricas de progreso e información de procesos de negocio, que permite al público objetivo captar con facilidad los insights más importantes. Se construye con herramientas sin código como Excel, Tableau o Power BI, o con herramientas de código como Python y R, y suele estar vinculado a bases de datos y servicios actualizados regularmente.
Análisis de datos (DA)
El análisis de datos se centra en limpiar, transformar, visualizar y explorar datos para extraer patrones e insights relevantes, y comunicar los resultados a las personas interesadas. Suele ser el primer hito en proyectos de ciencia de datos, aunque también puede ser un proyecto independiente. A diferencia de la ciencia de datos, se orienta más a la analítica descriptiva que a la predictiva.
Data analyst
Al igual que las personas analistas de negocio, las data analysts son responsables de analizar datos e informar de los insights de su análisis. Domina el flujo de trabajo analítico y comunican sus hallazgos usando una combinación de herramientas con y sin código.
Base de datos
Una base de datos es un espacio de almacenamiento estructurado donde los datos se organizan en múltiples tablas para que la información necesaria se pueda acceder y resumir fácilmente. Se utilizan principalmente con un sistema de gestión de bases de datos relacional (RDBMS) como Oracle o PostgreSQL. El lenguaje más común para interactuar con los datos es SQL.
Sistema de gestión de bases de datos (DBMS)
Un sistema de gestión de bases de datos es un paquete de software para realizar fácilmente distintas operaciones sobre los datos: acceder, manipular, recuperar, gestionar y almacenar datos en una base. Según cómo se organicen los datos, hay distintos tipos de DBMS: relacional, de grafos, jerárquico, etc. Ejemplos: Oracle, MySQL, PostgreSQL, Microsoft SQL Server, MongoDB.
Consumidor de datos
Las personas consumidoras de datos suelen desempeñar funciones no técnicas, pero consumen insights y analítica proporcionados por profesionales de datos para tomar decisiones basadas en datos. A menudo necesitan conversar con estos profesionales y distinguir cuándo los datos pueden y cuándo no pueden responder a preguntas de negocio.
Data engineer
Una persona data engineer es especialista en poner los datos adecuados en manos de data scientists y data analysts. Diseña y mantiene la infraestructura de almacenamiento y las canalizaciones de datos que llevan grandes volúmenes de datos en bruto de diversas fuentes a un lugar centralizado con datos limpios, correctamente formateados y relevantes para la organización.
Data engineering (DE)
Data engineering es una especialización centrada en escalar el acceso a los datos dentro de la organización. Se ocupa de la adquisición, recopilación, gestión y almacenamiento de datos, así como de configurar canalizaciones y transformar los datos en información de alta calidad y utilizable por el resto del equipo.
Enriquecimiento de datos
El enriquecimiento de datos es el proceso de mejorar, refinar y ampliar los datos en bruto para que sean más útiles para la organización, obtener insights de negocio más significativos y optimizar la analítica predictiva.
Dataframe
Un dataframe es una estructura de datos tabular con ejes etiquetados (filas y columnas) que pueden ser de tipos distintos.
Gobernanza de datos
DAMA define la gobernanza de datos como «La planificación, supervisión y control sobre la gestión de los datos y de los recursos relacionados con los datos». Establece roles, responsabilidades y procesos para garantizar la disponibilidad, relevancia, calidad, usabilidad, integridad y seguridad de los datos. Incluye un órgano de gobierno, un marco de normas y prácticas para cubrir las necesidades de información de la empresa, y un programa para ejecutarlas.
Periodismo de datos
El periodismo de datos es un tipo de periodismo centrado en procesar y analizar grandes volúmenes de datos numéricos con el objetivo de crear una historia sobre los datos o la información derivada de ellos. Surgió por el crecimiento continuo del flujo de información y la mayor interacción del periodismo con áreas como la estadística, las tecnologías de la información y la ciencia de datos.
Data lake
Un data lake es un repositorio único que contiene una gran cantidad de datos en bruto y sin procesar de cualquier tipo y de diversas fuentes, aún sin un propósito definido. Incluye tanto datos estructurados de distintas estructuras sin relación entre sí como, más a menudo, datos no estructurados, como documentos y archivos de texto. Los datos en bruto se conservan como fuente original sin necesidad de estructurarlos ni tratarlos salvo cuando se necesiten.
Competencia en datos
La competencia en datos es la capacidad de leer, escribir, analizar, comunicar y razonar con datos para tomar mejores decisiones basadas en datos. A nivel organizativo, es un espectro de habilidades que va desde la toma de decisiones basada en datos hasta competencias técnicas avanzadas en ciencia de datos, data engineering y machine learning, con el fin de que toda la organización tenga las competencias adecuadas y genere valor a escala a partir de los datos.
Minería de datos
La minería de datos es el proceso de recopilar datos relevantes de varias fuentes, limpiarlos y transformarlos al formato adecuado, detectar y extraer tendencias, patrones e interconexiones significativas, y comunicar insights accionables para ayudar a tomar decisiones basadas en datos y diseñar mejores estrategias. Para ello se emplean técnicas analíticas y de modelado como análisis estadístico, visualización, regresión y clasificación.
Modelado de datos
El modelado de datos es el proceso de desarrollar una representación visual de todo un sistema de TI, o de partes del mismo, para comunicar las conexiones entre puntos y estructuras de datos. Muestra los tipos de datos utilizados y almacenados, las relaciones entre fuentes distintas y cómo se agrupan según atributos y características. En ciencia de datos, también puede referirse a construir modelos fiables que transformen datos en bruto en insights predictivos, consistentes y accionables, entendiendo bien las necesidades de negocio, las fuentes disponibles y los plazos, y proporcionando un marco basado en datos y bien formateado para satisfacerlas.
Canalización de datos
Una canalización de datos es un conjunto de scripts de procesamiento enlazados que automatizan el flujo de datos por la organización, donde se extraen, transforman y cargan para que estén listos para su uso.
Ciencia de datos (DS)
La ciencia de datos es un campo interdisciplinar que utiliza métodos científicos, técnicas avanzadas de análisis y algoritmos de modelado predictivo para extraer insights relevantes de los datos y ayudar a responder preguntas estratégicas de negocio o científicas. Combina un amplio abanico de habilidades técnicas y no técnicas y suele requerir un sólido conocimiento del dominio donde se aplica para interpretar correctamente los datos disponibles y los resultados obtenidos.
Data scientist
Las personas data scientist investigan, extraen y comunican insights relevantes a partir de los datos de la organización. Transmiten estos insights a perfiles no técnicos, entienden bien los flujos de trabajo de machine learning y cómo conectarlos con aplicaciones de negocio. Trabajan casi exclusivamente con herramientas de código, realizan análisis y a menudo utilizan herramientas de big data.
Conjunto de datos
Un conjunto de datos es una colección de datos de uno o varios tipos que representan observaciones reales o generadas sintéticamente y que se usan para análisis estadístico o modelado de datos. Suele almacenarse en alguna estructura, normalmente una tabla, donde las columnas corresponden a variables y las filas a entradas de datos.
Estructura de datos
Una estructura de datos es una forma de organizar y almacenar datos para acceder a ellos y trabajar de manera eficiente. Define la relación entre los datos y las operaciones que pueden realizarse. Estructuras comunes en ciencia de datos son dataframes, listas, arrays y más.
Visualización de datos
La visualización de datos es un campo interdisciplinar que se ocupa de condensar y representar información en formato visual. Los datos pueden visualizarse en mapas, histogramas, gráficos de barras y líneas, y combinarse en infografías, cuadros de mando y más, para ayudar al público objetivo a comprender mejor los datos subyacentes y los resultados obtenidos.
Data warehouse
Un data warehouse es un repositorio central para almacenar datos estructurados, limpios y transformados recogidos de múltiples fuentes mediante procesos ETL (extracción, transformación y carga). Las y los profesionales de datos acceden fácilmente a la información a través de herramientas de business intelligence, consultas SQL, etc., y la utilizan para análisis y modelado con los que responder preguntas de negocio.
Data wrangling
El data wrangling, también llamado data munging, abarca tareas de limpieza, reestructuración, combinación, agregación y transformación de datos al formato adecuado para un fin concreto. En resumen, es la preparación de los datos para facilitar su acceso y análisis.
Árbol de decisión
Un árbol de decisión es un algoritmo de aprendizaje supervisado usado sobre todo para clasificación, aunque también para regresión. Formula una secuencia de preguntas if-else sobre características individuales con el objetivo de inferir las etiquetas de clase. Se beneficia de una representación en forma de árbol, imita la toma de decisiones humana y su lógica es intuitiva, pero tiende a sobreajustar.
Deep learning (DL)
El deep learning es un subconjunto de algoritmos de machine learning basado en artificial neural networks (ANN) multicapa, inspiradas en la estructura del cerebro. Las ANN son muy flexibles y pueden aprender de cantidades masivas de datos para ofrecer salidas muy precisas. Suelen estar detrás de casos de uso como reconocimiento de imágenes o sonido, traducción de idiomas y otros problemas avanzados.
Reducción de la dimensionalidad
La reducción de la dimensionalidad consiste en reducir el número de características del conjunto de entrenamiento, conservando solo las más relevantes que capturan la mayor parte de la variación, para mejorar el rendimiento del modelo. Es especialmente útil con conjuntos grandes con muchas variables: ayuda a optimizar almacenamiento y tiempo de cómputo y a corregir la multicolinealidad. La técnica más popular es el PCA.
E
EDA
EDA son las siglas de exploratory data analysis y se refiere a la primera fase del análisis de datos, centrada en explorar lo disponible, resumir sus características principales y encontrar patrones y tendencias iniciales, problemas a corregir y preguntas para investigar después. En esta etapa, una persona analista o data scientist obtiene una comprensión general de los datos como base para un análisis más detallado.
ELT
ELT (extract, load, transform) es un sistema de canalización de datos diseñado por data engineers, alternativa al más popular ETL (extract, transform, load). Antes de aplicar transformaciones, los datos en bruto se cargan en el data lake y se transforman allí. Su ventaja frente a ETL es que requiere menos tiempo, se adapta a grandes volúmenes y es más rentable.
ETL
ETL (extract, transform, load) es un sistema de canalización de datos diseñado por data engineers. Los datos se extraen de múltiples fuentes, se transforman desde su forma en bruto a un formato adecuado y consistente con otras fuentes, y se cargan en el data warehouse de destino. Desde ahí se usan para análisis y modelado que resuelven problemas de negocio.
Métricas de evaluación
Las métricas de evaluación son un conjunto de medidas para estimar el rendimiento de un modelo estadístico o de machine learning. Ejemplos: accuracy score, f-score, recall y RMSE.
F
Falso negativo (FN, error de tipo II)
Un falso negativo es un resultado en el que un modelo de clasificación predice incorrectamente la clase negativa para una variable objetivo binaria (p. ej., si predecimos churn, un falso negativo sería predecir «no hará churn» cuando la etiqueta real es «hará churn»).
Falso positivo (FP, error de tipo I)
Un falso positivo es un resultado en el que un modelo de clasificación predice incorrectamente la clase positiva para una variable objetivo binaria. Por ejemplo, si predecimos churn, un falso positivo sería predecir «hará churn» cuando la etiqueta real es «no hará churn».
Característica (feature)
Una característica es una variable independiente usada como entrada en un modelo de machine learning. Por ejemplo, si predecimos la probabilidad de diabetes usando altura, peso e ingesta de azúcar, esas tres son características.
Ingeniería de características
La ingeniería de características es el proceso de usar conocimiento del dominio y experiencia técnica para transformar características en bruto en otras que reflejen mejor el problema subyacente y se adapten mejor a los algoritmos de machine learning. Incluye extraer nuevas características o manipular las existentes. Por ejemplo, para predecir probabilidad de diabetes, calcular el IMC a partir de altura y peso es ingeniería de características.
Selección de características
La selección de características consiste en elegir un subconjunto de las más relevantes del conjunto de datos para predecir la variable objetivo. Es especialmente importante en conjuntos grandes, ya que reduce la complejidad del modelo, el sobreajuste y el tiempo de cómputo, y aumenta la precisión.
F-score
El F-score es una métrica de evaluación que combina precisión y recall. Habitualmente se usa el F1-score, que es la media armónica de precisión y recall. El caso genérico es Fβ, donde se da más peso a una u otra.
G
Descenso de gradiente
El descenso de gradiente es un proceso iterativo de optimización usado en machine learning para minimizar la función de coste encontrando los valores óptimos de sus parámetros.
H
Hadoop
Hadoop es un framework de software en Java y de código abierto que permite el procesamiento paralelo y el almacenamiento distribuido de big data en clústeres de muchos ordenadores. Hadoop ahorra tiempo y permite manejar volúmenes de datos mucho mayores que con un solo equipo.
Hiperparámetro
Los hiperparámetros son atributos de un modelo de machine learning cuyo valor se fija manualmente antes de iniciar el entrenamiento. A diferencia de otros parámetros, no se estiman ni aprenden directamente de los datos. Ajustándolos y evaluando el rendimiento resultante, podemos determinar sus valores óptimos para lograr el mejor modelo. Intuitivamente, afinar un hiperparámetro es como sintonizar una radio en busca de la señal perfecta. Un ejemplo es el número de árboles en un algoritmo de random forest.
Hipótesis
Una hipótesis es una suposición sobre un problema o fenómeno que debe ponerse a prueba y, según el resultado del experimento, confirmarse o rechazarse.
I
Imputación
La imputación es el proceso de rellenar valores faltantes en un conjunto de datos. Las técnicas pueden ser estadísticas (imputación por media/moda) o de machine learning (imputación con KNN).
K
K-means
K-means es el algoritmo de clustering más popular: identifica K centros de clúster (centroides) con coordenadas tentativas en los datos y asigna iterativamente cada observación al centro más cercano según sus características hasta que los centroides convergen. Los puntos dentro de un clúster son similares entre sí y distintos de los de los demás.
K-nearest neighbors (KNN)
K-nearest neighbors es un algoritmo supervisado que clasifica observaciones en función de su similitud con sus vecinos más cercanos. Los parámetros más importantes a ajustar son el número de vecinos y la métrica de distancia (Minkowski, euclídea, Manhattan, etc.).
L
Álgebra lineal
El álgebra lineal es una rama de las matemáticas que estudia sistemas lineales: rectas, planos, espacios vectoriales, matrices y sus operaciones (suma, multiplicación, etc.). Es muy útil en ciencia de datos y machine learning, ya que los conjuntos de datos y muchos modelos pueden representarse en forma matricial.
Regresión lineal
La regresión lineal es un algoritmo de regresión que modela una relación lineal entre una variable objetivo continua y una o varias características continuas. Un ejemplo típico es la predicción de precios a partir de distintos atributos de entrada.
Regresión logística
La regresión logística es un algoritmo de regresión que utiliza una función logística sobre las características de entrada para predecir la probabilidad de clase o directamente la etiqueta de clase de la variable objetivo. En este segundo caso, la salida es un conjunto de categorías en lugar de valores continuos, actuando así como técnica de clasificación. Un caso de uso típico es predecir la probabilidad de churn de clientes.
M
Machine learning (ML)
El machine learning es una rama de la inteligencia artificial (IA) que ofrece algoritmos diseñados para aprender patrones y tendencias a partir de datos históricos. Su propósito es predecir resultados futuros y generalizar más allá de los puntos del conjunto de entrenamiento sin programación explícita. Hay dos tipos principales: supervisado y no supervisado, cada uno con numerosas técnicas para distintos casos de uso.
Media
La media es el valor promedio aritmético de un conjunto de números, es decir, la suma de todos los valores dividida entre el número de valores. Suele usarse junto con otras estadísticas para tener una visión general del conjunto.
Error absoluto medio (MAE)
El error absoluto medio (MAE) es el promedio aritmético de todos los errores absolutos entre los valores predichos y los reales.
Error cuadrático medio (MSE)
El error cuadrático medio (MSE) es el promedio aritmético de los cuadrados de todos los errores entre los valores predichos y los reales.
Mediana
La mediana es el valor central de un conjunto de números ordenados. Si hay un número par de valores, es la media aritmética de los dos centrales. Se usa junto con otras estadísticas para entender el conjunto y es especialmente útil para detectar posibles valores atípicos.
Moda
La moda es el valor (o valores) que más se repite en un conjunto de datos.
Ajuste de modelos
El ajuste de modelos es el proceso de ajustar los hiperparámetros para maximizar la precisión del modelo sin sobreajustarlo.
Modelado multivariante
El modelado multivariante es el proceso de modelar la relación entre múltiples variables (predictores) definidas en la selección de características y la variable objetivo.
N
Naive Bayes
Naive Bayes es un conjunto de algoritmos de clasificación basados en el teorema de Bayes y en la hipótesis de independencia entre las características usadas en el clasificador. Aunque en la práctica no siempre son independientes, estos algoritmos pueden aplicarse con éxito en casos como filtrado de spam o análisis de sentimiento.
Procesamiento del lenguaje natural (NLP)
El procesamiento del lenguaje natural (NLP) es una rama de la informática que busca que las aplicaciones entiendan y analicen el lenguaje humano escrito o hablado. Las técnicas de NLP toman texto (normalmente no estructurado), lo convierten en una forma estructurada, buscan patrones lingüísticos y contextuales, los categorizan y extraen insights. También aprovecha machine learning y deep learning para generar lenguaje, categorizarlo y realizar otras tareas cognitivas. Ejemplos: chatbots, conversión de voz a texto, análisis de sentimiento y traducción automática.
Normalización
La normalización es el proceso de reescalar los datos para que todos los atributos tengan la misma escala. Es necesaria para comparar atributos de forma significativa y la requieren algunos algoritmos de machine learning.
NoSQL
NoSQL significa "not only SQL". Es un sistema de gestión de bases de datos para el almacenamiento y recuperación de bases de datos no relacionales (no tabulares). Algunos modelos no relacionales son grafos, documentos y pares clave-valor. Los sistemas NoSQL destacan por su alta flexibilidad y velocidad operativa, y por poder escalarse en muchos servidores.
Hipótesis nula
La hipótesis nula es un tipo de hipótesis que afirma lo contrario de la hipótesis alternativa que se quiere comprobar; es decir, que no existe una relación estadística significativa entre dos variables y que las observaciones se deben al azar. Puede rechazarse o confirmarse mediante un experimento estadístico.
O
Código abierto
Código abierto se refiere a software y recursos con licencia libre disponibles para modificar y compartir. Las herramientas open source facilitan la colaboración entre personas usuarias y suelen ser más estables, ya que la comunidad puede añadir funciones útiles o corregir problemas técnicos y errores.
Variable ordinal
Una variable ordinal puede tomar uno de un número limitado de valores posibles con un orden intrínseco. Un ejemplo sería una pregunta de encuesta con respuestas ordenadas por intensidad (p. ej., «Totalmente en desacuerdo», «En desacuerdo», «Neutral», «De acuerdo», «Totalmente de acuerdo»).
Valor atípico
Un valor atípico es un valor anómalo en un conjunto de datos que se desvía considerablemente del resto de observaciones. Puede indicar un error de medición o un suceso extraordinario.
Sobreajuste
El sobreajuste se produce cuando un modelo aprende demasiada información del conjunto de entrenamiento, incluyendo posible ruido y valores atípicos. Como resultado, se vuelve demasiado complejo y dependiente de ese conjunto y rinde mal con datos no vistos. El sobreajuste implica alta varianza en el equilibrio sesgo-varianza.
P
Parámetro
Un parámetro es una variable con nombre que se pasa a una función en programación y ciencia de datos. En machine learning, los parámetros son componentes internos de un algoritmo que se aprenden a partir de los datos. Algunos algoritmos son paramétricos, con un conjunto fijo de parámetros (p. ej., regresión lineal y logística), mientras que otros son no paramétricos (p. ej., k-nearest neighbors).
Precisión
La precisión es una métrica de evaluación para estimar el rendimiento de un modelo de machine learning que muestra la proporción entre el número de casos positivos predichos correctamente y el total de casos predichos como positivos.
Analítica predictiva
La analítica predictiva es el proceso de analizar datos históricos mediante análisis estadístico, minería de datos, visualización y machine learning para predecir eventos futuros en un negocio.
Análisis de componentes principales (PCA)
El análisis de componentes principales (PCA) es una técnica estadística de análisis factorial y reducción de la dimensionalidad que transforma un conjunto de características iniciales posiblemente correlacionadas en un conjunto más pequeño de características linealmente no correlacionadas llamadas componentes principales. Así, el PCA conserva la mayor varianza posible minimizando el número de características.
Python
Python es un lenguaje de programación de alto nivel, orientado a objetos y de código abierto. Es muy popular en ciencia de datos, pero también ampliamente usado para programación general. Es intuitivo y fácil de aprender y usar, y aun así muy potente para resolver problemas complejos. Ofrece una biblioteca estándar extensa y muchos módulos adicionales útiles, y está en constante evolución y mejora.
R
R
R es un lenguaje de programación y software libre muy popular para resolver problemas de ciencia de datos y machine learning, especialmente conocido por su potencia en computación estadística y sus excelentes soluciones de visualización. Incluye numerosas herramientas y paquetes, funciona en muchos sistemas operativos y cuenta con una comunidad en línea muy activa.
Random forest
Random forest es un algoritmo supervisado para problemas de regresión o clasificación que combina las salidas de muchos árboles de decisión en un único modelo. Sus predicciones representan esencialmente el promedio de los árboles, por lo que suele ofrecer resultados más precisos que un solo árbol.
Exhaustividad (recall)
El recall es una métrica de evaluación para estimar el rendimiento de un modelo de machine learning que muestra la proporción entre el número de casos positivos predichos correctamente y el total de casos positivos reales.
Regresión
La regresión es un problema de aprendizaje supervisado en el que hay que predecir resultados continuos a partir de características de entrada. El modelo aprende la relación entre una o varias características independientes y la variable objetivo, y luego usa la función aprendida para predecir datos no vistos. Ejemplos de algoritmos: regresión lineal y regresión ridge. Un problema típico es la predicción de precios.
Reinforcement learning (RL)
El reinforcement learning (RL) es una rama independiente del aprendizaje automático (ni supervisado ni no supervisado) en la que un algoritmo aprende gradualmente interactuando con un entorno. Toma decisiones basándose en su experiencia pasada sobre qué acciones lo acercan a un objetivo. Recibiendo recompensas por aciertos y penalizaciones por errores, encuentra la estrategia óptima para maximizar su desempeño. Ejemplos incluyen sistemas que juegan al ajedrez o agentes de videojuegos.
Base de datos relacional
Una base de datos relacional almacena datos en varias tablas relacionadas entre sí mediante identificadores únicos (claves), a partir de las cuales se puede acceder, extraer, resumir o recomponer la información de distintas maneras.
Raíz del error cuadrático medio (RMSE)
La raíz del error cuadrático medio (RMSE) es la raíz cuadrada del MSE. Es más intuitiva que el MSE porque el resultado se expresa en las mismas unidades que los datos originales.
S
Error de muestreo
El error de muestreo es la diferencia estadística entre toda la población de datos y su subconjunto (muestra), debido a que la muestra no incluye todos los elementos de la población.
SQL
SQL (structured query language) es un lenguaje de programación diseñado para interactuar con sistemas de gestión de bases de datos relacionales (RDBMS). Tiene varios sabores, como SQLite, PostgreSQL y MySQL, algunos libres y de código abierto. Comparten una sintaxis similar con variaciones menores en funcionalidades adicionales.
Desviación estándar
La desviación estándar es la raíz cuadrada de la varianza de una población. Mide la dispersión de los valores y es más intuitiva que la varianza porque usa las mismas unidades que los datos.
Aprendizaje supervisado
El aprendizaje supervisado enseña a un modelo con un conjunto de entrenamiento etiquetado de datos históricos. Aprende la relación entre entradas y salidas y mide luego cuán bien predice las salidas de un conjunto de prueba con salidas reales conocidas. Así puede usarse después para predecir datos completamente nuevos. Incluye regresión lineal y logística, árboles de decisión y SVM. Tareas comunes: predecir precios de vivienda y clasificar mensajes como spam o no spam.
SVM
SVM (Support Vector Machine) es un algoritmo supervisado usado sobre todo para clasificación, aunque también para regresión. En clasificación, proporciona un hiperplano óptimo que separa las observaciones de ambas clases (en multiclase descompone el problema en varios binarios). En regresión, ofrece el hiperplano de mejor ajuste dentro de un umbral definido.
Datos sintéticos
Los datos sintéticos son datos creados artificialmente. Suelen reflejar las propiedades estadísticas del conjunto original, por lo que pueden usarse en ámbitos de alta privacidad como banca y salud, o para ampliar un conjunto existente con observaciones adicionales representativas.
T
Variable objetivo
La variable objetivo (también llamada variable dependiente) es la que un algoritmo de machine learning intenta predecir usando características. Por ejemplo, si predecimos la probabilidad de diabetes con altura, peso e ingesta de azúcar, el estado de diabetes es la variable objetivo.
Conjunto de prueba
El conjunto de prueba es un subconjunto de los datos disponible antes de construir un modelo, normalmente entre el 20 y el 30% del total. Se utiliza para evaluar la precisión de los modelos ajustados sobre el conjunto de entrenamiento.
Serie temporal
Una serie temporal es una secuencia de observaciones de una variable tomadas en distintos momentos y ordenadas cronológicamente. Normalmente se miden en intervalos sucesivos y equiespaciados. Ejemplos: precios bursátiles o temperatura a lo largo del tiempo.
Conjunto de entrenamiento
El conjunto de entrenamiento es un subconjunto de los datos disponible antes de construir un modelo, normalmente entre el 70 y el 80% del total. Se usa para ajustar el modelo que se evaluará después con el conjunto de prueba.
Verdadero negativo (TN)
Un verdadero negativo (TN) es un resultado en el que el modelo predice correctamente la clase negativa para una variable objetivo binaria (p. ej., predice «Falso» cuando la etiqueta real es Falso).
Verdadero positivo (TP)
Un verdadero positivo (TP) es un resultado en el que el modelo predice correctamente la clase positiva para una variable objetivo binaria (p. ej., predice «Verdadero» cuando la etiqueta real es Verdadero).
U
Subajuste
El subajuste ocurre cuando un modelo no es capaz de detectar los patrones del conjunto de entrenamiento porque se ha construido con información insuficiente. Como resultado, es demasiado simple y rinde mal tanto con datos no vistos como con el propio entrenamiento. Los modelos subajustados tienen alto sesgo.
Modelado univariante
El modelado univariante es el proceso de modelar la relación entre una sola variable (predictor) y la variable objetivo. Suele usarse con series temporales.
Datos no estructurados
Los datos no estructurados son aquellos que no encajan en una estructura predefinida, como la típica de filas y columnas de una base de datos. Ejemplos: imágenes, correos electrónicos, documentos de texto, vídeos y audio.
Aprendizaje no supervisado
El aprendizaje no supervisado es una clase de algoritmos de machine learning que aprenden la estructura subyacente de un conjunto de datos sin una variable objetivo. Sirve para descubrir patrones comunes, agrupar valores según sus atributos y luego realizar predicciones sobre datos no vistos. El algoritmo más común es k-means. Tareas frecuentes: detección de anomalías y segmentación de clientes por características comunes.
V
Varianza
La varianza es la media de las diferencias al cuadrado entre los valores individuales y la media del conjunto en matemáticas y estadística; en otras palabras, mide la dispersión. En machine learning, la varianza es un error causado por la sensibilidad del modelo a pequeñas variaciones en el conjunto de entrenamiento. Una varianza alta refleja tendencia a aprender ruido aleatorio, lo que conduce al sobreajuste.
W
Web scraping
El web scraping es el proceso de extraer datos específicos de sitios web para su uso posterior. Puede automatizarse escribiendo un programa que capture la información necesaria de una web.
Z
Z-score
El z-score (también llamado puntuación tipificada, estándar o normalizada) es el número de unidades de desviación estándar que un valor observado está por encima o por debajo de la media del conjunto. Un z-score igual a 0 indica que la observación está cerca de la media.
