Ir al contenido principal

Ver como una máquina: guía para principiantes sobre el análisis de imágenes en aprendizaje automático

Descubre cómo los ordenadores "ven" e interpretan imágenes, las técnicas para manipularlas y cómo el aprendizaje automático ha cambiado las reglas del juego.
Actualizado 17 sept 2026  · 15 min leer

Explorar con IA

ChatGPTClaudePerplexity

Las imágenes y los vídeos están en todas partes. Como humanos, dependemos de la vista para un sinfín de tareas: conducir, reconocer a nuestros amigos o detectar problemas. A medida que los ordenadores participan más en nuestro día a día, es cada vez más importante que también puedan usar imágenes. El análisis de imágenes es el medio por el que los ordenadores pueden "ver" y comprender una imagen. Cuando el análisis de imágenes está impulsado por aprendizaje automático, lo llamamos visión por computador.

Este tutorial te guiará por cómo los ordenadores "ven" las imágenes, repasará los fundamentos de la manipulación de imágenes y, por último, explicará cómo se aplican el aprendizaje automático y la IA generativa a las imágenes. ¡Vamos allá!

Si te interesa profundizar en la clasificación de imágenes, echa un vistazo a nuestro code-along sobre Image Classification with Hugging Face

¿Qué es la visión por computador?

La visión por computador es un campo de la inteligencia artificial que permite a ordenadores y sistemas extraer información útil de imágenes digitales, vídeos y otras entradas visuales. Es la ciencia y la tecnología de las máquinas que pueden ver. Como disciplina científica, la visión por computador busca aplicar sus teorías y modelos a la construcción de sistemas de visión por computador.

En esencia, la visión por computador consiste en interpretar datos visuales. Implica adquirir, procesar, analizar y comprender imágenes digitales para extraer datos de alta dimensión del mundo real y producir información numérica o simbólica que pueda usar una máquina. Emplea métodos y técnicas de múltiples disciplinas, como física, matemáticas, ingeniería eléctrica e informática.

Introducción al análisis de imágenes

En el nivel más bajo, los ordenadores operan con 1 y 0. Con las imágenes no es distinto. Un ordenador puede representar una imagen como una matriz de 1 y 0. Al mostrar una imagen, presenta una cuadrícula de píxeles, cada uno con un color. Pensemos en una forma muy simple, como el triángulo negro de abajo.

Figure 2: Black triangle with each pixel outlined.

Figura 1: Un triángulo sencillo y de baja resolución formado por 28 píxeles.

Esta forma está compuesta por 28 píxeles: 16 negros y 12 blancos. Puedes ver el contorno de cada píxel en la imagen siguiente.

Figura 2: Triángulo negro con cada píxel delineado.

Pero esta imagen no deja de ser una representación de la matriz de números que guarda el ordenador.

Figure 3: A demonstration of the 1's and 0's in the matrix that makes up the triangle image.

Figura 3: Demostración de los 1 y 0 en la matriz que compone la imagen del triángulo.

Esto es bastante sencillo para imágenes con solo dos colores: blanco y negro. Si tu imagen está en escala de grises, necesitas más matices. Puedes acabar con números como 0,015 en las celdas. Ese número le indica al ordenador qué luminancia dar a cada píxel en pantalla. Define un valor entre negro (1) y blanco (0).

Análisis de imágenes en color

Pero las imágenes rara vez son tan planas. ¿Qué hacen los ordenadores con imágenes en color? ¡Convirtamos este triángulo en verde!

Figure 4: The same 28-pixel triangle as before, but with a splash of color!

Figura 4: El mismo triángulo de 28 píxeles de antes, pero con un toque de color.

En este caso, no puedes usar un número entre cero y uno para describir este color. Hay demasiados colores como para asignarles de forma práctica un único número que resulte intuitivo.

En su lugar, se han desarrollado varios sistemas que descomponen los componentes individuales de un color y asignan números a cada componente.

Por ejemplo, quizá te suene RGB. Es un modelo de color que descompone cada color en la cantidad de rojo, verde y azul, respectivamente, que se combinan para crear el color deseado.

El modelo RGB parte del uso de pantallas con píxeles rojos, verdes y azules, como las de los televisores. Este modelo permite la mezcla aditiva de color propia de la luz en estos dispositivos.

En este sistema, rojo, azul y verde se llaman "canales". En una imagen de 8 bits, a cada canal se le asigna un valor entre 0 y 255 (el valor máximo que puede representar un número binario de 8 dígitos).

Veamos qué significa esto para nuestro sencillo triángulo verde.

Los valores RGB de este tono de verde son 154, 205 y 50, respectivamente. Ten en cuenta que, si fuera un verde puro, los canales rojo y azul serían 0. Esta representación RGB nos muestra que hay bastante rojo y un poco de azul mezclados con el verde para obtener este tono. Cada píxel tiene tres canales de valores que lo describen. Cada píxel verde se representa con 154, 205, 50 y cada píxel blanco se representa con 0, 0, 0.

Eso significa que este simple triángulo verde de 28 píxeles se representa mediante tres matrices de 7x4.

Puedes imaginar estas tres matrices apiladas una sobre otra para crear la imagen.

Figure 5

Figura 5: En este triángulo verde, cada canal de color en el sistema RGB contiene una matriz de valores de píxeles que representa la imagen. Al combinarlas, estas tres matrices se apilan para crear una sola imagen.

Así se entiende cómo las imágenes pueden ocupar rápidamente mucho espacio en un ordenador si cada píxel requiere tres números para definirse. Piensa por un momento cuántos números componen una imagen de alta resolución, por ejemplo una 4K (con 4.000 píxeles).

RGB no es el único sistema para asignar colores a las imágenes. Quizá te suene CMYK, que usa cuatro números para describir cada color. Este modelo usa cuatro colores: cian, magenta, amarillo y negro. Es útil cuando necesitas un modelo de color sustractivo, por ejemplo en impresión.

Cada sistema de color tiene sus ventajas e inconvenientes, y puede valerte la pena investigar varios si te topas con problemas de memoria al analizar imágenes. Para este tutorial, nos quedaremos con RGB.

Entonces, ¿qué puedes hacer con estas matrices de valores de píxeles?

Técnicas manuales de análisis de imágenes

Aislar objetos con umbrales

¿Cómo determina un ordenador qué píxeles representan una cara u otro objeto? Hoy en día, gran parte de esa identificación se hace con modelos de aprendizaje automático. Pero, para entenderlos, primero ayuda comprender cómo aislar manualmente una figura en una imagen.

Imagina que tienes un vídeo de dos lagartos sobre un fondo claro. Para simplificar, lo conviertes a escala de grises, de modo que solo haya un canal a considerar. Te interesa seguir el movimiento del lagarto a lo largo del vídeo.

Un vídeo no es más que una serie de fotos (o fotogramas) apiladas. Así que lo primero es descomponer esa pila y tomar cada foto por separado. Ya con una foto en escala de grises, necesitas indicar al ordenador qué parte de la foto es un lagarto y cuál no.

En teoría, podrías usar el ratón para señalar uno a uno todos los píxeles que forman el lagarto y etiquetarlos como "lagarto". Pero, dada la resolución de la mayoría de fotos y que tienes muchas para cada vídeo, no es razonable.

En su lugar, puedes definir una regla que le diga al ordenador qué es parte del lagarto y qué no. La forma más sencilla es con el umbralado.

Figure 6: To simplify things, we'll work with this photo in grayscale.

Figura 6: Para simplificar, trabajaremos con esta foto en escala de grises.

¿Qué es el umbralado?

El umbralado es el proceso de segmentar una imagen en función del valor numérico asignado a cada píxel. Fíjate de nuevo en la imagen en escala de grises de los lagartos. Observa cómo los lagartos aparecen más oscuros que el fondo. En muchas imágenes, habrá una diferencia de luminancia entre el objeto que queremos aislar y su fondo.

El umbralado consiste en hallar el borde del objeto, en este caso los lagartos, utilizando esa diferencia de luminancia. Esta técnica busca definir un umbral de luminancia que separe los píxeles claros de los oscuros.

Crear una imagen binaria

Imagina la matriz de números que define esta imagen en escala de grises. Cada píxel se define con un número entre 0 y 255.

Con el umbralado, puedes definir una regla por la que todo lo suficientemente oscuro sea un lagarto. Por ejemplo, podrías decir que cualquier píxel con un valor de 130 o superior es un lagarto, y todo lo inferior a 130 no lo es.

Técnicamente, establecerías cualquier valor en el umbral o superior a 255 y el resto a 0. Esto crea una imagen binaria con píxeles en blanco y negro. Si has elegido bien el umbral, los lagartos serán negros sobre un fondo blanco.

Figure 7: Binary image generated by setting a threshold of 130.

Figura 7: Imagen binaria generada con un umbral de 130.

En este ejemplo, hemos elegido un número arbitrario como umbral: 130. Sin embargo, para aislar correctamente a nuestros lagartos, querrás escoger un valor que capture la gran mayoría de los lagartos minimizando los píxeles que no lo son.

A este proceso de elegir un único valor de umbral para toda la imagen se le llama umbralado global. Es una forma tosca de aislar tu objetivo y a menudo es muy imperfecta. Si tienes un lagarto perfectamente silueteado sobre un fondo perfectamente blanco, el umbralado global funcionará de maravilla. Pero, como ves en este ejemplo, las imágenes reales rara vez son tan sencillas. Probablemente necesites un método de umbralado más complejo.

Uno de ellos es el umbralado local. En esta técnica, eliges distintos valores de umbral para diferentes partes de la imagen. Es especialmente útil cuando hay un gradiente de iluminación en el fondo. Existen muchos otros métodos de optimización con distinta complejidad, y la elección depende de tus circunstancias.

También es posible aplicar umbrales a imágenes en color. Es mucho más complejo y queda fuera del alcance de este tutorial.

Análisis morfológico

Aunque el umbralado te puede llevar bastante lejos para aislar a estos lagartos, no es perfecto. Puede que sigas teniendo partes del fondo clasificadas como lagarto o partes del lagarto ausentes. Necesitas otra herramienta para aislar mejor a los animales. Con el umbralado, definiste una regla basada en el color o la luminancia. Ahora definirás una regla basada en la forma, usando operaciones morfológicas.

Definir una forma con elementos estructurantes

Las operaciones morfológicas usan elementos estructurantes para determinar los bordes de las formas. Un elemento estructurante es una pequeña matriz con una forma específica, normalmente un cuadrado, un círculo o una cruz. También puedes cambiar su tamaño para conseguir distintos efectos.

Durante una operación morfológica, cada píxel se compara con sus vecinos dentro de esa forma. Hay dos operaciones morfológicas básicas para definir la forma del objeto que nos interesa: dilatación y erosión.

Dilatación

En la dilatación, si alguno de los píxeles vecinos dentro de los límites del elemento estructurante es oscuro (en este caso, 1), entonces el píxel objetivo pasa a ser 1 para coincidir.

Imagina que pasas por una cuadrícula de números con una lupa en forma de cuadrado. Colocas uno de los números en el centro del cuadrado y miras los demás números dentro de ese cuadrado. Si alguno es 1, etiquetas el del centro como 1, fuera cual fuera al principio.

De este modo, la dilatación puede expandir los bordes de los objetos o rellenar huecos.

Erosión

La erosión funciona igual que la dilatación, pero con el efecto contrario. Con la erosión, si alguno de los vecinos de un píxel es 0, ese píxel se redefine como 0. Esto puede servir para separar objetos, reducir ruido y afinar contornos.

Figure 8

Figura 8: Ejemplo visual de dilatación y erosión con un elemento estructurante en forma de cruz. En este ejemplo, solo aplicamos la operación morfológica a la segunda fila de la matriz. En una imagen real, se aplicaría a cada píxel. Aun así, se ve cómo la erosión separa los bordes de la línea mientras que la dilatación la engruesa.

Así es como la dilatación y la erosión modifican la imagen binaria de los lagartos.

Figura 9: Ejemplo de erosión y dilatación aplicadas a la foto del lagarto. El elemento estructurante usado fue un cuadrado de 6x6.

Combinar dilatación y erosión

La dilatación y la erosión pueden usarse de forma iterativa o secuencial para cambiar el resultado final. Es habitual usar ambas para definir mejor la imagen aislada.

Cuando la erosión va seguida de dilatación, se eliminan pequeñas protuberancias y ruido, y se refuerza el contorno restante. Esta técnica se llama apertura.

Cuando la dilatación va seguida de erosión, se rellenan pequeños huecos y se limpian los bordes. Esta técnica se llama cierre.

Figure 10: Demonstration of opening and closing techniques using a 6x6 square structuring element on the lizard photo.

Figura 10: Demostración de técnicas de apertura y cierre usando un elemento estructurante cuadrado de 6x6 en la foto del lagarto.

Ves que ninguna de estas imágenes llega a aislar del todo a los lagartos del fondo. Pero con cada ajuste e iteración puedes acercarte más y más.

En la siguiente iteración, podrías indicarle al ordenador que ignore todo lo que esté fuera de un cierto rango de tamaño. Esto eliminaría la mayoría de los puntitos y dejaría intactos a los lagartos. Aprende a hacerlo tú mismo en el curso Image Processing in Python de DataCamp.

Para cada imagen o serie de imágenes puedes definir una cadena de reglas como estas para decirle al ordenador cómo es tu objetivo. Luego el ordenador puede usar esa información para tomar decisiones.

Estas decisiones influyen en todo, desde identificar galaxias hasta encontrar tejido enfermo. Pero crear una serie de reglas para cada imagen de forma individual es lento y tedioso. Ahí es donde entra el aprendizaje automático.

Aprendizaje automático supervisado para análisis de imágenes

Entrenar un modelo supervisado de ML

Como has visto, analizar imágenes a mano puede ser exigente, porque entran en juego muchísimas variables. Por suerte, el aprendizaje automático (ML) puede ayudar a automatizar el proceso. Para un repaso en profundidad del aprendizaje automático, puedes consultar Machine Learning Scientist with Python o Supervised Machine Learning. Este tutorial solo cubrirá brevemente los aspectos útiles para entender el procesamiento de imágenes.

Hay dos grandes categorías de ML: aprendizaje supervisado y aprendizaje no supervisado.

Con el aprendizaje supervisado, básicamente le das al ordenador un gran número de imágenes y las etiquetas de antemano. Es un poco como enseñar a un bebé cómo son los animales señalándolos y diciendo: "Esto es un elefante". El bebé debe averiguar el patrón que siguen las cosas a las que llamamos elefantes frente a las que llamamos peces.

En el aprendizaje supervisado, el ordenador hace un trabajo similar al del bebé.

Figure 11

Figura 11: Imagen generada con DALL·E de una madre señalando animales de juguete para enseñar a un bebé cómo son. El aprendizaje supervisado funciona de forma parecida: se proporcionan ejemplos con la respuesta correcta.

Anotación y extracción de características

Supongamos que quieres entrenar un modelo de aprendizaje automático para identificar objetos en una imagen que no ha visto antes. El primer paso para entrenar este modelo supervisado es anotar y etiquetar un conjunto de imágenes, llamado conjunto de entrenamiento. La anotación consiste en identificar manualmente y marcar las regiones de interés en una imagen.

Por ejemplo, si queremos entrenar un modelo para clasificar distintos tipos de animales, anotaríamos cada imagen delimitando los animales presentes y asignándoles la etiqueta de clase correspondiente, "cow", "cat", etc. Este conjunto anotado se convierte en la base para entrenar el modelo. También hay muchos conjuntos ya etiquetados de acceso público con los que puedes trabajar.

Una vez que tienes el conjunto de entrenamiento etiquetado, necesitas extraer características relevantes de las imágenes. La extracción de características implica identificar y capturar rasgos o patrones importantes que distinguen una clase de otra.

En nuestro ejemplo de animales, puedes definir como rasgo importante de las vacas tener cuatro patas y manchas.

Redes neuronales convolucionales

Existen diversas técnicas para la extracción de características en procesamiento de imágenes, desde métodos sencillos como histogramas de color y descriptores de textura hasta enfoques más avanzados como las redes neuronales convolucionales (CNN).

Las CNN son un algoritmo supervisado popular que aprende automáticamente características y patrones importantes a partir de imágenes etiquetadas durante el entrenamiento. Están formadas por capas, y cada capa realiza operaciones específicas sobre los datos de imagen.

Las capas de convolución aplican filtros para capturar patrones locales, mientras que las de agrupación (pooling) reducen las dimensiones espaciales. Las capas totalmente conectadas combinan la información de las anteriores. Con estas operaciones secuenciales, la red extrae y combina características para hacer predicciones precisas sobre el contenido de la imagen.

Elegir una arquitectura

El proceso de entrenamiento de un modelo supervisado, como una CNN, implica varios pasos. Primero, hay que preprocesar los datos para garantizar consistencia y calidad. Esto puede incluir redimensionar imágenes, normalizar valores de píxel y aumentar el conjunto aplicando transformaciones como rotaciones o volteos para incrementar su diversidad.

A continuación, diseñarás la arquitectura del modelo CNN. En esencia, la arquitectura es el número y tipo de capas que usas y cómo las configuras. Debe elegirse con cuidado para equilibrar complejidad y simplicidad, permitiendo al modelo capturar lo esencial evitando el sobreajuste. Puede ser útil empezar con una arquitectura consolidada y ajustarla a tus necesidades. Puedes encontrar una lista útil de arquitecturas en un recurso externo.

Figure 12: Simple example CNN architectures.

Figura 12: Ejemplos sencillos de arquitecturas CNN.

Sobreajuste

El sobreajuste ocurre cuando el ordenador se vuelve muy bueno etiquetando las imágenes del conjunto de entrenamiento pero no acierta con imágenes fuera de ese conjunto.

Suele pasar porque el ordenador ha detectado algún sesgo que introdujimos sin querer en el conjunto de entrenamiento y que no representa la vida real (por ejemplo, que la mayoría de fotos de gatos tengan fondo azul). Hay muchas técnicas para evitar que el modelo memorice los datos de entrenamiento y, en su lugar, aprenda patrones más generalizables.

Entrenar un modelo supervisado

Una vez definida la arquitectura, hay que inicializar los parámetros del modelo y comenzar el entrenamiento.

Durante el entrenamiento, el modelo ajusta iterativamente sus parámetros con técnicas de optimización como el descenso de gradiente para minimizar la diferencia entre sus predicciones y las etiquetas reales que definiste.

Este proceso implica calcular la función de pérdida, que cuantifica el error de predicción del modelo, y actualizar los parámetros en consecuencia.

Entrenar un modelo supervisado para análisis de imágenes es un proceso iterativo. Entrenas el modelo con el conjunto etiquetado, evalúas su rendimiento en un conjunto de validación y haces ajustes para mejorar su precisión. Este ciclo continúa hasta que el modelo logra resultados satisfactorios.

Aplicaciones de modelos supervisados en análisis de imágenes

Una vez entrenado con datos etiquetados, un modelo supervisado puede aplicarse a diversas tareas de análisis de imágenes. Estas son algunas aplicaciones habituales que demuestran su eficacia.

Clasificación de imágenes

La clasificación de imágenes es una tarea fundamental cuyo objetivo es asignar una etiqueta o clase a una imagen de entrada.

Por ejemplo, se puede entrenar un modelo supervisado para clasificar imágenes de animales en categorías como "fish", "lizard" o "beetle".

Figure 13: An example of image classification. This image has been classified as “Dinner.”

Figura 13: Ejemplo de clasificación de imágenes. Esta imagen se ha clasificado como "Dinner".

Al aprender de un conjunto diverso con ejemplos etiquetados, el modelo puede generalizar y clasificar con alta precisión. Esta técnica sirve para tareas como identificar enfermedades en imágenes médicas, reconocer objetos en imágenes satelitales o incluso clasificar emociones a partir de expresiones faciales. Consulta este webinar de DataCamp para más detalles.

Detección de objetos

La detección de objetos es otra aplicación importante. A diferencia de la clasificación, aquí no solo se identifican los objetos presentes, sino que también se localizan dibujando cajas delimitadoras a su alrededor.

Este proceso permite identificar múltiples objetos de interés dentro de una misma imagen.

Figure 14: An example of object detection. Various objects within this image have been identified.

Figura 14: Ejemplo de detección de objetos. Se han identificado varios objetos en esta imagen.

Las aplicaciones incluyen la conducción autónoma, donde los modelos detectan y siguen peatones, vehículos y señales, así como sistemas de vigilancia para identificar y rastrear individuos u objetos de interés. Facebook e Instagram también usan este método cuando encuentran tu cara en fotos.

Retos de los modelos supervisados

Aunque las capacidades de los modelos supervisados en análisis de imágenes son impresionantes, hay limitaciones y retos a considerar.

Un gran desafío es la necesidad de grandes volúmenes de datos etiquetados. El proceso de anotar y etiquetar imágenes requiere tiempo y recursos.

Los modelos supervisados también son sensibles a sesgos presentes en los datos de entrenamiento, lo que puede llevar a predicciones sesgadas o resultados injustos. Adaptarlos a nuevos dominios o categorías de imagen puede requerir entrenamiento adicional o ajuste fino.

Además, interpretar las representaciones aprendidas y los procesos de decisión de modelos complejos como las CNN puede ser difícil, lo que complica entender por qué el modelo hizo una predicción concreta.

A pesar de estos retos, los modelos supervisados siguen ampliando los límites del análisis de imágenes, permitiendo avances notables en campos como la salud, la agricultura y la seguridad.

A medida que avanza la investigación y el desarrollo, abordar estos retos y refinar los modelos allanará el camino hacia soluciones de procesamiento de imágenes aún más precisas y fiables.

Aprendizaje automático no supervisado para análisis de imágenes

Uso del aprendizaje no supervisado

Una alternativa al aprendizaje supervisado es el aprendizaje no supervisado. A diferencia del supervisado, no depende de datos etiquetados, sino que busca descubrir patrones, estructuras o relaciones ocultas dentro de los propios datos.

El objetivo del aprendizaje no supervisado en análisis de imágenes es desvelar estructuras e ideas valiosas a partir de datos no etiquetados. Al utilizar estas técnicas, puedes extraer información útil y comprender mejor las características subyacentes de las imágenes.

El aprendizaje no supervisado puede ayudar a identificar grupos de imágenes similares, descubrir patrones o texturas característicos de ciertas clases de imagen y detectar anomalías o valores atípicos en los datos.

En qué se diferencia el no supervisado

Si el aprendizaje supervisado es como decirle a un bebé qué es una vaca y qué es un pez, el no supervisado sería darle un montón de animales y dejar que los ordene como quiera. Puede que los agrupe por tamaño, número de patas, textura o color.

El resultado final puede parecerse a lo que obtendrías separándolos por especie, o puede ser muy distinto. Aun así, examinar las características de las categorías resultantes puede darte información útil.

Figure 15: DALL-E generated image of a baby sorting animal toys in an unsupervised learning environment.

Figura 15: Imagen generada con DALL·E de un bebé ordenando juguetes de animales en un entorno de aprendizaje no supervisado.

Análisis de imágenes con modelos no supervisados

Los modelos de aprendizaje no supervisado ofrecen posibilidades interesantes al permitir agrupar imágenes en categorías sin necesidad de datos etiquetados.

Imagina que tienes una enorme colección de imágenes y quieres organizarlas en grupos con sentido. Los modelos no supervisados pueden analizar sus rasgos visuales y agruparlas según características compartidas, como color o forma. Esto aporta información valiosa y simplifica las tareas de análisis.

Algoritmos de clustering

Los algoritmos de clustering agrupan imágenes similares según sus características compartidas. Uno muy usado es el k-means, que divide los datos en un número predeterminado de clústeres minimizando iterativamente la distancia matemática entre cada imagen de un conjunto.

El clustering jerárquico es otro enfoque que crea una estructura jerárquica de conjuntos de imágenes fusionando o dividiéndolos recursivamente en función de su similitud. Estos algoritmos permiten descubrir agrupaciones naturales en conjuntos de imágenes no etiquetados, ofreciendo información sobre similitud y diversidad.

Segmentación de imágenes

El aprendizaje no supervisado es especialmente valioso para la segmentación de imágenes, que consiste en dividir una imagen en regiones u objetos significativos.

Aplicando técnicas de clustering u otros métodos no supervisados, puedes separar una imagen en regiones distintas basadas en color, textura u otras características.

Esta técnica puede ser útil en imágenes médicas para encontrar tumores, en imágenes satelitales para clasificar coberturas del suelo o en gráficos por computador para extraer elementos de primer plano y fondo.

Reconocimiento de patrones

El reconocimiento de patrones es otra área en la que destaca el aprendizaje no supervisado.

Estos algoritmos pueden aprender representaciones o características que capturan los patrones o estructuras subyacentes presentes en los datos. Al extraer estas características aprendidas, puede clasificarse o agruparse imágenes en función de sus patrones compartidos o similitudes visuales. Esto hace posibles tareas como la recuperación o la síntesis de imágenes.

Detección de anomalías

El aprendizaje no supervisado también se usa para detectar anomalías. Al aprender los patrones normales de un conjunto de datos, los algoritmos pueden identificar imágenes o regiones que se desvían del resto. Es especialmente útil en ámbitos como la vigilancia, donde detectar actividades inusuales o sospechosas ayuda a la monitorización de la seguridad.

Retos de los modelos no supervisados

El aprendizaje no supervisado también tiene sus propios retos. Uno importante es interpretar los resultados, ya que no hay una verdad de referencia ni datos etiquetados con los que comparar.

Volviendo al ejemplo de ordenar animales, puedes acabar con una categoría que contenga un caballo, un escarabajo y un pulpo, todos marrones, mientras que otra categoría contenga un caballo blanco, un conejo y una flor. Como no especificaste cómo ordenarlos, puedes terminar con grupos poco significativos.

Puede ser complicado evaluar la calidad y la precisión de los clústeres o patrones que propone el modelo no supervisado.

Ventajas de los modelos no supervisados

Los modelos no supervisados ofrecen varias ventajas en el procesamiento de imágenes. La más importante: eliminan la necesidad de un etiquetado manual exhaustivo, lo que facilita y abarata el trabajo con conjuntos a gran escala.

Imagina tener que revisar y etiquetar manualmente cada imagen de Instagram. Los modelos de aprendizaje no supervisado evitan ese esfuerzo largo y laborioso.

Además, pueden revelar patrones y estructuras ocultas en los datos, permitiendo descubrir ideas nuevas y relaciones visuales que no son evidentes a primera vista.

Este carácter exploratorio abre nuevas vías para el análisis de imágenes y puede conducir a avances en ámbitos como la exploración espacial, la robótica o la medicina.

 

Supervised ML

Unsupervised ML

Tareas

  • Clasificación de imágenes
  • Detección de objetos
  • Reconocimiento de patrones
  • Detección de anomalías

Ventajas

  • Resultados más previsibles y útiles
  • Puede usarse con conjuntos más pequeños
  • Menor esfuerzo manual
  • Puede revelar patrones ocultos e ideas nuevas

Desventajas

  • Más trabajo manual
  • Sensible a sesgos en los datos de entrenamiento
  • Los grupos resultantes pueden ser poco significativos
  • Los resultados pueden ser inesperados

Figura 16: Comparación entre aprendizaje supervisado y no supervisado en procesamiento de imágenes.

Generar imágenes nuevas con IA generativa

Una vez que un modelo ha determinado qué características definen distintos objetos en imágenes, puede usar esa información para crear imágenes nuevas.

DALL·E y Midjourney son ejemplos destacados de modelos no supervisados que aprovechan el modelado generativo para generar imágenes. Al entrenarse con conjuntos masivos, han aprendido los componentes necesarios para crear imágenes con ciertos clasificadores.

Así, si le pides a DALL·E que cree la imagen de un panda robot, el modelo recurrirá a su definición interna de qué compone a los robots y a los pandas y combinará esas piezas para crear la imagen que has pedido.

Por ejemplo, puede determinar que los robots tienen metal y engranajes, mientras que los pandas son blancos y negros. Usará esta información para crear un panda robot metálico, blanco y negro, con engranajes.

Figure 17: DALL-E generated image using the prompt 'Panda Robot'.

Figura 17: Imagen generada con DALL·E usando el prompt 'Panda Robot'.

Conclusión

Este tutorial ofrece una visión de alto nivel del análisis de imágenes con el objetivo de comprender mejor su papel en el aprendizaje automático. Ahora deberías tener una mejor intuición de cómo los ordenadores "ven" y manipulan imágenes y una comprensión básica de conceptos clave de ML como el preprocesamiento, la extracción de características y los algoritmos de clasificación.

El procesamiento de imágenes juega un papel enorme en nuestras vidas, desde las redes sociales hasta la imagen médica, la exploración espacial o la vigilancia. Si quieres seguir profundizando en este tema fascinante, echa un vistazo a Image Processing with Python, Image Processing with Keras in Python y Deep Learning for Images with PyTorch en DataCamp.


Amberle McKee's photo
Author
Amberle McKee
LinkedIn

Soy doctor con 13 años de experiencia trabajando con datos en un entorno de investigación biológica. Creo software en varios lenguajes de programación, como Python, MATLAB y R. Me apasiona compartir mi amor por el aprendizaje con el mundo.

Temas
Aprendizaje automático
Relacionado

blog

Clasificación en machine learning: Introducción

Aprende sobre la clasificación en machine learning viendo qué es, cómo se utiliza y algunos ejemplos de algoritmos de clasificación.
Zoumana Keita 's photo

Zoumana Keita

14 min

Machine Learning Concept

blog

¿Qué es el machine learning? Definición, tipos, herramientas y más

Descubre todo lo que necesitas saber sobre el machine learning en 2023, incluidos sus tipos, usos, carreras profesionales y cómo iniciarte en el sector.
Matt Crabtree's photo

Matt Crabtree

14 min

Machine Learning

blog

33 proyectos de machine learning para todos los niveles en 2026

Proyectos de machine learning para principiantes, estudiantes de último año y profesionales. La lista incluye proyectos guiados, tutoriales y código fuente de ejemplo.
Abid Ali Awan's photo

Abid Ali Awan

15 min

Tutorial

Introducción al aprendizaje automático estadístico

Descubra la potente fusión de estadística y aprendizaje automático. Explore cómo las técnicas estadísticas sustentan los modelos de aprendizaje automático, permitiendo la toma de decisiones basada en datos.
Joanne Xiong's photo

Joanne Xiong

11 min

Tutorial

Introducción a las redes neuronales convolucionales (CNN)

Una guía completa para entender las CNN, su impacto en el análisis de imágenes y algunas estrategias clave para combatir el sobreajuste en aplicaciones robustas de CNN frente al aprendizaje profundo.
Zoumana Keita 's photo

Zoumana Keita

14 min

Tutorial

Visión GPT-4: Guía completa para principiantes

Este tutorial le presentará todo lo que necesita saber sobre GPT-4 Vision, desde cómo acceder a él hasta ejemplos prácticos del mundo real y sus limitaciones.
Arunn Thevapalan's photo

Arunn Thevapalan

12 min

Ver MásVer Más