Curso
En machine learning, Deep Learning y ciencia de datos, los formatos de datos más usados son JSON o CSV. Aquí aprenderemos sobre CSV y lo usaremos para crear un conjunto de datos. CSV significa Comma Separated Values (valores separados por comas). Son campos de una base de datos exportados a un formato en el que cada registro va en una línea y se separa por comas. Los archivos con extensión .csv son similares a los de texto plano. Esto permite compartir archivos de base de datos entre personas que no usan las mismas aplicaciones.
Para este tutorial, necesitarás:
1->Microsoft Excel
2->Algunas imágenes
3->Notepad++ (lo recomiendo porque es fácil de usar; también puedes probar con WordPad, el Bloc de notas o cualquier editor de texto)
Con esto, ¡vamos al lío!
Ahora instala "Notepad++": visita este enlace - https://notepad-plus-plus.org/download/v7.5.6.html - e instala la versión que mejor funcione en tu dispositivo.
Para 32 bits

Para 64 bits

Ahora descarga algunas imágenes
Crea una carpeta nueva (yo la llamé dataset), crea dentro varias subcarpetas y rellénalas con imágenes. Yo he descargado matrículas de coche de varias partes del mundo y las he guardado en esas carpetas.


Abre la terminal/Command Prompt en el directorio actual, es decir, en la carpeta dataset, y ejecuta los comandos que indico a continuación. Primero, para usuarios de Windows:
Comando para obtener el listado de carpetas y archivos del directorio: -- dir /b/s
Comando para listar nombres de archivos y guardarlos en un texto: -- dir /b/s/w *.jpg > "filename.txt"
Para usuarios de Linux (Ubuntu):
Comando para obtener el listado de carpetas y archivos del directorio: -- ls -LR
Comando para listar nombres de archivos y guardarlos en un texto: -- ls -LR *.jpg > files.txt
Para Mac OSX: macOS es compatible con POSIX, así que incluye las utilidades habituales de línea de comandos de los entornos Unix.
Comando para obtener el listado de carpetas y archivos del directorio: -- ls /b/s
Comando para listar nombres de archivos y guardarlos en un texto: -- ls /b/s/w*.jpg > filename.txt


Yo llamé al archivo "filename"; tú puedes elegir el nombre que quieras, como "names.txt". Se guardará en el directorio desde el que ejecutaste el comando. (Aquí quería solo imágenes con extensión .JPG, por eso usé *.jpg para referirme a ellas; puedes usar .jpeg o XML, según la extensión de tus imágenes).


Ahora pulsa Ctrl+F y elimina los detalles del directorio principal. Para que Excel pueda leer las imágenes, necesitamos que las rutas de subcarpetas y nombres de archivo empiecen por " ./ ". Así que sustituye la primera barra invertida \ por ./ y la segunda por /

Tras hacer los cambios, guarda el archivo de texto.

Ahora abre Microsoft Excel, copia todos los nombres del archivo de texto y pégalos en una hoja de Excel.

Si quieres etiquetar las imágenes, crea otra columna llamada label y rellénala según el criterio que quieras. Aquí yo las etiqueté por país.

Guárdalo con la extensión CSV (Comma delimited) en la carpeta (dataset) donde tienes las carpetas con las imágenes.

Ahora elimina el archivo de texto de esa carpeta y comprime la carpeta dataset a un archivo zip.
¡Listo!
Has creado correctamente un conjunto de datos en formato CSV.
Conclusión
Este tutorial ofrece una guía rápida para crear conjuntos de datos en formato CSV a partir de imágenes para ciencia de datos. Espero que te resulte útil cuando quieras crear tu propio dataset. ¡Enhorabuena! Has completado el tutorial. Si tienes preguntas o comentarios, déjalos abajo.

