Curso
DataCamp Workspace se basa en los notebooks de Jupyter y optimiza la experiencia para que seas más productivo.
Un obstáculo habitual para analistas y científicos de datos es que puede ser complicado conectar un notebook de Jupyter a una base de datos para empezar a trabajar. El problema es aún mayor si estás empezando: ¿cómo vas a aprender a escribir SQL si ni siquiera puedes conectarte a una base de datos?
Workspace hace que escribir SQL sea sencillo, tanto si estás practicando como si estás trabajando. Este tutorial te muestra cómo empezar a escribir SQL en Workspace en cuestión de segundos.
Este tutorial asume que ya has usado SQL. Si no es así, lee antes nuestro tutorial de SQL para principiantes y luego prueba en Workspace los ejemplos de ese tutorial con las técnicas que verás aquí.
Primeros pasos
Para usar Workspace, necesitas crear una cuenta en DataCamp. (Con una cuenta gratuita te vale para empezar.)
Cuando tengas tu cuenta, usa la barra de navegación superior para ir a Workspace.

En este tutorial usaremos el conjunto de datos integrado NBA Shooting Data. Si prefieres usar tu propio conjunto de datos, salta a la sección de abajo.
Usa la navegación de la izquierda para ir a la página de Datasets.

Escribe "nba" en el buscador y haz clic en el dataset.

Verás una vista previa del dataset. Léela y después haz clic en "Use Dataset".

Sube tu propio dataset
Puedes usar SQL para analizar cualquier dato en formato tabular en Workspace. Actualmente, los archivos CSV son los mejor soportados, así que, para aprender, si subes tu propio dataset te recomendamos usar un CSV.
Desde la página Overview, haz clic en "Empty" para crear un workspace vacío.

Ponle un nombre a tu workspace y haz clic en "Create Workspace".

En la barra lateral izquierda, abre la herramienta Files.

En la parte superior izquierda de la herramienta, arrastra un archivo de datos al panel para subirlo. (También puedes hacer clic en "browse files" o pulsar el botón ⊕ y luego Upload).
Usar SQL con datos en archivos CSV
Los datos de tiro de la NBA están en el archivo nba_players_shooting.csv. En la barra lateral izquierda, abre la herramienta Files para ver el archivo.

El notebook del workspace incluye algo de código en Python para importar el dataset. Sin embargo, en este caso queremos usar SQL.
Al final del notebook, haz clic en "Add SQL".

En el desplegable "Select source", selecciona "DataFrames and CSVs".

Para escribir una consulta SQL sobre un archivo CSV, solo necesitas un cambio respecto al SQL estándar. En la cláusula FROM, en lugar de poner el nombre de la tabla, escribe la ruta al archivo CSV entre comillas simples.
Vamos a calcular la proporción de tiros encestados para cada jugador, ordenada de mejor a peor. En la celda de SQL, escribe el siguiente código.
SELECT
shooter,
SUM((SCORE = 'MADE')::DOUBLE) / COUNT(*) AS prop_score_made
FROM 'nba_players_shooting.csv'
GROUP BY shooter
ORDER BY prop_score_made DESC

Ten en cuenta que, cuando trabajas con un archivo CSV, el dialecto de SQL que se usa es DuckDB. Puedes leer más en DuckDB makes SQL a first-class citizen on DataCamp Workspace.
Sigue trabajando en Python, R o con gráficos sin código
En el último ejemplo dejamos la configuración por defecto del formato de retorno de la consulta. Si te fijas arriba de la celda SQL, verás que indica que el valor devuelto es un DataFrame llamado df. Esto significa que puedes seguir trabajando con los resultados en Python (o en R, si estás en un workspace de R) o crear gráficos sin código.

Haz clic en "Add Chart" para añadir un gráfico sin código.

Configura estas opciones.
- Type: Bar
- X-axis: prop_score_made
- Y-axis: SHOOTER

Usar SQL con datos en data frames
La consulta SQL que ejecutamos sobre el CSV creó un data frame llamado df. También puedes escribir consultas SQL sobre estos data frames de pandas o R. La única diferencia con el SQL estándar es que, en la cláusula FROM, indicas el nombre del data frame en lugar del de la tabla.
Aquí vamos a reutilizar los resultados previos en df y a dividir la columna shooter en nombre y apellidos. Añade una celda SQL, selecciona "DataFrames and CSVs" como origen y usa el siguiente código.
SELECT
str_split(shooter, ' ')[1] AS first_name,
str_split(shooter, ' ')[2] AS last_name,
prop_score_made
FROM df
Usar bases de datos de ejemplo
Workspace también ofrece varias bases de datos de ejemplo para que practiques tus habilidades de SQL.
Añade una celda SQL y, en el desplegable de origen, baja hasta la sección "Sample Integrations". Aquí usaremos "Bicycle Sales".

Aparecerá una consulta por defecto. Para el tutorial, sustitúyela por una consulta más sencilla.
SELECT
product_name,
MIN(list_price) AS cheapest_list_price
FROM products
GROUP BY product_name
Cuando usas una conexión a una base de datos (en lugar de escribir SQL contra un CSV o un data frame), tienes la opción de devolver los resultados como una query. En el desplegable, selecciona "Query". También puedes nombrar el resultado. Aquí cambia "query" por "best_price".

Al ejecutar la consulta obtendrás esta salida.

Ahora puedes usar este resultado para escribir más SQL sobre él. En la práctica, has creado una common table expression (que se trata en el tutorial SQL Commands for Data Scientists) sin tener que usar la sintaxis de CTE.
Añade otra celda SQL y escribe esta nueva consulta.
SELECT *
FROM best_price
WHERE cheapest_list_price > 10000
Al ejecutar esta consulta obtendrás los siguientes resultados.

Conectar con otras bases de datos
Workspace también te permite conectarte a muchos tipos de bases de datos, como PostgreSQL, MySQL, Redshift, BigQuery, Athena, SQL Server, MariaDB y Oracle Database. Tienes todos los detalles de conexión en la documentación de Workspace.
En la barra lateral izquierda, haz clic en "Integrations" y luego en el botón ⊕ para crear una nueva integración.
Elige el tipo de base de datos a la que te vas a conectar.

Se te pedirán los detalles de la conexión (varían según el tipo de base de datos).

Usar el asistente de IA
Aunque escribir SQL puede ser divertido y muy útil, pedir a una IA que lo escriba por ti puede ayudarte a aprender y a ser más productivo. Puedes leer sobre el asistente de IA en From Data to Insights: Get There Faster with the DataCamp Workspace AI Assistant.
Añade una celda SQL. En el menú contextual de la derecha, haz clic en "Generate".

Aparecerá una caja de texto en la parte superior de la celda SQL. Escribe ahí una tarea para la IA. Elige tu propia tarea o prueba la siguiente.
Return the product names and list prices for all mountain bikes made by Trek that are in stock.
Después de escribir tu petición, pulsa Intro para que la IA genere el código SQL.

Si te parece que el código tiene sentido, haz clic en "Accept & run" (o en "Accept" y luego "Run") para ver los resultados de la consulta.

Pídele a la IA que explique tus errores
También puedes usar la IA integrada en Workspace para explicar por qué se producen errores en tu SQL. Imagina que te has liado al escribir la consulta de las bicis caras y has usado un .GT al estilo Fortran en lugar de `>`.
SELECT *
FROM best_price
WHERE cheapest_list_price .GT. 10000
Esto genera un error. En la parte inferior izquierda de la celda SQL, haz clic en "Fix Error".

La IA te propondrá el código correcto y te explicará qué falló.

Resumen
Has visto cómo evitar montar una base de datos escribiendo consultas SQL sobre archivos CSV y data frames. Has usado bases de datos de ejemplo para practicar y has aprendido a usar la IA para generar SQL con lenguaje natural y corregir tus errores.
Estas funciones facilitan mucho empezar a escribir SQL y ser más productivo mientras aprendes y trabajas.
Súbelo de nivel
Empieza con SQL en Workspace iniciando sesión o creando una cuenta en DataCamp. También puedes dominar algunos de los fundamentos de SQL en nuestro itinerario de habilidades, que te dará todo lo necesario para interactuar con tus datos y consultarlos.
Richie ayuda a particulares y organizaciones a mejorar en el uso de los datos y la IA. Es científico de datos desde antes de que se llamara ciencia de datos, y ha escrito dos libros y creado muchos cursos DataCamp sobre el tema. Es presentador del podcast DataFramed, y dirige el programa de seminarios web de DataCamp.



