Este artículo fue escrito por Richie Cotton, con la colaboración de Ramnath Vaidyanathan, Dieter De Mesmaeker y Martijn Theuwissen.
La educación online vive un momento apasionante por la constante innovación. Todas las empresas del sector, incluida DataCamp, seguimos buscando la mejor manera de ayudar a la gente a aprender. Los equipos de producto e ingeniería de DataCamp desarrollan sin descanso nuevas herramientas para enseñar ciencia de datos con más eficacia, que nuestros equipos de contenido incorporan a los materiales actuales y futuros.
Cuatro instructores de DataCamp —Ben Baumer, Andrew Bray, Mine Çetinkaya-Rundel y Jo Hardin— publicaron recientemente un artículo en el Journal of Statistical Education sobre su experiencia creando cursos en DataCamp y sus reflexiones acerca de las diferencias entre la formación presencial y la online. Estos instructores apoyaron DataCamp desde el principio, y agradecemos que hayan compartido su experiencia.
En este post, queremos repasar sus comentarios, hablar de la pedagogía en DataCamp, mostrar algunas de las mejoras que hemos realizado desde que los autores crearon sus cursos en DataCamp y aclarar nuestra postura sobre ciertas observaciones del artículo.
Los cursos
Los instructores crearon ocho cursos entre 2016 y 2018. Primero llegó una serie de cuatro cursos sobre estadística descriptiva: Introduction to Data in R, Exploratory Data Analysis in R, Correlation and Regression in R y Multiple and Logistic Regression in R, incluidos en el itinerario de habilidades Statistics Fundamentals with R. Después se sumaron cuatro cursos de estadística inferencial: Foundations of Inference, Inference for Categorical Data, Inference for Numerical Data e Inference for Linear Regression, que forman el itinerario Statistical Inference with R.
En total, estos cursos llegaron a más de 94.000 estudiantes. El curso mejor valorado tiene una puntuación de 4,55 (sobre 5) y el de menor puntuación, 4,33. Al tratarse de algunos de nuestros cursos con más volumen, han generado hasta la fecha 475.000 $ en regalías para los cuatro instructores.
Las ventajas de DataCamp
El artículo destaca muchos de los puntos fuertes de DataCamp. Para empezar, los cuatro académicos señalan que las universidades son caras.
nuestras instituciones [...] tienen un coste medio anual de asistencia de 71.156,25 $
Ese es el precio de un coche de lujo cada año, lo que pone en valor la propuesta de DataCamp, que cuesta menos que un abono anual de metro en Nueva York. Aunque es cierto que somos una empresa con ánimo de lucro, queremos destacar nuestro programa gratuito DataCamp for the Classroom, que da a docentes y estudiantes acceso ilimitado a todo nuestro catálogo de cursos. Desde su lanzamiento, más de 200.000 estudiantes han participado en el programa. Esto nos diferencia de las elevadas matrículas de muchas universidades privadas, y nos enorgullece.
Para los estudiantes, subrayan que el uso del vídeo aporta una ventaja clave frente a la enseñanza en directo: permite controlar el ritmo.
Para empezar, tener vídeos en lugar de un profesor en persona significa que el estudiante puede detener el vídeo, ralentizarlo o volver a verlo. Es decir, cada estudiante puede asimilar las ideas a su propio ritmo. Además, a diferencia de un aula tradicional, puede pausar el vídeo para buscar una definición o contextualizar un ejemplo.
La retroalimentación instantánea que proporcionan las pruebas automáticas en nuestros ejercicios de código también recibió valoraciones positivas.
Los estudiantes reciben comentarios al instante en los ejercicios de código de DataCamp. Esto reduce su frustración y libera al instructor de tener que responder a algunos de los correos más urgentes de los estudiantes.
Para docentes universitarios, responsables de formación y desarrollo y otros formadores, la escalabilidad de DataCamp es una característica clave. Nuestra plataforma libera a los educadores de la presión y la monotonía de corregir tareas.
Cada estudiante adicional en tu clase requiere más tiempo y esfuerzo por tu parte para corregir sus tareas, atenderle en horario de tutorías, hacerle hueco en el aula, etc. Por el contrario, DataCamp puede ofrecer contenido de forma asíncrona a un número ilimitado de estudiantes.
¿Qué hay de nuevo?
Desde 2016, DataCamp ha invertido en muchas mejoras.
El ciclo evaluar–aprender–practicar–aplicar
En 2016, DataCamp tenía un único producto: nuestros cursos, diseñados para ayudar a adquirir nuevas habilidades. Con el tiempo, la visión pedagógica de DataCamp se ha articulado en torno al ciclo de evaluar tus competencias actuales, aprender habilidades nuevas, practicar esas habilidades, aplicarlas en contextos nuevos y volver a evaluar para ver cuánto has mejorado. La imagen siguiente muestra el ciclo evaluar–aprender–practicar–aplicar.

Figura 1: el ciclo evaluar–aprender–practicar–aplicar que sustenta la filosofía pedagógica de DataCamp.
Para ayudar a cerrar este ciclo, añadimos tres productos nuevos.
Practice
En 2017 incorporamos DataCamp Practice, con retos de código breves que se alinean estrechamente con el contenido de los cursos para reforzar el aprendizaje. El ejemplo siguiente muestra una pregunta tipo test que pone a prueba habilidades vistas en el curso Introduction to the Tidyverse.

Figura 2: un ejercicio de DataCamp Practice que evalúa habilidades de visualización de datos.
Projects
Ese mismo año lanzamos DataCamp Projects, que permite aplicar habilidades a problemas reales utilizando uno de los entornos de ciencia de datos más populares: Jupyter Notebooks.

Figura 3: un Project que permite aplicar habilidades en SQL.
Assessments
El paso final del ciclo llegó en 2019 con el lanzamiento de DataCamp Signal, nuestro producto de evaluación de habilidades que permite medir cuánto has aprendido. Las evaluaciones de habilidades se parecen, en concepto, al modo práctica pero bajo condiciones de examen: se evalúan contenidos relacionados con los cursos correspondientes, cada pregunta tiene un límite de tiempo y se asigna una puntuación según el número de aciertos y su dificultad. Puedes leer más sobre el uso de pruebas adaptativas y psicometría en Signal aquí.

Figura 4: una pregunta de evaluación de habilidades en Signal que mide conocimientos de machine learning en Python bajo presión de tiempo.
Mejoras en los cursos
Además de introducir tres productos nuevos, DataCamp ha mejorado sus cursos añadiendo varios tipos de ejercicios. Un área en la que el artículo del JSE fue especialmente premonitorio es que DataCamp necesitaba soporte para ejercicios gráficos de tipo «señalar y hacer clic».
Algunas estrategias docentes no eran posibles en la plataforma de DataCamp, pero veíamos margen para que la plataforma incorporase estos métodos a medida que desarrollase capacidades de presentación más sofisticadas. En particular, no era posible usar la plataforma de DataCamp para recorrer el uso de un applet que explicase un concepto concreto.
Ejercicios explorables
En 2019, DataCamp ideó un nuevo tipo de ejercicio que llamamos «ejercicio explorable». Permiten incluir paneles, visualizaciones interactivas e incluso software web en los ejercicios. Una forma de crearlos utiliza una herramienta llamada Shiny —una versión más moderna de los applets de Java a los que se refiere el artículo—. (También tenemos una serie de cursos sobre Shiny para quien quiera crear los suyos.)
Los ejercicios explorables se han aprovechado muy bien en la serie «For Everyone» de DataCamp, pensada para quienes necesitan comprender los datos pero no tienen background en ciencia de datos o analítica. En particular, el curso Data Visualization For Everyone saca gran partido de los paneles para que los estudiantes exploren cómo los cambios en los gráficos afectan a su capacidad para responder preguntas sobre ellos.
En el ejemplo siguiente, el estudiantado puede explorar cómo cambiar los colores de un gráfico afecta a la interpretación de las respuestas de una encuesta.

Figura 5: ejercicio explorable con un panel para investigar los efectos de las elecciones de color en un gráfico de barras apiladas.
Una de las críticas a DataCamp en los inicios era que, aunque los ejercicios de código enseñan muy bien a escribir fragmentos, era fácil perderse en los detalles sin entender cómo encajarlos. Aunque siempre hemos valorado enseñar los flujos de trabajo y animado a explicarlos en los vídeos, necesitábamos una herramienta más potente. El año pasado incorporamos otro tipo de ejercicio para ello. Los ejercicios de arrastrar y soltar permiten resolver moviendo elementos por la pantalla. Hay varias variantes, pero la más importante para enseñar flujos de trabajo es el «ejercicio de ordenación».
En el ejemplo siguiente, tomado de Introduction to Writing Functions in R, se pide reordenar los pasos de un flujo de trabajo para convertir un script en una función reutilizable. Al apartarnos de la escritura de código, pueden centrarse en el concepto.

Figura 6: ejercicio de arrastrar y soltar para enseñar un flujo de trabajo ordenando pasos.
Además de los ejercicios explorables y de arrastrar y soltar, añadimos muchos más tipos de ejercicio y formatos de contenido. Algunos de los más destacados son:
Ejercicios IDE
El ejercicio IDE utiliza uno de los editores de código más populares, Visual Studio Code. Este tipo se usa en nuestros contenidos más avanzados de ingeniería de datos.

Figura 7: ejercicio IDE que evalúa habilidades de «devops» para desplegar código con el entorno Visual Studio Code.
Ejercicios VM
Y más recientemente, creamos el ejercicio VM, que ejecuta una máquina virtual de Windows con software específico preinstalado. Se usan principalmente en nuestro contenido de Tableau.

Figura 8: ejercicio VM que enseña a manipular datos en la herramienta de business intelligence Tableau.
Algunas sugerencias del artículo son complejas de implementar en una plataforma online como DataCamp, por ejemplo:
En el aula física, dividimos a los estudiantes en equipos y cada equipo recibe una bolsa con 20 trozos de papel, cada uno con el alquiler de un piso muestreado impreso. Luego, cada equipo toma una muestra bootstrap de 20 pisos de su bolsa, calcula la mediana y la anota en la pizarra colocando un punto en el diagrama de puntos. El proceso ofrece una experiencia práctica de muestreo con reemplazo para construir una distribución bootstrap de medianas muestrales.
Aunque los instructores no pueden interactuar con el alumnado en nuestra plataforma, coincidimos en que los juegos didácticos son una parte importante de la enseñanza en directo. Por eso, en nuestro último hackathon, uno de nuestros equipos de ingeniería exploró la creación de DataCamp VR. Aunque aún faltan años, la innovación es clave para nuestra compañía (¡y nos lo pasamos en grande!).
Más allá de eso, es un error pensar que la educación online y la enseñanza presencial compiten entre sí. En DataCamp las vemos como complementarias. Por eso hemos lanzado una serie de webinars de live coding, donde los estudiantes pueden interactuar más de cerca con un instructor. Descubre nuestros próximos webinars y formaciones en directo aquí.
Mejora continua
A diferencia de otros medios educativos como los libros de texto, que se consideran «cerrados» al publicarse, en DataCamp el desarrollo de materiales no termina cuando se lanza un curso. Animamos activamente a los instructores a mejorar sus cursos para ofrecer una mejor experiencia: reescribir indicaciones poco claras, aclarar conceptos y mantener el contenido actualizado en el vertiginoso mundo de la ciencia de datos.
Curiosamente, la serie de cursos de estadística inferencial creada por los autores fue un gran motor de varias mejoras técnicas y de proceso en DataCamp. Aunque los cursos eran populares, los datos cuantitativos —como valoraciones y tasas de finalización— nos mostraron un amplio margen de mejora. El gran problema es que la estadística inferencial es conceptualmente difícil y requiere habilidades de programación de nivel intermedio para exponer esos conceptos.
Para solucionarlo, el equipo de Content Quality de DataCamp trabajó con los instructores para reescribir por completo los cuatro cursos. Nuestros Content Quality Analysts ajustaron el ritmo para introducir el nuevo código de forma más gradual, reescribieron instrucciones y simplificaron el código para que el foco estuviera en los conceptos. El resultado es que ahora son cuatro grandes cursos —para aprendices avanzados—.
En la línea de la mejora continua, uno de los próximos retos del equipo de Contenidos de DataCamp es averiguar cómo enseñar estadística inferencial a principiantes absolutos. ¡Atento a las novedades!
Mejoras para responsables de formación y desarrollo
El artículo del JSE expone muy bien los pros y contras de enseñar en DataCamp, pero contiene una ligera inexactitud al afirmar que
los cursos de DataCamp son asíncronos y a tu propio ritmo, por lo que [no hay] plazos que preocupen al estudiante.
Esto es cierto para la mayoría de quienes aprenden. Si tienes una suscripción personal a DataCamp, puedes aprender a tu ritmo y consumir el contenido como mejor encaje en tu día a día. Sin embargo, para nuestros clientes empresariales y académicos, DataCamp ha desarrollado un conjunto de herramientas administrativas para que administradores y docentes puedan seguir el progreso de sus empleados y estudiantes:
- Tareas: permitimos a instructores y administradores definir tareas de curso o de XP con fecha límite. El administrador del grupo recibirá automáticamente una exportación de los datos relevantes una vez venza el plazo.
- Informes: desde el lanzamiento de DataCamp para empresas y academia hemos ampliado enormemente las capacidades de reporting, ofreciendo insights automáticos sobre participación, adopción, uso de contenidos, uso de evaluaciones, etc. dentro de la aplicación.
- Datos de bajo nivel: los administradores pueden exportar datos de bajo nivel de sus grupos y clases para crear sus propios paneles localmente si lo prefieren.
- Integraciones con LMS y SSO: en 2019 ampliamos nuestras integraciones con sistemas de gestión del aprendizaje (LMS) a otros proveedores como SAP SuccessFactors y Degreed, y añadimos inicio de sesión único (SSO) para mayor seguridad.
Mejoras para instructores
Cuando DataCamp se lanzó, nos apresuramos a crear tantos cursos como fuera posible porque, sin cursos, no habría estudiantes. A medida que nuestra biblioteca ha crecido y nuestra base de usuarios se ha diversificado, correr para cubrir huecos del programa de formación es menos importante que cuestiones como «¿dónde encaja este curso respecto a los demás?» y «¿a quién le interesará hacer este curso?»
Esto significa que, al inicio del desarrollo, dedicamos tiempo a definir la audiencia objetivo con el instructor. Por ejemplo, el enfoque para explicar conceptos a expertos en machine learning es muy distinto al que requiere un público de managers de científicos de datos, que quizá sean menos técnicos pero deben dar feedback crítico sobre los resultados de un análisis.
También vemos que muchas personas prefieren seguir secuencias de cursos mediante nuestros career tracks y skill tracks. Por eso, durante el desarrollo, preguntamos mucho qué se espera que sepan antes de comenzar, qué otros cursos deberían haber hecho, qué se espera que aprendan al terminar y hacia qué otros cursos podría llevar. Hacer cursos no es algo aislado: es un viaje hacia una mayor competencia en datos.
Una vez acotado el alcance, hay que asegurarse de que realmente se aprende. DataCamp trabaja con sus instructores para definir objetivos de aprendizaje usando la taxonomía de Bloom —un marco para describir el nivel de dominio de una tarea—. Estos objetivos de aprendizaje alimentan las evaluaciones de habilidades de DataCamp Signal.
Por supuesto, todo esto puede ser mucho para quienes empiezan a impartir. Por eso, DataCamp ofrece amplio apoyo durante la creación del curso. Cada instructor recibe normalmente más de 80 horas de guía por parte de empleados de DataCamp —todos científicos de datos y educadores— sobre cómo estructurar el curso con una buena narrativa, cómo redactar buenos ejercicios y revisiones técnicas por pares del contenido. Además, contamos con un metacurso sobre cómo crear cursos en DataCamp y documentación extensa con pautas para encontrar datasets interesantes o grabar audio de alta calidad, entre otras cosas.
Una vez lanzados, DataCamp ofrece otra ventaja frente a la enseñanza presencial: los instructores reciben feedback cuantitativo sobre el rendimiento de sus cursos. La dificultad de cada ejercicio se evalúa por la proporción de estudiantes que piden pistas y soluciones, lo que permite detectar dónde se atascan. También se registran las respuestas incorrectas, de modo que los instructores pueden identificar qué errores son comunes y actualizar ejercicios para ganar claridad. Puedes saber más sobre cómo mejora DataCamp la calidad de sus cursos en este post.
En algunos casos, hemos visto que ciertos ejercicios de DataCamp resultan difíciles simplemente porque el código subyacente que queremos enseñar es complejo de usar. De hecho, los cursos de estadística inferencial mencionados se basaban en un paquete de R llamado infer, y varios empleados de DataCamp ayudaron a desarrollarlo para facilitar su uso. En DataCamp, nos enorgullece este bucle de feedback donde la enseñanza inspira el desarrollo. Detectar partes complejas del código y ayudar a los desarrolladores a mejorar hace que el software sea más fácil de usar para todos.
Conclusión
Nos alegra que nuestros instructores se hayan tomado el tiempo de contar su experiencia creando contenido para DataCamp. Doscientas setenta y seis personas han pasado ya por el proceso de instrucción, contribuyendo a nuestra misión de democratizar la ciencia de datos.
La educación online es especialmente relevante ahora que muchas personas están en casa. En nuestra misión de democratizar la competencia en datos para personas y empresas, nuestros equipos de producto, contenido e ingeniería trabajan continuamente para mejorar cómo enseñamos habilidades en datos. ¡Pronto habrá más novedades!
Feliz aprendizaje.
Apéndice: aclaración de la postura de DataCamp sobre observaciones del artículo
Queremos aclarar nuestra postura sobre algunos puntos del artículo del JSE.
- El artículo cuestiona la duración máxima de los vídeos en DataCamp y propone que los instructores puedan «dedicar 10–20 min a explicar temas». El límite de tiempo se basa en una publicación de edX sobre la duración óptima del vídeo para la implicación del estudiante. Tenemos contenido en vídeo de formato largo en grabaciones de webinars, pero creemos que vídeos más largos romperían el ritmo de los cursos.
- En DataCamp apoyamos las contribuciones open source. Tanto antiguos como actuales miembros del equipo de DataCamp contribuyeron al paquete infer en su tiempo libre y laboral: Chester Ismay, Nick Solomon y Richie Cotton (fuente).
- Aunque se menciona en el artículo, no tenemos contratos de exclusividad con los instructores. La propiedad intelectual permanece en el instructor.
- Reconocemos que, como empresa con ánimo de lucro, tomamos decisiones de forma diferente, pero siempre velando por el interés del estudiante. Nuestros incentivos están completamente alineados con crear material formativo de alta calidad, que influye directamente en el valor para nuestros clientes. Por eso hacemos un seguimiento tan detallado de métricas como las que se mencionan en el artículo.
- De forma similar a cómo se divulgó la relación comercial con DataCamp, creemos que habría sido apropiado divulgar la relación comercial de uno de los autores con RStudio al referenciar LearnR, un paquete creado por el equipo de RStudio.
- En relación con el artículo de BuzzFeed citado: DataCamp encargó una revisión independiente por terceros de los eventos de octubre de 2017, dirigida por Anurima Bhargava, exresponsable del Departamento de Justicia en la administración Obama, y Pamela Coukos de Working IDEAL. El informe resultante se publicó y se compartió online en este post del blog. Se invitó a participar en la revisión a miembros del Instructor Advisory Board (el «IAB») (incluida una de las autoras del artículo), así como a otras partes interesadas, entre ellas miembros de nuestra comunidad de instructores.

