Como a DataCamp cria o melhor programa de estudos em ciência de dados
Na DataCamp, temos orgulho de oferecer a melhor plataforma e o melhor programa de estudos para aprender ciência de dados. Por isso, nos dedicamos para que cada exercício seja eficaz para ensinar e, ao mesmo tempo, prazeroso. Depois que um curso é lançado, ele não é considerado "pronto": o lançamento é só o começo da coleta de dados. Sempre que um aluno tenta resolver um exercício, registramos pontos de dados como quantas tentativas foram necessárias e se ele precisou de ajuda com dica ou solução. Ao agregar esses dados de todos os alunos, conseguimos uma visão de quão difícil é cada exercício. Além disso, os alunos podem avaliar os exercícios de uma a cinco estrelas e enviar feedback dizendo o quanto gostaram.
Nosso time de Content Quality trabalha com os instrutores para agir com base nesses dados e melhorar os cursos. Isso pode acontecer de várias formas, já que muita coisa pode dar errado em um exercício.
1. Corrigindo dados ausentes
Às vezes, pequenos detalhes incomodam muita gente. No curso Data Science Toolbox (Part 1), os alunos aprendem a escrever funções lambda em Python usando um conjunto de dados baseado na Sociedade do Anel, de J.R.R. Tolkien, da trilogia O Senhor dos Anéis. Infelizmente, o conjunto de dados não tinha o Gandalf nem o Pippin. Nossos alunos reclamaram com razão, nós ouvimos e corrigimos o problema.

2. Evitando equívocos e confusões para os alunos da DataCamp
Analisar o feedback de muitos exercícios pode revelar padrões de conceitos equivocados que os alunos têm. Muitas análises de dados mantêm suas informações em formato retangular, em que cada linha é um registro e cada coluna é um valor daquele registro. Por exemplo, cada linha pode corresponder a uma pessoa, e as colunas podem ser nome, altura e cor favorita.
Uma prática muito comum de manipulação de dados é filtrar as linhas desse conjunto retangular. Um instrutor poderia escrever uma instrução como:
Filtre o conjunto de dados para remover as linhas em que as pessoas têm menos de 170 cm.
Isso funciona, mas a maior parte dos softwares estatísticos, incluindo o pacote dplyr do R e o pacote Pandas do Python, fazem você filtrar especificando o que quer manter. Se a instrução for reescrita assim:
Filtre o conjunto de dados para manter as linhas em que as pessoas têm mais de 170 cm.
Então a instrução passa a refletir o modo como o código funciona e evita um ponto de confusão para os alunos. Em cursos avançados, nos quais se espera familiaridade com manipulação de dados, essa formulação seria menos problemática. No nosso curso Pandas Foundations, percebemos que muitos alunos estavam com dificuldade por causa disso e ajustamos a linguagem.
3. Criando uma jornada de aprendizagem mais fluida com feedbacks mais completos e granulares
Todos os exercícios da DataCamp são avaliados automaticamente por um software desenvolvido pelo nosso time de Content Engineering. Isso permite dar feedback inteligente e imediato quando o aluno erra. É talvez o maior diferencial da nossa plataforma. Uma das partes mais difíceis é antecipar os erros dos alunos para orientar direitinho o que fazer diferente na próxima tentativa. Por isso, ocasionalmente uma solução correta pode ser marcada como incorreta. Quando isso acontece, os alunos detestam. Em um caso, um aluno reclamou:

No nosso curso Cluster Analysis in R, muitos alunos notaram que, embora a solução sugerida para um exercício usasse a conhecida função min() para calcular um valor mínimo, havia uma alternativa mais simples e elegante usando a menos conhecida função de mínimo paralelo, pmin().

Inicialmente, o exercício aceitava apenas uma solução, mas com a ideia engenhosa dos alunos, passamos a aceitar as duas. Um dos objetivos do time de Content Engineering ao desenvolver o sistema de feedback da DataCamp é ampliar a flexibilidade da avaliação, permitindo que os alunos resolvam problemas do seu próprio jeito.
Outra frustração comum com nosso feedback automatizado é ver a mesma mensagem repetida várias vezes durante um exercício. O princípio está ilustrado no diagrama abaixo, em que o aluno precisa criar um array em Python com três elementos.

Ao oferecer feedback mais granular, que trate problemas específicos da resposta do aluno, proporcionamos uma experiência de aprendizagem mais positiva. Os resultados dessa melhoria são animadores. Em um exercício do nosso curso Intermediate Python for Data Science, a mudança para feedback granular fez a porcentagem de alunos que viam a mesma mensagem mais de uma vez cair de cerca de 65% para menos de 10%.

A porcentagem de usuários que veem a mesma mensagem de feedback mais de uma vez é uma métrica que monitoramos em todos os exercícios e cursos. Em combinação com a popularidade dos cursos, criamos uma forma baseada em dados para seguir aprimorando a experiência de aprendizagem com o maior impacto possível.
Conclusão
Nossa meta para o fim do ano é que, na metade mais popular dos cursos, a média da taxa de feedback repetido ao longo de todos os exercícios fique abaixo de 30% em cada curso.
Vamos continuar aplicando essas melhorias em todas as tecnologias que os alunos podem aprender na DataCamp. Internamente, também aprimoramos as ferramentas usadas para criar o feedback e analisar as submissões dos alunos, garantindo que a experiência de aprendizagem continue evoluindo para todo o conteúdo atual e futuro.
Muita coisa pode dar errado em um exercício, mas esperamos que isso mostre como a DataCamp ouve o feedback dos alunos e trabalha continuamente para aumentar a satisfação com nossos cursos.

