Curso

Os notebooks se tornaram comuns em data science na maior parte dos últimos 10 anos, e todo cientista de dados já trabalhou com um. Eles permitem experimentar rapidamente e compartilhar insights por meio da criação ágil de ambientes, saída interativa e trechos de código que podem ser executados em qualquer ordem.
As organizações vêm investindo pesado em data science e analytics, e uma área-chave desse investimento são as ferramentas que permitem que cientistas de dados trabalhem com eficiência e experimentem rápido com dados. Os notebooks estão no centro disso e fazem parte de muitas inovações de ferramentas que vemos hoje no moderno data stack. Mais importante ainda, os notebooks também estão capacitando citizen data scientists a democratizar insights de dados.
Este artigo aborda o passado, o presente e o futuro dos notebooks e como eles estão derrubando barreiras no trabalho com dados e na colaboração.
a história do notebook de data science
Praticamente todo cientista de dados hoje já usou um notebook, sendo o mais popular o Jupyter Notebooks. No entanto, os notebooks têm uma história rica que antecede a data science — começando no início dos anos 1980.
a ascensão da programação literária
Apresentada em 1984 por Donald Knuth, a programação literária surgiu como uma metodologia para criar programas legíveis por humanos. A ideia era escrever a lógica do programa em linguagem natural, com trechos de código e macros como comentários separados, no formato conhecido como “WEB”. As macros são semelhantes ao pseudocódigo usado no ensino de ciência da computação.
Um pré-processador então analisa o WEB para criar o código-fonte (“tangle”) e a documentação (“weave”). A programação literária ainda é usada hoje, por exemplo no Axiom, mas as ideias centrais dessa abordagem inspiraram o desenvolvimento de notebooks muito parecidos com os que vemos atualmente.
os primeiros notebooks
Os primeiros notebooks de destaque foram o Wolfram Mathematica e o Maple, lançados no fim dos anos 1980. Eles operavam com um front-end e um kernel no back-end. A imagem abaixo mostra um gráfico 3D gerado no Mathematica com a conhecida notação In[ ] e Out[ ] que seguimos vendo nos notebooks de hoje.

o primeiro Wolfram Mathematica Notebook
Essas ferramentas tinham diferenças sutis, como usar Enter em vez de Shift + Enter para rodar o código e variações na maneira como operações matemáticas eram exibidas. Porém, ambas incorporavam ideias que influenciaram o design dos notebooks modernos.
Uma barreira importante para adoção em larga escala era o custo, já que essas ferramentas eram caras e exigiam licença. Esse foi um problema em todo o setor que levou, em 1998, à criação da Open Source Initiative, abrindo caminho para muitas das ferramentas poderosas e gratuitas que usamos hoje (como o Jupyter Notebooks!).
as bases dos notebooks modernos de data science
Em 2001, foram lançados o IPython e o SciPy, com o Matplotlib chegando em 2003. O SciPy permitiu realizar uma série de cálculos científicos em Python, enquanto o IPython melhorou a experiência no terminal e adicionou suporte a computação distribuída. Como hoje, o Matplotlib facilitou a criação de visualizações de dados em Python.
Só em 2005 essas e outras ferramentas open source foram reunidas em um único projeto, o SageMath. O objetivo era oferecer uma alternativa aberta ao Mathematica e ao Maple, combinando e ampliando outras ferramentas científicas open source e trazendo recursos baseados na web — marca registrada dos notebooks modernos.
Em 2011, o IPython lançou seu notebook, com uma distinção clara entre o front-end da aplicação web e o documento de notebook subjacente.

o IPython Notebook
o nascimento do Jupyter Notebooks
O Jupyter foi desmembrado do IPython em 2014, apresentando a interface de notebook e levando outras partes neutras em relação a linguagem do IPython. O nome veio das linguagens que ele suportava inicialmente: Julia, Python e R. Hoje, os Jupyter notebooks são a escolha número um dos cientistas de dados e, sem dúvida, a interface de notebook mais usada.
Uma área-chave de evolução nos últimos anos são os apps que separam o front-end do kernel, de modo que o front-end é acessado no navegador pelo usuário, enquanto o kernel roda em data centers na nuvem. Um ótimo exemplo é o DataCamp Workspace, onde você começa a trabalhar com uma instância de Jupyter Notebook direto no navegador.

JupyterLab no DataCamp Workspace
Com o avanço na adoção e popularidade dos notebooks, os últimos anos trouxeram uma onda de interfaces modernas que permitem que qualquer pessoa trabalhe com dados com facilidade. Na próxima seção, vamos detalhar como os notebooks modernos estão derrubando barreiras para trabalhar com dados.
como os notebooks modernos de data science capacitam citizen data scientists
A expressão Citizen Data Scientists foi cunhada pela Gartner em 2016. Citizen Data Scientists têm habilidades técnicas, mas podem não ter formação tradicional em data science, estatística ou ciência da computação.
À medida que a data science deixa de ser apenas uma área e se consolida como uma metodologia para resolver problemas de negócio, os Citizen Data Scientists se tornam a cara das organizações modernas orientadas por dados. Os notebooks são excelentes ferramentas para esses profissionais, pois permitem rápida experimentação e geração de insights compartilháveis com pouca ou nenhuma barreira de entrada.
Embora os notebooks sempre tenham sido ótimos para explorar e analisar rapidamente um dataset, antes eles deixavam a desejar em colaboração e compartilhamento de insights. Em 2022, isso mudou: notebooks modernos e seu ecossistema passaram a cobrir muitos desses pontos cegos históricos. Veja algumas formas como eles estão impulsionando produtividade, eficiência e colaboração.
notebooks modernos de data science são colaborativos
Um exemplo claro de ferramenta colaborativa moderna é o Google Docs. Vários usuários podem usar e editar documentos, e também é possível controlar quem pode editar e quem só pode sugerir comentários. As alterações são salvas com frequência para evitar perdas.
Tecnologia semelhante agora está disponível para notebooks com ferramentas como o Deepnote e o Datacamp Workspace. Diversos usuários podem editar e executar notebooks e deixar comentários. Toda essa colaboração acontece em tempo real, tornando o processo muito mais eficiente.

colaboração no DataCamp Workspace
Colaboração é essencial para quem trabalha com dados. Reduzir barreiras de colaboração também significa reduzir silos de dados ao compartilhar conhecimento e expertise. Tradicionalmente, colaborar via notebooks podia ser lento; já o data stack moderno é rápido e eficiente. Muitas ferramentas se integram perfeitamente ao stack tecnológico existente, permitindo que os usuários trabalhem com o que já conhecem e ainda colaborem com colegas.
eles ajudam a democratizar insights
Compartilhar análises com outros públicos pode ser difícil — sejam stakeholders de negócio ou perfis mais técnicos. Historicamente, profissionais compartilhavam relatórios e insights de notebooks por e-mail, Slack, apresentações ou web apps sob medida.
Os notebooks modernos, porém, democratizam insights ao permitir o compartilhamento de forma fluida. Por exemplo, o IPyWidgets adiciona widgets interativos aos notebooks, permitindo que usuários ajustem sliders para mudar gráficos e interajam mais com os insights. O Binder transforma um repositório em notebooks interativos hospedados, permitindo que qualquer pessoa rode e interaja com o notebook. O Voila transforma um notebook em um web app hospedado, permitindo interação total até sem ver o código. O Datacamp Workspace permite compartilhar notebooks e oferece templates para contar histórias com dados.

publicação de relatórios no DataCamp Workspace
eles podem reduzir o gap de talentos
Data science é ampla e profunda: há muito o que aprender em diversas áreas. Ser especialista em NLP não faz de você um grande engenheiro de dados — e nem garante domínio em visão computacional.
Um elo essencial entre os diferentes subcampos é dado e infraestrutura. Sem bons dados, modelos não performam bem. Da mesma forma, sem infraestrutura para dar suporte ao desenvolvimento de modelos e à limpeza de dados, é muito difícil começar.
Para os Citizen Data Scientists, não é necessário ter habilidades avançadas de engenharia. Notebooks modernos permitem começar rápido aproveitando infraestrutura em nuvem. Ambientes e pacotes são bem gerenciados e podem ser atualizados e modificados com facilidade pela maioria dos usuários. Assim, lacunas de engenharia não precisam ser preenchidas, e os profissionais podem focar em gerar insights.
Além disso, a maior parte das técnicas de data science funciona muito bem em notebooks — é possível treinar modelos, traçar gráficos 3D e construir pipelines de dados. Isso garante que Citizen Data Scientists experimentem um leque completo de técnicas e comuniquem resultados com facilidade para stakeholders ou compartilhem o código com usuários técnicos.
notebooks modernos integram com outras ferramentas
Já vimos como notebooks modernos derrubam silos entre times e reduzem a barreira de entrada para trabalhar com dados. Outro ponto de dor histórico era a falta de integração com outras ferramentas do fluxo de trabalho de data science. Um exemplo clássico é SQL.
No passado, profissionais configuravam conexões com bancos usando pacotes como `mysql.connector` em Python ou `DBI` em R. Essas bibliotecas exigiam configurar manualmente as conexões e inserir credenciais para acessar os dados.
Os notebooks modernos, por sua vez, oferecem suporte nativo a SQL. No DataCamp Workspace, por exemplo, é possível configurar uma conexão segura diretamente do Editor de Notebooks do DataCamp para bancos como PostgreSQL, MySQL e Amazon Redshift. Os dados extraídos desses bancos integrados podem então ser analisados com R ou Python.

células SQL no DataCamp Workspace
o futuro do notebook de data science
O notebook moderno está no coração da revolução dos dados. Ele equipa profissionais com diferentes níveis de habilidade para experimentar com dados com facilidade, compartilhar insights e aproximar o negócio do time de dados. Além disso, os notebooks estão capacitando citizen data scientists e impulsionando uma nova onda de fluência em dados nas organizações.
Organizações data-first como a Netflix são famosas por sua inovação com notebooks, já que eles são a ferramenta mais popular para trabalhar com dados entre perfis e equipes. O futuro dos notebooks será definido por maior agilidade, melhor integração com o restante do data stack e colaboração e compartilhamento robustos para democratizar insights. Para saber mais sobre notebooks, confira estes recursos:

