Pular para o conteúdo principal

O que o Exército dos EUA pode ensinar sobre ciência de dados

A vida militar ensina habilidades, traços e hábitos muito úteis. E também mostra como começar em ciência de dados na prática.
Atualizado 17 de set. de 2026  · 14 min lido

Explorar com IA

ChatGPTClaudePerplexity

Quando concluí recentemente a trilha de carreira Data Scientist with Python da DataCamp, me senti pronto para encarar desafios reais com dados — mas não é bem assim. Completar cursos na DataCamp ou na universidade é só o primeiro passo de uma longa jornada para se tornar um cientista de dados. As habilidades que você aprendeu precisam ser praticadas, lapidadas e transformadas em um portfólio que mostre o que você sabe e comprove para futuros empregadores que você pode agregar valor ao time.

Mas como chegar lá?

Ter algumas ferramentas no seu arsenal e saber usá‑las razoavelmente bem é uma coisa; começar, de fato, pode ser assustador.

Então, por onde começar?

Este artigo não é sobre o código que você vai escrever, e sim sobre o processo que você vai seguir. Vou tentar responder a essa pergunta a partir da minha experiência no Exército dos EUA.

Assuntos Civis e Gestão de Informações Civis

Antes de iniciar meu caminho em ciência de dados, passei vinte anos nas Forças Armadas dos EUA, sendo os últimos cinco na reserva do Exército, no ramo de Assuntos Civis (Civil Affairs). Em resumo, Assuntos Civis é a área do Exército responsável por estabilizar uma região após um desastre ou conflito. Eles são mobilizados em situações que vão do surto de Ebola no Chifre da África (2014 a 2016) à recuperação após o furacão Katrina. Também são muito acionados em conflitos como a Guerra do Iraque. A missão é devolver a região à “vida normal” que existia antes do desastre.

E o que isso tem a ver com ciência de dados?

Assuntos Civis depende de informação. Ou seja, dados. Para restaurar uma região à normalidade, é preciso saber o que era normal — e se esse “normal” é suficiente para garantir estabilidade. A população pode achar normal não ter sistema educacional, segurança ou até água potável. Decidir o que uma região precisa para se tornar estável exige uma quantidade enorme de dados que devem ser coletados, analisados e colocados nas mãos de quem decide.

Os tomadores de decisão em Assuntos Civis são o equivalente ao “alto escalão” no mundo corporativo. São oficiais de alta patente e autoridades governamentais, líderes de agências como a Cruz Vermelha e a Organização Mundial da Saúde, que determinam para onde vão dinheiro, esforço e tempo. Suas decisões se baseiam fortemente em informações de qualidade coletadas por um processo chamado Civil Information Management (CIM) — gestão de informações civis.

Meu tempo em Assuntos Civis foi como líder de um time de CIM, ensinando o processo para outras unidades e aprimorando as técnicas que usávamos. Eu era amplamente considerado um especialista no assunto e posso afirmar: isso não é exclusivo do meio militar. Os dados que usávamos não eram sigilosos. Precisavam ser consumidos pelo Exército, governos locais, FEMA e organizações civis como a Cruz Vermelha e a OMS.

O processo de CIM que usávamos para coletar, analisar e disseminar essas informações pode ser aplicado à ciência de dados e, pelo que vi na DataCamp, é amplamente utilizado — talvez só mude o nome.

Ciência de dados vai além do terminal ou do Jupyter Notebook. Ao trabalhar com um conjunto de dados, quase sempre existe um objetivo final e um cliente. Se você está explorando um dataset por curiosidade ou para praticar, o cliente é você. O cliente pode ser o público do seu blog, colegas de trabalho, seu gestor ou um cliente pagante.

Se você aceita que sempre há um cliente, também precisa aceitar que sempre deve existir um produto — e esse produto precisa responder à “pergunta” central.

A pergunta

Antes de entrar nas seis etapas do processo de CIM, você precisa saber qual é “a pergunta”. Em termos simples, é o motivo pelo qual você está fazendo a análise.

Por exemplo, em Intro to Python for Data Science, a pergunta é: “Qual é a altura mediana dos goleiros no FIFA?”. No Kaggle Titanic Competition, a pergunta é: “Que tipo de pessoa tinha mais chance de sobreviver ao naufrágio do Titanic?”.

Sempre existe uma pergunta e, em muitos casos, são várias. Sabendo qual é “a pergunta”, você pode começar o processo.

O processo de CIM

Coleta

Sem dados, não há o que analisar — nem razão de existir cientista de dados. Os conjuntos usados na DataCamp, Kaggle, Driven Data e Data.gov precisaram ser coletados. Há uma quantidade quase infinita de dados na Internet e boa parte da coleta pode ser automatizada com web scraping e outras técnicas. Quando eu estava em Assuntos Civis, usava bastante o CIA World Factbook, dados de Censos e o Google Maps.

Mas nem sempre é tão simples.

Em novembro de 2016, a cidade de Gatlinburg, no Tennessee, foi atingida por um incêndio florestal devastador que destruiu mais de 2.500 casas e comércios. Na época eu servia em uma unidade de Assuntos Civis em Knoxville, ali perto, e fomos chamados para ajudar na avaliação dos danos. A região é rural e montanhosa, com casas espalhadas pelas montanhas, e é quase impossível manter mapas atualizados. A única forma de saber quais construções ainda estavam de pé foi coletar os dados manualmente. Em parceria com voluntários e órgãos locais, dividimos equipes e percorremos de carro ou a pé aquelas estradas rurais em busca de residências. Para cada construção que encontrávamos, marcávamos no mapa e registrávamos o grau de dano. Depois, esses dados eram enviados para consolidação pelos órgãos locais.

Outro grande exemplo de coleta manual é o conjunto Scandens Beak Depth Heredity, usado em Statistical Thinking in Python Part 2. Esses dados vieram de mais de 40 anos de observações!

É bem provável que você não precise ir tão longe para conseguir dados. Você pode começar com os datasets fornecidos no início de cada curso da DataCamp e, se nada agradar, explorar os recursos citados acima ou simplesmente procurar no Google o que você precisa.

Consolidação

É ótimo quando você encontra um dataset com tudo o que precisa, bem empacotado. Infelizmente, isso é exceção. Na maioria das vezes, você encontrará dados em partes que precisam ser reunidas.

Consolidação é quando os dados começam a ser organizados a partir da forma bruta em um conjunto com o qual dá para trabalhar.

Embora muito do dado inicial em Assuntos Civis venha da Internet, é minoria. A grande maioria vem de pessoas em campo. As equipes vão até a área, tiram fotos, entrevistam a população local e avaliam prédios como aeroportos, escolas, delegacias e usinas. Tudo isso volta em relatórios escritos que precisam ser consolidados em informação utilizável. Eu não participei da consolidação dos dados dos incêndios de que falei, mas cada um daqueles mapas marcados à mão precisou ser unificado em uma fonte única, com coordenadas, condição e descrição de cada imóvel vistoriado.

Para quem está começando em ciência de dados, é na consolidação que a maioria de nós passa a “pegar” nos dados.

Pegue os dados do Scandens Beak Depth Heredity, por exemplo. Cada relatório diário precisou ser consolidado em relatórios semanais ou mensais, depois anuais, até chegar a um único conjunto representando 40 anos.

Uma boa consolidação poupa muito trabalho lá na frente, porque já permite limpar os dados e colocá‑los nas categorias certas. Técnicas como merge, join e append mostram seu valor nessa etapa.

Processamento

Sejamos sinceros: mesmo quando encontramos um dataset coletado e consolidado com tudo o que procuramos, ele provavelmente estará “feio” e precisará de limpeza. Processamento é quando pegamos “dados” e transformamos em algo utilizável, pronto para análise. Em Assuntos Civis, passei muito tempo coletando e consolidando, mas foi no processamento que realmente conheci os dados e comecei a desenhar o plano de análise.

No time de CIM, fazíamos muitas “avaliações de área”: uma análise inicial de determinada região, antes de irmos a campo, para entender quais problemas priorizar. Depois de coletar e consolidar os dados relevantes, nós os processávamos em informação consumível — antes mesmo da análise. O resultado geralmente era uma planilha do Excel ou um banco de dados com informações limpas e categorizadas, que podiam ser pesquisadas ou filtradas para responder perguntas básicas sem precisar de análise profunda.

Em ciência de dados, é aqui que organizamos e exploramos o dataset e fazemos a análise exploratória (EDA). Dá para evitar muita dor de cabeça na análise se você tiver cuidado em categorizar e rotular corretamente, além de garantir que cada variável esteja com o “tipo” adequado. Um bom processamento prepara o terreno para uma ótima análise.

Análise

Voltando à avaliação de área: é ótimo ter um dataset que eu possa consultar e obter respostas. Posso descobrir quantos médicos existem na região ou quantos galões de água potável por pessoa por ano estão disponíveis. Isso é importante, mas ainda não é análise. A análise responderia perguntas como: “como a região se compara às vizinhas em Governo, Economia, Infraestrutura, Segurança e Saúde?” e “no ritmo atual de consumo, em quanto tempo a região ficará sem água potável?”.

Análise é o coração do que a maioria de nós veio fazer na DataCamp; é a parte mais divertida para mim e onde respondemos à pergunta central. Também é tema amplamente coberto em praticamente todos os cursos da DataCamp, então não vou me alongar. O ponto-chave é trabalhar os dados e tirar conclusões.

Produção

Voltando ao incêndio de Gatlinburg. Depois de coletar, consolidar e processar tudo em um banco com as coordenadas de cada construção, sua condição e a descrição dos danos, determinamos que 60% dos prédios na área afetada foram destruídos além de qualquer reparo. Respondemos à pergunta: “qual a extensão do impacto do incêndio na região?”.

Podemos ir além, estimar o valor de cada imóvel danificado e calcular o custo de reconstrução de toda a área, detalhando por bairro e rua. Também dá para identificar quais bairros foram mais atingidos, priorizando os esforços de reconstrução.

A análise é ótima, mas não adianta nada se não virar um produto — e é disso que trata a etapa de Produção no CIM. Tudo até aqui constrói este momento: criar a peça de vitrine, aquilo que você vai compartilhar com o cliente.

É a culminação de tudo o que você fez com os dados. O produto pode ser um Jupyter Notebook, uma planilha com tabelas e gráficos, uma página web, um PDF ou código-fonte. Outras opções: apresentação presencial, vídeo guiando a análise ou slides no Sway ou PowerPoint. Independentemente do formato, a escolha precisa atender às necessidades do cliente. Alguns requisitos adicionais:

  1. Ser claro, objetivo e fácil de consumir pelo cliente.
  2. Contar a história e fazer sentido para o cliente.
  3. Estar adequado ao nível técnico e educacional do cliente.

Disseminação

Disseminação é a etapa final do processo de CIM e, à primeira vista, parece simples: basta entregar o produto ao cliente. Porém, pensando bem, é provavelmente a etapa mais importante. No time de CIM, geralmente produzíamos PDFs, slides em PowerPoint ou relatórios em Excel. Por quê? Porque são formatos acessíveis, fáceis de usar e portáteis, que quase todo mundo domina.

Com as habilidades que tenho hoje, eu poderia ter criado páginas web interativas com relatórios, gráficos Bokeh com sliders e filtros e mapas interativos. Seria um produto complexo e dinâmico que quase todos poderiam usar, já que estaria dentro de uma página web. Mas, por melhor que seja o produto final, ele não serve para nada se não for disseminado ao cliente de uma forma:

  • Acessível: por se tratar de informação, o cliente precisa conseguir acessá‑la. Esconder o produto em algum lugar inacessível ao público-alvo dificulta o consumo e leva ao esquecimento.
  • Fácil de usar: o método de entrega deve ser simples para a ampla maioria do público. Por exemplo, entregar um script em Python para um grupo de cientistas de dados pode funcionar, mas enviar o mesmo script para alguém que não sabe rodar “data_analysis.py” provavelmente não vai dar certo.
  • Portátil: consumimos cada vez mais informação no celular. Raramente temos tempo para sentar à mesa e ler conteúdos longos. Produtos de dados precisam ser portáteis, seja via aplicativos do Office como PowerPoint e Excel, PDFs ou pela internet.

Há uma abundância de formas de disseminar seu trabalho, e seria impossível listar todas aqui. A escolha exige decisão consciente. Pergunte sempre: “Como posso entregar este produto ao cliente da maneira que melhor atenda às necessidades de acessibilidade, facilidade de uso e portabilidade?”.

Dito isso, se você está montando um portfólio, Github, Anaconda Cloud, páginas e blogs pessoais e redes sociais são ótimos pontos de partida. Não tenha medo de publicar seu trabalho e compartilhá‑lo com outras pessoas com os mesmos interesses.

Considerações finais

Se você trabalha com dados, provavelmente já usa algumas das etapas que descrevi. Mesmo que não participe pessoalmente das seis, agora você tem uma visão mais clara delas e de um processo para transformar dado bruto em produto final. Pode parecer estranho falar de procedimentos militares em ciência de dados, mas essas seis etapas me serviram muito bem tanto nas Forças Armadas quanto no mundo corporativo — e espero que também ajudem você na sua jornada para se tornar um cientista de dados.

Tópicos
Ciência de dados
Relacionado

blog

O que é ciência de dados? Definição, exemplos, ferramentas e mais

A ciência de dados é um campo interdisciplinar que usa métodos científicos, processos, algoritmos e sistemas para extrair conhecimento e percepções de dados estruturados e não estruturados.
Matt Crabtree's photo

Matt Crabtree

15 min

blog

As 15 principais habilidades para cientistas de dados em 2026

Uma lista das habilidades essenciais que todo cientista de dados deve ter em seu arsenal, incluindo recursos para desenvolver suas habilidades.
Javier Canales Luna's photo

Javier Canales Luna

8 min

blog

As 10 melhores ferramentas de ciência de dados para usar em 2026

As ferramentas essenciais de ciência de dados para iniciantes e profissionais da área para coletar, processar, analisar, visualizar e modelar os dados de forma eficiente.
Abid Ali Awan's photo

Abid Ali Awan

9 min

blog

O que é o Shell?

Descubra o que é o Shell e como aprendê-lo pode tornar você um cientista de dados mais eficiente e versátil.

Wendy Gittleson

13 min

blog

Um roteiro de ciência de dados para 2026

Quer começar ou crescer na área de ciência de dados? Esse roteiro de ciência de dados ajuda você a entender e começar a trabalhar na área de ciência de dados.
Mark Graus's photo

Mark Graus

15 min

Data Science Concept Vector Image

blog

Como se tornar um cientista de dados em 2026

Descubra tudo o que você precisa saber sobre como se tornar um cientista de dados e veja se essa é a carreira certa para você!
Jose Jorge Rodriguez Salgado's photo

Jose Jorge Rodriguez Salgado

12 min

Ver MaisVer Mais