Cuando terminé recientemente el itinerario de carrera Data Scientist with Python de DataCamp, sentí que tenía munición para enfrentarme a retos de datos reales, pero no es tan sencillo. Completar cursos en DataCamp o en la universidad es solo el primer paso de un camino largo para convertirte en científico/a de datos. Las habilidades que has aprendido hay que practicarlas, pulirlas y transformarlas en un porfolio que demuestre lo que sabes hacer y convenza a futuros empleadores de que puedes aportar valor a su equipo.
Pero, ¿cómo llegas hasta ahí?
Tener algunas herramientas y saber más o menos usarlas es una cosa; arrancar de verdad puede imponer bastante.
Entonces, ¿por dónde empiezas?
Este artículo no va del código que escribirías, sino del proceso que seguirías. Voy a intentar responder a esa pregunta desde mi experiencia en el ejército de Estados Unidos.
Asuntos Civiles y gestión de información civil
Antes de empezar mi camino para ser Data Scientist, pasé veinte años en las Fuerzas Armadas de EE. UU., los últimos cinco en la rama de Asuntos Civiles de la Reserva del US Army. En pocas palabras, Asuntos Civiles es la rama del Ejército encargada de estabilizar una región tras un desastre o un conflicto. Se despliegan en situaciones que van desde el brote de ébola en el Cuerno de África (2014–2016) hasta la recuperación tras el huracán Katrina. También se emplean mucho durante conflictos como la guerra de Irak. Su misión es devolver una región a lo que era la "vida normal" antes del desastre.
Ahora te preguntarás: ¿qué tiene que ver esto con la ciencia de datos?
Asuntos Civiles se apoya en la información. Es decir, en los datos. Para devolver una región a la normalidad, primero hay que saber qué era "normal" y si esa normalidad basta para que sea estable. Puede que la población considere normal carecer de sistema educativo, seguridad o incluso agua potable. Tomar decisiones sobre lo que una región necesita para estabilizarse exige enormes volúmenes de datos que hay que recopilar, analizar y poner en manos de quienes deciden.
Quienes toman decisiones en Asuntos Civiles serían lo que en la empresa privada llamarías alta dirección. Son altos mandos militares y funcionarios, líderes de organismos como la Cruz Roja y la Organización Mundial de la Salud, que deciden en última instancia dónde invertir dinero, esfuerzos y tiempo. Sus decisiones se basan en gran medida en resultados de buena información recopilada mediante un proceso conocido como Civil Information Management (CIM).
Mi etapa en Asuntos Civiles la pasé liderando un equipo de CIM, enseñando el proceso de CIM a otras unidades de Asuntos Civiles y mejorando las técnicas que usábamos. Se me consideraba ampliamente experto en la materia en CIM, y puedo asegurarte que no es exclusivo del ámbito militar. Los datos que usábamos no eran clasificados. Tenían que ser consumibles por el ejército, las administraciones locales, FEMA y organizaciones civiles como la Cruz Roja y la OMS.
El proceso de CIM que empleábamos para recopilar, analizar y difundir esa información se puede aplicar a la ciencia de datos y, por lo que he visto en DataCamp, se usa mucho aunque no siempre con ese nombre.
La ciencia de datos va más allá de la línea de comandos o un Jupyter Notebook. Cuando trabajas con un conjunto de datos casi siempre hay un objetivo final y un cliente. Si analizas un dataset por curiosidad o para practicar, el cliente eres tú. El cliente puede ser el público de tu blog, otras personas de tu empresa, tu responsable o un cliente que te paga.
Si aceptas que siempre hay un cliente, también debes aceptar que siempre tiene que haber un producto, y ese producto debe responder a la gran "pregunta".
La pregunta
Antes de meterte en el proceso de seis pasos del CIM, tienes que saber cuál es "la pregunta". En pocas palabras, es el motivo por el que haces el análisis.
Por ejemplo, en Intro to Python for Data Science, la pregunta es: "¿Cuál es la altura mediana de los porteros en FIFA?". En la competición Titanic de Kaggle, la pregunta es: "¿Qué tipo de persona tenía más probabilidades de sobrevivir al hundimiento del Titanic?".
Siempre hay una pregunta y, en muchos casos, varias. Una vez tengas clara "la pregunta", puedes empezar el proceso.
El proceso CIM
Recopilación
Sin datos no habría nada que analizar ni, en realidad, motivo para la ciencia de datos. Los datasets que se usan en DataCamp, Kaggle, Driven Data y Data.gov han tenido que recopilarse. En Internet hay datos casi ilimitados y gran parte de la recopilación puede automatizarse con web scraping u otras técnicas. Cuando estaba en Asuntos Civiles, me apoyaba mucho en el CIA World Factbook, datos del censo y Google Maps.
Aun así, no siempre es tan sencillo.
En noviembre de 2016, la localidad de Gatlinburg (Tennessee) sufrió un devastador incendio forestal que destruyó más de 2.500 viviendas y negocios. En ese momento yo estaba destinado en una unidad de Asuntos Civiles en la cercana Knoxville (Tennessee) y nos pidieron ayudar a evaluar los daños. La zona de Gatlinburg es rural y montañosa, con casas dispersas por las montañas, y es casi imposible mantener los mapas al día. La única forma de saber qué edificios seguían en pie era recopilar los datos manualmente. Junto con voluntarios locales y organismos públicos, nos dividimos en equipos y recorrimos en coche o a pie esas carreteras rurales para localizar viviendas. De cada edificio que veíamos, lo marcábamos en el mapa y anotábamos el grado de daño. Luego las agencias locales recopilaban toda esa información.
Otro gran ejemplo de recopilación manual es el conjunto de datos Scandens Beak Depth Heredity, utilizado en Statistical Thinking in Python Part 2. ¡Se obtuvo a partir de más de 40 años de observaciones personales!
Seguro que tú no tendrás que llegar tan lejos para conseguir datos con los que trabajar. Puedes empezar con los datasets que se facilitan al comienzo de cada curso de DataCamp y, si no encuentras nada que te guste, explorar los recursos anteriores o simplemente buscar en Google los datos que necesitas.
Integración
Es una gran sensación cuando das con un dataset que trae toda la información que buscas, bien empaquetada. Por desgracia, eso es más la excepción que la norma. La mayoría de las veces encontrarás los datos en piezas que hay que ensamblar.
La integración es el punto en el que los datos empiezan a organizarse desde su forma bruta en un conjunto con el que se pueda trabajar.
Aunque mucha de la información inicial en Asuntos Civiles proviene de fuentes online, es una pequeña parte. La gran mayoría llega de la gente sobre el terreno. Los equipos de Asuntos Civiles entran en un área, hacen fotos, entrevistan a la población y evalúan edificios como aeropuertos, escuelas, comisarías o centrales eléctricas. Todo eso vuelve en informes escritos que hay que integrar en información útil. Yo no participé en integrar los datos de los incendios de los que hablé, pero todos aquellos mapas marcados a mano hubo que convertirlos en una única fuente que mostrara coordenadas, estado y descripción de cada propiedad evaluada.
Como futuro/a Data Scientist, diría que la integración es donde la mayoría empezamos a tocar datos.
Toma los datos de Scandens Beak Depth Heredity, por ejemplo. Cada informe diario hubo que integrarlo en informes semanales o mensuales, luego anuales y, finalmente, en un único dataset que representa 40 años de datos.
Una buena integración ahorra mucho trabajo después, porque te permite ir limpiando los datos y ubicarlos en categorías adecuadas que serán más fáciles de manejar. Técnicas como merge, join y append son imprescindibles aquí.
Procesamiento
Seamos sinceros: incluso si encontramos un dataset ya recopilado e integrado con toda la información que buscamos, probablemente estará desordenado y necesitará limpieza. El procesamiento es donde convertimos los "datos" en algo utilizable y listo para analizar. En Asuntos Civiles pasé mucho tiempo recopilando e integrando datos, pero en el procesamiento es donde realmente llegaba a conocerlos y a perfilar mi plan de análisis.
En el equipo de CIM hice muchas lo que llamábamos "evaluaciones de área": un análisis inicial de una zona, antes de pisarla, que nos da una idea de qué problemas habrá que priorizar allí. Tras recopilar e integrar los datos relevantes del área, se procesan en información consumible, incluso antes del análisis. El resultado suele ser un libro de Excel o una base de datos con información limpia y categorizada que se puede buscar o filtrar para responder preguntas básicas sin necesidad de análisis.
En ciencia de datos, aquí es donde ordenamos y exploramos los datos y realizamos el análisis exploratorio. Puedes ahorrarte muchos problemas más adelante si te aseguras de categorizar y etiquetar bien los datos y de que su "tipo" sea el adecuado. Procesarlos con mimo sienta las bases de un buen análisis.
Análisis
Volviendo a mi evaluación de área, está genial tener un dataset que pueda consultar para obtener respuestas. Podría averiguar cuántos médicos hay en la zona o cuántos galones de agua potable por persona y por año tiene la región. Es información importante, pero no es un análisis. El análisis respondería a preguntas como: "¿Cómo se compara el área con su entorno en gobierno, economía, infraestructuras, seguridad y sanidad?" y "Al ritmo actual de consumo, ¿cuánto tardará la zona en quedarse sin agua potable?".
El análisis es el núcleo de lo que probablemente nos trae a DataCamp; es con lo que más disfruto y donde respondemos a esa pregunta clave. Además, es un tema que se cubre en detalle en casi todas las clases de DataCamp, así que no me detendré demasiado. La clave es trabajar con los datos y extraer conclusiones.
Producción
Volvamos al incendio de Gatlinburg. Una vez que todos los datos se han recopilado, integrado y procesado en una base de datos con las coordenadas de cada edificio, su estado y una descripción de los daños, determinamos que el 60% de los edificios del área afectada están dañados sin posibilidad de reparación. Hemos respondido a la pregunta: "¿Qué parte del área circundante ha quedado afectada por el incendio?".
Podemos ir más allá, estimar el valor de cada edificio dañado y calcular el coste de reconstrucción de toda la zona, desglosado por barrios y calles. Incluso podríamos identificar qué barrios han sido los más golpeados para priorizar los esfuerzos de reconstrucción.
El análisis es fantástico, pero no sirve de nada si no se convierte en un producto, y de eso trata la fase de Producción del proceso CIM. Todo lo anterior desemboca aquí: es donde construyes esa pieza de exhibición, lo que vas a compartir con el cliente.
Es la culminación de todo tu trabajo con los datos. El producto puede ser un Jupyter Notebook, una hoja de cálculo con tablas y gráficos, una página web, un PDF o código fuente. Otras opciones: una presentación presencial, un vídeo en el que recorras el análisis o una presentación con Sway o PowerPoint. Lo que elijas debe ajustarse a las necesidades del cliente. Hay algunos requisitos adicionales:
- Que sea claro, conciso y fácil de consumir para el cliente.
- Que cuente la historia y tenga sentido para el cliente.
- Que se adapte al nivel técnico y formativo del cliente.
Difusión
La difusión es el último paso del proceso CIM y, a simple vista, parece sencillo: hacer llegar el producto al cliente. Sin embargo, si lo piensas, probablemente sea el paso más importante de todo el proceso. En el equipo de CIM, la mayoría de las veces entregábamos PDF, diapositivas de PowerPoint o informes de Excel basados en nuestro análisis. ¿Por qué esos formatos? Porque son accesibles, fáciles de usar y portátiles, y casi todo el mundo sabe manejarlos.
Con las competencias que tengo ahora, podría haber creado páginas web interactivas con informes, gráficos de Bokeh con deslizadores y filtros y mapas interactivos. Sería un producto complejo y dinámico que casi cualquiera podría usar al estar envuelto en una página web. Aun así, por muy bueno que sea el producto final, no sirve de nada si no se difunde al cliente de una forma que sea:
- Accesible: al tratarse de información, el cliente debe poder acceder a ella. Enterrar el producto donde tu público no puede llegar dificulta su consumo y hace que caiga pronto en el olvido.
- Fácil de usar: el método de entrega debe ser fácil de usar para la gran mayoría de tus clientes. Por ejemplo, entregar un script de Python a un grupo de Data Scientists puede estar bien, pero enviar ese mismo script a alguien que no sabe cómo ejecutar "
data_analysis.py" quizá no sea la mejor idea. - Portable: seamos realistas, cada vez consumimos más información en dispositivos móviles. Raras veces nos sentamos en un escritorio a leer grandes cantidades de contenido. Los productos de datos deben ser portables, ya sea mediante aplicaciones de Office como PowerPoint y Excel, en PDF o a través de Internet.
Hay infinidad de métodos de difusión disponibles para cualquiera que lea este artículo y sería imposible enumerarlos todos. Elegir cómo difundir tu producto requiere decidir. Pregúntate siempre: "¿Cómo puedo hacer llegar este producto al cliente de la forma que mejor se adapte a sus necesidades de accesibilidad, facilidad de uso y portabilidad?"
Dicho esto, si estás construyendo un porfolio, Github, Anaconda Cloud, páginas web y blogs personales y las redes sociales son un gran punto de partida. No tengas miedo de mostrar tu trabajo y compartirlo con otras personas afines.
Reflexiones finales
Si trabajas con datos, es muy probable que ya estés usando algunos de los pasos de los que he hablado. Aunque no participes personalmente en los seis, ahora los conoces mejor y tienes un proceso para convertir datos en bruto en un producto terminado. Puede parecer raro hablar de procedimientos militares para ciencia de datos, pero estos seis pasos me han servido tanto en el ámbito militar como en la empresa privada y espero que también te ayuden en tu camino para convertirte en Data Scientist.


