Las visualizaciones nos ayudan a entender el mundo y nos permiten transmitir grandes cantidades de información compleja, datos y predicciones de forma concisa. Las predicciones de expertos que deben comunicarse a públicos no especializados —ya sea la trayectoria de un huracán o el resultado de unas elecciones— siempre incluyen un grado de incertidumbre. Si esa incertidumbre no se refleja en las visualizaciones pertinentes, los resultados pueden llevar a error e incluso ser peligrosos.
Aquí analizamos el papel de la visualización de datos a la hora de representar las trayectorias previstas de los huracanes. Exploramos distintos métodos visuales para transmitir la incertidumbre de las predicciones de expertos y su efecto en la interpretación por parte del público general. Además, lo conectamos con un debate más amplio sobre buenas prácticas en la forma en que los medios informan sobre modelos de expertos y resultados científicos en temas relevantes para la población.
¿Sin gráficos de espagueti?
Hemos visto recientemente los estragos causados por sistemas de tormentas tropicales en América. Medios como The New York Times han explicado gran parte de lo ocurrido con visualizaciones interactivas de los huracanes Harvey e Irma, por ejemplo. Entre las visualizaciones hay mapas geográficos del porcentaje de personas sin electricidad, cantidad de lluvia, daños y número de personas en refugios, entre muchas otras.
Un tipo concreto de gráfico ha aparecido con frecuencia y ha generado controversia: cómo representar la trayectoria prevista de un huracán, por ejemplo, en las próximas 72 horas. Hay varias formas de visualizar trayectorias previstas, cada una con sus trampas y posibles malentendidos. Hace poco incluso vimos un artículo en Ars Technica titulado Please, please stop sharing spaghetti plots of hurricane models, dirigido a Nate Silver y fivethirtyeight.
En lo que sigue, compararé tres enfoques habituales, exploraré sus ventajas e inconvenientes y haré sugerencias para otros tipos de gráficos. También profundizaré en por qué importan estos formatos, lo que nos ayudará a decidir qué métodos y técnicas visuales resultan más adecuados.
Aviso: no soy experto en meteorología ni en predicción de huracanes. Pero he reflexionado mucho sobre métodos visuales para transmitir datos, predicciones y modelos. Agradezco y animo activamente los comentarios de expertos y de cualquier otra persona.
Visualizar las trayectorias previstas de los huracanes
Hay tres formas comunes de crear visualizaciones de trayectorias previstas de huracanes. Antes de hablar de ellas, quiero que las mires y pienses qué información puedes extraer de cada una. Intenta interpretar qué pretende contarte cada una, y luego entraremos en sus objetivos, ventajas e inconvenientes:
El cono de incertidumbre
Gráficos de espagueti (tipo I)
Gráficos de espagueti (tipo II)
Interpretación e impacto de las visualizaciones de trayectorias previstas de huracanes
El cono de incertidumbre
El cono de incertidumbre, una herramienta usada por el National Hurricane Center (NHC) y difundida por muchos medios, muestra la trayectoria más probable del huracán durante los próximos cinco días, indicada por los puntos negros dentro del cono. También expresa cuánta confianza hay en esa trayectoria. A medida que pasa el tiempo, la predicción se vuelve menos certera y esto se refleja en el cono: hay aproximadamente un 66,6% de probabilidad de que el centro del huracán se mantenga dentro de los límites del cono.
¿Se deduce esto directamente del gráfico?
A mí, de entrada, no me lo pareció, y reuní esta información a partir del propio gráfico, de la página del NHC sobre el cono de incertidumbre y de la guía explicativa de weather.com. Hay tres puntos más relevantes a los que volveremos:
- Es habitual malinterpretar que el ensanchamiento del cono con el tiempo indica que la tormenta crecerá;
- El gráfico no contiene ninguna información sobre el tamaño de la tormenta, solo sobre la posible trayectoria de su centro, por lo que sirve de forma limitada para anticipar, por ejemplo, dónde se esperan vientos con fuerza de huracán;
- Hay información esencial en el texto que acompaña la visualización, además de en la propia visualización, como la nota destacada arriba: "[e]l cono contiene la trayectoria probable del centro de la tormenta pero no muestra el tamaño de la misma..."; al juzgar la eficacia de una visualización de datos, debemos considerar todas sus propiedades, incluido el texto (y si realmente podemos esperar que la gente lo lea); observa que estas visualizaciones no son interactivas (y quizá deberían serlo).
Gráficos de espagueti (tipo I)
Este tipo de gráficos muestra varias predicciones en una misma figura. En un gráfico de espagueti tipo I, las trayectorias visualizadas son predicciones de modelos de distintas agencias (NHC, la National Oceanic and Atmospheric Administration o la UK Met Office, por ejemplo). Son útiles porque, como el cono de incertidumbre, nos indican la región general que podría estar en la trayectoria del huracán. Son maravillosamente inútiles —y de hecho engañosos— en que ponderan por igual cada modelo (o predicción).
En el gráfico tipo I anterior, hay predicciones con grados de incertidumbre diferentes, procedentes de agencias que han tenido éxitos desiguales en el pasado. Así que algunas trayectorias son más probables que otras, según lo que sabemos. Esa información no aparece. Aún más preocupante: algunas de las líneas ni siquiera son verdaderas predicciones. Fíjate en la línea negra de puntos XTRP, que proyecta en línea recta la trayectoria actual de la tormenta. Eso ni siquiera es un modelo. Eric Berger lo explica con detalle en este artículo de Ars Technica.
En esencia, este tipo de gráficos ofrecen un modelo por conjunto (ensemble) (compáralo con el agregado de encuestas). Pero un aspecto clave de los modelos por conjunto es que se asigna a cada modelo un peso adecuado, y esos pesos deben comunicarse en cualquier visualización. Veremos enseguida cómo hacerlo con una variación del tipo I.
Gráficos de espagueti (tipo II)
Estos gráficos muestran muchas —digamos 50— realizaciones distintas de un mismo modelo. La idea es que, si simulamos (ejecutamos) un modelo varias veces, cada vez dará una trayectoria diferente. ¿Por qué? Nate Cohen lo explicó bien en The Upshot:
Es realmente difícil predecir con exactitud cuándo girará una tormenta. Incluso una diferencia de 15 o 20 millas en el momento en que se desvía al norte puede determinar si Miami recibe el muro del ojo —el anillo de tormentas con los vientos más fuertes que rodea el ojo más calmado—.
Quizá sean mis favoritos de los tres por varias razones:
- Al simular múltiples ejecuciones del modelo, ofrecen una indicación de la incertidumbre subyacente a cada modelo;
- Dan una idea de la probabilidad relativa de que el centro de la tormenta pase por un lugar determinado. En pocas palabras: si más trayectorias pasan por el punto A que por el punto B, entonces, según el modelo, es más probable que el centro de la tormenta pase por A;
- Es menos probable que se malinterpreten (al menos comparados con el cono de incertidumbre y los tipo I). El texto necesario en la visualización podría reducirse a: "Cada línea representa un pronóstico de la trayectoria de Irma".
Un contra del tipo II es que no representan múltiples modelos, pero, como veremos, esto puede solventarse combinándolos con los tipo I. Otro inconveniente es que, como los demás, solo comunican la trayectoria del centro de la tormenta y no dicen nada sobre su tamaño. En breve veremos cómo remediarlo. Ten en cuenta que la distinción entre gráficos de espagueti tipo I y tipo II no la he encontrado en la literatura: la propongo aquí porque sus interpretaciones y efectos son muy distintos.
De momento, observa que hemos estado hablando de la eficacia de ciertos gráficos sin abordar explícitamente su propósito, es decir, por qué los necesitamos. Antes de seguir, demos un paso atrás y tratemos de responder a la pregunta "¿Para qué visualizar la trayectoria prevista de un huracán?" Este tipo de ejercicio, en apariencia ingenuo, suele ser esclarecedor.
¿Por qué representar trayectorias previstas de huracanes?
¿Por qué intentamos transmitir la trayectoria prevista de una tormenta tropical? Te doy varias respuestas en un momento.
Pero primero, lo que estas visualizaciones no buscan. No las usamos para ayudar a la gente a decidir si debe evacuar su casa o su localidad. La orden o recomendación de evacuar la toman las autoridades locales, tras consultar repetidamente con expertos, científicos, modelizadores y otros agentes clave.
El objetivo principal de este tipo de visualización es que la población esté lo mejor informada posible sobre las posibles trayectorias del huracán y que pueda prepararse para lo peor si existe la posibilidad de que su zona esté en la ruta de destrucción. No se trata de asustar innecesariamente. Como weather.com afirma sobre la función del cono de incertidumbre, "[a] cada sistema tropical se le asigna un cono de pronóstico para ayudar al público a entender mejor hacia dónde se dirige" y "[e]l cono está diseñado para mostrar la creciente incertidumbre del pronóstico con el paso del tiempo".
En este sentido, creo que una propiedad importante sería que cualquier lector pudiera mirarlo y decir: "es muy probable/probable/posible al 50%/poco probable/muy improbable" que mi casa (por ejemplo) sufra daños importantes por el huracán.
Aún mejor: poder decir "Hay entre un 30% y un 40% de probabilidad, según los modelos más avanzados, de que mi casa sufra daños importantes".
Así, tenemos una jerarquía de lo que queremos que comunique nuestra visualización:
- Como mínimo, queremos alertar a la ciudadanía de las posibles trayectorias del huracán.
- Después, nos gustaría que pudiera valorar si es muy probable, probable, poco probable o muy improbable que, por ejemplo, su casa esté en la trayectoria.
- Idealmente, cualquier persona podría leer en la visualización, de forma cuantitativa, la probabilidad (o rango de probabilidades) de que su casa esté en la trayectoria del huracán.
Además, queremos que nuestras visualizaciones no sean engañosas ni fáciles de malinterpretar.
El cono de incertidumbre frente a los gráficos de espagueti
Los tres métodos cumplen la función mínima: alertar sobre las posibles trayectorias del huracán. El cono de incertidumbre hace un buen trabajo al permitir estimar cuán probable es que el huracán pase por un punto concreto (dentro del cono, la probabilidad ronda dos tercios). Al menos de forma cualitativa, los gráficos de espagueti tipo II también funcionan bien aquí: "si más trayectorias pasan por A que por B, entonces, según el modelo, es más probable que el centro de la tormenta pase por A".
Si representas 50 trayectorias, te haces una idea de por dónde es más probable que se sitúe el centro de la tormenta: si aproximadamente la mitad atraviesan un lugar, hay alrededor de un 50% de probabilidad (según el modelo) de que el centro impacte en ese punto. Ninguno de estos métodos cumple aún la tercera función; veremos más abajo cómo combinar los gráficos de espagueti tipo I y tipo II para lograrlo.
El gran problema del cono de incertidumbre y de los gráficos tipo I es doble: el cono se interpreta fácilmente mal (mucha gente entiende el cono como una tormenta en crecimiento y no capta el papel de la incertidumbre) y los tipo I son engañosos (presentan todos los modelos como igual de fiables). Por tanto, no satisfacen el requisito básico de que "queremos visualizaciones que no sean engañosas ni fáciles de malinterpretar".
Buenas prácticas para visualizar trayectorias de predicción de huracanes
Los gráficos de espagueti tipo II son los más descriptivos y los menos propensos a malentendidos. Pero fallan al presentar resultados de todos los modelos: no agregan múltiples modelos como vimos en el tipo I.
Entonces, ¿y si combinamos los tipos I y II?
Para responder, hice un pequeño experimento con python, folium y numpy. Puedes ver el código aquí.
Primero tomé una de las trayectorias previstas para el huracán Irma del NHC de la semana pasada, añadí algo de ruido aleatorio y tracé 50 trayectorias. Insisto: no soy experto en meteorología. El ruido que generé y añadí a la señal/trayectoria prevista no se basó en modelos reales y, en un caso de uso real, vendría de los propios modelos (si te interesa, usé ruido gaussiano). Por cierto, me resultó difícil encontrar datos de las trayectorias previstas publicadas en los medios. Los datos que utilicé finalmente los encontré aquí.
Aquí tienes un gráfico de espagueti tipo II sencillo con 50 trayectorias:
Pero estas son trayectorias posibles generadas por un único modelo. ¿Y si tuviéramos múltiples modelos de distintas agencias? Podemos trazar 50 trayectorias de cada uno:
Una de las cosas más interesantes de los gráficos tipo II es que, si representamos suficientes trayectorias, cada línea deja de distinguirse y empezamos a ver un mapa de calor de las zonas por las que es más probable que pase el centro del huracán. Dicho de otro modo: cuanto más azul en una región, más probable es que la trayectoria pase por allí. Haz zoom para verlo.
Además, si consideramos que un modelo es más fiable que otro (por ejemplo, porque sus autores han sido más precisos en el pasado), podemos ponderarlos en consecuencia, por ejemplo ajustando la transparencia de las trayectorias, como hacemos abajo. Ten en cuenta que asignar pesos a los modelos es tarea de expertos y una parte esencial del proceso de modelización agregada.
Lo anterior resuelve las tareas asociadas a las dos primeras propiedades que queremos en nuestras visualizaciones. Para lograr la tercera —que una persona pueda leer que hay, por ejemplo, un 30-40% de probabilidad de que el centro del huracán pase por un punto— hay dos soluciones:
- modificar el mapa de calor para que varíe, por ejemplo, de rojo a azul e incluir una leyenda que indique que el rojo significa una probabilidad superior al 90%;
- transformar el mapa de calor en un mapa de contornos que muestre regiones con determinados valores de probabilidad.
Ten en cuenta también que esto indicará la probabilidad de que un lugar concreto sea atravesado por el centro del huracán. Puedes combinar (mejor dicho, convolucionar) esto con información sobre el tamaño del huracán para convertir el mapa de calor en uno de probabilidad de sufrir vientos con fuerza de huracán. Si te apetece, trastea con el código que escribí para generar los gráficos anteriores (planeo publicar una segunda parte explicándolo paso a paso).
Visualizar la incertidumbre y periodismo de datos
¿Con qué nos quedamos? Hemos explorado varios tipos de métodos de visualización de trayectorias previstas de huracanes, analizado los pros y los contras de cada uno y propuesto un camino para obtener gráficos más informativos y menos engañosos, que comuniquen no solo los resultados sino también la incertidumbre de los modelos.
Esto forma parte de una conversación más amplia que debemos mantener sobre cómo informar de la incertidumbre en visualizaciones y en el periodismo de datos en general. Hay que participar activamente en el debate sobre cómo los expertos comunican la incertidumbre a la ciudadanía a través de los medios. Este artículo de The Upshot muestra cómo podría verse el informe de empleo debido al ruido estadístico aunque el empleo se mantuviera estable. Este otro de The Upshot ilustra el papel del ruido y la incertidumbre al interpretar encuestas. Soy consciente de que hacen falta titulares para vender noticias y del papel del clickbait en el panorama mediático actual, pero debemos comunicar no solo resultados, sino la incertidumbre que los rodea para no inducir a error al público —ni a nosotros mismos—. Y, quizá más importante, la educación debe evolucionar y dotar a toda la ciudadanía de competencia en datos y cultura estadística para afrontar esta era basada en datos. Todos podemos aportar.


