SAVIA: la estadística detrás de un sistema que obtuvo 100/100 priorizando dónde intervenir en la Amazonía colombiana

Equipo 66 — Concurso Datos al Ecosistema 2026: IA para Colombia · Nivel Avanzado · Reto Desarrollo Sostenible y Medio Ambiente

9/10/20267 min read

Equipo 66 — Concurso Datos al Ecosistema 2026: IA para Colombia · Nivel Avanzado · Reto Desarrollo Sostenible y Medio Ambiente

El problema: la deforestación no se queda donde ocurre

En 2024, Colombia perdió 113.608 hectáreas de bosque natural. Caquetá, por sí solo, perdió 25.263: más que cualquier otro departamento del país. Son cifras que salen todos los años en los reportes oficiales del IDEAM, y todos los años generan la misma sensación de urgencia sin una respuesta clara sobre qué hacer con esa información.

Hay un problema de fondo que esas cifras no resuelven: la deforestación no se queda quieta. Cuando se tala un bosque en la parte alta de una cuenca, el daño viaja río abajo. Aumenta la sedimentación, altera el caudal, cambia la química del agua que finalmente llega a los tanques y a las redes de distribución de comunidades que muchas veces no talaron un solo árbol. El problema es que nadie mide este efecto de red. Los reportes oficiales agregan por departamento o por municipio, como si cada territorio fuera una isla, sin conectar lo que pasa arriba con lo que va a pasar abajo.

Ese fue el punto de partida de SAVIA: un sistema para identificar qué cuencas hidrográficas del Caquetá concentran mayor riesgo combinado de deforestación acumulada aguas arriba e infraestructura hídrica expuesta, para que las autoridades ambientales sepan, con evidencia, dónde intervenir primero. Y como estadística de formación, quiero contar esta historia poniendo el foco en la parte que más me apasiona del proyecto: cómo la estadística, no solo el machine learning, sostiene cada decisión del sistema.

Por qué Caquetá y no todo el país

La tentación en un proyecto de este tipo es tratar de cubrir todo el territorio nacional. Decidimos no hacerlo, y por una razón puntual: el propio documento del reto sugiere explícitamente priorizar profundidad sobre amplitud. Caquetá es además el departamento donde el reto pedía validar un caso concreto —el evento de deforestación de 2020-2022— y es donde contábamos con los mejores datos locales de infraestructura hídrica para construir un análisis serio.

Preferimos entregar un análisis riguroso sobre 44 cuencas que uno superficial sobre miles.

Cómo seguimos el agua: la cascada topológica

La pieza central de SAVIA es un concepto simple llevado a la práctica con rigor: seguir el curso del agua. Dividimos el departamento en 44 cuencas hidrográficas (usando HydroBASINS, una base de datos hidrológica global) y construimos un grafo dirigido donde cada cuenca sabe hacia cuál otra drena su agua.

Con ese grafo, para cualquier cuenca podemos calcular no solo cuánta deforestación ocurrió en su propio territorio, sino cuánta le está llegando acumulada desde todas las cuencas que la alimentan aguas arriba. A esto lo llamamos la cascada topológica. La cuenca con mayor cascada en nuestro análisis acumula 277.636 hectáreas de deforestación reciente provenientes de 34 cuencas ancestro, aunque su propio territorio no sea necesariamente el más deforestado.

La estadística detrás del score: donde realmente se jugó el proyecto

Aquí está la parte que quiero desarrollar con más detalle, porque es donde la estadística —no el algoritmo de moda— tomó las decisiones que definieron el resultado final.

Primero, una auditoría de colinealidad que cambió el ranking

Antes de construir cualquier índice, teníamos cuatro variables candidatas para medir el riesgo de cada cuenca. Corrimos una matriz de correlación de Pearson entre ellas y encontramos algo que no podíamos ignorar: dos pares de variables estaban correlacionadas al 1.00 y al 0.96. En términos simples, eran la misma información contada dos veces, una consecuencia natural de cómo se construye la cascada sobre el grafo.

Usar las cuatro variables sin corregir esto habría inflado artificialmente el peso de una sola dimensión del problema. Descartamos dos variables y nos quedamos con únicamente dos, verdaderamente independientes entre sí (correlación de apenas -0.07). El efecto de esta decisión fue medible: una cuenca que antes de la corrección ocupaba el puesto 6 del ranking pasó al puesto número 1, simplemente porque el score dejó de estar dominado por una variable redundante. Sin esa auditoría estadística, habríamos estado priorizando la cuenca equivocada.

Segundo, corregir el sesgo antes de combinar variables

Las dos variables que sobrevivieron a la auditoría tenían un problema adicional: distribuciones con sesgo positivo fuerte (coeficientes de asimetría de 4.2 y 1.6, cuando lo manejable ronda valores cercanos a 1). Sin corregirlo, unas pocas cuencas con valores extremos habrían dominado el índice completo. Aplicamos una transformación logarítmica (log1p) que redujo la asimetría a niveles razonables (0.7 y 0.3) antes de construir el score final.

Tercero, no confiar en un solo peso arbitrario

El score combina las dos variables con pesos de 0.6 y 0.4. Pudimos habernos quedado ahí, pero decidimos preguntarnos qué tan sensible era nuestro ranking a esa elección de pesos. Recalculamos el score con pesos alternativos entre 0.5 y 0.8, y medimos la correlación de Spearman entre cada ranking alternativo y el nuestro, además del solapamiento del top-10 de cuencas prioritarias usando el índice de Jaccard. Los resultados (correlaciones entre 0.978 y 1.000, coincidencias del top-10 de al menos 67%) nos permitieron decir, con evidencia y no con intuición, que el ranking es robusto y no depende de un capricho metodológico.

Cuarto, detección de anomalías sin inventar un umbral

Para identificar cuencas que se comportan distinto al resto, usamos Isolation Forest, un algoritmo no supervisado que no necesita etiquetas previas. El parámetro más delicado de este algoritmo es contamination, que define qué proporción de los datos se considera atípica. En vez de fijarlo a nuestro criterio, usamos el valor automático recomendado en el paper original del método (Liu et al., 2008), y además hicimos un análisis de sensibilidad probando distintos valores. Encontramos que el resultado sí cambia bastante según el parámetro elegido (índice de Jaccard entre 0.45 y 0.82 frente a la configuración automática), y decidimos reportar esa sensibilidad abiertamente en vez de esconderla.

Quinto, y lo más importante: preguntarnos si el patrón era real

Quisimos comprobar si "más deforestación arriba implica más infraestructura hídrica expuesta" era un patrón sistemático en todo el departamento, o si solo lo parecía en algunos casos puntuales. Con apenas 44 cuencas y sin garantías de que se cumplieran los supuestos de una prueba clásica, optamos por un test de permutación: mezclamos aleatoriamente una de las dos variables 9.999 veces, recalculamos la correlación en cada mezcla y construimos así una distribución nula empírica contra la cual comparar nuestro resultado observado.

El resultado: una correlación observada de -0.072 con un valor p de 0.68. Es decir, no hay evidencia de que el patrón sea generalizable. Pudimos haber omitido este resultado del análisis final. Decidimos no hacerlo. Ese hallazgo, lejos de debilitar el proyecto, definió cómo lo presentamos: SAVIA no es un modelo que predice el futuro de todo el departamento, es una herramienta que prioriza casos concretos, cuenca por cuenca, con evidencia verificable detrás de cada uno.

Como contraste adicional, corrimos también un modelo de panel de datos con efectos fijos a escala nacional (243 estaciones del IDEAM), y encontramos un R² menor al 0.35% en todos los modelos evaluados. La deforestación, sola, explica una fracción mínima de la variación en la calidad del agua. Reportar ese número bajo, en vez de maquillarlo, es parte de la misma disciplina.

Lo que el jurado calificó: 100 sobre 100

El pasado periodo de sustentación presentamos SAVIA ante el jurado del concurso, y el resultado fue una calificación perfecta en los seis criterios de evaluación:

Criterio Puntaje obtenido Uso de datos abiertos 20/20 Uso de tecnologías emergentes e IA 20/20 Impacto y escalabilidad 20/20 Innovación y creatividad 15/15 Análisis y rigor técnico 15/15 Diseño, comunicación y usabilidad 10/10 Evaluación final 100/100

En el criterio de análisis y rigor técnico, el jurado destacó específicamente que confirmamos durante la sustentación que la metodología utilizada corresponde a CRISP-ML, y que la evidencia presentada permitió verificar un proceso metodológico consistente para el desarrollo de la solución y la preparación de la información utilizada en el análisis. En el criterio de uso de datos abiertos, se reconoció la integración de más de 28 fuentes públicas documentadas con su URL exacta.

Para nosotras, la parte más significativa de esta calificación no es el número final sino la confirmación de que la honestidad metodológica no penaliza, fortalece. Reportar un hallazgo nulo con un valor p de 0.68 en vez de ocultarlo, declarar abiertamente qué partes del sistema estaban completas y cuáles no, y sostener cada decisión con una prueba estadística en vez de con una intuición, fue evaluado como rigor técnico, no como debilidad.

Una funcionalidad nueva: el asistente conversacional del sistema

Entre los componentes del sistema que el jurado evaluó dentro del criterio de tecnologías emergentes e inteligencia artificial está un chatbot conversacional construido sobre DeepSeek, que permite a cualquier usuario del sistema hacer preguntas en lenguaje natural sobre las cuencas priorizadas, sus métricas y la evidencia que sustenta cada resultado, sin necesidad de interpretar directamente el mapa o las tablas del dashboard. Es una capa adicional de accesibilidad para usuarios no técnicos, que complementa el ranking visual con una forma más conversacional de explorar la información.

Lo que queda como producto

El resultado de este trabajo es un dashboard público donde cualquier persona —una autoridad ambiental, un investigador, un ciudadano— puede ver el mapa de las 44 cuencas de Caquetá coloreadas por nivel de riesgo, revisar el ranking de cuencas priorizadas, explorar el evento de deforestación retrospectivo de 2021 con desagregación por cuenca, conversar con el asistente integrado, y descargar toda la evidencia estadística detrás de cada hallazgo.

Todo el código es abierto y el proceso es reproducible: el mismo pipeline que corrimos sobre Caquetá puede ejecutarse sobre cualquier otro departamento amazónico con solo cambiar el polígono de entrada. No construimos una demo aislada. Documentamos cada decisión metodológica, cada prueba de sensibilidad y cada resultado —esperado o no— porque creemos que esa es, finalmente, la única forma honesta de construir una herramienta que alguien pueda usar para tomar decisiones reales sobre el territorio.

Este proyecto fue desarrollado por el Equipo 66 en el marco del Concurso Datos al Ecosistema 2026: IA para Colombia, nivel Avanzado, reto Desarrollo Sostenible y Medio Ambiente, donde obtuvo una calificación de 100/100 en la fase de sustentación. El código y la documentación técnica completa están disponibles en el repositorio abierto del proyecto.