Saltar al contenido

ALTAI #6 · Sostenibilidad

La huella de cada respuesta medida, citada y reproducible

Responder también consume energía y agua. Aquí está la metodología completa (fórmula, coeficientes calibrados y bibliografía) para que cualquier auditor o usuario pueda reproducir el cálculo y discutirlo.

Resumen ejecutivo

Cada consulta al asistente Fluxia consume energía (la electricidad de las GPU que ejecutan el modelo) y, de forma indirecta, agua (la refrigeración del centro de datos y la de las centrales eléctricas que alimentan la red).

Publicamos el cálculo completo, los coeficientes calibrados con sus fuentes, y la banda de incertidumbre. Nada está oculto detrás de “orientativo”: si un valor te sorprende, puedes reconstruirlo paso a paso desde estas mismas fórmulas y comprobarlo contra las fuentes citadas. La cifra publicada es operacional: mide la inferencia, no el entrenamiento del modelo ni la fabricación del hardware (ver el contraste de ciclo de vida más abajo).


La fórmula (metodología v3, 2026-08-08)

Wh_servidor  = Wh_entrada × (tokens_entrada / 1 000)
             + Wh_salida  × (tokens_salida  / 1 000)
kWh_facility = Wh_servidor / 1 000 × PUE_proveedor
litros_total = kWh_facility × (WUE_onsite + WUE_source)

Las tres ideas que la distinguen de la versión anterior:

  1. Entrada y salida a tarifas separadas. El contexto documental (el prefill) se procesa en paralelo y cuesta ~5 % por token de lo que cuesta generar la respuesta token a token (el decode). Una consulta RAG lleva decenas de miles de tokens de contexto: tarifarlos a precio de decode — lo que hacía la versión anterior — inflaba la cifra ~20×.
  2. El perfil del centro de datos es el del PROVEEDOR del modelo. La inferencia de Mistral ocurre en sus centros de datos en Francia (red eléctrica nuclear-dominante, ~40-60 gCO₂eq/kWh); los embeddings, en la flota de Google. La región del servidor web de Fluxia no interviene: allí no se ejecuta ningún modelo.
  3. La tarifa por modelo se deriva de mediciones públicas. Ajuste de EcoLogits sobre el benchmark ML.ENERGY (GPU H100, con batching) ×3 de factor de flota: en la medición de producción de Google, el acelerador activo es solo el 58 % de la energía total (el resto es host, memoria y capacidad ociosa).

Coeficientes calibrados (versión 2026-08-08)

Tarifa por modelo (Wh por 1 000 tokens, nivel servidor, sin PUE)

Modelo (parámetros activos)Wh entradaWh salidaNotas
ministral-3b (3B)0.0070.13Contextualización de ingesta
mistral-small (24B, pesos abiertos)0.0080.16Router, HyDE, pases auxiliares
mistral-medium (~55B, estimado)0.0110.22Síntesis — Mistral no publica sus parámetros
mistral-large (123B, Large 2)0.0170.33Escaladas
gemini-embedding-0010.005—Una pasada de encoder, sin decode

Perfil de infraestructura por proveedor

PerfilPUEWUE_onsite (L/kWh)WUE_source (L/kWh)Base
Mistral · Francia1.20.21.6CPD europeo moderno sobre red francesa (nuclear-dominante). Mistral no publica PUE/WUE: estimación declarada
Google · flota1.091.073.0Medias de flota del 2024 Environmental Report

Banda de incertidumbre ±50 %

Ningún proveedor publica la energía por token de su inferencia, y las mejores fuentes públicas no coinciden entre sí:

La banda ±50 % refleja esa horquilla real entre fuentes, no una varianza estadística. La versión anterior publicaba ±30 %: era precisión espuria.


Contraste de ciclo de vida (lo que la cifra NO incluye)

Nuestra cifra es operacional. El propio Mistral, en su análisis de ciclo de vida con ADEME y Carbone 4 (julio 2025), estima 45 mL de agua y 1.14 gCO₂e por respuesta media de 400 tokens si se amortizan el entrenamiento del modelo y la fabricación del hardware. Ese contraste está citado también dentro del asistente (pregúntale por su consumo): preferimos que la diferencia entre ambos límites del sistema sea visible a que parezca que no existe.


Comprobación de plausibilidad

Una consulta típica al asistente (~35 000 tokens de contexto en el modelo pequeño + ~5 000 de contexto y ~1 500 de salida en síntesis):

small : (0.008 × 35 + 0.16 × 0.5)  ≈ 0.36 Wh
medium: (0.011 × 5  + 0.22 × 1.5)  ≈ 0.39 Wh
total : 0.75 Wh × PUE 1.2          ≈ 0.9 Wh  ≈ 0.0009 kWh
agua  : 0.0009 × (0.2 + 1.6)       ≈ 0.0016 L ≈ 1.6 mL

~1-2 mililitros de agua y ~1 Wh por consulta (operacional). El prompt mediano de Google — bastante más corto que una consulta RAG de Fluxia — midió 0.24 Wh y 0.26 mL: mismo orden de magnitud una vez descontada la diferencia de tamaño. El ancla de ciclo de vida de Mistral (45 mL/400 tokens) queda ~un orden por encima, como corresponde a un límite que incluye el entrenamiento.


Lo que NO estamos contando

Preferimos declarar los huecos a inflar la precisión del número:

El reranking y la búsqueda web sí se cuentan (con tarifas conservadoras propias) — la versión anterior de esta página decía lo contrario y estaba desactualizada.


Bibliografía

  1. Mistral AI (2025). Our contribution to a global environmental standard for AI. Análisis de ciclo de vida de Mistral Large 2 con ADEME y Carbone 4. mistral.ai/news/our-contribution-to-a-global-environmental-standard-for-ai: 45 mL + 1.14 gCO₂e por respuesta de 400 tokens (ciclo de vida).
  2. Elsworth, C., Patterson, D. et al. (2025). Measuring the environmental impact of delivering AI at Google Scale. arXiv:2508.15734. arxiv.org/abs/2508.15734: 0.24 Wh / 0.26 mL el prompt mediano, medido en flota; el acelerador activo es el 58 % de la energía total.
  3. EcoLogits (GenAI Impact) + ML.ENERGY Leaderboard. ecologits.ai/latest/methodology/llm_inference: energía GPU por token de salida en función de los parámetros activos.
  4. Google (2024). 2024 Environmental Report. sustainability.google/reports/google-2024-environmental-report: PUE y WUE on-site de flota (perfil de los embeddings).
  5. Patterson, D. et al. (2021). Carbon Considerations when Choosing a Machine Learning Platform. arXiv:2104.10350. arxiv.org/abs/2104.10350: WUE_source por mix eléctrico.
  6. Li, P. et al. (2023). Making AI Less Thirsty: Uncovering and Addressing the Secret Water Footprint of AI Models. arXiv:2304.03271 (publicado en Communications of the ACM, 2025). arxiv.org/abs/2304.03271: separación entre agua on-site y embebida en la electricidad.