Resumen ejecutivo
Cada consulta al asistente Fluxia consume energía (la electricidad
de las GPU que ejecutan el modelo) y, de forma indirecta, agua (la
refrigeración del centro de datos y la de las centrales eléctricas que
alimentan la red).
Publicamos el cálculo completo, los coeficientes calibrados con sus fuentes, y la banda de incertidumbre. Nada está oculto detrás de “orientativo”: si un valor te sorprende, puedes reconstruirlo paso a paso desde estas mismas fórmulas y comprobarlo contra las fuentes citadas. La cifra publicada es operacional: mide la inferencia, no el entrenamiento del modelo ni la fabricación del hardware (ver el contraste de ciclo de vida más abajo).
La fórmula (metodología v3, 2026-08-08)
Wh_servidor = Wh_entrada × (tokens_entrada / 1 000)
+ Wh_salida × (tokens_salida / 1 000)
kWh_facility = Wh_servidor / 1 000 × PUE_proveedor
litros_total = kWh_facility × (WUE_onsite + WUE_source)
Las tres ideas que la distinguen de la versión anterior:
- Entrada y salida a tarifas separadas. El contexto documental (el prefill) se procesa en paralelo y cuesta ~5 % por token de lo que cuesta generar la respuesta token a token (el decode). Una consulta RAG lleva decenas de miles de tokens de contexto: tarifarlos a precio de decode — lo que hacía la versión anterior — inflaba la cifra ~20×.
- El perfil del centro de datos es el del PROVEEDOR del modelo. La inferencia de Mistral ocurre en sus centros de datos en Francia (red eléctrica nuclear-dominante, ~40-60 gCO₂eq/kWh); los embeddings, en la flota de Google. La región del servidor web de Fluxia no interviene: allí no se ejecuta ningún modelo.
- La tarifa por modelo se deriva de mediciones públicas. Ajuste de EcoLogits sobre el benchmark ML.ENERGY (GPU H100, con batching) ×3 de factor de flota: en la medición de producción de Google, el acelerador activo es solo el 58 % de la energía total (el resto es host, memoria y capacidad ociosa).
Coeficientes calibrados (versión 2026-08-08)
Tarifa por modelo (Wh por 1 000 tokens, nivel servidor, sin PUE)
| Modelo (parámetros activos) | Wh entrada | Wh salida | Notas |
|---|---|---|---|
| ministral-3b (3B) | 0.007 | 0.13 | Contextualización de ingesta |
| mistral-small (24B, pesos abiertos) | 0.008 | 0.16 | Router, HyDE, pases auxiliares |
| mistral-medium (~55B, estimado) | 0.011 | 0.22 | Síntesis — Mistral no publica sus parámetros |
| mistral-large (123B, Large 2) | 0.017 | 0.33 | Escaladas |
| gemini-embedding-001 | 0.005 | — | Una pasada de encoder, sin decode |
Perfil de infraestructura por proveedor
| Perfil | PUE | WUE_onsite (L/kWh) | WUE_source (L/kWh) | Base |
|---|---|---|---|---|
| Mistral · Francia | 1.2 | 0.2 | 1.6 | CPD europeo moderno sobre red francesa (nuclear-dominante). Mistral no publica PUE/WUE: estimación declarada |
| Google · flota | 1.09 | 1.07 | 3.0 | Medias de flota del 2024 Environmental Report |
Banda de incertidumbre ±50 %
Ningún proveedor publica la energía por token de su inferencia, y las mejores fuentes públicas no coinciden entre sí:
- Google (2025) midió su flota real: 0.24 Wh y 0.26 mL el prompt mediano — operacional, con host, capacidad ociosa y PUE incluidos.
- ML.ENERGY / EcoLogits miden la GPU en benchmark, con batching óptimo — el suelo del rango.
- Mistral (2025) publicó su análisis de ciclo de vida, pero sin la
energía por respuesta ni el reparto entrenamiento/inferencia, y los
parámetros de
mistral-mediumno son públicos (estimados ~55B por posición de precio).
La banda ±50 % refleja esa horquilla real entre fuentes, no una varianza estadística. La versión anterior publicaba ±30 %: era precisión espuria.
Contraste de ciclo de vida (lo que la cifra NO incluye)
Nuestra cifra es operacional. El propio Mistral, en su análisis de ciclo de vida con ADEME y Carbone 4 (julio 2025), estima 45 mL de agua y 1.14 gCO₂e por respuesta media de 400 tokens si se amortizan el entrenamiento del modelo y la fabricación del hardware. Ese contraste está citado también dentro del asistente (pregúntale por su consumo): preferimos que la diferencia entre ambos límites del sistema sea visible a que parezca que no existe.
Comprobación de plausibilidad
Una consulta típica al asistente (~35 000 tokens de contexto en el modelo pequeño + ~5 000 de contexto y ~1 500 de salida en síntesis):
small : (0.008 × 35 + 0.16 × 0.5) ≈ 0.36 Wh
medium: (0.011 × 5 + 0.22 × 1.5) ≈ 0.39 Wh
total : 0.75 Wh × PUE 1.2 ≈ 0.9 Wh ≈ 0.0009 kWh
agua : 0.0009 × (0.2 + 1.6) ≈ 0.0016 L ≈ 1.6 mL
~1-2 mililitros de agua y ~1 Wh por consulta (operacional). El prompt mediano de Google — bastante más corto que una consulta RAG de Fluxia — midió 0.24 Wh y 0.26 mL: mismo orden de magnitud una vez descontada la diferencia de tamaño. El ancla de ciclo de vida de Mistral (45 mL/400 tokens) queda ~un orden por encima, como corresponde a un límite que incluye el entrenamiento.
Lo que NO estamos contando
Preferimos declarar los huecos a inflar la precisión del número:
- Coste del almacenamiento vectorial: despreciable frente al cómputo del modelo.
- Coste de la red (CDN, tráfico de salida): despreciable.
- Entrenamiento del modelo y fabricación del hardware: fuera del límite operacional — el ancla de ciclo de vida de Mistral (arriba) es la referencia para quien quiera ese límite.
- PUE/WUE reales de los CPD de Mistral: no publicados; usamos valores típicos de un CPD europeo moderno, declarados como estimación.
El reranking y la búsqueda web sí se cuentan (con tarifas conservadoras propias) — la versión anterior de esta página decía lo contrario y estaba desactualizada.
Bibliografía
- Mistral AI (2025). Our contribution to a global environmental standard for AI. Análisis de ciclo de vida de Mistral Large 2 con ADEME y Carbone 4. mistral.ai/news/our-contribution-to-a-global-environmental-standard-for-ai: 45 mL + 1.14 gCO₂e por respuesta de 400 tokens (ciclo de vida).
- Elsworth, C., Patterson, D. et al. (2025). Measuring the environmental impact of delivering AI at Google Scale. arXiv:2508.15734. arxiv.org/abs/2508.15734: 0.24 Wh / 0.26 mL el prompt mediano, medido en flota; el acelerador activo es el 58 % de la energía total.
- EcoLogits (GenAI Impact) + ML.ENERGY Leaderboard. ecologits.ai/latest/methodology/llm_inference: energía GPU por token de salida en función de los parámetros activos.
- Google (2024). 2024 Environmental Report. sustainability.google/reports/google-2024-environmental-report: PUE y WUE on-site de flota (perfil de los embeddings).
- Patterson, D. et al. (2021). Carbon Considerations when Choosing a Machine Learning Platform. arXiv:2104.10350. arxiv.org/abs/2104.10350: WUE_source por mix eléctrico.
- Li, P. et al. (2023). Making AI Less Thirsty: Uncovering and Addressing the Secret Water Footprint of AI Models. arXiv:2304.03271 (publicado en Communications of the ACM, 2025). arxiv.org/abs/2304.03271: separación entre agua on-site y embebida en la electricidad.