Qué significa el sello
Cada respuesta del asistente lleva un sello de confianza visible en
la interfaz y en la cabecera HTTP X-Confidence-Level. Tiene tres
valores:
| Sello | Significado | Cuándo aparece |
|---|---|---|
| high | El asistente tiene fragmentos con rerank_score ≥ 0.6 y citas verificadas | Consultas con anclaje normativo claro (artículos, BOE, anejos) |
| medium | Fragmentos relevantes con rerank_score entre 0.4 y 0.6, o cita única | Consultas donde el corpus cubre el tema pero la respuesta requiere síntesis |
| low | Sin fragmentos con rerank ≥ 0.4, o respuesta de la ruta de respaldo extractiva | Consultas fuera del dominio, ambiguas o donde el modelo agotó el presupuesto de tokens |
El sello es conservador por diseño: ante la duda baja un nivel.
Las cinco señales que lo alimentan
El backend computa el sello combinando cinco señales deterministas:
- Rerank score máximo: la confianza del reranker sobre el mejor fragmento. Umbrales calibrados a partir del set de evaluación humana.
- Cobertura del corpus: porcentaje de fragmentos en la respuesta
que el verificador numérico ha podido respaldar. Bajo este número
bajamos a
mediumaunque el rerank sea alto. - Autoverificación contra las fuentes: una segunda llamada al
modelo que se pregunta “¿sostienen las fuentes citadas esta
respuesta?”. Si falla, sello →
low. - Detección de negativas: si la respuesta contiene fórmulas de
rechazo (“no puedo afirmar…”, “no dispongo de datos…”), sello →
lowautomáticamente. - Ruta de respaldo: si la síntesis acabó cayendo a la extracción
de respaldo (se agotó el tiempo o los reintentos), sello →
lowsin importar el resto.
Cada señal está versionada y sus umbrales están fijados en la batería de tests del backend, para que cualquier cambio los rompa de forma visible.
Cómo se valida la calibración
Un sello mal calibrado es peor que ningún sello: convierte una señal de transparencia en publicidad. Por eso aplicamos tres validaciones continuas:
1. Set de evaluación humana
El set de evaluación contiene 15 casos revisados a mano, cada uno con
su veredicto humano de referencia (faithfulness: 0.0 | 1.0). Sobre ese
set medimos la correlación de Pearson entre confidence_level y
faithfulness.
| Métrica | Esperado | Aceptable | Bloqueante |
|---|---|---|---|
Correlación de Pearson r | > 0.7 | > 0.5 | < 0.5 |
| κ de Cohen frente al panel de jueces | > 0.6 | > 0.4 | < 0.4 |
Si la correlación cae por debajo de 0.5 en dos baselines consecutivos, el sello pasa a modo determinista —solo rerank y cobertura, sin la autoverificación— hasta que se recalibre.
2. Acuerdo entre jueces
Tres modelos evaluadores independientes califican las mismas 40
respuestas. Cuando la dispersión entre jueces supera 0.3 en
faithfulness, el caso se marca como no fiable y no entra en la
métrica de calibración. Así un juez ruidoso no puede desplazar los
umbrales.
3. Vigilancia de deriva (monitorización post-mercado)
El plan de monitorización post-mercado define umbrales rojo / ámbar /
verde sobre la distribución diaria de sellos. Si la proporción de
high sube más de un 10 % en una semana sin que hayan cambiado ni el
prompt ni el modelo, es un síntoma de deriva de calibración y dispara
una revisión manual.
Limitaciones honestas
- El sello no es probabilidad. Es una clase ordinal calibrada
contra evaluación humana, no
P(respuesta correcta) ∈ [0, 1]. Tratarlo como probabilidad lleva a sobreconfianza. - No cubre prompt injection. Si el usuario introduce instrucciones en la consulta, el sello sigue evaluando grounding sobre el corpus, no la coherencia con la intención benigna original.
- No cubre actualidad. Para consultas con datos de “ahora” (caudales en tiempo real, embalses) el sello evalúa la cita, no la frescura del dato. Mira la marca de tiempo de la fuente.
Cambios
| Fecha | Cambio | Versión |
|---|---|---|
| 2026-05-27 | Página inicial. Documenta calibración v2 post Tier 3.3. | 1.0 |