Saltar al contenido

ALTAI #4 · Transparencia

El sello de confianza qué significa y cómo se valida

Cada respuesta llega con un sello de confianza: alta, media o baja. Esta página documenta qué señales lo determinan y contra qué evaluación humana lo contrastamos, para que el sello signifique exactamente lo que dice.

Qué significa el sello

Cada respuesta del asistente lleva un sello de confianza visible en la interfaz y en la cabecera HTTP X-Confidence-Level. Tiene tres valores:

SelloSignificadoCuándo aparece
highEl asistente tiene fragmentos con rerank_score ≥ 0.6 y citas verificadasConsultas con anclaje normativo claro (artículos, BOE, anejos)
mediumFragmentos relevantes con rerank_score entre 0.4 y 0.6, o cita únicaConsultas donde el corpus cubre el tema pero la respuesta requiere síntesis
lowSin fragmentos con rerank ≥ 0.4, o respuesta de la ruta de respaldo extractivaConsultas fuera del dominio, ambiguas o donde el modelo agotó el presupuesto de tokens

El sello es conservador por diseño: ante la duda baja un nivel.

Las cinco señales que lo alimentan

El backend computa el sello combinando cinco señales deterministas:

  1. Rerank score máximo: la confianza del reranker sobre el mejor fragmento. Umbrales calibrados a partir del set de evaluación humana.
  2. Cobertura del corpus: porcentaje de fragmentos en la respuesta que el verificador numérico ha podido respaldar. Bajo este número bajamos a medium aunque el rerank sea alto.
  3. Autoverificación contra las fuentes: una segunda llamada al modelo que se pregunta “¿sostienen las fuentes citadas esta respuesta?”. Si falla, sello → low.
  4. Detección de negativas: si la respuesta contiene fórmulas de rechazo (“no puedo afirmar…”, “no dispongo de datos…”), sello → low automáticamente.
  5. Ruta de respaldo: si la síntesis acabó cayendo a la extracción de respaldo (se agotó el tiempo o los reintentos), sello → low sin importar el resto.

Cada señal está versionada y sus umbrales están fijados en la batería de tests del backend, para que cualquier cambio los rompa de forma visible.

Cómo se valida la calibración

Un sello mal calibrado es peor que ningún sello: convierte una señal de transparencia en publicidad. Por eso aplicamos tres validaciones continuas:

1. Set de evaluación humana

El set de evaluación contiene 15 casos revisados a mano, cada uno con su veredicto humano de referencia (faithfulness: 0.0 | 1.0). Sobre ese set medimos la correlación de Pearson entre confidence_level y faithfulness.

MétricaEsperadoAceptableBloqueante
Correlación de Pearson r> 0.7> 0.5< 0.5
κ de Cohen frente al panel de jueces> 0.6> 0.4< 0.4

Si la correlación cae por debajo de 0.5 en dos baselines consecutivos, el sello pasa a modo determinista —solo rerank y cobertura, sin la autoverificación— hasta que se recalibre.

2. Acuerdo entre jueces

Tres modelos evaluadores independientes califican las mismas 40 respuestas. Cuando la dispersión entre jueces supera 0.3 en faithfulness, el caso se marca como no fiable y no entra en la métrica de calibración. Así un juez ruidoso no puede desplazar los umbrales.

3. Vigilancia de deriva (monitorización post-mercado)

El plan de monitorización post-mercado define umbrales rojo / ámbar / verde sobre la distribución diaria de sellos. Si la proporción de high sube más de un 10 % en una semana sin que hayan cambiado ni el prompt ni el modelo, es un síntoma de deriva de calibración y dispara una revisión manual.

Limitaciones honestas

Cambios

FechaCambioVersión
2026-05-27Página inicial. Documenta calibración v2 post Tier 3.3.1.0