Skip to content

Home Dashboard

0. Overview MetricsSQL Server + Windows

UID: homeVersión: 2.0 Paneles: 3 secciones

Propósito

El dashboard Home es el punto de entrada principal del sistema de monitorización Coyote. Proporciona una vista consolidada y de alto nivel del estado de toda la infraestructura, permitiendo:

  • Detección rápida de problemas: Identificar servidores con issues de un vistazo
  • Navegación dirigida: Cada métrica enlaza al dashboard detallado correspondiente
  • Monitorización multi-servidor: Ver todas las instancias SQL y hosts Windows simultáneamente

Importancia: Este dashboard debe ser la primera pantalla que revise el equipo de operaciones cada mañana y la pantalla que se muestre en monitores de NOC (Network Operations Center).

Variables

VariableDescripción
$InstanceInstancias SQL Server (multi-selección, todas por defecto)
$hostnameHosts Windows (multi-selección, todos por defecto)

Variables ocultas

Las variables están configuradas como ocultas (hide: 2) porque el dashboard está diseñado para mostrar todas las instancias automáticamente usando la función de repetición de paneles.


Secciones

Alerts (Colapsado)

Alerts alertlist

Lista de alertas activas en el sistema. Por defecto está colapsado para no distraer, pero muestra alertas en estados Firing, Pending y Error.

Importancia: Las alertas son notificaciones proactivas configuradas en Grafana. Si hay alertas activas, deben investigarse antes de revisar el resto del dashboard.

Estados mostrados:

  • Firing: Alerta activa que requiere atención
  • Pending: Alerta en período de evaluación
  • Error: Problema con la evaluación de la alerta

Recomendación práctica

Expanda esta sección al inicio del día para revisar si hay alertas pendientes de la noche anterior. Configure notificaciones por email/Teams para alertas críticas.


Windows Status

Windows Status stat (repetido por hostname)

Estado de cada servidor Windows monitorizado. Se repite automáticamente para cada host en la variable $hostname.

Métricas mostradas por servidor:

MétricaDescripciónUmbral VerdeUmbral Magenta
Avg CPUUso promedio de CPU (últimos 5 min)< 80%>= 80%
Min Disk %Porcentaje mínimo de espacio libre en cualquier disco> 20%<= 20%

Importancia: Estos dos indicadores resumen la salud del sistema operativo:

  • CPU alto sostenido: Puede indicar queries pesadas, procesos desbocados o falta de recursos
  • Disco bajo: Riesgo de que bases de datos pasen a modo solo lectura o que fallen backups

Acción ante indicadores en magenta

  • CPU > 80%: Hacer clic para ir a Windows Counters y revisar qué proceso consume CPU
  • Disk < 20%: Hacer clic para identificar qué disco está bajo y liberar espacio o expandir

Navegación: Al hacer clic en cualquier métrica, navega automáticamente a Windows Counters filtrado por ese hostname.


SQL Server Status

SQL Server Status stat (repetido por Instance)

Estado de cada instancia SQL Server monitorizada. Se repite automáticamente para cada instancia en la variable $Instance.

Métricas mostradas por instancia:

MétricaDescripciónUmbral VerdeUmbral MagentaEnlace a
BlocksProcesos bloqueados actualmente0>= 1Process Status
Failed JobsJobs fallidos en el período0>= 1Job Status
SQL VersionEstado de actualizaciónUpdatedTo CheckVersion & Patch
PLEPage Life Expectancy> 3000 seg<= 3000 segSQL Counters
Log UsedTamaño de logs de transacción< 15 GB>= 15 GBSQL Counters
AVG IOI/O promedio de base de datos< 2 MB/s>= 2 MB/sSQL Counters

Interpretación de Métricas

Blocks (Bloqueos)

Importancia: Los bloqueos indican que hay procesos esperando recursos que otro proceso tiene bloqueados. Incluso 1 bloqueo puede causar degradación de rendimiento si afecta a transacciones críticas.

ValorSignificadoAcción
0Sin bloqueos activosNormal
1-5Bloqueos menoresInvestigar si persiste
> 5Problema de concurrenciaInvestigar inmediatamente

Diagnóstico rápido de bloqueos

  1. Clic en el panel para ir a Process Status
  2. Identificar el "head blocker" (proceso que bloquea a los demás)
  3. Evaluar si el proceso bloqueador puede terminarse o debe esperar
  4. Revisar si hay índices faltantes que causen table scans prolongados

Failed Jobs (Jobs Fallidos)

Importancia: Los jobs de SQL Agent automatizan tareas críticas como backups, mantenimiento de índices, ETL y sincronización de datos. Un job fallido puede significar:

  • Backups no realizados (riesgo de pérdida de datos)
  • Índices sin mantenimiento (degradación de rendimiento)
  • Datos no sincronizados (problemas de negocio)
ValorSignificadoAcción
0Todos los jobs exitososNormal
>= 1Hay jobs que fallaronInvestigar inmediatamente

Jobs de backup fallidos

Si el job fallido es un backup, la prioridad es máxima. Cada minuto sin backup es un minuto de datos potencialmente perdidos ante un desastre.


SQL Version (Estado de Actualización)

Importancia: Mantener SQL Server actualizado es crítico para seguridad y estabilidad. Microsoft libera regularmente actualizaciones de seguridad (SU) y acumulativas (CU).

EstadoSignificadoAcción
UpdatedVersión actualizadaNormal
To CheckActualización disponiblePlanificar ventana de mantenimiento

Actualizaciones de seguridad

Las actualizaciones marcadas como "Security Update" deben aplicarse lo antes posible. Las vulnerabilidades de SQL Server pueden permitir acceso no autorizado a datos sensibles.


PLE (Page Life Expectancy)

Importancia: El PLE indica cuánto tiempo (en segundos) las páginas permanecen en el buffer pool. Es el indicador más importante de presión de memoria en SQL Server.

ValorSignificadoAcción
> 3000 segSistema saludableNormal
1000 - 3000 segPresión moderadaMonitorizar tendencia
< 1000 segPresión severaInvestigar queries pesadas

Fórmula moderna de PLE

El umbral de 300 segundos es obsoleto. La fórmula actual es:

PLE mínimo = (RAM asignada a SQL en GB / 4) × 300

Para un servidor con 64 GB: PLE mínimo = 4,800 segundos


Log Used (Tamaño de Logs)

Importancia: Los logs de transacción crecen cuando hay transacciones activas o cuando no se realizan backups de log. Un log muy grande puede:

  • Consumir espacio en disco
  • Indicar transacciones de larga duración
  • Indicar problemas con backups de log
ValorSignificadoAcción
< 15 GBNormal-
>= 15 GBLog grandeVerificar backups de log

AVG IO (I/O Promedio)

Importancia: El I/O indica la cantidad de datos leídos/escritos en disco. Un I/O muy alto puede indicar:

  • Queries ineficientes que leen muchos datos
  • Índices faltantes
  • Backups o mantenimiento en ejecución
ValorSignificadoAcción
< 2 MB/sI/O normal-
>= 2 MB/sI/O elevadoInvestigar queries activas

Guía de Uso Diario

Checklist de Revisión Matutina

  1. Expandir sección Alerts: Revisar si hay alertas activas
  2. Escanear Windows Status: Identificar servidores con CPU o disco en magenta
  3. Escanear SQL Server Status: Identificar instancias con indicadores en magenta
  4. Priorizar investigación:
    • Máxima: Failed Jobs (especialmente backups), Blocks > 5
    • Alta: Disk < 10%, PLE < 1000
    • Media: SQL Version = To Check, CPU > 80%

Flujo de Navegación

                    ┌─────────────┐
                    │    HOME     │
                    └──────┬──────┘

        ┌──────────────────┼──────────────────┐
        │                  │                  │
        ▼                  ▼                  ▼
┌───────────────┐  ┌───────────────┐  ┌───────────────┐
│ Windows       │  │ SQL Counters  │  │ Process       │
│ Counters      │  │               │  │ Status        │
│ (CPU, Disco)  │  │ (PLE, Log)    │  │ (Bloqueos)    │
└───────────────┘  └───────────────┘  └───────────────┘


                   ┌───────────────┐
                   │ Job Status    │
                   │ (Jobs)        │
                   └───────────────┘

Mejores Prácticas

Configuración de Pantalla NOC

Para usar este dashboard en un monitor de operaciones:

  1. Refresh automático: Configurar refresh cada 1-5 minutos
  2. Modo kiosko: Usar ?kiosk en la URL para ocultar menús
  3. Variables expandidas: Asegurar que todas las instancias estén seleccionadas
  4. Alertas sonoras: Configurar alertas sonoras para estados críticos

Umbrales Personalizados

Los umbrales predeterminados pueden ajustarse según el entorno:

MétricaValor DefaultCuándo Ajustar
CPU80%Servidores de alta carga pueden tolerar más
Disk20%Discos muy grandes pueden funcionar con menos
PLE3000Ajustar según RAM del servidor
Log15 GBAjustar según tamaño típico de BD

Referencias de Microsoft

TemaEnlace
Page Life Expectancylearn.microsoft.com
Monitorización de SQL Serverlearn.microsoft.com
SQL Server Agentlearn.microsoft.com
Bloqueos y concurrencialearn.microsoft.com
Transaction Loglearn.microsoft.com