Home Dashboard
UID:
homeVersión: 2.0 Paneles: 3 secciones
Propósito
El dashboard Home es el punto de entrada principal del sistema de monitorización Coyote. Proporciona una vista consolidada y de alto nivel del estado de toda la infraestructura, permitiendo:
- Detección rápida de problemas: Identificar servidores con issues de un vistazo
- Navegación dirigida: Cada métrica enlaza al dashboard detallado correspondiente
- Monitorización multi-servidor: Ver todas las instancias SQL y hosts Windows simultáneamente
Importancia: Este dashboard debe ser la primera pantalla que revise el equipo de operaciones cada mañana y la pantalla que se muestre en monitores de NOC (Network Operations Center).
Variables
| Variable | Descripción |
|---|---|
$Instance | Instancias SQL Server (multi-selección, todas por defecto) |
$hostname | Hosts Windows (multi-selección, todos por defecto) |
Variables ocultas
Las variables están configuradas como ocultas (hide: 2) porque el dashboard está diseñado para mostrar todas las instancias automáticamente usando la función de repetición de paneles.
Secciones
Alerts (Colapsado)
Alerts alertlist
Lista de alertas activas en el sistema. Por defecto está colapsado para no distraer, pero muestra alertas en estados Firing, Pending y Error.
Importancia: Las alertas son notificaciones proactivas configuradas en Grafana. Si hay alertas activas, deben investigarse antes de revisar el resto del dashboard.
Estados mostrados:
- Firing: Alerta activa que requiere atención
- Pending: Alerta en período de evaluación
- Error: Problema con la evaluación de la alerta
Recomendación práctica
Expanda esta sección al inicio del día para revisar si hay alertas pendientes de la noche anterior. Configure notificaciones por email/Teams para alertas críticas.
Windows Status
Windows Status stat (repetido por hostname)
Estado de cada servidor Windows monitorizado. Se repite automáticamente para cada host en la variable $hostname.
Métricas mostradas por servidor:
| Métrica | Descripción | Umbral Verde | Umbral Magenta |
|---|---|---|---|
| Avg CPU | Uso promedio de CPU (últimos 5 min) | < 80% | >= 80% |
| Min Disk % | Porcentaje mínimo de espacio libre en cualquier disco | > 20% | <= 20% |
Importancia: Estos dos indicadores resumen la salud del sistema operativo:
- CPU alto sostenido: Puede indicar queries pesadas, procesos desbocados o falta de recursos
- Disco bajo: Riesgo de que bases de datos pasen a modo solo lectura o que fallen backups
Acción ante indicadores en magenta
- CPU > 80%: Hacer clic para ir a Windows Counters y revisar qué proceso consume CPU
- Disk < 20%: Hacer clic para identificar qué disco está bajo y liberar espacio o expandir
Navegación: Al hacer clic en cualquier métrica, navega automáticamente a Windows Counters filtrado por ese hostname.
SQL Server Status
SQL Server Status stat (repetido por Instance)
Estado de cada instancia SQL Server monitorizada. Se repite automáticamente para cada instancia en la variable $Instance.
Métricas mostradas por instancia:
| Métrica | Descripción | Umbral Verde | Umbral Magenta | Enlace a |
|---|---|---|---|---|
| Blocks | Procesos bloqueados actualmente | 0 | >= 1 | Process Status |
| Failed Jobs | Jobs fallidos en el período | 0 | >= 1 | Job Status |
| SQL Version | Estado de actualización | Updated | To Check | Version & Patch |
| PLE | Page Life Expectancy | > 3000 seg | <= 3000 seg | SQL Counters |
| Log Used | Tamaño de logs de transacción | < 15 GB | >= 15 GB | SQL Counters |
| AVG IO | I/O promedio de base de datos | < 2 MB/s | >= 2 MB/s | SQL Counters |
Interpretación de Métricas
Blocks (Bloqueos)
Importancia: Los bloqueos indican que hay procesos esperando recursos que otro proceso tiene bloqueados. Incluso 1 bloqueo puede causar degradación de rendimiento si afecta a transacciones críticas.
| Valor | Significado | Acción |
|---|---|---|
| 0 | Sin bloqueos activos | Normal |
| 1-5 | Bloqueos menores | Investigar si persiste |
| > 5 | Problema de concurrencia | Investigar inmediatamente |
Diagnóstico rápido de bloqueos
- Clic en el panel para ir a Process Status
- Identificar el "head blocker" (proceso que bloquea a los demás)
- Evaluar si el proceso bloqueador puede terminarse o debe esperar
- Revisar si hay índices faltantes que causen table scans prolongados
Failed Jobs (Jobs Fallidos)
Importancia: Los jobs de SQL Agent automatizan tareas críticas como backups, mantenimiento de índices, ETL y sincronización de datos. Un job fallido puede significar:
- Backups no realizados (riesgo de pérdida de datos)
- Índices sin mantenimiento (degradación de rendimiento)
- Datos no sincronizados (problemas de negocio)
| Valor | Significado | Acción |
|---|---|---|
| 0 | Todos los jobs exitosos | Normal |
| >= 1 | Hay jobs que fallaron | Investigar inmediatamente |
Jobs de backup fallidos
Si el job fallido es un backup, la prioridad es máxima. Cada minuto sin backup es un minuto de datos potencialmente perdidos ante un desastre.
SQL Version (Estado de Actualización)
Importancia: Mantener SQL Server actualizado es crítico para seguridad y estabilidad. Microsoft libera regularmente actualizaciones de seguridad (SU) y acumulativas (CU).
| Estado | Significado | Acción |
|---|---|---|
| Updated | Versión actualizada | Normal |
| To Check | Actualización disponible | Planificar ventana de mantenimiento |
Actualizaciones de seguridad
Las actualizaciones marcadas como "Security Update" deben aplicarse lo antes posible. Las vulnerabilidades de SQL Server pueden permitir acceso no autorizado a datos sensibles.
PLE (Page Life Expectancy)
Importancia: El PLE indica cuánto tiempo (en segundos) las páginas permanecen en el buffer pool. Es el indicador más importante de presión de memoria en SQL Server.
| Valor | Significado | Acción |
|---|---|---|
| > 3000 seg | Sistema saludable | Normal |
| 1000 - 3000 seg | Presión moderada | Monitorizar tendencia |
| < 1000 seg | Presión severa | Investigar queries pesadas |
Fórmula moderna de PLE
El umbral de 300 segundos es obsoleto. La fórmula actual es:
PLE mínimo = (RAM asignada a SQL en GB / 4) × 300Para un servidor con 64 GB: PLE mínimo = 4,800 segundos
Log Used (Tamaño de Logs)
Importancia: Los logs de transacción crecen cuando hay transacciones activas o cuando no se realizan backups de log. Un log muy grande puede:
- Consumir espacio en disco
- Indicar transacciones de larga duración
- Indicar problemas con backups de log
| Valor | Significado | Acción |
|---|---|---|
| < 15 GB | Normal | - |
| >= 15 GB | Log grande | Verificar backups de log |
AVG IO (I/O Promedio)
Importancia: El I/O indica la cantidad de datos leídos/escritos en disco. Un I/O muy alto puede indicar:
- Queries ineficientes que leen muchos datos
- Índices faltantes
- Backups o mantenimiento en ejecución
| Valor | Significado | Acción |
|---|---|---|
| < 2 MB/s | I/O normal | - |
| >= 2 MB/s | I/O elevado | Investigar queries activas |
Guía de Uso Diario
Checklist de Revisión Matutina
- Expandir sección Alerts: Revisar si hay alertas activas
- Escanear Windows Status: Identificar servidores con CPU o disco en magenta
- Escanear SQL Server Status: Identificar instancias con indicadores en magenta
- Priorizar investigación:
- Máxima: Failed Jobs (especialmente backups), Blocks > 5
- Alta: Disk < 10%, PLE < 1000
- Media: SQL Version = To Check, CPU > 80%
Flujo de Navegación
┌─────────────┐
│ HOME │
└──────┬──────┘
│
┌──────────────────┼──────────────────┐
│ │ │
▼ ▼ ▼
┌───────────────┐ ┌───────────────┐ ┌───────────────┐
│ Windows │ │ SQL Counters │ │ Process │
│ Counters │ │ │ │ Status │
│ (CPU, Disco) │ │ (PLE, Log) │ │ (Bloqueos) │
└───────────────┘ └───────────────┘ └───────────────┘
│
▼
┌───────────────┐
│ Job Status │
│ (Jobs) │
└───────────────┘Mejores Prácticas
Configuración de Pantalla NOC
Para usar este dashboard en un monitor de operaciones:
- Refresh automático: Configurar refresh cada 1-5 minutos
- Modo kiosko: Usar
?kiosken la URL para ocultar menús - Variables expandidas: Asegurar que todas las instancias estén seleccionadas
- Alertas sonoras: Configurar alertas sonoras para estados críticos
Umbrales Personalizados
Los umbrales predeterminados pueden ajustarse según el entorno:
| Métrica | Valor Default | Cuándo Ajustar |
|---|---|---|
| CPU | 80% | Servidores de alta carga pueden tolerar más |
| Disk | 20% | Discos muy grandes pueden funcionar con menos |
| PLE | 3000 | Ajustar según RAM del servidor |
| Log | 15 GB | Ajustar según tamaño típico de BD |
Referencias de Microsoft
| Tema | Enlace |
|---|---|
| Page Life Expectancy | learn.microsoft.com |
| Monitorización de SQL Server | learn.microsoft.com |
| SQL Server Agent | learn.microsoft.com |
| Bloqueos y concurrencia | learn.microsoft.com |
| Transaction Log | learn.microsoft.com |
