Pessoal, compartilho um checklist que venho usando em assessment de ambiente. Talvez seja útil para quem herdou um Zabbix mal configurado ou está preparando uma evolução de versão.
São 25 verificações em cinco áreas. A ideia não é contar quantos "sim" você tem — é descobrir onde está o buraco.
Engenharia de sinal. As triggers críticas usam função de janela temporal em vez de comparar o último valor coletado? Todo alerta crítico tem mecanismo de fechamento declarado, seja expressão de recuperação, fechamento manual ou correlação por tag? As regras de LLD usam filtros e overrides? Você sabe quantos alertas dispararam na semana e quantos viraram incidente? Existe alguma trigger que a equipe já aprendeu a ignorar?
Rotina de operação. Existe checklist de abertura de turno, incluindo a saúde do próprio Zabbix — fila, NVPS, percentual de busy dos pollers? Sua matriz P1–P5 está mapeada nas seis severidades nativas? As tags seguem taxonomia padronizada que sustenta Actions e IT Services? O escalonamento por turno está configurado ou é combinado informal? Postmortem vira mudança de configuração?
Plataforma e banco. O housekeeping está de acordo com o mecanismo do banco em uso, e você sabe qual é? Existe projeção de quando o disco enche? Os pollers foram dimensionados por medição ou por valor copiado de tutorial? A cadeia de notificação foi testada ponta a ponta nos últimos 90 dias? Existe canal independente que avisa se o próprio Zabbix cair?
Janela de mudança. Você sabe em que versão exata está e se ela ainda tem suporte completo? O plano de rollback tem tempo de restauração cronometrado, não estimado? O último upgrade foi testado em cópia real do banco? Se usa HA nativo, o banco também é redundante? Você distingue o que já está no código do 8.0 do que ainda é roadmap?
Negócio. Existe árvore de IT Services mapeando serviço, não host? Há SLO por serviço com error budget? O relatório de disponibilidade sai do Zabbix ou de planilha preenchida à mão? Você traduz uma hora de parada em valor aproximado? A diretoria consulta algum painel por conta própria?
Na minha experiência, o item que mais pega gente boa de surpresa é o housekeeping com particionamento. Circula bastante a orientação de desabilitar o housekeeper quando se usa TimescaleDB, e a documentação oficial diz o contrário — o efeito colateral aparece semanas depois, com o disco já em 98%.
Montei também uma versão interativa que calcula a nota por área automaticamente, caso prefira: https://zabbixops.com.br/diagnostico/ — é gratuita e não pede cadastro. Mas o checklist acima está completo aqui mesmo.
Se alguém tiver verificação que faltou, comento e incluo.
Resumen en español: comparto una lista de 25 verificaciones para evaluar la madurez de una operación Zabbix, agrupadas en cinco áreas — ingeniería de alertas, rutina de operación, plataforma y base de datos, ventana de cambio, y traducción al negocio. El punto que más sorprende a gente con experiencia es el housekeeping con TimescaleDB: circula la recomendación de desactivarlo cuando hay particionamiento, y la documentación oficial dice lo contrario. Hay una versión interactiva que calcula la puntuación por área en el enlace de arriba. Comentarios y sugerencias son bienvenidos.
São 25 verificações em cinco áreas. A ideia não é contar quantos "sim" você tem — é descobrir onde está o buraco.
Engenharia de sinal. As triggers críticas usam função de janela temporal em vez de comparar o último valor coletado? Todo alerta crítico tem mecanismo de fechamento declarado, seja expressão de recuperação, fechamento manual ou correlação por tag? As regras de LLD usam filtros e overrides? Você sabe quantos alertas dispararam na semana e quantos viraram incidente? Existe alguma trigger que a equipe já aprendeu a ignorar?
Rotina de operação. Existe checklist de abertura de turno, incluindo a saúde do próprio Zabbix — fila, NVPS, percentual de busy dos pollers? Sua matriz P1–P5 está mapeada nas seis severidades nativas? As tags seguem taxonomia padronizada que sustenta Actions e IT Services? O escalonamento por turno está configurado ou é combinado informal? Postmortem vira mudança de configuração?
Plataforma e banco. O housekeeping está de acordo com o mecanismo do banco em uso, e você sabe qual é? Existe projeção de quando o disco enche? Os pollers foram dimensionados por medição ou por valor copiado de tutorial? A cadeia de notificação foi testada ponta a ponta nos últimos 90 dias? Existe canal independente que avisa se o próprio Zabbix cair?
Janela de mudança. Você sabe em que versão exata está e se ela ainda tem suporte completo? O plano de rollback tem tempo de restauração cronometrado, não estimado? O último upgrade foi testado em cópia real do banco? Se usa HA nativo, o banco também é redundante? Você distingue o que já está no código do 8.0 do que ainda é roadmap?
Negócio. Existe árvore de IT Services mapeando serviço, não host? Há SLO por serviço com error budget? O relatório de disponibilidade sai do Zabbix ou de planilha preenchida à mão? Você traduz uma hora de parada em valor aproximado? A diretoria consulta algum painel por conta própria?
Na minha experiência, o item que mais pega gente boa de surpresa é o housekeeping com particionamento. Circula bastante a orientação de desabilitar o housekeeper quando se usa TimescaleDB, e a documentação oficial diz o contrário — o efeito colateral aparece semanas depois, com o disco já em 98%.
Montei também uma versão interativa que calcula a nota por área automaticamente, caso prefira: https://zabbixops.com.br/diagnostico/ — é gratuita e não pede cadastro. Mas o checklist acima está completo aqui mesmo.
Se alguém tiver verificação que faltou, comento e incluo.
Resumen en español: comparto una lista de 25 verificaciones para evaluar la madurez de una operación Zabbix, agrupadas en cinco áreas — ingeniería de alertas, rutina de operación, plataforma y base de datos, ventana de cambio, y traducción al negocio. El punto que más sorprende a gente con experiencia es el housekeeping con TimescaleDB: circula la recomendación de desactivarlo cuando hay particionamiento, y la documentación oficial dice lo contrario. Hay una versión interactiva que calcula la puntuación por área en el enlace de arriba. Comentarios y sugerencias son bienvenidos.